DeepSeek发布V4.1 Flash,压缩缓存并下调API价格
摘要:新模型通过压缩缓存降低长任务的硬件需求,并同步下调API价格。9月14日12时后,V4 Pro接口请求将转由新模型处理。
产联社编辑 | 黄钰慧

【产联社】DeepSeek此次模型更新,重点在智能体能力和使用成本。9月10日,深度求索(DeepSeek)正式发布DeepSeek V4.1 Flash。该模型采用新的非对称架构,原生支持多模态视觉理解。与上一代模型相比,其对高带宽内存(HBM)和固态硬盘(SSD)的需求分别降至四分之一和八分之一。
V4.1 Flash已同步上线DeepSeek API。DeepSeek还下调了API价格,并继续采用峰谷定价,闲时价格为高峰时段的一半。 Deepseek API闲时的缓存命中输入、缓存未命中输入和输出价格,分别为每百万Token 0.02元、1元和4元。
DeepSeek还将调整V4 Pro接口。按照官方安排,北京时间9月14日12时以后,在V4.1 Pro上线之前,访问deepseek-v4-pro的请求将被路由至V4.1 Flash,并按照V4.1 Flash单价计费。
总参数5520亿,每次只调用一部分
V4.1 Flash拥有5520亿总参数,但处理一次任务时只会激活其中一小部分,以降低实际运行成本。
DeepSeek介绍,V4.1 Flash是一款混合专家模型(MoE),采用全新的Causal-Encoder-Decoder结构。模型的输入和输出采用不同的参数激活规模,输入阶段激活80亿参数,输出阶段激活160亿参数。
通俗来说,混合专家模型虽然拥有较大的总参数量,但每次处理任务时不会同时调用全部参数。V4.1 Flash在处理输入时调用的参数更少,在生成回答时调用的参数更多。DeepSeek称,这种结构的成本低于已知的同等参数规模模型。
V4.1 Flash是DeepSeek新模型结构系列中尺寸最小的一款。DeepSeek称,新结构的设计目标包括提高模型的能力上限、推理速度和吞吐量,并可进一步扩展至参数规模更大的模型。
DeepSeek公布的评测表列出了V4.1 Flash、V4 Pro 0813、上一代V4 Flash 0731,以及GLM-5.3、Kimi K3、GPT-5.6-Sol和Claude Opus 5等模型的成绩。

分项结果显示,V4.1 Flash并非在所有测试中居首。例如,在考察知识和推理能力的GPQA Diamond测试中,V4.1 Flash得分90.9,低于V4 Pro 0813的92.4、GPT-5.6-Sol的94.1和Claude Opus 5的93.4;在Terminal-Bench 3.0中,其得分30.0,也低于GPT-5.6-Sol的34.4和Claude Opus 5的43.3。
在部分智能体测试中,V4.1 Flash超过了表内多款模型。其在Terminal-Bench 2.1、CyberGym和Automation-Bench中分别取得90.6、88.1和54.8分;在DeepSWE v1.1中取得74.2分,略高于Claude Opus 5的74.0分。
不过,不同测试项目、运行框架和模型版本之间不能直接得出模型整体优劣,企业仍需按照自己的业务任务进行测试。
缓存缩小,长任务首先受益
新模型减少了长对话和连续智能体任务需要保存的上下文信息,从而降低内存和存储压力。
大模型生成内容时,需要保留已经处理过的上下文,避免每次输出都重新计算。这些临时记录通常被称为KV Cache。普通问答的上下文相对有限,但在代码开发、资料整理和自动执行流程中,智能体可能连续运行较长时间,缓存规模也会随之扩大。
DeepSeek称,与上一代模型相比,V4.1 Flash对HBM的需求降至四分之一,对SSD的需求降至八分之一。HBM是模型运行时使用的高速内存,SSD则可用于存放规模更大的缓存数据。两类硬件需求下降,可以减少服务商为长任务缓存预留的资源。
DeepSeek公布的数据还显示,每个Token对应的全局KV Cache由2023年11月DeepSeek V1的389120字节,降至V4.1 Flash的890字节。按照DeepSeek给出的口径,缓存规模累计缩小约437倍;与2026年4月的V4 Flash相比,V4.1 Flash进一步缩小约3.9倍。
这一变化主要影响需要长上下文和多轮工具调用的业务。例如,客服系统需要保留此前的沟通内容,编程智能体需要追踪代码和修改记录,企业知识助手可能一次读取多份文档。缓存越小,服务商处理上述长任务时需要预留的内存和存储空间越少。
不过,缓存需求下降不等于企业总成本会按相同比例下降。实际费用还取决于输入和输出Token数量、缓存命中率、任务运行时间以及服务商的计费方式。
API降价,闲时价格减半
DeepSeek继续实行峰谷定价,不要求即时处理的任务可以通过错峰调用降低费用。
V4.1 Flash已经上线DeepSeek API,开发者将模型名称设置为deepseek-flash即可调用。此前的V4 Flash和V4 Flash Vision Exp现已下线;为保持接口兼容,deepseek-v4-flash和deepseek-v4-flash-vision-exp两个旧模型名称将暂时路由至V4.1 Flash。
国内API以每百万Token计费。闲时阶段,缓存命中输入为0.02元、缓存未命中输入为1元、输出为4元;高峰时段分别为0.04元、2元和8元。其中,缓存命中是指系统复用此前已处理并缓存的部分输入,其价格明显低于缓存未命中的输入。
高峰时段为工作日北京时间9时至12时、14时至18时,其余时间均按照闲时价格计费,周末和休息日也属于闲时。新价格已于9月10日12时生效。
DeepSeek还称,腾讯旗下WorkBuddy、CodeBuddy以及开源开发工具OpenCode已全量接入V4.1 Flash。同期发布的DeepSeek Harness v0.1.5也完成了模型适配,覆盖标准模式、程序化工具调用模式和极简模式。
DeepSeek此前将V4 Flash定位为速度和成本优先的版本。其官方API更新记录显示,上一代V4 Flash已经重点增强智能体能力,并支持Responses API。
DeepSeek将在V4.1 Pro上线前,把现有V4 Pro接口请求转交给V4.1 Flash处理。
DeepSeek表示,经多方测试,V4.1 Flash在性能、费用、速度和任务总用时等方面超过V4 Pro,因此计划有序下线V4 Pro。按照DeepSeek公布的安排,北京时间9月14日12时以后,在V4.1 Pro上线之前,访问deepseek-v4-pro的请求将被路由至V4.1 Flash,并按照V4.1 Flash的单价计费。
届时,企业即使继续使用原有接口名称,实际调用的也将是V4.1 Flash,因此需在切换前检查结构化输出、提示词和工具调用流程是否仍能正常运行。
商务合作/报料请联系侯经理 18801065284(微信同号)
特别声明:本文仅供参考,不构成任何投资建议,未经允许不得转载。

