DeepSeek给V4 Pro正式版留出的时间只有32天。9月10日,公司发布V4.1 Flash,并宣布从北京时间9月14日中午12点起,官方API中发给V4 Pro的请求全部由Flash接手,按更低的Flash价格收费,这一安排持续到V4.1 Pro推出。V4 Pro从4月24日开始提供预览版,8月13日才正式发布,上线不到一个月,退场时间就已定下。

V4 Pro主打智能体、代码编程和工具调用,为此开放了不同推理强度,并适配了Codex。但正式版上线当天,官网通知和开放平台公告一度撤下,当晚才恢复。有开发者反馈,模型思考时间过短,长任务会中途提前结束,同一道题隔几个小时再跑,结果也可能差别很大。8月17日起,Pro高峰时段的输出价格从每百万Token 6元涨到27元,是原来的4.5倍。
Flash则在Pro主推的方向上追了上来。官方数据显示,软件工程测试DeepSWE v1.1中,Flash得74.2分,Pro为62.7分;办公自动化测试AutomationBench中,Flash得54.8分,Pro为43.2分。不过Pro并非每项都输:在不调用工具的HLE纯文本子集里,它以42.7分领先Flash的39.1分;在允许使用工具的完整HLE测试中,Flash得63.9分,高于Pro的60分。在后训练前的基础模型对比中,Pro在SimpleQA-Verified知识问答和LongBench-V2长文本测试上仍保持领先。因此官方公告中的“全面超越”,不能理解为每个分项都胜出。
成本是另一个原因。据官方模型卡披露,V4 Pro每个Token激活的参数量高达490亿;V4.1 Flash把处理输入与生成回答解耦,分别只激活80亿和160亿参数。相比V4 Flash,V4.1 Flash的全局KV缓存占用降到约四分之一,持久化KV缓存占用的SSD空间降到约八分之一。智能体任务需要反复读取上下文,缓存占用会随任务周期与并发量上升。降价只能改变账单上的数字,改变不了底层的计算与存储消耗,这大概就是DeepSeek不再为旧Pro保留独立档位的原因。






