DeepSeek V4.1 Flash正式发布:552B参数“以小博大”,V4 Pro全面下线

9.10 DeepSeek正式发布V4.1 Flash模型,这是其全新模型结构系列中尺寸最小的模型,却实现了对上一代旗舰V4 Pro的全面超越。伴随新模型上线,DeepSeek同步宣布将有序下线V4 Pro,9月14日12:00后所有V4 Pro请求将路由至V4.1 Flash并按新单价计费。

9月10日,DeepSeek正式发布V4.1 Flash模型,这是其全新模型结构系列中尺寸最小的模型,却实现了对上一代旗舰V4 Pro的全面超越。伴随新模型上线,DeepSeek同步宣布将有序下线V4 Pro,9月14日12:00后所有V4 Pro请求将路由至V4.1 Flash并按新单价计费。

非对称架构:输入8B、输出16B,小成本跑大任务

V4.1 Flash的总参数量为552B,采用MoE架构,但真正颠覆性的是其全新的Causal-Encoder-Decoder(因果编码器-解码器)结构。

这套架构的核心特点是输入与输出不对称:处理输入时仅激活8B参数,生成输出时激活16B参数。DeepSeek表示,这种设计让模型在处理代码仓库、长文档等需要读取大量信息、生成有限判断的任务时,显著降低了输入环节的计算开销。

效率提升的另一关键来自KV Cache的大幅压缩。与上一代模型相比,V4.1 Flash对HBM的需求减少到1/4,对SSD的需求减少到1/8;若对照初代架构,累计缩小约437倍。在Agent使用场景中,缓存命中费用往往占比较高,这一压缩直接降低了长上下文任务的成本。

agentic-benchmark

性能全面超越V4 Pro,多项基准登顶

根据官方公布的对比数据,V4.1 Flash在多项核心基准上超越V4 Pro及部分竞品:

基准测试V4.1 FlashV4 ProGLM 5.3Kimi K3GPT 5.6-Sol
GPQA Diamond90.992.488.192.994.1
Codeforces34713348———
Terminal-Bench 2.190.687.988.288.388.8
DeepSWE v1.174.262.766.967.573.0
CyberGym88.183.384.580.084.5
Automation-Bench54.843.248.846.745.8

在编程竞赛(Codeforces)中,V4.1 Flash评级达3471,超过V4 Pro的3348;在终端任务执行(Terminal-Bench 2.1)和长周期编程(DeepSWE v1.1)上均领先;网络安全测试(CyberGym)以88.1分居首。

原生多模态:视觉理解融入主力模型

V4.1 Flash是DeepSeek首个原生具备多模态视觉理解能力的主力模型,不再依赖外挂视觉模块处理图文请求。此前需要同时调用V4 Flash(文本)和V4 Flash Vision Exp(图像)的两条路径,现在统一到一个模型中,开发者只需维护一个端点。

定价下调:缓存命中0.02元/百万Token

伴随新模型上线,DeepSeek同步下调API价格,仍采用峰谷定价:

时段输入(缓存命中)输入(缓存未命中)输出
空闲时段0.02元1.0元4.0元
高峰时段0.04元2.0元8.0元

高峰时段为工作日9:00-12:00、14:00-18:00,其余时段(含周末)均为空闲时段。新价格于9月10日12:00生效。

API变更与生态接入

API层面,模型名改为deepseek-flash即可调用V4.1 Flash。旧版V4 Flash与V4 Flash Vision Exp已下线,出于兼容考虑暂时路由至新模型。9月14日12:00后,deepseek-v4-pro的请求也将全部路由至V4.1 Flash,并按新单价计费。

腾讯WorkBuddy、CodeBuddy和OpenCode作为官方合作伙伴已全量接入。

V4.1 Flash的发布标志着DeepSeek完成了一次“旗舰交替”——用尺寸最小的Flash模型,接替了上一代尺寸更大的Pro模型。非对称架构配合KV Cache压缩,让“小成本跑大任务”从口号变为可验证的工程实践。这一策略的深层影响在于,当模型效率提升带来成本下降时,AI在办公、编程、客服等场景的渗透有望加速-3。而对开发者而言,以更低价格获得更强能力,无疑是最直接的利好。

官网:https://www.deepseek.com/news/deepseek-v4-1-flash/