9月10日,DeepSeek正式发布V4.1 Flash模型,这是其全新模型结构系列中尺寸最小的模型,却实现了对上一代旗舰V4 Pro的全面超越。伴随新模型上线,DeepSeek同步宣布将有序下线V4 Pro,9月14日12:00后所有V4 Pro请求将路由至V4.1 Flash并按新单价计费。
非对称架构:输入8B、输出16B,小成本跑大任务
V4.1 Flash的总参数量为552B,采用MoE架构,但真正颠覆性的是其全新的Causal-Encoder-Decoder(因果编码器-解码器)结构。
这套架构的核心特点是输入与输出不对称:处理输入时仅激活8B参数,生成输出时激活16B参数。DeepSeek表示,这种设计让模型在处理代码仓库、长文档等需要读取大量信息、生成有限判断的任务时,显著降低了输入环节的计算开销。
效率提升的另一关键来自KV Cache的大幅压缩。与上一代模型相比,V4.1 Flash对HBM的需求减少到1/4,对SSD的需求减少到1/8;若对照初代架构,累计缩小约437倍。在Agent使用场景中,缓存命中费用往往占比较高,这一压缩直接降低了长上下文任务的成本。

性能全面超越V4 Pro,多项基准登顶
根据官方公布的对比数据,V4.1 Flash在多项核心基准上超越V4 Pro及部分竞品:
| 基准测试 | V4.1 Flash | V4 Pro | GLM 5.3 | Kimi K3 | GPT 5.6-Sol |
|---|---|---|---|---|---|
| GPQA Diamond | 90.9 | 92.4 | 88.1 | 92.9 | 94.1 |
| Codeforces | 3471 | 3348 | — | — | — |
| Terminal-Bench 2.1 | 90.6 | 87.9 | 88.2 | 88.3 | 88.8 |
| DeepSWE v1.1 | 74.2 | 62.7 | 66.9 | 67.5 | 73.0 |
| CyberGym | 88.1 | 83.3 | 84.5 | 80.0 | 84.5 |
| Automation-Bench | 54.8 | 43.2 | 48.8 | 46.7 | 45.8 |
在编程竞赛(Codeforces)中,V4.1 Flash评级达3471,超过V4 Pro的3348;在终端任务执行(Terminal-Bench 2.1)和长周期编程(DeepSWE v1.1)上均领先;网络安全测试(CyberGym)以88.1分居首。
原生多模态:视觉理解融入主力模型
V4.1 Flash是DeepSeek首个原生具备多模态视觉理解能力的主力模型,不再依赖外挂视觉模块处理图文请求。此前需要同时调用V4 Flash(文本)和V4 Flash Vision Exp(图像)的两条路径,现在统一到一个模型中,开发者只需维护一个端点。
定价下调:缓存命中0.02元/百万Token
伴随新模型上线,DeepSeek同步下调API价格,仍采用峰谷定价:
| 时段 | 输入(缓存命中) | 输入(缓存未命中) | 输出 |
|---|---|---|---|
| 空闲时段 | 0.02元 | 1.0元 | 4.0元 |
| 高峰时段 | 0.04元 | 2.0元 | 8.0元 |
高峰时段为工作日9:00-12:00、14:00-18:00,其余时段(含周末)均为空闲时段。新价格于9月10日12:00生效。
API变更与生态接入
API层面,模型名改为deepseek-flash即可调用V4.1 Flash。旧版V4 Flash与V4 Flash Vision Exp已下线,出于兼容考虑暂时路由至新模型。9月14日12:00后,deepseek-v4-pro的请求也将全部路由至V4.1 Flash,并按新单价计费。
腾讯WorkBuddy、CodeBuddy和OpenCode作为官方合作伙伴已全量接入。
V4.1 Flash的发布标志着DeepSeek完成了一次“旗舰交替”——用尺寸最小的Flash模型,接替了上一代尺寸更大的Pro模型。非对称架构配合KV Cache压缩,让“小成本跑大任务”从口号变为可验证的工程实践。这一策略的深层影响在于,当模型效率提升带来成本下降时,AI在办公、编程、客服等场景的渗透有望加速-3。而对开发者而言,以更低价格获得更强能力,无疑是最直接的利好。