DeepSeek联合北大发布DSpark:推理速度提升85%,高并发场景实测吞吐量暴涨661%

6.29 业界早就有一个经典解法推测解码SpeculativeDecoding用一个轻量级的草稿模型先快速生成一串候选token,再让完整的大模型一次性批量验证,接受猜对的部分

2026062902


就在DeepSeek被曝完成首轮大规模融资后不久,这家以“极致性价比”著称的AI公司再次放出重磅技术成果。6月27日,DeepSeek联合北京大学正式发布并开源DSpark推理加速框架,同步开源全栈推测解码训练工具库DeepSpec。

这不是一次模型能力的迭代,而是一次推理效率的工程革命。在DeepSeek-V4的真实线上流量中,DSpark已将单用户生成速度提升60%至85%,并在高并发场景下实现了661%的吞吐量优势。

为什么需要DSpark?——大模型推理的“自回归诅咒”

大模型生成文本的过程,本质上是一个“猜字游戏”:每生成一个token,都需要一次完整的前向传播计算。生成100个token,模型就要把自己写过的内容重新“消化”99遍-
。

业界早就有一个经典解法——推测解码(Speculative Decoding):用一个轻量级的“草稿模型”先快速生成一串候选token,再让完整的大模型一次性批量验证,接受猜对的部分。

但现有方案各有短板:

  • 串行草稿模型(如Eagle3):逐token生成,质量高但速度慢,实际部署中只能使用短候选块

  • 并行草稿模型(如DFlash):一次生成整块token,速度快但每个位置无法依赖前文信息,导致“后缀衰减”——候选越长,后面token的通过率越低

更致命的是,高并发场景下,固定长度的验证策略会迫使大模型将宝贵的批处理算力浪费在那些极大概率被拒绝的token上,整体吞吐量不升反降——这也是DeepSeek此前在晚高峰时段经常“转圈”甚至崩溃的根本原因。

DSpark的两把“刀”:半自回归架构 + 置信度调度验证

DSpark的核心创新在于两项互补机制:

第一把刀:半自回归生成架构

DSpark保留并行草稿模型的高吞吐优势,同时加入一个轻量级顺序模块(马尔可夫头或RNN头),在采样时把“前一个token是什么”的信息注入进来,让后续token不再是“盲猜”。

实验结果令人印象深刻:仅2层Transformer深度的DSpark,在所有测试领域上性能超过了5层的DFlash,有效抑制了后缀衰减。在Qwen3-4B目标模型上,DSpark的平均接受长度比Eagle3提升30.9%,比DFlash提升16.3%。

第二把刀:置信度调度验证

DSpark额外训练了一个置信度估计头,对每个草稿token预测“前缀存活概率”,并通过顺序温度缩放(STS)方法将校准误差从3%-8%压到约1%-
。

硬件感知调度器则根据当前系统负载和每个token的生存概率,动态决定每个请求该验证几个token——轻负载时大胆多验证,高并发时果断剪掉低置信后缀。

论文明确保证:“接纳规则能够精准完整地保留目标分布,投机解码可在不损失输出质量的前提下加速生成过程。”-

线上实测:速度提升85%,吞吐量暴涨661%

DSpark已部署在DeepSeek-V4-Flash和V4-Pro的预览版服务引擎中,并于V4预览版发布两周后完全替换了原有的单token基线MTP-1-
。

实测数据:

引擎SLA要求吞吐量提升关键结论
V4-Flash80 token/s/user+51%中等负载下稳定提升
V4-Flash120 token/s/user+661%MTP-1已接近崩溃,DSpark维持正常运行
V4-Pro35 token/s/user+52%低SLA下稳定提升
V4-Pro50 token/s/user+406%严格SLA下优势显著

在匹配的实际吞吐水平下,DSpark将单用户生成速度提升了57%至85%。原来等10秒的回复,现在五六秒就能出来-
。

更关键的是,DSpark让系统在高并发场景下不再“崩盘”。遇到流量尖峰时,调度器自动缩短验证长度,避免占用关键批处理容量——在不扩容的情况下扛住突发流量-
。

DeepSpec开源:把整个行业的推理成本再拉一截

随DSpark一同开源的还有DeepSpec,一个用于训练和评估推测性解码草稿模型的全栈代码库。

DeepSpec将流程拆分为数据准备、训练、评估三个阶段,目前内置了DSpark、DFlash和Eagle3三种草稿模型,支持Qwen3和Gemma等目标模型系列。

这意味着,开发者可以用这套工具给自己的大模型训练专属的推理加速草稿模型,而无需从零搭建基础设施。正如钛媒体评论所言:“等于把整个行业的推理成本基准线又往下拉了一个台阶。”

编辑点评

DSpark的真正价值,不在于它在benchmark上跑了多高分,而在于它解决了一个真实世界的工程问题:当用户涌进来的时候,系统不崩。

2024-2025年,DeepSeek靠“极致性价比”一战成名。到了2026年,算力短缺从“创业公司的烦恼”升级为“巨头之间的博弈”,推理效率的竞争已成为AI行业的核心战场。

梁文锋在完成融资后率先落子推理优化赛道,战略意图清晰:不仅要加速模型迭代和产品化,还要向下抢占算力效率的制高点。而在算力贵过黄金的时代,效率本身就是最深的护城河。

本文综合自DeepSeek官方论文、机器之心、智东西、凤凰网科技、环球网科技、钛媒体等多家媒体报道。