稀疏注意力机制的技术突破,正悄然重塑大模型市场的定价格局。
人工智能公司DeepSeek的研究团队9月29日宣布,正式发布名为DeepSeek-V3.2-Exp的新实验模型,该模型通过创新的“稀疏注意力”机制,大幅降低长上下文操作的推理成本。

这一里程碑式进展在Hugging Face和GitHub上同步发布,并附有详细的学术论文。
作为迈向新一代架构的中间步骤,V3.2-Exp在V3.1-Terminus的基础上引入了DeepSeek Sparse Attention稀疏注意力机制,针对长文本的训练和推理效率进行了探索性优化与验证。
DeepSeek又一次展示了其“价格屠夫”的本色。输出价格骤降75%,输入价格也大幅下调。缓存命中时,DeepSeek-V3.2-Exp从0.5元/百万tokens降至0.2元/百万tokens,缓存未命中的价格则从4元/百万tokens降为2元/百万tokens。更引人注目的是输出价格,从12元/百万tokens直接降到了3元/百万tokens。

DeepSeek透露,在新价格政策下,开发者调用DeepSeek API的成本将降低50%以上。
从下图最新价格比较表来看,尽管 OpenAI 的 GPT-5 Nano 仍然是最便宜的模型,但DeepSeek V3.2-Exp 成为了开发人员 API 最便宜的选择之一。

DeepSeek Sparse Attention(DSA)成为本次技术突破的关键。DSA首次实现了细粒度稀疏注意力机制,在几乎不影响模型输出效果的前提下,可以实现长文本训练和推理效率的大幅提升。为严谨评估引入稀疏注意力带来的影响,团队将DeepSeek-V3.2-Exp的训练设置与V3.1-Terminus进行了严格对齐。在各领域的公开评测集上,DeepSeek-V3.2-Exp的表现与V3.1-Terminus基本持平。
稀疏注意力机制并非全新概念,但将其有效投入实践一直面临挑战。长上下文建模是下一代大型语言模型的关键能力,但标准注意力机制的高计算开销是重大挑战。北京大学计算机学院张铭教授团队与DeepSeek梁文锋团队合作,在长上下文大语言模型高效建模领域取得突破性进展。他们提出了一种全新的注意力机制——原生可训练稀疏注意力(Native Sparse Attention,NSA)。该成果已在自然语言处理领域顶级会议ACL 2025中发表,并被评为最佳论文。
实验结果表明,基于NSA预训练的模型在通用基准、长上下文及指令推理任务上,均能保持甚至超越传统注意力模型表现。在64k序列长度下,NSA在解码、前向传播与反向传播阶段均实现显著加速。与Flash Attention对比,NSA在前向传播速度提升可达9倍,反向传播实现6倍加速,呈现“越长越优”趋势。
研究团队介绍,NSA的核心创新体现在两个方面:
硬件对齐的算法与实现,通过算术强度均衡设计和专用算子,显著提升运行速度;
原生可训练性,实现端到端训练模式,解决了稀疏注意力训练难题。
华为云已完成对DeepSeek-V3.2-Exp模型的适配工作,最大可支持160K长序列上下文长度。华为云继续使用大EP并行方案进行部署,通过稀疏Attention结构叠加实现长序列亲和的上下文并行策略,同时优化了模型的时延和吞吐性能。
作为一个实验性的版本,DeepSeek-V3.2-Exp虽然已经在公开评测集上得到了有效性验证,但仍然需要在用户的真实使用场景中进行更广泛测试。为方便用户进行对比测试,DeepSeek为V3.1-Terminus临时保留了额外的API访问接口。用户只需修改base_url即可访问V3.1-Terminus,调用价格与V3.2-Exp相同。该接口将保留到北京时间2025年10月15日23:59。
目前,DeepSeek-V3.2-Exp 模型已在Huggingface与魔搭开源,官方App、网页端、小程序均已同步更新为DeepSeek-V3.2-Exp。API的模型版本已经更新为DeepSeek-V3.2-Exp,访问方式保持不变。
HuggingFace:
https://huggingface.co/deepseek-ai/DeepSeek-V3.2-Exp
ModelScope:
https://modelscope.cn/models/deepseek-ai/DeepSeek-V3.2-Exp
论文:
https://github.com/deepseek-ai/DeepSeek-V3.2-Exp/blob/main/DeepSeek_V3_2.pdf