DeepSeek发布V3.2正式版:推理能力比肩GPT-5,开源模型再迎突破

12.1 根据官方技术报告,V3.2在智能体工具调用评测中达到了当前开源模型的最高水平,大幅缩小了开源模型与闭源模型在该能力上的差距

在宣布对DSA稀疏注意力机制进行实验性探索两个月后,深度求索(DeepSeek)公司于今日正式推出了其新一代大语言模型——DeepSeek-V3.2及其高性能变体V3.2-Speciale。


官方网页、App及API现已全面更新为正式版DeepSeek-V3.2。


Speciale版本则以临时API服务形式开放供社区评测,并将持续至12月15日。两款模型均已在HuggingFace与ModelScope平台开源。


DeepSeek一改过往思考模式下无法调用工具的局限,DeepSeek-V3.2首次将深度思考与工具调用融合,在主流推理测试中已逼近顶尖闭源商业模型的性能。

 

性能突破:开源模型紧追闭源顶流

 

DeepSeek-V3.2的定位是一款平衡推理能力与输出效率的日常使用模型。该公司表示,在公开的推理类基准测试中,DeepSeek-V3.2已达到了GPT-5的水平,表现略低于谷歌的Gemini-3.0-Pro。


2025-12-01_204302_748

 

与同样主打长思考的竞品Kimi-K2-Thinking相比,V3.2在实现相近性能的同时,输出长度大幅降低。这不仅显著减少了计算开销,也缩短了用户的等待时间。

 

更具突破性的是专为极限推理任务设计的V3.2-Speciale版本。它融合了DeepSeek-Math-V2的定理证明能力,在主流推理基准上的性能已可媲美Gemini-3.0-Pro。

 

更引人注目的是,该模型在多项顶级国际竞赛的模拟评测中均获得金牌:

  • IMO 2025(国际数学奥林匹克)

  • CMO 2025(中国数学奥林匹克)

  • ICPC World Finals 2025(国际大学生程序设计竞赛)

  • IOI 2025(国际信息学奥林匹克)

 

其在ICPC与IOI中的成绩,分别达到了人类选手第二名与第十名的水平。官方也提醒,Speciale版本在处理复杂任务时消耗的代币(Tokens)显著更多,成本更高,目前仅供研究使用。


2025-12-01_203918_164

 

核心进化:思考与工具调用的首次融合

 

此次V3.2版本最核心的进化,是首次实现了“思考”与“工具使用”两大核心能力的融合。

 

过往版本在思考模式下无法调用工具的局限被打破,DeepSeek-V3.2成为该公司首个支持在思考模式与非思考模式下均可进行工具调用的模型。

 

为实现这一能力,团队提出并实施了一种大规模Agent训练数据合成方法。他们构建了包含1800多个环境和超过85,000条复杂指令的强化学习任务数据集,其特点是“难解答,易验证”。

 

根据官方技术报告,V3.2在智能体工具调用评测中达到了当前开源模型的最高水平,大幅缩小了开源模型与闭源模型在该能力上的差距。


2025-12-01_203931_059

 

DeepSeek特别说明,V3.2并未针对这些评测集的工具进行特殊训练,因此预计在真实应用场景中能展现出较强的泛化能力。

 

在思考模式下,模型能够进行多轮的内部推理并调用外部工具,最终给出更详尽和准确的回答。该模式现已增加对Claude Code的支持,用户可通过修改模型名或在命令行中按Tab键开启。

 

技术基石:已验证的DSA稀疏注意力机制

 

此次发布的正式版,建立在两个月前推出的实验性版本V3.2-Exp的基础之上。

 

V3.2-Exp当时的主要革新是首次引入了DeepSeek自研的DeepSeek Sparse Attention稀疏注意力机制,旨在优化长文本的处理效率。

 

为了严谨评估该机制的影响,团队将V3.2-Exp的训练设置与前代模型V3.1-Terminus进行了严格对齐。

 

根据官方今日发布的信息,经过两个月社区用户的广泛对比测试,未发现V3.2-Exp在任何特定场景中显著差于V3.1-Terminus,这验证了DSA稀疏注意力机制在保持性能前提下的有效性。

 

V3.2-Exp发布时,其配套的API服务价格曾同步大幅下调超过50%。输入(缓存命中)价格降至每百万tokens 0.2元,输出价格降至每百万tokens 3元。

 

这一成本优势在此次正式版中得以延续,进一步降低了开发者的使用门槛。

 

快速迭代:DeepSeek的“小步快跑”模式

 

从V3.2-Exp实验版到今日的双正式版发布,仅间隔两个月,这体现了DeepSeek高速的模型迭代节奏。

 

回顾2025年,DeepSeek在V3系列上保持了密集的更新频率:

  • 3月:V3模型小版本升级,优化长上下文与代码生成。

  • 5月:试升级R1模型,在代码生成测试中性能媲美OpenAI模型。

  • 8月:发布V3.1,采用专为国产芯片设计的FP8参数精度。

  • 9月:推出V3.1-Terminus,解决输出不稳定问题,并强化Agent能力。

 

这种“小步快跑”的模式,一方面快速响应了开发者的需求,另一方面也在激烈的市场竞争中持续巩固其技术地位。

 

就在DeepSeek频繁更新之际,国内其他厂商如智谱AI也宣布其GLM4.6模型即将亮相,显示出中国大模型竞赛正向纵深发展。

 

使用与开源:全面可及的双重路径

 

对于普通用户和开发者,DeepSeek提供了灵活的使用路径。DeepSeek-V3.2已成为官方在所有平台(网页、App、API)默认提供服务的正式模型,使用方式与此前版本一致。

 

对于希望体验极限推理性能的研究者,可以通过设置特定的API base_url来临时访问V3.2-Speciale模型,该服务将持续至北京时间12月15日23:59。该版本仅支持思考模式下的对话,不支持工具调用。

 

最为重要的是,秉承一贯的开源理念,DeepSeek-V3.2和V3.2-Speciale的模型权重与代码均已完全开源,发布于HuggingFace和ModelScope平台。

 

官方同步发布了详细的技术报告,并配套提供了演示新聊天模板编码和解码的Python脚本。这为全球开发者研究、评测乃至基于此进行二次开发奠定了坚实基础。

 

国际数学奥林匹克(IMO)、国际信息学奥林匹克(IOI)——这些代表人类最高智力竞技水平的赛场,如今成了AI模型的试金石。

 

当DeepSeek-V3.2-Speciale在模拟中摘下这些赛事的金牌时,其意义远超一场技术测试的胜利。它像一个坐标,清晰地标出了开源大模型在复杂推理能力上所抵达的新高度。

 

这种高度,正以前所未有的速度,逼近甚至在某些维度上触及着闭源商业模型的边界。


技术报告:

https://modelscope.cn/models/deepseek-ai/DeepSeek-V3.2/resolve/master/assets/paper.pdf