DeepSeek发布可自验证数学模型DeepSeekMath-V2,AI数学推理迈入新阶段

11.28 近日,人工智能公司DeepSeek正式发布了其最新数学推理模型DeepSeekMathV2,该模型基于DeepSeekV3.2ExpBase构建,主打可自我验证的数学推理训练框架,在多项国际顶级数学竞赛中展现出接近人类顶尖选手的解题能力

近日,人工智能公司 DeepSeek 正式发布了其最新数学推理模型 DeepSeekMath‑V2,该模型基于 DeepSeek‑V3.2‑Exp‑Base 构建,主打可自我验证的数学推理训练框架,在多项国际顶级数学竞赛中展现出接近人类顶尖选手的解题能力。

 

DeepSeek 团队指出,传统大模型往往只关注最终答案的正确率,却忽视了推理链条本身的严谨性——这一缺陷在需要严密逻辑推导的定理证明任务中尤为致命。为解决这一问题,DeepSeekMath‑V2 引入了一个基于大语言模型(LLM)的自动验证器,能够对模型自身生成的数学证明进行逐行审查。验证器不仅评估最终结论,更检验每一步推理是否逻辑自洽、前提充分。

 

更进一步,该框架利用验证结果持续生成高难度训练样本,形成“生成—验证—再训练”的闭环,从而不断提升验证器本身的判别能力与模型的整体推理水平。这种“自我质疑、自我修正”的机制,标志着AI数学推理正从“应试型”向“理解型”跃迁。

 

DeepSeekMath‑V2 的性能已在多项国际权威数学竞赛中得到验证。据官方披露,该模型在 2025年国际数学奥林匹克竞赛(IMO 2025)和 2024年中国数学奥林匹克竞赛(CMO 2024)的模拟测试中,均达到了金牌水准。

 

值得注意的是,在刚刚结束的2024年普特南数学竞赛(Putnam 2024)中,DeepSeekMath‑V2 取得了 118/120 分的惊人成绩,近乎满分,远超绝大多数人类参赛者。这一成绩不仅证明了其强大的问题解决能力,更凸显了其在处理高难度、开放式证明题上的优势。


2025-11-28_112426_381

 

DeepSeek 的这一突破并非孤例。近期,包括 VerityMath、Verifiable Hybrid Reasoning (VHR) 在内的多个研究项目也纷纷将“自验证”(Self-Verification)作为提升模型可靠性的核心策略。学术界普遍认为,通过让模型具备自我审查和纠错能力,是通向更强大、更可信赖的通用人工智能的关键路径之一。

 

尽管 DeepSeek 团队坦言,构建真正具备人类级数学理解能力的AI系统仍有大量工作待完成,但 DeepSeekMath‑V2 的成功已清晰地表明:可自验证的数学推理是一条切实可行的研究路径,有望为未来构建更强大、更可靠的科学智能系统奠定坚实基础。


https://huggingface.co/deepseek-ai/DeepSeek-Math-V2 

https://github.com/deepseek-ai/DeepSeek-Math-V2