SuperCLUE 2025年度报告发布:国产大模型加速赶超,开源生态领跑全球

2.24 报告显示,2025年是大模型从技术爆发走向智能体落地的关键一年,国产大模型在推理能力代码生成开源生态等领域展现出强劲的追赶势头,部分任务已实现全球领先

ScreenShot_2026-02-24_163620_104


近日,SuperCLUE发布了《2025年年度中文大模型基准测评报告》,全面梳理了过去一年全球大模型技术的发展格局与核心突破。报告显示,2025年是大模型从“技术爆发”走向“智能体落地”的关键一年,国产大模型在推理能力、代码生成、开源生态等领域展现出强劲的追赶势头,部分任务已实现全球领先。

 

一、2025年大模型三大关键进展:智能体崛起、推理突破、开源主导

 

报告将2025年的大模型发展划分为三个关键阶段:  

  • 百模大战与多模态萌芽(2023-2024):ChatGPT引爆全球关注,国内百度、阿里、讯飞等迅速跟进,开源模型如Baichuan、ChatGLM2等推动技术民主化。  

  • 多模态爆发与推理突破(2024-2025):OpenAI发布Sora、GPT-4o,推动视频生成与实时交互;国内可灵AI、Vidu等视频模型在海外取得突破;推理模型如DeepSeek-R1、k0-math集中涌现。  

  • 智能体崛起与生态重构(2025年至今):DeepSeek-R1以超高性价比引爆全球;中国开源模型占据全球半壁江山;Manus、AutoGLM等智能体产品落地,编程Agent成为亮点。 


ScreenShot_2026-02-24_163707_696

 

二、全球榜单:海外仍占头部,国产加速并跑

 

在2025年年度SuperCLUE通用基准测评中,Claude-Opus-4.5-Reasoning以68.25分位居全球第一,Gemini-3-Pro-Preview(65.59分)和GPT-5.2(high)(64.32分)紧随其后。

 

国产模型表现亮眼:月之暗面的Kimi-K2.5-Thinking(61.50分)位列全球第四,阿里Qwen3-Max-Thinking(60.61分)排名第六,双双跻身全球前十。报告指出,国产大模型正从“跟跑”向“并跑”加速演进,在代码生成、数学推理等任务上已具备全球竞争力。

 

ScreenShot_2026-02-24_165300_723 

 

三、开源生态:国产主导,全面超越海外

 

在开源模型赛道,国产模型全面领先。Kimi-K2.5-Thinking以61.50分位居开源第一,DeepSeek-V3.2-Thinking和GLM-4.7分别位列第二、第三,大幅超越海外最佳开源模型gpt-oss-120b。报告评价称:“中国开源模型已主导全球开源生态。”

 

ScreenShot_2026-02-24_165418_474 

 

四、六大任务深度拆解:国产代码登顶,指令遵循仍是短板

 

本次测评涵盖数学推理、科学推理、代码生成、智能体(任务规划)、精确指令遵循、幻觉控制六大任务。主要发现包括: 

  • 代码生成:Kimi-K2.5-Thinking以53.33分全球第一,超越Grok-4、Claude等海外顶尖模型,尤其在WebCoding子任务上表现突出。 

  • 数学推理:Qwen3-Max-Thinking与Gemini-3-Pro-Preview并列全球第一(80.87分)。 

  • 智能体(任务规划):Qwen3-Max-Thinking位列全球第三(70.13分),Kimi-K2.5-Thinking紧随其后。 

  • 精确指令遵循:国内模型整体落后,与海外头部差距超13分,是国产模型的明显短板。 

  • 幻觉控制:GLM-4.7跻身全球前三,与海外第一梯队差距缩小至5分以内。

 

ScreenShot_2026-02-24_165848_538 

 

五、开闭源对比:闭源全面领先,开源单点突破

 

在开闭源模型对比中,闭源模型在六大任务上均保持领先,尤其在智能体、指令遵循、幻觉控制等任务上优势明显。但开源模型在代码生成任务上实现单点突破,Kimi-K2.5-Thinking登顶全球,展现出开源阵营在垂直领域的强大潜力。

 

六、性价比与效能:国产性价比优势显著,推理效率仍有提升空间

 

在性价比方面,国产模型以更低价格实现接近国际顶尖的性能。Kimi-K2.5-Thinking、Qwen3-Max-Thinking、Doubao-Seed-1.8等均位于高性价比区间,而海外同等性能模型价格普遍是国内的3倍以上。

 

在推理效能上,海外模型仍占据高效能区,但国产模型正在加速优化。Kimi-K2.5-Thinking相比前代Kimi-K2-Thinking,推理能力提升近14%,推理速度提升近3倍,初步实现“高性能+高效率”的协同优化。

 

七、人类一致性验证:SuperCLUE与LMArena高度相关

 

报告还进行了人类一致性验证,将SuperCLUE得分与LMArena大众匿名投票结果进行相关性分析,皮尔逊相关系数达0.8239,斯皮尔曼相关系数达0.8321,表明SuperCLUE基准测评结果与人类偏好高度一致,具有较强的公信力。

 

八、专项测评矩阵全面升级:覆盖多模态、Agent、编程等前沿领域

 

除通用基准外,SuperCLUE 2025年还推出了多个专项测评板块,涵盖: 

  • 编程竞技场:Claude-Opus-4.5-Reasoning领跑,Kimi-K2.5-Thinking位列第二。 

  • 图像/视频竞技场:Gemini-3-Pro-Image-Preview、veo-3.0等国际模型领先,国产Seedream、可灵等紧随其后。 

  • Agent专项:涵盖CUA、通用智能体、软件工程(SWE)、深度研究(DeepResearch)等方向,全面评估模型在真实场景中的应用能力。 

  • 幻觉与指令遵循专项:DeepSeek-R1在事实性幻觉任务中领跑,GPT-5系列在精确指令遵循上表现最优。

 

ScreenShot_2026-02-24_170058_810 

 

九、2026年展望:国产模型有望实现全面并跑

 

报告总结指出,2025年是国产大模型从“跟跑”到“并跑”的关键一年。在代码生成、数学推理、开源生态等领域,国产模型已具备全球竞争力;在智能体、指令遵循等任务上,仍有提升空间。随着Kimi-K2.5-Thinking、Qwen3-Max-Thinking等新一代模型的发布,国产大模型正加速向国际顶尖水平迈进。

 

SuperCLUE表示,未来将继续深化多模态、Agent、推理等方向的测评体系建设,为行业提供更科学、更全面的参考依据,助力中国大模型产业高质量发展。

 

关于SuperCLUE 

SuperCLUE是中文语言理解测评基准CLUE在大模型时代的延续,专注于通用大模型的综合性测评,致力于为产业、学术和研究机构提供客观、中立的第三方评估服务。

 

完整报告详见:报告全文