2025上半年中文大模型测评报告发布:国产模型崛起,海外仍领跑推理领域

9.2 独立第三方测评机构SuperCLUE团队于2025年8月4日发布的报告显示,海外模型在推理任务上优势显著,国产模型则在智能体幻觉控制等任务中表现突出,开源模型领域中国已实现领先

独立第三方测评机构SuperCLUE团队于2025年8月4日发布《中文大模型综合性测评基准2025年上半年报告》,对国内外45个主流大模型进行了全面评估。报告显示,海外模型在推理任务上优势显著,国产模型则在智能体、幻觉控制等任务中表现突出,开源模型领域中国已实现领先。

 

 一、总体排名:海外模型占据前三

 

本次测评涵盖数学推理、科学推理、代码生成、智能体Agent、幻觉控制、精确指令遵循六大任务,题目总量1288道,全部为原创题目。

 

第一名:OpenAI o3(73.78分)

第二名:OpenAI o4-mini(high)(73.32分)

第三名:Google Gemini-2.5-Pro(68.98分)

国产最佳:字节跳动Doubao-Seed-1.6-thinking-250715(68.04分,全球第四)


250603

 

国内外顶尖模型差距从5月的10.42%缩小至7.78%,显示国产模型正在迅速追赶。 


250609


二、国产模型亮点突出

 

1. 智能体任务全球领先

Doubao-Seed-1.6-thinking-250715以90.67分位列全球第一。

GLM-4.5、SenseNova V6 Reasoner以83.58分并列国内第二。


250626

 

2. 幻觉控制表现优异

Doubao-Seed、ERNIE-X1-Turbo-32K-Preview、Hunyuan-T1-20250711包揽国内前三,与海外顶尖模型差距不足1分。

 

3. 开源模型显著领先

DeepSeek-R1-0528(66.15分)、Qwen3-235B-A22B-Thinking-2507(64.34分)、GLM-4.5(63.25分)位列开源榜前三。

海外最佳开源模型仅46.37分,落后国产模型近20分。

 

三、海外模型仍主导推理任务

 

o3在推理任务中获75.02分,领先国产最佳模型DeepSeek-R1-0528(65.74分)近10分。

海外模型在代码生成任务中也占据前五中的四席,闭源模型平均分(76.16)显著高于开源模型(54.94)。


250632

 

四、小参数模型表现亮眼

 

在10B参数以下模型中:

Qwen3-8B(Thinking)以48.38分位居榜首,超越海外同规模模型。

端侧5B级别模型中,国产模型包揽前二,展现强大落地潜力。


250633

 

五、性价比与效能分析

 

海外头部模型(如o3)价格高昂,性价比低于国产模型。

国产模型中,Hunyuan-T1、GLM-4.5、Doubao-Seed等兼具高性能与合理成本。

推理效能方面,海外模型响应更快,国产模型中仅SenseNova V6 Reasoner进入高效区。


250635


六、专项能力成熟度

 

根据SC成熟度指数,国产模型在以下方面表现:

中成熟度(0.5–0.8):数学推理、智能体、科学推理、代码生成

低成熟度(0.1–0.5):幻觉控制、精确指令遵循

 

七、代表性模型分析

 

1. Doubao-Seed-1.6-thinking-250715:强于智能体、代码生成与幻觉控制。

2. DeepSeek-R1-0528:擅长复杂推理与精确指令遵循,开源模型第一。

3. GLM-4.5:智能体任务国内第一,科学推理领先。

4. kimi-k2-0711-preview:代码生成国内第三,推理能力突出。

 

八、专项基准扩展

 

报告还介绍了多项专项测评基准:

Agent系列:如DeepResearch、AgentCLUE-General

多模态系列:涵盖视觉推理、文生视频、图生视频、文生图等

文本与推理系列:聚焦幻觉控制、事实性、指令遵循等

性能系列:包括第三方平台接入稳定性与搜索能力测评

 

结语

 

2025年上半年,中文大模型在通用能力、开源生态、智能体应用等方面进步显著,尤其在中文场景下展现出强劲竞争力。然而,在复杂推理、代码生成等核心能力上,海外模型仍保持领先。未来,国产模型需在技术深度、效能优化、多模态融合等方面持续突破。

 

报告来源:SuperCLUE团队  

完整报告详见:
https://pan.baidu.com/s/1p2gjbT3C22KzUYE2iNC40A?pwd=b8ia