独立第三方测评机构SuperCLUE团队于2025年8月4日发布《中文大模型综合性测评基准2025年上半年报告》,对国内外45个主流大模型进行了全面评估。报告显示,海外模型在推理任务上优势显著,国产模型则在智能体、幻觉控制等任务中表现突出,开源模型领域中国已实现领先。
一、总体排名:海外模型占据前三
本次测评涵盖数学推理、科学推理、代码生成、智能体Agent、幻觉控制、精确指令遵循六大任务,题目总量1288道,全部为原创题目。
第一名:OpenAI o3(73.78分)
第二名:OpenAI o4-mini(high)(73.32分)
第三名:Google Gemini-2.5-Pro(68.98分)
国产最佳:字节跳动Doubao-Seed-1.6-thinking-250715(68.04分,全球第四)

国内外顶尖模型差距从5月的10.42%缩小至7.78%,显示国产模型正在迅速追赶。

二、国产模型亮点突出
1. 智能体任务全球领先
Doubao-Seed-1.6-thinking-250715以90.67分位列全球第一。
GLM-4.5、SenseNova V6 Reasoner以83.58分并列国内第二。

2. 幻觉控制表现优异
Doubao-Seed、ERNIE-X1-Turbo-32K-Preview、Hunyuan-T1-20250711包揽国内前三,与海外顶尖模型差距不足1分。
3. 开源模型显著领先
DeepSeek-R1-0528(66.15分)、Qwen3-235B-A22B-Thinking-2507(64.34分)、GLM-4.5(63.25分)位列开源榜前三。
海外最佳开源模型仅46.37分,落后国产模型近20分。
三、海外模型仍主导推理任务
o3在推理任务中获75.02分,领先国产最佳模型DeepSeek-R1-0528(65.74分)近10分。
海外模型在代码生成任务中也占据前五中的四席,闭源模型平均分(76.16)显著高于开源模型(54.94)。

四、小参数模型表现亮眼
在10B参数以下模型中:
Qwen3-8B(Thinking)以48.38分位居榜首,超越海外同规模模型。
端侧5B级别模型中,国产模型包揽前二,展现强大落地潜力。

五、性价比与效能分析
海外头部模型(如o3)价格高昂,性价比低于国产模型。
国产模型中,Hunyuan-T1、GLM-4.5、Doubao-Seed等兼具高性能与合理成本。
推理效能方面,海外模型响应更快,国产模型中仅SenseNova V6 Reasoner进入高效区。

六、专项能力成熟度
根据SC成熟度指数,国产模型在以下方面表现:
中成熟度(0.5–0.8):数学推理、智能体、科学推理、代码生成
低成熟度(0.1–0.5):幻觉控制、精确指令遵循
七、代表性模型分析
1. Doubao-Seed-1.6-thinking-250715:强于智能体、代码生成与幻觉控制。
2. DeepSeek-R1-0528:擅长复杂推理与精确指令遵循,开源模型第一。
3. GLM-4.5:智能体任务国内第一,科学推理领先。
4. kimi-k2-0711-preview:代码生成国内第三,推理能力突出。
八、专项基准扩展
报告还介绍了多项专项测评基准:
Agent系列:如DeepResearch、AgentCLUE-General
多模态系列:涵盖视觉推理、文生视频、图生视频、文生图等
文本与推理系列:聚焦幻觉控制、事实性、指令遵循等
性能系列:包括第三方平台接入稳定性与搜索能力测评
结语
2025年上半年,中文大模型在通用能力、开源生态、智能体应用等方面进步显著,尤其在中文场景下展现出强劲竞争力。然而,在复杂推理、代码生成等核心能力上,海外模型仍保持领先。未来,国产模型需在技术深度、效能优化、多模态融合等方面持续突破。
报告来源:SuperCLUE团队
完整报告详见:
https://pan.baidu.com/s/1p2gjbT3C22KzUYE2iNC40A?pwd=b8ia