9月28日,中文通用大模型综合性测评基准SuperCLUE发布了2025年9月榜单。数据显示,国际顶尖模型依然保持领先,但国产大模型正以惊人速度缩短差距,在多项关键能力上展现出强劲竞争力。

国际巨头暂居前列,OpenAI持续领跑
本次评测中,OpenAI的GPT-S(high)以69.37分的综合成绩位居榜首,在数字推理(73.64分)和幻觉控制(78.34分)方面表现突出。同属OpenAI的o3(high)模型在数字推理上更是获得77.27分的高分,显示出该公司在逻辑推理方面的技术积累。
Anthropic的Claude-Opus-4.1-Reasoning在幻觉控制方面表现最佳,获得86.23分的优异成绩。Google的Gemini-2.5-Pro则在智能体能力上以83.06分领先其他模型。前五名均被国际厂商包揽,形成了目前大模型领域的第一梯队。
国产力量强势崛起,多领域实现突破
值得关注的是,国产大模型正展现出强大的追赶势头。深度求索的DeepSeek-V3.1-Terminus-Thinking以61.44分领跑国内阵营,与榜首的差距已缩小到8分以内。字节跳动的Doubao-Seed-1.6-thinking以60.96分紧随其后,在幻觉控制(77.78分)和智能体能力(82.50分)方面表现亮眼。
百度ERNIE-XL1、阿里巴巴Qwen3-Max分别以60.33分和59.68分跻身国内前列,形成了颇具竞争力的国产第一梯队。华为的openPangu-Ultra-MoE-7188以58.87分展现出不俗实力。

技术路线多元化,思维链效果显著
从技术路线看,带有“Thinking”(思维链)功能的模型普遍表现更好。深度求索、字节跳动、阿里巴巴等厂商的Thinking版本都在原有基础上有了明显提升,说明思维链技术在增强模型推理能力方面效果显著。
在具体能力维度上,国产模型展现出差异化优势。阿里巴巴Qwen3-Max在代码生成方面获得67.18分,在国内模型中领先;字节跳动Doubao在智能体能力上取得82.50分的高分;深度求索在科学推理和智能体能力上均衡发展。
产业生态日趋成熟,应用前景广阔
目前,大模型产业已形成多层次、多技术路线的健康发展格局。从互联网大厂到专业AI公司,都在开源和闭源两条技术路线上积极布局。这种多元化发展态势为不同应用场景提供了丰富选择,也将推动整个AI产业生态的繁荣发展。
业内专家表示,国产大模型在短短几年内实现如此快速的进步,体现了中国在人工智能领域强大的创新能力和产业实力。随着技术不断成熟和应用场景持续拓展,大模型将在数字经济发展中发挥更加重要的作用,为产业升级和创新发展注入新动能。
展望未来,国产大模型有望在中文理解、本土化应用场景等方面进一步发挥优势,同时在基础能力建设上继续突破,推动中国人工智能产业实现高质量发展。
报告全文:
https://pan.baidu.com/s/1V1e2NmhWuukBGnmuCMZ7-Q?pwd=xga3