国产大模型迅猛追赶,SuperCLUE九月榜显AI新格局

9.29 展望未来,国产大模型有望在中文理解本土化应用场景等方面进一步发挥优势,同时在基础能力建设上继续突破,推动中国人工智能产业实现高质量发展

9月28日,中文通用大模型综合性测评基准SuperCLUE发布了2025年9月榜单。数据显示,国际顶尖模型依然保持领先,但国产大模型正以惊人速度缩短差距,在多项关键能力上展现出强劲竞争力。


superclue202509

 

国际巨头暂居前列,OpenAI持续领跑

 

本次评测中,OpenAI的GPT-S(high)以69.37分的综合成绩位居榜首,在数字推理(73.64分)和幻觉控制(78.34分)方面表现突出。同属OpenAI的o3(high)模型在数字推理上更是获得77.27分的高分,显示出该公司在逻辑推理方面的技术积累。

 

Anthropic的Claude-Opus-4.1-Reasoning在幻觉控制方面表现最佳,获得86.23分的优异成绩。Google的Gemini-2.5-Pro则在智能体能力上以83.06分领先其他模型。前五名均被国际厂商包揽,形成了目前大模型领域的第一梯队。

 

国产力量强势崛起,多领域实现突破

 

值得关注的是,国产大模型正展现出强大的追赶势头。深度求索的DeepSeek-V3.1-Terminus-Thinking以61.44分领跑国内阵营,与榜首的差距已缩小到8分以内。字节跳动的Doubao-Seed-1.6-thinking以60.96分紧随其后,在幻觉控制(77.78分)和智能体能力(82.50分)方面表现亮眼。

 

百度ERNIE-XL1、阿里巴巴Qwen3-Max分别以60.33分和59.68分跻身国内前列,形成了颇具竞争力的国产第一梯队。华为的openPangu-Ultra-MoE-7188以58.87分展现出不俗实力。


superclue202509znzs

 

技术路线多元化,思维链效果显著

 

从技术路线看,带有“Thinking”(思维链)功能的模型普遍表现更好。深度求索、字节跳动、阿里巴巴等厂商的Thinking版本都在原有基础上有了明显提升,说明思维链技术在增强模型推理能力方面效果显著。

 

在具体能力维度上,国产模型展现出差异化优势。阿里巴巴Qwen3-Max在代码生成方面获得67.18分,在国内模型中领先;字节跳动Doubao在智能体能力上取得82.50分的高分;深度求索在科学推理和智能体能力上均衡发展。

 

产业生态日趋成熟,应用前景广阔

 

目前,大模型产业已形成多层次、多技术路线的健康发展格局。从互联网大厂到专业AI公司,都在开源和闭源两条技术路线上积极布局。这种多元化发展态势为不同应用场景提供了丰富选择,也将推动整个AI产业生态的繁荣发展。

 

业内专家表示,国产大模型在短短几年内实现如此快速的进步,体现了中国在人工智能领域强大的创新能力和产业实力。随着技术不断成熟和应用场景持续拓展,大模型将在数字经济发展中发挥更加重要的作用,为产业升级和创新发展注入新动能。

 

展望未来,国产大模型有望在中文理解、本土化应用场景等方面进一步发挥优势,同时在基础能力建设上继续突破,推动中国人工智能产业实现高质量发展。


链接:
https://superclueai.com/

报告全文:
https://pan.baidu.com/s/1V1e2NmhWuukBGnmuCMZ7-Q?pwd=xga3