5月28日,SuperCLUE团队发布了2025年5月中文大模型综合性测评基准报告,对国内外43个大模型进行了全面评估。报告显示,OpenAI的o4-mini(high)以70.51分的总分位居榜首,在推理、代码生成、智能体等多个维度展现出卓越能力,领先国内最好模型7.35分。国内模型虽在综合能力上仍有差距,但在文本创作、代码生成等细分领域表现突出,部分指标甚至超越海外模型。

国内外模型差距缩小,但指令逻辑仍是短板
报告指出,过去25个月中,国内外大模型在中文领域的通用能力差距逐步缩小。然而,国内模型在指令逻辑任务上表现较弱,得分最高的Hunyuan-T1-20250403(36.97分)与o4-mini(high)相差31.1分,显示出较大的提升空间。
国内模型亮点频现
字节跳动的Doubao-1.5-thinking-pro-250415在文本理解与创作任务中以81.04分领先其他模型;阿里巴巴的Qwen3-235B-A22B在代码生成任务中取得90.53分,与海外顶尖模型差距微小。此外,小参数模型如Qwen3系列展现出惊人潜力,其中4B、8B和14B版本在推理任务上分数均超过50分,超越部分闭源大模型。

开源模型与性价比优势
国内开源模型表现抢眼,深度求索的DeepSeek-R1和阿里巴巴的Qwen3系列在中文场景下领先全球开源生态。国产模型在性价比方面优势显著,如DeepSeek-V3-0324以低价格实现高质量输出,而海外模型如Gemini 2.5 Pro虽性能优异,但价格高昂。

成熟度分析:文本理解能力最强,科学推理待提升
国内大模型在文本理解与创作任务上成熟度最高(SC指数0.91),而科学推理(0.26)和数学推理(0.38)仍处于低成熟度区间,需进一步优化。

未来展望
SuperCLUE团队表示,随着AI技术快速发展,国内模型在特定领域已具备与国际竞争的实力,但需在指令逻辑、多模态交互等方向持续突破。报告还呼吁业界关注小参数模型的极致性价比潜力,以推动端侧应用的广泛落地。
此次测评覆盖数学推理、科学推理、代码生成等六大任务,题目全部原创,每两个月更新一次题库,确保测评的客观性和时效性。SuperCLUE作为独立第三方测评机构,致力于为行业提供专业参考,助力中文大模型技术发展。