SuperCLUE评分榜 —— 清华大学和智谱AI联合开发的中文通用大模型综合性评测基准

该榜单旨在全面评估中文大模型在语言理解知识应用专业能力等多维度的表现,并通过与国际先进模型的对比,推动中文自然语言处理技术的进步

SuperCLUE评分榜是由清华大学和智谱AI联合开发的中文通用大模型综合性评测基准。该榜单旨在全面评估中文大模型在语言理解、知识应用、专业能力等多维度的表现,并通过与国际先进模型的对比,推动中文自然语言处理技术的进步。

 

一、评估体系与任务设计

SuperCLUE从基础能力、专业能力和中文特性能力三大维度对模型进行评测,覆盖70余项子任务,确保评估的全面性和挑战性。

1. 基础能力(10项):

1. 语义理解:解析短语、句子及文本块的含义。

2. 逻辑推理:分析并回答问题,如数学计算、逻辑判断。

3. 角色模拟:在特定场景中扮演角色,生成符合角色设定的回复。

4. 代码能力:编写或理解编程语言(如Python、Java)。

5. 生成与创作:创作文章、诗歌或文案。

2. 专业能力(50+项):

1. 涵盖数学、物理、化学、生物学、计算机科学等学科知识,考察模型在专业领域的解题能力。

2. 示例任务:解微分方程、分析电路图、诊断医学案例等。

3. 中文特性能力(10项):

1. 成语与诗词:理解成语含义、创作诗词。

2. 方言与古文:解析方言表达、翻译文言文。

3. 歇后语与对联:补全歇后语、创作对联。


二、技术亮点与评测方式

1. 自动化测评:

1. 通过统一提示词(Prompt)和自动化脚本,一键完成模型测试,确保结果客观性和效率。

2. 系统自动提取模型答案并评分,对非标准答案采用优化策略处理。

2. 多轮对话与开放问题:

1. OPEN基准:评估模型在多轮对话中的上下文理解、指令遵循能力。

2. OPT基准:通过数千道客观选择题,考察模型的知识储备和逻辑推理。

3. 人类基准对比:

1. 提供模型与人类表现的对比数据,帮助开发者明确差距和改进方向。

4. 定期更新:

1. 榜单每月更新,纳入新模型和数据集,反映中文大模型的最新进展。


三、行业影响与社区反馈

1. 推动中文大模型发展:

1. 为开发者提供统一的评估标准,促进模型在中文任务上的优化,如角色扮演、知识问答等场景。

2. 案例:360智脑的RAG方案在SuperCLUE-RAG榜单中夺冠,验证了检索增强生成(RAG)技术的有效性。

2. 企业与技术社区认可:

1. 企业应用:企业可参考榜单选择或优化AI模型,提升客服、内容创作等场景的效率。

2. 学术价值:支持研究中文大模型与国际模型的差距,如GPT-4在逻辑推理上领先国内模型20个百分点。

3. 社区反馈与挑战:

1. 积极评价:认可其任务多样性和综合性,尤其在中文特性任务上填补了空白。

2. 改进空间:部分用户提出权威性、数据透明度的质疑,建议扩大评测范围和公开测试方法。


四、参与方式与资源


评分榜榜单:
https://www.superclueai.com/ 

官网访问:
https://www.cluebenchmarks.com/superclue.html

GitHub项目:
https://github.com/CLUEbenchmark/SuperCLUE

SuperCLUE评分榜 —— 清华大学和智谱AI联合开发的中文通用大模型综合性评测基准 | AIYXL