OpenAI 周四发布了一项新基准测试,测试其人工智能模型与各行各业和工作中的人类专业人士相比的表现。该测试名为 GDPval,是了解 OpenAI 的系统在具有经济价值的工作中与超越人类有多接近的早期尝试——这是该公司开发通用人工智能 (AGI) 的创始使命的关键部分。
OpenAI 表示,它发现其 GPT-5 模型和 Anthropic 的 Claude Opus 4.1“已经接近行业专家制作的工作质量”。
这并不是说 OpenAI 的模型将立即开始取代人类的工作。尽管一些首席执行官预测人工智能将在短短几年内取代人类的工作,但 OpenAI 承认,如今的 GDPval 涵盖了人们在实际工作中完成的非常有限的任务。然而,这是该公司衡量人工智能朝这一里程碑取得进展的最新方法之一。
GDPval 基于对美国国内生产总值贡献最大的九个行业,包括医疗保健、金融、制造业和政府等领域。该基准测试了人工智能模型在这些行业的 44 个职业中的性能,从软件工程师到护士再到记者。
对于OpenAI的第一个测试版本GDPval-v0,OpenAI要求有经验的专业人士将AI生成的报告与其他专业人士生成的报告进行比较,然后选择最好的一份。例如,一个提示要求投资银行家为最后一英里交付行业创建竞争对手格局,并将其与人工智能生成的报告进行比较。然后,OpenAI 将人工智能模型的“胜率”与所有 44 个职业的人类报告进行平均。
对于 GPT-5-high,具有额外计算能力的 GPT-5 增强版,该公司表示,该 AI 模型在 40.6% 的时间内被评为优于或与行业专家相当。
OpenAI 还测试了 Anthropic 的 Claude Opus 4.1 模型,该模型在 49% 的任务中被评为优于或与行业专家相当。OpenAI 表示,它认为 Claude 得分如此之高是因为它倾向于制作令人愉悦的图形,而不是纯粹的性能。

图片来源:OpenAI
值得注意的是,大多数在职专业人士所做的不仅仅是向老板提交研究报告,而这正是 GDPval-v0 测试的全部内容。OpenAI 承认这一点,并表示计划在未来创建更强大的测试,以考虑更多行业和交互式工作流程。
尽管如此,该公司认为 GDPval 的进展值得注意。
OpenAI 首席经济学家 Aaron Chatterji 博士在接受 TechCrunch 采访时表示,GDPval 的结果表明,从事这些工作的人现在可以使用人工智能模型将时间花在更有意义的任务上。
“[因为]该模型在其中一些事情上变得越来越好,”Chatterji 说,“随着能力的提高,从事这些工作的人现在可以使用该模型来减轻他们的一些工作并做潜在的更高价值的事情。
OpenAI 的评估负责人 Tejal Patwardhan 告诉 TechCrunch,她对 GDPval 的进展速度感到鼓舞。OpenAI 的 GPT-4o 模型得分仅为 13.7%(与人类的胜负),大约 15 个月前发布。现在 GPT-5 的得分几乎是这个数字的三倍,Patwardhan 预计这一趋势将持续下去。
硅谷有广泛的基准测试,用于衡量人工智能模型的进展并评估给定模型是否是最先进的。其中最受欢迎的是 AIME 2025(竞争性数学问题测试)和 GPQA Diamond(博士级科学问题测试)。然而,一些人工智能模型在其中一些基准测试上已接近饱和,许多人工智能研究人员表示需要更好的测试来衡量人工智能对现实世界任务的熟练程度。
像 GDPval 这样的基准在这场对话中可能会变得越来越重要,因为 OpenAI 证明其人工智能模型对各行各业都很有价值。但OpenAI可能需要一个更全面的测试版本,才能明确地说其AI模型可以超越人类。