谷歌 DeepMind 创造人工智能历史,在全球最艰难的数学竞赛中获得金牌

7.22 谷歌DeepMind周一宣布,其Gemini人工智能模型的高级版本已在国际数学奥林匹克竞赛上正式获得金牌级表现,解决了六个异常困难的问题中的五个,并被公认为第一个获得竞赛组织者官方金级评级的人工智能系统

2025072203


谷歌 DeepMind 周一宣布,其 Gemini 人工智能模型的高级版本已在国际数学奥林匹克竞赛上正式获得金牌级表现,解决了六个异常困难的问题中的五个,并被公认为第一个获得竞赛组织者官方金级评级的人工智能系统。

 

这一胜利推动了人工智能推理领域的发展,并使谷歌在科技巨头构建下一代人工智能的激烈战斗中处于领先地位。更重要的是,它表明人工智能现在可以使用自然语言理解来解决复杂的数学问题,而不需要专门的编程语言。

 

自 1959 年以来,国际数学奥林匹克竞赛每年举行一次,被广泛认为是世界上最负盛名的大学预科生数学竞赛。每个参赛国都会派出 6 名精英青年数学家参加比赛,解决 6 个极具挑战性的问题,涵盖代数、组合学、几何学和数论。通常只有大约 8% 的人类参与者获得金牌。

 

Google DeepMind 的 Gemini Deep Think 如何破解数学界最难题

谷歌的最新成功远远超过了其 2024 年的表现,当时该公司的 AlphaProof 和 AlphaGeometry 系统组合通过解决六个问题中的四个而获得银牌。早期的系统要求人类专家首先将自然语言问题转换为特定于领域的编程语言,然后解释 AI 的数学输出。

 

今年的突破来自大语言模型深度思考,这是一种增强的推理系统,采用研究人员所说的“平行思维”。与遵循单一推理链的传统人工智能模型不同,Deep Think 在得出最终答案之前同时探索多种可能的解决方案。


“我们的模型以自然语言端到端运行,直接从官方问题描述中生成严格的数学证明,”Hassabis 在社交媒体网站 X 上的后续帖子中解释说,并强调该系统在比赛的标准 4.5 小时时限内完成了工作。

 

该模型获得了 35 分(满分 42 分),轻松超过了金牌门槛。根据 IMO 主席 Gregor Dolinar 教授博士的说法,这些解决方案“在许多方面都令人惊讶”,并且被比赛评分员发现“清晰、准确且其中大多数易于遵循”。

 

OpenAI 因绕过官方竞争规则而面临强烈反对

该公告发布之际,人工智能行业在竞争实践和透明度方面的紧张局势日益加剧。谷歌 DeepMind 发布结果的谨慎方法赢得了人工智能社区的赞扬,特别是与竞争对手 OpenAI 处理类似成就的方式形成鲜明对比。

 

“我们没有在周五宣布,因为我们尊重了国际海事组织委员会的原始要求,即所有人工智能实验室只有在官方结果已经得到独立专家的验证并且学生们正确地得到了他们应得的赞誉之后才能分享他们的结果,”Hassabis写道,似乎引用了OpenAI早些时候宣布的自己的奥林匹克表现。

 

社交媒体用户很快就注意到了这种区别。“你明白吗?OpenAI 无视 IMO 的要求。羞耻。没有素质。直截的不尊重,“一位用户写道。“Google DeepMind 秉持诚信和人性。”

 

批评源于 OpenAI 决定在不参与 IMO 官方评估过程的情况下宣布自己的数学奥林匹克竞赛结果。相反,OpenAI 让一个由前 IMO 参与者组成的小组对其 AI 的性能进行评分,社区中的一些人认为这种方法缺乏可信度。

 

“OpenAI 很可能是目前地球上最糟糕的公司,”一位批评者写道,而其他人则建议该公司需要“认真对待事情”和“更加可信”。

 

推动大语言模型掌握数学的训练方法内部

Google DeepMind 的成功似乎源于超越传统方法的新型训练技术。该团队使用了先进的强化学习方法,旨在利用多步推理、问题解决和定理证明数据。该模型还获得了对精选的高质量数学解决方案集合的访问权限,并获得了有关处理 IMO 式问题的具体指导。

 

这项技术成就给 AI 研究人员留下了深刻的印象,他们注意到了其更广泛的含义。“不仅仅是解决数学问题......而是理解语言描述的问题并将抽象逻辑应用于新案例,“AI 观察员 Elyss Wren 写道。“这不是死记硬背——这是运动中的涌现认知。”


沃顿商学院研究人工智能的教授伊桑·莫利克 (Ethan Mollick) 强调了使用通用模型而不是专用工具的重要性。“越来越多的证据表明法学硕士能够推广到解决新问题的能力,”他写道,并强调了这与以前需要专门数学软件的方法有何不同。

 

该模型在一个问题中展示了特别令人印象深刻的推理,许多人类竞争对手应用了研究生水平的数学概念。根据 DeepMind 研究人员 Junehyuk Jung 的说法,Gemini “做出了一个出色的观察,只使用初等数论创建了一个自包含的证明”,找到了一个比许多人类参与者更优雅的解决方案。

 

Google DeepMind 的胜利对 2000 亿美元的 AI 竞赛意味着什么

这一突破发生在 AI 行业的关键时刻,各公司都在竞相展示卓越的推理能力。这一成功具有立竿见影的实际意义:谷歌计划在向 Google AI Ultra 订阅者推出此 Deep Think 模型的一个版本之前提供给数学家进行测试,这些订阅者每月支付 250 美元即可访问该公司最先进的 AI 模型。

 

这一时机还凸显了主要人工智能实验室之间日益激烈的竞争。虽然谷歌庆祝其有条不紊、经过官方验证的方法,但围绕 OpenAI 公告的争议反映了人们对 AI 开发透明度和可信度的更广泛的紧张关系。

 

这种竞争动态不仅限于数学推理。最近几周,多家人工智能公司宣布了突破性能力,但并非所有公司都受到积极欢迎。埃隆·马斯克 (Elon Musk) 的 xAI 最近推出了 Grok 4,该公司声称这是“世界上最聪明的人工智能”,尽管排行榜得分显示它落后于谷歌和 OpenAI 的模型。此外,Grok 还因有争议的功能而受到批评,包括性化的人工智能伴侣和生成反犹太主义内容的情节。

 

像人类一样思考的人工智能的曙光——并带来现实世界的后果

数学奥林匹克竞赛的胜利不仅仅是竞争性的吹嘘。Gemini 的性能表明,AI 系统现在可以在需要创造力、抽象思维和跨多个领域综合见解的复杂任务中匹配人类水平的推理。

 

“与去年的突破性结果相比,这是一个重大进步,”DeepMind 团队在他们的技术公告中指出。从需要专门的形式语言到完全以自然语言运行的进展表明,人工智能系统正变得更加直观和易于访问。

 

对于企业来说,这一发展表明 AI 可能很快就会解决各个行业的复杂分析问题,而无需专门的编程或领域专业知识。使用日常语言通过复杂挑战进行推理的能力可以使整个组织的复杂分析能力大众化。

 

然而,关于这些推理能力是否能有效地转化为更混乱的现实世界挑战的问题仍然存在。数学奥林匹克提供了明确定义的问题和明确的成功标准——这与定义大多数商业和科学努力的模棱两可、多方面的决策相去甚远。

 

谷歌 DeepMind 计划重返明年的比赛,“以寻求满分”。该公司认为,将自然语言流利性与严谨推理相结合的人工智能系统“将成为数学家、科学家、工程师和研究人员的宝贵工具,帮助我们在通往 AGI 的道路上推进人类知识。

 

但也许最能说明问题的细节来自比赛本身:当面对比赛最棘手的问题时,双子座从一个错误的假设开始,再也没有恢复过来。只有五名人类学生正确解决了这个问题。最后,似乎即使是获得金牌的人工智能,仍然需要向青少年数学家学习。