OpenAI 让 AI 为您做任何事情的探索

8.4 借助人工智能推理模型,OpenAI确定它有两个新轴可以改进人工智能模型在人工智能模型的后期训练期间使用更多的计算能力,以及在回答问题时为人工智能模型提供更多时间和处理能力

亨特·莱特曼 (Hunter Lightman) 于 2022 年加入 OpenAI 担任研究员后不久,他目睹了同事们推出了 ChatGPT,这是有史以来增长最快的产品之一。与此同时,莱特曼在一个团队中悄悄地工作,教授 OpenAI 的模型来解决高中数学竞赛。

如今,这个名为 MathGen 的团队被认为对 OpenAI 创建人工智能推理模型的行业领先努力发挥了重要作用:人工智能代理背后的核心技术,可以像人类一样在计算机上执行任务。

“我们试图让模型在数学推理方面做得更好,而当时他们不太擅长,”莱特曼告诉 TechCrunch,描述了 MathGen 的早期工作。

OpenAI 的模型如今远非完美——该公司最新的人工智能系统仍然出现幻觉,其代理在复杂的任务中苦苦挣扎。

但其最先进的模型在数学推理方面有了显着改进。OpenAI 的一款模型最近在国际数学奥林匹克竞赛中获得了金牌,这是一项针对世界上最聪明的高中生的数学竞赛。OpenAI 相信这些推理能力将转化为其他主题,并最终为该公司一直梦想构建的通用代理提供动力。

ChatGPT 是一个令人高兴的意外——一个低调的研究预览变成了病毒式的消费者业务——但 OpenAI 的代理是公司内部长达数年深思熟虑的努力的产物。

“最终,你只需向计算机询问你需要什么,它就会为你完成所有这些任务,”OpenAI 首席执行官 Sam Altman 在该公司 2023 年的首届开发者大会上表示。“这些能力在人工智能领域经常被谈论为代理。这样做的好处将是巨大的。


tp080401
OpenAI 首席执行官 Sam Altman 于 2023 年 11 月 6 日在加利福尼亚州旧金山举行的 OpenAI DevDay 活动中发表讲话。(贾斯汀·沙利文/盖蒂图片社摄)

 

代理是否会满足 Altman 的愿景还有待观察,但 OpenAI 在 2024 年秋季发布了其首个 AI 推理模型 o1,震惊了世界。不到一年后,这一突破背后的 21 名基础研究人员成为硅谷最受追捧的人才。

马克·扎克伯格招募了五名 o1 研究人员来研究 Meta 新的专注于超级智能的部门,并提供了一些超过 1 亿美元的薪酬方案。其中一位赵胜佳最近被任命为 Meta Superintelligence Labs 的首席科学家。

强化学习的复兴

OpenAI 推理模型和代理的兴起与一种称为强化学习 (RL) 的机器学习训练技术有关。RL 向 AI 模型提供反馈,了解其在模拟环境中的选择是否正确。

RL 已经使用了几十年。例如,2016 年,即 OpenAI 于 2015 年成立大约一年后,谷歌 DeepMind 使用 RL 创建的人工智能系统 AlphaGo 在棋盘游戏围棋中击败世界冠军后获得了全球关注。


tp080402
2016 年 3 月 13 日,韩国职业围棋棋手李世石(右)在韩国首尔举行的 Google DeepMind 挑战赛中准备与谷歌人工智能程序 AlphaGo 的第四场比赛。李世石与谷歌开发的计算机程序 AlphaGo 进行了一场五局比赛。(照片由谷歌通过 Getty Images 提供)

 

大约在那个时候,OpenAI 的第一批员工之一 Andrej Karpathy 开始思考如何利用 RL 创建可以使用计算机的 AI 代理。但 OpenAI 需要数年时间才能开发必要的模型和训练技术。

到 2018 年,OpenAI 率先推出了 GPT 系列中的第一个大型语言模型,该模型在大量互联网数据和大型 GPU 集群上进行了预训练。GPT 模型擅长文本处理,最终催生了 ChatGPT,但在基本数学方面遇到了困难。

直到 2023 年,OpenAI 才通过结合 LLM、RL 和一种称为测试时间计算的技术,实现了突破,最初被称为“Q*”,然后被称为“Strawberry”。后者为模型提供了额外的时间和计算能力来计划和解决问题,验证其步骤,然后再提供答案。

这使得 OpenAI 能够引入一种称为“思维链”(CoT) 的新方法,该方法提高了人工智能在模型以前从未见过的数学问题上的性能。

“我可以看到模型开始推理,”El Kishky 说。“它会注意到错误并回溯,它会感到沮丧。这真的感觉就像在读一个人的想法。

尽管这些技术单独并不新鲜,但 OpenAI 将它们独特地结合起来创建了 Strawberry,这直接导致了 o1 的发展。OpenAI 很快发现,人工智能推理模型的规划和事实核查能力可能有助于为人工智能代理提供支持。

“我们解决了一个我几年来一直在努力解决的问题,”莱特曼说。“这是我研究生涯中最激动人心的时刻之一。”

缩放推理

借助人工智能推理模型,OpenAI 确定它有两个新轴可以改进人工智能模型:在人工智能模型的后期训练期间使用更多的计算能力,以及在回答问题时为人工智能模型提供更多时间和处理能力。

“OpenAI 作为一家公司,不仅考虑事物的现状,还考虑事物的扩展方式,”莱特曼说。

两位消息人士告诉 TechCrunch,在 2023 年 Strawberry 取得突破后不久,OpenAI 组建了一个由 OpenAI 研究员 Daniel Selsam 领导的“Agents”团队,以在这一新范式上取得进一步进展。尽管该团队被称为“代理”,但 OpenAI 最初并没有像我们今天所认为的那样区分推理模型和代理。该公司只是想让人工智能系统能够完成复杂的任务。

最终,Selsam 的 Agents 团队的工作成为开发 o1 推理模型的更大项目的一部分,领导者包括 OpenAI 联合创始人 Ilya Sutskever、首席研究官 Mark Chen 和首席科学家 Jakub Pachocki。


tp080403
2023 年 6 月 5 日,俄罗斯裔以色列裔加拿大计算机科学家、OpenAI 联合创始人兼首席科学家 Ilya Sutskever 在特拉维夫特拉维夫大学发表演讲。(杰克·格兹/法新社摄)

 

OpenAI 将不得不转移宝贵的资源——主要是人才和 GPU——来创造 o1。纵观OpenAI的历史,研究人员不得不与公司领导谈判才能获得资源;展示突破是确保它们的必经之路。

“OpenAI 的核心组成部分之一是研究中的一切都是自下而上的,”莱特曼说。“当我们展示 [o1] 的证据时,该公司说,'这很有道理,让我们继续努力吧。'

一些前员工表示,这家初创公司开发 AGI 的使命是围绕人工智能推理模型实现突破的关键因素。通过专注于开发最智能的人工智能模型而不是产品,OpenAI 能够将 o1 置于其他工作之上。在竞争的人工智能实验室中,这种对想法的大量投资并不总是可能的。

事实证明,尝试新训练方法的决定是有先见之明的。到 2024 年底,几家领先的人工智能实验室开始发现通过传统预训练扩展创建的模型的回报递减。如今,人工智能领域的大部分动力来自推理模型的进步。

人工智能的“推理”意味着什么?

在许多方面,人工智能研究的目标是用计算机重新创造人类智能。自 o1 推出以来,ChatGPT 的用户体验充满了“思考”和“推理”等更多听起来像人类的功能。

当被问及 OpenAI 的模型是否真正具有推理性时,El Kishky 对冲,称他从计算机科学的角度思考这个概念。

“我们正在教模型如何有效地消耗计算来获得答案。所以如果你这样定义它,是的,这就是推理,“El Kishky 说。

莱特曼采取的方法是关注模型的结果,而不是手段或它们与人脑的关系。


tp080404
OpenAI 标志在他们的开发者日阶段屏幕上。(图片来源:Devin Coldeway)

 

“如果模型正在做困难的事情,那么它就会做任何必要的推理近似值来做到这一点,”莱特曼说。“我们可以称之为推理,因为它看起来像这些推理痕迹,但这都只是试图制造真正强大且对很多人有用的人工智能工具的代理。”

OpenAI 的研究人员指出,人们可能不同意他们的推理命名法或定义——当然,批评者也已经出现——但他们认为这不如他们模型的能力重要。其他人工智能研究人员倾向于同意。

非营利组织 AI2 的人工智能研究员内森·兰伯特 (Nathan Lambert) 在一篇博文中将人工智能推理模式比作飞机。他说,两者都是受自然启发的人造系统——分别是人类推理和鸟类飞行——但它们通过完全不同的机制运作。这并没有降低它们的用处,或者降低实现类似结果的能力。

来自 OpenAI、Anthropic 和谷歌 DeepMind 的一组 AI 研究人员在最近的一份立场文件中一致认为,人工智能推理模型如今还没有得到很好的理解,需要更多的研究。现在自信地声称他们内心到底发生了什么可能还为时过早。

下一个前沿领域:用于主观任务的人工智能代理

当今市场上的 AI 代理最适合定义明确、可验证的领域,例如编码。OpenAI 的 Codex 代理旨在帮助软件工程师减轻简单的编码任务。与此同时,Anthropic 的模型在 Cursor 和 Claude Code 等 AI 编码工具中变得特别受欢迎——这些是人们愿意付费购买的首批 AI 代理。

然而,像 OpenAI 的 ChatGPT Agent 和 Perplexity 的 Comet 这样的通用 AI 代理在人们想要自动化的许多复杂、主观的任务中遇到了困难。当尝试使用这些工具进行在线购物或寻找长期停车位时,我发现代理花费的时间比我想要的要长,并且会犯愚蠢的错误。

当然,代理是无疑会改进的早期系统。但研究人员必须首先弄清楚如何更好地训练底层模型来完成更主观的任务。


tp080405
人工智能应用(照片由 Jonathan Raa/NurPhoto 通过 Getty Images 拍摄)

 

“就像机器学习中的许多问题一样,这是一个数据问题,”当被问及代理在主观任务上的局限性时,莱特曼说。“我现在真正兴奋的一些研究是弄清楚如何训练难以验证的任务。我们有一些关于如何做这些事情的线索。

帮助创建 IMO 模型和 o1 的 OpenAI 研究员 Noam Brown 告诉 TechCrunch,OpenAI 拥有新的通用 RL 技术,使他们能够教授 AI 模型不易验证的技能。他说,这就是该公司构建模型的方式,并在 IMO 上获得金奖。

OpenAI 的 IMO 模型是一种较新的人工智能系统,它会产生多个代理,然后这些代理同时探索多个想法,然后选择最佳答案。这些类型的人工智能模型正变得越来越流行;谷歌和 xAI 最近发布了使用这种技术的最先进的模型。

“我认为这些模型在数学方面会变得更有能力,我认为它们在其他推理领域也会变得更有能力,”布朗说。“进展非常快。我认为没有任何理由认为它会放缓。

这些技术可能有助于 OpenAI 的模型提高性能,这些收益可能会体现在该公司即将推出的 GPT-5 模型中。OpenAI 希望通过推出 GPT-5 来巩固其对竞争对手的主导地位,理想情况下,为开发人员和消费者提供最好的人工智能模型来为代理提供动力。

但该公司也希望使其产品更易于使用。El Kishky 表示,OpenAI 希望开发能够直观地理解用户想要什么的 AI 代理,而无需他们选择特定设置。他说,OpenAI 旨在构建人工智能系统,了解何时调用某些工具以及推理多长时间。

这些想法描绘了 ChatGPT 终极版本的图景:一个可以在互联网上为您做任何事情的代理,并了解您希望如何完成。这与今天的 ChatGPT 产品大不相同,但该公司的研究正朝着这个方向发展。

虽然 OpenAI 在几年前无疑引领了人工智能行业,但该公司现在面临着一批有价值的对手。问题不再只是 OpenAI 能否实现其代理未来,而是该公司能否在谷歌、Anthropic、xAI 或 Meta 击败他们之前做到这一点?