
OpenAI 周三宣布推出 o3 和 o4-mini,这是新的 AI 推理模型。
OpenAI 称 o3 为其有史以来最先进的推理模型,在测量数学、编码、推理、科学和视觉理解能力的测试中优于该公司以前的模型。同时,o4-mini 提供了 OpenAI 所说的价格、速度和性能之间的竞争性权衡——这是开发人员在选择 AI 模型来支持其应用程序时经常考虑的三个因素。
与以前的推理模型不同,o3 和 o4-mini 可以使用 ChatGPT 中的工具生成响应,例如网页浏览、Python 代码执行、图像处理和图像生成。从今天开始,这些模型以及一个名为“o4-mini-high”的 o4-mini 变体可供 OpenAI 的 Pro、Plus 和 Team 计划的订阅者使用。
新模型是 OpenAI 在残酷的全球 AI 竞赛中击败 Google、Meta、xAI、Thropic 和 DeepSeek 的努力的一部分。虽然 OpenAI 率先发布了 AI 推理模型 o1,但竞争对手很快紧随其后,推出了自己的版本,这些版本的性能达到或超过 OpenAI 系列的性能。事实上,推理模型已经开始在该领域占据主导地位,因为 AI 实验室希望从他们的系统中获得更多性能。
O3 几乎没有在 ChatGPT 中发布。OpenAI 首席执行官山姆·奥特曼 (Sam Altman) 在 2 月份表示,该公司打算将更多资源投入到包含 O3 技术的复杂替代方案上。但竞争压力似乎促使 OpenAI 最终改变了方向。
OpenAI 表示,o3 在经过 SWE 工作台验证(无需自定义脚手架)上实现了最先进的性能,这是一项衡量编码能力的测试,得分为 69.1%。o4-mini 模型实现了类似的性能,得分为 68.1%。OpenAI 的下一个最佳模型 o3-mini 在测试中得分为 49.3%,而 Claude 3.7 Sonnet 得分为 62.3%。
OpenAI 声称 o3 和 o4-mini 是其第一个可以“用图像思考”的模型。在实践中,用户可以将图像上传到 ChatGPT,例如白板草图或 PDF 中的图表,模型会在回答之前在其“思维链”阶段分析图像。由于这种新发现的能力,o3 和 o4-mini 可以理解模糊和低质量的图像,并可以在推理时执行缩放或旋转图像等任务。
除了图像处理功能之外,o3 和 o4-mini 还可以通过 ChatGPT 的 Canvas 功能直接在浏览器中运行和执行 Python 代码,并在询问时事时搜索网络。
除了 ChatGPT 之外,所有三种模型——o3、o4-mini 和 o4-mini-high——都将通过 OpenAI 面向开发人员的端点、聊天完成 API 和响应 API 提供,允许工程师使用公司的模型以基于使用量的价格构建应用程序。
鉴于 o3 的性能得到提升,OpenAI 向开发人员收取的价格相对较低,为每百万输入代币 10 美元(大约 750,000 个单词,比《指环王》系列还长)和每百万输出代币 40 美元。对于 o4-mini,OpenAI 的收费与 o3-mini 相同,每百万输入代币 1.10 美元,每百万输出代币 4.40 美元。
在接下来的几周内,OpenAI 表示计划发布 o3-pro,这是 o3 的一个版本,它使用更多的计算资源来生成答案,专为 ChatGPT Pro 订阅者提供。
OpenAI 首席执行官 Sam Altman 表示,o3 和 o4-mini 可能是 GPT-5 之前 ChatGPT 中最后一个独立的 AI 推理模型,该公司表示该模型将统一 GPT-4.1 等传统模型与其推理模型。