2026年4月24日,OpenAI正式发布GPT-5.5——距离GPT-5.4发布仅过去两个月,迭代速度显著加快。官方将其定位为“一种面向实际工作和智能体的新型智能”。
这一次,奥特曼没有以“看到原子弹爆炸”来形容使用体验,而是请来了一批早期测试用户充当“嘴替”。其中一位英伟达工程师在短暂失去GPT-5.5访问权限后说的一句话,或许比任何跑分都更有说服力:
“失去GPT-5.5,就像被截肢。”

核心突破:打破Scaling Law的“更强不慢”悖论
过去每一次模型升级,“更强”和“更慢”几乎是打包出售的。更大的模型、更多的参数、更长的思考时间——用户为智能买单的同时也在为延迟买单。
GPT-5.5打破了这个铁律。
在真实生产环境中,它的逐Token延迟与GPT-5.4相当,完成相同任务所需的Token却更少。根据Artificial Analysis的评测,GPT-5.5实现相同智能分数时,Token消耗比其他模型更少——性价比大幅提升。
“在同等延迟下,智能水平大幅跃升”。这一突破的秘诀,不是单点优化,而是整个推理系统的重构。
更令人震撼的是,GPT-5.5驱动的Codex系统,分析了数周的生产流量数据后,自己写出了一套负载均衡的分区启发式算法——根据实际流量形态动态调整分块策略,Token生成速度提升了超过20%。
模型开始优化自己运行的基础设施了。
编程能力跃升:从“被指挥”到“自主工作”
编程是GPT-5.5提升最迅猛的领域。
前代模型使用时,开发者仍需要小心翼翼地拆解任务,一步步看着它走,随时准备纠偏。GPT-5.5不一样了——把需求丢过去,它自己拆解、自己执行、自己检查。

在衡量复杂命令行工作流的硬核测试Terminal-Bench 2.0中,GPT-5.5拿下82.7%的准确率,远超GPT-5.4的75.1%和Claude Opus 4.7的69.4%。
早期测试者Dan Shipper做了一个实验:他的App上线后出现了一个bug,请了一位顶尖工程师来重构。工程师给出了解决方案。然后他把时钟拨回去,让模型独立做同样的决策。
GPT-5.4做不到。GPT-5.5做到了。
Shipper说,这是他第一次在一个编程模型身上感受到真正的“概念清晰度”——不是接话,而是理解了问题之后自己想明白如何解决。
OpenAI展示了Codex下GPT-5.5生成的3D动作游戏,在网页上直接运行——包括用TypeScript/Three.js实现战斗系统、敌人遭遇、HUD反馈以及GPT生成的环境纹理。
知识工作与科学研究:AI成为“研究伙伴”
GPT-5.5的能力远不止编程。生成文档、整理表格、做PPT,它比上一代更懂你想要什么。
在知识工作基准测试GDPval上,GPT-5.5拿到84.9%,比Claude Opus 4.7高出4.6个百分点。在评估GitHub问题解决的SWE-Bench Pro中达到58.6%,在Expert-SWE等长周期任务中均超越前代。

真正有意思的是科学家们怎么用它。
波兰亚当·密茨凯维奇的数学助理教授Bartosz Naskręcki给Codex写了一句话,11分钟后,一个代数几何可视化应用就跑了上来——能画出两个二次曲面的交线,标成红色,还能用Riemann-Roch定理把交线转成Weierstrass曲线的标准形式。
杰克逊基因组医学实验室的免疫学教授Derya Unutmaz用GPT-5.5 Pro分析了一份基因表达数据集:62个样本,将近28000个基因。最终产出了一份完整的研究报告。他说,这本来要花团队几个月的时间。
OpenAI对GPT-5.5在科研中的定位有一句话概括得很准:它不再像一次性答案引擎,更像一个“研究伙伴”。
科学突破:AI发现数学新证明
GPT-5.5在数学领域做了一件大事。
Ramsey数,组合数学里最核心的问题之一。它研究的是:一个网络要大到什么程度,才能保证某种秩序必然出现?off-diagonal Ramsey数的渐近性质,是数学界几十年的硬骨头。
GPT-5.5找到了一个新的证明路径。 不是复现已知方法,而是发现了一条新路。随后,这个证明被数学界最严格的形式化验证工具之一Lean确认无误。
一个AI在纯数学的核心领域,做出了被形式化工具验证的原创贡献。一年前,这还不可想象。
在FrontierMath Tier 4(目前最难的数学基准之一,题目来自未发表的论文和顶尖研究者的开放问题)上,GPT-5.5 Pro拿下了39.6%,而Claude Opus 4.7是22.9%,差距接近一倍。
战略联盟:OpenAI与英伟达的“双向奔赴”
GPT-5.5的另一大看点,是它背后前所未有的合作深度。
第一,GPT-5.5和英伟达GB200、GB300 NVL72系统是联合设计的。 从训练到部署,模型和硬件之间从诞生开始就“双向奔赴”。
第二,OpenAI将Codex推广到英伟达全公司。 奥特曼还晒出了与老黄的邮件。
成果立竿见影:
英伟达内部已有超过10000名员工率先使用该技术
相比前代系统,百万Token成本降低至35分之一
每兆瓦Token输出量提升50倍
原本耗时数天的调试周期缩短至数小时

OpenAI内部,超过85%的员工每周使用Codex——财务团队利用其审核了超7万页税务文件,效率提升显著。
与竞品对标:Claude Mythos的“幽灵”
GPT-5.5的发布时间点耐人寻味。
4月7日,Anthropic发布了Claude Mythos Preview——一个因网络安全能力过强而决定不公开发布的模型。随后又公开了Claude Opus 4.7。
GPT-5.5则不同:它是广泛可用的实用模型,而非限定预览。
从基准测试看:
Mythos在SWE-Bench Pro达到77.8%,而GPT-5.5为58.6%、Opus 4.7为64.3%
在Humanity‘s Last Exam(工具版本)中,Mythos 64.7%领先GPT-5.5的57.2%
GPT-5.5 Pro在BrowseComp上以90.1%领先Mythos的86.9%
两者定位迥异:Mythos是“能力过强不敢公开”的谨慎,GPT-5.5是“能力够强直接商用”的进取。在网络安全竞赛中,两家都通过“可信访问”计划向防御用途开放高级能力,但在公开发布策略上走了截然相反的路。
价格与产品分层:“25折”的效率革命
GPT-5.5的定价策略颇具深意。
API输入价格为每百万Token 5美元,输出每百万Token 30美元。相比GPT-5.4(约2.5美元/百万Token输入),价格接近翻倍,但完成任务所需Token减少约40%。
综合计算,运行Artificial Analysis Intelligence Index的实际成本仅上升约20%。用更贵的单价,办更高效的事。
产品分层如下:
GPT-5.5:向ChatGPT Plus、Pro、Business、Enterprise用户开放
GPT-5.5 Pro:专属Pro及企业级订阅用户的高性能版本
API版本:即将上线
总裁布罗克曼点明了战略方向:“模型本身不再是产品的全部。模型对应大脑,我们推出的应用和智能体框架才是身体。”
“超级应用”蓝图与安全考量
布罗克曼将GPT-5.5定义为公司历史上“最智能、最直观”的模型,并称其发布标志着OpenAI距离打造AI“超级应用”的愿景更近了一步。
这个超级应用将整合ChatGPT、Codex和AI浏览器,成为一个功能齐全、如“瑞士军刀”般的统一服务。Codex周活跃用户已突破400万,从两年前的“零”起步,增速惊人。
安全方面,GPT-5.5在OpenAI的“Preparedness Framework”上被分类为“High”,但未达最高等级“Critical”。OpenAI安全主管表示:“当用户尝试进行安全相关活动时,可能会感觉被拒绝的情况比以往更多——这是有意为之的设计。”
结 语
GPT-5.5的发布,标志着三个重要转折:
第一,“更强即更慢”的铁律被打破。 模型不再只能做“智力-速度”的单选题。整个行业竞争维度,将从“谁更聪明”转向“谁在同等延迟下更聪明”。
第二,模型开始优化自己的基础设施。 当AI能分析生产流量、重写调度算法让自身提速20%时,AI系统的演进正从“人类优化AI”进入“AI优化AI”的递归阶段。
第三,OpenAI与英伟达的“双向奔赴”定义了下一代AI基础设施范式。 模型和硬件的联合设计,正在成为顶级玩家的新壁垒。
至于那个悬而未决的问题——当模型已经能自主优化运行环境,下一步会是什么?
也许连OpenAI自己,也无法给出确切的答案。但可以确定的是:这条路,才刚刚开始。