
当地时间7月9日,OpenAI正式发布新一代语音模型GPT-Live系列,包含GPT-Live-1和GPT-Live-1 mini两个版本,即日起向全球ChatGPT用户开放。GPT-Live-1面向Plus、Pro和Go订阅用户,GPT-Live-1 mini面向免费用户,未来还将接入API。
GPT-Live的核心升级是全双工架构,模型可同时聆听与说话,不再依赖单轮结束后再响应。对话中,GPT-Live可通过“嗯嗯”“yeah”等短语表明正在倾听,支持快速来回交替发言,也能在用户思考时保持安静——更接近真人对话的状态,多了一点“分寸感”。
架构创新:“边聊边工作”的分工模式。面对需要网络搜索、深度推理或复杂任务时,GPT-Live将工作委托给后台GPT-5.5系列模型处理,前台语音模型则继续与用户保持对话。这种“委托模式”将语音交互与深度推理分离为两个独立环节,推理引擎可随技术进展随时更换,语音模型体验无需重新训练即可升级。当前后台模型为GPT-5.5 Instant(GPT-Live-1/1 mini)、GPT-5.5 Thinking Medium(GPT-Live-1 Medium)和GPT-5.5 Thinking High(GPT-Live-1 High)。
在时长5-10分钟的配对对话测试中,与高级语音模式(Advanced Voice Mode)相比,GPT-Live-1在整体偏好、轮次衔接、打断情况、对话流畅度与自然度等指标上全面领先,整体偏好达75.7%。
用户规模方面,OpenAI披露每周有超过1.5亿人通过Voice和Dictation等功能与ChatGPT进行语音交互,应用场景涵盖免手持日常协助、语言练习、睡前故事与通勤闲聊。GPT-Live还支持在语音对话中展示天气、股票、体育等可视化卡片,并继续支持搜索、记忆、图片和文件上传。
安全方面,OpenAI表示GPT-Live在自伤、精神病性症状、对AI的情感依赖、暴力及性内容等领域接受了音频原生评测、合成音频评测与内部红队测试,在所有评估维度上与高级语音模式相当或更优。
GPT-Live的发布标志着AI语音交互从“能听能说”进入 “像真人一样对话” 的新阶段。“全双工架构”和“边聊边工作”的分工模式,不仅让对话更自然,更开启了语音作为AI操作系统入口的可能性。当1.5亿人每周用语音与AI对话时,交互方式的变革本身就是一场范式转移。