马斯克发布Grok Voice Think Fast 2.0:响应仅需0.7秒,登顶智能体语音榜首

7.30 马斯克旗下SpaceXAI 7月29日发布新一代语音到语音模型GrokVoiceThinkFast2.0,以0.7秒的首响应时间和智能体性能登顶的成绩,重新定义了实时语音交互的标准

语音AI的竞争,正在从“能听会说”全面转向“能推理、会干活”。7月29日,马斯克旗下SpaceXAI发布新一代语音到语音模型Grok Voice Think Fast 2.0,以0.7秒的首响应时间和智能体性能登顶的成绩,重新定义了实时语音交互的标准。

性能飞跃:综合评分82.9%,智能体能力登顶

据Artificial Analysis公布的语音到语音基准测试数据,Grok Voice Think Fast 2.0的AA Speech-to-Speech Quality Index综合评分达到82.9%,较前代1.0版本的75.7%提升7.2个百分点。在衡量智能体性能的Tau Voice基准测试中,该模型以56.5%的得分排名第一,击败了OpenAI的GPT-Realtime-2.1 High(45.7%)和谷歌的Gemini 3.1 Flash(37.7%)等竞品。

在细分指标上,新模型表现尤为亮眼:

  • 语音推理能力(Big Bench Audio):97.2%

  • 对话动态体验(Full Duplex Bench):95.1%(前代仅为77.8%)

  • 响应速度(Time to First Audio):0.70秒

这意味着,在衡量多人实时语音交互体验的Full Duplex Bench测试中,新模型从前代的77.8%跃升至95.1%,已接近人类自然对话的水平。

2026073003

响应仅需0.7秒:比前代快44%,推理Token消耗减少60%

响应速度是Grok Voice Think Fast 2.0最直观的升级。其平均首音频响应时间仅0.70秒,较前代1.0版本的1.25秒大幅缩短44%,是Artificial Analysis榜单前五名中唯一低于1秒的模型,快于GPT-Realtime-2 High(1.14秒)和GPT-Realtime-2.1 High(1.21秒)。

SpaceXAI称,新模型支持“边说边推理”——可在说话时同步完成推理,无需以额外延迟换取推理能力。相比前代,其中位数推理Token消耗减少约60%(降至1.0版本的40%),使得工具调用通常能在智能体说完第一句话前完成。

转录能力:24种语言,准确率提升1.5-2倍

在语音转录方面,SpaceXAI在覆盖24种语言、数千条短语的内部评估中称,Grok Voice Think Fast 2.0的转录表现较Deepgram Nova 3和ElevenLabs Scribe v2提升1.5至2.0倍,较1.0版提升1.4倍。

在存在明显背景噪声和电话压缩的场景中,xAI称其与专用语音转文字模型的差距可扩大至约10倍,显示出在真实复杂环境下的强大鲁棒性。

定价与可用性:每分钟0.08美元,8月5日默认升级

定价方面,该模型音频费用为每分钟0.08美元(约合每小时输入音频4.80美元),较前代1.0版本的每小时3.00美元有所上涨,但价格仅为GPT-Realtime-2.1 High的约45%。

SpaceXAI计划于8月5日将grok-voice-latest模型从1.0版本自动升级至2.0版本。仍需要使用旧版本的开发者需提前锁定1.0版本标识符。

实测反馈:开发者称“飞跃式进步”

多位开发者在X平台分享实测体验。AI公司Helionova AI的CEO Nick White称,已在旗下产品Tradecraft上完成全栈语音实时升级,形容这是“绝对是一次飞跃式的进步”。实测中,模型在多轮实时电话对话中几乎没有明显停顿,能根据对话内容持续推进情节并实时反馈。

SpaceXAI软件工程师Parker Conrad表示:“整个语音团队为此倾注了大量努力、思考和热爱。模型的智能水平、准确性和能力几乎让人感觉不真实。”

目前,Grok Voice已在Starlink电话服务中进行A/B测试,并带来了销售转化率和客服响应效率的提升。

当语音模型从“能听会说”进化到“能推理、会干活”,竞争的赛道已经从语音识别准确率转向了对话智能体的综合能力。Grok Voice Think Fast 2.0以“边说边推理”的低延迟架构和登顶的智能体性能,正在将语音AI推向“像人一样对话、像人一样干活”的新阶段。随着8月5日默认模型切换,这一能力将正式进入开发者与企业的生产环境。