当地时间8月12日,SpaceXAI正式发布新一代大模型Grok 4.6。在第三方评测机构Artificial Analysis的综合智能指数中,Grok 4.6以61分的成绩追平OpenAI的GPT-5.6 Sol Max,并列全球第三,仅次于Anthropic的Claude Opus 5和Fable 5 Max。这一发布标志着马斯克麾下的AI力量已正式跻身全球大模型第一梯队。

一、性能跃升:智能体与编程能力成最大亮点
相比7月发布的Grok 4.5,新模型在多个关键维度实现了显著提升。在Artificial Analysis智能指数中,Grok 4.6较上一代的56分提升了5分,在综合9项基准测试中与GPT-5.6 Sol Max打成平手。
从细分测试来看,Grok 4.6的强项在于长周期智能体任务和复杂编程。据多家媒体报道,在衡量软件工程能力的DeepSWE v1.1基准中,Grok 4.6得分65.9%,远超Grok 4.5的54%;在评估终端操作能力的Terminal-Bench v3.0中,得分26%,较前代的15.7%大幅提升。不过在APEX-Agents和Terminal-Bench等测试中,Claude Fable 5 Max仍保持领先。
在知识工作领域,Grok 4.6同样表现不俗。在GDPval-AA v2评测中,其Elo得分达1753,超过GPT-5.6 Sol Max的1728和Claude Fable 5的1741;在评估长时程知识工作Agent任务的AA-Briefcase私有基准中,Elo得分1577,仅次于Claude Opus 5。

二、定向强化:让AI从“回答问题”到“完成项目”
此次升级的核心,不再是让模型单纯回答问题,而是使其能持续完成需要多步骤执行的复杂任务。SpaceXAI表示,Grok 4.6经历了比Grok 4.5更长的补充训练,训练数据涵盖经筛选的模型生成推理数据、高级技术概念数据及高质量工程数据。
在训练方法上,团队利用Grok 4.5重新生成SFT轨迹,覆盖不同推理强度、智能体运行框架,以及STEM、软件工程和知识工作等领域,并使用基于模型的检查剔除有问题轨迹。Grok 4.6还接受了广泛的智能体强化学习训练,任务覆盖知识工作、通用编程、内核优化、Web开发和计算机辅助设计等领域。
在实际项目测试中,Grok 4.6擅长将宽泛产品构想转化为可运行的初版——先研究陌生领域、规划应用结构、实现核心交互,再根据多轮反馈持续完善结果。在更长任务流程中,模型还表现出更多自主测试和验证行为,会在继续执行前检查已完成工作。
三、定价策略:性能对标旗舰,价格仅“一半”
定价是Grok 4.6另一把“杀手锏”。其API起售价为每百万输入Token 2美元、每百万输出Token 6美元,不到GPT-5.6 Sol标准模式价格的一半,另有速度更快、价格翻倍的版本。
投资机构Atreides Management首席投资官Gavin Baker评价更为激进:他认为Grok 4.6性能大致相当于Fable 5 Max,但输入Token价格低80%、输出Token价格低88%,在性能与成本组合上优势明显。科技业分析师Kim Monnis也指出,Grok 4.6不仅比Opus 5和GPT-5.6 Sol便宜,甚至低于Sonnet 5,同时性能至少处于顶级水平。不过,不同模型Token消耗存在差异,实际成本需综合考量。
四、安全与可用性
安全方面,Grok 4.6完成了SpaceXAI历来规模最大的安全评估,覆盖部署前能力测试、防护校准及部署后第三方测试,面向漏洞修补、工程设计和AI研究等场景提升实用性并控制风险。
目前,Grok 4.6已在Cursor和Grok Build上线,并通过API及OpenRouter、Vercel、Cloudflare等合作伙伴平台开放。首周,Cursor和Grok Build用户可享两倍使用额度,以低成本试用新模型。
Grok 4.6的发布,标志着SpaceXAI在“性能-成本”曲线上找到了独特的竞争位置。它选择在特定任务上做到极致,而非追求全能冠军。当AI模型性能趋同时,“单位智能的成本”将成为开发者选择的核心变量。Grok 4.6证明了“足够好+足够便宜”的组合依然有效,这正是它向市场发出的最清晰信号。