代码任务工具调用少20%、Token省25%:Meta发布Muse Spark 1.3,定价不变硬刚GPT-5.6

9.3 当地时间9月2日,Meta推出迄今为止最强大的AI模型Muse Spark 1.3,专为延长智能体工作流与增强编码能力设计。Meta首席AI官Alexandr Wang表示,新模型在编码能力上超越OpenAI的GPT-5.6 Sol,与Anthropic的Claude Fable 5.1表现持平。

meta

当地时间9月2日,Meta推出迄今为止最强大的AI模型Muse Spark 1.3,专为延长智能体工作流与增强编码能力设计。Meta首席AI官Alexandr Wang表示,新模型在编码能力上超越OpenAI的GPT-5.6 Sol,与Anthropic的Claude Fable 5.1表现持平。

性能跃升:知识工作、长上下文、编程全面突破

在多项基准测试中,Muse Spark 1.3展现出对前代和竞品的全面优势:

基准测试Muse Spark 1.3Muse Spark 1.2GPT-5.6 SolOpus 5
GDPVal-AA v2(知识工作)1754161517101824
DeepSWE v1.1(长周期编程)75.455.073.074.0
Terminal-Bench 2.1(终端编程)88.882.988.886.7
MRCR 256K-512K(长上下文)98.566.391.5—
MRCR 512K-1M(长上下文)98.155.573.8—
OSWorld 2.0(智能体电脑操作)66.947.662.768.3
Agentic IF Index(指令遵循)57.846.260.559.1

Artificial Analysis数据显示,Muse Spark 1.3(xhigh)的Intelligence Index达到61分,与GPT-5.6 Sol(max)和Grok 4.6(high)处于同一档位。限量预览的max版本达到62分,仅落后于Claude Fable 5.1和Claude Opus 5的部分版本。

值得注意的是,Meta承认在多项基准中竞争对手仍保持领先,且模型之间的直接比较存在局限性——不同模型在不同任务上各有优劣,基准参数也可能被刻意优化。

效率革命:工具调用少20%,Token省25%

Muse Spark 1.3在运行效率上实现了显著优化:

  • 工具调用减少约20%:模型在编码任务中更少“绕路”,减少了不必要的迭代

  • Token消耗减少约25%:完成相同任务所需Token大幅下降

  • 编码更简洁清晰:整体编码风格更加精炼

对于长周期智能体任务,新模型能在单一长线程中协作处理多个工作流,主动修正计划缺口并跟踪学习成果。面对模糊指令时,它会主动提出澄清问题;遇到障碍时请求用户帮助;执行关键操作前也会先寻求确认。

在航空工程流体仿真案例中,模型展示了完整的长任务执行能力:从CFD模拟结果和STEP格式CAD模型出发,自主完成分析目标整理、参数提取、升力与阻力分析,最终按指定结构输出PDF报告。

定价不变,“贡献者版本”低价换数据

定价方面,Muse Spark 1.3维持与前代相同的标准价格:

  • 输入:每百万Token 1.25美元

  • 缓存命中输入:每百万Token 0.15美元

  • 输出:每百万Token 4.25美元

新模型已上线Muse Code和Meta Model API,并将逐步整合至Instagram、Facebook及Meta AI助手。部分开发者的API周用量已达万亿级Token。

Meta还同步推出了“贡献者版本”(Contributor SKU),定价仅为标准的1/12至1/21(输入0.10美元/百万Token、输出0.20美元/百万Token),作为交换,用户的使用数据可能被用于训练Meta的模型。Alexandr Wang表示,已有“两位数的百分比”开发者选择了这一版本。

Muse Spark 1.3的核心升级不在于跑分突破,而在于“干同样的活,少走弯路”——工具调用和Token消耗的双降,正是智能体走向实用的关键。5个月内四次更新,Meta正在用高频迭代追赶头部。而贡献者版本的推出,则揭示了另一个趋势:当模型性能趋同时,数据本身正成为AI公司最稀缺的战略资源。