
当地时间9月2日,Meta推出迄今为止最强大的AI模型Muse Spark 1.3,专为延长智能体工作流与增强编码能力设计。Meta首席AI官Alexandr Wang表示,新模型在编码能力上超越OpenAI的GPT-5.6 Sol,与Anthropic的Claude Fable 5.1表现持平。
性能跃升:知识工作、长上下文、编程全面突破
在多项基准测试中,Muse Spark 1.3展现出对前代和竞品的全面优势:
| 基准测试 | Muse Spark 1.3 | Muse Spark 1.2 | GPT-5.6 Sol | Opus 5 |
|---|---|---|---|---|
| GDPVal-AA v2(知识工作) | 1754 | 1615 | 1710 | 1824 |
| DeepSWE v1.1(长周期编程) | 75.4 | 55.0 | 73.0 | 74.0 |
| Terminal-Bench 2.1(终端编程) | 88.8 | 82.9 | 88.8 | 86.7 |
| MRCR 256K-512K(长上下文) | 98.5 | 66.3 | 91.5 | — |
| MRCR 512K-1M(长上下文) | 98.1 | 55.5 | 73.8 | — |
| OSWorld 2.0(智能体电脑操作) | 66.9 | 47.6 | 62.7 | 68.3 |
| Agentic IF Index(指令遵循) | 57.8 | 46.2 | 60.5 | 59.1 |
Artificial Analysis数据显示,Muse Spark 1.3(xhigh)的Intelligence Index达到61分,与GPT-5.6 Sol(max)和Grok 4.6(high)处于同一档位。限量预览的max版本达到62分,仅落后于Claude Fable 5.1和Claude Opus 5的部分版本。
值得注意的是,Meta承认在多项基准中竞争对手仍保持领先,且模型之间的直接比较存在局限性——不同模型在不同任务上各有优劣,基准参数也可能被刻意优化。
效率革命:工具调用少20%,Token省25%
Muse Spark 1.3在运行效率上实现了显著优化:
工具调用减少约20%:模型在编码任务中更少“绕路”,减少了不必要的迭代
Token消耗减少约25%:完成相同任务所需Token大幅下降
编码更简洁清晰:整体编码风格更加精炼
对于长周期智能体任务,新模型能在单一长线程中协作处理多个工作流,主动修正计划缺口并跟踪学习成果。面对模糊指令时,它会主动提出澄清问题;遇到障碍时请求用户帮助;执行关键操作前也会先寻求确认。
在航空工程流体仿真案例中,模型展示了完整的长任务执行能力:从CFD模拟结果和STEP格式CAD模型出发,自主完成分析目标整理、参数提取、升力与阻力分析,最终按指定结构输出PDF报告。
定价不变,“贡献者版本”低价换数据
定价方面,Muse Spark 1.3维持与前代相同的标准价格:
输入:每百万Token 1.25美元
缓存命中输入:每百万Token 0.15美元
输出:每百万Token 4.25美元
新模型已上线Muse Code和Meta Model API,并将逐步整合至Instagram、Facebook及Meta AI助手。部分开发者的API周用量已达万亿级Token。
Meta还同步推出了“贡献者版本”(Contributor SKU),定价仅为标准的1/12至1/21(输入0.10美元/百万Token、输出0.20美元/百万Token),作为交换,用户的使用数据可能被用于训练Meta的模型。Alexandr Wang表示,已有“两位数的百分比”开发者选择了这一版本。
Muse Spark 1.3的核心升级不在于跑分突破,而在于“干同样的活,少走弯路”——工具调用和Token消耗的双降,正是智能体走向实用的关键。5个月内四次更新,Meta正在用高频迭代追赶头部。而贡献者版本的推出,则揭示了另一个趋势:当模型性能趋同时,数据本身正成为AI公司最稀缺的战略资源。