Anthropic 推出 Claude Opus 4.8:聚焦智能体可靠性与知识工作精准度

5.29 作为Opus4.7的增量升级版,新模型在保持价格不变的前提下,重点强化了智能体编程可靠性多步骤推理稳定性与知识工作准确性,并显著降低幻觉与无依据结论的发生率

5 月 29 日,AI 安全先锋 Anthropic 正式发布旗舰模型 Claude Opus 4.8。作为 Opus 4.7 的增量升级版,新模型在保持价格不变的前提下,重点强化了智能体编程可靠性、多步骤推理稳定性与知识工作准确性,并显著降低“幻觉”与无依据结论的发生率。


更可靠、更敏锐:智能体行为全面优化

与前代相比,Opus 4.8 的更新幅度虽小,但直击当前 AI 智能体落地的核心痛点——不可靠性。据 Anthropic 官方及多家早期测试方反馈,Opus 4.8 在复杂、多步骤任务中表现“更可靠,判断也更敏锐”。


具体而言:

主动质疑不合理计划:当用户指令存在逻辑漏洞或目标模糊时,模型会主动提问或提出异议,而非盲目执行;

识别并修正自身错误:在长任务链中能回溯上下文,发现前后矛盾并自我纠正;

代码缺陷标注率提升:放任自己所写代码存在缺陷却不加说明的概率降至 Opus 4.7 的四分之一;

减少无依据结论:更愿意主动标出不确定性,避免“自信地胡说”。

这一系列改进源于 Anthropic 对“对齐”(alignment)技术的持续深化。在亲社会指标上,Opus 4.8 在“支持用户自主性”“按用户最佳利益行动”等维度创下新高;同时,欺骗、操纵等失配行为出现率进一步降低,已接近其前沿研究模型 Claude Mythos Preview 的水平。


2026052903_20260529_17800471614251740


性能与成本双优化:快速模式提速 2.5 倍,成本降至 1/3

Anthropic 同步宣布了 Opus 4.8 的性能与定价调整:

快速模式(Fast Mode):推理速度提升至 2.5 倍,适用于对响应时间敏感的场景;

模型成本:整体降至此前模型的 1/3,为大规模部署提供经济基础。


定价方面维持双轨制:

常规模式:输入 $5 / 百万 tokens,输出 $25 / 百万 tokens(与 Opus 4.7 相同);

快速模式:输入 $10 / 百万 tokens,输出 $50 / 百万 tokens。

此外,claude.ai 新增 effort 程度控制 功能,用户可在 high、extra(Claude Code 中为 xhigh)、max 等档位间切换,灵活平衡质量与成本。默认 high 档在编码任务中的 token 消耗与 Opus 4.7 相近,但效果更优;更高档位则通过增加计算投入换取极致输出。

基准测试:SWE-Bench Pro 达 69.2%,超越 GPT-5.5 与 Gemini 3.1 Pro


在权威评测中,Opus 4.8 表现亮眼:

SWE-Bench Pro(软件工程基准):得分 69.2%,超越 OpenAI GPT-5.5 与 Google Gemini 3.1 Pro;

多领域知识推理:在法律、金融、科研等专业场景中,事实一致性与逻辑严谨性显著提升。

不过,在终端编程(Terminal-based coding)等特定任务上,GPT-5.5 仍保持领先,显示不同模型在细分领域的优势分化正日益明显。


2026052905


行业背景:AI 进入“责任时代”,可靠性成竞争焦点

Opus 4.8 的发布正值全球 AI 产业从“能力竞赛”转向“责任竞赛”的关键节点。随着 GitHub Copilot 全面转向用量计费、企业将 AI 深度嵌入生产流程,模型的可靠性、可解释性与成本可控性已成为选型核心标准。

Anthropic 此次聚焦“减少幻觉”“主动标注不确定性”等看似“保守”的改进,实则是对高责任场景(如企业自动化、医疗辅助、金融分析)的精准回应。在 AI 从“玩具”变为“工具”的过程中,稳定比惊艳更重要,诚实比聪明更珍贵。