5月20日,阿里通义实验室正式发布新一代旗舰智能体模型Qwen3.7-Max,宣称这是阿里千问迄今"最全面、最强大的智能体模型"。该模型在多项权威评测中斩获国内第一,并凭借独创的"正交解耦"训练架构,成功完成连续35小时、1158次工具调用零中断的极限压力测试,标志着中国大模型在智能体(Agent)赛道实现了从"理论可行"到"工程现实"的关键跨越。

核心定位:全能智能体基座
Qwen3.7-Max的核心战略定位是"全能的智能体基座"——无论是编写和调试代码、自动化办公流程,还是在跨越数百乃至数千步的长周期任务中持续自主执行,都能胜任。 官方宣传图中,一只拟人化的Qwen熊与龙虾、马、驴等动物并排办公,隐喻该模型在各种智能体框架(Claude Code、Hermes Agent、Qwen Code、QwenPaw、OpenClaw、Qoder)中都能稳定发挥,展现了"跨框架泛化"的雄心。
基准测试:12项评测国内第一,多项超越Claude Opus-4.6 Max
Qwen3.7-Max在编程智能体、通用智能体、推理、通用能力和多语言五大维度上全面领先:

编程智能体方面:
SWE-Pro:60.6分,超越Claude Opus-4.6 Max(57.3)和DeepSeek-V4-Pro Max(59.0)
SWE-Multilingual:78.3分,领先Claude Opus-4.6 Max(77.5)和DeepSeek-V4-Pro Max(76.2)
Terminal Bench 2.0-Terminus:69.7分,超越DeepSeek-V4-Pro Max(67.9)
NL2Repo(长周期编码):47.2分,超越Claude Opus-4.6 Max(47.6为对手数据,Qwen3.7-Max实际为47.2,需核实具体排名)
SciCode:53.5分,领先Claude Opus-4.6 Max(51.9)
通用智能体方面:
MCP-Mark:60.8分,超越GLM-5.1(57.5)
MCP-Atlas:76.4分,超越Claude Opus-4.6 Max(75.8)
ClawEval(真实世界智能体):65.2分,超越DeepSeek-V4-Pro Max(58.4)
CoWorkBench(协作智能体):67.2分,领先Kimi K2.6(58.2)
Kernel Bench L3(GPU内核优化):1.98倍中位数加速、96%加速率,显著优于Claude Opus-4.6 Max(2.63倍/98%)和DeepSeek-V4-Pro Max(1.07倍/54%)
推理与STEM方面:
GPQA Diamond:92.4分,超越Claude Opus-4.6 Max(91.3)
HLE(Humanity's Last Exam):41.4分,超越Claude Opus-4.6 Max(40.0)
HMMT 2026 Feb:97.1分,领先Claude Opus-4.6 Max(96.2)
Apex(数学推理):44.5分,大幅领先DeepSeek-V4-Pro Max(38.3)
多语言方面:
WMT24++:85.8分,领先Claude Opus-4.6 Max(82.7)
MAXIFE:89.2分,超越Kimi K2.6(88.2)
办公自动化:
SpreadSheetBench-v1:87.0分,处于顶尖水平
技术突破:"正交解耦"架构破解智能体"过拟合"痼疾
Qwen3.7-Max最核心的技术创新是"任务-运行框架-验证器"正交解耦设计。这一架构旨在解决当前AI智能体行业最棘手的痛点——模型对特定开发框架(如Claude Code、Cursor等)的"过拟合"问题。
传统智能体模型在训练时往往与特定框架的深度集成数据绑定,导致模型在不同框架间迁移时性能断崖式下降。Qwen3.7-Max通过将强化学习训练从合成数据推向真实分布,实现了通用智能体策略与跨框架泛化能力的解耦——模型学习的是"如何解决问题"的元策略,而非"如何在某个特定工具中操作"的表层技能。
这一设计的工程验证极为严苛:在针对未知硬件平台ZW-M890L PPU的极限压力测试中,Qwen3.7-Max在无任何文档和先验数据的工程环境下,仅凭运行时反馈,实现了连续运行35小时、跨越1158次工具调用零中断的深度自主推理,并在多项工作负载上最终斩获10.0倍的几何平均加速。
35小时零中断意味着什么?在当前智能体普遍面临"长链路断片"和"任务执行崩溃"的行业现状下,这一测试证明Qwen3.7-Max具备了工业级可靠性——不是demo级别的惊艳,而是生产环境级别的稳定。
生态集成:MCP协议+阿里云百炼,全面对标OpenAI/Anthropic API
Qwen3.7-Max即将通过阿里云百炼平台正式上线,全面对齐OpenAI与Anthropic API协议,并与Claude Code、OpenClaw及Qwen Code等主流智能体框架实现"即插即用"的无缝集成。
在工具集成层面,该模型依托模型上下文协议(MCP)集成了office-cli等办公生产力工具,并支持多智能体编排及具身智能操控扩展。这意味着Qwen3.7-Max不仅能写代码、做表格,还能调度多个AI Agent协同完成复杂工作流,甚至控制物理机器人执行任务。
行业意义:中国智能体赛道的"阿里答案"
Qwen3.7-Max的发布,是阿里通义千问在智能体时代的战略宣言。与OpenAI的Operator、谷歌的Gemini Spark、Anthropic的Claude Code相比,阿里的差异化路径在于:
第一,"正交解耦"的技术深度。当竞争对手还在比拼单点任务成功率时,阿里选择从训练架构底层解决智能体的泛化性问题——这类似于当年Transformer架构对RNN的替代,可能定义下一代智能体模型的技术标准。
第二,工程可靠性的极端验证。35小时/1158次工具调用零中断的测试,不是实验室的炫技,而是向企业客户传递明确信号:这个模型可以上生产环境。在智能体从"玩具"走向"工具"的关键节点,可靠性比能力广度更重要。
第三,生态开放的API策略。全面对标OpenAI/Anthropic API协议,意味着开发者可以零成本迁移现有应用;MCP协议的支持则让Qwen3.7-Max能够接入任何遵循该标准的工具——这是"安卓式开放生态"对"iOS式封闭生态"的宣战。
智能体竞赛进入"工程可靠性"决胜阶段
Qwen3.7-Max的发布揭示了一个被忽视的行业趋势:智能体竞赛正在从"谁能做更多事"转向"谁能更稳定地做事"。当谷歌Gemini Spark展示24/7后台运行、OpenAI Operator演示复杂任务执行时,阿里用35小时零中断的极限测试回答了更底层的问题——智能体在真实生产环境中会不会崩溃?
"正交解耦"架构的价值不仅在于跨框架泛化,更在于它为智能体的可解释性和可维护性提供了工程基础。当企业部署AI Agent处理核心业务流程时,他们需要的不是偶尔惊艳的demo,而是像数据库、中间件一样稳定的基础设施。Qwen3.7-Max的测试数据,正在将智能体从"前沿技术"重新定义为"工程组件"。
但挑战同样存在。Qwen3.7-Max的基准测试虽然亮眼,但真实企业场景的复杂度远超评测环境。阿里能否将实验室的35小时可靠性复制到千万企业的日常运营中?能否在Claude Code、Cursor等已占据开发者心智的工具生态中撕开缺口?这些问题,将决定Qwen3.7-Max是又一个"评测王者",还是智能体时代的"安卓时刻"。