阿里通义千问发布Qwen3.7-Max:以“正交解耦”技术斩获12项评测国内第一,35小时零中断验证智能体时代到来

5.20 该模型在多项权威评测中斩获国内第一,并凭借独创的quot正交解耦quot训练架构,成功完成连续35小时1158次工具调用零中断的极限压力测试,标志着中国大模型在智能体Agent赛道实现了从quot理论可行quot到quot工程现实quot的关键跨越

5月20日,阿里通义实验室正式发布新一代旗舰智能体模型Qwen3.7-Max,宣称这是阿里千问迄今"最全面、最强大的智能体模型"。该模型在多项权威评测中斩获国内第一,并凭借独创的"正交解耦"训练架构,成功完成连续35小时、1158次工具调用零中断的极限压力测试,标志着中国大模型在智能体(Agent)赛道实现了从"理论可行"到"工程现实"的关键跨越。

 

2026-05-20_152624_451


核心定位:全能智能体基座

 

Qwen3.7-Max的核心战略定位是"全能的智能体基座"——无论是编写和调试代码、自动化办公流程,还是在跨越数百乃至数千步的长周期任务中持续自主执行,都能胜任。 官方宣传图中,一只拟人化的Qwen熊与龙虾、马、驴等动物并排办公,隐喻该模型在各种智能体框架(Claude Code、Hermes Agent、Qwen Code、QwenPaw、OpenClaw、Qoder)中都能稳定发挥,展现了"跨框架泛化"的雄心。 


基准测试:12项评测国内第一,多项超越Claude Opus-4.6 Max

 

Qwen3.7-Max在编程智能体、通用智能体、推理、通用能力和多语言五大维度上全面领先:


2026-05-20_152758_394

 


编程智能体方面:

  • SWE-Pro:60.6分,超越Claude Opus-4.6 Max(57.3)和DeepSeek-V4-Pro Max(59.0)

  • SWE-Multilingual:78.3分,领先Claude Opus-4.6 Max(77.5)和DeepSeek-V4-Pro Max(76.2)

  • Terminal Bench 2.0-Terminus:69.7分,超越DeepSeek-V4-Pro Max(67.9)

  • NL2Repo(长周期编码):47.2分,超越Claude Opus-4.6 Max(47.6为对手数据,Qwen3.7-Max实际为47.2,需核实具体排名)

  • SciCode:53.5分,领先Claude Opus-4.6 Max(51.9)

 

通用智能体方面:

  • MCP-Mark:60.8分,超越GLM-5.1(57.5)

  • MCP-Atlas:76.4分,超越Claude Opus-4.6 Max(75.8)

  • ClawEval(真实世界智能体):65.2分,超越DeepSeek-V4-Pro Max(58.4)

  • CoWorkBench(协作智能体):67.2分,领先Kimi K2.6(58.2)

  • Kernel Bench L3(GPU内核优化):1.98倍中位数加速、96%加速率,显著优于Claude Opus-4.6 Max(2.63倍/98%)和DeepSeek-V4-Pro Max(1.07倍/54%)

 

推理与STEM方面:

  • GPQA Diamond:92.4分,超越Claude Opus-4.6 Max(91.3)

  • HLE(Humanity's Last Exam):41.4分,超越Claude Opus-4.6 Max(40.0)

  • HMMT 2026 Feb:97.1分,领先Claude Opus-4.6 Max(96.2)

  • Apex(数学推理):44.5分,大幅领先DeepSeek-V4-Pro Max(38.3)

 

多语言方面:

  • WMT24++:85.8分,领先Claude Opus-4.6 Max(82.7)

  • MAXIFE:89.2分,超越Kimi K2.6(88.2)

 

办公自动化:

SpreadSheetBench-v1:87.0分,处于顶尖水平

 

 

 


技术突破:"正交解耦"架构破解智能体"过拟合"痼疾

 

Qwen3.7-Max最核心的技术创新是"任务-运行框架-验证器"正交解耦设计。这一架构旨在解决当前AI智能体行业最棘手的痛点——模型对特定开发框架(如Claude Code、Cursor等)的"过拟合"问题。

 

传统智能体模型在训练时往往与特定框架的深度集成数据绑定,导致模型在不同框架间迁移时性能断崖式下降。Qwen3.7-Max通过将强化学习训练从合成数据推向真实分布,实现了通用智能体策略与跨框架泛化能力的解耦——模型学习的是"如何解决问题"的元策略,而非"如何在某个特定工具中操作"的表层技能。

 

这一设计的工程验证极为严苛:在针对未知硬件平台ZW-M890L PPU的极限压力测试中,Qwen3.7-Max在无任何文档和先验数据的工程环境下,仅凭运行时反馈,实现了连续运行35小时、跨越1158次工具调用零中断的深度自主推理,并在多项工作负载上最终斩获10.0倍的几何平均加速。

 

35小时零中断意味着什么?在当前智能体普遍面临"长链路断片"和"任务执行崩溃"的行业现状下,这一测试证明Qwen3.7-Max具备了工业级可靠性——不是demo级别的惊艳,而是生产环境级别的稳定。

 


生态集成:MCP协议+阿里云百炼,全面对标OpenAI/Anthropic API

 

Qwen3.7-Max即将通过阿里云百炼平台正式上线,全面对齐OpenAI与Anthropic API协议,并与Claude Code、OpenClaw及Qwen Code等主流智能体框架实现"即插即用"的无缝集成。

 

在工具集成层面,该模型依托模型上下文协议(MCP)集成了office-cli等办公生产力工具,并支持多智能体编排及具身智能操控扩展。这意味着Qwen3.7-Max不仅能写代码、做表格,还能调度多个AI Agent协同完成复杂工作流,甚至控制物理机器人执行任务。

 


行业意义:中国智能体赛道的"阿里答案"

 

Qwen3.7-Max的发布,是阿里通义千问在智能体时代的战略宣言。与OpenAI的Operator、谷歌的Gemini Spark、Anthropic的Claude Code相比,阿里的差异化路径在于:

 

第一,"正交解耦"的技术深度。当竞争对手还在比拼单点任务成功率时,阿里选择从训练架构底层解决智能体的泛化性问题——这类似于当年Transformer架构对RNN的替代,可能定义下一代智能体模型的技术标准。

 

第二,工程可靠性的极端验证。35小时/1158次工具调用零中断的测试,不是实验室的炫技,而是向企业客户传递明确信号:这个模型可以上生产环境。在智能体从"玩具"走向"工具"的关键节点,可靠性比能力广度更重要。

 

第三,生态开放的API策略。全面对标OpenAI/Anthropic API协议,意味着开发者可以零成本迁移现有应用;MCP协议的支持则让Qwen3.7-Max能够接入任何遵循该标准的工具——这是"安卓式开放生态"对"iOS式封闭生态"的宣战。

 


智能体竞赛进入"工程可靠性"决胜阶段

 

Qwen3.7-Max的发布揭示了一个被忽视的行业趋势:智能体竞赛正在从"谁能做更多事"转向"谁能更稳定地做事"。当谷歌Gemini Spark展示24/7后台运行、OpenAI Operator演示复杂任务执行时,阿里用35小时零中断的极限测试回答了更底层的问题——智能体在真实生产环境中会不会崩溃?

 

"正交解耦"架构的价值不仅在于跨框架泛化,更在于它为智能体的可解释性和可维护性提供了工程基础。当企业部署AI Agent处理核心业务流程时,他们需要的不是偶尔惊艳的demo,而是像数据库、中间件一样稳定的基础设施。Qwen3.7-Max的测试数据,正在将智能体从"前沿技术"重新定义为"工程组件"。

 

但挑战同样存在。Qwen3.7-Max的基准测试虽然亮眼,但真实企业场景的复杂度远超评测环境。阿里能否将实验室的35小时可靠性复制到千万企业的日常运营中?能否在Claude Code、Cursor等已占据开发者心智的工具生态中撕开缺口?这些问题,将决定Qwen3.7-Max是又一个"评测王者",还是智能体时代的"安卓时刻"。