阿里发布 Qwen3.7-Plus:11小时自主开发万行代码APP,视觉智能体跻身全球前五

6.2 它保留并强化了Qwen3.7在文本编码工具使用和生产力工作流方面的完整智能体能力,同时全面升级视觉-语言融合能力,支持图像视频屏幕网页和文本输入,可在GUI图形用户界面CLI命令行界面和工具环境中完成任务

6月2日,阿里巴巴旗下通义千问团队正式发布 Qwen3.7-Plus 多模态交互混合智能体模型。这款定位为"视觉与语言统一的智能体基座"的新模型,在 Qwen3.7 强大文本与 Agent 能力基础上深度融合视觉理解,实现了 GUI 操作、CLI 调用、代码生成与自我验证的端到端闭环。在权威视觉模型榜单 Vision Arena 中,Qwen3.7-Plus 助力阿里跻身全球前五、中国第一。


2026-06-02_104847_763

 

核心定位:能看、能想、能动手

 

Qwen3.7-Plus 的核心特色在于"能看、能想、能动手"——可看懂图形界面、操作应用、生成代码并交付结果。它保留并强化了 Qwen3.7 在文本、编码、工具使用和生产力工作流方面的完整智能体能力,同时全面升级视觉-语言融合能力,支持图像、视频、屏幕、网页和文本输入,可在 GUI(图形用户界面)、CLI(命令行界面)和工具环境中完成任务。

 

在纯文本测试中,Qwen3.7-Plus 接近 Max 级别模型表现,在编码智能体、通用智能体、推理、指令遵循和多语言任务上保持强劲竞争力。多模态测试显示,该模型在视觉推理、工具调用和任务执行链路上均有显著提升,在 BabyVision、MathVision、ScreenSpot Pro、OSWorld-Verified、AndroidWorld 等评测中进步明显。


2026-06-02_105555_701

 

颠覆性实测:11小时自主闭环开发真实APP

 

为验证实际落地能力,阿里团队让 Qwen3.7-Plus 独立完成了一款英语单词学习 APP 的全链路开发。基于该模型构建的 Hybrid-Agent 智能体系统 连续稳定运行 11 小时以上,全程无人工干预,累计生成超过10,000 行代码,触发 Agent 调用超过 1,000 次,完整覆盖了软件开发全生命周期的核心环节:

 

- 需求文档自动生成

- 代码自动编写

- 自动化安装部署

- 测试用例创建

- GUI 自动化测试

- 多场景并行化测试

- 产品说明自动更新

- 自动版本迭代演进

 

这一实测结果标志着 AI 智能体从"辅助编程"迈向"全栈自主开发"的关键跨越。

 


多模态编程:从截图到可运行代码

 

Qwen3.7-Plus 在视觉编程领域展现出强大潜力。在桌面应用场景中,该模型可自主交互 macOS 原生"股市"(Stocks)应用,理解 UI 布局与功能细节,自动生成 SwiftUI 源码,接入 LongBridge 真实行情 API 获取实时数据,自动编译构建并启动复刻应用。随后自主执行 10 项功能验证测试并全部通过,最终完整复现原生应用的暗色主题、分栏布局与实时行情交互体验。

 

此外,Qwen3.7-Plus 还支持:

  • 复杂图像解析:如地铁线路图等空间信息理解

  • 搜索增强视觉问答:结合联网搜索进行多模态推理

  • 图像/视频转 SVG 矢量代码:视觉驱动的网页设计

  • 浏览器 Agent 场景:自动完成阿里云 ECS 云服务器采购及运维链路闭环

 


评测表现:Vision Arena 全球前五,编程能力国产登顶

 

在全球权威视觉模型榜单 Vision Arena 中,凭借 Qwen3.7-Plus 的强劲表现,阿里巴巴成功跻身全球前五、中国第一。


2026-06-02_105118_861

 

回顾 Qwen3.7 系列的发布节奏,阿里展现了惊人的迭代速度。5 月 18 日,Arena AI 官方公布 Qwen3.7-Max-Preview 和 Qwen3.7-Plus-Preview 成绩:前者在文本领域整体排名全球第 13,数学赛道第 7、编程赛道第 10,均为全球前十;后者在视觉领域拿下第 16 名,推动阿里实验室视觉赛道总排名攻入前五。

 

更早前的 Qwen3.6-Plus 已在开发者社区引发轰动——4 月 4 日 OpenRouter 数据显示其日调用量突破 1.4 万亿 Token,新上榜即登顶第一,增长率达 711%。在 Arena 编程子榜中,阿里凭借 Qwen3.6-Plus 成为全球编程能力排名第二的 AI 机构,仅次于 OpenAI。

 


跨框架泛化与开放接入

 

Qwen3.7-Plus 已正式通过 阿里云百炼平台 对外提供服务,也可在 Qwen Studio 体验。模型支持 OpenAI 兼容 API 与 Anthropic 协议调用,无论通过 Claude Code、OpenClaw 还是 Qwen Code 等框架部署,均能保持稳定的跨框架泛化表现。

 

这一开放策略延续了阿里千问系列"开源+商用"双轮驱动的路线。此前 Qwen3.6-Plus 已支持百万 Token 原生上下文、原生 Agent 框架深度适配(OpenClaw、Claude Code、OpenCode 等),以及 119 种语言的多语言适配。

 

随着 Qwen3.7-Plus 的正式上线,阿里千问系列正从"模型能力竞赛"转向"智能体生产力落地"的新阶段。在 Vision Arena 全球前五的排名背后,是国产多模态大模型首次在视觉智能体赛道与 GPT、Claude、Gemini 等顶级模型同台竞技并占据一席之地的标志性时刻。