6月2日,阿里巴巴旗下通义千问团队正式发布 Qwen3.7-Plus 多模态交互混合智能体模型。这款定位为"视觉与语言统一的智能体基座"的新模型,在 Qwen3.7 强大文本与 Agent 能力基础上深度融合视觉理解,实现了 GUI 操作、CLI 调用、代码生成与自我验证的端到端闭环。在权威视觉模型榜单 Vision Arena 中,Qwen3.7-Plus 助力阿里跻身全球前五、中国第一。

核心定位:能看、能想、能动手
Qwen3.7-Plus 的核心特色在于"能看、能想、能动手"——可看懂图形界面、操作应用、生成代码并交付结果。它保留并强化了 Qwen3.7 在文本、编码、工具使用和生产力工作流方面的完整智能体能力,同时全面升级视觉-语言融合能力,支持图像、视频、屏幕、网页和文本输入,可在 GUI(图形用户界面)、CLI(命令行界面)和工具环境中完成任务。
在纯文本测试中,Qwen3.7-Plus 接近 Max 级别模型表现,在编码智能体、通用智能体、推理、指令遵循和多语言任务上保持强劲竞争力。多模态测试显示,该模型在视觉推理、工具调用和任务执行链路上均有显著提升,在 BabyVision、MathVision、ScreenSpot Pro、OSWorld-Verified、AndroidWorld 等评测中进步明显。

颠覆性实测:11小时自主闭环开发真实APP
为验证实际落地能力,阿里团队让 Qwen3.7-Plus 独立完成了一款英语单词学习 APP 的全链路开发。基于该模型构建的 Hybrid-Agent 智能体系统 连续稳定运行 11 小时以上,全程无人工干预,累计生成超过10,000 行代码,触发 Agent 调用超过 1,000 次,完整覆盖了软件开发全生命周期的核心环节:
- 需求文档自动生成
- 代码自动编写
- 自动化安装部署
- 测试用例创建
- GUI 自动化测试
- 多场景并行化测试
- 产品说明自动更新
- 自动版本迭代演进
这一实测结果标志着 AI 智能体从"辅助编程"迈向"全栈自主开发"的关键跨越。
多模态编程:从截图到可运行代码
Qwen3.7-Plus 在视觉编程领域展现出强大潜力。在桌面应用场景中,该模型可自主交互 macOS 原生"股市"(Stocks)应用,理解 UI 布局与功能细节,自动生成 SwiftUI 源码,接入 LongBridge 真实行情 API 获取实时数据,自动编译构建并启动复刻应用。随后自主执行 10 项功能验证测试并全部通过,最终完整复现原生应用的暗色主题、分栏布局与实时行情交互体验。
此外,Qwen3.7-Plus 还支持:
复杂图像解析:如地铁线路图等空间信息理解
搜索增强视觉问答:结合联网搜索进行多模态推理
图像/视频转 SVG 矢量代码:视觉驱动的网页设计
浏览器 Agent 场景:自动完成阿里云 ECS 云服务器采购及运维链路闭环
评测表现:Vision Arena 全球前五,编程能力国产登顶
在全球权威视觉模型榜单 Vision Arena 中,凭借 Qwen3.7-Plus 的强劲表现,阿里巴巴成功跻身全球前五、中国第一。

回顾 Qwen3.7 系列的发布节奏,阿里展现了惊人的迭代速度。5 月 18 日,Arena AI 官方公布 Qwen3.7-Max-Preview 和 Qwen3.7-Plus-Preview 成绩:前者在文本领域整体排名全球第 13,数学赛道第 7、编程赛道第 10,均为全球前十;后者在视觉领域拿下第 16 名,推动阿里实验室视觉赛道总排名攻入前五。
更早前的 Qwen3.6-Plus 已在开发者社区引发轰动——4 月 4 日 OpenRouter 数据显示其日调用量突破 1.4 万亿 Token,新上榜即登顶第一,增长率达 711%。在 Arena 编程子榜中,阿里凭借 Qwen3.6-Plus 成为全球编程能力排名第二的 AI 机构,仅次于 OpenAI。
跨框架泛化与开放接入
Qwen3.7-Plus 已正式通过 阿里云百炼平台 对外提供服务,也可在 Qwen Studio 体验。模型支持 OpenAI 兼容 API 与 Anthropic 协议调用,无论通过 Claude Code、OpenClaw 还是 Qwen Code 等框架部署,均能保持稳定的跨框架泛化表现。
这一开放策略延续了阿里千问系列"开源+商用"双轮驱动的路线。此前 Qwen3.6-Plus 已支持百万 Token 原生上下文、原生 Agent 框架深度适配(OpenClaw、Claude Code、OpenCode 等),以及 119 种语言的多语言适配。
随着 Qwen3.7-Plus 的正式上线,阿里千问系列正从"模型能力竞赛"转向"智能体生产力落地"的新阶段。在 Vision Arena 全球前五的排名背后,是国产多模态大模型首次在视觉智能体赛道与 GPT、Claude、Gemini 等顶级模型同台竞技并占据一席之地的标志性时刻。