Qwen 的夏天:新开源 Qwen3-235B-A22B-Thinking-2507 在关键基准测试中超越 OpenAI、Gemini 推理模型

7.26 Qwen3-235B-A22B-Thinking-2507是在Apache2.0许可证下发布的,这是一个高度宽松且商业友好的许可证,允许企业不受限制地下载修改自托管微调和集成到专有系统中

如果人工智能行业有一首相当于唱片业的“夏季歌曲”——这首热门歌曲在北半球温暖的月份流行起来,到处都能听到播放——那么这个称号的明显获奖者将是阿里巴巴的 Qwen 团队。

就在过去的一周里,这家中国电子商务巨头的前沿模型人工智能研究部门发布了四个(!!)新的开源生成式人工智能模型,这些模型提供了创纪录的基准,甚至超过了一些领先的专有选项。

昨晚,Qwen Team 发布了 Qwen3-235B-A22B-Thinking-2507,它更新了推理大型语言模型 (LLM),它比非推理或“指导”LLM 需要更长的时间来响应,参与“思维链”或自我反思和自我检查,有望在更困难的任务上做出更正确、更全面的响应。

事实上,新的 Qwen3-Thinking-2507(我们简称它)现在在几个主要基准测试中领先或紧随于性能最佳的模型。

正如 AI 影响者和新闻聚合商 Andrew Curran 在 X 上所写:“Qwen 最强推理模型已经到来,而且处于前沿。


qwen2507 


在旨在评估数学和逻辑背景下解决问题的能力的 AIME25 基准测试中,Qwen3-Thinking-2507 以 92.3 分领先所有报告的模型,以微弱优势超过 OpenAI 的 o4-mini (92.7) 和 Gemini-2.5 Pro (88.0)。

该模型在 LiveCodeBench v6 上也表现出压倒性的性能,得分为 74.1,领先于 Google Gemini-2.5 Pro (72.5)、OpenAI o4-mini (71.8),并且明显优于其早期版本的 55.7。

在研究生水平多项选择题的基准 GPQA 中,该模型达到了 81.1,几乎与 Deepseek-R1-0528 (81.0) 持平,落后于 Gemini-2.5 Pro 的最高分 86.4。

在通过胜率评估一致性和主观偏好的 Arena-Hard v2 上,Qwen3-Thinking-2507 得分为 79.7,领先于所有竞争对手。

结果表明,该模型不仅在每个主要类别上都超越了其前身,而且还为开源、以推理为中心的模型所能实现的目标设定了新标准。

 

从“混合推理”的转变

Qwen3-Thinking-2507 的发布反映了阿里巴巴 Qwen 团队更广泛的战略转变:摆脱了需要用户在“思考”和“非思考”模式之间手动切换的混合推理模型。

相反,该团队现在正在为推理和指令任务训练单独的模型。这种分离允许每个模型针对其预期目的进行优化,从而提高一致性、清晰度和基准性能。新的Qwen3-Thinking模型充分体现了这一设计理念。

与此同时,Qwen 还推出了 Qwen3-Coder-480B-A35B-Instruct,这是一个专为复杂编码工作流程构建的 480B 参数模型。它支持 100 万个令牌上下文窗口,并在 SWE-bench 验证上优于 GPT-4.1 和 Gemini 2.5 Pro。

还宣布了 Qwen3-MT,这是一种多语言翻译模型,在 92+ 种语言的数万亿个代币上进行了训练。它支持域适配、术语控制和推理,每百万个代币仅需 0.50 美元。

本周早些时候,该团队发布了 Qwen3-235B-A22B-Instruct-2507,这是一个非推理模型,在多个基准测试中超越了 Claude Opus 4,并引入了轻量级 FP8 变体,以便在受限的硬件上进行更高效的推理。

所有模型均在 Apache 2.0 下获得许可,可通过 Hugging Face、ModelScope 和 Qwen API 获得。

 

许可:Apache 2.0 及其企业优势

Qwen3-235B-A22B-Thinking-2507 是在 Apache 2.0 许可证下发布的,这是一个高度宽松且商业友好的许可证,允许企业不受限制地下载、修改、自托管、微调和集成到专有系统中。

这与专有模型或仅限研究的开放版本形成鲜明对比,后者通常需要 API 访问、施加使用限制或禁止商业部署。对于希望控制成本、延迟和数据隐私的具有合规意识的组织和团队来说,Apache 2.0 许可可实现完全的灵活性和所有权。

可用性和定价

Qwen3-235B-A22B-Thinking-2507现已在Hugging Face 和 ModelScope 上免费下载。

对于那些不想或没有资源和能力通过阿里云的 API、vLLM 和 SGLang 在自己的硬件或虚拟私有云上托管模型推理的企业。

输入价格:每百万个代币 0.70 美元

产出价格:每百万个代币 8.40 美元

免费套餐:100 万个代币,有效期为 180 天

 

集成和工具

该模型通过 Qwen-Agent 与代理框架兼容,并支持通过 OpenAI 兼容的 API 进行高级部署。

它还可以使用 Transformer 框架在本地运行,或通过 Node.js、CLI 工具或结构化提示接口集成到开发堆栈中。

对于复杂任务,最佳性能的采样设置包括温度=0.6、top_p=0.95和最大输出长度为81,920个标记。

 

企业应用和未来展望

凭借其强大的基准性能、长上下文功能和宽松的许可,Qwen3-Thinking-2507 特别适合用于涉及推理、规划和决策支持的企业 AI 系统。

更广泛的 Qwen3 生态系统(包括编码、指令和翻译模型)进一步扩大了对希望将人工智能整合到工程、本地化、客户支持和研究等垂直领域的技术团队和业务部门的吸引力。

Qwen 团队决定在技术透明度和社区支持的支持下,为不同的用例发布专门的模型,这标志着有意转向构建开放、高性能和生产就绪的 AI 基础设施。

随着越来越多的企业寻求 API 门控黑盒模型的替代方案,阿里巴巴的 Qwen 系列越来越将自己定位为智能系统的可行开源基础——大规模提供控制和功能。