阿里通义千问Qwen3-Max发布:万亿参数AI大模型全球领先

9.24 这款参数总量超过1万亿的模型在多项国际基准测试中表现卓越,其中Qwen3-Max-Instruct的预览版在LMArena文本排行榜上位列全球第三,超越了GPT-5-Chat

超越GPT-5-Chat,跻身全球前三,中国AI模型在国际竞赛中实现重大突破。

 

在人工智能领域竞争日趋白热化的今天,阿里云通义千问团队于2025年9月24日正式推出其迄今为止规模最大、能力最强的AI大模型——Qwen3-Max。

 

这款参数总量超过1万亿的模型在多项国际基准测试中表现卓越,其中Qwen3-Max-Instruct的预览版在LMArena文本排行榜上位列全球第三,超越了GPT-5-Chat。


2025-09-24_140037_340

 

Qwen3-Max作为通义千问家族的旗舰模型,采用了先进的技术架构和训练策略。

模型总参数超过1T,预训练数据量高达36T tokens,沿用了Qwen3系列的设计范式,使用了阿里云提出的global-batch load balancing损失函数。


2025-09-24_140037_350

 

该模型采用MoE(混合专家)架构,训练过程稳定平滑,没有出现损失尖刺。在训练效率方面,PAI-FlashMoE多级流水并行策略优化下,Qwen3-Max-Base的模型MFU相比Qwen2.5-Max-Base相对提升30%。

 

Qwen3-Max还支持1M上下文长度,具备超长文本处理能力,在长序列训练场景中表现出色,训练吞吐量达到序列并行方案的3倍。

 

Qwen3-Max推出了三个主要版本,形成完整的能力矩阵。

 

Qwen3-Max-Base是基础版本,作为整个系列的核心,提供了强大的基础能力。

 

Qwen3-Max-Instruct是指令优化版本,正式版在代码能力和智能体(agent)能力方面进一步提升。

 

最引人注目的是Qwen3-Max-Thinking,这是推理增强版本,目前仍在训练中,但已展现出非凡潜力。该版本通过集成代码解释器并运用并行测试时计算技术,在极具挑战性的数学推理基准测试AIME 25和HMMT上均取得了满分成绩。


2025-09-24_140628_925

 

Qwen3-Max在多项国际权威基准测试中表现优异。

 

在LMArena文本排行榜上,Qwen3-Max-Instruct的预览版稳居全球前三,超越了GPT-5-Chat。正式版本在代码生成与智能体表现方面更加卓越。


2025-09-24_140432_157

 

在编程能力方面,Qwen3-Max-Instruct在SWE-Bench Verified测试中取得了69.6分的优异成绩,该测试专注于解决现实编程挑战。

 

在智能体工具调用能力方面,在Tau2-Bench测试中以74.8分超越Claude Opus 4与DeepSeek-V3.1。

 

阿里云已经全面开放了Qwen3-Max的使用渠道。用户可以在通义千问QwenChat上免费体验Qwen3-Max,也可以通过阿里云百炼平台调用API服务。Qwen3-Max-Instruct正式版已经上线Qwen Chat并在阿里云百炼提供API。