阿里开源Qwen3-Next模型:800亿参数仅激活30亿,成本暴降90%

9.13 通过将线性注意力与动态门控注意力结合,模型在保持长文本处理能力的同时,大幅降低了计算复杂度

9月12日,阿里云通义团队宣布推出新一代基础模型架构Qwen3-Next,并开源基于该架构的Qwen3-Next-80B-A3B系列模型。

 

这一采用混合注意力机制和高稀疏度MoE结构的创新模型,总参数达到800亿,但每次推理仅激活30亿参数。

 

其训练成本相较前代产品Qwen3-32B大幅下降90%,推理效率提升10倍,尤其在处理超长文本场景中表现突出。

 

技术突破:四大创新设计重塑模型架构

 

Qwen3-Next并非简单迭代,而是对传统Transformer组件进行了深度重构。通义团队表示,上下文长度扩展与总参数扩展是未来大模型发展的两大核心趋势,Qwen3-Next正是为应对这些挑战而设计。

 

新架构相比Qwen3的MoE结构进行了四项核心升级:引入混合注意力机制(Hybrid Attention)、采用高稀疏度MoE结构、优化训练稳定性,并开发多token预测机制。

 

混合注意力机制融合了Gated DeltaNet与Gated Attention技术。线性注意力虽能打破标准注意力的二次复杂度,但召回能力弱;标准注意力则推理成本高、速度慢。

 

Qwen3-Next创新性地将75%的层采用Gated DeltaNet线性注意力模块,25%的层保留标准多头自注意力机制,实现了性能与效率的平衡。


2025091302

 

效率革命:训练成本降90%,推理速度升10倍

 

Qwen3-Next-80B-A3B-Base模型实现了与Qwen3-32B密集模型相近甚至略好的性能,而它的训练成本(GPU hours)仅为Qwen3-32B的十分之一不到。

 

在32k以上的上下文下的推理吞吐量则是Qwen3-32B的十倍以上。预训练阶段,Qwen3-Next仅需Qwen3-32B所用GPU计算资源的9.3%,便能训练出性能更好的基础模型。

 

具体到推理速度,在预填充阶段:4K上下文长度下,吞吐量几乎是Qwen3-32B的7倍;超过32K时,速度提升超过10倍。

 

解码阶段:4K上下文下,吞吐量提升近4倍;即使超过32K,仍保持10倍以上的速度优势。


2025091301

 

性能表现:媲美旗舰模型,超越谷歌Gemini

 

基于Qwen3-Next架构的指令微调(Instruct)和推理优化(Thinking)两大版本表现出色。

 

指令模型Qwen3-Next-80B-A3B-Instruct在多个基准测试中接近阿里旗舰模型Qwen3-235B的表现。

 

思维模型Qwen3-Next-80B-A3B-Thinking则在部分复杂推理任务上超越了谷歌最新的Gemini-2.5-Flash-Thinking模型。

 

在RULER基准测试中,指令模型在各长度下均优于注意力层更多的Qwen3-30B-A3B-Instruct-2507,且在256K上下文内击败总层数更多的Qwen3-235B-A22B-Instruct-2507。

 

思维模型在编程、复杂问答等场景全面领先,部分指标接近Qwen3-235B-A22B-Thinking-2507水平。


2025091303


2025091304

 

长远上下文:原生支持262K,可外推至101万tokens

 

Qwen3-Next-80B-A3B系列模型原生支持262K tokens的上下文窗口,经测试可外推至约101万tokens的长文本处理能力。

 

这一能力使模型能够处理超长文档、代码库分析和复杂多步推理任务,为大规模信息处理和综合分析提供了可能。

 

混合注意力机制的应用是长上下文能力的关键。通过将线性注意力与动态门控注意力结合,模型在保持长文本处理能力的同时,大幅降低了计算复杂度。

 

实验数据显示,新模型在百万级Tokens输入下的推理延迟较同类产品降低80%以上。

 

开源生态:开发者可多渠道获取模型

 

阿里已将Qwen3-Next-80B-A3B系列模型权重在Hugging Face平台以Apache-2.0协议开源,支持通过Transformers、SGLang、vLLM等主流框架部署。

 

第三方平台OpenRouter也已完成适配上线,开发者可便捷调用相关能力。此外,开发者还可通过Qwen Chat免费体验,或直接调用阿里云百炼平台提供的API服务。

 

Pine AI联合创始人李博杰评价道:“Qwen3-Next采用了混合注意力机制和高稀疏MoE架构,从而大幅提升效率;除了这两大创新点以外,Qwen3-Next还在预训练时采用了多Token预测技术MTP,模型推理速度大幅提升。”

 

他进一步表示:“虽然以上三种技术创新在学界已有研究,但阿里证明了其在工业界的实用性,同时还保持了开源。Qwen3-Next第一次证明了这些技术能够放在一起共同运作,并且能够在实际的业务场景中展现出很好的能力表现。”

 

Qwen3-Next系列模型已在魔搭社区和Hugging Face等平台全面开源。

 

全球AI开源社区Hugging Face的最新数据显示,通义千问Qwen衍生模型数已超17万,稳坐全球第一开源模型。

 

国际权威市场调研机构沙利文报告显示,中国企业级大模型调用呈爆发式增长,2025年上半年日均调用量较2024年底实现363%的增长,目前超10万亿Tokens。

 

其中,阿里通义占比17.7%,位列第一,是中国企业选择最多的大模型。


在线体验:
https://chat.qwen.ai/ 

开源地址:
https://huggingface.co/collections/Qwen/qwen3-next-68c25fd6838e585db8eeea9d