英伟达于7月2日发布并开源了Nemotron-Labs-TwoTower,一种基于预训练自回归骨干网络的离散扩散语言模型,旨在解决大模型Token生成速度瓶颈。
双塔架构:上下文与去噪分离
该模型总参数为60B,采用双塔架构,包括30B的自回归模型和30B的扩散/降噪Tower,每个Tower激活3B模型,128个可路由专家。
TwoTower最大的亮点在于将文本生成任务中的上下文表示与去噪过程分离到两个独立的神经网络“塔”中:一个塔保持冻结,维护文本的自回归上下文;另一个塔负责对噪声块进行去噪,两个塔通过逐层交叉注意力连接协作。
性能数据:速度与质量的平衡
英伟达表示,从综合基准测试质量来看,双塔架构保留98.7%的质量表现,但实际运行时间吞吐量提高了2.42倍。
在具体任务上,MMLU得分为78.24(对照AR模型为78.56),HumanEval为75.58(对照为79.27),质量损失极小。

该模型以开源权重形式在HuggingFace平台发布,授权协议为NVIDIA Nemotron Open Model License。
在算力成本高企的2026年,“推理速度”和“Token成本”是决定模型商业价值的关键变量。英伟达用98.7%的质量换取2.42倍的速度提升,这种“以微小质量牺牲换取大幅效率提升”的思路,可能成为推理优化的重要方向。对开发者而言,这意味着可以用更少的GPU、更低的成本跑出接近顶尖质量的推理结果。