蚂蚁集团开源dInfer,扩散模型推理速度提升10倍

10.13 在代码生成任务HumanEval上,dInfer在单批次推理中创造了1011Tokens秒的速度,首次在开源社区中实现扩散语言模型的单批次推理速度显著超越自回归模型

开源社区迎来一项重要突破,扩散语言模型终于打破了推理速度的“枷锁”。

 

10月13日,蚂蚁集团正式开源了业界首个高性能扩散语言模型(dLLM)推理框架dInfer。在基准测试中,dInfer将扩散语言模型的推理速度相比英伟达扩散模型框架Fast-dLLM提升了10.7倍。

 

在代码生成任务HumanEval上,dInfer在单批次推理中创造了1011 Tokens/秒的速度,首次在开源社区中实现扩散语言模型的单批次推理速度显著超越自回归模型。

 

这一突破标志着扩散语言模型从“理论可行”迈向“实践高效”的关键一步。


2025101301
(dInfer的架构)

 

突破瓶颈:扩散模型的理论潜能与现实困境

 

在人工智能领域,自回归模型一直是语言生成任务的主流选择,但其逐词串行生成的方式无法充分发挥GPU的并行计算能力,成为推理效率提升的瓶颈。

 

扩散语言模型作为一种全新范式,将文本生成视为一个“从随机噪声中逐步恢复完整序列”的去噪过程。

 

这一机制使其具备高度并行、全局视野、结构灵活三大优势。

 

以蚂蚁集团和人大发布的LLaDA-MoE为代表的扩散模型已在多个基准测试中,展现出与顶尖自回归模型相媲美的准确性。

 

然而在推理效率方面,扩散语言模型理论上的强大潜能却长期被现实“枷锁”所束缚。其高效推理面临计算成本高、KV缓存失效、并行解码三大挑战。

 

这些瓶颈使得扩散语言模型的推理速度一直不尽人意,打破枷锁释放其推理效率潜能成为整个领域亟待解决的难题。

 

技术革新:dInfer的架构设计与核心突破

 

dInfer是一款专为扩散语言模型设计的、算法与系统深度协同的高性能推理框架,可支持多种扩散语言模型,包括LLaDA、LLaDA-MoE、LLaDA-MoE-TD等。

 

该框架包含四大核心模块:模型接入(Model)、KV缓存管理器(KV-Cache Manager)、扩散迭代管理器(Iteration Manager)和解码策略(Decoder)。

 

这种可插拔的架构允许开发者像搭乐高一样,进一步组合和探索不同模块的优化策略。

 

针对扩散模型面临的三大挑战,dInfer在每个模块中都集成了针对性的解决方案。

 

面对计算成本高的问题,dInfer通过邻近KV缓存刷新策略,基于“语义局部性”原理,在每次迭代解码时仅选择性地重新计算当前解码块及其邻近区域的KV,有效降低计算开销。

 

针对KV缓存失效,dInfer进行了系列系统优化,采用多卡并行技术、编译优化和循环展开等方法,使效率提升超过200%。

 

对于并行解码的挑战,dInfer提出了层级解码和信用解码两种算法。层级解码借鉴“分治”思想将待解码区域递归分割,信用解码则引入累积信用机制追踪token在历史迭代中的表现。

 

dInfer还引入迭代平滑算法,回收未解码位置的概率分布信息,通过加权Embedding融入下一轮迭代,使单次迭代解码的token数量平均提升30-40%。

 

性能表现:基准测试中的里程碑式飞跃

 

在配备8块NVIDIA H800 GPU的节点上,dInfer的性能表现令人瞩目。

 

与先前的dLLM推理方案Fast-dLLM的对比中,dInfer在模型效果持平的情况下,平均推理速度实现了10.7倍的巨大提升(681 vs 63.6)。

 

在代码生成任务HumanEval上,dInfer在单批次推理中创造了1011 tokens/秒的速度。

 

更引人注目的是,与在业界顶尖的推理服务框架vLLM上运行的、参数量和性能相当的自回归模型Qwen2.5-3B相比,dInfer的平均推理速度是其2.5倍(681 vs 277)。

 

这些数据来源于蚂蚁集团在arXiv上发布的学术论文,确保了性能指标的可信度。

 

未来展望:开启高效AI推理新纪元

 

dInfer的出现连接了前沿研究与产业落地,为扩散语言模型的实际应用铺平了道路。

 

蚂蚁集团表示,此次开源是诚邀全球的开发者与研究者共同探索扩散语言模型的巨大潜能,构建更加高效、开放的AI新生态。

 

dInfer的工作表明,扩散语言模型具备显著的效率潜力,可以通过系统性的创新工程兑现,为通往AGI的架构路径提供极具竞争力的选项。

 

随着AI在各行业的广泛应用,对模型推理效率的要求也越来越高,dInfer的出现恰逢其时。

 

未来,dInfer有望在自然语言处理、代码生成、智能助手等领域发挥重要作用,推动整个人工智能行业向更高效、更实用的方向发展。

 

在8块H800 GPU的测试节点上,dInfer平均推理速度达到681 tokens/秒,让扩散语言模型在单批次推理中首次超越了自回归模型的表现。

 

这一技术飞跃证明,通过系统性的创新工程,扩散语言模型的效率潜力可以被充分兑现。

 

dInfer开源社区的大门已经敞开,全球开发者现在可以共同探索通往AGI的这条全新路径。