苹果发布革命性FS-DFM模型:长文本生成提速128倍,仅需8步实现媲美传统模型质量

10.14 在人工智能文本生成领域,主流模型通常采用两种技术路径以ChatGPT为代表的自回归模型通过逐字生成确保连贯性,而扩散模型则采用并行生成策略

近日,苹果公司与俄亥俄州立大学研究团队联合推出FS-DFM(Few-Step Discrete Flow-Matching)模型,这一突破性技术正在重塑长文本生成的效率标准。研究表明,这款新型语言模型仅需8轮快速迭代就能生成与传统模型上千轮迭代相媲美的高质量文本,同时实现了最高128倍的写入速度提升,彻底打破了长文本生成领域的效率瓶颈。


2025-10-14_152450_565

 

在人工智能文本生成领域,主流模型通常采用两种技术路径:以ChatGPT为代表的自回归模型通过逐字生成确保连贯性,而扩散模型则采用并行生成策略。FS-DFM创新性地在扩散模型基础上进行简化,通过独特的离散流匹配技术,实现了用极简步骤生成优质文本的突破。

 

为实现这一技术飞跃,研究团队设计了一套精妙的三步法架构。首先,模型经过特殊训练,具备适应不同精炼迭代次数的灵活性;其次,引入“教师”模型引导机制,确保每轮迭代更新既保持大幅跃升又维持精准度,有效避免过度调整;最后,通过优化迭代机制,使模型能够以更少且更稳健的步骤完成文本生成。

 

在性能测试中,FS-DFM与参数量达70亿的Dream模型和80亿的LLaDA模型同台竞技。令人惊叹的是,尽管FS-DFM参数量仅为1.7亿至17亿,但在关键指标上全面领先——不仅呈现出更低的困惑度(表明文本更准确流畅),还展现出更稳定的熵值(反映模型选词信心更强)。这种“小而精”的设计理念证明了高效文本生成不必以庞大参数为代价。

 

这项突破标志着长文本生成技术迈入新纪元,为移动设备部署高质量语言模型开辟了全新可能。在大型语言模型竞相追逐参数规模的行业背景下,苹果的这项研究展现了一条更具实用性的技术发展路径,将对AI写作助手、内容生成工具等应用领域产生深远影响。


项目:
https://machinelearning.apple.com/research/fs-dfm