美团开源LongCat-Flash-Omni:5600亿参数全模态大模型开启实时交互新时代

11.3 美团LongCat团队近日正式发布并开源其最新的多模态大模型LongCat-Flash-Omni,此举标志着其在人工智能领域,特别是全模态实时交互技术方面迈出了关键一步

美团LongCat团队近日正式发布并开源其最新的多模态大模型——LongCat-Flash-Omni,此举标志着其在人工智能领域,特别是全模态实时交互技术方面迈出了关键一步。作为LongCat-Flash系列的最新成员,LongCat-Flash-Omni不仅延续了该系列在计算效率上的优势,更在多模态感知与生成能力上实现了重大突破。


2025-11-03_112236_279
模型构架

 

LongCat-Flash-Omni是在今年9月推出的LongCat-Flash系列(包括LongCat-Flash-Chat和LongCat-Flash-Thinking)基础上的又一次升级。新模型总参数高达5600亿,激活参数为270亿,依托其核心的Shortcut-Connected MoE(ScMoE)技术,成功克服了大规模模型在通信上的瓶颈。ScMoE通过引入跨层快捷连接,将密集前馈网络(FFN)的计算与混合专家(MoE)层的通信操作并行化,从而在保证强大性能的同时,显著提升了推理效率。

 

这款模型最大的亮点在于其一体化的全模态架构。LongCat-Flash-Omni集成了高效的多模态感知模块和语音重建模块,能够直接处理并理解文本、图像、视频和音频等多种信息,并生成自然流畅的文本与语音响应。其端到端的设计理念确保了从感知到生成的整个过程都能在毫秒级内完成,为实时音视频交互、智能客服、虚拟助手等应用场景提供了强大的技术支持。

 

根据官方公布的综合评估结果,LongCat-Flash-Omni在全模态基准测试中表现卓越,达到了当前开源领域的最先进水平(SOTA)。这意味着该模型在不牺牲任何单一模态能力的前提下,实现了“全模态不降智”的目标,在文本生成、图像理解、视频分析及语音合成等关键任务中均展现出顶尖的竞争力。


2025-11-03_112305_774

 

在当前多模态大模型竞争日益激烈的市场环境下,包括阿里Qwen3-VL在内的多个模型也纷纷宣称达到SOTA水平。美团LongCat-Flash-Omni的发布,无疑为开发者社区提供了一个功能强大且高效的新选择。伴随着LongCat官方App的上线,该模型的应用生态有望得到快速拓展,为2025年多模态AI技术的普及与落地注入新的活力。


https://huggingface.co/meituan-longcat/LongCat-Flash-Omni 

https://github.com/meituan-longcat/LongCat-Flash-Omni