美团AI长视频新突破,LongCat-Video支持5分钟高质量连贯视频生成

10.27 LongCat-Video基于先进的DiffusionTransformerDiT架构,以统一模型架构无缝支持三大核心视频生成任务文本生成视频图像生成视频和视频续写,实现了任务闭环,无需为不同任务单独微调或部署额外模型

近日美团 LongCat 团队正式发布并开源其最新视频生成模型——LongCat-Video,该模型凭借原生支持长达5分钟的高质量连贯视频生成能力,迅速引发业界关注。此举不仅标志着美团在生成式人工智能领域的重大技术突破,也为其在“世界模型”方向的研究提供了关键支撑。


2025-10-27_115502_687

 

LongCat-Video 基于先进的Diffusion Transformer(DiT)架构,以统一模型架构无缝支持三大核心视频生成任务:文本生成视频、图像生成视频和视频续写,实现了任务闭环,无需为不同任务单独微调或部署额外模型。在文生视频方面,模型可生成 720p 分辨率、30fps 帧率的高清视频,能够精准解析文本中关于物体、人物、场景及艺术风格等复杂指令,语义理解与视觉呈现能力达到当前开源领域的最先进水平(SOTA)。图生视频则能严格保留原始图像的关键特征,并确保动态过程符合物理规律。

 

该模型的核心亮点在于其原生支持5分钟级长视频生成,且在整个生成过程中无明显质量损失。为实现这一目标,LongCat-Video 采用了包括视频续写任务预训练、块因果注意力机制(Block-Causal Attention)以及 GRPO 后训练策略在内的多项创新技术,有效保障了跨帧时序一致性、色彩稳定性与物理运动合理性。此外,通过三重优化策略,模型的推理效率提升高达 10.1 倍,显著缓解了长视频生成中常见的“时长-质量-效率”三角矛盾。


2025102705

 

美团 LongCat 团队表示,LongCat-Video 不仅面向内容创作、广告营销等通用场景,未来还将探索在自动驾驶仿真、机器人环境建模等需要高保真动态世界模拟的领域落地应用。作为开源模型,LongCat-Video 的发布有望推动视频生成技术的标准化与生态建设,为全球开发者提供强大且高效的长视频生成工具。

 

目前,LongCat-Video 已在多个内部与公开基准测试中展现出卓越的通用性能,综合能力位居开源视频生成模型前列,被官方称为达到“行业顶尖水平”。随着长视频生成技术的成熟,AI“看见”并模拟真实世界运行规律的能力正迈入新阶段。

 

https://github.com/meituan-longcat/LongCat-Video 

https://huggingface.co/meituan-longcat/LongCat-Video 

https://meituan-longcat.github.io/LongCat-Video/