国产长视频生成模型取得关键突破:中国科大与字节跳动联合发布 MoGA

10.24 这一设计成功突破了长视频生成中计算复杂度呈二次方增长的瓶颈,使模型能够高效处理长达580Ktoken的上下文信息,显著降低了显存占用和计算开销

10月24日,北京消息 —— 在全球生成式人工智能(AIGC)竞赛日益激烈的背景下,中国科学技术大学与字节跳动联合研发的端到端长视频生成模型MoGA(Modular Global Attention)正式亮相。该模型能够一键生成长达数分钟、分辨率达480p、帧率为24fps的多镜头高质量短片,标志着我国在视频生成核心技术领域取得关键性进展。


2025-10-24_154337_498

 

长期以来,AI视频生成技术主要受限于上下文长度和算力成本,业界主流模型如Runway Gen-2和Pika通常只能生成4至16秒的短视频片段。尽管OpenAI的Sora模型率先实现了长达一分钟的视频生成,但其技术细节和模型并未完全开源,且对算力要求极高。在此背景下,MoGA的出现为国产长视频生成技术开辟了新路径。

 

MoGA模型的核心创新在于其独创的“混合组注意力”(Modular Global Attention)机制。该机制通过引入轻量级、可学习的令牌路由器,替代了传统稀疏注意力中粗粒度的块级估计,从而实现了对长序列令牌的精准分组。这一设计成功突破了长视频生成中计算复杂度呈二次方增长的瓶颈,使模型能够高效处理长达580K token的上下文信息,显著降低了显存占用和计算开销。


2025-10-24_153620_224

 

研究团队表示,MoGA不仅在算法上实现了突破,还具备极强的工程落地能力。其模块化架构可无缝集成FlashAttention、xFormers、DeepSpeed等主流高效加速库,大幅提升了训练与推理效率。这意味着该技术可快速应用于影视创作、广告营销、游戏过场动画及数字人内容生产等多个产业场景。

 

值得注意的是,字节跳动近年来在视频生成领域持续发力,已相继推出PixelDance、Seaweed和Seedance 1.0等多款模型,并在多镜头切换、主体运动一致性等方面积累了深厚的技术储备。此次与中国科大合作推出的MoGA模型,进一步巩固了其在该领域的领先地位。

 

业内专家分析,MoGA的成功发布,不仅填补了国内在分钟级长视频生成领域的空白,更在全球AIGC竞赛中展现了中国技术的独特优势。随着算法、数据和算力的协同进步,国产视频生成模型有望在未来与国际顶尖水平并驾齐驱,甚至在特定应用场景实现超越。


地址:
https://jiawn-creator.github.io/mixture-of-groups-attention/