在AI视频生成领域,一个划时代的里程碑已经到来。由英伟达(NVIDIA)联合麻省理工学院(MIT)、香港大学(HKU)等机构共同研发的全新视频扩散模型——SANA-Video,以其惊人的效率和卓越的质量,彻底颠覆了行业对实时视频生成的认知。该模型能够以27帧每秒的速度进行实时视频生成,并仅需35秒即可合成1分钟的720p高清视频,将训练成本大幅降低,为AI视频创作开辟了全新的可能性。
核心技术:线性DiT架构引领效率革命
SANA-Video的成功,源于其两大核心技术创新。首先,它采用了革命性的线性DiT(Diffusion Transformer)架构。传统的扩散模型在处理高分辨率图像和视频时,由于需要处理海量的token(数据单元),导致计算复杂度急剧上升,推理速度缓慢。SANA-Video通过将DiT中的传统注意力机制全面替换为线性注意力,极大地降低了计算复杂度,尤其是在处理长时长、高分辨率的视频任务时,效率优势尤为显著。
其次,模型引入了恒定显存KV缓存机制。这一设计确保了在生成分钟级长视频时,显存占用保持恒定,避免了因显存溢出而导致的生成中断或性能下降,从而实现了稳定、高效的长视频合成。
值得注意的是,SANA-Video并非凭空构建,而是在其强大的图像生成模型SANA-Image的基础上继续训练而来。SANA-Image本身就是一个能够高效生成高达4K分辨率图像的先进模型。这种继承关系使得SANA-Video不仅在视频领域表现出色,也确保了其生成画面的高质量和细节丰富度。

性能卓越:全面超越同类模型
在性能方面,SANA-Video的表现堪称惊艳。官方数据显示,该模型能够高效生成最高720×1280分辨率、时长可达一分钟的视频内容。这不仅满足了当前主流社交媒体和短视频平台的需求,也为更复杂的视频应用场景奠定了基础。
更重要的是,SANA-Video在保证速度的同时,并未牺牲视频质量。在业界权威的视频生成模型评测体系VBench上,SANA-Video取得了与Wan-2.1等顶尖开源扩散视频模型持平甚至超越的成绩。VBench是一个由上海人工智能实验室等机构提出的综合性评测体系,从多个维度对视频生成模型的内在保真度、语义一致性等方面进行全面评估。SANA-Video在该基准上的优异表现,充分证明了其生成视频在质量、流畅度和内容准确性上的可靠性。

综上所述,SANA-Video凭借其创新的线性DiT架构和高效的工程实现,成功解决了AI视频生成领域长期存在的速度与质量难以兼顾的难题。它的出现,不仅将AI视频生成的效率推向了新的高度,也为未来的影视制作、游戏开发、虚拟现实等产业带来了无限的想象空间。
论文地址:
https://arxiv.org/pdf/2509.24695
项目主页:
https://nvlabs.github.io/Sana/Video/