字节跳动发布新一代AI视频模型Vidi2,聚焦长视频理解与智能编辑

12.1 根据字节跳动公布的基准测试结果,Vidi2在专门评估视频理解能力的VUE-STG时空管和VUE-TR-V2时序检索两大基准上,性能显著优于包括谷歌Gemini3Pro预览版和GPT-5在内的主流商用模型

字节跳动近日正式发布了其新一代多模态大模型Vidi2。该模型拥有120亿参数,专为视频理解与编辑而设计,旨在通过人工智能技术简化视频内容创作流程。

 

Vidi2的核心能力在于处理长达数小时的原始视频素材,并能根据用户的简单文字指令,自动识别、剪辑并生成短视频或完整的叙事内容。这一技术突破主要依托于其先进的“细粒度时空定位”能力。与传统视频AI仅能提供大致时间范围不同,Vidi2可以精确识别视频中特定对象或人物,并输出一个包含时间戳和连续空间边界框(bounding box tube)的“时空管道”,从而实现像素级的精准追踪与编辑。


2025120101

 

为应对长视频带来的海量数据处理挑战,Vidi2采用了自适应视觉令牌压缩技术,有效降低了计算资源消耗,同时确保了关键内容上下文的完整性。在技术架构上,模型融合了文本、视觉帧和音频等多种信息,以实现全面的多模态理解。

 

根据字节跳动公布的基准测试结果,Vidi2在专门评估视频理解能力的VUE-STG(时空管)和VUE-TR-V2(时序检索)两大基准上,性能显著优于包括谷歌Gemini 3 Pro(预览版)和GPT-5在内的主流商用模型。


2025120102

 

目前,Vidi2作为研究项目,其技术论文已在arXiv平台发布,相关代码也已在GitHub开源。官方表示,一个可供体验的演示版本(Demo)即将上线。此举被视为字节跳动在AI多模态领域,继MagicVideo系列之后的又一重要布局,有望为全球内容创作者提供更强大的智能化工具。


https://www.alphaxiv.org/abs/2511.19529