谷歌发布 Veo 3.1 视频生成模型:强化音频与编辑能力,剑指 AI 视频创作新高地

10.16 随着Veo3.1的全面铺开,谷歌正加速其在AI赋能内容创作领域的布局,试图为从专业电影人到普通内容创作者的所有用户提供一套强大而易用的工具集,引领下一波视频创作的浪潮

谷歌今日正式发布了其最新一代AI视频生成模型 Veo 3.1,标志着其在生成式AI视频领域的又一次重大飞跃。新模型不仅为视频添加了原生音频支持,还引入了革命性的对象编辑功能,旨在为创作者提供前所未有的叙事控制力和创作自由度。


2025-10-16_151816_134

 

Veo 3.1 是在2025年5月发布的 Veo 3 基础上进行的深度优化。谷歌表示,新版本显著提升了生成视频的一致性、视觉流畅度以及音画同步效果,能够生成更加逼真且能精准遵循用户提示的视频片段。此次升级的核心亮点之一是原生音频生成。Veo 3.1 现在能够根据视频内容自动生成包括对话、环境音效和配乐在内的丰富音频,使生成的视频从“无声画面”迈向“有声世界”,极大地增强了内容的生动性和沉浸感。

 

除了音频,Veo 3.1 在精细化编辑控制方面也取得了突破。用户现在可以向已有的视频片段中“添加”新对象,并确保这些对象能自然地融入原始画面的风格与光影之中。谷歌还预告,一项更强大的“对象移除”功能即将在视频编辑工具 Flow 中上线,这将进一步简化视频后期制作流程。此前,Veo 3 已支持通过参考图像定义角色、提供首尾帧生成视频以及基于结尾帧自动延长视频等高级功能,而 Veo 3.1 为所有这些功能都赋予了音频能力。

 

Veo 3.1 的推出并非孤立事件,而是谷歌构建其AI视频创作生态的关键一环。该模型现已陆续部署至其视频编辑平台 Flow、Gemini 应用程序、Vertex AI 平台以及 Gemini API 接口。自 Flow 于今年5月上线以来,其用户增长势头迅猛。截至7月,用户已创作超过4000万个Veo 3视频;而到10月,这一数字已飙升至惊人的2.75亿个,彰显了市场对AI视频工具的巨大需求和认可。

 

在竞争激烈的AI视频模型赛道上,Veo 3.1 的发布也加剧了与 OpenAI 的 Sora 2、Runway 的 Gen-3/4 等模型的正面交锋。有分析指出,Veo 3.1 在故事驱动型内容创作上表现更佳,其生成的视频在整体质量和专业用途上被认为优于 Sora 2。尤其在带音效的视频生成方面,Veo 3.1 被认为超越了包括 Sora 2 Pro 在内的多个竞品。此外,Veo 3.1 支持生成长达60秒的连贯视频,为创作者实现完整的叙事弧线提供了可能,这在当前普遍以短片段为主的AI视频领域是一个显著优势。

 

随着 Veo 3.1 的全面铺开,谷歌正加速其在AI赋能内容创作领域的布局,试图为从专业电影人到普通内容创作者的所有用户提供一套强大而易用的工具集,引领下一波视频创作的浪潮。