谷歌 Veo 3 亮相,好莱坞瞩目!

5.29 对话生成功能尤其引人注目输入脚本或让Veo3生成角色对话,它就能生成与视觉效果相匹配的声音,嘴唇动作也完美同步


20250527_1152


谷歌新发布的 Veo 3 正在彻底重新定义 AI 生成的视频。发布于 谷歌I / O 2025,Veo 3 制作的视频片段非常逼真,大多数观众都难以将其与实景镜头区分开来。


Veo 3 引入了原生音频生成和影院级视觉保真度等功能,大大降低了 专业级视频制作。


集成音频打破“静音时代”


这是 AI 视频生成器首次配备自己的音景。 Veo 3 生成音效、环境噪音,甚至人物对话来配合每个场景,所有这些都与动作同步。谷歌 DeepMind 的首席执行官 Demis Hassabis 将其描述为 “从视频生成的无声时代中走出来”,创作者不仅可以向 Veo 3 提供场景描述,还可以告诉他们场景应该如何发声。


该模型会分析自身生成的帧,并自动同步合适的音频,从而让脚步声、门的吱嘎声,以及人物的说话方式,都恰到好处。这项内置音频功能堪称颠覆性创新——之前的生成模型生成的素材都是静音的,需要用户手动添加声音。相比之下,Veo 3 可以生成完整的视频片段,并带有丰富的音频,有效地一次性完成了摄影师和声音设计师的双重角色。



逼真的音频的加入极大地提升了沉浸感,也为创作者带来了实用性。对话生成功能尤其引人注目
——输入脚本或让 Veo 3 生成角色对话,它就能生成与视觉效果相匹配的声音,嘴唇动作也完美同步。背景噪音和音乐也能完美呈现,无论是公园场景中的鸟鸣,还是高潮时激昂的管弦乐,都能清晰呈现。


谷歌表示,Veo 3 经过训练,能够将这些元素无缝融合,这得益于 DeepMind 对视频转音频建模的研究。实际上,一个独立的创作者现在可以输入“海上雷雨交加,水手大声下达指令”,就能得到一段包含海浪拍打、狂风呼啸以及水手声音的短片——所有这些都一次性生成。这种端到端的视听生成技术消除了制作专业视频所需的另一层专业知识,让没有声音编辑技能的人也能获得高质量的作品。


电影品质和不可思议的真实感


Veo 3 使其素材比以往任何时候都更接近好莱坞品质。该模型输出更清晰、更细腻的视频(分辨率高达 4K),并展现出对现实世界物理和光照的出色把握。早期的样例以其逼真的画面震撼了观众:Veo 3 生成的场景通常没有明显的合成痕迹。帧间运动流畅连贯——AI 很少中断连续性,这意味着您不会看到抖动的伪影或人物在不同时刻的不可预测的变形。


如果汽车在拐角处加速行驶,尘埃轨迹和阴影会自然地移动;如果人物奔跑,他们的动作会遵循动量和重力等物理定律。这种对现实的忠实甚至延伸到一些众所周知的棘手细节,例如人手和言语。Veo 3 中的人物比例自然(没错,每只手有五个手指),面部动作与语音精准同步——这一成就使屏幕对话更加逼真。



所有这些改进都源于更大的训练语料库和模型优化,使得 Veo 3 能够将复杂、详细的提示转化为精美、逼真的视频。


重要的是,该机型专注于电影级输出,使其能够实现此前非工作室无法企及的艺术品质。谷歌宣称 Veo 3 拥有“更高的真实感和保真度,包括 4K 输出”,其演示片段中的纹理、光线和相机景深确实营造出专业电影般的观感。


精准提示和创意控制变得简单


Veo 3 的一大优势在于它能够忠实地遵循导演在提示中描述的愿景。该模型擅长解读复杂的多行提示——即使是短篇故事或故事板——并将其转化为连贯的视频。谷歌报告称,Veo 3 在提示执行方面取得了显著提升:Veo XNUMX 可以跟踪文本中指示的一系列动作或多个场景变化,并以正确的时间和细节进行渲染。


对于创作者来说,这意味着你可以一次性勾勒出整个概念(“场景 1:英雄进入黑暗的房间……场景 2:突然爆炸引发混乱……”),Veo 3 会生成一个按顺序呈现这些节拍的片段。这种理解水平使得通过文本讲述故事的能力远超之前的生成模型,之前的生成模型往往难以在哪怕几秒钟的视频中保持一致性。Veo 3 有效地扮演着摄像师、布景设计师和剪辑师的角色, 得到 您的剧本——以全新的精确度遵循有关角色和摄像机角度的舞台指导。


谷歌通过用户友好的工具增强了这种快速驱动的能力,使创作者无需具备编辑专业知识即可对结果进行精细控制。除了 Veo 3 之外,该公司还推出了 自动化流程,一款专为利用该模型的功能而定制的人工智能电影制作应用程序。


Flow 提供了一系列功能,从虚拟“摄像机控制”(用于设置特定角度或平滑摇摄的镜头)到“场景构建器”(用于扩展或调整生成的场景,使其具有连续的运动和一致的人物角色)。例如,您可以让 Veo 生成一个户外市场场景,然后使用场景构建器 延长 在该片段中,展现更多环境内容或无缝过渡到下一个场景。Flow 甚至支持对象级编辑:创作者可以添加或删除片段中的元素,或更改宽高比(例如,将纵向视频转换为横向宽屏),模型会根据需要填充新的背景。所有这些都通过简单的提示或 UI 滑块实现,无需手动动画。


最终呈现的是一个迭代式、几乎毫不费力的创作过程——你用文字勾勒出一个想法,然后拍摄一段视频,最后通过指示AI调整“摄像机”或“重塑”道具来完善它,它最终会照做。这种紧密的人机协作意味着,即使是视频制作新手,也能完成通常需要高级技能或团队协作才能完成的复杂拍摄和剪辑。


民主化专业视频制作


Veo 3 的发布标志着一个新时代的到来,好莱坞级别的制作价值将为更广泛的创作者和企业所用。通过自动化大部分繁重的工作——摄影、特效甚至音效设计——Veo 3 显著减少了制作精美视频所需的资源。


现在,个人 YouTuber 或小型初创公司都能创作出外观和音质都如同由完整工作室团队制作的影片。这大大降低了制作广告、预告片或其他宣传媒体的入门成本。事实上,行业分析师指出,像 Veo 3 这样的工具可以用于更多商业营销和媒体工作,无需庞大的团队或预算即可快速完成广告和内容制作。需要为宣传活动临时制作视频广告?营销团队无需聘请演员和租用设备,只需根据提示制作一段逼真的 30 秒短片,即可在当天完成。


值得注意的是,Veo 3 最高级的功能(例如音频生成)在发布时,最初可通过谷歌每月 249 美元的 AI Ultra 订阅和企业云服务使用。虽然这种高级访问权限可能会在短期内限制业余爱好者的使用,但其发展趋势显而易见——随着时间的推移,这些功能只会变得更加普及和经济实惠。即使是现在,订阅费用也只是专业视频拍摄或后期制作费用的一小部分。从总体来看,Veo 3 是 AI 驱动的内容创作流程的预览,它能够以最小的开销扩展质量,从根本上改变视频制作的经济效益。


隆重推出 Google AI Ultra:一次订阅即可享受 Google AI 的最佳功能


新的创意前沿和新的责任


Veo 3 的到来无疑对创造力和效率大有裨益,但它也迫使创意产业必须应对一些重要的影响。一方面,真实内容与合成内容之间的界限正在变得模糊:互联网上已经充斥着 Veo 生成的视频片段,它们的真实感让观众惊叹不已,但现实与人工智能的界限却变得如此模糊,令人不安。


电影制作人和视频专业人士正面临着一个未来:人工智能可以按需制作出令人信服的素材。这引发了人们对原创性、真实性以及人类技艺在其中所扮演角色的质疑。一些艺术家和纯粹主义者对此心存疑虑,这可以理解。批评者认为,无论人工智能视频的技术多么精湛,它们都是毫无灵魂的垃圾,他们担心低质量内容的泛滥或失业。这些担忧与人工智能兴起后摄影和设计领域所经历的颠覆性变革如出一辙:当创作民主化时,它会挑战现有的所有权和劳动规范。


另一方面,支持者认为人工智能就像 Veo 3 这只是创意技术的下一个进化——它并非取代人类的创造力,而是一个强大的新工具。谷歌在 Veo 3 中内置了一些安全措施,以解决一些隐患,包括隐形水印(通过 DeepMind 的 SynthID),以帮助检测和标记 AI 制作的视频。该模型还设有内容防护栏:测试人员发现,它拒绝生成深度伪造式政治虚假信息或有害场景的提示。随着超现实 AI 视频的制作变得越来越容易,这些负责任的 AI 措施将至关重要。


与此同时,许多具有前瞻性思维的创作者正在拥抱这款工具,专注于它如何增强他们的想象力,而不是取代它们。通过在开发过程中与电影制作人合作,谷歌旨在确保 Veo 3 支持创意工作流程,而不是破坏它们。理想情况下,最终结果是人工智能能够承担繁琐的制作后勤工作,让人类创作者能够专注于故事叙述、风格和创意。


从内容工作室到广告公司,人工智能视频生成技术已成主流,而且功能日益强大。Veo 3 以最高品质展现了这一趋势。它降低了门槛和成本,同时也挑战了创意人员,让他们的作品在人人都能创作出令人惊叹的视觉效果的世界中脱颖而出。


当我们站在这个新前沿时,像 Veo 3 这样的工具显然将在未来的电影制作和媒体领域发挥重要作用。整个创意产业都需要适应,为 AI 辅助内容建立新的规范。在谷歌看来,这项技术是 “赋能者,帮助新一波电影制作人更轻松地讲述他们的故事”,最终释放出新的声音和想法,否则这些想法可能永远无法登上银幕。未来几年,蓬勃发展的故事讲述者很可能是那些学会运用人工智能模型的人,比如 Veo 3 作为其艺术工具包的一部分——利用生成视频的效率和规模,同时以独特的人类创造力和视野来引导它。


链接:https://deepmind.google/models/veo/

谷歌 Veo 3 亮相,好莱坞瞩目! | AIYXL