谷歌Gemini应用重磅更新:多图引导AI视频生成,创意控制再升级

11.17 创作者不仅可以利用多张图片来精确指定视频中角色物体或特定场景的视觉风格,还能有效确保角色在多个镜头间的外观一致性,从而创作出更具连贯性和专业感的叙事内容

近日,谷歌对其广受欢迎的Gemini应用进行了一次重大更新,为其AI视频生成模型Veo 3.1引入了一项革命性的新功能,旨在为用户提供前所未有的创意控制权。


2025-11-17_120149_657

 

此次更新的核心在于,用户现在可以在单个视频生成提示中上传最多三张参考图像。系统将综合分析这些图像以及用户输入的文本提示,协同生成包含画面与音频的完整视频内容。这一“多图引导”机制,标志着AI视频生成从单纯的文本驱动迈向了多模态、高精度的控制新阶段。


2025-11-17_120229_928

 

据谷歌官方介绍,这项新功能极大地提升了用户对最终视频成品外观和声音的直接掌控能力。创作者不仅可以利用多张图片来精确指定视频中角色、物体或特定场景的视觉风格,还能有效确保角色在多个镜头间的外观一致性,从而创作出更具连贯性和专业感的叙事内容。例如,用户可以提供角色的正面、侧面和背面图像,AI便能据此生成一个全方位一致的动态角色。

 

此外,谷歌还优化了Veo 3.1的视频输出选项,新增了4秒、6秒和8秒等多种时长选择,以满足不同场景的创作需求。结合此前推出的“帧转视频”功能(即通过指定第一帧和最后一帧来生成中间过程),Gemini应用正逐步构建起一个功能强大且直观易用的AI视频创作平台。

 

业内分析认为,此举不仅是谷歌在AI生成内容(AIGC)领域的一次技术深化,更是对用户“精细化控制”需求的直接回应。随着多图引导、角色一致性等关键能力的完善,AI视频生成工具正从概念验证走向实际应用,为内容创作者、营销人员乃至普通用户开辟了全新的表达与创作空间。