今天,埃隆·马斯克旗下人工智能公司xAI为其AI助手Grok的“Grok Imagine”功能推出重大升级,正式全面支持纯文本生成短视频。用户只需输入一句简单描述,系统便能在17秒内生成一段6至15秒、包含背景音效、动态运镜与专业画质的完整视频片段,全程无需任何图像输入或视频编辑技能。

这一更新标志着AI视频生成技术从“辅助创作”迈向“自主成片”的关键一步。xAI将此次升级视为打通“想法到成片”最后一环的突破性进展。值得注意的是,Grok Imagine生成的视频不仅包含画面,还同步嵌入了AI生成的背景音效,显著提升了内容的沉浸感与完整性。
在性能方面,Grok Imagine v0.9版本主打“极致速度”与“移动端友好”,特别针对X平台(原Twitter)用户优化,使其成为目前市场上响应最快的文本到视频工具之一。马斯克本人甚至将其比作“新的Vine”,强调其在社交短视频创作中的潜力。
此举无疑将对当前AI视频生成领域的两大巨头——OpenAI的Sora与Google DeepMind的Veo——构成直接挑战。目前,Sora 2已能生成长达一分钟以上的高保真1080p视频,以电影级画质和物理模拟见长;而Google的Veo 3则在音画同步与场景一致性方面表现出色,同样支持生成带音效的短视频。
然而,Grok Imagine选择以“速度+易用性”切入市场,在生成效率上实现碾压。相较于Sora和Veo动辄数十秒甚至数分钟的生成时间,Grok Imagine宣称17秒内交付成品的能力,使其在即时创作、社交分享等高频场景中具备显著优势。
尽管Grok Imagine当前生成的视频时长相对较短(6-15秒),但其低门槛、快响应的特性,正迅速吸引大量普通用户和内容创作者。随着xAI持续迭代模型能力,AI视频生成领域的竞争格局或将因这一“快”变量而发生深刻变化。