一张静态照片在十几秒内变成带背景音乐、人物对话甚至唱歌的动态视频,AI正让每个人成为“电影导演”的梦想照进现实。
埃隆·马斯克与萨姆·阿尔特曼的AI竞争再次升级。本周,马斯克旗下xAI公司正式推出视频生成模型Grok Imagine v0.9,并宣布免费向所有用户开放。
这一举动被视为对OpenAI一周前发布Sora 2的直接回应。 这也标志着AI视频生成技术从“实验室玩具”向“大众利器”的转变,一场关于创意表达与技术可及性的革命正在上演。

技术飞跃:从v0.1到v0.9的进化
Grok Imagine v0.9是xAI自今年7月推出首版v0.1后的首次重大迭代。相比前代,新模型在视觉质量、运动流畅度和音频生成上实现了“海量升级”。
该模型支持从静态图像直接转化为动态视频,并无缝集成背景音乐、对白甚至唱歌元素。 用户只需上传一张图片,通过简单提示词即可触发生成,几乎“秒出”结果。
马斯克在X平台上宣称,Imagine v0.9生成视频不到20秒,而Sora 2可能需要一至两分钟。
这一速度优势可能改变内容创作的工作流程,让即时视频生成成为现实。
功能亮点:电影级制作民主化
Grok Imagine v0.9的核心突破在于其原生音画同步生成能力。 不同于传统AI工具需后期配音,该模型能自动为视频注入背景音乐、对白和唱歌元素,实现“所见即所闻”的沉浸式体验。
从xAI公布的演示视频来看,该模型能创造出电影般的视频效果。
例如,在一条龙飞舞的视频中,可以实时配上龙的嘶吼声;在滑雪场景中,人物从起跳到落地的动作流畅自然。
此外,模型还支持动态相机效果,如智能焦点切换。 在一条街景视频中,随着相机位置变化,背景会自动虚化以突出人物,展现出专业的摄影技巧。
市场竞争:AI视频生成赛道升温
随着Grok Imagine v0.9的加入,AI视频生成领域的竞争日趋激烈。目前市场上已有众多玩家,包括OpenAI的Sora 2、快手的“可灵”、百度“蒸汽机”等。
商业化探索也已悄然启动。据披露,快手旗下的“可灵”在2025年第二季度收入已超过2.5亿元。 生数科技的Vidu上线8个月年化经常性收入突破2000万美元。
收费模式上,各家差异明显。可灵、生数科技的Vidu标准版分别为66元、59元;爱诗科技的拍我、字节跳动的即梦则均为79元。
值得注意的是,Grok Imagine目前免费开放,与Sora 2的邀请制形成鲜明对比。
技术挑战:买家秀与卖家秀的差距
尽管进步显著,AI视频生成技术仍面临诸多挑战。在实测中,Grok Imagine v0.9出现了误解提示词、音画不同步等问题。
使用Sora 2的官方提示词进行测试时,Imagine v0.9生成的视频中,探险者在雪地大喊的场景只有人张嘴却没有声音;男子后空翻的指令生成的人物则在空中360度乱转,完全无视重力原理。
更为令人担忧的是,深度伪造风险。测试显示,Grok Imagine在上传马斯克照片并让他“说话”时,没有提供任何深度伪造风险警告。
而且生成的中文含糊不清,只能听清“是好朋友”几个字。
目前,Grok的网页版无法正常使用,移动版也经常出现连接失败的情况,表明技术仍需完善。
行业影响:重塑内容创作生态
Grok Imagine v0.9的推出,正在降低内容创作的门槛,为社交和商业领域注入新活力。
想象一下,电商卖家上传产品照,即可批量生成带解说音乐的演示视频;教育者用历史画像变身为生动讲解动画;社交用户一键将自拍转化为“唱跳MV”。
影视行业已成为第一批尝鲜者。今年8月上线的50集动漫短剧《明日周一》,80%左右内容由生数科技的Vidu生成。
不到10人的制作团队在45天内完成了第一季50集的所有内容制作,而传统2分钟漫剧制作周期长达一周,效率提升至少7倍。
AI视频生成技术正以惊人速度发展,从Runway只能生成3-4秒视频,到如今支持15秒甚至更长的内容。科技巨头与初创公司纷纷涌入这条赛道,探索从影视创作到具身智能的无限可能。
然而在这场技术竞赛中,速度与免费可能并非最终答案。当生成视频的时间从几分钟缩短到20秒,当技术从专业走向普及,如何在创新与责任、自由与安全之间找到平衡点,将是所有玩家必须面对的课题。