“大卫”挑战“歌利亚”:OpenCV创始人携CraftStory破局AI视频时长困局

11.20 在OpenAI的Sora2谷歌的Veo以及RunwayPika等巨头激烈角逐AI视频生成赛道之际,一家名不见经传的美国初创公司CraftStory悄然登场,以其长达5分钟的高质量以人为中心的视频生成能力,撕开了当前AI视频技术最关键的瓶颈时长与一致性

2025-11-20_151146_255


在OpenAI的Sora 2、谷歌的Veo以及Runway、Pika等巨头激烈角逐AI视频生成赛道之际,一家名不见经传的美国初创公司CraftStory近日悄然登场,以其长达5分钟的高质量、以人为中心的视频生成能力,撕开了当前AI视频技术最关键的瓶颈——时长与一致性。

 

CraftStory由OpenCV早期核心贡献者、计算机视觉领域资深专家维克多·叶鲁希莫夫(Victor Erukhimov)创立,并获得了前Wrike创始人安德鲁·菲列夫(Andrew Filev)200万美元的种子投资。菲列夫曾将项目管理软件Wrike以22.5亿美元出售给Citrix,如今专注于AI编码公司Zencoder。这笔看似“寒酸”的融资,与OpenAI动辄数十亿美元的军备竞赛形成鲜明对比,却恰恰体现了CraftStory“以巧破力”的战略思路。

 

技术突破:并行扩散架构打破“时间诅咒”

 

当前主流AI视频模型(如Sora 2、Veo、Runway Gen-3等)普遍采用顺序扩散方法,通过在三维时空体积(x, y, t)上运行算法生成视频。这导致视频越长,所需算力、模型规模和训练数据呈指数级增长,实际生成时长被限制在10至25秒之间。

 

CraftStory则另辟蹊径,提出“并行扩散架构”(parallelized diffusion architecture)。该系统在整个目标视频时长内同时运行多个小型扩散过程,并通过双向约束机制确保各片段间的连贯性。“视频的后半部分也会影响前半部分,”叶鲁希莫夫解释道,“这避免了顺序生成中错误累积的问题”。这一创新使得CraftStory Model 2.0能够一次性生成长达5分钟、动作连贯、画质稳定的视频,远超竞争对手。

 

更关键的是,CraftStory并未依赖海量网络爬取数据,而是自建高质量专有素材库:聘请专业演员,在高帧率摄像系统下拍摄,确保手指等快速运动细节清晰无模糊。叶鲁希莫夫坚信:“你只需要高质量的数据,而非海量数据。”

 

精准定位:深耕B2B长视频蓝海市场

 

与多数竞品聚焦短视频娱乐或创意工具不同,CraftStory明确将目标锁定在企业级应用——如软件教程、产品演示、员工培训等。这类内容通常需要2-5分钟时长,且对人物动作、口型同步、信息准确性要求极高。一个10秒的炫酷视频,无法教会客户如何使用CRM系统。

 

菲列夫指出:“这个市场的一个巨大空白,是缺乏能够在较长片段中生成一致视频的模型——这对现实应用极为重要”。据市场研究,全球AI视频生成器市场规模预计在2025年达到7.168亿美元,并以20%的年复合增长率扩张,其中企业级内容创作是增长最快的细分领域之一。

 

CraftStory目前以“视频对视频”模式运行(上传静态图+“驾驶视频”),未来将上线文本直生视频和移动摄像机场景(如“边走边说”)支持,进一步降低企业视频制作门槛。菲列夫估算,小企业主未来或可在几分钟内产出过去需耗资2万美元、耗时两个月的高质量视频。

 

专业主义能否战胜资本洪流?

 

CraftStory的出现,是对当前AI领域“唯大模型、唯海量算力”路径的一次有力反叛。叶鲁希莫夫深厚的计算机视觉背景(OpenCV、Itseez)使其团队更理解人体运动、时间连续性、视觉一致性等底层问题——这正是生成逼真人类视频的核心。

 

然而,挑战依然严峻。Sora 2、Veo等虽时长短,但在通用场景理解、想象力方面优势明显。CraftStory若不能快速扩展其文本生成能力和场景多样性,恐难逃“垂直工具”的局限。

 

但菲列夫的信念或许点中了要害:“当你投资初创企业时,你根本上是在押注人”。在生成式AI从“炫技”走向“实用”的拐点,像CraftStory这样由领域专家领衔、聚焦真实痛点的团队,或许正是撬动百亿美元企业视频市场的那根杠杆。

 

正如叶鲁希莫夫所言:“人工智能生成的视频很快将成为公司传达故事的主要方式。” 而谁先掌握“长时长、高一致、低成本”这把钥匙,谁就将赢得这场“大卫与歌利亚”之战的真正入场券。