AI“记住”角色,生成连贯长视频:南洋理工与字节的StoryMem开启叙事新模式

12.29 整个流程始于一个结构化的分镜脚本storyscript,系统首先用文本到视频T2V模型生成故事的开场镜头,并将其关键帧存入记忆库

在AI视频生成技术飞速发展的2025年末,一段由AI生成的、超过一分钟的多镜头故事视频,如果能保证角色形象、场景氛围和叙事节奏的高度连贯,这已不再是遥不可及的幻想。近日由南洋理工大学与字节跳动联合研发的StoryMem系统,正以其独特的“视觉记忆”机制,为这一难题提供了令人瞩目的解决方案。

 

不同于市面上大多数AI视频模型仅能生成几秒钟的孤立片段,StoryMem的目标是创作具有电影质感的完整叙事。其核心创新在于,它将生成过程从一次性输出转变为基于记忆的迭代式镜头合成。受人类记忆机制的启发,StoryMem在生成每一个新镜头时,都能“回溯”此前镜头的关键视觉信息,并以此为条件进行创作。这种显式的记忆机制,有效解决了长视频生成中最棘手的角色一致性与场景连贯性问题。


2025-12-29_142323_654

 

具体而言,StoryMem并非从零开始构建一个全新的庞大模型,而是巧妙地改造了现有的单镜头视频扩散模型(如Wan2.2)。它引入了一个名为“Memory-to-Video (M2V)”的微调模块(LoRA),将单镜头生成器升级为一个多镜头叙事者。整个流程始于一个结构化的分镜脚本(story script),系统首先用文本到视频(T2V)模型生成故事的开场镜头,并将其关键帧存入“记忆库”。随后,在生成后续每一个镜头时,模型都会读取这份记忆,并结合当前镜头的文本描述,生成既能延续前情、又符合新设定的画面。此外,StoryMem还提供了MI2V(记忆+首帧图像)和MM2V(记忆+前五帧动态)等高级模式,以实现更平滑的镜头转场。


2025-12-29_142926_637

 

为了推动该领域的评估标准化,研发团队还同步发布了名为ST-Bench的基准测试集。该数据集包含30个风格迥异的长故事脚本,共计300个详细的视频生成提示,为未来多镜头长视频生成模型的公平比较奠定了基础。

 

目前,StoryMem的代码与模型已在GitHub上全面开源,其技术细节也以论文形式公开于arXiv(编号arXiv:2512.19539)。这一成果不仅代表了AI视频生成技术从“短片段”向“长叙事”的关键跨越,更预示着未来AI将不仅仅是内容的制造者,更是具备上下文理解和记忆能力的“数字导演”。对于影视预览、游戏叙事、广告创意乃至个性化内容创作等领域,StoryMem所展现的潜力无疑是革命性的。


项目地址:
https://github.com/Kevin-thu/StoryMem