
当前视频合成研究的主要目标之一是从单幅图像生成完整的 AI 驱动视频表演。本周,字节跳动智能创作的一篇新论文概述了迄今为止最全面的此类系统,该系统能够制作将富有表现力的面部细节与精确的大规模动作相结合的全身和半身动画,同时还能实现更好的身份一致性——即使是领先的商业系统也常常无法做到这一点。
在下面的例子中,我们看到了一场由演员驱动的表演(左上角),并从一个图像(右上角)衍生而来,它提供了非常灵活和灵巧的渲染,没有任何通常的 问题 围绕创建大幅度的动作或“猜测”遮挡区域(即,由于在唯一源照片中不可见,因此必须推断或发明的衣服部分和面部角度):
音频内容。点击播放。表演有两个来源,包括口型同步,这通常是专用辅助系统的专利。这是来自源站点的简化版本。
虽然我们可以看到随着每个剪辑的进行,身份持久性方面仍存在一些挑战,但这是我见过的第一个系统,它在不使用 LoRA:
音频内容。点击播放. 来自 DreamActor 项目的更多示例。
新系统名为 梦想演员,采用三部分混合控制系统,重点关注面部表情、头部旋转和核心骨骼设计,从而适应人工智能驱动的表演,面部和身体方面都不会受到影响而损害另一方——这在同类系统中是一种罕见的、可以说是未知的功能。
下面我们看到其中一个方面, 头部旋转,实际操作中。每个缩略图右角的彩色球表示一种虚拟万向架,它独立于面部运动和表情定义头部方向,这里由演员(左下)驱动。
点击播放。这里可视化的多色球代表虚拟角色头部的旋转轴,而表情则由单独的模块驱动,并由演员的表演决定(见左下方)。
该项目最有趣的功能之一(在论文的测试中甚至没有正确包括在内)是其直接从音频中获取口型同步动作的能力 - 即使没有驱动演员视频,该功能也能很好地运行。
研究人员与这一领域的佼佼者展开了激烈竞争,其中包括备受赞誉的 跑道第一幕 和 现场肖像,并报告DreamActor能够取得更好的量化结果。
由于研究人员可以设定自己的标准,定量结果不一定是经验标准;但随附的定性测试似乎支持作者的结论。
不幸的是,该系统并不打算公开发布,社区从这项工作中可能获得的唯一价值是有可能重现论文中概述的方法(正如对同样闭源的 2022 年的 Google Dreambooth).
论文指出*:
“人体图像动画具有潜在的社会风险,例如被滥用来制作假视频。这项技术可用于制作假人物视频,但现有的检测工具[德曼巴, 休眠] 就能发现这些假货。
“为了降低这些风险,明确的道德规则和负责任的使用指南是必要的。我们将严格限制对我们的核心模型和代码的访问,以防止滥用。”
当然,从商业角度来看,这种道德考量是方便的,因为它为仅通过 API 访问模型提供了理由,然后可以将其货币化。字节跳动在 2025 年已经做过一次这样的事情,通过 备受赞誉的 OmniHuman 可在 Dreamina 网站上付费购买。因此,由于 DreamActor 可能是一款更强大的产品,这似乎是可能的结果。尚待观察的是,其原理(就本文所解释的而言)能为开源社区提供多大程度的帮助。
- 新文 标题为 DreamActor-M1:具有混合引导的整体、富有表现力和鲁棒性的人体图像动画,来自六位字节跳动研究人员。
付款方式
本文提出的 DreamActor 系统旨在利用 扩散变压器 (DiT)框架适用于 潜在空间 (显然是稳定扩散的某种形式,尽管本文只引用了 2022 年里程碑发布出版物).
作者没有依赖外部模块来处理参考条件,而是直接在 DiT 主干内部合并外观和运动特征,从而通过注意力实现跨空间和时间的交互:
新系统的架构:DreamActor 将姿势、面部动作和外观编码为单独的潜伏信号,并将它们与 3D VAE 生成的带噪视频潜伏信号相结合。这些信号在 Diffusion Transformer 中使用自注意力和交叉注意力进行融合,并在各个分支之间共享权重。该模型通过将去噪输出与干净的视频潜伏信号进行比较来进行监督。 来源:https://arxiv.org/pdf/2504.01724
为此,该模型使用预先训练的 3D 变分自动编码器 对输入视频和参考图像进行编码。这些潜在特征是 已修补,连接起来,并输入到 DiT 中,由 DiT 联合处理它们。
这种架构不同于连接辅助网络进行参考注入的常见做法,这是有影响力的 为任何人制作动画 和 动画任何人 2 项目。
相反,DreamActor 将融合构建到主模型本身中,简化设计,同时增强外观和运动线索之间的信息流。然后使用 流匹配 而不是标准的扩散目标(流匹配通过直接预测数据和噪声之间的速度场来训练扩散模型,跳过 分数估计).
混合运动引导
为神经渲染提供信息的混合运动引导方法结合了来自 3D 身体骨骼和头部球体的姿势标记、由预训练面部编码器提取的隐式面部表示以及从源图像中采样的参考外观标记。
这些元素通过独特的注意力机制集成在扩散变压器中,使系统能够在整个生成过程中协调全局运动、面部表情和视觉识别。
对于第一个,DreamActor 不依赖于面部特征,而是使用隐式面部表征来引导表情生成,显然能够对面部动态进行更精细的控制,同时将身份和头部姿势与表情区分开来。
为了创建这些表示,管道首先检测并裁剪驾驶视频中每帧的面部区域,将其大小调整为 224×224。裁剪后的面部由在 局部性FGC 数据集,然后由 MLP 层。
DreamActor 中使用的 PD-FGC 可以根据参考图像生成说话的头部,并可以独立控制口型同步(来自音频)、头部姿势、眼球运动和表情(来自单独的视频),从而实现对每个动作的精确、独立操作。 来源:https://arxiv.org/pdf/2211.14506
结果是一系列面部运动标记,这些标记通过 交叉注意力 层。
同一框架还支持 音频驱动 变体,其中训练了一个单独的编码器,将语音输入直接映射到面部动作标记。这使得无需驾驶视频即可生成同步面部动画(包括嘴唇动作)。
音频内容。点击播放。口型同步完全源自音频,没有驱动演员的参考。唯一的角色输入是右上角的静态照片。
其次,为了独立于面部表情控制头部姿势,该系统引入了 3D 头部球体表示(参见本文前面嵌入的视频),将面部动态与整体头部运动分离,提高动画过程中的精确度和灵活性。
头部球体是通过从驾驶视频中提取 3D 面部参数(例如旋转和相机姿势)生成的,使用 脸谱网 追蹤方法。
FaceVerse 项目的架构。 来源:https://www.liuyebin.com/faceverse/faceverse.html
这些参数用于渲染投影到 2D 图像平面上的彩色球体,该球体在空间上与驱动头部对齐。球体的大小与参考头部相匹配,其颜色反映了头部的方向。这种抽象降低了学习 3D 头部运动的复杂性,有助于保留动画中绘制的角色的风格化或夸张的头部形状。
影响头部方向的控制球的可视化。
最后,为了引导全身运动,系统使用具有自适应骨骼长度归一化的 3D 身体骨架。身体和手部参数使用以下方法估计: 4D人类 以及以手为中心的 哈默尔,两者都在 SMPL-X 身體模型。
SMPL-X 在图像中的整个人体上应用参数网格,与估计的姿势和表情对齐,从而可以使用网格作为体积指南进行姿势感知操作。 来源:https://arxiv.org/pdf/1904.05866
从这些输出中,选择关键关节,将其投影到 2D 中,并连接到基于线的骨架图中。与以下方法不同 冠军,渲染全身网格,这种方法避免强加预定义的形状先验,并且通过仅依赖骨骼结构,从而鼓励模型直接从参考图像推断身体形状和外观,减少对固定身体类型的偏见,并提高在一系列姿势和构造中的泛化能力。
在训练过程中,3D 身体骨架与头部球体连接在一起,并通过姿势编码器输出 功能 然后将其与有噪声的视频潜在信号相结合,产生扩散变压器使用的噪声标记。
在推理时,系统通过标准化骨骼长度来解释受试者之间的骨骼差异。 种子编辑 预训练图像编辑模型将参考图像和驾驶图像转换为标准 规范配置. 实时姿势 然后用于提取骨骼比例,用于调整驾驶骨骼以匹配参考对象的解剖结构。
推理流程概述。可以生成伪参考来丰富外观线索,同时从驾驶视频中提取混合控制信号(隐式面部运动和来自头部球体和身体骨骼的显式姿势)。然后将它们输入到 DiT 模型中以产生动画输出,面部运动与身体姿势分离,从而允许使用音频作为驱动因素。
外观指导
为了增强外观保真度,特别是在被遮挡或很少可见的区域,系统使用从输入视频中采样的伪参考来补充主要参考图像。
点击播放。系统预计需要准确且一致地渲染遮挡区域。这是我在此类项目中见过的最接近 CGI 风格的位图纹理方法。
使用 RTMPose 选择这些额外的帧来实现姿势多样性,并使用基于 CLIP 的相似性进行过滤,以确保它们与主体的身份保持一致。
所有参考帧(主参考帧和伪参考帧)均由同一视觉编码器编码,并通过自注意力机制融合,从而使模型能够访问互补的外观线索。此设置可提高细节覆盖率,例如侧面视图或肢体纹理。伪参考帧始终用于训练期间,也可在推理期间使用(可选)。
培训
DreamActor 分三个阶段进行训练,逐步引入复杂性并提高稳定性。
在第一阶段,仅使用 3D 身体骨架和 3D 头部球体作为控制信号,不包括面部表征。这允许从初始化为 MMDiT,以适应人体动画,而不会被细粒度的控制所淹没。
在第二阶段,添加了隐式面部表征,但所有其他参数 冻结。此时仅训练了面部运动编码器和面部关注层,使得模型能够单独学习表达细节。
在最后阶段,所有参数都被解冻,以便在外观、姿势和面部动态方面进行联合优化。
数据与测试
对于测试阶段,模型从预训练的图像到视频 DiT 检查点进行初始化† 并分三个阶段进行训练:前两个阶段每个阶段 20,000 步,第三阶段 30,000 步。
为了提高 概括 在不同时长和分辨率下,视频片段被随机采样,长度在 25 到 121 帧之间。然后将它们调整为 960x640px,同时保持宽高比。
训练在 8 个 (以中国为重点) NVIDIA H20 GPU,每个配备 96GB VRAM,使用 亚当 优化器(可容忍的高) 学习率 5e−6。
在推理过程中,每个视频片段包含 73 帧。为了保持各个片段之间的一致性,一个片段的最终潜在值被重新用作下一个片段的初始潜在值,这将任务情境化为连续的图像到视频生成。
无分类器指导 对于参考图像和运动控制信号,其权重均为 2.5。
作者构建了一个训练数据集(论文中未说明来源),其中包含来自不同领域的 500 小时视频,其中包括舞蹈、体育、电影和公开演讲等实例。该数据集旨在捕捉广泛的人体动作和表情,全身和半身镜头均匀分布。
为了提高面部合成质量, 内森布勒 被纳入数据准备过程。
来自 Nersemble 数据集的示例,用于扩充 DreamActor 的数据。 来源:https://www.youtube.com/watch?v=a-OAWqBzldU
为了评估,研究人员还使用他们的数据集作为基准来评估各种场景的泛化能力。
该模型的性能是使用先前研究的标准指标来衡量的: 弗雷谢起始距离 (金融时报); 结构相似性指数 (SSIM); 学习感知图像块相似性 (LPIPS);及 峰值信噪比 (PSNR)表示帧级质量。 Fréchet 视频距离 (FVD)用于评估时间连贯性和整体视频保真度。
作者对身体动画和肖像动画任务进行了实验,所有实验都采用单个(目标)参考图像。
对于身体动画,DreamActor-M1 与 Animate Everyone;Champ; 模拟运动及 处理.
与竞争框架进行定量比较。
虽然 PDF 提供了静态图像作为视觉比较,但项目网站上的其中一个视频可能更清楚地突出差异:
音频内容。 点击播放。挑战者框架之间的视觉比较。驾驶视频在左上角,作者得出的 DreamActor 产生最佳效果的结论似乎是合理的。
对于肖像动画测试,该模型根据 LivePortrait 进行评估; X-肖像; SkyReels-A1;和第一幕。
肖像动画的定量比较 。
作者指出,他们的方法在定量测试中胜出,并认为其在质量上也更胜一筹。
音频内容。点击播放. 肖像动画对比示例。
可以说,与几个竞争框架相比,上面视频中显示的第三个也是最后一个剪辑的口型同步效果不太令人信服,但总体质量非常高。
结语
字节跳动预见到需要隐含但实际上并不存在于这些重建的唯一目标图像中的纹理,因此解决了基于扩散的视频生成面临的最大挑战之一——一致、持久的纹理。完善这种方法后的下一个合乎逻辑的步骤是以某种方式从最初生成的剪辑中创建参考图集,该图集可以应用于后续的不同代,以在没有 LoRA 的情况下保持外观。
虽然这种方法实际上仍然是一种外部参考,但这与传统 CGI 技术中的纹理映射没有什么不同,而且真实感和可信度的质量远远高于旧方法所能获得的。
话虽如此,DreamActor 最令人印象深刻的还是其组合式三部分引导系统,它以巧妙的方式弥合了传统的以面部为中心和以身体为中心的人体合成之间的鸿沟。
还有待观察的是,这些核心原则是否可以在更容易获得的产品中得到利用;就目前情况而言,DreamActor 似乎注定要成为另一个综合即服务产品,受到使用限制的严重束缚,以及在商业架构上进行广泛实验的不切实际性。