腾讯混元团队近日正式推出Hunyuan-GameCraft,这是一款基于HunyuanVideo底模的高动态交互式游戏视频生成框架。该技术突破性地实现了仅凭一张图像、文字描述和动作指令,即可生成高清、连贯的动态游戏视频,为游戏开发、影视制作和创意设计领域带来了革命性的工具。
Hunyuan-GameCraft的核心创新在于其实时交互式视频生成能力。传统的游戏视频生成通常依赖预渲染或固定脚本,而该技术则允许用户通过键盘和鼠标操作,动态控制生成内容,使AI实时“想象”并渲染对应的游戏画面。

关键技术亮点
1. 统一动作空间建模
统将键盘(WASD)、鼠标移动等离散输入信号映射到共享的连续相机表示空间,使AI能精准理解玩家的操作意图,如速度、转向角度等细微变化。
例如,按下“W”键前进时,AI会实时调整视角和场景变化,而非播放预设动画,从而提供更自然的交互体验。
2. 混合历史条件训练
为避免长时间生成时的画面崩坏,团队提出混合历史记忆策略,AI能选择性保留关键信息(如场景布局、光照),同时响应新操作。
这一技术使生成的视频在长时间序列中仍保持3D空间一致性,即使玩家突然转向或大幅度移动,场景也不会出现逻辑断裂。
3. 模型蒸馏加速推理
通过阶段一致性模型和无分类器引导蒸馏,团队将推理速度提升10-20倍,达到每秒6.6帧的实时渲染水平,大幅降低交互延迟。
Hunyuan-GameCraft的潜力不仅限于游戏领域,其动态生成能力可广泛应用于:
游戏原型设计:开发者输入概念草图,即可快速生成可交互的关卡演示,加速迭代。
影视预可视化:导演可通过动作指令实时调整镜头,生成动态故事板,降低拍摄成本。
虚拟世界构建:结合文本描述(如“赛博朋克城市”),用户可自由探索AI生成的开放环境,为元宇宙应用提供新可能。
腾讯混元团队此次发布的Hunyuan-GameCraft,标志着AI生成内容(AIGC)从静态图像、短视频向实时交互式媒体的跨越。目前,该技术已在部分3A游戏项目中测试,未来或与腾讯的混元游戏视觉生成平台(工业级AIGC工具)整合,进一步优化游戏美术管线。
尽管仍面临长时一致性、硬件依赖等挑战,Hunyuan-GameCraft已展现出AI驱动创意生产的巨大潜力。随着技术迭代,它可能彻底改变游戏、影视乃至虚拟社交的内容创作方式,让“所想即所得”的交互体验成为现实。
项目官网:
https://hunyuan-gamecraft.github.io/
代码:
https://github.com/Tencent-Hunyuan/Hunyuan-GameCraft-1.0
技术报告:
https://arxiv.org/abs/2506.17201
Hugging Face:
https://huggingface.co/tencent/Hunyuan-GameCraft-1.0