在近日举行的2025世界人工智能大会(WAIC)上,生数科技正式推出Vidu Q1"参考生视频"功能。这项创新技术通过算法突破,为视频制作行业带来全新变革。

传统视频制作中繁琐的分镜环节将被大幅简化。据介绍,用户现在只需上传人物、道具、场景等参考图片,并输入文字描述,系统就能直接生成完整的视频素材。这种"参考图+文字提示"的制作方式,将原本多环节的流程大大简化。
以历史人物对话场景为例,用户输入"诸葛亮与丘吉尔、拿破仑在会议室讨论"的提示词,并上传相应的人物和场景参考图,系统即可自动生成三人对话的完整视频内容。
该技术的突破性在于解决了视频生成领域的主体一致性难题。目前系统可支持最多七个主体同时输入并保持特征一致,这一性能已经能够满足大多数商业创作需求。
生数科技CEO骆怡航表示,这项技术将广泛应用于广告制作、影视创作、动漫设计、文旅宣传和教育培训等多个领域,推动视频制作从传统拍摄向AI创作的转型。
在技术层面,生数科技采用U-ViT架构,结合了扩散模型与Transformer技术,并通过算法优化提升了系统性能。公司表示,目前主要聚焦于产业应用落地,优先考虑实际内容产出效果。
值得注意的是,生数科技还与清华大学合作开发了具身智能模型Vidar。该模型通过"视频大模型+具身智能"的技术路径,实现了低成本、高效率的机器人动作学习。研究人员发现,视频模型与具身智能在时空信息处理上具有共通性,这使得基于视频数据的机器人训练成为可能。
骆怡航透露,公司当前的首要任务仍是持续提升视频生成能力,同时将具身智能作为重要的探索方向,为未来开辟新的商业应用场景。
官网:
https://www.vidu.cn/
体验:
https://www.vidu.cn/login?redirect=%2Fcreate%2Fcharacter2video