12月2日,可灵AI宣布自研O1视频大模型正式向公众开放。公司称,新模型把文本、图片、视频三种指令合并到同一输入框,可一次完成文生视频、图生视频、局部编辑和镜头延展,无需切换界面。
技术方面,O1采用多模态视觉语言(MVL)架构,并加入Chain-of-Thought推理链路,官方称其是“全球首个统一多模态视频大模型”。据产品负责人介绍,模型通过多视角主体构建技术锁定人物与物体特征,减少镜头切换时的“特征漂移”,以保持画面连贯。


目前,用户可在可灵App及官网体验该功能,支持3–10秒时长自定义,主要面向短视频创作者、广告团队和个人。公司计划后续开放API,供第三方接入。行业观点认为,O1或降低AI视频制作门槛,但其生成质量与成本控制仍需市场验证。