字节跳动发布Seedance 2.5:单次生成30秒4K视频,AI从“生成片段”进化到“完成创作”

7.31 字节跳动正式发布新一代视频生成模型Seedance2.5,将单次视频生成时长从15秒翻倍提升至30秒,并支持最多50个多模态参考输入和4K原生画质

7月31日,字节跳动正式发布新一代视频生成模型Seedance 2.5,将单次视频生成时长从15秒翻倍提升至30秒,并支持最多50个多模态参考输入和4K原生画质。该模型已陆续上线即梦AI与豆包专业版,API服务也将于近期接入火山方舟。

2026-07-31_142903_993

核心升级:从“生成片段”到“完成创作”

Seedance 2.5延续了Seedance 2.0统一的多模态音视频联合生成架构,但核心目标已发生质变——官方称,用户的期待正从“生成一个片段”走向“完成一段创作”。

30秒一镜到底:单次生成时长从15秒提升至30秒,是目前主流商用模型中最长的单次时长。更重要的是,模型可在30秒内组织铺垫、推进、转折、收尾等多个逻辑关联的镜头,让AI视频第一次具备完整的叙事能力。在官方示例中,一段歌手一镜到底登台演出的片段,从幕布推进、后台化妆间、登台互动到体育馆全景,呈现了完整的起承转合。

多轮延长与一致性:支持在已有视频基础上继续生成30秒,并保持人物主体、场景、画面风格和声音的一致性。示例中,小男孩抱足球跑出地铁车厢、男主追赶并最终抓住男孩的连续动作一气呵成,毫无跳脱感。

50个多模态参考输入:单次可输入最多30张图片、10段视频、10段音频作为参考素材,模型可综合理解不同素材中的构图、场景、风格、人物、道具等元素,精准用于生成。在多人同框场景中,可同时还原多个人物形象与声音并保持主体稳定。

4K原生画质与同步音频:生成原生4K分辨率视频,并内置信噪同步音频生成,声画匹配无需后期配音。

从“创意工具”到“生产力平台”

视频生成模型的竞争已从“谁的画面更真实”转向“谁更适合做生产力工具”。Seedance 2.5的升级直接回应了这一趋势,面向影视、广告、教育、具身智能和自动驾驶等场景,目标是让视频生成从“能生成”变为“可修改、可迭代、可交付”-。

在工业制造领域,徐工集团已基于Seedance系列模型,将其应用于工业操作培训与工序SOP视频生成,大幅降低传统实拍与3D动画的制作成本。在智能驾驶领域,模型可合成极端天气、罕见路况等场景素材,帮助拓展测试覆盖面。在具身智能领域,穹彻智能借助视频生成扩充训练数据,无需依赖实体机器人逐一采集,即可生成适配不同机型的操作数据。

市场格局与行业影响

当前AI视频赛道已形成“双寡头”格局。据AI普瑞斯统计,按日消耗占比计算,Seedance系列已占据市场超八成份额,可灵约占14%,其余为其它模型。

Seedance 2.5以30秒长片段和50个参考输入,面向影视级生产工作流,定价约0.30美元/秒(720p)至0.68美元/秒(4K),而Seedance 2.0仍可用约0.11美元/秒,适合短视频批量生产场景。

同时,阿里巴巴HappyHorse 1.0以开源和自托管特性占据特定生态位,谷歌Gemini Omni Flash则以对话式编辑独树一帜。但字节跳动凭借火山引擎的云服务体系和剪映、即梦等内容生态,正在将Seedance从单一模型升级为“模型+平台+版权”的完整工业化体系。

视频生成赛道正从“谁更能生成炫酷片段”转向“谁能真正解决生产问题”。30秒连续生成解决了“拼接碎片”的痛点,50个参考输入提供了“可控性”,4K画质和同步音频满足了“交付标准”。当生成式AI开始理解“一镜到底”和“起承转合”,它就不再只是视频创作者的工具,而是正在成为创作流程本身的一部分。

项目主页:https://seed.bytedance.com/zh/seedance2_5