字节跳动发布SeedRealtime:原生音视频全双工大模型,开启“边看、边听、边说”全模态交互时代

8.5 博物馆主动提醒用户交代看到错金银铜虎噬鹿屏座就提醒我,模型便在镜头不断移动的过程中留意画面,扫过那件展品时主动出声提醒,随后结合画面细节讲解相关文物

8月5日,字节跳动Seed团队正式推出原生音视频全双工大模型SeedRealtime,并宣布该模型已在豆包App全量上线,在业界率先实现了音视频全双工技术的规模化落地。

2026-08-05_135916_719

技术突破:从“一问一答”到“全双工同步”

音视频实时交互此前长期卡在两种形态之间。级联系统依赖ASR、视觉模型、TTS等多个模块串联,延迟层层叠加,信息逐级损耗;端到端模型虽更流畅,但不少方案仍依赖外置VAD判断轮次,本质上仍接近一问一答的半双工交互。

SeedRealtime的核心突破,在于将声音、画面、时序与表达统一到同一个端到端模型中。它不是先听完、再看完、最后作答,而是在连续音视频流上让感知、理解、决策与表达同步进行,使“听到的”和“看到的”能够共同参与每一次实时判断。

三大核心能力:理解、主动、节奏

模型实现了三项关键突破:

音视频联合理解:原生支持声音、画面与时序信息的深度融合。模型既能结合场景消解同音词歧义,也能准确理解视觉中的时序指代。用户说“这个怎么弄”时,模型需要结合当前画面、手势、视线与历史动作,判断“这个”具体指向什么。

主动的交互能力:具备持续的环境感知与主动表达能力。模型能在察觉画面状态变化时(如关键目标出现)主动提醒,并能调用工具融入表达,让交互从被动响应升级为主动协作。

流畅的交互节奏:能够实时感知用户的对话状态与交流节奏,在适当时机自然接话、停顿与回应;同时具备较强的抗干扰能力,能分辨旁人闲聊与背景噪声,不因干扰误触发。

三、真实场景实测:从多人聚会到博物馆导览

在官方展示的多个应用案例中,SeedRealtime展现出强大的场景适应能力:

多人聚会场景:四位好友聚餐,人声嘈杂。模型能根据外形特征把名字和人对上,在之后的交谈中始终把每个人的声音和身份对应起来,还能分辨每句话出自谁,并给出一份兼顾每个人需求的旅行方案。

外国游客点餐:外籍食客面对中文菜单一筹莫展时,模型直接从画面中认出菜品、用英语推荐,还能顺着文化背景解释“为什么‘鱼香肉丝’里没有鱼”。

博物馆主动提醒:用户交代“看到错金银铜虎噬鹿屏座就提醒我”,模型便在镜头不断移动的过程中留意画面,扫过那件展品时主动出声提醒,随后结合画面细节讲解相关文物。

咖啡机操作纠错:当观察到用户把整粒咖啡豆直接倒进萃取手柄时,模型快速指出“豆子不能直接倒进去,得先磨成细粉”;萃取结束后,基于对杯中油脂成色与液量的视觉解析,主动给出调整建议。

学术阅读辅助:研读论文时,用户说“帮我盯着,翻到训练参数那部分提醒我”,模型在快速翻页的过程中持续观看画面,准确认出“3.4 Implementation”段落并主动叫停。

在复杂环境下,模型也能保持稳健。大兴机场人流密集、环境嘈杂,同伴闲聊时随口提到“老李的航班”,模型并未被这句无关对话触发回复;当用户正式问起,即便航班信息已从画面移出,它仍能结合此前看到的大屏信息,回答实时到达时间。妈妈让模型陪女儿学习动物英文,背景里爸爸正在接电话,模型却没有被这段无关对话带偏,始终跟着女孩手指的方向实时纠音。

性能评测与商用落地

端到端人工评测结果显示,相比级联模型,SeedRealtime的音视频对话节奏问题减少了一半——模型对说话时机的把握更加自然,“话未说完被抢断、话音已落却回应迟缓、或是被背景杂音与闲聊误触发”等卡壳现象显著减少;同时,单次对话能够完整、顺畅交流的概率也有明显提升。

目前,SeedRealtime已在豆包App全量上线,用户更新至最新版本后,在对话框内选择“打电话”,进入视频通话界面即可体验。豆包App此前已在鸿蒙版更新中支持视频通话、屏幕共享、拍照答疑等核心功能,此次SeedRealtime的落地,将这一体验提升至全模态实时交互的新高度。

SeedRealtime的意义在于,它让AI第一次能够像真人一样“边看、边听、边说”——在连续变化的真实场景中同步感知、理解与回应。从多人嘈杂环境中的精准识人,到博物馆中的主动提醒,再到机场中的抗干扰判断,这些能力正在将AI从“被动回答工具”推向“主动协作伙伴”。字节跳动选择将这一前沿技术直接在豆包App全量上线,而非停留在实验室Demo,显示出AI大模型竞争已从“模型参数竞赛”进入“真实场景体验”的决胜阶段。未来,随着模型在端到端时延、多人复杂场景理解以及工具调用能力上的持续优化,AI有望真正成为能够“在真实世界中协助完成实际任务”的智能体。

项目主页地址:
https://seed.bytedance.com/seedrealtime