当前位置: 首页 » 资讯 » 科技头条 » 正文

字节跳动:音视频全双工大模型SeedRealtime发布

IP属地 中国·北京 编辑:顾雨柔 时间:2026-08-05 16:10:37

8月5日,字节跳动正式推出原生音视频全双工大模型SeedRealtime,并宣布该模型已在豆包App全量上线。作为走向全模态交互的关键一步,SeedRealtime用统一架构原生融合音频、视频与文本,能在连续的多模态信息流上实时交互,带来“边看、边听、边说”的全新体验。用户将豆包更新至最新版本后,通过“打电话”功能进入视频通话界面即可体验。

字节跳动

CNMO科技注意到,音视频实时交互此前长期卡在两种形态之间:级联系统依赖ASR、VLM、TTS等多个模块串联,延迟层层叠加,信息逐级损耗;端到端模型虽更流畅,但不少方案仍依赖外置VAD判断轮次,本质上仍接近一问一答的半双工交互。SeedRealtime的核心突破,在于将声音、画面、时序与表达统一到同一个端到端模型中——它不是先听完、再看完、最后作答,而是在连续音视频流上让感知、理解、决策与表达同步进行。具体而言,SeedRealtime实现了三项核心能力:

音视频联合理解:原生支持声音、画面与时序信息的深度融合。模型既能结合场景消解同音词歧义,也能准确理解视觉中的时序指代,让所见、所闻与所说融为一体。用户说“这个怎么弄”时,模型需要结合当前画面、手势、视线与历史动作,判断“这个”具体指向什么。

主动的交互能力:具备持续的环境感知与主动表达能力。模型能在察觉画面状态变化时(如关键目标出现)主动提醒,并能调用工具融入表达,让交互从被动响应升级为主动协作。

流畅的交互节奏:能够实时感知用户的对话状态与交流节奏,在适当时机自然接话、停顿与回应;同时具备较强的抗干扰能力,能分辨旁人闲聊与背景噪声,不因干扰误触发,保持沟通的流畅连贯。

在官方展示的多个应用案例中,SeedRealtime展现出强大的场景适应能力:

在多人聚会场景中,模型能够识别不同人物身份并持续对应发言者;帮助外国游客实时理解中文菜单和服务员介绍;在博物馆中持续观察镜头画面,识别指定文物后主动提醒;辅助用户操作咖啡机并根据画面变化实时纠错;阅读论文时持续监测翻页过程,在指定章节出现后自动提示。

在复杂环境下,SeedRealtime还能根据多模态信息判断何时回应、何时保持沉默。官方演示显示,在机场等嘈杂场景中,模型能够区分用户与旁人对话,避免因背景噪声或无关聊天误触发回应;在儿童学习场景中,也能够持续跟随用户互动,不受背景电话等声音干扰。

端到端人工评测结果显示,相比传统级联系统,SeedRealtime将音视频对话中的节奏问题减少约50%。模型对说话时机的把握更加自然,“话未说完被抢断、话音已落却回应迟缓、或是被背景杂音与闲聊误触发”等卡壳现象显著减少;同时,单次对话能够完整、顺畅交流的概率也有明显提升。

字节表示,未来将继续优化模型的端到端时延、主动感知与决策能力、多人复杂场景理解能力以及工具调用能力,推动AI从传统问答交互进一步发展到能够在真实场景中持续理解环境并协助完成实际任务。SeedRealtime已在豆包App全量上线,在业界率先实现了音视频全双工技术的规模化落地。

免责声明:本网信息来自于互联网,目的在于传递更多信息,并不代表本网赞同其观点。其内容真实性、完整性不作任何保证或承诺。如若本网有任何内容侵犯您的权益,请及时联系我们,本站将会在24小时内处理完毕。