字节跳动发布SeedRealtime音视频全双工大模型,可实现边看边听边说实时交互利好

2026-08-05 12:25:26
来源:凤凰网
分享
AIME

问财摘要

1、字节跳动发布原生音视频全双工大模型SeedRealtime,并宣布该模型已在豆包App全量上线。用户将豆包更新至最新版本后,可通过“打电话”功能进入视频通话界面,体验实时音视频AI交互。 2、SeedRealtime采用统一端到端架构,原生融合音频、视频和文本,支持模型在连续多模态信息流中同步完成感知、理解、决策与表达,实现“边看、边听、边说”的实时交互。与传统依赖ASR、视觉模型、TTS等多个模块串联的级联系统相比,该模型减少了多模块带来的延迟和信息损耗,也不再依赖外部VAD进行轮次判断。 3、字节表示,SeedRealtime实现了音视频联合理解、主动交互能力以及更自然的对话节奏。模型能够结合画面、声音和时序信息理解用户意图,例如利用视觉信息消除同音词歧义、识别手势和指代对象,并持续跟踪画面变化,在目标出现时主动提醒用户。 4、在复杂环境下,SeedRealtime还能根据多模态信息判断何时回应、何时保持沉默。官方演示显示,在机场等嘈杂场景中,模型能够区分用户与旁人对话,避免因背景噪声或无关聊天误触发回应;在儿童学习场景中,也能够持续跟随用户互动,不受背景电话等声音干扰。 5、字节披露的端到端人工评测结果显示,相比传统级联系统,SeedRealtime将音视频对话中的节奏问题减少约50%,包括抢话、回应延迟以及背景噪声误触发等情况均明显下降,同时单次对话能够完整、流畅进行的概率也有所提升。 6、字节表示,未来将继续优化模型的端到端时延、主动感知与决策能力、多人复杂场景理解能力以及工具调用能力,推动AI从传统问答交互进一步发展到能够在真实场景中持续理解环境并协助完成实际任务。
免责声明 内容由AI生成

凤凰网科技讯(作者/于雷)8月5日,字节跳动正式发布原生音视频全双工大模型SeedRealtime,并宣布该模型已在豆包App全量上线。用户将豆包更新至最新版本后,可通过“打电话”功能进入视频通话界面,体验实时音视频AI交互。

SeedRealtime采用统一端到端架构,原生融合音频、视频和文本,支持模型在连续多模态信息流中同步完成感知、理解、决策与表达,实现“边看、边听、边说”的实时交互。与传统依赖ASR、视觉模型、TTS等多个模块串联的级联系统相比,该模型减少了多模块带来的延迟和信息损耗,也不再依赖外部VAD进行轮次判断。

字节表示,SeedRealtime实现了三项核心能力,包括音视频联合理解、主动交互能力以及更自然的对话节奏。模型能够结合画面、声音和时序信息理解用户意图,例如利用视觉信息消除同音词歧义、识别手势和指代对象,并持续跟踪画面变化,在目标出现时主动提醒用户。

在官方展示的多个应用案例中,模型能够在多人聚会中识别不同人物身份并持续对应发言者;帮助外国游客实时理解中文菜单和服务员介绍;在博物馆持续观察镜头画面,识别指定文物后主动提醒;辅助用户操作咖啡机并根据画面变化实时纠错;阅读论文时持续监测翻页过程,在指定章节出现后自动提示。

在复杂环境下,SeedRealtime还能根据多模态信息判断何时回应、何时保持沉默。官方演示显示,在机场等嘈杂场景中,模型能够区分用户与旁人对话,避免因背景噪声或无关聊天误触发回应;在儿童学习场景中,也能够持续跟随用户互动,不受背景电话等声音干扰。

字节披露的端到端人工评测结果显示,相比传统级联系统,SeedRealtime将音视频对话中的节奏问题减少约50%,包括抢话、回应延迟以及背景噪声误触发等情况均明显下降,同时单次对话能够完整、流畅进行的概率也有所提升。

字节表示,未来将继续优化模型的端到端时延、主动感知与决策能力、多人复杂场景理解能力以及工具调用能力,推动AI从传统问答交互进一步发展到能够在真实场景中持续理解环境并协助完成实际任务。

免责声明:风险提示:本文内容仅供参考,不代表同花顺观点。同花顺各类信息服务基于人工智能算法,如有出入请以证监会指定上市公司信息披露平台为准。如有投资者据此操作,风险自担,同花顺对此不承担任何责任。
homeBack返回首页
不良信息举报与个人信息保护咨询专线:10100571违法和不良信息涉企侵权举报涉算法推荐举报专区涉青少年不良信息举报专区

浙江同花顺互联信息技术有限公司版权所有

网站备案号:浙ICP备18032105号
证券投资咨询服务提供:浙江同花顺云软件有限公司 (中国证监会核发证书编号:ZX0050)
AIME