豆包视频通话升级,火山引擎多模态传输系统提供技术支撑

走到一个陌生景点,举着手机让豆包带你逛,它看到路牌标识主动提醒方向,看到建筑开口介绍典故;旁边路人聊天、街边叫卖,豆包不会被带偏,依然只跟你对话。豆包视频通话功能升级后,AI 可以在连续变化的真实场景中实现更自然的连续交互,这为用户带来了三个最直观的感受:

能边看边听边说。 用户不用等 AI 说完才能开口,AI 能同时接收和处理音频、视频、文本三路输入。指着航班牌问 "这个怎么走",它看懂你指的是行李转盘;多人聊天时,它结合口型和画面判断是谁在对话,不被旁边闲聊带偏。

AI 会主动开口。 持续感知环境变化,看到关键标识会主动提醒,处理任务时主动调用工具查信息、整理结果。交互模式从 "一问一答" 升级成了 "双向协作",用户不用每次都先开口。

对话节奏自然。 不打断也不冷场,该说时说,该听时听。自然接话、合理停顿,精准分辨旁人闲聊和背景噪声。官方评测显示,对比传统级联方案,对话节奏违和问题减少了约 50%------ 用户几乎不会遇到 "AI 说完话突然停住" 或 "我还没说完 AI 就抢答" 的尴尬。

这背后是一次双线升级:模型层接入原生音视频全双工大模型 SeedRealtime ,在业界率先实现音视频全双工技术的规模化落地。而支撑这一切的底层传输架构,也已悄然完成从实时通信技术 (RTC)到火山引擎多模态传输系统(MMT)的代际跃迁

SeedRealtime 定义了 "AI 能做什么",而火山引擎 MMT 决定了 "用户能不能真正感受到这些能力"。MMT 在三个核心环节完成了提升。

秒接通,秒应答

传统 RTC 架构下,音视频通道与信令通道分离,用户发起视频通话时需要经历多轮协商 ------ 媒体通道建联、模型会话建立、状态同步各自为政,叠加下来往往需要数秒才能真正进入可用状态。用户看到的是 "连接中..." 的转圈等待,体验大打折扣。

MMT 通过统一的多模态会话架构,将媒体传输与模型会话深度整合:

  • 客户端底层基于 QUIC 库,复用连接、多路复用,一次建联即可承载音视频、信令、模型状态等多路数据;

  • 传输层基于 MoQ 协议实现统一会话控制,媒体流与控制信令在同一会话中协同调度,省去了多通道分别建联的开销。

最终,建联耗时从秒级压缩到数百毫秒,用户点开视频通话几乎"秒接通",对话感的连贯性大幅提升。

零丢字,从源头杜绝答非所问

此前,音频传输通道和模型推理通道是异步建联的 ------ 音频可能已经在传了,但模型会话还没建立好;或者模型已经就绪,但首帧音频还没同步到位。用户刚开口说 "帮我看看这道题",模型只收到了 "这道题",回答自然跑偏。

MMT 的核心突破,就是用统一的多模态会话控制从根本上解决了状态异步问题:

  • 音视频流与模型会话状态在同一传输链路中统一调度,不再是"两条各跑各的管道";

  • 网关层引入 MediaKit 同源处理算法,实时判断首帧是否完整、音画是否对齐、模型是否就绪------只有所有模态状态同步后,才会触发模型推理,从源头上杜绝了"丢字"和"答非所问";

  • 延迟抖动超过 1 秒就会导致模型接收信息变形的老问题,在 MMT 的精细会话控制下得到系统性改善。

精准意图理解,智能推理应答

人与人通话,传输层忠实搬运就够了。但 AI 交互不一样:用户指着屏幕上一行小字提问,如果传输层继续传低码率视频,模型可能根本看不清那行字,回答自然跑偏,更合理的方式是触发高清图、抽帧或局部增强。传统 RTC 不具备按需调整传输策略的能力。

MMT 通过 C/S 架构设计,让传输从"哑管道"变成了"智能调度层":

  • 服务侧网关承担关键决策角色。 用户传来一句话,网关可以选择是否直接送往模型;用户打开摄像头,网关判断是否需要抽帧、是否需要高清图、是否要结合模型反馈改变处理策略;

  • 分层会话控制。 哪一路音频优先、哪一帧视频更值得送给模型、哪些内容需要可靠传输、哪些可以为低延迟做取舍,都由 MoQ 信令上的分层逻辑单元精细控制;

  • 多模态同步保障。 语音、画面、时序信息在传输层就完成对齐,模型拿到的是"打包好的、同步的"多模态输入,而不是自己再去拼拼凑凑。

传输系统第一次 "理解" 了模型需要什么,而不是机械地搬运所有数据。MMT 不是被动地等 SeedRealtime 来 "取" 数据,而是主动地根据模型的推理状态,把 "对的数据、以对的形态、在对的时机" 递送到模型面前。

模型决定智能上限,传输决定体验下限

AI 实时交互的竞争,不只发生在模型层。

当行业焦点都在讨论"谁的模型更聪明"时,火山引擎在做一件更长期的事:把传输基础设施从"哑管道"升级为"智能调度层",让大模型的能力近乎无损耗地传递给每一个终端用户。

豆包视频通话接入 SeedRealtime,是这套能力的一次完整展示。

随着同传、外语陪练、博物馆讲解等场景加速落地,"边看边听边说"的实时多模态交互将成为越来越多产品的标配体验。而支撑这一切的底座,是一个经过亿级用户验证、能承载百倍复杂度的传输系统。

模型让 AI 更聪明,火山引擎让 AI 更"真实"。

相关推荐
searchforAI1 小时前
AI自动总结YouTube视频:英文内容一键总结、智能时间戳、视频重点快速看
人工智能·ai·音视频
cxk18082721 小时前
2026 年9月 AI 营销机构选型方法论:基于 GEO 精采信模式的三维评估体系
大数据·人工智能·科技·ai·geo·昆明geo
威视锐科技1 小时前
AI-RAN:下一代无线接入网,5G-A迈向6G的智能底座
人工智能·5g·威视锐
Elastic 中国社区官方博客1 小时前
不再有分配延迟:在无状态 Elasticsearch 中将快照与分片迁移解耦
大数据·运维·人工智能·elasticsearch·搜索引擎·全文检索
俊哥V1 小时前
每日 AI 研究简报 · 2026-09-02
人工智能·ai
人工智能时代 准备好了吗1 小时前
搜索别名治理实用指南:在首次出现时说明主名称与别名关系
人工智能
人工智能时代 准备好了吗1 小时前
同名品牌如何避免被AI认错?
人工智能
段一凡-华北理工大学1 小时前
高炉智能布料技术与炉料分布优化~专栏简介与目录
android·人工智能·高炉智能化·高炉布料·高炉布料分布·高炉布料参数优化·高炉布料矩阵
火山引擎开发者社区1 小时前
GLM-5.3 系列落地 veStack:面向复杂编码与多模态 Agent 的企业部署
人工智能