多模态与实时交互:语音 Agent 与 Computer Use 的架构分析

多模态与实时交互:语音 Agent 与 Computer Use 的架构分析

前几章构建的 Agent 与世界的交互是轮流的:用户说完一句,Agent 想一段、调用几个工具,再回一句;在它思考的这段时间里,世界被默认为静止的。这个前提如此自然,以至于很少被当成一个假设写出来。然而真实环境不会等模型作出反应:邮件在思考时到达,用户在说话途中插话,页面在两次截图之间已经变了样。本文围绕模态和触发时机两个维度,对 Agent 交互架构的扩展进行技术分析,涵盖异步事件驱动、语音交互范式、Computer Use 以及机器人操作。

两个扩展维度

把观察空间和动作空间摊开,会发现它们各有两个可以扩展的方向:

  • 模态决定观察和动作的形式:Agent 是只读文本,还是也能听见声音、看见屏幕、感知力矩;是只能输出 token,还是也能发声、点击、驱动关节。
  • 触发时机决定观察和动作的节奏:观察是 Agent 主动去取,还是世界主动推来;动作是必须在一个回合内做完,还是可以跨越回合、中途被打断、被更紧急的事抢占。
尺度 场景 观察侧的变化 动作侧的变化
秒-天 异步与事件驱动 会被外部事件主动唤醒的 Agent 动作跨回合:先发起,后续靠事件收尾
10 毫秒-1 秒 语音 边说边听,不等一句说完 边想边说,可被打断
亚秒-秒 Computer Use 屏幕在两帧之间持续变化 动作后必须重新确认现实是否仍符合计划
毫秒 机器人 传感器连续回流 动作分块:一次规划一小段,可被抢占

异步与事件驱动:当世界主动找上门

核心矛盾:训练同步,部署异步

LLM 的训练范式假设同步------发出工具调用后,下一条消息必须是工具结果。而真实部署要求异步------用户随时可能打断,多个任务可能并发推进,外部事件可能在工具尚未返回时就抵达。这一"训练同步/部署异步"的矛盾贯穿了异步 Agent 架构的所有工程取舍。

事件驱动的异步 Agent 架构不再主动反复检查"有没有新消息"(轮询效率低),而是在新消息到达时自动触发处理逻辑。所有的输入、输出、思考过程和外部交互都被统一建模为事件流。

基于紧急度的三种处理策略

一个 Agent 实例可能同时面对多个事件:用户的新消息、工具返回的结果、定时器到期、另一个 Agent 的协作请求。三种处理策略的区别在于对待安全点的方式:

取消式处理用于紧急事件,主动中断当前步骤,把这一刻变成可以消费新事件的边界。系统停止当前操作,清空待处理队列,将所有事件一次性追加到轨迹末尾,立即重新调用 LLM。这对应于用户在 Agent 执行可能错误的操作时输入"停!我说错了"的场景。

队列式处理用于常规事件,不打断当前操作,等待当前操作完成后将所有事件一次性追加。例如 Agent 调用搜索工具后,用户补充"只看最近一个月的结果",搜索结果返回时两个事件一起呈现给 LLM,避免不必要的往返。

并行处理用于独立的轻量级查询,如"今天天气怎么样"。既不打断主任务,也不让用户等太久,在并行推理会话中独立执行。

工程权宜:模拟同步的异步实现

核心思想是在没有打断发生的常态下,让 LLM 看到标准的同步轨迹,只在打断时才插入占位符来修复格式。有五条关键规则:LLM 输出后立即记录 assistant message;工具调用完成时才记录 tool result;工具执行中的打断需要占位符;LLM 思考中的打断直接丢弃当前思考;非打断事件进入队列等待批处理。

这套方案的核心优势是常态下 LLM 看到的是完美的同步轨迹,最大程度保证了思考质量。但仍存在加剧幻觉的风险:尽管占位符明确说明工具"尚未完成",系统仍可能在后续思考中"编造"一个工具结果,基于虚构的结果做出不恰当的决策。

语音:从级联到全双工的范式演进

语音的价值不只是把文字换成声音。正常说话的速度约为打字的四倍,而且不占用双手与视线,因此它天然适合把 Agent 放进持续工作、随时可能被打断的输入输出回路。

三种交互范式的主线是:如何摆脱"轮流说话"和 VAD(语音活动检测)对发言权的猜测。

范式 核心结构 主要优势 主要限制
级联 VAD -> ASR -> LLM -> TTS 模块清晰、易替换、易调试 延迟累积,副语言信息在接口处丢失
端到端 Omni 原生音频输入输出,按轮次交互 延迟较低,能保留语气、情绪和环境声 仍依赖轮次,训练和调试成本较高
全双工 原生音频输入输出,持续听、说和决策 支持重叠说话、自然打断和连续流 模型训练、控制和评估都更复杂

级联流水线及其优化

绝大多数商业语音助手基于串行流水线:VAD 判断用户何时说完,ASR 把音频转成文字,LLM 理解并生成回复,TTS 再把文字念出来。模块化让每个组件可以独立优化,但每一级都可能增加等待时间。

级联方案有三个问题:延迟累积(必须等待一段静音才能确认说完)、信息丢失(有声/无声二值信号无法表达犹豫、情绪和环境声)、上下文被切断(专有名词可能被分片识别而出错)。流式感知是一种保留模块化分工前提下的优化方案:ASR 边听边转,LLM 推测执行,TTS 增量合成,让各阶段尽早产出增量结果。

全双工交互模型

Omni 仍然把对话分成"用户说"和"模型说"两个时段,但同声传译等任务要求两者重叠进行。全双工模型不再预设轮次,而是持续听、持续说,并不断决定继续、停顿、打断或调用工具。Thinking Machines Lab 将这类路线称为交互模型:交互性不再依靠 VAD 等外部 harness 拼装实现,而是内建在模型中。OpenAI 的 GPT-Live 则把全双工路线带到生产规模。

快慢思考分离与端到端统一的取舍

"交互表现"和"智能上限"是两个维度:前台模型要在用户仍然在线时回应,后台模型可以花更多时间思考。三种方案是设计取舍:快思考回应慢思考回答、快思考交互慢思考提醒、端到端思考与表达统一。

快慢分离有一个重要的工程优势:它能直接承接慢模型的迭代红利。前台快模型只负责低延迟地倾听、应答和维持对话,后台慢模型负责推理、规划和工具调用;更强的思考模型发布后,只需替换后台模型,不必重新训练整套实时语音系统。统一路线则把推理与交互绑定在同一个训练周期中,每次升级都要重新兼顾智能水平、响应延迟和表达自然度。

Computer Use:GUI 自动化 Agent

语音把时机轴推到了毫秒级,但它的观察仍是一维的声音流。Computer Use 把同一个问题搬上二维的屏幕:观察变成持续变化的像素,动作变成坐标上的点击与输入。

感知-思考-行动循环

Computer Use 的核心是一个感知-思考-行动循环:Agent 截取当前屏幕画面,多模态模型接收截图和任务指令输出一个具体动作,执行层在真实环境中执行该动作,等待界面响应后再次截图进入下一轮循环。

这里要区分"看懂界面"和"完成任务"。前者更接近多模态理解能力,可以用一次截图问答来测量;后者则要求模型把理解和生成动作放进闭环,处理页面加载、状态变化、误操作和不可逆后果。Computer Use 的难点不只是让模型在截图上答对,而是让它在每一步之后重新确认现实是否仍符合计划。

动作空间设计

Anthropic 的参考实现把完整交互能力分成三类工具:GUI 操作工具(鼠标移动/点击/拖拽、键盘输入、截图等)、命令执行工具(持久 bash 终端会话)、文件编辑工具(基于字符串匹配的安全编辑)。这是一个清晰的动作空间设计,但不是必须遵守的私有协议:只要 Harness 能把同样的截图、动作约束和执行结果转换成目标模型支持的消息与结构化输出,不同模型都可以驱动同一个循环。

视觉定位的三条路线

在循环的每一轮中,模型需要在截图中准确定位目标元素。当前主要有两条思路:

把定位变成选择题:先把界面元素标注好编号,模型只需从中选一个。有两种实现方式------纯视觉标注(Set-of-Mark,用分割模型在像素上切出候选区域)和结构化元素索引(DOM/Accessibility Tree,直接读取界面自带的结构)。后者的优势是把开放式的"在截图中找到按钮并预测坐标"转化为封闭式的"从已标注好的元素中选一个",就像考试中选择题比填空题更容易答对。

纯坐标预测:不做任何标注,直接让模型输出坐标。以 SeeClick 和 Claude 的 computer use 为代表,在海量 GUI 截图和元素位置的配对数据上训练视觉模型,让它学会将自然语言描述直接映射到截图中的精确坐标。模型对坐标的理解高度依赖训练时使用的分辨率,因此需要在工具层实现双向坐标缩放机制。

三条路线的选择逻辑:结构化信息可得时优先用 DOM/Accessibility Tree 索引,定位最精确稳定;不可得时(原生桌面软件、Canvas/WebGL 渲染的界面、游戏)可以用视觉标注或坐标预测。

Computer Use 的世界模型

传统 Computer Use 假设屏幕是静止的------截一张图、想一步、点一下,再截下一张图。可现实里的屏幕会放视频、会弹出转瞬即逝的通知、会播放会议里的人声。观察接口(AOI)通过屏幕关键帧截图、音量门控的语音转写和文字描述画面等技术,把连续的环境观察转换成模型便于处理的离散事件。

更进一步,世界模型让 Agent 能够在行动前预测桌面接下来可能变成什么,从而实现类似于人类的推测执行机制:如果实际变化与预期一致,就沿着原定计划继续执行;只有发现页面状态偏离预期,才停下来重新观察和规划。2026 年 Induction Labs 公布的 Photon-1 展示了这条路线的一种实现,把每帧压缩为离散的潜在 token,自回归预测动作之后的下一状态表示。

移动端的生态壁垒

Computer Use 在移动端面临的主要挑战往往不是技术差异,而是生态壁垒。传统互联网应用的核心变现逻辑是流量与注意力:用户刷信息流时看到广告,浏览页面时产生冲动消费。当 Agent 代替用户操作时,这条变现链路被彻底绕过:AI 不会关注广告,也不会冲动消费,直奔目标完成任务就走。这意味着 Computer Use 面对的不仅是 CAPTCHA 等技术对抗,更是一个结构性的利益冲突。

机器人操作:从仿真到真机

机器人操作比"看图回答问题"难得多。模型不但要看懂画面,还要在真实世界里连续做出动作,而且每个动作都会改变下一刻的情况。

机器人系统通常把不同时间尺度的工作分开:任务目标(分钟级)、长程规划(秒到分钟)、基本技能(约 1-3 秒)、VLA/技能策略(约 1-10 Hz 推理)、底层控制与安全层(约 50-1000 Hz)。这种分工的关键是把"任务顺序"和"眼前动作"分开,否则高层模型的推理延迟会拖慢底层控制。

VLA(Vision-Language-Action)模型接收当前画面和技能指令,输出机器人接下来要执行的动作。但 VLA 有几个局限:训练数据有限(机器人演示远少于互联网文本和图像数据)、只学会模仿不一定懂后果、机器人各不相同、观察可能过时。因此需要世界模型帮助判断"做了之后可能发生什么"。

从仿真环境到真实机器人,并不是再换一种控制器,而是要处理两个环境之间的差异:训练时使用遥操作数据、视频数据或仿真交互数据;部署时同一个物体出现在不同的背景、光照、相机位置和遮挡关系中,机械臂还会遇到不同的摩擦、传感器噪声和执行器延迟。

小结

顺着模态和执行时机两根轴看,异步与事件驱动把观察从"Agent 主动去取"扩展为"世界主动推来",模态没变,变的只有时机。语音把尺度压到毫秒,三种范式的演进主线就是从"轮流说话"逐步走向持续听说。Computer Use 把同一个闭环搬到屏幕上,瓶颈已从"能否完成任务"扩展到操作效率、连续视觉理解和动作后的状态确认。机器人则把它推到物理世界,动作分块在平滑性与反应速度之间取舍,而最终是否完成仍必须由新的观察来判定。

四节共享同一条控制骨架:持续感知、判断当前状态与时机、选择回复或动作、让输出进入环境、观察反馈、继续或修正或重试或停止或重新规划。也共享同一组原语------唤醒、安全点、取消、抢占、快慢分离。这些原语在不同时间尺度上的实现差异,主要由环境变化的速度、动作的可逆性和观察的获取成本决定。

本文内容整理自开源技术书《深入理解 AI Agent》(bojieli/ai-agent-book),采用 Apache 2.0 许可证

相关推荐
精益数智工坊14 分钟前
指标管理系统价值怎么释放?指标管理系统运营怎么做?
大数据·人工智能·数据挖掘·数据可视化
Mr数据杨16 分钟前
NLP Challenge Squad BA 多标签文本分类实战复盘
人工智能·数据分析·kaggle竞赛
云器科技18 分钟前
云器科技担任 CCSA TC601 WG15 副组长单位,参与推进 AI 时代语义基础设施标准化
大数据·人工智能
七夜zippoe20 分钟前
我用 Qwen3.8-Max 搭了一个 AI 作业辅导助手,拍照讲题 + 错题本诊断一次搞定
人工智能·ai·大模型·qwen3.8-max·build with qwen
bgy666621 分钟前
Ceph 分布式存储完整实战指南:架构、部署与全场景运维
分布式·ceph·架构
腾视科技-AI21 分钟前
腾视科技AI大模型应用:提效、破局与落地,重塑智能新生态
大数据·人工智能·科技·大模型·ai大模型·腾视科技·ai算力盒
方方洛24 分钟前
vllm教程-02-核心原理
人工智能·算法·vllm
iNeuOS工业互联网27 分钟前
多模态知识库,打通文本、图像与视频资源的协同实践与应用
人工智能·python·音视频
Geek-Chow44 分钟前
MCP 模型上下文协议:四、概念地图 · 八个概念与五个组件
人工智能·大语言模型·mcp