多模态与实时交互:语音 Agent 与 Computer Use 的架构分析前几章构建的 Agent 与世界的交互是轮流的:用户说完一句,Agent 想一段、调用几个工具,再回一句;在它思考的这段时间里,世界被默认为静止的。这个前提如此自然,以至于很少被当成一个假设写出来。然而真实环境不会等模型作出反应:邮件在思考时到达,用户在说话途中插话,页面在两次截图之间已经变了样。本文围绕模态和触发时机两个维度,对 Agent 交互架构的扩展进行技术分析,涵盖异步事件驱动、语音交互范式、Computer Use 以及机器人操作。