主题: 企业级智能体的入口之争在谷歌那里升级成了一位「有工号的同事」,而具身智能这边,机器人在同一周里同时拿到了便利店的门店岗位、车企的物流合同,以及一批更懂物理的新的世界模型。
编制时间: 2026-10-09
本期看点: 企业代理有了独立身份 / 声明式智能体运行时 / 世界模型接棒 VLA / 零售具身零改造
一、要闻速览(Top Stories)
| 序号 | 事件 | 标签 | 关键词 |
|---|---|---|---|
| 1 | 谷歌云发布通用工作智能体 Gemini agent | AI Coding | 企业同事代理 / 独立邮箱身份 / 多模型路由 / 实时支出上限 |
| 2 | Docker 发布 docker-agent,用 YAML 定义多智能体 | AI Coding | 声明式配置 / MCP 工具 / OCI registry 分发 / 技能从 GitHub 加载 |
| 3 | 三大编码 CLI 同周换代,本地沙箱转正 | AI Coding | 本地沙箱 / Haiku 5.5 默认 / 钩子可阻断 / Git worktree |
| 4 | SuperCLUE 智能体编程中文榜:小米 MiMo V2.6 Pro 登顶 | AI Coding | 64.65 分 / 每题成本 / Claude Code 框架 / 国产模型 |
| 5 | Sierra 与 Meta 公布 Personal Agent Protocol | AI Coding | 代理身份 / OAuth 会话 / 只读与读写 / v0.1 规范 |
| 6 | 正行创新发布零售 Physical AI 方案 | 具身智能 | 便利店 / 世界动作模型 SLM-0.5 / 零改造 / 2027 商业化 |
| 7 | 优必选与一汽-大众达成战略合作 | 具身智能 | 物流场景 / 战略签约 / 柳州万台级工厂 / 既有产线延伸 |
| 8 | NVIDIA 发布 Long-WAM 世界动作模型 | 具身智能 | 19.2 秒视觉记忆 / 自回归预训练 / 107.4 毫秒 / 宇树 G1 |
| 9 | 灵生科技完成亿元级 A 轮 | 具身智能 | 跨本体底座 RUDA / 清华团队 / 工业精密装配 / 卖铲子 |
| 10 | Odyssey 发布 Odyssey-3 基础世界模型 | 具身智能 | 六域通用 / Physics-IQ 66.1 / Flexion / 自恢复行为 |
筛选标准:5-10 条,侧重 AI Coding 与具身智能方向;每条一句话概括事件 + 快速定位标签。
二、AI Coding 与智能体工程

1. 谷歌云把 Gemini 做成「有工号的企业同事」
事件: 10 月 8 日,谷歌云在 Gemini at Work 2026 上发布通用工作智能体 Gemini agent,把问答、知识工作、图像与媒体生成、代码编写与运行收进同一个代理;它有自己的企业身份和独立邮箱地址,可以被指派给一个团队,也能代表组织里的某个角色持续工作。
核心能力 / 产品细节:
- 单个提示框下达目标,代理自行规划、调用技能与工具,在 Gmail、Drive、Docs、Sheets、Slides、Chat、Calendar 里交付成品;
- 按任务动态挑选模型,谷歌自有模型之外也可路由到 Anthropic 的 Claude;成本侧给了智能路由与实时支出上限;
- 可以接入 MCP 服务器与企业自建软件,支持用户自定义技能,并通过子代理协同处理复杂任务;
- 企业侧提供身份与策略管理、授权与权限控制、安全沙箱与网络网关;金融、法律两个行业版已进入预览,政府、医疗、零售在路上。
值得关注的原因:
- 这是把代理从「聊天框里的助手」推到「编制内的同事」的一步,独立身份意味着权限、审计与开销都能按人来管,也意味着出问题时责任归属要重新定义;
- 模型选择被收进平台侧并明确计费,等于把「换模型」这件事从开发者手里拿走,多模型编排正式成为企业合同里的条款;
- 金融与法律先行预览,说明谷歌挑的是合规压力最大的场景来验证治理能力。
2. Docker 把智能体做成一个 YAML 文件
事件: Docker 发布 docker-agent,一个定义在 YAML 里的多智能体构建与运行时,1.149.0 版本在 10 月 7 日登上 Hacker News 首页(247 分、114 条评论),项目已积累约 3,500 星。
产品细节:
- 一个 YAML 块就是一名智能体:模型、描述、指令、工具集;
docker agent run agent.yaml起跑,Docker Desktop 4.63 起已内置; - 单个文件可以描述一个团队,根代理自动把子任务派给专职代理;工具来自内置的 think、todo、memory,以及任意 MCP 服务器;
- 检索可插拔,支持 BM25、向量、混合检索与重排序;模型侧兼容 OpenAI、Anthropic、Gemini、Bedrock、Mistral、xAI 与本地 Docker Model Runner;
- 新版本让技能可以直接从公开 GitHub 仓库加载,评估器默认走 models gateway,并把 OpenAI Decisions 接成原生评分后端。
值得关注的原因:
- 把代理当成「打包问题」来解,正是 Docker 过去解决过一次的题:代理能推到任意 OCI registry,再用
docker agent run org/agent:tag拉起来跑,版本化与分发沿用团队已有的流程; - 技能从公开仓库直接加载,等于把社区正在形成的技能仓库变成可插拔的一层,这与同期 GitHub 上技能类仓库走热是同一件事;
- 评估器接进决策模型接口,说明「怎么给代理打分」正在从人工抽查变成流水线里的一步。
3. 三大编码 CLI 同周换代:本地沙箱转正,廉价小模型成为默认
事件: 10 月 7 日至 8 日,GitHub Copilot CLI 连发 1.0.93 与 1.0.94,Claude Code 连发 2.1.293 到 2.1.295,OpenAI Codex CLI 发出 rust-v0.162.0。
版本要点:
- Copilot CLI:本地沙箱从预览转为正式可用,覆盖 CLI、应用与走 Agent Host 的 VS Code 会话;接入 Claude Haiku 5.5,
/model还能直接切到本机 Ollama 里跑着的模型; - Claude Code:2.1.293 把 Claude Haiku 5.5 设为默认 Haiku 模型(100 万上下文);2.1.294 修正了基于指令的钩子解释方式,让「阻断」规则真正生效;2.1.295 进一步允许钩子在失败时阻断动作,并显示终端状态;
- Codex CLI 0.162.0:可在受信任的本地项目上创建与管理 Git worktree,任务能在命令中心固定并归入共享分组,界面里的 URL 全部可点击;
- 一周内这三家的共同走向很清楚:命令先给你看再批准,执行放进沙箱,默认模型换成更快更便宜的那一档。
值得关注的原因:
- 本地沙箱转正,把「代理能在你机器上做什么」从口头约定变成可执行边界,这与微软本周在 Windows 里推出 MXC 是同一个方向;
- 钩子能在失败时阻断动作,是治理能力从「记录」走向「拦截」的一小步,也正是自动批准模式敢放开的前提;
- 默认模型下沉到廉价档,让「一个主代理加一群子代理」的开销第一次变得可以承受。
4. SuperCLUE 智能体编程中文榜:小米 MiMo V2.6 Pro 登顶
事件: 10 月 9 日,SuperCLUE 发布智能体终端编程中文测评榜单,考察模型驱动智能体框架时的中文需求理解、任务规划、工具调用、文件修改、错误排查与最终交付,统一使用 Claude Code 作为框架。
榜单数据:
- 小米 MiMo V2.6 Pro 以 64.65 分列第一,每题成本 1.52 元;同门 MiMo V2.6 Flash 以 0.67 元每题拿下 53.54 分,是本次成本最低的一档;
- Kimi、GLM、腾讯 Hy4 排在第二到第四位;对比组里 Hy4-Preview(high)55.56 分、每题 11.61 元,DeepSeek-V4.1-Flash(max)50.51 分、每题 1.86 元;
- 时间效率上 DeepSeek-V4.1-Flash 占优,MiMo V2.6 Pro 在分数与耗时之间更均衡。
值得关注的原因:
- 榜单把「每题成本」和「综合分」并列摆出,评测口径从比能力转向比单位成本的产出,这与海外榜单近期在奖金口径上的变化是同一趋势;
- 中文指令理解被单列,说明本土模型在真实开发流程里的位置已经从「可选项」变成「按场景分工」;
- 统一框架的横向对比让分数可复现,但也要提醒一句:换一套框架,排名不一定还是这个顺序。
5. Sierra 与 Meta 提出 Personal Agent Protocol
事件: 10 月 6 日,Sierra 与 Meta 在 Sierra Summit 上公布 Personal Agent Protocol(PAP),一份面向消费者个人代理与企业系统对接的开放标准;Walmart、Shopify、Stripe、Genesys、Rocket、Instinct 作为创始伙伴。
标准要点:
- 会话建立在 OAuth 之上,代理可以先以访客身份查库存和退货政策,需要账户操作时由用户登录,并由用户选择只读还是读写;
- 权限由两方各管一半:用户决定给代理多大权限,企业决定代理能在自家系统上做什么;
- 企业可选三条接入路径:常规网页、基于 MCP 或 OpenAPI 的接口,或者转交给企业自己的代理;
- v0.1 规范计划 10 月底发布,同时有设计工作坊与参考实现;支付、细粒度权限、主动通知留作后续扩展。
值得关注的原因:
- 电商网站目前分不清访客是人还是代理,一部分直接封禁,一部分在不知情中把人的权限给了伪装成人的代理,这套标准想把这段灰色地带换成规则;
- 它与 MCP、谷歌的 A2A、Visa 一侧的支付协议分成不同车道,说明代理相关标准正在按「接工具」「代理互通」「支付」「消费者身份与权限」分头成型;
- 首版不含支付,OpenAI、Anthropic、亚马逊并未列名,标准能不能站住要看 10 月底那份规范到底写了什么。
三、具身智能方向

6. 正行创新发布零售 Physical AI 方案:便利店先上岗
事件: 10 月 8 日,在第 22 届亚太零售商大会(APRCE 2026)上,正行创新(Striding AI)发布面向零售开放场景的 Physical AI 方案,主打 24/7 便利店的人机协作。
产品与参数:
- 本体两款:通用型双足人形 H1(支持 20 多种语言、45 种表情、36 种手势,提供开放 API),以及专为狭窄通道设计的搬运理货轮臂式机器人 C1(作业高度覆盖 100mm 到 1750mm 以上,遇障制动距离小于 10cm,配前后深度视觉与 360 度全景视觉);
- 大脑三件:轻量世界动作模型 SLM-0.5 在 LIBERO 基准取得 98.6% 平均任务成功率,官方称推理速度比主流方案快 24 倍;基于 RLinf 的强化学习后训练体系 STEAM 在指定商品上货任务实现 95% 执行成功率;与清华、无问芯穹联合的智能体基座 Rpent 负责任务拆解、执行规划与机器人调度;
- 管理平台 M1 负责任务分配、状态监控与人工接管;方案支持「零改造」部署,不改门店货架与动线,官方称 99% 的任务可自主完成。
值得关注的原因:
- 它把落地场景从仓储后场推到零售前场,那里通道窄、SKU 密、客流与陈列一直在变,是对感知与动态适配要求更高的一类开放环境;
- 世界动作模型的分数与「快 24 倍」被同时给出来,等于宣称轻量路线也能撑起实时作业,这套组合是否经得起真实门店的验证还要看;
- 商业模式写明直接采购与 RaaS 订阅两条路,并给了 2027 年正式商业化的时间表,切入口足够具体。
7. 优必选与一汽-大众签约,人形机器人从质检走向物流
事件: 10 月 8 日,优必选宣布与一汽-大众达成战略合作,双方将共同推进具身智能机器人在物流领域的场景开发与测试,并共建示范应用场景。
合作要点:
- 这是在既有基础上的延伸:此前优必选 Walker S Lite 已进入一汽-大众青岛的国家级智能制造示范工厂做车辆质检实训,与工厂自动化控制系统对接;
- 优必选给出四大技术集群:具身大脑、仿人小脑、高性能本体与群体智能;具身大脑一侧搭的是「基座模型、世界模型、行动模型」的自研体系;
- 产能侧,柳州工业人形机器人超级智慧工厂已于 9 月 12 日投产,定位适配万台级产能,每 10 分钟可下线 1 台。
值得关注的原因:
- 从质检的单一工位走向物流是一条更长的链路,搬运与转运对续航、节拍和与人混行的安全要求都不一样;
- 车企开放的是真实产线与真实节拍,这类合作的价值不在签约本身,而在测试跑完之后能不能转成持续订单;
- 国内人形机器人的出货口径仍然分裂,按细分品类口径优必选排第一,按总出货量口径则是另一家领先,读数据时要先看清分母。
8. NVIDIA 发布 Long-WAM:更长的视觉记忆要配自回归预训练才管用
事件: NVIDIA 联合 MIT、香港大学、加州大学圣地亚哥分校发布 Long-WAM,一个在实时控制约束下扩展视觉上下文的世界动作模型框架。
核心结论与参数:
- 在 RoboCasa GR-1 上,把观测历史从 0 拉到 19.2 秒,任务成功率从 63.3% 升到 78.7%;同一窗口下,双向预训练的初始化则没有净增益,说明「能拿到历史」和「会用历史」是两件事;
- 预训练阶段 LongLive2.0-Robot 用了约 1 万等效窗口小时的机器人视频与第一视角视频,且不带动作标签;LIBERO-Long 上仅用 2.4 秒历史就把成功率从 94.5% 提到 99.5%;
- 架构上视频与动作专家通过非对称注意力接口耦合,先预测未来再动作,不去解码像素;单个动作块(含未来视频潜变量预测)在 RTX 5090 上耗时 107.4 毫秒;
- 实机侧在宇树 G1 与 YAM 上运行,动态叠杯成功率 95%,论文称 π₀.₅ 与 Fast-WAM 在 20 次试验里一次未成。
值得关注的原因:
- 它把「上下文窗口」从硬件预算问题改成了数据与训练目标问题:不是把历史堆进去就有用,预训练目标对了才有收益;
- 与同期 Odyssey-3 放在一起看,这一周世界模型这条线明显比 VLA 更热,行业内部的提法已经是让世界模型接替 VLA 做主干;
- 结论来自厂商与论文自己的评测,能否在开放环境、新传感器和不同算力下复现,是接下来最值得跟的一步。
9. 灵生科技完成亿元级 A 轮,做跨本体通用底座
事件: 10 月 8 日,具身智能基础设施服务商灵生科技宣布完成亿元级 A 轮融资,由华方资本、道禾长期旗下道禾元启、苏文电能以及某具身智能产业方联合投资。
要点:
- 团队有清华背景:创始人兼 CEO 杨洪兵曾任职腾讯并带领大规模 AI 中台团队,后担任头部人形机器人公司 CTO;联合创始人兼 CTO 蒋玉骅是清华博士;科学顾问为清华大学自动化系长聘正教授高飞飞;
- 主攻自研的机器人统一设备架构 RUDA,目标是让硬件与各类大模型、智能体能力高效对接,把机器人技能沉淀为可复用、可迁移的资产;
- 已在光模块插拔、电池装配等高精度工业场景落地测试,并布局 3C 质检与厂区物料转运;公开说法中光模块插拔任务成功率接近 100%;
- 资金将用于 RUDA 的底层研发,以及 PhiAgent、RoboAgent 两个核心模块的迭代。
值得关注的原因:
- 换一种机械臂就要重新采数、训练与部署,是工业场景长期绕不开的支出,跨本体底座正面回答的是这个问题;
- 资本在这个时点愿意押「卖铲子」的一侧,与同期端侧芯片公司拿到大额融资是同一个判断:通用的底层设施比单机本体更稀缺;
- 工业环境的粉尘与震动会持续干扰感知,场景扩张的不确定性仍在,这是行业里公认需要理性看待的变量。
10. Odyssey 发布 Odyssey-3:一个世界模型同时驱动机器人、人形、车辆与无人机
事件: 10 月 8 日,Odyssey 发布其第三代基础世界模型 Odyssey-3,宣称在机器人与虚拟环境之间共享同一套对世界如何运作的理解。
能力范围:
- 六个方向都有演示:控制多台机械臂,并出现未经专门训练的自恢复行为;与 Flexion 合作驱动实时控制策略;用约 20 小时模拟驾驶数据学到能在印度道路自动驾驶的策略;生成可供 AI 智能体试错的环境;为无人机生成室内避障的导航策略;以及玩《GTA V》并初步把学到的行为迁移到其他游戏;
- Odyssey-3 Pro 在 Physics-IQ Verified 的视频到视频基准上取得 66.1 分,官方称是目前该测试报告的最高分;
- 创始团队来自 DeepMind、特斯拉、Waymo、Meta、苹果与 Wayve,早期做的是自动驾驶;Flexion 已采用该模型。
值得关注的原因:
- 一个模型跨机器形态与虚拟环境复用同一套物理常识,是「先学世界再学任务」这条路线的核心主张,与 Long-WAM 的判断互相印证;
- 演示里机械臂从一次抓取失败中恢复,模型方称这个行为没出现在训练示范里,若能在独立复现中站住,这类涌现行为比分数更有意义;
- 世界模型同时充当训练环境,等于把「造数据」和「学策略」合成一件事,这条路走通会改变具身智能的数据支出结构。
四、产业趋势总结
- 代理从工具变成编制内的角色:独立身份、可指派给团队、有支出上限,权限与责任随之要重新定义。
- 代理开始被当作打包问题:Docker 用 YAML 与 OCI registry 分发代理,编码 CLI 把执行放进本地沙箱,交付与边界都在走基础设施的老路。
- 比价从能力转向单位成本:廉价小模型成为 CLI 默认档,中文榜单把每题成本与综合分并列,评测口径随之变化。
- 世界模型接棒 VLA 的讨论升温:Long-WAM 与 Odyssey-3 同周出现,重心从「描述世界」转向「预测世界会怎么变」。
- 具身智能的落点回到具体岗位:便利店补货、车企物流、工业精密装配,场景越具体越容易验证投资回报。
- 代理标准按车道成型:接工具、代理互通、支付、消费者身份与权限各自有主导方,配套规范密集落地。
从当天筛选的 10 条中提炼 4-6 条跨事件共性趋势。
五、值得持续关注的信号
- 谷歌 Gemini agent 的行业版本落地节奏,以及金融、法律之外政府与医疗什么时候跟进;
- Personal Agent Protocol 10 月底的 v0.1 规范,看它是否写下真正的规则,还是只把 OAuth 与 API 重述一遍;
- 编码 CLI 的本地沙箱 是否会被更严格的默认策略收口,自动批准模式的边界会不会随之收紧;
- SuperCLUE 智能体编程榜 换用别家框架后的排名稳定性,以及成本口径会不会被后续评测继续沿用;
- 正行创新的零售方案 在真实门店的回报率验证,2027 年商业化时间表能否守住;
- 优必选与一汽-大众 的测试进度,以及这类车企合作能否转成持续订单;
- 世界模型路线 能否在中低算力与开放环境下复现厂商给出的收益。
从当天报道中提取值得长期跟踪的信号或待验证的节点。
本日报基于公开报道整理,仅供参考。