一、AI Coding
1. xAI 把 Grok Bot 做成平台:Marketplace + 自托管 + Grok 4.7 全量上线
- 事件:xAI 正将 Grok Bot 从单一工具升级为平台------据 Polymarket 信息,Grok Bot Marketplace 已允许用户挂载工程、研究、销售、营销等专属 agent(上架机制与定价未公开);一场内部分享显示 xAI 已用自家 Grok Bot 造 Grok Bot 本身(一张线框图自动展开完整 Figma 流程、项目自动拆给 4 个"工程师 bot"并行、X 上的重复 bug 自动转修复提案)。同日 Grok 4.7 从 Grok Build/Grok Bot 专属扩展到全平台(Fast/Expert/Build/Heavy 全模式),Grok Build 连发两个点版本修复模型切换 UI 同步、Goal 面板打不开、大工作区性能等问题。
- 值得关注:这是"agent 自我增殖"第一次进入产品化叙事------工具商开始用 agent 生产自己的下一代工具。Marketplace 化也意味着 coding agent 的竞争从"谁的模型强"切到"谁的生态/专业人士多"。对国内同类(Manus Cue、智谱 ZCode、阿里 Qoder)是明确的平台化参照。
2. DeepSeek Harness v0.2 Preview:桌面 App + 插件管理器,国产开源 harness 成 API 用户主流
- 事件:DeepSeek 发布 Harness v0.2 预览,新增 macOS/Windows 原生桌面端、免终端的插件管理器(聊天即可创建插件)、以及 Automation Task 定时任务插件。DeepSeek 称 Harness 已成为官方 API 用户中使用最广泛的 coding agent。
- 值得关注:国产开源 harness 在"自托管 + 插件生态 + 定时自动化"三层补齐,正在从"调用模型"升级为"开发者的常驻工作台"。与 9 月"卷 harness 而非卷模型"的叙事一致------价值继续从底层模型向运行时/编排层转移。
3. Google 安全与长程评测三连击:Android Bench 2.0 / Stitch CLI / Mantis 安全审查包
- 事件 :Google 三箭齐发------① Android 团队发布 Android Bench 2.0 ,从修 bug 小任务升级为约 30 个"多天级"长程工程任务(从零建 app、迁移依赖与设计并跨平台移植),专门测长程编码能力;② Stitch 团队放出
@google/stitchCLI,本地 coding agent 可直接把 dev-server 快照推入 Stitch;③ 开源 Mantis 安全审查技能包(威胁建模、漏洞扫描、误报过滤、PoC 生成、补丁验证 6 条命令)。Google Cloud 同步启动 Advent of Agents Season 3(31 期免费、免登录的 agent 安全实战视频,含 prompt injection 防御、沙箱、kill switch)。
- 值得关注:大厂把"安全 + 长程评测"当成 coding agent 的基建来铺------前者是 agent 进入企业的准入门槛,后者是"到底有没有真干活"的标尺。Mantis 开源直接把安全审查做进 agent 工作流,对标 NVIDIA Open Agent Safety Platform 的"安全成产业红线"趋势。
4. 并行编码 + 长任务治理:ParallelPilot 实测 +63% 吞吐,Claude Code 上线"体面收尾"
- 事件 :① 论文 ParallelPilot 从 14 人开发者研究里提炼出 5 条"多 agent 并行"监督实践,报告并行编码带来 63% 吞吐提升 ;微软另发 CASD ------把 agent 历史运行日志交给普通 coding agent 写分析代码定位系统性失败,3/4 基准上以约 $1.60/提示 跑赢 GEPA 优化器。② Anthropic 给 Claude Code 加了 Wrap-Up Allowance:撞上 5 小时上限时不再硬切(改到一半直接 429),而是从周额度划一小段"收尾额度"把当前这一步做完再停(Pro 每周 1 次、Max/Team Premium 每次命中可用)。
- 值得关注:长任务工程化进入"并行 + 优雅收尾"阶段。但注意 Wrap-Up 只解决"停在哪"、不解决"记忆留什么"------会话状态仍需显式序列化(Stop hook 写 checkpoint)。对实际跑 overnight /loop 的团队,这是 9 月"长程 agent 可靠性"议题的落地补丁。
5. Benzi:编译器驱动的 coding agent,78.2% SWE-bench Verified、单次修复 <10¢
- 事件 :开发者发布 Benzi ,用编译器 + 静态分析替代"读源码"。核心思路:编辑前先让编译器报告改动爆破半径并跑全量静态检查,模型几乎不用问"谁调了这个函数"。数据:同任务 Sonnet 只读了 9,125 行 vs Claude Code 20,704 行、DeepSeek harness 43,598 行、OpenCode 65K+;SWE-bench Verified 78.2%,单次修复成本 <10¢(用 V4flash)。支持 Python/JS/TS/Java/C#/C++/C/Go/Rust/Ruby。
- 值得关注:直接挑战"上下文窗口军备竞赛"------主张"索引仓库 > 读原文"更经济。若被验证可泛化,将动摇"长上下文 = 强 agent"的默认假设,也给自托管/低成本 coding agent 一条新路径。需观察基准是否过拟合及多语言真实工程表现。
二、具身智能
6. Boston Dynamics Atlas 换新四指手:13 DOF、砍掉小指、为量产可制造
- 事件 :现代汽车旗下 Boston Dynamics 发布 Atlas 新一代手------四指、13 自由度 (拇指 4 DOF、其余三指各 3 DOF)、直接驱动、指腹+手掌压触觉传感,支持 in-hand 重定位、滑落自恢复、握钻/扳手/焊枪并扣扳机。设计上刻意去掉小指 :团队让工程师把小指和无名指绑一天,结论是省下的复杂度/功耗/故障点不值。配套 Georgia 的 RMAC 训练中心已开张,现代起亚计划 2028 年起部署 Atlas (先零件排序、2030 扩到装配),远期 2.5 万台进全球工厂;部分零件成本已降 60--80%。
- 值得关注:这是人形从"炫技手"到"量产可制造手"的设计哲学转折------不追求拟人,而追求可靠、便宜、好修。现代起亚的 2.5 万台订单把"上量"从 PPT 变成供应链计划,直接牵动执行器/减速器/触觉传感上游(A股相关标的的订单能见度提升)。
7. Agility × FORT Robotics 签 Digit 5 安全 MOU:离机安全桥成标准件
- 事件 :Agility Robotics 与 FORT Robotics(10/1)签 MOU,围绕下一代 Digit 5 共建三层安全架构:安全吊坠 + 本体通信 + Offboard Safety Bridge 离机安全接口(把协作安全从机器人本体延伸到外部环境系统)。FORT 此前已为 Digit 提供吊坠载板(急停+使能装置)。Digit 5 主打"无物理围栏、贴近人协作",前代已累计 6.5 万+ 小时现场运行(GXO/Schaeffler/Amazon/丰田)。Digit 5 早期可用 2027 H1、通用可用 2027 年底。
- 值得关注:人形机器人"安全架构"开始标准化、模块化、从本体走向环境------这是进工厂/仓库的硬准入。对 A股来说,"机器人安全/功能安全"从概念变成可采购的子系统,利好安全控制器、急停/使能硬件、协作安全软件相关标的。
8. CrossBFM:跨本体行为基础模型,训练从数百 GPU 小时降到 <1 小时
- 事件 :研究提出 CrossBFM ,把多个不同人形本体的共享行为潜空间蒸馏出来,用跨本体重定向(cross-embodiment retargeting)生成统一、可迁移的表征,将行为基础模型的训练时间从数百 GPU 小时压缩到 1 小时以内,并实现策略在不同机器人间直接迁移,解决"每款机器人各训各的、潜空间不兼容"的瓶颈。
- 值得关注:行为基础模型的"跨本体"瓶颈被突破,意味着"一个大脑管多种身体"的工程成本骤降------直击具身智能最大的数据/训练碎片化痛点。国产 VLA/世界动作模型(宇树 WLA、智元 GE-Act、银河 RoboDojo 等)需要对照评估自己的跨本体能力,否则会被"通用底座"路线拉开差距。
9. 可靠性评测下沉:VLA 相机故障物理失效模式 + Fiatlux 长程基准
- 事件 :① 研究分析 π0.5 / GR00T 等 VLA 在相机故障(黑屏 vs 冻结帧)下的物理失效差异:冻结引发关节剧烈运动、黑屏增加掉落率,并验证本体感知(proprioception)可补偿、相机黑屏训练有效。② 新基准 Fiatlux(基于 NVIDIA Isaac Lab):让宇树 G1 爬梯、换灯泡、丢弃旧灯泡,单幕融合垂直移动+精细操作+易碎品处理,12 个子任务、部分给分,把评测从桌面/ locomotion 推向真实长程。
- 值得关注:具身评测从"能不能动"升级到"坏了怎么办、长程连不连得起来"------这是量产验收前必须过的关。VLA 失效模式研究提示:视觉故障下"动作安全兜底"要依赖本体感知,对传感器冗余/故障注入测试提出新要求;Fiatlux 类长程基准会成为厂商能力宣传的新标尺。
三、跨主线信号(投资 / 能源视角)
- 算力能源锚延续 :本期 coding 侧"安全实战 + 长程评测"密集铺开(Advent of Agents S3、Mantis、CASD、ParallelPilot),具身侧"安全架构标准化"(Digit 5 Offboard Safety Bridge)同步硬化------Agent 安全合规已成 coding + 具身共享的硬约束,监管与采购都会据此设门槛。
- A股三条线可跟踪:① 具身上游卖铲人------Atlas 2.5 万台订单 + Digit 5 安全子系统,牵动执行器/减速器/触觉传感/功能安全硬件;② 行为基础模型/跨本体------CrossBFM 把"通用大脑"成本打下来,倒逼国产 VLA 证明跨本体能力;③ 绿电算力------长程 agent 与机器人训练都吃算力,能源(储能/供电/绿电)仍是底层锚。
- 叙事收口:Coding"平台化 + 安全 + 长程评测 + 价值向 harness 转移";具身"可制造手 + 安全标准化 + 跨本体大脑 + 长程可靠性评测"。两边都在从"能力演示"切到"能不能规模部署、坏了谁负责"。
一句话总结:今日 AI Coding 与具身智能同频收敛------竞争焦点正从"谁模型更强"切换到"谁能把 agent 安全、可靠地规模部署",平台化运行时、离机安全桥与长程评测已取代单纯参数,成为压过模型性能的新护城河,也直接决定具身估值的兑现与上游订单的能见度。