MHS 三部曲(中):8 小时集成、六种被拦截的故障,和一次教科书级的翻车

导读

上篇讲了 MHS 的概念与设计。这一篇全部交给实战:卡内基梅隆大学的 8 小时到底替代了什么、六种人为注入的故障如何被拦在设备动作之前、Genentech 的 AI 如何自我校准又如何在泡沫面前翻车、以及一个会自己找离心机解决问题的系统。

案例的价值不在宣传数字,而在它们同时画出了能力的上限和下限。

一、CMU:8 小时替代数周,替代的到底是什么

卡内基梅隆大学的设备环境堪称地狱难度:机械臂由调度软件控制、靠往目录里扔作业文件驱动;液体处理器只有老式 Windows 脚本接口;酶标仪根本没有编程接口、只有屏幕------MHS 直接像人一样点界面。从零写驱动加编排层用了约 8 小时 ,而厂商交付同类方案通常要数周[[1]](#[1])[[2]](#[2])

注意:8 小时替代的是设备接入与流程编排时间,不是把数周的科学实验压缩成 8 小时。 这是最容易被误读的数字。

接通之后才是重点。Agent 运行连续稀释剂量响应实验,第一轮最高浓度设 200 μg/mL,高浓度区饱和、拟合 R² 仅 0.884,系统自己判定不合格 ------把最高浓度降到 100 μg/mL、换新孔板重跑,第二轮 R² 提升到 0.981,全程无人介入[[1:1]](#[1:1])

这证明的是:在给定目标、接口和评价指标下,Agent 能完成「观察---判断---调整---重跑」的闭环。它没有证明系统能理解任意实验。

更硬核的是安全测试:团队人为注入六种故障------板子缺失、板子放反、读板器忙、相机断连、设备不可达、急停生效 ------六种情况下,系统全部在设备动作之前拦截[[3]](#[3])[[4]](#[4])

二、Genentech:自优化很漂亮,翻车也很诚实

基因泰克的 BCA 蛋白定量实验里,Claude 的表现其实很亮眼:它自主编排液体处理仪、机械臂和酶标仪,还通过对照专家操作自我校准,把移液速度优化到水约 140 μL/s 、黏稠蛋白液约 10 μL/s [[3:1]](#[3:1])

但翻车了:蛋白溶液摇晃产生泡沫,Claude 把它当作普通运行错误,在原孔位换参数重试,泡沫越搅越多。研究人员必须明确告诉它:这是物理故障 ,要换干净孔位、减少混合[[1:2]](#[1:2])。之后团队把这条经验写成可复用的 skill,同类错误率明显下降[[2:1]](#[2:1])

模型能读懂错误码,不等于理解错误背后的物理过程。 代码世界里合理的「重试」,到了液体世界可能让情况更糟。放到工厂里同理:相机看到工件位置不对,Agent 不断让机械臂重抓,却可能没发现是夹具松了------多试几次不是排障,反而可能把小问题变成碰撞。

三、更多一线信号

华盛顿大学 :一位博士生一周内接入六台仪器(含自己写驱动),做了远程仪表盘、能盯着 qPCR 扩增曲线在平台期前自动叫停的监督流程,以及机械臂与液体处理仪之间的无碰撞交接。他也说了句实在话:让 Agent 长时间盯仪器,算力成本要跟省下的人力算一笔账[[3:2]](#[3:2])[[2:2]](#[2:2])

HHMI Janelia :需要按序启动 7 个厂商软件的双光子显微镜平台整合为一键操作,后来新增一台相机只花几分钟[[1:3]](#[1:3])[[3:3]](#[3:3])

Tetsuwan Scientific :在 9,143 次分液、1,508 个测量条件上跑通自动化移液优化,留出数据上的精度预测比厂商标称还准约 12%[[3:4]](#[3:4])。还有一个更能说明「能力发现」的细节:qPCR 试验中相机发现移液产生了气泡,机械臂本身解决不了,系统在已连接的设备中自己找到了离心机 ,提出把试管送进去低速转一下,再通过 MHS 下达指令[[5]](#[5])[[6]](#[6])------相机负责发现问题,机械臂负责搬运,离心机负责处理,没有人为它们两两写连接程序。

四、安全原则:约束必须长在模型之外

这些案例背后是同一条安全原则。MHS 在硬件接口层强制设备自声明的边界、联锁和急停,与模型完全独立[[7]](#[7])------Janelia 的激光功率上限在设备层强制,而不是依赖 Claude「记住不要开太大」。

为什么必须这样?因为操作员换成了 Agent,而 Agent 不可信。把限幅、联锁写在上位机界面逻辑里的时代过去了,唯一可信的地方只剩驱动层。提示词可以告诉模型"速度不要超过多少",但不能代替控制器的硬限制;设备还要在模型失联、读数异常、权限被盗或指令冲突时,自己停在安全状态。

五、它不是 VLA------恰恰因为不是,才值得重视

具身智能行业最熟悉的词是 VLA:把视觉和语言指令映射成机器人动作。VLA 解决「这台机器人此刻该怎么动」;MHS 处理的是另一层:「整个现场有哪些设备、各自能干什么、现在什么状态、哪些动作绝对不能做」。

层级 解决什么 典型输出
MHS(接口编排层) 发现、理解、读取并编排异构设备 设备清单、状态、流程、约束
VLA / Policy(技能层) 把视觉与指令转成动作策略 轨迹、动作序列、高层技能
PLC / 控制器(执行层) 以确定时序执行运动与安全联锁 伺服指令、IO、毫秒级急停

两条路线不冲突。更准确的说法不是「Claude 终于拥有了身体」,而是:它第一次有了一套标准方法去调用身体------而且这个身体不一定是人形机器人,也可以是一间实验室、一套量子设备、一整条制造单元。

本篇小结

四个案例合起来说明三件事:接入与编排成本可以数量级下降(CMU/Janelia),闭环试错和跨设备补救是真的(CMU/Tetsuwan),但物理直觉仍是硬伤(Genentech),安全必须长在模型之外。

下篇预告:技术边界看清了,产业和人的问题才刚开始------谁允许 AI 行动?出了事谁负责?国内厂商用不了 Claude 怎么办?欧盟新规又卡在哪里?下篇聊权力、合规与落地清单。


参考资料:


  1. Anthropic's Model Hardware Standard Lets Claude Control Lab Robots Overnight --- AlphaSignal ↩︎ ↩︎ ↩︎ ↩︎

  2. MHS:Anthropic 给硬件定了个"MCP",写上位机的人该怎么读 --- 实验室仪器上位机 ↩︎ ↩︎ ↩︎

  3. Anthropic Model Hardware Standard (MHS) Explained --- Kingy AI ↩︎ ↩︎ ↩︎ ↩︎ ↩︎

  4. Anthropic previews Model Hardware Standard for AI-controlled lab and factory equipment --- MLQ.ai ↩︎

  5. Previewing the Model Hardware Standard --- Anthropic ↩︎

  6. 从 MCP 到 MHS,AI 从调用软件走到了操作机器 --- Daily Buffer ↩︎

  7. Holding the Light: Teaching an AI to Lock and Tune our Quantum Computer's Lasers --- QuEra ↩︎