昊梵体育网

# 当AI开始操纵现实:Anthropic为什么要给物理世界定义一层MHS 信源:[Anthropic|《AI models can now help run physical science experiments》|2026-08-27] 过去两年,Agent最显眼的进步几乎都发生在数字世界:写代码、查资料、调用API、修改文件。这里的错误大多可以重试、回滚或隔离。到了实验 ​

当AI开始操纵现实:Anthropic为什么要给物理世界定义一层MHS

信源:[Anthropic|《AI models can now help run physical science experiments》|2026-08-27]

过去两年,Agent最显眼的进步几乎都发生在数字世界:写代码、查资料、调用API、修改文件。这里的错误大多可以重试、回滚或隔离。到了实验室和工厂,事情立刻变得不同。一次错误的激光功率、一条越界的机械臂轨迹、一次不合适的移液速度,损失的可能是样本、设备,甚至人身安全。Anthropic发布Model Hardware Standard(MHS),这次更值得关注的,是它试图给概率式AI与确定性物理系统之间划出一条可工程化的边界。

MHS可以被理解为四样东西的组合:统一的设备驱动、可被Agent发现的状态与能力描述、独立于模型的安全限制,以及连接MCP、命令行和代码文件的执行接口。设备不再只暴露一堆厂商专有API,而是用统一格式说明“我能测量什么、能调整什么、当前处于什么状态、哪些动作绝对不能越界”。Agent负责理解目标和选择下一步,底层驱动负责把动作翻译成设备命令,并执行人类预先设定的边界。

换句话说,MHS标准化的并非某一种机器人,而是AI理解和操纵异构硬件所需的最小公共语义。[Anthropic公开的架构]显示,它还允许模型把探索中学到的操作序列固化为代码,让长时间或高频任务脱离在线推理运行。

这解决的是科学自动化里一个长期被低估的瓶颈:设备集成。实验室的显微镜、相机、位移台、激光器和传感器往往来自不同厂商,分别运行在MATLAB、Python、C或封闭软件中。新增一台设备,不只是多接一根线,还要重新处理状态同步、数据格式、控制时序和安全规则。

MHS采用“每台设备接入一次”的思路,把点对点翻译改成共享接口。在HHMI Janelia的显微成像系统中,原本需要七套厂商程序协同;接入后,新相机的集成从数天缩短到几分钟,启动实验也从七个独立步骤变成一次操作。这种变化的核心,是让后续分析、可视化和Agent控制能够复用同一套状态字典。

QuEra的量子激光案例更能说明MHS应该怎样工作。旧的手写恢复脚本按固定顺序模仿专家,单次约需150秒,成功率约58%。Claude通过MHS在真实测试台上反复提出方案、读取传感器结果并修正策略,最后生成了一个独立运行的控制器。

在七类扰动、每类100次的验证中,它成功恢复695次,成功率99.3%;简单故障耗时0.9至5.4秒,最困难的故障约10至14秒,而人工恢复通常需要5至10分钟。[QuEra披露],真正运行时AI并不在微秒级伺服回路里,台架上执行的是可检查的确定性程序,硬件接口还独立执行限值、联锁和急停。

这揭示了物理Agent更可靠的路径:用模型搜索未知解,再把验证过的经验“编译”为确定性控制。

Genentech的实验也暴露了另一面。Claude第一次执行蛋白检测时,为水和黏稠蛋白溶液选择了相同的通用移液参数,结果蛋白溶液产生气泡,转移精度下降。研究人员补充物理原因后,模型才通过闭环实验分别找到适合水和BSA溶液的流速。

它说明大模型拥有文字世界的知识,却没有天然的物理直觉。MHS不能凭空补上这种直觉,它能做的是把传感器反馈、设备约束和专家经验变成机器可读、可复用、可验证的上下文。这里真正被数字化的,是过去散落在纸质手册、工程师电脑和老师傅经验里的隐性知识。

因此,MHS对“AI for Science”的更深影响,是可能把瓶颈从提出假设推向实验闭环的吞吐量。模型生成一百个候选分子并不困难,困难的是让液体工作站、机械臂、读板机和分析程序连续运行,及时发现异常,再根据结果设计下一轮实验。

一旦设备状态、操作语义和安全边界被统一,Agent才可能完成“提出方案—执行实验—读取结果—修正假设”的闭环。科研效率的衡量单位也会随之变化:不再只看一次模型回答有多聪明,而要看单位时间内能完成多少轮可信、可复现的实验迭代。

价值也会沿着这条链条迁移。除了模型本身,更重要的资产将包括高质量设备驱动、传感器与联锁系统、仪器语义描述、经过验证的操作技能,以及实验数据的溯源与审计。谁能把设备接入成本降下来,并把一次调试沉淀为整个组织可复用的能力,谁才更接近“自主实验室”的控制层。

不过,[MHS目前仍是面向少数合作伙伴的研究预览],公开规范和独立安全评估尚未完成,现有结果也主要来自Anthropic及其合作方。它最终能否成为“标准”,取决于设备厂商是否愿意原生支持、不同模型能否互操作,以及驱动编写与安全验证的成本是否真的低于旧式定制集成。

如果每台设备仍需要大量专家重新描述和校准,复杂度就只是从厂商API转移到了MHS驱动。接下来最值得看的不是更多演示视频,而是开放规范之后,第三方能否在陌生设备和真实故障上复现这些结果。

物理AI的分水岭将由一件事决定:系统能否把不确定的推理,稳定地转化为受约束、可观测、可验证的动作。