返回
Kevin Riedl

9 分钟 阅读 · 2026年9月7日
最近审核

下一篇
图片在你的设备上生成,不连接 Instagram。文章链接会复制到剪贴板,供链接贴纸使用。

Model Hardware Standard 企业评估:现在该试点 MHS 实体 AI 吗?

当昂贵的 AI 项目仍被看似普通的设备集成拖住时,Model Hardware Standard 才真正值得关注。实验室和工厂往往已经有可编程设备,但每增加一台机器人、读板机、显微镜或控制器,就会多一套 API、SDK、GUI 或厂商专用流程。Anthropic 的 MHS Research Preview 正在尝试标准化这一层。

我们的建议比发布会叙事更窄:只有当定制硬件集成已经是可量化瓶颈,而且你能隔离一个非关键流程时,才值得试点 MHS。如果设备没有编程接口、流程涉及安全关键动作,或采购要求今天就有稳定公开规范,更合理的选择是等待。

本文负责企业采用决策,而不是抢占所有相关关键词。只想了解软件侧协议定义,请看我们的 Model Context Protocol 词条。如果你评估的是具体机器人模型而不是硬件接口,请看 Gemini Robotics 2 评估

Model Hardware Standard 是什么?

MHS 是一套共享规范,目标是让 AI Agent 发现、理解并操作可编程物理设备。Anthropic 在 2026 年 8 月 27 日开放了 Model Hardware Standard Research Preview,项目最初与 HHMI Janelia Research Campus 合作推进。当前预览覆盖液体处理设备、显微镜、机械臂等科研与先进制造设备。

正确的抽象不是“让 LLM 直接开机器”。MHS Driver 向 Agent 提供标准化读写原语、发现信息、设备特征,以及操作限制等自然语言上下文。Agent 可以通过 MCP、命令行或代码 API 访问设备。长时间或延迟敏感的步骤可以固化成确定性代码,不必每一步都让模型在线推理。

截至 2026 年 9 月 7 日,MHS 官方网站仍将它描述为需要申请访问的有限 Research Preview。Anthropic 表示会在更多安全评估和最佳实践工作之后再开源。因此,现在的企业决策是“是否准备并试点”,而不是“是否立刻迁移到新标准”。

MHS 与 MCP 的区别:每一层负责什么?

MCP 与 MHS 是互补关系,不是竞争标准。MCP 是 Agent 调用软件工具的一条通路。MHS 增加的是物理设备描述、发现和操作上下文,这些内容不是通用软件工具协议天然拥有的。

核心职责企业决策
MCP向 Agent 暴露软件工具和资源需要可移植的软件工具接口时使用
MHS用 Agent 可读的边界描述并操作可编程物理设备重复设备集成成为瓶颈时评估
ROS 2、OPC UA 或厂商 SDK现有机器人、工业或设备通信与执行保留已经验证的控制底座,不要为了加 Agent 就重写
安全控制器与 Interlock独立于模型判断强制执行物理限制保持在概率型 AI 层之下

实际架构应该保持分层:模型选择受限目标,Agent 调用 MHS 描述的能力,既有控制器执行,独立安全逻辑仍可停止系统。MHS 试点首先要证明这种职责分离。

早期 MHS 试点真正证明了什么?

这些公开结果更适合被当作集成信号和失败模式,而不是一条可以复制到采购表格里的万能数字。

试点公开结果采购方应如何解读
Carnegie Mellon串行稀释实验大约快了三倍;团队报告从设备就绪到完成稀释曲线并包含一次自主重跑共约八小时在边界清晰、可编程的实验流程里,集成时间可能显著压缩,但不是通用报价
QuEra开发出的激光 Relock 控制器实现 99.3% 的恢复率,之前的定制脚本约为 58%Agent 辅助探索可以改进狭窄控制器,但公开报告同样记录了专家上下文和物理故障排查限制
GenentechClaude 最初把气泡造成的液体处理故障当成软件重试问题评测必须覆盖物理失败语义,不能只看 API 是否返回成功

Universal Robots 提供了工业视角。在其 UR Cobot MHS 概念验证中,Claude Opus 4.8 把四个独立机器人应用协调成一个工作单元。UR 同时明确说明这还不是普遍可用产品,而且底层仍由自己的安全架构掌控。

对生产环境而言,后一句比 Demo 更重要。“Agent 协调了四台机器人”很吸引眼球。“确定性的安全底座仍拥有最终权威”才是值得复制的架构。

哪些场景现在不适合 MHS?

  • 没有编程接口的设备:Anthropic 明确表示 MHS 目前还不能覆盖这类硬件。
  • 安全关键自治:语言模型不能成为唯一的碰撞、力、温度、压力或急停控制。
  • 采购必须依赖稳定公开规范:当前 Preview 受限且仍是临时规范。
  • 只有一台设备且 API 很稳定:直接集成可能仍比再引入一层抽象更便宜。
  • 缺乏领域专家:Genentech 和 QuEra 都说明了物理上下文仍需要真正理解设备的人来提供。

MHS 是否意味着家用机器人马上成熟?

它让“降低硬件集成成本”的方向更可信,但今天还没有一个可用的家庭标准。当前 Preview 聚焦科研和先进制造,这些环境里的设备、空间和流程相对结构化。家庭里有儿童、宠物、杂物、隐私敏感传感器、不可预测的物体位置,以及更模糊的动作授权关系。

更现实的过渡可能是受限的消费级邻近场景,例如辅助设备、维护工具、高端家电或能力很窄的服务机器人,并配合强本地安全机制。真正值得关注的信号不是一段家庭 Demo,而是硬件厂商是否开始提供安全、可发现、能经受模型切换和含糊自然语言目标的接口。

如何计算 MHS 试点是否有商业价值?

不要先算 Token。先算你已经在支付的集成瓶颈。

年度集成负担 = 每年集成次数 × 每次集成的工程师天数 × 单个工程师每日完全成本。

然后把试点价值估算为节省的集成工作,加上减少的恢复或交接时间,再减去 Driver、评测、可观测性和治理成本。除非在自己的设备上复现,否则不要把厂商案例数字直接写进 ROI。

指标为什么重要怎么测
首次安全设备动作所需时间验证集成压缩假设从干净环境到一次获批动作的小时数
任务完成率区分“接通了”与“流程真的成功”固定代表性测试集中的验收 Run
危险命令拒绝率验证对抗性或含糊指令下的边界被拒绝危险请求数除以危险测试用例数
人工干预率暴露隐藏运营成本每个验收 Run 的干预次数和原因
故障恢复率判断 Agent 增加的是韧性还是新的失败模式在允许策略内恢复的注入故障比例

一个 30 天 MHS 就绪性试点

  1. 第 1 到 5 天,选一个工作单元。选择两到三台已经存在集成痛点的可编程设备。任何错误动作可能伤人或破坏不可替代材料的流程都先排除。
  2. 第 6 到 10 天,画出控制栈。记录原生 API、现有编排、单位、操作边界、紧急控制、认证,以及每类动作由谁批准。
  3. 第 11 到 15 天,建立 Eval Harness。加入正常任务、畸形指令、过期状态、断连、传感器异常和模拟物理故障。在接入 Agent 之前先定义通过标准。
  4. 第 16 到 22 天,测试 Agent 接口层。有 Preview 权限就直接对 MHS 实现。没有权限就做内部就绪性 Adapter,保持设备描述、受限动作和确定性安全分离,但不要声称 MHS 合规。
  5. 第 23 到 27 天,做监督运行。记录目标、发现的能力、拟议调用、批准、设备状态、停止事件和恢复过程。
  6. 第 28 到 30 天,作出决策。把集成时间和每个验收任务成本与当前基线比较,然后选择扩展、重构或等待公开规范。

更广泛的上线方法可以参考我们的 AI Agent 30/60/90 天试点计划。如果商业问题是自建集成层还是购买平台,请看 定制软件与现成产品决策指南

选择 MHS 集成伙伴时应问什么?

  • 控制栈哪些部分是确定性的,哪些部分允许模型决策?
  • 同一个设备 Adapter 能否换模型或 Agent Harness?
  • 单位、限制、校准状态和权限如何表示并测试?
  • 如果设备 API 返回成功但物理动作失败,会发生什么?
  • 能否从日志重放每个动作,同时不暴露 Secret 或危险凭证?
  • 如果未来公开 MHS 规范与 Preview 不同,迁移路径是什么?
  • 什么具体指标会迫使团队停止一个表现不佳的试点?

Wavect 的 AI Enablement 与 Agent Engineering 服务可以帮助设计实体 AI 试点的软件集成、Eval Harness 和治理,而硬件最终权限继续由自动化专家掌握。我们的 TwinSoft AI 案例只是生产级 AI 集成的邻近证据,并不表示我们在那里部署过 MHS 或工业机器人。如果你已经有两台不兼容的可编程设备和一个长期消耗集成时间的流程,可以带着这个流程做一次 MHS 就绪性讨论

Model Hardware Standard 常见问题

Model Hardware Standard 现在开源了吗?

截至 2026 年 9 月 7 日还没有。Anthropic 将 MHS 描述为需要申请访问的有限 Research Preview,并表示会在更多安全评估和最佳实践工作后开源。

MHS 与 MCP 有什么区别?

MCP 是 Agent 访问软件工具和资源的协议。MHS 描述并操作带有设备上下文和限制的物理硬件。Anthropic 将 MCP 列为访问 MHS 的多种方式之一。

MHS 会替代 ROS 2 或 OPC UA 吗?

不要把试点设计成替换已经验证的控制基础设施。更稳妥的做法是把 MHS 视为位于现有设备或机器人接口上方或旁边的 Agent 硬件抽象,并在公开规范发布后再次验证。

MHS 今天能控制消费级设备吗?

Research Preview 聚焦科研和先进制造。消费场景是合理的未来方向,不是当前一般可用性声明。

哪些团队最适合先试点 MHS?

拥有多台可编程设备、持续承担定制集成成本、具备强领域知识,并且能安全隔离一个测试流程的团队最值得评估。

生产级 AI 支持

正在构建 AI 产品,却担心推理成本、架构或生产可用性?Wavect 帮助创始人把 AI 原型变成可靠的生产系统。

查看相关服务:

只收重要内容

关注与你相关的内容

每当我们发布新文章,你会收到一封简短邮件。你可以关注整个博客,也可以只选感兴趣的主题。

你希望接收哪些内容?
选择主题

免费、双重确认、不使用跟踪像素。

返回
Kevin Riedl

9 分钟 阅读 · 2026年9月7日
最近审核

下一篇

获取下一篇关于AI 与智能体的一线笔记

有新文章时发送一封简短邮件,不使用跟踪像素,也不发送填充内容。

免费、双重确认、不使用跟踪像素。