Hark Handoff 评测:真正会点击网页的电脑操作智能体
Hark Handoff 是目前最清楚展示电脑操作智能体完成日常开放网页任务的产品之一。面对没有专用集成的网站,它可以点击、输入和滚动。Hark 展示了完整的订餐、购物、餐厅预订、候选人触达、跨站研究和机票预订。
我们对研究预览版的采购结论比发布叙事更克制:当高价值流程需要跨越陌生网页,而且没有好用的 API 时,Handoff 值得进入受控试点。它还不足以成为替换稳定 API、确定性自动化,或取消高影响操作人工批准的理由。
本文只回答这一产品决策。如果智能体主要需要广泛读取公开信息,请看 Agent Reach 评测。如果你在选择浏览器基础设施,请看 Lightpanda 生产评估。如果要计算完整经济性,请使用 每次可接受智能体操作成本。
你的流程是否被困在门户、表单和客户网站里?
规划电脑操作试点Hark Handoff 是什么?
Hark Handoff 是通过虚拟电脑在真实网站执行长流程任务的电脑操作智能体。Hark 表示,每次请求都会获得一个包含浏览器、文件系统和终端的独立环境。智能体生成鼠标和键盘操作,观察页面状态变化,再继续执行,直到得到结果。
Hark 的 Handoff 官方研究预览称,在近 300 万分钟的屏幕使用样本中,74.9% 的时间发生在浏览器内,而且不到千分之一的网站提供公开 API。这是厂商报告的数据,并非独立普查,但它准确指出了商业缺口:大量重要工作仍藏在为人设计的界面后面。
产品名称也说明了它的承诺。用户交付的是目标,而不是录制宏或指定每个选择器。模型需要理解陌生页面,决定下一步,并在网站表现不同时恢复。
Hark Handoff 如何工作?
- 用户描述结果。例如找到合适的航班、订晚餐或研究候选清单。
- Hark 启动隔离的虚拟电脑。环境包含浏览器和任务所需的通用工具。
- Handoff 观察并操作。它定位屏幕坐标,点击、输入、滚动,再读取结果。
- 智能体保持任务状态。公开演示包含多步推理和跨站操作。
- 关联账户提供个人上下文。Hark 表示,Handoff 可以使用已保存的地址、偏好和历史。
这种感知、行动、反馈循环更像机器人,而不是传统 API 集成。这并非巧合。Hark 创始人 Brett Adcock 的 官方个人简介把 Figure 描述为“给 AI 一个身体”的项目。Handoff 把同一个系统问题指向不可预测的数字界面:感知环境、选择动作、检查结果、继续调整。
Handoff 目前能做什么?
研究预览展示了六类实用任务。它们说明能力广度,但不等于正式服务目录或可靠性保证。
| 任务类别 | 公开示例 | 对应的企业流程 |
|---|---|---|
| 订餐 | DoorDash 和餐厅网站 | 跨越无统一 API 供应商的日常采购 |
| 购物 | 在大型零售网站比价并结账 | 低价值采购、库存检查和报价收集 |
| 预订 | OpenTable 和餐厅网站 | 通过合作方门户安排时间 |
| 招聘 | 在 LinkedIn 搜索并联系候选人 | 需要人工批准的候选研究与外联准备 |
| 研究 | 交叉核对评论、Reddit 和新闻 | 从不断变化的公开来源收集证据 |
| 旅行 | 跨航空公司比较并预订航班 | 多供应商搜索加受控交易 |
演示普通,反而最值得关注。一个供应商表单可能不值得单独开发集成,又可能变化太快,导致固定宏经常失效。通用智能体可以把人类界面变成可编程入口,不必等待网站所有者开发新 API。
Hark 的基准成绩有多可靠?
结果值得关注,但采购方必须区分公开基准与 Hark 内部评测。Hark 表示 Handoff 在人工评估的 Online-Mind2Web 排行榜中位居第一,并在三项浏览器评测的平均成绩上超过多个前沿模型。发布文章同时说明,WebTailBench 和内部评测使用 Hark 自建的测试框架。
Online-Mind2Web 论文是合适的一手资料。它定义了分布在 136 个真实网站上的 300 项任务,并报告自动评审与人工判断约有 85% 的一致率。真实网站比冻结页面更接近部署环境,但也会在不同运行之间变化。该基准衡量广泛网页能力,无法证明智能体在你的账户、规则、数据和月度业务量下的成功率。
基准告诉采购方什么,又没有告诉什么?
| 信号 | 能够支持的判断 | 仍未证明的部分 |
|---|---|---|
| 真实网站任务成功 | 模型能处理多样、变化的网页界面 | 你的完整流程能否稳定复现 |
| 相对模型分数 | Handoff 当前具备竞争力 | 网站和竞品模型变化后的表现 |
| 模型延迟与 Token 价格 | 底层模型可能有成本优势 | 浏览器时间、重试、审核、支持和失败成本 |
| 高质量现场录像 | 这些任务在技术上可行 | 普通、未筛选运行中的失败分布 |
采购时应询问各任务类别通过率、重复运行方差、人工介入率、超时政策、交易失败处理方式和准确分母。排行榜用于发现供应商,你自己的验收集才用于购买。
Handoff、API、RPA 与浏览器自动化该如何选择?
使用能够可靠解决问题的最窄接口。电脑操作智能体的价值是填补系统之间的缺口,不是把每个系统都退化成像素和点击。
| 方案 | 最适合 | 主要弱点 |
|---|---|---|
| 官方 API | 对象和权限明确的稳定、高频流程 | 可能没有所需操作或网站 |
| 确定性浏览器自动化 | 相对稳定界面上的已知重复流程 | UI 变化会破坏选择器和脚本路径 |
| 传统 RPA | 受控桌面应用中的规则型工作 | 变更与异常处理成本高 |
| Handoff 类电脑操作智能体 | 需要视觉推理和恢复的不规则跨站任务 | 概率行为、延迟、安全和验证难度 |
| 定制混合集成 | API 处理核心,GUI 只补特定缺口的高价值流程 | 需要产品工程和长期负责人 |
| 人工操作 | 少见、敏感或高风险的模糊异常 | 成本、排队时间和扩展性 |
成熟生产架构通常有三条通道。API 负责确定性的读写,电脑操作智能体覆盖少量无合适接口的门户和例外,人工批准资金、外部消息、法律承诺和模糊情况。
Hark Handoff 价格是多少?
截至 2026 年 8 月 7 日的公开资料审查,Hark 尚未发布通用 Handoff 价格、企业合同或服务等级承诺。公司表示底层模型的每 Token 成本低于部分前沿替代方案,但采购应比较每个可接受任务的总成本,而不是 Token 单价。
成本需要包括虚拟电脑运行时间、模型轮次、浏览器延迟、重试、验证码、会话拦截、人工批准、错误购买、凭据运维、可观测性和维护。便宜模型如果需要大量步骤或频繁救援,依然会形成昂贵流程。报价前可使用我们的 AI 智能体操作成本指南。
Hark Handoff 用于企业是否安全?
独立虚拟电脑是良好的隔离基础,但不是完整安全模型。Handoff 在持有登录权限和点击能力时,可能遇到恶意页面内容。这会把不可信输入与真实权限放在一起。
NIST 的 2026 年智能体劫持分析涵盖对 13 个前沿模型目标发起的 25 万多次攻击。每个目标都至少出现一次成功劫持。这不是对 Handoff 的专项评估,但它说明网页智能体必须按“恶意指令迟早会出现”来设计。
真实试点前必须具备的控制
- 专用身份:试点账户只拥有单一流程需要的数据、余额和权限。
- 批准边界:结账、预订、发消息、接受条款、下载可执行文件或修改账户前暂停。
- 任务级密钥:凭据只暴露给相关网站和单次运行,随后撤销或轮换。
- 完整证据:保留目标、页面状态、动作、批准、最终收据和失败原因。
- 网络与文件控制:按试点需要限制目的地、下载、上传和终端命令。
- 人工回退:不确定、被拦截或金额不符时,在不丢失状态的情况下转交操作员。
- 条款与数据审查:确认所选网站允许账户自动化、数据保存和模型处理。
NIST 的 智能体工具访问分类把浏览器使用归入“不可信环境中的受限写入”,把通用电脑操作归入更广泛的写入类别。对应的架构规则很简单:授予智能体的权限应少于虚拟机技术上能够提供的权限。
哪些企业流程适合?
| 流程 | 试点适合度 | 必要边界 |
|---|---|---|
| 跨供应商报价收集 | 高 | 只读、保留来源与有效期 |
| 旅行比较 | 付款前很高 | 人工确认旅客信息、价格和预订 |
| 低价值日常采购 | 有条件 | 供应商白名单、硬性额度和收据校验 |
| 候选人研究 | 有条件 | 合法数据政策,联系前人工批准 |
| 门户数据录入 | 中等业务量较高 | Schema 校验、防重复和审计日志 |
| 支付、监管申报或合同接受 | 不适合自主执行 | API 或具名批准的严格受控系统 |
最好的首个任务应该繁琐、有价值、容易验证、便于撤销。最差的任务模糊、高影响、无法审计。“收集三份可比供应商报价”是试点,“处理采购”则是伪装成提示词的责任风险。
企业应如何试点 Hark Handoff?
- 选择一个有边界的流程。固定 30 到 50 个代表性任务,包含复杂页面、过期会话和不可用选项。
- 记录人工基线。衡量完成率、耗时、审核时间、错误率和总人工。
- 演示前定义验收。写清正确结果、必要证据、禁止动作和批准节点。
- 使用可丢弃身份。先用合成或低价值数据、窄权限和硬性交易额度。
- 重复运行。一次成功录像不是分母,应在不同日期重试并保留失败。
- 比较替代方案。同时估算官方 API、确定性脚本、混合设计和人工流程。
- 只扩展胜出通道。异常继续人工处理,稳定子流程在经济合理时迁移到 API。
电脑操作试点评分表
| 指标 | 定义 | 用途 |
|---|---|---|
| 可接受结果率 | 有正确证据的结果除以所有合格任务 | 避免把部分导航算成成功 |
| 每个可接受结果成本 | 厂商、运行、审核和失败成本除以可接受结果 | 让模型与人工、API 可比较 |
| 人工介入率 | 除计划批准外还需要救援的任务 | 暴露隐藏运维负担 |
| 不安全动作率 | 每项任务中禁止或错误建议的动作 | 衡量风险,而不仅是效率 |
| 恢复率 | UI 或会话异常在不破坏状态时被解决 | 检验相对脚本的核心优势 |
| 获得证据时间 | 审核者得到可用结果与轨迹的耗时 | 同时包含浏览器延迟与审核 |
我们的 AI 智能体 30、60、90 天试点计划提供治理节奏。智能体评测沙箱安全清单进一步覆盖隔离、密钥、网络和证据。
应该购买 Handoff,还是自建电脑操作流程?
如果稀缺能力是通用网页操作,可以购买或试点 Handoff。如果竞争优势来自流程规则、专有数据、批准和内部系统集成,应构建混合架构。训练通用电脑操作模型不是普通产品待办事项,拥有专用模型周围的编排层则完全可行。
采购前应向 Hark 询问地区可用性、数据处理与保留、账户连接、模型训练、审计导出、批准控制、基准轨迹、支持、事故处理、并发、限额、价格和退出方案。随后由你的团队决定哪些控制必须留在厂商边界之外。
Wavect 的 AI 产品工程服务可以规划边界,并围绕智能体试点构建 API、策略和人工审核层。Twinsoft AI 案例展示了我们的生产系统方法,从原型到生产决策指南可帮助界定加固范围。如果你已有具体流程,可以申请架构评审。
常见问题
Hark Handoff 是什么?
Hark Handoff 能订餐和预订航班吗?
Hark Handoff 已经开放吗?
Hark Handoff 多少钱?
Handoff 比浏览器自动化更好吗?
Hark Handoff 用于购买和登录账户安全吗?
研究边界
本文于 2026 年 8 月 7 日审阅 Hark 发布文章与官网、Brett Adcock 官方简介、Online-Mind2Web 论文和 NIST 智能体安全材料。我们没有获得付费访问,没有连接个人账户,也没有独立运行 Handoff 基准。厂商声明均明确标注。采购前请确认最新可用性、价格、控制和合同条款。
最终思考
Hark Handoff 的重要性在于,它让软件经济的备用接口,也就是为人设计的网站,成为智能体可以操作的入口。长期被忽视的门户、跨站比较和一次性表单因此不必等待每个供应商提供完美 API。
最佳架构不会假装所有点击都具备确定性。它会把每项动作路由到最窄且可靠的通道:稳定契约交给 API,不规则缺口交给电脑操作,需要重大判断时交给人。应在恢复能力比吞吐量更重要的地方试点 Handoff,再用结果证据、权限和失败路径建立信任。
