Hark Handoff: análisis del agente que sí hace clic
Hark Handoff es una de las demostraciones más claras de un agente de uso del ordenador que completa trabajo cotidiano en la web abierta. Hace clic, escribe y se desplaza por sitios para los que no recibió una integración específica. Hark muestra pedidos de comida, compras, reservas de restaurantes, selección de candidatos, investigación entre fuentes y vuelos de principio a fin.
Nuestro veredicto de compra sobre la research preview es más estrecho que el relato del lanzamiento: Handoff merece un piloto controlado cuando un proceso valioso cruza interfaces desconocidas y no existen APIs útiles. Todavía no justifica sustituir APIs estables, automatización determinista o aprobación humana en acciones con consecuencias.
Este artículo responde esa decisión. Para acceso de lectura amplio, consulta el análisis de Agent Reach. Para elegir infraestructura de navegador, revisa Lightpanda en producción. Para la economía completa, calcula el coste por acción aceptada del agente.
¿Tienes un proceso atrapado en portales, formularios y webs de clientes?
Definir un piloto de computer use¿Qué es Hark Handoff?
Hark Handoff es un agente de uso del ordenador creado para completar tareas largas en webs reales mediante un ordenador virtual. Hark afirma que prepara para cada petición un entorno dedicado con navegador, sistema de archivos y terminal. El agente genera acciones de cursor y teclado, observa el nuevo estado y continúa hasta alcanzar un resultado.
La research preview oficial de Handoff informa de que el 74,9% de casi tres millones de minutos de pantalla observados se pasó en un navegador y que menos de una de cada mil webs ofrece una API pública. Son mediciones del proveedor, no un censo independiente, pero señalan bien la oportunidad: mucho trabajo importante sigue detrás de interfaces diseñadas para personas.
El nombre explica la promesa. El usuario entrega el objetivo en vez de grabar una macro o declarar cada selector. El modelo debe entender una página nueva, elegir el siguiente paso y recuperarse cuando el sitio cambia.
¿Cómo funciona Hark Handoff?
- Describes un resultado. Por ejemplo, encontrar un vuelo, pedir una cena o preparar una lista de candidatos.
- Hark inicia un ordenador virtual aislado. El entorno incluye navegador y herramientas generales.
- Handoff observa y actúa. Apunta a coordenadas, hace clic, escribe, se desplaza y lee el estado resultante.
- El agente mantiene el estado. En las demos razona durante varios pasos y entre varios sitios.
- Las cuentas conectadas aportan contexto. Hark dice que puede usar direcciones, preferencias e historial guardados.
El ciclo de percepción, acción y feedback se parece más a un robot que a una integración API convencional. No es casualidad. La biografía oficial del fundador Brett Adcock describe Figure como un proyecto para dar cuerpo a la IA. Handoff aplica el mismo problema a interfaces digitales impredecibles: percibir, decidir, actuar, comprobar y corregir.
¿Qué puede hacer Handoff hoy?
La preview enseña seis familias de tareas. Demuestran amplitud, no un catálogo contractual ni una garantía de fiabilidad.
| Familia | Ejemplo publicado | Proceso empresarial sugerido |
|---|---|---|
| Comida | Pedidos en DoorDash y restaurantes | Compra rutinaria entre proveedores sin API común |
| Compras | Búsqueda de precio y checkout en grandes comercios | Compras de bajo valor, stock y recopilación de ofertas |
| Reservas | OpenTable y webs de restaurantes | Planificación a través de portales de socios |
| Recruiting | Buscar y contactar candidatos en LinkedIn | Sourcing con revisión humana antes del contacto |
| Investigación | Cruzar reseñas, Reddit y noticias | Recoger evidencia en fuentes públicas cambiantes |
| Viajes | Comparar y reservar vuelos entre aerolíneas | Búsqueda multi-proveedor y transacción controlada |
Que las demos sean corrientes es una buena señal. Un portal puede ser demasiado pequeño para justificar una integración a medida y demasiado variable para una macro frágil. Un agente general convierte la interfaz humana en una superficie programable sin esperar a que su propietario cree una API.
¿Qué solidez tienen los benchmarks de Hark?
Los resultados son prometedores, pero hay que separar el benchmark público de las evaluaciones internas. Hark afirma ocupar el primer puesto del leaderboard Online-Mind2Web evaluado por personas y superar de media a modelos frontier concretos en tres pruebas. WebTailBench y la evaluación interna se ejecutaron con el harness de Hark, según el artículo de lanzamiento.
El paper de Online-Mind2Web es la referencia primaria adecuada. Define 300 tareas en 136 webs reales e informa de cerca de un 85% de acuerdo entre su juez automático y la evaluación humana. Las páginas vivas aportan realismo, pero cambian entre ejecuciones. El benchmark mide competencia web amplia. No demuestra fiabilidad en tus cuentas, reglas, datos y volumen mensual.
Qué demuestra y qué no
| Señal | Qué respalda | Qué falta |
|---|---|---|
| Éxito en webs reales | El modelo maneja interfaces variadas y cambiantes | Tasa repetible de tu proceso completo |
| Posición relativa | Handoff parece competitivo hoy | Rendimiento después de cambios en webs y modelos |
| Latencia y precio del modelo | El modelo subyacente puede ser eficiente | Navegador, reintentos, revisión, soporte y fallos |
| Grabaciones buenas | Las tareas mostradas son posibles | Distribución de errores en ejecuciones no seleccionadas |
Pide tasas por familia de tarea, variación entre intentos, intervención, timeouts, tratamiento de transacciones fallidas y denominador exacto. El leaderboard sirve para descubrir proveedores. Tu set de aceptación sirve para comprar.
Handoff frente a API, RPA y automatización de navegador
Usa la interfaz fiable más estrecha que resuelva el problema. Computer use es valioso porque cubre huecos entre sistemas, no porque cada sistema deba reducirse a píxeles y clics.
| Enfoque | Mejor encaje | Debilidad principal |
|---|---|---|
| API oficial | Flujo estable y de gran volumen con objetos y permisos soportados | Puede no exponer la acción o el sitio necesarios |
| Automatización determinista | Proceso conocido y repetido en una interfaz estable | Selectores y rutas se rompen con el cambio |
| RPA tradicional | Trabajo reglado en aplicaciones de escritorio controladas | Cambios y excepciones elevan el coste |
| Agente como Handoff | Tarea irregular entre sitios con razonamiento visual y recuperación | Probabilidad, latencia, seguridad y validación |
| Integración híbrida | Proceso valioso donde APIs cubren el núcleo y la GUI rellena huecos | Necesita ingeniería y ownership continuo |
| Persona | Excepción rara, sensible o ambigua con gran impacto | Coste, cola y poca escala |
Una buena arquitectura suele tener tres carriles. Las APIs procesan lecturas y escrituras deterministas. Computer use cubre pocos portales y excepciones sin interfaz útil. Una persona aprueba dinero, comunicación externa, compromisos legales y casos ambiguos.
¿Cuánto cuesta Hark Handoff?
Hark no había publicado un precio general, contrato enterprise o compromiso de nivel de servicio cuando revisamos el material público el 7 de agosto de 2026. La empresa afirma que su modelo cuesta menos por token que alternativas frontier, pero la métrica de compra es el coste total por tarea aceptada.
Incluye ordenador virtual, turnos de modelo, latencia, reintentos, captchas, sesiones bloqueadas, aprobación, compras fallidas, credenciales, observabilidad y mantenimiento. Un modelo barato puede producir un proceso caro. Usa nuestra guía de coste por acción del agente antes de comparar una oferta con trabajo interno.
¿Es seguro Hark Handoff para empresas?
Un ordenador virtual dedicado es una buena primitiva de aislamiento, no un modelo de seguridad completo. Handoff puede encontrar contenido hostil mientras tiene una sesión iniciada y permiso para actuar. Eso combina entrada no confiable con autoridad real.
El análisis de agent hijacking de NIST estudia más de 250.000 ataques contra 13 modelos frontier. Se encontró al menos un ataque exitoso contra cada objetivo. No evalúa Handoff, pero justifica diseñar cualquier agente web suponiendo que acabará viendo instrucciones maliciosas.
Controles mínimos para un piloto real
- Identidades dedicadas: una cuenta con los mínimos datos, saldo y permisos para un solo flujo.
- Límites de aprobación: pausa antes de pagar, reservar, enviar, aceptar condiciones, descargar ejecutables o cambiar la cuenta.
- Secretos por tarea: credenciales solo para el sitio y la ejecución necesarios, con revocación posterior.
- Evidencia completa: objetivo, estados, acciones, aprobaciones, recibo final y motivo de error.
- Control de red y archivos: restringir destinos, descargas, cargas y comandos.
- Fallback manual: entregar incertidumbre, bloqueos y totales erróneos sin perder el estado.
- Revisión de términos y datos: validar automatización, retención y procesamiento para cada sitio.
La taxonomía de acceso a herramientas de NIST sitúa browser use en un entorno no confiable con escritura limitada y computer use en la categoría de escritura más amplia. La regla de arquitectura es directa: concede menos autoridad de la que permite técnicamente la máquina virtual.
¿Qué procesos empresariales encajan?
| Proceso | Encaje del piloto | Límite necesario |
|---|---|---|
| Recopilar ofertas de proveedores | Alto | Solo lectura, fuente y caducidad |
| Comparar viajes | Alto antes de pagar | Persona confirma datos, precio y reserva |
| Compras rutinarias de poco valor | Condicional | Proveedores permitidos, límite y recibo |
| Investigar candidatos | Condicional | Política de datos y aprobación antes del contacto |
| Entrada de datos en portales | Alto con volumen medio | Validación, deduplicación y auditoría |
| Pagos, trámites regulados o contratos | Malo en autónomo | API o sistema controlado con aprobación nominal |
La mejor primera tarea es tediosa, valiosa, verificable y reversible. La peor es vaga, peligrosa e imposible de auditar. “Recoge tres ofertas comparables” es un piloto. “Gestiona compras” es una declaración de responsabilidad disfrazada de prompt.
¿Cómo pilotar Hark Handoff?
- Elegir un flujo acotado. Congela entre 30 y 50 tareas, incluyendo páginas difíciles y sesiones vencidas.
- Medir la base humana. Registra éxito, tiempo, revisión, error y coste laboral.
- Definir aceptación antes de la demo. Resultado correcto, evidencia, acciones prohibidas y aprobaciones.
- Usar una identidad desechable. Datos sintéticos o de poco valor, acceso mínimo y límite de transacción.
- Repetir pruebas. Un vídeo exitoso no es el denominador. Conserva también los fallos.
- Comparar alternativas. Valora API, script determinista, híbrido y proceso manual.
- Escalar solo el carril ganador. Mantén excepciones manuales y mueve subflujos estables a APIs.
Scorecard del piloto
| Métrica | Definición | Por qué importa |
|---|---|---|
| Resultado aceptado | Resultados correctos con evidencia entre tareas elegibles | No cuenta navegación parcial como éxito |
| Coste por resultado | Proveedor, runtime, revisión y fallos entre resultados aceptados | Compara modelo, personas y APIs |
| Intervención humana | Tareas rescatadas fuera de las aprobaciones previstas | Descubre carga operativa oculta |
| Acciones inseguras | Acciones prohibidas o mal propuestas por tarea | Mide impacto negativo |
| Recuperación | Fallos de UI o sesión resueltos sin corromper estado | Prueba la ventaja frente a scripts |
| Tiempo hasta evidencia | Tiempo hasta un resultado y traza revisables | Une latencia y revisión |
Nuestro plan de piloto de 30, 60 y 90 días aporta el ritmo de gobierno. La checklist de seguridad del sandbox profundiza en aislamiento, secretos, red y evidencia.
¿Comprar Handoff o construir un flujo propio?
Compra o prueba Handoff cuando la capacidad web general sea el recurso escaso. Construye un híbrido cuando tu ventaja esté en reglas, datos propios, aprobaciones e integración interna. Entrenar un modelo general de computer use no es un backlog normal. Ser dueño de la orquestación alrededor de un modelo especialista sí lo es.
Pregunta a Hark por regiones, procesamiento, retención, conexión de cuentas, entrenamiento, auditoría, aprobaciones, trazas, soporte, incidentes, concurrencia, límites, precio y salida. Después decide qué controles deben quedar fuera del proveedor.
El servicio de ingeniería de productos con IA de Wavect puede diseñar esa frontera y construir las capas de API, política y revisión. El caso Twinsoft AI enseña nuestro enfoque de producción y la guía de prototipo a producción ayuda a estimar el hardening. Para un proceso concreto, solicita una revisión de arquitectura.
Preguntas frecuentes
¿Qué es Hark Handoff?
¿Puede Hark Handoff pedir comida y reservar vuelos?
¿Está disponible Hark Handoff?
¿Cuánto cuesta Hark Handoff?
¿Es Handoff mejor que automatizar el navegador?
¿Es seguro para compras y cuentas conectadas?
Límite de la investigación
Revisado el 7 de agosto de 2026 a partir del lanzamiento y la web de Hark, la biografía oficial de Brett Adcock, el paper Online-Mind2Web y material de NIST sobre seguridad de agentes. No recibimos acceso pagado, no conectamos una cuenta personal ni ejecutamos un benchmark independiente. Identificamos las afirmaciones del proveedor. Confirma disponibilidad, precio, controles y contrato antes de comprar.
Reflexiones finales
Hark Handoff importa porque convierte la interfaz de último recurso de la economía del software, la web hecha para una persona, en algo que un agente puede operar. Portales olvidados, comparaciones entre sitios y formularios puntuales se vuelven abordables sin esperar la API perfecta de cada proveedor.
La arquitectura ganadora no finge que los clics son deterministas. Envía cada acción al carril fiable más estrecho: APIs para contratos estables, computer use para huecos irregulares y personas para decisiones importantes. Prueba Handoff donde recuperarse importe más que el volumen y construye confianza con evidencia, permisos y una ruta de fallo.
