Hark Handoff im Test: Der Computer-Use-Agent, der wirklich klickt
Hark Handoff ist eine der bisher klarsten Demonstrationen eines Computer-Use-Agenten, der gewöhnliche Aufgaben im offenen Web erledigt. Er klickt, tippt und scrollt durch Websites, für die er keine eigene Integration erhalten hat. Hark zeigt vollständige Essensbestellungen, Shopping, Restaurantreservierungen, Recruiting, Cross-Site-Recherche und Flugbuchungen.
Unser Buyer Verdict zur Research Preview ist bewusst enger als die Launch Story: Handoff ist ein starker Kandidat für einen kontrollierten Piloten, wenn ein wertvoller Prozess mehrere unbekannte Weboberflächen durchläuft und brauchbare APIs fehlen. Noch ist er kein Grund, stabile APIs, deterministische Automation oder menschliche Freigabe bei folgenreichen Aktionen zu ersetzen.
Dieser Artikel beantwortet genau diese Produktentscheidung. Für breiten Lesezugriff bei Recherche gibt es unseren Agent-Reach-Test. Wer Browser-Infrastruktur auswählt, sollte den Lightpanda-Produktionstest lesen. Die vollständige Wirtschaftlichkeit erklärt der Preis pro akzeptierter Agent-Aktion.
Steckt ein Prozess hinter Portalen, Formularen und Kundenseiten fest?
Computer-Use-Pilot planenWas ist Hark Handoff?
Hark Handoff ist ein Computer-Use-Agent für längere Aufgaben auf echten Websites, die er über einen virtuellen Computer bedient. Hark stellt nach eigener Aussage für jede Anfrage eine eigene Umgebung mit Browser, Dateisystem und Terminal bereit. Der Agent erzeugt Cursor- und Tastaturaktionen, beobachtet den neuen Zustand und arbeitet bis zu einem Ergebnis weiter.
In Harks offizieller Handoff Research Preview heißt es, 74,9% von fast drei Millionen beobachteten Bildschirmminuten entfielen auf den Browser und weniger als eine von tausend Websites biete eine öffentliche API. Das sind Angaben des Anbieters, keine unabhängige Vollerhebung. Die kommerzielle Lücke beschreiben sie trotzdem treffend: Wichtige Arbeit steckt weiterhin hinter Oberflächen für Menschen.
Der Produktname erklärt das Versprechen. Nutzer übergeben ein Ziel, statt ein Makro aufzuzeichnen oder jeden Selektor zu spezifizieren. Das Modell soll eine neue Seite verstehen, den nächsten Schritt wählen und sich an Abweichungen anpassen.
Wie funktioniert Hark Handoff?
- Du beschreibst das Ergebnis. Zum Beispiel einen passenden Flug finden, Essen bestellen oder eine Shortlist recherchieren.
- Hark startet einen isolierten virtuellen Computer. Die Umgebung enthält Browser und allgemeine Computer-Tools.
- Handoff beobachtet und handelt. Er zielt auf Bildschirmkoordinaten, klickt, tippt, scrollt und liest den neuen Zustand.
- Der Agent hält den Task State. In den Demos arbeitet er über viele Schritte und mehrere Websites.
- Verknüpfte Accounts liefern Kontext. Laut Hark kann Handoff gespeicherte Adressen, Präferenzen und Verlauf verwenden.
Diese Wahrnehmungs-, Aktions- und Feedbackschleife ähnelt eher einem Roboter als einer klassischen API-Integration. Das ist kein Zufall. Die offizielle Biografie von Hark-Gründer Brett Adcock beschreibt Figure als Versuch, KI einen Körper zu geben. Handoff richtet dasselbe Systemproblem auf unberechenbare digitale Oberflächen: Umgebung wahrnehmen, Aktion wählen, Ergebnis prüfen und anpassen.
Was kann Handoff heute?
Die Research Preview zeigt sechs nützliche Aufgabenfamilien. Sie belegen Breite, aber noch keinen Servicekatalog und keine Zuverlässigkeitsgarantie.
| Aufgabenfamilie | Gezeigtes Beispiel | Möglicher Geschäftsprozess |
|---|---|---|
| Essensbestellung | DoorDash und Restaurantseiten | Routineeinkauf bei Lieferanten ohne gemeinsame API |
| Shopping | Preissuche und Checkout bei großen Händlern | Kleine Beschaffung, Bestandsprüfung und Angebotsvergleich |
| Reservierungen | OpenTable und Restaurantseiten | Terminplanung über Partnerportale |
| Recruiting | Kandidaten auf LinkedIn finden und anschreiben | Recherche und vorbereiteter Outreach mit Freigabe |
| Recherche | Reviews, Reddit und News abgleichen | Belege aus wechselnden öffentlichen Quellen sammeln |
| Reise | Flüge über mehrere Airlines vergleichen und buchen | Multi-Vendor-Suche mit kontrollierter Transaktion |
Die Alltäglichkeit ist der Punkt. Ein Lieferantenformular kann zu klein für eine individuelle Integration und zu wechselhaft für ein fragiles Makro sein. Ein allgemeiner Agent macht die Oberfläche programmierbar, ohne auf eine neue API des Seitenbetreibers zu warten.
Wie belastbar sind Harks Benchmark-Aussagen?
Die Ergebnisse sind vielversprechend. Käufer sollten aber den öffentlichen Benchmark von Harks internen Evaluierungen trennen. Hark meldet Platz eins im menschlich bewerteten Online-Mind2Web-Leaderboard und im Mittel bessere Ergebnisse als benannte Frontier-Modelle über drei Browser-Evaluierungen. WebTailBench und Harks interne Evaluation liefen laut Launch-Artikel im eigenen Hark Harness.
Das Online-Mind2Web-Forschungspapier ist eine hilfreiche Primärquelle. Es definiert 300 Aufgaben auf 136 echten Websites und berichtet rund 85% Übereinstimmung zwischen automatischem Judge und menschlicher Bewertung. Echte Websites sind realistischer als eingefrorene Seiten, verändern sich aber zwischen Läufen. Der Benchmark misst breite Web-Kompetenz. Er beweist keine Erfolgsrate mit deinen Accounts, Regeln, Daten und Monatsvolumen.
Was der Benchmark Käufern sagt und was nicht
| Signal | Was es stützt | Was offenbleibt |
|---|---|---|
| Erfolg auf Live-Sites | Das Modell kann unterschiedliche, wechselnde Oberflächen bedienen | Wiederholbare End-to-End-Rate deines Prozesses |
| Relativer Modellscore | Handoff wirkt gegenüber aktuellen Alternativen konkurrenzfähig | Leistung nach Website- und Modelländerungen |
| Modelllatenz und Tokenpreis | Das Basismodell kann wirtschaftlich sein | Browserzeit, Retries, Review, Support und Fehlerkosten |
| Gute Live-Aufnahmen | Die gezeigten Aufgaben sind technisch möglich | Fehlerverteilung über gewöhnliche, unkuratierte Läufe |
Frage nach Pass Rates pro Aufgabenfamilie, Varianz über Wiederholungen, Eingriffsquote, Timeout-Policy, Behandlung fehlgeschlagener Transaktionen und exaktem Nenner. Das Leaderboard gehört in die Vendor Discovery. Dein Acceptance Set gehört in die Beschaffung.
Handoff vs API, RPA und Browser-Automation: Was passt?
Verwende die engste zuverlässige Schnittstelle, die das Geschäftsproblem löst. Ein Computer-Use-Agent ist wertvoll, weil er Lücken zwischen Systemen abdeckt. Das macht Pixel und Klicks nicht zur besten Schnittstelle für jedes unterstützte System.
| Ansatz | Beste Eignung | Hauptschwäche |
|---|---|---|
| Offizielle API | Stabile, hochvolumige Prozesse mit unterstützten Objekten und Rechten | Gewünschte Aktion oder Website fehlt möglicherweise |
| Deterministische Browser-Automation | Bekannter, wiederholter Ablauf auf recht stabiler Oberfläche | Selektoren und Pfade brechen bei UI-Änderungen |
| Klassische RPA | Regelbasierte Arbeit in kontrollierten Desktop-Programmen | Änderungen und Ausnahmen werden teuer |
| Computer-Use-Agent wie Handoff | Unregelmäßige Cross-Site-Aufgabe mit visueller Logik und Recovery | Probabilistisches Verhalten, Latenz, Sicherheit und schwierige Validierung |
| Individuelle Hybridintegration | Wertvoller Prozess, bei dem APIs den Kern und GUI-Aktionen einzelne Lücken abdecken | Braucht Product Engineering und laufende Ownership |
| Mensch | Seltene, sensible oder unklare Ausnahme mit hohem Schaden | Kosten, Wartezeit und begrenzte Skalierung |
Ein gutes Produktionsdesign nutzt oft drei Spuren. APIs übernehmen deterministische Reads und Writes. Computer Use deckt wenige Portale und Ausnahmen ohne brauchbare Schnittstelle ab. Ein Mensch genehmigt Geldbewegung, externe Kommunikation, rechtliche Bindung und unklare Fälle.
Was kostet Hark Handoff?
Bei unserer Prüfung am 7. August 2026 hatte Hark keinen allgemeinen Preis, Enterprise-Vertrag oder öffentliches Service Level für Handoff veröffentlicht. Hark meldet niedrigere Modellkosten pro Token als bei Frontier-Alternativen. Für Käufer zählt jedoch der Gesamtpreis pro akzeptierter Aufgabe, nicht der Tokenpreis.
Rechne virtuellen Computer, Modellschritte, Browserlatenz, Retries, Captchas oder Blockaden, menschliche Freigabe, Fehlkäufe, Credential-Betrieb, Observability und Wartung ein. Ein günstiges Modell kann einen teuren Prozess erzeugen, wenn es viele Schritte oder häufige Rettung braucht. Nutze unseren Kostenleitfaden für Agent-Aktionen, bevor du ein Angebot mit interner Arbeit vergleichst.
Ist Hark Handoff sicher für Unternehmen?
Ein eigener virtueller Computer ist ein guter Isolationsbaustein, aber noch kein vollständiges Sicherheitsmodell. Handoff kann bösartige Seiteninhalte sehen, während er angemeldet ist und klicken darf. Damit treffen nicht vertrauenswürdiger Input und echte Berechtigung zusammen.
NISTs Analyse zu Agent Hijacking von 2026 umfasst mehr als 250.000 Angriffsversuche gegen 13 Frontier-Modellziele. Gegen jedes Ziel wurde mindestens ein erfolgreicher Hijacking-Angriff gefunden. Das ist keine Handoff-Evaluation. Es zeigt aber, warum Browser-Agenten unter der Annahme gebaut werden müssen, dass sie irgendwann manipulierte Anweisungen sehen.
Pflichtkontrollen vor einem echten Piloten
- Eigene Identitäten: Ein Pilot-Account erhält nur Daten, Guthaben und Rechte für einen Prozess.
- Freigabegrenzen: Pause vor Checkout, Buchung, Nachricht, Zustimmung zu Bedingungen, ausführbarem Download oder Account-Änderung.
- Task-begrenzte Secrets: Credentials nur für relevante Site und Run bereitstellen, danach widerrufen oder rotieren.
- Vollständige Belege: Ziel, Seitenzustände, Aktionen, Freigaben, Beleg und Fehlergrund erhalten.
- Netzwerk- und Dateiregeln: Ziele, Downloads, Uploads und Terminalbefehle auf den Pilotbedarf begrenzen.
- Manueller Fallback: Unsicherheit, Blockaden und abweichende Summen ohne State-Verlust an Menschen übergeben.
- Terms und Daten prüfen: Account-Automation, Aufbewahrung und Modellverarbeitung müssen zulässig sein.
NISTs Taxonomie für Agent-Tool-Zugriff ordnet Browser Use einer nicht vertrauenswürdigen Umgebung mit begrenztem Schreibzugriff zu, allgemeines Computer Use der breiteren Write-Kategorie. Daraus folgt eine praktische Architekturregel: Gib dem Agenten weniger Autorität, als die virtuelle Maschine technisch erlaubt.
Welche Geschäftsprozesse passen?
| Prozess | Pilot-Eignung | Nötige Grenze |
|---|---|---|
| Angebote mehrerer Lieferanten sammeln | Stark | Read-only, Quellenbeleg und Ablaufdatum |
| Reisevergleich | Vor Kauf stark | Mensch bestätigt Reisedaten, Preis und Buchung |
| Kleine Routineeinkäufe | Bedingt | Erlaubte Anbieter, hartes Limit und Belegprüfung |
| Kandidatenrecherche | Bedingt | Menschliches Review, zulässige Datenregeln und Freigabe vor Outreach |
| Dateneingabe in Portale | Bei mittlerem Volumen stark | Schema-Validierung, Duplikatschutz und Audit Log |
| Zahlung, regulierte Meldung oder Vertragsannahme | Schlecht für Autonomie | API oder enges System mit namentlicher Freigabe |
Die beste erste Aufgabe ist lästig, wertvoll, einfach prüfbar und günstig umkehrbar. Die schlechteste ist vage, folgenreich und nicht auditierbar. „Sammle drei vergleichbare Lieferantenangebote“ ist ein Pilot. „Erledige die Beschaffung“ ist eine Haftungsaussage in Prompt-Form.
Wie sollte ein Unternehmen Hark Handoff pilotieren?
- Einen begrenzten Prozess wählen. Friere 30 bis 50 typische Aufgaben ein, einschließlich schwieriger Seiten, abgelaufener Sessions und nicht verfügbarer Optionen.
- Menschliche Baseline messen. Completion, Zeit, Review, Fehlerquote und Arbeit erfassen.
- Akzeptanz vor der Demo definieren. Korrektes Ergebnis, Pflichtbelege, verbotene Aktionen und Freigabepunkte festlegen.
- Wegwerfidentität verwenden. Mit synthetischen oder wenig wertvollen Daten, engen Rechten und hartem Transaktionslimit starten.
- Versuche wiederholen. Ein Video ist kein Nenner. Aufgaben an verschiedenen Tagen wiederholen und Fehler erhalten.
- Alternativen vergleichen. Offizielle API, deterministisches Skript, Hybriddesign und manuellen Ist-Prozess bepreisen.
- Nur die Gewinner-Spur skalieren. Ausnahmen manuell lassen und stabile Teilprozesse bei guter Wirtschaftlichkeit in APIs verschieben.
Scorecard für den Computer-Use-Piloten
| Metrik | Definition | Warum sie zählt |
|---|---|---|
| Akzeptierte Ergebnisrate | Korrekte, belegte Ergebnisse geteilt durch alle geeigneten Aufgaben | Teilnavigation zählt nicht als Erfolg |
| Kosten pro akzeptiertem Ergebnis | Vendor, Runtime, Review und Fehler geteilt durch akzeptierte Ergebnisse | Macht Modellpreis mit Arbeit und APIs vergleichbar |
| Menschliche Eingriffsquote | Aufgaben mit Rettung über geplante Freigaben hinaus | Zeigt versteckten Betriebsaufwand |
| Rate unsicherer Aktionen | Verbotene oder falsch vorgeschlagene Aktionen pro Aufgabe | Misst Schaden, nicht nur Produktivität |
| Recovery Rate | Unerwartete UI- oder Sessionfehler ohne kaputten State gelöst | Testet den Kernvorteil gegenüber Skripten |
| Zeit bis zum Beleg | Zeit bis Reviewer ein nutzbares Ergebnis mit Trace haben | Erfasst Browserlatenz und Review gemeinsam |
Unser 30-60-90-Tage-Plan für Agent-Piloten liefert den Governance-Rhythmus. Die Security-Checkliste für Agent-Eval-Sandboxes vertieft Isolation, Secrets, Netzwerkregeln und Belege.
Handoff kaufen oder eigenen Computer-Use-Prozess bauen?
Kaufe oder pilotiere Handoff, wenn allgemeine Web-Kompetenz die knappe Fähigkeit ist. Baue einen Hybrid, wenn dein Vorteil in Prozessregeln, eigenen Daten, Freigaben und internen Integrationen steckt. Ein allgemeines Computer-Use-Modell zu trainieren ist kein normales Produkt-Backlog. Orchestrierung um ein Spezialmodell zu besitzen schon.
Frage Hark vor der Beschaffung nach regionaler Verfügbarkeit, Datenverarbeitung, Aufbewahrung, Account-Anbindung, Modelltraining, Audit-Export, Freigaben, Benchmark-Traces, Support, Incidents, Parallelität, Limits, Preisen und Kündigung. Danach muss dein Team entscheiden, welche Controls außerhalb der Vendor-Grenze bleiben.
Wavects KI-Produktentwicklung kann diese Grenze planen und API-, Policy- sowie Review-Schichten um einen Piloten bauen. Die Twinsoft-AI-Fallstudie zeigt unseren Umgang mit einem Produktionssystem. Der Leitfaden vom Prototyp zur Produktion hilft beim Hardening-Scope. Für einen konkreten Prozess kannst du eine Architekturprüfung anfragen.
Häufig gestellte Fragen
Was ist Hark Handoff?
Kann Hark Handoff Essen bestellen und Flüge buchen?
Ist Hark Handoff bereits verfügbar?
Was kostet Hark Handoff?
Ist Handoff besser als Browser-Automation?
Ist Hark Handoff sicher für Käufe und angemeldete Accounts?
Recherchegrenze
Geprüft am 7. August 2026 anhand von Harks Launch-Artikel und Website, Brett Adcocks offizieller Biografie, dem Online-Mind2Web-Papier und NIST-Material zur Agent-Sicherheit. Wir hatten keinen bezahlten Zugang, haben keinen persönlichen Account verbunden und keinen unabhängigen Handoff-Benchmark ausgeführt. Anbieterangaben sind als solche gekennzeichnet. Prüfe Verfügbarkeit, Preise, Controls und Verträge vor einer Kaufentscheidung.
Fazit
Hark Handoff ist wichtig, weil er die Fallback-Schnittstelle der Softwarewirtschaft, die für Menschen gebaute Website, für Agenten bedienbar macht. Damit werden vernachlässigte Portale, Cross-Site-Vergleiche und einmalige Formulare adressierbar, ohne auf die perfekte API jedes Anbieters zu warten.
Die beste Architektur macht Klicks nicht künstlich deterministisch. Sie schickt jede Aktion in die engste zuverlässige Spur: APIs für stabile Verträge, Computer Use für unregelmäßige Lücken und Menschen für folgenreiches Urteil. Pilotiere Handoff dort, wo Recovery mehr zählt als reiner Durchsatz, und verdiene Vertrauen mit Ergebnisbelegen, Berechtigungen und einem Fehlerweg.
