Zurück
Kevin Riedl

11 Min. Lesezeit · 13. Sep. 2026
Zuletzt geprüft

Weiter
Entsteht auf deinem Gerät, ohne Instagram-Verbindung. Den Beitragslink kopieren wir für deinen Link-Sticker.

OpenAI Agents API im Review: Migration, Kosten und Datenkontrollen

Mit der OpenAI Agents API wird der Codex-Agentenloop zum Managed Service. Berechtigungen, Abnahmetests und Anforderungen an deine Daten verschwinden dadurch nicht. Die relevante Kaufentscheidung lautet: Welche Infrastruktur kannst du abgeben, ohne die Kontrollen aufzugeben, die deine Kunden brauchen?

OpenAI hat die öffentliche Beta am 10. September 2026 angekündigt. Die Veröffentlichung zur Agents API beschreibt automatische Kontextkomprimierung, Tool-Suche, programmatische Tool-Aufrufe und parallele Subagenten sowie unterschiedliche Ausführungsumgebungen. Hier geht es um diese konkrete Produktentscheidung. Die allgemeine Architektur erklärt unser Beitrag zum KI-Agenten-Harness.

Was die Zahlen zum Start tatsächlich aussagen

Die Zahlen stammen von unterschiedlichen Kunden in OpenAIs Ankündigung. Sie rechtfertigen einen Test, sind aber weder ein gemeinsamer Benchmark noch ein Leistungsversprechen für deinen Anwendungsfall.

KundeBerichtetes ErgebnisUnzulässige Schlussfolgerung
CiridaeBewertung von 0,71 auf 0,85; vierfache Verbesserung der LatenzAllgemeingültige Genauigkeit oder jede Aufgabe viermal schneller
SafetyKit60 % geringere Kosten je Fall bei gleichbleibender Leistung60 % Rabatt auf die gesamte Agenteninfrastruktur
Hypha86 % weniger fehlgeschlagene AgentenantwortenEine Verbesserung um 86 Prozentpunkte oder eine bekannte absolute Fehlerquote

Ein gemeinsamer Aufgabensatz, die Stichprobengrößen und eine unabhängige Reproduktion fehlen in diesen Kundenstimmen. Ciridaes Veränderung beträgt absolut 0,14 Bewertungspunkte. Ohne Bewertungsmaßstab lässt sich daraus keine allgemeine Antwortgenauigkeit ableiten. Vergleiche stattdessen beide Systeme anhand von Aufgaben, deren Ergebnis du selbst prüfen kannst.

Agents API, Agents SDK und Responses API im Vergleich

Die Namen ähneln sich, die Betriebsverantwortung nicht. OpenAIs Vergleich von SDK und Responses API trennt einen durch das SDK ausgeführten Loop von eigener Orchestrierung. Mit der Managed Agents API kommt eine weitere Betriebsoption hinzu.

AnsatzWer betreibt den Loop?Wann er passt
Responses APIDeine Anwendung orchestriert die ModellaufrufeEnger Workflow mit eigener Verzweigungslogik und direkter Kontrolle
Agents SDKDas SDK führt den Loop in deinem Anwendungsbetrieb ausKontrolle über Zustand, Tools, Freigaben und Infrastruktur im eigenen Code
Managed Agents APIOpenAI betreibt den Codex-Harness; du wählst die AusführungsumgebungWeniger Pflege allgemeiner Infrastruktur für lang laufende Agenten

Bei eigenen Funktionen bleibt die Ausführung im dokumentierten Responses-Tool-Ablauf bei deiner Anwendung: vorgeschlagenen Aufruf entgegennehmen, Code ausführen, Ergebnis zurückgeben. Ein anderer API-Client migriert weder diese Funktionen noch Authentifizierung oder Freigaben automatisch. Erstelle zuerst ein Verzeichnis der Aufgaben deines bisherigen Harness.

Auch Ramp Inspect mit einer Sandbox je Sitzung behandelt einen anderen Schwerpunkt. Die Sandbox stellt die Ausführungsumgebung bereit. Ein Managed Harness liefert zusätzlich die Orchestrierung. Die Beschaffung des einen ersetzt nicht automatisch das andere.

Drei Deployment-Prüfungen, die wichtiger sind als die Demo

Trenne den Betriebsort des Harness, die Tool-Ausführung und die Speicherung des Zustands. Eine Sandbox in deinem Netz verschiebt OpenAIs Managed Harness nicht in dieses Netz. Argumente und Tool-Ergebnisse können die Grenze weiterhin überschreiten. OpenAIs Dokumentation zu Datenkontrollen unterscheidet Anwendungszustand, Aufbewahrung zur Missbrauchserkennung und Eignung einzelner Endpunkte. Eine Freigabe für einen Endpunkt belegt keine Freigabe für einen anderen.

PrüfungErforderlicher NachweisGrund zum Anhalten
Datenresidenz und VerarbeitungRegionen für konkreten Endpunkt, Modell, Sitzungszustand, Tools und UmgebungDer geforderte ausschließlich europäische Datenpfad ist nicht bestätigt
Aufbewahrung und LöschungEignung der Agents API für eure Vereinbarung; Lebenszyklus von Sitzungen, Dateien, Traces und BackupsZero Data Retention ist vorgeschrieben, aber nicht für die Funktion nachgewiesen
Isolation und BereinigungPfade für Credentials, Mounts, Netzwerk, geteilte Subagentenressourcen, Abbruch und Sandbox-AbbauMandantentrennung oder Abbruch mit Zustandsabgleich sind nicht belegbar

Grenze dieses Reviews, 13. September 2026: Die Ankündigung und der allgemeine Datenleitfaden waren abrufbar, die neu verlinkte Agents-API-Übersicht dagegen nicht. Deshalb stellen wir weder US-only-Verfügbarkeit noch fehlende Zero-Data-Retention-Eignung oder eine bestimmte Sitzungsaufbewahrung als verifizierte Endpunkt-Fakten dar. Prüfe die aktuelle Übersicht erneut und hole eine schriftliche Bestätigung für dein Deployment ein, bevor sensible Daten übertragen werden.

Das bedeutet nicht, dass sämtliche europäischen oder regulierten Projekte verboten wären. Es bedeutet, dass eine Produktionsfreigabe warten sollte, wenn ein benötigter Kontrollnachweis fehlt. Ein Pilot mit synthetischen Daten kann technische Fragen klären, ohne die Beschaffungsprüfung vorwegzunehmen. Unser Leitfaden zur EU-Datenresidenz für KI-Anwendungen behandelt die übergreifende Architektur.

Keine Plattformgebühr bedeutet nicht kostenlose Ergebnisse

Laut Ankündigung fällt keine zusätzliche Agents-API-Gebühr an. Kalkuliere Modellnutzung, Tools und Ausführung gesondert anhand der aktuellen Preisdokumentation. Übertrage weder den Sandbox-Preis eines anderen Anbieters noch ein Modell-Abonnementkontingent ungeprüft in ein API-Budget.

Kosten je abgenommener Aufgabe =
  (Modell + Tools + Rechenleistung + Wiederholungen + Prüfung + Betrieb)
  / unabhängig abgenommene Aufgaben

Ein Rechenbeispiel, keine OpenAI-Preisauskunft: 100 Versuche verursachen 30 € Maschinenkosten und 70 € Prüfaufwand. Bei 80 abgenommenen Ergebnissen kostet jedes 1,25 €. Sinkt der Maschinenanteil auf 12 €, steigen aber die Prüfkosten auf 100 € und bestehen nur 70 Ergebnisse, werden daraus 1,60 €. Ein billigerer Aufruf kann den Prozess verteuern.

Bei Subagenten ist das besonders wichtig. Begrenze zunächst die Parallelität, erfasse die gesamte Nutzung eines Laufs und unterscheide Wartezeit von Rechenverbrauch. Parallele Arbeit kann schneller fertig sein und trotzdem mehr kosten. Prüfe auch die Kontextkomprimierung: Die Kürzung darf keine Information verlieren, die zur Abnahme erforderlich ist.

Ein minimales Beispiel ohne Produktivzugriff

Das JavaScript-Beispiel folgt der Sitzungserstellung aus OpenAIs Veröffentlichung. Es nutzt erfundene Daten, verbindet keine Geschäftssysteme und verlangt eine ausdrückliche Aktivierung der kostenpflichtigen Ausführung. Es ist kein fertiger Dienst. Der Installer dieses Artikels führt das Beispiel nicht aus und richtet keinen Agenten in deinen Systemen ein.

import OpenAI from "openai";

// Opt in explicitly: this example can incur API and compute charges.
if (process.env.RUN_PAID_AGENTS_DEMO !== "yes") {
  throw new Error("Set RUN_PAID_AGENTS_DEMO=yes to enable this demo.");
}
if (!process.env.OPENAI_API_KEY) {
  throw new Error("OPENAI_API_KEY is required on the server.");
}

const client = new OpenAI({ maxRetries: 0 });
if (!client.beta?.agents?.sessions?.create) {
  throw new Error("Install an OpenAI SDK version supporting Agents API beta.");
}

try {
  const session = await client.beta.agents.sessions.create({
    agent: {
      model: process.env.OPENAI_AGENT_MODEL || "gpt-6-astra",
      multi_agent: { enabled: true, max_concurrent_subagents: 2 },
    },
    environment: { type: "openai_hosted" },
    input:
      "Use only these fictional facts: Service A had 4 errors in 100 requests; " +
      "Service B had 9 errors in 300 requests. Compare the error rates, " +
      "have a second agent check the arithmetic, and save a short report " +
      "under /workspace/outputs. Do not contact external services.",
  });
  console.log(JSON.stringify({ session_id: session.id }));
} catch (error) {
  // Do not dump prompts, credentials or the complete server response.
  console.error("Session creation failed. Reconcile its status before retrying.");
  process.exitCode = 1;
}

Nutze eine SDK-Version mit der Beta-Ressource und fixiere sie nach der Prüfung. Ausführen solltest du das Beispiel nur serverseitig mit freigegebenem Projekt und Modell. Eine ausgegebene Sitzungs-ID belegt keinen fertigen Bericht. Beobachtung des dokumentierten Sitzungslebenszyklus, Abbruch, Abruf der Artefakte und Bereinigung gehören in die Integration. Automatische Wiederholungen der Erstellung sind hier deaktiviert, damit ein unklarer Netzwerkfehler nicht blind einen zweiten Auftrag auslöst. Die Anweisung, keine externen Dienste zu kontaktieren, ersetzt keine technisch durchgesetzte Netzwerkrichtlinie.

Migration ohne Verlust der Geschäftskontrollen

Beginne mit einer klaren Adaptergrenze: Eine Aufgabe geht hinein, eine Sitzungsreferenz und später ein Artefakt kommen heraus. Aufgaben-ID, Autorisierung, Tool-Berechtigungen, Freigaben und Abnahmeergebnis bleiben außerhalb der Modellanweisungen. OpenAIs MCP-Sicherheitsleitfaden betont das Vertrauen in externe Server, Prompt Injection und Freigaben bei sensiblen Aktionen. Nutze den Freigabemechanismus deiner tatsächlichen API, statt Felder eines anderen Endpunkts zu übernehmen.

PhaseÄnderungAbnahmenachweis
AusgangsmessungRepräsentative Aufgaben und bestehende Implementierung festhaltenAbgenommene Ergebnisse, Prüfzeit, Latenzverteilung und Gesamtkosten
Paralleler TestbetriebManaged Pfad mit synthetischen oder freigegebenen Lesedaten testenKeine unerwünschten Schreibaktionen; vergleichbare Ergebnisse mit Quellen
Begrenzte EinführungEinen reversiblen Workflow mit begrenzten Rechten aktivierenMandantentrennung, Wiederholungsabgleich und menschliche Freigaben bestehen
AusweitungVolumen erst nach wiederholter Abnahme steigernStabile Qualität und Kosten sowie getesteter Rückweg

Trenne zwei Experimente. Mit gleichem Modell und gleichen Tools lässt sich der Orchestrierungswechsel besser isolieren. Der Vergleich der jeweils besten tragfähigen Gesamtsysteme beantwortet die wirtschaftliche Frage, erlaubt aber keine vollständige Zuschreibung an den Harness. OpenAIs Eval-Leitfaden empfiehlt aufgabenspezifische Tests und kontinuierliche Bewertung. Ergänze reale Fehlerfälle statt nur einer überzeugenden Demo.

Unser vorgeschlagenes Testset enthält einen Timeout nach möglicherweise erfolgreichem Schreibvorgang, doppelte Eingaben, abgelaufene Credentials, widersprüchliche Subagentenergebnisse, versteckte Anweisungen in Dokumenten, einen Verbindungsabbruch und eine Information, die die Komprimierung überstehen muss. Ein Ersatzpfad muss zuerst den ursprünglichen Auftrag abgleichen. Sonst wiederholt er möglicherweise genau die Aktion, deren Ausfall er beheben sollte.

Sieben überschaubare Agentenpiloten

Dies sind Vorschläge, keine Behauptungen über sieben bereits produktiv validierte Wavect- oder OpenAI-Lösungen. Jeder Pilot liefert ein prüfbares Ergebnis und lässt sich ohne autonome Geschäftsschreibrechte starten.

PilotErgebnisAnfängliche Grenze
Incident-Belege zusammenstellenZeitleiste mit Log-QuellenBereinigte Telemetrie nur lesen; keine Deployment-Änderung
Repository-Änderung bewertenAuswirkungsbericht mit TestvorschlägenFreigegebener Code-Stand; keine Merge-Credentials
Supportfall untersuchenAntwortentwurf mit QuellenBegrenzte Datensätze; Versand durch einen Menschen
Dokumente abgleichenUnterschiede und offene WidersprücheFreigegebene Dokumente; keine Änderung maßgeblicher Daten
Lieferantennachweise prüfenListe fehlender BelegeKeine Compliance-Zertifizierung oder Kaufentscheidung
Release-Reife prüfenCheckliste auf Basis von TestergebnissenKeine Release- oder Deployment-Berechtigung
Öffentliche Quellen recherchierenBriefing mit zuordenbaren QuellenKeine vertraulichen Prompts oder automatische Veröffentlichung

Wann migrieren, wann den eigenen Harness behalten?

Prüfe die Managed API, wenn die Pflege lang laufender Orchestrierung viel Kapazität bindet und Daten-, Tool- sowie Vertragsanforderungen erfüllbar sind. Bleibe beim bisherigen Ansatz, wenn er einfach und zuverlässig funktioniert, wichtige Fähigkeiten fehlen oder nötige Deployment-Kontrollen ungeklärt sind. Eine attraktive Produkteinführung ist kein Grund, einen stabilen Transaktionsprozess neu zu bauen.

OpenAIs Empfehlungen für den Produktivbetrieb behandeln Kapazität, Kostenkontrolle und Sicherheit. Benenne für diese Migration Verantwortliche für Versionswechsel, Regressionstests, Nutzungsabgleich und Vorfälle. Halte Konfigurationen sowie einen Exportpfad für Aufgabenstatus und abgenommene Artefakte vor. Eine anbieterspezifische Sitzungs-ID sollte nicht der einzige Geschäftsdatensatz sein.

Wavects KI-Beratung und Umsetzung unterstützt beim Eingrenzen von Datenpfad, Tool-Verträgen und Abnahmetests. Die Twinsoft-AI-Fallstudie zeigt angrenzende Umsetzungserfahrung, keinen Agents-API-Benchmark. Unser Vergleich zwischen Individual- und Standardsoftware hilft bei der Verantwortungsentscheidung. Für eine klar eingegrenzte Agents-API-Migrationsprüfung sind dein Workflow, heutige Kosten und erforderliche Kontrollen der richtige Ausgangspunkt.

Häufige Fragen

Ersetzt die Agents API das Agents SDK?
Die Verantwortung liegt anders. Bei der Managed API betreibt OpenAI den Harness. Das SDK führt den Loop in deiner Anwendung aus. Entscheide nach Kontrolle, Datenanforderungen und gemessenen Betriebskosten.
Sind die Zahlen 4x, 60 % und 86 % ein gemeinsamer Benchmark?
Nein. Ciridae berichtet über Bewertung und Latenz, SafetyKit über Kosten je Fall und Hypha über fehlgeschlagene Antworten. Es sind getrennte Kundenstimmen ohne Garantie für dein Ergebnis.
Ist die OpenAI Agents API kostenlos?
Die Ankündigung nennt keine zusätzliche API-Gebühr. Modellnutzung, Tools und Ausführung können trotzdem kostenpflichtig sein. Prüfung, Wiederherstellung und Betrieb gehören ebenfalls ins Budget.
Bleiben mit einer eigenen Sandbox alle Daten lokal?
Nicht automatisch. Tools können in deiner Infrastruktur ausgeführt werden, während der Managed Harness bei OpenAI bleibt. Untersuche Prompts, Ergebnisse, Sitzungszustand, Logs und Tool-Datenverkehr getrennt.
Ist die API für jedes EU-Projekt oder regulierte Geschäft freigegeben?
Aus der Ankündigung folgt weder eine pauschale Freigabe noch ein pauschales Verbot. Die neue endpunktspezifische Übersicht war hier nicht unabhängig abrufbar. Bestätige nötige Residenz-, Aufbewahrungs- und Vertragskontrollen vor sensibler Produktivnutzung.
Welche erste Migration ist sinnvoll?
Beginne mit synthetischen oder freigegebenen Lesedaten, einer reversiblen Aufgabe, unabhängiger Abnahme und begrenzter Parallelität. Prüfe Unterbrechung und Zustandsabgleich vor folgenreichen Schreibaktionen.

Hilfe für KI in Produktion

Du baust ein KI-Produkt und machst dir Sorgen um Inference-Kosten, Architektur oder Production Readiness? Wavect hilft Gründern, KI-Prototypen in zuverlässige Produktionssysteme zu verwandeln.

Passender Service:

Postfach, ohne Lärm

Folge der Arbeit, die für dich zählt

Du bekommst eine kurze E-Mail, wenn wir etwas Neues veröffentlichen. Folge dem ganzen Blog oder nur den Themen, die dich interessieren.

Was möchtest du erhalten?
Themen auswählen

Kostenlos, Double-Opt-in, ohne Tracking-Pixel.

Zurück
Kevin Riedl

11 Min. Lesezeit · 13. Sep. 2026
Zuletzt geprüft

Weiter

Erhalte die nächste Feldnotiz zu AI und Agents

Eine kurze E-Mail, wenn wir veröffentlichen. Ohne Tracking-Pixel und ohne Postfachfüller.

Kostenlos, Double-Opt-in, ohne Tracking-Pixel.