---
title: "AI Agent Cost per Action: Token-Kosten-Rechner"
canonical: https://wavect.io/de/blog/ai-agent-cost-per-action-2026/
language: de
description: "Warum sprengen agentische Workflows Token-Rechnungen? Berechne AI Agent Cost per Action für Support-Tickets, Rechnungen, PR-Reviews, Lead-Enrichment, Tools, Retries und Evals."
image: "https://wavect.io/img/blog/headers/header_ai-agent-cost-per-action-2026.png"
---

[**Zurück**](/de/blog/overview/)

[![Kevin Riedl](/img/team/kevin.webp)](/de/team/kevin-riedl/)

[Kevin Riedl](/de/team/kevin-riedl/) https://linkedin.com/in/wsdt

12 Min Lesezeit · 9. Juli 2026 Zuletzt geprüft 7. August 2026

[**Weiter**](/de/blog/local-models-vs-apis-break-even-eu-2026/)

# AI Agent Cost per Action: Warum agentische Workflows Token-Rechnungen sprengen

TL;DR

AI Agent Cost per Action ist der Gesamtpreis eines erfolgreichen Geschäftsergebnisses, nicht eines Modellaufrufs. Fehlversuche, Tool Calls, Retries, Freigaben, Eskalation und menschliche Nacharbeit bleiben im Zähler. Miss gelöste Tickets, extrahierte Rechnungen, reviewte Pull Requests oder angereicherte Leads. Senke Kosten mit vollständigen Traces, begrenzten Loops, weniger Tools, stabilem Cache-Kontext, günstigeren Modellen für einfache Schritte und Evals für die Qualität. Providerpreise sind eine Momentaufnahme vom Juli 2026 und müssen vor dem Budgetieren geprüft werden.

Passende Leistung: [KI Enablement](/de/services/ai-enablement/)

Executives kaufen keine Tokens. Gekauft werden erledigte Aktionen: ein gelöstes Support-Ticket, eine extrahierte Rechnung, ein reviewter Pull Request, ein angereicherter Lead, eine genehmigte Rückerstattung, ein triagierter Claim. Genau diese Einheit sollte dein Kostenmodell verwenden. Cost per Action ist der Gesamtpreis, um ein Geschäftsergebnis bis zu deinem Qualitätsniveau fertigzustellen, inklusive Modell-Calls, Tool-Calls, Retries, Verifier, Eskalationen, gecachten Tokens, nicht gecachten Tokens und menschlicher Korrektur.

Dieser Artikel ist enger als unser [LLM-Kostenrechner](/de/blog/llm-cost-calculator-2026/). Dort geht es um Cost per successful Task über LLM-Systeme hinweg. Hier geht es um agentische Workflows, bei denen die Rechnung wächst, weil der Agent loopt: planen, Tools aufrufen, Tool-Output lesen, Kontext erweitern, verifizieren, erneut versuchen und manchmal an einen Spezialisten übergeben. Genau diese Trace-Struktur muss in die Kostenrechnung.

## Was ist AI Agent Cost per Action?

AI Agent Cost per Action ist der Gesamtpreis eines abgeschlossenen Geschäftsergebnisses, nicht eines Modell-Calls. Dazu gehören Input Tokens, cached Input, Output Tokens, Tool-Schemas, Retrieval-Kontext, Tool-Observations, Retries, Verifier Calls, Eskalationen, menschliches Review und fehlgeschlagene Versuche, geteilt durch erfolgreiche Aktionen.

Cost per Action = (alle Modellkosten + Tool- und Retrieval-Kosten + Retry-Kosten + Verifier-Kosten + menschliche Nacharbeit) / erfolgreiche Aktionen.

Der Nenner ist entscheidend. Wenn ein Agent 10.000 Leads anreichert, aber nur 8.700 die Validierung bestehen, rechnest du mit 8.700. Fehlgeschlagene Aktionen sind nicht gratis. Diese Fehlversuche haben Tokens, Tools, Zeit und Vertrauen verbraucht.

## Warum Agents Tokens multiplizieren

Ein einzelner LLM-Call ist eine Zeile. Ein Agent Run ist ein Trace. ReAct machte das Muster bekannt: Sprachmodelle können Reasoning und Actions verschränken, um externe Informationen einzusammeln, bevor sie weitermachen. Das ist nützlich, verändert aber die Ökonomie. Jede Schleife trägt mehr History und mehr Observations weiter.

| Kostenmultiplikator | Was passiert | Warum die Rechnung wächst |
| --- | --- | --- |
| Planning | Der Agent fragt, was als Nächstes zu tun ist. | Planner-Prompts und Reasoning-Output entstehen vor der eigentlichen Arbeit. |
| Tool-Schemas | Funktionen, MCP-Tools, Permissions und Beispiele liegen im Kontext. | Statische Tool-Beschreibungen sind groß und wiederholen sich ohne Cache. |
| Tool-Observations | Suchresultate, CRM-Daten, Rechnungen, Diffs oder Logs gehen zurück ins Modell. | Jede Observation wird neuer Input im nächsten Schritt. |
| Retries | Schemafehler, Timeouts oder niedrige Confidence starten einen zweiten Versuch. | Der zweite Versuch trägt oft den ersten Versuch als Kontext mit. |
| Verification | Ein Modell oder Regelwerk prüft Grounding, Policy, Extraktion oder Code-Risiko. | Qualitätssicherung ist nötig, aber ein eigener Kostenblock. |
| Handoffs | Ein Generalist delegiert an einen Spezialisten. | Kontext wird kopiert, zusammengefasst oder neu erweitert. |

## Vier Beispiele, die das Management versteht

| Geschäftsaktion | Naive Annahme | Typischer Agent Trace | Kostenmetrik |
| --- | --- | --- | --- |
| Support-Ticket gelöst | Eine Antwort. | Klassifizieren, Policy holen, Account prüfen, Entwurf, Verifier, CRM-Update. | Kosten pro gelöstes Ticket, das QA besteht. |
| Rechnung extrahiert | Ein OCR plus JSON. | Datei lesen, Layout erkennen, Felder extrahieren, Vendor-Lookup, Summen prüfen, fehlende Felder wiederholen. | Kosten pro Rechnung ohne manuelle Korrektur. |
| PR reviewt | Ein Code-Review-Prompt. | Diff zusammenfassen, Dateien prüfen, Tests laufen lassen, Dependencies suchen, Findings verifizieren, Review schreiben. | Kosten pro PR mit brauchbaren Findings und wenigen False Positives. |
| Lead angereichert | Ein Enrichment-Call. | Web suchen, Firmenseite parsen, CRM prüfen, ICP fit klassifizieren, deduplizieren, score schreiben. | Kosten pro Lead, den Sales akzeptiert. |

## Der Action-Rechner

Lege eine Zeile pro Aktionstyp an. Support, Rechnungen, PR-Reviews und Leads gehören nicht in denselben Durchschnitt.

| Spalte | Beispiel | Warum sie zählt |
| --- | --- | --- |
| Aktionstyp | Support-Ticket gelöst | Business-Einheit statt API-Einheit. |
| Versuche pro Monat | 40.000 | Volumen vor Fehlern. |
| Success Rate | 86% | Macht aus Versuchen erfolgreiche Aktionen. |
| Modell-Calls pro Aktion | 4,7 im Schnitt | Planning, Drafting, Verification und Retries. |
| Tool-Calls pro Aktion | 3,2 im Schnitt | Search, CRM, Datenbank, Code, Browser oder Ticketsystem. |
| Nicht gecachter Input | 8.400 Tokens | Dynamische User-Daten, Tool-Resultate und Observations. |
| Gecachter Input | 18.000 Tokens | System Prompt, Tool-Schemas, Policies und Beispiele. |
| Output Tokens | 2.300 | Entwürfe, JSON, Review-Kommentare. |
| Retry Rate | 14% | Versteckte Schleifensteuer. |
| Eskalationsrate | 9% | Stärkeres Modell oder Mensch. |
| Menschliche Nacharbeit | 0,8 Minuten | Wandelt schlechte Qualität in Kosten um. |

## Beispiel: Support-Ticket gelöst

Ein Support-Agent soll Tier-1-Tickets lösen. Die Demo wirkte billig: ein Ticket, ein Modell-Call. Produktion ist anders. Der Agent klassifiziert, ruft Policies ab, prüft Accountdaten, schreibt eine Antwort, lässt Grounding prüfen und aktualisiert das Ticket. Einige Tickets brauchen Refund Approval, einige scheitern am Schema und laufen erneut.

| Schritt | Calls | Input-Muster | Hebel |
| --- | --- | --- | --- |
| Klassifizieren | 1 | Kurzes Ticket plus Taxonomie | Kleines Modell oder Regeln. |
| Policy abrufen | 1 Tool-Call | Suchquery und Snippets | Bessere Filter, kürzere Chunks. |
| Account prüfen | 1 Tool-Call | Status und Bestelldaten | Nur nötige Felder zurückgeben. |
| Antwort schreiben | 1 | Ticket, Policy, Account, Tone Guide | Statische Instruktionen cachen. |
| Grounding prüfen | 1 | Antwort plus Evidenz | Regeln oder günstiger Verifier zuerst. |
| Retry | 0,18 im Schnitt | Fehlendes Schema oder niedrige Confidence | Tool-Verträge fixen, bevor du das Modell wechselst. |

## Wo Caching hilft und wo es bricht

Prompt Caching ist bei Agents der erste Hebel, weil Tool-Schemas, Policies und Instruktionen wiederkehren. OpenAI nennt bis zu 80% geringere Latenz und bis zu 90% geringere Input-Token-Kosten, mit automatischem Caching ab 1.024 Tokens und exakten Prefix-Matches. Anthropic bepreist Cache Reads mit 0,1x Basis-Input, Gemini Paid Tiers enthalten Context Caching und Batch.

Agent-Kontext ist aber unordentlich. Forschung zu Prompt Caching in long-horizon agentischen Tasks fand 45% bis 80% API-Kostenreduktion, wenn Caching gut strukturiert ist. TokenPilot zeigt denselben Zielkonflikt: Wenn du Tokens sparst, aber den Prefix ständig veränderst, zerstörst du Cache-Hits.

Die Regel: Stabiles nach vorne, Volatiles nach hinten. System-Instruktionen, Tool-Schemas, Policies und Beispiele an den Anfang; Tickettext, Rechnungsseiten, Suchresultate, Diffs und Tool-Observations ans Ende.

## Wann Batch Geld spart

Batch-Rabatte sind stark, aber nur für Aktionen, die warten dürfen. OpenAI listet 50% Discount gegenüber synchronen APIs und Abschluss innerhalb von 24 Stunden. Anthropic nennt 50% Discount auf Input und Output Tokens. Gemini Paid Tier nennt Batch API mit 50% Kostenreduktion. Das passt zu Invoice Backlogs, Lead Enrichment, nightly QA, Eval Runs, Dokumentmigration und Offline-Klassifikation.

Live-Support, interaktives PR-Review und Fraud-Entscheidungen brauchen andere Hebel: weniger Loops, schärfere Tool-Verträge, kleinere Verifier-Modelle, besseres Caching und Routing über einen [LLM Gateway oder Router](/de/blog/llm-gateway-router-comparison-2026/).

## Wie du die Rechnung kontrollierst

1. **Trace jede Aktion.** Logge Action ID, Modell, Tool, Tokens, Cache Hits, Retry-Grund, Latenz, Status und Eval-Verdikt.
2. **Begrenze Loops.** Gib dem Agent maximale Tool-Calls und einen klaren Fallback.
3. **Trenne Planner, Worker und Verifier.** Nicht jeder Schritt braucht das teuerste Modell.
4. **Mach Tools schmal.** Gib fünf nötige Felder zurück, nicht das ganze CRM-Objekt.
5. **Cache statischen Kontext.** Halte Prefixe über Aktionen stabil.
6. **Batch Offline-Arbeit.** Leads, Rechnungen und Evals sollten keine Live-Preise zahlen, wenn sie warten können.
7. **Miss Erfolg statt Versuche.** Fehlgeschlagene Aktionen bleiben im Zähler.

## Qualität gehört in die Kosten

Der billigste Agent erzeugt oft Arbeit für andere Teams. Ein Support-Ticket mit falschem Ton, ein Lead, den Sales ablehnt, eine Rechnung mit korrigierten Feldern oder ein PR-Review voller False Positives hat seine versprochene Ersparnis nicht geliefert. Deshalb ist eine Aktion erst erfolgreich, wenn sie dein Business-Qualitätsniveau erreicht.

Für den Rollout-Plan siehe unseren [30/60/90-Tage-AI-Agent-Pilot](/de/blog/ai-agent-pilot-30-60-90-days/). Für das Scheitermuster siehe [warum AI-Agent-Projekte gecancelt werden](/de/blog/why-ai-agent-projects-get-cancelled/).

Wenn du nicht das Modell, sondern den Coding-Harness auswählst, trennt unser [Team-Kostenvergleich Claude Code vs OpenCode](/de/blog/claude-code-vs-opencode-team-cost-2026/) fixen Prompt-Overhead, Cache-Ökonomie, Abo-Preise und Kosten pro akzeptiertem Repository-Task.

Trenne dieses Betriebskostenmodell von Sprachforschung. Der [Semaprax Benchmark](/de/semaprax/benchmarks/) prüft, ob typisierter, begrenzter Compiler-Kontext Agentenarbeit reduzieren kann. Er misst aber noch keine Modelltokens, akzeptierten Aktionen oder Kosten und belegt daher keinen niedrigeren AI Agent Cost per Action.

Wenn deine Traces stark von großen Tool-Ausgaben geprägt sind, prüfe vor einem reinen Modellwechsel zuerst den [Codag-Ansatz für Coding Agent Output-Kompression](/de/blog/codag-cost-control/).

## Quellen und Live-Preis-Hinweis

Providerpreise und Agent-Plattformen bewegen sich schnell. Die Mechanik ist stabil, die Zahlen sind Snapshot vom Juli 2026. Prüfe [OpenAI Agents SDK](https://developers.openai.com/api/docs/guides/agents), [OpenAI Prompt Caching](https://developers.openai.com/api/docs/guides/prompt-caching), [OpenAI Batch API](https://developers.openai.com/api/docs/guides/batch), [Anthropic Pricing](https://platform.claude.com/docs/en/about-claude/pricing) und [Gemini Pricing](https://ai.google.dev/gemini-api/docs/pricing). Forschung: [ReAct](https://arxiv.org/abs/2210.03629), [Don't Break the Cache](https://arxiv.org/abs/2601.06007) und [TokenPilot](https://arxiv.org/abs/2606.17016).

So einen Trace auf vertretbare Kosten pro Aktion zu bringen ist Designarbeit: weniger Schritte, günstigere Modelle für die mechanischen davon, ein Retry-Budget und ein Eskalationspfad, der die Schleife stoppt. Genau das macht unser [KI Setup Service](/de/services/ai-enablement/), wenn der Agent intern läuft, und [KI-Softwareentwicklung in Österreich](/de/ai-software-development-austria/), wenn er in einem Produkt ausgeliefert wird. [Twinsoft AI](/de/case-studies/twinsoft-ai/) zeigt die Eval-Schicht, die die Zahlen ehrlich hält.

## Fazit

Agentische Workflows sprengen Token-Rechnungen, weil aus einer Anfrage ein Trace wird: planen, Tool aufrufen, Observation lesen, Entwurf schreiben, prüfen, retryen, eskalieren und speichern. Die richtige Einheit ist nicht ein Modell-Call oder eine Chat-Nachricht. Es ist eine erfolgreiche Geschäftsaktion.

Wenn du Cost per Action misst, wird Optimierung praktisch: jede Aktion tracen, Loops begrenzen, Tools verschlanken, statischen Kontext cachen, Offline-Arbeit batchen, günstige Schritte routen, Qualität prüfen und fehlgeschlagene Versuche im Zähler lassen.

## Das könnte dich auch interessieren..

[**LLM-Kostenrechner 2026** Der breitere Rechner für Cost per successful Task: cached Input, Batch, Routing, Retries, Self-Hosting und Eval-Qualität.](/de/blog/llm-cost-calculator-2026/) [**AI Enablement vs generische KI-Beratung** Die eine liefert Strategiefolien. Das andere shippt ein funktionierendes Setup auf deiner Infrastruktur, das dein Team besitzt.](/de/compare/ai-enablement-vs-generic-ai-consultancy/)

## Primärquellen für diesen Leitfaden

Nutze Tracing und Risikomanagement als stabile Methode und aktualisiere anschließend die Preise für deinen tatsächlichen Modellmix.

- [OpenAI Agents Guide](https://developers.openai.com/api/docs/guides/agents)
- [OpenAI API Pricing](https://openai.com/api/pricing/)
- [NIST AI Risk Management Framework](https://www.nist.gov/itl/ai-risk-management-framework)

Agent Engineering

## In diesem Cluster weiterlesen

Coding Agents, MCP, Kontextsysteme, Evaluation und Kontrollen für verlässliche Automatisierung.

[Mit dem Grundlagenartikel starten**Graph Engineering für KI-Agenten: Wann lohnt sich ein Knowledge Graph?**](/de/blog/graph-engineering-ai-agents/)

- [Graft Review 2026: Gehört die Repo-Map ins Git?](/de/blog/graft-review-agent-repo-map/)
- [Wie du Coding-Agenten mit Tool-Ausgabe-Kompression skalierbar machst](/de/blog/codag-cost-control/)
- [Intelligenterer Token-Einsatz mit deinem AI-Coding-Agenten](/de/blog/smarter-token-usage-with-your-ai-coding-agent/)
- [DeepSeek Harness im Test: Ist der Plugin-Stack produktionsreif?](/de/blog/deepseek-harness-enterprise-review/)
- [OpenSandbox im Review: Lohnt sich Self-Hosting?](/de/blog/opensandbox-ai-agent-sandbox-review/)

Postfach, ohne Lärm

## Folge der Arbeit, die für dich zählt

Du bekommst eine kurze E-Mail, wenn wir etwas Neues veröffentlichen. Folge dem ganzen Blog oder nur den Themen, die dich interessieren.

[**Zurück**](/de/blog/overview/)

[![Kevin Riedl](/img/team/kevin.webp)](/de/team/kevin-riedl/)

[Kevin Riedl](/de/team/kevin-riedl/) https://linkedin.com/in/wsdt

12 Min Lesezeit · 9. Juli 2026 Zuletzt geprüft 7. August 2026

[**Weiter**](/de/blog/local-models-vs-apis-break-even-eu-2026/)

Neue Beiträge per E-Mail ×

×

Neue Beiträge per E-Mail

Eine kurze E-Mail, wenn wir etwas veröffentlichen. Kostenlos, ohne Tracking.

## Structured Data

```json
{
  "@context": "https://schema.org",
  "@graph": [
    {
      "@id": "https://wavect.io/#organization",
      "@type": [
        "Organization",
        "ProfessionalService",
        "LocalBusiness"
      ],
      "employee": [
        {
          "@id": "https://wavect.io/team/kevin-riedl/#person",
          "@type": "Person",
          "jobTitle": "Managing Director",
          "name": "Kevin Riedl",
          "url": "https://wavect.io/team/kevin-riedl/",
          "worksFor": {
            "@id": "https://wavect.io/#organization",
            "@type": [
              "Organization",
              "ProfessionalService",
              "LocalBusiness"
            ]
          }
        },
        {
          "@id": "https://wavect.io/team/christof-jori/#person",
          "@type": "Person",
          "jobTitle": "Managing Director",
          "name": "Christof Jori",
          "url": "https://wavect.io/team/christof-jori/",
          "worksFor": {
            "@id": "https://wavect.io/#organization",
            "@type": [
              "Organization",
              "ProfessionalService",
              "LocalBusiness"
            ]
          }
        }
      ],
      "founder": [
        {
          "@id": "https://wavect.io/team/kevin-riedl/#person",
          "@type": "Person",
          "jobTitle": "Managing Director",
          "name": "Kevin Riedl",
          "url": "https://wavect.io/team/kevin-riedl/",
          "worksFor": {
            "@id": "https://wavect.io/#organization",
            "@type": [
              "Organization",
              "ProfessionalService",
              "LocalBusiness"
            ]
          }
        },
        {
          "@id": "https://wavect.io/team/christof-jori/#person",
          "@type": "Person",
          "jobTitle": "Managing Director",
          "name": "Christof Jori",
          "url": "https://wavect.io/team/christof-jori/",
          "worksFor": {
            "@id": "https://wavect.io/#organization",
            "@type": [
              "Organization",
              "ProfessionalService",
              "LocalBusiness"
            ]
          }
        }
      ],
      "legalRepresentative": [
        {
          "@id": "https://wavect.io/team/kevin-riedl/#person",
          "@type": "Person",
          "jobTitle": "Managing Director",
          "name": "Kevin Riedl",
          "url": "https://wavect.io/team/kevin-riedl/",
          "worksFor": {
            "@id": "https://wavect.io/#organization",
            "@type": [
              "Organization",
              "ProfessionalService",
              "LocalBusiness"
            ]
          }
        },
        {
          "@id": "https://wavect.io/team/christof-jori/#person",
          "@type": "Person",
          "jobTitle": "Managing Director",
          "name": "Christof Jori",
          "url": "https://wavect.io/team/christof-jori/",
          "worksFor": {
            "@id": "https://wavect.io/#organization",
            "@type": [
              "Organization",
              "ProfessionalService",
              "LocalBusiness"
            ]
          }
        }
      ],
      "name": "Wavect GmbH",
      "subjectOf": {
        "@id": "https://wavect.io/verified-claims.json#dataset",
        "@type": "Dataset",
        "creator": {
          "@id": "https://wavect.io/#organization",
          "@type": [
            "Organization",
            "ProfessionalService",
            "LocalBusiness"
          ]
        },
        "description": "A machine-readable registry of quantitative and qualitative claims published by Wavect, with review dates, localized page appearances and public third-party citations where available.",
        "inLanguage": "en",
        "isAccessibleForFree": true,
        "license": "https://creativecommons.org/licenses/by/4.0/",
        "name": "Wavect verified publication claims",
        "url": "https://wavect.io/verified-claims.json"
      },
      "url": "https://wavect.io/"
    },
    {
      "@id": "https://wavect.io/team/kevin-riedl/#person",
      "@type": "Person",
      "jobTitle": "Managing Director",
      "name": "Kevin Riedl",
      "sameAs": [
        "https://www.wikidata.org/wiki/Q139796365",
        "https://www.linkedin.com/in/wsdt",
        "https://github.com/wsdt"
      ],
      "url": "https://wavect.io/team/kevin-riedl/",
      "worksFor": {
        "@id": "https://wavect.io/#organization",
        "@type": [
          "Organization",
          "ProfessionalService",
          "LocalBusiness"
        ]
      }
    },
    {
      "@id": "https://wavect.io/team/christof-jori/#person",
      "@type": "Person",
      "jobTitle": "Managing Director",
      "name": "Christof Jori",
      "sameAs": [
        "https://www.wikidata.org/wiki/Q139796367",
        "https://www.linkedin.com/in/jocr77/",
        "https://github.com/jo-chris"
      ],
      "url": "https://wavect.io/team/christof-jori/",
      "worksFor": {
        "@id": "https://wavect.io/#organization",
        "@type": [
          "Organization",
          "ProfessionalService",
          "LocalBusiness"
        ]
      }
    },
    {
      "@id": "https://wavect.io/#website",
      "@type": "WebSite",
      "inLanguage": [
        "en",
        "de",
        "es",
        "zh"
      ],
      "name": "Wavect",
      "potentialAction": {
        "@type": "SearchAction",
        "query-input": "required name=search_term_string",
        "target": {
          "@type": "EntryPoint",
          "urlTemplate": "https://wavect.io/search/?q={search_term_string}"
        }
      },
      "publisher": {
        "@id": "https://wavect.io/#organization",
        "@type": [
          "Organization",
          "ProfessionalService",
          "LocalBusiness"
        ]
      },
      "url": "https://wavect.io/"
    },
    {
      "@id": "https://wavect.io/de/blog/ai-agent-cost-per-action-2026/#webpage",
      "@type": "WebPage",
      "dateModified": "2026-07-09",
      "inLanguage": "de",
      "isPartOf": {
        "@id": "https://wavect.io/#website",
        "@type": "WebSite"
      },
      "lastReviewed": "2026-07-09",
      "url": "https://wavect.io/de/blog/ai-agent-cost-per-action-2026/"
    }
  ]
}
```

```json
{
  "@context": "https://schema.org",
  "@type": "BlogPosting",
  "abstract": "AI Agent Cost per Action ist der Gesamtpreis eines erfolgreichen Geschäftsergebnisses, nicht eines Modellaufrufs. Fehlversuche, Tool Calls, Retries, Freigaben, Eskalation und menschliche Nacharbeit bleiben im Zähler. Miss gelöste Tickets, extrahierte Rechnungen, reviewte Pull Requests oder angereicherte Leads. Senke Kosten mit vollständigen Traces, begrenzten Loops, weniger Tools, stabilem Cache-Kontext, günstigeren Modellen für einfache Schritte und Evals für die Qualität. Providerpreise sind eine Momentaufnahme vom Juli 2026 und müssen vor dem Budgetieren geprüft werden.",
  "articleBody": " Blog-Übersicht/AI und Agents/Agent Engineering AI Agent Cost per Action: Warum agentische Workflows Token-Rechnungen sprengen TL;DR AI Agent Cost per Action ist der Gesamtpreis eines erfolgreichen Geschäftsergebnisses, nicht eines Modellaufrufs. Fehlversuche, Tool Calls, Retries, Freigaben, Eskalation und menschliche Nacharbeit bleiben im Zähler. Miss gelöste Tickets, extrahierte Rechnungen, reviewte Pull Requests oder angereicherte Leads. Senke Kosten mit vollständigen Traces, begrenzten Loops, weniger Tools, stabilem Cache-Kontext, günstigeren Modellen für einfache Schritte und Evals für die Qualität. Providerpreise sind eine Momentaufnahme vom Juli 2026 und müssen vor dem Budgetieren geprüft werden. Passende Leistung: KI Enablement Executives kaufen keine Tokens. Gekauft werden erledigte Aktionen: ein gelöstes Support-Ticket, eine extrahierte Rechnung, ein reviewter Pull Request, ein angereicherter Lead, eine genehmigte Rückerstattung, ein triagierter Claim. Genau diese Einheit sollte dein Kostenmodell verwenden. Cost per Action ist der Gesamtpreis, um ein Geschäftsergebnis bis zu deinem Qualitätsniveau fertigzustellen, inklusive Modell-Calls, Tool-Calls, Retries, Verifier, Eskalationen, gecachten Tokens, nicht gecachten Tokens und menschlicher Korrektur. Dieser Artikel ist enger als unser LLM-Kostenrechner. Dort geht es um Cost per successful Task über LLM-Systeme hinweg. Hier geht es um agentische Workflows, bei denen die Rechnung wächst, weil der Agent loopt: planen, Tools aufrufen, Tool-Output lesen, Kontext erweitern, verifizieren, erneut versuchen und manchmal an einen Spezialisten übergeben. Genau diese Trace-Struktur muss in die Kostenrechnung. Was ist AI Agent Cost per Action? AI Agent Cost per Action ist der Gesamtpreis eines abgeschlossenen Geschäftsergebnisses, nicht eines Modell-Calls. Dazu gehören Input Tokens, cached Input, Output Tokens, Tool-Schemas, Retrieval-Kontext, Tool-Observations, Retries, Verifier Calls, Eskalationen, menschliches Review und fehlgeschlagene Versuche, geteilt durch erfolgreiche Aktionen. Cost per Action = (alle Modellkosten + Tool- und Retrieval-Kosten + Retry-Kosten + Verifier-Kosten + menschliche Nacharbeit) / erfolgreiche Aktionen. Der Nenner ist entscheidend. Wenn ein Agent 10.000 Leads anreichert, aber nur 8.700 die Validierung bestehen, rechnest du mit 8.700. Fehlgeschlagene Aktionen sind nicht gratis. Diese Fehlversuche haben Tokens, Tools, Zeit und Vertrauen verbraucht. Warum Agents Tokens multiplizieren Ein einzelner LLM-Call ist eine Zeile. Ein Agent Run ist ein Trace. ReAct machte das Muster bekannt: Sprachmodelle können Reasoning und Actions verschränken, um externe Informationen einzusammeln, bevor sie weitermachen. Das ist nützlich, verändert aber die Ökonomie. Jede Schleife trägt mehr History und mehr Observations weiter. KostenmultiplikatorWas passiertWarum die Rechnung wächst PlanningDer Agent fragt, was als Nächstes zu tun ist.Planner-Prompts und Reasoning-Output entstehen vor der eigentlichen Arbeit. Tool-SchemasFunktionen, MCP-Tools, Permissions und Beispiele liegen im Kontext.Statische Tool-Beschreibungen sind groß und wiederholen sich ohne Cache. Tool-ObservationsSuchresultate, CRM-Daten, Rechnungen, Diffs oder Logs gehen zurück ins Modell.Jede Observation wird neuer Input im nächsten Schritt. RetriesSchemafehler, Timeouts oder niedrige Confidence starten einen zweiten Versuch.Der zweite Versuch trägt oft den ersten Versuch als Kontext mit. VerificationEin Modell oder Regelwerk prüft Grounding, Policy, Extraktion oder Code-Risiko.Qualitätssicherung ist nötig, aber ein eigener Kostenblock. HandoffsEin Generalist delegiert an einen Spezialisten.Kontext wird kopiert, zusammengefasst oder neu erweitert. Vier Beispiele, die das Management versteht GeschäftsaktionNaive AnnahmeTypischer Agent TraceKostenmetrik Support-Ticket gelöstEine Antwort.Klassifizieren, Policy holen, Account prüfen, Entwurf, Verifier, CRM-Update.Kosten pro gelöstes Ticket, das QA besteht. Rechnung extrahiertEin OCR plus JSON.Datei lesen, Layout erkennen, Felder extrahieren, Vendor-Lookup, Summen prüfen, fehlende Felder wiederholen.Kosten pro Rechnung ohne manuelle Korrektur. PR reviewtEin Code-Review-Prompt.Diff zusammenfassen, Dateien prüfen, Tests laufen lassen, Dependencies suchen, Findings verifizieren, Review schreiben.Kosten pro PR mit brauchbaren Findings und wenigen False Positives. Lead angereichertEin Enrichment-Call.Web suchen, Firmenseite parsen, CRM prüfen, ICP fit klassifizieren, deduplizieren, score schreiben.Kosten pro Lead, den Sales akzeptiert. Der Action-Rechner Lege eine Zeile pro Aktionstyp an. Support, Rechnungen, PR-Reviews und Leads gehören nicht in denselben Durchschnitt. SpalteBeispielWarum sie zählt AktionstypSupport-Ticket gelöstBusiness-Einheit statt API-Einheit. Versuche pro Monat40.000Volumen vor Fehlern. Success Rate86%Macht aus Versuchen erfolgreiche Aktionen. Modell-Calls pro Aktion4,7 im SchnittPlanning, Drafting, Verification und Retries.",
  "articleSection": "Engineering",
  "author": {
    "@id": "https://wavect.io/team/kevin-riedl/#person",
    "@type": "Person",
    "name": "Kevin Riedl",
    "sameAs": [
      "https://www.wikidata.org/wiki/Q139796365",
      "https://www.linkedin.com/in/wsdt",
      "https://github.com/wsdt"
    ],
    "url": "https://wavect.io/team/kevin-riedl/"
  },
  "citation": [
    {
      "@type": "WebPage",
      "name": "OpenAI Agents Guide",
      "url": "https://developers.openai.com/api/docs/guides/agents"
    },
    {
      "@type": "WebPage",
      "name": "OpenAI API Pricing",
      "url": "https://openai.com/api/pricing/"
    },
    {
      "@type": "WebPage",
      "name": "NIST AI Risk Management Framework",
      "url": "https://www.nist.gov/itl/ai-risk-management-framework"
    }
  ],
  "dateModified": "2026-08-07",
  "datePublished": "2026-07-09",
  "description": "AI Agent Cost per Action ist der Gesamtpreis eines erfolgreichen Geschäftsergebnisses, nicht eines Modellaufrufs. Fehlversuche, Tool Calls, Retries, Freigaben, Eskalation und menschliche Nacharbeit bleiben im Zähler. Miss gelöste Tickets, extrahierte Rechnungen, reviewte Pull Requests oder angereicherte Leads. Senke Kosten mit vollständigen Traces, begrenzten Loops, weniger Tools, stabilem Cache-Kontext, günstigeren Modellen für einfache Schritte und Evals für die Qualität. Providerpreise sind eine Momentaufnahme vom Juli 2026 und müssen vor dem Budgetieren geprüft werden.",
  "headline": "AI Agent Cost per Action: Warum agentische Workflows Token-Rechnungen sprengen",
  "image": "https://wavect.io/img/blog/headers/header_ai-agent-cost-per-action-2026.svg",
  "inLanguage": "de",
  "mainEntityOfPage": {
    "@id": "https://wavect.io/de/blog/ai-agent-cost-per-action-2026/",
    "@type": "WebPage"
  },
  "publisher": {
    "@id": "https://wavect.io/#organization",
    "@type": [
      "Organization",
      "ProfessionalService",
      "LocalBusiness"
    ]
  },
  "url": "https://wavect.io/de/blog/ai-agent-cost-per-action-2026/",
  "wordCount": 1632
}
```

```json
{
  "@context": "https://schema.org",
  "@type": "BreadcrumbList",
  "itemListElement": [
    {
      "@type": "ListItem",
      "item": "https://wavect.io/de/",
      "name": "Startseite",
      "position": 1
    },
    {
      "@type": "ListItem",
      "item": "https://wavect.io/de/blog/overview/",
      "name": "Blog-Übersicht",
      "position": 2
    },
    {
      "@type": "ListItem",
      "item": "https://wavect.io/de/blog/topics/ai-agents/",
      "name": "AI und Agents",
      "position": 3
    },
    {
      "@type": "ListItem",
      "item": "https://wavect.io/de/blog/clusters/agent-engineering/",
      "name": "Agent Engineering",
      "position": 4
    },
    {
      "@type": "ListItem",
      "item": "https://wavect.io/de/blog/ai-agent-cost-per-action-2026/",
      "name": "AI Agent Cost per Action: Token-Kosten-Rechner | ",
      "position": 5
    }
  ]
}
```
