---
title: "Lokale Modelle vs APIs: EU-Break-even-Rechner"
canonical: https://wavect.io/de/blog/local-models-vs-apis-break-even-eu-2026/
language: de
description: "Wann schlagen lokale LLMs APIs für EU-Unternehmen? Ein Break-even-Rechner für GPU-Auslastung, API-Kosten, Datenresidenz, Ops, Evals und Workload-Form."
image: "https://wavect.io/img/blog/headers/header_local-models-vs-apis-break-even-eu-2026.png"
---

[**Zurück**](/de/blog/overview/)

[![Kevin Riedl](/img/team/kevin.webp)](/de/team/kevin-riedl/)

[Kevin Riedl](/de/team/kevin-riedl/) https://linkedin.com/in/wsdt

13 Min Lesezeit · 8. Juli 2026

[**Weiter**](/de/blog/llm-cost-calculator-2026/)

# Wann lokale Modelle APIs schlagen: Break-even-Rechner für EU-Unternehmen

TL;DR

Lokale LLMs schlagen APIs nur, wenn die komplette Rechnung gewinnt, nicht wenn die GPU-Stunde billig aussieht. API-Kosten sind Kosten pro erfolgreiche Aufgabe; Self-Host-Kosten sind GPU-Stunden plus Redundanz, Storage, Netzwerk, Observability, Engineering-Ops, Eval-Pflege und Leerlaufkapazität, geteilt durch erfolgreiche Aufgaben. Utilization-Forschung zeigt, dass dieselbe H100 je nach Concurrency und Last pro Million Output-Token sehr günstig oder extrem teuer sein kann, also ist Auslastung die erste Variable. Hosted APIs gewinnen bei niedrigem, sprunghaftem oder schnell wechselndem Workload; lokal gewinnt bei hohem stetigem Volumen, strikter EU-Datenresidenz oder als Ersatz für teure Frontier-APIs, wenn ein Open-Weight-Modell dein Eval besteht. Der Rechner fragt nach Tokenvolumen, Tokens pro Aufgabe, Concurrency, Utilization, Latenz-SLO, Engineer-Kosten, Eval-Pass-Rate und API-Alternative. Hoste nicht selbst, bevor Caching, Batching, Routing und Model Right-sizing gemessen sind. Zahlen sind eine Momentaufnahme vom Juli 2026; prüfe Live-Providerpreise erneut.

Passende Leistung: [KI Enablement](/de/services/ai-enablement/)

Lokale LLMs schlagen APIs nur, wenn Workload, Governance und Betrieb zusammenpassen. Eine billige GPU-Stunde ist noch kein Business Case. Der Business Case ist der Preis pro erfolgreiche Aufgabe, nachdem Auslastung, Concurrency, Redundanz, Engineer-Zeit, Eval-Pflege und EU-Datenresidenz eingerechnet sind. Wenn das Open-Weight-Modell dein Eval nicht besteht, endet die Rechnung. Wenn es besteht, die GPU aber den Großteil des Tages wartet, endet sie meistens auch.

Für ein konkretes Extrembeispiel zeigt unser [Colibri-Test mit GLM-5.2 auf Consumer-Hardware](/de/blog/colibri-glm-5-2-consumer-hardware/), warum „läuft lokal“ nicht automatisch „ist wirtschaftlich“ bedeutet: 25 GB RAM reichen technisch, aber kalt entstehen nur 0,05 bis 0,1 Token pro Sekunde. Retrieval fügt dieser Rechnung eine eigene Zeile hinzu: Unser Leitfaden zum [16x Schrumpfen des RAG-Vektorspeichers](/de/blog/rag-vector-memory-quantization/) behandelt den Embedding-Index-Bedarf und den Recall-Kompromiss.

Dieser Artikel ist die Self-Hosting-Ergänzung zu unserem [LLM-Kostenrechner 2026](/de/blog/llm-cost-calculator-2026/). Dort vergleichen wir API-Rechnungen pro Aufgabe. Hier vergleichen wir API-Aufgaben mit lokaler Inferenz. Die wichtigste 2026er-Erkenntnis aus der Utilization-Forschung: Dieselbe H100 kann pro Million Output-Token extrem günstig oder brutal teuer wirken, je nachdem, wie gut Last und Concurrency passen. Ein aktuelles arXiv-Paper misst auf identischer H100-Hardware eine Spanne von $0.21 bis $15.25 pro Million Output-Token und zeigt, dass Utilization-blinde Rechner die Kosten um 1 / U unterschätzen.

Dieser Rechner besitzt die Wirtschaftlichkeitsfrage für Server und Private Cloud. Wenn der Workload auf Kundengeräten laufen kann, behandelt unser [Produktionsguide für Browser-KI mit Transformers.js](/de/blog/transformers-js-browser-ai-guide/) clientseitigen Datenschutz, Modelldelivery, WebGPU- und WASM-Fallbacks sowie die Kostenverlagerung in Produktentwicklung und Nutzerhardware.

## Die kurze Antwort

Nimm eine API, wenn Traffic klein, sprunghaft, schwer planbar oder auf Frontier-Reasoning angewiesen ist. Prüfe lokale Modelle, wenn du hohes und stetiges Volumen hast, ein Modell dein Eval besteht, dein Team den Stack betreiben kann und entweder EU-Governance oder ein teurer API-Baseline echte Marge lässt. Dazwischen liegen EU-regionale APIs und managed Open-Weight-Endpunkte, oft der bessere Schritt vor vollem Self-Hosting.

| Situation | Gewinnt meist | Warum |
| --- | --- | --- |
| Interner Assistent mit wenigen tausend Aufgaben pro Monat | API | Leerlauf und Ops-Kosten fressen Token-Ersparnis auf. |
| Nachts laufende Extraktion über Millionen Dokumente | Lokal oder Batch-API | Stetige Last und asynchrone Latenz können Kapazität füllen. |
| Regulierter EU-Workload mit sensiblen Daten | EU-API, private Deployment oder lokal | Governance kann reine Kosten schlagen, aber managed EU-Optionen gehören zuerst in den Vergleich. |
| Public SaaS Chatbot mit Peaks | API oder hybrid | Elastizität, Safety-Updates und Burst-Handling sind wichtiger als GPU-Stickerpreise. |
| High-volume Klassifikation, Routing, Enrichment oder Summaries | Lokaler Kandidat | Kleine Open-Weight-Modelle können Evals bestehen und günstigere Hardware gut auslasten. |

## Der Rechner

Vergleiche API-Kosten pro erfolgreiche Aufgabe mit lokalen Kosten pro erfolgreiche Aufgabe. Nicht Provider-Rechnung gegen GPU-Rechnung.

| Zeile | Formel | Hinweis |
| --- | --- | --- |
| API-Kosten pro Monat | tasks_per_month * api_cost_per_successful_task | Nutze die Task-Rechnung, nicht einen einzelnen Call. |
| API-Kosten pro Aufgabe | sum(input + cached_input + output + tools + retries + failure_rework) | Prompt Caching und Batch nur anwenden, wenn der Workload wirklich qualifiziert. |
| Self-Host-Kosten pro Monat | gpu_hours + redundancy + storage + networking + observability + engineering_ops + eval_upkeep | Engineer-Zeit gehört in die Tabelle. |
| Lokale Kosten pro Aufgabe | self_host_monthly / successful_tasks_per_month + variable_task_cost | Durch bestandene Aufgaben teilen, nicht durch Requests. |
| Break-even-Aufgaben | self_host_fixed_monthly / (api_task_cost - self_host_variable_task_cost) | Wenn der Nenner klein oder negativ ist, gewinnt die API. |

Effektive lokale Kosten pro 1M Token = ((gpu_hourly_rate + infra_hourly + ops_hourly) / (tokens_per_second * 3600 * measured_utilization)) * 1,000,000.

Measured Utilization ist die Falltür. Wenn dein Spreadsheet 80% annimmt, Produktion aber 12% liefert, liegst du vor Redundanz und Ops schon ungefähr um Faktor 6,7 daneben.

Bevor du einen lokalen Kandidaten kalkulierst, prüfe seinen Fit auf der Zielmaschine mit geplantem Kontext und geplanter Quantisierung. Unser [llmfit Guide für den Hardware-Fit lokaler LLMs](/de/blog/llmfit-local-llm-hardware-guide/) zeigt dir die Shortlist und erklärt, wo die Speed-Schätzung noch einen echten Benchmark braucht. Wenn der Kandidat DeepSeek V4 Flash 0731 ist, zeigt unser [Deployment-Check für einen einzelnen KI-PC](/de/blog/deepseek-v4-flash-0731-local-ai-pc/), welche Annahmen zu 128 GB und 192 GB in deine Rechnung gehören.

## Welche Inputs du sammeln musst

| Input | Was messen? | Warum es entscheidet |
| --- | --- | --- |
| Task-Volumen | Erfolgreiche Business-Aufgaben pro Tag und Monat | Niedriges Volumen macht fixe lokale Kosten schmerzhaft. |
| Token pro Aufgabe | Uncached Input, cached Input, Output, Tool Calls, Verifier Calls | Output-lastige Aufgaben machen APIs teuer; stabiler Input macht Caching stark. |
| Concurrency | Requests pro Sekunde, p95-Latenz, In-flight Requests | Concurrency entscheidet GPU-Sättigung und Queueing. |
| Batchbarer Anteil | Anteil, der Minuten oder Stunden warten kann | Batch APIs können Kosten senken, bevor Self-Hosting Sinn ergibt. |
| Eval-Pass-Rate | Lokaler Kandidat gegen API-Baseline | Ein billiges Modell, das scheitert, verschiebt Kosten nur in Support. |
| Ops-Kapazität | Stunden für Serving, Security, Monitoring, Updates, Incidents | Lokale Systeme haben eine Gehaltszeile. |
| Datenanforderungen | GDPR, Verträge, Datenresidenz, Auditbedarf | Governance kann lokal erzwingen, auch wenn API-Kosten niedriger sind. |

## Warum Auslastung wichtiger ist als GPU-Preis

GPU-Preise sind einfach. Utilization ist unangenehm, weil sie aus deinem Traffic entsteht. Ein interaktiver Assistent hat oft lange Leerlaufphasen und kurze Peaks. Eine nächtliche Extraktion kann mit kontrollierter Queue-Tiefe stundenlang laufen. Der zweite Workload kann lokale Modelle rational machen; der erste oft nicht.

Auch der Serving-Stack zählt. Eine Studie zu vLLM versus HuggingFace TGI fand bei hoher Concurrency bis zu 24x höheren Durchsatz für vLLM, während TGI bei interaktiven Szenarien mit moderater Concurrency niedrigere Tail-Latenzen zeigte. Dein Rechner braucht deshalb Benchmark-Zeilen für genau dein Modell, deine Quantisierung, deine Context Length und dein Latenzziel.

## Vergleiche nicht gegen die falsche API

Ein lokales Modell muss nicht das teuerste Frontier-Modell schlagen, wenn deine Aufgabe das gar nicht braucht. Es muss den günstigsten akzeptablen managed Pfad schlagen, nachdem Caching, Batch, Routing und Model Right-sizing eingerechnet sind.

- OpenAI Pricing trennt Input, cached Input und Output. Stabile Prefixes verändern die Baseline.
- Gemini Pricing führt Context Caching und Batch Pricing auf Paid Tiers und unterscheidet Produktverbesserung nach Tier.
- Amazon Bedrock nennt Batch Inference für ausgewählte Foundation Models zu 50% niedrigerem Preis als On-demand.
- Azure OpenAI ist für EU-Unternehmen relevant, weil Data Zones, Provisioned Throughput, Reservierungen und Procurement neben Tokenpreisen zählen.

Die Optimierungsreihenfolge steht in [LLM Token Costs 2026 senken](/de/blog/reduce-llm-token-costs-2026/). Die Modellauswahl vertiefen wir im [Open-Weight-LLM-Vergleich](/de/blog/open-weight-llm-comparison-2026/).

## Beispielrechnung

Ein EU-SaaS-Unternehmen betreibt eine Dokument-Enrichment-Pipeline. Der API-Pfad kostet nach Caching, Batch, Retries und Verifier 0,018 Dollar pro erfolgreiches Dokument. Der lokale Kandidat besteht dasselbe Eval. Der lokale Stack kostet all-in 9.800 Dollar pro Monat: GPU, Spare-Kapazität, Storage, Logging, Monitoring, Netzwerk, Engineering und Eval-Pflege. Variable lokale Kosten liegen bei 0,003 Dollar pro Dokument.

| Metrik | Wert | Interpretation |
| --- | --- | --- |
| API-Kosten pro Aufgabe | $0.018 | Gemessene Kosten pro erfolgreiches Dokument. |
| Variable lokale Kosten | $0.003 | Zusatzkosten pro Dokument, nachdem der Stack steht. |
| Fixe lokale Monatskosten | $9,800 | Infra plus Menschen und Eval-Pflege. |
| Ersparnis pro Aufgabe | $0.015 | API-Aufgabe minus lokale variable Kosten. |
| Break-even | 653,334 erfolgreiche Dokumente pro Monat | 9,800 / 0.015, noch ohne Risikopuffer. |

Füge einen Risikopuffer hinzu. Wenn Eval-Pass-Rate, Utilization oder Failover schlechter ausfallen als im Benchmark, wandert der Break-even nach rechts. Wenn der Workload async ist und die GPU nachts sättigt, wandert er nach links. Wenn die API-Baseline ein günstiger hosted Open-Weight-Endpunkt ist, kann Self-Hosting komplett uninteressant werden.

## EU-Faktoren

Für EU-Unternehmen ist lokal versus API selten nur Preis. GDPR, DPAs, Kundenaudits, Sektorregeln und Datenresidenz bestimmen oft die Architektur. Trotzdem gibt es mehrere Governance-Pfade.

| Anforderung | API-freundlicher Pfad | Lokaler Pfad |
| --- | --- | --- |
| EU-Datenresidenz | EU-Region oder EU Data Zone nutzen, wenn Vertrag und Risiko passen. | Inferenz auf EU-Cloud oder eigener Infrastruktur mit kontrollierten Logs und Storage. |
| Kein Training auf Prompts | Enterprise/API-Bedingungen je Produkt und Tier prüfen. | Prompts, Outputs, Logs und Embeddings bleiben in deiner Umgebung. |
| Kundenaudit | Subprozessoren, Retention, Zugriff und Provider Terms dokumentieren. | GPU-Provider, Image-Provenance, Modelllizenz, Serving Logs und Zugriffe dokumentieren. |
| Sensible Sektordaten | Private Endpoints, Redaction oder Gateway-Policy prüfen. | Lokal bevorzugen, wenn Rohdaten die Tenant-Grenze nicht verlassen dürfen. |

Mehr dazu: [EU-Datenresidenz für AI Apps](/de/blog/eu-data-residency-ai-apps-2026/) und [was Self-Hosting von LLMs in der EU wirklich kostet](/de/blog/self-hosting-llms-eu-cost/).

Wenn das gewählte Modell jeden einzelnen Host übersteigt, erklärt unser [Mesh-LLM-Test die verteilte Inferenz auf mehreren Rechnern](/de/blog/mesh-llm-distributed-inference-multiple-computers/), inklusive Netzwerk- und Reliability-Kosten des gemeinsamen Speichers.

## Die Stack-Kosten

Der Stack ist nicht "Modell plus GPU". Produktion heißt Serving Runtime wie [vLLM](https://docs.vllm.ai/en/latest/), Model Artifacts, Quantisierung, Autoscaling oder Queue-Control, Telemetrie, Logging-Regeln, Zugriffskontrolle, Eval Jobs, Rollout Gates, Incident Response und eine Fallback-Route, wenn das lokale Modell scheitert oder die GPU-Pool voll ist.

Oft ist hybrid der beste Punkt: lokal für günstige, stabile High-volume-Arbeit; API für harte Fälle, Overflow, multimodale Features, Tool-heavy Reasoning oder Aufgaben, bei denen Frontier-Qualität gewinnt. Dann wird der Break-even zum Routing-Rechner: lokaler Default, API-Fallback, gemessene Eskalationsrate, Eval als Qualitätsbremse.

## Quellen und Live-Preis-Hinweis

Providerpreise und Modellnamen bewegen sich schnell. Die Formeln bleiben, die Preisbeispiele sind Snapshot vom Juli 2026. Prüfe [OpenAI Pricing](https://developers.openai.com/api/docs/pricing), [Gemini API Pricing](https://ai.google.dev/gemini-api/docs/pricing), [Amazon Bedrock Pricing](https://aws.amazon.com/bedrock/pricing/) und [Azure OpenAI Pricing](https://azure.microsoft.com/en-us/pricing/details/azure-openai/) vor einer Budgetentscheidung. Für Utilization und Serving-Annahmen: [Beyond Per-Token Pricing](https://arxiv.org/abs/2606.11690) und [die vLLM-versus-TGI-Studie](https://arxiv.org/abs/2511.17593).

Diesen Vergleich gegen deine eigene Last zu rechnen und danach die Gewinnerseite zu bauen, ist unser [KI Setup Service](/de/services/ai-enablement/). Wenn EU-Datenhaltung überhaupt erst der Grund für Self-Hosting ist, behandelt [KI-Softwareentwicklung in Österreich](/de/ai-software-development-austria/) das Abbilden des Datenflusses, bevor du dich auf Hardware festlegst. [Hyperstate AI](/de/case-studies/hyperstate-ai/) ist der veröffentlichte Fall, in dem die GPU-Ökonomie tatsächlich die Architektur bestimmt hat.

## Fazit

Lokale Modelle schlagen APIs, wenn das Modell dein Eval besteht, der Workload Hardware auslastet, die fixen Betriebskosten niedriger sind als die API-Ersparnis und EU-Governance wirklich zählt. Lokal verliert bei niedrigem oder sprunghaftem Traffic, bei unoptimierter API-Baseline oder wenn das Team die GPU einpreist, aber die Menschen vergisst.

Für viele EU-Unternehmen ist hybrid der realistische Zielpunkt: API zuerst, während du Cost per Task misst, danach lokal für stabile High-volume-Arbeit, mit API-Fallback für Overflow und schwierige Fälle. Break-even ist kein Bauchgefühl. Es ist eine Zeile in deiner Produktionstelemetrie.

## Das könnte dich auch interessieren..

[**LLM-Kostenrechner 2026** Der Begleit-Rechner für API-Kosten pro erfolgreiche Aufgabe: Caching, Batch, Routing, Retries und Eval-Qualität.](/de/blog/llm-cost-calculator-2026/) [**AI Enablement vs generische KI-Beratung** Die eine liefert Strategiefolien. Das andere shippt ein funktionierendes Setup auf deiner Infrastruktur, das dein Team besitzt.](/de/compare/ai-enablement-vs-generic-ai-consultancy/)

Modelle und Infrastruktur

## In diesem Cluster weiterlesen

Modellauswahl, Inferenzkosten, lokaler Betrieb, Kompression und Serving-Architektur.

[Mit dem Grundlagenartikel starten**LLMs in der EU selbst hosten: Wann sich Open Weights wirklich rechnen**](/de/blog/self-hosting-llms-eu-cost/)

- [Der vLLM- und Triton-Stack von Netflix: 7 Produktionslektionen](/de/blog/netflix-vllm-triton-inference-stack/)
- [Transformers.js im Browser: Wann lokale KI in dein Produkt gehört](/de/blog/transformers-js-browser-ai-guide/)
- [LiteLLM selbst hosten: Production-Guide 2026](/de/blog/self-host-litellm-production-2026/)
- [KI-fähiges Unternehmenswiki: Architektur und Aufbau](/de/blog/ai-ready-company-wiki/)
- [Versieht Claude Texte mit Wasserzeichen? API-Antwort 2026](/de/blog/claude-text-watermark-api-2026/)

Postfach, ohne Lärm

## Folge der Arbeit, die für dich zählt

Du bekommst eine kurze E-Mail, wenn wir etwas Neues veröffentlichen. Folge dem ganzen Blog oder nur den Themen, die dich interessieren.

[**Zurück**](/de/blog/overview/)

[![Kevin Riedl](/img/team/kevin.webp)](/de/team/kevin-riedl/)

[Kevin Riedl](/de/team/kevin-riedl/) https://linkedin.com/in/wsdt

13 Min Lesezeit · 8. Juli 2026

[**Weiter**](/de/blog/llm-cost-calculator-2026/)

Neue Beiträge per E-Mail ×

×

Neue Beiträge per E-Mail

Eine kurze E-Mail, wenn wir etwas veröffentlichen. Kostenlos, ohne Tracking.

## Structured Data

```json
{
  "@context": "https://schema.org",
  "@graph": [
    {
      "@id": "https://wavect.io/#organization",
      "@type": [
        "Organization",
        "ProfessionalService",
        "LocalBusiness"
      ],
      "employee": [
        {
          "@id": "https://wavect.io/team/kevin-riedl/#person",
          "@type": "Person",
          "jobTitle": "Managing Director",
          "name": "Kevin Riedl",
          "url": "https://wavect.io/team/kevin-riedl/",
          "worksFor": {
            "@id": "https://wavect.io/#organization",
            "@type": [
              "Organization",
              "ProfessionalService",
              "LocalBusiness"
            ]
          }
        },
        {
          "@id": "https://wavect.io/team/christof-jori/#person",
          "@type": "Person",
          "jobTitle": "Managing Director",
          "name": "Christof Jori",
          "url": "https://wavect.io/team/christof-jori/",
          "worksFor": {
            "@id": "https://wavect.io/#organization",
            "@type": [
              "Organization",
              "ProfessionalService",
              "LocalBusiness"
            ]
          }
        }
      ],
      "founder": [
        {
          "@id": "https://wavect.io/team/kevin-riedl/#person",
          "@type": "Person",
          "jobTitle": "Managing Director",
          "name": "Kevin Riedl",
          "url": "https://wavect.io/team/kevin-riedl/",
          "worksFor": {
            "@id": "https://wavect.io/#organization",
            "@type": [
              "Organization",
              "ProfessionalService",
              "LocalBusiness"
            ]
          }
        },
        {
          "@id": "https://wavect.io/team/christof-jori/#person",
          "@type": "Person",
          "jobTitle": "Managing Director",
          "name": "Christof Jori",
          "url": "https://wavect.io/team/christof-jori/",
          "worksFor": {
            "@id": "https://wavect.io/#organization",
            "@type": [
              "Organization",
              "ProfessionalService",
              "LocalBusiness"
            ]
          }
        }
      ],
      "legalRepresentative": [
        {
          "@id": "https://wavect.io/team/kevin-riedl/#person",
          "@type": "Person",
          "jobTitle": "Managing Director",
          "name": "Kevin Riedl",
          "url": "https://wavect.io/team/kevin-riedl/",
          "worksFor": {
            "@id": "https://wavect.io/#organization",
            "@type": [
              "Organization",
              "ProfessionalService",
              "LocalBusiness"
            ]
          }
        },
        {
          "@id": "https://wavect.io/team/christof-jori/#person",
          "@type": "Person",
          "jobTitle": "Managing Director",
          "name": "Christof Jori",
          "url": "https://wavect.io/team/christof-jori/",
          "worksFor": {
            "@id": "https://wavect.io/#organization",
            "@type": [
              "Organization",
              "ProfessionalService",
              "LocalBusiness"
            ]
          }
        }
      ],
      "name": "Wavect GmbH",
      "subjectOf": {
        "@id": "https://wavect.io/verified-claims.json#dataset",
        "@type": "Dataset",
        "creator": {
          "@id": "https://wavect.io/#organization",
          "@type": [
            "Organization",
            "ProfessionalService",
            "LocalBusiness"
          ]
        },
        "description": "A machine-readable registry of quantitative and qualitative claims published by Wavect, with review dates, localized page appearances and public third-party citations where available.",
        "inLanguage": "en",
        "isAccessibleForFree": true,
        "license": "https://creativecommons.org/licenses/by/4.0/",
        "name": "Wavect verified publication claims",
        "url": "https://wavect.io/verified-claims.json"
      },
      "url": "https://wavect.io/"
    },
    {
      "@id": "https://wavect.io/team/kevin-riedl/#person",
      "@type": "Person",
      "jobTitle": "Managing Director",
      "name": "Kevin Riedl",
      "sameAs": [
        "https://www.wikidata.org/wiki/Q139796365",
        "https://www.linkedin.com/in/wsdt",
        "https://github.com/wsdt"
      ],
      "url": "https://wavect.io/team/kevin-riedl/",
      "worksFor": {
        "@id": "https://wavect.io/#organization",
        "@type": [
          "Organization",
          "ProfessionalService",
          "LocalBusiness"
        ]
      }
    },
    {
      "@id": "https://wavect.io/team/christof-jori/#person",
      "@type": "Person",
      "jobTitle": "Managing Director",
      "name": "Christof Jori",
      "sameAs": [
        "https://www.wikidata.org/wiki/Q139796367",
        "https://www.linkedin.com/in/jocr77/",
        "https://github.com/jo-chris"
      ],
      "url": "https://wavect.io/team/christof-jori/",
      "worksFor": {
        "@id": "https://wavect.io/#organization",
        "@type": [
          "Organization",
          "ProfessionalService",
          "LocalBusiness"
        ]
      }
    },
    {
      "@id": "https://wavect.io/#website",
      "@type": "WebSite",
      "inLanguage": [
        "en",
        "de",
        "es",
        "zh"
      ],
      "name": "Wavect",
      "potentialAction": {
        "@type": "SearchAction",
        "query-input": "required name=search_term_string",
        "target": {
          "@type": "EntryPoint",
          "urlTemplate": "https://wavect.io/search/?q={search_term_string}"
        }
      },
      "publisher": {
        "@id": "https://wavect.io/#organization",
        "@type": [
          "Organization",
          "ProfessionalService",
          "LocalBusiness"
        ]
      },
      "url": "https://wavect.io/"
    },
    {
      "@id": "https://wavect.io/de/blog/local-models-vs-apis-break-even-eu-2026/#webpage",
      "@type": "WebPage",
      "dateModified": "2026-07-08",
      "inLanguage": "de",
      "isPartOf": {
        "@id": "https://wavect.io/#website",
        "@type": "WebSite"
      },
      "lastReviewed": "2026-07-08",
      "url": "https://wavect.io/de/blog/local-models-vs-apis-break-even-eu-2026/"
    }
  ]
}
```

```json
{
  "@context": "https://schema.org",
  "@type": "BlogPosting",
  "abstract": "Lokale LLMs schlagen APIs nur, wenn die komplette Rechnung gewinnt, nicht wenn die GPU-Stunde billig aussieht. API-Kosten sind Kosten pro erfolgreiche Aufgabe; Self-Host-Kosten sind GPU-Stunden plus Redundanz, Storage, Netzwerk, Observability, Engineering-Ops, Eval-Pflege und Leerlaufkapazität, geteilt durch erfolgreiche Aufgaben. Utilization-Forschung zeigt, dass dieselbe H100 je nach Concurrency und Last pro Million Output-Token sehr günstig oder extrem teuer sein kann, also ist Auslastung die erste Variable. Hosted APIs gewinnen bei niedrigem, sprunghaftem oder schnell wechselndem Workload; lokal gewinnt bei hohem stetigem Volumen, strikter EU-Datenresidenz oder als Ersatz für teure Frontier-APIs, wenn ein Open-Weight-Modell dein Eval besteht. Der Rechner fragt nach Tokenvolumen, Tokens pro Aufgabe, Concurrency, Utilization, Latenz-SLO, Engineer-Kosten, Eval-Pass-Rate und API-Alternative. Hoste nicht selbst, bevor Caching, Batching, Routing und Model Right-sizing gemessen sind. Zahlen sind eine Momentaufnahme vom Juli 2026; prüfe Live-Providerpreise erneut.",
  "articleBody": " Blog-Übersicht/AI und Agents/Modelle und Infrastruktur Wann lokale Modelle APIs schlagen: Break-even-Rechner für EU-Unternehmen TL;DR Lokale LLMs schlagen APIs nur, wenn die komplette Rechnung gewinnt, nicht wenn die GPU-Stunde billig aussieht. API-Kosten sind Kosten pro erfolgreiche Aufgabe; Self-Host-Kosten sind GPU-Stunden plus Redundanz, Storage, Netzwerk, Observability, Engineering-Ops, Eval-Pflege und Leerlaufkapazität, geteilt durch erfolgreiche Aufgaben. Utilization-Forschung zeigt, dass dieselbe H100 je nach Concurrency und Last pro Million Output-Token sehr günstig oder extrem teuer sein kann, also ist Auslastung die erste Variable. Hosted APIs gewinnen bei niedrigem, sprunghaftem oder schnell wechselndem Workload; lokal gewinnt bei hohem stetigem Volumen, strikter EU-Datenresidenz oder als Ersatz für teure Frontier-APIs, wenn ein Open-Weight-Modell dein Eval besteht. Der Rechner fragt nach Tokenvolumen, Tokens pro Aufgabe, Concurrency, Utilization, Latenz-SLO, Engineer-Kosten, Eval-Pass-Rate und API-Alternative. Hoste nicht selbst, bevor Caching, Batching, Routing und Model Right-sizing gemessen sind. Zahlen sind eine Momentaufnahme vom Juli 2026; prüfe Live-Providerpreise erneut. Passende Leistung: KI Enablement Lokale LLMs schlagen APIs nur, wenn Workload, Governance und Betrieb zusammenpassen. Eine billige GPU-Stunde ist noch kein Business Case. Der Business Case ist der Preis pro erfolgreiche Aufgabe, nachdem Auslastung, Concurrency, Redundanz, Engineer-Zeit, Eval-Pflege und EU-Datenresidenz eingerechnet sind. Wenn das Open-Weight-Modell dein Eval nicht besteht, endet die Rechnung. Wenn es besteht, die GPU aber den Großteil des Tages wartet, endet sie meistens auch. Für ein konkretes Extrembeispiel zeigt unser Colibri-Test mit GLM-5.2 auf Consumer-Hardware, warum „läuft lokal“ nicht automatisch „ist wirtschaftlich“ bedeutet: 25 GB RAM reichen technisch, aber kalt entstehen nur 0,05 bis 0,1 Token pro Sekunde. Retrieval fügt dieser Rechnung eine eigene Zeile hinzu: Unser Leitfaden zum 16x Schrumpfen des RAG-Vektorspeichers behandelt den Embedding-Index-Bedarf und den Recall-Kompromiss. Dieser Artikel ist die Self-Hosting-Ergänzung zu unserem LLM-Kostenrechner 2026. Dort vergleichen wir API-Rechnungen pro Aufgabe. Hier vergleichen wir API-Aufgaben mit lokaler Inferenz. Die wichtigste 2026er-Erkenntnis aus der Utilization-Forschung: Dieselbe H100 kann pro Million Output-Token extrem günstig oder brutal teuer wirken, je nachdem, wie gut Last und Concurrency passen. Ein aktuelles arXiv-Paper misst auf identischer H100-Hardware eine Spanne von $0.21 bis $15.25 pro Million Output-Token und zeigt, dass Utilization-blinde Rechner die Kosten um 1 / U unterschätzen. Dieser Rechner besitzt die Wirtschaftlichkeitsfrage für Server und Private Cloud. Wenn der Workload auf Kundengeräten laufen kann, behandelt unser Produktionsguide für Browser-KI mit Transformers.js clientseitigen Datenschutz, Modelldelivery, WebGPU- und WASM-Fallbacks sowie die Kostenverlagerung in Produktentwicklung und Nutzerhardware. Die kurze Antwort Nimm eine API, wenn Traffic klein, sprunghaft, schwer planbar oder auf Frontier-Reasoning angewiesen ist. Prüfe lokale Modelle, wenn du hohes und stetiges Volumen hast, ein Modell dein Eval besteht, dein Team den Stack betreiben kann und entweder EU-Governance oder ein teurer API-Baseline echte Marge lässt. Dazwischen liegen EU-regionale APIs und managed Open-Weight-Endpunkte, oft der bessere Schritt vor vollem Self-Hosting. SituationGewinnt meistWarum Interner Assistent mit wenigen tausend Aufgaben pro MonatAPILeerlauf und Ops-Kosten fressen Token-Ersparnis auf. Nachts laufende Extraktion über Millionen DokumenteLokal oder Batch-APIStetige Last und asynchrone Latenz können Kapazität füllen. Regulierter EU-Workload mit sensiblen DatenEU-API, private Deployment oder lokalGovernance kann reine Kosten schlagen, aber managed EU-Optionen gehören zuerst in den Vergleich. Public SaaS Chatbot mit PeaksAPI oder hybridElastizität, Safety-Updates und Burst-Handling sind wichtiger als GPU-Stickerpreise. High-volume Klassifikation, Routing, Enrichment oder SummariesLokaler KandidatKleine Open-Weight-Modelle können Evals bestehen und günstigere Hardware gut auslasten. Der Rechner Vergleiche API-Kosten pro erfolgreiche Aufgabe mit lokalen Kosten pro erfolgreiche Aufgabe. Nicht Provider-Rechnung gegen GPU-Rechnung. ZeileFormelHinweis API-Kosten pro Monattasks_per_month * api_cost_per_successful_taskNutze die Task-Rechnung, nicht einen einzelnen Call. API-Kosten pro Aufgabesum(input + cached_input + output + tools + retries + failure_rework)Prompt Caching und Batch nur anwenden, wenn der Workload wirklich qualifiziert. Self-Host-Kosten pro Monatgpu_hours + redundancy + storage + networking + observability + engineering_ops + eval_upkeepEngineer-Zeit gehört in die Tabelle. Lokale Kosten pro Aufgabeself_host_monthly / successful_tasks_per_month + variable_task_costDurch bestandene Aufgaben teilen, nicht durch",
  "articleSection": "Engineering",
  "author": {
    "@id": "https://wavect.io/team/kevin-riedl/#person",
    "@type": "Person",
    "name": "Kevin Riedl",
    "sameAs": [
      "https://www.wikidata.org/wiki/Q139796365",
      "https://www.linkedin.com/in/wsdt",
      "https://github.com/wsdt"
    ],
    "url": "https://wavect.io/team/kevin-riedl/"
  },
  "dateModified": "2026-07-08",
  "datePublished": "2026-07-08",
  "description": "Lokale LLMs schlagen APIs nur, wenn die komplette Rechnung gewinnt, nicht wenn die GPU-Stunde billig aussieht. API-Kosten sind Kosten pro erfolgreiche Aufgabe; Self-Host-Kosten sind GPU-Stunden plus Redundanz, Storage, Netzwerk, Observability, Engineering-Ops, Eval-Pflege und Leerlaufkapazität, geteilt durch erfolgreiche Aufgaben. Utilization-Forschung zeigt, dass dieselbe H100 je nach Concurrency und Last pro Million Output-Token sehr günstig oder extrem teuer sein kann, also ist Auslastung die erste Variable. Hosted APIs gewinnen bei niedrigem, sprunghaftem oder schnell wechselndem Workload; lokal gewinnt bei hohem stetigem Volumen, strikter EU-Datenresidenz oder als Ersatz für teure Frontier-APIs, wenn ein Open-Weight-Modell dein Eval besteht. Der Rechner fragt nach Tokenvolumen, Tokens pro Aufgabe, Concurrency, Utilization, Latenz-SLO, Engineer-Kosten, Eval-Pass-Rate und API-Alternative. Hoste nicht selbst, bevor Caching, Batching, Routing und Model Right-sizing gemessen sind. Zahlen sind eine Momentaufnahme vom Juli 2026; prüfe Live-Providerpreise erneut.",
  "headline": "Wann lokale Modelle APIs schlagen: Break-even-Rechner für EU-Unternehmen",
  "image": "https://wavect.io/img/blog/headers/header_local-models-vs-apis-break-even-eu-2026.svg",
  "inLanguage": "de",
  "mainEntityOfPage": {
    "@id": "https://wavect.io/de/blog/local-models-vs-apis-break-even-eu-2026/",
    "@type": "WebPage"
  },
  "publisher": {
    "@id": "https://wavect.io/#organization",
    "@type": [
      "Organization",
      "ProfessionalService",
      "LocalBusiness"
    ]
  },
  "url": "https://wavect.io/de/blog/local-models-vs-apis-break-even-eu-2026/",
  "wordCount": 1843
}
```

```json
{
  "@context": "https://schema.org",
  "@type": "BreadcrumbList",
  "itemListElement": [
    {
      "@type": "ListItem",
      "item": "https://wavect.io/de/",
      "name": "Startseite",
      "position": 1
    },
    {
      "@type": "ListItem",
      "item": "https://wavect.io/de/blog/overview/",
      "name": "Blog-Übersicht",
      "position": 2
    },
    {
      "@type": "ListItem",
      "item": "https://wavect.io/de/blog/topics/ai-agents/",
      "name": "AI und Agents",
      "position": 3
    },
    {
      "@type": "ListItem",
      "item": "https://wavect.io/de/blog/clusters/models-infrastructure/",
      "name": "Modelle und Infrastruktur",
      "position": 4
    },
    {
      "@type": "ListItem",
      "item": "https://wavect.io/de/blog/local-models-vs-apis-break-even-eu-2026/",
      "name": "Lokale Modelle vs APIs: EU-Break-even-Rechner | ",
      "position": 5
    }
  ]
}
```
