Zurück
Kevin Riedl

13 min Lesezeit · 12. Juni 2026
Zuletzt geprüft

Weiter
Entsteht auf deinem Gerät, ohne Instagram-Verbindung. Den Beitragslink kopieren wir für deinen Link-Sticker.

Scope-Vorlage für ein KI-MVP: Abnahmekriterien, Eval-Set, Launch-Gate und was in den SoW gehört

Ein KI-MVP abzugrenzen unterscheidet sich von einem vollständig deterministischen Workflow, weil Modellausgaben je nach Modellversion, Sampling-Einstellungen, Kontext und Formulierung variieren können. "Nutzer kann Passwort zurücksetzen" lässt sich eventuell exakt als bestanden oder fehlgeschlagen testen; "der Assistent antwortet korrekt" braucht eine definierte Aufgabenverteilung und Bewertungsregel. Unser empfohlenes Statement of Work nennt deshalb vier Dinge: ein versioniertes Eval-Set mit Referenzlabels oder Bewertungsrubriken, eine Zielmetrik samt Schwellenwert, ein Launch-Gate und die explizite Behandlung des unsicheren Falls samt Rollback. Die kopierfertige Vorlage findest du weiter unten.

Das ist ein Ausgangspunkt für die Beschaffung, keine Rechtsberatung und kein universeller Qualitätsstandard. Wir haben die regulatorischen Daten und die Evaluierungsleitlinien am 2. September 2026 erneut geprüft.

Willst du diesen Scope auf Herz und Nieren prüfen lassen, bevor du bei einer Agentur unterschreibst?

 Kostenloses Erstgespräch buchen

Warum "es funktioniert" bei KI nicht funktioniert

Auch konventionelle Software nutzt statistische, leistungsbezogene und eigenschaftsbasierte Tests, daher ist Abnahme nicht immer binär. Das besondere Problem hier ist, dass generierte Antworten mehrere zulässige Formen haben und zwischen Durchläufen variieren können. Miss ein definiertes Set, wiederhole Fälle, bei denen Varianz zählt, und dokumentiere Modell und Konfiguration genau. Temperatur null kann Sampling-Varianz verringern, garantiert bei einem gehosteten Modell aber keine identische Ausgabe. Führe Regressionsevaluierungen bei wesentlichen Änderungen an Prompt, Retrieval, Modell, Richtlinie oder Tools durch, mit einer dem Risiko angemessenen Häufigkeit. Das entspricht der Empfehlung des NIST, Testsets, Metriken, produktionsähnliche Bedingungen, Unsicherheit und laufendes Monitoring in seiner AI-RMF-Leitlinie zu Measure zu dokumentieren.

Was ein Statement of Work für ein KI-MVP festlegen muss

Jeder Abschnitt verdient seinen Platz. Die tragenden sind das Eval-Set, die Abnahmekriterien und das Launch-Gate.

AbschnittWas er festlegen muss
Problem + ein ErgebnisEin Satz. Die eine Nutzeraufgabe, die das MVP erfüllen muss. Alles, was ihr nicht dient, ist out of scope.
In und out of scopeZwei Listen. Die Out-of-Scope-Liste ist die tragende: Benenn die verlockenden Dinge, die du nicht baust (Mehrsprachigkeit, Sprache, Fine-Tuning, Mobile), damit sie zu Change Requests werden, nicht zu Annahmen.
Funktionale + KI-VerhaltensspezifikationNormale Anforderungen plus das KI-Verhalten: Aufgabe, Tonalität, Verweigerungsverhalten (wann es "Ich weiß es nicht" sagen muss), Zitatpflicht und Fallback bei niedriger Konfidenz oder fehlendem Retrieval-Treffer. Hier kodierst du den unsicheren Fall.
AbnahmekriterienZielmetrik plus Schwellenwert auf einem benannten Eval-Set. Niemals "es funktioniert". Beispiele unten.
Das Eval-SetWie Fälle aus der vorgesehenen und vorhersehbaren Nutzung ausgewählt werden, wie die Stichprobengröße begründet wird, wer Referenzlabels oder Bewertungsrubriken besitzt und wie Fälle bewertet werden. Nutze nach Möglichkeit deterministische Prüfungen; kalibriere Modellbewerter gegen menschliche Prüfungen und dokumentiere Abweichungen.
Launch-Gate + RollbackDie messbare Latte für den Go-Live, vor dem Launch vereinbart von den verantwortlichen Produkt-, Engineering-, Risiko- und Qualitätsrollen, plus Monitoring, Rollback-Auslöser und Kill-Kriterium.
DatenQuellen, Herkunft, Nutzungsrechte, Umgang mit personenbezogenen Daten, Übermittlungen, Aufbewahrung und Anforderungen an den Speicherort. Bestimme anhand der EDPB-Leitlinie zu den Rollen, ob jeder Anbieter Verantwortlicher, Auftragsverarbeiter oder Unterauftragsverarbeiter ist, und vereinbare den nötigen Vertrag und die Weisungen. No-Training- und Aufbewahrungseinstellungen sind produktspezifische Kontrollen, keine universellen DSGVO-Formulierungen.
Nicht-funktionale AnforderungenVom Nutzer wahrgenommene und Ende-zu-Ende-Latenz, time-to-first-token, wo Streaming zählt, Kosten pro erfolgreicher Aufgabe, Nebenläufigkeit, Verfügbarkeit und datenschutzgerechte Telemetrie. Prüfe die aktuellen Input-, Output-, Cache-, Tool- und Medienpreise des gewählten Anbieters, statt ein festes Verhältnis anzunehmen.
Sicherheit und ComplianceAuthentifizierung, Autorisierung, Mandantentrennung, Bedrohungsmodell, Incident Response, anwendbare DSGVO-Pflichten sowie die systemspezifische Klassifizierung und Transparenzpflichten des EU AI Act.
Meilensteine, Zahlung, IP, ÜbergabePhasen aus Discovery, Build, Evaluierung, Härtung und Launch, mit im Vertrag vereinbarten kaufmännischen Bedingungen, IP-Regelungen, Behandlung von Drittanbieter-Lizenzen und benannten Übergabeartefakten.

Abnahmekriterien: falsch versus richtig

Das ist der Abschnitt, der entscheidet, ob du einen Anbieter an irgendetwas binden kannst.

Falsch, weil es keine Zahl, kein Set und keine Untergrenze gibt: "der Chatbot beantwortet Kundenfragen korrekt", "der Assistent ist präzise und hilfreich", "das Modell halluziniert selten", "es funktioniert gut im Test".

Besser strukturiert, mit beispielhaften Platzhaltern, die durch evidenzbasierte Schwellenwerte für das tatsächliche Risiko und die Arbeitslast ersetzt werden müssen:

  • Ziel für Faithfulness [Schwellenwert], im abgerufenen Kontext verankert, gegen eine Rubrik bewertet und anhand menschlicher Labels kalibriert;
  • Ziel für Antwortrelevanz [Schwellenwert];
  • kritische Sicherheitsfehler [null oder eine ausdrücklich genehmigte Risikogrenze], mit benannten blockierenden Kategorien;
  • Verweigerung oder Eskalation bei nicht beantwortbaren Fällen [Schwellenwert];
  • p95-Budgets für time-to-first-token und vollständige Antwort [wo jeweils relevant];
  • Kosten pro erfolgreicher Aufgabe [Budget] beim vereinbarten Modell und Workflow;
  • keine Regression unter eine Untergrenze im Eval-Lauf vor einem Deploy.

Diese Felder sind Beispiele, keine Branchenstandards. Es gibt keine belastbare universelle Größe für ein Eval-Set und keinen universellen Schwellenwert für Faithfulness, schädliche Ausgaben, Latenz oder Kosten. Leite jeden Wert aus Nutzungshäufigkeit, Schwere möglicher Folgen, Abdeckung relevanter Gruppen, Konfidenzintervallen und dem verfügbaren Fallback ab. Das Generative AI Profile des NIST ist eine freiwillige Leitlinie, bietet aber einen nützlichen risikobasierten Rahmen. Die Bewertungsmethoden stehen in wann sich LLM-Evals lohnen.

Die kopierfertige Scope-Vorlage

Einfügen, Klammern ausfüllen, Nichtzutreffendes löschen. Schick sie herum, bevor du ein einziges Angebot annimmst.

KI-MVP-Scope / SoW, [Projektname]
Datum [Datum] · Version [v0.1] · Owner [Name]

1. Problem + ein Ergebnis. Problem: [ein Satz]. Das eine Ergebnis, das dieses MVP liefern muss: [Nutzer] kann [X tun], damit [Y].

2. Scope. In scope: [Feature 1], [Feature 2]. Out of scope, nur per Change Request: [Mehrsprachigkeit], [Sprache], [Fine-Tuning], [Mobile].

3. Funktional + KI-Verhalten. Funktional: [Liste]. KI-Verhalten: Aufgabe [genau was], Tonalität [knapp, keine Spekulation], Zitate [muss oder darf nicht in Quellen verankern], Verweigerung [bei out of scope oder niedriger Konfidenz "Ich weiß es nicht" sagen oder eskalieren], Fallback [Sekundärmodell, gecachte Antwort oder menschliche Übergabe].

4. Abnahmekriterien. Auf Eval-Set [Name/Version]: [Metrik] >= [Schwellenwert mit Begründung und Unsicherheit]; kritische Sicherheitsfehler [null oder definierte Risikogrenze]; korrekte Verweigerung oder Eskalation >= [Schwellenwert] bei nicht beantwortbaren Fällen; p95 [Latenzmaß] < [Budget]; Kosten pro erfolgreicher Aufgabe < [Budget]; keine wesentliche Regression unter eine vereinbarte Untergrenze vor dem Deploy.

5. Eval-Set. Größe [N, mit Stichprobenbegründung] über [Happy Path], [Edge], [nicht beantwortbar], [adversarial] und relevante Gruppenfälle. Owner der Referenzen: [Fachexperte des Kunden]. Bewertung: deterministische Prüfungen für [objektive Felder], Modellbewerter mit Rubrik für [Qualität] und verblindete menschliche Prüfung zur Kalibrierung und bei Streitfällen. Gespeichert und versioniert in [Ort].

6. Launch-Gate + Rollback. Go-Live, wenn alle Untergrenzen aus Abschnitt 4 erreicht sind, abgezeichnet von [Produkt] + [Engineering] + [QA]. Rollback: Wenn [Metrik] über ein [Fenster] unter [Untergrenze] fällt, automatisch zurückrollen. Kill-Kriterium: Nicht ausliefern, wenn [Faithfulness < X% oder eine schädliche Ausgabe].

7. Daten. Quellen [Liste], Herkunft und Rechte [je Quelle], personenbezogene Daten [Art, Zweck, Rechtsgrundlage, Aufbewahrung], Übermittlung und Speicherort [Anforderungen]. Anbieterrolle [Verantwortlicher/Auftragsverarbeiter/Unterauftragsverarbeiter], Artikel-28-Bedingungen, wo anwendbar, Trainingsnutzung [Bedingungen], Aufbewahrung [Bedingungen/Einstellungen].

8. Nicht-funktionale Anforderungen. Latenz-, Verfügbarkeits-, Nebenläufigkeits- und Kostenbudgets wie in Abschnitt 4. Observability: nur die für Qualität, Sicherheit und Kosten nötigen Metadaten erfassen; rohe Prompts und Antworten ohne Begründung vermeiden oder schwärzen; Zugriff und Aufbewahrung festlegen; Warnung bei [Schwellenwert].

9. Sicherheit + Compliance. Auth [Methode], Berechtigungen und Mandantentrennung [Modell], Bedrohungsmodell und Incident Response, DSGVO-Pflichten [Rollen, Verzeichnis wo nötig, Rechtsgrundlage, DPIA bei voraussichtlich hohem Risiko, Auftragsverarbeiterbedingungen] sowie anwendbare Rolle, Klassifizierung, Artikel-50-Pflicht und Frist nach dem EU AI Act.

10. Meilensteine + Zahlung. Discovery, Build, Evaluierung und Härtung, Launch, Zahlung je Phase. Eigentum, Übertragung oder Lizenzierung von IP, Drittanbieter-Komponenten und Wirksamkeitsdatum: [Vertragsbedingungen]. Übergabe: Eval-Set und Ergebnisse, Prompt- und Modellregister, Architektur- und Datenflussdiagramm, Runbook, Zugriff auf Logs, Credentials. Abzeichnung: Kunde [__] Anbieter [__] Datum [__].

Kevin Riedl

"Wenn der Scope dir nicht in Zahlen sagen kann, wie gut genug aussieht und was passiert, wenn das Modell falsch liegt, dann ist es kein Scope. Es ist ein Wunsch. Das Eval-Set und das Launch-Gate sind die zwei Zeilen, die aus einer KI-Demo etwas machen, das du tatsächlich kaufen kannst."

Eine Anmerkung zum AI Act

Artikel 50 gilt nicht pauschal für jede App mit KI. Anbieter von Systemen, die zur direkten Interaktion mit Menschen bestimmt sind, müssen grundsätzlich darüber informieren, dass eine Interaktion mit KI stattfindet, sofern dies für eine angemessen informierte, aufmerksame und verständige Person nicht offensichtlich ist; gesetzliche Ausnahmen bleiben vorbehalten. Weitere Artikel-50-Pflichten betreffen die Kennzeichnung synthetischer Inhalte und bestimmte Offenlegungen durch Betreiber. Die meisten anwendbaren Artikel-50-Pflichten gelten seit 2. August 2026; für Anbieter nach Artikel 50 Absatz 2, deren Systeme für synthetische Inhalte bereits auf dem Markt waren, gilt eine Übergangsfrist bis 2. Dezember 2026. Nach Verordnung (EU) 2026/1744 gelten Hochrisiko-Regeln nach Anhang III ab 2. Dezember 2027 und für produktintegrierte Hochrisiko-Systeme nach Anhang I ab 2. August 2028. Prüfe den aktuellen konsolidierten AI-Act-Text und deine Rolle, statt ein Datum auf jedes System anzuwenden.

Häufig gestellte Fragen

Wie schreibt man Abnahmekriterien für ein KI-Feature?
Nicht als "es funktioniert." Definiere eine Zielmetrik und einen begründeten Schwellenwert auf einem benannten, versionierten Eval-Set, dazu blockierende Sicherheitskategorien, Verweigerungs- oder Eskalationsverhalten, Latenz- und Kostenbudgets sowie eine Regressionsregel. Wiederhole Durchläufe, wo Ausgabevarianz zählt, und dokumentiere Unsicherheit, statt universelle Zahlen zu kopieren.
Was ist ein Eval-Set?
Eine versionierte, klar verantwortete Stichprobe aus vorgesehenen, Rand-, nicht beantwortbaren, adversarialen und relevanten Gruppenfällen mit Referenzlabels oder Rubriken. Es gibt keine universelle Mindestgröße. Begründe Abdeckung und Unsicherheit für Entscheidung und Risiko und erweitere das Set mit Fehlern aus der Produktion.
Wem sollte das Eval-Set gehören?
Einem Fachexperten auf deiner Seite, nicht dem Anbieter allein. Die Person, die weiß, wie eine korrekte Antwort aussieht, muss die Goldantworten definieren, sonst lässt du den Erbauer seine eigenen Hausaufgaben benoten.
Wie werden Eval-Fälle bewertet?
Kombiniere deterministische Code-Prüfungen für objektive Felder wie Daten, IDs und JSON-Form mit rubrikbasierter Modellbewertung und menschlicher Prüfung, wo Urteil nötig ist. Kalibriere Modellbewerter gegen verblindete menschliche Labels, erfasse Abweichungen und leite strittige oder folgenreiche Fälle an Menschen weiter.
Was ist ein Launch-Gate für eine LLM-App?
Die messbare Latte für den Go-Live: Schwellenwerte und blockierende Bedingungen, die das System auf dem vereinbarten Eval-Set erfüllen muss, abgezeichnet von den verantwortlichen Produkt-, Engineering-, Risiko- und Qualitätsrollen. Es definiert außerdem Monitoring, Rollback-Auslöser und Kill-Kriterium.
Was gehört in ein Statement of Work für KI?
Problem und ein Ergebnis, in und out of scope, funktionale Anforderungen plus eine KI-Verhaltensspezifikation (Tonalität, Verweigerung, Zitate, Fallback), Abnahmekriterien als Metrik plus Schwellenwert auf einem Eval-Set, das Eval-Set selbst, das Launch-Gate und Rollback, Datenrechte sowie PII und Speicherort, nicht-funktionale Anforderungen (Latenz, Kosten pro Aktion, Logging), Sicherheit und Compliance sowie Meilensteine, Zahlung, IP und Übergabeartefakte.
Warum kann ich nicht einfach "die KI antwortet korrekt" in den Scope schreiben?
Weil generierte Antworten mehrere zulässige Formen haben und zwischen Durchläufen oder Modellversionen variieren können. Du brauchst ein definiertes Set, eine Bewertungsregel und eine Untergrenze, sonst gibt es nichts Objektives zum Abzeichnen und nichts, worüber man bei schlechter Qualität streiten kann.
Wie behandle ich den Fall, dass die KI falsch liegt oder unsicher ist?
Lege einen Verweigerungs-, Eskalations- oder Fallback-Pfad fest und teste ihn mit nicht beantwortbaren und mehrdeutigen Fällen. Bestimme den Schwellenwert anhand der möglichen Folgen und der verfügbaren menschlichen Prüfung, statt einen universellen Prozentsatz zu kopieren.
Welche Datenklauseln braucht ein KI-MVP-SoW?
Dokumentiere Herkunft und Nutzungsrechte, Zweck und Rechtsgrundlage für personenbezogene Daten, Aufbewahrung, Übermittlung und Speicherort, Anbieterrollen, Auftragsverarbeiterbedingungen, wo anwendbar, Trainingsnutzung, Sicherheitskontrollen, Löschung und Audit-Rechte. Ein Modellanbieter kann je nach Vertragskette Auftrags- oder Unterauftragsverarbeiter sein.
Betrifft der EU AI Act meinen KI-MVP-Scope?
Das kann er, abhängig von System, Rolle und Use Case. Anwendbare Artikel-50-Pflichten gelten grundsätzlich seit 2. August 2026, Hochrisiko-Regeln nach Anhang III ab 2. Dezember 2027 und produktintegrierte Hochrisiko-Regeln nach Anhang I ab 2. August 2028. Klassifiziere das System und prüfe das konsolidierte Gesetz.

Fazit

Ein KI-MVP-Scope hängt von einem belastbaren Eval-Set und Launch-Gate ab. Zusammen machen sie aus einem vagen "baut uns einen Assistenten" Nachweise und Vertragsbedingungen, die ein Käufer beurteilen kann.

Schreib vor einem Angebot das Ergebnis auf, zieh die Out-of-Scope-Linie, definiere begründete Metriken und Untergrenzen auf einem von deinen Fachexperten verantworteten Set, entscheide, was bei Unsicherheit passiert, und benenne die Launch-Latte. Füll die Vorlage zuerst aus, damit Angebote anhand derselben Anforderungen vergleichbar werden.

Willst du das Eval-Set und das Launch-Gate fest in deinen MVP-Scope eingebaut haben?

 Kostenloses Erstgespräch buchen

Hilfe für KI in Produktion

Du baust ein KI-Produkt und machst dir Sorgen um Inference-Kosten, Architektur oder Production Readiness? Wavect hilft Gründern, KI-Prototypen in zuverlässige Produktionssysteme zu verwandeln.

Passender Service:

Postfach, ohne Lärm

Folge der Arbeit, die für dich zählt

Du bekommst eine kurze E-Mail, wenn wir etwas Neues veröffentlichen. Folge dem ganzen Blog oder nur den Themen, die dich interessieren.

Was möchtest du erhalten?
Themen auswählen

Kostenlos, Double-Opt-in, ohne Tracking-Pixel.

Zurück
Kevin Riedl

13 min Lesezeit · 12. Juni 2026
Zuletzt geprüft

Weiter

Erhalte die nächste Feldnotiz zu Produkt und MVP

Eine kurze E-Mail, wenn wir veröffentlichen. Ohne Tracking-Pixel und ohne Postfachfüller.

Kostenlos, Double-Opt-in, ohne Tracking-Pixel.