In diesem Beitrag
Scope-Vorlage für ein KI-MVP: Abnahmekriterien, Eval-Set, Launch-Gate und was in den SoW gehört
Ein KI-MVP abzugrenzen unterscheidet sich von einem vollständig deterministischen Workflow, weil Modellausgaben je nach Modellversion, Sampling-Einstellungen, Kontext und Formulierung variieren können. "Nutzer kann Passwort zurücksetzen" lässt sich eventuell exakt als bestanden oder fehlgeschlagen testen; "der Assistent antwortet korrekt" braucht eine definierte Aufgabenverteilung und Bewertungsregel. Unser empfohlenes Statement of Work nennt deshalb vier Dinge: ein versioniertes Eval-Set mit Referenzlabels oder Bewertungsrubriken, eine Zielmetrik samt Schwellenwert, ein Launch-Gate und die explizite Behandlung des unsicheren Falls samt Rollback. Die kopierfertige Vorlage findest du weiter unten.
Das ist ein Ausgangspunkt für die Beschaffung, keine Rechtsberatung und kein universeller Qualitätsstandard. Wir haben die regulatorischen Daten und die Evaluierungsleitlinien am 2. September 2026 erneut geprüft.
Willst du diesen Scope auf Herz und Nieren prüfen lassen, bevor du bei einer Agentur unterschreibst?
Kostenloses Erstgespräch buchenWarum "es funktioniert" bei KI nicht funktioniert
Auch konventionelle Software nutzt statistische, leistungsbezogene und eigenschaftsbasierte Tests, daher ist Abnahme nicht immer binär. Das besondere Problem hier ist, dass generierte Antworten mehrere zulässige Formen haben und zwischen Durchläufen variieren können. Miss ein definiertes Set, wiederhole Fälle, bei denen Varianz zählt, und dokumentiere Modell und Konfiguration genau. Temperatur null kann Sampling-Varianz verringern, garantiert bei einem gehosteten Modell aber keine identische Ausgabe. Führe Regressionsevaluierungen bei wesentlichen Änderungen an Prompt, Retrieval, Modell, Richtlinie oder Tools durch, mit einer dem Risiko angemessenen Häufigkeit. Das entspricht der Empfehlung des NIST, Testsets, Metriken, produktionsähnliche Bedingungen, Unsicherheit und laufendes Monitoring in seiner AI-RMF-Leitlinie zu Measure zu dokumentieren.
Was ein Statement of Work für ein KI-MVP festlegen muss
Jeder Abschnitt verdient seinen Platz. Die tragenden sind das Eval-Set, die Abnahmekriterien und das Launch-Gate.
| Abschnitt | Was er festlegen muss |
|---|---|
| Problem + ein Ergebnis | Ein Satz. Die eine Nutzeraufgabe, die das MVP erfüllen muss. Alles, was ihr nicht dient, ist out of scope. |
| In und out of scope | Zwei Listen. Die Out-of-Scope-Liste ist die tragende: Benenn die verlockenden Dinge, die du nicht baust (Mehrsprachigkeit, Sprache, Fine-Tuning, Mobile), damit sie zu Change Requests werden, nicht zu Annahmen. |
| Funktionale + KI-Verhaltensspezifikation | Normale Anforderungen plus das KI-Verhalten: Aufgabe, Tonalität, Verweigerungsverhalten (wann es "Ich weiß es nicht" sagen muss), Zitatpflicht und Fallback bei niedriger Konfidenz oder fehlendem Retrieval-Treffer. Hier kodierst du den unsicheren Fall. |
| Abnahmekriterien | Zielmetrik plus Schwellenwert auf einem benannten Eval-Set. Niemals "es funktioniert". Beispiele unten. |
| Das Eval-Set | Wie Fälle aus der vorgesehenen und vorhersehbaren Nutzung ausgewählt werden, wie die Stichprobengröße begründet wird, wer Referenzlabels oder Bewertungsrubriken besitzt und wie Fälle bewertet werden. Nutze nach Möglichkeit deterministische Prüfungen; kalibriere Modellbewerter gegen menschliche Prüfungen und dokumentiere Abweichungen. |
| Launch-Gate + Rollback | Die messbare Latte für den Go-Live, vor dem Launch vereinbart von den verantwortlichen Produkt-, Engineering-, Risiko- und Qualitätsrollen, plus Monitoring, Rollback-Auslöser und Kill-Kriterium. |
| Daten | Quellen, Herkunft, Nutzungsrechte, Umgang mit personenbezogenen Daten, Übermittlungen, Aufbewahrung und Anforderungen an den Speicherort. Bestimme anhand der EDPB-Leitlinie zu den Rollen, ob jeder Anbieter Verantwortlicher, Auftragsverarbeiter oder Unterauftragsverarbeiter ist, und vereinbare den nötigen Vertrag und die Weisungen. No-Training- und Aufbewahrungseinstellungen sind produktspezifische Kontrollen, keine universellen DSGVO-Formulierungen. |
| Nicht-funktionale Anforderungen | Vom Nutzer wahrgenommene und Ende-zu-Ende-Latenz, time-to-first-token, wo Streaming zählt, Kosten pro erfolgreicher Aufgabe, Nebenläufigkeit, Verfügbarkeit und datenschutzgerechte Telemetrie. Prüfe die aktuellen Input-, Output-, Cache-, Tool- und Medienpreise des gewählten Anbieters, statt ein festes Verhältnis anzunehmen. |
| Sicherheit und Compliance | Authentifizierung, Autorisierung, Mandantentrennung, Bedrohungsmodell, Incident Response, anwendbare DSGVO-Pflichten sowie die systemspezifische Klassifizierung und Transparenzpflichten des EU AI Act. |
| Meilensteine, Zahlung, IP, Übergabe | Phasen aus Discovery, Build, Evaluierung, Härtung und Launch, mit im Vertrag vereinbarten kaufmännischen Bedingungen, IP-Regelungen, Behandlung von Drittanbieter-Lizenzen und benannten Übergabeartefakten. |
Abnahmekriterien: falsch versus richtig
Das ist der Abschnitt, der entscheidet, ob du einen Anbieter an irgendetwas binden kannst.
Falsch, weil es keine Zahl, kein Set und keine Untergrenze gibt: "der Chatbot beantwortet Kundenfragen korrekt", "der Assistent ist präzise und hilfreich", "das Modell halluziniert selten", "es funktioniert gut im Test".
Besser strukturiert, mit beispielhaften Platzhaltern, die durch evidenzbasierte Schwellenwerte für das tatsächliche Risiko und die Arbeitslast ersetzt werden müssen:
- Ziel für Faithfulness [Schwellenwert], im abgerufenen Kontext verankert, gegen eine Rubrik bewertet und anhand menschlicher Labels kalibriert;
- Ziel für Antwortrelevanz [Schwellenwert];
- kritische Sicherheitsfehler [null oder eine ausdrücklich genehmigte Risikogrenze], mit benannten blockierenden Kategorien;
- Verweigerung oder Eskalation bei nicht beantwortbaren Fällen [Schwellenwert];
- p95-Budgets für time-to-first-token und vollständige Antwort [wo jeweils relevant];
- Kosten pro erfolgreicher Aufgabe [Budget] beim vereinbarten Modell und Workflow;
- keine Regression unter eine Untergrenze im Eval-Lauf vor einem Deploy.
Diese Felder sind Beispiele, keine Branchenstandards. Es gibt keine belastbare universelle Größe für ein Eval-Set und keinen universellen Schwellenwert für Faithfulness, schädliche Ausgaben, Latenz oder Kosten. Leite jeden Wert aus Nutzungshäufigkeit, Schwere möglicher Folgen, Abdeckung relevanter Gruppen, Konfidenzintervallen und dem verfügbaren Fallback ab. Das Generative AI Profile des NIST ist eine freiwillige Leitlinie, bietet aber einen nützlichen risikobasierten Rahmen. Die Bewertungsmethoden stehen in wann sich LLM-Evals lohnen.
Die kopierfertige Scope-Vorlage
Einfügen, Klammern ausfüllen, Nichtzutreffendes löschen. Schick sie herum, bevor du ein einziges Angebot annimmst.
KI-MVP-Scope / SoW, [Projektname]
Datum [Datum] · Version [v0.1] · Owner [Name]
1. Problem + ein Ergebnis. Problem: [ein Satz]. Das eine Ergebnis, das dieses MVP liefern muss: [Nutzer] kann [X tun], damit [Y].
2. Scope. In scope: [Feature 1], [Feature 2]. Out of scope, nur per Change Request: [Mehrsprachigkeit], [Sprache], [Fine-Tuning], [Mobile].
3. Funktional + KI-Verhalten. Funktional: [Liste]. KI-Verhalten: Aufgabe [genau was], Tonalität [knapp, keine Spekulation], Zitate [muss oder darf nicht in Quellen verankern], Verweigerung [bei out of scope oder niedriger Konfidenz "Ich weiß es nicht" sagen oder eskalieren], Fallback [Sekundärmodell, gecachte Antwort oder menschliche Übergabe].
4. Abnahmekriterien. Auf Eval-Set [Name/Version]: [Metrik] >= [Schwellenwert mit Begründung und Unsicherheit]; kritische Sicherheitsfehler [null oder definierte Risikogrenze]; korrekte Verweigerung oder Eskalation >= [Schwellenwert] bei nicht beantwortbaren Fällen; p95 [Latenzmaß] < [Budget]; Kosten pro erfolgreicher Aufgabe < [Budget]; keine wesentliche Regression unter eine vereinbarte Untergrenze vor dem Deploy.
5. Eval-Set. Größe [N, mit Stichprobenbegründung] über [Happy Path], [Edge], [nicht beantwortbar], [adversarial] und relevante Gruppenfälle. Owner der Referenzen: [Fachexperte des Kunden]. Bewertung: deterministische Prüfungen für [objektive Felder], Modellbewerter mit Rubrik für [Qualität] und verblindete menschliche Prüfung zur Kalibrierung und bei Streitfällen. Gespeichert und versioniert in [Ort].
6. Launch-Gate + Rollback. Go-Live, wenn alle Untergrenzen aus Abschnitt 4 erreicht sind, abgezeichnet von [Produkt] + [Engineering] + [QA]. Rollback: Wenn [Metrik] über ein [Fenster] unter [Untergrenze] fällt, automatisch zurückrollen. Kill-Kriterium: Nicht ausliefern, wenn [Faithfulness < X% oder eine schädliche Ausgabe].
7. Daten. Quellen [Liste], Herkunft und Rechte [je Quelle], personenbezogene Daten [Art, Zweck, Rechtsgrundlage, Aufbewahrung], Übermittlung und Speicherort [Anforderungen]. Anbieterrolle [Verantwortlicher/Auftragsverarbeiter/Unterauftragsverarbeiter], Artikel-28-Bedingungen, wo anwendbar, Trainingsnutzung [Bedingungen], Aufbewahrung [Bedingungen/Einstellungen].
8. Nicht-funktionale Anforderungen. Latenz-, Verfügbarkeits-, Nebenläufigkeits- und Kostenbudgets wie in Abschnitt 4. Observability: nur die für Qualität, Sicherheit und Kosten nötigen Metadaten erfassen; rohe Prompts und Antworten ohne Begründung vermeiden oder schwärzen; Zugriff und Aufbewahrung festlegen; Warnung bei [Schwellenwert].
9. Sicherheit + Compliance. Auth [Methode], Berechtigungen und Mandantentrennung [Modell], Bedrohungsmodell und Incident Response, DSGVO-Pflichten [Rollen, Verzeichnis wo nötig, Rechtsgrundlage, DPIA bei voraussichtlich hohem Risiko, Auftragsverarbeiterbedingungen] sowie anwendbare Rolle, Klassifizierung, Artikel-50-Pflicht und Frist nach dem EU AI Act.
10. Meilensteine + Zahlung. Discovery, Build, Evaluierung und Härtung, Launch, Zahlung je Phase. Eigentum, Übertragung oder Lizenzierung von IP, Drittanbieter-Komponenten und Wirksamkeitsdatum: [Vertragsbedingungen]. Übergabe: Eval-Set und Ergebnisse, Prompt- und Modellregister, Architektur- und Datenflussdiagramm, Runbook, Zugriff auf Logs, Credentials. Abzeichnung: Kunde [__] Anbieter [__] Datum [__].

"Wenn der Scope dir nicht in Zahlen sagen kann, wie gut genug aussieht und was passiert, wenn das Modell falsch liegt, dann ist es kein Scope. Es ist ein Wunsch. Das Eval-Set und das Launch-Gate sind die zwei Zeilen, die aus einer KI-Demo etwas machen, das du tatsächlich kaufen kannst."
Eine Anmerkung zum AI Act
Artikel 50 gilt nicht pauschal für jede App mit KI. Anbieter von Systemen, die zur direkten Interaktion mit Menschen bestimmt sind, müssen grundsätzlich darüber informieren, dass eine Interaktion mit KI stattfindet, sofern dies für eine angemessen informierte, aufmerksame und verständige Person nicht offensichtlich ist; gesetzliche Ausnahmen bleiben vorbehalten. Weitere Artikel-50-Pflichten betreffen die Kennzeichnung synthetischer Inhalte und bestimmte Offenlegungen durch Betreiber. Die meisten anwendbaren Artikel-50-Pflichten gelten seit 2. August 2026; für Anbieter nach Artikel 50 Absatz 2, deren Systeme für synthetische Inhalte bereits auf dem Markt waren, gilt eine Übergangsfrist bis 2. Dezember 2026. Nach Verordnung (EU) 2026/1744 gelten Hochrisiko-Regeln nach Anhang III ab 2. Dezember 2027 und für produktintegrierte Hochrisiko-Systeme nach Anhang I ab 2. August 2028. Prüfe den aktuellen konsolidierten AI-Act-Text und deine Rolle, statt ein Datum auf jedes System anzuwenden.
Häufig gestellte Fragen
Wie schreibt man Abnahmekriterien für ein KI-Feature?
Was ist ein Eval-Set?
Wem sollte das Eval-Set gehören?
Wie werden Eval-Fälle bewertet?
Was ist ein Launch-Gate für eine LLM-App?
Was gehört in ein Statement of Work für KI?
Warum kann ich nicht einfach "die KI antwortet korrekt" in den Scope schreiben?
Wie behandle ich den Fall, dass die KI falsch liegt oder unsicher ist?
Welche Datenklauseln braucht ein KI-MVP-SoW?
Betrifft der EU AI Act meinen KI-MVP-Scope?
Fazit
Ein KI-MVP-Scope hängt von einem belastbaren Eval-Set und Launch-Gate ab. Zusammen machen sie aus einem vagen "baut uns einen Assistenten" Nachweise und Vertragsbedingungen, die ein Käufer beurteilen kann.
Schreib vor einem Angebot das Ergebnis auf, zieh die Out-of-Scope-Linie, definiere begründete Metriken und Untergrenzen auf einem von deinen Fachexperten verantworteten Set, entscheide, was bei Unsicherheit passiert, und benenne die Launch-Latte. Füll die Vorlage zuerst aus, damit Angebote anhand derselben Anforderungen vergleichbar werden.
Willst du das Eval-Set und das Launch-Gate fest in deinen MVP-Scope eingebaut haben?
Kostenloses Erstgespräch buchen