---
title: "Canary AI QA: Fehlererkennung statt Benchmark-Punkte prüfen"
canonical: https://wavect.io/de/blog/canary-ai-qa-defect-detection/
language: de
description: "Bewerte Canary neben Claude Code oder Codex mit bekannten Defekten, fehlerfreien Kontrollen und ausgeführten Tests. Ordne QA-Bench v0 richtig ein."
image: "https://wavect.io/img/blog/headers/header_canary-ai-qa-defect-detection.png"
---

[**Zurück**](/de/blog/overview/)

[![Kevin Riedl](/img/team/kevin.webp)](/de/team/kevin-riedl/)

[Kevin Riedl](/de/team/kevin-riedl/) https://linkedin.com/in/wsdt

3 min Lesezeit · 8. Oktober 2026 Zuletzt geprüft 8. Oktober 2026

[**Weiter**](/de/blog/greptile-base-plus-apex-review-budget/)

# Canary AI QA: Fehlererkennung statt Benchmark-Punkte prüfen

TL;DR

Canarys QA-Bench v0 bewertet erzeugte Prüftexte mit einem LLM als Richter. Der Score ist keine gemessene Fehlererkennungsquote. Prüfe die Einführung mit bekannten Defekten, fehlerfreien Kontrollen, ausgeführten Tests und unabhängig reproduzierten Befunden.

**Quellenbasis:** Dokumentation am 8. Oktober 2026 geprüft. Dies ist ein recherchierter Implementierungsleitfaden. Der folgende Pilot ist ein Vorschlag; wir haben diese Herstellerprüfungen nicht durchgeführt und ihre Leistung nicht gemessen.

## Was belegt Canarys QA-Benchmark?

Canarys [Methodik von QA-Bench v0](https://www.runcanary.ai/blog/qa-bench-v0) bewertet Prüfausgaben zu 35 PRs in vier Repositories. Ein LLM bewertet Relevanz, Abdeckung und Kohärenz. Die Einschränkungen nennen den Unterschied zwischen groben Testplänen und konkreten Skripten und halten ausgeführte Pass-Fail-Tests für einen faireren Vergleich.

Ein Gesamtwert wie 83,1 bedeutet deshalb nicht „Canary findet 83,1 Prozent der Fehler“. Er belegt auch nicht die Leistung deiner aktuellen Claude-Code- oder Codex-Konfiguration. Nutze den Benchmark, um die Prüffrage zu verstehen, und miss anschließend das tatsächlich benötigte Ergebnis.

## Was sollte ein Einführungspilot stattdessen messen?

Prüfe je bekanntem Defekt, ob der erzeugte und ausgeführte Test auf der fehlerhaften Version scheitert und auf der reparierten aus dem richtigen Grund besteht. Trenne Ablaufidentifikation, Testerstellung, Ausführung und Fehlerreproduktion. Ein guter Plan kann nützlich sein, ohne bereits ein ausführbarer Regressionstest zu sein.

Canarys [veröffentlichte Einrichtungsreferenz](https://www.runcanary.ai/#install) ist der Ausgangspunkt für aktuelle Integrationen. Fixiere getestete Version und unterstützten Ablauf; ein Modellname im alten Benchmark belegt keine heutige Kompatibilität. Trenne möglichst den feature-erstellenden Agenten von der Abnahmeevidenz.

## Welche Fehler gehören in die Testanwendung?

Nutze eine isolierte Anwendung mit zwei Mandanten und einer bekannten korrekten Referenzversion. Baue jeweils einen Defekt ein, halte seine Kennzeichnung vor dem geprüften Agenten verborgen und ergänze fehlerfreie Kontrolländerungen. Die Tabelle ist ein vorgeschlagener Korpus, kein Canary-Ergebnis.

| Defekt | Erforderliche Assertion | Nützliche Kontrolle |
| --- | --- | --- |
| Fehlende Mandantenprüfung | A kann B's Datensatz nicht lesen | A kann eigene Daten lesen |
| Doppelte Übermittlung | Ein logischer Request erzeugt einen Datensatz | Zwei verschiedene Requests erzeugen zwei |
| Rechte nur in UI geprüft | Direkter Backend-Schreibzugriff wird verweigert | Berechtigte Rolle kann schreiben |
| Fehler als Erfolg angezeigt | Anzeige und gespeicherter Zustand zeigen Fehler | Normaler Ablauf speichert korrekt |
| Zu breites Löschen | Nur ausgewählte Daten werden gelöscht | Andere Daten bleiben lesbar |
| Abgelaufene Session | Kein privilegierter Schreibzugriff | Gültige Session funktioniert |

Absichtliche Sicherheitsdefekte gehören ausschließlich in lokale oder isolierte synthetische Daten. Baue sie nicht in geteilte Produktion ein, um realistische Ergebnisse zu erhalten.

## Wie bewertest du Ergebnisse ohne Selbsttäuschung?

1. Nutze dieselbe Ausgangsapp, PR-Kontext und Zeitgrenze für alle Konfigurationen.
2. Sichere Pläne, Tests, Befehle, Logs und Zielzustand.
3. Reproduziere gemeldete Defekte unabhängig und klassifiziere Infrastrukturfehler separat.
4. Führe jeden Kandidatentest gegen fehlerhafte und reparierte Version aus.
5. Zähle bestätigte Erkennungen, übersehene bekannte Defekte, Fehlalarme bei Kontrollen und Review-Minuten.

Nenne Ergebnisse je Fehlerklasse und Stichprobengröße. Scheitert die App beim Start, ist das keine erfolgreiche Fehlererkennung. Scheitert der Test auch nach Reparatur, belegt er keine brauchbare Regression. Wiederhole Läufe, damit Schwankungen sichtbar bleiben.

## Kann Canary die bestehende Testsuite ersetzen?

Entscheide das nicht anhand eines Herstellerscores. Behalte deterministische Tests für geschäftliche Invarianten und kritische Integrationen. Generierte explorative Tests können zusätzliche Abläufe erschließen. Übernimm einen Test erst nach Prüfung von Assertions, Testdatenverantwortung und Stabilität in die gepflegte Suite.

Definiere eigene Stop-Kriterien für Datenlecks und destruktive Fehler. Ein hoher Durchschnitt darf einen übersehenen kritischen Mandantenfehler nicht ausgleichen. Lege diese Grenze vor der Auswertung fest.

## Wie budgetierst du KI-QA?

Miss Kosten pro akzeptierter Prüfung inklusive Infrastruktur, Wiederholungen und menschlicher Nachprüfung. Mehrfachmeldungen sind ein Defekt. Erfasse, welche Tests nach Reparatur und nächster Produktänderung weiter nützlich sind. Niedrige Erstellungskosten können durch Fehlalarme pro PR teuer werden.

## Wann solltest du Canary ergänzen?

Wenn ein isolierter Pilot zusätzliche brauchbare Defekte oder gepflegte Regressionstests zu tragbarem Prüfaufwand zeigt. Liegt der Nutzen in der Ablaufplanung, nutze und benenne ihn so. Mit Defektkorpus und Abnahmeregeln kannst du [eine unabhängige QA-Evaluation eingrenzen](/de/contact/).

[Lade das vorgeschlagene Pilotprotokoll als JSON herunter. Es enthält Abnahmefälle und leere Ergebnisfelder, keine gemessenen Anbieterresultate.](/downloads/canary-ai-qa-defect-detection-pilot.json)

## Weiterführende Umsetzungshilfe

[Greptile Base, Plus oder Apex: PR-Reviews sinnvoll budgetieren](/de/blog/greptile-base-plus-apex-review-budget/). [Arga Labs oder Archal: Zustandsbasierte Integrationstests](/de/blog/arga-vs-archal-agent-integration-testing/).

## Geprüfte Quellen

- [Canary: QA-Bench v0](https://www.runcanary.ai/blog/qa-bench-v0)
- [Canary: CLI](https://www.runcanary.ai/#install)

**Unabhängigkeit und Marken:** Wavect veröffentlicht diese Seite und ist selbst Anbieter, wir haben also ein wirtschaftliches Interesse daran. Mit den hier genannten anderen Unternehmen sind wir weder verbunden noch von ihnen beauftragt oder empfohlen, und alle Firmennamen, Marken und Warenzeichen Dritter gehören ihren jeweiligen Inhabern. Aussagen über andere Anbieter stammen aus öffentlich zugänglichen Quellen, vor allem aus deren eigenen veröffentlichten Seiten, mit Stand des auf dieser Seite genannten Prüfdatums, und können sich seither geändert haben. Bitte prüfe sie vor einer Entscheidung selbst. Diese Seite wurde nach bestem Wissen und Gewissen erstellt, mit dem Ziel, möglichst objektiv zu bleiben. Wenn dir etwas falsch oder unfair erscheint, schreib uns und wir korrigieren es: [office@wavect.io](mailto:office@wavect.io)

QA und Produktionsreife

## In diesem Cluster weiterlesen

Tests, Audits, Wartung und Härtung für verlässliche Produktionssoftware.

[Mit dem Grundlagenartikel starten**QA für KI-generierten Code**](/de/blog/qa-for-ai-generated-code/)

- [Greptile Base, Plus oder Apex: PR-Reviews sinnvoll budgetieren](/de/blog/greptile-base-plus-apex-review-budget/)
- [Arga Labs oder Archal: Zustandsbasierte Integrationstests](/de/blog/arga-vs-archal-agent-integration-testing/)
- [Cua für Desktop-QA: Browser und native App gemeinsam testen](/de/blog/cua-desktop-qa-browser-native-workflow/)
- [Browser Use vs. Playwright: Aktionen nach Timeouts sicher prüfen](/de/blog/browser-use-vs-playwright-authenticated-workflow/)
- [ChatGPT Dots + GitHub: Vom Bugreport zum geprüften PR](/de/blog/chatgpt-dots-github-bug-triage/)

[**Zurück**](/de/blog/overview/)

[![Kevin Riedl](/img/team/kevin.webp)](/de/team/kevin-riedl/)

[Kevin Riedl](/de/team/kevin-riedl/) https://linkedin.com/in/wsdt

3 min Lesezeit · 8. Oktober 2026 Zuletzt geprüft 8. Oktober 2026

[**Weiter**](/de/blog/greptile-base-plus-apex-review-budget/)

## Structured Data

```json
{
  "@context": "https://schema.org",
  "@graph": [
    {
      "@id": "https://wavect.io/#organization",
      "@type": [
        "Organization",
        "ProfessionalService",
        "LocalBusiness"
      ],
      "employee": [
        {
          "@id": "https://wavect.io/team/kevin-riedl/#person",
          "@type": "Person",
          "jobTitle": "Managing Director",
          "name": "Kevin Riedl",
          "url": "https://wavect.io/team/kevin-riedl/",
          "worksFor": {
            "@id": "https://wavect.io/#organization",
            "@type": [
              "Organization",
              "ProfessionalService",
              "LocalBusiness"
            ]
          }
        },
        {
          "@id": "https://wavect.io/team/christof-jori/#person",
          "@type": "Person",
          "jobTitle": "Managing Director",
          "name": "Christof Jori",
          "url": "https://wavect.io/team/christof-jori/",
          "worksFor": {
            "@id": "https://wavect.io/#organization",
            "@type": [
              "Organization",
              "ProfessionalService",
              "LocalBusiness"
            ]
          }
        }
      ],
      "founder": [
        {
          "@id": "https://wavect.io/team/kevin-riedl/#person",
          "@type": "Person",
          "jobTitle": "Managing Director",
          "name": "Kevin Riedl",
          "url": "https://wavect.io/team/kevin-riedl/",
          "worksFor": {
            "@id": "https://wavect.io/#organization",
            "@type": [
              "Organization",
              "ProfessionalService",
              "LocalBusiness"
            ]
          }
        },
        {
          "@id": "https://wavect.io/team/christof-jori/#person",
          "@type": "Person",
          "jobTitle": "Managing Director",
          "name": "Christof Jori",
          "url": "https://wavect.io/team/christof-jori/",
          "worksFor": {
            "@id": "https://wavect.io/#organization",
            "@type": [
              "Organization",
              "ProfessionalService",
              "LocalBusiness"
            ]
          }
        }
      ],
      "legalRepresentative": [
        {
          "@id": "https://wavect.io/team/kevin-riedl/#person",
          "@type": "Person",
          "jobTitle": "Managing Director",
          "name": "Kevin Riedl",
          "url": "https://wavect.io/team/kevin-riedl/",
          "worksFor": {
            "@id": "https://wavect.io/#organization",
            "@type": [
              "Organization",
              "ProfessionalService",
              "LocalBusiness"
            ]
          }
        },
        {
          "@id": "https://wavect.io/team/christof-jori/#person",
          "@type": "Person",
          "jobTitle": "Managing Director",
          "name": "Christof Jori",
          "url": "https://wavect.io/team/christof-jori/",
          "worksFor": {
            "@id": "https://wavect.io/#organization",
            "@type": [
              "Organization",
              "ProfessionalService",
              "LocalBusiness"
            ]
          }
        }
      ],
      "name": "Wavect GmbH",
      "subjectOf": {
        "@id": "https://wavect.io/verified-claims.json#dataset",
        "@type": "Dataset",
        "creator": {
          "@id": "https://wavect.io/#organization",
          "@type": [
            "Organization",
            "ProfessionalService",
            "LocalBusiness"
          ]
        },
        "description": "A machine-readable registry of quantitative and qualitative claims published by Wavect, with review dates, localized page appearances and public third-party citations where available.",
        "inLanguage": "en",
        "isAccessibleForFree": true,
        "license": "https://creativecommons.org/licenses/by/4.0/",
        "name": "Wavect verified publication claims",
        "url": "https://wavect.io/verified-claims.json"
      },
      "url": "https://wavect.io/"
    },
    {
      "@id": "https://wavect.io/team/kevin-riedl/#person",
      "@type": "Person",
      "jobTitle": "Managing Director",
      "name": "Kevin Riedl",
      "sameAs": [
        "https://www.wikidata.org/wiki/Q139796365",
        "https://www.linkedin.com/in/wsdt",
        "https://github.com/wsdt"
      ],
      "url": "https://wavect.io/team/kevin-riedl/",
      "worksFor": {
        "@id": "https://wavect.io/#organization",
        "@type": [
          "Organization",
          "ProfessionalService",
          "LocalBusiness"
        ]
      }
    },
    {
      "@id": "https://wavect.io/team/christof-jori/#person",
      "@type": "Person",
      "jobTitle": "Managing Director",
      "name": "Christof Jori",
      "sameAs": [
        "https://www.wikidata.org/wiki/Q139796367",
        "https://www.linkedin.com/in/jocr77/",
        "https://github.com/jo-chris"
      ],
      "url": "https://wavect.io/team/christof-jori/",
      "worksFor": {
        "@id": "https://wavect.io/#organization",
        "@type": [
          "Organization",
          "ProfessionalService",
          "LocalBusiness"
        ]
      }
    },
    {
      "@id": "https://wavect.io/#website",
      "@type": "WebSite",
      "inLanguage": [
        "en",
        "de",
        "es",
        "zh"
      ],
      "name": "Wavect",
      "potentialAction": {
        "@type": "SearchAction",
        "query-input": "required name=search_term_string",
        "target": {
          "@type": "EntryPoint",
          "urlTemplate": "https://wavect.io/search/?q={search_term_string}"
        }
      },
      "publisher": {
        "@id": "https://wavect.io/#organization",
        "@type": [
          "Organization",
          "ProfessionalService",
          "LocalBusiness"
        ]
      },
      "url": "https://wavect.io/"
    },
    {
      "@id": "https://wavect.io/de/blog/canary-ai-qa-defect-detection/#webpage",
      "@type": "WebPage",
      "dateModified": "2026-10-08",
      "inLanguage": "de",
      "isPartOf": {
        "@id": "https://wavect.io/#website",
        "@type": "WebSite"
      },
      "lastReviewed": "2026-10-08",
      "url": "https://wavect.io/de/blog/canary-ai-qa-defect-detection/"
    }
  ]
}
```

```json
{
  "@context": "https://schema.org",
  "@type": "BlogPosting",
  "abstract": "Canarys QA-Bench v0 bewertet erzeugte Prüftexte mit einem LLM als Richter. Der Score ist keine gemessene Fehlererkennungsquote. Prüfe die Einführung mit bekannten Defekten, fehlerfreien Kontrollen, ausgeführten Tests und unabhängig reproduzierten Befunden.",
  "articleBody": " Blog-Übersicht/Delivery und QA/QA und Produktionsreife Canary AI QA: Fehlererkennung statt Benchmark-Punkte prüfen TL;DR Canarys QA-Bench v0 bewertet erzeugte Prüftexte mit einem LLM als Richter. Der Score ist keine gemessene Fehlererkennungsquote. Prüfe die Einführung mit bekannten Defekten, fehlerfreien Kontrollen, ausgeführten Tests und unabhängig reproduzierten Befunden. Quellenbasis: Dokumentation am 8. Oktober 2026 geprüft. Dies ist ein recherchierter Implementierungsleitfaden. Der folgende Pilot ist ein Vorschlag; wir haben diese Herstellerprüfungen nicht durchgeführt und ihre Leistung nicht gemessen. Was belegt Canarys QA-Benchmark? Canarys Methodik von QA-Bench v0 bewertet Prüfausgaben zu 35 PRs in vier Repositories. Ein LLM bewertet Relevanz, Abdeckung und Kohärenz. Die Einschränkungen nennen den Unterschied zwischen groben Testplänen und konkreten Skripten und halten ausgeführte Pass-Fail-Tests für einen faireren Vergleich. Ein Gesamtwert wie 83,1 bedeutet deshalb nicht „Canary findet 83,1 Prozent der Fehler“. Er belegt auch nicht die Leistung deiner aktuellen Claude-Code- oder Codex-Konfiguration. Nutze den Benchmark, um die Prüffrage zu verstehen, und miss anschließend das tatsächlich benötigte Ergebnis. Was sollte ein Einführungspilot stattdessen messen? Prüfe je bekanntem Defekt, ob der erzeugte und ausgeführte Test auf der fehlerhaften Version scheitert und auf der reparierten aus dem richtigen Grund besteht. Trenne Ablaufidentifikation, Testerstellung, Ausführung und Fehlerreproduktion. Ein guter Plan kann nützlich sein, ohne bereits ein ausführbarer Regressionstest zu sein. Canarys veröffentlichte Einrichtungsreferenz ist der Ausgangspunkt für aktuelle Integrationen. Fixiere getestete Version und unterstützten Ablauf; ein Modellname im alten Benchmark belegt keine heutige Kompatibilität. Trenne möglichst den feature-erstellenden Agenten von der Abnahmeevidenz. Welche Fehler gehören in die Testanwendung? Nutze eine isolierte Anwendung mit zwei Mandanten und einer bekannten korrekten Referenzversion. Baue jeweils einen Defekt ein, halte seine Kennzeichnung vor dem geprüften Agenten verborgen und ergänze fehlerfreie Kontrolländerungen. Die Tabelle ist ein vorgeschlagener Korpus, kein Canary-Ergebnis. DefektErforderliche AssertionNützliche Kontrolle Fehlende MandantenprüfungA kann B's Datensatz nicht lesenA kann eigene Daten lesenDoppelte ÜbermittlungEin logischer Request erzeugt einen DatensatzZwei verschiedene Requests erzeugen zweiRechte nur in UI geprüftDirekter Backend-Schreibzugriff wird verweigertBerechtigte Rolle kann schreibenFehler als Erfolg angezeigtAnzeige und gespeicherter Zustand zeigen FehlerNormaler Ablauf speichert korrektZu breites LöschenNur ausgewählte Daten werden gelöschtAndere Daten bleiben lesbarAbgelaufene SessionKein privilegierter SchreibzugriffGültige Session funktioniert Absichtliche Sicherheitsdefekte gehören ausschließlich in lokale oder isolierte synthetische Daten. Baue sie nicht in geteilte Produktion ein, um realistische Ergebnisse zu erhalten. Wie bewertest du Ergebnisse ohne Selbsttäuschung? Nutze dieselbe Ausgangsapp, PR-Kontext und Zeitgrenze für alle Konfigurationen.Sichere Pläne, Tests, Befehle, Logs und Zielzustand.Reproduziere gemeldete Defekte unabhängig und klassifiziere Infrastrukturfehler separat.Führe jeden Kandidatentest gegen fehlerhafte und reparierte Version aus.Zähle bestätigte Erkennungen, übersehene bekannte Defekte, Fehlalarme bei Kontrollen und Review-Minuten. Nenne Ergebnisse je Fehlerklasse und Stichprobengröße. Scheitert die App beim Start, ist das keine erfolgreiche Fehlererkennung. Scheitert der Test auch nach Reparatur, belegt er keine brauchbare Regression. Wiederhole Läufe, damit Schwankungen sichtbar bleiben. Kann Canary die bestehende Testsuite ersetzen? Entscheide das nicht anhand eines Herstellerscores. Behalte deterministische Tests für geschäftliche Invarianten und kritische Integrationen. Generierte explorative Tests können zusätzliche Abläufe erschließen. Übernimm einen Test erst nach Prüfung von Assertions, Testdatenverantwortung und Stabilität in die gepflegte Suite. Definiere eigene Stop-Kriterien für Datenlecks und destruktive Fehler. Ein hoher Durchschnitt darf einen übersehenen kritischen Mandantenfehler nicht ausgleichen. Lege diese Grenze vor der Auswertung fest. Wie budgetierst du KI-QA? Miss Kosten pro akzeptierter Prüfung inklusive Infrastruktur, Wiederholungen und menschlicher Nachprüfung. Mehrfachmeldungen sind ein Defekt. Erfasse, welche Tests nach Reparatur und nächster Produktänderung weiter nützlich sind. Niedrige Erstellungskosten können durch Fehlalarme pro PR teuer werden. Wann solltest du Canary ergänzen? Wenn ein isolierter Pilot zusätzliche brauchbare Defekte oder gepflegte Regressionstests zu tragbarem Prüfaufwand zeigt. Liegt der Nutzen in der Ablaufplanung, nutze und benenne ihn so. Mit Defektkorpus und Abnahmeregeln kannst du eine unabhängige QA-Evaluation eingrenzen. Lade das vorgeschlagene",
  "articleSection": "Entwicklung",
  "author": {
    "@id": "https://wavect.io/team/kevin-riedl/#person",
    "@type": "Person",
    "name": "Kevin Riedl",
    "sameAs": [
      "https://www.wikidata.org/wiki/Q139796365",
      "https://www.linkedin.com/in/wsdt",
      "https://github.com/wsdt"
    ],
    "url": "https://wavect.io/team/kevin-riedl/"
  },
  "citation": [
    {
      "@type": "WebPage",
      "name": "Methodik von QA-Bench v0",
      "url": "https://www.runcanary.ai/blog/qa-bench-v0"
    },
    {
      "@type": "WebPage",
      "name": "veröffentlichte Einrichtungsreferenz",
      "url": "https://www.runcanary.ai/#install"
    }
  ],
  "dateModified": "2026-10-08",
  "datePublished": "2026-10-08",
  "description": "Canarys QA-Bench v0 bewertet erzeugte Prüftexte mit einem LLM als Richter. Der Score ist keine gemessene Fehlererkennungsquote. Prüfe die Einführung mit bekannten Defekten, fehlerfreien Kontrollen, ausgeführten Tests und unabhängig reproduzierten Befunden.",
  "headline": "Canary AI QA: Fehlererkennung statt Benchmark-Punkte prüfen",
  "image": "https://wavect.io/img/blog/headers/header_canary-ai-qa-defect-detection.svg",
  "inLanguage": "de",
  "keywords": "Entwicklung, KI-Agenten",
  "mainEntityOfPage": {
    "@id": "https://wavect.io/de/blog/canary-ai-qa-defect-detection/",
    "@type": "WebPage"
  },
  "publisher": {
    "@id": "https://wavect.io/#organization",
    "@type": [
      "Organization",
      "ProfessionalService",
      "LocalBusiness"
    ]
  },
  "url": "https://wavect.io/de/blog/canary-ai-qa-defect-detection/",
  "wordCount": 937
}
```

```json
{
  "@context": "https://schema.org",
  "@type": "BreadcrumbList",
  "itemListElement": [
    {
      "@type": "ListItem",
      "item": "https://wavect.io/de/",
      "name": "Startseite",
      "position": 1
    },
    {
      "@type": "ListItem",
      "item": "https://wavect.io/de/blog/overview/",
      "name": "Blog-Übersicht",
      "position": 2
    },
    {
      "@type": "ListItem",
      "item": "https://wavect.io/de/blog/topics/delivery-qa/",
      "name": "Delivery und QA",
      "position": 3
    },
    {
      "@type": "ListItem",
      "item": "https://wavect.io/de/blog/clusters/qa-production/",
      "name": "QA und Produktionsreife",
      "position": 4
    },
    {
      "@type": "ListItem",
      "item": "https://wavect.io/de/blog/canary-ai-qa-defect-detection/",
      "name": "Canary AI QA: Fehlererkennung statt Benchmark-Punkte prüfen",
      "position": 5
    }
  ]
}
```
