Zurück
Kevin Riedl

10 Min Lesezeit · 5. September 2026
Zuletzt geprüft

Weiter
Entsteht auf deinem Gerät, ohne Instagram-Verbindung. Den Beitragslink kopieren wir für deinen Link-Sticker.

Wissenstransfer zwischen KI-Agenten: Einmal entdecken, günstiger skalieren

Wissenstransfer zwischen KI-Agenten macht aus teurer Entdeckung ein wiederverwendbares Gut. Ein leistungsfähiges Modell untersucht eine unbekannte Aufgabe, dokumentiert bestätigte Regeln und widerlegte Hypothesen. Danach liest ein günstigeres Modell dieses Handbuch, bevor es die wiederkehrende Arbeit übernimmt. Die Modellgewichte bleiben unverändert.

Agno hat dieses Muster auf ARC-AGI-3 messbar gemacht. Mit Handbüchern von GPT-5.6 stieg Gemini-3.7-Flash von 37,33 im Kaltstart auf 96,42. Das rechtfertigt keinen pauschalen Modellwechsel. Es ist eine prüfbare Architekturhypothese für wiederkehrende Workflows mit klarer Abnahme.

Dieser Beitrag behandelt bewusst den engen Intent modellübergreifender Wissenstransfer ohne Retraining. Allgemeine Einsparungen durch Caching, Batching und Prompts stehen im Leitfaden zu LLM-Token-Kosten. Die LLM-Router-Übersicht behandelt die Auswahl pro Anfrage. Unser Review zu Agenten-Memory bewertet Speicher- und Retrieval-Infrastruktur.

Was zeigte Agno auf ARC-AGI-3?

Explizite Handbücher aus früheren Läufen ließen ein günstigeres Modell auf demselben öffentlichen Benchmark beinahe zum Frontier-Modell aufschließen. In Agnos Bericht zur ARC-AGI Arcade erreichten warme GPT-5.6-Läufe 100,00 RHAE über 183 Levels in 25 öffentlichen Spielen. Gemini-3.7-Flash erzielte 37,33 ohne Vorwissen und 96,42 mit den GPT-5.6-Handbüchern.

LaufRHAEAbgeschlossene LevelsOutput-Tokens pro Spiel
GPT-5.6, warm100,00183/18380K
Gemini-3.7-Flash, kalt37,33In Agnos Vergleichstabelle nicht angegeben195K
Gemini-3.7-Flash mit GPT-5.6-Handbüchern96,42179/18365K
Aggregierter Expertenwert für Menschen95,4183/183Nicht anwendbar

Für die beiden führenden Ergebnisse gibt es serverseitig erzeugte Belege: Die Scorecard des warmen GPT-5.6-Laufs und die Scorecard des vorbereiteten Gemini-Laufs protokollieren die wiedergegebenen Aktionsfolgen. Score und Abschlussquote sind nicht identisch. Gemini lag mit 96,42 über dem Expertenwert von 95,4, verfehlte aber vier Levels.

Die Grenze gehört zur Aussage. Der technische ARC-AGI-3-Bericht beschreibt einen interaktiven Benchmark für Exploration, Zielerkennung, Weltmodelle und effizientes Handeln in unbekannten Umgebungen. Agno testete den öffentlichen Demonstrationssatz mit 25 Spielen. Laut eigener Einschränkung sind die privaten Sätze schwieriger, nicht öffentlich spielbar und außerhalb dieser Verteilung. ARC-AGI-3 ist damit nicht gelöst.

Was ist Wissenstransfer zwischen KI-Agenten?

Wissenstransfer zwischen KI-Agenten bedeutet, dass ein anderer Lauf, Agent oder ein anderes Modell explizite und geprüfte Erfahrungen aus einem früheren Lauf wiederverwendet. Das Wissen liegt als lesbare Regel, Anleitung oder Beispiel außerhalb der Modellgewichte. Es lässt sich prüfen, korrigieren und löschen, ohne Training oder Fine-Tuning.

Das ist konkreter als ein allgemeines Gedächtnisversprechen. Ein nützliches Learning hat Scope und Beleg. „Nutzer mögen kurze Antworten“ ist eine Präferenz. „Fehler E104 verschwindet erst nach Erneuerung des OAuth Grants und einem Retry mit demselben Idempotency Key“ ist eine ausführbare Regel, sofern Version und Evidenz mitgespeichert werden.

Wie funktionierte Agnos modellübergreifendes Lernen?

  1. Kalt starten: Der Agent beginnt ohne spielspezifische Anleitung, Regeln oder genanntes Ziel.
  2. Sparsam experimentieren: Er führt eine Aktion aus, beobachtet den exakten Zustandswechsel und untersucht den aufgezeichneten Verlauf.
  3. Geprüfte Learnings speichern: Mechaniken, Gefahren, erfolgreiche Lösungsformen und widerlegte Hypothesen werden kurze Handbucheinträge.
  4. Konversation zurücksetzen: Nach jedem Level beginnt eine neue Session. Nur das Handbuch bleibt erhalten.
  5. Anderes Modell vorbereiten: Die Markdown-Handbücher von GPT-5.6 fließen in den Wissenskontext von Gemini-3.7-Flash.
  6. Weiterlernen: Gemini nutzt die Notizen als Startpunkt, prüft überraschende Aussagen und darf bessere Wege finden.

Das Open-Source-Repository der ARC-AGI Arcade dokumentiert Learning Store, Laufmodi, Kontaminationsregeln, Traces und Scorecard-Replay. Das übertragbare Muster lautet: Entdeckung, haltbare Evidenz und wiederholte Ausführung über eine stabile Schnittstelle trennen.

Ist das Destillation, RAG, Memory oder Routing?

MusterWas sich ändertZentrale Frage
Agenten-WissenstransferExterne Handbücher oder AbläufeKann ein weiterer Lauf geprüfte Erfahrung nutzen?
ModelldestillationTrainingsdaten und meist Gewichte des Student-ModellsKann ein trainiertes kleines Modell das Teacher-Verhalten nachbilden?
RAGPro Anfrage abgerufener QuellkontextWelche externen Fakten sind jetzt relevant?
Agenten-MemoryDauerhafter Nutzer-, Session-, Entitäts- oder LernzustandWas soll zwischen Interaktionen bestehen bleiben?
Modell-RoutingZuständiges Modell pro Anfrage oder SchrittWelches Modell erfüllt den Grenzwert am günstigsten?

Ein Produktionssystem kann alle fünf Muster kombinieren. Wissenstransfer macht Erfahrung portabel. Routing wählt das Modell. Retrieval lädt passende Einträge. Evals prüfen, ob die Kombination weiterhin akzeptabel ist.

Wo liegt der wirtschaftliche Wert?

Unternehmen können Entdeckung einmal bezahlen und über sichere Wiederholungen amortisieren. Agno berichtet 65K Output-Tokens pro Spiel für den vorbereiteten Gemini-Lauf, ein Drittel der 195K im Kaltstart und weniger als die 80K von GPT-5.6 warm. Das ist ein Token-Ergebnis, keine allgemeine Rechnung. Preise, Input, Tools, Laufzeit, Retries und menschliche Prüfung bestimmen die Kosten.

Kosten pro akzeptierter Aufgabe = anteilige Entdeckung + Modell + Tools + Retries + Review + Fehlerbehebung

Der Ansatz passt, wenn Aufgaben häufig wiederkehren, Regeln ausreichend stabil bleiben, Ergebnisse objektiv prüfbar sind und ein Fallback existiert. Mögliche Fälle sind Support-Triage, Dokumentklassifikation, strukturierte Datenbereinigung, wiederkehrende QA-Analysen und Coding-Aufgaben in einem stabilen Repository. Einmalige Strategie und folgenreiche Ermessensentscheidungen können weiterhin ein Frontier-Modell verlangen.

Wie kann übertragenes Wissen scheitern?

  • Falscher Scope: Wissen aus einem Spiel, Mandanten oder einer Produktversion gelangt in einen anderen Kontext.
  • Falsche Sicherheit: Eine Hypothese wird nach einem zufälligen Erfolg als Fakt gespeichert.
  • Veraltung: API, Richtlinie oder Workflow ändern sich, das Handbuch bleibt jedoch vertrauenswürdig markiert.
  • Knowledge Poisoning: Nicht vertrauenswürdiger Inhalt bringt den Agenten dazu, eine schädliche Anweisung dauerhaft zu speichern.
  • Kompressionsverlust: Eine kurze Regel verliert genau die Ausnahme, die sie sicher machte.
  • Benchmark-Leakage: Quellcode, Lösungsschlüssel oder menschliche Baselines verfälschen die Messung.

Agno markiert kontaminierte Läufe und sperrt betroffene Handbücher. Unternehmen brauchen dieselbe Disziplin: Provenienz, Scope, Freigabe, Ablaufdatum, Versionierung, Redaction und Rollback. Ein Learning Store beeinflusst künftige Entscheidungen. Schreibzugriffe verdienen daher Kontrollen ähnlich einem Code-Change.

Wie plant man einen Pilot für Frontier-zu-günstig?

  1. Einen wiederkehrenden Workflow wählen: 30 bis 100 repräsentative Aufgaben mit seltenen und teuren Fehlern sammeln.
  2. Drei Baselines einfrieren: Frontier-Modell kalt, günstiges Modell kalt und heutigen Prozess mehrfach messen.
  3. Learning-Schema definieren: Pro Eintrag eine Aussage mit Scope, Beleg, Modell, Zeit, Version, Konfidenz und Ablaufdatum speichern.
  4. Schreib- und Leserechte trennen: Das Frontier-Modell schlägt Learnings vor. Deterministische Prüfung oder ein Mensch genehmigt geteiltes Wissen.
  5. Günstige Lane vorbereiten: Nur relevante Einträge laden und ihre Versionen im Trace festhalten.
  6. Eskalation bauen: Neuheit, Widerspruch, geringe Konfidenz und fehlgeschlagene Verifikation zurückleiten.
  7. Feindliche Tests ausführen: Veraltete Handbücher, Widersprüche, Prompt Injection, Mandantenwechsel und Löschung abdecken.
  8. Akzeptierte Ergebnisse vergleichen: Erfolgsquote, schwere Fehler, P50/P95, Review-Minuten und Gesamtkosten messen.

Hilfe für KI in Produktion

Du baust ein KI-Produkt und machst dir Sorgen um Inference-Kosten, Architektur oder Production Readiness? Wavect hilft Gründern, KI-Prototypen in zuverlässige Produktionssysteme zu verwandeln.

Passender Service:

Wavects AI Enablement kann daraus eine workloadspezifische Modellleiter, einen kontrollierten Learning Store und ein Abnahmeset bauen. Die Hyperstate-AI-Fallstudie zeigt unseren breiteren Ansatz, Kosten und Latenz durch das System rund um den AI-Workload zu verbessern. Ist der wiederholbare Prozess noch unklar, hilft zuerst der Leitfaden zur Discovery-Phase.

FAQ zum Wissenstransfer zwischen KI-Agenten

Was ist Wissenstransfer zwischen KI-Agenten?
Dabei nutzt ein anderer Lauf, Agent oder ein anderes Modell explizite und geprüfte Erfahrungen aus einem früheren Lauf. Das Wissen bleibt außerhalb der Gewichte und kann geprüft, versioniert, gelöscht und getestet werden.
Hat Gemini-3.7-Flash Menschen auf ARC-AGI-3 geschlagen?
Der vorbereitete Lauf lag mit 96,42 RHAE über dem gemeldeten Expertenwert von 95,4, schloss aber 179 von 183 Levels ab, während die Menschenreferenz alle 183 abdeckte. Private Evaluationssätze wurden nicht getestet.
Braucht modellübergreifendes Lernen Fine-Tuning?
Nein. Agno übertrug Markdown-Handbücher und änderte keine Modellgewichte. Fine-Tuning und Destillation sind getrennte Investitionen mit anderen Prüf- und Rollback-Pfaden.
Bedeutet ein Drittel der Output-Tokens ein Drittel der Kosten?
Nicht zwingend. Berechne Input, Output, Tools, Infrastruktur, Retries, Review und Fehlerbehebung mit deinen tatsächlichen Preisen und Fällen.
Welcher Business-Workflow eignet sich zuerst?
Wähle einen häufigen, reversiblen Workflow mit wiederkehrenden Mechaniken und objektiven Abnahmetests. Beginne nicht mit einer einmaligen Strategiefrage oder einer irreversiblen Aktion.

Quellen und Evidenzgrenzen

Die fünf verlinkten Primärquellen wurden am 5. September 2026 geprüft. Agno entwickelte den Harness und berichtete Kaltvergleich sowie Output-Tokens. ARCs Server erzeugte die verlinkten Replay-Scorecards. Dennoch betrifft der Versuch nur den öffentlichen Demonstrationssatz. Wavect hat die Läufe und Providerabrechnungen nicht unabhängig reproduziert. Das Ergebnis begründet einen Pilot, keine garantierte Einsparung.

Fazit

Das wertvollste Artefakt eines teuren Agentenlaufs ist womöglich nicht seine letzte Antwort. Es kann das kompakte, geprüfte Handbuch sein, mit dem jeder spätere Lauf weiter vorne beginnt.

Agnos ARC-AGI-3-Demonstration zeigt die Architektur: Ein Frontier-Modell entdeckt, ein externer Learning Store bewahrt, ein günstigeres Modell führt aus und der Benchmark prüft. Scope jedes Learning, erhalte die Evidenz, teste die günstige Lane auf eingefrorenen Aufgaben und eskaliere Unsicherheit. So bezahlst du Frontier-Reasoning für Neues statt für jede Wiederholung.

Hilfe für KI in Produktion

Du baust ein KI-Produkt und machst dir Sorgen um Inference-Kosten, Architektur oder Production Readiness? Wavect hilft Gründern, KI-Prototypen in zuverlässige Produktionssysteme zu verwandeln.

Passender Service:

Postfach, ohne Lärm

Folge der Arbeit, die für dich zählt

Du bekommst eine kurze E-Mail, wenn wir etwas Neues veröffentlichen. Folge dem ganzen Blog oder nur den Themen, die dich interessieren.

Was möchtest du erhalten?
Themen auswählen

Kostenlos, Double-Opt-in, ohne Tracking-Pixel.

Zurück
Kevin Riedl

10 Min Lesezeit · 5. September 2026
Zuletzt geprüft

Weiter

Erhalte die nächste Feldnotiz zu AI und Agents

Eine kurze E-Mail, wenn wir veröffentlichen. Ohne Tracking-Pixel und ohne Postfachfüller.

Kostenlos, Double-Opt-in, ohne Tracking-Pixel.