In diesem Beitrag
Wissenstransfer zwischen KI-Agenten: Einmal entdecken, günstiger skalieren
Wissenstransfer zwischen KI-Agenten macht aus teurer Entdeckung ein wiederverwendbares Gut. Ein leistungsfähiges Modell untersucht eine unbekannte Aufgabe, dokumentiert bestätigte Regeln und widerlegte Hypothesen. Danach liest ein günstigeres Modell dieses Handbuch, bevor es die wiederkehrende Arbeit übernimmt. Die Modellgewichte bleiben unverändert.
Agno hat dieses Muster auf ARC-AGI-3 messbar gemacht. Mit Handbüchern von GPT-5.6 stieg Gemini-3.7-Flash von 37,33 im Kaltstart auf 96,42. Das rechtfertigt keinen pauschalen Modellwechsel. Es ist eine prüfbare Architekturhypothese für wiederkehrende Workflows mit klarer Abnahme.
Dieser Beitrag behandelt bewusst den engen Intent modellübergreifender Wissenstransfer ohne Retraining. Allgemeine Einsparungen durch Caching, Batching und Prompts stehen im Leitfaden zu LLM-Token-Kosten. Die LLM-Router-Übersicht behandelt die Auswahl pro Anfrage. Unser Review zu Agenten-Memory bewertet Speicher- und Retrieval-Infrastruktur.
Was zeigte Agno auf ARC-AGI-3?
Explizite Handbücher aus früheren Läufen ließen ein günstigeres Modell auf demselben öffentlichen Benchmark beinahe zum Frontier-Modell aufschließen. In Agnos Bericht zur ARC-AGI Arcade erreichten warme GPT-5.6-Läufe 100,00 RHAE über 183 Levels in 25 öffentlichen Spielen. Gemini-3.7-Flash erzielte 37,33 ohne Vorwissen und 96,42 mit den GPT-5.6-Handbüchern.
| Lauf | RHAE | Abgeschlossene Levels | Output-Tokens pro Spiel |
|---|---|---|---|
| GPT-5.6, warm | 100,00 | 183/183 | 80K |
| Gemini-3.7-Flash, kalt | 37,33 | In Agnos Vergleichstabelle nicht angegeben | 195K |
| Gemini-3.7-Flash mit GPT-5.6-Handbüchern | 96,42 | 179/183 | 65K |
| Aggregierter Expertenwert für Menschen | 95,4 | 183/183 | Nicht anwendbar |
Für die beiden führenden Ergebnisse gibt es serverseitig erzeugte Belege: Die Scorecard des warmen GPT-5.6-Laufs und die Scorecard des vorbereiteten Gemini-Laufs protokollieren die wiedergegebenen Aktionsfolgen. Score und Abschlussquote sind nicht identisch. Gemini lag mit 96,42 über dem Expertenwert von 95,4, verfehlte aber vier Levels.
Die Grenze gehört zur Aussage. Der technische ARC-AGI-3-Bericht beschreibt einen interaktiven Benchmark für Exploration, Zielerkennung, Weltmodelle und effizientes Handeln in unbekannten Umgebungen. Agno testete den öffentlichen Demonstrationssatz mit 25 Spielen. Laut eigener Einschränkung sind die privaten Sätze schwieriger, nicht öffentlich spielbar und außerhalb dieser Verteilung. ARC-AGI-3 ist damit nicht gelöst.
Was ist Wissenstransfer zwischen KI-Agenten?
Wissenstransfer zwischen KI-Agenten bedeutet, dass ein anderer Lauf, Agent oder ein anderes Modell explizite und geprüfte Erfahrungen aus einem früheren Lauf wiederverwendet. Das Wissen liegt als lesbare Regel, Anleitung oder Beispiel außerhalb der Modellgewichte. Es lässt sich prüfen, korrigieren und löschen, ohne Training oder Fine-Tuning.
Das ist konkreter als ein allgemeines Gedächtnisversprechen. Ein nützliches Learning hat Scope und Beleg. „Nutzer mögen kurze Antworten“ ist eine Präferenz. „Fehler E104 verschwindet erst nach Erneuerung des OAuth Grants und einem Retry mit demselben Idempotency Key“ ist eine ausführbare Regel, sofern Version und Evidenz mitgespeichert werden.
Wie funktionierte Agnos modellübergreifendes Lernen?
- Kalt starten: Der Agent beginnt ohne spielspezifische Anleitung, Regeln oder genanntes Ziel.
- Sparsam experimentieren: Er führt eine Aktion aus, beobachtet den exakten Zustandswechsel und untersucht den aufgezeichneten Verlauf.
- Geprüfte Learnings speichern: Mechaniken, Gefahren, erfolgreiche Lösungsformen und widerlegte Hypothesen werden kurze Handbucheinträge.
- Konversation zurücksetzen: Nach jedem Level beginnt eine neue Session. Nur das Handbuch bleibt erhalten.
- Anderes Modell vorbereiten: Die Markdown-Handbücher von GPT-5.6 fließen in den Wissenskontext von Gemini-3.7-Flash.
- Weiterlernen: Gemini nutzt die Notizen als Startpunkt, prüft überraschende Aussagen und darf bessere Wege finden.
Das Open-Source-Repository der ARC-AGI Arcade dokumentiert Learning Store, Laufmodi, Kontaminationsregeln, Traces und Scorecard-Replay. Das übertragbare Muster lautet: Entdeckung, haltbare Evidenz und wiederholte Ausführung über eine stabile Schnittstelle trennen.
Ist das Destillation, RAG, Memory oder Routing?
| Muster | Was sich ändert | Zentrale Frage |
|---|---|---|
| Agenten-Wissenstransfer | Externe Handbücher oder Abläufe | Kann ein weiterer Lauf geprüfte Erfahrung nutzen? |
| Modelldestillation | Trainingsdaten und meist Gewichte des Student-Modells | Kann ein trainiertes kleines Modell das Teacher-Verhalten nachbilden? |
| RAG | Pro Anfrage abgerufener Quellkontext | Welche externen Fakten sind jetzt relevant? |
| Agenten-Memory | Dauerhafter Nutzer-, Session-, Entitäts- oder Lernzustand | Was soll zwischen Interaktionen bestehen bleiben? |
| Modell-Routing | Zuständiges Modell pro Anfrage oder Schritt | Welches Modell erfüllt den Grenzwert am günstigsten? |
Ein Produktionssystem kann alle fünf Muster kombinieren. Wissenstransfer macht Erfahrung portabel. Routing wählt das Modell. Retrieval lädt passende Einträge. Evals prüfen, ob die Kombination weiterhin akzeptabel ist.
Wo liegt der wirtschaftliche Wert?
Unternehmen können Entdeckung einmal bezahlen und über sichere Wiederholungen amortisieren. Agno berichtet 65K Output-Tokens pro Spiel für den vorbereiteten Gemini-Lauf, ein Drittel der 195K im Kaltstart und weniger als die 80K von GPT-5.6 warm. Das ist ein Token-Ergebnis, keine allgemeine Rechnung. Preise, Input, Tools, Laufzeit, Retries und menschliche Prüfung bestimmen die Kosten.
Kosten pro akzeptierter Aufgabe = anteilige Entdeckung + Modell + Tools + Retries + Review + Fehlerbehebung
Der Ansatz passt, wenn Aufgaben häufig wiederkehren, Regeln ausreichend stabil bleiben, Ergebnisse objektiv prüfbar sind und ein Fallback existiert. Mögliche Fälle sind Support-Triage, Dokumentklassifikation, strukturierte Datenbereinigung, wiederkehrende QA-Analysen und Coding-Aufgaben in einem stabilen Repository. Einmalige Strategie und folgenreiche Ermessensentscheidungen können weiterhin ein Frontier-Modell verlangen.
Wie kann übertragenes Wissen scheitern?
- Falscher Scope: Wissen aus einem Spiel, Mandanten oder einer Produktversion gelangt in einen anderen Kontext.
- Falsche Sicherheit: Eine Hypothese wird nach einem zufälligen Erfolg als Fakt gespeichert.
- Veraltung: API, Richtlinie oder Workflow ändern sich, das Handbuch bleibt jedoch vertrauenswürdig markiert.
- Knowledge Poisoning: Nicht vertrauenswürdiger Inhalt bringt den Agenten dazu, eine schädliche Anweisung dauerhaft zu speichern.
- Kompressionsverlust: Eine kurze Regel verliert genau die Ausnahme, die sie sicher machte.
- Benchmark-Leakage: Quellcode, Lösungsschlüssel oder menschliche Baselines verfälschen die Messung.
Agno markiert kontaminierte Läufe und sperrt betroffene Handbücher. Unternehmen brauchen dieselbe Disziplin: Provenienz, Scope, Freigabe, Ablaufdatum, Versionierung, Redaction und Rollback. Ein Learning Store beeinflusst künftige Entscheidungen. Schreibzugriffe verdienen daher Kontrollen ähnlich einem Code-Change.
Wie plant man einen Pilot für Frontier-zu-günstig?
- Einen wiederkehrenden Workflow wählen: 30 bis 100 repräsentative Aufgaben mit seltenen und teuren Fehlern sammeln.
- Drei Baselines einfrieren: Frontier-Modell kalt, günstiges Modell kalt und heutigen Prozess mehrfach messen.
- Learning-Schema definieren: Pro Eintrag eine Aussage mit Scope, Beleg, Modell, Zeit, Version, Konfidenz und Ablaufdatum speichern.
- Schreib- und Leserechte trennen: Das Frontier-Modell schlägt Learnings vor. Deterministische Prüfung oder ein Mensch genehmigt geteiltes Wissen.
- Günstige Lane vorbereiten: Nur relevante Einträge laden und ihre Versionen im Trace festhalten.
- Eskalation bauen: Neuheit, Widerspruch, geringe Konfidenz und fehlgeschlagene Verifikation zurückleiten.
- Feindliche Tests ausführen: Veraltete Handbücher, Widersprüche, Prompt Injection, Mandantenwechsel und Löschung abdecken.
- Akzeptierte Ergebnisse vergleichen: Erfolgsquote, schwere Fehler, P50/P95, Review-Minuten und Gesamtkosten messen.
Hilfe für KI in Produktion
Du baust ein KI-Produkt und machst dir Sorgen um Inference-Kosten, Architektur oder Production Readiness? Wavect hilft Gründern, KI-Prototypen in zuverlässige Produktionssysteme zu verwandeln.
Passender Service:
Wavects AI Enablement kann daraus eine workloadspezifische Modellleiter, einen kontrollierten Learning Store und ein Abnahmeset bauen. Die Hyperstate-AI-Fallstudie zeigt unseren breiteren Ansatz, Kosten und Latenz durch das System rund um den AI-Workload zu verbessern. Ist der wiederholbare Prozess noch unklar, hilft zuerst der Leitfaden zur Discovery-Phase.
FAQ zum Wissenstransfer zwischen KI-Agenten
Was ist Wissenstransfer zwischen KI-Agenten?
Hat Gemini-3.7-Flash Menschen auf ARC-AGI-3 geschlagen?
Braucht modellübergreifendes Lernen Fine-Tuning?
Bedeutet ein Drittel der Output-Tokens ein Drittel der Kosten?
Welcher Business-Workflow eignet sich zuerst?
Quellen und Evidenzgrenzen
Die fünf verlinkten Primärquellen wurden am 5. September 2026 geprüft. Agno entwickelte den Harness und berichtete Kaltvergleich sowie Output-Tokens. ARCs Server erzeugte die verlinkten Replay-Scorecards. Dennoch betrifft der Versuch nur den öffentlichen Demonstrationssatz. Wavect hat die Läufe und Providerabrechnungen nicht unabhängig reproduziert. Das Ergebnis begründet einen Pilot, keine garantierte Einsparung.
Fazit
Das wertvollste Artefakt eines teuren Agentenlaufs ist womöglich nicht seine letzte Antwort. Es kann das kompakte, geprüfte Handbuch sein, mit dem jeder spätere Lauf weiter vorne beginnt.
Agnos ARC-AGI-3-Demonstration zeigt die Architektur: Ein Frontier-Modell entdeckt, ein externer Learning Store bewahrt, ein günstigeres Modell führt aus und der Benchmark prüft. Scope jedes Learning, erhalte die Evidenz, teste die günstige Lane auf eingefrorenen Aufgaben und eskaliere Unsicherheit. So bezahlst du Frontier-Reasoning für Neues statt für jede Wiederholung.
