Zurück
Kevin Riedl

9 min Lesezeit · 18. Aug 2026
Zuletzt geprüft

Weiter
Entsteht auf deinem Gerät, ohne Instagram-Verbindung. Den Beitragslink kopieren wir für deinen Link-Sticker.

Agentenlesbare Websites: llms.txt, Markdown-Spiegel und was wirklich kaputtgeht

Eine agentenlesbare Website liefert zu jeder Seite eine saubere Maschinenkopie aus, kündigt sie im Seitenkopf an und blockt nichts, was sie abrufen muss. Der schwierige Teil ist nicht die Entscheidung dafür. Es ist, das nach dem vierten Deployment noch wahr zu halten, denn jeder Fehlerfall hier ist im Browser unsichtbar und in deinen Logs stumm.

Wir betreiben diesen Stack auf der Website, die du gerade liest: einen Markdown-Spiegel jeder Seite, eine llms.txt pro Sprache, veröffentlichte Agent Skills und einen Verifier, der den Production-Build scheitern lässt, sobald davon etwas kaputt ist. Dieser Beitrag ist die Liste der Dinge, die dieser Verifier gefangen hat, und die ist nützlicher als die Liste, die man beim Lesen der Spezifikation bekommt.

Willst du wissen, ob ein Agent deine Website lesen kann, bevor du in Fixes investierst?

 Kostenlosen Checker starten

Die vier Oberflächen, die ein Agent tatsächlich nutzt

Agentenlesbarkeit wird als ein Thema diskutiert, es sind aber vier voneinander unabhängige Oberflächen, und eine Website kann drei davon bestehen und trotzdem unsichtbar bleiben.

OberflächeBeantwortete FrageSo sieht der Fehler aus
robots.txtDarf ich das überhaupt abrufen?Stilles Fehlen in Antworten
Ausgeliefertes HTMLSteht der Text hier, bevor JavaScript läuft?Eine leere Hülle mit Navigation
Markdown-SpiegelGibt es eine günstige, eindeutige Kopie?Teures, verrauschtes Parsen von gerendertem Beiwerk
JSON-LDWer hat das veröffentlicht und was ist es?Aus Prosa geratene Fakten, oder nichts

Die Reihenfolge zählt. Strukturierte Daten auf einer Seite zu reparieren, von der ein Retrieval-Fetcher ausgeschlossen ist, ist verlorene Arbeit, und genau so wird dieses Projekt am häufigsten von hinten begonnen.

llms.txt, ehrlich betrachtet

llms.txt ist eine Konvention, kein Standard. Keine Engine ist verpflichtet, sie zu lesen, und wer dir garantierte Auswertung verkauft, verkauft zu viel. Sie ist auch günstig zu erzeugen und gibt einem Agenten eine saubere Karte statt deiner gerenderten Navigation, weshalb wir eine veröffentlichen und sie meistens empfehlen.

Wenn du sie veröffentlichst, entscheiden drei Dinge, ob sie nützlich ist:

  • Absolute URLs. Das ist der Fehler, den wir am häufigsten sehen, und wir haben ihn selbst gemacht. Eine llms.txt wird abgerufen und weitergegeben, losgelöst von der Seite, aus der sie kommt, es bleibt also keine Basis-URL, gegen die relative Links auflösen könnten. Eine Datei voller /services/…-Pfade ist eine Datei voller Sackgassen.
  • Das Blockquote unter der H1. Dieser eine Satz ist das, was ein Agent am ehesten wörtlich übernimmt, wenn er dich vorstellt. Lass ihn weg, und der Agent schreibt diesen Satz selbst, aus dem, was er sich zusammengereimt hat.
  • Notizen an jedem Link. Die : Notizen-Hälfte jedes Bullets ist, wie ein Agent mit knappem Budget entscheidet, welchen Link er öffnet. Eine nackte Titelliste lässt ihn raten.

Markdown-Spiegel und wie man sie ankündigt

Ein Spiegel ist derselbe Inhalt wie die Seite, ohne Beiwerk, als Markdown unter einem vorhersagbaren Pfad ausgeliefert und aus dem Seitenkopf verlinkt:

<link rel="alternate" type="text/markdown" href="/services/ai-visibility.md">

Spiegel zu erzeugen ist einfach. Sie treu zu halten ist der Teil, der eine Maschine braucht, denn ein Spiegel kann auf Weisen subtil falsch sein, die monatelang niemandem auffallen. Der Generator läuft nach dem Site-Build, geht das gerenderte HTML durch, und der Verifier vergleicht danach beides.

Die Fehlerfälle, die man kennen sollte

Das sind echte Funde aus unserem eigenen Build, keine Hypothesen. Jeder davon ist mindestens einmal live gegangen, bevor es das Gate gab.

FehlerWarum er passiertWas ein Agent sieht
Unaufgelöster Template-WertEin Generator gibt seinen No-Value-Platzhalter aus, oder ein Paar Template-Delimiter übersteht ungerendert, und niemand liest die AusgabeEine Seite, die dir deine Templating-Sprache zurückzitiert
Unbalancierte Code-FenceEine öffnende Fence ohne schließendeJede Überschrift danach ist keine Überschrift mehr, das Dokument verliert seine Struktur
Unaufgelöste HTML-EntityEntities werden bei der Konvertierung nicht dekodiertEine nicht dekodierte Ampersand- oder Apostroph-Entity, gelesen als ihre wörtlichen Zeichen statt als das Satzzeichen
Zusammengeklebte LinksWhitespace zwischen zwei Anchors bei der Konvertierung verlorenZwei Linktexte zu einer Phrase verschmolzen
Attribution am Link klebendEin fehlendes Leerzeichen vor einem AutorenlinkEin Autorenstring, in dem das Wort vor dem Link mit dem Namen verschmolzen ist
Nicht passende TabellenspaltenKopfzeile und Trennzeile sind sich über die Spaltenzahl nicht einigDie Tabelle wird nicht mehr als Tabelle geparst, jede Zahl verliert ihre Spalte
Mehr als eine H1Chrome-Überschriften lecken in den BodyUnklarheit darüber, worum es auf der Seite überhaupt geht
Leerer BodyInhalt clientseitig eingefügt, der Spiegel hat nichts zu spiegelnFront Matter und Stille

Unser Favorit war subtiler als alle davon. Ein dekoratives Glyph auf einer Seite brachte ein wörtliches Anführungszeichen in einen SVG-Textknoten, was den HTML-Minifier in Foreign Content stoppte. Der Rest dieser Seite ging unminifiziert live, und ihr Markdown-Spiegel brach still nach zwei Dritteln ab und nahm die komplette FAQ mit. Im Browser sah nichts falsch aus. Das Gate ließ den Build scheitern, benannte die Route, und der Fix war ein einzelnes Zeichen.

Die robots.txt-Falle: Retrieval ist nicht Training

Das ist das teuerste Missverständnis im ganzen Thema, und es ist eine Zeile Konfiguration.

Manche Crawler existieren, um Trainingsdaten zu sammeln. Andere rufen eine Seite ab, um eine Frage zu beantworten und sie zu zitieren, jetzt gerade. Die erste Gruppe zu blocken ist eine Lizenzentscheidung, die du durchaus treffen willst. Die zweite Gruppe zu blocken entfernt dich komplett aus Antworten, und das passiert fast immer unbeabsichtigt:

User-agent: GPTBot
Disallow: /

User-agent: *
Disallow: /

Der erste Block ist ein bewusstes Trainings-Opt-out. Der zweite nimmt jeden Answer-Engine-Fetcher mit, weil ein Crawler ohne eigene Gruppe die Wildcard erbt. Das Team, das das geschrieben hat, glaubte, aus dem Training ausgestiegen zu sein. Es war auch aus dem Zitiertwerden ausgestiegen.

Wenn du die Position „zitiere mich, aber trainiere nicht auf mir“ willst, ist die schlüssig und konfigurierbar: benenne die Retrieval-Fetcher explizit und lass sie durch, und schließe die Trainings-Crawler namentlich aus.

Warum ein Gate und keine Checkliste

Jeder Punkt oben ist leicht einmal zu beheben und unmöglich durch guten Willen behoben zu halten. Der Inhalt ändert sich wöchentlich, die Templates monatlich, und keiner dieser Fehler erzeugt ein sichtbares Symptom. Ein Quartals-Audit findet sie ein Quartal zu spät.

Die Checks gehören also in den Build, neben die Tests. Unsere laufen nach dem Generieren der Website und lassen das Deployment scheitern, ein kaputter Spiegel ist damit eine rote Pipeline und kein langsames Leck. Das ist der ganze Trick, und deshalb geben wir Leuten den Regelkatalog statt eines Reports: der Agent Readability Checker führt dieselben Spiegel-Regeln in deinem Browser aus, und es ist derselbe Codepfad, der entscheidet, ob diese Website deployt.

Für die Nachbarprobleme: unser Open-Knowledge-Format-Guide behandelt das Verpacken internen Wissens als portables Markdown, und der Guide zum KI-fähigen Firmenwiki behandelt das Ausliefern dieses Wissens an deine eigenen Agenten. Dieser Beitrag dreht sich strikt um die öffentliche Oberfläche: was der Agent von jemand anderem lesen kann.

Häufige Fragen

Was macht eine Website agentenlesbar?
Vier Dinge zusammen: Robots-Regeln, die Retrieval-Fetcher hereinlassen, Text, der im ausgelieferten HTML steht, bevor JavaScript läuft, eine saubere Markdown- oder llms.txt-Kopie, die im Seitenkopf angekündigt wird, und valides JSON-LD, das den Herausgeber benennt. Drei von vier zu bestehen genügt meist, um unsichtbar zu bleiben.
Ist llms.txt ein Standard?
Nein. Es ist eine Konvention, und keine Engine ist verpflichtet, sie zu lesen. Sie ist günstig zu veröffentlichen und gibt einem Agenten eine saubere Karte statt gerenderter Navigation, deshalb betreiben wir eine. Behandle Behauptungen über garantierte Auswertung aber als Grund, am Rest des Pitches zu zweifeln.
Funktionieren relative URLs in llms.txt?
Nicht zuverlässig. Die Datei wird abgerufen und weitergegeben, losgelöst von der Seite, aus der sie kommt, es bleibt also keine Basis-URL zum Auflösen. Nutze absolute URLs.
Sollen wir GPTBot blocken?
Das ist eine Lizenzentscheidung, keine Sichtbarkeitsfrage. GPTBot oder CCBot zu blocken ist ein Opt-out aus Trainingsdaten und entfernt dich nicht aus Antworten von ChatGPT oder Perplexity, weil die von separaten Retrieval-Fetchern bedient werden. Erst die Retrieval-Fetcher zu blocken entfernt dich aus Antworten.
Erzeugen Markdown-Spiegel Duplicate Content für Suchmaschinen?
Nimm die kanonische URL in den Spiegel mit und halte die Spiegel aus deiner XML-Sitemap heraus, damit Discovery weiter auf die HTML-Seite zeigt. Der Spiegel ist eine alternative Repräsentation eines kanonischen Dokuments, angekündigt per rel=alternate.
Wie verhindern wir, dass das nach dem Launch verfällt?
Steck die Checks in den Build statt in ein Dokument. Inhalt und Templates ändern sich dauernd, und keiner dieser Fehler hat ein sichtbares Symptom, alles, was nur durch guten Willen gilt, fällt binnen ein bis zwei Quartalen zurück.

Fazit

Agentenlesbarkeit ist kein Content-Projekt. Es sind vier mechanische Oberflächen, eine kurze Liste von Konvertierungsfehlern und eine Konfigurationszeile, die entscheidet, ob der Rest überhaupt zählt.

Fang mit robots.txt an, weil das der günstigste Check und der teuerste Fehler ist. Liefere dann eine saubere Kopie aus, kündige sie an, validiere deine strukturierten Daten, und stell alles hinter ein Gate, damit das nächste Deployment es wahr halten muss.

Von Maschinen gelesen und zitiert werden

Answer Engines können nicht zitieren, was sie nicht abrufen, parsen oder dir zuordnen können. Wavect bringt Agent-Zugriff, maschinenlesbare Spiegel, strukturierte Daten und Entitätsidentität in dem Stack in Ordnung, den du schon betreibst, und macht das Produkt dann für Agenten nutzbar und nicht nur lesbar.

Passende Service-Wege:

Postfach, ohne Lärm

Folge der Arbeit, die für dich zählt

Du bekommst eine kurze E-Mail, wenn wir etwas Neues veröffentlichen. Folge dem ganzen Blog oder nur den Themen, die dich interessieren.

Was möchtest du erhalten?
Themen auswählen

Kostenlos, Double-Opt-in, ohne Tracking-Pixel.

Zurück
Kevin Riedl

9 min Lesezeit · 18. Aug 2026
Zuletzt geprüft

Weiter

Neue Beiträge per E-Mail

Eine kurze E-Mail, wenn wir etwas veröffentlichen. Kostenlos, ohne Tracking.

Kostenlos, Double-Opt-in, ohne Tracking-Pixel.