SEO

llms.txt vs. robots.txt: Welche Datei sorgt dafür, dass KI Ihre Website liest?

Die robots.txt entscheidet, welche KI-Crawler Ihre Seiten abrufen dürfen; die llms.txt schlägt nur vor, was gelesen werden soll. Die eine steuert den Zugriff, die andere beschreibt Inhalte. So arbeiten beide zusammen.

Kurze Antwort: Die robots.txt entscheidet, ob KI-Systeme Ihre Website lesen können, weil sie steuert, welche Crawler Ihre Seiten abrufen dürfen. Die llms.txt beschreibt nur, welche Seiten sich zu lesen lohnen. Wenn die robots.txt den Crawler einer Antwortmaschine blockiert, sorgt keine llms.txt dafür, dass diese Maschine Sie zitiert. Beginnen Sie mit der robots.txt; ergänzen Sie die llms.txt als Wegweiser.

Was macht jede Datei?

robots.txt llms.txt
Zweck Crawler zulassen oder sperren Modelle auf wichtige Seiten hinweisen
Status Standard (RFC 9309, 2022) Vorschlag aus der Community (2024)
Gelesen von Jedem regelkonformen Crawler Einigen KI-Tools und Agenten
Von der Google-Suche genutzt Ja Laut Google nein
Kann den Zugriff sperren Ja Nein
Format Regeln mit User-agent und Disallow Markdown mit Links

Die beiden Dateien sind keine Konkurrenten. Die robots.txt ist die Tür; die llms.txt ist eine Karte, die Sie auf den Tisch legen, sobald die Besucher drinnen sind.

Warum zählt die robots.txt für KI-Sichtbarkeit mehr?

Weil der Zugriff zuerst kommt. Jede KI-Antwortmaschine nutzt einen eigenen Crawler, und jeder Crawler prüft die robots.txt, bevor er etwas abruft:

  • Die ChatGPT-Suche nutzt OAI-SearchBot. OpenAI erklärt, dass Websites, die ihn ausschließen, nicht in den Antworten der ChatGPT-Suche erscheinen.
  • Perplexity nutzt PerplexityBot für seine Suchergebnisse.
  • Die Suche von Claude nutzt Claude-SearchBot.
  • Google AI Overviews sind Teil der Suche und stützen sich auf Googlebot.

Ist einer davon gesperrt, kann die jeweilige Maschine Ihre Seiten nicht abrufen, um sie zu zitieren. Eine noch so gut geschriebene llms.txt ändert daran nichts, denn der Crawler kommt nie an der Tür vorbei.

Welche Bots sollten Sie sperren und welche zulassen?

Das ist die Entscheidung, auf die es ankommt, und die meisten robots.txt-Dateien treffen sie falsch, weil sie alle KI-Bots gleich behandeln. Es gibt zwei Sorten:

  • Crawler von Antwortmaschinen rufen Seiten ab, um sie in Antworten anzuzeigen und zu verlinken. Wer sie sperrt, verschwindet aus den Ergebnissen dieser Maschine.
  • Reine Trainings-Crawler sammeln Text, um Modelle zu trainieren. Sie zu sperren ist eine Lizenzentscheidung. Aus Antworten verschwinden Sie dadurch nicht.

Die Namen sind leicht zu verwechseln. GPTBot ist der Trainings-Crawler von OpenAI; OAI-SearchBot ist der, der die ChatGPT-Suche antreibt. ClaudeBot ist der Trainings-Crawler von Anthropic; Claude-SearchBot treibt die Suche an. Google-Extended und Applebot-Extended sind gar keine Crawler, sondern robots.txt-Tokens, die die Nutzung für Training steuern, und sowohl Google als auch Apple sagen, dass sie die Suche nicht beeinflussen.

Eine gängige, vernünftige Regelung für ein Unternehmen, das zitiert, aber nicht für Training genutzt werden möchte, sieht so aus:

User-agent: GPTBot
Disallow: /

User-agent: ClaudeBot
Disallow: /

User-agent: Google-Extended
Disallow: /

User-agent: *
Allow: /

So bleiben die Crawler von Antwortmaschinen, darunter OAI-SearchBot, Claude-SearchBot und PerplexityBot, über die Wildcard-Gruppe zugelassen, während Sie den genannten Trainingsnutzungen widersprechen. Ob Sie dem Training widersprechen, entscheiden Sie; wichtig ist, dass Sie es bewusst tun. Unsere Liste der KI-Crawler zeigt jeden Agenten, den wir verfolgen, und zu welcher Gruppe er gehört.

Welche Fehler sehen wir am häufigsten?

  • Sperren per Wildcard. User-agent: * mit Disallow: / sperrt jeden Crawler ohne eigene Gruppe, auch Antwortmaschinen.
  • Eine "KI-Sperrliste" aus einem Forum kopieren. Solche Listen enthalten oft OAI-SearchBot und PerplexityBot neben Trainings-Bots und entfernen die Website stillschweigend aus KI-Antworten.
  • Annehmen, die robots.txt entferne Seiten aus Indizes. Sie steuert das Crawling. Eine gesperrte URL kann trotzdem erscheinen, wenn andere Seiten auf sie verlinken. Um eine Seite herauszuhalten, setzen Sie noindex auf eine crawlbare Seite.
  • Eine llms.txt, die in Wahrheit eine HTML-Seite ist. Viele Websites liefern unter /llms.txt ihre 404-Seite mit Status 200 aus. Tools, die nur den Statuscode prüfen, halten die Datei für vorhanden.

Wo hilft die llms.txt trotzdem?

Wenn der Zugriff stimmt, kann die llms.txt einem Modell die Arbeit auf großen oder technischen Websites erleichtern: Sie verweist auf die Seiten, die echte Fragen beantworten, statt das Modell anhand der Navigation raten zu lassen. Am nützlichsten ist sie für Dokumentation, APIs und SaaS-Produkte. Wie man eine schreibt, erklären wir in Was ist llms.txt.

Wie sieht das klassische SEO das?

Die robots.txt gehört seit Jahrzehnten zum SEO, und es gelten dieselben Regeln: Sperren Sie keine Seiten, die indexiert werden sollen, verstecken Sie damit keine sensiblen Inhalte und halten Sie sie kurz genug, um sie prüfen zu können. Neu ist, dass es jetzt viel mehr User-Agents zu bedenken gibt, und der Unterschied zwischen einem Trainings-Bot und einem Such-Bot verändert, was eine Sperre Sie kostet.

Wie prüfen Sie Ihre eigene Website?

Unser kostenloser robots.txt- und llms.txt-Checker liest Ihre robots.txt, zeigt Ihnen, welche Crawler von Antwortmaschinen und welche Trainings-Crawler Sie zulassen, und prüft, ob Ihre llms.txt eine echte Datei ist. Er braucht eine einzige Anfrage und keine Anmeldung.

Häufig gestellte Fragen

Wenn ich GPTBot sperre, zitiert ChatGPT mich dann nicht mehr?

Nein. GPTBot wird für das Training genutzt. Die ChatGPT-Suche nutzt OAI-SearchBot. Wer GPTBot sperrt, widerspricht dem Training, nicht der ChatGPT-Suche.

Brauche ich eine llms.txt, wenn meine robots.txt korrekt ist?

Nicht zwingend. Eine korrekte robots.txt ist die Voraussetzung; die llms.txt ist ein optionaler Wegweiser, der einigen KI-Tools auf größeren oder technischen Websites hilft.

Liest Google die llms.txt?

Google hat erklärt, dass die Google-Suche die llms.txt nicht nutzt. Die robots.txt liest sie sehr wohl.

Kann die robots.txt private Inhalte schützen?

Nein. Die robots.txt ist öffentlich und bittet Crawler nur, nichts abzurufen. Alles Private braucht eine Authentifizierung.

Website analysieren