KI-Crawler
27 KI-Crawler, einzeln benannt.
Nach diesen User-Agents suchen unser Audit und unser kostenloses Prüfwerkzeug. Jeder ist entweder eine Antwortmaschine, die Sie zitieren und verlinken kann, oder ein reiner Trainings-Crawler, der Text für Modelle sammelt und nichts zurückgibt. Genau dieser Unterschied zählt, wenn Sie entscheiden, was Sie blockieren.
Antwortmaschinen: 16 Crawler, die Sie zitieren können
Einen davon zu sperren entfernt Sie von einer Fläche, auf der ein Modell Sie als Quelle nennen könnte.
| User-Agent | Betreiber | Was er tut |
|---|---|---|
oai-searchbot | OpenAI | Powers ChatGPT's search index |
chatgpt-user | OpenAI | Fetches a page when a user asks ChatGPT about it |
claude-user | Anthropic | Fetches a page when a user asks Claude about it |
claude-searchbot | Anthropic | Powers Claude's search results |
perplexitybot | Perplexity | Builds the index Perplexity answers from |
perplexity-user | Perplexity | Fetches a page a user asked about |
google-cloudvertexbot | Vertex AI grounding | |
bingbot | Microsoft | Copilot answers are built on the Bing index |
msnbot-media | Microsoft | Media crawling for Bing/Copilot |
meta-externalagent | Meta | Crawls for Meta AI answers |
meta-externalfetcher | Meta | Fetches a page on user request |
amazonbot | Amazon | Feeds Alexa and Rufus answers |
youbot | You.com | Indexes pages You.com can cite |
cohere-ai | Cohere | Retrieval for Cohere-powered assistants |
diffbot | Diffbot | Knowledge-graph extraction used by several assistants |
timpibot | Timpi | Independent index used by AI search products |
Die Beschreibungen bleiben auf Englisch, in der Sprache, in der die Betreiber sie veröffentlichen.
Nur Training: 11 Crawler, die nichts zurückgeben
Diese sammeln Inhalte für das Modelltraining. Sie zu sperren ist eine Lizenzentscheidung: es verringert Ihre Sichtbarkeit nicht.
| User-Agent | Betreiber | Was er tut |
|---|---|---|
gptbot | OpenAI | Collects content that may be used to train OpenAI models; ChatGPT search uses OAI-SearchBot instead |
claudebot | Anthropic | Collects content that may be used to train Anthropic models; Claude search uses Claude-SearchBot |
google-extended | Not a crawler: a robots.txt token for Gemini training and grounding; Google says it does not affect Google Search | |
applebot-extended | Apple | Not a crawler: a robots.txt token for training Apple models; Apple says it does not affect Apple search |
claude-web | Anthropic | Legacy Anthropic agent no longer documented; current user fetches use Claude-User |
ccbot | Common Crawl | Public dataset many models train on |
bytespider | ByteDance | Training data collection |
omgili | Webz.io | Data resale and training corpora |
anthropic-ai | Anthropic | Legacy training-data agent (no live citation) |
facebookbot | Meta | Training data collection |
petalbot | Huawei | Petal search and training corpora |
Die Beschreibungen bleiben auf Englisch, in der Sprache, in der die Betreiber sie veröffentlichen.
Einen einzelnen Crawler steuern
robots.txt wirkt je User-Agent. Diese Gruppe blockiert einen Crawler und lässt alles andere unverändert:
User-agent: CCBot
Disallow: /Wer einen Antwortmaschinen-Crawler blockiert, verschwindet aus deren Antworten. Einen reinen Trainings-Crawler zu blockieren, ändert nichts daran, ob Sie zitiert werden.
Prüfen Sie Ihre eigene robots.txt
Das kostenlose Prüfwerkzeug liest Ihre robots.txt und llms.txt und zeigt, welche dieser 27 Crawler Sie zulassen.
Diese Seite wird aus demselben Katalog erzeugt, den das Produkt nutzt, und kann daher nicht von dem abweichen, was das Audit prüft.