KI-Crawler

27 KI-Crawler, einzeln benannt.

Nach diesen User-Agents suchen unser Audit und unser kostenloses Prüfwerkzeug. Jeder ist entweder eine Antwortmaschine, die Sie zitieren und verlinken kann, oder ein reiner Trainings-Crawler, der Text für Modelle sammelt und nichts zurückgibt. Genau dieser Unterschied zählt, wenn Sie entscheiden, was Sie blockieren.

Antwortmaschinen: 16 Crawler, die Sie zitieren können

Einen davon zu sperren entfernt Sie von einer Fläche, auf der ein Modell Sie als Quelle nennen könnte.

User-AgentBetreiberWas er tut
oai-searchbotOpenAIPowers ChatGPT's search index
chatgpt-userOpenAIFetches a page when a user asks ChatGPT about it
claude-userAnthropicFetches a page when a user asks Claude about it
claude-searchbotAnthropicPowers Claude's search results
perplexitybotPerplexityBuilds the index Perplexity answers from
perplexity-userPerplexityFetches a page a user asked about
google-cloudvertexbotGoogleVertex AI grounding
bingbotMicrosoftCopilot answers are built on the Bing index
msnbot-mediaMicrosoftMedia crawling for Bing/Copilot
meta-externalagentMetaCrawls for Meta AI answers
meta-externalfetcherMetaFetches a page on user request
amazonbotAmazonFeeds Alexa and Rufus answers
youbotYou.comIndexes pages You.com can cite
cohere-aiCohereRetrieval for Cohere-powered assistants
diffbotDiffbotKnowledge-graph extraction used by several assistants
timpibotTimpiIndependent index used by AI search products

Die Beschreibungen bleiben auf Englisch, in der Sprache, in der die Betreiber sie veröffentlichen.

Nur Training: 11 Crawler, die nichts zurückgeben

Diese sammeln Inhalte für das Modelltraining. Sie zu sperren ist eine Lizenzentscheidung: es verringert Ihre Sichtbarkeit nicht.

User-AgentBetreiberWas er tut
gptbotOpenAICollects content that may be used to train OpenAI models; ChatGPT search uses OAI-SearchBot instead
claudebotAnthropicCollects content that may be used to train Anthropic models; Claude search uses Claude-SearchBot
google-extendedGoogleNot a crawler: a robots.txt token for Gemini training and grounding; Google says it does not affect Google Search
applebot-extendedAppleNot a crawler: a robots.txt token for training Apple models; Apple says it does not affect Apple search
claude-webAnthropicLegacy Anthropic agent no longer documented; current user fetches use Claude-User
ccbotCommon CrawlPublic dataset many models train on
bytespiderByteDanceTraining data collection
omgiliWebz.ioData resale and training corpora
anthropic-aiAnthropicLegacy training-data agent (no live citation)
facebookbotMetaTraining data collection
petalbotHuaweiPetal search and training corpora

Die Beschreibungen bleiben auf Englisch, in der Sprache, in der die Betreiber sie veröffentlichen.

Einen einzelnen Crawler steuern

robots.txt wirkt je User-Agent. Diese Gruppe blockiert einen Crawler und lässt alles andere unverändert:

User-agent: CCBot
Disallow: /

Wer einen Antwortmaschinen-Crawler blockiert, verschwindet aus deren Antworten. Einen reinen Trainings-Crawler zu blockieren, ändert nichts daran, ob Sie zitiert werden.

Prüfen Sie Ihre eigene robots.txt

Das kostenlose Prüfwerkzeug liest Ihre robots.txt und llms.txt und zeigt, welche dieser 27 Crawler Sie zulassen.

Prüfwerkzeug öffnen

Diese Seite wird aus demselben Katalog erzeugt, den das Produkt nutzt, und kann daher nicht von dem abweichen, was das Audit prüft.