Zurück zum Blog

KI-Crawler & robots.txt: GPTBot, ClaudeBot & Co. richtig steuern

KI-Crawler wie GPTBot, ClaudeBot oder PerplexityBot durchsuchen Ihre Website automatisiert, um Inhalte für KI-Systeme zu sammeln – zum Training von Modellen, für einen eigenen Suchindex oder für den Live-Abruf einzelner Seiten. Über die robots.txt-Datei legen Sie fest, welche dieser Bots willkommen sind. Entscheidend dabei: Nicht jeder KI-Crawler verfolgt denselben Zweck, und robots.txt ist eine Bitte, kein Schloss.

Was sind KI-Crawler, und warum besuchen sie Ihre Website?

Ähnlich wie der klassische Googlebot durchsucht ein KI-Crawler das Web automatisiert und lädt Seiteninhalte herunter. Der Unterschied liegt im Verwendungszweck: Während klassische Suchcrawler vor allem den Suchindex speisen, sammeln KI-Crawler Daten für generative KI-Systeme – teils um Sprachmodelle zu trainieren, teils um einen eigenen Antwortindex aufzubauen, aus dem Systeme wie ChatGPT, Perplexity oder Claude bei einer Anfrage zitieren. Wer seine KI-Sichtbarkeit verbessern will, muss zunächst sicherstellen, dass die relevanten Bots die eigenen Seiten überhaupt lesen können – alles Weitere setzt darauf auf.

Die wichtigsten KI-Crawler im Überblick

AnbieterUser-AgentZweckFolgen einer Sperre
OpenAIGPTBotTraining zukünftiger SprachmodelleInhalte fließen nicht in neue Trainingsdaten ein
OpenAIOAI-SearchBotIndexierung für die ChatGPT-WebsucheGeringere Chance, in ChatGPT-Suchantworten als Quelle zu erscheinen
OpenAIChatGPT-UserLive-Abruf einzelner Seiten, wenn ein Nutzer explizit danach fragtChatGPT kann die Seite bei einer konkreten Nutzeranfrage nicht live einsehen
AnthropicClaudeBotTraining von Claude-ModellenAusschluss aus zukünftigen Trainingsdaten für Claude
AnthropicClaude-SearchBotWebsuche-Funktion von ClaudeGeringere Sichtbarkeit in Claude-Antworten mit Websuche
AnthropicClaude-UserLive-Abruf durch NutzeraktionClaude kann die Seite bei Live-Anfrage nicht einsehen
PerplexityPerplexityBotIndexierung für Perplexity-AntwortenGeringere Chance auf Zitierung bei Perplexity
PerplexityPerplexity-UserLive-Abruf durch NutzeraktionLive-Abruf einzelner Seiten nicht möglich
GoogleGoogle-ExtendedNutzung für Gemini-Training und -GroundingBetrifft nicht Google Search, AI Overviews oder den KI-Modus
AppleApplebot-ExtendedTraining für Apple-KI-FunktionenAusschluss aus Apple-KI-Trainingsdaten
Common CrawlCCBotOffener Webdatensatz, von vielen Modellen als Trainingsquelle genutztInhalte fehlen in vielen daraus abgeleiteten Trainingsdatensätzen

Prüfen Sie regelmäßig die aktuellen Angaben der Anbieter, da neue Bots hinzukommen und sich Bezeichnungen ändern können (Stand: September 2026).

Training, Suche, Nutzer-Abruf: drei unterschiedliche Zwecke

Wer robots.txt für KI-Crawler konfiguriert, sollte zwischen drei Kategorien unterscheiden – eine pauschale „KI-Crawler blockieren"-Regel trifft sie sonst alle gleich, obwohl sie sehr unterschiedliche Folgen haben.

Trainings-Crawler

GPTBot, ClaudeBot, Google-Extended, Applebot-Extended und CCBot sammeln Inhalte, die periodisch in das Training oder Fine-Tuning zukünftiger Modellversionen einfließen. Eine Sperre wirkt hier nur nach vorn: Bereits verwendete Trainingsdaten lassen sich damit nicht zurückholen, künftige Crawl-Durchläufe werden aber ausgeschlossen.

Such- und Index-Crawler

OAI-SearchBot, Claude-SearchBot und PerplexityBot speisen den Antwortindex, aus dem die jeweilige KI bei einer konkreten Anfrage zitiert oder verlinkt. Diese Kategorie ist für GEO besonders relevant: Wer diese Bots blockiert, verringert unmittelbar die Chance, in den entsprechenden KI-Antworten als Quelle genannt zu werden.

Nutzer-Abruf-Crawler

ChatGPT-User, Claude-User und Perplexity-User werden erst aktiv, wenn ein Nutzer live nach einer bestimmten Seite fragt – etwa „Fasse mir diese URL zusammen". Eine Sperre betrifft hier nicht das allgemeine Training oder die Indexierung, sondern genau diesen einzelnen, nutzergetriebenen Abruf.

robots.txt: KI-Crawler gezielt steuern

Die robots.txt-Datei liegt im Root-Verzeichnis Ihrer Domain (ihredomain.de/robots.txt) und enthält Regeln pro User-Agent. Drei typische Konfigurationen:

Beispiel 1: Trainings-Bots sperren, Such-Bots zulassen

Eine verbreitete Strategie: Trainingsdaten nicht preisgeben, aber in KI-Suchantworten trotzdem zitierfähig bleiben.

User-agent: GPTBot
Disallow: /

User-agent: ClaudeBot
Disallow: /

User-agent: Google-Extended
Disallow: /

User-agent: Applebot-Extended
Disallow: /

User-agent: CCBot
Disallow: /

User-agent: OAI-SearchBot
Allow: /

User-agent: ChatGPT-User
Allow: /

User-agent: PerplexityBot
Allow: /

User-agent: Perplexity-User
Allow: /

User-agent: Claude-SearchBot
Allow: /

User-agent: Claude-User
Allow: /

Beispiel 2: Alle KI-Crawler vollständig sperren

Wer grundsätzlich keine KI-Nutzung seiner Inhalte wünscht, kann alle bekannten KI-Crawler ausschließen:

User-agent: GPTBot
Disallow: /

User-agent: ChatGPT-User
Disallow: /

User-agent: OAI-SearchBot
Disallow: /

User-agent: ClaudeBot
Disallow: /

User-agent: Claude-User
Disallow: /

User-agent: Claude-SearchBot
Disallow: /

User-agent: PerplexityBot
Disallow: /

User-agent: Perplexity-User
Disallow: /

User-agent: Google-Extended
Disallow: /

User-agent: Applebot-Extended
Disallow: /

User-agent: CCBot
Disallow: /

Beispiel 3: Nur bestimmte Bereiche sperren

Statt ganze Bots komplett auszuschließen, lassen sich auch nur einzelne Verzeichnisse schützen, etwa interne Bereiche oder Kundenportale:

User-agent: GPTBot
Disallow: /intern/
Allow: /

User-agent: ClaudeBot
Disallow: /intern/
Allow: /

robots.txt ist freiwillig – kein Zugriffsschutz

Wichtig für die Einordnung: robots.txt ist eine Anweisung, keine technische Sperre. Seriöse Anbieter wie OpenAI, Anthropic oder Perplexity geben an, sich an robots.txt-Regeln zu halten, doch die Einhaltung beruht auf Selbstverpflichtung der Crawler-Betreiber. Ein Bot, der sich nicht daran hält, wird durch die Datei technisch nicht ausgesperrt. Wer Inhalte wirklich vor jedem Zugriff schützen will, braucht zusätzlich serverseitige Maßnahmen wie IP-Sperren, Login-Bereiche oder eine Web Application Firewall – robots.txt allein reicht dafür nicht.

Server-Logs prüfen: Wer besucht Sie wirklich?

Da robots.txt-Einhaltung freiwillig ist, lohnt sich der Blick in die eigenen Server- oder CDN-Logs. Dort lassen sich die tatsächlichen User-Agent-Strings und Zugriffsmuster auswerten: Kommt GPTBot wirklich regelmäßig vorbei? Ruft PerplexityBot einzelne Seiten ab? Weichen einzelne Zugriffe verdächtig von den bekannten Bot-Signaturen ab? Nur die Logs zeigen verlässlich, was tatsächlich passiert – unabhängig davon, was in der robots.txt-Datei steht. Genau diese Art von technischer Prüfung – ob KI-Crawler eine Seite überhaupt erreichen und lesen können – deckt auch die technische Analyse von findAIble ab.

Crawler-Steuerung ist nur der Anfang

Eine korrekt konfigurierte robots.txt-Datei stellt sicher, dass die relevanten Bots Ihre Inhalte lesen können – sie garantiert aber nicht, dass Ihre Seite auch tatsächlich als Quelle ausgewählt wird. Wie KI-Suchmaschinen unter den erreichbaren Seiten auswählen, welche sie zitieren, beschreibt der Artikel Wie KI-Suchmaschinen Quellen auswählen. Ergänzend lohnt sich ein Blick auf llms.txt als weiteres, allerdings noch unbestätigtes Steuerungsinstrument, sowie auf die KI-Sichtbarkeit messen-Anleitung, um zu prüfen, ob geöffnete Crawler-Zugänge auch tatsächlich zu mehr Erwähnungen führen. Einen strukturierten Fahrplan für die technische Grundlage insgesamt liefert die GEO-Audit-Checkliste.

Checkliste: KI-Crawler richtig steuern

  • Sind alle relevanten KI-Crawler in der robots.txt-Datei explizit berücksichtigt?
  • Ist die Unterscheidung zwischen Trainings-, Such- und Nutzer-Abruf-Bots bewusst getroffen?
  • Wurde geprüft, dass Google-Extended nicht mit Googlebot verwechselt wird?
  • Werden Server-Logs regelmäßig auf tatsächliche Bot-Zugriffe geprüft?
  • Ist die robots.txt-Datei unter /robots.txt öffentlich erreichbar und fehlerfrei?
  • Wurde die Entscheidung dokumentiert, warum bestimmte Bots gesperrt oder erlaubt sind?

Mehr erfahren: Der Begriff KI-Crawler im Glossar und der GEO-Leitfaden.

Weiterlesen: llms.txt · GEO-Audit

Häufige Fragen

Was ist der Unterschied zwischen GPTBot und OAI-SearchBot?

GPTBot sammelt Inhalte für das Training zukünftiger OpenAI-Modelle. OAI-SearchBot indexiert Seiten für die Websuche-Funktion von ChatGPT – nur wer diesen Bot zulässt, hat eine Chance, dort als Quelle zitiert zu werden.

Blockiert Google-Extended auch Google AI Overviews oder den KI-Modus?

Nein. Google-Extended steuert nur die Nutzung für Gemini-Training und -Grounding. AI Overviews und der KI-Modus in der Google-Suche greifen auf den regulären Googlebot-Index zurück und werden von Google-Extended nicht berührt.

Ist robots.txt ein zuverlässiger Schutz vor KI-Crawlern?

Nein. robots.txt ist eine freiwillige Anweisung, an die sich seriöse Crawler in der Regel halten, die aber technisch nicht erzwungen wird. Wer Inhalte wirklich sperren will, braucht zusätzliche technische Maßnahmen wie serverseitige Zugriffskontrollen.

Was passiert, wenn ich alle KI-Crawler blockiere?

Ihre Inhalte fließen dann nicht in neue Trainingsdaten und Suchindizes der jeweiligen Anbieter ein. Das schützt vor unerwünschter Nutzung, verringert aber auch die Chance, in KI-Antworten genannt oder zitiert zu werden.

Wie erkenne ich, ob KI-Crawler meine Website tatsächlich besuchen?

Prüfen Sie Ihre Server- oder CDN-Logs auf die jeweiligen User-Agent-Strings, etwa GPTBot oder PerplexityBot. Nur die Logs zeigen verlässlich, welche Bots wirklich zugreifen – unabhängig davon, was in der robots.txt steht.

KI-Crawler & robots.txt: GPTBot, ClaudeBot & Co. richtig steuern | findAIble