KI-Crawler & robots.txt: GPTBot, ClaudeBot & Co. richtig steuern
KI-Crawler wie GPTBot, ClaudeBot oder PerplexityBot durchsuchen Ihre Website automatisiert, um Inhalte für KI-Systeme zu sammeln – zum Training von Modellen, für einen eigenen Suchindex oder für den Live-Abruf einzelner Seiten. Über die robots.txt-Datei legen Sie fest, welche dieser Bots willkommen sind. Entscheidend dabei: Nicht jeder KI-Crawler verfolgt denselben Zweck, und robots.txt ist eine Bitte, kein Schloss.
Was sind KI-Crawler, und warum besuchen sie Ihre Website?
Ähnlich wie der klassische Googlebot durchsucht ein KI-Crawler das Web automatisiert und lädt Seiteninhalte herunter. Der Unterschied liegt im Verwendungszweck: Während klassische Suchcrawler vor allem den Suchindex speisen, sammeln KI-Crawler Daten für generative KI-Systeme – teils um Sprachmodelle zu trainieren, teils um einen eigenen Antwortindex aufzubauen, aus dem Systeme wie ChatGPT, Perplexity oder Claude bei einer Anfrage zitieren. Wer seine KI-Sichtbarkeit verbessern will, muss zunächst sicherstellen, dass die relevanten Bots die eigenen Seiten überhaupt lesen können – alles Weitere setzt darauf auf.
Die wichtigsten KI-Crawler im Überblick
| Anbieter | User-Agent | Zweck | Folgen einer Sperre |
|---|---|---|---|
| OpenAI | GPTBot | Training zukünftiger Sprachmodelle | Inhalte fließen nicht in neue Trainingsdaten ein |
| OpenAI | OAI-SearchBot | Indexierung für die ChatGPT-Websuche | Geringere Chance, in ChatGPT-Suchantworten als Quelle zu erscheinen |
| OpenAI | ChatGPT-User | Live-Abruf einzelner Seiten, wenn ein Nutzer explizit danach fragt | ChatGPT kann die Seite bei einer konkreten Nutzeranfrage nicht live einsehen |
| Anthropic | ClaudeBot | Training von Claude-Modellen | Ausschluss aus zukünftigen Trainingsdaten für Claude |
| Anthropic | Claude-SearchBot | Websuche-Funktion von Claude | Geringere Sichtbarkeit in Claude-Antworten mit Websuche |
| Anthropic | Claude-User | Live-Abruf durch Nutzeraktion | Claude kann die Seite bei Live-Anfrage nicht einsehen |
| Perplexity | PerplexityBot | Indexierung für Perplexity-Antworten | Geringere Chance auf Zitierung bei Perplexity |
| Perplexity | Perplexity-User | Live-Abruf durch Nutzeraktion | Live-Abruf einzelner Seiten nicht möglich |
| Google-Extended | Nutzung für Gemini-Training und -Grounding | Betrifft nicht Google Search, AI Overviews oder den KI-Modus | |
| Apple | Applebot-Extended | Training für Apple-KI-Funktionen | Ausschluss aus Apple-KI-Trainingsdaten |
| Common Crawl | CCBot | Offener Webdatensatz, von vielen Modellen als Trainingsquelle genutzt | Inhalte fehlen in vielen daraus abgeleiteten Trainingsdatensätzen |
Prüfen Sie regelmäßig die aktuellen Angaben der Anbieter, da neue Bots hinzukommen und sich Bezeichnungen ändern können (Stand: September 2026).
Training, Suche, Nutzer-Abruf: drei unterschiedliche Zwecke
Wer robots.txt für KI-Crawler konfiguriert, sollte zwischen drei Kategorien unterscheiden – eine pauschale „KI-Crawler blockieren"-Regel trifft sie sonst alle gleich, obwohl sie sehr unterschiedliche Folgen haben.
Trainings-Crawler
GPTBot, ClaudeBot, Google-Extended, Applebot-Extended und CCBot sammeln Inhalte, die periodisch in das Training oder Fine-Tuning zukünftiger Modellversionen einfließen. Eine Sperre wirkt hier nur nach vorn: Bereits verwendete Trainingsdaten lassen sich damit nicht zurückholen, künftige Crawl-Durchläufe werden aber ausgeschlossen.
Such- und Index-Crawler
OAI-SearchBot, Claude-SearchBot und PerplexityBot speisen den Antwortindex, aus dem die jeweilige KI bei einer konkreten Anfrage zitiert oder verlinkt. Diese Kategorie ist für GEO besonders relevant: Wer diese Bots blockiert, verringert unmittelbar die Chance, in den entsprechenden KI-Antworten als Quelle genannt zu werden.
Nutzer-Abruf-Crawler
ChatGPT-User, Claude-User und Perplexity-User werden erst aktiv, wenn ein Nutzer live nach einer bestimmten Seite fragt – etwa „Fasse mir diese URL zusammen". Eine Sperre betrifft hier nicht das allgemeine Training oder die Indexierung, sondern genau diesen einzelnen, nutzergetriebenen Abruf.
robots.txt: KI-Crawler gezielt steuern
Die robots.txt-Datei liegt im Root-Verzeichnis Ihrer Domain (ihredomain.de/robots.txt) und enthält Regeln pro User-Agent. Drei typische Konfigurationen:
Beispiel 1: Trainings-Bots sperren, Such-Bots zulassen
Eine verbreitete Strategie: Trainingsdaten nicht preisgeben, aber in KI-Suchantworten trotzdem zitierfähig bleiben.
User-agent: GPTBot
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: Google-Extended
Disallow: /
User-agent: Applebot-Extended
Disallow: /
User-agent: CCBot
Disallow: /
User-agent: OAI-SearchBot
Allow: /
User-agent: ChatGPT-User
Allow: /
User-agent: PerplexityBot
Allow: /
User-agent: Perplexity-User
Allow: /
User-agent: Claude-SearchBot
Allow: /
User-agent: Claude-User
Allow: /
Beispiel 2: Alle KI-Crawler vollständig sperren
Wer grundsätzlich keine KI-Nutzung seiner Inhalte wünscht, kann alle bekannten KI-Crawler ausschließen:
User-agent: GPTBot
Disallow: /
User-agent: ChatGPT-User
Disallow: /
User-agent: OAI-SearchBot
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: Claude-User
Disallow: /
User-agent: Claude-SearchBot
Disallow: /
User-agent: PerplexityBot
Disallow: /
User-agent: Perplexity-User
Disallow: /
User-agent: Google-Extended
Disallow: /
User-agent: Applebot-Extended
Disallow: /
User-agent: CCBot
Disallow: /
Beispiel 3: Nur bestimmte Bereiche sperren
Statt ganze Bots komplett auszuschließen, lassen sich auch nur einzelne Verzeichnisse schützen, etwa interne Bereiche oder Kundenportale:
User-agent: GPTBot
Disallow: /intern/
Allow: /
User-agent: ClaudeBot
Disallow: /intern/
Allow: /
robots.txt ist freiwillig – kein Zugriffsschutz
Wichtig für die Einordnung: robots.txt ist eine Anweisung, keine technische Sperre. Seriöse Anbieter wie OpenAI, Anthropic oder Perplexity geben an, sich an robots.txt-Regeln zu halten, doch die Einhaltung beruht auf Selbstverpflichtung der Crawler-Betreiber. Ein Bot, der sich nicht daran hält, wird durch die Datei technisch nicht ausgesperrt. Wer Inhalte wirklich vor jedem Zugriff schützen will, braucht zusätzlich serverseitige Maßnahmen wie IP-Sperren, Login-Bereiche oder eine Web Application Firewall – robots.txt allein reicht dafür nicht.
Server-Logs prüfen: Wer besucht Sie wirklich?
Da robots.txt-Einhaltung freiwillig ist, lohnt sich der Blick in die eigenen Server- oder CDN-Logs. Dort lassen sich die tatsächlichen User-Agent-Strings und Zugriffsmuster auswerten: Kommt GPTBot wirklich regelmäßig vorbei? Ruft PerplexityBot einzelne Seiten ab? Weichen einzelne Zugriffe verdächtig von den bekannten Bot-Signaturen ab? Nur die Logs zeigen verlässlich, was tatsächlich passiert – unabhängig davon, was in der robots.txt-Datei steht. Genau diese Art von technischer Prüfung – ob KI-Crawler eine Seite überhaupt erreichen und lesen können – deckt auch die technische Analyse von findAIble ab.
Crawler-Steuerung ist nur der Anfang
Eine korrekt konfigurierte robots.txt-Datei stellt sicher, dass die relevanten Bots Ihre Inhalte lesen können – sie garantiert aber nicht, dass Ihre Seite auch tatsächlich als Quelle ausgewählt wird. Wie KI-Suchmaschinen unter den erreichbaren Seiten auswählen, welche sie zitieren, beschreibt der Artikel Wie KI-Suchmaschinen Quellen auswählen. Ergänzend lohnt sich ein Blick auf llms.txt als weiteres, allerdings noch unbestätigtes Steuerungsinstrument, sowie auf die KI-Sichtbarkeit messen-Anleitung, um zu prüfen, ob geöffnete Crawler-Zugänge auch tatsächlich zu mehr Erwähnungen führen. Einen strukturierten Fahrplan für die technische Grundlage insgesamt liefert die GEO-Audit-Checkliste.
Checkliste: KI-Crawler richtig steuern
- Sind alle relevanten KI-Crawler in der robots.txt-Datei explizit berücksichtigt?
- Ist die Unterscheidung zwischen Trainings-, Such- und Nutzer-Abruf-Bots bewusst getroffen?
- Wurde geprüft, dass Google-Extended nicht mit Googlebot verwechselt wird?
- Werden Server-Logs regelmäßig auf tatsächliche Bot-Zugriffe geprüft?
- Ist die robots.txt-Datei unter
/robots.txtöffentlich erreichbar und fehlerfrei? - Wurde die Entscheidung dokumentiert, warum bestimmte Bots gesperrt oder erlaubt sind?
Mehr erfahren: Der Begriff KI-Crawler im Glossar und der GEO-Leitfaden.
Häufige Fragen
Was ist der Unterschied zwischen GPTBot und OAI-SearchBot?
GPTBot sammelt Inhalte für das Training zukünftiger OpenAI-Modelle. OAI-SearchBot indexiert Seiten für die Websuche-Funktion von ChatGPT – nur wer diesen Bot zulässt, hat eine Chance, dort als Quelle zitiert zu werden.
Blockiert Google-Extended auch Google AI Overviews oder den KI-Modus?
Nein. Google-Extended steuert nur die Nutzung für Gemini-Training und -Grounding. AI Overviews und der KI-Modus in der Google-Suche greifen auf den regulären Googlebot-Index zurück und werden von Google-Extended nicht berührt.
Ist robots.txt ein zuverlässiger Schutz vor KI-Crawlern?
Nein. robots.txt ist eine freiwillige Anweisung, an die sich seriöse Crawler in der Regel halten, die aber technisch nicht erzwungen wird. Wer Inhalte wirklich sperren will, braucht zusätzliche technische Maßnahmen wie serverseitige Zugriffskontrollen.
Was passiert, wenn ich alle KI-Crawler blockiere?
Ihre Inhalte fließen dann nicht in neue Trainingsdaten und Suchindizes der jeweiligen Anbieter ein. Das schützt vor unerwünschter Nutzung, verringert aber auch die Chance, in KI-Antworten genannt oder zitiert zu werden.
Wie erkenne ich, ob KI-Crawler meine Website tatsächlich besuchen?
Prüfen Sie Ihre Server- oder CDN-Logs auf die jeweiligen User-Agent-Strings, etwa GPTBot oder PerplexityBot. Nur die Logs zeigen verlässlich, welche Bots wirklich zugreifen – unabhängig davon, was in der robots.txt steht.