Türk SEM · SEO-Werkzeug
What AI Sees: der KI-Crawler-Check
Die Crawler von ChatGPT, Claude und Perplexity lesen nur das HTML, das Ihr Server ausliefert. JavaScript führen sie nicht aus. Der Check zeigt Ihnen, welcher Inhalt ihnen dadurch entgeht, welche KI-Crawler Ihre robots.txt hereinlässt und wie Sie beides gezielt steuern.
Automatisch von Ihrer Website holen
Wir öffnen Ihre Seite einmal in einem echten Browser und vergleichen sie mit dem rohen HTML, das KI-Crawler erhalten. Weitere Daten Ihrer Website speichern wir nicht.
So funktioniert der Check
- 1
Ein Seitenaufruf im echten Browser
Wir laden Ihre Seite einmal in Chromium. Dabei halten wir zwei Fassungen fest: das HTML, das der Server als Erstes schickt, und die fertige Seite, nachdem JavaScript gelaufen ist.
- 2
Textabgleich
Taucht eine Passage von mindestens acht Wörtern erst in der fertigen Seite auf, bekommen KI-Crawler sie nie zu sehen. Der Prozentwert gibt an, wie viel Ihres Textes schon im rohen HTML steht.
- 3
Auswertung der robots.txt
Für jeden offiziell dokumentierten KI-Crawler prüfen wir einzeln, ob er Ihre Seite abrufen darf. Sortiert wird nach Aufgabe: Training, KI-Suche oder Abruf im Auftrag eines Nutzers.
So lesen Sie das Ergebnis
Entscheidend ist, welchen Anteil Ihres Textes KI-Crawler lesen können.
- 95 % und mehr
- Die Seite ist für KI-Crawler vollständig lesbar. Beim Rendering besteht kein Handlungsbedarf.
- 70 bis 94 %
- Der Hauptinhalt kommt an. Einzelne Elemente wie Bewertungen oder Tabs werden erst per JavaScript geladen.
- 25 bis 69 %
- KI-Crawlern entgeht ein großer Teil der Seite. Verlagern Sie den wichtigen Text in das rohe HTML, das der Server ausliefert.
- Unter 25 %
- Ohne JavaScript bleibt die Seite fast leer. Für KI-Assistenten ist sie praktisch unsichtbar.
JavaScript-SEO: Warum KI-Crawler weniger sehen
Im Dezember 2024 haben Vercel und MERJ ausgewertet, wie sich KI-Crawler auf realen Websites verhalten. Keiner der großen KI-Crawler führte JavaScript aus, auch nicht die von OpenAI, Anthropic, Meta und Perplexity (Vercel). Heruntergeladen werden JavaScript-Dateien durchaus, bei ChatGPT in 11,50 % der Anfragen, bei Claude in 23,84 %. Ausgeführt werden sie nicht. Text, den Ihre Skripte erst im Browser erzeugen, erreicht die Crawler deshalb nie.
Anders bei Google: Der Googlebot rendert JavaScript, bevor er eine Seite in den Index aufnimmt (Google Search Central). Aus diesem Index speist sich auch die „Übersicht mit KI“. So kann eine Seite bei Google gut ranken und für ChatGPT trotzdem leer aussehen.
Welcher Crawler welche Aufgabe hat
In der robots.txt regeln Sie jeden KI-Crawler einzeln. Genau das wird oft übersehen: Wer nur dem Training widersprechen will, sperrt alle Crawler eines Anbieters und fällt damit auch aus den Antworten seiner KI-Suche. Welcher Crawler was tut, beschreiben die Anbieter selbst.
Bei OpenAI sammelt GPTBot Trainingsdaten, OAI-SearchBot versorgt die ChatGPT-Suche, und ChatGPT-User ruft eine Seite ab, wenn ein Nutzer im Chat danach fragt. Websites, die OAI-SearchBot sperren, erscheinen laut OpenAI nicht mehr in den Antworten der ChatGPT-Suche, höchstens noch als Navigationslink (OpenAI). Eine Sperre für GPTBot allein lässt die ChatGPT-Suche dagegen unberührt.
Anthropic arbeitet nach demselben Muster mit ClaudeBot, Claude-SearchBot und Claude-User (Anthropic). Perplexity setzt PerplexityBot für seine Suchergebnisse und Perplexity-User für Abrufe in Echtzeit ein. Perplexity-User hält sich laut Perplexity in der Regel nicht an die robots.txt (Perplexity).
Google-Extended ist ein Sonderfall: Hinter dem Namen steht kein Crawler, sondern ein Token in der robots.txt. Es legt fest, ob Gemini mit Ihren Inhalten trainiert werden und seine Antworten darauf stützen darf. Auf die Aufnahme in die Google-Suche und auf das Ranking hat es laut Google keinen Einfluss (Google).
Was Sie tun können
Fehlt Text im ausgelieferten HTML, gehört er dorthin. Das erreichen Sie mit serverseitigem Rendering (SSR) oder Prerendering; die meisten aktuellen Frameworks beherrschen beides. Beginnen Sie mit den Inhalten, die eine Suchanfrage beantworten: Überschriften, Haupttext, Preise und FAQ.
Ist ein Crawler aus Versehen gesperrt, übernehmen Sie eine der fertigen Regeln aus dem Check. Diese Regeln enthalten für jede Rolle alle offiziell dokumentierten Crawler. So bleibt die KI-Suche offen, auch wenn Sie dem Training widersprechen.
Maschinenlesbarkeit ist die Voraussetzung. Der nächste Schritt: von KI-Assistenten als Quelle genannt werden. Genau daran arbeiten wir bei GEO (Generative Engine Optimization) und AIO (KI-Optimierung). Wie Google seine KI-Antworten erstellt, erklärt unser Leitfaden zur „Übersicht mit KI“.
Häufige Fragen
Schadet es meinem Google-Ranking, wenn ich KI-Crawler sperre?
Nein. Eine Sperre für Google-Extended oder für KI-Crawler ändert nichts an Ihrem Ranking in der Google-Suche; laut Google hat Google-Extended darauf keinen Einfluss. Schaden würde nur eine Sperre des Googlebots selbst.
Wie sperre ich GPTBot, ohne aus der ChatGPT-Suche zu fallen?
Sperren Sie in der robots.txt nur GPTBot und lassen Sie OAI-SearchBot und ChatGPT-User zu. GPTBot sammelt ausschließlich Trainingsdaten. Für die Antworten der ChatGPT-Suche ist OAI-SearchBot zuständig.
Führt ChatGPT JavaScript aus?
Nein. Die Crawler von ChatGPT lesen das HTML, das Ihr Server ausliefert. JavaScript-Dateien laden sie mitunter herunter, führen sie aber nicht aus. Was Ihre Skripte an Text erzeugen, sehen sie deshalb nicht.
Warum ist meine Seite bei Google sichtbar, hier aber fast leer?
Der Googlebot rendert JavaScript vor der Indexierung und sieht deshalb die fertige Seite. KI-Crawler lesen nur das rohe HTML. Wird Ihr Inhalt per JavaScript geladen, erreicht er nur Google.
Hält die robots.txt KI-Crawler zuverlässig fern?
Nicht ganz. Die großen KI-Crawler sagen zu, sich daran zu halten. Anders bei Abrufen im Auftrag eines Nutzers: Perplexity-User etwa hält sich unter Umständen nicht daran. Die robots.txt äußert einen Wunsch; durchsetzen kann sie ihn nicht.
Ist eine llms.txt Pflicht?
Nein. Die llms.txt ist ein Vorschlag aus der Community, der Sprachmodellen eine kurze Übersicht über Ihre Website geben soll. Kein großer KI-Anbieter hat bestätigt, dass er sie auswertet. Kümmern Sie sich zuerst um HTML und robots.txt.
Quellen
- Vercel und MERJ: The rise of the AI crawler (Dezember 2024)
- OpenAI: Übersicht der OpenAI-Crawler
- Anthropic: So sperren Website-Betreiber den Crawler
- Perplexity: Perplexity-Crawler
- Google: Gängige Crawler und Google-Extended
- Google Search Central: Grundlagen zu JavaScript-SEO
- Cloudflare: Content Signals Policy
- Der llms.txt-Vorschlag