Kostenloses Tool

KI-Sichtbarkeits-Check

Eine Seite kann in der robots.txt vollständig offen sein und für KI trotzdem unsichtbar bleiben. Eine Firewall liest keine robots.txt, sie antwortet einfach mit 403. Dieser Check stellt beide Fragen getrennt, dazu drei weitere, die darüber entscheiden, ob ein Modell die Seite überhaupt nutzen kann.

Eine Domain. Wir rufen die Startseite einmal je Crawler ab, ein Lauf dauert deshalb einige Sekunden. Ergebnisse bleiben sechs Stunden zwischengespeichert; nach einer Änderung an Ihrer Seite können Sie neu prüfen.

Warum robots.txt nur die halbe Antwort ist

Die robots.txt ist eine Richtlinie: Sie sagt gutwilligen Crawlern, was sie abrufen dürfen. Davor sitzt aber oft eine Firewall, ein Security-Plugin oder eine Bot-Management-Schicht, die entscheidet, ob die Anfrage überhaupt beantwortet wird. Beide Ebenen können sich widersprechen – dann sieht die Seite offen aus, verhält sich aber geschlossen.

Meist steckt dahinter keine bewusste Entscheidung. Cloudflare und mehrere Managed-Hoster sperren KI-Crawler ab Werk, sodass eine Seite nach einem Plattformwechsel plötzlich abweist, ohne dass es jemand im Team bemerkt. Dieser Check ruft Ihre Startseite einmal je Crawler und einmal als normaler Browser ab und vergleicht die Antworten.

Warum wir eine Sperre nie auf schwacher Grundlage melden

Wir haben diesen Check im September 2026 über 200 Domains laufen lassen und zunächst gemeldet, ein großer Teil sperre KI-Crawler. Ein guter Teil davon stimmte nicht: Der Durchlauf war schnell genug, um eine Drosselung auszulösen, und eine 429 ist keine Sperre. Daraus wurde die Regel, nach der dieses Tool arbeitet: Zu jeder Prüfung läuft ein Kontrollabruf als Browser mit, und ein Crawler gilt nur dann als abgewiesen, wenn die Kontrolle durchkommt und er nicht. Eine 429, eine Zeitüberschreitung oder eine für alle unerreichbare Seite ergeben „unklar“.

Common Crawl ist der Teil, den man nicht kaufen kann

Common Crawl ist ein offener Webcrawl, mitfinanziert von denselben Unternehmen, die große Sprachmodelle trainieren, und eine wichtige Quelle ihrer Trainingsdaten. Eine Seite, die dort fehlt, taucht mit hoher Wahrscheinlichkeit auch im nächsten Modell nicht auf. Es ist zugleich die einzige Messung zur KI-Sichtbarkeit, die ohne bezahltes Werkzeug möglich ist – deshalb steht sie in diesem Check.

Zu fehlen ist kein Todesurteil, enthalten zu sein keine Garantie. Behandeln Sie es als ein Signal: Fehlt Ihre Seite im Index und weist Ihr Server zugleich den CCBot ab, hängen beide Tatsachen zusammen – und beide lassen sich beheben.

Text, den es erst nach dem JavaScript gibt

KI-Crawler holen in aller Regel nur HTML und führen kein JavaScript aus. Baut Ihre Seite ihren Text erst im Browser zusammen, bekommen sie eine leere Hülle. Wir zählen deshalb die Wörter im rohen HTML, das Ihr Server ausliefert. Eine niedrige Zahl bei einer Seite, die im Browser voll aussieht, ist das typische Merkmal einer im Browser gerenderten Seite – und das teuerste Sichtbarkeitsproblem, wenn man es ignoriert.

Was man mit dem Ergebnis macht

Werden Crawler abgewiesen und sollen sie hinein: Die Einstellung sitzt im CDN oder in der Firewall, nicht in der robots.txt. Bei Cloudflare heißt sie KI-Bot-Steuerung unter „Sicherheit“. Wollen Sie sie aussperren, tun Sie es bewusst in der robots.txt statt versehentlich an der Firewall – dann lässt sich der Unterschied später noch erkennen.

llms.txt ist eine junge Konvention: eine Textdatei im Wurzelverzeichnis, die Sprachmodelle auf die wichtigen Seiten hinweist. Verlässlich ausgewertet wird sie bislang von nichts. Sie kostet fast nichts und ersetzt keine der vier Prüfungen oben.

FAQ

Schadet es meinem Google-Ranking, wenn ich KI-Crawler sperre?

Nicht direkt. Google-Extended steuert die Trainingsnutzung und ist vom Googlebot getrennt, der die Suche bedient. GPTBot oder ClaudeBot zu sperren hat auf die Google-Suche keinerlei Wirkung – es entscheidet nur, ob ChatGPT, Claude und ähnliche Systeme Sie lesen und zitieren können.

Meine robots.txt erlaubt alles, das Tool sagt trotzdem „abgewiesen“. Was nun?

Genau dafür gibt es dieses Tool. Etwas vor Ihrer Seite weist die Anfrage ab: eine CDN-Bot-Regel, eine WAF, ein Security-Plugin oder der Hoster. Dort nachsehen, nicht in der robots.txt. Eine Ausnahme: Manche Schutzsysteme prüfen Bots anhand ihrer IP-Adresse. Sie weisen unseren Abruf ab, lassen den echten Crawler aber durch – welcher Fall vorliegt, zeigt das Protokoll Ihrer Firewall.

Warum kommt ein Crawler durch und ein anderer nicht?

Bot-Management arbeitet meist mit Listen bekannter KI-Agenten, und diese Listen unterscheiden sich je nach Anbieter und werden zu unterschiedlichen Zeiten gepflegt. Ein neuerer oder kleinerer Crawler steht oft schlicht noch nicht darauf.

Was bedeutet „unklar“?

Wir konnten keine Sperre nachweisen. Entweder bekam der Crawler eine Drosselungsantwort, die Anfrage lief in eine Zeitüberschreitung, oder auch der Kontrollabruf schlug fehl. Lieber „unklar“ melden als eine Sperre, die keine ist.

Sollte jede Seite für KI-Crawler offen sein?

Nein. Ein Verlag, der den Zugang zu seinem Archiv verkauft, hat gute Gründe zu schließen. Diese Prüfung soll nur sicherstellen, dass die Entscheidung bewusst getroffen wird und sichtbar ist – kein Nebeneffekt einer Voreinstellung.

Domain-Authority-Checker →

Für KI unsichtbar und unklar, warum?

Wir prüfen die ganze Kette: CDN-Regeln, robots.txt, Rendering, strukturierte Daten und ob Ihr Thema in den Korpora überhaupt vorkommt – abgerechnet nach Stunden, nie nach Versprechen.