Warum zitiert ChatGPT unsere Website nicht? Drei Prüfungen — und nur eine ist ein Schalter
OAI-SearchBot, der Index dahinter und die Quellen, auf die die Engine ohnehin setzt. Diese Folge liest unsere eigene robots.txt vor laufender Kamera — Fehler inklusive — und beantwortet zwei Fragen, die im deutschsprachigen Raum anders ausfallen: was § 44b UrhG mit Ihrer robots.txt zu tun hat, und wie viel Bing bei 5,84 % Marktanteil in Deutschland noch wiegt.

Ob ChatGPT Sie zitiert, entscheiden drei Prüfungen: ob OAI-SearchBot Ihre Seite überhaupt abrufen darf, ob Sie in dem Suchindex stehen, den die Engine heranzieht, und ob Sie auf den Referenz- und Community-Flächen vorkommen, auf die sie ohnehin setzt. Nur die erste ist ein Schalter — OpenAI schreibt selbst, dass Seiten, die OAI-SearchBot ausschließen, in ChatGPT-Suchantworten nicht erscheinen. Die zweite und dritte verdient man sich, und im deutschsprachigen Raum unter anderen Bedingungen als im englischen.
Eine einzige Zeile in einer Datei, die die meisten Betreiber nie geöffnet haben, kann Sie unbemerkt aus den Antworten von ChatGPT entfernen: die robots.txt im Wurzelverzeichnis Ihrer Domain. In der Answer Engine Optimization — eine Website so bauen, dass KI-Assistenten sie zitieren — ist das die einzige Prüfung, die ein Schalter ist und kein Handwerk. Ihre Texte können hervorragend und Ihr Markup sauber sein: Kommt der Crawler nie an, ist nichts davon in dem Pool, aus dem die Antwort gezogen wird. Diese Seite geht die drei Prüfungen an unserer eigenen Datei durch — Fehler inklusive — und beantwortet dabei die zwei Fragen, die im deutschsprachigen Raum anders ausfallen als in den englischen Ratgebern: was das Urheberrecht mit Ihrer robots.txt zu tun hat, und wie viel Bing hier wirklich wiegt.
Sehen Sie sich die Folge an
Ein Bot schließt Sie heute von ChatGPT aus, der andere trainiert nur ein künftiges Modell — welcher ist welcher?
OAI-SearchBot — und die Prüfung dauert zwei Minuten. Rufen Sie Ihre eigene Domain mit /robots.txt am Ende auf und suchen Sie diesen Namen. OAI-SearchBot ist der Suchcrawler von OpenAI, und OpenAIs eigene Crawler-Dokumentation sagt, dass Seiten, die ihn ausgeschlossen haben, in ChatGPT-Suchantworten nicht gezeigt werden. Und nun der Punkt, den fast alle verwechseln: GPTBot ist ein anderer Bot mit einer anderen Aufgabe. OpenAI beschreibt GPTBot als Crawler für Inhalte, die zum Training der Basismodelle verwendet werden können. GPTBot zu sperren ändert nichts daran, ob ChatGPT Sie heute zitiert — es ändert, ob Ihre Texte in ein künftiges Modell gelangen. Zwei Bots, zwei Fragen. Lesen Sie die Zeile, nicht das Etikett.
Warum die robots.txt in Deutschland auch eine Rechtsfrage ist
Weil das deutsche Urheberrecht genau an dieser Datei ansetzt. § 44b UrhG erlaubt Text und Data Mining an rechtmäßig zugänglichen Werken — aber nur, solange der Rechteinhaber sich die Nutzung nicht vorbehalten hat. Und für online zugängliche Werke hält das Gesetz ausdrücklich fest: Ein solcher Nutzungsvorbehalt ist nur dann wirksam, wenn er in maschinenlesbarer Form erfolgt. Die robots.txt ist die etablierte maschinenlesbare Form. Damit ist die Entscheidung über GPTBot hierzulande zweistufig, nicht einstufig: technisch geht es um das Trainingskorpus, rechtlich um Ihren Vorbehalt gegen TDM an Ihren Inhalten. Was sich dadurch NICHT ändert, ist die Zitierfrage — der Vorbehalt gegenüber den Trainings-Crawlern lässt Ihre Sichtbarkeit in den heutigen ChatGPT-Antworten unberührt, denn dafür ist OAI-SearchBot zuständig. Wer die beiden Ebenen vermengt, sperrt entweder aus Rechtsgründen den falschen Bot oder öffnet aus Sichtbarkeitsgründen einen, den er nie öffnen wollte.
Eine benannte Gruppe hebt die Regeln auf, die Sie für alle geschrieben haben
Weil die Spezifikation es so vorsieht. Googles Dokumentation zur Auslegung der robots.txt hält fest, dass für einen bestimmten Crawler nur eine Gruppe gilt: Der Crawler nimmt die Gruppe, deren User-Agent am genauesten auf ihn passt, und ignoriert jede andere. Wenige Zeilen darunter steht der Satz, der still Sichtbarkeit kostet — user-agent-spezifische Gruppen und globale Gruppen werden nicht kombiniert. Was in einer benannten Gruppe steht, ist für diesen Crawler das ganze Gesetz. Wenn Sie je einen „KI-Bots“-Block aus einem Blogbeitrag in eine Datei kopiert haben, in der bereits sorgfältige Regeln standen, lesen Sie nach, was dieser Block enthält — es ist das Einzige, was der Crawler sieht.
Welchen Fehler enthält unsere eigene robots.txt?
Unsere benannten KI-Crawler-Gruppen erben nichts von den Regeln darüber — und wir zeigen das an unserer eigenen Datei, statt eine fremde zu benoten. Prüfung eins besteht sie: Es gibt eine Gruppe für OAI-SearchBot mit Allow. Weiter oben trägt die Sternchen-Gruppe aber unsere eigentlichen Regeln — die Fehlerseite nicht crawlen, das Portal nicht crawlen. Keine davon erreicht OAI-SearchBot. In dem Moment, in dem dieser Crawler seine eigene benannte Gruppe bekam, hat er aufgehört, irgendetwas zu erben. Das ist kein Fehler in unserer Datei, das ist die Spezifikation, wie sie geschrieben steht. Hier kostet es uns wenig, weil diese Pfade hinter einem Login liegen — und private Seiten schützt ein Login, niemals eine Zeile in dieser Datei.
Wie viele Crawler in Ihrer Datei zählen wirklich?
Drei von den siebzehn, die wir namentlich führen. Ein Zitat kosten können heute der Suchcrawler von OpenAI, der Crawler von Perplexity und der Suchcrawler von Anthropic. Der Rest ist kein Ballast: GPTBot regelt, ob Ihre Texte in ein künftiges Trainingskorpus gelangen — eine echte Frage, nur eine langsamere, und in Deutschland zusätzlich eine urheberrechtliche. Wenn Ihnen aber jemand Geld dafür berechnet, die Trainings-Bots freizugeben, damit die KI Sie zitiert, zahlen Sie für die falsche Zeile. Beachten Sie außerdem den einen entscheidenden Crawler, den wir bewusst nicht benannt haben: Googlebot bleibt in der Sternchen-Gruppe und folgt damit weiter unseren Regeln — und über Googlebot erreichen Sie den Index, um den es in Prüfung zwei geht.
Bing oder Google — welchen Index zieht ChatGPT heran?
Beide Hälften stimmen, und die meisten Ratgeber liefern nur eine. Hälfte eins: OpenAIs eigene Hilfeseite zur ChatGPT-Suche nennt Partnerschaften mit anderen Suchanbietern und benennt dabei Bing und Shopify. Wir haben diese Seite am 1. August 2026 direkt gelesen, und Bing stand darin — im Bing-Index zu sein ist also keine vergeudete Mühe. Hälfte zwei: Microsoft hat die Bing-Such-APIs im August 2025 eingestellt, und über dieses Jahr hinweg fiel in einem Panel von Profound über tausend Prompts die Überschneidung von ChatGPT mit Bing-Ergebnissen von 26 % auf 8 %, während die Überschneidung mit Google von rund 12 % auf 33 % stieg. Das sind fremde Messungen, und wir reichen sie als Messungen weiter, nicht als Gesetz.
Wie viel Gewicht hat Bing im deutschen Markt wirklich?
Weniger, als die Debatte vermuten lässt — und das verschiebt die Reihenfolge Ihrer Arbeit. Statcounter weist für Deutschland im August 2026 Google mit 88,49 % und Bing mit 5,84 % der Suchanfragen aus; dahinter folgen Yahoo mit 1,57 %, Yandex mit 1,56 %, DuckDuckGo mit 1,2 % und Ecosia mit 1,02 %. Für eine deutschsprachige Seite heißt das: Die Indexierbarkeit bei Google ist nicht eine von zwei gleichwertigen Baustellen, sondern die Baustelle. Trotzdem lautet die Empfehlung nicht „Bing ignorieren“, sondern eine Frage der Reihenfolge und des Aufwands — erst serverseitig gerenderte Seiten, eine ehrliche Sitemap und ein nicht gesperrter Googlebot, danach die zwanzig kostenlosen Minuten, um dieselbe Sitemap in den Bing Webmaster Tools einzureichen, weil OpenAI Bing weiterhin als Partner nennt und Sie das nichts kostet. Der Fehler wäre, die zwanzig Minuten zuerst zu investieren und die 88 % danach.
Auf welche Quellen stützt sich ChatGPT ohnehin?
Nicht gleichmäßig auf das Web. In einer dieses Jahr veröffentlichten Untersuchung von 600.000 Zitier-Ereignissen in den USA entfiel auf Wikipedia und Reddit zusammen mehr als ein Viertel von allem, was ChatGPT zitierte. Und jetzt die Einschränkung, die Sie von uns hören sollen: In einer anderen Messung über mehr als 100 Millionen Zitate brach Reddits Anteil in rund sechs Wochen von etwa 60 % auf etwa 10 % ein. Behandeln Sie den Quellenmix wie Wetter. Die Crawler-Zeile ist Architektur. Bauen Sie auf die Architektur und kleiden Sie sich nach dem Wetter. Beide Zahlen stammen zudem aus englischsprachigen Panels — für eine deutschsprachige Frage ist die Zusammensetzung eine andere, und die beiden folgenden Abschnitte sagen, welche.
Warum die deutschsprachige Wikipedia für die meisten Mittelständler verschlossen ist
Weil sie ihre Hürde als Zahl veröffentlicht, nicht als Ermessen. Die Relevanzkriterien der deutschsprachigen Wikipedia halten für Wirtschaftsunternehmen fest, wann ein eigener Artikel überhaupt in Frage kommt: mindestens 1.000 Vollzeitmitarbeiter, oder mehr als 100 Millionen Euro Jahresumsatz, oder eine Notierung im regulierten Markt, oder mindestens 20 Betriebsstätten in Verbindung mit der Eigenschaft als große Kapitalgesellschaft, oder eine belegte marktbeherrschende beziehungsweise innovationsführende Stellung. Ein Kriterium genügt — aber ein typisches deutsches Software- oder Dienstleistungsunternehmen mit dreißig Mitarbeitern erfüllt keines davon. Daraus folgt eine unbequeme, aber saubere Konsequenz: Wenn Ihnen jemand einen Wikipedia-Eintrag als AEO-Leistung verkauft, verkauft er Ihnen etwas, das die Relevanzkriterien in Ihrem Fall gar nicht zulassen. Der ehrliche Weg führt über die Flächen, die keine Umsatzschwelle kennen — Fachpresse, Branchenverzeichnisse und die Community-Flächen unten — und erst viel später, falls überhaupt, über einen Enzyklopädie-Eintrag.
Auf welchen deutschsprachigen Flächen wird Ihre Kategorie besprochen?
Auf anderen als in den englischsprachigen Studien — und das ist der Grund, warum eine übersetzte Checkliste hier ins Leere greift. Die viel zitierten Reddit-Anteile stammen aus englischsprachigen Panels; für eine Frage, die ein Kunde auf Deutsch stellt, zieht die Engine bevorzugt deutschsprachige Belege heran. Die Arbeit besteht deshalb nicht darin, „überall zu sein“, sondern die zwei bis drei Flächen zu bestimmen, auf denen Ihre Kategorie tatsächlich auf Deutsch diskutiert wird: das einschlägige Fachmedium Ihrer Branche, das Verzeichnis oder der Verband, den Ihre Kunden kennen, und das Forum oder Portal, in dem Ihre Kategorie erklärt statt beworben wird. Prüfen Sie das nicht nach Gefühl, sondern indem Sie die Frage Ihres Kunden wörtlich auf Deutsch in ChatGPT und Perplexity stellen und aufschreiben, welche Domains in der Antwort verlinkt sind. Das ist eine Arbeitsstunde und ersetzt jede geborgte Statistik.
Was sagen kostenlose Sichtbarkeits-Tools über den Crawler-Zugang?
Nichts — und das ist eine Lücke in ihrer Aufgabenstellung, keine Kritik an den Werkzeugen. Der AI Visibility Checker von Ahrefs ist wirklich kostenlos, ohne Anmeldung, mit Ergebnis in Sekunden, und der Report dahinter ist echt: KI-Erwähnungen gesamt, Erwähnungen nach Plattform, Top-Themen, meistzitierte Domains, meistzitierte Seiten. Suchen Sie auf dieser Seite nach dem Wort „robots“: null Treffer. Nichts zum Crawler-Zugang, nichts zu OAI-SearchBot, nichts zu GPTBot. Semrush hat dieselbe Form und ist großzügig beim Zugang — drei Durchläufe pro Tag ohne Registrierung — mit einem gut gebauten Report aus Sichtbarkeitswert, Erwähnungen, Zitaten, Plattformabdeckung, meistzitierten Seiten und Wettbewerbsvergleich. Keine dieser Dimensionen ist der Crawler-Zugang. HubSpots Grader braucht für einen einzelnen Lauf kein Konto und liefert einen Sammelwert aus Tonalität, Präsenzqualität, Markenbekanntheit, Share of Voice und Wettbewerbsumfeld. Fünf Dimensionen, keine davon Zugang. Wäre Ihre eine entscheidende Zeile falsch, würden Ihnen alle drei einen niedrigen Wert reichen — und keines würde Ihnen sagen, warum.
Was macht unser eigener Open-Source-Tracker stattdessen?
Er bindet jeden Bot an das, was eine Sperre tatsächlich kostet. aeo-platform ist unser eigener Tracker, kostenlos und quelloffen auf npm, und sein Crawl-Audit meldet keine Anzahl gesperrter Bots. Es kennzeichnet jeden nach Stufe: Suchstufe heißt, eine Sperre entfernt Sie aus den Antworten dieser Engine; Trainingsstufe heißt, es geht ausschließlich um das Trainingskorpus, ohne gemessene Wirkung auf heutige Zitate; Nutzerstufe heißt, der Abruf wird vom Nutzer ausgelöst und ignoriert Ihre Datei ohnehin meist. Zusätzlich verweigert das Werkzeug, Ihnen eine Aufgabe zum Entsperren eines Trainings-Bots zu schreiben. Diese Verweigerung ist das Produkt — ein Tool, das Ihnen fünf dringend wirkende Zugangs-Aufgaben reicht, obwohl nur eine davon ein Zitat verändern kann, verkauft Beschäftigung und keine Sichtbarkeit.
Wo unsere eigene Seite bei dieser Checkliste durchfällt
Bei Prüfung drei, und zwar deutlich. Suchen Sie heute in der deutschsprachigen Wikipedia nach Webappski, und Sie bekommen null Treffer — wir haben es am 25. August 2026 erneut geprüft. Wir fehlen auf genau der Fläche, auf die ChatGPT am stärksten setzt. Nach den oben zitierten Relevanzkriterien werden wir sie auf absehbare Zeit auch nicht erreichen: Wir haben keine 1.000 Mitarbeiter und keine 100 Millionen Euro Umsatz, und einen Artikel über uns selbst zu schreiben wäre genau der Weg, den die Wikipedia zurückweist. Diese Prüfung steht auf unserer eigenen Tafel auf Rot und bleibt es eine Weile. Wir zeigen Ihnen das lieber, als Ihnen eine Abkürzung zu verkaufen — und es ist die ehrliche Form dieser Checkliste: Zwei der drei Dinge, auf die ChatGPT schaut, verdient man langsam, und nur das erste ist ein Schalter, den Sie heute Nachmittag umlegen können.
Die vollständige Checkliste für den deutschsprachigen Raum
Sechs Prüfungen in dieser Reihenfolge, die wir für jeden Kunden durchgehen. Erstens: OAI-SearchBot in der robots.txt erlaubt — als einzige der sechs ein Schalter. Zweitens: die benannte Gruppe lesen, die Sie ihm gegeben haben, denn sie erbt nichts von der Gruppe darüber. Drittens: die Entscheidung über die Trainings-Crawler bewusst treffen, mit § 44b UrhG im Blick, und sie nicht mit der Zitierfrage vermengen. Viertens: serverseitig gerenderte Seiten im Google-Index und Googlebot nicht gesperrt — bei 88 % Marktanteil in Deutschland ist das die Hauptarbeit. Fünftens: dieselbe Sitemap in den Bing Webmaster Tools einreichen, weil OpenAI Bing weiterhin nennt und es zwanzig kostenlose Minuten sind. Sechstens: die zwei bis drei deutschsprachigen Flächen bestimmen, auf denen Ihre Kategorie wirklich besprochen wird, statt eine englischsprachige Quellenliste zu übernehmen. Die erste Prüfung dauert zwei Minuten, und die meisten Seiten haben nie nachgesehen.
Häufige Fragen
Sollten wir GPTBot sperren?
Das ist eine Entscheidung über Training und Urheberrecht, nicht über Zitate. OpenAI beschreibt GPTBot als Crawler für Inhalte, die zum Training der Basismodelle dienen können; ihn zu sperren entfernt Sie also nicht aus den heutigen ChatGPT-Antworten — das tut OAI-SearchBot. In Deutschland kommt die zweite Ebene hinzu: § 44b UrhG macht den Nutzungsvorbehalt gegen Text und Data Mining nur wirksam, wenn er maschinenlesbar erklärt ist, und die robots.txt ist die etablierte maschinenlesbare Form. Entscheiden Sie also rechtlich, ob Ihre Werke ins Training dürfen — und wissen Sie, dass die Antwort Ihre Sichtbarkeit so oder so nicht verändert.
Wir haben einen KI-Bots-Block eingefügt. Ist das unbedenklich?
Nur wenn Sie lesen, was in dem Block steht. Einen Crawler zu benennen erzeugt seine eigene Gruppe, und laut Spezifikation ist das die einzige Gruppe, der dieser Crawler folgt — spezifische und globale Gruppen werden nicht kombiniert. Jede Disallow-Regel aus Ihrer Sternchen-Gruppe gilt für die eben benannten Bots nicht mehr. Lesen Sie den eingefügten Block, als wäre er für diese Crawler Ihre ganze Datei. Genau das ist er.
Lohnt sich Bing für ein deutsches Unternehmen überhaupt noch?
Ja, aber als Zwanzig-Minuten-Aufgabe und nicht als Strategie. Statcounter weist Bing für Deutschland im August 2026 mit 5,84 % aus, Google mit 88,49 % — die eigentliche Arbeit gehört also in die Indexierbarkeit bei Google. Zugleich nennt OpenAIs Hilfeseite Bing weiterhin als Suchpartner, und eine Sitemap in den Bing Webmaster Tools einzureichen kostet nichts außer der halben Stunde. Reihenfolge statt Entweder-oder: erst Google, dann Bing.
Zeigt ein kostenloses Tool, ob ein Crawler gesperrt ist?
Die drei geprüften nicht. Ahrefs, Semrush und HubSpot melden Erwähnungen, zitierte Seiten, Plattformabdeckung und Sammelwerte — nützlich für die Frage, ob Sie vorkommen, stumm zur Frage, warum nicht. Ein gesperrter Suchcrawler und eine langweilige Seite ergeben in diesen Reports denselben niedrigen Wert. Prüfen Sie die robots.txt selbst oder nutzen Sie einen Tracker, dessen Crawl-Audit die Stufe jedes Bots benennt.
Brauchen wir einen Wikipedia-Eintrag, um zitiert zu werden?
Brauchen nicht, und die meisten deutschen Mittelständler können ihn auch gar nicht bekommen. Die Relevanzkriterien der deutschsprachigen Wikipedia verlangen unter anderem 1.000 Vollzeitmitarbeiter, über 100 Millionen Euro Jahresumsatz, eine Börsennotierung oder mindestens 20 Betriebsstätten — ein Kriterium genügt, aber wer keines erfüllt, bekommt keinen Artikel, gleich wie gut der Text wäre. Arbeiten Sie stattdessen an den Flächen ohne Umsatzschwelle: Fachpresse, Branchenverzeichnisse und die deutschsprachigen Foren, in denen Ihre Kategorie erklärt wird.
Sollen wir diese Prüfungen auf Ihrer Seite durchgehen?
Wir gehen alle sechs durch — Crawler-Zugang, Gruppenvererbung, die Trainings-Entscheidung nach § 44b UrhG, Index-Abdeckung bei Google, die Bing-Einreichung und die deutschsprachige Quellenpräsenz — auf echten Kundenseiten, und die erste KI-Sichtbarkeitsanalyse ist kostenlos. Wenn Sie wissen möchten, ob ChatGPT Sie überhaupt erreichen kann, fordern Sie die kostenlose Analyse unter webappski.com an.



