Warum eine ChatGPT-Prüfung nichts über Gemini aussagt: 616 Quellen, 14 von allen drei zitiert
Ausgabe 1 der monatlichen Webappski-Forschungsreihe: 267 Beobachtungen aus eigenen Messungen auf einem polnischsprachigen Fragensatz, 2006 Zitat-Instanzen und 616 Domains — ausgewertet zu der Frage, wie weit eine einzelne Sichtbarkeitsprüfung überhaupt trägt. Mit offengelegtem Interessenkonflikt und dem Teil der Streuung, der nicht auf die Engines, sondern auf unsere eigene ungleiche Erfassung zurückgeht. Ein datierter Schnitt aus drei Engines, keine Agentur-Rangliste.

In 267 polnischsprachigen KI-Antworten zitierten drei Engines 616 verschiedene Hosts — nur 14 davon alle drei. 504 Hosts, also 81,8 %, nannte genau eine einzige Engine. Webappski hat diese Messung finanziert und durchgeführt und verkauft selbst AEO-Dienstleistungen: 21 der 267 Beobachtungen entfallen auf unsere eigene Marke.
Gemessen wurde auf Polnisch, veröffentlicht wird das hier für den deutschsprachigen Raum — und dieser Umweg ist der eigentliche Punkt. Für ein Unternehmen im DACH-Raum ist nicht interessant, welche polnische Agentur oft genannt wird, sondern wie weit die Aussage einer einzelnen Prüfung reicht. Wer seine KI-Sichtbarkeit einmal in ChatGPT nachsieht, hat eine von drei weitgehend getrennten Quellenlisten gesehen. Wer sie auf Englisch nachsieht, hat den deutschsprachigen Markt gar nicht geprüft.
Diese Ausgabe beantwortet eine Frage, die wir uns selbst gestellt haben. Unsere englischsprachige Auswertung 168 Antworten in vier Sprachpanels endete am 12. August 2026 mit der Ankündigung, als Nächstes zu prüfen, ob Antwortmaschinen in Englisch, Polnisch, Deutsch und Russisch unterschiedliche Quellen zitieren. Sie zählte Nennungen und Zitatvolumen, berechnete aber kein einziges Überschneidungsmaß. Hier steht diese Größe erstmals gerechnet — auf einem Korpus, der rund 5,5-mal größer ist als der polnische Teilkorb jener Auswertung: 267 Beobachtungen gegenüber 48 Antwortzellen. Ein Teil der so gemessenen Streuung geht dabei nicht auf die Engines zurück, sondern auf die ungleiche Erfassung unseres eigenen Messaufbaus; wir legen das weiter unten in derselben Sektion offen, in der die 81,8 % stehen.
Was hier nicht steht, ist ebenso wichtig: keine repräsentative Stichprobe eines Marktes, keine Zeitreihe, keine Rangliste nach Qualität. Wer eine Anbieterübersicht für den DACH-Raum sucht, findet sie in unserem Vergleich der Answer-Engine-Optimization-Agenturen im DACH-Raum; die deutschsprachige Entsprechung dieser Messreihe haben wir als Quellencheck über 48 deutsche Antwortzellen veröffentlicht. Dieser Beitrag wiederholt beide nicht. Er ergänzt sie um genau eine neue Größe: die gerechnete Streuung zwischen den Engines innerhalb einer Sprache.
Was bedeutet Quellen-Streuung zwischen KI-Engines?
Quellen-Streuung ist der Anteil der Domains, die innerhalb desselben Fragensatzes nur eine einzige Engine zitiert. Sie bewertet keine Quelle und kürt keinen Sieger. Sie beschreibt, wie weit drei Adresslisten auseinanderlaufen, die auf dieselben Fragen geantwortet haben.
Eine Beobachtung ist eine Messzelle: eine Frage, an eine Engine gestellt, in einem Lauf. Der polnischsprachige Schnitt enthält 267 davon, verteilt auf 39 Fragen.
Eine Zitat-Instanz ist ein einzelnes Vorkommen einer Adresse im Antworttext. Eine Antwort kann ein Dutzend Adressen tragen; deshalb ergeben 267 Beobachtungen 2006 Zitat-Instanzen.
Ein eindeutiger Host ist eine Domain, einmal gezählt, unabhängig davon, wie oft sie vorkommt. Im polnischsprachigen Schnitt sind es 616.
Der Jaccard-Koeffizient zweier Engines ist die Zahl der gemeinsamen Domains, geteilt durch die Zahl der Domains, die bei mindestens einer von beiden vorkommen. Null bedeutet keine Schnittmenge, eins bedeutet identische Listen.
Eine Nennung ist kein Zitat. Eine Engine kann eine Marke beim Namen nennen, ohne eine Adresse anzugeben — und umgekehrt eine Domain zitieren, ohne die Firma zu nennen. Beide Ereignisse zählen wir getrennt.
Der Gültigkeitsbereich einer Messung ist die Menge der Bedingungen, unter denen ihr Ergebnis gilt: diese Engines, dieser Fragensatz, diese Sprache, dieser Tag. Alles außerhalb davon ist unbelegt. Um diesen Bereich geht es in diesem Beitrag mehr als um jede einzelne Zahl.
Wie weit laufen die drei Engines auseinander — und wie viel davon geht auf unsere Messung zurück?
Von 616 Domains zitierten alle drei Engines nur 14; genau eine Engine zitierte 504 Domains, also 81,8 %. Die paarweisen Jaccard-Koeffizienten liegen zwischen 0,065 und 0,164.
| Kennzahl | Wert |
|---|---|
| Beobachtungen (Frage × Engine) | 267 |
| Fragen im Satz | 39 |
| Zitat-Instanzen | 2006 |
| Eindeutige Domains | 616 |
| Von allen drei Engines zitiert | 14 |
| Von genau einer Engine zitiert | 504 (81,8 %) |
| Paarweiser Jaccard-Koeffizient | 0,065 bis 0,164 |
Im besten Paar beträgt der Jaccard-Koeffizient 0,164: Die Schnittmenge ist dort etwa ein Sechstel der Vereinigung beider Listen. Im schwächsten Paar sind es 0,065. Wer seine Sichtbarkeit in einer einzigen Engine prüft, hat also nicht „die KI“ geprüft, sondern eine von drei Listen, die einander kaum überlappen.
Ein Teil dieser Streuung stammt aus ungleicher Erfassung, nicht aus unterschiedlichen Vorstellungen von Autorität. Bevor die Zahl weiterverwendet wird, gehört diese Gegenprobe daneben: Gemini liefert in diesem Schnitt 350 eindeutige Hosts, Claude 232, ChatGPT 160. Eine breit zitierende und eine sparsam zitierende Engine müssen auseinanderlaufen, selbst wenn sie Quellen identisch bewerten würden.
| Engine | Beobachtungen | Fragen | Eindeutige Hosts | Hinweis zur Erfassung |
|---|---|---|---|---|
| Gemini (Google) | 90 | 39 | 350 | Breiteste Zitierung im Vergleich |
| ChatGPT (OpenAI) | 90 | 39 | 160 | 51 von 308 Zitat-Instanzen führen auf eine einzige Adresse, clutch.co, und stammen aus 7 Fragen |
| Claude (Anthropic) | 86 | 39 | 232 | 75 der 86 Beobachtungen manuell eingefügt, nicht über die Programmierschnittstelle; 443 Zitat-Instanzen |
Am deutlichsten ist die Konzentration bei ChatGPT: 51 seiner 308 Zitat-Instanzen im polnischsprachigen Schnitt führen auf clutch.co, und sie stammen aus lediglich 7 Fragen. Das ist kein breites Marktbild, sondern die enge Gewohnheit einer Engine.
Die Claude-Spalte hat ein eigenes Problem, und wir zeigen es lieber, als es zu verschweigen. In unserem eigenen Bericht vom 31. August (auf Polnisch veröffentlicht) haben wir als Regel des Hauses beschrieben, dass manuell eingefügte Claude-Antworten üblicherweise null URL-Zitate liefern. In diesem Datensatz trägt genau diese manuelle Spalte 232 Hosts und 443 Zitat-Instanzen. Daraus folgt: Die Erfassung von Zitaten im manuellen Modus ist zwischen den Erhebungssitzungen uneinheitlich — für die Vergleichbarkeit der Engines ist das schlechter als eine gleichmäßige Null.
Dieser Schnitt umfasst drei Engines, nicht vier: ChatGPT, Gemini und Claude. Weitere Antwortflächen sind darin nicht belastbar gemessen, und wir veröffentlichen für sie hier keine Zahl und keine Schlussfolgerung.
Die 81,8 % lesen wir deshalb als die wahre Zahl dieses Korpus, nicht als Beleg dafür, dass drei unabhängige Systeme unabhängig voneinander verschiedene Autoritäten gewählt hätten. Die Streuung ist real; ihre Ursachen sind mindestens zwei, und diese Messung trennt sie nur teilweise.
Was heißt ein polnischsprachiger Schnitt für ein Unternehmen im DACH-Raum?
Er zeigt, dass der Gültigkeitsbereich einer KI-Sichtbarkeitsmessung an der Sprachgrenze endet, nicht an der Landesgrenze. Der polnischsprachige Schnitt ist hier die Prüfbank, nicht das Thema: Er ist der Fall, in dem die Frage nicht auf Englisch gestellt wurde — genau die Bedingung, die eine rein englische Messung nie testet.
Im polnischsprachigen Schnitt führen 40,5 % der Zitate auf .pl-Domains und 36,2 % auf .com. Im englischsprachigen Schnitt derselben Datenbasis liegt .com bei 69,2 %. Die Sprache der Frage verschiebt also messbar, aus welchem Adressraum geantwortet wird.
Die naheliegende Übertragung auf den deutschen Markt ist eine Hypothese, keine Messung. Ob deutschsprachige Fragen entsprechend häufiger auf .de-Adressen führen, haben wir in diesem Schnitt nicht gemessen, und wir behaupten es hier nicht. Was der Schnitt belegt, ist die schwächere, aber teurere Aussage: Eine in einer Sprache erhobene Quellenliste ist nicht die Quellenliste der anderen Sprache.
Für den deutschsprachigen Raum haben wir dazu eine eigene, kleinere Messung veröffentlicht. In 48 deutschsprachigen Antwortzellen — dieselbe Panelgröße wie der oben genannte polnische Teilkorb, aber ein anderer Fragensatz und ein anderes Korpus — kehrten deutschsprachige Anbieterdomains wieder, darunter die GEO-Agentur von Suchhelden (Suchhelden GmbH, Osnabrück) und die AEO-Strategieseite der SearchGPT Agentur (track by track GmbH, Berlin); beide Angebotsseiten haben wir am 1. September 2026 erneut aufgerufen. In der Tabelle der meistgenannten Marken des polnischsprachigen Schnitts weiter unten steht keine von beiden.
Zwei Vorbehalte gehören unmittelbar dazu. Erstens zählen die beiden Auswertungen Unterschiedliches: Der deutschsprachige Quellencheck zählt gespeicherte kanonische URL-Einträge, dieser Schnitt zählt Zitat-Instanzen und Nennungen. Zweitens stammen sie aus verschiedenen Korpora und verschiedenen Fragensätzen. Zusammen belegen sie keine Rangfolge zwischen Ländern — sie belegen, dass beide Listen getrennt erhoben werden müssen.
Praktisch heißt das für ein mittelständisches Unternehmen: Eine Prüfung auf Englisch und in einer einzigen Engine beantwortet die eigene Frage nicht, egal wie sauber sie durchgeführt wurde. Wie sich eine solche Prüfung im deutschsprachigen Raum aufsetzen lässt, ohne personenbezogene Daten zu verarbeiten, beschreibt unser Leitfaden KI-Sichtbarkeit für den Mittelstand — ohne DSGVO-Risiko.
Tragen Verzeichnisse wie Clutch die Antwort in einem nicht-englischen Markt?
Im polnischsprachigen Schnitt entfallen 3,8 % der Zitate auf Verzeichnisse und Marktplätze — 77 von 2006. Daraus folgt nicht, dass ein Verzeichniseintrag wertlos wäre.
| Kübel | Anteil im polnischsprachigen Schnitt |
|---|---|
| .pl-Domains | 40,5 % |
| .com-Domains | 36,2 % |
| Verzeichnisse und Marktplätze (Klasse Clutch, G2, DesignRush) | 3,8 % — 77 von 2006 Zitaten |
| Domains von Unternehmen, welche die Engines ohnehin namentlich nennen | 59,9 % |
| Zum Vergleich: .com-Domains im englischsprachigen Schnitt | 69,2 % |
Die ersten beiden Zeilen beschreiben die Domain-Endung, die beiden folgenden den Seitentyp; dieselbe Domain kann daher in mehreren Kübeln stehen. Aus den 3,8 % folgt kein Urteil über den Handelswert eines Verzeichnisses: clutch.co ist in demselben Schnitt die dritthäufigste Domain nach absoluter Zitatzahl.
Hinter dieser Häufigkeit steht allerdings kein Marktkonsens, sondern eine einzelne Engine. Von 55 Clutch-Zitaten im polnischsprachigen Schnitt entfallen 51 auf ChatGPT, 3 auf Claude und 1 auf Gemini — verteilt auf ganze 7 Fragen. Ein Verzeichniseintrag zahlt in diesem Schnitt also vor allem auf eine der drei Antwortflächen ein.
Die Zeile mit den 59,9 % verlangt eine ehrliche Anmerkung. Sie besagt, dass 59,9 % der Zitate des polnischsprachigen Schnitts auf Domains von Unternehmen führen, welche die Engines ohnehin namentlich nennen — und sie ist teilweise per Konstruktion wahr, weil eine Domain genau deshalb in diesen Kübel fällt, weil die zugehörige Marke in der Antwort fiel. Wir ziehen daraus keinen Schluss über einen Vorrang von Anbieterseiten gegenüber Verzeichnissen.
Welche Marken nannten die Engines am häufigsten — und warum ist das keine Rangliste?
An der Spitze steht ein exakter Gleichstand: Agencja Whites und Delante mit je 77 Nennungen. Die Reihenfolge der Tabelle ist alphabetisch und ausdrücklich keine Wertung.
| Marke | Nennungen | Was es ist |
|---|---|---|
| Agencja Whites | 77, in 25 Fragen | Agentur aus Warschau; führt eine eigene GEO-Leistung sowie eine „AI-Ready“-Strategie |
| Delante | 77, in 26 Fragen | Agentur aus Krakau; AISO-Leistung, KI-Audit und Monitoring der Sichtbarkeit in KI-Antworten |
| Widoczni | 63 | Agentur aus Posen; Positionierung in KI-Modellen wie ChatGPT und Gemini |
| EACTIVE | 42 | Agentur aus Breslau; GEO als Teil des Angebots „Omni SEO“ |
| Otterly.AI | 30 | SaaS-Werkzeug zur Überwachung der Markensichtbarkeit in KI-Suche, keine Agentur |
| Sembility | 29 | Agentur aus Posen; Leistung „Pozycjonowanie AI“ für Sichtbarkeit in KI-Assistenten |
| Webappski | 21 von 267 Beobachtungen | Wir — Herausgeber dieser Messung und Anbieter von AEO-Dienstleistungen |
Zwei Anmerkungen gehören zu dieser Tabelle. Erstens entstanden die 77 Nennungen von Agencja Whites aus der Zusammenführung zweier Schreibweisen derselben Marke — „Agencja Whites“ (42) und „Whites“ (35); bei Delante gab es in diesem Korpus keine abweichende Schreibweise, dort war nichts zusammenzuführen. Zweitens ist das keine Rangliste nach Qualität, Umsatz oder Marktanteil, sondern die Häufigkeit, mit der die Engines eine Marke in unseren 39 polnischsprachigen Fragen genannt haben. Eine Anbieterübersicht für den deutschsprachigen Markt steht im DACH-Vergleich, nicht hier.
Welche Fehler steckten in den Daten, bevor wir sie veröffentlicht haben?
Drei: 32,3 % Duplikate, auseinanderlaufende Schreibweisen und ein Normalisierungsschritt, der 15 russische Marken zu einer einzigen zusammenzog. Alle drei sind im Code behoben. Wir zeigen sie, weil jeder von ihnen ein Ergebnis umdrehen kann.
Duplikate. Das Suchmuster für die Ergebnisdateien übersah ein Verzeichnis mit Antworten, und byte-identische Kopien derselben Läufe lagen zusätzlich in einer Sicherungskopie, in einem parallelen Arbeitsverzeichnis und in einem Basisordner desselben Tages. Die Folge war nicht kosmetisch: In den Rohdaten stand Agencja Whites über Delante, nach der Deduplizierung stehen beide gleichauf.
Schreibweisen. „Agencja Whites“ und „Whites“, „Widoczni“, „widoczni“ und „Widoczni.com“, „EACTIVE“ und „Eactive“, „Otterly.AI“ und „Otterly“ — zusammengeführt über eine offengelegte Alias-Tabelle, nicht über Raten. Paare vom Typ Hersteller und Produkt, etwa Semrush und Semrush AI Visibility Toolkit, haben wir bewusst nicht zusammengeführt; solche Fälle bleiben als eigene Liste naher Kollisionen im Ergebnis stehen.
Normalisierung der Namen. Der schwerste Fehler der drei: Die erste Fassung entfernte alle Zeichen außerhalb des ASCII-Bereichs, sodass jeder kyrillisch geschriebene Name in einen leeren Schlüssel fiel. Auf diese Weise verschmolzen 15 nicht zusammengehörige russische Agenturen zu einem einzigen „Marktführer“ mit 49 Nennungen. Aufgefallen ist das erst beim Lauf über den russischsprachigen Schnitt; behoben wurde es mit einer Normalisierung über die Zeichenklassen \p{L}\p{N} und einem Regressionstest.
Wir schreiben das nicht aus Bescheidenheit auf, sondern weil es die häufigsten Fallen jeder Auswertung sind, die Nennungen nach Markennamen zählt. Wenn jemand eine Rangliste der KI-Sichtbarkeit ohne Deduplizierung und ohne offengelegte Schreibweisen-Tabelle zeigt, kann sein erster Platz ein Artefakt der Auswertung sein und kein Ergebnis.
Wie wurde gemessen — und was steckt nicht drin?
Aus 30 eigenen Messläufen blieben 864 Beobachtungen; 267 davon bilden den polnischsprachigen Schnitt. Die Daten stammen aus Messungen zwischen dem 19. April und dem 31. August 2026 und sind keine repräsentative Stichprobe eines Marktes.
Der Weg von den Rohdaten zu diesen 864 Beobachtungen sieht so aus: 56 gefundene Ergebnisdateien, 1290 rohe Beobachtungen, 417 davon als Duplikate verworfen (32,3 %) und 9 fehlerhaft oder ohne entschiedene Nennung. Der Duplikatanteil ist hoch, und er ist oben als eigener Punkt beschrieben.
Elf Kundenläufe mit 225 Beobachtungen haben wir vollständig ausgeschlossen, bevor überhaupt aggregiert wurde. Kundendaten veröffentlichen wir in keiner Form, auch nicht aggregiert.
Die Regel des Schnitts liegt offen: Eine Beobachtung zählt dazu, wenn die Sprache der Frage Polnisch ist oder der Zielmarkt Polen. Auf die Sprache allein entfallen 154 Beobachtungen, auf den Markt allein 27, auf beides zugleich 86 — zusammen 267, also 30,9 % des gesamten Datensatzes.
Der Schnitt wurde am 1. September 2026 gezogen. Zwei Stunden später umfasste der Datensatz bereits 57 Dateien und 870 Beobachtungen, weil parallel ein weiterer eigener Lauf fertig wurde. Der polnischsprachige Schnitt verschob sich dabei um keine einzige Position, weil dieser Lauf keine polnischsprachigen Zeilen enthält.
Zwei Einschränkungen gehören zu jeder Zahl oben. Die Claude-Spalte entstand über den Import manuell eingefügter Antworten (75 von 86 Beobachtungen) und damit über ein anderes Werkzeug als eine Abfrage über die Programmierschnittstelle. Und der Datensatz hat bewusst keine Zeitachse: Über die Monate änderten sich sowohl das Werkzeug (14 verschiedene Kombinationen aus Anbieter und Modell) als auch der Fragensatz. Jede Aussage der Form „gestiegen“ oder „gefallen“ wäre aus diesen Daten unzulässig.
Die Rohdatei dieses Datensatzes veröffentlichen und verlinken wir nicht. Sie enthält Verwaltungsblöcke mit Domains von Kunden sowie lokale Dateipfade, während die Aggregate in diesem Beitrag keinerlei Kundendaten tragen. Sollten wir die Daten je öffentlich bereitstellen, wird das ein eigener, bereinigter Export sein und nicht diese Datei.
Wie prüfen Sie das selbst nach?
Drei Dinge genügen: ein eingefrorener Fragensatz, in jeder Runde dieselben Engines und getrennt gezählte Hosts je Engine. Statt auf Referenzen zu verweisen, geben wir die Befehle an, mit denen Sie uns nachrechnen können.
- Konfiguration mit dem offenen Werkzeug anlegen:
npx aeo-platform initschreibt eine Datei.aeo-tracker.jsonmit Marke, Domain, Engine-Liste und Fragen. - Fragensatz einfrieren, bevor gemessen wird. Ein zwischen zwei Runden geänderter Fragensatz zerstört den Nenner — das ist der häufigste Grund, warum fremde „Sichtbarkeitszuwächse“ nicht vergleichbar sind.
- Messung starten:
npx aeo-platform runfragt die Engines mit Ihren eigenen Zugangsschlüsseln ab und speichert die vollständigen Antworten samt Zusammenfassung. - Engines ohne bequeme Schnittstelle getrennt behandeln:
aeo-platform run-manualimportiert manuell eingefügte Antworten. Vermerken Sie am Ergebnis, dass diese Spalte manuell entstanden ist — sonst vergleichen Sie zwei Erhebungsmethoden als eine. - Für jede Engine eine eigene Menge eindeutiger Hosts bilden. Die Schnittmenge aller drei Mengen und die Zahl der nur von einer Engine gesehenen Domains ergeben das Streuungsmaß; je Paar berechnen Sie den Jaccard-Koeffizienten als Schnittmenge geteilt durch Vereinigungsmenge.
- Vor jeder Auswertung nach Dateiinhalt deduplizieren und Schreibweisen über eine Normalisierung vereinheitlichen, die Umlaute, polnische Zeichen und nicht-lateinische Buchstaben nicht entfernt.
Diese Schritte sind unsere Antwort auf die Frage, warum man uns glauben sollte: Nachprüfbarkeit statt Referenzen. Wir nennen Fragensatz, Engines, Zeitraum und Befehle, damit jede Leserin und jeder Leser die Messung auf der eigenen Marke wiederholen und mit unserem Ergebnis vergleichen kann.
Was prüfen wir in Ausgabe 2?
Wir prüfen, ob diese Seite selbst zu einer zitierten Quelle wird — nicht, ob sich unsere Sichtbarkeit allgemein verändert hat. Die Hypothese schreiben wir vor der Messung auf, damit sie sich hinterher nicht an das Ergebnis anpassen lässt.
Wenn dieser Beitrag live und indexierbar ist und ein Alter von 21 bis 28 Tagen erreicht hat, stellen wir sechs feste deutschsprachige Fragen in denselben drei Engines — zusammen 18 Antwortzellen:
- Zitieren ChatGPT, Gemini und Claude dieselben Quellen?
- Wie viele Quellen haben KI-Engines innerhalb einer Sprache gemeinsam?
- Reicht eine Prüfung der KI-Sichtbarkeit in einer einzigen Engine?
- Wie misst man die Streuung der Quellen zwischen KI-Engines?
- Zitieren KI-Engines bei deutschsprachigen Fragen eher lokale Domains?
- Spielen Verzeichnisse wie Clutch in KI-Antworten außerhalb des englischsprachigen Raums eine Rolle?
Die vorab festgelegte Hypothese lautet: Die Adresse dieses Beitrags erscheint in mindestens 2 der 18 Zellen und bei mindestens zwei Engines. Widerlegt ist sie, wenn sie in null oder einer Zelle auftaucht oder nur bei einer einzigen Engine. Das Ergebnis veröffentlichen wir unabhängig davon, in welche Richtung es ausfällt.
Häufig gestellte Fragen
Sechs Fragen, die zu dieser Art von Messung regelmäßig zurückkommen.
Reicht es, die KI-Sichtbarkeit in einer einzigen Engine zu prüfen?
In diesem Korpus nicht: Von 616 Domains zitierten alle drei Engines nur 14, und 504 Domains sah genau eine Engine. Eine Prüfung in einer Engine beschreibt damit eine von drei weitgehend getrennten Quellenlisten, nicht „die KI-Sichtbarkeit“.
Sind 14 gemeinsame Domains von 616 viel oder wenig?
In diesem Schnitt sehr wenig; die paarweisen Jaccard-Koeffizienten von 0,065 bis 0,164 sagen dasselbe in anderer Form. Ob sich dieses Verhältnis auf einem anderen Fragensatz hält, wissen wir nicht — es ist ein datierter Schnitt, kein allgemeines Gesetz.
Warum umfasst diese Ausgabe drei Engines und nicht vier?
Weil nur ChatGPT, Gemini und Claude in diesem Schnitt mit tragfähiger Fallzahl vorliegen: 90, 90 und 86 Beobachtungen über jeweils dieselben 39 Fragen. Für weitere Antwortflächen veröffentlichen wir aus diesem Datensatz bewusst keine Zahl.
Lassen sich polnische Ergebnisse auf den deutschsprachigen Markt übertragen?
Die Zahlen nicht, der Befund schon. Die Anteile — 40,5 % .pl gegenüber 36,2 % .com — gelten für den polnischsprachigen Schnitt, nicht für Deutschland, Österreich oder die Schweiz. Übertragbar ist die Aussage darüber, was eine Messung leistet: Sprache und Engine bestimmen ihren Gültigkeitsbereich, deshalb muss der deutschsprachige Fall getrennt gemessen werden.
Veröffentlichen Sie die Rohdaten dieser Auswertung?
Nein. Die Datei enthält Verwaltungsblöcke mit Kundendomains und lokale Pfade, deshalb geben wir sie weder heraus noch verlinken wir sie. Veröffentlicht sind stattdessen die vollständige Regel des Schnitts, die Zahlen nach jeder Filterstufe und die Befehle, mit denen sich die Messung nachbauen lässt.
Wie geht Webappski mit dem eigenen Interessenkonflikt um?
Wir geben uns nicht als neutraler Herausgeber aus: Wir verkaufen AEO-Dienstleistungen und stehen damit in derselben Nische wie die genannten Agenturen. Deshalb steht unser eigenes Ergebnis im ersten Absatz und in derselben Tabelle wie alle anderen Marken — 21 von 267 Beobachtungen — und wird durch keine Korrektur angehoben.
Was folgt daraus für Ihre nächste Messung?
Prüfen Sie in mindestens drei Engines, in der Sprache Ihrer Kunden und mit einem eingefrorenen Fragensatz. Alles andere liefert eine Zahl, deren Gültigkeitsbereich kleiner ist als die Frage, die Sie eigentlich stellen.
Praktisch sind das drei Entscheidungen. Fragen Sie auf Deutsch, weil die Sprache der Frage nachweislich verschiebt, aus welchem Adressraum geantwortet wird. Stützen Sie kein Urteil auf eine einzelne Engine, weil deren Quellenliste sich mit den anderen kaum überschneidet. Und halten Sie den Fragensatz konstant, damit die zweite Messung mit der ersten überhaupt vergleichbar ist.
Wenn Sie diese Art von Zahl für Ihre eigene Marke sehen möchten statt für unsere, können Sie ein kostenloses AEO-Audit von Webappski anfordern — gemessen an Ihren Fragen, aufgeschlüsselt nach Engine und mit der Liste der Quellen, aus denen geantwortet wurde. Welche Arbeit daraus folgt, beschreibt die Seite zu unseren AEO-Leistungen.
Methodik: Die Daten stammen aus 30 eigenen Messläufen von Webappski zwischen dem 19. April und dem 31. August 2026, gezogen am 1. September 2026. Nach dem Verwerfen von 417 Duplikaten und 9 fehlerhaften Datensätzen blieben 864 Beobachtungen, davon bilden 267 den polnischsprachigen Schnitt: 39 Fragen, 2006 Zitat-Instanzen, 616 eindeutige Domains. Der Schnitt umfasst drei Engines — ChatGPT, Gemini und Claude — wobei 75 der 86 Claude-Beobachtungen über den Import manuell eingefügter Antworten entstanden. Elf Kundenläufe mit 225 Beobachtungen wurden vollständig ausgeschlossen. Es handelt sich um einen datierten Schnitt, nicht um eine repräsentative Stichprobe und nicht um eine Qualitätsrangliste.


