Czy ChatGPT, Gemini i Claude cytują te same źródła po polsku? 14 domen z 616

Wydanie nr 1 comiesięcznego cyklu badawczego Webappski: 267 polskich obserwacji z własnych pomiarów, 2006 instancji cytowań i 616 domen — z pokazaną wprost częścią rozbieżności, która wynika z nierównej hojności silników, a nie z różnicy zdań o autorytecie. Datowany wycinek trzech silników, nie ranking agencji.

Czy ChatGPT, Gemini i Claude cytują te same źródła po polsku? 14 domen z 616

W 267 polskich odpowiedziach AI zmierzonych przez Webappski trzy silniki zacytowały 616 domen, a wspólnych dla całej trójki było 14. Dokładnie jeden silnik zacytował 504 domeny, czyli 81,8%. Badanie sfinansowało i przeprowadziło Webappski, które samo sprzedaje usługi AEO: nasza marka ma w tym wycinku 21 wzmianek z 267 obserwacji.

To wydanie nr 1 naszego comiesięcznego cyklu badawczego: raz w miesiącu publikujemy liczby policzone na własnych, wcześniej zebranych pomiarach — razem z tym, czego nie dowodzą. Pytanie o rozbieżność źródeł postawiliśmy sobie zresztą sami: nasza angielska analiza 168 odpowiedzi w czterech językach kończy się zapowiedzią kolejnego pomiaru sformułowaną dosłownie tak: „Do AI answer engines cite different sources in English, Polish, German and Russian?”. Tamten materiał liczył wzmianki i objętość cytowań, ale nie policzył ani jednej miary pokrycia. Ten liczy właśnie pokrycie — na korpusie około 5,5 raza większym niż polski wycinek poprzednika: 267 obserwacji wobec 48 komórek.

Dwa wcześniejsze polskie materiały zajmują sąsiednie ujęcia i tym wpisem ich nie zastępujemy. Jakie źródła AI cytuje po polsku opisuje, które domeny wracały w 48 komórkach, a Agencje AEO w Polsce pokazuje 12-odpowiedziowy wycinek z nazwami agencji. Nowa jest tutaj jedna rzecz: policzona miara rozbieżności między silnikami wewnątrz jednego języka.


Co dokładnie mierzy rozbieżność źródeł między silnikami AI?

Rozbieżność źródeł to udział domen, które w tym samym koszyku pytań cytuje tylko jeden silnik, a nie cała trójka. Nie jest to ocena jakości źródeł ani wskazanie, który silnik ma rację — to opis tego, jak bardzo trzy listy adresów się rozjeżdżają.

Obserwacja to jedna komórka pomiaru: jedno pytanie zadane jednemu silnikowi w jednym przebiegu. Polski wycinek ma ich 267 przy 39 pytaniach.

Instancja cytowania to pojedyncze wystąpienie adresu w treści odpowiedzi. Jedna odpowiedź potrafi nieść kilkanaście cytowań, dlatego 267 obserwacji dało 2006 instancji.

Unikalny host to domena policzona raz, niezależnie od tego, ile razy wystąpiła. Takich domen jest w polskim wycinku 616.

Współczynnik Jaccarda dla dwóch silników to liczba domen wspólnych podzielona przez liczbę domen występujących u któregokolwiek z nich. Zero oznacza brak części wspólnej, jeden — identyczne listy.

Wzmianka to co innego niż cytowanie. Silnik może wymienić markę z nazwy, nie podając żadnego adresu, i odwrotnie — zacytować domenę bez nazwania firmy. W tym materiale liczymy oba te zdarzenia osobno.


Ile źródeł mają wspólnych ChatGPT, Gemini i Claude po polsku?

Na 616 domen polskiego wycinka wszystkie trzy silniki zacytowały tylko 14, a 504 domeny zacytował dokładnie jeden. To 81,8% wszystkich hostów, jakie w tym pomiarze w ogóle się pojawiły.

Polski wycinek pomiarów Webappski, stan na 1 września 2026.
MiaraWartość
Obserwacje (pytanie × silnik)267
Pytania w koszyku39
Instancje cytowań2006
Unikalne domeny616
Domeny cytowane przez wszystkie trzy silniki14
Domeny cytowane przez dokładnie jeden silnik504 (81,8%)
Parowy współczynnik Jaccardaod 0,065 do 0,164

Najwyższa para osiąga 0,164 — część wspólna to w niej mniej więcej jedna szósta sumy obu list; najniższa 0,065. Dla firmy, która sprawdza swoją widoczność tylko w jednym silniku, wniosek jest prosty: sprawdziła jedną z trzech w dużej mierze rozłącznych list źródeł.


Czy to naprawdę różnica zdań o autorytecie? Nie w całości

Część rozbieżności bierze się nie z różnicy zdań o autorytecie, lecz z nierównej hojności: Gemini dał 350 hostów, Claude 232, ChatGPT 160. Silnik cytujący szeroko i silnik cytujący wąsko muszą się rozjechać nawet wtedy, gdy oceniają źródła identycznie.

Pokrycie silników w polskim wycinku; unikalne hosty liczone osobno dla każdego silnika.
SilnikObserwacjePytaniaUnikalne hostyUwaga o sposobie zbierania
Gemini (Google)9039350Około 14 cytowań na odpowiedź (3,9 unikalnego hosta) — najszersze cytowanie w zestawieniu
ChatGPT (OpenAI)903916051 z 308 instancji cytowań prowadzi na jeden adres, clutch.co, i pochodzi z 7 pytań
Claude (Anthropic)863923275 z 86 obserwacji wklejonych ręcznie, nie przez API; 443 instancje cytowań

Ten wycinek obejmuje trzy silniki, nie cztery: ChatGPT, Gemini i Claude. Perplexity nie jest w nim mierzone i nie podajemy dla niego żadnej liczby ani wniosku.

Skupienie ChatGPT jest tu najbardziej wymowne: 51 z 308 jego instancji cytowań w polskim wycinku prowadzi na jeden adres — clutch.co — i pochodzi z zaledwie 7 pytań. To nie jest szeroki obraz rynku, tylko wąski nawyk jednego silnika.

Kolumna Claude ma osobny problem i wolimy go pokazać, niż przemilczeć. W naszym własnym raporcie z 31 sierpnia opisaliśmy jako regułę domu, że ręczne wklejenie odpowiedzi Claude zwykle daje zero cytowań URL. W tym zbiorze ta sama ręczna kolumna niesie 232 hosty i 443 instancje cytowań. Znaczy to jedno: przechwytywanie cytowań w trybie ręcznym jest niespójne między sesjami zbierania, a dla porównywalności silników to gorsze niż równe zero.

Dlatego 81,8% czytamy jako prawdziwą liczbę tego korpusu, a nie jako dowód, że trzy niezależne systemy niezależnie wybrały różne autorytety. Rozbieżność jest realna; jej przyczyny są co najmniej dwie, a ten pomiar rozdziela je tylko częściowo.


Z jakich domen odpowiadają silniki, gdy pytanie jest po polsku?

W polskim wycinku 40,5% cytowań prowadzi na domeny .pl, a 36,2% na .com; w wycinku angielskim .com ma 69,2%. Polskojęzyczne pytanie realnie przesuwa punkt ciężkości źródeł na adresy lokalne.

To nie jest nowość na naszym blogu, tylko praktyczne następstwo tego, co pokazała już analiza 48 polskich odpowiedzi. Nowe jest to, że ten sam wniosek stoi teraz na 2006 instancjach cytowań z 267 obserwacji, a nie na 48 komórkach.

Rozkład 2006 instancji cytowań w polskim wycinku. Kubełki liczone są na dwóch różnych osiach, więc nie sumują się do 100%.
KubełekUdział w polskim wycinku
Domeny .pl40,5%
Domeny .com36,2%
Katalogi i marketplace'y (klasa Clutch, G2, DesignRush)3,8% — 77 z 2006 cytowań
Domeny firm, które silniki i tak wymieniają z nazwy59,9%
Dla porównania: domeny .com w wycinku angielskim69,2%

Pierwsze dwa wiersze opisują końcówkę domeny, dwa kolejne — typ strony, więc ta sama domena może trafić do kilku kubełków. Z 3,8% nie wynika, że obecność w katalogach jest bez wartości: clutch.co jest w tym samym wycinku trzecią domeną pod względem bezwzględnej liczby cytowań, a 3,8% cytowań to nie 3,8% wartości handlowej.

Wiersz o 59,9% wymaga jednej uczciwej uwagi. Ta liczba mówi, że 59,9% cytowań polskiego wycinka prowadzi na domeny firm, które silniki i tak wymieniają z nazwy — i jest częściowo prawdziwa z definicji, bo domena trafia do tego kubełka właśnie dlatego, że jej marka padła w odpowiedzi. Nie wyciągamy z niej żadnego wniosku o przewadze stron firmowych nad katalogami.


Które marki wracały najczęściej w polskich odpowiedziach?

Najwięcej wzmianek — po 77 — mają Agencja Whites i Delante, i jest to dokładny remis, a nie pierwsze i drugie miejsce. Kolejność w tabeli poniżej jest alfabetyczna i nie jest rankingiem.

Marki najczęściej wymieniane w 267 polskich obserwacjach. Kolejność alfabetyczna; opisy firm sprawdzone na ich własnych stronach 1 września 2026.
MarkaWzmiankiCzym jest
Agencja Whites77, w 25 pytaniachAgencja z Warszawy; ma osobno nazwaną usługę Generative Engine Optimization oraz „Strategię AI-Ready”
Delante77, w 26 pytaniachAgencja z Krakowa; usługa AISO, audyt AI i monitoring widoczności w AI
Widoczni63Agencja z Poznania; „SEO w modelach AI (GEO)” oraz audyt widoczności marki w AI
EACTIVE42Agencja z Wrocławia; GEO w ramach oferty „Omni SEO”
Otterly.AI30Narzędzie SaaS do monitoringu widoczności w AI, nie agencja
Sembility29Agencja z Poznania; usługa „Pozycjonowanie AI” w ChatGPT i Gemini
Webappski21 z 267 obserwacjiMy — wydawca tego pomiaru, sprzedający usługi AEO

Do tej tabeli należą się dwie uwagi. Po pierwsze, 77 wzmianek Agencji Whites powstało ze scalenia dwóch zapisów tej samej marki — „Agencja Whites” (42) i „Whites” (35); Delante nie miało w tym korpusie żadnego wariantu zapisu, więc u niego nie było czego scalać. Po drugie, to nie jest ranking jakości ani udziału w rynku, tylko częstotliwość, z jaką silniki wymieniały markę w naszych 39 polskich pytaniach — szersze ujęcie samych agencji opisuje osobny wpis o agencjach AEO w Polsce.


Jak zbudowaliśmy ten wycinek?

Z 30 własnych przebiegów pomiarowych zostało 864 obserwacji, a polski wycinek to 267 z nich. Dane pochodzą z pomiarów prowadzonych od 19 kwietnia do 31 sierpnia 2026 i nie są próbą reprezentatywną polskiego rynku.

Ścieżka od surowych danych do tych 864 obserwacji wygląda tak: 56 znalezionych plików podsumowań, 1290 surowych obserwacji, 417 odrzuconych jako duplikaty (32,3%) i 9 błędnych lub bez rozstrzygniętej wzmianki. Odsetek duplikatów jest wysoki i opisujemy go niżej osobno.

Jedenaście przebiegów klienckich — 225 obserwacji — wyłączyliśmy w całości przed jakąkolwiek agregacją. Danych klientów nie publikujemy w żadnej formie, także zagregowanej.

Reguła polskiego wycinka jest jawna: obserwacja wchodzi, jeśli językiem pytania jest polski albo rynkiem docelowym jest Polska. Samego języka dotyczy 154 obserwacji, samego rynku 27, obu naraz 86 — razem 267, czyli 30,9% całego zbioru.

Cięcie zrobiliśmy 1 września 2026. Dwie godziny później zbiór miał już 57 plików i 870 obserwacji, bo równolegle zakończył się kolejny nasz przebieg — polski wycinek nie przesunął się przy tym ani o jedną pozycję, ponieważ nowy przebieg nie niósł polskich wierszy.

Dwa ograniczenia trzeba trzymać w głowie przy każdej liczbie powyżej. Kolumna Claude powstała w trybie importu ręcznie wklejonych odpowiedzi (75 z 86 obserwacji), a to inne narzędzie niż odpytanie API. W zbiorze nie ma też osi czasu, i to świadomie: przez te miesiące zmieniało się zarówno narzędzie (14 różnych par dostawca–model), jak i siatka pytań, więc żadne zdanie typu „wzrosło” albo „spadło” nie jest z tych danych uprawnione.


Jakie błędy znaleźliśmy w danych, zanim je opublikowaliśmy?

Trzy: 32,3% duplikatów, rozjechane warianty zapisu nazw i fold, który skleił 15 rosyjskich marek w jedną. Wszystkie są naprawione w kodzie, ale pokazujemy je, bo każdy z nich potrafi odwrócić wniosek.

Duplikaty. Wzorzec wyszukiwania plików pomijał jeden z katalogów z odpowiedziami, a bajtowo identyczne kopie tych samych przebiegów leżały w kopii zapasowej, w równoległym katalogu roboczym i w folderze bazowym z tego samego dnia. Efekt nie był kosmetyczny: w surowych danych Agencja Whites stała ponad Delante, a po deduplikacji obie marki mają remis.

Warianty zapisu. „Agencja Whites” i „Whites”, „Widoczni”, „widoczni” i „Widoczni.com”, „EACTIVE” i „Eactive”, „Otterly.AI” i „Otterly” — scaliliśmy je jawną tabelą aliasów, a nie zgadywaniem. Par typu producent–produkt (na przykład Semrush i Semrush AI Visibility Toolkit) świadomie nie scalaliśmy; zostają one w wyniku jako osobna lista bliskich kolizji.

Fold nazw. Najgorszy błąd z trójki: pierwsza wersja normalizacji usuwała wszystkie znaki spoza ASCII, więc każda nazwa zapisana cyrylicą zapadła się w jeden pusty klucz. W efekcie 15 niepowiązanych rosyjskich agencji zlało się w jednego „lidera” z 49 wzmiankami. Wyłapaliśmy to dopiero na przebiegu rosyjskiego wycinka i naprawiliśmy foldem opartym na klasach znaków \p{L}\p{N} oraz testem regresyjnym.

Piszemy o tym nie z pokory, tylko dlatego, że to najczęstsze pułapki każdego, kto liczy wzmianki po nazwie marki. Jeśli ktoś pokazuje ranking widoczności w AI bez deduplikacji i bez tabeli wariantów zapisu, jego pierwsze miejsce może być artefaktem, a nie wynikiem.


Czego ten pomiar nie dowodzi?

Nie dowodzi, który silnik ma rację, ani jak wyglądałby wynik na innym koszyku pytań. Poniżej pełna lista granic, postawiona świadomie przed sekcją z zastosowaniem praktycznym.

  • Nie jest to próba reprezentatywna polskiego rynku ani ranking jakości agencji.
  • Nie mówi nic o zmianie w czasie — w zbiorze nie ma osi czasu, a narzędzie i siatka pytań zmieniały się w trakcie.
  • Nie dowodzi, że silniki niezależnie sięgnęły po różne autorytety: część rozbieżności to nierówna hojność w cytowaniu.
  • Nie dowodzi, że obecność w katalogach jest bezwartościowa — 3,8% cytowań to nie 3,8% wartości handlowej.
  • Nie mówi, że najczęściej wymieniana marka jest najlepsza: mierzymy częstotliwość, nie skuteczność.
  • Nie przenosi się automatycznie na inny język — to wycinek polski, a angielski zachowuje się inaczej już na poziomie końcówek domen.

Surowego pliku z tym zbiorem nie publikujemy i nie linkujemy. Zawiera bloki służbowe z nazwami domen klientów oraz lokalne ścieżki, podczas gdy agregaty w tym wpisie nie niosą żadnych danych klienckich. Gdybyśmy kiedyś udostępnili dane publicznie, będzie to osobny, wyczyszczony eksport, a nie ten plik.


Jak samodzielnie powtórzyć taki pomiar?

Potrzebne są trzy rzeczy: zamrożona lista pytań, te same silniki w każdej rundzie i liczenie hostów osobno dla każdego silnika. Zamiast powoływać się na tytuły, wolimy podać komendy, którymi da się nas sprawdzić.

  1. Utwórz konfigurację otwartym narzędziem: npx aeo-platform init zapisuje plik .aeo-tracker.json z marką, domeną, listą silników i pytaniami.
  2. Zamroź koszyk pytań, zanim zaczniesz mierzyć. Zmiana pytań między rundami niszczy mianownik i to jest najczęstszy powód, dla którego cudze „wzrosty widoczności” są nieporównywalne.
  3. Uruchom pomiar: npx aeo-platform run odpytuje silniki Twoimi kluczami API i zapisuje pełne odpowiedzi razem z podsumowaniem.
  4. Silniki bez wygodnego API obsłuż osobno: aeo-platform run-manual importuje ręcznie wklejone odpowiedzi. Zapisz przy wyniku, że ta kolumna powstała ręcznie — inaczej porównasz dwie różne metody zbierania jako jedną.
  5. Policz dla każdego silnika osobny zbiór unikalnych hostów. Część wspólna wszystkich trzech zbiorów oraz liczba domen widzianych przez dokładnie jeden silnik dają miarę rozbieżności; dla pary policz Jaccarda jako część wspólną podzieloną przez sumę zbiorów.
  6. Zanim policzysz cokolwiek, zdeduplikuj dane po zawartości plików i ujednolić warianty nazwy marki foldem, który nie usuwa polskich znaków ani liter spoza alfabetu łacińskiego.

Ten zestaw kroków jest naszą odpowiedzią na pytanie „dlaczego mamy wam wierzyć”. Nie prosimy o zaufanie do autora — podajemy koszyk pytań, silniki, daty i komendy, żeby dowolna osoba mogła powtórzyć pomiar na własnej marce i sprawdzić, czy wychodzi podobnie.


Co sprawdzimy w wydaniu nr 2?

Sprawdzimy, czy ta strona sama stanie się cytowanym źródłem, a nie czy zmieniła naszą widoczność w ogóle. Hipotezę zapisujemy przed pomiarem, żeby nie dało się jej później dopasować do wyniku.

Kiedy ten wpis będzie żywy, zaindeksowany i będzie miał od 21 do 28 dni, zadamy sześć stałych pytań w tych samych trzech silnikach — łącznie 18 komórek:

  • Czy ChatGPT, Gemini i Claude cytują te same źródła po polsku?
  • Ile źródeł mają wspólnych silniki AI w jednym języku?
  • Jakie domeny cytują silniki AI przy polskich pytaniach o widoczność marki?
  • Czy silniki AI po polsku cytują częściej domeny .pl czy .com?
  • Jak zmierzyć rozbieżność źródeł między ChatGPT, Gemini i Claude?
  • Czy katalogi typu Clutch mają znaczenie w polskich odpowiedziach AI?

Hipoteza postawiona z góry: adres tego wpisu pojawi się w co najmniej 2 z 18 komórek i u co najmniej dwóch silników. Będzie obalona, jeśli wystąpi w zerze albo w jednej komórce, albo tylko u jednego silnika. Wynik opublikujemy niezależnie od tego, w którą stronę wyjdzie.


Najczęściej zadawane pytania

Poniżej sześć pytań, które najczęściej wracają przy tej metodzie pomiaru.

Czy 14 wspólnych domen na 616 to dużo czy mało?

W tym korpusie to bardzo mało: 14 domen jest wspólnych dla wszystkich trzech silników, a 504 domeny zacytował dokładnie jeden. Nie wiemy jednak, czy ta proporcja utrzyma się na innym koszyku pytań — to jeden datowany wycinek, nie prawo ogólne.

Czy ten pomiar wskazuje, który silnik jest lepszy?

Nie. Pokazuje różnicę w tym, co silniki cytują, a nie w tym, co jest prawdą. Gemini cytuje najszerzej (350 hostów), ChatGPT najwęziej (160), ale szerokość cytowania nie jest miarą jakości odpowiedzi.

Dlaczego kolumna Claude powstała ręcznie i co to zmienia?

Ten silnik zbieraliśmy trybem importu wklejonych odpowiedzi, bo nie odpytujemy go API-em w tym zestawieniu — dotyczy to 75 z 86 obserwacji. Zmienia to porównywalność: nasz wcześniejszy raport opisywał ręczne wklejenie jako dające zwykle zero cytowań URL, a tutaj ta sama kolumna niesie 232 hosty i 443 cytowania.

Czy warto płacić za obecność w katalogach takich jak Clutch?

Z tego pomiaru nie wynika ani „tak”, ani „nie”. Cały kubełek katalogów to 3,8% cytowań (77 z 2006), ale clutch.co jest w tym samym wycinku trzecią domeną pod względem bezwzględnej liczby cytowań — przy czym 51 z jego 55 wystąpień pochodzi od jednego silnika i z 7 pytań.

Czy publikujecie surowe dane tego badania?

Nie. Plik z danymi zawiera bloki służbowe z domenami klientów i lokalne ścieżki, więc go nie udostępniamy ani nie linkujemy. Publikujemy natomiast pełną regułę wycinka, liczby po każdym etapie odsiewu i komendy, którymi da się powtórzyć pomiar u siebie.

Jak Webappski radzi sobie z własnym konfliktem interesów?

Nie udajemy neutralnego wydawcy: sprzedajemy usługi AEO i jesteśmy w tej samej niszy co wymienione agencje. Dlatego własny wynik podajemy w pierwszym akapicie i w tej samej tabeli co pozostałe marki — 21 z 267 obserwacji — i nie podnosimy go żadną korektą.


Co z tego wynika dla polskiej firmy?

Jeden silnik to jedna próbka: mierząc widoczność w AI po polsku, trzeba pytać co najmniej trzy i liczyć źródła osobno dla każdego. Wynik z jednego czatu opisuje jedną z trzech w dużej mierze rozłącznych list źródeł, a nie „widoczność w AI” jako taką.

Praktycznie oznacza to trzy decyzje: pytaj po polsku, bo końcówki domen w źródłach realnie się wtedy przesuwają; nie opieraj wniosku na jednym silniku; i trzymaj stały koszyk pytań, żeby drugi pomiar dawało się porównać z pierwszym.

Jeśli chcesz zobaczyć ten sam rodzaj liczby dla własnej marki, a nie dla naszej, możesz zamówić darmowy audyt AEO Webappski — pomiar na Twoich pytaniach, z rozbiciem na silniki i z listą źródeł, z których odpowiadały. Zakres naszej pracy opisuje strona usług AEO.

Metodyka: dane pochodzą z 30 własnych przebiegów pomiarowych Webappski prowadzonych od 19 kwietnia do 31 sierpnia 2026, zebranych 1 września 2026. Po odrzuceniu 417 duplikatów i 9 wadliwych rekordów zostało 864 obserwacji, z czego 267 tworzy polski wycinek: 39 pytań, 2006 instancji cytowań, 616 unikalnych domen. Wycinek obejmuje trzy silniki — ChatGPT, Gemini i Claude — przy czym 75 z 86 obserwacji Claude powstało przez import ręcznie wklejonych odpowiedzi. Jedenaście przebiegów klienckich (225 obserwacji) wyłączono w całości. To datowany wycinek, nie próba reprezentatywna i nie ranking jakości agencji.

← Powrót do wszystkich wpisów