26 sie 2026

Na co patrzy ChatGPT, gdy cytuje źródło?

O tym, czy ChatGPT może cię zacytować, decydują trzy rzeczy: dostęp crawlera, indeks, po który sięga, i źródła, na których już się opiera. Tylko pierwsza jest twardym przełącznikiem z oficjalnym zdaniem producenta. W tym odcinku czytamy przed kamerą własny plik robots.txt — razem z błędem, który w nim jest.

Na co patrzy ChatGPT, gdy cytuje źródło?

ChatGPT patrzy przy cytowaniu na trzy rzeczy: czy OAI-SearchBot ma prawo zaindeksować twoją stronę, czy jesteś w indeksie wyszukiwania, po który sięga, i czy pojawiasz się na źródłach referencyjnych i społecznościowych, na których już się opiera. Twardą bramką jest tylko pierwsza — OpenAI pisze, że strony, które wykluczyły OAI-SearchBot, nie pojawią się w odpowiedziach wyszukiwania ChatGPT.

Jedna linijka w pliku, którego większość właścicieli nigdy nie otworzyła, potrafi po cichu usunąć cię z odpowiedzi ChatGPT. Tym plikiem jest robots.txt — plik tekstowy w katalogu głównym domeny, który mówi każdemu crawlerowi, co wolno mu pobrać. W Answer Engine Optimization (AEO), czyli budowaniu strony tak, by asystenci AI ją cytowali, to jedyna kontrola będąca przełącznikiem, a nie rzemiosłem. Twoje treści mogą być świetne, a znaczniki bez zarzutu — jeśli crawler nigdy nie dotrze, nic z tego nie trafia do puli, z której powstaje odpowiedź.

Zobacz odcinek

What does ChatGPT look at when citing a source?
Czytamy przed kamerą własny robots.txt — razem z regułą, która po cichu przestaje obowiązywać.

Jeden bot dziś blokuje cię w ChatGPT, drugi tylko trenuje przyszły model — który jest który?

OAI-SearchBot — a sprawdzenie zajmuje dwie minuty. Otwórz własną domenę z końcówką /robots.txt i poszukaj tej nazwy. OAI-SearchBot to crawler wyszukiwania OpenAI, a własna dokumentacja OpenAI mówi, że strony, które go wykluczyły, nie będą pokazywane w odpowiedziach wyszukiwania ChatGPT. I teraz rzecz, którą myli niemal każdy: GPTBot to inny bot z innym zadaniem. OpenAI opisuje GPTBota jako crawler treści, które mogą posłużyć do trenowania ich modeli podstawowych. Zablokowanie GPTBota nie zmienia nic w tym, czy ChatGPT cytuje cię dzisiaj — zmienia to, czy twoje teksty trafią do przyszłego modelu. Dwa boty, dwa pytania. Czytaj wiersz, nie etykietę.

Nazwana grupa kasuje reguły napisane dla wszystkich

Bo tak mówi specyfikacja. Dokumentacja Google o interpretacji robots.txt stwierdza, że dla danego crawlera obowiązuje tylko jedna grupa: crawler bierze tę, której user-agent pasuje do niego najdokładniej, a każdą inną ignoruje. Kilka linijek dalej pada zdanie, które po cichu kosztuje ludzi widoczność — grupy przypisane do konkretnego user-agenta i grupy globalne nie są łączone. To, co jest w nazwanej grupie, jest dla tego crawlera całym prawem. Jeśli kiedykolwiek wkleiłeś blok „boty AI” z jakiegoś wpisu do pliku, w którym były już przemyślane reguły, przeczytaj, co ten blok zawiera — to jedyna rzecz, którą ten crawler zobaczy.

Co jest źle w naszym własnym robots.txt?

Nasze nazwane grupy crawlerów AI nie dziedziczą niczego z reguł powyżej — i pokazujemy to na własnym pliku, zamiast oceniać cudzy. Pierwszą kontrolę plik przechodzi: ma grupę dla OAI-SearchBota z Allow. Ale wyżej, w grupie z gwiazdką, siedzą nasze faktyczne reguły — nie indeksuj strony 404, nie indeksuj portalu. Żadna z nich nie sięga OAI-SearchBota. W chwili, gdy daliśmy temu crawlerowi własną nazwaną grupę, przestał cokolwiek dziedziczyć. To nie jest błąd w naszym pliku, to specyfikacja działająca dokładnie tak, jak ją zapisano. U nas kosztuje to niewiele, bo te ścieżki są za logowaniem — a prywatne strony chroni logowanie, nigdy linijka w tym pliku.

Ile crawlerów w twoim pliku faktycznie się liczy?

Trzy z siedemnastu, które wymieniamy. Cytowanie mogą dziś kosztować crawler wyszukiwania OpenAI, crawler Perplexity i crawler wyszukiwania Anthropic. Reszta to nie śmieci: GPTBot decyduje o tym, czy twoje teksty trafią do przyszłego korpusu treningowego — realne pytanie, tylko wolniejsze. Ale jeśli ktoś bierze od ciebie pieniądze za odblokowanie botów treningowych, żeby AI cię cytowała, płacisz za niewłaściwy wiersz. Zwróć też uwagę na jeden bramkujący crawler, którego świadomie nie nazwaliśmy: Googlebot zostaje w grupie z gwiazdką, więc nadal przestrzega naszych reguł — a to przez Googlebota docierasz do indeksu, o którym jest druga kontrola.

Bing czy Google — po który indeks sięga ChatGPT?

Obie połowy są prawdziwe, a większość poradników podaje tylko jedną. Połowa pierwsza: własna strona pomocy OpenAI o wyszukiwaniu w ChatGPT mówi o partnerstwie z innymi dostawcami wyszukiwania i wymienia Bing oraz Shopify. Przeczytaliśmy tę stronę bezpośrednio 1 sierpnia 2026 i Bing tam był, więc obecność w indeksie Binga nie jest zmarnowanym wysiłkiem. Połowa druga: Microsoft wycofał API wyszukiwania Bing w sierpniu 2025, a w ciągu tamtego roku, w panelu tysiąca zapytań prowadzonym przez Profound, pokrycie wyników ChatGPT z Bingiem spadło z 26% do 8%, podczas gdy pokrycie z Google wzrosło z około 12% do 33%. W jednym publicznym teście ChatGPT zacytował nawet stronę zaindeksowaną wyłącznie w Google. To cudze pomiary i podajemy je jako pomiary, a nie jako prawo. Wniosek nie brzmi ani „słuchaj Binga”, ani „olej Binga”: ciężar postaw najpierw na Google — strony renderowane po stronie serwera, prawdziwa mapa witryny, niezablokowany Googlebot — a potem poświęć dwadzieścia darmowych minut na zgłoszenie tej samej mapy w Bing Webmaster Tools, bo OpenAI wciąż wymienia Bing, a to nic nie kosztuje.

Na jakich źródłach ChatGPT już się opiera?

Nie na całym internecie po równo. W opublikowanym w tym roku badaniu 600 000 zdarzeń cytowania w Stanach Zjednoczonych Wikipedia i Reddit odpowiadały razem za ponad jedną czwartą wszystkiego, co ChatGPT zacytował. Dla małej firmy ruchem nie jest więc „być wszędzie”, tylko być poprawnie opisanym na tych dwóch, trzech powierzchniach referencyjnych i społecznościowych, gdzie twoja kategoria jest naprawdę omawiana. I zaraz zastrzeżenie, bo lepiej, żebyś usłyszał je od nas: w innym pomiarze, obejmującym ponad 100 milionów cytowań, udział Reddita załamał się z około 60% do około 10% w mniej więcej sześć tygodni. Traktuj miks źródeł jak pogodę. Linijka o crawlerze to architektura. Buduj na architekturze, ubieraj się pod pogodę.

Co darmowe narzędzia mówią o dostępie crawlerów?

Nic — i to luka w tym, do czego zostały zbudowane, a nie zarzut wobec nich. AI Visibility Checker od Ahrefs jest naprawdę darmowy, bez rejestracji, z wynikiem w kilka sekund, a raport za nim jest prawdziwy: łączne wzmianki w AI, wzmianki wg platformy, główne tematy, najczęściej cytowane domeny i strony. Poszukaj na tej stronie słowa „robots”: zero trafień. Nic o dostępie crawlerów, nic o OAI-SearchBocie, nic o GPTBocie. Semrush ma ten sam kształt i jest hojny w dostępie — trzy uruchomienia dziennie bez rejestracji — z porządnym raportem: wynik widoczności, wzmianki, cytowania, pokrycie platform, najczęściej cytowane strony, porównanie z konkurencją. Żaden z tych wymiarów to nie dostęp crawlera. Grader HubSpota nie wymaga konta do jednego przebiegu i zwraca wynik zbiorczy z wydźwięku, jakości obecności, rozpoznawalności marki, udziału głosu i otoczenia konkurencyjnego. Pięć wymiarów i ani jeden to dostęp. Gdyby ta jedna bramkująca linijka była u ciebie źle ustawiona, wszystkie trzy podałyby ci niski wynik i żadne nie powiedziałoby dlaczego.

Co zamiast tego robi nasz otwarty tracker?

Wiąże każdego bota z tym, ile realnie kosztuje jego zablokowanie. aeo-platform to nasz własny tracker, darmowy i otwarty na npm, a jego audyt indeksowania nie raportuje liczby zablokowanych botów. Oznacza każdego z nich poziomem: poziom wyszukiwania oznacza, że blokada usuwa cię z odpowiedzi danego silnika; poziom treningowy oznacza wyłącznie korpus treningowy, bez zmierzonego wpływu na dzisiejsze cytowania; poziom użytkownika oznacza pobranie wywołane przez człowieka, które i tak zwykle ignoruje twój plik. Narzędzie ma też zabezpieczenie, które odmawia wypisania ci zadania „odblokuj bota treningowego”. Ta odmowa jest produktem — narzędzie, które podaje pięć pilnie wyglądających zadań o dostępie, choć tylko jedno może zmienić cytowanie, sprzedaje zajęcie, a nie widoczność.

Tu nasza własna strona oblewa listę kontrolną

Na trzeciej kontroli, i to mocno. Poszukaj dziś w Wikipedii hasła Webappski, a dostaniesz zero wyników — sprawdziliśmy to ponownie 25 sierpnia 2026. Nie ma nas na powierzchni, na której ChatGPT opiera się najmocniej, i nie naprawimy tego, pisząc stronę o sobie, bo Wikipedia wymaga najpierw niezależnych publikacji. Ta kontrola świeci u nas na czerwono i jeszcze przez jakiś czas będzie. Wolimy ci to pokazać, niż sprzedać skrót — i taki jest uczciwy kształt całej listy: dwie z trzech rzeczy, na które patrzy ChatGPT, zdobywa się powoli, a tylko pierwsza jest przełącznikiem do przestawienia dziś po południu.

Pełna lista kontrolna dla ChatGPT

Pięć kontroli w tej kolejności, które robimy dla każdego klienta. Pierwsza: OAI-SearchBot dozwolony w robots.txt — jako jedyna z pięciu jest przełącznikiem. Druga: przeczytaj nazwaną grupę, którą mu dałeś, bo nie dziedziczy nic z grupy powyżej. Trzecia: strony renderowane po stronie serwera w indeksie Google i niezablokowany Googlebot. Czwarta: mapa witryny zgłoszona w Bing Webmaster Tools, bo OpenAI wciąż wymienia Bing. Piąta: uczciwa obecność na tych dwóch, trzech powierzchniach referencyjnych i społecznościowych, gdzie omawiana jest twoja kategoria — i żadnej wiary w to, że ten miks się nie zmieni. Pierwsza zajmuje dwie minuty, a większość stron nigdy tam nie zajrzała.

Najczęstsze pytania

Czy powinniśmy blokować GPTBota?

To decyzja o treningu, nie o cytowaniach. OpenAI opisuje GPTBota jako crawler treści, które mogą posłużyć do trenowania ich modeli podstawowych, więc jego zablokowanie nie usuwa cię z dzisiejszych odpowiedzi ChatGPT — robi to OAI-SearchBot. Blokuj GPTBota, jeśli nie chcesz swoich tekstów w przyszłym modelu, i wiedz, że w widoczności nie zmienia to nic w żadną stronę.

Wkleiliśmy blok botów AI do robots.txt. Czy to bezpieczne?

Tylko jeśli przeczytasz, co ten blok zawiera. Nazwanie crawlera tworzy jego własną grupę, a zgodnie ze specyfikacją to jedyna grupa, której ten crawler słucha — grupy dla konkretnego user-agenta i globalne nie są łączone. Każda reguła Disallow z grupy z gwiazdką przestaje obowiązywać dla botów, które właśnie nazwałeś. Przeczytaj wklejony blok tak, jakby był dla tych crawlerów całym twoim plikiem. Bo jest.

Czy nadal trzeba być w Bingu, żeby cytował nas ChatGPT?

Nadal pomaga i jest tanie, ale ciężar przesunął się do Google. Strona pomocy OpenAI wciąż wymienia Bing jako partnera wyszukiwania, dlatego mapa witryny w Bing Webmaster Tools jest warta dwudziestu darmowych minut. Niezależne pomiary panelowe z 2025 roku pokazują spadające pokrycie z Bingiem i rosnące z Google — właściwą pracę włóż więc najpierw w indeksowalność w Google.

Czy darmowe narzędzie pokaże, że crawler jest zablokowany?

Te trzy sprawdzone nie pokażą. Ahrefs, Semrush i HubSpot raportują wzmianki, cytowane strony, pokrycie platform i wyniki zbiorcze — przydatne do pytania, czy się pojawiasz, milczące na pytanie, dlaczego nie. Zablokowany crawler wyszukiwania i nudna strona dają w tych raportach ten sam niski wynik. Sprawdź robots.txt samodzielnie albo użyj trackera, którego audyt nazywa poziom każdego bota.

Jak trafić na źródła, na których opiera się ChatGPT?

Powoli i przez bycie poprawnie opisanym, a nie przez publikowanie o sobie. Wikipedia wymaga najpierw niezależnych publikacji, więc prasa i realne teksty osób trzecich są przed jakimkolwiek hasłem w encyklopedii. Na powierzchniach społecznościowych: bądź tam, gdzie twoja kategoria jest faktycznie omawiana, i bądź tam rzetelny. Traktuj miks jako niestabilny — jeden zmierzony spadek zabrał udział Reddita z około 60% do 10% w mniej więcej sześć tygodni.

Przejść te pięć kontroli na twojej stronie?

Robimy wszystkie pięć — dostęp crawlera, dziedziczenie grup, pokrycie w indeksie, zgłoszenie do Binga i obecność w źródłach — na prawdziwych stronach klientów, a pierwszy audyt widoczności w AI jest bezpłatny. Jeśli chcesz wiedzieć, czy ChatGPT w ogóle może dziś do ciebie dotrzeć, zamów bezpłatny audyt na webappski.com.

← Powrót do wszystkich wpisów