Czy spadek widoczności w AI jest prawdziwy? Nasz raport ogłosił −42 punkty i wskazał sześć marek, które nas nie wyparły

Zapis jednej wycofanej diagnozy Webappski i reguł, które z niej zostały. 1 września 2026 nasz własny pomiar ogłosił spadek, wskazał winnych i był przekonujący w każdym szczególe — a przyczyną okazał się model podmieniony wewnątrz jednego silnika. Z uczciwą granicą: nie cały ruch wyniku był winą przyrządu.

Czy spadek widoczności w AI jest prawdziwy? Nasz raport ogłosił −42 punkty i wskazał sześć marek, które nas nie wyparły

1 września 2026 nasz własny raport ogłosił spadek widoczności o 42 punkty procentowe — 6 na 12 sprawdzeń zamiast 11 — i wymienił sześć marek, które rzekomo zajęły nasze miejsce. Webappski wycofało wniosek o wyparciu przez konkurencję: w silniku OpenAI zmienił się model, a nie rynek. Tak wygląda odmowa wniosku, którego dane nie unoszą.

Konflikt interesów wykładamy na starcie, zanim padnie pierwsza liczba. Zbudowaliśmy narzędzie, którym mierzymy — otwarte aeo-platform. Sprzedajemy usługi widoczności w AI. Pomyłka opisana niżej jest nasza, dotyczy naszej marki i została znaleziona przez nas na własnych danych. To nie jest studium przypadku o cudzym błędzie.

Ten materiał nie jest też opowieścią o narzędziu. Jest opisem jednej konkretnej dyscypliny w naszej pracy: odmawiania wniosku, którego dane nie unoszą — nawet wtedy, gdy wniosek jest gotowy, spójny i policzony co do punktu. Pokazujemy go na jedynym przypadku, na jakim wolno go pokazywać uczciwie: na własnym.

Czym jest przyrząd w pomiarze widoczności w AI?

Przyrządem nie jest silnik, tylko konkretny model uruchomiony w środku tego silnika w dniu pomiaru. „ChatGPT” to nazwa produktu, pod którą w kolejnych tygodniach odpowiadają różne modele — i to one, nie logo, decydują o treści odpowiedzi.

Silnik to powierzchnia, na której użytkownik zadaje pytanie: ChatGPT, Gemini, Claude, Perplexity. Marka silnika bywa stała przez rok.

Model to wersja systemu, która faktycznie generuje odpowiedź w danym przebiegu — na przykład gpt-5-search-api, gpt-5.4-mini albo gpt-5.6-luna. Model wymienia się cicho i bez ogłoszenia; nazwa silnika w raporcie nie drgnie.

Komórka to jedno pytanie zadane jednemu silnikowi w jednym przebiegu. Nasz koszyk to trzy pytania i cztery silniki, czyli dwanaście komórek na przebieg — i każdy procent w tym tekście ma właśnie ten mianownik.

Oś silnika a oś modelu to dwa różne pytania i warto je rozdzielić. Opisaliśmy wcześniej oś silnika: wynik z jednego silnika nie przenosi się na drugi, bo trzy silniki cytują w dużej mierze rozłączne listy źródeł. Ten materiał dotyczy osi modelu, czyli rozjazdu wewnątrz jednego silnika, przy niezmienionej nazwie na raporcie. Pierwsza oś każe pytać kilka silników. Druga każe zapisywać, którym modelem zapytano — i to jest twardsza dyscyplina, bo jej złamanie nie widać z zewnątrz.

Trwałość to jedyny rozstrzygacz, jaki mamy między szumem a sygnałem. Komórka, która gaśnie i wraca w obrębie jednej serii, jest wahaniem. Komórka zamknięta w trzech kolejnych przebiegach jest sygnałem i dopiero ona uzasadnia wydatek.

Co pokazał jeden dzień, w którym zmienił się tylko model?

13 sierpnia 2026, ta sama marka, te same trzy pytania, ten sam dzień: gpt-5-search-api wymienił markę w 3 odpowiedziach na 3, a gpt-5.4-mini w 1 na 3. Zmienna była dokładnie jedna — model. Wszystko inne stało.

Kontrolna para z 13 sierpnia 2026. Liczby to wystąpienia nazwy marki w tekście odpowiedzi; jedna metoda liczenia dla wszystkich komórek, adresy URL i metadane nie są liczone.
PrzyrządQ1: najlepsze narzędziaQ2: e-commerceQ3: wielojęzycznośćKomórki z wzmianką
gpt-5-search-api327123 z 3
gpt-5.4-mini8001 z 3

Różnica dwóch komórek na dwanaście to 16,7 punktu procentowego całego przebiegu — około 17 punktów wytworzonych samym wyborem przyrządu. Na nodze OpenAI liczonej osobno ta sama różnica to 2 na 3. Podajemy oba mianowniki celowo: w tekście, którego tezą jest „liczba bez przyrządu nie jest faktem”, liczba bez mianownika też nim nie jest.

Dla porządku: tego samego dnia mieliśmy drugą parę kontrolną, na silniku Google. gemini-3.5-flash dał 2 komórki na 3, a gemini-3.6-flash również 2 na 3. Nie każda podmiana modelu przesuwa wynik — i to jest dokładnie powód, dla którego wolno mówić o przyrządzie tylko wtedy, gdy istnieje para, w której nic poza nim się nie zmieniło.

Jak nasz własny raport doszedł do fałszywego wniosku?

Podmieniony model przeczytał pytanie o e-commerce jako pytanie o rozszerzenia do przeglądarki — i stąd wziął się fałszywy wniosek. Łańcuch miał cztery ogniwa: inny przyrząd, inne odczytanie pytania, wypadnięcie naszej kategorii z odpowiedzi, a na końcu raport nazywający to wyparciem przez konkurencję. Każde ogniwo z osobna było poprawne; fałszywa była dopiero całość.

Odpowiedź z 1 września na pytanie o e-commerce nie mówiła o widżetach osadzanych na cudzych stronach. Mówiła o rozszerzeniach do Chrome, którymi pojedyncza osoba wypełnia formularze sobie — inna kategoria produktowa, inny kupujący, inna półka. Sprawdziliśmy to nie po nazwach, tylko po surowym tekście odpowiedzi: rekomendacje prowadziły do sklepu z rozszerzeniami przeglądarki.

Sześć marek z kolumny „kto pojawił się zamiast nas” — bo tyle ich tam było — nie jest jedną historią. Rozkłada się na cztery plus dwie i dopiero ten rozkład jest prawdą o tych danych.

Marki wskazane przez nasz raport z 1 września 2026 jako te, które zajęły utracone komórki, z przypisaną przyczyną po ponownym rozbiorze.
KomórkaMarki wskazane przez raportCo się wydarzyło naprawdę
ChatGPT · pytanie o e-commerceTalk2Forms, Speak2Fill.ai, Smart Form Automation, ServiceMark AI Form FillerPodmiana modelu przesunęła rozumienie pytania na inną kategorię produktową. Te marki nie zajęły naszego miejsca — odpowiadały na inne pytanie niż to, które zadaliśmy.
Gemini · pytanie o najlepsze narzędziaFulcrum Audio FastFill, VoiceFill.aiModel się nie zmienił. To zwykły rozrzut przebiegu i tak trzeba to nazwać — dzień później ta sama komórka wróciła.

Te sześć nazw nie jest zmyślone: wszystkie stoją w surowym tekście odpowiedzi. Błędem nie było ich odczytanie, tylko dopisanie im roli, której nie pełniły — i wsadzenie dwóch różnych przyczyn pod jeden nagłówek. Zsumowanie ich w jedno zdanie o wyparciu jest dokładnie tym grzechem, który ten tekst opisuje.

Warto też zobaczyć, jak ten sam raport podał tę jedną zmianę różnymi liczbami. Obecność: wynik przebiegu 50 wobec 92, czyli wydrukowany w raporcie spadek o 42 punkty procentowe — przy czym oba wyniki są zaokrągleniem z komórek (6 z 12 i 11 z 12), więc licząc wprost na komórkach wychodzi 41,7. Wskaźnik zbiorczy, liczony w inny sposób, spadł w tym samym raporcie o 18 punktów. To nie są trzy wersje tej samej prawdy, tylko trzy liczby o trzech różnych mianownikach — a ich mieszanie to najprostszy sposób, żeby czytelnik zgubił, o czym właściwie jest zdanie.

Czy 2 września wynik naprawdę wrócił?

2 września, po naprawieniu wyboru modelu, ten sam koszyk dał 83 procent — 10 komórek z 12. Powrót do poziomu, który zajmowaliśmy przed podmianą, jest najmocniejszym argumentem, że przyczyną był przyrząd — i jednocześnie miejscem, w którym najłatwiej przesadzić.

Seria porównywalna: ten sam koszyk trzech pytań, ten sam skład czterech silników, 12 komórek na przebieg. Pomiary własne Webappski dla naszego produktu TypelessForm.
PrzebiegWynikKomórki z wzmiankąPrzyrząd na nodze OpenAI
11 czerwca 20268310 z 12gpt-5-search-api
11 lipca 202610012 z 12gpt-5-search-api
13 sierpnia 20269211 z 12gpt-5-search-api
1 września 2026506 z 12gpt-5.4-mini
2 września 20268310 z 12gpt-5.6-luna

Kolumna z przyrządem jest w tej tabeli ważniejsza od kolumny z wynikiem. Bez niej cztery pierwsze wiersze wyglądają jak historia marki, a są historią marki mierzonej trzema różnymi modelami, z których jeden czytał jedno z pytań jako pytanie o coś innego.

Czy cały ruch wyniku był winą przyrządu? Nie

Nie — Gemini pracował 1 i 2 września na tym samym modelu gemini-3.7-flash, a mimo to przesunął się z 1 komórki na 3 do 2 na 3. Przyrząd stał, wynik się ruszył — to zwykły rozrzut przebiegu i nie ma dla niego lepszego wyjaśnienia.

Piszemy o tym w środku tekstu, a nie w przypisie, bo to jest jego właściwa pointa. Artykuł, który zrzuciłby cały ruch wyniku na podmianę modelu, myliłby się dokładnie tak samo, jak mylił się raport z 1 września: wziąłby jedną prawdziwą przyczynę i rozciągnął ją na zjawiska, których nie tłumaczy. Wygodne wyjaśnienie po naszej stronie jest tak samo podejrzane, jak niewygodne.

Skoro wielkość spadku nie odróżnia szumu od sygnału — bo sam wybór przyrządu wygenerował w tym przebiegu około 17 z 42 punktów procentowych, a reszta pozostaje nieprzypisana — potrzebny jest inny rozstrzygacz. Używamy trwałości: komórka, która gaśnie i wraca w obrębie serii, jest wahaniem; komórka zamknięta w trzech kolejnych przebiegach jest sygnałem.

Na naszych danych ten test wskazuje jedno konkretne miejsce. Pytanie o wielojęzyczność na silniku Gemini nie dało wzmianki 13 sierpnia, nie dało 1 września i nie dało 2 września — trzy kolejne przebiegi, w tym dwa na różnych modelach. To nie jest szum i to jest jedyne miejsce z tej serii, w którym wolno nam wydać pieniądze na treść. Cała reszta ruchu jest na razie tylko ruchem.

Jakie reguły mamy wpisane w kod, żeby nie nazwać wahania zmianą?

Cztery — i wszystkie cztery są odpowiedzią na inny sposób oszukania samego siebie liczbą. Każda z nich stoi w kodzie naszego otwartego narzędzia, a nie w deklaracji na stronie usług; poniżej z progami, jakie mają dzisiaj.

Reguły powściągliwości w silniku raportu aeo-platform. Progi podane za stanem kodu na 2 września 2026.
RegułaPrógPrzed jakim samooszustwem chroni
Próg istotności3,0 punktu na osi 0–100Malowanie na czerwono każdego drgnięcia. Ruch poniżej progu nie jest nazywany ruchem.
Test szumuDelta musi przebić medianę dotychczasowych kroków; aktywny dopiero od piątego przebieguNazwanie „poruszeniem” czegoś, co dla tej metryki jest zwykłym krokiem. Na krótkiej historii test jest wyłączony, bo nie ma czego porównywać.
Blokada słów o trendziePoniżej trzech przebiegówZdania „rośnie” i „spada” postawione na dwóch punktach. Linia przez dwa punkty to delta, nie trend.
Gate pokryciaPrzesunięcie populacji odpowiedzi o więcej niż 25%Podawanie delty średniej, która ruszyła się dlatego, że policzono ją na innym zbiorze odpowiedzi.

Mechanikę tych progów rozłożyliśmy wcześniej na czynniki pierwsze przy okazji datowanej serii pomiarów — tutaj nie powtarzamy tamtego wywodu, tylko domykamy go tym, czego tamten tekst jeszcze nie wiedział.

A wiemy dziś coś niewygodnego: żadna z tych czterech reguł nie zatrzymałaby wniosku z 1 września. Spadek o 42 punkty procentowe przechodzi próg istotności bez trudu. Przebija medianę dotychczasowych kroków, więc test szumu też go przepuszcza. Przebiegów było wtedy więcej niż trzy, więc blokada słów o trendzie nie miała zastosowania. Gate pokrycia dotyczy tylko miar warunkowych — tonu i pozycji — a obecność liczona na komórkach w ogóle przez niego nie przechodzi.

To nie jest usterka tych reguł. One pilnują innej rzeczy: chronią przed nazwaniem wahania zmianą. Błąd z 1 września nie był wahaniem — był poprawnie zmierzoną zmianą z fałszywie przypisaną przyczyną. Przed tym broni co innego.

Co dopisaliśmy po 1 września?

Dwie rzeczy, których żaden próg liczbowy nie zastąpi: nazwanie przyrządu przy każdej liczbie i regułę trwałości przy każdej rekomendacji wydatku. Obie są tańsze niż kolejny współczynnik i obie łapią klasę błędu, której progi nie widzą.

  1. Przy każdej liczbie stoi model, który ją wyprodukował. Nie „ChatGPT”, tylko konkretna nazwa modelu i data. Porównanie dwóch liczb, przy których stoją dwie różne nazwy, przestaje wtedy być porównaniem marki, a staje się porównaniem marki i przyrządu naraz — i widać to gołym okiem, zanim ktoś wyciągnie wniosek.
  2. Rekomendacja wydatku wymaga trwałości, nie wielkości. Nazwać miejsce do naprawy wolno dopiero wtedy, gdy komórka jest zamknięta w trzech kolejnych przebiegach. Jednorazowa dziura, choćby najgłębsza, jest obserwacją, a nie zadaniem.
  3. Zabezpieczenie, które drukuje się tam, gdzie nikt nie patrzy, nie jest zabezpieczeniem. Ostrzeżenie o podmianie modelu musi stać na tej samej powierzchni, na której czytelnik widzi spadek — nie w sąsiednim pliku, nie w rozwiniętej sekcji, nie w załączniku. Reguła bez powierzchni to intencja.
  4. Nazwana przyczyna to zawsze osobna hipoteza. Zdanie „konkurent zajął twoje miejsce” wymaga sprawdzenia w surowym tekście odpowiedzi, o czym ta odpowiedź w ogóle była. U nas to sprawdzenie zajęło kilkanaście minut i odwróciło wniosek.

Liczba bez podanego przyrządu i daty nie jest faktem o marce. Jest faktem o pomiarze.

Jak polska firma może sprawdzić raport widoczności w AI, który dostała?

Sześcioma pytaniami, które dają się zadać agencji albo dostawcy narzędzia w jednym mailu i na które odpowiedź albo jest, albo jej nie ma. Żadne z nich nie wymaga wiedzy technicznej — wymagają tylko, żeby ktoś po drugiej stronie zapisał, czym mierzył.

  1. Którym modelem zmierzono każdą liczbę i czy w poprzednim przebiegu był ten sam? Odpowiedź „ChatGPT” jest niepełna — to nazwa produktu, nie przyrządu.
  2. Ile było komórek? Procent bez mianownika nie mówi nic; „50%” z 12 sprawdzeń i „50%” z 200 to dwa różne zdania.
  3. Czy koszyk pytań był identyczny w obu przebiegach? Podmiana choćby jednego pytania między pomiarami unieważnia deltę.
  4. Na ilu przebiegach stoi słowo „trend”? Poniżej trzech to nie trend, tylko dwie liczby obok siebie.
  5. Czy nazwana przyczyna spadku została sprawdzona w surowym tekście odpowiedzi, czy tylko w liście nazw? To pytanie odwróciło wniosek u nas.
  6. Czy komórka wskazana jako miejsce do naprawy była zamknięta w trzech kolejnych przebiegach? Jeśli nie, to jest obserwacja, a nie zadanie do zrobienia za pieniądze.

Jeżeli chcesz zrobić ten sam pomiar sam, wystarczą trzy komendy otwartego narzędzia — i zapisanie sobie obok, którym modelem poszedł każdy przebieg.

npx aeo-platform init    # konfiguracja: marka, domena, silniki, koszyk pytań
npx aeo-platform run     # pomiar Twoimi kluczami API, pełne odpowiedzi na dysk
npx aeo-platform report  # raport z deltami wobec poprzednich przebiegów

Najważniejszy krok nie jest komendą: zamroź koszyk pytań przed pierwszym pomiarem i nie ruszaj go. Bez tego druga liczba nie ma z czym się porównać, a wszystko, co napisaliśmy wyżej o przyrządzie, przestaje mieć znaczenie — bo zmienna będzie już nie jedna.

Czego ten materiał nie dowodzi?

Nie dowodzi, że spadki widoczności w AI są zwykle złudzeniem, ani że nasza widoczność jest dziś wysoka. Poniżej pełna lista granic, postawiona przed sekcją z wnioskiem, a nie po niej.

  • To jeden koszyk trzech pytań i jedna marka. Na innym koszyku podmiana modelu może nie ruszyć wyniku wcale — mieliśmy taki przypadek tego samego dnia na silniku Google.
  • Nie dowodzi, że wymienione marki nie są realną konkurencją. Dowodzi tylko, że w tych konkretnych komórkach nie zajęły naszego miejsca.
  • Nie cały ruch wyniku był winą przyrządu — Gemini na niezmienionym modelu przesunął się o jedną komórkę i nie mamy dla tego lepszego wyjaśnienia niż rozrzut.
  • Reguła trwałości przy trzech przebiegach jest naszym wyborem progu, nie prawem. Przy rzadkim pomiarze trzy przebiegi to kwartał i sygnał przyjdzie za późno.
  • Powrót do 83 procent 2 września jest jednym punktem po naprawie, a nie potwierdzeniem, że wynik jest stabilny.
  • Wynik dotyczy naszego produktu i naszych pytań; nie przenosimy go automatycznie na polskojęzyczny koszyk pytań, którego ta seria nie obejmowała.

Najczęściej zadawane pytania

Sześć pytań, które wracają, gdy pokazujemy tę historię klientom.

Czy spadek widoczności w AI o 42 punkty może wynikać z samego narzędzia pomiarowego?

Tak — u nas dokładnie tak było, choć precyzyjniej winny jest model podmieniony wewnątrz silnika, a nie samo narzędzie. Kontrola z 13 sierpnia 2026 pokazała, że przy niezmienionym wszystkim innym dwa różne modele dały 3 komórki na 3 i 1 na 3. Dlatego pierwsze pytanie do każdego spadku brzmi „czym mierzono?”, a nie „kto nas wyparł?”.

Skąd wiadomo, że spadek jest sygnałem, a nie zwykłym wahaniem?

Z trwałości, nie z wielkości. Komórka, która gaśnie i wraca w obrębie serii, jest wahaniem; komórka zamknięta w trzech kolejnych przebiegach jest sygnałem. W naszej serii taka jest jedna: pytanie o wielojęzyczność na silniku Gemini, ciemne 13 sierpnia, 1 i 2 września.

Czy zmiana modelu w silniku unieważnia porównanie dwóch przebiegów?

Nie unieważnia, ale zmienia to, co porównujesz. Klientowi zależy na tym, co silnik odpowiada ludziom dzisiaj, więc mierzymy najnowszym pokoleniem modeli i deltę pokazujemy zawsze. Podmiana modelu jest wtedy wierszem w rozbiorze przyczyny, a nie powodem, żeby nie porównywać.

Dlaczego publikujecie własny błąd, skoro sprzedajecie usługi widoczności w AI?

Bo to jedyny sposób, żeby pokazać metodę na czymś, czego nie da się wyretuszować. Klient kupuje u nas przede wszystkim zdolność do powiedzenia „tego nie wiemy” — a tej zdolności nie da się udowodnić na cudzym przypadku. Nasze własne niepochlebne liczby publikujemy zresztą regularnie, razem z pełnym raportem widoczności Webappski.

Ile przebiegów musi minąć, zanim raport w ogóle powie „rośnie” albo „spada”?

Trzy — poniżej tego progu nasz raport blokuje słowa o trendzie i podaje wyłącznie stan na dziś. Test szumu, który porównuje deltę z medianą dotychczasowych kroków, włącza się jeszcze później, dopiero od piątego przebiegu, bo wcześniej nie ma historii, wobec której cokolwiek nazwać normą.

Czy da się to sprawdzić samodzielnie, bez agencji?

Tak. Narzędzie, którym zrobiliśmy wszystkie pomiary w tym tekście, jest otwarte i uruchamia się trzema komendami na własnych kluczach API; surowe odpowiedzi zapisują się na dysk, więc każdy wniosek można zweryfikować w tekście, a nie tylko w liczbie. Przegląd innych opcji zebraliśmy w zestawieniu darmowych narzędzi widoczności w AI.

Co z tego wynika dla Twojej firmy?

Zanim zareagujesz na spadek widoczności w AI, sprawdź, czy zmienił się rynek, czy przyrząd — bo tylko jedna z tych rzeczy jest warta budżetu. Różnica między nimi nie jest widoczna w samej liczbie i nigdy nie będzie.

Praktycznie oznacza to trzy nawyki. Zapisuj przy każdej liczbie model i datę, a nie nazwę silnika. Nie wydawaj pieniędzy na komórkę, która nie była zamknięta trzy razy z rzędu. I zanim uwierzysz w nazwane przyczyny spadku, przeczytaj surowy tekst odpowiedzi — bo czasem odpowiedź w ogóle nie jest o Twojej kategorii. Skąd biorą się różnice między samymi silnikami, opisaliśmy osobno w analizie polskich odpowiedzi AI.

Jeśli chcesz zobaczyć taki pomiar dla własnej marki — z przyrządem podanym przy każdej liczbie i z jawnie zaznaczonymi miejscami, w których nie wiemy — możesz zamówić darmowy audyt AEO Webappski. Zakres stałej pracy opisuje strona usług AEO.

Metodyka: wszystkie liczby pochodzą z własnych przebiegów pomiarowych Webappski dla produktu TypelessForm, z 11 czerwca, 11 lipca, 13 sierpnia oraz 1 i 2 września 2026. Koszyk trzech pytań i skład czterech silników są w tej serii niezmienione, więc przebiegi są porównywalne. Wzmianki liczone jedną metodą dla wszystkich komórek: wystąpienia nazwy marki w tekście odpowiedzi, bez adresów URL i metadanych. Kontrola z 13 sierpnia 2026 obejmuje dwie pary modeli zapisane tego samego dnia. Progi reguł podane za stanem kodu otwartego narzędzia aeo-platform na 2 września 2026. To datowany wycinek jednej marki, nie badanie rynku.

← Powrót do wszystkich wpisów