Отчёт показал минус 42 пункта, а мы его не отправили: как отличить падение видимости в ИИ от смены модели
1 сентября 2026 года наш собственный трекер выдал уверенный и полностью правдоподобный ложный вывод о нашем же продукте: падение на 42 пункта и шесть чужих марок, «занявших наши ячейки». Четыре из шести объясняются подменой модели внутри одного движка, две — не объясняются ею вовсе. Разбор того, как мы это поймали, и почему четыре сторожа, которые в инструменте уже стояли, эту ошибку пропустили: они честно охраняли другую ось.

Один движок, один день, один бренд, два разных прибора. 13 августа 2026 года gpt-5-search-api назвал typelessform в 3 ответах из 3, а gpt-5.4-mini — в 1 из 3. Вопросы были те же самые. Поменялась только модель внутри ChatGPT — и вместе с ней поменялся вывод, который отчёт готов был напечатать.
Конфликт интересов раскрываем сразу, до первой таблицы. Трекер, о котором идёт речь, построили мы — это открытый CLI aeo-platform от Webappski. Бренд, который им замеряли, — тоже наш: typelessform, наш собственный продукт. Услугу, спрос на которую этот текст усиливает, продаём тоже мы. И провал, который здесь разобран, — наш: ложный вывод напечатал наш инструмент про наш продукт, и прочитали его мы сами, а не клиент.
Эта статья не про то, что наш инструмент хорош. Она про то, как устроена наша работа: дисциплина отказа от вывода, который данные не выдерживают. Мы показываем не победу, а место, где мы ошиблись, — и разбираем, почему сторожа, которые в инструменте уже стояли, эту ошибку пропустили, а поймало её совсем другое.
Что такое ось модели и почему это не то же самое, что ось движка?
Ось модели — это версия нейросети, которая на самом деле отвечала на ваш вопрос, тогда как ось движка — это витрина, под именем которой ответ пришёл. «ChatGPT» и «Gemini» — витрины. gpt-5-search-api и gpt-5.4-mini — приборы, стоящие за одной и той же витриной.
Разница практическая, а не терминологическая. Когда меняется движок, в отчёте меняется имя колонки, и это видно. Когда внутри движка меняется модель, имя колонки остаётся прежним: в шапке по-прежнему написано ChatGPT. Ось модели — это скрытая ось, и именно поэтому она опаснее явной.
Почему выбор модели вообще плавает от прогона к прогону, если конфиг никто не трогал. Наш трекер по умолчанию сам находит самое свежее поколение моделей у поставщика и берёт его — это правильное поведение для замера, потому что покупатель разговаривает не с прошлогодней версией. Обратная сторона правильного поведения в том, что между двумя вашими прогонами линейка может смениться молча. Замер, который не печатает имя использованной модели рядом с числом, эту смену от вас прячет.
Здесь стоит сказать прямо, чем этот разбор отличается от нашего же предыдущего. В статье почему ChatGPT назвал бренд, а Gemini нет мы сравнивали два прогона, в которых одновременно поменялись четыре переменные — вопросы, состав движков, версии моделей и дата, — и написали там прямо: когда меняются четыре переменные сразу, разность чисел не значит ничего. Тот вывод остаётся в силе. Этот текст делает следующий шаг: он изолирует ровно ту переменную, которую та статья объявила неизолируемой, — потому что в замере 13 августа три остальные держали неподвижно намеренно.
Как выглядит подмена линейки, когда всё остальное держат неподвижным?
13 августа 2026 года мы прогнали одну и ту же тройку вопросов по одному и тому же бренду дважды, отличалась только модель. У OpenAI зачтённая модель назвала бренд в 3 ячейках из 3, контрольная — в 1 из 3. Ни вопрос, ни бренд, ни дата, ни движок при этом не двигались.
Считаем одним методом для всех ячеек, иначе таблица опровергнет сама себя. Берём текст ответа движка и регистронезависимо считаем в нём вхождения слова «typelessform». URL-ы, блоки цитат и служебные метаданные не считаются вообще — иначе один и тот же прогон даёт два разных числа в зависимости от того, где смотреть, и сравнивать строки становится нельзя.
| Модель | Роль в прогоне | Q1 | Q2 | Q3 | Ячеек с упоминанием |
|---|---|---|---|---|---|
| gpt-5-search-api | зачтённая | 32 | 7 | 12 | 3 из 3 |
| gpt-5.4-mini | контрольная | 8 | 0 | 0 | 1 из 3 |
| gemini-3.5-flash | зачтённая | 3 | 5 | 0 | 2 из 3 |
| gemini-3.6-flash | контрольная | 1 | 3 | 0 | 2 из 3 |
Обратите внимание на нижние две строки, потому что они портят красивую историю, и это правильно. У Gemini контрольная пара дала одинаковый счёт ячеек: 2 из 3 и там, и там. Поштучные числа внутри ячеек разошлись, а итог по ячейкам — нет. То есть ось модели кусается не всегда и не везде; в этот день она укусила у OpenAI и не укусила у Gemini. Утверждение «смена модели всегда всё объясняет» из этой таблицы не следует.
Теперь цена вопроса на итоговом балле — и сразу пометка о статусе этого числа. Корзина замера — 12 ячеек: три вопроса на четыре движка. С зачтённой моделью 13 августа вышло 11 из 12, то есть 92%. Если бы в ту же корзину подставили контрольную модель, вышло бы 9 из 12, то есть 75%. Семнадцать пунктов между этими числами — не то, что напечатал отчёт, а наш собственный контрфактический расчёт по той же таблице выше. Мы отмечаем это явно: статья про честное чтение чисел — неподходящее место, чтобы выдавать свою арифметику за печатный результат.
Что напечатал отчёт 1 сентября — и что в этом было неправдой?
Отчёт 1 сентября 2026 года напечатал падение на 42 пункта — с 92% до 50% — и назвал шесть чужих марок в таблице «где вы потеряли позиции». Числа были посчитаны верно. Неправдой была причинная связь: из шести названных марок ни одна не вытесняла нас из ячейки, которую мы держали.
Вот что стояло в отчёте дословно — три строки из машинного вывода, без нашего пересказа.
▼ -42pp vs 2026-08-13 · 6 of 12 checks returned a mention
Down 42 points. ChatGPT dropped an answer it had held before.
Where you lost ground:
| top one-shot voice form filling services for e-commerce | ChatGPT | Talk2Forms, Speak2Fill.ai, Smart Form Automation, ServiceMark AI Form Filler |
| best voice form filling tools 2026 | Gemini | Fulcrum Audio FastFill, VoiceFill.ai |Прочитайте это глазами человека, который платит за отчёт. Строка «минус 42 пункта», строка «ChatGPT потерял ответ, который держал раньше», шесть конкретных имён. Ни одного признака, что что-то не так. Это и есть самый неприятный вид ошибки: не сбой, который видно, а уверенный, связный и полностью правдоподобный вывод.
Марки, кстати, существуют — их не выдумал ни инструмент, ни мы. Talk2Forms, Speak2Fill.ai, Smart Form Automation и ServiceMark AI Form Filler дословно стоят в тексте ответа ChatGPT за 1 сентября. Ложным было не их наличие, а слово «вместо»: отчёт поставил их в колонку «кто появился вместо вас», хотя они появились не вместо нас, а в ответе на другой по сути вопрос.
Потому что модель, отвечавшая 1 сентября, поняла вопрос про e-commerce иначе, чем предыдущая. Вот как она начала свой ответ — дословно, из сохранённого сырого ответа прогона.
If you mean tools that let shoppers or staff fill e-commerce forms by speaking once, the best options I found are mostly browser extensions and voice agents, not full standalone “one-shot” commerce suites.
Дальше в том же ответе идут ссылки на карточки расширений в Chrome Web Store: инструменты, которые человек ставит себе в браузер, чтобы голосом заполнять чужие формы. Это другая товарная категория. typelessform — встраиваемый виджет, который владелец сайта ставит на свою форму, чтобы её заполнил посетитель. Модель ответила про личное автозаполнение, а мы живём в категории «форма на вашем сайте».
Отсюда точная формулировка того, что произошло. Мы не потеряли четыре ячейки конкурентам. Мы получили ответ на смежный вопрос, в котором нашей категории просто не было, — и инструмент, сравнивая две даты механически, оформил это как вытеснение. Разница между «нас перестали рекомендовать» и «спросили про другое» — это разница между поводом переписывать сайт и поводом перечитать вопрос.
Почему две из шести марок сменой модели не объясняются?
Потому что две из шести пришли не от ChatGPT, а от Gemini, а Gemini 1 и 2 сентября работал на одной и той же модели gemini-3.7-flash. Прибор там не менялся, а результат всё равно сдвинулся: 1 из 3 ячеек первого сентября и 2 из 3 второго.
Fulcrum Audio FastFill и VoiceFill.ai стоят в строке Gemini. Списать их на подмену модели нельзя ничем: модель та же, вопрос тот же, бренд тот же. Это обычный разброс прогона — генеративный ответ не обязан быть дословно воспроизводимым, и никто такой воспроизводимости не обещает.
Отсюда правило, которое мы вписали себе первым, ещё до кода: шесть имён — это не одна причина. Четыре из шести объясняются подменой прибора, две не объясняются ею вообще. Статья, которая списала бы на смену модели всё движение целиком, была бы неправа ровно тем же способом, каким был неправ отчёт 1 сентября: она взяла бы одно правдоподобное объяснение и натянула его на данные, которые его не держат.
Различитель шума и сигнала у нас один, и он не про статистику, а про устойчивость. Ячейка, которая ушла и вернулась внутри одного-двух прогонов, — это разброс. Ячейка, которая закрыта три прогона подряд, — это сигнал. Всё, что между, не называется ни тем, ни другим до следующего замера, и это нормальное состояние честного отчёта: часть строк в нём должна оставаться без вывода.
Проверка диагноза пришла на следующий день. 2 сентября, после починки оси модели, прогон по той же корзине из 12 ячеек дал 83% — 10 из 12, при этом у OpenAI снова 3 из 3. Сопоставимая серия по одной и той же корзине и одному составу движков выглядит так.
| Дата прогона | Балл | Ячеек с упоминанием | Модель OpenAI в этом прогоне |
|---|---|---|---|
| 11 июня 2026 | 83 | 10 из 12 | gpt-5-search-api |
| 11 июля 2026 | 100 | 12 из 12 | gpt-5-search-api |
| 13 августа 2026 | 92 | 11 из 12 | gpt-5-search-api |
| 1 сентября 2026 | 50 | 6 из 12 | gpt-5.4-mini |
| 2 сентября 2026 | 83 | 10 из 12 | gpt-5.6-luna |
И сразу граница этой таблицы, чтобы её нельзя было прочитать шире, чем она есть. Она не доказывает, что gpt-5.4-mini «хуже» — эта модель дешевле и не ходит в веб тем же способом. Она доказывает ровно одно: между двумя соседними строками поменялся не бренд, а прибор, и без строки «модель» правый край таблицы читается как катастрофа, которой не было.
Почему четыре сторожа, которые уже стояли в инструменте, эту ошибку пропустили?
Потому что все четыре защищают от разброса, а здесь был не разброс. Порог значимости, проверка на шум, задержка языка трендов и отказ считать дельту при сдвинувшейся выборке ловят маленькое движение, выданное за находку. У нас было большое движение с ложной причиной — против этого класса не стоял ни один из них.
Перечислим их всё равно, потому что без них не виден контраст. Вот что инструмент уже умел не говорить.
- Порог значимости — 3.0 пункта. Движение меньше трёх пунктов на непрерывной шкале от 0 до 100 не объявляется движением вообще: у него нет отдельного заголовка, нет стрелки, нет объяснения. Это защита от главного жанра отчётности — рассказывать историю про колебание, которое ничем не отличается от нуля. На счётных величинах порог другой: там минимальная единица и есть одна штука, и придумывать ей дополнительный барьер значило бы навсегда запретить отчёту заметить потерю одного ответа.
- Проверка на шум — дельта обязана побить собственный медианный исторический шаг. Инструмент смотрит, на сколько эта метрика обычно двигается от прогона к прогону у этого домена, и не называет движителем изменение, которое типично для неё же. Честная граница: проверка включается только с пятого измеренного прогона. До пятого она пропускает всё — не потому, что мы забыли, а потому, что на двух точках единственный имеющийся шаг и есть тот самый, который мы судим, и такая проверка молча вычеркнула бы любую находку на молодом аккаунте.
- Язык трендов не включается раньше третьего прогона. Слова «тренд», «динамика», «набираете» и подписи к базовой линии появляются в отчёте только тогда, когда точек хотя бы три. Две точки — это отрезок, а не тренд, и рисовать по ним стрелку значит продавать читателю уверенность, которой в данных нет.
- Отказ называть дельту, если популяция ответов сдвинулась больше чем на 25%. Если доля ячеек, по которым метрика вообще посчитана, изменилась между прогонами сильнее чем на четверть, инструмент печатает охват вместо разницы: «показатель посчитан по стольким-то ответам из двенадцати» — и не даёт числа изменения. Сравнивать среднее по пяти ячейкам со средним по одиннадцати — это сравнивать две разные выборки и называть разницу движением.
Теперь приложим каждого из четырёх к нашим 42 пунктам, по очереди. Порог значимости 42 пункта проходят насквозь: они больше трёх в четырнадцать раз. Проверку на шум — тоже: такой дельты не было в истории этого домена никогда, значит, она бьёт любой медианный шаг и объявляется движителем законно. Порог языка трендов ни при чём вовсе: это был девятый прогон, право говорить о динамике инструмент получил ещё в июне. А гейт покрытия на присутствие просто не смотрит.
Последнее стоит развернуть, потому что это не оговорка, а устройство. Ось, посчитанная по всем ячейкам корзины, помечена в коде как прямая и получает право на дельту немедленно, без всякой проверки покрытия; через гейт идут только условные оси — тональность и позиция, те, что считаются по части ответов. Присутствие и цитируемость — прямые. Заголовок «минус 42 пункта» — это присутствие. То есть он не проскочил мимо сторожа: сторож в принципе стоит не на этой дороге.
При этом сам гейт в том же отчёте 1 сентября честно отработал — на тех осях, которые он охраняет, на той же самой странице, где заголовок соврал. Вот его собственная формулировка, дословно.
Sentiment (reported on 5 of 12 answers); Rank (reported on 6 of 12 answers)
— reported on too few answers this run, or on a population that moved too
much between runs, to carry a change figure. The coverage is printed instead
of a delta rather than implying movement the data cannot support.Вот и весь контраст, ради которого этот раздел написан. Инструмент к 1 сентября уже аккуратно охранял ось вопросов: он умел не называть движением то, что меньше собственного шума, и умел отказаться от дельты, когда выборка под ней уехала. На оси модели у него не стояло ничего. Отсюда важное для нас правило письма: написать здесь «вот поэтому у нас есть эти сторожа» значило бы совершить ровно ту ошибку, которую разбирает эта статья, — пришить аккуратную причину, которая не подходит.
Что тогда действительно отвечает этому классу ошибки?
Две вещи, и ни одна из них не порог. Первая — называние прибора рядом с каждым числом: отчёт печатает пару «было — стало» по моделям и снимает спокойную формулировку «держались стабильно», когда линейка сдвинулась. Вторая — устойчивость через прогоны, различитель шума и сигнала.
Начнём с первой, потому что её видно глазами. К прогону 2 сентября рядом со сравнением появился отдельный абзац, которого 1 сентября не было ни в каком виде. Вот он дословно.
A note on the measurement: ChatGPT ran gpt-5.4-mini last time and
gpt-5.6-luna this time. Different models read the same question differently
and return different lists. On ChatGPT there is no overlap at all between the
two runs — not one answer was measured the same way twice, so nothing on that
engine is a like-for-like comparison. So some of the movement above belongs to
that change rather than to your visibility. It is still real and still worth
acting on; it is the size of it that carries this caveat.Разберём, что здесь сделано механически, а не риторически. Обе модели названы по идентификаторам — только в этой форме утверждение «линейку подменили» можно проверить, а не принять на веру; пара «было — стало» печатается ровно один раз за раздел и ставится рядом с той самой таблицей, в которой и рассказывалась вводящая в заблуждение история. Сама таблица при этом помечена построчно: каждая строка, чья ячейка мерилась на сменившейся модели, несёт отдельную отметку «другая модель, чем в прошлый раз» — чтобы читатель, скользящий глазами по именам конкурентов, наткнулся на оговорку в той же строке, а не только в абзаце под таблицей. И самое важное: когда прибор сдвинулся, у отчёта отключается спокойная концовка про удержанные позиции — удержать позицию относительно другой линейки нельзя, и мягкая формулировка была бы враньём в нашу пользу.
И сразу провенанс, чтобы это не осталось словом на слово. В версии 1.10.0 — той, которой сгенерирован отчёт 1 сентября, — этого абзаца не существовало вообще; мы сверились с кодом на релизном срезе, а не с памятью. Он появился в версии 1.11.0, вышедшей 2 сентября, и лежит именно в опубликованном пакете: код, который печатает пару моделей и снимает концовку про удержанные позиции, читается прямо в установленной из npm копии. То есть между двумя отчётами поменялся не только прибор замера, но и прибор чтения — и второе изменение мы обязаны раскрывать так же честно, как первое.
Вторая вещь дешевле и не требует ни строчки кода. Различитель шума и сигнала — устойчивость ячейки через прогоны, и на наших же данных он читается прямо. Вопрос про multilingual у Gemini закрыт три прогона подряд: 13 августа, 1 сентября и 2 сентября — ноль упоминаний везде, причём между первым и вторым у Gemini поменялась модель, и ячейка осталась закрытой. Пережившая смену прибора дыра — это сигнал.
А теперь соседняя ячейка того же движка, и она ведёт себя противоположно. Вопрос «best voice form filling tools 2026» у Gemini: 13 августа бренд назван, 1 сентября нет, 2 сентября снова назван — ушла и вернулась за один прогон, на одной и той же модели. Это разброс. И это именно та ячейка, из которой отчёт 1 сентября достал Fulcrum Audio FastFill и VoiceFill.ai и поставил их в колонку «кто появился вместо вас». Две марки из шести оказались там потому, что механическая разница двух списков не умеет ждать третьего прогона, а человек — умеет.
Чего это не чинило — и что закрылось в тот же день
Главного: сторож стоял не на той поверхности. Версия 1.11.0, вышедшая утром 2 сентября, чинила причину — выбор модели, приоритет источников этого выбора и запись того, какая модель была запрошена и какая ответила, — и печатала предупреждение в текстовой версии отчёта. А в HTML-версии, той самой, которую открывают и показывают, его по-прежнему не было.
Механика была простой и оттого обидной. Код собирал сравнение двух прогонов, включая строку «модель отличается от прошлого прогона», клал результат в структуру — и HTML-рендерер эту структуру не читал никогда. Слова «like-for-like», «instrument» и заголовок «где вы потеряли позиции» в текстовом отчёте были, а в HTML не встречались ни разу. Ложный вывод 1 сентября был прочитан именно из HTML. Сторож, построенный ровно против этого класса ошибки, стоял на поверхности, которую в тот момент никто не читал. Закрыла это версия 1.12.0, вышедшая через несколько часов того же дня: тот же объект сравнения, который раньше вычислялся и выбрасывался, теперь питает предупреждение и в HTML, а сами формулировки вынесены в общий модуль, чтобы две поверхности не могли разойтись словами.
Второй случай был соседним по природе. Смена состава движков между прогонами не детектировалась вообще: если поставщик в этот раз не опрашивался, его ячейки уходили в неопределённую корзину, а эту корзину не выводил ни один рендерер. То есть отчёт не сказал бы вам «этот движок в этот раз не мерили» — он сказал бы безымянное «неполный прогон». 1 сентября это на нас не сработало только потому, что состав движков совпал. Закрылось это тем же релизом 1.12.0, что и первое: выпавший движок теперь называется по имени.
Черновик этого текста был написан, когда оба дефекта были ещё открыты, и мы намеренно не переписали его так, будто их не было. Причина одна. Дефект, о котором никто не рассказал, невозможно проверить снаружи, а весь смысл открытого инструмента — в том, что его границы видны без доверия к нам. Инструмент, у которого нельзя увидеть границы, стоит ровно столько же, сколько круглое число без даты. Порядок здесь важнее итога: сначала причина, потом текстовая поверхность, и только последним — та, на которой ошибку прочитали. Пересказ, в котором всё чинится одним ровным движением, был бы удобнее и неправдой.
Есть ли ось модели в русскоязычном контуре — у GigaChat и Алисы?
Есть, и там она спрятана так же: одна вывеска, несколько разных моделей под ней. У GigaChat это отдельные линейки Lite, Pro, Max и Ultra; у Яндекса под именем Alice AI живёт целое семейство моделей разного назначения.
На странице моделей GigaChat в документации Сбера (прочитано 2 сентября 2026 года) генеративные модели перечислены отдельными позициями: GigaChat 3 Ultra, GigaChat 2 Max, GigaChat 2 Pro и GigaChat 2 Lite, где Lite описан как модель для базовых повседневных задач, а Max — для сложных. Это ровно та же развилка, что у нас была между gpt-5-search-api и gpt-5.4-mini: одно имя сервиса снаружи, разные приборы внутри. Замер «в GigaChat» без указания линейки не воспроизводим по построению.
У Яндекса развилка ещё и по назначению модели. На странице «Нейросети Яндекса» (ya.ru/ai, прочитано 2 сентября 2026 года) Alice AI назван новым семейством нейросетей, внутри которого перечислены Alice AI LLM как генеративная текстовая модель, Alice AI VLM как визуально-языковая и Alice AI ART для изображений и видео; отдельными позициями там же стоят YandexGPT и сервис Нейро, объединяющий возможности Поиска и YandexGPT. Точных идентификаторов моделей мы не приводим: документация Yandex Cloud в этот день отдала нам страницу проверки на робота, а сочинять правдоподобные идентификаторы в статье про честное чтение чисел мы не станем.
Отсюда практический вывод для русскоязычного покупателя, и он не про нас. Если вам показывают динамику по Алисе или GigaChat, вопрос к отчёту ровно один: на какой линейке мерили в первый раз и на какой во второй. Пока в отчёте нет строки с именем модели, любая стрелка вниз имеет как минимум два прочтения, и второе из них — «поменяли линейку».
И наша собственная граница, которую честнее назвать заранее. Ни GigaChat, ни Алиса, ни ИИ-ответы в поиске Яндекса в наш замер не входят ни на одном тарифе: мы читаем ChatGPT, Gemini, Claude и Perplexity. Что каждый русскоязычный сервис мониторинга обещает показать до регистрации и кто из них действительно читает российские поверхности, мы разбирали отдельно в статье в каких нейросетях проверять бренд.
Какие пять вопросов ловят подмену прибора в чужом отчёте?
Пять, и ни один из них не требует доверия к поставщику — все проверяются по тому, что напечатано на странице. Если инструмент не отвечает хотя бы на первый, остальные четыре можно не задавать.
- Какая модель отвечала в этом прогоне и какая в предыдущем? Не «ChatGPT», а конкретное имя версии. Если в отчёте есть стрелка изменения, но нет двух имён моделей рядом с ней, стрелка не интерпретируема.
- Совпадает ли корзина вопросов дословно? Одна переформулированная строка вопроса превращает сравнение двух прогонов в сравнение двух разных экспериментов. Проверяется взглядом: вопросы должны быть напечатаны целиком, а не пересказаны.
- Что отчёт делает с ячейкой, которая не вернула ответа? Исключает её из знаменателя, считает как «бренд не назван» или молчит об этом. Три разных ответа дают три разных балла на одних и тех же данных.
- С какого прогона включается язык трендов? Если сервис рисует «динамику» по двум точкам, он продаёт уверенность, которой в данных нет. У нас этот порог — третий прогон, и мы называем его цифрой, а не словом «достаточно».
- Показан ли конкурент как причина или как совпадение? Строка «вместо вас появился X» — это причинное утверждение. Спросите, на чём оно построено: на том, что X занял вашу позицию в том же вопросе, или на том, что X просто присутствует в ответе, которого вы не читали.
Пятый вопрос — тот самый, на котором споткнулись мы. Наш инструмент строил строку «кто появился вместо вас» механически, из разницы двух списков, и не проверял, остался ли вопрос тем же вопросом по смыслу. Это не экзотический дефект чужого сервиса, это наш собственный, и мы разобрали его выше не как гипотезу.
Частые вопросы про смену модели и падение балла видимости
Как понять, что балл упал из-за смены модели, а не из-за видимости?
Сравните имена моделей в двух прогонах — если они разные, дельта не интерпретируема, пока вы не повторите замер на одной и той же модели. Наш случай выглядел так: 92% на gpt-5-search-api, 50% на gpt-5.4-mini, снова 83% на gpt-5.6-luna. Бренд между этими датами не менялся.
Сколько прогонов нужно, чтобы падение можно было назвать падением?
Для слова «тренд» — минимум три прогона; это порог, зашитый у нас в код. Для вывода про конкретную ячейку разумнее другое правило: ячейка, ушедшая и вернувшаяся за один-два прогона, — это разброс, а ячейка, закрытая три прогона подряд, — сигнал. Между этими состояниями честный отчёт обязан молчать.
Что делать, если инструмент вообще не показывает, на какой модели он мерил?
Считать его историю несопоставимой между прогонами и пользоваться ей как одиночным снимком, а не как динамикой. Модели под именем движка обновляются молча и довольно часто; отчёт, не печатающий имя модели, физически не может отличить смену прибора от смены реальности.
Значит ли всё это, что дешёвая модель хуже дорогой?
Нет, и такого вывода из наших данных не следует. Дешёвая модель иначе ходит в веб и иначе трактует широкий вопрос — это другой прибор, а не испорченный. Ошибка была не в том, что мы взяли её, а в том, что мы сравнили её результат с результатом другой модели и назвали разницу падением видимости.
Читает ли ваш замер GigaChat, Алису и ИИ-ответы Яндекса?
Нет, ни на одном тарифе. Мы читаем ChatGPT, Gemini, Claude и Perplexity. Российские ИИ-поверхности в наш знаменатель не входят, и мы предпочитаем сказать это до того, как вы посмотрите на балл, а не после.
Можно ли увидеть свою разбивку по движкам без регистрации?
Да. Бесплатная проверка на нашем сайте просит домен и название бренда, показывает ответы по движкам и марки, названные вместо вас, без аккаунта и без почты. Одна проверка на домен в сутки. Полный аудит по заявке мы делаем бесплатно — с теми же границами, которые перечислены в этой статье.
Какой вывод честно следует из этой истории?
Число без имени модели и даты рядом с ним не является фактом о вашей видимости. В нашем случае из пяти «потерянных» ячеек три пришли с движка, у которого сменился прибор, а шесть названных марок не отняли у нас ни одной позиции.
Дисциплина, которая из этого следует, звучит скучно и стоит дорого. Отчёт обязан уметь не делать вывод. Не смягчать формулировку, не писать «возможно», а просто печатать охват вместо дельты и оставлять строку без объяснения до следующего замера. Инструмент, который на каждое движение находит причину, всегда найдёт её и там, где причины не было, — потому что правдоподобная причина существует всегда.
Проверить это на своём домене можно без нас и без регистрации: бесплатная проверка просит домен и название бренда и показывает разбивку по движкам, а не один усреднённый балл. Как устроен полный аудит и что в нём считается — в разборе как Webappski проверяет, рекомендует ли ИИ ваш сайт. Почему единому баллу видимости в принципе можно или нельзя доверять — в статье можно ли доверять оценке AI-видимости, а разбор того, кто вообще объясняет причину движения балла, — в статье балл видимости в нейросетях упал: кто объяснит, из-за чего именно.
О методе. Опубликовано 2 сентября 2026 года. Все числа взяты из наших собственных прогонов по бренду typelessform — нашему продукту, замеренному нашим инструментом: 11.06, 11.07, 13.08, 01.09 и 02.09.2026, одна корзина из 12 ячеек (три вопроса на четыре движка), один состав движков. Упоминания считаны одним методом для всех строк — регистронезависимые вхождения слова в тексте ответа; URL-ы и метаданные не считаются. Контрольные модели 13.08 прогонялись рядом с зачтёнными в тот же день на тех же вопросах. Цитаты из отчёта 1 сентября и из сырого ответа ChatGPT приведены дословно из сохранённых файлов прогона; сами отчёты не опубликованы. Расчёт «92% против 75%» — наш контрфактический пересчёт по таблице, а не печатное число отчёта. Пороги 3.0 пункта, пятый прогон, третий прогон и 25%, а также правило «ось, посчитанная по всем ячейкам, получает дельту без проверки покрытия» сверены по исходному коду трекера 2 сентября 2026 года. Версия пакета aeo-platform в npm в тот же день — 1.11.0; отчёт 1 сентября сгенерирован версией 1.10.0, отчёт 2 сентября — версией 1.11.0. Предупреждение о смене модели в коде 1.10.0 отсутствует и в коде 1.11.0 присутствует — сверено по обоим релизным срезам и по установленной из npm копии пакета, а не по памяти. Страницы документации GigaChat и ya.ru/ai прочитаны 2 сентября 2026 года; страница моделей Yandex Cloud в этот день отдала проверку на робота, поэтому идентификаторы её моделей здесь не приводятся. Это разобранный случай на одном бренде, а не измерение поведения движков в целом. Числа и границы меняются; при обновлении статьи мы правим дату.


