26 авг. 2026 г.

На что смотрит ChatGPT, когда цитирует источник?

Процитирует ли вас ChatGPT, решают три вещи: доступ краулера, индекс, к которому он обращается, и источники, на которые он уже опирается. Жёсткий переключатель — только первая, и только у неё есть прямая формулировка вендора. В выпуске мы читаем собственный robots.txt на камеру — вместе с ошибкой, которая в нём есть.

На что смотрит ChatGPT, когда цитирует источник?

Когда ChatGPT цитирует источник, он смотрит на три вещи: разрешён ли на вашем сайте OAI-SearchBot, есть ли вы в поисковом индексе, к которому он обращается, и присутствуете ли вы на справочных и сообществных площадках, на которые он опирается. Жёсткие ворота — только первое: OpenAI пишет, что сайты, отключившие OAI-SearchBot, в поисковых ответах ChatGPT не показываются.

Одна строка в файле, который большинство владельцев никогда не открывали, способна тихо убрать вас из ответов ChatGPT. Этот файл — robots.txt, текстовый файл в корне домена, который сообщает каждому краулеру, что ему можно забирать. В Answer Engine Optimization (AEO) — работе над сайтом так, чтобы ИИ-ассистенты его цитировали, — это единственная проверка, которая является переключателем, а не ремеслом. Тексты могут быть отличными, а разметка безупречной: если краулер не пришёл, ничего из этого нет в пуле, из которого собирается ответ.

Посмотрите выпуск

What does ChatGPT look at when citing a source?
Читаем собственный robots.txt на камеру — вместе с правилом, которое тихо перестаёт действовать.

Какой бот OpenAI на самом деле решает судьбу цитирования?

OAI-SearchBot, и проверка занимает две минуты. Откройте свой сайт с /robots.txt на конце и найдите это имя. OAI-SearchBot — поисковый краулер OpenAI, и собственная документация OpenAI говорит: сайты, отключившие его, в поисковых ответах ChatGPT показаны не будут. А теперь то, что путают почти все: GPTBot — другой бот с другой задачей. OpenAI описывает GPTBot как краулер контента, который может использоваться для обучения их базовых моделей. Заблокировать GPTBot никак не влияет на то, цитирует ли вас ChatGPT сегодня, — это влияет на то, попадут ли ваши тексты в будущую модель. Два бота, два вопроса. Читайте строку, а не ярлык.

Почему именованная группа отменяет правила, написанные для всех?

Потому что так устроена спецификация. Документация Google о том, как читается robots.txt, говорит: для конкретного краулера действительна только одна группа — краулер берёт ту, чей user-agent совпадает с ним точнее всего, и игнорирует все остальные. Несколькими строками ниже стоит фраза, которая тихо стоит людям видимости: группы для конкретного user-agent и глобальные группы не объединяются. Всё, что лежит в именованной группе, — это весь закон для данного краулера. Если вы когда-нибудь вставляли блок «ИИ-боты» из чьего-то поста в файл, где уже были аккуратные правила, перечитайте, что именно в этом блоке. Больше этот краулер ничего не увидит.

Что не так в нашем собственном robots.txt

Наши именованные группы ИИ-краулеров не наследуют ничего из правил выше — и мы показываем это на своём файле, а не оцениваем чужой. Первую проверку файл проходит: в нём есть группа для OAI-SearchBot с Allow. Но выше, в группе со звёздочкой, лежат наши реальные правила — не индексировать страницу 404, не индексировать портал. Ни одно из них до OAI-SearchBot не доходит. В тот момент, когда мы дали этому краулеру собственную именованную группу, он перестал наследовать что-либо. Это не баг в нашем файле, это спецификация ровно в том виде, в каком она написана. Здесь нам это стоит немного, потому что те пути закрыты логином, — а приватные страницы защищает логин, а не строка в этом файле.

Сколько краулеров в вашем файле реально важны?

Три из семнадцати, которые мы перечисляем. Цитирования сегодня могут стоить поисковый краулер OpenAI, краулер Perplexity и поисковый краулер Anthropic. Остальные — не мусор: GPTBot определяет, попадут ли ваши тексты в будущий обучающий корпус, вопрос реальный, просто более медленный. Но если с вас берут деньги за разблокировку обучающих ботов, «чтобы ИИ вас цитировал», вы платите не за ту строку. Обратите внимание и на единственный воротный краулер, который мы намеренно не назвали: Googlebot остаётся в группе со звёздочкой и поэтому продолжает соблюдать наши правила — а именно через Googlebot вы попадаете в индекс, о котором вторая проверка.

Bing или Google — к какому индексу обращается ChatGPT?

Обе половины верны, а большинство советов дают только одну. Половина первая: собственная страница помощи OpenAI о поиске в ChatGPT говорит о партнёрстве с другими поисковыми провайдерами и называет Bing и Shopify. Мы читали эту страницу напрямую 1 августа 2026 года, и Bing там был, — значит, присутствие в индексе Bing не потраченные впустую усилия. Половина вторая: Microsoft закрыл поисковые API Bing в августе 2025 года, и за тот год на панели из тысячи запросов, которую вёл Profound, пересечение ответов ChatGPT с результатами Bing упало с 26% до 8%, а пересечение с Google выросло примерно с 12% до 33%. В одном публичном тесте ChatGPT процитировал страницу, проиндексированную только в Google. Это чужие измерения, и мы передаём их как измерения, а не как закон. Вывод не «слушаться Bing» и не «игнорировать Bing»: основной вес — на Google (страницы с серверным рендерингом, честная карта сайта, незаблокированный Googlebot), а затем потратьте двадцать бесплатных минут и подайте ту же карту сайта в Bing Webmaster Tools, потому что OpenAI по-прежнему называет Bing и это ничего не стоит.

На какие источники ChatGPT уже опирается?

Не на весь веб равномерно. В опубликованном в этом году исследовании 600 000 случаев цитирования в США на Wikipedia и Reddit вместе пришлось больше четверти всего, что процитировал ChatGPT. Поэтому для малого бизнеса ход не в том, чтобы быть везде, а в том, чтобы быть корректно описанным на тех двух-трёх справочных и сообществных площадках, где вашу категорию действительно обсуждают. И сразу оговорка, которую лучше услышать от нас: в другом измерении, охватившем более 100 миллионов цитирований, доля Reddit обрушилась примерно с 60% до примерно 10% за шесть недель. Относитесь к набору источников как к погоде. Строка про краулера — это архитектура. Стройте на архитектуре, одевайтесь по погоде.

Что бесплатные сервисы видимости говорят о доступе краулеров?

Ничего — и это пробел в том, на что они вообще рассчитаны, а не претензия к ним. AI Visibility Checker у Ahrefs действительно бесплатный, без регистрации, с результатом за секунды, и отчёт за ним настоящий: всего упоминаний в ИИ, упоминания по платформам, главные темы, самые цитируемые домены и страницы. Поищите на этой странице слово «robots» — ноль совпадений. Ничего про доступ краулеров, ничего про OAI-SearchBot, ничего про GPTBot. Semrush той же формы и щедр на доступ — три прогона в день без регистрации — с добротным отчётом: балл видимости, упоминания, цитирования, охват платформ, самые цитируемые страницы, сравнение с конкурентами. Ни одно из этих измерений не про доступ краулера. Грейдер HubSpot не требует аккаунта для одного прогона и возвращает сводный балл по тональности, качеству присутствия, узнаваемости бренда, доле голоса и конкурентной среде. Пять измерений, и ни одного про доступ. Если бы у вас была неверна та единственная воротная строка, все три выдали бы низкое число и ни один не сказал бы почему.

Что вместо этого делает наш открытый трекер

Он привязывает каждого бота к тому, сколько реально стоит его блокировка. aeo-platform — наш собственный трекер, бесплатный и с открытым кодом на npm, и его аудит краулинга не сообщает «сколько ботов заблокировано». Он размечает каждого по уровню: поисковый уровень означает, что блокировка убирает вас из ответов этого движка; обучающий уровень — только обучающий корпус, без измеренного влияния на сегодняшние цитирования; пользовательский уровень — запрос инициирован человеком и ваш файл обычно всё равно игнорирует. Плюс там есть предохранитель, который отказывается писать вам задачу «разблокировать обучающего бота». Этот отказ и есть продукт: инструмент, который выдаёт пять срочных на вид задач по доступу, когда изменить цитирование может только одна, продаёт занятость, а не видимость.

Где по этому чек-листу проваливаемся мы сами

На третьей проверке, и сильно. Поищите сегодня в Wikipedia «Webappski» — ноль результатов, мы перепроверили это 25 августа 2026 года. Нас нет на площадке, на которую ChatGPT опирается сильнее всего, и починить это статьёй о самих себе нельзя: Wikipedia требует сначала независимых публикаций. Эта проверка у нас на доске красная и останется такой ещё какое-то время. Мы лучше покажем это, чем продадим вам обходной путь, — и в этом честная форма всего чек-листа: две вещи из трёх зарабатываются медленно, и только первая является переключателем, который можно щёлкнуть сегодня днём.

Полный чек-лист по ChatGPT

Пять проверок по порядку, которые мы проходим для каждого клиента. Первая: OAI-SearchBot разрешён в robots.txt — единственная из пяти, которая является переключателем. Вторая: прочитайте именованную группу, которую вы ему дали, — она не наследует ничего из группы выше. Третья: страницы с серверным рендерингом в индексе Google и незаблокированный Googlebot. Четвёртая: карта сайта, поданная в Bing Webmaster Tools, потому что OpenAI по-прежнему называет Bing. Пятая: честное присутствие на тех двух-трёх справочных и сообществных площадках, где обсуждают вашу категорию, — и никакой веры в то, что этот набор останется прежним. Первая занимает две минуты, и большинство сайтов туда ни разу не заглядывали.

Частые вопросы

Стоит ли блокировать GPTBot?

Это решение про обучение, а не про цитирование. OpenAI описывает GPTBot как краулер контента, который может пойти на обучение их базовых моделей, поэтому его блокировка не убирает вас из сегодняшних ответов ChatGPT — это делает OAI-SearchBot. Блокируйте GPTBot, если не хотите, чтобы ваши тексты попали в будущую модель, и понимайте, что для видимости это не даёт ничего ни в ту, ни в другую сторону.

Мы вставили блок ИИ-ботов в robots.txt. Это безопасно?

Только если вы прочитали, что в этом блоке. Назвав краулера, вы создаёте отдельную группу, и по спецификации это единственная группа, которой он подчиняется: группы для конкретного user-agent и глобальные не объединяются. Любое правило Disallow из группы со звёздочкой перестаёт действовать для всех ботов, которых вы только что назвали. Перечитайте вставленный блок так, будто для этих краулеров он и есть весь ваш файл. Так оно и есть.

Нужно ли по-прежнему быть в Bing, чтобы вас цитировал ChatGPT?

Это по-прежнему помогает и стоит дёшево, но вес сместился к Google. Страница помощи OpenAI всё ещё называет Bing поисковым партнёром, поэтому карта сайта в Bing Webmaster Tools стоит двадцати бесплатных минут. Независимые панельные измерения за 2025 год показывают снижение пересечения с Bing и рост пересечения с Google — значит, основную работу вкладывайте сначала в индексируемость в Google.

Покажет ли бесплатный сервис, что краулер заблокирован?

Проверенные три — нет. Ahrefs, Semrush и HubSpot отчитываются про упоминания, цитируемые страницы, охват платформ и сводные баллы: полезно для вопроса «появляюсь ли я», молчание на вопрос «почему нет». Заблокированный поисковый краулер и скучная страница дают в этих отчётах одинаково низкое число. Проверьте robots.txt сами или возьмите трекер, чей аудит называет уровень каждого бота.

Как попасть в источники, на которые опирается ChatGPT?

Медленно и через то, что вас корректно описывают, а не через публикации о себе. Wikipedia требует сначала независимого освещения, поэтому пресса и настоящие сторонние тексты идут раньше любой энциклопедической статьи. На сообществных площадках: присутствуйте там, где вашу категорию реально обсуждают, и будьте там точны. Считайте набор нестабильным — один измеренный обвал увёл долю Reddit примерно с 60% до 10% за шесть недель.

Пройти эти пять проверок на вашем сайте?

Мы проходим все пять — доступ краулера, наследование групп, покрытие в индексе, подачу в Bing и присутствие в источниках — на реальных клиентских сайтах, и первый аудит видимости в ИИ бесплатный. Если хотите понять, может ли ChatGPT вообще до вас дотянуться, закажите бесплатный аудит на webappski.com.

← Вернуться ко всем постам