Запрет GPTBot не убирает сайт из ответов ChatGPT. За обучение моделей и за показ в поиске ChatGPT отвечают разные роботы, и правило в robots.txt для одного не действует на другого. То же у Anthropic, Google и Яндекса.
Поэтому строка «закрыть нейросети», написанная одним движением, обычно даёт худший из возможных результатов: контент всё равно попадает в обучающие датасеты через тех ботов, о которых владелец не знал, а из ответов ассистентов сайт исчезает. Ниже — кто есть кто, дословно по документации вендоров, и что с этим делать.
Все user-agent-строки и цитаты сверены с первоисточниками 1 сентября 2026 года. Список меняется: страница Anthropic обновлена 7 апреля 2026, а у OpenAI роботов уже четыре — к поисковому, обучающему и пользовательскому добавился рекламный.
Что такое ИИ-краулер и чем он отличается от поискового робота
ИИ-краулер — программа, которая обходит сайты и забирает содержимое страниц для работы языковых моделей: для обучения, для поискового индекса ассистента или для ответа на конкретный вопрос человека.
Технически он ничем не отличается от Googlebot: тот же HTTP-запрос, тот же заголовок User-Agent, то же чтение robots.txt. Отличается назначение — и последствия для сайта. Классический робот приводит человека на страницу. Краулер ассистента чаще отвечает вместо страницы: спросивший получает готовый текст, а переход может не состояться. Со стороны выдачи это разбирали в материале про режим ИИ и обзоры Google.
Решение «пускать или не пускать» — не вопрос безопасности. Это вопрос о том, хотите ли вы, чтобы ассистент называл ваш бренд. Что такое GEO — оптимизация под генеративные системы — отдельная тема, но начинается она с того, что робот должен физически дойти до текста.
Четыре типа ботов, которые нельзя смешивать

Такие роботы делятся на четыре группы по задаче. Правила для них пишутся разные.
| Тип | Что делает | Что будет, если закрыть |
|---|---|---|
| Обучающий | забирает контент в датасеты для тренировки моделей | контент не попадёт в будущие версии модели; на текущие ответы не влияет |
| Поисковый | строит индекс, из которого ассистент берёт источники для ответа | сайт перестаёт появляться в ответах ассистента |
| Пользовательский | открывает страницу в момент, когда человек задал вопрос со ссылкой | ассистент не прочитает страницу по прямой просьбе |
| Служебный | проверяет рекламу, доступность, снимает превью | зависит от сервиса, к видимости обычно отношения не имеет |
Смешивать их — и есть та ошибка, из-за которой сайты выпадают из ответов ассистентов, ничего не выигрывая взамен.
Кто именно ходит по сайтам: справочник user-agent
Ниже — роботы, чьи ответы читает русскоязычная аудитория. Строки и формулировки мы брали из официальной документации вендоров, ссылки стоят рядом с каждым разделом.
OpenAI: четыре робота и полная независимость правил
Документация OpenAI описывает четыре агента:
| User-agent | Задача |
|---|---|
GPTBot | сбор контента для обучения базовых моделей — тех, на которых работает GPT |
OAI-SearchBot | поиск: показ сайта в поисковых функциях ChatGPT |
ChatGPT-User | переход по ссылке в момент, когда о ней попросили в чате |
OAI-AdsBot | проверка страниц, поданных под рекламу в ChatGPT |
Ключевая фраза документации: «Each setting is independent of the others» — каждая настройка независима от остальных. Там же приведён и рабочий сценарий: разрешить OAI-SearchBot, чтобы появляться в результатах, и запретить GPTBot, чтобы контент не шёл в обучение.
Что произойдёт при запрете поискового робота, OpenAI формулирует прямо: сайты, отказавшиеся от OAI-SearchBot, «will not be shown in ChatGPT search answers, though can still appear as navigational links» — в поисковых ответах ChatGPT их не покажут, хотя навигационной ссылкой сайт появиться ещё может.
У ChatGPT-User есть особенность: раз запрос инициирует человек, «robots.txt rules may not apply» — правила robots.txt могут не применяться. Это заявленное поведение, а не сбой.
IP-диапазоны OpenAI публикует отдельными файлами — openai.com/gptbot.json, /searchbot.json, /chatgpt-user.json, /adsbot.json. Изменения в robots.txt для поиска подхватываются примерно за сутки.
Anthropic: три робота и поддержка Crawl-delay
Страница Anthropic про краулеров обновлена 7 апреля 2026 и описывает три агента:
ClaudeBot— обучение. При запрете «future materials should be excluded from our AI model training datasets»;Claude-SearchBot— индексация для качества поисковых ответов Claude;Claude-User— доступ к странице, когда о ней попросили в чате.
Anthropic заявляет, что её боты уважают директивы robots.txt и не пытаются обходить капчу. Дополнительно поддерживается нестандартная директива Crawl-delay:
User-agent: ClaudeBot
Crawl-delay: 1
В документации Anthropic есть предупреждение, о котором обычно забывают: блокировка по IP вместо robots.txt может не сработать. Она мешает роботу прочитать сам файл с правилами.
Perplexity: два робота, один из них robots.txt не подчиняется
Документация Perplexity описывает PerplexityBot и Perplexity-User. Первый — поисковый, и про него сказано: «It is not used to crawl content for AI foundation models», для обучения он не используется.
Про второй в документации написано открытым текстом: «Since a user requested the fetch, this fetcher generally ignores robots.txt rules» — раз запрос сделал пользователь, этот загрузчик обычно игнорирует правила robots.txt.
Perplexity в той же документации приводит инструкции по настройке Cloudflare WAF и AWS WAF. Вендор признаёт: файрвол часто блокирует роботов раньше, чем до них доходит очередь robots.txt.
Google: Google-Extended не влияет на обзоры от ИИ
Здесь самая частая путаница. Google-Extended — не робот. В справке Google сказано, что у него нет отдельной user-agent-строки: обход идёт обычными агентами Google, а токен в robots.txt работает «in a control capacity» — только управляющей меткой.
Управляет он обучением Gemini и подстановкой контента в ответы Gemini Apps. Дальше формулировка справки: «Google-Extended does not impact a site’s inclusion in Google Search nor is it used as a ranking signal» — на попадание сайта в поиск Google не влияет и фактором ранжирования не является.
А что с обзорами от ИИ и режимом ИИ? Справка Google по ИИ-функциям в поиске отвечает без двусмысленностей:
AI is built into Search and integral to how Search functions, which is why robots.txt directives for Googlebot is the control for site owners to manage access to how their sites are crawled for Search.
То есть закрыть Google-Extended и считать, что сайт исчез из обзоров, — ошибка. Эти блоки берут данные из поискового индекса, который наполняет Googlebot. Ограничить показ можно только nosnippet, data-nosnippet, max-snippet или noindex — а они бьют и по обычной выдаче.
Заодно справка снимает вопрос про «особую оптимизацию» под эти блоки: никаких дополнительных требований для попадания в обзоры и режим ИИ нет.
Яндекс: YandexAdditional, о котором почти никто не пишет
У Яндекса есть свой токен для ответов с нейросетью, и устроен он иначе, чем у остальных. В списке роботов Яндекса YandexAdditional описан так: учитывается при обработке robots.txt «для ограничения отображения контента страницы в быстрых ответах с YandexGPT и в ответах Поиска с Алисой».
Разница принципиальная. GPTBot ходит за контентом — запрет останавливает сбор. YandexAdditional за контентом не ходит вообще: он «применяется к страницам, проиндексированным основным индексирующим роботом». Правило управляет не обходом, а показом уже проиндексированного текста в готовом ответе.
Второй нюанс из той же таблицы: в колонке «Учитывает общие правила, указанные в robots.txt» у него стоит «Нет». Строки User-agent: * и User-agent: Yandex его не покрывают — писать нужно явно. Это подтверждает и справка про user-agent: если найдены директивы для конкретного робота, общие правила не используются.
Остальные: Bingbot, CCBot и краулеры соцсетей
Пять вендоров выше закрывают ассистентов, которыми пользуется русскоязычная аудитория. Дальше идёт длинный хвост из десятков ботов, и несколько имён из него стоит знать.
Bingbot — обычный поисковый робот Microsoft, но именно из индекса Bing берёт данные Copilot. Отдельного ИИ-агента у Microsoft нет, и закрывать Bingbot ради выхода из Copilot не нужно: для этого есть метатеги. По объявлению Bing Webmaster, контент с меткой NOARCHIVE «will not be included in Bing Chat answers» и не идёт в обучение моделей Microsoft, а метка NOCACHE оставляет в ответе только URL, заголовок и сниппет. При этом — дословно — «content with the NOCACHE tag or NOARCHIVE tag will still appear in our search results»: на позиции в поиске это не влияет.
CCBot — робот некоммерческого проекта Common Crawl. Сам он моделей не обучает: он собирает открытый архив веба, которым потом пользуются сторонние разработчики, в том числе создатели языковых моделей. Запрет CCBot закрывает попадание в новые срезы архива. На уже собранные он не действует — задним числом контент оттуда не убрать.
Ещё несколько имён встречаются в логах регулярно: Meta-ExternalAgent, Amazonbot, Bytespider (ByteDance). Отдельно стоит Applebot-Extended — в логах его не будет никогда: Apple пишет, что он «does not crawl webpages» и лишь определяет, как использовать данные, собранные обычным Applebot. Такой же управляющий токен, как Google-Extended.
Полный справочник по хвосту быстро устаревает, поэтому проверяйте документацию вендора в момент, когда увидели незнакомую строку в логе, а не список из статьи.
Что писать в robots.txt
Два сценария закрывают большинство задач. Оба предполагают, что до этого сайт не был закрыт целиком.
Максимальная видимость в ассистентах — не запрещаем ничего, кроме служебных разделов. Отдельных строк не нужно: если робот не запрещён, он разрешён.
Видимость без обучения — закрываем обучающих, поисковых не трогаем вовсе:
User-agent: GPTBot
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: Google-Extended
Disallow: /
Здесь есть ловушка, на которой ошибаются чаще всего: дописывать Allow: / для поисковых роботов не нужно, и это вредно. Робот выбирает ровно одну группу правил — самую конкретную. Спецификация Google формулирует это прямо: «Only one group is valid for a particular crawler», а группы для конкретного агента и общая * «are not combined». То же в RFC 9309.
Значит, стоит завести персональную группу для OAI-SearchBot — и он перестанет читать User-agent: *, а вместе с ней и ваши запреты на /admin, корзину и страницы поиска. Робот, которому ничего не запрещено, разрешён по умолчанию — отдельная строка ему не требуется.
Чего в файле быть не должно: строки Disallow: / для Googlebot, YandexBot, OAI-SearchBot, PerplexityBot и Claude-SearchBot. Каждая убирает сайт из ответов, а не из обучения.
Если нужно убрать сайт из ответов Алисы и быстрых ответов, но оставить в обычном поиске, добавьте строку для Яндекса:
User-agent: YandexAdditional
Disallow: /
У нас самих на момент публикации в robots.txt открыто всё, кроме админки и API, а рядом лежит llms.txt. Мы продаём видимость в языковых моделях, и закрытый от них сайт был бы странной рекомендацией.
Пускать роботов и попадать в ответы — не одно и то же: доступ это необходимое условие, а не достаточное. Что должно быть в самом тексте, чтобы модель его процитировала, разбирали отдельно; там же — зачем нужен llms.txt и работает ли он.
Поиск роботов в логах сервера
Проверка занимает одну команду. В логах nginx:
grep -oiE "GPTBot|OAI-SearchBot|ChatGPT-User|ClaudeBot|Claude-SearchBot|Claude-User|PerplexityBot|Perplexity-User|Bingbot" /var/log/nginx/access.log | sort | uniq -c | sort -rn
Команда покажет, кто из роботов приходил и сколько раз. Второй вопрос — с каким ответом их встретил сервер; для этого нужен код статуса, в combined-логе это девятое поле:
grep -iE "OAI-SearchBot|PerplexityBot|Claude-SearchBot" /var/log/nginx/access.log | awk '{print $9}' | sort | uniq -c
Что здесь читать. Логи — единственный надёжный источник: внешние сервисы не покажут, кого вы пускаете на самом деле. Полное отсутствие OAI-SearchBot и PerplexityBot при живом трафике означает, что их блокирует файрвол или CDN, а не robots.txt. Массовые 403 в ответах — то же самое.
YandexAdditional искать в логах бессмысленно: запросов он не делает — правило для него читается при обработке robots.txt.
Мелочь, которая экономит время: при запросе самого robots.txt OpenAI добавляет в user-agent маркер robots.txt — такие обращения видно в логах, даже когда пути не пишутся.
Как отличить настоящего бота от подделки
Строка User-Agent подделывается в одну строку кода, поэтому сама по себе она ничего не доказывает. Способов проверки два.
Сверка с опубликованными адресами. OpenAI, Anthropic и Perplexity публикуют диапазоны IP в виде json-файлов. Адрес из лога должен быть в списке.
Обратный DNS. Так проверяется Яндекс: его список IP не публикуется, потому что адреса часто меняются. Справка называет автономные сети AS13238, AS208722 и AS212066 и предлагает делать обратный DNS-запрос с прямой перепроверкой результата.
Зачем это нужно: под чужими именами ходят обычные парсеры, и блокировать их по user-agent бессмысленно — они его сменят.
robots.txt — сигнал, а не забор

Файл robots.txt не запрещает доступ технически. Он сообщает о предпочтении, и добросовестный робот его выполняет.
Что бывает, когда предпочтение игнорируют, документально описано. В августе 2025 года Cloudflare опубликовала расследование про Perplexity: клиенты запретили сервис в robots.txt и дополнительно заблокировали оба его заявленных робота правилами WAF, но контент продолжал попадать в ответы.
Cloudflare провела тесты на новых доменах и обнаружила недекларированный краулер: он использовал адреса вне официального диапазона Perplexity и менял их в ответ на блокировки, а запросы шли из разных автономных систем. Масштаб — «десятки тысяч доменов и миллионы запросов в сутки». Поведение признано противоречащим RFC 9309 — стандарту Robots Exclusion Protocol. Perplexity исключили из списка верифицированных ботов Cloudflare.
Отсюда две разные задачи и два разных инструмента. Закрыть контент по-настоящему robots.txt не поможет — нужны серверные ограничения. А вот управлять видимостью в ассистентах он позволяет: крупные вендоры его соблюдают.
Файл robots.txt в этой истории решает не задачу защиты, а задачу выбора. Он не мешает забрать текст тому, кто твёрдо решил его забрать. Зато он определяет, попадёте ли вы в ответ ассистента, — и именно поэтому строка «закрыть все нейросети» стоит дороже, чем кажется.
Частые вопросы
Если запретить GPTBot, сайт исчезнет из ChatGPT?
Нет. GPTBot отвечает за обучение. За показ в поисковых функциях ChatGPT отвечает OAI-SearchBot — он и решает, появится ли сайт в ответе.
Стоит ли закрывать обучающих роботов? Зависит от того, чем вы торгуете. Для медиа и сервисов с уникальными базами — аргумент есть. Для компании, которой нужны упоминания в ответах ассистентов, закрытие обучающих ботов ничего не даёт и ничему не мешает: видимость определяют поисковые роботы.
Помогает ли Disallow: / для User-agent: *?
Такая строка закроет сайт и от обычного поиска. Роботы, инициированные пользователем — ChatGPT-User и Perplexity-User, — её по документации всё равно могут не соблюдать.
Чем проверить, что сайт открыт для ассистентов?
Посмотреть robots.txt на явные запреты, проверить логи на приход поисковых роботов и убедиться, что WAF не отдаёт им 403. Базовые вещи можно прогнать бесплатной проверкой сайта — она смотрит доступ ИИ-агентов среди прочих пунктов.
Как понять, что нас реально стали упоминать? Доступ роботов и упоминания в ответах — разные метрики. Способы замера разбирали в статье про мониторинг упоминаний бренда в нейросетях.
Ограничения этого материала
Список роботов стареет. Все строки сверены с документацией вендоров 1 сентября 2026 года. Anthropic обновляла свою страницу в апреле 2026, OpenAI добавила рекламного робота — за полгода набор меняется. Перед правкой robots.txt открывайте документацию, а не статью, включая эту.
Долю игнорирования robots.txt никто публично не измерял. Есть один документированный случай — Cloudflare против Perplexity. Цифры вида «столько-то процентов роботов нарушают запреты» встречаются в блогах, но первоисточников за ними мы не нашли и повторять их не будем.
Мы не замеряли, что происходит с трафиком после блокировки. Насколько падает или растёт число упоминаний бренда в ответах ассистентов после правки robots.txt — эксперимента с контрольной группой у нас нет. Обещать здесь цифры было бы выдумкой.
Наличие доступа не гарантирует попадания в ответ. Робот, дошедший до страницы, — необходимое условие. Достаточным его не делает ничто: выбор источника остаётся за моделью.
Материал подготовил Даниил Кизилов. Данные сверены с официальной документацией OpenAI, Anthropic, Perplexity, Google и Яндекса 1 сентября 2026 года.
Нужно понять, видят ли ассистенты ваш сайт и что показывают по вашим запросам, — напишите нам.
Видят ли нейросети ваш сайт
Бесплатная проверка по 26 пунктам — с конкретными приоритетами.




