Каждый день по сайтам ходят полтора десятка роботов нейросетей: одни собирают материал для обучения будущих моделей, другие приходят прямо в момент, когда человек задал вопрос, и читают вашу страницу, чтобы сформулировать ответ. Закрыть их всех одной строкой в robots.txt просто — и это самая частая дорогая ошибка, потому что вместе с обучающими краулерами вы отрезаете и тех, кто приводит вам людей. Разбираем, кто из ботов что делает с контентом, что вы теряете и что защищаете в каждом сценарии, как разрешить выборочно и как проверить, что политика доступа действительно работает.

Зачем вообще решать, кого пускать

Решение принимается по умолчанию, даже если вы его не принимали. Пустой robots.txt означает «заходите все». Строка User-agent: * / Disallow: / означает «никому нельзя». Оба варианта — это выбор, просто во втором случае осознанный, а в первом нет.

Вопрос стал практическим, потому что у доступа появилась цена в обе стороны. Пуская роботов, вы отдаёте контент в системы, которые перескажут его своими словами и человек может не дойти до сайта. Закрывая, вы гарантированно не попадёте в ответы — а это уже канал, из которого приходят люди.

Правильная постановка вопроса не «пускать или нет», а «кого именно и на какие разделы». Роботы разные, и последствия от их блокировки разные.

Два типа AI-ботов, и почему их нельзя равнять

Ключевое различие, из-за которого чаще всего ошибаются: обучающий обход и обращение в момент живого запроса — это разные роботы с разными именами.

тип 1Обучающий обход. GPTBot, ClaudeBot, Google-Extended, CCBot, Applebot-Extended. Собирают материал впрок, для следующей версии модели. Ваша страница попадёт в корпус, но окажется ли в конкретном ответе — вопрос открытый
тип 2Живой запрос пользователя. ChatGPT-User, Claude-User, Perplexity-User. Прямо сейчас человек задал вопрос, и модель пошла на вашу страницу за ответом. Именно отсюда берутся ссылки, по которым к вам приходят
тип 3Поисковый индекс сервиса. OAI-SearchBot, PerplexityBot. Строят собственный индекс, из которого потом отбираются источники для ответов
ошибкаЗакрыть всё разом маской по слову «GPT» или «AI» — и вместе с обучением отрезать типы 2 и 3, то есть сам канал переходов

Эта разница — центральная. Блокировка обучающего краулера стоит вам присутствия в будущих версиях модели, эффект отложенный и вероятностный. Блокировка робота живого запроса стоит вам ссылок и переходов прямо сейчас, эффект немедленный и полностью ваш.

⚠️

Самая дорогая опечатка в robots.txt. Правило User-agent: GPTBot закрывает только обучающий обход OpenAI. А вот попытка «закрыть всё от OpenAI» через маски или через Disallow для ChatGPT-User убирает вас из живых ответов ChatGPT — то есть из того единственного места, откуда этот сервис вообще приводит трафик.

Справочник: кто ходит по сайту и что делает с контентом

Актуальный набор на 2026 год. Колонка «что теряете при блокировке» — то, ради чего эту таблицу и стоит читать.

User-agentВладелецНазначениеЧто теряете при блокировке
ChatGPT-UserOpenAIЧтение страницы в момент запроса пользователяСсылки и переходы из ChatGPT — немедленно
OAI-SearchBotOpenAIИндекс для поиска ChatGPTПопадание в выдачу ChatGPT Search
GPTBotOpenAIОбучение моделейПрисутствие в будущих версиях — отложенно
Claude-UserAnthropicЧтение в момент запросаСсылки и переходы из Claude
ClaudeBot, anthropic-aiAnthropicОбучениеПрисутствие в будущих версиях
Perplexity-UserPerplexityЧтение в момент запросаСсылки и переходы из Perplexity
PerplexityBotPerplexityПостроение индексаПопадание в источники Perplexity
Google-ExtendedGoogleОбучение GeminiПрисутствие в Gemini. Не влияет на обычную выдачу Google
Applebot-ExtendedAppleОбучение Apple IntelligenceПрисутствие в моделях Apple
YandexAdditionalЯндексОбход для НейроПрисутствие в ответах Нейро
CCBotCommon CrawlОткрытый корпус, на нём учатся многиеКосвенное присутствие во множестве моделей
BytespiderByteDanceОбучениеПрисутствие в моделях ByteDance
meta-externalagentMetaОбучениеПрисутствие в моделях Meta
Amazonbot, cohere-ai, MistralAI-UserпрочиеОбучение и запросыПрисутствие в соответствующих сервисах
💡

Отдельно про Google-Extended. Это самая безопасная блокировка из всех: она отключает использование контента для обучения Gemini и никак не влияет на индексацию в обычном поиске Google — за неё отвечает Googlebot, это другой робот. Если хочется закрыть обучение, но страшно потерять поиск, начинать разумно именно отсюда.

Что вы теряете, закрывая доступ

Потери зависят от того, кого именно закрыли.

При блокировке роботов живого запроса

  • Ссылки в ответах исчезают сразу. Модель не может сослаться на страницу, которую ей не дали прочитать.
  • Переходы прекращаются. Люди, которые пришли бы из диалога, не приходят.
  • Про вас расскажут по чужим источникам. Модель ответит на вопрос всё равно — просто взяв данные у конкурента или из старой перепечатки, где сведения могут быть неверными.

При блокировке обучающих краулеров

  • Отложенная потеря присутствия. В следующей версии модели ваших материалов не будет.
  • Ослабление связки бренда с темой. Модель хуже связывает компанию с её нишей — подробно этот механизм разобран в статье про продвижение бренда в нейросетях.
  • Эффект не мгновенный. То, что уже собрано, из корпуса не исчезнет.
⚠️

Контент всё равно перескажут. Блокировка не убирает вашу тему из ответов — она убирает вас как источник. Вопрос «сколько стоит имплантация» получит ответ в любом случае: по данным конкурентов, агрегаторов или устаревших перепечаток. Закрываясь, вы отказываетесь не от участия в теме, а от авторства в ней.

Что вы защищаете, закрывая доступ

Аргументы в пользу блокировки существуют, и они не сводятся к «жалко контент».

  • Уникальные данные с коммерческой ценностью. Собственные исследования, базы, методики, расчёты — то, что стоило денег и составляет преимущество.
  • Платный и закрытый контент. Материалы по подписке, за регистрацией, курсы. Здесь блокировка — вопрос выполнения обязательств перед клиентами.
  • Лицензионные ограничения. Если контент лицензирован третьей стороной и вы не вправе передавать его для обучения.
  • Персональные данные. Профили, отзывы с личной информацией, каталоги специалистов — здесь блокировка снижает риски.
  • Позиция по авторскому праву. Некоторые компании принципиально не отдают материалы для обучения без соглашения. Это законная позиция.
  • Нагрузка. Редко, но на больших каталогах интенсивный обход заметен по ресурсам.

Цена закрытия доступа: что теряете и что защищаете

Слева потери: ссылки исчезают сразу, переходы прекращаются, тему раскроют по чужим источникам, в следующей версии модели материалов не будет. Справа что защищает блокировка: уникальные данные, платный контент, лицензии, персональные данные, позиция по авторскому праву, нагрузка.Что теряетеСсылки в ответах исчезают сразуПереходы из диалогов прекращаютсяПро вас расскажут по чужим источникамВ следующей версии модели ваших материаловне будетМодель хуже связывает компанию с её нишейЧто защищаетеУникальные данные: исследования, базы,методики, расчётыПлатный и закрытый контент, материалы поподпискеЛицензионный контент, который вы не вправепередаватьПерсональные данные: профили, отзывы,каталоги людейПозиция по авторскому праву — она законнаяНагрузка: на больших каталогах обход заметен
Сравнение. Две стороны решения о доступе AI-ботов — потери и то, ради чего блокировку всё-таки ставят.

Как принять решение: разбор по типам бизнеса

Универсального ответа нет, но есть закономерность: чем больше бизнес зависит от привлечения новых клиентов через поиск, тем дороже обходится блокировка.

Тип бизнесаРоботы живого запросаОбучающие краулерыЛогика
Услуги, клиники, юристы, агентстваПускатьПускатьКанал привлечения важнее защиты текстов, которые и так публичны
Интернет-магазинПускатьПускатьКарточки и категории должны попадать в подборки и сравнения
Медиа и изданияПускатьПо ситуацииСсылки нужны, но обучение отдаётся бесплатно — предмет отдельного решения
SaaS и B2B-продуктПускатьПускатьДокументация в ответах моделей работает как канал знакомства с продуктом
Исследования, аналитика, базы данныхПускать витринуЗакрывать данныеАнонсы открыты, сами данные — нет
Платный контент, курсыПускать открытую частьЗакрывать закрытуюОбязательства перед платящими клиентами
Персональные данные, каталоги людейПо ситуацииЗакрыватьСнижение правовых рисков

Для подавляющего большинства коммерческих сайтов ответ один: пускать всех, закрывая точечно отдельные разделы. Полная блокировка оправдана редко и почти всегда там, где контент сам является товаром.

Как разрешить выборочно: синтаксис robots.txt

Правила читаются по группам User-agent. Робот выбирает наиболее специфичную группу для себя и игнорирует остальные, включая *.

рекомендуемый вариант для большинства сайтов
# Роботы живого запроса — пускаем: отсюда приходят люди
User-agent: ChatGPT-User
User-agent: Claude-User
User-agent: Perplexity-User
User-agent: MistralAI-User
Allow: /

# Поисковые индексы AI-сервисов — пускаем
User-agent: OAI-SearchBot
User-agent: PerplexityBot
Allow: /

# Обучающие краулеры — пускаем, но закрываем чувствительные разделы
User-agent: GPTBot
User-agent: ClaudeBot
User-agent: Google-Extended
User-agent: Applebot-Extended
User-agent: CCBot
Disallow: /lk/
Disallow: /clients/
Disallow: /research/data/

# Общее правило
User-agent: *
Disallow: /wp-admin/
Allow: /wp-admin/admin-ajax.php

Sitemap: https://example.ru/sitemap.xml
если нужно закрыть обучение полностью переходы при этом сохраняются
# Обучение запрещаем
User-agent: GPTBot
Disallow: /

User-agent: ClaudeBot
Disallow: /

User-agent: anthropic-ai
Disallow: /

User-agent: Google-Extended
Disallow: /

User-agent: Applebot-Extended
Disallow: /

User-agent: CCBot
Disallow: /

User-agent: Bytespider
Disallow: /

# А живые запросы — разрешаем, иначе теряем канал
User-agent: ChatGPT-User
Allow: /

User-agent: Claude-User
Allow: /

User-agent: Perplexity-User
Allow: /
💡

Про порядок и специфичность. Если для робота есть своя группа, правило User-agent: * он не читает вовсе. Поэтому нельзя написать общий Disallow: / и рассчитывать, что отдельные Allow ниже что-то откроют для тех, у кого своей группы нет. Каждому роботу, чьё поведение отличается от общего, нужна собственная группа.

Где заканчивается robots.txt: он рекомендательный

robots.txt — это просьба, а не запрет. Технически он не мешает скачать страницу: файл лежит в открытом доступе, его читают добровольно, и соблюдение зависит от добросовестности робота.

Крупные вендоры — OpenAI, Anthropic, Google, Perplexity — правила соблюдают: для них это репутационный вопрос, и нарушения быстро становятся публичными. Но существует прослойка менее заметных сборщиков, которые обходят сайты, не представляясь или маскируясь под браузер. На них robots.txt не действует никак.

Отсюда практический вывод: если контент действительно нельзя отдавать, robots.txt для этого недостаточен. Он выражает вашу позицию и работает с теми, кто её уважает, — но не является технической защитой.

Где заканчивается robots.txt

Вопрос: контент действительно нельзя отдавать? Если да — robots.txt недостаточен, нужны авторизация, блокировка по диапазонам IP вендора или ограничение частоты на WAF. Если нет — robots.txt выражает позицию и работает: OpenAI, Anthropic, Google, Perplexity правила соблюдают.Контент действительно нельзя отдавать?ДАrobots.txt для этого малоавторизация, блок по диапазонам IP, лимит частоты иWAFНЕТrobots.txt работаеткрупные вендоры соблюдают правила: эторепутация
Схема. robots.txt — просьба, а не запрет: средство выбирают по тому, можно ли отдавать контент вообще.

Что реально ограничивает доступ

По возрастанию надёжности и стоимости внедрения.

СредствоНасколько надёжноЦена внедренияПобочные эффекты
robots.txtРаботает с добросовестнымиМинимальнаяНет
Мета-тег noai, noimageaiСоблюдается частью сервисовМинимальнаяНет
Блокировка по User-Agent на сервереОстанавливает тех, кто честно представляетсяНизкаяРиск задеть лишних при неточной маске
Блокировка по диапазонам IP вендораНадёжнее: подделать сложнееСредняя, диапазоны меняютсяТребует поддержки списков
Авторизация, платный доступРаботает всегдаВысокаяКонтент выпадает и из обычного поиска
Ограничение частоты и WAFПротив массового скачиванияСредняяВозможны ложные срабатывания
nginx блокировка обучающих краулеров на уровне сервера
map $http_user_agent $block_ai_training {
    default 0;
    "~*(GPTBot|ClaudeBot|anthropic-ai|Google-Extended)"    1;
    "~*(Applebot-Extended|CCBot|Bytespider|meta-external)" 1;
}

# в server-блоке:
# if ($block_ai_training) { return 403; }
⚠️

Осторожно с масками. Шаблон вида ~*ai совпадёт с половиной обычных браузеров: подстрока «ai» встречается в Mail, Safari и множестве других строк. Маски нужно писать по полным именам роботов, а после внедрения — проверять по логам, что живые посетители не получают 403.

llms.txt рядом с robots.txt: разные задачи

Файлы часто путают, хотя они решают противоположные задачи.

robots.txtllms.txt
Что говоритКуда нельзя ходитьЧто стоит прочитать в первую очередь
ХарактерОграничениеРекомендация и навигация
ФорматДирективы User-agent / DisallowMarkdown со ссылками и описаниями
Кто читаетВсе роботы, включая поисковыеЯзыковые модели
ОбязательностьУстоявшийся стандартМолодое соглашение, поддержка неполная

Правильная связка: robots.txt задаёт границы доступа, llms.txt внутри этих границ подсказывает, что важнее всего. Противоречия между ними быть не должно — бессмысленно перечислять в llms.txt раздел, закрытый в robots.txt. Как составить сам файл, пошагово разобрано в статье llms.txt: зачем нужен и как составить.

Как проверить, что политика работает

Написать правила мало — нужно убедиться, что они применяются именно так, как задумано. Проверка делается в три уровня.

Уровень 1. Синтаксис

Откройте /robots.txt в браузере: файл должен отдаваться с кодом 200 и содержать ровно то, что вы написали. Частая неприятность — файл генерируется плагином и перезаписывает ваш вручную загруженный. Эту и смежные проверки удобно делать в рамках общего технического аудита.

Уровень 2. Ответ сервера конкретному роботу

проверка как сайт отвечает разным ботам
# должен пускать — ожидаем 200
curl -sI -A "Mozilla/5.0 (compatible; ChatGPT-User/1.0)" https://example.ru/ | head -1

# если закрывали на уровне сервера — ожидаем 403
curl -sI -A "Mozilla/5.0 (compatible; GPTBot/1.2)" https://example.ru/ | head -1

# обычный посетитель не должен пострадать — ожидаем 200
curl -sI -A "Mozilla/5.0 (Macintosh; Intel Mac OS X 10_15_7)" https://example.ru/ | head -1

Уровень 3. Факт: кто реально приходит

Самая важная проверка. Синтаксис может быть верным, а робот всё равно не появляться — например, потому что страницы отдаются из кэша и до кода дело не доходит. Единственный способ убедиться — считать обращения на стороне сервера. Механика подробно разобрана в статье про мониторинг AI-трафика: там же готовый счётчик и SQL-запросы.

логи nginx кто приходил за последнее время
grep -oiE 'GPTBot|ChatGPT-User|OAI-SearchBot|ClaudeBot|Claude-User|PerplexityBot|Perplexity-User|Google-Extended|YandexAdditional|CCBot' 
  /var/log/nginx/access.log | sort | uniq -c | sort -rn
💡

Что считать нормой. После открытия доступа обращения появляются в течение недель, а не дней, и они разрежены: десятки визитов в месяц — обычная картина, а не признак поломки. Тревожный сигнал другой — если после изменения robots.txt обращения с суффиксом -User полностью прекратились, значит вы случайно закрыли живые запросы.

Три уровня проверки политики доступа

Три уровня проверки: /robots.txt отдаётся с кодом 200 и с вашим текстом; curl с User-Agent конкретного робота показывает, где ждём 200, а где 403; обращения считаются в логах сервера. Норма — десятки визитов в месяц; тревога — если подписи с суффиксом -User пропали совсем.1Синтаксис/robots.txt отдаётся с кодом 200и с вашим текстом2Ответ сервераконкретному роботуcurl с User-Agent бота: где ждём200, а где 4033Факт: кто реальноприходитсчитать обращения на сторонесервера, а не по синтаксису
Порядок работ. Три уровня из статьи; норма — десятки визитов в месяц, тревога — если обращения с суффиксом -User пропали совсем.

Если контент уже в обучающих данных

Закрытие доступа действует только вперёд. Материалы, собранные раньше, из обучающего корпуса не исчезают, и добавленный сегодня Disallow их оттуда не убирает.

Что реально доступно:

  1. Остановить дальнейший сбор. Закрыть обучающие краулеры — новые публикации в корпус не попадут.
  2. Обратиться к вендору. У части сервисов есть формы для правообладателей: запрос на исключение материалов или на удаление персональных данных. Процедуры небыстрые, но существуют.
  3. Работать с текущими ответами. Если модель выдаёт ваш контент с ошибками или без атрибуции, влиять можно замещением: свежие корректные материалы, которые модель находит при поиске в момент ответа, весят больше устаревших данных из корпуса.
  4. Принять как данность и переключиться. Для большинства коммерческих сайтов присутствие в корпусе — не потеря, а актив: именно оно даёт узнаваемость бренда в ответах.

Типичные ошибки

  • Закрыть всех одной строкой. Самая частая и самая дорогая: вместе с обучением отрезается канал переходов.
  • Не различать GPTBot и ChatGPT-User. Первый про обучение, второй про живые ответы и ссылки.
  • Путать Google-Extended с Googlebot. Первый отвечает за обучение Gemini, второй за обычную выдачу. Их блокировка имеет совершенно разную цену.
  • Маски вроде ~*ai в конфиге сервера. Совпадают с обычными браузерами и режут живых посетителей.
  • Написать правила и не проверить. Плагин перезаписал robots.txt, кэш не пускает код к исполнению — вариантов много.
  • Считать robots.txt защитой. Это просьба; недобросовестные сборщики её игнорируют.
  • Противоречие между robots.txt и llms.txt. Перечислять в llms.txt разделы, закрытые в robots.txt, бессмысленно.
  • Закрыть доступ и ждать, что контент исчезнет из ответов. Собранное раньше остаётся; тему всё равно раскроют, но уже по чужим источникам.
  • Не пересматривать список. Вендоры добавляют новые имена роботов; список стоит сверять раз в квартал.

Рабочая конфигурация и типичные ошибки

Помогает: пускать роботов живого запроса и поисковые индексы, обучающим краулерам закрывать личные кабинеты и платные разделы, считать обращения в логах. Мешает: закрыть всех одной строкой, не различать GPTBot и ChatGPT-User, путать Google-Extended с Googlebot, маски вида ~*ai.ПомогаетРоботов живого запроса пускать всегдаПоисковые индексы AI-сервисов пускатьОбучающим закрывать личные кабинеты иплатные разделыСвоя группа User-agent каждому роботу сособым поведениемСчитать реальные обращения на сторонесервераМешаетЗакрыть всех одной строкой Disallow: /Не различать GPTBot и ChatGPT-UserПутать Google-Extended с GooglebotМаски вроде ~*ai в конфиге сервераНаписать правила и ни разу не проверить
Сравнение. Что делать с доступом AI-ботов и какие решения обходятся дороже всего.

Что в итоге

Решение о доступе AI-ботов сводится к одному различению: обучающие краулеры и роботы живого запроса — это разные вещи, и цена их блокировки разная. Первое стоит отложенного присутствия в будущих версиях моделей. Второе стоит ссылок и переходов сегодня.

Для большинства коммерческих сайтов рабочая конфигурация выглядит так: роботов живого запроса и поисковых индексов пускать всегда, обучающим краулерам открывать сайт, но закрывать личные кабинеты, платные разделы и уникальные данные. Полная блокировка оправдана там, где контент сам является товаром. Как доступ встраивается в общую работу по GEO-оптимизации — отдельный разговор, но без него она не начинается.

И главное — правила нужно проверять фактом, а не синтаксисом. Единственный способ узнать, работает ли политика, — считать реальные обращения на стороне сервера: кто пришёл, на какие страницы и с какой подписью. Как это устроить, разобрано в статье про мониторинг AI-трафика. Без такого учёта вы управляете доступом вслепую: правила написаны, а действуют ли они — неизвестно.

Доступ — это фундамент, а не стратегия. Открытый сайт ещё не означает попадания в ответы: дальше начинается работа над извлекаемостью контента, о которой в гайде как попасть в ответы нейросетей, и над узнаваемостью компании, о которой в материале про продвижение бренда в нейросетях.

Нужна помощь с доступом AI-ботов?

Проверим, кто реально ходит по вашему сайту, настроим политику доступа под задачи бизнеса и поставим учёт обращений, чтобы решения принимались по фактам, а не вслепую.

Получить бесплатный аудит