Каждый день по сайтам ходят полтора десятка роботов нейросетей: одни собирают материал для обучения будущих моделей, другие приходят прямо в момент, когда человек задал вопрос, и читают вашу страницу, чтобы сформулировать ответ. Закрыть их всех одной строкой в robots.txt просто — и это самая частая дорогая ошибка, потому что вместе с обучающими краулерами вы отрезаете и тех, кто приводит вам людей. Разбираем, кто из ботов что делает с контентом, что вы теряете и что защищаете в каждом сценарии, как разрешить выборочно и как проверить, что политика доступа действительно работает.
Зачем вообще решать, кого пускать
Решение принимается по умолчанию, даже если вы его не принимали. Пустой robots.txt означает «заходите все». Строка User-agent: * / Disallow: / означает «никому нельзя». Оба варианта — это выбор, просто во втором случае осознанный, а в первом нет.
Вопрос стал практическим, потому что у доступа появилась цена в обе стороны. Пуская роботов, вы отдаёте контент в системы, которые перескажут его своими словами и человек может не дойти до сайта. Закрывая, вы гарантированно не попадёте в ответы — а это уже канал, из которого приходят люди.
Правильная постановка вопроса не «пускать или нет», а «кого именно и на какие разделы». Роботы разные, и последствия от их блокировки разные.
Два типа AI-ботов, и почему их нельзя равнять
Ключевое различие, из-за которого чаще всего ошибаются: обучающий обход и обращение в момент живого запроса — это разные роботы с разными именами.
GPTBot, ClaudeBot, Google-Extended, CCBot, Applebot-Extended. Собирают материал впрок, для следующей версии модели. Ваша страница попадёт в корпус, но окажется ли в конкретном ответе — вопрос открытыйChatGPT-User, Claude-User, Perplexity-User. Прямо сейчас человек задал вопрос, и модель пошла на вашу страницу за ответом. Именно отсюда берутся ссылки, по которым к вам приходятOAI-SearchBot, PerplexityBot. Строят собственный индекс, из которого потом отбираются источники для ответовЭта разница — центральная. Блокировка обучающего краулера стоит вам присутствия в будущих версиях модели, эффект отложенный и вероятностный. Блокировка робота живого запроса стоит вам ссылок и переходов прямо сейчас, эффект немедленный и полностью ваш.
Самая дорогая опечатка в robots.txt. Правило User-agent: GPTBot закрывает только обучающий обход OpenAI. А вот попытка «закрыть всё от OpenAI» через маски или через Disallow для ChatGPT-User убирает вас из живых ответов ChatGPT — то есть из того единственного места, откуда этот сервис вообще приводит трафик.
Справочник: кто ходит по сайту и что делает с контентом
Актуальный набор на 2026 год. Колонка «что теряете при блокировке» — то, ради чего эту таблицу и стоит читать.
| User-agent | Владелец | Назначение | Что теряете при блокировке |
|---|---|---|---|
ChatGPT-User | OpenAI | Чтение страницы в момент запроса пользователя | Ссылки и переходы из ChatGPT — немедленно |
OAI-SearchBot | OpenAI | Индекс для поиска ChatGPT | Попадание в выдачу ChatGPT Search |
GPTBot | OpenAI | Обучение моделей | Присутствие в будущих версиях — отложенно |
Claude-User | Anthropic | Чтение в момент запроса | Ссылки и переходы из Claude |
ClaudeBot, anthropic-ai | Anthropic | Обучение | Присутствие в будущих версиях |
Perplexity-User | Perplexity | Чтение в момент запроса | Ссылки и переходы из Perplexity |
PerplexityBot | Perplexity | Построение индекса | Попадание в источники Perplexity |
Google-Extended | Обучение Gemini | Присутствие в Gemini. Не влияет на обычную выдачу Google | |
Applebot-Extended | Apple | Обучение Apple Intelligence | Присутствие в моделях Apple |
YandexAdditional | Яндекс | Обход для Нейро | Присутствие в ответах Нейро |
CCBot | Common Crawl | Открытый корпус, на нём учатся многие | Косвенное присутствие во множестве моделей |
Bytespider | ByteDance | Обучение | Присутствие в моделях ByteDance |
meta-externalagent | Meta | Обучение | Присутствие в моделях Meta |
Amazonbot, cohere-ai, MistralAI-User | прочие | Обучение и запросы | Присутствие в соответствующих сервисах |
Отдельно про Google-Extended. Это самая безопасная блокировка из всех: она отключает использование контента для обучения Gemini и никак не влияет на индексацию в обычном поиске Google — за неё отвечает Googlebot, это другой робот. Если хочется закрыть обучение, но страшно потерять поиск, начинать разумно именно отсюда.
Что вы теряете, закрывая доступ
Потери зависят от того, кого именно закрыли.
При блокировке роботов живого запроса
- Ссылки в ответах исчезают сразу. Модель не может сослаться на страницу, которую ей не дали прочитать.
- Переходы прекращаются. Люди, которые пришли бы из диалога, не приходят.
- Про вас расскажут по чужим источникам. Модель ответит на вопрос всё равно — просто взяв данные у конкурента или из старой перепечатки, где сведения могут быть неверными.
При блокировке обучающих краулеров
- Отложенная потеря присутствия. В следующей версии модели ваших материалов не будет.
- Ослабление связки бренда с темой. Модель хуже связывает компанию с её нишей — подробно этот механизм разобран в статье про продвижение бренда в нейросетях.
- Эффект не мгновенный. То, что уже собрано, из корпуса не исчезнет.
Контент всё равно перескажут. Блокировка не убирает вашу тему из ответов — она убирает вас как источник. Вопрос «сколько стоит имплантация» получит ответ в любом случае: по данным конкурентов, агрегаторов или устаревших перепечаток. Закрываясь, вы отказываетесь не от участия в теме, а от авторства в ней.
Что вы защищаете, закрывая доступ
Аргументы в пользу блокировки существуют, и они не сводятся к «жалко контент».
- Уникальные данные с коммерческой ценностью. Собственные исследования, базы, методики, расчёты — то, что стоило денег и составляет преимущество.
- Платный и закрытый контент. Материалы по подписке, за регистрацией, курсы. Здесь блокировка — вопрос выполнения обязательств перед клиентами.
- Лицензионные ограничения. Если контент лицензирован третьей стороной и вы не вправе передавать его для обучения.
- Персональные данные. Профили, отзывы с личной информацией, каталоги специалистов — здесь блокировка снижает риски.
- Позиция по авторскому праву. Некоторые компании принципиально не отдают материалы для обучения без соглашения. Это законная позиция.
- Нагрузка. Редко, но на больших каталогах интенсивный обход заметен по ресурсам.
Цена закрытия доступа: что теряете и что защищаете
Как принять решение: разбор по типам бизнеса
Универсального ответа нет, но есть закономерность: чем больше бизнес зависит от привлечения новых клиентов через поиск, тем дороже обходится блокировка.
| Тип бизнеса | Роботы живого запроса | Обучающие краулеры | Логика |
|---|---|---|---|
| Услуги, клиники, юристы, агентства | Пускать | Пускать | Канал привлечения важнее защиты текстов, которые и так публичны |
| Интернет-магазин | Пускать | Пускать | Карточки и категории должны попадать в подборки и сравнения |
| Медиа и издания | Пускать | По ситуации | Ссылки нужны, но обучение отдаётся бесплатно — предмет отдельного решения |
| SaaS и B2B-продукт | Пускать | Пускать | Документация в ответах моделей работает как канал знакомства с продуктом |
| Исследования, аналитика, базы данных | Пускать витрину | Закрывать данные | Анонсы открыты, сами данные — нет |
| Платный контент, курсы | Пускать открытую часть | Закрывать закрытую | Обязательства перед платящими клиентами |
| Персональные данные, каталоги людей | По ситуации | Закрывать | Снижение правовых рисков |
Для подавляющего большинства коммерческих сайтов ответ один: пускать всех, закрывая точечно отдельные разделы. Полная блокировка оправдана редко и почти всегда там, где контент сам является товаром.
Как разрешить выборочно: синтаксис robots.txt
Правила читаются по группам User-agent. Робот выбирает наиболее специфичную группу для себя и игнорирует остальные, включая *.
# Роботы живого запроса — пускаем: отсюда приходят люди
User-agent: ChatGPT-User
User-agent: Claude-User
User-agent: Perplexity-User
User-agent: MistralAI-User
Allow: /
# Поисковые индексы AI-сервисов — пускаем
User-agent: OAI-SearchBot
User-agent: PerplexityBot
Allow: /
# Обучающие краулеры — пускаем, но закрываем чувствительные разделы
User-agent: GPTBot
User-agent: ClaudeBot
User-agent: Google-Extended
User-agent: Applebot-Extended
User-agent: CCBot
Disallow: /lk/
Disallow: /clients/
Disallow: /research/data/
# Общее правило
User-agent: *
Disallow: /wp-admin/
Allow: /wp-admin/admin-ajax.php
Sitemap: https://example.ru/sitemap.xml# Обучение запрещаем
User-agent: GPTBot
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: anthropic-ai
Disallow: /
User-agent: Google-Extended
Disallow: /
User-agent: Applebot-Extended
Disallow: /
User-agent: CCBot
Disallow: /
User-agent: Bytespider
Disallow: /
# А живые запросы — разрешаем, иначе теряем канал
User-agent: ChatGPT-User
Allow: /
User-agent: Claude-User
Allow: /
User-agent: Perplexity-User
Allow: /Про порядок и специфичность. Если для робота есть своя группа, правило User-agent: * он не читает вовсе. Поэтому нельзя написать общий Disallow: / и рассчитывать, что отдельные Allow ниже что-то откроют для тех, у кого своей группы нет. Каждому роботу, чьё поведение отличается от общего, нужна собственная группа.
Где заканчивается robots.txt: он рекомендательный
robots.txt — это просьба, а не запрет. Технически он не мешает скачать страницу: файл лежит в открытом доступе, его читают добровольно, и соблюдение зависит от добросовестности робота.
Крупные вендоры — OpenAI, Anthropic, Google, Perplexity — правила соблюдают: для них это репутационный вопрос, и нарушения быстро становятся публичными. Но существует прослойка менее заметных сборщиков, которые обходят сайты, не представляясь или маскируясь под браузер. На них robots.txt не действует никак.
Отсюда практический вывод: если контент действительно нельзя отдавать, robots.txt для этого недостаточен. Он выражает вашу позицию и работает с теми, кто её уважает, — но не является технической защитой.
Где заканчивается robots.txt
Что реально ограничивает доступ
По возрастанию надёжности и стоимости внедрения.
| Средство | Насколько надёжно | Цена внедрения | Побочные эффекты |
|---|---|---|---|
| robots.txt | Работает с добросовестными | Минимальная | Нет |
Мета-тег noai, noimageai | Соблюдается частью сервисов | Минимальная | Нет |
| Блокировка по User-Agent на сервере | Останавливает тех, кто честно представляется | Низкая | Риск задеть лишних при неточной маске |
| Блокировка по диапазонам IP вендора | Надёжнее: подделать сложнее | Средняя, диапазоны меняются | Требует поддержки списков |
| Авторизация, платный доступ | Работает всегда | Высокая | Контент выпадает и из обычного поиска |
| Ограничение частоты и WAF | Против массового скачивания | Средняя | Возможны ложные срабатывания |
map $http_user_agent $block_ai_training {
default 0;
"~*(GPTBot|ClaudeBot|anthropic-ai|Google-Extended)" 1;
"~*(Applebot-Extended|CCBot|Bytespider|meta-external)" 1;
}
# в server-блоке:
# if ($block_ai_training) { return 403; }Осторожно с масками. Шаблон вида ~*ai совпадёт с половиной обычных браузеров: подстрока «ai» встречается в Mail, Safari и множестве других строк. Маски нужно писать по полным именам роботов, а после внедрения — проверять по логам, что живые посетители не получают 403.
llms.txt рядом с robots.txt: разные задачи
Файлы часто путают, хотя они решают противоположные задачи.
| robots.txt | llms.txt | |
|---|---|---|
| Что говорит | Куда нельзя ходить | Что стоит прочитать в первую очередь |
| Характер | Ограничение | Рекомендация и навигация |
| Формат | Директивы User-agent / Disallow | Markdown со ссылками и описаниями |
| Кто читает | Все роботы, включая поисковые | Языковые модели |
| Обязательность | Устоявшийся стандарт | Молодое соглашение, поддержка неполная |
Правильная связка: robots.txt задаёт границы доступа, llms.txt внутри этих границ подсказывает, что важнее всего. Противоречия между ними быть не должно — бессмысленно перечислять в llms.txt раздел, закрытый в robots.txt. Как составить сам файл, пошагово разобрано в статье llms.txt: зачем нужен и как составить.
Как проверить, что политика работает
Написать правила мало — нужно убедиться, что они применяются именно так, как задумано. Проверка делается в три уровня.
Уровень 1. Синтаксис
Откройте /robots.txt в браузере: файл должен отдаваться с кодом 200 и содержать ровно то, что вы написали. Частая неприятность — файл генерируется плагином и перезаписывает ваш вручную загруженный. Эту и смежные проверки удобно делать в рамках общего технического аудита.
Уровень 2. Ответ сервера конкретному роботу
# должен пускать — ожидаем 200
curl -sI -A "Mozilla/5.0 (compatible; ChatGPT-User/1.0)" https://example.ru/ | head -1
# если закрывали на уровне сервера — ожидаем 403
curl -sI -A "Mozilla/5.0 (compatible; GPTBot/1.2)" https://example.ru/ | head -1
# обычный посетитель не должен пострадать — ожидаем 200
curl -sI -A "Mozilla/5.0 (Macintosh; Intel Mac OS X 10_15_7)" https://example.ru/ | head -1Уровень 3. Факт: кто реально приходит
Самая важная проверка. Синтаксис может быть верным, а робот всё равно не появляться — например, потому что страницы отдаются из кэша и до кода дело не доходит. Единственный способ убедиться — считать обращения на стороне сервера. Механика подробно разобрана в статье про мониторинг AI-трафика: там же готовый счётчик и SQL-запросы.
grep -oiE 'GPTBot|ChatGPT-User|OAI-SearchBot|ClaudeBot|Claude-User|PerplexityBot|Perplexity-User|Google-Extended|YandexAdditional|CCBot'
/var/log/nginx/access.log | sort | uniq -c | sort -rnЧто считать нормой. После открытия доступа обращения появляются в течение недель, а не дней, и они разрежены: десятки визитов в месяц — обычная картина, а не признак поломки. Тревожный сигнал другой — если после изменения robots.txt обращения с суффиксом -User полностью прекратились, значит вы случайно закрыли живые запросы.
Три уровня проверки политики доступа
Если контент уже в обучающих данных
Закрытие доступа действует только вперёд. Материалы, собранные раньше, из обучающего корпуса не исчезают, и добавленный сегодня Disallow их оттуда не убирает.
Что реально доступно:
- Остановить дальнейший сбор. Закрыть обучающие краулеры — новые публикации в корпус не попадут.
- Обратиться к вендору. У части сервисов есть формы для правообладателей: запрос на исключение материалов или на удаление персональных данных. Процедуры небыстрые, но существуют.
- Работать с текущими ответами. Если модель выдаёт ваш контент с ошибками или без атрибуции, влиять можно замещением: свежие корректные материалы, которые модель находит при поиске в момент ответа, весят больше устаревших данных из корпуса.
- Принять как данность и переключиться. Для большинства коммерческих сайтов присутствие в корпусе — не потеря, а актив: именно оно даёт узнаваемость бренда в ответах.
Типичные ошибки
- Закрыть всех одной строкой. Самая частая и самая дорогая: вместе с обучением отрезается канал переходов.
- Не различать
GPTBotиChatGPT-User. Первый про обучение, второй про живые ответы и ссылки. - Путать
Google-ExtendedсGooglebot. Первый отвечает за обучение Gemini, второй за обычную выдачу. Их блокировка имеет совершенно разную цену. - Маски вроде
~*aiв конфиге сервера. Совпадают с обычными браузерами и режут живых посетителей. - Написать правила и не проверить. Плагин перезаписал robots.txt, кэш не пускает код к исполнению — вариантов много.
- Считать robots.txt защитой. Это просьба; недобросовестные сборщики её игнорируют.
- Противоречие между robots.txt и llms.txt. Перечислять в llms.txt разделы, закрытые в robots.txt, бессмысленно.
- Закрыть доступ и ждать, что контент исчезнет из ответов. Собранное раньше остаётся; тему всё равно раскроют, но уже по чужим источникам.
- Не пересматривать список. Вендоры добавляют новые имена роботов; список стоит сверять раз в квартал.
Рабочая конфигурация и типичные ошибки
Что в итоге
Решение о доступе AI-ботов сводится к одному различению: обучающие краулеры и роботы живого запроса — это разные вещи, и цена их блокировки разная. Первое стоит отложенного присутствия в будущих версиях моделей. Второе стоит ссылок и переходов сегодня.
Для большинства коммерческих сайтов рабочая конфигурация выглядит так: роботов живого запроса и поисковых индексов пускать всегда, обучающим краулерам открывать сайт, но закрывать личные кабинеты, платные разделы и уникальные данные. Полная блокировка оправдана там, где контент сам является товаром. Как доступ встраивается в общую работу по GEO-оптимизации — отдельный разговор, но без него она не начинается.
И главное — правила нужно проверять фактом, а не синтаксисом. Единственный способ узнать, работает ли политика, — считать реальные обращения на стороне сервера: кто пришёл, на какие страницы и с какой подписью. Как это устроить, разобрано в статье про мониторинг AI-трафика. Без такого учёта вы управляете доступом вслепую: правила написаны, а действуют ли они — неизвестно.
Доступ — это фундамент, а не стратегия. Открытый сайт ещё не означает попадания в ответы: дальше начинается работа над извлекаемостью контента, о которой в гайде как попасть в ответы нейросетей, и над узнаваемостью компании, о которой в материале про продвижение бренда в нейросетях.
Нужна помощь с доступом AI-ботов?
Проверим, кто реально ходит по вашему сайту, настроим политику доступа под задачи бизнеса и поставим учёт обращений, чтобы решения принимались по фактам, а не вслепую.