
GPTBot, ClaudeBot и YandexAdditional ходят по сайтам прямо сейчас, и в журнале сервера их видно даже у совсем небольших проектов. Отсюда вопрос, который встаёт перед каждым владельцем: закрывать их в robots.txt, потому что «забирают контент», или не закрывать, потому что «оттуда приходят люди».
Ответ зависит не от отношения к нейросетям, а от того, чем вы зарабатываете и какой именно агент к вам пришёл. Потому что под словом «ИИ-робот» скрываются три разные задачи: сбор данных для обучения, построение поискового индекса для чат-бота и переход по конкретной ссылке в ответ на вопрос живого человека. Закрывать их надо по-разному, и цена ошибки тоже разная. Ниже — кто ходит, что даёт и что отнимает закрытие, готовые блоки robots.txt под три решения и способ проверить, кто на самом деле был у вас в гостях.
Кто именно ходит по сайту
Названия агентов публикуют сами компании, и это единственный надёжный источник: список меняется, компании добавляют новых роботов и переименовывают старых. Ниже — состав, который на сегодня встречается в журналах чаще всего.
| Агент | Чей | Для чего | Что теряете, закрыв |
|---|---|---|---|
| GPTBot | OpenAI | Сбор страниц для обучения моделей | Ничего из трафика; только участие в обучении |
| OAI-SearchBot | OpenAI | Индекс для поиска внутри чат-бота | Показы и ссылки на вас в ответах с поиском |
| ChatGPT-User | OpenAI | Переход по ссылке по запросу живого человека | Возможность открыть вашу страницу по просьбе пользователя |
| ClaudeBot | Anthropic | Сбор страниц для обучения | Только участие в обучении |
| Claude-SearchBot, Claude-User | Anthropic | Поиск и открытие страницы по запросу пользователя | Ссылки на вас в ответах |
| Google-Extended | Не робот, а признак в robots.txt: разрешение использовать контент в генеративных продуктах | Участие в ответах Google, обычный поиск не затрагивается | |
| YandexAdditional, YandexAdditionalBot | Яндекс | Отдельный агент Яндекса; его назначение и последствия запрета описаны в справке Вебмастера | Возможные последствия внутри сервисов Яндекса — см. ниже отдельный раздел |
| PerplexityBot, Perplexity-User | Perplexity | Индекс и переходы по ссылкам | Ссылки на вас в ответах сервиса |
| Applebot-Extended | Apple | Признак в robots.txt: разрешение на обучение | Только участие в обучении |
| CCBot | Common Crawl | Открытый архив страниц, на котором учат многие модели | Участие в обучении сразу у многих моделей |
| Bytespider, Meta-ExternalAgent, Amazonbot | ByteDance, Meta, Amazon | Сбор данных для своих задач | Обычно ничего заметного |
Практический вывод из таблицы один: закрывать «ИИ-роботов вообще» — плохая идея, потому что в одном списке лежат агенты, которые не приносят ничего, и агенты, через которых к вам приходят живые читатели.
Три разные вещи, которые называют одним словом
Обучение. Робот скачивает страницы, они попадают в обучающий набор. Вы не получаете ни переходов, ни упоминаний. Модель после обучения не помнит, откуда именно взяла формулировку, и ссылку на вас не поставит. Это единственный случай, где закрытие не стоит вам трафика.
Поиск в реальном времени. У чат-ботов есть свой индекс: когда пользователь задаёт вопрос, система ищет подходящие страницы и формирует ответ с ссылками на источники. Здесь закрытие стоит вам показов и переходов — вы просто исчезаете из этого канала.
Переход по ссылке по запросу человека. Пользователь дал боту адрес или попросил проверить конкретный сайт. Такой агент действует от имени человека, и блокировать его — примерно то же, что блокировать браузер. Если вы продаёте услуги, это последний агент, которого стоит закрывать: именно так к вам приходит человек, который уже интересуется.
Отдельно замечу: запрет в robots.txt не удаляет то, что уже скачано раньше. Если ваш текст попал в обучающий набор два года назад, закрытие сегодня на это не влияет. Решение про robots.txt — про будущее, а не про прошлое.
Что вы теряете, закрыв доступ
Первое и главное — исчезаете из ответов там, где сейчас складывается заметная часть поиска. Люди всё чаще получают ответ, не заходя на сайт, а ссылка под ответом остаётся единственным способом попасть к вам. Если её нет, вас нет. Механику этого сдвига я разбирал отдельно: Zero-click убивает трафик.
Второе — теряете упоминания без переходов, которые всё равно работают. Человек спросил у бота, к кому обратиться, бот назвал несколько имён и компаний. Переход по ссылке может не состояться, а имя запомнится и потом будет вбито в поиск отдельно. Это трудно измерить, но легко потерять.
Третье — закрытие часто задевает не то, что планировали. Одна неаккуратная строчка, и вы закрываетесь не от нейросетей, а от обычного поиска. Я видел это много раз и описывал последствия: одна строчка в robots.txt — и сайт пропадает из Яндекса. Особенно опасны шаблоны из интернета с длинными списками агентов и универсальными правилами в конце.
Четвёртое — теряете возможность проверить, как вас видит бот. Закрыв доступ, вы не сможете попросить нейросеть проанализировать свою же страницу, и лишитесь простого способа контроля.
Что вы получаете, закрыв доступ
Честно: выгоды есть, но они узкие.
Вы уменьшаете вероятность, что ваши уникальные материалы попадут в обучающий набор и будут пересказываться без упоминания вас. Для тех, кто зарабатывает продажей самого текста — курсов, отчётов, баз, платного доступа, — это реальная причина закрыть обучающих роботов.
Вы снижаете нагрузку на сервер, если краулеры действительно ходят интенсивно. На слабом хостинге бывает заметно.
Вы уменьшаете риск, что закрытые разделы утекут наружу. Но это решается не запретом для ИИ-агентов, а нормальной защитой доступа: запрет в robots.txt — не средство защиты вообще, о чём ниже.
Чего закрытие не даёт: оно не защищает авторские права, не мешает человеку скопировать текст руками, не убирает вас из уже обученных моделей и не влияет на копирование текстов конкурентами, которое остаётся куда более частой проблемой.
Как robots.txt работает на самом деле
Файл robots.txt описан стандартом RFC 9309, принятым в 2022 году, и это именно соглашение, а не техническая преграда. Сервер отдаёт файл, робот его читает и добросовестно выполняет. Робот, который не хочет выполнять, просто не выполняет — и вы об этом даже не узнаете, если не смотрите журналы.
Дальше — четыре свойства, из-за которых чаще всего ошибаются.
Правила выбираются по одному блоку. Робот берёт блок, который адресован именно ему, а если такого нет — общий. Блоки не складываются. Если вы завели отдельный блок для GPTBot и вписали в него только запрет обучения, все остальные правила из общего блока к нему не применятся.
Запрет обхода не равен запрету показа. Страница, закрытая в robots.txt, может попасть в выдачу по ссылкам с других сайтов — без описания, но попасть. Чтобы гарантированно убрать страницу из результатов, нужен метатег с запретом индексации, и тогда robots.txt эту страницу закрывать не должен: иначе робот не увидит метатег. Разбор этой развилки — в статье как закрыть страницу от индексации.
Не все директивы поддерживаются всеми. Директиву Clean-param понимает Яндекс, у других поисковиков её нет. Директиву Crawl-delay Яндекс не учитывает — скорость обхода настраивается в Вебмастере; ИИ-краулеры её тоже в основном игнорируют.
Файл читается не мгновенно. Роботы кэшируют robots.txt, и изменения вступают в силу не в ту же минуту. Ждать эффекта стоит сутки и дольше.
И бытовое: проверяйте файл после каждой правки. Типовые ошибки — пустая строка внутри блока, опечатка в названии агента, слеш не там, где нужно, и правило, которое противоречит предыдущему. Полный разбор этих грабель вместе с картой сайта — тут: ошибки robots.txt и sitemap.xml.
Готовые блоки под три решения
Вариант первый: пускаем всех, ничего не закрываем. Это моё решение по умолчанию для сайтов, которые продают услуги и товары. В robots.txt отдельных блоков для ИИ-агентов просто нет.
Вариант второй: запрещаем обучение, оставляем поиск и переходы. Подходит тем, у кого уникальный контент — исследования, методики, авторские материалы, — но при этом нужны читатели из ответов.
User-agent: GPTBot
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: CCBot
Disallow: /
User-agent: Google-Extended
Disallow: /
User-agent: Applebot-Extended
Disallow: /
User-agent: Bytespider
Disallow: /
Здесь важно, чего в списке нет: поисковых агентов чат-ботов и агентов, которые открывают страницу по просьбе человека. Они остаются открытыми, и канал работает.
Вариант третий: закрываем всё, что связано с нейросетями. К списку выше добавляются поисковые агенты чат-ботов и агенты пользовательских переходов. Я советую этот вариант только двум типам проектов: тем, кто продаёт доступ к контенту, и тем, у кого контент — предмет лицензионных договоров. Во всех остальных случаях вы отрезаете канал, который растёт.
В любом варианте актуальные названия агентов сверяйте с документацией их владельцев перед тем, как вставлять блок. Список из статьи годичной давности почти наверняка неполон, а опечатка в имени агента делает правило бесполезным — и вы будете думать, что закрылись, когда не закрылись.
YandexAdditional: почему я не советую его закрывать
Этот агент стоит в стороне от остальных по одной причине: он принадлежит той же компании, что и основной поисковый робот, от которого зависит ваш трафик из Яндекса. Его назначение и последствия запрета Яндекс описывает в справке Вебмастера в разделе про роботов и robots.txt — и перед любым действием читать надо именно её, в действующей редакции.
Моя позиция практическая. Выгода от закрытия одного агента Яндекса умозрительная: вы не знаете, что именно потеряете внутри сервисов компании, и не получите взамен ни трафика, ни денег. Риск конкретный: правки robots.txt, касающиеся агентов Яндекса, слишком легко сделать так, что зацепишь основного робота. Названия начинаются одинаково, и неверно составленное правило накрывает больше, чем планировалось.
Отдельно: если вас беспокоит, как ваш сайт выглядит в генеративных ответах, правильный путь — не закрываться, а привести страницы в состояние, из которого удобно брать ответ. Структура, прямые ответы на вопросы в первых абзацах, таблицы, ясные формулировки, факты с источниками. Что именно для этого делается на техническом уровне, я собрал здесь: GEO и техническое SEO, а быстрый набор действий — в разборе за двадцать минут.
Когда robots.txt не помогает: блокировка на уровне сервера
Если вы приняли решение закрыться и хотите, чтобы оно действительно исполнялось, нужен запрет на уровне сервера. Робот, игнорирующий robots.txt, не увидит вежливой просьбы, зато получит код ответа с отказом.
Работает это так: в конфигурации веб-сервера или в файле правил на стороне сайта проверяется строка агента, и при совпадении отдаётся отказ. Механизм грубый, поэтому три предосторожности обязательны.
Первая: сравнение строки агента должно быть точным по подстроке имени, а не по общим словам. Правило по слову «bot» отрежет половину полезных роботов, включая поисковые.
Вторая: после включения проверьте доступность сайта для основных поисковых роботов средствами их панелей вебмастера. Ошибка здесь стоит позиций, и обнаруживается она через недели.
Третья: не блокируйте по адресам сети без крайней необходимости. Диапазоны меняются, и через полгода вы будете блокировать кого-то другого, а свой список уже не вспомните.
И помните, что запрет на уровне сервера не подходит как замена контролю доступа. Платный или личный контент закрывается авторизацией, а не списком агентов. Файлы, которые нельзя закрыть метатегом — документы, таблицы, картинки, — закрываются заголовком ответа сервера; как это делается, описано в статье про X-Robots-Tag для PDF и картинок.
Как узнать, кто реально к вам заходил
Обсуждать решение имеет смысл, только посмотрев на свои данные. Порядок такой.
- Возьмите журнал обращений к сайту за месяц. У большинства хостингов он доступен в панели или лежит в отдельной папке на сервере.
- Отфильтруйте строки по именам агентов из таблицы выше и посчитайте число запросов по каждому.
- Посмотрите, какие разделы они обходят. Часто выясняется, что робот ходит по служебным адресам и параметрам, а не по статьям, — и тогда вопрос не в нейросетях, а в том, что сайт отдаёт лишние адреса.
- Проверьте подлинность. Строку агента подделать может кто угодно: за GPTBot прячутся и обычные парсеры. OpenAI и Anthropic публикуют диапазоны адресов своих роботов, и проверка по ним отделяет настоящих от самозванцев. Дополнительный способ — обратный запрос имени по адресу.
- Сопоставьте с нагрузкой. Если в часы пиков сервер отвечает медленнее, а в журнале в это время массовый обход — причина найдена. Если нет, дело не в краулерах.
Часто после такой проверки решение меняется само. Настоящих ИИ-агентов оказывается немного, зато обнаруживается десяток безымянных парсеров, которые действительно грузят сервер и не приносят ничего. Вот их и стоит закрывать в первую очередь.
Нагрузка: когда краулеры действительно мешают
| Признак | Что это значит | Что делать |
|---|---|---|
| Массовые запросы к адресам с параметрами и фильтрам | Сайт отдаёт бесконечные варианты одной страницы | Закрыть параметры от обхода, настроить канонические адреса |
| Обход одних и тех же страниц по кругу | Неверные коды ответа или цепочки перенаправлений | Проверить коды ответа и убрать цепочки |
| Пики запросов от одного агента, узкий интервал | Агрессивный обход конкретным роботом | Ограничить частоту на уровне сервера, не запрещая полностью |
| Нагрузку дают безымянные агенты | Парсеры и скраперы, не имеющие отношения к нейросетям | Закрыть их по строке агента; это даёт больше эффекта, чем блокировка ИИ |
| Медленно при любом трафике | Дело в хостинге или сайте, а не в роботах | Кэширование, оптимизация запросов, смена тарифа |
Что закрывать всегда, независимо от решения про ИИ
Есть набор разделов, которые не должны обходиться никем, и это не зависит от вашей позиции по нейросетям.
| Что | Почему | Чем закрывать |
|---|---|---|
| Личные кабинеты, корзина, оформление заказа | Нет смысла в индексе, плюс утечка данных в адресах | Авторизация плюс запрет обхода |
| Внутренний поиск по сайту | Бесконечные адреса, мусор в индексе | Запрет обхода адресов поиска |
| Платный контент и файлы | Иначе доступ теряет смысл | Авторизация; отдача файлов через скрипт |
| Служебные и технические страницы, тестовые копии | Дубли и утечка черновиков | Запрет обхода плюс метатег, на тестовых — авторизация |
| Страницы благодарности после формы | Портят статистику целей и попадают в выдачу | Метатег с запретом индексации |
| Адреса с метками рекламных кампаний | Дубли основных страниц | Канонические адреса, для Яндекса — Clean-param |
Если этот список у вас не закрыт, разбираться с ИИ-роботами преждевременно: сначала наведите порядок в том, что видят обычные поисковики. Посмотреть текущее состояние можно через бесплатный аудит сайта.
Три сценария решения по типу сайта
Сайт услуг и товаров. Пускайте всех. Ваш контент — не товар, товар — услуга, и любое упоминание работает на вас. Здесь я не вижу ни одной причины закрываться, а закрытие означает добровольный отказ от растущего источника обращений. Если задача не «закрыться», а «попадать в ответы», то это работа с содержимым и структурой страниц — то же, чем занимается обычное продвижение сайта в Яндексе с настройкой индексации, только с поправкой на формат ответа.
Контентный проект, который живёт с рекламы. Спорный случай. Ответ нейросети заменяет визит, и деньги вы теряете, но закрытие не вернёт этот визит: человек всё равно получит ответ, только без ссылки на вас. Разумный компромисс — закрыть обучающих роботов, оставить поисковых и держать на страницах то, за чем всё равно приходят: расчёты, инструменты, свежие данные, обсуждение.
Проект, который продаёт сам контент. Закрывайте и обучение, и поиск, но делайте это одновременно с нормальным контролем доступа: авторизация, отдача файлов через скрипт, исключение платных адресов из кэша. Иначе получится, что вежливо попросили не смотреть, а дверь оставили открытой.
И общее правило для всех трёх: решение записывайте. В отдельный файл — дату, состав правил, причину. Через год вы не вспомните, почему в robots.txt стоит блок из восьми агентов, и либо оставите его на всякий случай, либо снесёте вместе с нужным.
Коротко
- Под «ИИ-роботом» скрываются три разные задачи: сбор данных для обучения, поисковый индекс чат-бота и переход по ссылке по просьбе живого человека. Закрывать их надо по-разному.
- Закрытие обучающих агентов не стоит вам трафика. Закрытие поисковых агентов чат-ботов стоит показов и переходов. Закрытие агентов пользовательского перехода — примерно то же, что блокировать браузер.
- Запрет в robots.txt не удаляет то, что уже скачано. Решение касается будущего, а не прошлого.
- robots.txt описан стандартом RFC 9309 и остаётся соглашением, а не преградой. Правила выбираются по одному блоку и не складываются.
- Запрет обхода не равен отсутствию в выдаче: чтобы убрать страницу, нужен метатег с запретом индексации, а robots.txt эту страницу закрывать не должен.
- Clean-param понимает Яндекс, Crawl-delay Яндекс не учитывает — скорость обхода настраивается в Вебмастере.
- Названия агентов сверяйте с документацией их владельцев перед каждой правкой: список меняется, а опечатка в имени делает правило бесполезным.
- Агентов Яндекса я не советую закрывать: выгода умозрительная, а риск задеть основного поискового робота неверным правилом вполне реальный.
- Если решили закрыться по-настоящему, нужен запрет на уровне сервера по точной подстроке имени агента, с обязательной проверкой доступности для поисковиков после включения.
- Прежде чем решать, посмотрите журнал сервера за месяц: кто ходил, сколько раз, по каким разделам. Подлинность проверяйте по опубликованным диапазонам адресов — строку агента подделывает кто угодно.
- Чаще всего нагрузку дают не ИИ-краулеры, а безымянные парсеры и собственные бесконечные адреса с параметрами. Их и стоит закрывать первыми.
- Всегда закрыты должны быть: личные кабинеты и корзина, внутренний поиск, платный контент и файлы, служебные и тестовые страницы, страницы благодарности, адреса с рекламными метками.
- Сайт услуг — пускать всех. Контентный проект на рекламе — закрыть обучение, оставить поиск. Продажа самого контента — закрыть всё, но вместе с нормальной авторизацией.
- Записывайте решение: дату, состав правил и причину. Через год вы не вспомните, зачем в файле стоит этот блок.
Увеличьте позиции и продажи вашего сайта
Профессиональное SEO-продвижение с гарантией результата. Выберите подходящую услугу:
Остались вопросы по продвижению?
Меня зовут Анатолий Кузнецов, я SEO-оптимизатор с 20-летним стажем. Разберу ваш сайт, отвечу на вопросы и подскажу, что улучшить для роста позиций в Яндексе и Google.
Связаться со мной →
Комментарии
Дмитрий
Посмотрел журнал за месяц. GPTBot и ClaudeBot — сотни запросов, а безымянных парсеров тысячи, и они долбят фильтры каталога. Получается, проблема была вообще не там, где я думал.
Анатолий Кузнецов автор
Так почти всегда и оказывается. И обратите внимание на вторую часть: они долбят фильтры. Значит, сайт отдаёт бесконечное число адресов, и это бьёт по обходу обычными поисковиками тоже. Начните с закрытия параметров фильтрации от обхода и канонических адресов, потом уже думайте про агентов. Нагрузка упадёт сильнее, чем от любых запретов.
Ирина
У меня блог с авторскими методиками, живу с консультаций. Закрывать обучение или нет? Жалко отдавать тексты бесплатно, но и без упоминаний оставаться не хочется.
Анатолий Кузнецов автор
Раз доход идёт с консультаций, а не с продажи текстов, ваш товар — вы, а не статьи. В этом случае я бы оставил открытым всё: чем чаще ваше имя и метод попадают в ответы, тем больше людей придёт на консультацию. Если психологически тяжело, закройте только обучающих агентов — трафика это не стоит. Но поисковых агентов чат-ботов и переходы по ссылкам оставьте открытыми обязательно, иначе вы просто исчезнете из этого канала.
Артём
Подтверждаю пункт про подделку строки агента. У меня за GPTBot ходил парсер с адресов, которых в списках OpenAI нет и близко. Просто копировал контент.
Константин
Не согласен с общим настроем статьи. Нейросети зарабатывают на нашем контенте, а мы должны радоваться ссылке под ответом. Закрывать надо всех и сразу.
Анатолий Кузнецов автор
Позиция понятная, и по обучающим агентам я с ней спорить не буду: там вы действительно ничего не получаете взамен. Возражение только про вторую часть. Закрыв поисковых агентов, вы не лишаете пользователя ответа — он получит его из других источников, а вот шанс попасть к вам исчезнет. Получается не защита контента, а самоустранение из канала. Если цель — защитить материалы от копирования, закрытие для ИИ эту задачу не решает вообще: руками копируют гораздо чаще.
Наталья
Вставила готовый блок из интернета — и через неделю обнаружила, что закрыла сайт от Яндекса. В шаблоне в конце был универсальный запрет. Проверяйте, что копируете.
Сергей
Вопрос: если закрыть обучающего робота, а поисковый оставить, разве данные не попадут в обучение через поисковый индекс? Технически ведь одна компания.
Анатолий Кузнецов автор
Вопрос по существу, и ответ на него даёт только документация самой компании: разделение агентов по задачам и обязательства по использованию собранного описаны там, и они у разных компаний разные. Проверить это со стороны владельца сайта нельзя никак — вы видите только запросы в журнале. Поэтому решение здесь принимается на доверии к заявленной политике. Если доверия нет, единственный последовательный вариант — закрывать всех, но и понимать, чем вы за это платите.
Валерия
Спасибо за таблицу «что закрывать всегда». Обнаружила, что страницы благодарности у меня открыты и висят в выдаче, а внутренний поиск наплодил кучу адресов.
Олег
Правило «записывайте решение» звучит скучно, но у меня в robots.txt висел блок, который поставил подрядчик три года назад. Никто не помнил зачем. Оказалось, закрывали тестовый поддомен, которого давно нет.
Марина
А как проверить, попадает ли сайт в ответы нейросетей сейчас? Хочется понять, есть ли что терять, прежде чем принимать решение.
Анатолий Кузнецов автор
Самый простой способ — руками. Возьмите десять вопросов, по которым вас логично было бы назвать, задайте их в нескольких чат-ботах с включённым поиском и запишите в таблицу, кого называют и чьи ссылки приводят. Повторите через месяц. Это грубо, но показывает картину. Второй источник — журнал сервера: по агентам пользовательских переходов видно, что бот открывал ваши страницы по чьей-то просьбе. И третий — переходы с адресов сервисов в отчётах Метрики, они там появляются как обычные источники.
Павел
Ограничил частоту запросов вместо полного запрета — и это оказалось лучшим решением. Нагрузка ушла, из канала не выпал.
Анна
Замечание про то, что закрытие не убирает уже скачанное, сэкономило мне вечер спора с коллегой. Он был уверен, что запрет «отзывает» тексты из моделей.
Тимур
У меня платный раздел был закрыт только запретом в robots.txt. После этой статьи проверил — открывался по прямой ссылке всем желающим. Поставил авторизацию.