
Как настроить robots.txt — вопрос из тех, где цена ошибки не соответствует размеру файла. Десять строк текста в корне сайта, и одна из них способна убрать из поиска всё, что вы делали годами. Забытую с разработки строку находят обычно через полгода, когда трафика уже нет, а восстановление занимает недели.
При этом файл несложный: директив в нём меньше десятка, половина устарела, и запомнить рабочий минимум можно за вечер. Ниже — что этот файл на самом деле делает и чего не делает, правила синтаксиса, на которых спотыкаются, готовая конфигурация для WordPress с пояснениями по каждой строке и список того, что закрывать нельзя ни при каких условиях.
Что robots.txt делает и чего он не делает
Половина ошибок с этим файлом происходит из-за неверного понимания его роли. Он управляет обходом, а не индексацией. Это разные вещи.
Обход — робот скачивает страницу и смотрит, что внутри. Индексация — страница попадает в поисковую базу и может показаться в выдаче. Строка Disallow запрещает первое, но не гарантирует отсутствие второго.
Механика такая: если на закрытую в robots.txt страницу ведут ссылки с других сайтов, поисковая система знает о её существовании и может показать адрес в выдаче — только без описания, потому что зайти и прочитать содержимое ей запрещено. Получается худший вариант: страница и в поиске, и выглядит пустой.
Отсюда практическое правило, которое стоит запомнить раньше синтаксиса:
- Нужно убрать страницу из поиска гарантированно — метатег
noindexв коде страницы, а обход оставить открытым. Робот должен зайти и увидеть запрет. - Нужно не тратить обход на служебные адреса — запрет в robots.txt. Годится для разделов, которые никому не интересны и на которые никто не ссылается.
- Нужно склеить дубли с параметрами — директива Clean-param для Яндекса и указание основного адреса в canonical для остальных систем.
Классическая ловушка — закрыть страницу одновременно и в robots.txt, и метатегом. Робот не может зайти на страницу, значит не видит метатег, значит запрет не срабатывает, и адрес остаётся в выдаче. Причём владелец сайта уверен, что перестраховался вдвойне.
Правила синтаксиса, на которых спотыкаются
Формат простой, но нестрогий к ошибкам: неправильная строка не вызывает ошибку, она просто молча не работает.
- Файл лежит строго в корне и доступен по адресу вида site.ru/robots.txt. В подпапке он не работает.
- Отдаётся с кодом 200 и без перенаправлений. Если файл отвечает 301 или 404, поведение робота становится непредсказуемым, а в случае ошибки 5xx часть систем считает сайт закрытым целиком.
- Кодировка UTF-8 без метки порядка байтов. Невидимая метка в начале файла ломает первую строку, и секция перестаёт читаться.
- Секции разделяются пустой строкой. Внутри секции пустых строк быть не должно — иначе всё, что ниже, теряет привязку к
User-agent. - Регистр в путях учитывается:
/Catalog/и/catalog/— разные адреса. Названия директив регистр не учитывают. - Комментарии начинаются с решётки и пишутся с начала строки.
- Робот выбирает одну секцию — самую подходящую по имени. Если есть секция для Yandex, робот Яндекса читает только её и не смотрит в общую секцию со звёздочкой. Значит, все нужные правила надо продублировать.
- Внутри секции побеждает более длинное правило, а не порядок строк. При одинаковой длине приоритет у
Allow.
Последние два пункта дают больше всего ошибок. Человек пишет общую секцию с полным набором правил, затем добавляет секцию для Яндекса из двух строк с Clean-param — и все запреты для Яндекса перестают действовать, потому что он читает только свою секцию.
Директивы: что живо, а что уже нет
Набор директив небольшой, и половина того, что до сих пор копируют из старых статей, уже ни на что не влияет.
| Директива | Что делает | Статус |
|---|---|---|
| User-agent | Указывает, к какому роботу относится секция | Обязательна, с неё начинается любая секция |
| Disallow | Запрещает обход адресов по маске | Основная рабочая директива |
| Allow | Разрешает обход внутри запрещённого раздела | Работает, приоритет по длине правила |
| Sitemap | Указывает адрес карты сайта | Работает, пишется полным адресом с протоколом |
| Clean-param | Отбрасывает указанные параметры адреса | Работает, но понимает только Яндекс |
| Host | Указывала главное зеркало сайта | Не учитывается, зеркало задаётся редиректом |
| Crawl-delay | Задавала паузу между запросами робота | Не учитывается, скорость обхода настраивается в Вебмастере |
| Request-rate, Visit-time | Ограничения частоты и времени обхода | Никогда всерьёз не поддерживались |
Про маски. Звёздочка заменяет любую последовательность символов, знак доллара обозначает конец адреса. Строка Disallow: /catalog закроет и /catalog/, и /catalogue-arhiv/, потому что совпадение идёт по началу строки. Если нужен только конкретный адрес, ставится доллар: Disallow: /catalog$. Разница между этими двумя вариантами регулярно стоит людям половины каталога.
Готовая конфигурация для WordPress
Рабочий вариант, от которого можно отталкиваться. Домен и адрес карты сайта подставляются свои.
User-agent: * Disallow: /wp-admin/ Disallow: /wp-login.php Disallow: /wp-register.php Disallow: /?s= Disallow: /search/ Disallow: /xmlrpc.php Disallow: */comment-page- Disallow: /*?replytocom Disallow: /cart/ Disallow: /checkout/ Disallow: /my-account/ Allow: /wp-admin/admin-ajax.php Allow: /wp-content/uploads/ Allow: /*.css Allow: /*.js User-agent: Yandex Disallow: /wp-admin/ Disallow: /wp-login.php Disallow: /wp-register.php Disallow: /?s= Disallow: /search/ Disallow: /xmlrpc.php Disallow: /cart/ Disallow: /checkout/ Disallow: /my-account/ Allow: /wp-admin/admin-ajax.php Allow: /wp-content/uploads/ Allow: /*.css Allow: /*.js Clean-param: utm_source&utm_medium&utm_campaign&utm_term&utm_content Clean-param: yclid&ysclid&gclid&fbclid&openstat&from Clean-param: replytocom&cpage Sitemap: https://site.ru/wp-sitemap.xml
Что здесь стоит отметить. Папка с загрузками открыта — картинки должны индексироваться, из поиска по изображениям идёт заметная доля трафика. Стили и скрипты разрешены явно, чтобы страница отрисовывалась так же, как её видит посетитель. Секция для Яндекса продублирована полностью, а не сокращена до Clean-param. Служебные страницы магазина закрыты от обхода, но если они уже попали в индекс, одного запрета мало — нужен ещё метатег noindex, а запрет снимается на время переобхода.
Почему метки закрывают Clean-param, а не Disallow
Это отдельная тема, потому что ошибка распространённая и последствия у неё дорогие. Разница между двумя способами принципиальная.
| Disallow: /*utm | Clean-param: utm_source | |
|---|---|---|
| Что делает робот | Не заходит на адрес с меткой | Заходит, отбрасывает параметр, считает адрес чистым |
| Судьба страницы | Выпадает из индекса вместе с содержимым | Остаётся в индексе по чистому адресу |
| Что с накопленными сигналами | Теряются вместе со страницей | Переходят на основной адрес |
| Дубли | Формально исчезают, вместе со страницей | Исчезают, страница остаётся |
| Поддержка | Все системы | Только Яндекс, для остальных нужен canonical |
Для сайта с рекламным трафиком разница ощутимая. Ссылка с меткой уходит в рассылку, в мессенджер, в соцсеть, там её пересылают дальше — и адрес с меткой начинает жить своей жизнью, собирая переходы и упоминания. Закрыв его запретом, вы выбрасываете из поиска рабочую страницу и всё, что она накопила. Директива Clean-param решает задачу иначе: параметр отбрасывается, адрес склеивается с чистым, дубля нет, страница остаётся на месте.
Важная оговорка: директиву понимает только Яндекс. Для остальных систем те же адреса закрываются указанием основного адреса в canonical. Делать нужно и то, и другое — это не альтернативы, а два разных механизма для двух разных систем.
Что закрывать нельзя ни в коем случае
Список короткий, и каждая строка в нём — реальная находка с чужих сайтов.
Папку с картинками. Закрыв её, вы теряете трафик из поиска по изображениям и мешаете системе оценить страницу целиком. Для магазинов и сайтов с портфолио это заметная потеря.
Стили и скрипты. Поисковые системы отрисовывают страницу так же, как браузер. Без стилей она выглядит сломанной, и оценка мобильного удобства получается отрицательной. Раньше эти файлы закрывали ради экономии обхода — сейчас это прямой вред.
Страницы с метатегом noindex. Разобрано выше: робот не заходит, не видит запрет, страница остаётся в выдаче.
Страницы, которые нужно убрать из индекса срочно. Здесь та же логика. Чтобы страница выпала, робот должен зайти и увидеть метатег или получить код 404. Запрет в robots только замораживает ситуацию.
Пагинацию, если она настроена правильно и имеет canonical на саму себя. Закрыв её, вы отрезаете роботу путь к товарам и записям со второй страницы и дальше.
Весь раздел целиком из-за нескольких плохих адресов. Частая ошибка при чистке дублей: вместо точечного правила пишут запрет на весь каталог. Проверяйте маску до публикации.
Файл карты сайта. Звучит абсурдно, но такое встречается — карта попадает под общую маску вроде Disallow: /*.xml.
Что закрывать стоит
Обратная сторона: адреса, которые в поиске не нужны и только съедают квоту обхода. Набор зависит от типа сайта.
| Тип адресов | Пример | Почему закрывают | Чем закрывать |
|---|---|---|---|
| Административная часть | /wp-admin/, /administrator/ | Служебные страницы, доступ по паролю | Disallow |
| Внутренний поиск | /?s=zapros | Число адресов не ограничено и растёт само | Disallow |
| Корзина и оформление заказа | /cart/, /checkout/ | Персональные страницы, в поиске бессмысленны | Disallow плюс noindex, если уже в индексе |
| Личный кабинет | /my-account/ | То же, плюс риск утечки данных в выдачу | Disallow плюс закрытие доступом |
| Рекламные метки | /uslugi/?utm_source=direct | Дубли основной страницы | Clean-param и canonical, не Disallow |
| Сортировки каталога | /katalog/?orderby=price | Тот же набор товаров по другому адресу | Canonical, параметр в Clean-param |
| Версии для печати | /statya/print/ | Полная копия страницы | Noindex или canonical на оригинал |
| Тестовые копии сайта | test.site.ru, /new/ | Полный дубль всего сайта | Закрытие паролем на сервере, а не robots |
Про тестовые копии стоит сказать отдельно. Закрывать их через robots.txt ненадёжно: файл может не скопироваться при переносе, а если на тестовый адрес где-то стоит ссылка, он попадёт в выдачу и создаст дубль всего сайта. Правильный способ — закрыть доступ на уровне сервера паролем. Тогда никакая ссылка и никакая забытая строка ситуацию не испортят.
Как проверить файл за десять минут
Проверка обязательна после каждой правки, потому что ошибка тут не проявляется сразу — она проявляется через месяц падением трафика.
- Откройте site.ru/robots.txt в браузере. Файл должен открыться текстом, а не перенаправить и не выдать ошибку. Заодно посмотрите на первую строку: если она отображается странно, в файле метка порядка байтов.
- Инструмент анализа в Яндекс.Вебмастере. Вставьте туда десяток важных адресов: главную, страницу услуги, карточку товара, статью, картинку из папки загрузок, файл стилей, файл скриптов. Все должны быть разрешены.
- Отдельно проверьте то, что должно быть закрыто. Адрес внутреннего поиска, корзину, административную часть. Если они разрешены — правило не сработало, чаще всего из-за неверной маски.
- Проверьте секцию для Яндекса отдельно. Инструмент показывает, какую секцию робот применил. Если оказалось, что он читает общую секцию вместо вашей, ищите опечатку в имени.
- Посмотрите, как страницу видит робот. В Вебмастере есть проверка отображения: если страница показана без оформления, значит закрыты стили.
- Через неделю откройте раздел исключённых страниц. Рост числа адресов с пометкой о запрете в robots — сигнал, что правило захватило лишнее.
Отдельная привычка, которая экономит месяцы: сохраняйте предыдущую версию файла перед каждой правкой. Тогда откат занимает минуту, а не восстановление по памяти.
Самая дорогая ошибка
User-agent: * Disallow: /
Две строки, закрывающие сайт целиком. Их ставят на время разработки, чтобы недоделанная версия не попала в поиск, и забывают убрать при запуске. Обнаруживается это обычно через месяц-полтора: страниц в поиске становится всё меньше, трафик уходит, а причину ищут в текстах и ссылках.
Восстановление после такой находки — не мгновенное. Роботу нужно заново обойти сайт, а на это уходит от двух недель до пары месяцев в зависимости от размера. Ускорить можно отправкой основных адресов на переобход и обновлением карты сайта, но полностью вернуть позиции за день не получится.
Правило, которое снимает риск целиком: после любого события, затрагивающего сервер, первым делом открывайте robots.txt и смотрите, что там написано. Список событий такой:
- запуск сайта или новой версии;
- перенос на другой хостинг или домен;
- обновление системы управления или темы;
- любые работы стороннего разработчика;
- восстановление из резервной копии — она может быть старше правок;
- установка плагина, который генерирует файл динамически.
Последний пункт стоит пояснить. Многие системы отдают robots.txt не файлом, а генерируют его на лету. В этом случае физического файла в корне нет, и правки в нём ничего не меняют — настройка живёт в админке или в коде плагина. Проверить просто: измените что-нибудь в файле на сервере и обновите страницу robots.txt в браузере. Если изменение не появилось, файл виртуальный.
Частые вопросы
Обязателен ли robots.txt вообще?
Формально нет: при отсутствии файла робот считает, что разрешено всё. Для маленького сайта на десять страниц без служебных разделов это рабочий вариант — лучше отсутствие файла, чем файл с ошибкой. Но как только появляется внутренний поиск, корзина или каталог с фильтрами, файл становится нужен.
Нужна ли отдельная секция для Google?
Обычно нет, общей секции со звёздочкой достаточно. Отдельная секция понадобится, если правила для Google должны отличаться. Помните главное: робот читает только одну секцию, и если вы создали именную, все правила в неё надо продублировать.
Как закрыть сайт от всех, кроме поисковых систем?
Через robots.txt никак — файл носит рекомендательный характер и агрессивные сборщики его игнорируют. Ограничение доступа делается на уровне сервера: по адресам, по частоте запросов, паролем. Robots.txt — это договорённость с добросовестными роботами, а не защита.
Через сколько робот увидит изменения в файле?
Обычно в течение нескольких дней, иногда быстрее. Ускорить переобход самого файла нельзя, но можно отправить на переобход страницы, доступ к которым вы открыли. Обратная ситуация опаснее: если вы закрыли что-то по ошибке, страницы начнут выпадать из индекса постепенно, и заметить это можно не сразу.
Что делать, если файл отдаётся с ошибкой 500?
Чинить срочно. Часть систем при недоступности файла считает, что сайт закрыт целиком, и приостанавливает обход. Ошибка 404 менее опасна — она читается как «ограничений нет», но и её лучше не оставлять.
Можно ли одним файлом обслуживать несколько поддоменов?
Нет. Каждый поддомен — отдельный сайт со своим корнем и своим файлом. Если у вас двадцать региональных поддоменов, файлов должно быть двадцать, и адрес карты сайта в каждом свой. Общая ошибка при настройке — оставить в файле поддомена адрес карты основного домена.
Стоит ли копировать robots.txt у конкурента?
Как образец структуры — можно, как готовое решение — нет. У него другой набор разделов, другой движок и, возможно, свои ошибки, которые вы перенесёте к себе. Разумнее взять типовую конфигурацию под свою систему управления и дополнить её адресами, которые есть именно у вас.
Технические проверки сайта, включая настройки индексации, показываю на живом примере:
Коротко
- Robots.txt управляет обходом, а не индексацией: закрытая в нём страница может остаться в выдаче, только без описания.
- Убрать страницу из поиска гарантированно можно метатегом noindex при открытом обходе — закрывать её одновременно и в robots нельзя.
- Робот читает только одну секцию: если есть именная для Яндекса, все правила из общей секции надо в неё продублировать.
- Рекламные метки закрывают через Clean-param и canonical, а не через Disallow — иначе страница выпадает из индекса целиком.
- Картинки, стили и скрипты закрывать нельзя: без них система видит сломанную страницу и занижает оценку удобства.
- После запуска, переезда, обновления и любых работ на сервере первым делом проверяйте, не появился ли Disallow со слэшем.
Если файл уже настроен, а страницы всё равно не попадают в поиск, дело обычно не в нём одном — нужно смотреть коды ответов, дубли и карту сайта вместе. Это SEO-консультация: разбираю настройки индексации конкретного сайта и говорю, что именно мешает. Быструю проверку можно запустить и самостоятельно — бесплатный аудит сайта покажет, что закрыто от обхода.
Увеличьте позиции и продажи вашего сайта
Профессиональное SEO-продвижение с гарантией результата. Выберите подходящую услугу:
Остались вопросы по продвижению?
Меня зовут Анатолий Кузнецов, я SEO-оптимизатор с 20-летним стажем. Разберу ваш сайт, отвечу на вопросы и подскажу, что улучшить для роста позиций в Яндексе и Google.
Связаться со мной →Комментарии
Сергей Дегтярёв
Правлю robots.txt на сервере, сохраняю, обновляю страницу — а там старое содержимое. Кэш чистил, ничего не меняется. Что вообще происходит?
Анатолий Кузнецов автор
Почти наверняка у вас виртуальный файл: система генерирует его на лету, и физический файл в корне при этом игнорируется. Так делают многие плагины и часть движков. Проверьте настройки того плагина, который отвечает у вас за карту сайта и индексацию — там обычно есть поле для редактирования robots.txt. Если плагин не найдётся, посмотрите, нет ли в корневом файле сервера правила, которое перехватывает запрос к robots.txt и отдаёт его скриптом. Радикальный вариант — отключить генерацию в настройках и вернуться к обычному файлу, так надёжнее: физический файл переживёт обновление плагина, а сгенерированный может сброситься к настройкам по умолчанию, и вы об этом не узнаете.
Анна Есипова
У нас в файле была секция для Яндекса всего с двумя строками Clean-param. Прочитала у вас про то, что робот читает только одну секцию, полезла проверять — и правда, все запреты для Яндекса не работали больше года. Это объясняет 30 тысяч исключённых страниц?
Анатолий Кузнецов автор
Объясняет напрямую. Робот Яндекса нашёл секцию со своим именем, прочитал только её и на всё остальное ограничений не увидел — значит, обходил внутренний поиск, корзину, служебные адреса и всё, что вы закрывали в общей секции. Тридцать тысяч исключённых при таком раскладе вполне закономерны. Продублируйте в свою секцию весь набор правил из общей, сохраните и проверьте в инструменте анализа Вебмастера: там видно, какую секцию робот применил и разрешён ли конкретный адрес. Дальше ждите переобхода — картина будет выправляться в течение месяца-двух, причём сначала число исключённых может ещё немного вырасти, это нормально.
Олег Жердев
Написал Disallow: /catalog чтобы закрыть один старый раздел, а у меня из индекса ушёл весь каталог /catalogue/. Не понимаю, как так вышло, названия же разные.
Анатолий Кузнецов автор
Совпадение идёт по началу строки, а не по целому слову. Ваше правило закрывает любой адрес, который начинается на /catalog, — и /catalogue/, и /catalog-arhiv/, и всё остальное с этим началом. Чтобы закрыть ровно один раздел, пишите со слэшем на конце: Disallow: /catalog/. Если нужен строго один адрес без вложенных, добавляется знак доллара: Disallow: /catalog$. Правьте и сразу проверяйте в инструменте анализа Вебмастера — вставьте туда пару адресов из каталога, который должен остаться, и убедитесь, что они разрешены. Возвращаться страницы начнут после переобхода, ускорить можно отправкой основных адресов раздела на переобход вручную.
Вера Золотарёва
Нужно срочно убрать из поиска несколько страниц с устаревшими ценами. Закрыла их в robots.txt неделю назад, а они как висели в выдаче, так и висят. Почему не работает?
Анатолий Кузнецов автор
Потому что запрет в robots.txt останавливает обход, а не выкидывает страницу из базы. Робот теперь не может зайти на эти адреса, значит не может и узнать, что там что-то изменилось, — страницы замерли в том виде, в каком были. Сделайте наоборот: уберите запрет, поставьте на эти страницы метатег noindex и отправьте адреса на переобход в Вебмастере. Робот зайдёт, увидит запрет и уберёт их из выдачи, обычно за несколько дней. Если страницы вообще не нужны, вариант надёжнее — отдавать по этим адресам код 404 или 410 и поставить перенаправление на актуальный раздел, чтобы посетители по старым ссылкам не упирались в пустоту.
Антон Дубровин
Не совсем согласен с советом открывать папку с загрузками. У нас там лежат договоры и прайсы в PDF, которые не для всех. Как быть?
Анатолий Кузнецов автор
Здесь надо разделить две задачи. Картинки из папки загрузок открывать стоит — это трафик из поиска по изображениям и корректная отрисовка страниц. А документы, которые не для всех, robots.txt в принципе не защищает: файл носит рекомендательный характер, и прямая ссылка на PDF откроет его любому. Правильное решение — вынести такие файлы из общедоступной папки и отдавать через скрипт с проверкой доступа либо закрыть каталог паролем на уровне сервера. Если это пока невозможно, добавьте точечное правило на подпапку с документами и одновременно заголовок с запретом индексации для этих файлов на стороне сервера — но помните, что это про поиск, а не про безопасность.
Лариса Ефимцева
Забрала конфигурацию для WordPress, спасибо. Особенно за строки с разрешением css и js — у нас они были закрыты общей маской, и Вебмастер ругался на мобильное отображение, а причину найти не могли.
Борис Жилин
Подскажите, а Clean-param есть ограничение по длине строки? У нас параметров много, боюсь не влезет.
Эльвира Зуева
Про тестовые копии — точно в цель. У нас поддомен с разработкой был закрыт только в robots, кто-то поставил на него ссылку с форума, и в выдаче оказался полный дубль сайта. Разбирались два месяца.
Игорь Демьянов
Вопрос про поддомены: у нас их семнадцать, файл на каждом свой, но карту сайта во всех прописали от основного домена. Насколько это критично и что чинить первым?
Нина Ершова
А если сайт совсем маленький, восемь страниц, без корзины и поиска — файл вообще нужен? Или лучше не трогать, раз есть риск ошибиться?
Валерий Жуков
Проверил после переезда на новый хостинг, как советуете. В корне лежал robots.txt с двумя строками и Disallow со слэшем — видимо, от шаблона хостера. Хорошо, что заглянул на второй день, а не через полгода.
Карина Зарубина
Скажите, а Crawl-delay совсем бесполезен? У нас слабый сервер, и робот его периодически кладёт. Чем ограничивать нагрузку, если директива не работает?
Забрала правила: не закрывать CSS и JS, указывать Sitemap, использовать Clean-param для параметров, для надёжного исключения — noindex, а не robots, и всегда проверять в валидаторе. Спасибо за конкретику.
Именно в Вебмастере: отчёт по страницам, исключённым из-за robots, плюс инструмент проверки конкретного URL — доступен он роботу или закрыт. Так видно и лишние запреты, и случайно закрытое нужное.
А как понять, что robots настроен правильно, кроме валидатора? Смотреть в Вебмастере, какие страницы исключены из-за запрета в robots? Или есть ещё способы проверить?
Милана, в Вебмастере есть отчёт по страницам, исключённым из-за запрета в robots, плюс инструмент проверки конкретного URL — доступен он роботу или закрыт. Так видно и лишние запреты, и случайно закрытое нужное. Плюс валидатор robots. Этих инструментов достаточно, чтобы убедиться, что файл настроен верно.
Совет: держите robots минималистичным и осмысленным. Закрывайте только служебное — админку, корзину, внутренний поиск, технические дубли. Не превращайте файл в свалку правил, в которой сами потом не разберётесь.
Спасибо, robots всегда казался мелочью, а тут оказывается — один символ и полсайта из индекса. Пойду проверю свой в Вебмастере и уберу лишние Disallow, накопившиеся за годы.
А боты нейросетей и AI-краулеры — их пускать или блокировать в robots? Сейчас это отдельная дилемма: и в AI-выдаче хочется быть, и контент отдавать не всем.
Проверяю robots после каждого переезда и обновления CMS. Однажды после смены хостинга подтянулся дефолтный robots, закрывавший весь сайт. Хорошо, заметили по падению индексации через Вебмастер.
Отдельная секция User-agent: Yandex имеет смысл, если для Яндекса и Google нужны разные правила. Но чаще хватает общей секции. Не усложняйте без необходимости, чем проще robots, тем меньше шансов ошибиться.
У нас в robots были правила ещё от старого движка, закрывавшие нужные разделы. Никто годами не смотрел. Почистили — часть страниц вернулась в индекс. Проверьте свой файл, вдруг там наследие.
Clean-param — мощная штука именно для Яндекса, отсекает параметры вроде utm и сессий, экономит краулинговый бюджет. Канониклы и Clean-param не взаимоисключают, а дополняют друг друга. Я использую оба.
А директива Clean-param для Яндекса реально помогает с дублями от utm и фильтров? Или проще канониклами разруливать? Запуталась, когда что применять.
Ксения, Clean-param — мощная штука именно для Яндекса, отсекает параметры вроде utm и сессий и экономит краулинговый бюджет. Она не взаимоисключает с канониклами, а дополняет: канониклы разруливают дубли для индекса, Clean-param — для обхода. Я использую оба, каждый на своём месте.
Обязательно указывайте директиву Sitemap в robots — путь к карте сайта. Мелочь, а помогает роботу быстрее находить страницы. Многие забывают эту строку, а она бесплатно ускоряет индексацию.
Частая ошибка — закрыть в robots папку со скриптами и стилями. Тогда робот не может отрендерить страницу и оценивает её как кривую. CSS и JS закрывать нельзя, это бьёт по ранжированию.
Ключевой нюанс: robots запрещает обход, но не гарантирует отсутствие в индексе. Если на страницу есть ссылки, она может попасть в поиск даже под Disallow. Для надёжного исключения — meta noindex, а не только robots.
А что вообще нужно закрывать в robots? Админку, корзину, поиск по сайту? И правда ли, что закрывать через robots от индексации ненадёжно и лучше noindex?
Алина, закрывайте служебное: админку, корзину, внутренний поиск, технические дубли с параметрами. И да, robots запрещает обход, но не гарантирует отсутствие в индексе — если на страницу есть ссылки, она может попасть в поиск. Для надёжного исключения используйте meta noindex, а не только robots.
robots.txt — файл, где легко наломать дров одной строкой. Видел, как случайный Disallow: / закрывал весь сайт от индексации и трафик обнулялся. Первое правило: после любой правки проверять файл в валидаторе Вебмастера.