Логотип seo-prodvizhenie-biznesa.ru
+7 (921) 333-77-45

Как настроить robots.txt

Как настроить robots.txt
Анатолий Кузнецов
Анатолий Кузнецов
SEO-оптимизатор с 20-летним стажем. Автор блога seo-prodvizhenie-biznesa.ru о продвижении и доработке сайтов.

Как настроить robots.txt — вопрос из тех, где цена ошибки не соответствует размеру файла. Десять строк текста в корне сайта, и одна из них способна убрать из поиска всё, что вы делали годами. Забытую с разработки строку находят обычно через полгода, когда трафика уже нет, а восстановление занимает недели.

При этом файл несложный: директив в нём меньше десятка, половина устарела, и запомнить рабочий минимум можно за вечер. Ниже — что этот файл на самом деле делает и чего не делает, правила синтаксиса, на которых спотыкаются, готовая конфигурация для WordPress с пояснениями по каждой строке и список того, что закрывать нельзя ни при каких условиях.

Что robots.txt делает и чего он не делает

Половина ошибок с этим файлом происходит из-за неверного понимания его роли. Он управляет обходом, а не индексацией. Это разные вещи.

Обход — робот скачивает страницу и смотрит, что внутри. Индексация — страница попадает в поисковую базу и может показаться в выдаче. Строка Disallow запрещает первое, но не гарантирует отсутствие второго.

Механика такая: если на закрытую в robots.txt страницу ведут ссылки с других сайтов, поисковая система знает о её существовании и может показать адрес в выдаче — только без описания, потому что зайти и прочитать содержимое ей запрещено. Получается худший вариант: страница и в поиске, и выглядит пустой.

Отсюда практическое правило, которое стоит запомнить раньше синтаксиса:

  • Нужно убрать страницу из поиска гарантированно — метатег noindex в коде страницы, а обход оставить открытым. Робот должен зайти и увидеть запрет.
  • Нужно не тратить обход на служебные адреса — запрет в robots.txt. Годится для разделов, которые никому не интересны и на которые никто не ссылается.
  • Нужно склеить дубли с параметрами — директива Clean-param для Яндекса и указание основного адреса в canonical для остальных систем.

Классическая ловушка — закрыть страницу одновременно и в robots.txt, и метатегом. Робот не может зайти на страницу, значит не видит метатег, значит запрет не срабатывает, и адрес остаётся в выдаче. Причём владелец сайта уверен, что перестраховался вдвойне.

Правила синтаксиса, на которых спотыкаются

Формат простой, но нестрогий к ошибкам: неправильная строка не вызывает ошибку, она просто молча не работает.

  • Файл лежит строго в корне и доступен по адресу вида site.ru/robots.txt. В подпапке он не работает.
  • Отдаётся с кодом 200 и без перенаправлений. Если файл отвечает 301 или 404, поведение робота становится непредсказуемым, а в случае ошибки 5xx часть систем считает сайт закрытым целиком.
  • Кодировка UTF-8 без метки порядка байтов. Невидимая метка в начале файла ломает первую строку, и секция перестаёт читаться.
  • Секции разделяются пустой строкой. Внутри секции пустых строк быть не должно — иначе всё, что ниже, теряет привязку к User-agent.
  • Регистр в путях учитывается: /Catalog/ и /catalog/ — разные адреса. Названия директив регистр не учитывают.
  • Комментарии начинаются с решётки и пишутся с начала строки.
  • Робот выбирает одну секцию — самую подходящую по имени. Если есть секция для Yandex, робот Яндекса читает только её и не смотрит в общую секцию со звёздочкой. Значит, все нужные правила надо продублировать.
  • Внутри секции побеждает более длинное правило, а не порядок строк. При одинаковой длине приоритет у Allow.

Последние два пункта дают больше всего ошибок. Человек пишет общую секцию с полным набором правил, затем добавляет секцию для Яндекса из двух строк с Clean-param — и все запреты для Яндекса перестают действовать, потому что он читает только свою секцию.

Директивы: что живо, а что уже нет

Набор директив небольшой, и половина того, что до сих пор копируют из старых статей, уже ни на что не влияет.

Директива Что делает Статус
User-agent Указывает, к какому роботу относится секция Обязательна, с неё начинается любая секция
Disallow Запрещает обход адресов по маске Основная рабочая директива
Allow Разрешает обход внутри запрещённого раздела Работает, приоритет по длине правила
Sitemap Указывает адрес карты сайта Работает, пишется полным адресом с протоколом
Clean-param Отбрасывает указанные параметры адреса Работает, но понимает только Яндекс
Host Указывала главное зеркало сайта Не учитывается, зеркало задаётся редиректом
Crawl-delay Задавала паузу между запросами робота Не учитывается, скорость обхода настраивается в Вебмастере
Request-rate, Visit-time Ограничения частоты и времени обхода Никогда всерьёз не поддерживались

Про маски. Звёздочка заменяет любую последовательность символов, знак доллара обозначает конец адреса. Строка Disallow: /catalog закроет и /catalog/, и /catalogue-arhiv/, потому что совпадение идёт по началу строки. Если нужен только конкретный адрес, ставится доллар: Disallow: /catalog$. Разница между этими двумя вариантами регулярно стоит людям половины каталога.

Готовая конфигурация для WordPress

Рабочий вариант, от которого можно отталкиваться. Домен и адрес карты сайта подставляются свои.

User-agent: *
Disallow: /wp-admin/
Disallow: /wp-login.php
Disallow: /wp-register.php
Disallow: /?s=
Disallow: /search/
Disallow: /xmlrpc.php
Disallow: */comment-page-
Disallow: /*?replytocom
Disallow: /cart/
Disallow: /checkout/
Disallow: /my-account/
Allow: /wp-admin/admin-ajax.php
Allow: /wp-content/uploads/
Allow: /*.css
Allow: /*.js

User-agent: Yandex
Disallow: /wp-admin/
Disallow: /wp-login.php
Disallow: /wp-register.php
Disallow: /?s=
Disallow: /search/
Disallow: /xmlrpc.php
Disallow: /cart/
Disallow: /checkout/
Disallow: /my-account/
Allow: /wp-admin/admin-ajax.php
Allow: /wp-content/uploads/
Allow: /*.css
Allow: /*.js
Clean-param: utm_source&utm_medium&utm_campaign&utm_term&utm_content
Clean-param: yclid&ysclid&gclid&fbclid&openstat&from
Clean-param: replytocom&cpage

Sitemap: https://site.ru/wp-sitemap.xml

Что здесь стоит отметить. Папка с загрузками открыта — картинки должны индексироваться, из поиска по изображениям идёт заметная доля трафика. Стили и скрипты разрешены явно, чтобы страница отрисовывалась так же, как её видит посетитель. Секция для Яндекса продублирована полностью, а не сокращена до Clean-param. Служебные страницы магазина закрыты от обхода, но если они уже попали в индекс, одного запрета мало — нужен ещё метатег noindex, а запрет снимается на время переобхода.

Почему метки закрывают Clean-param, а не Disallow

Это отдельная тема, потому что ошибка распространённая и последствия у неё дорогие. Разница между двумя способами принципиальная.

Disallow: /*utm Clean-param: utm_source
Что делает робот Не заходит на адрес с меткой Заходит, отбрасывает параметр, считает адрес чистым
Судьба страницы Выпадает из индекса вместе с содержимым Остаётся в индексе по чистому адресу
Что с накопленными сигналами Теряются вместе со страницей Переходят на основной адрес
Дубли Формально исчезают, вместе со страницей Исчезают, страница остаётся
Поддержка Все системы Только Яндекс, для остальных нужен canonical

Для сайта с рекламным трафиком разница ощутимая. Ссылка с меткой уходит в рассылку, в мессенджер, в соцсеть, там её пересылают дальше — и адрес с меткой начинает жить своей жизнью, собирая переходы и упоминания. Закрыв его запретом, вы выбрасываете из поиска рабочую страницу и всё, что она накопила. Директива Clean-param решает задачу иначе: параметр отбрасывается, адрес склеивается с чистым, дубля нет, страница остаётся на месте.

Важная оговорка: директиву понимает только Яндекс. Для остальных систем те же адреса закрываются указанием основного адреса в canonical. Делать нужно и то, и другое — это не альтернативы, а два разных механизма для двух разных систем.

Что закрывать нельзя ни в коем случае

Список короткий, и каждая строка в нём — реальная находка с чужих сайтов.

Папку с картинками. Закрыв её, вы теряете трафик из поиска по изображениям и мешаете системе оценить страницу целиком. Для магазинов и сайтов с портфолио это заметная потеря.

Стили и скрипты. Поисковые системы отрисовывают страницу так же, как браузер. Без стилей она выглядит сломанной, и оценка мобильного удобства получается отрицательной. Раньше эти файлы закрывали ради экономии обхода — сейчас это прямой вред.

Страницы с метатегом noindex. Разобрано выше: робот не заходит, не видит запрет, страница остаётся в выдаче.

Страницы, которые нужно убрать из индекса срочно. Здесь та же логика. Чтобы страница выпала, робот должен зайти и увидеть метатег или получить код 404. Запрет в robots только замораживает ситуацию.

Пагинацию, если она настроена правильно и имеет canonical на саму себя. Закрыв её, вы отрезаете роботу путь к товарам и записям со второй страницы и дальше.

Весь раздел целиком из-за нескольких плохих адресов. Частая ошибка при чистке дублей: вместо точечного правила пишут запрет на весь каталог. Проверяйте маску до публикации.

Файл карты сайта. Звучит абсурдно, но такое встречается — карта попадает под общую маску вроде Disallow: /*.xml.

Что закрывать стоит

Обратная сторона: адреса, которые в поиске не нужны и только съедают квоту обхода. Набор зависит от типа сайта.

Тип адресов Пример Почему закрывают Чем закрывать
Административная часть /wp-admin/, /administrator/ Служебные страницы, доступ по паролю Disallow
Внутренний поиск /?s=zapros Число адресов не ограничено и растёт само Disallow
Корзина и оформление заказа /cart/, /checkout/ Персональные страницы, в поиске бессмысленны Disallow плюс noindex, если уже в индексе
Личный кабинет /my-account/ То же, плюс риск утечки данных в выдачу Disallow плюс закрытие доступом
Рекламные метки /uslugi/?utm_source=direct Дубли основной страницы Clean-param и canonical, не Disallow
Сортировки каталога /katalog/?orderby=price Тот же набор товаров по другому адресу Canonical, параметр в Clean-param
Версии для печати /statya/print/ Полная копия страницы Noindex или canonical на оригинал
Тестовые копии сайта test.site.ru, /new/ Полный дубль всего сайта Закрытие паролем на сервере, а не robots

Про тестовые копии стоит сказать отдельно. Закрывать их через robots.txt ненадёжно: файл может не скопироваться при переносе, а если на тестовый адрес где-то стоит ссылка, он попадёт в выдачу и создаст дубль всего сайта. Правильный способ — закрыть доступ на уровне сервера паролем. Тогда никакая ссылка и никакая забытая строка ситуацию не испортят.

Как проверить файл за десять минут

Проверка обязательна после каждой правки, потому что ошибка тут не проявляется сразу — она проявляется через месяц падением трафика.

  1. Откройте site.ru/robots.txt в браузере. Файл должен открыться текстом, а не перенаправить и не выдать ошибку. Заодно посмотрите на первую строку: если она отображается странно, в файле метка порядка байтов.
  2. Инструмент анализа в Яндекс.Вебмастере. Вставьте туда десяток важных адресов: главную, страницу услуги, карточку товара, статью, картинку из папки загрузок, файл стилей, файл скриптов. Все должны быть разрешены.
  3. Отдельно проверьте то, что должно быть закрыто. Адрес внутреннего поиска, корзину, административную часть. Если они разрешены — правило не сработало, чаще всего из-за неверной маски.
  4. Проверьте секцию для Яндекса отдельно. Инструмент показывает, какую секцию робот применил. Если оказалось, что он читает общую секцию вместо вашей, ищите опечатку в имени.
  5. Посмотрите, как страницу видит робот. В Вебмастере есть проверка отображения: если страница показана без оформления, значит закрыты стили.
  6. Через неделю откройте раздел исключённых страниц. Рост числа адресов с пометкой о запрете в robots — сигнал, что правило захватило лишнее.

Отдельная привычка, которая экономит месяцы: сохраняйте предыдущую версию файла перед каждой правкой. Тогда откат занимает минуту, а не восстановление по памяти.

Самая дорогая ошибка

User-agent: *
Disallow: /

Две строки, закрывающие сайт целиком. Их ставят на время разработки, чтобы недоделанная версия не попала в поиск, и забывают убрать при запуске. Обнаруживается это обычно через месяц-полтора: страниц в поиске становится всё меньше, трафик уходит, а причину ищут в текстах и ссылках.

Восстановление после такой находки — не мгновенное. Роботу нужно заново обойти сайт, а на это уходит от двух недель до пары месяцев в зависимости от размера. Ускорить можно отправкой основных адресов на переобход и обновлением карты сайта, но полностью вернуть позиции за день не получится.

Правило, которое снимает риск целиком: после любого события, затрагивающего сервер, первым делом открывайте robots.txt и смотрите, что там написано. Список событий такой:

  • запуск сайта или новой версии;
  • перенос на другой хостинг или домен;
  • обновление системы управления или темы;
  • любые работы стороннего разработчика;
  • восстановление из резервной копии — она может быть старше правок;
  • установка плагина, который генерирует файл динамически.

Последний пункт стоит пояснить. Многие системы отдают robots.txt не файлом, а генерируют его на лету. В этом случае физического файла в корне нет, и правки в нём ничего не меняют — настройка живёт в админке или в коде плагина. Проверить просто: измените что-нибудь в файле на сервере и обновите страницу robots.txt в браузере. Если изменение не появилось, файл виртуальный.

Частые вопросы

Обязателен ли robots.txt вообще?
Формально нет: при отсутствии файла робот считает, что разрешено всё. Для маленького сайта на десять страниц без служебных разделов это рабочий вариант — лучше отсутствие файла, чем файл с ошибкой. Но как только появляется внутренний поиск, корзина или каталог с фильтрами, файл становится нужен.

Нужна ли отдельная секция для Google?
Обычно нет, общей секции со звёздочкой достаточно. Отдельная секция понадобится, если правила для Google должны отличаться. Помните главное: робот читает только одну секцию, и если вы создали именную, все правила в неё надо продублировать.

Как закрыть сайт от всех, кроме поисковых систем?
Через robots.txt никак — файл носит рекомендательный характер и агрессивные сборщики его игнорируют. Ограничение доступа делается на уровне сервера: по адресам, по частоте запросов, паролем. Robots.txt — это договорённость с добросовестными роботами, а не защита.

Через сколько робот увидит изменения в файле?
Обычно в течение нескольких дней, иногда быстрее. Ускорить переобход самого файла нельзя, но можно отправить на переобход страницы, доступ к которым вы открыли. Обратная ситуация опаснее: если вы закрыли что-то по ошибке, страницы начнут выпадать из индекса постепенно, и заметить это можно не сразу.

Что делать, если файл отдаётся с ошибкой 500?
Чинить срочно. Часть систем при недоступности файла считает, что сайт закрыт целиком, и приостанавливает обход. Ошибка 404 менее опасна — она читается как «ограничений нет», но и её лучше не оставлять.

Можно ли одним файлом обслуживать несколько поддоменов?
Нет. Каждый поддомен — отдельный сайт со своим корнем и своим файлом. Если у вас двадцать региональных поддоменов, файлов должно быть двадцать, и адрес карты сайта в каждом свой. Общая ошибка при настройке — оставить в файле поддомена адрес карты основного домена.

Стоит ли копировать robots.txt у конкурента?
Как образец структуры — можно, как готовое решение — нет. У него другой набор разделов, другой движок и, возможно, свои ошибки, которые вы перенесёте к себе. Разумнее взять типовую конфигурацию под свою систему управления и дополнить её адресами, которые есть именно у вас.

Технические проверки сайта, включая настройки индексации, показываю на живом примере:

Коротко

  • Robots.txt управляет обходом, а не индексацией: закрытая в нём страница может остаться в выдаче, только без описания.
  • Убрать страницу из поиска гарантированно можно метатегом noindex при открытом обходе — закрывать её одновременно и в robots нельзя.
  • Робот читает только одну секцию: если есть именная для Яндекса, все правила из общей секции надо в неё продублировать.
  • Рекламные метки закрывают через Clean-param и canonical, а не через Disallow — иначе страница выпадает из индекса целиком.
  • Картинки, стили и скрипты закрывать нельзя: без них система видит сломанную страницу и занижает оценку удобства.
  • После запуска, переезда, обновления и любых работ на сервере первым делом проверяйте, не появился ли Disallow со слэшем.

Если файл уже настроен, а страницы всё равно не попадают в поиск, дело обычно не в нём одном — нужно смотреть коды ответов, дубли и карту сайта вместе. Это SEO-консультация: разбираю настройки индексации конкретного сайта и говорю, что именно мешает. Быструю проверку можно запустить и самостоятельно — бесплатный аудит сайта покажет, что закрыто от обхода.

Увеличьте позиции и продажи вашего сайта

Профессиональное SEO-продвижение с гарантией результата. Выберите подходящую услугу:

Анатолий Кузнецов — SEO-оптимизатор

Остались вопросы по продвижению?

Меня зовут Анатолий Кузнецов, я SEO-оптимизатор с 20-летним стажем. Разберу ваш сайт, отвечу на вопросы и подскажу, что улучшить для роста позиций в Яндексе и Google.

Связаться со мной →

Комментарии

Сергей Дегтярёв

Правлю robots.txt на сервере, сохраняю, обновляю страницу — а там старое содержимое. Кэш чистил, ничего не меняется. Что вообще происходит?

Анатолий Кузнецов автор

Почти наверняка у вас виртуальный файл: система генерирует его на лету, и физический файл в корне при этом игнорируется. Так делают многие плагины и часть движков. Проверьте настройки того плагина, который отвечает у вас за карту сайта и индексацию — там обычно есть поле для редактирования robots.txt. Если плагин не найдётся, посмотрите, нет ли в корневом файле сервера правила, которое перехватывает запрос к robots.txt и отдаёт его скриптом. Радикальный вариант — отключить генерацию в настройках и вернуться к обычному файлу, так надёжнее: физический файл переживёт обновление плагина, а сгенерированный может сброситься к настройкам по умолчанию, и вы об этом не узнаете.

Анна Есипова

У нас в файле была секция для Яндекса всего с двумя строками Clean-param. Прочитала у вас про то, что робот читает только одну секцию, полезла проверять — и правда, все запреты для Яндекса не работали больше года. Это объясняет 30 тысяч исключённых страниц?

Анатолий Кузнецов автор

Объясняет напрямую. Робот Яндекса нашёл секцию со своим именем, прочитал только её и на всё остальное ограничений не увидел — значит, обходил внутренний поиск, корзину, служебные адреса и всё, что вы закрывали в общей секции. Тридцать тысяч исключённых при таком раскладе вполне закономерны. Продублируйте в свою секцию весь набор правил из общей, сохраните и проверьте в инструменте анализа Вебмастера: там видно, какую секцию робот применил и разрешён ли конкретный адрес. Дальше ждите переобхода — картина будет выправляться в течение месяца-двух, причём сначала число исключённых может ещё немного вырасти, это нормально.

Олег Жердев

Написал Disallow: /catalog чтобы закрыть один старый раздел, а у меня из индекса ушёл весь каталог /catalogue/. Не понимаю, как так вышло, названия же разные.

Анатолий Кузнецов автор

Совпадение идёт по началу строки, а не по целому слову. Ваше правило закрывает любой адрес, который начинается на /catalog, — и /catalogue/, и /catalog-arhiv/, и всё остальное с этим началом. Чтобы закрыть ровно один раздел, пишите со слэшем на конце: Disallow: /catalog/. Если нужен строго один адрес без вложенных, добавляется знак доллара: Disallow: /catalog$. Правьте и сразу проверяйте в инструменте анализа Вебмастера — вставьте туда пару адресов из каталога, который должен остаться, и убедитесь, что они разрешены. Возвращаться страницы начнут после переобхода, ускорить можно отправкой основных адресов раздела на переобход вручную.

Вера Золотарёва

Нужно срочно убрать из поиска несколько страниц с устаревшими ценами. Закрыла их в robots.txt неделю назад, а они как висели в выдаче, так и висят. Почему не работает?

Анатолий Кузнецов автор

Потому что запрет в robots.txt останавливает обход, а не выкидывает страницу из базы. Робот теперь не может зайти на эти адреса, значит не может и узнать, что там что-то изменилось, — страницы замерли в том виде, в каком были. Сделайте наоборот: уберите запрет, поставьте на эти страницы метатег noindex и отправьте адреса на переобход в Вебмастере. Робот зайдёт, увидит запрет и уберёт их из выдачи, обычно за несколько дней. Если страницы вообще не нужны, вариант надёжнее — отдавать по этим адресам код 404 или 410 и поставить перенаправление на актуальный раздел, чтобы посетители по старым ссылкам не упирались в пустоту.

Антон Дубровин

Не совсем согласен с советом открывать папку с загрузками. У нас там лежат договоры и прайсы в PDF, которые не для всех. Как быть?

Анатолий Кузнецов автор

Здесь надо разделить две задачи. Картинки из папки загрузок открывать стоит — это трафик из поиска по изображениям и корректная отрисовка страниц. А документы, которые не для всех, robots.txt в принципе не защищает: файл носит рекомендательный характер, и прямая ссылка на PDF откроет его любому. Правильное решение — вынести такие файлы из общедоступной папки и отдавать через скрипт с проверкой доступа либо закрыть каталог паролем на уровне сервера. Если это пока невозможно, добавьте точечное правило на подпапку с документами и одновременно заголовок с запретом индексации для этих файлов на стороне сервера — но помните, что это про поиск, а не про безопасность.

Лариса Ефимцева

Забрала конфигурацию для WordPress, спасибо. Особенно за строки с разрешением css и js — у нас они были закрыты общей маской, и Вебмастер ругался на мобильное отображение, а причину найти не могли.

Борис Жилин

Подскажите, а Clean-param есть ограничение по длине строки? У нас параметров много, боюсь не влезет.

Эльвира Зуева

Про тестовые копии — точно в цель. У нас поддомен с разработкой был закрыт только в robots, кто-то поставил на него ссылку с форума, и в выдаче оказался полный дубль сайта. Разбирались два месяца.

Игорь Демьянов

Вопрос про поддомены: у нас их семнадцать, файл на каждом свой, но карту сайта во всех прописали от основного домена. Насколько это критично и что чинить первым?

Нина Ершова

А если сайт совсем маленький, восемь страниц, без корзины и поиска — файл вообще нужен? Или лучше не трогать, раз есть риск ошибиться?

Валерий Жуков

Проверил после переезда на новый хостинг, как советуете. В корне лежал robots.txt с двумя строками и Disallow со слэшем — видимо, от шаблона хостера. Хорошо, что заглянул на второй день, а не через полгода.

Карина Зарубина

Скажите, а Crawl-delay совсем бесполезен? У нас слабый сервер, и робот его периодически кладёт. Чем ограничивать нагрузку, если директива не работает?

19 комментариев к “Как настроить robots.txt”

  1. Регина

    Забрала правила: не закрывать CSS и JS, указывать Sitemap, использовать Clean-param для параметров, для надёжного исключения — noindex, а не robots, и всегда проверять в валидаторе. Спасибо за конкретику.

  2. Геннадий

    Именно в Вебмастере: отчёт по страницам, исключённым из-за robots, плюс инструмент проверки конкретного URL — доступен он роботу или закрыт. Так видно и лишние запреты, и случайно закрытое нужное.

  3. Милана

    А как понять, что robots настроен правильно, кроме валидатора? Смотреть в Вебмастере, какие страницы исключены из-за запрета в robots? Или есть ещё способы проверить?

    1. Admin

      Милана, в Вебмастере есть отчёт по страницам, исключённым из-за запрета в robots, плюс инструмент проверки конкретного URL — доступен он роботу или закрыт. Так видно и лишние запреты, и случайно закрытое нужное. Плюс валидатор robots. Этих инструментов достаточно, чтобы убедиться, что файл настроен верно.

  4. Валерий

    Совет: держите robots минималистичным и осмысленным. Закрывайте только служебное — админку, корзину, внутренний поиск, технические дубли. Не превращайте файл в свалку правил, в которой сами потом не разберётесь.

  5. Инна

    Спасибо, robots всегда казался мелочью, а тут оказывается — один символ и полсайта из индекса. Пойду проверю свой в Вебмастере и уберу лишние Disallow, накопившиеся за годы.

  6. Семён

    А боты нейросетей и AI-краулеры — их пускать или блокировать в robots? Сейчас это отдельная дилемма: и в AI-выдаче хочется быть, и контент отдавать не всем.

  7. Галина

    Проверяю robots после каждого переезда и обновления CMS. Однажды после смены хостинга подтянулся дефолтный robots, закрывавший весь сайт. Хорошо, заметили по падению индексации через Вебмастер.

  8. Антон

    Отдельная секция User-agent: Yandex имеет смысл, если для Яндекса и Google нужны разные правила. Но чаще хватает общей секции. Не усложняйте без необходимости, чем проще robots, тем меньше шансов ошибиться.

  9. Марина

    У нас в robots были правила ещё от старого движка, закрывавшие нужные разделы. Никто годами не смотрел. Почистили — часть страниц вернулась в индекс. Проверьте свой файл, вдруг там наследие.

  10. Фёдор

    Clean-param — мощная штука именно для Яндекса, отсекает параметры вроде utm и сессий, экономит краулинговый бюджет. Канониклы и Clean-param не взаимоисключают, а дополняют друг друга. Я использую оба.

  11. Ксения

    А директива Clean-param для Яндекса реально помогает с дублями от utm и фильтров? Или проще канониклами разруливать? Запуталась, когда что применять.

    1. Admin

      Ксения, Clean-param — мощная штука именно для Яндекса, отсекает параметры вроде utm и сессий и экономит краулинговый бюджет. Она не взаимоисключает с канониклами, а дополняет: канониклы разруливают дубли для индекса, Clean-param — для обхода. Я использую оба, каждый на своём месте.

  12. Роман

    Обязательно указывайте директиву Sitemap в robots — путь к карте сайта. Мелочь, а помогает роботу быстрее находить страницы. Многие забывают эту строку, а она бесплатно ускоряет индексацию.

  13. Жанна

    Частая ошибка — закрыть в robots папку со скриптами и стилями. Тогда робот не может отрендерить страницу и оценивает её как кривую. CSS и JS закрывать нельзя, это бьёт по ранжированию.

  14. Олег

    Ключевой нюанс: robots запрещает обход, но не гарантирует отсутствие в индексе. Если на страницу есть ссылки, она может попасть в поиск даже под Disallow. Для надёжного исключения — meta noindex, а не только robots.

  15. Алина

    А что вообще нужно закрывать в robots? Админку, корзину, поиск по сайту? И правда ли, что закрывать через robots от индексации ненадёжно и лучше noindex?

    1. Admin

      Алина, закрывайте служебное: админку, корзину, внутренний поиск, технические дубли с параметрами. И да, robots запрещает обход, но не гарантирует отсутствие в индексе — если на страницу есть ссылки, она может попасть в поиск. Для надёжного исключения используйте meta noindex, а не только robots.

  16. Виктор

    robots.txt — файл, где легко наломать дров одной строкой. Видел, как случайный Disallow: / закрывал весь сайт от индексации и трафик обнулялся. Первое правило: после любой правки проверять файл в валидаторе Вебмастера.

Оставьте комментарий

Ваш адрес email не будет опубликован. Обязательные поля помечены *

 Нажимая «оставить комментарий» вы принимаетеправила конфиденциальности 

Прокрутить вверх