Логотип seo-prodvizhenie-biznesa.ru
+7 (921) 333-77-45

Как закрыть страницу от индексации: robots.txt, noindex и что выбрать

Как закрыть страницу от индексации: robots.txt, noindex и что выбрать
Анатолий Кузнецов
Анатолий Кузнецов
SEO-оптимизатор с 20-летним стажем. Автор блога seo-prodvizhenie-biznesa.ru о продвижении и доработке сайтов.

Закрыть страницу от индексации можно двумя совершенно разными способами, и путаница между ними стоит владельцам сайтов месяцев ожидания. Человек дописывает строчку Disallow в robots.txt, ждёт две недели, открывает поиск — а страница всё ещё там. Или наоборот: ставит метатег на странице, которая уже запрещена в robots.txt, и робот этот метатег даже не читает. Ниже — точная разница между запретом обхода и запретом показа, список того, что закрывать нужно и чего трогать нельзя, готовые примеры кода и порядок проверки в Вебмастере.

Всё, что ниже, выполнимо через админку и файловый менеджер хостинга, без программиста. Если правки в файлах пугают, есть техническое сопровождение сайта — но сначала стоит понять, что именно вы закрываете и зачем.

Два разных запрета, которые все путают

Запрет обхода — директива Disallow в файле robots.txt. Она говорит роботу: не ходи по этому адресу. Робот не скачивает страницу, не видит её содержимое и не тратит на неё ресурсы обхода.

Запрет показа — метатег robots с директивой noindex в коде самой страницы или HTTP-заголовок X-Robots-Tag с тем же значением. Робот страницу скачивает, читает инструкцию и не показывает её в результатах поиска.

Ключевой момент, из-за которого ломается половина попыток: чтобы прочитать метатег, робот обязан зайти на страницу. Если вы запретили обход в robots.txt, заходить он не будет — а значит, и метатег не увидит. Справка Яндекса формулирует это прямо: если страница запрещена в robots.txt, директива метатега или заголовка не действует.

Второй момент — из справки по запрету индексирования: если главная страница запрещена в файле robots.txt, но на неё ведут ссылки с других сайтов, страница может попасть в результаты поиска. Disallow не гарантирует отсутствия адреса в выдаче — только то, что робот по нему не пойдёт.

Отсюда рабочее правило. Нужно, чтобы робот не тратил обход на мусор, — Disallow. Нужно, чтобы конкретного адреса не было в выдаче, — noindex на открытой для обхода странице. Нужно и то и другое — сначала noindex, дождаться ухода адреса из поиска, и только потом Disallow.

Что закрывать точно, а что трогать нельзя

Список того, что закрывают почти на каждом коммерческом сайте, короткий и за годы не меняется. А вот список того, что закрывать нельзя, пополняется за счёт чужих «универсальных» файлов robots.txt из интернета.

Что закрываем Чем закрываем Почему именно так
Корзина, оформление заказа Метатег noindex + Disallow Страницы бесполезны в поиске и генерируются под каждого посетителя
Личный кабинет, страницы авторизации Disallow, при необходимости авторизация Справка Яндекса прямо называет авторизацию одним из способов закрыть раздел
Результаты внутреннего поиска по сайту Метатег noindex Бесконечное число адресов с разным содержимым, поиск считает их малоценными
Служебные и технические адреса движка Disallow Содержимого для посетителя там нет, обход тратится впустую
Дубли с UTM и другими незначащими параметрами Clean-param в robots.txt Справка рекомендует Clean-param вместо Disallow: директива позволяет передавать основному адресу накопленные показатели
Версии страниц для печати Метатег noindex или canonical Содержимое совпадает с основной страницей
PDF, прайсы, документы во вложениях HTTP-заголовок X-Robots-Tag Метатег в PDF не вставить, работает только заголовок
Тестовый домен, копия сайта на поддомене Авторизация на уровне сервера Любые текстовые запреты робот может обойти по внешней ссылке
Страницы услуг и товаров Не закрывать Это то, ради чего сайт существует
Пагинация каталога целиком Не закрывать Закрытая пагинация обрывает роботу путь к карточкам вглубь каталога
Файлы CSS и JavaScript Не закрывать Робот Яндекса использует их, чтобы видеть страницу как современный браузер
Папка с загруженными изображениями Не закрывать Теряется трафик из поиска по картинкам

Про CSS и JavaScript стоит сказать отдельно: запрет на них тянется из старых шаблонных файлов. Яндекс сообщал, что робот использует скрипты и стили при обходе, чтобы видеть содержимое так, как его видит современный браузер, и рекомендовал открыть эти файлы тем, кто закрыл их раньше. В индекс они при этом не попадают — нужны только для отрисовки.

Отдельная история — массовая чистка мусорных адресов, когда закрываешь не одну страницу, а сотни. Как это выглядит на практике, видно в разборе кейса, где закрытие 1400 мусорных страниц подняло позиции за месяц.

Как закрыть страницу метатегом robots

Это основной и самый надёжный способ убрать адрес из выдачи. Метатег ставится внутри секции <head> скрываемой страницы.

<meta name="robots" content="noindex, nofollow" />

Яндекс учитывает в этом метатеге директивы noindex (не индексировать текст), nofollow (не переходить по ссылкам), none (эквивалент noindex, nofollow), noarchive (не показывать сохранённую копию), а также разрешающие index, follow, archive и all. При сочетании запрещающих и разрешающих приоритет у разрешающих — не пишите в одной строке noindex, index.

Если нужно убрать страницу из поиска, но сохранить передачу веса по ссылкам с неё на другие разделы, ставьте только запрет индексирования:

<meta name="robots" content="noindex" />

Для файлов, в которые HTML-код не вставить — PDF, документы, изображения — существует HTTP-заголовок с теми же директивами:

X-Robots-Tag: noindex, nofollow

Заголовок настраивается на сервере, на Apache — в файле .htaccess. Прежде чем править его, сохраните копию: ошибка в синтаксисе кладёт весь сайт с ошибкой 500. Разбор тонкостей — в материале про X-Robots-Tag и закрытие PDF от индексации.

Как закрыть раздел через robots.txt

Файл robots.txt лежит в корне сайта и доступен по адресу вида https://вашсайт.ру/robots.txt. Требования Яндекса к нему простые: файл должен называться именно robots.txt, лежать в корневом каталоге, при обращении сервер обязан отдавать код 200 OK, размер — не более 500 КБ. Кириллица в файле запрещена, домены записывайте в Punycode, а пути — в URL-кодировке.

Минимальный рабочий пример запрета раздела:

User-agent: *
Disallow: /cart/
Disallow: /checkout/
Disallow: /search/
Sitemap: https://вашсайт.ру/sitemap.xml

Директива Allow делает исключение внутри запрещённого раздела — например, чтобы закрыть служебную папку целиком, но оставить открытым один нужный скрипт:

User-agent: *
Disallow: /wp-admin/
Allow: /wp-admin/admin-ajax.php

Важная деталь: если файл не отвечает требованиям, сайт считается открытым для индексирования. Сломанный robots.txt — это не «всё закрыто на всякий случай», а «всё открыто». Проверить, как правила понимает робот, можно инструментом анализа robots.txt в Вебмастере: он разбирает директивы по правилам Яндекса и показывает предупреждения об опечатках.

Отдельный класс задач — когда правила нужно задавать не на весь раздел, а по одной странице. Про это есть полное руководство по постраничному robots, повторять его здесь смысла нет.

Как закрыть страницу на WordPress: три пути

На WordPress задача решается тремя способами, и выбор зависит от того, нужно закрыть одну страницу, весь сайт или целый тип записей.

Путь первый: штатная настройка для всего сайта

В разделе настроек чтения есть опция «Попросить поисковые системы не индексировать сайт»: она переключает внутреннюю опцию blog_public в ноль. Вариант для сайта, который ещё разрабатывается. Три предупреждения. Это просьба, а не запрет — решение остаётся за поисковой системой. При включённой опции WordPress отключает встроенную карту сайта. И главное: галочку регулярно забывают снять после запуска, и сайт месяцами стоит закрытым.

Путь второй: плагин

Любой популярный плагин оптимизации добавляет в редактор записи переключатель вида «показывать эту страницу в результатах поиска». Выключаете — плагин подставляет в <head> метатег с noindex. Простейший путь, если не хочется трогать код: результат сразу виден в исходном коде страницы.

Путь третий: без плагинов, через фильтр

Начиная с версии 5.7 в WordPress есть фильтр wp_robots, который собирает директивы метатега robots. Перед правкой файлов темы сделайте резервную копию сайта и работайте через дочернюю тему — иначе обновление темы сотрёт ваш код. В файл functions.php дочерней темы добавляется примерно такое:

add_filter( 'wp_robots', function ( $robots ) {
    if ( is_page( array( 'korzina', 'oformlenie-zakaza' ) ) || is_search() ) {
        $robots['noindex'] = true;
    }
    return $robots;
} );

В массиве перечисляются ярлыки закрываемых страниц, а is_search() закрывает результаты внутреннего поиска. Есть и готовая функция ядра wp_robots_no_robots: подключённая к тому же фильтру, она выводит noindex, follow для публичного сайта и noindex, nofollow для закрытого.

Про сам файл robots.txt на WordPress нужно знать одну вещь: если физического файла в корне нет, движок отдаёт виртуальный, собранный на лету. Как только вы создаёте настоящий файл robots.txt, виртуальный перестаёт работать и всё содержимое придётся прописать руками — включая строку с картой сайта. Рабочий вариант файла для этого движка разобран отдельно: robots.txt для WordPress.

Как закрыть ссылку, а не страницу

Атрибут rel="nofollow" указывается, чтобы робот не проходил по ссылке. Справка Яндекса по рекомендациям для ссылок предлагает также rel="ugc" для пользовательских ссылок, в качестве которых вы не уверены, и rel="sponsored" для рекламных и партнёрских. Значения можно комбинировать:

<a href="https://primer.ru/" rel="nofollow sponsored">рекламная ссылка</a>

Чего атрибут не делает: он не прячет страницу-цель от поиска. Робот может узнать о ней из карты сайта, из ссылки на стороннем ресурсе, из данных счётчика. Если задача — спрятать страницу, атрибут ссылки для этого не инструмент. То же и с метатегом nofollow на всю страницу: он не мешает роботу узнать об адресах из других источников.

Как проверить, что запрет сработал

Шаг Что сделать Как понять, что всё верно
1 Открыть адрес robots.txt в браузере Файл открывается, текст читается, кириллицы в нём нет
2 Прогнать файл через инструмент анализа robots.txt в Вебмастере Нет предупреждений и ошибок в директивах
3 Посмотреть исходный код закрываемой страницы и найти в нём meta name=»robots» Метатег на месте, написание директив без опечаток
4 Проверить страницу инструментом проверки ответа сервера в Вебмастере Код ответа 200, в содержимом для робота виден нужный метатег
5 Убедиться, что запрещаемая страница не закрыта одновременно и в robots.txt Иначе метатег робот не прочитает и запрет не сработает
6 Через неделю-две посмотреть раздел со страницами в поиске Адрес перешёл в исключённые с ожидаемым статусом

Ускорить удаление помогает инструмент удаления страниц из поиска в Вебмастере. Чтобы заявка прошла, страница должна быть запрещена директивой Disallow, либо отдавать код 404, 403 или 410, либо содержать метатег robots с noindex. По справке, страницы удаляются из базы поиска в течение недели после того, как робот обнаружит ваши указания. Лимиты: до 500 отдельных адресов в сутки на сайт и до 20 префиксов адресов, если удаляете группами.

Раздел «Страницы в поиске» и соседние отчёты панели — главный источник правды по индексации; как их читать, разобрано в материале про три отчёта Вебмастера.

Частые ошибки, которые я вижу чаще всего

Закрыли весь сайт и забыли. Строчка Disallow: / под User-agent: * или невыключенная галочка в настройках движка. Сайт запущен, реклама крутится, трафика из поиска нет. Проверяется за минуту: откройте robots.txt и исходный код главной. Сюда же — опечатки вида Disalow или кириллическая «с» в латинском слове: инструмент анализа в Вебмастере ловит их сразу.

Закрыли служебные адреса, но оставили дубли. Человек берёт чужой robots.txt, закрывает им десяток технических папок и считает задачу выполненной. А в поиске лежат сотни адресов с параметрами сортировки, фильтров и меток. Для них нужны другие инструменты — Clean-param, canonical или редирект; что в каком случае, разобрано в сравнении Clean-param, canonical и 301.

Поставили noindex и Disallow одновременно. Классическая ловушка, описанная выше: запрет обхода выключает метатег. Страница остаётся в поиске, владелец не понимает почему.

Закрыли пагинацию целиком. В каталоге на тысячу товаров карточки доступны только со страниц пагинации. Закрыли её — робот перестал находить карточки, и они выпали из индекса.

Закрыли страницу вместо того, чтобы доработать. Страница не приносит трафика, и её закрывают «чтобы не мешала». Иногда это правильно, но чаще перед вами не мусор, а недоработанная страница, которая при нормальном тексте начнёт работать.

Когда этого не хватит и когда нужен специалист

Метатеги и robots.txt закрывают задачу «убрать из поиска конкретный адрес». Они не закрывают задачу «навести порядок в индексе». Четыре ситуации, где одними запретами не обойтись.

Дубли, которые появляются динамически: фильтры каталога порождают тысячи комбинаций адресов, закрывать их поштучно бессмысленно. Сайт на конструкторе без доступа к файлам: ни .htaccess, ни functions.php там нет, остаётся то, что даёт панель платформы. Конфликт плагинов: два плагина оптимизации подставляют разные метатеги в один <head>, и разбираться придётся с приоритетами хуков. И последнее — страница закрыта, а из поиска не уходит месяцами: робот до неё просто не доходит, потому что она закрыта в robots.txt либо на неё нет ни одной внутренней ссылки и в карте сайта её тоже нет.

Сомневаетесь — не закрывайте наугад: массовое закрытие вслепую убирает из индекса живые страницы, а возвращаются они долго. Дешевле начать с бесплатного аудита сайта и получить список адресов, по которым решение очевидно.

Частые вопросы

Сколько ждать, пока страница исчезнет из поиска

По справке, страницы удаляются из базы поиска в течение недели после того, как робот обнаружит ваши указания. Но сначала робот должен до страницы дойти: на маленьком сайте это занимает и месяц. Ускорить можно двумя вещами — отправить адрес на переобход и подать заявку через инструмент удаления страниц.

Что лучше для одной страницы — robots.txt или метатег

Метатег. Он надёжнее, потому что действует на показ в выдаче, а не только на обход. Директива Disallow уместна, когда речь идёт о целом разделе, содержимое которого роботу вообще незачем скачивать.

Нужно ли закрывать теги и архивы на WordPress

Зависит от того, есть ли на них трафик. Архивы по авторам и датам, которые никто не читает, закрывайте метатегом. Но если страницы тегов оформлены как тематические подборки с текстом, они работают как обычные посадочные, и трогать их не надо.

Можно ли закрыть страницу и оставить её в рекламе

Да, это разные системы: закрытая от индексации страница спокойно работает посадочной для объявлений. Обратная сторона — бесплатных переходов на неё не будет никогда, она живёт ровно столько, сколько вы за неё платите.

Коротко

Запрет обхода и запрет показа — разные вещи. Disallow в robots.txt не пускает робота на страницу, метатег robots с noindex убирает страницу из выдачи. Справка Яндекса прямо предупреждает: закрытая в robots.txt страница может попасть в результаты поиска, если на неё ведут ссылки с других сайтов.

Не ставьте noindex и Disallow на один адрес одновременно: если страница запрещена в robots.txt, метатег робот не прочитает. Сначала метатег, потом, когда адрес уйдёт из поиска, при желании Disallow.

Закрывать стоит корзину, оформление заказа, личный кабинет, результаты внутреннего поиска и служебные адреса. Не закрывайте страницы услуг, пагинацию каталога целиком, папку с изображениями и файлы стилей и скриптов — робот использует их, чтобы видеть страницу как браузер.

На WordPress три пути: штатная настройка на весь сайт для периода разработки, переключатель в плагине для отдельной страницы и фильтр wp_robots в дочерней теме. Перед правкой файлов сохраняйте копию — ошибка в .htaccess или functions.php кладёт сайт целиком.

После правки проверьте результат: анализ robots.txt в Вебмастере, исходный код страницы, инструмент проверки ответа сервера. Ускорить удаление помогает инструмент удаления страниц из поиска, лимит — до 500 адресов в сутки на сайт.

Закрытые страницы наводят порядок в индексе, но трафик приносят открытые. Реклама даёт переходы ровно до тех пор, пока списываются деньги; позиции в поиске остаются вашим активом и работают, когда кабинет выключен. Разумно держать оба канала и постепенно наращивать долю бесплатного, чтобы не зависеть от одного аукциона. Если по вашему сайту непонятно, какие адреса закрывать, а какие срочно доводить до рабочего вида, разберём это на консультации по продвижению — по итогам останется список действий с приоритетами, а не общие рассуждения.

Увеличьте позиции и продажи вашего сайта

Профессиональное SEO-продвижение с гарантией результата. Выберите подходящую услугу:

Анатолий Кузнецов — SEO-оптимизатор

Остались вопросы по продвижению?

Меня зовут Анатолий Кузнецов, я SEO-оптимизатор с 20-летним стажем. Разберу ваш сайт, отвечу на вопросы и подскажу, что улучшить для роста позиций в Яндексе и Google.

Связаться со мной →

Комментарии

Макар

Полгода назад закрыл в robots.txt раздел с отзывами, потому что там были дубли. Страницы до сих пор висят в поиске, хотя робот туда не ходит. Теперь понял почему, но что делать сейчас — просто убрать Disallow?

Анатолий Кузнецов автор

Порядок именно такой, только в три шага. Сначала ставите на эти страницы метатег robots с noindex — физически, в код. Потом убираете строку Disallow из robots.txt, чтобы робот смог до страниц дойти и метатег прочитать. И только после этого отправляете адреса на переобход, чтобы не ждать, пока робот придёт сам. Через неделю после его визита адреса уйдут из базы поиска. Если раздел большой, дополнительно подайте адреса через инструмент удаления страниц — там лимит 500 адресов в сутки, для группы можно использовать префиксы.

Милана

Спасибо за таблицу, забрала в закладки. Один вопрос: у нас магазин, фильтры по цвету и размеру дают адреса с параметрами. Метатег на них не поставить, они генерируются автоматически. Как быть?

Анатолий Кузнецов автор

Для параметров есть отдельный инструмент — директива Clean-param в robots.txt. Она межсекционная, то есть её можно указать в любом месте файла, и ограничение на длину одного правила — 500 символов. Справка прямо рекомендует её вместо Disallow, потому что так основному адресу передаются накопленные показатели. Но сначала разделите фильтры на две группы: те, по которым люди реально ищут, стоит наоборот оставить открытыми и оформить как отдельные посадочные страницы. Закрывать имеет смысл только комбинации, которые никто не ищет.

Денис В.

Не соглашусь насчёт CSS и JS. Открытые стили — это лишняя нагрузка на сервер от робота и лишний расход обхода. У меня хостинг слабый, я их закрыл и ничего не потерял.

Анатолий Кузнецов автор

Нагрузка действительно появляется, тут вы правы, и Яндекс сам про это предупреждал — просил убедиться, что запросы этих файлов не создают проблем для сервера. Но позиция поисковика однозначная: робот использует скрипты и стили, чтобы видеть страницу как современный браузер, и владельцам рекомендовали их открыть. «Ничего не потерял» проверяется только сравнением: закрытые стили чаще всего бьют не по обычным страницам, а по тем, где содержимое подгружается скриптом. Если у вас статичный сайт без динамики, вы и правда можете не заметить разницы. Если хостинг не тянет обход стилей — это повод чинить хостинг, а не robots.txt.

Галина

А правда, что если поставить noindex, то страница перестанет передавать вес по внутренним ссылкам на другие разделы?

Кирилл

Галина, зависит от того, что именно написать. Если только noindex — робот страницу не показывает, но по ссылкам с неё ходит. Если noindex, nofollow или none — не ходит. У меня так было с разделом акций: поставил none, и через месяц просели страницы, на которые оттуда стояли ссылки.

Борис

Сайт на WordPress, разработчик сдал проект и уехал. Обнаружил галочку «попросить не индексировать» включённой. Снял. Сколько теперь ждать и надо ли что-то ещё делать?

Анатолий Кузнецов автор

Надо, и прямо сегодня. Эта опция отключает встроенную карту сайта WordPress, поэтому сначала убедитесь, что карта снова отдаётся — откройте адрес wp-sitemap.xml в браузере. Дальше добавьте сайт в Вебмастер, если его там нет, укажите карту в разделе с файлами Sitemap, проверьте robots.txt на предмет забытых Disallow и отправьте на переобход главную и основные посадочные страницы. И обязательно посмотрите исходный код главной: иногда кроме галочки в настройках noindex дополнительно прописан в теме или в плагине, и снятие галочки ничего не меняет.

Вера

Уточнение по конструкторам: у некоторых платформ есть переключатель индексации на уровне страницы, просто он спрятан в дополнительных настройках страницы, а не в общих. Искала неделю, нашла случайно.

Аркадий

Вопрос по PDF. У нас каталог продукции выложен пдфками, они лезут в поиск вместо страниц товаров. Метатег туда не вставить. X-Robots-Tag — это точно то, что нужно?

Анатолий Кузнецов автор

Да, для файлов это единственный корректный способ: Яндекс поддерживает заголовок X-Robots-Tag с теми же директивами, что и метатег. Настраивается на сервере, для Apache — через .htaccess, и перед правкой обязательно сохраните копию файла. Но прежде чем закрывать, подумайте: если PDF попадают в поиск и по ним приходят люди, проблема не в PDF, а в том, что страницы товаров слабее собственного прайса. Иногда правильнее не закрывать документы, а довести карточки до состояния, когда они выигрывают у файла.

Инна

Мне кажется, вся эта история с закрытием страниц сильно переоценена. Поисковик сам разберётся, что показывать, а что нет. Трачу время на тексты, а не на robots.txt, и всё нормально.

Дмитрий К.

Инна, до определённого размера сайта согласен. У меня визитка на 12 страниц, там нечего закрывать. Но как только появился каталог с фильтрами, за полгода в поиск уехало около трёх тысяч адресов с параметрами, и нужные страницы стали показываться хуже. Так что зависит от типа сайта.

Лев

Проверил по вашей таблице — нашёл в robots.txt строку, закрывающую всю папку с загрузками. Файл достался от прошлого подрядчика. Картинок в поиске не было вообще, теперь понятно почему. Убрал.

Алевтина

Скажите, а обязательно ли вообще иметь robots.txt? Если на сайте нечего закрывать, можно без него? Читала, что при отсутствии файла сайт всё равно считается открытым, но тогда непонятно, как сообщать роботам адрес карты сайта.

Оставьте комментарий

Ваш адрес email не будет опубликован. Обязательные поля помечены *

 Нажимая «оставить комментарий» вы принимаетеправила конфиденциальности 

Прокрутить вверх