
Приручить роботов Яндекса — значит перестать надеяться, что поисковая система сама разберётся, какие страницы на сайте важные, и начать управлять её вниманием. Робот не листает сайт как человек: он скачивает код по адресам из очереди, вытаскивает оттуда ссылки и тратит на ваш домен ограниченный ресурс. Если этот ресурс уходит на дубли, фильтры и служебные адреса, нужные страницы месяцами не попадают в поиск — и никакие тексты, ссылки и правки заголовков этого не изменят, потому что оценивать нечего.
В SEO я с 2005 года, и на технических аудитах картина повторяется с досадным постоянством: сайт вроде бы сделан, статьи написаны, деньги потрачены, а в поиске половина того, что должно там быть. Ниже — как устроен обход, какими инструментами он управляется и в каком порядке чинить, если страницы упорно не индексируются.
Обход и индексация: два процесса, которые постоянно путают
Разделение этих двух понятий экономит недели бессмысленных действий, поэтому начну с него.
Обход (краулинг) — робот берёт URL из очереди, запрашивает страницу у сервера, получает код ответа и содержимое, извлекает из кода ссылки и добавляет новые адреса в очередь. У Яндекса за это отвечают несколько роботов: основной индексирующий, который обходит сайт планомерно, и быстрый робот, подхватывающий свежий и часто обновляемый контент — новости, объявления, записи блога.
Индексация — обработка того, что скачали: разбор содержимого, оценка полезности, сравнение с уже известными документами и решение, включать страницу в поисковый индекс или нет.
Робот может годами регулярно заходить на адрес и не добавлять его в индекс. И наоборот: страница может быть в индексе, а робот давно на неё не заходил. Практический смысл различия простой. Если страница не обойдена — проблема техническая: недоступность, запрет, отсутствие ссылок. Если обойдена, но не в индексе — проблема содержательная: дубль, шаблонность, малополезность. Лечатся эти два случая совершенно разными действиями, и попытка вылечить второй случай отправкой на переобход — самая частая трата времени, которую я вижу.
Цикл целиком выглядит так: адрес попадает в очередь → страница скачивается → из неё извлекаются ссылки → содержимое уходит на обработку → принимается решение об индексации → страница участвует в ранжировании. Ваша задача на техническом уровне — ускорить прохождение нужных страниц по этой цепочке и не пускать в неё ненужные.
robots.txt: что он может и чего не может
Файл лежит в корне сайта по адресу вида site.ru/robots.txt и задаёт правила обхода. Ключевой момент, который упускают чаще всего: запрет в robots.txt закрывает обход, но не гарантирует отсутствия адреса в поиске. Если на закрытый URL ведут ссылки, он может оказаться в выдаче без описания — робот знает, что адрес существует, но не может посмотреть, что там. Для надёжного исключения используют мета-тег noindex на самой странице, и тогда страницу нельзя закрывать в robots.txt, иначе робот не увидит тег.
| Директива | Что делает | Типовая ошибка |
|---|---|---|
| User-agent | Указывает, к какому роботу относятся правила: Yandex или * для всех | Правила для Yandex написаны, а общий блок противоречит им |
| Disallow | Запрещает обход пути или раздела | Слишком широкая маска закрывает нужный раздел заодно |
| Allow | Разрешает обход внутри запрещённого раздела | Забывают открыть служебный обработчик, нужный для работы страницы |
| Sitemap | Указывает полный адрес карты сайта, действует для всех роботов | Адрес карты с http вместо https или с прежнего домена |
| Clean-param | Сообщает о незначащих GET-параметрах, чтобы не плодить дубли | Не используется вообще, хотя метки создают десятки копий страниц |
| Crawl-delay | Устарела и не учитывается; скорость обхода настраивается в Вебмастере | Осталась в файле с давних времён и вводит в заблуждение |
Что я нахожу в чужих robots.txt чаще всего. Первое место с большим отрывом — строка Disallow с одним слешем, оставшаяся с этапа разработки: сайт запущен, а обход закрыт целиком. Второе — закрытые папки со стилями и скриптами: робот не может отрисовать страницу так, как её видит человек, и оценивает её по обрывкам. Третье — правила, скопированные из чужого файла для другой CMS: они закрывают разделы, которых у вас нет, и не закрывают те, что есть.
После любой правки проверяйте файл инструментом «Анализ robots.txt» в Яндекс.Вебмастере: вставляете список адресов и видите, какие из них разрешены, а какие заблокированы. Это занимает минуту и снимает большую часть рисков.
sitemap.xml: карта, которой робот верит
Карта сайта — список адресов, которые вы хотите видеть в поиске, с датой последнего изменения каждого. Карта не заставляет индексировать, но помогает роботу быстрее находить новое и переобходить обновлённое, особенно на больших сайтах со слабой перелинковкой.
Если нужны детали, смотрите «Как улучшить позиции сайта».
- В карту включают только индексируемые страницы, отдающие код 200. Никаких редиректов, ошибок, закрытых в robots.txt адресов и неканонических дублей. Карта с мусором обесценивается: робот перестаёт ей доверять как источнику приоритетов.
- Дата изменения должна быть настоящей. Если CMS проставляет текущую дату всем страницам при каждой генерации карты, сигнал перестаёт работать: робот не понимает, что реально обновилось.
- Не более 50 000 адресов в одном файле. Для крупных проектов делают несколько карт и объединяют их индексной картой.
- Адрес карты указывают в robots.txt и добавляют в Вебмастере в разделе «Индексирование — Файлы Sitemap», чтобы видеть статус обработки и ошибки.
- Разбивайте карту по типам страниц. Отдельно товары, отдельно категории, отдельно статьи. Тогда в Вебмастере видно, какая именно группа индексируется плохо, а не общее число по сайту.
- Как улучшить позиции с ТОП 30 до ТОП 3
Последний пункт недооценивают, а он превращает карту из формальности в инструмент диагностики. Когда у вас одна карта на двадцать тысяч адресов, статистика по ней не говорит ничего. Когда карт пять и по одной из них в поиске сорок процентов адресов, а по остальным — девяносто, вы сразу знаете, где искать проблему.
Краулинговый бюджет: куда он утекает
Помогу с продвижением: заказать продвижение сайта — вывожу сайты в топ Яндекса белыми методами.
Краулинговый бюджет — количество страниц, которое робот готов обойти на сайте за период. Для сайта на несколько сотен адресов вопрос обычно не стоит: робот успевает всё. Остро он встаёт на каталогах, магазинах с фильтрами и проектах с тысячами страниц, где ресурс уходит на мусор и не доходит до важного.
| Источник утечки | Как выглядит | Чем закрывается |
|---|---|---|
| GET-параметры | Сортировки, метки, идентификаторы сессий создают копии страниц | Clean-param, канонические адреса, запрет в robots |
| Фильтры каталога | Комбинации фильтров дают тысячи адресов с одинаковым содержимым | Открыть только фильтры со спросом, остальные закрыть |
| Календари и архивы | Робот уходит в бесконечную пагинацию по датам | Отключить или закрыть от обхода |
| Цепочки редиректов | Каждый лишний переход тратит запрос робота | Сократить цепочки до одного шага |
| Битые ссылки | Робот регулярно ходит по адресам, отдающим ошибку | Починить ссылки в шаблоне и контенте |
| Медленный ответ сервера | Чем дольше отдаётся страница, тем меньше их успевают скачать | Кэширование, оптимизация запросов к базе, нормальный хостинг |
| Теги и метки без спроса | Сотни автоматических страниц с одной-двумя записями | Оставить только те, под которые есть запросы |
Оптимизация бюджета сводится к двум движениям: убрать из зоны обхода лишнее и облегчить доступ к важному. Второе часто забывают. Приоритетные страницы должны быть в двух-трёх кликах от главной, а не на пятнадцатой странице пагинации. Раздел, до которого от главной ведёт единственная ссылка из подвала, робот обходит редко, как бы хорош ни был его контент.
Если интересно направление с сайтами — базу даю в своём курсе:
Дубли: главный пожиратель внимания робота
Дубли вредят дважды: тратят бюджет обхода и размывают оценку, потому что вместо одной сильной страницы поиск видит несколько слабых и выбирает канонической не ту, что нужна вам.
Типовые источники дублей на большинстве сайтов: доступность страницы по адресу со слешем на конце и без него, версии с www и без, http и https, версии для печати, страницы с меткой источника перехода, пагинация без разделения заголовков, товар, доступный по нескольким путям в каталоге.
Порядок работы такой. Сначала выбирается один канонический вид адреса и настраивается 301 на него со всех остальных вариантов — это делается на уровне сервера и решает половину проблемы. Затем на страницы, которые должны существовать в нескольких вариантах по техническим причинам, ставится ссылка rel=»canonical» на основной адрес. И наконец, незначащие параметры перечисляются в Clean-param, чтобы робот вообще не считал их разными адресами.
Подробнее об этом — в статье «Как улучшить позиции сайта в Яндекс».
Проверить результат можно в Вебмастере: раздел «Индексирование — Страницы в поиске» с фильтром по исключённым адресам показывает, что именно поиск считает дублями и какую версию выбрал основной. Если выбрана не та — почти всегда причина в противоречии между canonical, редиректом и картой сайта.
Почему страница не попадает в индекс
Статус любого адреса смотрится в Вебмастере инструментом «Проверить статус URL»: он показывает, обошёл ли робот страницу, когда это было и почему она исключена. Дальше действуют по причине.
| Причина | Как проверить | Что делать |
|---|---|---|
| Закрыта в robots.txt | Инструмент «Анализ robots.txt» | Убрать запрещающее правило и отправить на переобход |
| Мета-тег или заголовок noindex | Исходный код страницы и заголовки ответа | Убрать тег и заголовок X-Robots-Tag |
| Недостаточно качественная | Статус в «Страницы в поиске» | Доработать содержание: полнота ответа, уникальные данные |
| Дубль другой страницы | Список исключённых с указанием канонического адреса | Настроить canonical и убрать параметры |
| Нет входящих ссылок | Поиск по сайту: ведёт ли на неё хоть одна ссылка | Добавить ссылки из разделов, меню, связанных материалов |
| Ошибка ответа сервера | Проверка кода ответа для адреса | Обеспечить корректный код 200 без редиректов |
| Робот ещё не дошёл | Дата последнего обхода в статусе URL | Отправить переобход, проверить наличие в карте |
Статус «Недостаточно качественная» заслуживает отдельного слова, потому что он самый частый и самый обидный: технически всё в порядке, а страницу не берут. Техника здесь не поможет — повторная отправка на переобход не изменит оценку. Помогает только содержание: страница должна давать человеку больше, чем то, что уже стоит в выдаче по этому запросу. Если такой статус получила не одна страница, а целый шаблон — карточки товаров, страницы городов, однотипные разделы — значит, проблема в самом шаблоне, и переписывать нужно его, а не отдельные адреса.
Как ускорить обход и индексацию
Когда страница технически чистая и содержательно готова, обход можно ускорить. Инструментов ровно три, и работают они по-разному.
Переобход в Вебмастере. Раздел «Индексирование — Переобход страниц»: вставляете список адресов в пределах суточного лимита и отправляете. Робот приходит на них в приоритетном порядке, обычно в течение нескольких дней. Это точечный ручной инструмент: опубликовали важную страницу или существенно обновили существующую — отправили.
IndexNow. Протокол, позволяющий уведомлять поисковые системы об изменении адреса сразу, не дожидаясь визита робота. Механика такая: генерируете ключ, кладёте текстовый файл с ним в корень сайта, а при публикации или правке страницы сайт отправляет запрос с адресом и ключом. На популярных CMS это делает плагин или встроенная интеграция, и пинг уходит автоматически. Для проектов с частыми публикациями срок попадания в индекс сокращается заметно.
Если нужна помощь по теме — обучение SEO-продвижению.
Внутренние ссылки. Самый недооценённый инструмент, потому что он бесплатный и постоянный. Робот находит страницы по ссылкам, и новая статья, на которую ссылаются из свежих материалов и из разделов, будет обойдена раньше страницы-сироты. Регулярное обновление существующих страниц с честной датой в карте тоже провоцирует переобход.
Чего эти инструменты не делают: они не влияют на решение об индексации и тем более на позиции. Отправка на переобход десять раз подряд не превратит слабую страницу в сильную. Это ускорители доставки, а не улучшители качества.
Тему разбирал отдельно: «Как увеличить трафик из поиска Яндекс и улучшить позиции сайта».
Скорость сервера и логи: то, что не видно в панелях
Связь между скоростью ответа и глубиной обхода прямая: чем быстрее сервер отдаёт документ, тем больше документов робот успевает забрать за сессию. На сайте из пятисот страниц это незаметно, на сайте из пятидесяти тысяч — определяет, дойдёт ли робот до новых разделов вообще.
Отдельно стоит следить за кодами 5xx. Периодические ошибки сервера при пиковой нагрузке робот воспринимает как сигнал снизить частоту запросов, и обход замедляется надолго, даже когда проблема уже устранена. В Вебмастере это видно в разделе статистики обхода: провалы по числу загруженных страниц совпадают с всплесками ошибок.
Самый честный источник данных об обходе — логи сервера. Панель показывает сводку, логи показывают факты: по каким адресам робот ходил, сколько раз, какие коды получал, сколько времени занимала отдача. Разбор логов за неделю обычно приносит два открытия. Первое: значительная доля запросов робота уходит на адреса, которых в вашем представлении о сайте вообще не существует. Второе: важные разделы посещаются в разы реже, чем мусорные.
Чеклист технической готовности
| Пункт | Чем проверить | Норма |
|---|---|---|
| Код ответа страницы | Проверка ответа сервера, статус URL | 200 без промежуточных редиректов |
| Доступность для обхода | Анализ robots.txt | Адрес разрешён |
| Отсутствие noindex | Исходный код и заголовки ответа | Тега и заголовка нет |
| Канонический адрес | Проверка ссылки rel=»canonical» | Указывает на саму страницу |
| Наличие в карте сайта | Открыть карту и найти адрес | Есть, с реальной датой изменения |
| Входящие внутренние ссылки | Поиск ссылок на адрес по сайту | Минимум две-три с разных разделов |
| Уведомление об изменении | Переобход или лог пинга IndexNow | Отправлено после публикации |
| Скорость отдачи | Статистика обхода в Вебмастере | Стабильная, без всплесков ошибок |
Пробегать этот список стоит не только после публикации, но и раз в квартал по случайной выборке из десятка страниц. Технические настройки имеют свойство ломаться незаметно: обновили CMS, поставили плагин, перенесли сайт — и половина пунктов уехала.
Частые вопросы
Сколько времени занимает индексация новой страницы? Гарантированного срока нет. При настроенной карте, отправке на переобход или работающем IndexNow страница нередко попадает в поиск за несколько дней. На слабо перелинкованном сайте без этих действий обход может занять недели. Робот распределяет ресурс сам, и точную дату не назовёт никто.
Страница обойдена, но не в индексе. Что делать? Ничего технического — техника уже отработала. Смотрите точную формулировку причины в статусе URL. Если написано про качество, дорабатывайте содержание; если про дубль — разбирайтесь с каноническим адресом. Повторные отправки на переобход в этой ситуации бесполезны.
Закрывать ли фильтры и сортировки? Сортировки — почти всегда да, они не несут отдельного смысла. Фильтры — по спросу: если по сочетанию «категория плюс признак» люди задают запросы, такую страницу оставляют открытой с собственными заголовком и описанием. Остальные комбинации закрывают, иначе каталог порождает тысячи одинаковых адресов.
Помогает ли частая отправка на переобход поднять позиции? Нет. Переобход ускоряет визит робота и не более того. Позиции определяются качеством страницы относительно конкурентов, и ускорение доставки на это не влияет.
Влияет ли скорость сайта на позиции или только на обход? На обход — напрямую и заметно. На позиции — опосредованно: медленная страница чаще теряет посетителя, а поведение аудитории уже участвует в оценке. Поэтому ускорение сервера обычно даёт двойной эффект.
Нужно ли закрывать страницы пагинации? Закрывать от обхода не нужно — по ним робот доходит до товаров и материалов вглубь каталога. Нужно сделать так, чтобы они не были дублями: разные заголовки, отсутствие повторяющегося вводного текста на каждой странице, canonical на саму себя, а не на первую.
Коротко
- Обход и индексация — разные процессы: техническая недоступность и низкая оценка качества лечатся совершенно разными действиями.
- robots.txt закрывает обход, но не гарантирует исключения из поиска; для надёжного исключения нужен noindex на открытой для обхода странице.
- Карта сайта работает, только если в ней чистые адреса с кодом 200 и настоящие даты изменения; разбивка карт по типам страниц превращает её в инструмент диагностики.
- Краулинговый бюджет утекает на параметры, фильтры, календари, цепочки редиректов и медленный сервер — сначала убирают лишнее, потом сокращают путь до важного.
- Ускорители обхода — переобход в Вебмастере, IndexNow и внутренние ссылки; на решение об индексации и на позиции они не влияют.
- Логи сервера показывают реальную картину обхода, которой нет ни в одной панели: куда робот ходит на самом деле и что игнорирует.
- Как улучшить позиции с ТОП 30 до ТОП 3
Если страницы вашего сайта индексируются частично, обход идёт медленно или нужные разделы месяцами не появляются в поиске, приходите на SEO-консультацию: посмотрим статистику обхода и список исключённых страниц вместе, определим, где именно теряется внимание робота, и составим порядок работ — от того, что чинится за день, до того, что требует переделки шаблона.
Увеличьте позиции и продажи вашего сайта
Профессиональное SEO-продвижение с гарантией результата. Выберите подходящую услугу:
Остались вопросы по продвижению?
Меня зовут Анатолий Кузнецов, я SEO-оптимизатор с 20-летним стажем. Разберу ваш сайт, отвечу на вопросы и подскажу, что улучшить для роста позиций в Яндексе и Google.
Связаться со мной →
Комментарии
Сергей Глотов
У нас каталог на восемнадцать тысяч товаров, в поиске около семи тысяч. Карта одна общая. Правильно понимаю, что первым делом надо разбить её по типам страниц, чтобы понять, какая группа проваливается, а не гадать по общей цифре?
Анатолий Кузнецов автор
Да, и это дешёвое действие с быстрым результатом. Сделайте отдельные карты для категорий, для товаров и для служебных разделов, объедините индексной и добавьте каждую в Вебмастер отдельной строкой. Через неделю-две вы увидите долю проиндексированных по каждой группе, и дальше разговор станет предметным. Обычно на таком объёме картина выходит одна из двух: либо проседают товары одной большой категории — тогда причина в шаблоне карточки, либо проседают глубокие страницы каталога — тогда причина в перелинковке и робот до них просто не доходит. Заодно проверьте, что в карте лежат только адреса с кодом 200: на каталогах такого размера в неё почти всегда попадают снятые с продажи товары, отдающие ошибку или редирект, и это обесценивает всю карту.
Анна Дорофейчук
Абзац про разницу между «не обойдена» и «обойдена, но не в индексе» стоил бы мне полугода, если бы я прочитала его раньше. Мы месяцами долбили переобход по страницам со статусом про качество и не понимали, почему ничего не меняется.
Михаил Ермилов
Про логи — согласен, но у нас обычный виртуальный хостинг, и доступ к логам там куцый: хранятся несколько дней и в неудобном формате. Есть способ понять картину обхода без нормальных логов?
Анатолий Кузнецов автор
Есть, хотя картина будет грубее. Первое: в Вебмастере раздел статистики обхода даёт список страниц, загруженных роботом за последние дни, с кодами ответа — это не полные логи, но там уже видно, ходит ли робот по мусорным адресам. Второе: там же есть динамика по числу загруженных страниц и по ошибкам, и провалы на графике почти всегда совпадают с проблемами на сервере. Третье, что мало кто делает: скачайте логи за те несколько дней, что хранятся, и разберите их — даже трёх суток хватает, чтобы увидеть, какая доля запросов уходит на параметры и фильтры. Если хостинг не даёт даже этого, попросите поддержку включить хранение хотя бы на неделю, обычно это делается по заявке. И на будущее: возможность нормально читать логи — один из немногих технических аргументов в пользу перехода на сервер, где вы хозяин.
Татьяна Гладышкина
Таблица с директивами закрыла давний спор с разработчиком про Crawl-delay. Он держал её в файле «на всякий случай» и уверял, что она снижает нагрузку. Строчка про то, что скорость настраивается в панели, оказалась убедительнее моих слов.
Константин Дёгтев
Вопрос про пагинацию. У нас на каждой странице списка выводится один и тот же вводный текст под заголовком, потому что так сделан шаблон. Заголовки тоже одинаковые. Переписывать текст для каждой страницы нереально, их сотни. Что делать?
Анатолий Кузнецов автор
Переписывать и не надо. Рабочее решение состоит из трёх правок в шаблоне, и все они делаются один раз. Первая: вводный текст выводить только на первой странице списка, со второй и далее не показывать — это снимает основную часть дублирования. Вторая: в заголовок и в Title страниц со второй добавлять номер страницы, чтобы они формально отличались. Третья: canonical на каждой странице пагинации должен указывать на неё саму, а не на первую — иначе робот считает, что содержимое глубоких страниц вы сами объявили неважным, и до товаров с них доходит хуже. Дополнительно проверьте, что ссылки на следующие страницы — обычные ссылки в коде, а не кнопка на скрипте: подгрузку по нажатию робот не всегда проходит, и весь каталог глубже первой страницы для него закрыт.
Ольга Егоркина
Нашли у себя классику: сайт после переезда полгода жил со строкой запрета всего обхода. Заметили только потому, что решили проверить файл по вашему списку. Тексты за это время написали на сто тысяч рублей.
Павел Груздев
Полезно про честную дату изменения в карте. У нас плагин ставил текущую дату всем страницам при каждой перегенерации, и получалось, что весь сайт «обновляется» ежедневно. Робот на это перестал реагировать вообще.
Инна Добрынина
Спорный для меня момент — про фильтры по спросу. У нас магазин запчастей, сочетаний фильтров сотни тысяч. Как вообще определить, по каким из них есть спрос, не проверяя каждое вручную?
Анатолий Кузнецов автор
Вручную и не проверяют, это делается выгрузкой. Порядок такой. Сначала соберите все реально возможные сочетания из базы — обычно оказывается, что осмысленных на порядок меньше, чем теоретических, потому что многие комбинации дают пустой список товаров. Дальше сгенерируйте из них поисковые фразы по шаблону «категория плюс значение фильтра» и прогоните массово через Вордстат или сервис сбора частотности. Открываете только те, где частота выше вашего порога — порог определяете сами, обычно это несколько показов в месяц. Дополнительный источник, который часто точнее Вордстата: собственный поиск по сайту и отчёт по поисковым запросам из Вебмастера — там видно, чем люди уже интересуются на вашем каталоге. Всё, что не прошло отбор, закрывайте от обхода. И правило на будущее: страницы фильтров, которые вы открыли, должны получать свои заголовок и описание автоматически по шаблону, иначе они станут дублями категории и вылетят по качеству.
Руслан Даутов
Добавлю про 5xx. У нас сервер падал по ночам при бэкапе, минут на двадцать. Казалось, мелочь. Обход просел почти вдвое и восстанавливался месяц после того, как бэкап перенесли.
Вера Елагина
Раздел про статус «недостаточно качественная» и про шаблон целиком — самое ценное. У нас так вылетели все страницы городов, и мы правили их по одной, вместо того чтобы понять, что дело в самом шаблоне, где менялось только название города.
Антон Гусаченко
Хочу уточнить про IndexNow. Мы поставили плагин, ключ лежит в корне, но как убедиться, что пинги реально уходят и принимаются, а не молча падают? В интерфейсе плагина всё зелёное, но верить не хочется.
Анатолий Кузнецов автор
Проверяется в три шага, и все выполняются за десять минут. Первый: откройте в браузере адрес вашего ключевого файла в корне сайта и убедитесь, что он отдаётся с кодом 200 и содержит ровно ключ, без лишних символов и разметки. Второй: посмотрите, ведёт ли плагин собственный журнал отправок — у нормальных реализаций он есть, и там видны адрес, время и код ответа сервиса. Код 200 или 202 означает, что уведомление принято; 403 обычно значит, что ключ не совпадает с файлом. Третий и самый честный: опубликуйте тестовую страницу и через сутки посмотрите её статус в Вебмастере — если робот пришёл на неё в первый же день, механизм работает. Отдельно предупрежу про типовую ловушку: если вы заливаете изменения на сайт напрямую в базу, минуя обычную публикацию, пинг не уйдёт, потому что плагин срабатывает на событие сохранения записи. В таких случаях адреса приходится отправлять отдельно, вручную или скриптом.
Максим Дунин
Про два-три клика от главной. У нас важный раздел висел единственной ссылкой в подвале, робот заходил туда раз в месяц. Добавили в меню и поставили ссылки из статей — частота обхода изменилась за пару недель, без всяких переобходов.