Индексация сайта: что это такое и как она работает

Анатолий Кузнецов
Анатолий Кузнецов
SEO-оптимизатор с 20-летним стажем. Автор блога hozyindachi.ru о продвижении и доработке сайтов.

Индексация сайта: что это такое и как она работает

Страница есть, открывается, текст на месте, а в поиске её нет. Это едва ли не самая частая проблема, с которой ко мне приходят, и почти всегда за ней стоит не «поисковик не заметил», а конкретная причина, которую видно в Вебмастере за десять минут. Я в SEO с 2005 года и за это время индексация из простой процедуры «робот пришёл, забрал, положил в базу» превратилась в многоступенчатый отбор, где страница может быть скачана, обработана и всё равно не попасть в выдачу — потому что поисковик решил, что она не нужна. Ниже разбираю весь путь страницы, статусы Яндекса и Google, причину «малополезная», способы ускорения и то, что изменилось к 2026 году с приходом ИИ-краулеров.

Как устроена индексация на самом деле

Путь страницы в поиск состоит из четырёх этапов, и провалиться можно на любом.

  1. Обнаружение. Робот узнаёт об адресе — из карты сайта, из внутренней ссылки, из внешней ссылки, из счётчика Метрики или через уведомление по протоколу IndexNow. Если ни один из каналов не сработал, страницы для поисковика не существует.
  2. Сканирование. Робот запрашивает страницу и получает код ответа и содержимое. Здесь теряются страницы, закрытые в robots.txt, отдающие ошибку, слишком медленные или требующие выполнения скриптов, которые робот не смог отработать.
  3. Обработка. Содержимое разбирается: выделяется текст, заголовки, ссылки, метатеги. Определяется каноническая версия, отсеиваются дубли, применяются директивы noindex и rel=canonical. Дублирующая страница может быть просканирована десять раз и всё равно не попасть в базу — робот считает её копией другой.
  4. Включение в поиск. Финальный отбор: страница попадает в индекс, если поисковик считает, что она способна отвечать на запросы. На этом этапе и появляются статусы «недостаточно качественная» и «малополезная».

Важное следствие: между «робот скачал страницу» и «страница в поиске» может пройти от нескольких часов до нескольких месяцев, а может не пройти ничего. Утверждение «сайт проиндексирован» без уточнения, сколько страниц реально в поиске, ничего не означает.

Краулинговый бюджет и что на него влияет

Робот не обходит сайт бесконечно. Каждому проекту выделяется свой объём обращений в сутки, зависящий от размера, скорости, авторитетности и от того, насколько часто на сайте появляется что-то новое. Для сайта на пятьсот страниц бюджет обычно не проблема. Для магазина на сто тысяч карточек с фильтрами он становится главным ограничением.

  • Скорость ответа сервера. Чем быстрее отдаётся страница, тем больше адресов робот успевает обойти за отведённое время. Ответ дольше секунды режет обход заметно.
  • Мусорные адреса. Страницы фильтров, сортировок, параметров utm, пагинация без ограничений, версии для печати. Робот тратит бюджет на них вместо карточек товаров.
  • Цепочки редиректов. Каждый переход — отдельное обращение. Цепочка из трёх редиректов стоит вчетверо дороже прямой ссылки.
  • Битые ссылки и мягкие 404. Страница, которая отдаёт код 200 с текстом «ничего не найдено», хуже честной ошибки: робот считает её нормальной и продолжает ходить.
  • Глубина вложенности. Страницы, до которых от главной больше трёх-четырёх кликов, обходятся редко. Это одна из главных причин, по которой старые статьи блога перестают обновляться в индексе.
  • Частота обновлений. Сайт, где регулярно появляется новое, обходится чаще. Заброшенный проект переводится роботом в разряд редко посещаемых.

Почему страница не попадает в поиск

Причина Как проверить Что делать
Закрыта в robots.txt Вебмастер, анализ robots.txt; строка Disallow убрать правило, дождаться переобхода файла
Метатег noindex или заголовок X-Robots-Tag исходный код страницы, ответ сервера снять директиву, отправить на переобход
Канонический адрес указывает на другую страницу тег rel=canonical в коде исправить или удалить, если каноникал ошибочный
Дубль другой страницы Вебмастер, раздел исключённых страниц уникализировать содержимое или склеить осознанно
Нет ни одной внутренней ссылки обход краулером, поиск страниц-сирот добавить ссылки из разделов и связанных материалов
Ошибка ответа сервера код ответа 4xx или 5xx починить, проверить доступность для робота отдельно
Содержимое подгружается скриптом просмотр страницы с отключённым JavaScript отдавать основной текст в HTML
Страница слишком новая дата публикации, отчёт обхода подождать, отправить на переобход, дать ссылок
Признана недостаточно качественной статус в Вебмастере переписать, объединить с похожими или удалить
Сайт под фильтром или с санкциями раздел безопасности и нарушений в Вебмастере устранять нарушение, отправлять на перепроверку

Порядок диагностики всегда один: сначала техника (доступность, директивы, каноникал), потом ссылочная связность, и только потом — качество содержимого. Начинать с переписывания текста, не проверив robots.txt, — потерянная неделя.

Статусы в Яндекс Вебмастере и Google Search Console

Обе панели показывают причину исключения, но называют вещи по-разному. Сводка ниже — то, чем я пользуюсь как шпаргалкой.

Статус Панель Что означает Приоритет
Недостаточно качественная Яндекс страница обработана, но признана бесполезной для выдачи высокий, разбираться обязательно
Дубль Яндекс содержимое совпадает с другой страницей сайта высокий
Неканоническая Яндекс указан каноникал на другой адрес средний, часто это норма
Запрещена к индексированию Яндекс robots.txt или метатег проверить, намеренно ли
Ошибка HTTP Яндекс сервер вернул код ошибки высокий
Обнаружена — не проиндексирована Google адрес известен, но робот до него не дошёл средний, вопрос бюджета обхода
Просканирована — не проиндексирована Google страница скачана, но в индекс не взята высокий, аналог «недостаточно качественной»
Страница является копией Google Google выбрал другую каноническую версию высокий для коммерческих страниц
Альтернативная страница с каноническим тегом Google всё работает как задумано низкий, реагировать не нужно
Заблокировано в robots.txt Google обход запрещён проверить намеренность

Самая коварная пара — «Просканирована, но не проиндексирована» у Google и «Недостаточно качественная» у Яндекса. Технически с такой страницей всё в порядке, ошибок нет, и потому её обычно игнорируют. А означает она ровно одно: поисковик посмотрел и решил, что показывать это пользователям незачем.

«Малополезная страница»: почему вылетает то, что уже было в поиске

Отдельная боль — страницы, которые год были в индексе и вдруг из него исчезли. В Яндексе это чаще всего статус недостаточно качественной, а на уровне всего сайта — санкции за малополезный контент. Причины, которые я вижу в работе чаще прочих:

  • Текст не отвечает на запрос. Статья на 8 000 знаков, в которой нет ни одного конкретного ответа: общие рассуждения, определения из словаря, «важно учитывать индивидуальные особенности». Особенно массово это касается материалов, сгенерированных нейросетью и опубликованных без редактуры.
  • Шаблонные страницы под города. Сотни адресов, отличающихся одним словом в заголовке. Поисковик склеивает их или выбрасывает целиком.
  • Каннибализация. Пять статей об одном и том же на одном сайте: поисковик оставляет одну, остальные помечает как дубли или бесполезные.
  • Устаревание. Материал с ценами позапрошлого года и ссылками на закрытые сервисы теряет позиции и через несколько обновлений вылетает.
  • Плохие поведенческие показатели. Люди заходят и сразу возвращаются в выдачу: это прямой сигнал, что ответ на странице не найден.
  • Перегруз рекламой и блоками. Если основной текст занимает меньше места, чем всё остальное, страница попадает под соответствующие санкции.

Практика: массово выпавший блог почти никогда не спасается переобходом. Спасает сокращение — объединить десять слабых материалов в два сильных, а остальное удалить с редиректом. Индекс, состоящий из полезных страниц, работает лучше, чем большой индекс из пустых.

Как ускорить индексацию

Инструмент Где Лимиты Когда применять
Переобход страниц Яндекс Вебмастер суточная квота, зависит от сайта, обычно десятки адресов после публикации и после правок важных страниц
Проверка URL и запрос индексирования Google Search Console несколько адресов в сутки точечно, для важных страниц
IndexNow Яндекс и Bing тысячи адресов, ключ на сервере автоматическое уведомление при публикации и обновлении
Карта сайта sitemap.xml обе панели до 50 000 адресов на файл всегда, с актуальными датами изменения
Обход по счётчику Метрики Яндекс Вебмастер по посещаемым страницам крупные сайты с большим числом новых адресов
Внутренняя перелинковка сайт без ограничений базовый и самый надёжный способ
Внешние ссылки и упоминания сторонние площадки для новых сайтов и разделов

Несколько практических замечаний. Переобход в Вебмастере не гарантирует попадания в поиск — он лишь ставит адрес в очередь на скачивание. Если страница исключена как недостаточно качественная, повторные отправки не изменят ничего, кроме расхода квоты. Карта сайта не приказ, а рекомендация: адреса из неё робот учитывает, но проверяет по своим правилам, и держать в ней закрытые или неканонические страницы вредно. IndexNow работает у Яндекса хорошо и подключается на стороне сайта одним ключом, но Google этот протокол не использует, для него остаются карта сайта и ссылки.

ИИ-краулеры и индексация в 2026 году

За последние пару лет в логах любого сайта появился новый класс роботов: краулеры больших языковых моделей и нейропоисковых сервисов. Они не индексируют сайт в классическом смысле и не влияют на позиции в органической выдаче напрямую, но меняют картину.

  • Нагрузка. Такие роботы ходят интенсивно и могут съедать заметную часть ресурсов сервера, что косвенно ухудшает скорость ответа для обычных поисковых роботов. Ограничивать их лучше не полным запретом, а лимитом частоты на стороне сервера.
  • Ответы в выдаче. И Яндекс, и Google формируют сгенерированные ответы поверх органики. В такие ответы попадают страницы, которые уже в индексе и содержат чёткие, вычленяемые формулировки: определения, пошаговые инструкции, таблицы, короткие абзацы с фактами.
  • Что это меняет для индексации. Требования ужесточились в одну сторону: страница без собственных данных, без конкретики и без структуры теперь имеет ещё меньше шансов попасть в индекс. Массовая генерация «под индексацию» перестала работать окончательно.
  • Управление доступом. Решение, пускать ли ИИ-краулеры, стратегическое: закрыв их, вы уходите из ИИ-ответов, но экономите ресурсы. Роботов Яндекса и Google при этом закрывать нельзя ни при каких условиях, и путать их с ИИ-краулерами по строке User-Agent опасно — принадлежность проверяется обратным DNS.

Частые ошибки

Самые дорогие ошибки в работе с индексацией такие. Закрывать разделы в robots.txt в надежде убрать их из поиска — робот перестанет заходить и не увидит noindex, страницы могут остаться в выдаче. Ставить noindex и одновременно запрещать обход — директива просто не будет прочитана. Держать в карте сайта закрытые и неканонические адреса. Массово отправлять на переобход страницы, исключённые за качество. Считать успехом рост числа страниц в индексе: тысяча пустых страниц хуже сотни полезных. Переносить сайт без карты соответствия адресов и получать сотни ошибок вместо редиректов. Ждать индексации через сутки после публикации и делать выводы. Забывать, что закрытая от индексации тестовая копия сайта на поддомене может быть открыта и конкурировать с основным доменом.

Чеклист диагностики

  1. Проверить, отдаёт ли страница код 200 и открывается ли она без авторизации.
  2. Посмотреть исходный код: есть ли noindex, какой указан канонический адрес.
  3. Проверить robots.txt через инструмент анализа в Вебмастере.
  4. Открыть страницу с отключённым JavaScript и убедиться, что текст на месте.
  5. Найти адрес в отчёте страниц в поиске и в списке исключённых, посмотреть статус.
  6. Проверить, ведут ли на страницу внутренние ссылки и с какой глубины.
  7. Убедиться, что адрес есть в карте сайта и дата изменения корректна.
  8. Поискать дубли: похожие страницы, версии с параметрами, копии на поддоменах.
  9. Оценить содержимое: отвечает ли оно на запрос конкретно, есть ли что-то, чего нет у конкурентов.
  10. Отправить на переобход и зафиксировать дату, чтобы отсчитывать срок.
  11. Через 7–14 дней проверить статус повторно; если не изменился — проблема в качестве, а не в обходе.
  12. Раз в квартал прогонять весь сайт краулером и сверять число страниц в индексе с числом полезных страниц.

Проблемы с индексацией лечатся технической частью — это доработка сайта. Список причин по вашему сайту даст бесплатный аудит.

Коротко

  • Индексация состоит из четырёх этапов: обнаружение, сканирование, обработка, включение в поиск. Провалиться можно на любом.
  • Скачанная страница не равна проиндексированной: финальный отбор поисковик делает по полезности.
  • Краулинговый бюджет расходуется на мусорные адреса, редиректы и медленные ответы — чистка кратно ускоряет обход нужных страниц.
  • Порядок диагностики: техника, потом ссылочная связность, потом качество содержимого.
  • Статусы «Недостаточно качественная» у Яндекса и «Просканирована, но не проиндексирована» у Google означают одно: страница не нужна выдаче.
  • Массовое выпадение страниц лечится не переобходом, а сокращением: объединить слабое, удалить пустое, усилить оставшееся.
  • Ускорить помогают переобход в Вебмастере, IndexNow для Яндекса, актуальная карта сайта, обход по счётчику Метрики и внутренняя перелинковка.
  • ИИ-краулеры на позиции напрямую не влияют, но требования к конкретике и структуре текста выросли, а массовая генерация под индексацию не работает.
  • Роботов Яндекса и Google блокировать нельзя, принадлежность проверяется обратным DNS.
  • Рост числа страниц в индексе сам по себе не достижение — считать надо страницы, приносящие трафик.

Если нужно вывод сайта в ТОП Яндекса — помогу вывести сайт в топ Яндекса и удержать позиции.

Увеличьте позиции и продажи вашего сайта

Профессиональное SEO-продвижение с гарантией результата. Выберите подходящую услугу:

Анатолий Кузнецов — SEO-оптимизатор

Остались вопросы по продвижению?

Меня зовут Анатолий Кузнецов, я SEO-оптимизатор с 20-летним стажем. Разберу ваш сайт, отвечу на вопросы и подскажу, что улучшить для роста позиций в Яндексе и Google.

Связаться со мной →

Оставьте комментарий

Ваш адрес email не будет опубликован. Обязательные поля помечены *

 Нажимая «оставить комментарий» вы принимаетеправила конфиденциальности 

Прокрутить вверх