Как проверить индексацию сайта в Яндексе

Анатолий Кузнецов
Анатолий Кузнецов
SEO-оптимизатор с 20-летним стажем. Автор блога hozyindachi.ru о продвижении и доработке сайтов.

Как проверить индексацию сайта в Яндексе

Вопрос «сколько страниц моего сайта в индексе Яндекса» звучит просто, но точный ответ даёт только один инструмент. Владелец смотрит выдачу через оператор site: и видит 1200 страниц, в Вебмастере их 840, в sitemap.xml — 1560. Все три числа верные и означают разное.

Как проверить индексацию сайта в Яндексе 1

Я в SEO с 2005 года и разобрал сотни ситуаций «сайт пропал из Яндекса». Чаще всего сайт никуда не пропадал: человек смотрел не туда и делал вывод по цифре, которая для выводов не предназначена. Ниже — как проверять индексацию правильно, что делать со статусами Вебмастера и как ускорить попадание страниц в поиск.

Что считать индексацией и почему цифры никогда не сходятся

Путь страницы до поиска состоит из трёх этапов, и их постоянно смешивают в одно слово «индексация».

  • Обход. Робот пришёл по URL, скачал HTML, получил код ответа. Страница может быть скачана и тут же отброшена.
  • Попадание в базу. Содержимое разобрано и сохранено, но пользователю не показывается — например, документ признан дублем или малоценным.
  • Попадание в поиск. Страница участвует в ранжировании. Только это состояние имеет смысл: вне поиска она не приносит ни одного визита.

Отсюда расхождения. Sitemap — ваше пожелание, он не гарантирует ничего. Оператор site: даёт оценочное число из выдачи. Вебмастер показывает внутреннюю статистику хоста.

Правда — это число страниц в поиске в Яндекс.Вебмастере. Если в поиске 840 страниц, а в sitemap 1560, у вас не баг панели, а 720 страниц, которые Яндекс посмотрел и решил не показывать. Разбираться нужно с ними, а не с расхождением чисел. У Google своя база и свой Search Console, проверять надо обе панели.

Яндекс.Вебмастер: основной и единственный точный способ

Всё нужное лежит в разделе «Индексирование».

Страницы в поиске

Главный отчёт, два режима. «Все страницы» — текущий список документов в поиске с датой посещения и статусом. «История» — график добавленных и исключённых страниц по дням.

График важнее числа. Обрыв на сотни страниц за день-два — событие с причиной: сбой, ошибка в robots.txt, переезд, смена CMS или ревизия по качеству.

Обход страниц и статистика обхода

«Обход страниц» показывает, какие URL робот посещал и с какими кодами ответа: здесь ловятся 404, 5xx, редиректы и адреса, которых робот не видел. «Статистика обхода» даёт динамику по дням.

Если новая страница не индексируется неделю, смотрите сюда первым делом: робот к ней приходил? Если нет, проблема не в тексте, а в доступности и внутренних ссылках.

Выгрузка полного списка

В отчёте «Страницы в поиске» есть кнопка выгрузки: данные приходят архивом с файлом внутри. Он нужен для честной сверки, потому что интерфейс показывает лишь часть строк.

Алгоритм, которым я пользуюсь на каждом аудите:

  1. Выгрузить из Вебмастера список страниц в поиске и список исключённых.
  2. Получить эталонный список URL: из sitemap.xml, выгрузки CMS или обходом краулером (Screaming Frog, Netpeak Spider).
  3. Привести оба списка к одному виду: убрать протокол и www, снять параметры, унифицировать слеш на конце.
  4. Найти URL, которые есть у вас, но отсутствуют в поиске — это кандидаты на разбор.
  5. Найти обратное: адреса в поиске, которых нет в вашем списке — мусор, старые версии, дубли с параметрами.
  6. Разбить «отсутствующие в поиске» по статусам исключения и работать группами, а не по одной странице.

Индексирование сайта

Оператор site: и другие операторы: быстро, но приблизительно

Операторы — это разведка, а не измерение.

  • site:example.com — документы сайта вместе с поддоменами.
  • host:example.com — документы одного хоста, без поддоменов; для проверки домена точнее.
  • url:example.com/page/ — проверка конкретного адреса.
  • site:example.com «точная фраза» — поиск дублей по фрагменту текста.

Число найденного — оценка, а не счёт: оно округляется, отличается у разных пользователей и меняется при повторе через минуту. Разброс в 20–30% между двумя проверками подряд — обычное дело.

Выдачу нельзя пролистать глубоко: дальше первых сотен результатов вы не уйдёте, полный список оператором не собрать. При частых автоматических запросах прилетает капча.

Когда оператор полезен: убедиться, что сайт вообще в поиске; проверить, не попал ли в индекс тестовый поддомен; найти дубли по куску текста.

Проверка одной страницы и массовая проверка списка

Один URL проверяется за минуту: в Вебмастере это инструмент «Проверить статус URL». Он показывает, известен ли адрес роботу, когда посещён, какой код ответа получен, участвует ли страница в поиске и почему исключена. Запрос url: в выдаче даёт только факт наличия, без причины.

Способ Что даёт Ограничения и цена
Выгрузка «Страницы в поиске» Список того, что в поиске, плюс статусы исключённых Бесплатно, только свой сайт, задержка в несколько дней
API Яндекс.Вебмастера Те же данные автоматически, в свою базу Бесплатно, нужен токен и немного кода
Десктопные краулеры Свой список URL, коды ответа, canonical, noindex 15–25 тысяч рублей в год, индексацию напрямую не показывают
Платные сервисы проверки Проверка чужих сайтов и больших списков 50–300 рублей за 1000 проверок
Сверка sitemap с выгрузкой Список «должно быть в поиске, но нет» Бесплатно, нужна обработка скриптом

Сверка с sitemap отвечает на вопрос «какие именно нужные страницы не работают», а это уже задача с планом действий.

Метрика и логи сервера: косвенная, но честная проверка

Есть проверка, которую невозможно подделать: страница получает поисковый трафик — значит, она в индексе. В Метрике откройте отчёт по источникам, группу «Поисковые системы», и добавьте группировку по странице входа. Каждый адрес в списке гарантированно в поиске. Обратное неверно: страница может быть проиндексирована, но не иметь спроса или стоять на 60-й позиции.

Отчёт «Роботы» в мониторинге показывает, ходят ли боты, но деталей там нет. Настоящая картина обхода — в access-логах сервера: фильтруете строки по user-agent с YandexBot и смотрите:

  • какие URL робот скачивал за сутки, неделю, месяц;
  • какие коды ответа получал — не отдаёт ли сайт 5xx именно роботу;
  • сколько запросов ушло в фильтры, сортировки и пагинацию вместо полезных страниц;
  • как быстро сервер отвечает роботу: медленный ответ сокращает объём обхода.

Логи — единственный способ разобраться, когда страница доступна, в robots.txt открыта, в sitemap есть, а в индекс не попадает. Обычно видно, что робот к ней не приходил вовсе или получал 503 и таймауты, хотя в браузере всё открывалось.

Индексирование сайта переобход страниц

Статусы Вебмастера и что с ними делать

У исключённых документов указана причина. Это самая полезная информация во всей панели: она превращает абстрактную проблему в конкретную задачу.

Статус Что означает Что делать
Страница проиндексирована Документ в поиске Ничего, работать над содержанием и позициями
Недостаточно качественная Алгоритм счёл страницу малополезной Переписать по существу, объединить, удалить или закрыть от индексации
Дубль Есть другая страница с тем же содержимым Настроить canonical, склеить редиректом, уникализировать текст
Малоценная Почти нет содержания или нет спроса Наполнить смыслом или убрать из индекса
Запрещена в robots.txt Обход закрыт директивой Disallow Проверить, намеренно ли закрыто, открыть нужное
Ошибка HTTP Сервер отдал 4xx или 5xx Починить сервер либо поставить редирект на живой аналог
Редирект Адрес перенаправляет на другой URL Норма при переезде, убрать старый адрес из ссылок и sitemap
Неканоническая Указан canonical на другой адрес Проверить: частая ошибка — весь сайт ссылается на главную
Не удалось скачать Таймаут, отказ, блокировка Проверить доступность для робота, лимиты хостинга, защиту от ботов
Метатег noindex В коде стоит запрет индексирования Убрать, если запрет случайный, — след переноса с тестового домена
Не является канонической Основным выбран другой адрес группы Убедиться, что в поиске остался нужный вариант
Нет в файле Sitemap Адрес не указан в карте сайта Не критично, но карту привести в порядок

Различие, которое экономит нервы: «исключена» не равно «наказана». Корзина, личный кабинет, сортировки, версии для печати должны быть вне поиска. Если из 2000 исключённых 1800 — параметры фильтров и служебные адреса, у сайта проблема не с индексацией, а с чистотой структуры. Санкции выглядят иначе: просадка по всем запросам сразу, сообщение в разделе диагностики о нарушениях, обвал трафика при сохранении страниц в индексе.

«Недостаточно качественная» и массовые выпадения

Выглядит одинаково у всех: график в «Истории» показывает провал, за день-два из поиска уходят десятки или сотни страниц со статусом «Недостаточно качественная», трафик падает следом. Реальные причины, которые я вижу чаще всего:

  • тонкий контент: две строки текста и таблица характеристик на карточке;
  • шаблонная генерация страниц под города или услуги, отличающихся одним словом;
  • фильтры и сортировки, размножившиеся комбинациями параметров;
  • дубли карточек, отличающихся цветом или размером;
  • страницы без спроса: тег или раздел, который никто не ищет;
  • тексты, сгенерированные ИИ без фактуры и практической пользы;
  • плохие поведенческие: люди заходят и сразу возвращаются в выдачу;
  • перегруз рекламой и всплывающими блоками.

Массовое выпадение почти всегда ревизия по качеству, а не сбой: алгоритм пересчитал полезность документов и убрал те, что не выигрывают у альтернатив. Ждать, что «само вернётся», бессмысленно.

  1. Выгрузить исключённые страницы и разложить по типам: карточки, категории, фильтры, статьи, теги.
  2. Оценить каждый тип: есть ли спрос и приносил ли он трафик раньше.
  3. Бесперспективное удалить с кодом 410 или склеить редиректом с живым разделом.
  4. Технический мусор закрыть через robots.txt и canonical.
  5. Перспективные страницы переписать: фактура, цифры, таблицы, ответы на реальные вопросы.
  6. Усилить внутреннюю перелинковку на переработанные страницы.
  7. Отправить обновлённые адреса на переобход и наблюдать за «Историей» раз в неделю.

Сроки честные: первые возвраты видны через две-четыре недели, восстановление раздела занимает от одного до трёх месяцев. Одна переписанная страница из ста ничего не изменит.

Чего делать не надо: гонять одни и те же URL на переобход по кругу, накручивать поведенческие, закупать дешёвые ссылки пачками, менять URL ради «свежего старта».

nastrojka-skorosti-obhoda-robotom-yandeksa

Как ускорить индексацию: переобход, IndexNow, sitemap и ссылки

Ускорить попадание в поиск можно, но пределы у инструментов жёсткие.

Способ Лимиты Скорость Когда работает
Переобход в Вебмастере Десятки URL в сутки, зависит от размера и качества сайта Часы — дни Точечно: важная новая страница, исправленная ошибка, новая цена
IndexNow Ключ на хосте, пакетная отправка, злоупотребление снижает доверие Уведомление мгновенно Новостные сайты, магазины с меняющимся ассортиментом
Sitemap.xml с lastmod 50 000 URL и 50 МБ на файл Дни Всегда, особенно на больших сайтах
Внутренняя перелинковка Без лимитов Дни — недели Всегда: страница в трёх кликах от главной индексируется охотнее
Внешние ссылки и соцсети Решает качество источника Часы — дни Быстрый первый заход робота в новый раздел
RSS и товарные фиды Требования к формату и валидности Часы — дни Медиа, блоги, магазины с потоком новинок
Быстрый сервер и чистый robots.txt Ограничено хостингом Недели Крупные сайты, где обход упирается в скорость ответа

Переобход — это очередь, а не кнопка «включить». Суточный лимит виден в интерфейсе и у небольших сайтов измеряется единицами и десятками адресов, поэтому тратить его надо на страницы, которые действительно изменились.

IndexNow работает так: генерируете ключ, кладёте текстовый файл с ним в корень сайта, при публикации отправляете запрос со списком URL. Яндекс протокол поддерживает. Но он ускоряет уведомление о странице, а не включение её в поиск: если содержимое слабое, робот придёт быстрее и быстрее откажет.

Главный вывод: устойчиво ускоряет индексацию не пинг, а структура — плоская архитектура, ссылки на новые материалы с посещаемых страниц, отсутствие бесконечных комбинаций параметров, быстрый сервер.

ИИ-краулеры, частые ошибки и чеклист

К 2026 году состав ботов изменился. Кроме YandexBot и Googlebot по страницам ходят краулеры ИИ-сервисов: боты для ИИ-ответов в поиске, ассистенты, подтягивающие страницу в момент запроса, и обучающие краулеры языковых моделей.

Их доступ управляется отдельными директивами robots.txt: у каждого сервиса свой user-agent, и общий блок для всех роботов описывает их не всегда так, как вы ожидаете. Обучающие боты можно закрыть, оставив доступ тем, кто формирует ИИ-ответы.

Ключевое: попадание в ИИ-ответ и индексация — разные вещи. Ассистент может процитировать страницу, не отправив пользователя на сайт, и наоборот. Отдельного отчёта по такой видимости в Вебмастере нет, проверять приходится вручную. Переходов оттуда заметно меньше, чем из обычной выдачи.

Частые ошибки

  • Закрытые в robots.txt разделы: правило добавили на время разработки и не сняли.
  • Метатег noindex, приехавший с шаблоном при переносе с тестового домена.
  • Canonical со всех страниц на главную из-за настройки плагина.
  • Sitemap, набитый 404 и редиректами.
  • Бесконечные фильтры, съедающие бюджет обхода вместо карточек и категорий.
  • Проверка через site: и паника из-за скачка числа.
  • Ожидание индексации нового сайта за сутки: нужны недели, крупному разделу — месяцы.
  • Смена URL без карты редиректов: страницы выпадают, позиции обнуляются.
  • Блокировка робота защитой от ботов: в браузере открывается, робот получает отказ.

Чеклист: страница не индексируется

  1. Открыть страницу в инкогнито и убедиться, что она отдаёт 200 и видна без авторизации.
  2. Проверить robots.txt: не попадает ли адрес под Disallow, в том числе под правило с маской.
  3. Посмотреть код на метатег noindex и заголовок X-Robots-Tag.
  4. Проверить canonical: указывает он на саму страницу или на другой адрес.
  5. Убедиться, что на страницу ведут внутренние ссылки с индексируемых разделов.
  6. Проверить адрес в инструменте «Проверить статус URL» и прочитать причину исключения.
  7. Заглянуть в «Обход страниц» и логи: приходил ли робот и какой код получил.
  8. Оценить содержимое честно: есть ли на странице то, чего нет у конкурентов.
  9. Отправить страницу на переобход и зафиксировать дату.
  10. Подождать одну-две недели, не трогая страницу, и проверить статус повторно.

Проблемы с индексацией лечит техническая доработка. Список причин по вашему сайту даст бесплатный аудит.

Коротко

  • Индексация — три состояния: обошёл робот, попала в базу, участвует в поиске. Считать надо последнее.
  • Единственная надёжная цифра — «Страницы в поиске» в Вебмастере; sitemap и site: дают оценки, а не факты.
  • Оператор site: годится для разведки и поиска дублей, но не для отчётности.
  • Полный список берут выгрузкой из Вебмастера и сверяют со своим списком URL из sitemap или краулера.
  • Один адрес быстрее всего проверять в «Проверить статус URL»: там виден и факт, и причина исключения.
  • Поисковый трафик в Метрике доказывает индексацию; отсутствие трафика не доказывает ничего.
  • Логи по YandexBot показывают, что реально обходится и куда уходит краулинговый бюджет.
  • «Исключена» не значит «наказана»: служебные адреса вне поиска — это норма.
  • Массовое выпадение по качеству лечится сегментацией и переработкой; сроки — недели и месяцы.
  • Переобход и IndexNow ускоряют уведомление, но не заменяют структуру и внутренние ссылки.

Если нужно SEO-специалист Анатолий Кузнецов — помогу вывести сайт в топ Яндекса и удержать позиции.

Увеличьте позиции и продажи вашего сайта

Профессиональное SEO-продвижение с гарантией результата. Выберите подходящую услугу:

Анатолий Кузнецов — SEO-оптимизатор

Остались вопросы по продвижению?

Меня зовут Анатолий Кузнецов, я SEO-оптимизатор с 20-летним стажем. Разберу ваш сайт, отвечу на вопросы и подскажу, что улучшить для роста позиций в Яндексе и Google.

Связаться со мной →

Оставьте комментарий

Ваш адрес email не будет опубликован. Обязательные поля помечены *

 Нажимая «оставить комментарий» вы принимаетеправила конфиденциальности 

Прокрутить вверх