Яндекс перестал индексировать новые страницы: 10 технических причин

Яндекс перестал индексировать новые страницы: 10 технических причин
Анатолий Кузнецов
Анатолий Кузнецов
SEO-оптимизатор с 20-летним стажем. Автор блога seo-prodvizhenie-biznesa.ru о продвижении и доработке сайтов.

4 300 страниц на сайте, в поиске — 380. Это не выдуманный пример: такие цифры я вижу в Вебмастере несколько раз в месяц, и почти всегда владелец сайта уверен, что «Яндекс сломался» или «попали под фильтр». Фильтр тут ни при чём в девяти случаях из десяти. Ломается что-то куда прозаичнее: заголовок сервера, одна строка в шаблоне, атрибут canonical, доставшийся по наследству от прошлого подрядчика.

Меня зовут Анатолий Кузнецов, я частный SEO-специалист, веду проекты в Москве и Петербурге лично — от разбора до вывода в ТОП. За годы практики диагностика индексации превратилась у меня в короткий чек-лист, по которому причина находится за один вечер. Ниже — этот чек-лист целиком, с командами, статусами Вебмастера и цифрами из живых проектов. Без воды про «уникальный контент» и «полезность для пользователя» — только техника.

Сначала отличите «не обходит» от «обходит и выбрасывает»

Это главная развилка, и почти все её проскакивают. «Страница не индексируется» — это два принципиально разных сценария, и лечатся они противоположными способами.

Сценарий А: робот на странице не был. Проверяется в Яндекс.Вебмастере: раздел «Индексирование» → «Статистика обхода». Если вашего URL нет в списке загруженных за последние недели — проблема в доступности и в маршруте к странице, а не в её качестве. Дополнительно я всегда открываю сырые логи сервера (access.log) и смотрю живые заходы робота:

  • grep -i "YandexBot" access.log | grep "/novaya-stranica/" — был ли робот на конкретном URL;
  • grep -i "YandexBot" access.log | awk '{print $9}' | sort | uniq -c — какие коды ответа робот получал: если в списке много 5xx, 429 или 403, дальше можно не искать.

Сценарий Б: робот был, страницу скачал и не взял в поиск. Тогда URL найдётся в «Страницы в поиске» → вкладка «Исключённые», и там будет конкретный статус. Статус — это половина диагноза, и его нужно читать буквально, а не как «Яндексу не понравилось».

Статус в ВебмастереЧто происходит на самом делеКуда смотреть в первую очередь
Запрещена в файле robots.txtДиректива Disallow перекрывает URL или его сегментrobots.txt, порядок Allow/Disallow, чистые ли шаблоны с *
Неканоническаяrel=»canonical» указывает на другой адресШаблон карточки, плагин SEO, пагинация, фильтры
Запрещена к индексированию тегом noindexmeta robots или HTTP-заголовок X-Robots-TagHTML и заголовки ответа сервера, отдельно
ДубльНайден идентичный или почти идентичный документTitle/Description, шаблонные блоки, параметры в URL
Малоценная или маловостребованная страницаРобот не видит спроса и самостоятельной ценностиСпрос на запросы, объём уникальной части, дубли внутри сайта
Ошибка HTTPРобот получил 4xx/5xx в момент обходаЛоги, WAF, лимиты хостинга, ответ на User-Agent робота
Страница не является каноническим адресом (редирект)URL отдаёт 301/302 на другой документ.htaccess, слеши, http→https, www

Когда развилка пройдена, поиск причины сокращается с недели до получаса. Дальше — сами причины, в том порядке, в котором они встречаются мне на практике чаще всего.

Причина 1. Страница-сирота: на неё нет ни одной внутренней ссылки

Самая частая и самая обидная. Страница создана в админке, лежит по своему адресу, отдаёт 200 — но попасть на неё можно только по прямой ссылке. В меню её нет, в листингах нет, в перелинковке нет, в карте сайта иногда тоже нет. Для робота такой страницы фактически не существует: он ходит по ссылкам, а ссылки на неё не ведут.

Особенно часто это бывает с товарами вне категорий, услугами, которые «пока не выводим в меню», и с региональными посадочными. Проверка простая: краулером (Screaming Frog, Netpeak Spider, SiteAnalyzer) обойдите сайт в режиме «только по внутренним ссылкам» и сравните полученный список с выгрузкой всех URL из CMS. Разница и есть ваши сироты.

Второй слой той же проблемы — глубина вложенности. Если до страницы от главной больше четырёх кликов, робот доберётся до неё нескоро и будет возвращаться редко. На интернет-магазине с 12 тысячами товаров это означает, что нижние карточки не переобходятся месяцами. Лечится это не «отправкой на переобход», а перестройкой структуры: блоки «похожие товары», ссылки из статей, HTML-карта разделов, вывод новинок на главную. Это ровно та работа, которую я закладываю в доработку сайта под требования поиска ещё до старта продвижения — без неё бюджет на семантику и тексты сгорает впустую.

Причина 2. Краулинговый бюджет съеден мусорными URL

У каждого сайта есть лимит: сколько документов робот готов скачивать в сутки. Он зависит от авторитета домена, скорости ответа и истории обхода. Если сайт генерирует десятки тысяч технических адресов, робот честно тратит квоту на них — а до ваших новых страниц очередь не доходит.

Что обычно раздувает индекс до неприличия:

  • фильтры и сортировки: ?sort=price&order=asc, ?filter[color]=red — комбинаторика даёт сотни тысяч адресов;
  • метки трафика: ?utm_source=, ?yclid=, ?gclid=, попавшие в индекс из-за ссылок с рекламы;
  • пагинация без ограничений: страницы 2, 3, 4 … 380 внутри каждой категории;
  • результаты внутреннего поиска: /search/?q= — бесконечное множество страниц;
  • версии для печати, календари, архивы по дням, теги, созданные автоматически.

В одном проекте по продаже металлопроката краулер нашёл 218 тысяч адресов при 1 900 реальных товарах — всё остальное давали фильтры. После закрытия параметров в robots.txt и настройки правил обхода число загруженных роботом страниц в сутки не изменилось, но 90% этого объёма впервые пошло на карточки, а не на комбинации фильтров. Новые позиции стали появляться в поиске за 5–9 дней вместо «никогда».

Краулинговый бюджет — это не то, что нужно увеличивать. Это то, что нужно перестать тратить на мусор. Разница принципиальная: первое вам никто не продаст, второе делается за один вечер.

Причина 3. Запрет, о котором никто не знает: robots.txt, noindex и X-Robots-Tag

Три разных механизма запрета, и владельцы сайтов регулярно проверяют только первый.

robots.txt. Классика — блок User-agent: * с Disallow: /, оставшийся с этапа разработки. Реже — тонкие ошибки: Disallow: /catalog закрывает и /catalog-2026/, потому что совпадение идёт по началу строки. Отдельная беда — раздельные секции для User-agent: Yandex и User-agent: *: Яндекс читает только свою секцию, и правила из общей на него не действуют. Проверять нужно инструментом «Анализ robots.txt» в Вебмастере, вставляя туда конкретные URL.

meta name=»robots» content=»noindex». Смотрите не глазами, а поиском по коду: curl -s https://site.ru/page/ | grep -i noindex. В WordPress тег часто ставит SEO-плагин на определённые типы записей, в «Битриксе» — настройки инфоблока, унаследованные от шаблона.

X-Robots-Tag в HTTP-заголовке. Самый коварный вариант: в исходном коде страницы чисто, всё выглядит нормально, а запрет живёт в ответе сервера и в браузере не виден. Проверяется одной командой:

  • curl -I -A "Mozilla/5.0 (compatible; YandexBot/3.0; +http://yandex.com/bots)" https://site.ru/page/

Если в ответе есть строка X-Robots-Tag: noindex — вы нашли причину. Я встречал её на сайтах, переехавших с тестового поддомена: правило в конфигурации nginx переносили вместе с остальным конфигом и забывали про него на полгода.

Причина 4. Canonical показывает не туда

Атрибут rel="canonical" — это указание роботу, какую версию документа считать главной. Ошибка в шаблоне превращает его в инструмент массового вычёркивания страниц из поиска.

Что я вижу чаще всего:

  • все страницы сайта отдают canonical на главную — типичный результат неудачной настройки плагина; в поиске остаётся один документ из тысячи;
  • пагинация категорий отдаёт canonical на первую страницу, и товары, которые видны только на 4-й, выпадают из обхода;
  • карточка товара, доступная по нескольким путям, ссылается на путь, которого уже нет после смены структуры;
  • canonical указывает на http-версию или на версию с www после переезда — робот честно идёт по указанному адресу и получает редирект.

Проверка занимает минуту: curl -s https://site.ru/page/ | grep canonical. Адрес в атрибуте должен совпадать с текущим URL символ в символ — включая протокол, поддомен и завершающий слеш. Кстати, после любого редизайна дубли и битые canonical — причина просадки номер один; я подробно разбирал эту механику в материале про редизайн сайта без потери позиций.

Причина 5. «Малоценная или маловостребованная страница»

Этот статус пугает владельцев сильнее всего, потому что звучит как приговор контенту. На деле за ним стоят три разных ситуации, и только одна из них про качество текста.

Первая: на странице нет спроса. Робот не видит запросов, по которым документ мог бы что-то дать пользователю. Так вылетают карточки редких артикулов, теги, страницы под запросы с нулевой частотностью. Лечится укрупнением: вместо двадцати пустых страниц — одна нормальная посадочная с таблицей и характеристиками.

Вторая: страница почти не отличается от соседних. Шаблонная карточка, где меняются два слова и артикул, для робота неотличима от сотни таких же. Порог простой: уникальная часть должна быть заметной долей документа, а не абзацем среди одинаковой обвязки. Помогают характеристики в таблицах, реальные фото, отзывы, вопросы-ответы под конкретный товар.

Третья: страница дублирует другую по смыслу. Две услуги с разными названиями и одинаковым текстом конкурируют между собой, и Яндекс оставляет в поиске одну. Это лечится не переписыванием, а пересборкой семантики: каждому кластеру запросов — своя страница, каждой странице — свой кластер. Если тексты нужны сразу «под индекс», у меня это отдельная услуга — SEO-статьи под конкретную семантику, а не абстрактный копирайтинг.

Причина 6. Сервер отвечает роботу не так, как браузеру

Вы открываете страницу — всё работает. Робот приходит — получает 403 или 429. Причина в защите: WAF, антибот-модули, лимиты частоты запросов, региональные блокировки на уровне хостинга. Для робота с нероссийского IP-диапазона или с непривычным User-Agent такие системы часто срабатывают по умолчанию.

Диагностика — сравнение двух запросов:

  • обычный: curl -I https://site.ru/page/
  • роботом: curl -I -A "Mozilla/5.0 (compatible; YandexBot/3.0; +http://yandex.com/bots)" https://site.ru/page/

Разные коды ответа — диагноз поставлен. Дальше проверяем подлинность робота через обратный DNS (у настоящего YandexBot имя хоста заканчивается на yandex.ru, yandex.net или yandex.com) и добавляем его в исключения защиты. Отдельно смотрите в Вебмастере раздел «Диагностика» — там прямо пишут про недоступность сайта для робота и рост числа ошибок.

Сюда же относится скорость. Если время ответа сервера регулярно уходит за 1,5–2 секунды, Яндекс сам снижает интенсивность обхода, чтобы не класть сайт. На дешёвом shared-хостинге с тяжёлой CMS это выглядит как «индексация замедлилась без причины», хотя причина — в графике «Время ответа сервера» в Вебмастере, куда почти никто не заглядывает.

Причина 7. Sitemap.xml, который вводит робота в заблуждение

Карта сайта не заставляет индексировать, но она задаёт приоритеты обхода. Плохая карта работает против вас.

  • Неверный lastmod. Если дата не меняется при обновлении страницы — робот считает, что смотреть нечего. Если у всех 20 тысяч URL стоит сегодняшнее число — карта перестаёт нести информацию, и робот перестаёт ей верить.
  • В карте есть закрытые и мусорные URL. Страницы с noindex, редиректы, 404 — всё это тратит доверие к файлу; в отчёте Вебмастера они появятся с ошибками.
  • Новые страницы в карту не попадают. Файл сгенерирован один раз руками или плагин кэширует его сутками.
  • Карта не указана в robots.txt и не добавлена в Вебмастер. Директива Sitemap: https://site.ru/sitemap.xml должна быть в robots.txt отдельной строкой.
  • Превышены лимиты: больше 50 000 URL или 50 МБ в одном файле — нужен индексный sitemap со ссылками на части.

Дополнительно подключайте IndexNow: протокол уведомляет поиск о новых и изменённых адресах напрямую, без ожидания планового обхода. На контентных проектах это стабильно сокращает попадание свежей публикации в индекс до 1–3 дней. Все мои свежие материалы в блоге о продвижении уходят в индекс именно так.

Причина 8. Контент рисуется JavaScript, а в HTML пусто

Сайты на React, Vue и подобных фреймворках без серверного рендеринга отдают роботу почти пустой каркас: пара div-контейнеров и подключение скриптов. Текст, цены, характеристики появляются позже, уже в браузере. Яндекс умеет исполнять JS, но делает это не всегда и не сразу, а на больших каталогах — выборочно.

Проверка честная и быстрая: curl -s https://site.ru/page/ | wc -c и просмотр того, что вернулось. Если ваш основной текст в этой выдаче не находится — робот его тоже не видит. Второй способ — в Вебмастере есть инструмент проверки ответа сервера, показывающий страницу глазами робота.

Решения ранжируются по надёжности: серверный рендеринг (SSR), предварительный рендеринг ключевых шаблонов (prerender), в крайнем случае — дублирование критичного контента в HTML. На проектах, которые я вёл с нуля, вопрос закрывается ещё на этапе создания сайта: переделывать фронтенд после запуска дороже, чем сразу собрать его правильно.

Причина 9. Зеркала, переезды и «главный хост»

Страница может индексироваться идеально — но не на том адресе, который вы проверяете. Классические ситуации:

  • сайт доступен одновременно по http и https, с www и без, со слешем и без — четыре версии одного документа;
  • после переезда на новый домен старый продолжает отдавать 200 вместо 301;
  • региональные поддомены дублируют основной сайт полностью, и робот выбирает главным не тот;
  • переклейка зеркал в Вебмастере запущена, но не завершена: в переходный период индексация новых страниц действительно замирает.

Здесь важна дисциплина: один документ — один канонический адрес, все остальные варианты закрываются постраничным 301-редиректом. Я сам недавно переезжал на новый домен постраничными редиректами и подтверждаю: пока склейка идёт, новые публикации попадают в поиск с задержкой — это нормально и лечится временем, а не паникой. Полезно параллельно проверить регион в Вебмастере и карточку в Яндекс Бизнесе: адрес сайта в ней должен указывать на главное зеркало.

Причина 10. Свежий сайт, недостроенное доверие и попытки ускорить силой

Молодой домен обходится редко и осторожно. Первые недели это выглядит как «Яндекс нас не видит», хотя система просто выделила минимальную квоту и наблюдает. Ошибка — начать «пробивать индексацию»: массово отправлять URL на переобход, закупать ссылки для «прогона», гнать ботов на страницы.

Что работает на самом деле:

  • инструмент «Переобход страниц» в Вебмастере — но точечно, на реально важные адреса; суточная квота на домен ограничена и расходуется мгновенно;
  • регулярность публикаций: предсказуемый график обновлений повышает частоту визитов робота лучше любых ручных отправок;
  • внешние упоминания с живых площадок — робот приходит по ссылкам, а не по вашему желанию;
  • внутренняя перелинковка: свежая страница должна получить ссылки с уже проиндексированных документов в первые же сутки.

А вот чего делать точно не стоит — накручивать поведенческие факторы «для ускорения». Это отдельная категория рисков, и она не имеет отношения к индексации: страницы от накрутки в индекс не попадут, а санкции получить можно быстро.

Мой протокол диагностики за 40 минут

Именно в таком порядке — от дешёвых проверок к дорогим. Обычно причина находится на шагах 1–4.

ШагДействиеВремяЧто означает «плохо»
1Вебмастер → «Страницы в поиске» → «Исключённые», выгрузка и группировка по статусам10 минОдин статус даёт больше 30% исключённых URL
2curl -I обычный и с User-Agent робота3 минРазные коды ответа, X-Robots-Tag, 403/429/5xx
3Проверка canonical и meta robots в исходном коде3 минCanonical не совпадает с URL, найден noindex
4Анализ robots.txt в Вебмастере по конкретным URL4 минURL закрыт правилом, о котором вы не знали
5Краулер: поиск сирот и глубины вложенности10 минСтраница не находится по внутренним ссылкам или глубже 4 кликов
6Sitemap: наличие URL, lastmod, ошибки в отчёте5 минURL нет в карте или дата не обновляется
7График «Время ответа сервера» и статистика обхода5 минОтвет дольше 1,5 с, падение числа загруженных страниц

Если после семи шагов причина не найдена — она почти наверняка в качестве и спросе, а не в технике: значит, работать нужно с семантикой и структурой, а не с конфигом сервера. Как это выглядит на реальных проектах, видно в портфолио с адресами сайтов и в видеоразборах: там показаны и провалы индексации, и восстановление после них.

Что делать, если страницы не индексируются, а трафика нет уже сейчас

Остановившаяся индексация почти никогда не приходит одна. Обычно рядом обнаруживается ещё десяток проблем: страницы под запросы без спроса, каннибализация посадочных, медленный сервер, устаревшая структура каталога. Каждая по отдельности терпима, вместе они дают ровно то, с чего начинается большинство обращений ко мне: сайт есть, страницы публикуются, заявок нет.

Я предлагаю два направления, и они хорошо работают вместе.

Классическое SEO-продвижение. Веду проект лично, без ассистентов и посредников: техническая диагностика и устранение всего, что мешает обходу и индексации, сбор и кластеризация семантики, оптимизация посадочных страниц, тексты, ссылочный профиль, еженедельные отчёты с позициями и трафиком. Тариф «Старт» — от 55 000 ₽/мес, продвижение до 200 запросов. Берусь за проект только тогда, когда вижу реальную возможность вывести его в ТОП-3 Яндекса, и честно говорю, если такой возможности нет. Начать можно бесплатно: закажите бесплатный аудит сайта — я проверю индексацию, ответы сервера, дубли и канонические адреса и покажу, что именно блокирует рост. Если нужна не разовая проверка, а полноценный разбор с планом работ, есть SEO-аудит по 120+ параметрам ранжирования.

GEO-продвижение — то, чего у ваших конкурентов пока нет. Люди всё чаще спрашивают не поисковую строку, а нейросеть: YandexGPT и Алису, ChatGPT, Perplexity, GigaChat, AI-ответы в выдаче. Модель отвечает одним абзацем и называет одну-две компании — и попадание в этот абзац сейчас стоит дешевле, чем ТОП-3 в классическом поиске. Работа строится вокруг извлекаемых фактов, семантической разметки Schema.org, экспертности и упоминаний бренда в источниках, которые нейросети читают. Подробности и модульный расчёт стоимости — на странице GEO-продвижения сайта.

Связка простая: SEO приводит тех, кто ищет руками, GEO — тех, кто спрашивает у нейросети. Через год второй канал будет стоить в разы дороже, потому что в него придут все.

Позвоните мне напрямую: +7 (921) 333-77-45 — отвечаю лично, без менеджеров и скриптов. Или оставьте заявку на разбор сайта: посмотрю индексацию вашего проекта, назову причину остановки и скажу, сколько времени и денег займёт её устранение. Даже если работать вместе мы не начнём, список проблем останется у вас.

Увеличьте позиции и продажи вашего сайта

Профессиональное SEO-продвижение с гарантией результата. Выберите подходящую услугу:

Анатолий Кузнецов — SEO-оптимизатор

Остались вопросы по продвижению?

Меня зовут Анатолий Кузнецов, я SEO-оптимизатор с 20-летним стажем. Разберу ваш сайт, отвечу на вопросы и подскажу, что улучшить для роста позиций в Яндексе и Google.

Связаться со мной →

Оставьте комментарий

Ваш адрес email не будет опубликован. Обязательные поля помечены *

 Нажимая «оставить комментарий» вы принимаетеправила конфиденциальности 

Прокрутить вверх