Индексация сайта решает судьбу любой страницы: пока её нет в базе поисковой системы, для поиска она не существует — как бы хорошо она ни была написана и сколько бы денег в неё ни вложили. При этом на средних сайтах в поиск не попадает от пятой части до половины страниц, и владелец об этом обычно не знает, потому что в браузере всё открывается нормально. Ниже — механика: как страница попадает в базу, за что её оттуда выбрасывают, сколько ждать в норме и что делать, когда страницы пропадают пачками.
Тема кажется технической и далёкой от денег, но связь прямая. Каталог на две тысячи товаров, из которых в поиске восемьсот, — это недополученные обращения по тысяче двумстам позициям. Причём страницы уже написаны, оплачены и лежат на сервере. Работа сделана, результата нет.
Как страница попадает в поиск
Путь состоит из трёх шагов, и застрять можно на каждом. Понимание, где именно застряло, определяет, что чинить.
- Обнаружение. Система должна узнать, что адрес существует. Источники три: карта сайта, внутренняя ссылка с уже известной страницы, ссылка с чужого ресурса. Страница, на которую не ведёт ни одной ссылки и которой нет в карте, может пролежать незамеченной сколько угодно.
- Обход. Робот приходит и скачивает содержимое. Если сервер отвечает ошибкой, отдаёт код 5xx или думает по нескольку секунд, шаг откладывается на потом. При регулярных ошибках частота визитов снижается.
- Индексация. Скачанное разбирается и оценивается. Здесь принимается решение: включить страницу в базу или отбраковать.
Третий шаг — самое неочевидное место. Робот заходил, страница доступна, кодов ошибок нет, а в поиске её нет. Это значит не «не дошли руки», а «решили не включать». Причину система называет прямо: в Яндекс.Вебмастере есть раздел с исключёнными страницами, где по каждому адресу написано, почему он не в поиске. В Google Search Console то же самое в отчёте об индексировании.
Разница между «не обошли» и «обошли и не взяли» принципиальная. В первом случае лечится доступность: ссылки, карта сайта, скорость ответа сервера. Во втором — содержание и настройки самой страницы. Работы разные, и путать их дорого.
Почему страницу не берут в индекс
Причин немного, и они хорошо диагностируются. Порядок в таблице — от самых частых к более редким.
| Причина | Как проверить | Что делать |
|---|---|---|
| Дубль другой страницы | Раздел исключённых страниц в Вебмастере | Свести к одному адресу, с остальных поставить canonical |
| Canonical указывает на другой адрес | Посмотреть тег link rel=»canonical» в коде | Исправить, если указан ошибочно шаблоном |
| Метатег noindex | Поиск по исходному коду страницы | Убрать; частая забытая настройка после разработки |
| Закрыта в robots.txt | Инструмент анализа robots в Вебмастере | Открыть, если страница нужна в поиске |
| Мало содержания | Оценить объём собственного текста без шаблона | Дописать то, чего нет у соседних страниц |
| Нет ни одной внутренней ссылки | Обход сайта краулером, поиск страниц-сирот | Связать со смежными разделами и добавить в карту |
| Сервер отдаёт ошибку или редирект | Проверка кода ответа по адресу | Починить сервер или убрать лишний редирект |
Самая частая пара — дубли и canonical, и на интернет-магазинах они дают основной объём исключённых адресов. Один товар доступен по трём адресам из разных категорий, к нему добавляются страницы фильтров и сортировок — система оставляет один вариант, остальные помечает дублями. Формально всё правильно, а фактически каталог наполовину не в поиске.
Отдельная категория — «недостаточно качественная страница». Формулировка расплывчатая, но за ней стоит понятная вещь: страница почти ничем не отличается от других на сайте. Карточки товара, у которых различаются два слова в названии и цифра в характеристиках, попадают под неё регулярно. Лечится не техникой, а содержанием: собственное описание, отличия, применимость, комплектация.
Сколько ждать и от чего зависит срок
Точных гарантий не даёт никто, но диапазоны предсказуемы. Для живого сайта с регулярными обновлениями новая страница попадает в поиск за срок от нескольких часов до двух недель. Для нового сайта без истории — от двух недель до полутора месяцев, иногда дольше.
На срок влияют четыре вещи:
Тему разбирал отдельно: «IndexNow — моментальная индексация сайта от Яндекс».
- Частота обновления сайта. Робот приходит тем чаще, чем чаще находит новое. Сайт, который обновляется раз в год, обходится соответственно.
- Скорость ответа сервера. Медленный ответ прямо снижает количество страниц, которые робот берёт за визит.
- Внутренние ссылки на новую страницу. Адрес, на который ведёт ссылка с главной, обнаруживается быстрее, чем адрес, лежащий в глубине структуры.
- Общее состояние сайта. Если среди обходимых адресов много ошибок и редиректов, полезная часть обхода сокращается.
Практический вывод: если новые страницы появляются в поиске месяцами, проблема почти никогда не в самих страницах. Она в скорости сервера, в структуре ссылок или в мусоре, на который тратится обход.
Как ускорить попадание в индекс
Действия перечислены по убыванию отдачи. Первые два работают почти всегда.
- Отправить адрес на переобход в Вебмастере. Инструмент так и называется. Для среднего сайта суточный лимит — около полутора сотен адресов, этого достаточно для любой разовой задачи. Отправлять один и тот же адрес по десять раз смысла нет.
- Поставить внутреннюю ссылку с уже проиндексированной страницы. Лучше всего работает ссылка с главной или с популярного раздела: робот заходит туда чаще всего.
- Обновить карту сайта. В ней должна стоять свежая дата изменения для новых адресов. Карта, которая генерируется раз в месяц по расписанию, задерживает обнаружение на этот же срок.
- Проверить скорость ответа сервера. Время до первого байта — тот показатель, который напрямую влияет на объём обхода. Если оно измеряется секундами, а не долями секунды, разговор про скорость индексации преждевременен.
- Убрать из обхода мусор. Страницы поиска по сайту, сортировки, служебные адреса. Каждый обойденный мусорный адрес — это не обойденный полезный.
Помогу с продвижением: продвижение сайта с гарантией результата — вывожу сайты в топ Яндекса белыми методами.
Чего делать не надо: покупать «ускорение индексации» у сервисов, которые обещают загнать страницы в поиск за сутки. Технически они делают то же самое, что доступно бесплатно, либо ставят ссылки с мусорных площадок, и это создаёт отдельную проблему.
Как проверить, что страница в индексе
Точный источник один — панели вебмастеров. В Яндекс.Вебмастере это раздел «Страницы в поиске»: видно, сколько адресов включено, сколько исключено и по какой причине. В Google Search Console — отчёт об индексировании с той же логикой.
Быстрая проверка одной страницы: вставьте её полный адрес в строку поиска. Если страница в базе, она найдётся по собственному адресу. Если не находится — её там нет, и дальше нужно смотреть причину.
На что смотреть в отчётах при регулярном контроле:
- Разрыв между числом страниц на сайте и числом страниц в поиске. Сам по себе он не диагноз, но задаёт масштаб работы.
- Распределение причин исключения. Одна доминирующая причина означает системную проблему, которая лечится одной правкой.
- Динамика. Постепенный рост нормален. Резкое падение — повод разбираться немедленно, не откладывая на неделю.
- Соотношение кодов ответов в статистике обхода. Заметная доля 404 и 301 среди обойденных адресов означает, что робот ходит по несуществующему.
Когда страницы выпадают массово
Резкое падение количества страниц в поиске почти всегда имеет техническую причину, и находится она за полчаса. Порядок проверки:
- robots.txt. Не появилась ли строка Disallow: / после работ на сайте. Классика при переносе с тестового сервера, где закрытие было правильным.
- Галочка запрета индексации в CMS. В WordPress это один переключатель в настройках чтения. Его забывают снять после разработки регулярно, и он выставляет noindex на весь сайт.
- Коды ответов. Массовые ошибки 5xx означают, что сервер не справлялся в момент обхода. Смотреть надо не текущее состояние, а журнал за период падения.
- Изменение адресов. Смена структуры без настройки редиректов 301 выбивает из поиска весь старый набор адресов и заводит новый с нуля.
- Раздел безопасности в Вебмастере. Заражение сайта или обнаруженные нарушения дают резкое выпадение с уведомлением.
- Сертификат и доступность по протоколу. Просроченный сертификат делает сайт недоступным для части запросов.
Первые два пункта закрывают большинство случаев. Если они в порядке, дальше смотрите даты: сопоставьте день начала падения с датой последних работ на сайте. Совпадение находится почти всегда.
Смежный материал по теме — «Краулинговый бюджет сайта: что это такое и как его оптимизировать».
Краулинговый бюджет: почему роботу не хватает сил на весь сайт
У каждого сайта есть предел числа страниц, которые робот берёт за сутки. Он не фиксирован и зависит от скорости сервера, частоты обновлений и общей оценки ресурса. Для сайта услуг на полсотни страниц предел неважен — обход укладывается в один визит. Для каталога на десятки тысяч адресов он определяет всё.
Считается просто: разделите число адресов, которые вы хотите видеть в поиске, на число страниц, обходимых за сутки. Получите срок полного цикла. Если он больше месяца, новые материалы будут появляться в поиске с задержкой в недели, и никакая отправка на переобход этого не компенсирует.
Что съедает бюджет чаще всего:
- Страницы фильтров и сортировок каталога, порождающие адреса комбинаторно.
- Внутренний поиск по сайту с адресами вида «?s=запрос».
- Адреса с рекламными метками, попавшие во внутренние ссылки.
- Цепочки редиректов: каждый шаг — отдельный запрос.
- Страницы вложений и архивы по датам в блогах на WordPress.
Для крупного проекта — например, если вы собираетесь открывать интернет-магазин с большим каталогом — управление обходом закладывают в структуру сразу, а не чинят потом. Переделывать адресацию работающего магазина дороже, чем спроектировать её один раз.
Что закрывать от индексации, а что нет
Ошибки здесь встречаются в обе стороны: закрывают нужное и оставляют открытым мусор. Ориентир по типовым разделам.
| Тип страниц | Решение | Чем закрывать |
|---|---|---|
| Личный кабинет, корзина, оформление заказа | Закрыть | robots.txt |
| Результаты внутреннего поиска | Закрыть | robots.txt |
| Страницы фильтров без спроса | Закрыть | Canonical на категорию |
| Страницы фильтров с реальным спросом | Оставить и оптимизировать | Свои title и текст |
| Пагинация категорий | Оставить открытой | Canonical на саму страницу, уникальные title |
| Теги и архивы по датам в блоге | Чаще закрыть | noindex, если нет собственной ценности |
| Служебные и технические разделы CMS | Закрыть | robots.txt плюс доступ по паролю |
Если нужна помощь по теме — обучение SEO-продвижению.
Важная деталь, на которой ошибаются постоянно: страница, закрытая в robots.txt, всё равно может оказаться в выдаче. Робот не заходит внутрь, но видит ссылки на неё и может показать адрес без описания. Если страницу нужно убрать из поиска гарантированно, её закрывают метатегом noindex и оставляют открытой для обхода — иначе робот просто не увидит запрет.
Переиндексация: что происходит, когда страницу правят
Попадание в базу — не разовое событие. Робот возвращается к уже известным адресам и переоценивает их, и от того, как часто он это делает, зависит скорость появления правок в выдаче. Обновили текст и цены, а в сниппете висит старое — значит, до переобхода этого адреса очередь пока не дошла.
Если нужны детали, смотрите «Кроссбраузерность сайта: что это такое и почему это важно».
Ускоряется тем же способом, что и первичная индексация: отправкой на переобход и обновлением даты изменения в карте сайта. Но есть условие, о котором забывают при массовых правках через базу данных: если дата последнего изменения страницы не поменялась, для карты сайта и для робота ничего не произошло. Правка есть, сигнала о ней нет. При обновлении большого числа страниц скриптом дату модификации нужно проставлять принудительно.
Обратная ситуация тоже встречается: страницу правят раз в неделю без содержательных изменений, надеясь, что частое обновление повысит частоту визитов робота. Это не работает. Система сравнивает версии и, обнаружив, что менялась одна запятая, снижает частоту переобхода — смысла ходить чаще нет.
Частые вопросы
Сколько страниц должно быть в поиске от общего числа?
Ориентир — почти все, которые вы намеренно оставили открытыми. Нормальным считается расхождение в несколько процентов. Разрыв в треть и больше означает системную причину, а не естественную убыль.
Помогает ли частая отправка на переобход?
Отправка ускоряет обнаружение, но не влияет на решение о включении в базу. Если страница отбраковывается по содержанию, её можно отправлять хоть каждый день — результат не изменится, пока не изменится сама страница.
Почему в Яндексе страниц в поиске больше, чем в Google, или наоборот?
Системы оценивают независимо и по-разному относятся к дублям и малополезным страницам. Разница в объёме индекса между ними нормальна. Сравнивать надо не системы между собой, а динамику каждой с самой собой.
Влияет ли количество страниц в индексе на позиции?
Прямой зависимости нет. Но страница, которой нет в базе, не ранжируется вообще — то есть ноль по определению. Плюс большое количество малополезных страниц в индексе ухудшает общую оценку сайта, поэтому наращивать число адресов ради числа вредно.
Что делать, если страница в индексе, но не находится по своим запросам?
Это уже не задача индексации, а задача ранжирования. Индексация отвечает на вопрос «есть ли страница в базе», а место в выдаче зависит от соответствия запросу, конкуренции и оценки сайта в целом.
Как быстро выпадают страницы после удаления?
Если адрес отдаёт 404 или 410, он исключается за срок от нескольких дней до пары недель. Ускорить можно через инструмент удаления страниц в панели вебмастера, но это временная мера: если страница продолжит отдавать код 200, она вернётся.
Показываю на примере, как читать раздел с исключёнными страницами и что делать с найденными причинами:
Коротко
- Пока страницы нет в базе поиска, для системы она не существует, и качество её содержания роли не играет.
- Робот может обойти страницу и не взять её: из-за дубля, canonical, метатега noindex или слабого содержания — причина всегда названа в разделе исключённых страниц.
- На живом сайте новая страница индексируется за срок от часов до двух недель; месяцы ожидания означают проблему со скоростью сервера или структурой ссылок.
- Ускоряют три вещи: переобход в Вебмастере, ссылка с уже проиндексированной страницы и свежая карта сайта.
- При массовом выпадении первыми проверяют robots.txt и галочку запрета индексации в настройках CMS — они закрывают большинство случаев.
- Закрытие в robots.txt не гарантирует отсутствия в выдаче: для гарантии нужен noindex при открытом обходе.
Если страницы вашего сайта не попадают в поиск и непонятно почему — это разбирается адресно на SEO-консультации: смотрю отчёты Вебмастера, называю причину по каждой группе адресов и порядок исправления. Первичную проверку можно запустить сразу — бесплатный аудит сайта.
Увеличьте позиции и продажи вашего сайта
Профессиональное SEO-продвижение с гарантией результата. Выберите подходящую услугу:
Остались вопросы по продвижению?
Меня зовут Анатолий Кузнецов, я SEO-оптимизатор с 20-летним стажем. Разберу ваш сайт, отвечу на вопросы и подскажу, что улучшить для роста позиций в Яндексе и Google.
Связаться со мной →
Комментарии
Тарас Виленский
Каталог 6000 позиций, в поиске 1900. В Вебмастере у большинства исключённых причина «недостаточно качественная». Описания у нас от поставщика, одинаковые для всей линейки. Переписывать шесть тысяч карточек нереально.
Анатолий Кузнецов автор
Переписывать все шесть тысяч и не надо. Возьмите отчёт по спросу и посмотрите, по каким позициям вообще есть запросы в Вордстате: обычно оказывается, что реальный спрос сосредоточен в двух-трёх сотнях товаров, а остальное — длинный хвост, который не ищут. С этих двух-трёх сотен и начинайте. Второе: описание от поставщика можно не переписывать целиком, достаточно добавить к нему свой блок, которого нет ни у кого — применимость, совместимость, что входит в комплект, чем отличается от соседней модели в линейке. Двести-триста собственных знаков на карточку меняют картину. Третье: проверьте, не борются ли карточки друг с другом — если один товар доступен по нескольким адресам из разных категорий, часть исключённых объясняется этим, а не качеством.
Вероника Голубева
У нас за неделю из поиска ушло почти всё. Сайт работает, открывается. Разработчик клянётся, что ничего не менял.
Анатолий Кузнецов автор
Проверьте два места, они закрывают большинство таких случаев. Первое — файл robots.txt: откройте его в браузере по прямому адресу и посмотрите, нет ли строки, запрещающей обход всего сайта. Второе — настройки CMS: в WordPress это переключатель в разделе чтения, который просит поисковые системы не индексировать сайт. Он выставляет запрет на весь сайт разом, и снаружи это никак не заметно. Дальше откройте исходный код любой страницы и поищите в нём слово noindex. Если оба места чисты, смотрите даты: сопоставьте начало падения с журналом изменений на сервере и с датой последнего обновления CMS или темы. «Ничего не менял» чаще всего означает автоматическое обновление, которое прошло само. И проверьте срок действия сертификата — просроченный делает сайт недоступным для части запросов.
Игнат Водянов
Новые статьи в блоге появляются в поиске через три-четыре недели. Раньше было несколько дней. Что могло измениться?
Анатолий Кузнецов автор
Смотрите статистику обхода в Вебмастере за последние месяцы: там видно, сколько адресов робот берёт в сутки и какие коды получает. Если число обойденных страниц упало, причина обычно в скорости сервера — замерьте время ответа, оно должно измеряться десятыми долями секунды, а не секундами. Если число не упало, но в составе обойденного много адресов с параметрами, редиректов и ошибок, значит бюджет уходит в мусор: проверьте, не открылись ли для обхода страницы внутреннего поиска или сортировок после обновления темы. Третья причина — карта сайта: если она генерируется по расписанию раз в неделю, задержка появляется ровно на этот срок. И проверьте, ставите ли вы ссылку на новую статью с главной или из свежего раздела: адрес, до которого можно дойти в один клик от часто посещаемой страницы, обнаруживается заметно быстрее.
Эмма Городнова
Правильно ли я поняла, что закрывать страницы в robots.txt для удаления из поиска — неверно? У нас так закрыты старые акции, и они всё равно висят в выдаче адресами без описания.
Анатолий Кузнецов автор
Поняли верно, и висят они именно поэтому. Запрет в robots не даёт роботу зайти внутрь, но не запрещает показывать адрес: система знает о нём по ссылкам и выводит голой строкой без описания. Чтобы убрать страницу гарантированно, порядок обратный: сначала откройте её для обхода, поставьте в код метатег noindex и дождитесь, пока робот зайдёт и увидит запрет. После исключения из поиска можно закрыть и в robots, если хочется экономить обход. Для старых акций часто правильнее другое решение — не убирать страницу, а сделать редирект 301 на действующий раздел: так вы сохраните переходы тех, кто попал на неё по старой ссылке.
Родион Вольнов
Посчитал по вашей формуле: адресов 14 тысяч, робот берёт около 300 в сутки. Полный цикл почти семь недель. Это приговор?
Анатолий Кузнецов автор
Не приговор, но задача. Начните с состава этих четырнадцати тысяч: выгрузите список обойденных адресов за последний месяц и посмотрите, сколько среди них страниц с параметрами, сортировок и результатов внутреннего поиска. На каталогах такого размера половина обхода уходит в подобный мусор, и после его закрытия цикл сокращается вдвое без всяких работ с сервером. Второе направление — скорость ответа: чем быстрее сервер отдаёт страницу, тем больше адресов робот успевает взять за визит, зависимость здесь прямая. Третье — плоская структура: если до карточки товара нужно пройти пять уровней вложенности, глубокие адреса обходятся реже. И отдельно держите приоритетные разделы в отдельной карте сайта, чтобы важное обходилось раньше остального.
Алевтина Гераимчук
Спасибо за таблицу с тем, что закрывать, а что нет. У нас пагинация была закрыта noindex целиком, теперь понятно, почему товары со второй страницы категории никогда не находились.
Мирон Гривцов
Вопрос про фильтры: как понять, у какого фильтра есть реальный спрос, а какой закрывать? У нас их сотни комбинаций.
Ульяна Вырубова
Нашла страницы-сироты обходом краулера — 340 штук, на них не ведёт ни одна ссылка. Половина из них вполне рабочие услуги, просто выпали из меню при редизайне.
Феликс Гнатюк
Не соглашусь про сервисы ускорения индексации. Пользуемся одним, страницы заходят в базу за сутки-двое. Другое дело, что держатся не все.
Зинаида Ветрова
Подскажите, а если сайт переехал на новый домен и старые адреса закрыли редиректом — сколько ждать, пока новый домен наберёт индекс полностью?
Ефим Гулин
Проверил галочку в настройках чтения WordPress. Стояла. Сайт запущен в марте, всё это время просил поиск себя не индексировать. Слов нет.
Ярослава Вахонина
А как быть с товарами, которых временно нет в наличии? Убирать страницу, оставлять или закрывать от индексации? Мнения читала разные.