Логотип seo-prodvizhenie-biznesa.ru
+7 (921) 333-77-45

Поисковый индекс

Поисковый индекс
Анатолий Кузнецов
Анатолий Кузнецов
SEO-оптимизатор с 20-летним стажем. Автор блога seo-prodvizhenie-biznesa.ru о продвижении и доработке сайтов.

В поисковый индекс попадает далеко не всё, что вы опубликовали, и именно отсюда Яндекс и Google берут страницы для выдачи. Если вашей страницы в этой базе нет, её не найдут ни по одному запросу — ни по названию компании, ни по точной фразе из текста. Ровно поэтому владелец сайта неделями смотрит в пустую статистику, хотя тексты написаны, дизайн заказан, а деньги за разработку заплачены.

Особенность здесь в том, что сайт при этом выглядит абсолютно рабочим. Страницы открываются, меню кликается, форма отправляет заявку. Просто поисковая система про эти страницы не знает или знает, но держит их в стороне от выдачи. Разница между «сайт существует» и «сайт в индексе» стоит бизнесу всего трафика — и увидеть её можно только в отчётах, а не глазами в браузере.

Что физически происходит с вашей страницей

Поисковая система не ищет по интернету в момент вашего запроса. Она ищет по своей заранее собранной базе. Путь страницы до этой базы состоит из трёх шагов, и застрять она может на любом.

Шаг первый — обход. Робот узнаёт адрес страницы: из карты сайта, из ссылки на другой странице, из внешней ссылки, из данных браузера. Приходит по адресу и скачивает код. Если сервер отдал ошибку, ответил слишком медленно или закрыл адрес в robots.txt, на этом всё заканчивается.

Шаг второй — обработка. Скачанный код разбирается: выделяется текст, заголовки, ссылки, разметка. Отдельно исполняется JavaScript, если содержимое подгружается скриптами. На этом шаге страница может потерять весь смысл: робот получил пустой каркас, а текст так и не подгрузился.

Шаг третий — включение в индекс. Разобранная страница оценивается: есть ли на ней уникальное содержание, не дублирует ли она соседнюю, отвечает ли она хоть на какой-то запрос. Именно здесь отсеивается большинство. Страницу скачали, разобрали и решили, что в базе ей делать нечего.

Из этой механики следует практический вывод: «страница не в поиске» — это не одна проблема, а минимум три разных, и лечатся они по-разному. Пока вы не знаете, на каком шаге застряло, любые действия — угадывание.

Как посмотреть, что у вас в индексе на самом деле

Есть три источника, и они отвечают на разные вопросы.

  • Яндекс.Вебмастер, раздел «Индексирование → Страницы в поиске». Главный отчёт. Показывает точное число страниц в базе, историю изменений и — самое ценное — список исключённых с указанием причины по каждой. Ещё там есть выгрузка в файл: берите её, а не листайте экраны.
  • Google Search Console, отчёт «Индексирование страниц». Та же логика: сколько проиндексировано, сколько отклонено и по какой причине. Отдельно проверяется конкретный адрес через инструмент проверки URL — он покажет, когда робот приходил последний раз и что решил.
  • Оператор site: в поисковой строке. Быстрая прикидка, не более. Число он показывает округлённое и нестабильное, но чтобы за минуту понять «сайт вообще виден или ноль», подходит.

Порядок проверки простой. Сначала берёте реальное количество страниц сайта — из карты sitemap.xml или из обхода краулером. Потом сравниваете с числом в Вебмастере. Расхождение больше чем на десять-пятнадцать процентов означает, что часть сайта не работает на вас, и надо смотреть причины.

Почему страницы вылетают: реальные причины

Формулировки в отчётах поисковых систем звучат сухо, поэтому владельцы их пролистывают. А там прямым текстом написан диагноз.

Причина в отчёте Что произошло на самом деле Что делать
Недостаточно качественная Страница есть, но система не нашла на ней ничего, ради чего показывать её людям: пара строк текста, шаблонное описание, копия соседней карточки Наполнить уникальным содержанием или объединить с похожей страницей через 301
Дубль Найдена страница с тем же содержанием: версия с параметром, копия с www, страница печати, второй адрес того же товара Настроить canonical или склеить адреса редиректом
Запрещена в robots.txt Правило закрывает раздел, часто вместе с нужными страницами — классика после переноса с тестового домена Проверить файл строка за строкой в инструменте проверки Вебмастера
Ошибка HTTP В момент прихода робота сервер отдал 5xx или не ответил вовсе Смотреть логи сервера за дату обхода, разбираться с хостингом
Редирект Адрес переадресует на другой — сам он в индекс не попадёт, и это нормально, если так задумано Проверить, что редирект ведёт куда надо и без цепочки
Не canonical Страница сама указала другой адрес как основной, иногда по ошибке плагина Проверить тег canonical в коде каждого типа страниц

Самая частая находка в этом отчёте у магазинов — «недостаточно качественная» на карточках товара. Причина обычно одна: описание взято из прайса поставщика и совпадает у сорока сайтов. Робот скачал, сравнил, увидел копию и не стал добавлять сорок первую.

Подробнее об этом — в статье «Индекс скорости загрузки страницы».

Robots.txt, noindex и canonical — три разных инструмента

Их путают чаще всего, и путаница стоит страниц.

Помогу с продвижением: вывести сайт в топ Яндекса — вывожу сайты в топ Яндекса белыми методами.

Robots.txt запрещает заходить. Робот не скачивает страницу и не видит, что на ней. Важный нюанс: закрытая в robots.txt страница может всё равно оказаться в выдаче — по внешним ссылкам, с пустым сниппетом. Поэтому убрать страницу из индекса через robots.txt нельзя, это распространённое заблуждение.

Мета-тег noindex разрешает зайти и запрещает добавлять в базу. Правильный инструмент для удаления страницы из индекса. Но чтобы он сработал, робот обязан страницу скачать — значит, она не должна быть закрыта в robots.txt одновременно. Двойной запрет работает не как усиление, а как отмена: робот не пришёл, тег не прочитал, страница висит в индексе дальше.

Canonical ничего не запрещает. Он говорит: «эта страница — вариант вот той, считайте главной ту». Для дублей и версий с параметрами это правильный ход, для мусорных страниц — нет.

Проверять эти три вещи надо не по документации CMS, а по коду живой страницы. Открываете исходный код в браузере, ищете robots в мета-тегах и canonical в head. Плагины любят проставлять noindex на категориях блога «для порядка», а владелец узнаёт об этом через полгода.

Сколько ждать и от чего это зависит

Точных сроков нет ни у кого, но диапазоны предсказуемые. Новая страница на живом сайте, где робот бывает ежедневно, попадает в базу за срок от суток до полутора-двух недель. Страница на новом домене без ссылок — от нескольких недель до пары месяцев. Разница не в качестве текста, а в том, как часто робот к вам приходит.

Частота обхода зависит от трёх вещей: как часто на сайте появляется новое, насколько быстро отвечает сервер и сколько внешних ссылок ведёт на сайт. Именно поэтому магазин, который каждый день добавляет товары, индексируется быстрее сайта услуг из пяти страниц, не менявшихся с запуска.

Отдельная беда — когда роботу физически не хватает ресурса обойти сайт. Он тратит проходы на страницы фильтров, сортировок и пагинации, а до карточек товара не доходит. У крупных каталогов так теряется половина ассортимента, и никакие тексты не помогут, пока не разобраны настройки обхода.

Тему разбирал отдельно: «Поисковый трафик — что это и как его привлечь».

Уникальность содержания — главный фильтр на третьем шаге

Когда техника в порядке, а страницы всё равно не берут в базу, причина почти всегда в содержании. И речь не про «уникальность текста» в понимании антиплагиата: можно переставить слова так, что любая проверка покажет сто процентов, а поисковая система всё равно увидит копию по смыслу.

Система сравнивает страницы не побуквенно. Она смотрит, о чём страница, какие сущности на ней упоминаются, какие вопросы закрывает. Если по всем этим признакам ваша страница совпадает с двадцатью другими, она не добавляет ничего к базе — и её не берут. Отсюда практическое правило: страница должна содержать хотя бы один блок информации, которого нет у соседей по выдаче.

Что обычно становится таким блоком у обычного бизнеса:

  • Реальные условия работы: сроки, география выезда, что входит в цену и что не входит.
  • Ответы на вопросы, которые вам задают по телефону каждую неделю — их никто, кроме вас, не знает.
  • Ограничения и отказы: в каких случаях услуга не подойдёт. Такого текста почти нигде нет, а читают его внимательно.
  • Собственные фотографии работ, таблицы параметров, схемы подбора, расчёты стоимости по вариантам.
  • Сравнение вариантов между собой, а не просто перечисление того, что вы делаете.

Проверить себя просто: откройте пять сайтов из первой десятки по вашему запросу и выпишите, что есть у них. Если на вашей странице всё то же самое и ничего сверх — вы сорок первый в очереди на то же место, и система это видит быстрее, чем вы.

Как ускорить попадание в индекс

Способы отличаются по силе и по трудозатратам. Порядок в таблице — от быстрых к долгим.

Способ Сколько занимает Насколько помогает
Отправка адреса в «Переобход страниц» Вебмастера Минута на страницу, есть суточный лимит Сильно для отдельных важных страниц, робот приходит обычно в течение суток
Подключение IndexNow Разово, час работы программиста Сильно: сайт сам сообщает об изменениях, не дожидаясь планового обхода
Актуальная карта sitemap.xml Разово, обычно даёт CMS Средне: помогает найти адреса, но не заставляет их индексировать
Внутренние ссылки на новую страницу Полчаса на страницу Сильно: страница без входящих ссылок для робота почти не существует
Ускорение ответа сервера От дня до недели Средне на дистанции: робот берёт больше страниц за визит
Внешние упоминания сайта Постоянная работа Сильно для новых доменов, слабо для старых

Что не работает вообще: сервисы «прогона по каталогам», массовая отправка адресов в сомнительные системы и покупка «ускоренной индексации» у случайных исполнителей. Робот приходит по тем же правилам, а вы получаете ссылки с мусорных площадок.

Когда страницы из индекса надо убирать самому

Если нужна помощь по теме — заказать сайт.

Большой индекс — не самоцель. Тысяча страниц, из которых восемьсот пустые, работает хуже, чем двести живых: система оценивает сайт целиком, и балласт тянет вниз общее впечатление о качестве.

  • Технические адреса: корзина, личный кабинет, страницы оформления заказа, результаты внутреннего поиска.
  • Пустые категории каталога, где нет ни одного товара.
  • Теги и метки блога, если они дублируют рубрики и никто ими не пользуется.
  • Страницы с параметрами сортировки и постраничной навигации, если они не несут отдельного смысла.
  • Старые акции и товары, снятые с продажи навсегда — их лучше склеить с актуальными разделами.

Порядок действий: закрываете мета-тегом noindex, ждёте, пока робот зайдёт и увидит, и только потом при желании закрываете в robots.txt, чтобы не тратить обход. Обратная последовательность — самая частая ошибка, страница остаётся в базе навсегда.

Смежный материал по теме — «Инвертированный индекс и шардирование: что физически происходит с вашей страницей после краула, и почему «переиндексация» — это не то, что вы думаете».

Что делать, если страниц в поиске стало резко меньше

Резкое падение числа проиндексированных страниц почти всегда техническое, а не алгоритмическое. Проверять по порядку:

  1. Открыть robots.txt и сравнить с копией месячной давности. Обновление CMS или шаблона любит переписывать этот файл.
  2. Проверить мета-тег robots на нескольких типовых страницах — не появился ли noindex после обновления плагина.
  3. Посмотреть в Вебмастере статистику ответов сервера за период падения: серия 5xx означает, что робот приходил в моменты, когда сайт лежал.
  4. Проверить, не сменился ли canonical: иногда после переезда весь сайт начинает указывать на главную.
  5. Убедиться, что сертификат не просрочен и https-версия открывается без предупреждений.

Четыре из пяти случаев закрываются на первых трёх пунктах. Если техника чистая, а страницы всё равно уходят с формулировкой о качестве — это уже разговор о содержании, и он длиннее. Быстро увидеть техническую картину помогает бесплатный аудит: он проверяет коды ответов, доступность и базовые запреты индексации.

Частые вопросы

Сайт в индексе, но по запросам его нет. Это нормально? Да, это две разные вещи. Индекс — условие показа, а не гарантия позиции. Страница в базе конкурирует с сотнями других, и если она слабее по содержанию, ссылкам и поведению людей, её просто не покажут выше десятой страницы.

Почему в Яндексе 300 страниц, а в Google 900? Разные правила отбора. Google охотнее берёт в базу технические и слабые адреса, Яндекс жёстче фильтрует по качеству. Сравнивать числа между системами бессмысленно, сравнивайте каждую с реальным количеством страниц сайта.

Помогает ли частое обновление текста удержаться в индексе? Помогает содержательное обновление: новые данные, новые разделы, ответы на новые вопросы. Перестановка слов и смена даты в заголовке не помогает — система сравнивает содержание, а не факт правки.

Нужно ли отправлять на переобход все страницы после доработок? Нет, лимит быстро закончится. Отправляйте те, где изменения принципиальные: главную, страницы услуг, разделы каталога. Остальное робот подхватит сам, если сайт живой.

Страница закрыта в robots.txt, а в выдаче висит. Как убрать? Открыть её в robots.txt, поставить мета-тег noindex, отправить на переобход. Когда робот зайдёт, прочитает запрет и уберёт из базы, можно снова закрывать в robots.txt.

Правда ли, что сайт можно вывести в топ без вложений в контекст? Правда, и это обычный сценарий для среднего бизнеса — но требует времени и системной работы, а не разовой оптимизации. Про то, как это устроено, я писал отдельно: бюджет здесь не главный фактор.

Разбор индексации удобнее смотреть на живых отчётах, чем читать описание. В коротком видео ниже я показываю логику проверки по шагам — от карты сайта до причин исключения в Вебмастере.

Коротко

  • Индекс — база, из которой формируется выдача. Нет страницы в базе — нет её в поиске ни по одному запросу.
  • Путь страницы состоит из обхода, обработки и включения в базу; застревать она может на любом из трёх шагов, и лечение у каждого своё.
  • Точную картину даёт отчёт «Страницы в поиске» в Вебмастере и «Индексирование страниц» в Search Console, а не оператор site:.
  • Robots.txt запрещает заходить, noindex запрещает добавлять в базу, canonical указывает главную версию — это три разных инструмента, и одновременный запрет двумя способами не работает.
  • Ускоряют индексацию переобход в Вебмастере, IndexNow, внутренние ссылки и быстрый сервер; «прогоны по каталогам» не дают ничего.
  • Резкое падение числа страниц в поиске почти всегда техническое: robots.txt, noindex после обновления, ошибки сервера или сбитый canonical.

Если по отчётам видно, что в индексе заметно меньше страниц, чем есть на сайте, а причины в списке исключённых непонятны — приходите на SEO-консультацию. Разберём отчёты вашего сайта, найдём, на каком шаге теряются страницы, и составим порядок действий под вашу CMS.

Увеличьте позиции и продажи вашего сайта

Профессиональное SEO-продвижение с гарантией результата. Выберите подходящую услугу:

Анатолий Кузнецов — SEO-оптимизатор

Остались вопросы по продвижению?

Меня зовут Анатолий Кузнецов, я SEO-оптимизатор с 20-летним стажем. Разберу ваш сайт, отвечу на вопросы и подскажу, что улучшить для роста позиций в Яндексе и Google.

Связаться со мной →

Комментарии

Игорь Обабков

В Вебмастере 1200 страниц исключено с формулировкой «недостаточно качественная», в поиске 340. Сайт — магазин запчастей, описания у товаров есть, взяты из каталога производителя. Получается, надо переписывать 1200 карточек руками? Это нереально.

Анатолий Кузнецов автор

Руками все 1200 переписывать не надо, и начинать с этого точно не стоит. Сначала выгрузите список исключённых в файл и посмотрите, какие это адреса: у магазинов запчастей половина обычно оказывается не карточками, а страницами фильтров по маркам и годам. С ними работа техническая, а не текстовая. По оставшимся карточкам сделайте выборку спроса через Вордстат: у части позиций запросов нет вообще, их достаточно оставить в каталоге и не тянуть в индекс. А вот те двести-триста, по которым люди реально ищут, стоит доработать — и не литературным текстом, а тем, чего нет в каталоге производителя: применимость к моделям, аналоги, отличия от соседней позиции, сроки поставки. Такая карточка перестаёт быть копией сорока других, и система это видит.

Светлана Оболенская

Сделали новый сайт вместо старого, адреса сохранили. Через две недели в Яндексе осталось 12 страниц из 80. Хостинг говорит, что всё в порядке.

Анатолий Кузнецов автор

Хостинг смотрит на доступность сайта сейчас, а робот приходил в момент переезда. Проверьте три вещи по порядку. Первое: откройте ваш robots.txt прямо в браузере — при разработке сайт обычно закрывают целиком, и снять запрет после переноса забывают чаще, чем можно представить. Второе: посмотрите исходный код любой внутренней страницы и найдите мета-тег robots, там мог остаться noindex от тестового окружения. Третье: в Вебмастере откройте статистику обхода за последние две недели и посмотрите коды ответов — если в дни переезда шли 5xx, робот выбросил страницы как недоступные, и они вернутся сами после переобхода. Двенадцать оставшихся страниц из восьмидесяти — характерная картина именно для запрета, а не для проблем с качеством.

Дмитрий Оборин

Не понял момент с robots.txt и noindex. Всегда думал, что чем больше запретов, тем надёжнее закрыто. Выходит, наоборот?

Анатолий Кузнецов автор

Именно наоборот, и это ловушка, на которой сидят очень многие сайты. Мета-тег noindex находится внутри страницы. Чтобы его прочитать, робот обязан страницу скачать. Если вы одновременно закрыли адрес в robots.txt, робот к нему не пойдёт и тега не увидит — значит, команда на удаление до него не дойдёт никогда. Страница при этом вполне может висеть в выдаче с пустым описанием, если на неё есть внешние ссылки. Правильная последовательность такая: сначала открываете адрес в robots.txt, ставите noindex, отправляете на переобход, дожидаетесь, пока страница пропадёт из отчёта, и только после этого при желании закрываете в robots.txt ради экономии обхода.

Наталья Образцова

Подскажите, а IndexNow реально что-то даёт или это очередная модная штука? Сайт на WordPress, обновляю блог два раза в неделю.

Анатолий Кузнецов автор

Даёт, и на вашем сценарии особенно заметно. Смысл в том, что обычно робот приходит по своему расписанию и о новой статье узнаёт с задержкой в несколько дней. С IndexNow сайт сам отправляет сигнал в момент публикации, и робот приходит в тот же день, часто в течение часа. Настраивается это на WordPress плагином за пятнадцать минут: генерируется ключ, кладётся файлом в корень сайта, дальше всё идёт автоматически. Важный нюанс: сигнал ускоряет визит робота, но не заставляет включить страницу в базу — если статья слабая, её всё равно отсеют на третьем шаге. Так что это ускоритель для нормального контента, а не способ протащить пустышку.

Роман Огнев

У меня в Google проиндексировано 4000 страниц, а сайт — визитка на 15 страниц. Откуда взялись остальные?

Алиса Одинокова

Отвечу как человек, который прошёл ровно это. У меня было то же самое на Битриксе: оказалось, что каждая страница доступна с десятком вариантов параметров в адресе, плюс версии для печати, плюс результаты внутреннего поиска попали в индекс через ссылки. Лечилось canonical и правилами в robots.txt для параметров.

Павел Ожегов

Как понять, что робот вообще заходил на конкретную страницу? В Вебмастере вижу общие цифры, а нужно по одному адресу.

Анатолий Кузнецов автор

Есть три уровня точности. Самый простой — в Search Console инструмент проверки URL: вставляете адрес и видите дату последнего обхода, результат и причину решения. В Яндекс.Вебмастере похожее есть в разделе проверки статуса страницы. Второй уровень — раздел статистики обхода в Вебмастере: там список конкретных адресов, которые робот брал за период, с кодами ответов, и его можно выгрузить. Третий, самый честный — логи сервера. В них видно каждое обращение робота с точным временем, и именно там обнаруживаются вещи вроде «робот сорок раз за сутки скачивал страницу пагинации и ни разу не зашёл в карточки товара». Логи запрашиваются у хостинга, на большинстве тарифов они доступны за последние недели.

Виктор Озеров

Читал у одного специалиста, что оператор site: врёт и им пользоваться нельзя вообще. У вас он в списке инструментов. Кому верить?

Ксения Орловская

Вопрос про пагинацию. У меня блог, страницы вида /blog/page/2/, /page/3/ и так далее до 40. Их закрывать от индексации или пусть висят?

Артём Окладников

Сайт живёт четвёртый месяц, в индексе главная и ещё две страницы. Ссылок на сайт нет вообще, сайт новый. Это нормальный срок или уже пора паниковать?

Марина Оводова

Столкнулась с обратной проблемой: убрала товар с сайта, отдаёт 404, а он до сих пор в выдаче третий месяц и люди на него заходят. Переобход отправляла дважды.

Сергей Олейник

А есть смысл держать в индексе страницы с ценами, если цены меняются раз в месяц? Боюсь, что система будет считать их неактуальными и понижать.

1 комментарий к “Поисковый индекс”

  1. Kebab

    Поисковые системы являются важным компонентом современного Интернета, и для их эффективного функционирования необходимы поисковые индексы.

Оставьте комментарий

Ваш адрес email не будет опубликован. Обязательные поля помечены *

 Нажимая «оставить комментарий» вы принимаетеправила конфиденциальности 

Прокрутить вверх