Поисковый индекс

Анатолий Кузнецов
Анатолий Кузнецов
SEO-оптимизатор с 20-летним стажем. Автор блога hozyindachi.ru о продвижении и доработке сайтов.

Практически каждый разбор чужого сайта у меня начинается с одного вопроса от владельца: «Почему страницы нет в поиске, она же есть на сайте?» Ответ лежит в понимании того, как устроен поисковый индекс. Сайт и индекс — два разных хранилища. Ваш сервер отдаёт документ по запросу браузера, а поисковая система показывает только то, что успела скачать, обработать и сохранить у себя. Между этими событиями лежит цепочка, в которой страница может потеряться на любом шаге.

Зачем нужен поисковый индекс

Что такое поисковый индекс на самом деле

Поисковый индекс — база данных, где хранятся обработанные копии веб-страниц и служебная информация о них. Ключевое слово здесь «обработанные»: поисковик не хранит ваш HTML в исходном виде и не ищет по нему подстроку в момент запроса. Это было бы физически невозможно при миллиардах документов и сотнях тысяч запросов в секунду.

Используется структура, которую называют инвертированным индексом. Обычный документ — это список слов внутри страницы. Инвертированный индекс — наоборот: список страниц для каждого слова, с указанием позиций в тексте, зоны документа и веса. Когда пользователь вводит запрос, система пересекает несколько таких списков и получает набор кандидатов за миллисекунды.

Поэтому индексация и ранжирование — разные задачи. Индексация отвечает на вопрос «знает ли поиск о вашей странице». Ранжирование — «на каком месте её показать». Страница вне индекса не имеет позиций в принципе: у неё не низкое место, у неё места нет.

Три этапа пути страницы в индекс

Обход. Робот должен узнать, что страница существует. Адреса он берёт из ссылок на известных страницах, из карты сайта, из данных счётчиков, из переданных вручную адресов. Затем скачивает документ, получая код ответа и содержимое.

Обработка. HTML разбирается: выделяется основной контент, извлекаются ссылки, текст разбивается на слова и нормализуется, определяется язык, считаются контрольные суммы для поиска дублей, при необходимости выполняется рендеринг JavaScript. Здесь принимается решение: достоин ли документ места в индексе.

Хранение и обновление. Документ записывается в базу, становится доступен для поиска, и дальше робот периодически возвращается проверить изменения. Частота возврата зависит от того, как часто менялся документ раньше и насколько он востребован.

Стадия Что происходит Типичная причина потери страницы
Обход Робот узнаёт адрес и скачивает документ Нет входящих ссылок, запрет в robots.txt, ошибка сервера или таймаут
Обработка Разбор контента, дедупликация, оценка качества Дубль, пустой контент, noindex, canonical на другой адрес
Хранение Запись в базу и периодический переобход Исключение при пересчёте качества, редкий переобход

Почему страница есть на сайте, но её нет в поиске

Когда я делаю аудит сайта и вижу разрыв между числом страниц в CMS и в индексе, я делю причины на две группы: техническая недоступность и содержательный отказ. Лечатся они по-разному.

Техническая недоступность — робот не смог получить страницу или ему запретили: закрытие в robots.txt, метатег noindex, заголовок X-Robots-Tag, редирект на другой адрес, коды 4xx и 5xx, медленный сервер, обрывающий соединение, контент, появляющийся только после тяжёлого скрипта.

Содержательный отказ — робот страницу получил, разобрал и решил не брать. Это встречается чаще, чем думают владельцы, и особенно портит статистику интернет-магазинам. Причины: страница признана дублем (тот же товар в разных категориях, версии с параметрами сортировки, печатные версии), почти нет уникального текста, страница генерируется автоматически и повторяет сотни таких же.

Отдельная категория — «робот знает, но страница ждёт очереди». Для новых разделов это нормально: чинить нечего, нужно дать сигналы важности.

Как проверить, в индексе ли страница

Способ проверки Что даёт Ограничение
Панель вебмастера, раздел исключённых страниц Причину исключения по каждому адресу Данные обновляются с задержкой
Инструмент проверки одного URL Точный статус конкретной страницы По одному адресу за раз
Поиск по точной фразе в кавычках Быстрый ответ без доступа к панелям Грубо, только факт наличия
Логи сервера Реальные визиты робота и коды ответов Нужен доступ к серверу
Оператор site: Порядок величины Число приблизительное, часто вводит в заблуждение

Основной источник — панель вебмастера. В Яндекс.Вебмастере есть раздел страниц в поиске и раздел исключённых с указанием причины. В Search Console — отчёт об индексировании и проверка URL, показывающая, когда робот заходил и что решил. Логи — единственный источник, не зависящий от интерпретаций панелей: они показывают, приходил ли робот физически и сколько страниц обошёл.

Краулинговый бюджет: кому о нём думать

Краулинговый бюджет — количество страниц вашего сайта, которые робот готов скачать за единицу времени. Складывается из двух факторов: сколько нагрузки выдержит сервер (при медленных ответах и ошибках робот снижает темп) и насколько система заинтересована в сайте.

Для сайта на пару сотен страниц бюджет обычно не проблема. Проблема начинается там, где адресов десятки и сотни тысяч, и особенно там, где они плодятся сами. Классический пример — фильтры каталога: пять параметров дают тысячи комбинаций, каждая со своим URL. Робот тратит бюджет на них вместо новых карточек товаров.

Источник расхода Как проявляется Решение
Параметры фильтров и сортировок Тысячи адресов с ?sort=, ?filter= в логах Закрыть в robots.txt, оставить продвигаемые комбинации
Цепочки редиректов Робот делает три-четыре перехода вместо одного Заменить прямым редиректом в один шаг
Битые ссылки Большая доля ответов 404 в логах Исправить ссылки в шаблонах и меню
Медленный ответ сервера Генерация страницы дольше 1-1,5 секунды Кэширование, доработка сайта на уровне бэкенда
Бесконечная пагинация Страницы вида /page/500/ с одним товаром Ограничить глубину, разбить каталог на разделы

Как ускорить попадание в индекс

Прямая передача адреса через панель вебмастера. Самый быстрый канал: часто страница появляется в индексе в течение суток. Лимиты небольшие, поэтому тратить их нужно на важные страницы — новые коммерческие разделы, изменённые посадочные.

Внутренние ссылки с проиндексированных страниц. Новая страница, на которую ведут ссылки с главной или крупного раздела, индексируется быстрее и держится стабильнее. Это же главный инструмент борьбы со страницами-сиротами, на которые вообще ничего не ссылается.

Актуальная карта сайта. Не гарантирует индексацию, но помогает обнаружить адреса. Важно, чтобы в ней были только страницы с кодом 200, открытые для индексации. Карта наполовину из редиректов и удалённых страниц снижает доверие ко всему файлу.

Регулярность обновлений. Робот подстраивает частоту визитов под ритм сайта. Регулярно выходящие материалы ускоряют индексацию не только сами по себе, но и подтягивают весь раздел.

Внешние ссылки. Упоминание с посещаемого ресурса приводит робота почти сразу. Гнаться за количеством ради индексации не нужно, достаточно естественных упоминаний.

Практический разбор: разрыв между сайтом и индексом

Типичная ситуация: в CMS 12 000 страниц, в поиске 3 000, владелец уверен, что сайт под фильтром. Диагностика строится так.

Сначала открываем раздел исключённых страниц и смотрим распределение по причинам — это отсекает половину гипотез. Дубли означают проблему в структуре URL и канонических адресах, недостаточное качество — проблему в контенте, запрет к индексированию — в robots.txt или метатегах.

Затем считаем, сколько страниц вообще должны быть в индексе. В большинстве магазинов число посадочных страниц в разы меньше числа адресов: корзина, личный кабинет, сравнение, версии для печати, комбинации фильтров индексировать не нужно.

Дальше берём выборку из 20-30 непроиндексированных страниц и проверяем каждую вручную. Ручная выборка почти всегда показывает одну доминирующую причину, невидимую в сводном отчёте.

Последний шаг — логи за месяц: какие разделы робот обходит, а какие обходит стороной. Часто выясняется, что до нужного каталога он не доходит, потому что путь к нему лежит через десять кликов от главной.

Чего делать не стоит

  • Не закрывайте страницу в robots.txt, чтобы убрать её из индекса. Запрет обхода мешает роботу увидеть noindex, и страница может остаться в выдаче без описания.
  • Не считайте расхождение оператора site: с панелью вебмастера доказательством санкций.
  • Не создавайте страницы «под индексацию» без содержания: пустые категории и теги ухудшают оценку качества всего сайта.
  • Не отправляйте одни и те же адреса на переобход каждый день — лимиты исчерпываются, а приоритет не растёт.
  • Не паникуйте из-за колебаний числа страниц в поиске на несколько процентов: индекс живой.
  • Не оставляйте новые разделы без внутренних ссылок в расчёте на карту сайта — это вспомогательный канал, а не замена структуре.

Частые вопросы

Сколько времени занимает индексация новой страницы? Для живого сайта с регулярными обновлениями — от нескольких часов до недели. Для нового домена без истории первые страницы могут ждать две-четыре недели. Отправка на переобход обычно сокращает срок до суток.

Страница в индексе, но не находится по своим запросам. Что не так? Это вопрос ранжирования, а не индексации. Проверьте соответствие содержания ожиданиям по запросу, нет ли на сайте другой страницы, конкурирующей за тот же запрос, и как выглядят конкуренты. Такой разбор — стандартная часть SEO-консультации.

Нужно ли закрывать пагинацию от индексации? В большинстве случаев нет: она помогает роботу добраться вглубь каталога. Разумнее оставить её открытой, но с уникальными заголовками и без дублирования текста с первой страницы.

Индекс Яндекса и Google — это одно и то же? Нет, это независимые базы с разными роботами и правилами отбора. Страница может быть в одном индексе и отсутствовать в другом, проверять нужно обе панели.

Влияет ли скорость сайта на индексацию? Напрямую. Медленный ответ сервера снижает число страниц, скачиваемых за визит. На больших сайтах ускорение бэкенда даёт рост охвата индексом без единой правки контента.

Чеклист по индексации

  • Сравнить количество страниц в CMS, в карте сайта и в панелях вебмастера обеих систем.
  • Выгрузить исключённые страницы и сгруппировать по причинам.
  • Проверить robots.txt на случайные запреты нужных разделов.
  • Проверить наличие noindex и X-Robots-Tag там, где их быть не должно.
  • Убедиться, что канонические адреса посадочных страниц указывают сами на себя.
  • Найти страницы-сироты и связать их с разделами.
  • Очистить карту сайта от редиректов, 404 и закрытых страниц.
  • Проверить логи: где робот тратит бюджет впустую.
  • Измерить время ответа сервера на типовых страницах.
  • Закрыть от обхода параметрические адреса фильтров, кроме продвигаемых.
  • Сократить цепочки редиректов до одного перехода.
  • Отправить на переобход приоритетные страницы.

Индексация — фундамент, на котором стоит всё остальное. Можно вложиться в тексты, ссылки и контекстную рекламу, но если половина посадочных страниц не доехала до базы поиска, вложения работают вхолостую. Начинайте разбор сайта с этого слоя: он проверяется за несколько часов.

Если нужно вывод сайта в ТОП Яндекса — помогу вывести сайт в топ Яндекса и удержать позиции.

Увеличьте позиции и продажи вашего сайта

Профессиональное SEO-продвижение с гарантией результата. Выберите подходящую услугу:

Анатолий Кузнецов — SEO-оптимизатор

Остались вопросы по продвижению?

Меня зовут Анатолий Кузнецов, я SEO-оптимизатор с 20-летним стажем. Разберу ваш сайт, отвечу на вопросы и подскажу, что улучшить для роста позиций в Яндексе и Google.

Связаться со мной →

1 комментарий к “Поисковый индекс”

  1. Поисковые системы являются важным компонентом современного Интернета, и для их эффективного функционирования необходимы поисковые индексы.

Оставьте комментарий

Ваш адрес email не будет опубликован. Обязательные поля помечены *

 Нажимая «оставить комментарий» вы принимаетеправила конфиденциальности 

Прокрутить вверх