
Как улучшить индексацию сайта — вопрос, который обычно задают уже после того, как потрачены месяцы на тексты и ссылки. Логика владельца понятна: контент есть, работа сделана, а страниц в поиске нет. Логика робота другая — он не обязан обходить всё, что вы написали, и тем более не обязан всё найденное добавлять в базу. Между «страница опубликована» и «страница участвует в выдаче» лежит цепочка из пяти-шести шагов, и рвётся она чаще всего в местах, которые владелец никогда не проверял: в одной строке служебного файла, в коде ответа сервера, в отсутствии ссылок на страницу изнутри сайта.
В SEO я с 2005 года, и по моим наблюдениям индексация — самая недооценённая часть работы. Она невидима: сайт открывается, всё выглядит нормально, ошибок никто не замечает. При этом на средних проектах регулярно обнаруживается, что от трети до половины полезных страниц в поиске отсутствуют, а обходы робота уходят на служебные адреса и мусорные фильтры. Ниже — порядок, по которому я разбираю индексацию на любом сайте, от корпоративного на тридцать страниц до магазина на десятки тысяч.
Путь страницы от обхода до индекса
Сначала о механике, потому что без неё лечение идёт вслепую. Робот сначала должен узнать об адресе — из ссылки на другой странице, из карты сайта, из отправленного вами уведомления. Затем он должен получить возможность его загрузить: файл robots.txt не запрещает, сервер отвечает, страница отдаётся за разумное время. Затем содержимое разбирается и оценивается: есть ли смысл держать этот документ в базе, не дублирует ли он уже имеющееся, отвечает ли на реальные запросы. И только после этого адрес попадает в поиск.
| Этап | Что должно произойти | Типовой сбой |
|---|---|---|
| Обнаружение | Робот узнаёт адрес | Страница-сирота: на неё нет ни одной внутренней ссылки |
| Разрешение | robots.txt не запрещает обход | Случайный Disallow на раздел или на весь сайт |
| Загрузка | Сервер отдаёт код 200 и содержимое | Таймауты, ошибки 5xx, медленный ответ |
| Разбор | Контент виден без выполнения скриптов | Содержимое подгружается только в браузере |
| Оценка | Страница признаётся самостоятельной и полезной | Дубль, тонкая страница, «недостаточно качественная» |
| Публикация | Адрес появляется в поиске | Индекс есть, но показов нет: нет спроса под эту страницу |
Диагностика всегда идёт по этой цепочке сверху вниз. Смысла разбираться с качеством контента нет, пока не проверено, что робот вообще может страницу загрузить. И наоборот: если страницы обходятся ежедневно, но в индекс не попадают, проблема точно не в robots.txt, и ковырять его бесполезно.
Где чаще всего перекрывают доступ роботу
Запрет на индексацию можно поставить четырьмя разными способами, и они действуют по-разному. Половина проблем возникает из-за того, что владелец знает про один способ и не проверяет остальные три.
| Способ | Где живёт | Что делает | Частая ошибка |
|---|---|---|---|
| Disallow в robots.txt | Файл в корне сайта | Запрещает обход адреса | Закрыт раздел целиком одной строкой при переносе с тестового сервера |
| Мета-тег noindex | Секция head страницы | Запрещает добавление в индекс | Остался на шаблоне после разработки, стоит на всех страницах типа |
| Заголовок X-Robots-Tag | HTTP-ответ сервера | То же, что noindex, но не виден в коде страницы | Никто не проверяет: в исходнике страницы его нет |
| Атрибут rel=»canonical» | Секция head | Указывает основной адрес из группы дублей | Все страницы указывают на главную — раздел исчезает из поиска |
| Закрытие паролем или по IP | Настройки сервера | Робот получает 401 или 403 | Осталась защита от тестового периода |
Отдельно предупрежу про сочетание Disallow и noindex. Если страница закрыта в robots.txt, робот не может её загрузить и, соответственно, не видит мета-тег noindex внутри. Чтобы страница гарантированно ушла из индекса, обход должен быть разрешён, а запрет — стоять в мета-теге или в заголовке ответа. Это одна из самых частых логических ошибок: закрывают в robots и удивляются, почему адреса продолжают висеть в поиске.
Проверять эти четыре места нужно не глазами по одной странице, а массово. Возьмите список адресов сайта и прогоните краулером, который показывает код ответа, мета-роботс, канонический адрес и заголовки. Разница между «я посмотрел главную, всё нормально» и полной выгрузкой обычно составляет несколько сотен неожиданно закрытых страниц.
Коды ответа и доступность сервера
Робот делает вывод не по содержимому страницы, а по коду ответа. Здесь ошибки стоят дороже всего, потому что они систематические: неправильный код отдают не одна страница, а весь класс адресов.
Если нужны детали, смотрите «Как улучшить позиции сайта».
- 200 на несуществующей странице. Так называемая мягкая 404: адрес удалён, а сервер отвечает «всё в порядке» и отдаёт пустую страницу или главную. Индекс постепенно засоряется мусорными адресами, обходы уходят в никуда.
- 302 вместо 301. Временный редирект не передаёт сигналы старого адреса новому и не убирает старый из индекса. При переездах и смене адресов ставится только 301.
- Цепочки редиректов. Три-четыре перехода подряд робот может не дойти до конца. Каждая ссылка внутри сайта должна вести на конечный адрес напрямую.
- Периодические 5xx. Хостинг падает под нагрузкой в часы обхода. В Вебмастере это видно как всплески ошибок и падение числа загруженных страниц.
- Медленный ответ. Если сервер отвечает секунду и больше, робот сокращает интенсивность обхода. На крупных сайтах это прямо ограничивает скорость появления новых страниц в поиске.
Время ответа сервера — тот показатель, который я проверяю первым на любом крупном сайте. Он влияет не на позиции напрямую, а на количество страниц, которые робот успевает загрузить за визит. Ускорение ответа с восьмисот миллисекунд до двухсот на магазине с десятками тысяч адресов меняет картину индексации сильнее, чем любые правки в карте сайта.
Помогу с продвижением: заказать продвижение сайта — вывожу сайты в топ Яндекса белыми методами.
О том, влияет ли сам домен на продвижение:
Карта сайта и внутренние ссылки: как робот находит страницы
Два канала обнаружения работают вместе, и подменять один другим нельзя. Карта сайта — это заявка на обход, список адресов, которые вы считаете нужными. Внутренние ссылки — это подтверждение важности: страница, на которую ссылаются из меню и из соседних материалов, выглядит частью сайта, а не случайным документом.
Требования к карте простые и почти всегда нарушаются. В ней должны быть только адреса, отдающие код 200. Не должно быть закрытых в robots, неканонических, редиректящих. Дата последнего изменения обязана быть настоящей: если она обновляется у всех страниц при каждой сборке, робот перестаёт ей доверять. Файл должен обновляться автоматически при публикации, а не раз в год руками.
Страницы-сироты — отдельная беда, особенно на сайтах, которые росли годами. Материал опубликован, лежит в базе, доступен по прямой ссылке, но ни одна страница сайта на него не ссылается. В карту он попадает, робот его иногда обходит, но веса не получает и в индексе держится плохо. Находятся сироты сравнением полной выгрузки адресов из базы со списком адресов, найденных краулером при обходе от главной: разница и есть список сирот.
Подробнее об этом — в статье «Как улучшить SEO сайта».
- Выгрузите все существующие адреса сайта из базы или карты.
- Прогоните сайт краулером в режиме обхода по ссылкам, начиная с главной.
- Сравните списки: адреса, которых нет во втором, — сироты.
- Для каждого решите: нужна ли страница вообще. Если нужна — поставьте на неё ссылки из тематически близких материалов и из раздела, к которому она относится.
- Если не нужна — удалите с кодом 410 или склейте редиректом с подходящей страницей.
Краулинговый бюджет и дубли
Число обращений робота к сайту за период ограничено. На маленьком сайте это неважно, на большом определяет всё: если робот тратит обходы на технический мусор, до новых карточек он доходит через недели. Дубли — главный пожиратель этого ресурса.
| Источник дублей | Как выглядит | Решение |
|---|---|---|
| Параметры сортировки и фильтров | Один список товаров под десятками адресов | Канонический адрес на основную категорию, запрет обхода бесполезных комбинаций |
| Пагинация | Страницы 2, 3, 4 с тем же текстом категории | Уникальные Title, без повтора описания категории на всех страницах |
| UTM-метки | Адрес с хвостом из рекламных параметров | Канонический адрес без параметров |
| Со слешем и без, с www и без, http и https | Четыре версии одного адреса | Один главный вариант, остальные — 301 |
| Товар в нескольких категориях | Одна карточка под разными путями | Один постоянный адрес карточки вне категорий |
| Печатные версии и служебные страницы | Копия содержимого по отдельному адресу | Запрет обхода или noindex |
Экономия бюджета делается не только запретами. Полезно убрать из внутренних ссылок всё, что ведёт на редиректы и закрытые адреса: робот идёт по ссылкам, и каждый бесполезный переход — это потраченный обход. На магазинах я обычно нахожу тысячи ссылок на старые адреса категорий, оставшихся после переезда несколько лет назад.
Страница обходится, но в индекс не попадает
Самый неприятный случай: технически всё в порядке, робот заходит регулярно, а адрес в поиске не появляется или появляется и выпадает. В Вебмастере такие страницы попадают в исключённые со статусом о недостаточном качестве. Формулировка расплывчатая, но за ней стоят вполне конкретные причины.
| Причина | Признак | Что делать |
|---|---|---|
| Нет спроса под страницу | Ни одного запроса, которому она отвечает | Пересобрать под реальный кластер или объединить с другой |
| Тонкое содержимое | Пара абзацев, шаблонный текст, отличие только в названии | Добавить фактическую информацию: параметры, цены, условия, ответы |
| Почти дубль соседней страницы | Отличие в одном слове заголовка | Склеить в одну страницу или развести по смыслу |
| Слабый внутренний вес | Одна ссылка из глубины сайта | Поднять в структуре, добавить ссылки из близких материалов |
| Содержимое подгружается скриптом | В исходном коде текста нет | Отдавать основной контент в HTML сразу |
| Общая репутация раздела | Весь раздел индексируется плохо | Чистить раздел от пустых страниц целиком, а не по одной |
Если нужна помощь по теме — проверить сайт.
Про последнюю строку скажу подробнее, потому что она объясняет самые упорные случаи. Оценка идёт не только по отдельной странице: если раздел на восемьдесят процентов состоит из пустых карточек, попасть в индекс тяжело и хорошим страницам внутри него. Поэтому массовая генерация страниц «под запросы» без фактического наполнения работает против сайта — сначала не индексируется мусор, потом хуже индексируется всё остальное.
Как ускорить попадание в индекс
Инструменты ускорения не заменяют исправление причин, но экономят недели, когда причины уже устранены.
Тему разбирал отдельно: «Как улучшить ранжирование молодого сайта».
- Переобход страниц в Вебмастере. Ручная отправка адресов на обход. Лимиты суточные, поэтому приоритет отдаётся новым и существенно изменённым страницам, а не всему сайту подряд.
- IndexNow. Протокол уведомления о новых и изменённых адресах. Настраивается один раз на стороне сайта и дальше работает автоматически при каждой публикации. Заметно сокращает задержку между публикацией и обходом.
- Настоящая дата изменения. Заголовок Last-Modified и поле даты в карте сайта должны меняться только при реальной правке. Тогда робот доверяет им и перепроверяет изменённое в первую очередь.
- Ссылки с уже индексируемых страниц. Новая страница, на которую ведёт ссылка с часто обходимого раздела, попадает в обход быстрее всего. Это самый дешёвый способ ускорения и самый недооценённый.
- Внешние упоминания. Ссылка с активного стороннего ресурса ускоряет обнаружение, особенно для нового сайта без истории.
- Порционная публикация. Выкладывать тысячу страниц одним днём хуже, чем частями: при массовом залпе значительная часть уходит в очередь и оценивается по остаточному принципу.
Постоянный контроль индексации
Индексация — не разовая задача, а показатель, который проверяют регулярно, как остаток на счёте. Минимальный набор наблюдений занимает пятнадцать минут в неделю.
- Число страниц в поиске и его динамика. Резкое падение — сигнал технической аварии, плавное снижение — накопление проблем с качеством.
- Соотношение загруженных и включённых в поиск. Большой разрыв означает, что робот тратит обходы на то, что потом отбрасывает.
- Список исключённых с причинами. Смотреть не общее число, а состав: какие типы адресов туда попадают.
- Ошибки обхода и коды ответа. Всплески 5xx и рост времени ответа сервера.
- Разница между числом страниц в карте и числом в поиске. Если карта заявляет пять тысяч, а в поиске полторы, у вас есть конкретный список для разбора.
- Скорость появления новых страниц. Сколько дней проходит от публикации до попадания в индекс. Это самая наглядная метрика здоровья сайта.
Частые вопросы
Сколько времени страница должна попадать в индекс? Для живого сайта с регулярными публикациями — от нескольких часов до нескольких дней. Для нового сайта без истории — недели. Если новые страницы висят месяц и дольше, это не «так работает поиск», а признак проблемы: чаще всего медленный сервер, отсутствие внутренних ссылок или общая слабость раздела.
Помогает ли частая публикация ускорить обход? Помогает, но только если публикуется содержательный материал. Робот подстраивает частоту визитов под темп обновлений. Публикация пустых страниц ради ритма даёт обратный эффект: доля отбракованного растёт, доверие к разделу падает.
Нужно ли закрывать от индексации служебные страницы? Да — корзину, личный кабинет, результаты внутреннего поиска, страницы оформления заказа, версии для печати. Они не отвечают ни на один поисковый запрос и только расходуют обходы. Закрывать лучше комбинацией: обход запрещён в robots для того, что заведомо не нужно, а для уже проиндексированного — noindex с открытым обходом до момента исчезновения из поиска.
Что делать, если страницы выпали из индекса массово? Проверять по порядку: доступность сайта и коды ответа за последние недели, изменения в robots.txt, появление мета-тега noindex после обновления шаблона или плагина, смену канонических адресов, переезд на новые адреса без 301. Массовое выпадение почти всегда техническое, а не «алгоритмическое».
Влияет ли скорость сайта на индексацию? Влияет напрямую, но не через ранжирование, а через объём обхода: чем быстрее ответ сервера, тем больше страниц робот успевает загрузить. На сайтах до сотни страниц разница незаметна, на крупных проектах она решающая.
Стоит ли удалять неиндексируемые страницы? Сначала разберитесь, почему они не индексируются. Если под ними нет спроса и наполнять их нечем — да, удалять или объединять полезнее, чем держать. Сокращение числа пустых страниц нередко улучшает индексацию оставшихся: раздел перестаёт выглядеть свалкой.
Коротко
- Между публикацией и появлением в поиске шесть шагов; диагностика идёт строго сверху вниз — от обнаружения адреса к оценке качества.
- Запрет на индексацию ставится четырьмя способами, и проверять надо все: robots.txt, мета-тег, заголовок ответа сервера, канонический адрес.
- Коды ответа важнее содержимого: мягкие 404, цепочки редиректов и периодические 5xx ломают индексацию системно, а не по одной странице.
- Карта сайта заявляет адреса, внутренние ссылки подтверждают их важность; страницы-сироты находятся сравнением выгрузки из базы с обходом краулера.
- Дубли съедают обходы: параметры, пагинация, метки и разные версии адреса нужно свести к одному каноническому варианту.
- Статус о недостаточном качестве почти всегда означает отсутствие спроса, тонкое содержимое или слабый внутренний вес, а ускорители вроде IndexNow работают только после устранения причин.
Если страницы не заходят в индекс, а причина по этим шагам не находится, приходите на SEO-консультацию: посмотрим Вебмастер и структуру сайта вместе и определим, на каком именно шаге цепочки теряются ваши страницы.
Увеличьте позиции и продажи вашего сайта
Профессиональное SEO-продвижение с гарантией результата. Выберите подходящую услугу:
Остались вопросы по продвижению?
Меня зовут Анатолий Кузнецов, я SEO-оптимизатор с 20-летним стажем. Разберу ваш сайт, отвечу на вопросы и подскажу, что улучшить для роста позиций в Яндексе и Google.
Связаться со мной →
Комментарии
Ксения Грачёва
Про X-Robots-Tag не знала вообще. Проверила заголовки ответа на своём разделе новостей — и там действительно noindex, которого нет в коде страниц. Остался с момента разработки, полтора года. В исходнике всё чисто, поэтому никто и не искал.
Анатолий Кузнецов автор
Классическая находка, и она попадается у меня в аудитах регулярно. Заголовок ставится на уровне сервера или через плагин, в HTML его не видно, а смотрят обычно именно HTML. Чтобы такое не повторялось, добавьте в свой чеклист проверку заголовков ответа при любом переносе сайта и при обновлении движка. Проще всего сделать это краулером, который выводит колонку с заголовками, — и прогонять его раз в квартал по всему сайту, а не по паре страниц. После снятия запрета не ждите пассивно: отправьте важные адреса на переобход в Вебмастере порциями и поставьте на них ссылки из уже индексируемых разделов, иначе робот доберётся до раздела нескоро. И проверьте заодно, не осталось ли там же Disallow — если обход запрещён, снятый noindex робот просто не увидит.
Зоя Дегтярникова
Сравнила карту сайта с выгрузкой из базы, как написано. В карте четыре тысячи адресов, в поиске восемьсот. Причём в карту попали и удалённые товары, и страницы с редиректами. Генерируется плагином, никто ни разу не смотрел.
Валентин Ерохов
Спорный, на мой взгляд, тезис про репутацию раздела. Оценка ведь идёт по странице, а не по папке. Откуда вообще у робота понятие «раздел плохой»? Мне кажется, это додумывание за алгоритм.
Анатолий Кузнецов автор
Возражение по существу, поэтому уточню формулировку. Никакого явного флага «раздел плохой» я не предполагаю, и утверждать про внутреннее устройство модели не берусь. Наблюдаемый факт другой: если в разделе большинство страниц отбраковано, новые страницы того же типа заходят в индекс заметно медленнее, чем такие же страницы в здоровом разделе того же сайта. Объяснений может быть несколько, и они не взаимоисключающие. Первое: страницы одного типа генерируются по одному шаблону, и оценка похожих документов оказывается похожей — это не про папку, а про сходство. Второе: обход внутри плохо индексируемого раздела становится реже, потому что робот подстраивает частоту под долю полезного. Третье: у страниц слабого раздела обычно и внутренний вес ниже. Практический вывод от объяснения не зависит: чистить такие разделы выгоднее целиком, а не вытягивать по одной странице.
Родион Галактионов
Добавлю про Last-Modified. У нас движок при каждой пересборке проставлял текущую дату всем страницам. В карте сайта каждый день обновлялись все пять тысяч записей. После исправления робот стал заходить на реально изменённые страницы в разы охотнее.
Матвей Драгомиров
Вопрос про порционную публикацию. У меня перенос каталога со старой площадки, три тысячи карточек разом. Разбивать на партии — это на сколько частей и с каким интервалом? И не хуже ли будет, если каталог половину месяца стоит неполным?
Анатолий Кузнецов автор
Разделите две вещи: доступность каталога для людей и темп подачи адресов роботу. Каталог выкладывайте целиком — неполный магазин теряет продажи, и это дороже любой индексации. А вот в карту сайта и на переобход подавайте порциями: примерно по двести-триста адресов в день, начиная с самых спросовых категорий и самых ходовых товаров. Порядок важнее скорости: если первыми зайдут карточки, под которые есть спрос, раздел начнёт получать показы и обход ускорится сам. Обязательно проверьте перед стартом две вещи — время ответа сервера под нагрузкой обхода и наличие внутренних ссылок на каждую карточку минимум из одной категории. И держите старые адреса со старой площадки живыми через 301 на новые: это переносит накопленные сигналы и заметно сокращает срок переиндексации.
Диана Евстигнеева
Нашла у себя мягкие 404: удалённые товары отдавали код 200 с текстом «товар не найден». В индексе висело около шестисот таких страниц. Настроили нормальный 404 — за месяц вычистились.
Юлия Гордейчук
Про сирот полезно. Но как быть с большим блогом, где старые статьи никому не нужны и ссылок на них нет естественным образом? Ставить ссылки искусственно кажется натяжкой.
Лариса Дудакова
У нас сайт на скриптовом фреймворке, контент подгружается после загрузки страницы. Разработчик уверяет, что поисковики давно всё исполняют и волноваться не о чем. По вашей таблице выходит, что это риск. Как проверить, кто прав, без веры на слово?
Анатолий Кузнецов автор
Проверяется без споров, за десять минут. Первое: откройте исходный код страницы — не панель разработчика с итоговым деревом, а именно исходник, который отдал сервер. Если основного текста и ссылок там нет, робот при первом заходе их тоже не видит. Второе: посмотрите сохранённую копию страницы в поиске и текстовую версию, если она доступна, — там видно, что реально попало в базу. Третье и самое наглядное: сравните в Вебмастере, сколько страниц такого типа загружено и сколько включено в поиск, с аналогичным разделом, отдающим обычный HTML. Разница обычно снимает вопрос. Ваш разработчик отчасти прав: скрипты действительно исполняются. Но это отдельная и более поздняя очередь обработки, и на крупных сайтах она означает задержку в недели, а не в часы. Компромисс — отдавать серверным рендерингом хотя бы основной текст, заголовки и ссылки, а на скрипты оставить интерактив.
Макар Ершаков
IndexNow настроил на выходных, заняло полчаса. Новые статьи стали появляться в поиске в день публикации вместо трёх-четырёх дней. Самая дешёвая правка за всё время работы с сайтом.
Савелий Гуняшов
Меня удивил совет удалять неиндексируемые страницы. Всегда думал, что лишние страницы просто лежат и есть не просят. Получается, они реально мешают остальным?
Кирилл Дьячук
Про время ответа сервера подтверждаю. Переехали с дешёвого тарифа, ответ упал с секунды до двухсот миллисекунд. Число загруженных страниц в Вебмастере выросло примерно втрое за месяц без единой правки контента.
Юлиана Елькина
Вопрос по пагинации. Читала противоположные советы: одни говорят закрывать страницы со второй и дальше, другие — оставлять открытыми с каноническим на первую, третьи — вообще ничего не трогать. Что делать интернет-магазину?
Анатолий Кузнецов автор
Разброс советов объясняется тем, что рекомендации менялись со временем, и старые статьи никто не переписывает. Рабочая схема сегодня такая. Страницы пагинации оставляйте открытыми для обхода — через них робот добирается до карточек, и закрыв их, вы отрезаете каталог. Канонический адрес каждая страница пагинации указывает на саму себя, а не на первую: иначе вы говорите роботу, что содержимое второй страницы дублирует первую, а это неправда — товары там разные. Текст описания категории размещайте только на первой странице, на остальных его не повторяйте. Title и Description на страницах со второй делайте с указанием номера, чтобы они не были одинаковыми. И следите, чтобы у каждой карточки был путь не только через пагинацию: чем глубже страница, тем реже она обходится, поэтому ходовые товары полезно подтягивать ссылками из хитов, подборок и связанных товаров.