
Проблемы с индексируемостью сайта коварны тем, что не видны изнутри: страница открывается в браузере, выглядит нормально, менеджеры её показывают клиентам — а в поиске её нет и не будет. Можно собрать точную семантику, написать сильный текст и вложиться в дизайн, но если робот не добавил адрес в свою базу, вся работа существует только для тех, кому вы дали прямую ссылку. Именно здесь прячутся самые дорогие ошибки, потому что они не сигнализируют о себе ничем.
В SEO с 2005 года, и порядок разбора у меня один и тот же независимо от движка сайта: сначала измерить разрыв между тем, сколько страниц должно быть в индексе и сколько там есть, потом пройти по причинам от технических к содержательным. Ниже — этот порядок в виде рабочего руководства, которое можно открыть рядом с панелью вебмастера и идти по пунктам.
Путь страницы в индекс и где он рвётся
Попадание в поиск состоит из трёх независимых этапов, и сбой на каждом выглядит для владельца одинаково — страницы нет в выдаче. Лечится каждый этап по-разному, поэтому начинать нужно с определения, где именно оборвалась цепочка.
- Обнаружение. Робот должен узнать об адресе. Источники — карта сайта, внутренние ссылки, внешние ссылки, ручная отправка через панель вебмастера. Страница, на которую не ведёт ни одна ссылка и которой нет в карте, для поиска не существует.
- Сканирование и обработка. Робот скачивает документ, получает код ответа, читает разметку, при необходимости выполняет скрипты. Здесь ломаются сайты, где содержимое подгружается только после действий пользователя.
- Включение в индекс. Система решает, стоит ли хранить эту страницу. Отказ на этом этапе — самый сложный случай: технически всё в порядке, но документ признан малополезным или дублирующим.
Ключевое различие, которое стоит усвоить до начала работы: «просканирована» и «в индексе» — разные состояния. Робот может годами заходить на адрес и не добавлять его в базу. Поэтому отчёт о посещениях робота не является доказательством того, что страница участвует в поиске, и наоборот — отсутствие свежих визитов не всегда означает проблему.
Как измерить масштаб проблемы
Диагностика начинается не с гипотез, а с чисел. Нужны две величины: сколько страниц на сайте должно быть в поиске и сколько их там фактически. Разрыв между ними и есть предмет разбора.
| Инструмент | Что показывает | Ограничение |
|---|---|---|
| Панель вебмастера, раздел страниц в поиске | Точное число и список исключённых с причинами | Данные обновляются с задержкой в несколько дней |
| Отчёт об обходе роботом | Коды ответа, которые получал робот | Не отвечает на вопрос, попала ли страница в индекс |
| Оператор site: в поиске | Грубую оценку объёма индекса | Число приблизительное, для точных выводов не годится |
| Карта сайта против индекса | Разрыв между планом и фактом | Требует, чтобы карта была актуальной |
| Краулер сайта на своём компьютере | Реальную структуру, коды, редиректы, запреты | Видит сайт как робот, но не знает решений поисковика |
| Проверка конкретного URL в панели | Статус одного адреса и причину исключения | Точечный инструмент, не для массового разбора |
Сначала считаем, сколько страниц должно быть. Возьмите выгрузку из CMS: товары в наличии, категории, услуги, статьи, служебные страницы. Затем сверьте с картой сайта — часто выясняется, что карта генерируется криво и половина разделов туда не попадает. Только после этого сравнивайте с числом в панели вебмастера.
Отдельно отсортируйте исключённые страницы по причинам. В большинстве проектов картина такая: значительная доля исключений приходится на дубли и служебные адреса, и это нормально. Тревожно, когда в исключённых оказываются нужные коммерческие страницы — карточки товаров, разделы каталога, посадочные под услуги.
Страница закрыта от робота
Первая группа причин — самая частая и самая быстрая в устранении. Робот просто не имеет права или возможности взять документ.
| Причина | Где проверить | Что делать |
|---|---|---|
| Запрет в robots.txt | Файл в корне, проверка URL в панели | Убрать правило или сузить его до служебных адресов |
| Мета-тег noindex | Исходный код страницы | Удалить тег на нужных страницах |
| Заголовок X-Robots-Tag | Ответ сервера, вкладка сети в браузере | Править конфигурацию сервера или плагин |
| Код ответа 404 или 410 | Краулер, отчёт об обходе | Восстановить страницу или настроить редирект |
| Ответ 5xx и таймауты | Отчёт об обходе, логи сервера | Разобраться с хостингом и нагрузкой |
| Цепочка редиректов | Краулер, проверка адреса | Свести к одному переходу без промежуточных |
| Закрытый доступ, авторизация | Открыть адрес в режиме инкогнито | Снять пароль с боевой версии |
| Медленный ответ сервера | Время ответа в отчётах и логах | Кэширование, оптимизация базы, смена тарифа |
Самая обидная ситуация из этого списка — сайт, оставшийся закрытым после разработки. Тестовую версию закрывают в robots.txt или паролем, а при переносе на боевой домен запрет забывают снять. Проверяется это за минуту, но живёт месяцами, потому что визуально ничего не сломано.
Подробнее об этом — в статье «Бесплатное продвижение сайта в поисковиках».
Вторая по обидности — коды 5xx под нагрузкой. Робот приходит пачкой запросов, дешёвый хостинг не справляется, сервер отдаёт ошибку. Владелец в это время видит нормальный сайт, потому что заходит по одной странице. Обнаруживается только в логах и в отчёте об обходе, где видна доля ошибок.
Страница доступна, но не попадает в индекс
Более сложная группа: технически всё в порядке, робот заходит, но документ не добавляется. Здесь причина в самом содержимом.
Из чего складывается продвижение сайта и как оно работает:
- Мало уникального содержимого. Карточка товара, где кроме названия и цены есть только скопированное описание производителя. Такие страницы поиск считает не добавляющими ценности.
- Шаблонная генерация. Сотни страниц, отличающихся подставленным словом — названием района, города, размера. Шаблон распознаётся, и раздел целиком получает низкую оценку.
- Содержимое доступно только скриптом. Текст подгружается после нажатия или прокрутки. Робот может не дождаться и обработать пустой документ.
- Страница дублирует другую. Одна из версий выбирается основной, остальные исключаются. Это штатное поведение, но выбор поисковика не всегда совпадает с вашим.
- Нет внутренних ссылок. Страница-сирота, доступная только по прямому адресу, получает минимальный приоритет: сайт сам сигнализирует, что она неважная.
- Слишком глубокая вложенность. Документ в пяти-шести кликах от главной обходится реже и позже.
Проверка на скрипты делается просто: отключите в браузере выполнение сценариев или посмотрите исходный код страницы, а не отрисованную версию. Если основного текста в исходном коде нет, это зона риска. То же самое проверяется инструментом просмотра страницы глазами робота в панели вебмастера.
Дубли и канонические адреса
Дубли — самая массовая причина исключений в коммерческих проектах. Один и тот же товар доступен по нескольким адресам, и поиск вынужден выбирать, какой из них считать основным.
| Источник дублей | Как выглядит | Решение |
|---|---|---|
| Слеш в конце адреса | Два варианта одного URL | Один формат, редирект со второго |
| Протокол и www | До четырёх версий сайта | Редирект на одну главную версию |
| Параметры сортировки и фильтров | Адреса с длинными хвостами | Канонический адрес, полезные фильтры — отдельными страницами |
| Метки рекламных кампаний | Адреса с параметрами отслеживания | Канонический адрес на чистую версию |
| Товар в нескольких категориях | Один товар по разным путям | Один постоянный адрес карточки |
| Пагинация | Страницы списка со второй по десятую | Не закрывать, а различать заголовки и описания |
| Версия для печати | Копия страницы по отдельному адресу | Запрет в robots или канонический адрес |
Про канонический адрес чаще всего ошибаются в двух местах. Первое: канонический тег указывает не на существующую страницу или на страницу, закрытую от индексации, — тогда сигнал игнорируется и поведение становится непредсказуемым. Второе: на всех страницах каталога прописан канонический адрес главной. Это встречается в шаблонах и приводит к тому, что весь каталог выпадает из поиска.
Отдельно про фильтры каталога. Комбинаций у фильтра тысячи, и открывать их все нельзя — робот утонет. Рабочий подход: определить два-три параметра, по которым люди реально ищут, и сделать по ним нормальные страницы со своими заголовками и текстами, а остальные комбинации свести к каноническому адресу категории.
Тему разбирал отдельно: «Самостоятельное SEO продвижение сайта».
Структура сайта и приоритет обхода
Робот не обходит сайт целиком за один заход, у него есть ограничения по объёму и частоте. На больших проектах это превращается в отдельную проблему: пока робот тратит запросы на служебные адреса и мусорные комбинации фильтров, нужные страницы ждут очереди неделями.
Признак нехватки ресурса обхода виден в отчётах: новые страницы попадают в поиск с задержкой в месяц и больше, а в списке обойдённых адресов преобладают технические URL. На маленьком сайте такой проблемы не бывает — там причина отсутствия страниц всегда в другом.
Что уменьшает бесполезный расход обхода: закрытие служебных разделов, устранение бесконечных цепочек редиректов, чистка битых ссылок, разумное обращение с фильтрами, актуальная карта сайта без исключённых адресов. Что увеличивает приоритет нужных страниц: перелинковка из разделов, ссылки с главной, небольшая глубина вложенности, регулярное обновление содержимого.
Правило вложенности простое: коммерчески важная страница должна достигаться за три клика от главной. Если до карточки товара нужно шесть переходов, дело не только в роботе — живой посетитель туда тоже не дойдёт, и это видно по статистике внутренних переходов.
Разбор одной страницы по шагам
Когда нужно понять, почему конкретный адрес не в поиске, порядок такой. Он занимает десять-пятнадцать минут и в большинстве случаев даёт ответ.
| Шаг | Что делаем | Признак проблемы |
|---|---|---|
| 1 | Проверяем адрес в панели вебмастера | Статус «исключена» с указанной причиной |
| 2 | Смотрим код ответа сервера | Не 200, редирект, ошибка |
| 3 | Читаем robots.txt и мета-теги | Запрет, noindex, X-Robots-Tag |
| 4 | Проверяем канонический адрес | Указывает на другую страницу |
| 5 | Открываем исходный код | Основного текста нет без скриптов |
| 6 | Ищем внутренние ссылки на адрес | Ни одной, страница-сирота |
| 7 | Сравниваем с похожими страницами сайта | Текст совпадает почти полностью |
| 8 | Проверяем наличие в карте сайта | Адреса нет или карта устарела |
Если нужна помощь по теме — разработка сайта под ключ.
Если все восемь шагов пройдены и проблем не найдено, остаётся два варианта. Либо страница новая и ещё в очереди — тогда нужно подождать и отправить адрес на переобход вручную. Либо документ признан малополезным, и лечится это только содержимым: добавлением информации, которой нет у похожих страниц.
Смежный материал по теме — «Оптимизация сайта под мобильные устройства».
Как ускорить попадание в индекс
- Ручная отправка адресов. В панели вебмастера есть инструмент переобхода с суточным лимитом. Для десятка важных страниц это самый быстрый способ.
- Актуальная карта сайта. Она должна обновляться автоматически при добавлении страниц и не содержать закрытых и битых адресов.
- Ссылки из уже проиндексированных разделов. Новая страница, на которую ведёт ссылка с посещаемой категории, обнаруживается быстрее.
- Уведомление об изменениях. Протоколы быстрого оповещения поисковых систем о новых и обновлённых адресах ускоряют обнаружение до часов.
- Обновление даты изменения. При правках содержимого дата модификации должна меняться, иначе робот считает страницу неизменной и откладывает повторный обход.
- Внешние упоминания. Ссылка с живого стороннего ресурса ускоряет обнаружение независимо от всего остального.
Чего делать не нужно: массово отправлять на переобход весь сайт, надеясь ускорить процесс. Лимит расходуется, приоритет от этого не растёт, а реальная причина исключения остаётся неустранённой. Инструмент переобхода работает как ускорение для уже пригодных страниц, а не как способ протолкнуть в индекс то, что поиск отклонил по существу.
Ошибки, из-за которых всё ломается заново
Индексация — не разовая задача. Чаще всего она рушится не сама по себе, а после действий на сайте, последствия которых никто не проверил.
- Переезд без карты соответствий. Смена движка или структуры адресов без постраничных редиректов обнуляет накопленную историю.
- Обновление шаблона. Новая версия темы приносит с собой канонические теги или запреты, которых раньше не было.
- Массовые правки через базу. Изменение содержимого без обновления даты модификации приводит к тому, что робот долго не замечает правок.
- Отключение старых разделов. Удалённые страницы, отдающие 404 без редиректа, тянут за собой битые внутренние ссылки.
- Установка плагинов. Модули кэширования и оптимизации нередко меняют заголовки ответа сервера и правила в robots.txt.
- Смена хостинга. Другое время ответа и другие настройки сервера меняют поведение робота, иногда резко.
Отсюда практическое правило: после любого крупного изменения на сайте проверяйте индексацию через неделю и через месяц. Достаточно посмотреть число страниц в поиске и список исключённых по причинам. Пятиминутная проверка ловит проблему, которая иначе обнаружится через квартал по упавшему трафику.
Частые вопросы
Сколько времени нужно ждать новую страницу? От нескольких часов до нескольких недель, в зависимости от размера сайта, частоты обновлений и авторитета домена. Для нового сайта нормально ждать неделями. Если прошёл месяц, а страница не появилась и не значится исключённой, нужно разбираться.
Закрывать ли страницы пагинации от индексации? Обычно нет. Через них робот добирается до товаров, и закрытие ухудшает обход каталога. Правильнее различать заголовки и описания страниц списка и не допускать полного совпадения содержимого.
Почему в индексе страниц больше, чем на сайте? Как правило, из-за дублей, генерируемых параметрами, версиями для печати или старой структурой адресов. Лишние адреса расходуют ресурс обхода, поэтому разбирать их стоит даже без видимого вреда для трафика.
Помогает ли частое обновление текстов? Помогает, когда обновление содержательное: добавились данные, ответы, разделы. Косметическая перестановка слов ради даты изменения эффекта не даёт, а на больших сайтах ещё и расходует обход впустую.
Что делать, если исключены сотни карточек как малополезные? Не бросаться дописывать всё подряд. Возьмите группу товаров, дающую основную выручку, доведите карточки до состояния, где есть уникальное описание, характеристики, фотографии и ответы на частые вопросы, и посмотрите на реакцию через месяц. Дальше масштабируйте подход на остальной ассортимент.
Может ли сайт выпасть из индекса целиком? Может — при санкциях, при массовом техническом сбое, при ошибочном запрете в robots.txt на весь сайт. Первым делом проверяют панель вебмастера на сообщения о нарушениях и файл robots.txt, дальше коды ответа сервера.
Коротко
- Путь страницы в поиск состоит из обнаружения, сканирования и включения в базу; сбой на каждом этапе выглядит одинаково, но лечится по-разному.
- Диагностика начинается с чисел: сколько страниц должно быть в индексе против того, сколько там есть, и разбор исключённых по причинам.
- Быстрые технические причины — запрет в robots.txt, noindex, ошибки сервера, цепочки редиректов и оставшийся с разработки пароль.
- Если робот заходит, но не индексирует, причина в содержимом: копипаст, шаблонная генерация, текст только через скрипты, страница-сирота.
- Дубли и неверные канонические адреса — самая массовая причина исключений в каталогах; фильтры открывают выборочно, а не все подряд.
- Индексация ломается после переездов, обновлений шаблона и массовых правок, поэтому её проверяют через неделю и через месяц после любых изменений.
Если число страниц в поиске заметно меньше, чем должно быть, и непонятно, где именно рвётся цепочка, приходите на SEO-консультацию — пройдём по панели вебмастера вместе и определим, что закрывает ваши страницы от поиска.
Увеличьте позиции и продажи вашего сайта
Профессиональное SEO-продвижение с гарантией результата. Выберите подходящую услугу:
Остались вопросы по продвижению?
Меня зовут Анатолий Кузнецов, я SEO-оптимизатор с 20-летним стажем. Разберу ваш сайт, отвечу на вопросы и подскажу, что улучшить для роста позиций в Яндексе и Google.
Связаться со мной →
Комментарии
Дмитрий Овчинников
Интернет-магазин, примерно двенадцать тысяч товаров, в поиске около трёх тысяч. Остальные висят как малополезные. Описания у нас от поставщика, переписать двенадцать тысяч карточек нереально ни силами, ни бюджетом. С чего вообще начинать в такой ситуации.
Анатолий Кузнецов автор
Переписывать всё и не нужно. Возьмите выгрузку продаж за год и посмотрите, какая доля ассортимента даёт основную выручку — обычно это несколько сотен позиций. Их доводите руками: своё описание, полные характеристики, свои фотографии, блок вопросов. Для остального работают групповые улучшения на уровне категории: нормальный текст категории, таблица сравнения товаров, отзывы, наличие и сроки поставки на карточке. И проверьте отдельно, не выпадают ли карточки из-за дублей по параметрам сортировки — иногда часть тех самых девяти тысяч исключена вовсе не за содержимое.
Алина Тихомирова
Проверила исходный код после статьи и обнаружила, что у нас весь текст услуг подгружается скриптом. Разработчик уверяет, что поисковики давно всё выполняют и проблемы нет. Кому верить.
Анатолий Кузнецов автор
Верить инструменту, а не аргументам. В панели вебмастера есть просмотр страницы глазами робота — откройте там свою страницу услуги и посмотрите, виден ли основной текст. Это займёт минуту и закроет спор. Разработчик отчасти прав: скрипты действительно обрабатываются, но с задержкой и не гарантированно, а на сайтах с большим числом страниц очередь на обработку может растянуться. Если текст в исходном коде отсутствует, самый надёжный путь — отдавать его сразу, а скриптом оставлять только интерактивные элементы вроде калькуляторов.
Вадим Погодин
Наткнулся ровно на описанную ловушку с переездом. Меняли CMS, редиректы сделали только для главных разделов, остальное отдало 404. Трафик просел за полтора месяца почти вдвое, восстанавливаем до сих пор.
Екатерина Лаврентьева
Вопрос по фильтрам. У нас каталог мебели, фильтров восемь штук, комбинаций получаются десятки тысяч. Сейчас все закрыты через robots. Правильно ли это или лучше канонические адреса?
Анатолий Кузнецов автор
Закрытие через robots и канонический адрес решают разные задачи, и в вашем случае нужны оба. Мусорные комбинации из нескольких фильтров сразу разумно не пускать вообще, чтобы не тратить обход. А по одиночным значениям, которые люди действительно ищут — материал, цвет, размер, — стоит сделать полноценные страницы со своим заголовком, описанием и текстом. Посмотрите частотность в Вордстате: если «диван угловой серый» спрашивают регулярно, это готовая посадочная страница, а не мусор. Обычно из восьми фильтров такими оказываются два-три.
Семён Раков
Про массовые правки через базу — больная тема. Обновили тексты на трёхстах страницах напрямую в базе, дату модификации не тронули. Робот не замечал изменений месяца два, пока не отправили вручную на переобход.
Марьяна Костенко
Не соглашусь насчёт пагинации. Мы закрыли страницы списка со второй и дальше, трафик не изменился совсем, зато исчезли жалобы на дубли в панели. Может, это зависит от размера каталога?
Глеб Ануфриев
Как определить, что проблема именно в ресурсе обхода, а не в чём-то ещё? У нас портал на сорок тысяч страниц, новое появляется в поиске неделями, но явных технических запретов не нашли.
Анатолий Кузнецов автор
Смотрите логи сервера за месяц с фильтром по роботам поисковых систем. Вас интересуют две вещи: сколько всего запросов приходится на сайт в сутки и как эти запросы распределены по разделам. Если половина обхода уходит на служебные адреса, параметры и страницы, которые вам вообще не нужны в поиске, — проблема именно в этом. Второй признак: свежесозданная страница, на которую вы поставили ссылку с главной, индексируется быстро, а такая же в глубине каталога — неделями. Тогда лечение идёт через чистку мусорных адресов и перелинковку, а не через отправку на переобход.
Валентина Шубина
Обнаружила у себя канонический тег на главную вообще на всех страницах сайта. Стоял с момента установки шаблона. В поиске была только главная, и я год думала, что дело в конкуренции.
Рустам Хабибуллин
Про коды 5xx под нагрузкой — узнал свою историю. Сайт работал нормально, а в отчёте об обходе четверть запросов с ошибкой. Оказалось, дешёвый тариф хостинга не выдерживал одновременных обращений робота.
Нелли Бурмистрова
Уточните момент про страницы-сироты. У нас есть посадочные под рекламу, на них специально нет ссылок из меню, чтобы не путать посетителей. Получается, они обречены не индексироваться?
Анатолий Кузнецов автор
Для рекламных посадочных это нормальная ситуация, и бороться с ней не нужно. Более того, такие страницы часто лучше вообще закрыть от индексации: они дублируют по смыслу ваши обычные страницы услуг и начинают конкурировать с ними в выдаче. Определитесь по каждой странице, для чего она нужна. Если только под трафик из рекламы — закрывайте мета-тегом noindex и не включайте в карту сайта. Если хотите, чтобы она собирала и поисковый трафик, вводите её в структуру: ссылка хотя бы из одного раздела и присутствие в карте. Промежуточное состояние, когда страница вроде открыта, но её никто не находит, — самое бесполезное.
Кирилл Дементьев
Проверка через неделю и через месяц после изменений — простой совет, но работает. Ввели у себя как обязательный пункт после каждого релиза, за полгода поймали три случая, когда разработчики случайно возвращали noindex.
Ангелина Просвирнина
А как быть с карточками товаров, которых нет в наличии? Держать в индексе или убирать? У нас сезонный ассортимент, половина позиций доступна четыре месяца в году, и каждый раз непонятно, что с ними делать.