
В поисковый индекс попадает далеко не всё, что вы опубликовали, и именно отсюда Яндекс и Google берут страницы для выдачи. Если вашей страницы в этой базе нет, её не найдут ни по одному запросу — ни по названию компании, ни по точной фразе из текста. Ровно поэтому владелец сайта неделями смотрит в пустую статистику, хотя тексты написаны, дизайн заказан, а деньги за разработку заплачены.
Особенность здесь в том, что сайт при этом выглядит абсолютно рабочим. Страницы открываются, меню кликается, форма отправляет заявку. Просто поисковая система про эти страницы не знает или знает, но держит их в стороне от выдачи. Разница между «сайт существует» и «сайт в индексе» стоит бизнесу всего трафика — и увидеть её можно только в отчётах, а не глазами в браузере.
Что физически происходит с вашей страницей
Поисковая система не ищет по интернету в момент вашего запроса. Она ищет по своей заранее собранной базе. Путь страницы до этой базы состоит из трёх шагов, и застрять она может на любом.
Шаг первый — обход. Робот узнаёт адрес страницы: из карты сайта, из ссылки на другой странице, из внешней ссылки, из данных браузера. Приходит по адресу и скачивает код. Если сервер отдал ошибку, ответил слишком медленно или закрыл адрес в robots.txt, на этом всё заканчивается.
Шаг второй — обработка. Скачанный код разбирается: выделяется текст, заголовки, ссылки, разметка. Отдельно исполняется JavaScript, если содержимое подгружается скриптами. На этом шаге страница может потерять весь смысл: робот получил пустой каркас, а текст так и не подгрузился.
Шаг третий — включение в индекс. Разобранная страница оценивается: есть ли на ней уникальное содержание, не дублирует ли она соседнюю, отвечает ли она хоть на какой-то запрос. Именно здесь отсеивается большинство. Страницу скачали, разобрали и решили, что в базе ей делать нечего.
Из этой механики следует практический вывод: «страница не в поиске» — это не одна проблема, а минимум три разных, и лечатся они по-разному. Пока вы не знаете, на каком шаге застряло, любые действия — угадывание.
Как посмотреть, что у вас в индексе на самом деле
Есть три источника, и они отвечают на разные вопросы.
- Яндекс.Вебмастер, раздел «Индексирование → Страницы в поиске». Главный отчёт. Показывает точное число страниц в базе, историю изменений и — самое ценное — список исключённых с указанием причины по каждой. Ещё там есть выгрузка в файл: берите её, а не листайте экраны.
- Google Search Console, отчёт «Индексирование страниц». Та же логика: сколько проиндексировано, сколько отклонено и по какой причине. Отдельно проверяется конкретный адрес через инструмент проверки URL — он покажет, когда робот приходил последний раз и что решил.
- Оператор site: в поисковой строке. Быстрая прикидка, не более. Число он показывает округлённое и нестабильное, но чтобы за минуту понять «сайт вообще виден или ноль», подходит.
Порядок проверки простой. Сначала берёте реальное количество страниц сайта — из карты sitemap.xml или из обхода краулером. Потом сравниваете с числом в Вебмастере. Расхождение больше чем на десять-пятнадцать процентов означает, что часть сайта не работает на вас, и надо смотреть причины.
Почему страницы вылетают: реальные причины
Формулировки в отчётах поисковых систем звучат сухо, поэтому владельцы их пролистывают. А там прямым текстом написан диагноз.
| Причина в отчёте | Что произошло на самом деле | Что делать |
|---|---|---|
| Недостаточно качественная | Страница есть, но система не нашла на ней ничего, ради чего показывать её людям: пара строк текста, шаблонное описание, копия соседней карточки | Наполнить уникальным содержанием или объединить с похожей страницей через 301 |
| Дубль | Найдена страница с тем же содержанием: версия с параметром, копия с www, страница печати, второй адрес того же товара | Настроить canonical или склеить адреса редиректом |
| Запрещена в robots.txt | Правило закрывает раздел, часто вместе с нужными страницами — классика после переноса с тестового домена | Проверить файл строка за строкой в инструменте проверки Вебмастера |
| Ошибка HTTP | В момент прихода робота сервер отдал 5xx или не ответил вовсе | Смотреть логи сервера за дату обхода, разбираться с хостингом |
| Редирект | Адрес переадресует на другой — сам он в индекс не попадёт, и это нормально, если так задумано | Проверить, что редирект ведёт куда надо и без цепочки |
| Не canonical | Страница сама указала другой адрес как основной, иногда по ошибке плагина | Проверить тег canonical в коде каждого типа страниц |
Самая частая находка в этом отчёте у магазинов — «недостаточно качественная» на карточках товара. Причина обычно одна: описание взято из прайса поставщика и совпадает у сорока сайтов. Робот скачал, сравнил, увидел копию и не стал добавлять сорок первую.
Подробнее об этом — в статье «Индекс скорости загрузки страницы».
Robots.txt, noindex и canonical — три разных инструмента
Их путают чаще всего, и путаница стоит страниц.
Помогу с продвижением: вывести сайт в топ Яндекса — вывожу сайты в топ Яндекса белыми методами.
Robots.txt запрещает заходить. Робот не скачивает страницу и не видит, что на ней. Важный нюанс: закрытая в robots.txt страница может всё равно оказаться в выдаче — по внешним ссылкам, с пустым сниппетом. Поэтому убрать страницу из индекса через robots.txt нельзя, это распространённое заблуждение.
Мета-тег noindex разрешает зайти и запрещает добавлять в базу. Правильный инструмент для удаления страницы из индекса. Но чтобы он сработал, робот обязан страницу скачать — значит, она не должна быть закрыта в robots.txt одновременно. Двойной запрет работает не как усиление, а как отмена: робот не пришёл, тег не прочитал, страница висит в индексе дальше.
Canonical ничего не запрещает. Он говорит: «эта страница — вариант вот той, считайте главной ту». Для дублей и версий с параметрами это правильный ход, для мусорных страниц — нет.
Проверять эти три вещи надо не по документации CMS, а по коду живой страницы. Открываете исходный код в браузере, ищете robots в мета-тегах и canonical в head. Плагины любят проставлять noindex на категориях блога «для порядка», а владелец узнаёт об этом через полгода.
Сколько ждать и от чего это зависит
Точных сроков нет ни у кого, но диапазоны предсказуемые. Новая страница на живом сайте, где робот бывает ежедневно, попадает в базу за срок от суток до полутора-двух недель. Страница на новом домене без ссылок — от нескольких недель до пары месяцев. Разница не в качестве текста, а в том, как часто робот к вам приходит.
Частота обхода зависит от трёх вещей: как часто на сайте появляется новое, насколько быстро отвечает сервер и сколько внешних ссылок ведёт на сайт. Именно поэтому магазин, который каждый день добавляет товары, индексируется быстрее сайта услуг из пяти страниц, не менявшихся с запуска.
Отдельная беда — когда роботу физически не хватает ресурса обойти сайт. Он тратит проходы на страницы фильтров, сортировок и пагинации, а до карточек товара не доходит. У крупных каталогов так теряется половина ассортимента, и никакие тексты не помогут, пока не разобраны настройки обхода.
Тему разбирал отдельно: «Поисковый трафик — что это и как его привлечь».
Уникальность содержания — главный фильтр на третьем шаге
Когда техника в порядке, а страницы всё равно не берут в базу, причина почти всегда в содержании. И речь не про «уникальность текста» в понимании антиплагиата: можно переставить слова так, что любая проверка покажет сто процентов, а поисковая система всё равно увидит копию по смыслу.
Система сравнивает страницы не побуквенно. Она смотрит, о чём страница, какие сущности на ней упоминаются, какие вопросы закрывает. Если по всем этим признакам ваша страница совпадает с двадцатью другими, она не добавляет ничего к базе — и её не берут. Отсюда практическое правило: страница должна содержать хотя бы один блок информации, которого нет у соседей по выдаче.
Что обычно становится таким блоком у обычного бизнеса:
- Реальные условия работы: сроки, география выезда, что входит в цену и что не входит.
- Ответы на вопросы, которые вам задают по телефону каждую неделю — их никто, кроме вас, не знает.
- Ограничения и отказы: в каких случаях услуга не подойдёт. Такого текста почти нигде нет, а читают его внимательно.
- Собственные фотографии работ, таблицы параметров, схемы подбора, расчёты стоимости по вариантам.
- Сравнение вариантов между собой, а не просто перечисление того, что вы делаете.
Проверить себя просто: откройте пять сайтов из первой десятки по вашему запросу и выпишите, что есть у них. Если на вашей странице всё то же самое и ничего сверх — вы сорок первый в очереди на то же место, и система это видит быстрее, чем вы.
Как ускорить попадание в индекс
Способы отличаются по силе и по трудозатратам. Порядок в таблице — от быстрых к долгим.
| Способ | Сколько занимает | Насколько помогает |
|---|---|---|
| Отправка адреса в «Переобход страниц» Вебмастера | Минута на страницу, есть суточный лимит | Сильно для отдельных важных страниц, робот приходит обычно в течение суток |
| Подключение IndexNow | Разово, час работы программиста | Сильно: сайт сам сообщает об изменениях, не дожидаясь планового обхода |
| Актуальная карта sitemap.xml | Разово, обычно даёт CMS | Средне: помогает найти адреса, но не заставляет их индексировать |
| Внутренние ссылки на новую страницу | Полчаса на страницу | Сильно: страница без входящих ссылок для робота почти не существует |
| Ускорение ответа сервера | От дня до недели | Средне на дистанции: робот берёт больше страниц за визит |
| Внешние упоминания сайта | Постоянная работа | Сильно для новых доменов, слабо для старых |
Что не работает вообще: сервисы «прогона по каталогам», массовая отправка адресов в сомнительные системы и покупка «ускоренной индексации» у случайных исполнителей. Робот приходит по тем же правилам, а вы получаете ссылки с мусорных площадок.
Когда страницы из индекса надо убирать самому
Если нужна помощь по теме — заказать сайт.
Большой индекс — не самоцель. Тысяча страниц, из которых восемьсот пустые, работает хуже, чем двести живых: система оценивает сайт целиком, и балласт тянет вниз общее впечатление о качестве.
- Технические адреса: корзина, личный кабинет, страницы оформления заказа, результаты внутреннего поиска.
- Пустые категории каталога, где нет ни одного товара.
- Теги и метки блога, если они дублируют рубрики и никто ими не пользуется.
- Страницы с параметрами сортировки и постраничной навигации, если они не несут отдельного смысла.
- Старые акции и товары, снятые с продажи навсегда — их лучше склеить с актуальными разделами.
Порядок действий: закрываете мета-тегом noindex, ждёте, пока робот зайдёт и увидит, и только потом при желании закрываете в robots.txt, чтобы не тратить обход. Обратная последовательность — самая частая ошибка, страница остаётся в базе навсегда.
Смежный материал по теме — «Инвертированный индекс и шардирование: что физически происходит с вашей страницей после краула, и почему «переиндексация» — это не то, что вы думаете».
Что делать, если страниц в поиске стало резко меньше
Резкое падение числа проиндексированных страниц почти всегда техническое, а не алгоритмическое. Проверять по порядку:
- Открыть robots.txt и сравнить с копией месячной давности. Обновление CMS или шаблона любит переписывать этот файл.
- Проверить мета-тег robots на нескольких типовых страницах — не появился ли noindex после обновления плагина.
- Посмотреть в Вебмастере статистику ответов сервера за период падения: серия 5xx означает, что робот приходил в моменты, когда сайт лежал.
- Проверить, не сменился ли canonical: иногда после переезда весь сайт начинает указывать на главную.
- Убедиться, что сертификат не просрочен и https-версия открывается без предупреждений.
Четыре из пяти случаев закрываются на первых трёх пунктах. Если техника чистая, а страницы всё равно уходят с формулировкой о качестве — это уже разговор о содержании, и он длиннее. Быстро увидеть техническую картину помогает бесплатный аудит: он проверяет коды ответов, доступность и базовые запреты индексации.
Частые вопросы
Сайт в индексе, но по запросам его нет. Это нормально? Да, это две разные вещи. Индекс — условие показа, а не гарантия позиции. Страница в базе конкурирует с сотнями других, и если она слабее по содержанию, ссылкам и поведению людей, её просто не покажут выше десятой страницы.
Почему в Яндексе 300 страниц, а в Google 900? Разные правила отбора. Google охотнее берёт в базу технические и слабые адреса, Яндекс жёстче фильтрует по качеству. Сравнивать числа между системами бессмысленно, сравнивайте каждую с реальным количеством страниц сайта.
Помогает ли частое обновление текста удержаться в индексе? Помогает содержательное обновление: новые данные, новые разделы, ответы на новые вопросы. Перестановка слов и смена даты в заголовке не помогает — система сравнивает содержание, а не факт правки.
Нужно ли отправлять на переобход все страницы после доработок? Нет, лимит быстро закончится. Отправляйте те, где изменения принципиальные: главную, страницы услуг, разделы каталога. Остальное робот подхватит сам, если сайт живой.
Страница закрыта в robots.txt, а в выдаче висит. Как убрать? Открыть её в robots.txt, поставить мета-тег noindex, отправить на переобход. Когда робот зайдёт, прочитает запрет и уберёт из базы, можно снова закрывать в robots.txt.
Правда ли, что сайт можно вывести в топ без вложений в контекст? Правда, и это обычный сценарий для среднего бизнеса — но требует времени и системной работы, а не разовой оптимизации. Про то, как это устроено, я писал отдельно: бюджет здесь не главный фактор.
Разбор индексации удобнее смотреть на живых отчётах, чем читать описание. В коротком видео ниже я показываю логику проверки по шагам — от карты сайта до причин исключения в Вебмастере.
Коротко
- Индекс — база, из которой формируется выдача. Нет страницы в базе — нет её в поиске ни по одному запросу.
- Путь страницы состоит из обхода, обработки и включения в базу; застревать она может на любом из трёх шагов, и лечение у каждого своё.
- Точную картину даёт отчёт «Страницы в поиске» в Вебмастере и «Индексирование страниц» в Search Console, а не оператор site:.
- Robots.txt запрещает заходить, noindex запрещает добавлять в базу, canonical указывает главную версию — это три разных инструмента, и одновременный запрет двумя способами не работает.
- Ускоряют индексацию переобход в Вебмастере, IndexNow, внутренние ссылки и быстрый сервер; «прогоны по каталогам» не дают ничего.
- Резкое падение числа страниц в поиске почти всегда техническое: robots.txt, noindex после обновления, ошибки сервера или сбитый canonical.
Если по отчётам видно, что в индексе заметно меньше страниц, чем есть на сайте, а причины в списке исключённых непонятны — приходите на SEO-консультацию. Разберём отчёты вашего сайта, найдём, на каком шаге теряются страницы, и составим порядок действий под вашу CMS.
Увеличьте позиции и продажи вашего сайта
Профессиональное SEO-продвижение с гарантией результата. Выберите подходящую услугу:
Остались вопросы по продвижению?
Меня зовут Анатолий Кузнецов, я SEO-оптимизатор с 20-летним стажем. Разберу ваш сайт, отвечу на вопросы и подскажу, что улучшить для роста позиций в Яндексе и Google.
Связаться со мной →Комментарии
Игорь Обабков
В Вебмастере 1200 страниц исключено с формулировкой «недостаточно качественная», в поиске 340. Сайт — магазин запчастей, описания у товаров есть, взяты из каталога производителя. Получается, надо переписывать 1200 карточек руками? Это нереально.
Анатолий Кузнецов автор
Руками все 1200 переписывать не надо, и начинать с этого точно не стоит. Сначала выгрузите список исключённых в файл и посмотрите, какие это адреса: у магазинов запчастей половина обычно оказывается не карточками, а страницами фильтров по маркам и годам. С ними работа техническая, а не текстовая. По оставшимся карточкам сделайте выборку спроса через Вордстат: у части позиций запросов нет вообще, их достаточно оставить в каталоге и не тянуть в индекс. А вот те двести-триста, по которым люди реально ищут, стоит доработать — и не литературным текстом, а тем, чего нет в каталоге производителя: применимость к моделям, аналоги, отличия от соседней позиции, сроки поставки. Такая карточка перестаёт быть копией сорока других, и система это видит.
Светлана Оболенская
Сделали новый сайт вместо старого, адреса сохранили. Через две недели в Яндексе осталось 12 страниц из 80. Хостинг говорит, что всё в порядке.
Анатолий Кузнецов автор
Хостинг смотрит на доступность сайта сейчас, а робот приходил в момент переезда. Проверьте три вещи по порядку. Первое: откройте ваш robots.txt прямо в браузере — при разработке сайт обычно закрывают целиком, и снять запрет после переноса забывают чаще, чем можно представить. Второе: посмотрите исходный код любой внутренней страницы и найдите мета-тег robots, там мог остаться noindex от тестового окружения. Третье: в Вебмастере откройте статистику обхода за последние две недели и посмотрите коды ответов — если в дни переезда шли 5xx, робот выбросил страницы как недоступные, и они вернутся сами после переобхода. Двенадцать оставшихся страниц из восьмидесяти — характерная картина именно для запрета, а не для проблем с качеством.
Дмитрий Оборин
Не понял момент с robots.txt и noindex. Всегда думал, что чем больше запретов, тем надёжнее закрыто. Выходит, наоборот?
Анатолий Кузнецов автор
Именно наоборот, и это ловушка, на которой сидят очень многие сайты. Мета-тег noindex находится внутри страницы. Чтобы его прочитать, робот обязан страницу скачать. Если вы одновременно закрыли адрес в robots.txt, робот к нему не пойдёт и тега не увидит — значит, команда на удаление до него не дойдёт никогда. Страница при этом вполне может висеть в выдаче с пустым описанием, если на неё есть внешние ссылки. Правильная последовательность такая: сначала открываете адрес в robots.txt, ставите noindex, отправляете на переобход, дожидаетесь, пока страница пропадёт из отчёта, и только после этого при желании закрываете в robots.txt ради экономии обхода.
Наталья Образцова
Подскажите, а IndexNow реально что-то даёт или это очередная модная штука? Сайт на WordPress, обновляю блог два раза в неделю.
Анатолий Кузнецов автор
Даёт, и на вашем сценарии особенно заметно. Смысл в том, что обычно робот приходит по своему расписанию и о новой статье узнаёт с задержкой в несколько дней. С IndexNow сайт сам отправляет сигнал в момент публикации, и робот приходит в тот же день, часто в течение часа. Настраивается это на WordPress плагином за пятнадцать минут: генерируется ключ, кладётся файлом в корень сайта, дальше всё идёт автоматически. Важный нюанс: сигнал ускоряет визит робота, но не заставляет включить страницу в базу — если статья слабая, её всё равно отсеют на третьем шаге. Так что это ускоритель для нормального контента, а не способ протащить пустышку.
Роман Огнев
У меня в Google проиндексировано 4000 страниц, а сайт — визитка на 15 страниц. Откуда взялись остальные?
Алиса Одинокова
Отвечу как человек, который прошёл ровно это. У меня было то же самое на Битриксе: оказалось, что каждая страница доступна с десятком вариантов параметров в адресе, плюс версии для печати, плюс результаты внутреннего поиска попали в индекс через ссылки. Лечилось canonical и правилами в robots.txt для параметров.
Павел Ожегов
Как понять, что робот вообще заходил на конкретную страницу? В Вебмастере вижу общие цифры, а нужно по одному адресу.
Анатолий Кузнецов автор
Есть три уровня точности. Самый простой — в Search Console инструмент проверки URL: вставляете адрес и видите дату последнего обхода, результат и причину решения. В Яндекс.Вебмастере похожее есть в разделе проверки статуса страницы. Второй уровень — раздел статистики обхода в Вебмастере: там список конкретных адресов, которые робот брал за период, с кодами ответов, и его можно выгрузить. Третий, самый честный — логи сервера. В них видно каждое обращение робота с точным временем, и именно там обнаруживаются вещи вроде «робот сорок раз за сутки скачивал страницу пагинации и ни разу не зашёл в карточки товара». Логи запрашиваются у хостинга, на большинстве тарифов они доступны за последние недели.
Виктор Озеров
Читал у одного специалиста, что оператор site: врёт и им пользоваться нельзя вообще. У вас он в списке инструментов. Кому верить?
Ксения Орловская
Вопрос про пагинацию. У меня блог, страницы вида /blog/page/2/, /page/3/ и так далее до 40. Их закрывать от индексации или пусть висят?
Артём Окладников
Сайт живёт четвёртый месяц, в индексе главная и ещё две страницы. Ссылок на сайт нет вообще, сайт новый. Это нормальный срок или уже пора паниковать?
Марина Оводова
Столкнулась с обратной проблемой: убрала товар с сайта, отдаёт 404, а он до сих пор в выдаче третий месяц и люди на него заходят. Переобход отправляла дважды.
Сергей Олейник
А есть смысл держать в индексе страницы с ценами, если цены меняются раз в месяц? Боюсь, что система будет считать их неактуальными и понижать.
Поисковые системы являются важным компонентом современного Интернета, и для их эффективного функционирования необходимы поисковые индексы.