
Индексация сайта от А до Я упирается в три инструмента — robots.txt, sitemap.xml и управление краулинговым бюджетом, — и почти все ошибки владельцев растут из того, что эти инструменты путают между собой. Файл robots.txt пытаются использовать как способ убрать страницу из поиска, карту сайта считают гарантией индексации, а краулинговый бюджет вспоминают только когда каталог перестаёт обновляться в выдаче. Между тем каждый из них решает свою узкую задачу, и знание границ экономит месяцы. Ниже — как устроен путь страницы от обхода до появления в поиске, чем управляется каждый этап и что проверять, когда страницы не индексируются.
Краулинг и индексация — разные этапы
Путь страницы в поиск состоит из двух последовательных процессов, и путать их нельзя.
Краулинг — обход. Робот приходит по ссылке или из карты сайта, запрашивает адрес, получает код ответа и содержимое. На этом этапе решается только один вопрос: доступна страница или нет.
Индексация — включение в базу. Система разбирает полученное содержимое, определяет тему, сравнивает с уже известными страницами и решает, добавлять ли адрес в поисковую базу. Здесь оцениваются полнота, уникальность, польза, дублирование.
Ключевой вывод, который снимает половину вопросов: обход не равен индексации. Робот может приходить на страницу неделями и не добавлять её в поиск — потому что она дублирует другую, потому что содержимое не несёт самостоятельной ценности, потому что раздел в целом оценивается низко. И наоборот: страница может попасть в поиск, не будучи упомянутой в карте сайта, — если на неё есть ссылки.
Отсюда правило диагностики. Когда страница не в поиске, сначала выясняется, доходил ли до неё робот. В панели вебмастера это видно по статусу конкретного адреса. Если не доходил — проблема в доступности и связях. Если доходил и не добавил — проблема в содержании или дублировании. Это две разные задачи с разными решениями, и лечить их одинаково бессмысленно.
robots.txt: что он умеет и чего не умеет
Текстовый файл в корне сайта, доступный по адресу вашсайт.ру/robots.txt. Он управляет обходом, а не индексацией, и это главное, что нужно про него понимать.
Базовый набор директив невелик:
Тему разбирал отдельно: «Краулинговый бюджет: что это и почему Яндекс не обходит половину вашего сайта».
- User-agent — для какого робота действует блок правил.
- Disallow — какие разделы не обходить.
- Allow — исключение из запрета, разрешающее конкретный подраздел внутри закрытого.
- Sitemap — где лежит карта сайта. Указывается полным адресом.
- Clean-param — какие параметры в адресе не влияют на содержимое и должны игнорироваться. Инструмент, который недоиспользуют, хотя он экономит бюджет обхода лучше многих других.
Чего файл не делает: он не убирает страницу из поиска. Если адрес уже в индексе или на него ведут ссылки, закрытие в robots.txt может привести к тому, что страница останется в выдаче, но без описания — робот не сможет её обойти и обновить сведения. Для удаления из поиска нужен мета-тег запрета индексации на самой странице, а страница для этого должна быть доступна роботу. То есть закрывать её в robots.txt в этот момент как раз нельзя.
Помогу с продвижением: раскрутка сайта белыми методами — вывожу сайты в топ Яндекса белыми методами.
Что закрывают в robots.txt обоснованно: административную часть, служебные каталоги движка, страницы поиска по сайту, корзину и оформление заказа, сравнение товаров, сортировки и виды отображения, печатные версии, страницы с параметрами отслеживания рекламных кампаний.
Типовые ошибки: строка полного запрета, оставшаяся с тестового сервера; закрытие каталогов со стилями и скриптами, из-за чего система видит страницу сломанной; закрытие разделов «на всякий случай» вместе с посадочными страницами; отсутствие указания на карту сайта; копирование чужого файла целиком без проверки, какие у вас вообще есть каталоги.
Способы закрыть страницу и когда какой применять
| Способ | Что делает | Когда применять |
|---|---|---|
| Disallow в robots.txt | Запрещает обход, экономит бюджет | Служебные разделы, которых не должно быть в поиске изначально |
| Мета-тег noindex | Запрещает включение в поиск, обход разрешён | Убрать из выдачи уже проиндексированную страницу |
| Канонический адрес | Указывает, какая версия основная | Страницы с параметрами, пагинация, дубли по категориям |
| Clean-param | Игнорирует незначимые параметры адреса | Метки кампаний, идентификаторы сессий, сортировки |
| Код 410 | Сообщает, что страница удалена намеренно | Окончательно убранные разделы без замены |
| Постоянный редирект | Передаёт вес на новый адрес | Переезд, объединение, устаревшие материалы с аналогом |
Самая частая ошибка выбора — попытка убрать страницу из поиска через robots.txt. Порядок правильный такой: ставим мета-тег запрета, дожидаемся, пока робот обойдёт страницу и уберёт её из базы, и только потом при желании закрываем адрес от обхода, чтобы не тратить бюджет.
sitemap.xml: как собрать карту, которой доверяют
Карта сайта — это список адресов, которые вы считаете достойными поиска, с датами их последнего изменения. Она не гарантирует индексацию, но ускоряет обнаружение новых и обновлённых страниц, а на крупных сайтах ещё и помогает роботу не пропустить разделы со слабой перелинковкой.
Требования к рабочей карте:
Смежный материал по теме — «Краулинговый бюджет сайта: что это такое и как его оптимизировать».
- Только индексируемые адреса. Никаких страниц, закрытых мета-тегом, отдающих редирект или ошибку. Карта с мусором обучает систему не доверять вашим подсказкам.
- Только канонические версии. Один адрес на одну страницу.
- Честные даты изменения. Если движок ставит текущую дату всем адресам при каждой пересборке, значение теряет смысл и перестаёт учитываться.
- Автоматическое обновление. Новая страница должна появляться в карте сама, без ручного вмешательства.
- Разделение на файлы для крупных сайтов. Ограничение на один файл — пятьдесят тысяч адресов и определённый объём; при превышении делается индексный файл, ссылающийся на несколько карт. Разделять удобно по типам: категории, карточки, статьи.
- Указание в robots.txt и подтверждение в панели вебмастера. Оба способа сразу.
Отдельно полезны специализированные карты: для изображений, для видео, для новостных материалов. Их имеет смысл делать, если соответствующий тип содержимого приносит трафик.
Практическая проверка карты занимает десять минут: откройте её, возьмите десять случайных адресов и проверьте, что каждый открывается с нормальным кодом ответа и не перенаправляет никуда. Если хотя бы два из десяти не проходят проверку, карту нужно пересобирать.
Краулинговый бюджет: на что робот тратит время
Краулинговый бюджет — не мистическая величина, а простое следствие ограниченности ресурсов: робот тратит на ваш сайт конечное количество запросов за период. Для сайта на сто страниц это неважно. Для каталога на сто тысяч адресов это определяет, попадут ли новые товары в поиск за неделю или за квартал.
Куда бюджет утекает чаще всего:
- Комбинации фильтров. Каждое сочетание цвета, размера, бренда и цены порождает адрес. Десять фильтров дают тысячи страниц, из которых спрос есть у единиц.
- Сортировки и виды отображения. Один и тот же список товаров в шести вариантах порядка.
- Календари и архивы. Особенно календари событий, которые генерируют страницы на годы вперёд.
- Параметры отслеживания. Метки рекламных кампаний, идентификаторы партнёров, ссылки из рассылок.
- Цепочки редиректов. Каждое звено — отдельный запрос.
- Страницы с ошибками. Робот регулярно перепроверяет адреса, отдающие 404, и это тоже расход.
- Медленный ответ сервера. Чем дольше сервер отвечает, тем меньше страниц робот успевает обойти.
Как экономить: закрывать сортировки и служебные комбинации, использовать Clean-param для незначимых параметров, сокращать цепочки редиректов до одного перехода, ускорять ответ сервера, следить за глубиной вложенности — страницы дальше третьего-четвёртого клика от главной обходятся заметно реже.
Проверить расход можно двумя способами. Первый — раздел статистики обхода в панели вебмастера: там видно, сколько страниц робот загружает в день и какие коды ответов получает. Второй, точнее, — логи сервера: в них видно, по каким именно адресам ходит робот. Если половина запросов приходится на страницы фильтров, вы знаете, где проблема.
Дубли: главный пожиратель индекса
Дубли одновременно тратят бюджет обхода и мешают индексации: система тратит ресурсы на разбор одинакового содержимого и выбирает из нескольких вариантов один, причём не всегда тот, который нужен вам.
Если нужны детали, смотрите «Проверка карты сайта: ошибки sitemap, из-за которых страницы не попадают в индекс».
- Технические дубли адресов. С www и без, по http и https, со слэшем на конце и без, с заглавными буквами и без. Решение — выбрать один вариант и поставить постоянные редиректы со всех остальных.
- Дубли по параметрам. Решаются каноническим адресом и директивой Clean-param.
- Один товар в нескольких категориях. Либо один адрес независимо от категории, либо канонический указатель на основную версию.
- Пагинация. Страницы списка со второй по последнюю не должны конкурировать с первой: у них свои заголовки и канонический указатель на себя, но продвигается первая.
- Дубли содержания без дублей адресов. Разные страницы с одинаковым текстом — например, карточки, отличающиеся только размером. Здесь помогает перенос смысловой нагрузки на категорию и различие в характеристиках.
- Версии для печати и мобильные поддомены. Наследие старых движков, которое до сих пор встречается.
Диагностика: что смотреть и в каком порядке
| Симптом | Где смотреть | Вероятная причина |
|---|---|---|
| Страниц в поиске в разы меньше, чем на сайте | Раздел индексирования, причины исключения | Запреты, дубли, низкая оценка содержания |
| Страниц в поиске больше, чем нужно | Список проиндексированных адресов | Фильтры, параметры, мусорные адреса |
| Новые страницы не появляются неделями | Статистика обхода, карта сайта | Исчерпан бюджет, страница не связана ссылками |
| Страница обходится, но не индексируется | Проверка конкретного адреса | Дубль или недостаточная ценность содержания |
| Страница выпала после долгого присутствия | История статуса адреса | Изменение содержания, появление дубля, переоценка раздела |
| Робот получает ошибки | Статистика обхода по кодам ответов | Проблемы сервера, битые ссылки, ограничение по частоте запросов |
Порядок действий при любом из симптомов один: сначала проверяем доступность конкретного адреса, потом наличие запретов, потом дубли, и только в последнюю очередь беремся за содержание. Обратный порядок приводит к тому, что переписанный текст лежит на странице, закрытой от обхода.
Как ускорить попадание страниц в поиск
- Отправка на переобход вручную. В панели вебмастера есть инструмент для ускоренной проверки конкретных адресов с дневным лимитом. Используйте его для важных новых и изменённых страниц, а не для всего подряд.
- Внутренние ссылки. Новая страница, на которую ведут ссылки с часто обходимых разделов, попадает в поиск быстрее, чем сирота из карты сайта.
- Обновление карты сайта. С честной датой изменения — это сигнал, что содержимое стоит перепроверить.
- Уменьшение вложенности. Важные разделы не должны быть глубже трёх кликов от главной.
- Ускорение сервера. Прямо увеличивает количество страниц, которые робот успевает обойти.
- Внешние ссылки на новый раздел. Даже одна ссылка с регулярно обходимого сайта ускоряет обнаружение.
Частые вопросы
Почему страница обходится роботом, но не появляется в поиске? Три основные причины. Первая — система считает её дублем другой страницы: проверьте, нет ли похожего содержимого на соседних адресах и правильно ли расставлены канонические указатели. Вторая — содержание оценивается как недостаточно ценное: это типично для страниц из нескольких предложений, для карточек без характеристик и для теговых страниц, собранных автоматически. Третья — низкая общая оценка раздела: если вокруг сотни пустых страниц, новая хорошая может не пройти отбор. Первое, что стоит сделать, — посмотреть точную причину исключения в панели вебмастера, она указывается словами.
Нужен ли sitemap.xml, если сайт маленький и хорошо перелинкован? На сайте из тридцати страниц с нормальным меню карта почти ничего не меняет — робот и так всё найдёт. Но делать её стоит: она бесплатна, собирается движком автоматически и становится полезной ровно в тот момент, когда сайт вырастет или появится раздел со слабыми связями. Плюс она даёт вам самим удобный способ проверить, какие адреса вы считаете нужными.
Сколько времени проходит от публикации до появления в поиске? От нескольких часов до нескольких недель. Скорость зависит от того, как часто робот обходит ваш сайт, а это, в свою очередь, зависит от регулярности обновлений и общей оценки ресурса. На активно обновляемом сайте новые материалы попадают в поиск за день-два, на редко обновляемом — за две-четыре недели. Ускорить можно отправкой на переобход и ссылками с часто посещаемых роботом страниц.
Что делать, если в поиск попало много мусорных адресов? Не спешить закрывать всё в robots.txt — это оставит их в выдаче без описания. Порядок такой: определить типы мусора, для каждого выбрать инструмент из таблицы выше, проставить мета-теги запрета или канонические указатели, дождаться переобхода и исчезновения адресов из поиска, и только после этого закрыть их от обхода для экономии бюджета. Процесс занимает от нескольких недель до пары месяцев на крупном сайте.
Влияет ли количество страниц в индексе на позиции? Само по себе количество ничего не значит, значение имеет соотношение полезных и бесполезных. Сайт из двухсот содержательных страниц ранжируется лучше сайта из двадцати тысяч, где девятнадцать тысяч — комбинации фильтров. Раздувание индекса мусором ухудшает общую оценку и одновременно не даёт роботу дойти до того, что действительно важно.
Можно ли управлять частотой обхода? Косвенно. Прямой настройки скорости в панели вебмастера может не быть или она ограничена, но на частоту влияет несколько вещей: регулярность обновления содержимого, скорость ответа сервера, отсутствие ошибок, объём внешних ссылок. Если робот ходит слишком часто и нагружает сервер, правильнее не ограничивать его, а разобраться с производительностью — ограничение обхода почти всегда оборачивается медленной индексацией.
Коротко
- Обход и индексация — разные этапы: робот может приходить на страницу и не добавлять её в поиск.
- robots.txt управляет обходом, а не присутствием в выдаче; убрать страницу из поиска можно только мета-тегом запрета.
- Карта сайта ускоряет обнаружение, но не гарантирует индексацию, и мусор в ней подрывает доверие к вашим подсказкам.
- Краулинговый бюджет тратится в основном на фильтры, сортировки, параметры и цепочки редиректов.
- Дубли одновременно съедают бюджет обхода и мешают попаданию нужных страниц в поиск.
- Диагностика идёт строго по порядку: доступность, запреты, дубли и только потом содержание.
Если страницы не индексируются, а причина по отчётам не читается, приходите на SEO-консультацию: разберём статистику обхода, причины исключения и составим список правок в том порядке, в котором их надо внедрять.
Увеличьте позиции и продажи вашего сайта
Профессиональное SEO-продвижение с гарантией результата. Выберите подходящую услугу:
Остались вопросы по продвижению?
Меня зовут Анатолий Кузнецов, я SEO-оптимизатор с 20-летним стажем. Разберу ваш сайт, отвечу на вопросы и подскажу, что улучшить для роста позиций в Яндексе и Google.
Связаться со мной →Комментарии
Порфирий Берендеев
Годами закрывал ненужное в robots.txt и не понимал, почему адреса продолжают висеть в выдаче без описания. Прочитал про порядок — сначала мета-тег, потом закрытие — и всё встало на места. Переделал, за месяц лишние страницы ушли.
Мамелфа Фаворовская
Про Clean-param мало кто пишет, а инструмент отличный. У нас в адресах болтались метки рассылок и партнёрские идентификаторы, робот честно обходил каждый вариант. После настройки статистика обхода изменилась в разы, новые товары стали появляться за пару дней.
Лариса Клеопина
Вопрос по фильтрам. Читаю, что часть комбинаций надо открывать. Но как определить, какие? У нас двенадцать параметров фильтрации, комбинаций десятки тысяч. Вручную это не проверить.
Анатолий Кузнецов автор
Вручную и не нужно, работайте от спроса, а не от комбинаций. Порядок такой. Возьмите список значений по каждому параметру и составьте формулировки вида «категория плюс значение»: «плитка керамогранит», «плитка для ванной», «плитка 60х60». Прогоните этот список через сервис подбора слов пакетно и оставьте всё, что имеет ненулевую частоту, — обычно это несколько десятков сочетаний, а не десятки тысяч. Дальше проверьте сочетания из двух параметров, но только для самых частотных значений: «керамогранит для ванной». Трёхпараметрические сочетания почти никогда не имеют спроса, и их открывать не надо. Получившийся список — это ваши будущие посадочные страницы: со своим заголовком, описанием и коротким текстом. Всё остальное закрывается каноническим указателем на категорию. Отдельно посмотрите отчёт по поисковым запросам в панели вебмастера — там могут обнаружиться сочетания, о которых вы не догадывались, и это самый надёжный источник.
Клим Брусилов
Наступили на грабли с датами в карте сайта. Движок при каждой пересборке ставил всем адресам текущую дату. Робот сначала честно перепроверял всё подряд, потом перестал обращать внимание на карту вообще. Починили генерацию — карта снова заработала как инструмент.
Ростислав Любомирский
По логам сервера подтверждаю. Пока не посмотрели логи, спорили гипотезами. Открыли — оказалось, шестьдесят процентов запросов робота уходило на страницы календаря событий, который генерировал адреса на пять лет вперёд. Никакая аналитика этого не показывала.
Горислава Павловцева
Не соглашусь про пагинацию. Мы поставили канонический указатель со всех страниц списка на первую, как советовали в старых статьях, и потеряли из индекса товары, которые были только на дальних страницах. Пришлось откатывать.
Анатолий Кузнецов автор
Вы описали ровно ту ошибку, из-за которой рекомендация в статье звучит иначе: каноническим указателем страниц списка должна быть сама страница, а не первая. Логика простая: вторая страница каталога — не дубль первой, на ней другие товары. Указывая канонический адрес на первую, вы сообщаете системе, что содержимое второй значения не имеет, и робот перестаёт по ней ходить. Дальше происходит то, что вы видели: карточки, доступные только со второй и последующих страниц, теряют входящие ссылки и выпадают. Что стоит сделать вместо этого. Первое: канонический указатель каждой страницы списка на себя. Второе: заголовки страниц списка различать добавлением номера, чтобы они не выглядели дублями. Третье, самое важное: обеспечить каждой карточке путь помимо пагинации — блоки похожих товаров, ссылки из подкатегорий, теговые страницы под реальный спрос. Тогда глубина каталога перестаёт быть проблемой.
Горислав Анцыферов
Добавлю по инструменту переобхода. Лимит в день небольшой, и его надо тратить с умом. Мы сначала загоняли туда всё подряд, потом стали отправлять только новые коммерческие страницы и те, где меняли содержание. Разница в скорости появления заметная.
Пелагея Осоргина
Вопрос по причинам исключения. У нас массово стоит «Недостаточно качественная страница». Это про тексты или про что-то ещё? Тексты у нас есть, по три-четыре тысячи знаков на карточку.
Анатолий Кузнецов автор
Эта формулировка почти никогда не про длину текста, и три тысячи знаков на карточке скорее насторожили бы меня в другую сторону. Проверьте по порядку. Первое: не являются ли эти тексты вариациями одного и того же — если описание генерируется подстановкой характеристик в шаблон, для системы это одна страница в сотне копий. Второе: есть ли на странице что-то помимо текста — цена, наличие, фотографии, характеристики, отзывы. Карточка без цены и наличия оценивается как незавершённая независимо от объёма описания. Третье: посмотрите на раздел целиком. Если в нём тысячи однотипных страниц и лишь десятки получают показы, система распространяет оценку на весь раздел. Четвёртое: проверьте, не отдаётся ли основное содержимое скриптом после загрузки — тогда робот может видеть пустую страницу. И самый практичный шаг: возьмите десять исключённых адресов, посмотрите их глазами робота через инструмент проверки в панели, и станет видно, что именно получает система.
Яромира Опочинина
Про глубину вложенности — недооценённый пункт. У нас карточки лежали на пятом уровне: главная, каталог, раздел, подраздел, подподраздел, товар. Перестроили меню и добавили ссылки с популярных категорий — обход этих страниц стал регулярным.
Изот Карабанов
История про закрытые стили и скрипты — про нас. Предыдущий подрядчик закрыл в robots.txt весь служебный каталог движка, а там лежали и стили. Мобильная версия для робота выглядела сломанной, и мы долго не понимали, почему проверка мобильной пригодности ругается, когда на телефоне всё нормально.
Чеслав Кравцевич
Вопрос по коду 410. Чем он реально лучше обычной 404, если страницу всё равно надо убрать? Или разницы никакой?
Анатолий Кузнецов автор
Разница в трактовке и в скорости. Код 404 означает «страница не найдена» — возможно, временно, возможно, из-за ошибки. Поэтому робот возвращается к такому адресу снова и снова в течение долгого времени, тратя бюджет обхода. Код 410 означает «страница удалена намеренно и не вернётся», и адрес исключается из базы быстрее, а перепроверяется реже. На небольшом сайте разница малозаметна. На каталоге, где регулярно снимаются с продажи тысячи позиций, она превращается в ощутимую экономию обхода. Практическая оговорка: применяйте 410 только к тому, что действительно не вернётся и не имеет замены. Если у снятого товара есть аналог — правильнее постоянный редирект на него, а если позиция сезонная и вернётся — карточку вообще не трогают, а меняют статус наличия.
Дарина Алабышева
Про соотношение полезных и бесполезных страниц — самая ценная мысль в статье. Мы гордились двадцатью тысячами страниц в индексе. Посмотрели, сколько из них получают хотя бы один показ в месяц — вышло около восьмисот. Начали чистку.
Анатолий Кузнецов автор
Соотношение восемьсот к двадцати тысячам типично для каталога с открытыми фильтрами, и чистку стоит вести аккуратно, чтобы не выбросить рабочее вместе с мусором. Порядок, который я советую. Первое: выгрузите за год, а не за месяц, все адреса, получавшие хотя бы один показ, — годовая выборка учитывает сезонность, и список окажется заметно больше восьмисот. Второе: отдельно выделите страницы, которые не получают показов, но нужны людям на сайте, — их не закрывают от поиска, а оставляют доступными, просто перестают считать посадочными. Третье: всё остальное разделите на типы и закрывайте типами, а не поштучно: сортировки, комбинации фильтров без спроса, страницы поиска по сайту, архивы по датам. Четвёртое: чистите партиями и замеряйте статистику обхода после каждой — вы должны увидеть, что робот стал больше времени тратить на нужные разделы. И зафиксируйте до начала цифры по индексации и показам, иначе через два месяца будет не с чем сравнить.
Отличный разбор от а до я. Иду проверять индексацию своего сайта по всем составляющим.
Добавлю: настройте протокол быстрого информирования об изменениях. Это ускоряет попадание новых страниц в индекс.
Спасибо. Забрала как чек-лист для проверки индексации своего сайта по всем пунктам.
Полезный гайд. Индексация — фундамент, без неё всё остальное SEO не имеет смысла.
После чистки robots и обновления sitemap мои страницы стали индексироваться заметно быстрее.
Подключите Вебмастер, отправляйте новые страницы на переобход, держите чистый sitemap — и индексация наладится.
Без нормальной индексации любой контент бесполезен: поиск его просто не видит. Базовая, но забываемая вещь.
А как ускорить индексацию новых страниц, чтобы они попадали в поиск за дни, а не за недели?
Владислав, ускоряют несколько вещей вместе. Добавьте новую страницу в sitemap и отправьте на переобход в Вебмастере вручную. Поставьте на неё внутренние ссылки с уже проиндексированных сильных страниц, чтобы робот быстрее дошёл. Настройте протокол быстрого информирования об изменениях, если движок это поддерживает. И держите сайт в целом здоровым: чем чище структура и меньше мусора, тем эффективнее робот тратит бюджет обхода на важное. Полностью убрать задержку нельзя, но связка sitemap плюс переобход плюс внутренние ссылки заметно сокращает срок до попадания в индекс.
Правильный sitemap только из важных страниц реально ускоряет индексацию. Проверено на своём сайте.
Спасибо за структурный разбор. По этой теме обычно куски, а тут всё от а до я в одном месте.
Краулинговый бюджет — то, что все игнорируют. А робот реально тратит его на мусор вместо важного.
А что делать, если страницы давно готовы, а в индекс так и не попадают? Куда копать в первую очередь?
Николай, если страницы готовы, а в индекс не попадают, проверяйте по порядку. Первое — robots.txt и мета-тег robots: не закрыта ли страница от индексации случайно. Второе — доступность: отвечает ли страница кодом 200, нет ли ошибок и лишних редиректов. Третье — есть ли на неё внутренние ссылки и в sitemap ли она, иначе робот может до неё не дойти. Четвёртое — качество: тонкий или дублирующий контент поиск может не брать в индекс. Отправьте страницу на переобход в Вебмастере. Идите от технических запретов к качеству, обычно причина в первых пунктах.
Прошлась по гайду и нашла, что sitemap у меня устаревший, а часть страниц закрыта в robots. Чиню.
Связка robots плюс sitemap плюс перелинковка решает половину проблем с индексацией. Хорошо, что вместе.
А с чего начать проверку индексации, если я вообще не уверена, что мой сайт нормально попадает в поиск?
Алина, начните с Вебмастера — это главный инструмент проверки индексации. Подключите сайт и посмотрите раздел со страницами в поиске: сколько всего в индексе и какие исключены. Там же видно причины исключения. Дальше проверьте robots.txt, что он не закрывает важное, и убедитесь, что sitemap актуален и содержит все нужные страницы. Грубая проверка: вбейте в поиск точную фразу с вашей страницы — если находится, значит, в индексе. Стартуйте с Вебмастера: он сразу показывает, что в индексе, что исключено и почему.
Наконец всё про индексацию в одном месте: robots, sitemap, краулинговый бюджет. Сохранил как справочник.