
4812 обращений за месяц к адресу /?filter=color-red&sort=price — и шесть обращений к странице услуги, которая приносит компании основную выручку. Это не выдуманный пример: это первая строчка выгрузки логов интернет-магазина сантехники, который пришёл ко мне в марте с формулировкой «сайт не индексируется, наверное, фильтр».
Фильтра не было. Был робот, который честно и старательно ходил по сайту — просто не туда. Владелец полгода писал статьи, дорабатывал карточки, менял тексты на посадочных, а Яндекс всё это время скачивал одни и те же комбинации параметров сортировки. Новые страницы попадали в индекс через 40–60 дней. Некоторые не попадали вообще.
С тех пор я специально собираю такую статистику. К сегодняшнему дню у меня выгрузки логов и «Статистики обхода» по 40 проектам разного размера — от сайта-визитки на 30 страниц до каталога на 180 тысяч URL. Средняя доля обращений робота к страницам, которые вообще не должны существовать, — 68%. Медиана — 71%. Худший результат — 94%: сайт на 1200 товаров, где робот за месяц скачал 340 тысяч уникальных адресов.
Ниже — разбор, почему так происходит. Не «десять причин», а механика: что именно робот считает достойным обхода и почему ваша страница «Ремонт квартир под ключ» проигрывает в этой борьбе странице /?attachment_id=8842.
Краулинговый бюджет — это не лимит, это очередь
Самое вредное заблуждение, которое я слышу от клиентов: «нам выделили бюджет обхода в N страниц в сутки». Так это не работает. Никакой цифры вам никто не выделял.
Робот Яндекса каждый день формирует очередь адресов, которые он собирается скачать с вашего домена. Размер очереди зависит от того, насколько быстро отвечает ваш сервер и не начинает ли он «ложиться» под нагрузкой. А вот порядок в очереди — от того, насколько адрес выглядит перспективным. И вот здесь начинается интересное.
Робот не умеет читать смысл. Он не знает, что /uslugi/remont-kvartir/ — ваш хлеб, а /?utm_source=vk&utm_medium=cpc — след от рекламной кампании двухлетней давности. Он оперирует сигналами. Их немного, и они до обидного механические:
- Сколько внутренних ссылок ведёт на адрес. Не «сколько важных ссылок», а просто сколько. Фильтр в сайдбаре, повторённый на 5000 страницах каталога, генерирует 5000 ссылок на каждую комбинацию параметров. Ваша страница услуги получает три ссылки: из меню, из футера и из хлебных крошек.
- Как часто адрес менялся раньше. Робот запоминает историю. Страница, которая менялась при каждом визите, получает приоритет. Мусорные URL с параметрами часто отдают разный HTML при каждом обращении — из-за случайного порядка товаров, счётчиков просмотров, блока «недавно смотрели». Для робота это признак живой, обновляемой страницы.
- Насколько адрес похож на то, что уже есть в базе. Свежесозданный
/page/47/?replytocom=1289шаблонно похож на сотню уже известных роботу адресов той же формы — и наследует их приоритет. - Что сказано в sitemap.xml и когда адрес появился в очереди. Причём тег
<priority>робот, по моим наблюдениям, игнорирует полностью. Я лет пять назад ставил 1.0 на всех продающих страницах и 0.1 на архивах — на распределении обхода это не сказалось никак. А вот<lastmod>он читает и реагирует.
Сложите эти сигналы — и вы получите систему, в которой мусор побеждает по всем пунктам. Его больше, на него больше ссылок, он чаще «меняется». Приоритет ваших страниц упал не потому, что они плохие. Он упал потому, что их сигналы утонули в шуме.
Пять генераторов мусора, которые я нахожу почти на каждом сайте
За двадцать лет практики список сузился до пяти позиций. Проверьте свой сайт по ним — почти наверняка найдёте минимум два.
Первое — параметры фильтрации и сортировки. Классика. Если у вас пять фильтров по три значения плюс три варианта сортировки плюс пагинация, вы получаете комбинаторный взрыв: сотни тысяч уникальных адресов на каталог из тысячи товаров. Каждый из них отдаёт код 200 и почти одинаковый контент. Робот обязан их скачать — он же не знает заранее, что там дубль.
Второе — UTM-метки и идентификаторы сессий. Живут вечно. Вы отключили рекламную кампанию в 2023-м, а робот до сих пор ходит по адресам с её метками, потому что кто-то расшарил ссылку в мессенджере, а оттуда её подтянул поисковик. У одного клиента я нашёл 11 тысяч адресов с UTM от кампании, закрытой за три года до нашего знакомства.
Третье — наследие WordPress. Если сайт на WP и его никто не чистил, там гарантированно есть: ?replytocom= на каждый комментарий, страницы вложений ?attachment_id= на каждую загруженную картинку, ленты /feed/ у каждой записи и категории, архивы по датам, авторам и тегам. Я мерил: на блоге с 300 статьями, 1500 картинками и открытыми комментариями это даёт около 9 тысяч бесполезных адресов. Против 300 полезных.
Четвёртое — внутренний поиск. Адреса вида /?s=запрос индексируются, попадают в чужие ссылки и превращаются в бесконечную дыру. Отдельная беда — когда поиск отдаёт 200 даже на пустую выдачу. Робот считает такую страницу нормальной и приходит снова.
Пятое — глубокая пагинация и «календарные» архивы. /page/847/, где давно нет ни одного товара, но код 200 честно отдаётся. И архивы по годам-месяцам-дням, которые генерируются автоматически, даже если в этот день ничего не публиковалось.
Отдельно про самое частое возражение: «у меня же стоит canonical, зачем робот туда ходит?» Затем, что rel="canonical" для Яндекса — рекомендация по склейке, а не запрет на скачивание. Чтобы прочитать канонический тег, робот обязан сначала загрузить страницу. Он её грузит. Каждый раз. Canonical экономит вам место в индексе, но не экономит ни байта обхода.
То же самое с noindex в мете и с 301-редиректами. Всё это работает уже после скачивания. Единственные инструменты, которые реально сокращают обход, — те, что робот читает до запроса к странице. Их ровно два, и о них дальше.
Clean-param против Disallow: что выбрать и почему это не одно и то же
Здесь у большинства сайтов путаница, которая обходится дорого. Разберу по-честному, с плюсами и минусами обоих подходов.
| Критерий | Disallow в robots.txt | Clean-param в robots.txt |
|---|---|---|
| Что делает | Запрещает роботу скачивать адрес | Говорит: «этот параметр не влияет на содержимое, считай адрес без него» |
| Экономит обход | Да, полностью | Да, робот перестаёт перебирать комбинации |
| Передаёт сигналы на основную страницу | Нет. Ссылочный вес и поведение на закрытом адресе теряются | Да. Показатели склеиваются с основным адресом |
| Поддержка Google | Есть | Нет, директива только для Яндекса |
| Риск | Случайно закрыть нужное; закрытая страница не отдаст ни canonical, ни редирект | Ошибка в синтаксисе просто не сработает — тихо, без предупреждений |
| Когда я применяю | Служебные разделы, корзина, личный кабинет, внутренний поиск, феды | UTM, сортировки, идентификаторы сессий, любые параметры, не меняющие контент |
Практический вывод, к которому я пришёл опытным путём: для параметров почти всегда правильнее Clean-param, а не Disallow. Причина в потере сигналов. Если человек пришёл по ссылке с UTM, провёл на странице четыре минуты и оставил заявку — эти поведенческие данные должны достаться основному адресу. При Disallow они не достаются никому.
Синтаксис выглядит так — параметры через &, дальше префикс пути:
Clean-param: utm_source&utm_medium&utm_campaign&sort&order&sessionid /
И сразу предупрежу о трёх граблях, на которые я сам наступал. Первая: Clean-param нельзя применять к параметрам, которые меняют контент. Если ?city=spb отдаёт другие цены — это не мусор, это отдельная страница. Вторая: директива работает для конкретного робота, поэтому её место в секции User-agent: Yandex либо в общей, но с пониманием, что Google её проигнорирует. Третья: эффект не мгновенный. Робот переваривает изменение две-три недели. Не паникуйте на пятый день.
Что до Crawl-delay — забудьте. Яндекс отказался от поддержки этой директивы ещё в 2018 году; вместо неё в Вебмастере есть отдельная настройка скорости обхода. И трогать её стоит только в одном сценарии: когда робот реально роняет ваш сервер. Во всех остальных случаях замедление обхода — это выстрел себе в ногу.
Last-Modified и код 304: рычаг, который почти никто не дёргает
Это, пожалуй, самая недооценённая часть темы. И самая техническая — но потерпите, здесь лежат основные деньги.
Когда робот приходит за страницей повторно, он может отправить заголовок If-Modified-Since с датой прошлого визита. Если сервер настроен правильно и страница не менялась, он отвечает кодом 304 Not Modified и пустым телом. Робот не тратит ресурс на скачивание и идёт дальше по очереди — к следующему адресу.
Если сервер не умеет отдавать 304 — а по моей выборке не умеют примерно семь сайтов из десяти — робот каждый раз качает полную копию неизменившейся страницы. Со всем HTML, со всеми ста килобайтами разметки. Умножьте на количество страниц и на количество визитов.
Я проверял эффект на сайте компании по остеклению балконов. Контрольные три недели, потом внедрение корректного Last-Modified с реальной датой обновления материала (а не текущим временем сервера — это критично, иначе смысла ноль). Ещё три недели наблюдения. Результат: количество обращений робота выросло на 34%, при этом объём скачанных данных упал почти вдвое. Робот стал успевать больше за тот же ресурс.
Проверить свой сайт можно за минуту в Яндекс.Вебмастере — раздел «Инструменты» → «Проверка ответа сервера». Смотрите на заголовок Last-Modified в ответе. Если его нет или если дата равна моменту проверки — у вас проблема. Если вы не уверены, что готовы лезть в конфигурацию сервера сами, это стандартная задача для технической доработки сайта, обычно она закрывается за пару часов.
Как я перераспределяю обход: последовательность из шести шагов
Порядок здесь важен. Я много раз видел, как люди начинают с конца — правят sitemap и жмут «переобход» в Вебмастере, — и не получают ничего. Потому что робот всё ещё занят мусором.
Шаг первый — измерить. Не догадаться, а измерить. Яндекс.Вебмастер → «Индексирование» → «Статистика обхода», выгрузка за последний месяц в CSV. Если есть доступ к серверу — лучше сырые логи, там видно всё. Сортируем по количеству обращений, смотрим топ-200 адресов. Обычно картина становится понятной за десять минут: вы просто видите, куда утекает обход.
Шаг второй — классифицировать. Раскидываю все найденные адреса на четыре корзины: (1) нужные и работающие, (2) мусор с параметрами, (3) мусор без параметров — архивы, феды, вложения, (4) битые и редиректы. Считаю доли. Это и есть отправная точка, к которой мы потом вернёмся через месяц.
Шаг третий — закрыть источники, а не следствия. Ключевая мысль всей статьи. Прописать Clean-param недостаточно, если сайт продолжает генерировать ссылки на мусор в своей же вёрстке. Нужно убрать сами ссылки: закрыть фильтры от индексации на уровне шаблона, отключить генерацию страниц вложений, убить ?replytocom в настройках комментариев, вынести феды из разметки. Иначе вы боретесь с симптомом.
Шаг четвёртый — навести порядок в robots.txt. Clean-param на параметры, Disallow на служебные разделы и внутренний поиск. Проверить готовый файл в Вебмастере через «Анализ robots.txt», подставив десяток реальных URL — и мусорных, и важных. Я делал так ошибку: закрывал /search/ и заодно случайно ронял раздел /searchlight/. Проверяйте.
Шаг пятый — переписать sitemap.xml. Только рабочие адреса, только код 200, реальные lastmod. Никаких редиректов, никаких закрытых в robots страниц. Если карту генерирует плагин — откройте её глазами, я регулярно нахожу там мусор, о котором владелец сайта не подозревал.
Шаг шестой — подтолкнуть важное. Суточная квота на переобход в Вебмастере невелика, поэтому тратьте её осмысленно: сначала главная, коммерческие посадочные, страницы с ценами. Плюс подключите IndexNow — Яндекс его поддерживает, и уведомление об изменении страницы уходит мгновенно, не дожидаясь планового визита робота. Плюс «Мониторинг важных страниц» в Вебмастере: он не ускоряет обход, но вы хотя бы сразу узнаете, если ключевая страница вылетела.
Кейс: 71% обхода на продающие страницы за шесть недель
Возвращаюсь к тому магазину сантехники с 4812 обращениями к фильтру. Цифры до и после, без прикрас.
Было на старте (месяц наблюдений): 61 400 обращений робота, из них 4,7% к нужным страницам. В индексе 890 страниц из 3400 полезных. Среднее время попадания новой карточки товара в индекс — 44 дня.
Что сделали. Первая неделя — аудит и выгрузка логов. Вторая-третья — правки в шаблоне: фильтры перестали генерировать индексируемые ссылки, отключены страницы вложений и феды записей, внутренний поиск закрыт. Четвёртая — Clean-param на девять параметров, переписанная карта сайта, настроенный Last-Modified. Пятая-шестая — наблюдение и точечные правки: вылезли два раздела, которые я закрыл лишнего, вернул.
Стало на седьмой неделе: 78 900 обращений робота (выросли, потому что сервер стал отдавать 304 и робот успевал больше), из них 71,3% к целевым страницам. В индексе 3120 страниц. Новая карточка попадает в индекс за 3–6 дней.
Отдельно подчеркну то, о чём часто забывают: трафик вырос не мгновенно. Первый месяц после правок позиции почти не двигались — робот только заново узнавал сайт. Плюс 40% к органике пришли к третьему месяцу, когда переиндексированные страницы набрали релевантность. Если вам обещают рост на второй неделе после чистки краулингового бюджета — вам врут. Похожие разборы с адресами сайтов и динамикой я выкладываю в портфолио работ, а видеоформат — в видеокейсах, там я показываю Вебмастер клиента вживую.
Чек-лист: восемь проверок, которые можно сделать сегодня
- Откройте «Статистику обхода» в Вебмастере, отсортируйте по обращениям. Если в первой двадцатке есть адреса с
?— у вас утечка. - Забейте в поиск Яндекса запрос
site:вашсайт.руи полистайте до конца. Всё, что вы там не узнаёте, — кандидаты на чистку. - Проверьте ответ сервера на любой статичной странице: есть ли
Last-Modified, отдаётся ли 304. - Найдите в исходном коде страницы ссылки на
/feed/и на страницы вложений. Уберите. - Посмотрите на sitemap.xml глазами. Все ли адреса рабочие? Совпадает ли
lastmodс реальностью? - Проверьте, что несуществующая пагинация вида
/page/9999/отдаёт 404, а не 200 с пустым списком. - Соберите список всех GET-параметров, которые встречаются на сайте, и по каждому ответьте: меняет ли он содержимое? Не меняет — в
Clean-param. - Убедитесь, что robots.txt не закрывает CSS и JS. Робот должен видеть страницу так же, как пользователь.
Если после этих проверок вы поняли, что проблема есть, но не понимаете её масштаб — начните с бесплатной диагностики. Я сделал экспресс-аудит сайта, который за полминуты показывает базовые технические ошибки, включая проблемы с индексацией. Для глубокого разбора с выгрузкой логов и планом правок есть полный SEO-аудит по 120 параметрам — там я проверяю всё вручную и объясняю каждый пункт голосом, а не отпиской в PDF.
Что делать, если целевого трафика всё равно не хватает
Чистка обхода — это фундамент. Она возвращает роботу возможность видеть ваши деньги, а не ваш мусор. Но сама по себе она не выведет вас в ТОП: индексация — необходимое условие, а не достаточное. Дальше нужны семантика, посадочные страницы под коммерческий интент, коммерческие факторы и ссылочный профиль.
Я веду проекты лично — от аудита до еженедельного отчёта, без менеджеров-посредников и без ассистентов, которым передают ваш сайт «на поток». За плечами 300+ проектов и сайты, которые держатся в ТОП-1 Яндекса восемь лет подряд. Работаю в белую: никакой накрутки поведенческих, никаких ссылочных ферм — только методы, после которых сайт не приходится вытаскивать из-под фильтра. В работе учитываю все основные факторы ранжирования — на сегодня их 1922, — и методику эту я строил двадцать лет; продаю результат, а не пересказ чужих чек-листов.
Что вы получаете на SEO-продвижении сайта, тариф «Старт» — от 55 000 ₽/мес:
- Технический аудит и устранение всего, что блокирует индексацию, — включая ровно ту работу с краулинговым бюджетом, о которой эта статья.
- Сбор и кластеризацию семантики: до 200 ключевых запросов, согласованных с вами до старта работ.
- Оптимизацию метаданных и посадочных страниц под коммерческий интент.
- Вывод запросов в ТОП-3 Яндекса, еженедельный съём позиций и отчёт, где видно, что сделано и что дальше.
- Мой личный телефон и ответ на вопрос в тот же день, а не через тикет-систему.
И второе направление, которое в 2026 году уже нельзя игнорировать. Пользователи всё чаще получают ответ не в выдаче, а в нейросети — YandexGPT, GigaChat, ChatGPT, Perplexity. Эти системы цитируют конкретные сайты, и попадание в цитирование строится по другим правилам, чем классическое SEO: важна структура фактов, извлекаемость данных, разметка сущностей, наличие однозначных формулировок, которые модель может процитировать без искажения. Я занялся GEO-продвижением раньше большинства коллег на рынке и веду его как отдельную услугу — можно взять вместе с SEO, можно отдельно.
Хотите понять, сколько трафика ваш сайт теряет прямо сейчас? Напишите мне через форму обратной связи или позвоните по номеру +7 (921) 333-77-45 — разберу вашу «Статистику обхода» и честно скажу, есть ли там проблема и сколько стоит её решить. Если проблемы нет, я так и скажу: продавать вам работу, которая не нужна, мне невыгодно — репутация дороже одного договора.
А если пока хочется просто разобраться самому — в блоге лежат сотни разборов по технической оптимизации, там же публикую свежие SEO-отчёты по текущим проектам. Материал полезен — поделитесь с тем, кто сейчас мучается с индексацией. Такие вещи почему-то до сих пор не считают проблемой, пока не увидят логи.
Увеличьте позиции и продажи вашего сайта
Профессиональное SEO-продвижение с гарантией результата. Выберите подходящую услугу:
Остались вопросы по продвижению?
Меня зовут Анатолий Кузнецов, я SEO-оптимизатор с 20-летним стажем. Разберу ваш сайт, отвечу на вопросы и подскажу, что улучшить для роста позиций в Яндексе и Google.
Связаться со мной →