
Краулинговый бюджет сайта становится заметен в тот момент, когда вы открываете Вебмастер и видите: страниц в базе десятки тысяч, а в поиске — вчетверо меньше, и новые разделы заходят в индекс неделями. Робот не обходит всё подряд и не обходит бесконечно: у каждого сайта есть свой потолок обращений в сутки, и распоряжаетесь этим потолком фактически вы — тем, какие адреса вообще существуют на сайте и как быстро сервер на них отвечает.
В SEO я с 2005 года, и вижу одну и ту же закономерность: про краулинговый бюджет вспоминают, когда индексация уже сломалась, а чинить приходится не индексацию, а структуру сайта. Ниже — как этот бюджет устроен, как измерить его по своим логам, куда он утекает чаще всего и в каком порядке разбирать проблему, чтобы не тратить месяцы на действия, которые ничего не меняют.
Из чего складывается краулинговый бюджет
Краулинговый бюджет — количество обращений, которые поисковый робот готов сделать к вашему сайту за отрезок времени. Складывается он из двух независимых величин, и путать их дорого.
Предел нагрузки. Сколько запросов сайт физически выдерживает. Робот следит за временем ответа: если сервер начинает отвечать медленнее или отдавать ошибки, частота обращений снижается автоматически — поисковик не заинтересован класть чужие сайты. Здесь всё решает хостинг, движок и кэширование.
Потребность в обходе. Сколько робот вообще хочет обойти. Зависит от того, насколько сайт востребован, как часто на нём появляется новое и оправдывались ли прошлые визиты. Если робот десять раз приходил и находил неизменные или бесполезные страницы, интерес падает.
Отсюда правило, которое экономит много времени: расширить бюджет напрямую нельзя, кнопки «дайте больше обхода» не существует. Можно убрать то, что мешает роботу тратить бюджет с пользой, и можно ускорить сервер, чтобы за то же время он успевал больше. Всё остальное — производные от этих двух действий.
Кому этим вообще нужно заниматься
Тема перегрета: краулинговый бюджет обсуждают на сайтах, где он никогда не станет проблемой. Ориентир по масштабу выглядит примерно так.
| Размер сайта | Актуальность темы | Что делать вместо этого |
|---|---|---|
| До 500 страниц | Практически не актуальна | Заниматься содержанием и структурой под спрос |
| 500–5000 страниц | Актуальна, если есть фильтры или поиск по сайту | Закрыть генерацию мусорных адресов, следить за дублями |
| 5000–50 000 страниц | Актуальна почти всегда | Разбор логов, приоритеты обхода, чистка мусора |
| Больше 50 000 страниц | Постоянная работа | Регламент: мониторинг логов, контроль генерации адресов |
| Любой размер при медленном сервере | Актуальна | Сначала ускорить ответ, потом всё остальное |
| Любой размер при частых обновлениях | Актуальна для скорости попадания в поиск | Корректный lastmod и внутренние ссылки на новое |
Последние две строки объясняют, почему тема иногда всплывает у небольших сайтов. Если сервер отвечает за три секунды, робот успевает мало независимо от количества страниц. И если новости попадают в поиск через две недели, а не через сутки, дело обычно не в объёме, а в том, что робот не получает сигнала о появлении нового.
Как измерить: логи сервера и отчёты Вебмастера
Разговор о бюджете имеет смысл только на цифрах. Источников данных два, и они дополняют друг друга.
Отчёты Вебмастера. В разделе индексирования есть статистика обхода: сколько страниц робот загрузил за день, сколько получил ошибок, как менялось соотношение. Там же видно число страниц в поиске и исключённых с причиной исключения. Это верхний уровень: показывает динамику, но не показывает, на какие именно адреса ушли обращения.
Логи веб-сервера. Единственный способ увидеть реальную картину. В журнале доступа записан каждый запрос: адрес, код ответа, агент, время. Отфильтруйте строки по агентам поисковых роботов за месяц — и вы получите точный список того, на что потрачен бюджет.
Подробнее об этом — в статье «Краулинговый бюджет: что это и почему Яндекс не обходит половину вашего сайта».
Что смотреть в логах в первую очередь:
- Топ-100 адресов по числу обращений робота. Обычно в первой сотне обнаруживается что-нибудь неожиданное: страница поиска по сайту, ссылки сортировки, версия для печати.
- Распределение по кодам ответа. Доля 200, 301, 404, 500. Если на редиректы и ошибки уходит больше десятой части обращений, у вас уже есть, что чинить.
- Доля обращений к страницам с параметрами. Всё, что содержит вопросительный знак: фильтры, метки, идентификаторы сессий.
- Время ответа по типам страниц. Часто выясняется, что категории отдаются за 200 миллисекунд, а карточки товара — за две секунды, и именно на них уходит время.
- Важные разделы, которых в логах нет. Самый ценный вывод: если робот за месяц ни разу не зашёл на группу страниц, они не «плохо ранжируются», их просто не видели.
Логи доступны в панели управления хостингом, обычно в разделе журналов. Разбирать их вручную не нужно: месячный журнал среднего сайта — это сотни мегабайт, но простая выборка по агенту и группировка по адресу решается любым скриптом или готовым анализатором логов за несколько минут.
Куда утекает бюджет
Помогу с продвижением: вывести сайт в топ Яндекса — вывожу сайты в топ Яндекса белыми методами.
Источники мусорных обращений повторяются от проекта к проекту. Список отсортирован по частоте, с которой я встречаю их при разборе.
| Источник | Как выглядит | Что с этим делать |
|---|---|---|
| Фильтры каталога | Комбинации параметров, дающие тысячи адресов с одинаковым содержимым | Открыть только востребованные комбинации, остальные закрыть от обхода |
| Сортировки и вид отображения | Один список товаров под десятком адресов | Закрыть в robots.txt, канонический адрес на базовую версию |
| Внутренний поиск | Адреса вида /search/?q=… из внешних ссылок и старых карт сайта | Закрыть от обхода полностью, отдавать noindex |
| Постраничная навигация без конца | Страницы 300+ с пустыми списками | Ограничить глубину, убрать ссылки на пустые страницы |
| Цепочки редиректов | Два-три перехода до конечного адреса | Сократить до одного перехода, поправить внутренние ссылки на конечный адрес |
| Битые ссылки внутри сайта | Массовые 404 из меню, футера или старых материалов | Починить источник ссылок, а не просто настроить редирект |
| Метки рекламных кампаний | Адреса с utm, попавшие в индекс через внешние ссылки | Канонический адрес без параметров, чистка карты сайта |
| Календари и архивы | Бесконечные ссылки на месяцы и годы вперёд | Убрать ссылки в будущее, закрыть архивы по датам |
Ключевая мысль про фильтры: закрывать их целиком — тоже ошибка. Комбинации, под которые есть реальный спрос, должны быть открыты и оформлены как полноценные посадочные страницы с уникальным заголовком и описанием. Закрывать нужно то, что спроса не имеет и существует только потому, что так работает движок. Разделить одно от другого можно по данным Вордстата и по тому, какие фильтры чаще всего выбирают живые посетители.
Если интересно направление с сайтами — базу даю в своём курсе:
Скорость ответа: вторая половина уравнения
Про чистку мусора помнят все, про скорость — заметно реже, хотя она напрямую задаёт, сколько страниц робот успеет за визит. Здесь важно не путать скорость загрузки в браузере и время ответа сервера.
Роботу безразлично, как быстро отрисуется страница: он не ждёт картинок, шрифтов и скриптов. Ему важно, за сколько сервер отдаёт HTML. Ориентир — до 200 миллисекунд, приемлемо до 500, дольше секунды — уже ограничение. Проверяется это не сервисами оценки скорости, а замером времени до первого байта или тем же логом, если в нём включена запись длительности запроса.
Что реально влияет на это время: кэширование на стороне сервера, количество запросов к базе на одну страницу, тариф хостинга и соседи по нему, работа тяжёлых модулей на каждой загрузке. Отдельная частая история — генерация страницы каталога с пересчётом фильтров при каждом обращении: посетитель этого не замечает благодаря кэшу браузера, а робот, приходящий по тысяче адресов, получает полный расчёт каждый раз.
Тему разбирал отдельно: «Индексация сайта от А до Я: robots.txt, sitemap, краулинговый бюджет».
Важно и постоянство. Резкий рост времени ответа или всплеск ошибок 5xx приводит к тому, что робот снижает частоту обращений и возвращается к прежней постепенно, за недели. Поэтому переезды, обновления движка и массовые правки лучше делать так, чтобы сайт не отвечал ошибками даже полчаса.
Чем управляют обходом, а чем — индексацией
Самая частая путаница в теме. Инструменты выглядят похоже, но действуют на разных этапах, и подмена одного другим даёт результат, обратный ожидаемому.
| Инструмент | Влияет на обход | Влияет на индексацию | Когда применять |
|---|---|---|---|
| Disallow в robots.txt | Да, запрещает загрузку | Косвенно | Массовый мусор: поиск, сортировки, служебные разделы |
| Мета-тег noindex | Нет, страницу нужно загрузить | Да, исключает из поиска | Единичные страницы, которые должны быть доступны людям |
| rel=canonical | Слабо, робот продолжает заходить | Да, склеивает дубли | Разные адреса с одинаковым содержимым |
| Код 404 | Постепенно снижает обращения | Да, выводит из индекса | Страница удалена без замены |
| Код 410 | Снижает быстрее, чем 404 | Да | Удалено окончательно и осознанно |
| Редирект 301 | Расходует бюджет на переход | Да, переносит адрес | Страница переехала, есть точная замена |
| rel=nofollow на ссылке | Почти нет, адрес найдут иначе | Нет | Как средство экономии бюджета не работает |
Из таблицы следует главная ловушка: закрытие в robots.txt не выводит страницу из поиска. Робот перестаёт её загружать, но адрес остаётся известным и может показываться в выдаче без описания. Если задача — убрать из индекса, нужен noindex, а для этого страница обязана оставаться доступной для загрузки. Одновременно ставить Disallow и noindex бессмысленно: робот не увидит тег, потому что не откроет страницу.
Обратная ошибка тоже распространена. Массовое закрытие тысяч адресов через noindex вместо robots.txt экономит индекс, но не экономит бюджет: чтобы прочитать тег, робот каждый раз скачивает страницу. Для мусора, генерируемого движком пачками, правильный инструмент — запрет обхода.
Структура и внутренние ссылки: как показать роботу важное
Робот распределяет внимание не равномерно. Чем ближе страница к главной по числу переходов и чем больше на неё внутренних ссылок, тем чаще к ней приходят. Это даёт рычаг, которым почти не пользуются.
- Уровень вложенности. Важные разделы должны достигаться за два-три перехода от главной. Страница на шестом уровне обходится редко даже на здоровом сайте.
- Ссылки из шаблонных блоков. Меню, футер, блоки «похожее» дают ссылки со всех страниц сразу. Что попало в них — обходится чаще всего, и место там стоит отдавать осознанно.
- Страницы-сироты. Материалы, на которые нет ни одной внутренней ссылки. Робот попадает на них только из карты сайта и с минимальным приоритетом. Найти их можно, сверив список адресов из карты со списком адресов, встречающихся в ссылках при обходе краулером.
- Ссылки на новое. Блок с последними материалами на главной или в разделе — самый простой способ сообщить о появлении страницы, не дожидаясь переобхода карты сайта.
- Разумная перелинковка. Ссылка внутри текста работает лучше блока внизу, но три сотни ссылок на странице размывают сигнал и сами по себе съедают обход.
Если нужна помощь по теме — курсы SEO-оптимизации.
Отдельно про постраничную навигацию. В больших каталогах именно она чаще всего съедает бюджет: чтобы дойти до товара с двадцать пятой страницы списка, робот должен пройти двадцать четыре предыдущих. Лечится это не отменой пагинации, а дополнительными точками входа: подкатегориями, страницами под востребованные фильтры и блоками ссылок на популярные позиции.
Карта сайта и lastmod: перестать обманывать робота
Sitemap не увеличивает бюджет, но помогает потратить его на нужное. Работает это при трёх условиях, которые нарушаются почти повсеместно.
Смежный материал по теме — «Индексация сайта: что это такое и как она работает».
В карте только страницы, которые должны быть в поиске. Не закрытые от обхода, не отдающие редирект, не удалённые. Каждый такой адрес — потраченное впустую обращение и повод меньше доверять карте целиком.
Дата изменения настоящая. Массовая беда: движок проставляет всем страницам сегодняшнее число при каждой генерации карты. Робот приходит, видит, что ничего не менялось, и перестаёт ориентироваться на этот признак. После этого карта теряет главную функцию — сообщать о свежих правках.
Карта разбита по смыслу. Отдельные файлы для товаров, категорий, статей. Так в отчётах Вебмастера видно, какая часть сайта индексируется плохо, — а на одном общем файле эта информация не собирается.
Полезное дополнение для сайтов, где важна скорость попадания в поиск, — отправка адресов через API переобхода в Вебмастере и через IndexNow. Это не расширяет бюджет и не гарантирует индексацию, но заметно сокращает время до первого визита робота на новую страницу.
Порядок работ
| Шаг | Действие | Результат |
|---|---|---|
| 1 | Выгрузить логи за месяц, отфильтровать по агентам роботов | Факт вместо предположений: на что уходят обращения |
| 2 | Посчитать распределение по кодам ответа и по типам адресов | Список источников утечки в порядке размера |
| 3 | Замерить время ответа сервера по типам страниц | Понимание, упирается ли всё в скорость |
| 4 | Закрыть генерацию мусорных адресов на уровне движка | Проблема перестаёт воспроизводиться, а не маскируется |
| 5 | Починить цепочки редиректов и внутренние ссылки на них | Освобождение заметной доли обращений |
| 6 | Привести карту сайта в порядок, включая честный lastmod | Робот снова ориентируется на карту |
| 7 | Сократить вложенность важных разделов, убрать сирот | Приоритет обхода смещается к нужным страницам |
| 8 | Через месяц повторить разбор логов | Проверка эффекта на тех же цифрах, что и до работ |
Восьмой шаг обязателен. Работы по краулинговому бюджету не дают эффектной картинки: позиции не взлетают, а число страниц в поиске меняется медленно. Единственное честное подтверждение — сравнение распределения обращений робота до и после. Если доля обращений к полезным страницам выросла с сорока процентов до семидесяти, работа сделана, даже когда остальные графики ещё стоят на месте.
Частые вопросы
Можно ли попросить поисковик обходить сайт чаще? Настройка скорости обхода в Вебмастере позволяет ограничить нагрузку или вернуть автоматический режим, но не увеличить бюджет сверх того, который поиск посчитал разумным. Единственный работающий путь — ускорить ответ сервера и дать роботу поводы приходить: обновления и внутренние ссылки на них.
Правда ли, что удаление старых статей улучшает индексацию? Иногда да, но удаление — крайняя мера. Сначала стоит разобраться, почему страницы бесполезны: чаще они не устарели, а дублируют друг друга или не отвечают ни на один реальный запрос. Объединение нескольких слабых материалов в один сильный обычно лучше удаления, потому что сохраняет накопленные ссылки.
Что делать с фильтрами в большом каталоге? Разделить на три группы. Комбинации с подтверждённым спросом — открыть и оформить как посадочные страницы. Комбинации без спроса, но полезные людям — оставить доступными и закрыть от обхода. Технический мусор вроде сортировок — закрыть полностью. Решение принимается по данным спроса, а не по внутреннему ощущению.
Влияет ли краулинговый бюджет на позиции? Напрямую нет. Он влияет на то, попадёт ли страница в поиск и как быстро поиск увидит её изменения. Страница, которую робот не обошёл, не ранжируется вовсе — в этом смысле связь есть, но это связь через индексацию, а не через качество страницы.
Сколько ждать эффекта от чистки? Первые изменения в статистике обхода видны через две-четыре недели, устойчивая картина — через два-три месяца. Быстрее реагируют небольшие сайты, у крупных каталогов перераспределение внимания робота идёт медленно и постепенно.
Нужно ли закрывать страницы пагинации от обхода? Обычно нет: через них робот попадает к товарам, и полное закрытие часто ухудшает индексацию каталога. Правильнее сократить необходимость в глубокой пагинации — добавить подкатегории и точки входа, а также убрать ссылки на заведомо пустые страницы за пределами реального числа позиций.
Коротко
- Краулинговый бюджет складывается из предела нагрузки на сервер и потребности поиска в обходе; расширить его напрямую нельзя, можно освободить и ускорить.
- Тема практически значима от нескольких тысяч страниц, а также на любом сайте с медленным ответом сервера или частыми обновлениями.
- Единственный честный источник данных — логи сервера: топ адресов по обращениям, распределение по кодам ответа и разделы, куда робот не заходил ни разу.
- Больше всего бюджета съедают фильтры и сортировки, внутренний поиск, цепочки редиректов и битые внутренние ссылки.
- Robots.txt управляет обходом, noindex — индексацией; одновременно они не работают, а nofollow как способ экономии бюджета не работает вовсе.
- Результат проверяется повторным разбором логов через месяц: важна доля обращений к полезным страницам, а не позиции в тот же период.
Если по вашему сайту видно, что в поиск попадает меньшая часть страниц, а причина неочевидна — фильтры, скорость сервера или структура, — приходите на SEO-консультацию: посмотрим отчёты Вебмастера и выборку из логов и определим, что съедает обход именно у вас.
Увеличьте позиции и продажи вашего сайта
Профессиональное SEO-продвижение с гарантией результата. Выберите подходящую услугу:
Остались вопросы по продвижению?
Меня зовут Анатолий Кузнецов, я SEO-оптимизатор с 20-летним стажем. Разберу ваш сайт, отвечу на вопросы и подскажу, что улучшить для роста позиций в Яндексе и Google.
Связаться со мной →
Комментарии
Максим Иноземцев
Разобрал логи впервые за всё время. В топе обращений робота оказалась страница внутреннего поиска с пустым запросом — на неё уходило больше обращений, чем на весь каталог. Ссылка на неё стояла в футере со времён прошлого разработчика.
Анатолий Кузнецов автор
Классическая находка, и хорошо, что вы дошли до причины, а не просто закрыли адрес. Уберите саму ссылку из футера — пока она есть, робот будет считать страницу важной, ведь на неё ссылается весь сайт. Дальше закройте раздел поиска в robots.txt целиком по маске, а не один конкретный адрес: параметров у поиска обычно много. И проверьте по логам за следующий месяц, не появились ли адреса поиска с внешних сайтов — такое бывает, если раздел когда-то попал в чужие подборки ссылок.
Евгения Жучкова
Про честный lastmod — прямо про нас. Движок ставил всем страницам дату генерации карты, то есть сегодняшнюю. Поправили, чтобы бралась дата последней правки, и робот заметно быстрее стал подхватывать изменения в карточках.
Владислав Зотов
Не могу согласиться с порогом в пятьсот страниц. У нас сайт услуг на восемьдесят страниц, и половина не в индексе месяцами. Тема с бюджетом получается актуальна и на маленьких сайтах, просто причины другие?
Анатолий Кузнецов автор
Причины другие, и это важно различать: на восьмидесяти страницах бюджет не может быть узким местом физически. Робот обходит такой сайт целиком за один визит. Значит, страницы не в поиске не потому, что до них не дошли, а потому, что их посмотрели и не взяли. Смотрите в Вебмастере раздел исключённых страниц и причину напротив каждой: чаще всего это дубли, недостаточное качество или ошибки ответа. Дубли лечатся склейкой и разведением по разным запросам, качество — тем, что страница должна отвечать на конкретный спрос, а не быть заготовкой на двести знаков. Логи в вашем случае тоже полезны, но как проверка: если робот заходил, а страница не в индексе, вопрос точно не в обходе.
Лариса Ипатова
Таблица про robots.txt и noindex — то, что стоило прочитать три года назад. Мы закрыли в robots тысячи страниц фильтров, они годами висели в выдаче без описания, и никто не понимал, почему они не уходят.
Тимур Ишков
Добавлю про время ответа. У нас категории отдавались быстро, а карточки по полторы секунды — на каждой загрузке пересчитывались остатки по складам. Вынесли пересчёт в фоновую задачу, время упало до двухсот миллисекунд, обход вырос сам собой.
Ирина Железнова
Вопрос по фильтрам. Как понять, у какой комбинации есть спрос, если их технически возможно собрать несколько десятков тысяч? Перебирать всё в Вордстате нереально, а ошибиться с выбором не хочется.
Анатолий Кузнецов автор
Перебирать всё и не нужно, работает отсечение по уровням. Первое: открывайте только комбинации из одного-двух параметров, три и больше почти никогда не имеют спроса. Второе: берите не все параметры подряд, а те, которыми люди реально формулируют запрос, — обычно это бренд, размер, назначение и материал, а не артикул или вес упаковки. Третье: посмотрите статистику собственного каталога, какие фильтры чаще всего выбирают посетители, — это бесплатная выборка по вашей нише. Полученный список из нескольких сотен комбинаций уже можно прогнать через Вордстат или Rush Analytics и оставить те, у которых спрос есть. Остальное закрывайте от обхода.
Софья Ирисова
Нашли у себя календарь событий, который генерировал ссылки на месяцы до 2035 года. Робот исправно ходил по всем. Ограничили горизонт двумя месяцами вперёд — и в логах освободилась примерно пятая часть обращений.
Анатолий Кузнецов автор
Календари и архивы — недооценённый источник утечки, потому что визуально они безобидны: одна стрелка «следующий месяц» порождает бесконечную последовательность. Раз горизонт вы уже ограничили, доведите до конца ещё три вещи. Уберите ссылки на месяцы без событий: пустая страница ничем не полезна ни человеку, ни роботу. Проверьте, не попали ли адреса будущих месяцев в карту сайта — их оттуда надо вычистить, иначе робот продолжит по ним ходить. И посмотрите, нет ли похожей конструкции в архиве по годам и по тегам: механизм там точно такой же, а замечают его гораздо реже.
Артур Жмурко
Про восьмой шаг с повторным разбором логов согласен полностью. Без него владельцу невозможно объяснить, за что заплачено: позиции не выросли, трафик тот же, а работа сделана большая. Сравнение двух распределений закрывает вопрос за минуту.
Кристина Зуйкова
У нас цепочки редиректов достались в наследство от двух переездов подряд: старый адрес вёл на промежуточный, тот на текущий. В логах на переходы уходило заметно больше десятой части обращений. Переписали правила на конечные адреса напрямую.
Денис Иевлев
Спорный для меня момент — совет не закрывать пагинацию. У нас в каталоге списки по шестьсот страниц, робот тонет в них и до новых товаров добирается неделями. Пока не нашёл решения лучше, чем частично их закрыть.
Анатолий Кузнецов автор
Шестьсот страниц в одном списке — это симптом, а закрытие пагинации будет лечением симптома. Сначала проверьте, сколько позиций выводится на страницу: увеличение с двадцати до шестидесяти сразу сокращает список втрое и обычно не вредит людям. Второе: такой длинный список почти всегда означает, что категория слишком широкая, и её пора делить на подкатегории — это заодно даёт новые посадочные страницы под спрос. Третье: добавьте роботу короткие пути к новым товарам — блок новинок в категории и отдельный файл карты сайта только для свежих позиций. После этих трёх шагов вопрос о закрытии пагинации обычно снимается сам.
Галина Жегалина
Разбила карту сайта на отдельные файлы по типам, как советуете. Сразу стало видно, что статьи индексируются почти полностью, а карточки товаров — примерно наполовину. На общем файле эта разница просто не была заметна.
Станислав Зубов
Добавлю неочевидное: у нас всплеск ошибок 5xx длился около часа при обновлении движка, а частота обхода восстанавливалась потом почти три недели. Теперь любые работы делаем с заглушкой, отдающей корректный код, а не с падением сервера.