Логотип seo-prodvizhenie-biznesa.ru
+7 (921) 333-77-45

Краулинговый бюджет сайта: что это такое и как его оптимизировать

Краулинговый бюджет сайта: что это такое и как его оптимизировать
Анатолий Кузнецов
Анатолий Кузнецов
SEO-оптимизатор с 20-летним стажем. Автор блога seo-prodvizhenie-biznesa.ru о продвижении и доработке сайтов.

Краулинговый бюджет сайта становится заметен в тот момент, когда вы открываете Вебмастер и видите: страниц в базе десятки тысяч, а в поиске — вчетверо меньше, и новые разделы заходят в индекс неделями. Робот не обходит всё подряд и не обходит бесконечно: у каждого сайта есть свой потолок обращений в сутки, и распоряжаетесь этим потолком фактически вы — тем, какие адреса вообще существуют на сайте и как быстро сервер на них отвечает.

В SEO я с 2005 года, и вижу одну и ту же закономерность: про краулинговый бюджет вспоминают, когда индексация уже сломалась, а чинить приходится не индексацию, а структуру сайта. Ниже — как этот бюджет устроен, как измерить его по своим логам, куда он утекает чаще всего и в каком порядке разбирать проблему, чтобы не тратить месяцы на действия, которые ничего не меняют.

Из чего складывается краулинговый бюджет

Краулинговый бюджет — количество обращений, которые поисковый робот готов сделать к вашему сайту за отрезок времени. Складывается он из двух независимых величин, и путать их дорого.

Предел нагрузки. Сколько запросов сайт физически выдерживает. Робот следит за временем ответа: если сервер начинает отвечать медленнее или отдавать ошибки, частота обращений снижается автоматически — поисковик не заинтересован класть чужие сайты. Здесь всё решает хостинг, движок и кэширование.

Потребность в обходе. Сколько робот вообще хочет обойти. Зависит от того, насколько сайт востребован, как часто на нём появляется новое и оправдывались ли прошлые визиты. Если робот десять раз приходил и находил неизменные или бесполезные страницы, интерес падает.

Отсюда правило, которое экономит много времени: расширить бюджет напрямую нельзя, кнопки «дайте больше обхода» не существует. Можно убрать то, что мешает роботу тратить бюджет с пользой, и можно ускорить сервер, чтобы за то же время он успевал больше. Всё остальное — производные от этих двух действий.

Кому этим вообще нужно заниматься

Тема перегрета: краулинговый бюджет обсуждают на сайтах, где он никогда не станет проблемой. Ориентир по масштабу выглядит примерно так.

Размер сайта Актуальность темы Что делать вместо этого
До 500 страниц Практически не актуальна Заниматься содержанием и структурой под спрос
500–5000 страниц Актуальна, если есть фильтры или поиск по сайту Закрыть генерацию мусорных адресов, следить за дублями
5000–50 000 страниц Актуальна почти всегда Разбор логов, приоритеты обхода, чистка мусора
Больше 50 000 страниц Постоянная работа Регламент: мониторинг логов, контроль генерации адресов
Любой размер при медленном сервере Актуальна Сначала ускорить ответ, потом всё остальное
Любой размер при частых обновлениях Актуальна для скорости попадания в поиск Корректный lastmod и внутренние ссылки на новое

Последние две строки объясняют, почему тема иногда всплывает у небольших сайтов. Если сервер отвечает за три секунды, робот успевает мало независимо от количества страниц. И если новости попадают в поиск через две недели, а не через сутки, дело обычно не в объёме, а в том, что робот не получает сигнала о появлении нового.

Как измерить: логи сервера и отчёты Вебмастера

Разговор о бюджете имеет смысл только на цифрах. Источников данных два, и они дополняют друг друга.

Отчёты Вебмастера. В разделе индексирования есть статистика обхода: сколько страниц робот загрузил за день, сколько получил ошибок, как менялось соотношение. Там же видно число страниц в поиске и исключённых с причиной исключения. Это верхний уровень: показывает динамику, но не показывает, на какие именно адреса ушли обращения.

Логи веб-сервера. Единственный способ увидеть реальную картину. В журнале доступа записан каждый запрос: адрес, код ответа, агент, время. Отфильтруйте строки по агентам поисковых роботов за месяц — и вы получите точный список того, на что потрачен бюджет.

Подробнее об этом — в статье «Краулинговый бюджет: что это и почему Яндекс не обходит половину вашего сайта».

Что смотреть в логах в первую очередь:

  • Топ-100 адресов по числу обращений робота. Обычно в первой сотне обнаруживается что-нибудь неожиданное: страница поиска по сайту, ссылки сортировки, версия для печати.
  • Распределение по кодам ответа. Доля 200, 301, 404, 500. Если на редиректы и ошибки уходит больше десятой части обращений, у вас уже есть, что чинить.
  • Доля обращений к страницам с параметрами. Всё, что содержит вопросительный знак: фильтры, метки, идентификаторы сессий.
  • Время ответа по типам страниц. Часто выясняется, что категории отдаются за 200 миллисекунд, а карточки товара — за две секунды, и именно на них уходит время.
  • Важные разделы, которых в логах нет. Самый ценный вывод: если робот за месяц ни разу не зашёл на группу страниц, они не «плохо ранжируются», их просто не видели.

Логи доступны в панели управления хостингом, обычно в разделе журналов. Разбирать их вручную не нужно: месячный журнал среднего сайта — это сотни мегабайт, но простая выборка по агенту и группировка по адресу решается любым скриптом или готовым анализатором логов за несколько минут.

Куда утекает бюджет

Помогу с продвижением: вывести сайт в топ Яндекса — вывожу сайты в топ Яндекса белыми методами.

Источники мусорных обращений повторяются от проекта к проекту. Список отсортирован по частоте, с которой я встречаю их при разборе.

Источник Как выглядит Что с этим делать
Фильтры каталога Комбинации параметров, дающие тысячи адресов с одинаковым содержимым Открыть только востребованные комбинации, остальные закрыть от обхода
Сортировки и вид отображения Один список товаров под десятком адресов Закрыть в robots.txt, канонический адрес на базовую версию
Внутренний поиск Адреса вида /search/?q=… из внешних ссылок и старых карт сайта Закрыть от обхода полностью, отдавать noindex
Постраничная навигация без конца Страницы 300+ с пустыми списками Ограничить глубину, убрать ссылки на пустые страницы
Цепочки редиректов Два-три перехода до конечного адреса Сократить до одного перехода, поправить внутренние ссылки на конечный адрес
Битые ссылки внутри сайта Массовые 404 из меню, футера или старых материалов Починить источник ссылок, а не просто настроить редирект
Метки рекламных кампаний Адреса с utm, попавшие в индекс через внешние ссылки Канонический адрес без параметров, чистка карты сайта
Календари и архивы Бесконечные ссылки на месяцы и годы вперёд Убрать ссылки в будущее, закрыть архивы по датам

Ключевая мысль про фильтры: закрывать их целиком — тоже ошибка. Комбинации, под которые есть реальный спрос, должны быть открыты и оформлены как полноценные посадочные страницы с уникальным заголовком и описанием. Закрывать нужно то, что спроса не имеет и существует только потому, что так работает движок. Разделить одно от другого можно по данным Вордстата и по тому, какие фильтры чаще всего выбирают живые посетители.

Если интересно направление с сайтами — базу даю в своём курсе:

Скорость ответа: вторая половина уравнения

Про чистку мусора помнят все, про скорость — заметно реже, хотя она напрямую задаёт, сколько страниц робот успеет за визит. Здесь важно не путать скорость загрузки в браузере и время ответа сервера.

Роботу безразлично, как быстро отрисуется страница: он не ждёт картинок, шрифтов и скриптов. Ему важно, за сколько сервер отдаёт HTML. Ориентир — до 200 миллисекунд, приемлемо до 500, дольше секунды — уже ограничение. Проверяется это не сервисами оценки скорости, а замером времени до первого байта или тем же логом, если в нём включена запись длительности запроса.

Что реально влияет на это время: кэширование на стороне сервера, количество запросов к базе на одну страницу, тариф хостинга и соседи по нему, работа тяжёлых модулей на каждой загрузке. Отдельная частая история — генерация страницы каталога с пересчётом фильтров при каждом обращении: посетитель этого не замечает благодаря кэшу браузера, а робот, приходящий по тысяче адресов, получает полный расчёт каждый раз.

Тему разбирал отдельно: «Индексация сайта от А до Я: robots.txt, sitemap, краулинговый бюджет».

Важно и постоянство. Резкий рост времени ответа или всплеск ошибок 5xx приводит к тому, что робот снижает частоту обращений и возвращается к прежней постепенно, за недели. Поэтому переезды, обновления движка и массовые правки лучше делать так, чтобы сайт не отвечал ошибками даже полчаса.

Чем управляют обходом, а чем — индексацией

Самая частая путаница в теме. Инструменты выглядят похоже, но действуют на разных этапах, и подмена одного другим даёт результат, обратный ожидаемому.

Инструмент Влияет на обход Влияет на индексацию Когда применять
Disallow в robots.txt Да, запрещает загрузку Косвенно Массовый мусор: поиск, сортировки, служебные разделы
Мета-тег noindex Нет, страницу нужно загрузить Да, исключает из поиска Единичные страницы, которые должны быть доступны людям
rel=canonical Слабо, робот продолжает заходить Да, склеивает дубли Разные адреса с одинаковым содержимым
Код 404 Постепенно снижает обращения Да, выводит из индекса Страница удалена без замены
Код 410 Снижает быстрее, чем 404 Да Удалено окончательно и осознанно
Редирект 301 Расходует бюджет на переход Да, переносит адрес Страница переехала, есть точная замена
rel=nofollow на ссылке Почти нет, адрес найдут иначе Нет Как средство экономии бюджета не работает

Из таблицы следует главная ловушка: закрытие в robots.txt не выводит страницу из поиска. Робот перестаёт её загружать, но адрес остаётся известным и может показываться в выдаче без описания. Если задача — убрать из индекса, нужен noindex, а для этого страница обязана оставаться доступной для загрузки. Одновременно ставить Disallow и noindex бессмысленно: робот не увидит тег, потому что не откроет страницу.

Обратная ошибка тоже распространена. Массовое закрытие тысяч адресов через noindex вместо robots.txt экономит индекс, но не экономит бюджет: чтобы прочитать тег, робот каждый раз скачивает страницу. Для мусора, генерируемого движком пачками, правильный инструмент — запрет обхода.

Структура и внутренние ссылки: как показать роботу важное

Робот распределяет внимание не равномерно. Чем ближе страница к главной по числу переходов и чем больше на неё внутренних ссылок, тем чаще к ней приходят. Это даёт рычаг, которым почти не пользуются.

  1. Уровень вложенности. Важные разделы должны достигаться за два-три перехода от главной. Страница на шестом уровне обходится редко даже на здоровом сайте.
  2. Ссылки из шаблонных блоков. Меню, футер, блоки «похожее» дают ссылки со всех страниц сразу. Что попало в них — обходится чаще всего, и место там стоит отдавать осознанно.
  3. Страницы-сироты. Материалы, на которые нет ни одной внутренней ссылки. Робот попадает на них только из карты сайта и с минимальным приоритетом. Найти их можно, сверив список адресов из карты со списком адресов, встречающихся в ссылках при обходе краулером.
  4. Ссылки на новое. Блок с последними материалами на главной или в разделе — самый простой способ сообщить о появлении страницы, не дожидаясь переобхода карты сайта.
  5. Разумная перелинковка. Ссылка внутри текста работает лучше блока внизу, но три сотни ссылок на странице размывают сигнал и сами по себе съедают обход.

Если нужна помощь по теме — курсы SEO-оптимизации.

Отдельно про постраничную навигацию. В больших каталогах именно она чаще всего съедает бюджет: чтобы дойти до товара с двадцать пятой страницы списка, робот должен пройти двадцать четыре предыдущих. Лечится это не отменой пагинации, а дополнительными точками входа: подкатегориями, страницами под востребованные фильтры и блоками ссылок на популярные позиции.

Карта сайта и lastmod: перестать обманывать робота

Sitemap не увеличивает бюджет, но помогает потратить его на нужное. Работает это при трёх условиях, которые нарушаются почти повсеместно.

Смежный материал по теме — «Индексация сайта: что это такое и как она работает».

В карте только страницы, которые должны быть в поиске. Не закрытые от обхода, не отдающие редирект, не удалённые. Каждый такой адрес — потраченное впустую обращение и повод меньше доверять карте целиком.

Дата изменения настоящая. Массовая беда: движок проставляет всем страницам сегодняшнее число при каждой генерации карты. Робот приходит, видит, что ничего не менялось, и перестаёт ориентироваться на этот признак. После этого карта теряет главную функцию — сообщать о свежих правках.

Карта разбита по смыслу. Отдельные файлы для товаров, категорий, статей. Так в отчётах Вебмастера видно, какая часть сайта индексируется плохо, — а на одном общем файле эта информация не собирается.

Полезное дополнение для сайтов, где важна скорость попадания в поиск, — отправка адресов через API переобхода в Вебмастере и через IndexNow. Это не расширяет бюджет и не гарантирует индексацию, но заметно сокращает время до первого визита робота на новую страницу.

Порядок работ

Шаг Действие Результат
1 Выгрузить логи за месяц, отфильтровать по агентам роботов Факт вместо предположений: на что уходят обращения
2 Посчитать распределение по кодам ответа и по типам адресов Список источников утечки в порядке размера
3 Замерить время ответа сервера по типам страниц Понимание, упирается ли всё в скорость
4 Закрыть генерацию мусорных адресов на уровне движка Проблема перестаёт воспроизводиться, а не маскируется
5 Починить цепочки редиректов и внутренние ссылки на них Освобождение заметной доли обращений
6 Привести карту сайта в порядок, включая честный lastmod Робот снова ориентируется на карту
7 Сократить вложенность важных разделов, убрать сирот Приоритет обхода смещается к нужным страницам
8 Через месяц повторить разбор логов Проверка эффекта на тех же цифрах, что и до работ

Восьмой шаг обязателен. Работы по краулинговому бюджету не дают эффектной картинки: позиции не взлетают, а число страниц в поиске меняется медленно. Единственное честное подтверждение — сравнение распределения обращений робота до и после. Если доля обращений к полезным страницам выросла с сорока процентов до семидесяти, работа сделана, даже когда остальные графики ещё стоят на месте.

Частые вопросы

Можно ли попросить поисковик обходить сайт чаще? Настройка скорости обхода в Вебмастере позволяет ограничить нагрузку или вернуть автоматический режим, но не увеличить бюджет сверх того, который поиск посчитал разумным. Единственный работающий путь — ускорить ответ сервера и дать роботу поводы приходить: обновления и внутренние ссылки на них.

Правда ли, что удаление старых статей улучшает индексацию? Иногда да, но удаление — крайняя мера. Сначала стоит разобраться, почему страницы бесполезны: чаще они не устарели, а дублируют друг друга или не отвечают ни на один реальный запрос. Объединение нескольких слабых материалов в один сильный обычно лучше удаления, потому что сохраняет накопленные ссылки.

Что делать с фильтрами в большом каталоге? Разделить на три группы. Комбинации с подтверждённым спросом — открыть и оформить как посадочные страницы. Комбинации без спроса, но полезные людям — оставить доступными и закрыть от обхода. Технический мусор вроде сортировок — закрыть полностью. Решение принимается по данным спроса, а не по внутреннему ощущению.

Влияет ли краулинговый бюджет на позиции? Напрямую нет. Он влияет на то, попадёт ли страница в поиск и как быстро поиск увидит её изменения. Страница, которую робот не обошёл, не ранжируется вовсе — в этом смысле связь есть, но это связь через индексацию, а не через качество страницы.

Сколько ждать эффекта от чистки? Первые изменения в статистике обхода видны через две-четыре недели, устойчивая картина — через два-три месяца. Быстрее реагируют небольшие сайты, у крупных каталогов перераспределение внимания робота идёт медленно и постепенно.

Нужно ли закрывать страницы пагинации от обхода? Обычно нет: через них робот попадает к товарам, и полное закрытие часто ухудшает индексацию каталога. Правильнее сократить необходимость в глубокой пагинации — добавить подкатегории и точки входа, а также убрать ссылки на заведомо пустые страницы за пределами реального числа позиций.

Коротко

  • Краулинговый бюджет складывается из предела нагрузки на сервер и потребности поиска в обходе; расширить его напрямую нельзя, можно освободить и ускорить.
  • Тема практически значима от нескольких тысяч страниц, а также на любом сайте с медленным ответом сервера или частыми обновлениями.
  • Единственный честный источник данных — логи сервера: топ адресов по обращениям, распределение по кодам ответа и разделы, куда робот не заходил ни разу.
  • Больше всего бюджета съедают фильтры и сортировки, внутренний поиск, цепочки редиректов и битые внутренние ссылки.
  • Robots.txt управляет обходом, noindex — индексацией; одновременно они не работают, а nofollow как способ экономии бюджета не работает вовсе.
  • Результат проверяется повторным разбором логов через месяц: важна доля обращений к полезным страницам, а не позиции в тот же период.

Если по вашему сайту видно, что в поиск попадает меньшая часть страниц, а причина неочевидна — фильтры, скорость сервера или структура, — приходите на SEO-консультацию: посмотрим отчёты Вебмастера и выборку из логов и определим, что съедает обход именно у вас.

Увеличьте позиции и продажи вашего сайта

Профессиональное SEO-продвижение с гарантией результата. Выберите подходящую услугу:

Анатолий Кузнецов — SEO-оптимизатор

Остались вопросы по продвижению?

Меня зовут Анатолий Кузнецов, я SEO-оптимизатор с 20-летним стажем. Разберу ваш сайт, отвечу на вопросы и подскажу, что улучшить для роста позиций в Яндексе и Google.

Связаться со мной →

Комментарии

Максим Иноземцев

Разобрал логи впервые за всё время. В топе обращений робота оказалась страница внутреннего поиска с пустым запросом — на неё уходило больше обращений, чем на весь каталог. Ссылка на неё стояла в футере со времён прошлого разработчика.

Анатолий Кузнецов автор

Классическая находка, и хорошо, что вы дошли до причины, а не просто закрыли адрес. Уберите саму ссылку из футера — пока она есть, робот будет считать страницу важной, ведь на неё ссылается весь сайт. Дальше закройте раздел поиска в robots.txt целиком по маске, а не один конкретный адрес: параметров у поиска обычно много. И проверьте по логам за следующий месяц, не появились ли адреса поиска с внешних сайтов — такое бывает, если раздел когда-то попал в чужие подборки ссылок.

Евгения Жучкова

Про честный lastmod — прямо про нас. Движок ставил всем страницам дату генерации карты, то есть сегодняшнюю. Поправили, чтобы бралась дата последней правки, и робот заметно быстрее стал подхватывать изменения в карточках.

Владислав Зотов

Не могу согласиться с порогом в пятьсот страниц. У нас сайт услуг на восемьдесят страниц, и половина не в индексе месяцами. Тема с бюджетом получается актуальна и на маленьких сайтах, просто причины другие?

Анатолий Кузнецов автор

Причины другие, и это важно различать: на восьмидесяти страницах бюджет не может быть узким местом физически. Робот обходит такой сайт целиком за один визит. Значит, страницы не в поиске не потому, что до них не дошли, а потому, что их посмотрели и не взяли. Смотрите в Вебмастере раздел исключённых страниц и причину напротив каждой: чаще всего это дубли, недостаточное качество или ошибки ответа. Дубли лечатся склейкой и разведением по разным запросам, качество — тем, что страница должна отвечать на конкретный спрос, а не быть заготовкой на двести знаков. Логи в вашем случае тоже полезны, но как проверка: если робот заходил, а страница не в индексе, вопрос точно не в обходе.

Лариса Ипатова

Таблица про robots.txt и noindex — то, что стоило прочитать три года назад. Мы закрыли в robots тысячи страниц фильтров, они годами висели в выдаче без описания, и никто не понимал, почему они не уходят.

Тимур Ишков

Добавлю про время ответа. У нас категории отдавались быстро, а карточки по полторы секунды — на каждой загрузке пересчитывались остатки по складам. Вынесли пересчёт в фоновую задачу, время упало до двухсот миллисекунд, обход вырос сам собой.

Ирина Железнова

Вопрос по фильтрам. Как понять, у какой комбинации есть спрос, если их технически возможно собрать несколько десятков тысяч? Перебирать всё в Вордстате нереально, а ошибиться с выбором не хочется.

Анатолий Кузнецов автор

Перебирать всё и не нужно, работает отсечение по уровням. Первое: открывайте только комбинации из одного-двух параметров, три и больше почти никогда не имеют спроса. Второе: берите не все параметры подряд, а те, которыми люди реально формулируют запрос, — обычно это бренд, размер, назначение и материал, а не артикул или вес упаковки. Третье: посмотрите статистику собственного каталога, какие фильтры чаще всего выбирают посетители, — это бесплатная выборка по вашей нише. Полученный список из нескольких сотен комбинаций уже можно прогнать через Вордстат или Rush Analytics и оставить те, у которых спрос есть. Остальное закрывайте от обхода.

Софья Ирисова

Нашли у себя календарь событий, который генерировал ссылки на месяцы до 2035 года. Робот исправно ходил по всем. Ограничили горизонт двумя месяцами вперёд — и в логах освободилась примерно пятая часть обращений.

Анатолий Кузнецов автор

Календари и архивы — недооценённый источник утечки, потому что визуально они безобидны: одна стрелка «следующий месяц» порождает бесконечную последовательность. Раз горизонт вы уже ограничили, доведите до конца ещё три вещи. Уберите ссылки на месяцы без событий: пустая страница ничем не полезна ни человеку, ни роботу. Проверьте, не попали ли адреса будущих месяцев в карту сайта — их оттуда надо вычистить, иначе робот продолжит по ним ходить. И посмотрите, нет ли похожей конструкции в архиве по годам и по тегам: механизм там точно такой же, а замечают его гораздо реже.

Артур Жмурко

Про восьмой шаг с повторным разбором логов согласен полностью. Без него владельцу невозможно объяснить, за что заплачено: позиции не выросли, трафик тот же, а работа сделана большая. Сравнение двух распределений закрывает вопрос за минуту.

Кристина Зуйкова

У нас цепочки редиректов достались в наследство от двух переездов подряд: старый адрес вёл на промежуточный, тот на текущий. В логах на переходы уходило заметно больше десятой части обращений. Переписали правила на конечные адреса напрямую.

Денис Иевлев

Спорный для меня момент — совет не закрывать пагинацию. У нас в каталоге списки по шестьсот страниц, робот тонет в них и до новых товаров добирается неделями. Пока не нашёл решения лучше, чем частично их закрыть.

Анатолий Кузнецов автор

Шестьсот страниц в одном списке — это симптом, а закрытие пагинации будет лечением симптома. Сначала проверьте, сколько позиций выводится на страницу: увеличение с двадцати до шестидесяти сразу сокращает список втрое и обычно не вредит людям. Второе: такой длинный список почти всегда означает, что категория слишком широкая, и её пора делить на подкатегории — это заодно даёт новые посадочные страницы под спрос. Третье: добавьте роботу короткие пути к новым товарам — блок новинок в категории и отдельный файл карты сайта только для свежих позиций. После этих трёх шагов вопрос о закрытии пагинации обычно снимается сам.

Галина Жегалина

Разбила карту сайта на отдельные файлы по типам, как советуете. Сразу стало видно, что статьи индексируются почти полностью, а карточки товаров — примерно наполовину. На общем файле эта разница просто не была заметна.

Станислав Зубов

Добавлю неочевидное: у нас всплеск ошибок 5xx длился около часа при обновлении движка, а частота обхода восстанавливалась потом почти три недели. Теперь любые работы делаем с заглушкой, отдающей корректный код, а не с падением сервера.

Оставьте комментарий

Ваш адрес email не будет опубликован. Обязательные поля помечены *

 Нажимая «оставить комментарий» вы принимаетеправила конфиденциальности 

Прокрутить вверх