
Поисковый робот — это программа, которая скачивает страницы сайта и передаёт их дальше по конвейеру поисковой системы: на обработку, индексирование и ранжирование. Владельцу сайта робот виден только по косвенным признакам — по записям в логах сервера, по отчётам в Яндекс.Вебмастере и Google Search Console, по внезапно выросшей нагрузке на хостинг. Между тем именно от того, как робот ходит по сайту, зависит базовая вещь: попадут ли ваши страницы в индекс вообще и как быстро туда попадут изменения, которые вы вносите.
Я в SEO с 2005 года и за это время видел десятки сайтов, у которых «не работало продвижение» ровно по одной причине: половина важных страниц просто не была скачана роботом. Не переоптимизирована, не под фильтром — а физически не обойдена. Ниже разберу, как устроен обход в 2026 году, кто ещё, кроме Яндекса и Google, стучится к вам на сервер и какими инструментами обходом можно управлять.
Чем робот отличается от браузера и почему это важно
Обычный браузер загружает страницу целиком: HTML, стили, скрипты, шрифты, картинки, — а потом исполняет JavaScript и показывает результат человеку. Робот делает то же самое, но с оговорками, и каждая из них превращается в источник проблем.
- Робот не обязан исполнять JavaScript сразу. Основной обход у Яндекса и Google — это скачивание исходного HTML. Рендеринг с исполнением скриптов идёт вторым этапом, отдельной очередью, и до неё страница может доехать через часы или дни. Если весь контент подгружается скриптом, вы фактически ставите сайт в конец очереди.
- Робот не имеет истории и авторизации. Он приходит «с нуля»: без кук, без сессии, без корзины. Всё, что показывается только авторизованному пользователю или только после клика, для робота не существует.
- Робот ограничен по времени и объёму. Если сервер отвечает три секунды, робот скачает за тот же промежуток времени втрое меньше страниц, чем на быстром сайте.
- Робот ходит не непрерывно, а порциями. Он планирует визиты, ставит адреса в очередь, распределяет приоритеты и возвращается к странице через интервал, который сам же и вычисляет.
Практический вывод простой: всё, что вы хотите видеть в поиске, должно быть доступно по обычной ссылке в HTML, отдаваться кодом 200 и грузиться быстро. Всё остальное — вопрос настройки, а не удачи.
Кто ходит по вашему сайту в 2026 году
Ещё лет пять назад список посетителей-роботов был коротким: два поисковика и мониторинг доступности. Сейчас заметную долю обхода дают краулеры ИИ-компаний и агрегаторов данных.
| Кто | Зачем ходит | Что даёт сайту | Пускать? |
|---|---|---|---|
| YandexBot и его подвиды (основной, картиночный, быстрый робот новостей) | Индексирование для органической выдачи Яндекса | Трафик из Яндекса — для России это основной источник | Обязательно |
| Googlebot (Smartphone, Image, Video) | Индексирование для Google | Трафик из Google, доля на российском рынке заметно ниже Яндекса, но игнорировать нельзя | Обязательно |
| Роботы Вебмастера и Search Console (проверка страниц, валидация разметки) | Сервисные проверки по вашему же запросу | Диагностика | Обязательно |
| ИИ-краулеры обучающего типа (собирают тексты для тренировки моделей) | Сбор корпуса данных | Прямого трафика не дают | Спорно — см. отдельный раздел |
| ИИ-краулеры ответного типа (ходят на сайт в момент, когда пользователь задал вопрос ассистенту) | Достать актуальный факт и процитировать источник | Упоминание бренда и переходы из ИИ-ответов | Как правило, да |
| SEO-сервисы (анализ ссылочного, парсеры конкурентов) | Наполнение собственных баз | Ничего, кроме нагрузки; иногда — данные о вас конкурентам | По желанию |
| Скраперы контента и парсеры цен | Копирование текстов, мониторинг ваших цен | Вред | Блокировать |
| Ботнеты накрутки поведенческих | Имитация пользователей | Вред: искажают статистику, могут спровоцировать санкции | Блокировать на уровне сервера |
Важная деталь: User-agent — это просто строка, которую отправляет клиент, и подделать её может кто угодно. Поэтому для настоящих поисковых роботов проверка идёт не по названию, а по IP: делается обратный DNS-запрос, а затем прямой — доменное имя должно принадлежать поисковику и резолвиться обратно в тот же адрес. У Яндекса это домены вида yandex.ru, yandex.net, yandex.com, у Google — googlebot.com и google.com. Всё, что называет себя роботом поисковика, но не проходит эту проверку, — маскировка, и её нужно резать.
Как робот решает, что и когда скачать
Обход — это не сплошное чтение сайта от первой страницы до последней. Это работа с очередью адресов, у каждого из которых есть приоритет. Планировщик поисковика собирает адреса из нескольких источников:
- Ссылки на уже обойдённых страницах — базовый и самый весомый способ. Если на страницу нет ни одной внутренней ссылки, робот про неё, скорее всего, не узнает.
- Файл Sitemap.xml — список адресов, который вы предоставляете сами. Это подсказка, а не приказ: попадание в sitemap не гарантирует обход и тем более индексирование.
- Внешние ссылки с других сайтов.
- История — адреса, которые робот уже знает и периодически перепроверяет, даже если ссылок на них больше нет.
- Данные счётчиков — Яндекс открыто использует Метрику как источник информации о новых страницах.
Приоритет внутри очереди зависит от «важности» страницы (сколько на неё внутренних и внешних ссылок, какой уровень вложенности) и от частоты её изменения. Раздел новостей робот может обходить несколько раз в сутки, страницу «О компании» — раз в месяц. Частота вычисляется: если робот десять раз пришёл и увидел один и тот же контент, интервал вырастет.
Краулинговый бюджет: кому о нём думать
Краулинговый бюджет — это то количество обращений, которое поисковик готов потратить на ваш сайт за единицу времени. Складывается оно из двух вещей: сколько сервер способен выдержать без деградации и сколько поисковик считает нужным потратить, исходя из ценности сайта.
Первую часть робот определяет опытным путём: наращивает частоту запросов и смотрит на время ответа и коды. Пошли пятисотые ошибки или ответ вырос до нескольких секунд — темп снижается. Вторую часть определяет качество: сайт с уникальным востребованным контентом обходится охотнее, чем свалка из шаблонных страниц.
Честный ответ на вопрос «нужно ли мне заниматься краулинговым бюджетом»:
| Тип сайта | Примерный объём | Насколько критичен бюджет | Что делать |
|---|---|---|---|
| Сайт услуг, лендинг, небольшой корпоративный | до 500 страниц | Практически не важен | Следить, чтобы не было мусорных дублей, и всё |
| Блог, СМИ | 1–20 тыс. | Важна скорость доставки свежего | Sitemap с датами, корректный Last-Modified, перелинковка со свежих на свежее |
| Интернет-магазин с фильтрами | 10–500 тыс. и больше в потенциале | Критичен | Управление фильтрами, канонические адреса, чистка пагинации |
| Агрегатор, доска, классифайд | от 500 тыс. | Определяющий фактор | Приоритизация разделов, отдельные sitemap по типам, работа с 304-ответами |
Главный пожиратель бюджета в интернет-магазинах — комбинаторика фильтров. Пять параметров по пять значений дают тысячи адресов, из которых полезны единицы. Робот честно уходит их обходить, а карточки новых товаров в это время ждут своей очереди. Второй по массовости пожиратель — параметры сортировки, отображения, UTM-метки и идентификаторы сессий, которые плодят копии одной страницы под десятком адресов.
Инструменты управления обходом и индексированием
Их немного, и путаница между ними — источник большинства ошибок. Ключевое различие: одни инструменты влияют на обход (пойдёт ли робот на адрес), другие — на индексирование (попадёт ли страница в базу и в выдачу). Это разные вещи.
| Инструмент | На что влияет | Где задаётся | Когда применять |
|---|---|---|---|
| robots.txt, директива Disallow | На обход. Страница может остаться в выдаче со ссылкой без описания | Файл в корне домена | Служебные разделы, скрипты корзины, бесконечные фильтры |
| Clean-param | Склеивает адреса с незначащими параметрами, экономит обход. Директива Яндекса | robots.txt | UTM-метки, сортировки, идентификаторы |
| meta name=»robots» content=»noindex» | На индексирование. Страница обходится, но не показывается | Секция head страницы | Страницы поиска по сайту, тонкие теги, черновики |
| X-Robots-Tag | То же, что meta robots, но для нетекстовых файлов | HTTP-заголовок сервера | PDF, документы, изображения |
| rel=»canonical» | Указывает предпочтительный адрес среди дублей. Рекомендация, не приказ | Секция head | Пагинация, версии с параметрами, товар в нескольких категориях |
| Sitemap.xml с lastmod | Подсказывает список адресов и даты изменения | Файл + указание в robots.txt и Вебмастере | Всегда, обязательный гигиенический минимум |
| Last-Modified и ответ 304 | Позволяет роботу не качать неизменившееся | Заголовки сервера | Крупные сайты, где обход упирается в объём |
| Переобход по запросу | Ручное ускорение для конкретных адресов | Вебмастер, Search Console, IndexNow | Срочные правки, новые важные страницы |
Отдельно про частую ошибку: закрыть страницу в robots.txt и одновременно поставить на ней noindex — бессмысленно. Робот не пойдёт на страницу и не увидит метатег, а адрес продолжит висеть в выдаче. Если нужно убрать страницу из поиска — оставьте её открытой для обхода и поставьте noindex. Если нужно просто не тратить на неё обход — закрывайте в robots.txt, но только когда её присутствие в выдаче вас не смущает.
ИИ-краулеры: пускать или закрывать
Это самая свежая часть темы и та, где мне чаще всего задают вопросы. К 2026 году сформировались две категории ИИ-ботов, и относиться к ним нужно по-разному.
Обучающие краулеры собирают тексты в корпус для тренировки моделей. Никакого трафика вам это не даёт: ваш материал растворяется в весах модели без ссылки и упоминания. Аргумент «за» — присутствие в обучающей выборке косвенно повышает шанс, что модель вообще знает о вашем бренде. Аргумент «против» — вы бесплатно отдаёте контент, на который потратили деньги.
Ответные краулеры ходят на сайт в момент, когда пользователь задал ассистенту вопрос: модель ищет свежий факт и, как правило, приводит источник со ссылкой. Здесь блокировка означает добровольный отказ от нового канала. По моим наблюдениям, доля переходов из ИИ-ответов у информационных сайтов растёт, и на некоторых проектах она уже сопоставима с трафиком из соцсетей.
Практическая рекомендация, которую я даю клиентам:
- Медиа, блоги, справочники — обучающие краулеры закрывать имеет смысл, ответные оставлять открытыми.
- Бизнес, который продаёт услуги и товары, — пускать всех: упоминание в ответе ассистента работает как реклама.
- Сайты с чувствительными данными — закрывать целиком и проверять, что закрытое защищено авторизацией, а не строчкой в robots.txt.
И главная оговорка: robots.txt — это соглашение, а не защита. Уважающий правила краулер директиву выполнит, недобросовестный парсер её проигнорирует. Если контент нужно защитить по-настоящему, работают только серверные средства: ограничение частоты запросов, блокировка по IP и сетям, проверка подлинности робота, а для действительно ценного — авторизация.
Когда управление обходом не поможет
Мне регулярно приносят задачу «настройте краулинговый бюджет, у нас страницы не в индексе», и в половине случаев проблема не в обходе вовсе. Вот ситуации, где чинить нужно другое:
- Страницы обходятся, но не индексируются. В Вебмастере они висят в статусе «недостаточно качественная». Это оценка контента, а не обхода. Никакой sitemap и никакой переобход не помогут — нужно переделывать сами страницы.
- Массовые дубли по смыслу. Сто страниц под сто городов с одинаковым текстом и заменённым названием города обойдутся все, а в индексе останется одна. Лечится уникализацией, а не техникой.
- Сайт под санкциями. Если наложен фильтр за накрутку поведенческих или за ссылочный спам, обход может идти прекрасно, а позиций не будет.
- Молодой сайт без ссылочного окружения. Первые недели индексирование идёт медленно: у поисковика нет оснований считать сайт заслуживающим частых визитов. Лечится временем, а не настройками.
- Хостинг не тянет. Если сервер отдаёт страницу по три секунды, любые оптимизации карты сайта разобьются о физику.
Частые ошибки, которые я вижу в аудитах
- Тестовый robots.txt уехал на боевой сайт. Классика:
Disallow: /после переноса с разработки. Проверять в первый же день после релиза. - Закрыты CSS и JS. Робот не может отрисовать страницу и видит её иначе, чем пользователь. В 2026 году это прямой путь к недооценке мобильной версии.
- Sitemap с 404-ми и редиректами. Карта, где половина адресов не отвечает 200, обесценивает сам файл как источник.
- Фальшивый lastmod. Массовая простановка сегодняшней даты всем страницам — робот быстро понимает, что даты врут, и перестаёт на них смотреть.
- Пагинация без canonical и без noindex. Тысячи страниц второго-третьего уровня едят обход и создают дубли.
- Бесконечные календари и фильтры. Календарь событий, который позволяет листать до 2099 года, порождает бесконечное дерево адресов.
- Мягкие 404. Страница «ничего не найдено» отдаёт код 200. Робот считает её нормальной и индексирует тысячами.
- Цепочки редиректов и блокировка по User-agent без проверки IP. В первом случае теряется вес, во втором под раздачу попадают настоящие роботы поисковиков.
Что это стоит и как проверить самому
Ориентиры по рынку на 2026 год, Россия. Технический аудит с разбором обхода и индексирования — от 25 000 до 80 000 рублей в зависимости от объёма сайта. Разовая настройка robots.txt, sitemap и канонических адресов — 10 000–30 000 рублей. Внедрение правок на стороне разработки обычно считают отдельно: 2 500–5 000 рублей за час программиста. Анализ логов сервера как отдельная услуга — от 20 000 рублей.
Самостоятельно базовую диагностику можно сделать бесплатно. Чеклист:
- Откройте robots.txt по адресу вашсайт/robots.txt и прочитайте его глазами. Убедитесь, что нет
Disallow: /и не закрыты стили и скрипты. - В Яндекс.Вебмастере посмотрите «Статистику обхода»: сколько страниц в день, какая доля кодов 200, есть ли всплески ошибок.
- Там же — «Страницы в поиске»: сравните число загруженных и число попавших в поиск. Большой разрыв означает проблему с качеством, а не с обходом.
- Проверьте, отдаёт ли несуществующий адрес честный код 404. Достаточно открыть вашсайт/проверка-абракадабра.
- Посмотрите в исходном коде страницы (Ctrl+U), виден ли основной текст без исполнения скриптов.
- Проверьте, что sitemap.xml открывается, указан в robots.txt и добавлен в Вебмастере.
- Запросите у хостинга доступ к логам и посмотрите, кто реально ходит по сайту, — часто там обнаруживается, что 70% обращений дают парсеры, а не поисковики.
Управление обходом и краулинговым бюджетом — часть технической доработки. Что мешает роботам на вашем сайте, покажет бесплатная проверка.
Коротко
- Робот — не браузер: он не ждёт исполнения скриптов, не авторизуется и ограничен по времени. Всё важное должно быть в HTML и отвечать кодом 200.
- В 2026 году по сайту ходят не только Яндекс и Google, но и ИИ-краулеры двух типов, SEO-парсеры и откровенные скраперы. Различать их нужно по IP, а не по User-agent.
- Краулинговый бюджет реально важен для магазинов и агрегаторов. Для сайта на двести страниц это не ваша проблема.
- robots.txt управляет обходом, noindex — индексированием. Комбинировать их на одной странице бессмысленно.
- Обучающие ИИ-краулеры можно закрывать, если контент — ваш товар. Ответные лучше пускать: они приводят людей.
- Если страницы обходятся, но не индексируются, дело в качестве контента, и настройками это не лечится.
- Начните с бесплатной диагностики: robots.txt, статистика обхода в Вебмастере, коды ответа, логи сервера. Половина проблем находится за час.
Если нужно продвижение сайта в Яндексе — помогу вывести сайт в топ Яндекса и удержать позиции.
Увеличьте позиции и продажи вашего сайта
Профессиональное SEO-продвижение с гарантией результата. Выберите подходящую услугу:
Остались вопросы по продвижению?
Меня зовут Анатолий Кузнецов, я SEO-оптимизатор с 20-летним стажем. Разберу ваш сайт, отвечу на вопросы и подскажу, что улучшить для роста позиций в Яндексе и Google.
Связаться со мной →
хорошая статья, зачет !
Жаль я не смог найти хорошую статью про то как скрейпить и уроки по скайпу только про SEO .
Собираюсь прокси для скрейпинга закупить, интересуют Smartproxy очень, но где кролера подобрать — не знаю))