
Сайт из ста страниц ещё можно просмотреть руками. Сайт из десяти тысяч — уже нет, и именно там прячутся вещи, из-за которых половина каталога годами не появляется в поиске. Программа обхода, или краулер, за час делает то, на что человек потратил бы недели: проходит по всем внутренним ссылкам, скачивает каждую страницу и складывает её характеристики в таблицу. Я в SEO с 2005 года и начинаю работу с любым проектом именно с обхода — до того, как обсуждать запросы и тексты.
Что делает программа обхода
Логика работы простая и повторяет поведение поискового робота. Краулеру даётся стартовый адрес. Он запрашивает страницу, получает код ответа сервера и HTML, извлекает из кода все ссылки, добавляет новые адреса в очередь и повторяет процедуру, пока очередь не опустеет. Попутно с каждой страницы снимаются десятки характеристик.
- Код ответа — доступна страница, перенаправляется или отдаёт ошибку.
- Заголовок и описание — есть ли, уникальны ли, какой длины.
- Заголовки в тексте — сколько первого уровня, соблюдена ли иерархия.
- Канонический адрес — указывает ли страница на себя или на другую.
- Директивы индексации — не закрыта ли страница от поиска.
- Объём текста — сколько слов в основном содержимом.
- Изображения — вес, наличие альтернативного описания.
- Внутренние ссылки — сколько ведёт на страницу и сколько уходит с неё.
- Скорость ответа — за сколько сервер отдал документ.
На выходе получается таблица, где каждая строка — страница, а столбцы — эти характеристики. Дальше начинается работа: превращение таблицы в список задач.
Чем краулер отличается от поискового робота
Путаница здесь встречается часто, а разница принципиальная. Оба обходят сайт по ссылкам, но цели и последствия у них разные.
| Признак | Программа обхода | Поисковый робот |
|---|---|---|
| Кто запускает | Вы, в нужный момент | Поисковая система, по своему графику |
| Цель | Собрать данные о состоянии сайта | Найти и обновить страницы для индекса |
| Влияние на выдачу | Никакого | Прямое: что обошёл, то и может ранжироваться |
| Границы обхода | Задаёте вы: раздел, глубина, число страниц | Определяются алгоритмом и лимитом обхода |
| Результат | Выгрузка в таблицу | Изменения в индексе |
| Отношение к запретам | По умолчанию учитывает, но можно игнорировать | Соблюдает |
Отсюда важное следствие: краулер показывает, что увидел бы робот при обходе, но не гарантирует, что робот пришёл к тем же выводам. Поэтому выгрузку всегда сверяют с реальными данными панелей вебмастера: что в индексе, какие ошибки видит сама поисковая система, какие страницы она считает дублями.
Какие проблемы находит обход
| Проблема | Как выглядит в выгрузке | Чем грозит |
|---|---|---|
| Битые ссылки | Код ответа 404 у страниц, на которые есть внутренние ссылки | Потеря посетителей и распыление внутреннего веса |
| Цепочки перенаправлений | Два и более переходов до конечного адреса | Замедление обхода, потеря части сигналов |
| Дубли заголовков | Одинаковый заголовок у десятков страниц | Страницы конкурируют между собой, поиск выбирает не ту |
| Пустые страницы | Минимальный объём текста при коде 200 | Раздувание индекса малополезными документами |
| Ошибки канонических адресов | Указание на несуществующую или чужую страницу | Из индекса выпадают нужные страницы |
| Случайные запреты индексации | Директива запрета на коммерческих страницах | Раздел вообще не участвует в поиске |
| Сироты | Страницы есть в карте сайта, но не найдены по ссылкам | Робот доходит до них редко или не доходит |
| Тяжёлые изображения | Картинки в несколько мегабайт | Медленная загрузка, особенно на мобильных |
| Большая глубина вложенности | До страницы больше четырёх-пяти кликов от главной | Товары обходятся редко и хуже ранжируются |
Краулер создаёт нагрузку: он запрашивает страницы в несколько потоков и на слабом хостинге способен положить сайт. Поэтому перед первым обходом крупного проекта я всегда снижаю скорость и предупреждаю администратора.
Второй момент — границы. Обходить весь сайт целиком нужно не всегда. Если задача — проверить каталог, ограничьте обход разделом. Отдельно решите, обходить ли адреса с параметрами: на магазинах с фильтрами их бывают сотни тысяч, и обход уйдёт в бесконечность. Третий момент — режим отрисовки. Если содержимое подгружается скриптами, обычный обход увидит пустые страницы; в таком случае включают режим с выполнением скриптов, он медленнее, но показывает реальную картину.
Как читать выгрузку
Самая частая ошибка новичков — открыть отчёт, увидеть три тысячи предупреждений и закрыть его. Отчёт нужно читать в определённом порядке, от смертельного к косметическому.
- Шаг первый — доступность. Смотрим коды ответа. Всё, что отдаёт ошибки сервера, разбираем немедленно.
- Шаг второй — индексация. Проверяем страницы, закрытые директивами или запретом обхода. Если среди них есть коммерческие разделы, это находка дня.
- Шаг третий — канонические адреса. Ищем страницы, указывающие на другие, и понимаем, намеренно ли это.
- Шаг четвёртый — дубли. Сортируем по заголовку и описанию, находим массовые совпадения.
- Шаг пятый — структура. Смотрим глубину вложенности и число входящих ссылок: важные страницы не должны иметь одну-две.
- Шаг шестой — содержимое. Пустые страницы, отсутствующие заголовки, картинки без описаний.
- Шаг седьмой — скорость. Самые медленные и тяжёлые страницы.
Обратите внимание: сервисы помечают многое красным цветом, но красная метка не равна проблеме. Например, «слишком длинный заголовок» на странице, которая отлично ранжируется, трогать не нужно. Здравый смысл важнее счётчика ошибок — этому, кстати, отдельно учат на нормальных программах обучения SEO, потому что слепое исправление всех предупреждений отнимает месяцы и не даёт результата.
Как превратить отчёт в задачи
| Приоритет | Что попадает | Формулировка задачи |
|---|---|---|
| Критично | Ошибки сервера, закрытые от индексации нужные разделы, неверные канонические адреса | Конкретный список адресов и требуемое поведение |
| Высокий | Массовые дубли заголовков, битые внутренние ссылки, цепочки перенаправлений | Правило генерации заголовков, замена ссылок на конечные адреса |
| Средний | Глубина вложенности, страницы без входящих ссылок, тонкое содержимое | Изменение перелинковки, объединение или удаление страниц |
| Низкий | Длина описаний, отсутствие альтернативных подписей, вес отдельных картинок | Пакетная правка при следующем обновлении |
Задача должна быть сформулирована так, чтобы разработчик мог её выполнить, не читая ваш отчёт. Не «исправить дубли», а «на страницах фильтров по адресам такого-то вида формировать заголовок по шаблону и указывать канонический адрес на страницу категории». К каждой задаче прикладывается выгрузка с конкретными адресами. Такой список и есть основной результат, ради которого проводится аудит сайта, — дальше он превращается в план работ и в понятную смету на доработку сайта.
Практический разбор: обход интернет-магазина
Типичная картина. Магазин, около восьми тысяч товаров, продвижение идёт год, каталог в поиске почти не виден. Запускаю обход с ограничением по разделу каталога и без выполнения скриптов, потом повторяю с выполнением — сравниваю.
Первое, что вылезает: в обычном режиме у товарных карточек пустое описание, а в режиме со скриптами оно появляется. Значит, характеристики подгружаются после загрузки страницы, и часть содержимого робот может не увидеть. Второе: глубина вложенности до карточек — семь кликов, потому что каталог разбит на страницы по двенадцать товаров. Третье: у полутора тысяч карточек одинаковый заголовок вида «Купить товар в интернет-магазине», потому что шаблон не подставляет название. Четвёртое: тысячи адресов фильтров без канонических указаний.
Список задач из этого получается короткий, но тяжёлый: выводить характеристики в исходном коде, увеличить число товаров на странице и добавить перелинковку между карточками, починить шаблон заголовков, настроить обработку фильтров. Ни одна из этих задач не про тексты и не про ссылки — и при этом до их решения любые другие работы дадут мало.
Чего делать не стоит
- Запускать обход в полную силу днём на боевом сервере. Скорость снижают заранее, обход крупного сайта лучше делать в ночные часы.
- Исправлять всё подряд по списку предупреждений. Сначала то, что мешает индексации и продажам, остальное — по остаточному принципу.
- Считать выгрузку истиной в последней инстанции. Данные всегда сверяются с панелями вебмастера и аналитикой.
- Обходить сайт один раз в год. Изменения в шаблонах ломают вещи молча, обход нужен после каждого крупного обновления.
- Удалять страницы с малым объёмом текста автоматически. Среди них бывают нужные разделы контактов, доставки, служебные страницы.
- Игнорировать сравнение с картой сайта. Разница между картой и результатом обхода находит сирот быстрее всего.
Частые вопросы
Как часто нужно обходить сайт? Небольшой сайт — раз в квартал и после каждого обновления шаблона. Крупный магазин с активной разработкой — ежемесячно, а критичные разделы чаще.
Заменяет ли обход панели вебмастера? Нет, они дополняют друг друга. Краулер видит сайт целиком и сразу, панель показывает, что об этом думает поисковая система и как ведут себя реальные посетители.
Почему число страниц в обходе не совпадает с числом в индексе? Это нормально. Часть страниц закрыта, часть признана дублями, часть робот ещё не посетил. Большой разрыв — сигнал проверить директивы и качество страниц.
Нужно ли выполнять скрипты при обходе? Если сайт собран на современном фреймворке или содержимое подгружается динамически — обязательно, иначе картина будет ложной. Для обычного сайта на распространённой системе управления достаточно быстрого режима.
Можно ли обходить чужой сайт? Технически да, и для анализа структуры конкурентов это обычная практика. Но нагрузку нужно держать минимальной и не игнорировать запреты в правилах обхода.
Чеклист работы с обходом
- Перед запуском выставлены ограничение скорости и границы обхода.
- Решено, обходить ли адреса с параметрами и выполнять ли скрипты.
- Проверены коды ответа, ошибки сервера разобраны первыми.
- Найдены страницы, закрытые от индексации по ошибке.
- Проверены канонические адреса на соответствие замыслу.
- Найдены массовые дубли заголовков и описаний.
- Оценена глубина вложенности важных страниц.
- Результат сверен с картой сайта для поиска страниц-сирот.
- Данные сопоставлены с панелями вебмастера и аналитикой.
- Отчёт превращён в приоритизированный список задач с конкретными адресами.
Обход — не разовая процедура и не отчёт для галочки. Это способ видеть сайт таким, каким его встречает робот, и находить проблемы раньше, чем они отразятся на трафике. Час работы программы обычно экономит месяцы гаданий о том, почему раздел не растёт.
Если нужно SEO-продвижение сайтов — помогу вывести сайт в топ Яндекса и удержать позиции.
Увеличьте позиции и продажи вашего сайта
Профессиональное SEO-продвижение с гарантией результата. Выберите подходящую услугу:
Остались вопросы по продвижению?
Меня зовут Анатолий Кузнецов, я SEO-оптимизатор с 20-летним стажем. Разберу ваш сайт, отвечу на вопросы и подскажу, что улучшить для роста позиций в Яндексе и Google.
Связаться со мной →