Сканер сайта

Анатолий Кузнецов
Анатолий Кузнецов
SEO-оптимизатор с 20-летним стажем. Автор блога hozyindachi.ru о продвижении и доработке сайтов.

Сканер сайта

Сайт из ста страниц ещё можно просмотреть руками. Сайт из десяти тысяч — уже нет, и именно там прячутся вещи, из-за которых половина каталога годами не появляется в поиске. Программа обхода, или краулер, за час делает то, на что человек потратил бы недели: проходит по всем внутренним ссылкам, скачивает каждую страницу и складывает её характеристики в таблицу. Я в SEO с 2005 года и начинаю работу с любым проектом именно с обхода — до того, как обсуждать запросы и тексты.

Что делает программа обхода

Логика работы простая и повторяет поведение поискового робота. Краулеру даётся стартовый адрес. Он запрашивает страницу, получает код ответа сервера и HTML, извлекает из кода все ссылки, добавляет новые адреса в очередь и повторяет процедуру, пока очередь не опустеет. Попутно с каждой страницы снимаются десятки характеристик.

  • Код ответа — доступна страница, перенаправляется или отдаёт ошибку.
  • Заголовок и описание — есть ли, уникальны ли, какой длины.
  • Заголовки в тексте — сколько первого уровня, соблюдена ли иерархия.
  • Канонический адрес — указывает ли страница на себя или на другую.
  • Директивы индексации — не закрыта ли страница от поиска.
  • Объём текста — сколько слов в основном содержимом.
  • Изображения — вес, наличие альтернативного описания.
  • Внутренние ссылки — сколько ведёт на страницу и сколько уходит с неё.
  • Скорость ответа — за сколько сервер отдал документ.

На выходе получается таблица, где каждая строка — страница, а столбцы — эти характеристики. Дальше начинается работа: превращение таблицы в список задач.

Чем краулер отличается от поискового робота

Путаница здесь встречается часто, а разница принципиальная. Оба обходят сайт по ссылкам, но цели и последствия у них разные.

Признак Программа обхода Поисковый робот
Кто запускает Вы, в нужный момент Поисковая система, по своему графику
Цель Собрать данные о состоянии сайта Найти и обновить страницы для индекса
Влияние на выдачу Никакого Прямое: что обошёл, то и может ранжироваться
Границы обхода Задаёте вы: раздел, глубина, число страниц Определяются алгоритмом и лимитом обхода
Результат Выгрузка в таблицу Изменения в индексе
Отношение к запретам По умолчанию учитывает, но можно игнорировать Соблюдает

Отсюда важное следствие: краулер показывает, что увидел бы робот при обходе, но не гарантирует, что робот пришёл к тем же выводам. Поэтому выгрузку всегда сверяют с реальными данными панелей вебмастера: что в индексе, какие ошибки видит сама поисковая система, какие страницы она считает дублями.

Какие проблемы находит обход

Проблема Как выглядит в выгрузке Чем грозит
Битые ссылки Код ответа 404 у страниц, на которые есть внутренние ссылки Потеря посетителей и распыление внутреннего веса
Цепочки перенаправлений Два и более переходов до конечного адреса Замедление обхода, потеря части сигналов
Дубли заголовков Одинаковый заголовок у десятков страниц Страницы конкурируют между собой, поиск выбирает не ту
Пустые страницы Минимальный объём текста при коде 200 Раздувание индекса малополезными документами
Ошибки канонических адресов Указание на несуществующую или чужую страницу Из индекса выпадают нужные страницы
Случайные запреты индексации Директива запрета на коммерческих страницах Раздел вообще не участвует в поиске
Сироты Страницы есть в карте сайта, но не найдены по ссылкам Робот доходит до них редко или не доходит
Тяжёлые изображения Картинки в несколько мегабайт Медленная загрузка, особенно на мобильных
Большая глубина вложенности До страницы больше четырёх-пяти кликов от главной Товары обходятся редко и хуже ранжируются

Как настроить обход, чтобы не навредить

Краулер создаёт нагрузку: он запрашивает страницы в несколько потоков и на слабом хостинге способен положить сайт. Поэтому перед первым обходом крупного проекта я всегда снижаю скорость и предупреждаю администратора.

Второй момент — границы. Обходить весь сайт целиком нужно не всегда. Если задача — проверить каталог, ограничьте обход разделом. Отдельно решите, обходить ли адреса с параметрами: на магазинах с фильтрами их бывают сотни тысяч, и обход уйдёт в бесконечность. Третий момент — режим отрисовки. Если содержимое подгружается скриптами, обычный обход увидит пустые страницы; в таком случае включают режим с выполнением скриптов, он медленнее, но показывает реальную картину.

Как читать выгрузку

Самая частая ошибка новичков — открыть отчёт, увидеть три тысячи предупреждений и закрыть его. Отчёт нужно читать в определённом порядке, от смертельного к косметическому.

  • Шаг первый — доступность. Смотрим коды ответа. Всё, что отдаёт ошибки сервера, разбираем немедленно.
  • Шаг второй — индексация. Проверяем страницы, закрытые директивами или запретом обхода. Если среди них есть коммерческие разделы, это находка дня.
  • Шаг третий — канонические адреса. Ищем страницы, указывающие на другие, и понимаем, намеренно ли это.
  • Шаг четвёртый — дубли. Сортируем по заголовку и описанию, находим массовые совпадения.
  • Шаг пятый — структура. Смотрим глубину вложенности и число входящих ссылок: важные страницы не должны иметь одну-две.
  • Шаг шестой — содержимое. Пустые страницы, отсутствующие заголовки, картинки без описаний.
  • Шаг седьмой — скорость. Самые медленные и тяжёлые страницы.

Обратите внимание: сервисы помечают многое красным цветом, но красная метка не равна проблеме. Например, «слишком длинный заголовок» на странице, которая отлично ранжируется, трогать не нужно. Здравый смысл важнее счётчика ошибок — этому, кстати, отдельно учат на нормальных программах обучения SEO, потому что слепое исправление всех предупреждений отнимает месяцы и не даёт результата.

Как превратить отчёт в задачи

Приоритет Что попадает Формулировка задачи
Критично Ошибки сервера, закрытые от индексации нужные разделы, неверные канонические адреса Конкретный список адресов и требуемое поведение
Высокий Массовые дубли заголовков, битые внутренние ссылки, цепочки перенаправлений Правило генерации заголовков, замена ссылок на конечные адреса
Средний Глубина вложенности, страницы без входящих ссылок, тонкое содержимое Изменение перелинковки, объединение или удаление страниц
Низкий Длина описаний, отсутствие альтернативных подписей, вес отдельных картинок Пакетная правка при следующем обновлении

Задача должна быть сформулирована так, чтобы разработчик мог её выполнить, не читая ваш отчёт. Не «исправить дубли», а «на страницах фильтров по адресам такого-то вида формировать заголовок по шаблону и указывать канонический адрес на страницу категории». К каждой задаче прикладывается выгрузка с конкретными адресами. Такой список и есть основной результат, ради которого проводится аудит сайта, — дальше он превращается в план работ и в понятную смету на доработку сайта.

Практический разбор: обход интернет-магазина

Типичная картина. Магазин, около восьми тысяч товаров, продвижение идёт год, каталог в поиске почти не виден. Запускаю обход с ограничением по разделу каталога и без выполнения скриптов, потом повторяю с выполнением — сравниваю.

Первое, что вылезает: в обычном режиме у товарных карточек пустое описание, а в режиме со скриптами оно появляется. Значит, характеристики подгружаются после загрузки страницы, и часть содержимого робот может не увидеть. Второе: глубина вложенности до карточек — семь кликов, потому что каталог разбит на страницы по двенадцать товаров. Третье: у полутора тысяч карточек одинаковый заголовок вида «Купить товар в интернет-магазине», потому что шаблон не подставляет название. Четвёртое: тысячи адресов фильтров без канонических указаний.

Список задач из этого получается короткий, но тяжёлый: выводить характеристики в исходном коде, увеличить число товаров на странице и добавить перелинковку между карточками, починить шаблон заголовков, настроить обработку фильтров. Ни одна из этих задач не про тексты и не про ссылки — и при этом до их решения любые другие работы дадут мало.

Чего делать не стоит

  • Запускать обход в полную силу днём на боевом сервере. Скорость снижают заранее, обход крупного сайта лучше делать в ночные часы.
  • Исправлять всё подряд по списку предупреждений. Сначала то, что мешает индексации и продажам, остальное — по остаточному принципу.
  • Считать выгрузку истиной в последней инстанции. Данные всегда сверяются с панелями вебмастера и аналитикой.
  • Обходить сайт один раз в год. Изменения в шаблонах ломают вещи молча, обход нужен после каждого крупного обновления.
  • Удалять страницы с малым объёмом текста автоматически. Среди них бывают нужные разделы контактов, доставки, служебные страницы.
  • Игнорировать сравнение с картой сайта. Разница между картой и результатом обхода находит сирот быстрее всего.

Частые вопросы

Как часто нужно обходить сайт? Небольшой сайт — раз в квартал и после каждого обновления шаблона. Крупный магазин с активной разработкой — ежемесячно, а критичные разделы чаще.

Заменяет ли обход панели вебмастера? Нет, они дополняют друг друга. Краулер видит сайт целиком и сразу, панель показывает, что об этом думает поисковая система и как ведут себя реальные посетители.

Почему число страниц в обходе не совпадает с числом в индексе? Это нормально. Часть страниц закрыта, часть признана дублями, часть робот ещё не посетил. Большой разрыв — сигнал проверить директивы и качество страниц.

Нужно ли выполнять скрипты при обходе? Если сайт собран на современном фреймворке или содержимое подгружается динамически — обязательно, иначе картина будет ложной. Для обычного сайта на распространённой системе управления достаточно быстрого режима.

Можно ли обходить чужой сайт? Технически да, и для анализа структуры конкурентов это обычная практика. Но нагрузку нужно держать минимальной и не игнорировать запреты в правилах обхода.

Чеклист работы с обходом

  • Перед запуском выставлены ограничение скорости и границы обхода.
  • Решено, обходить ли адреса с параметрами и выполнять ли скрипты.
  • Проверены коды ответа, ошибки сервера разобраны первыми.
  • Найдены страницы, закрытые от индексации по ошибке.
  • Проверены канонические адреса на соответствие замыслу.
  • Найдены массовые дубли заголовков и описаний.
  • Оценена глубина вложенности важных страниц.
  • Результат сверен с картой сайта для поиска страниц-сирот.
  • Данные сопоставлены с панелями вебмастера и аналитикой.
  • Отчёт превращён в приоритизированный список задач с конкретными адресами.

Обход — не разовая процедура и не отчёт для галочки. Это способ видеть сайт таким, каким его встречает робот, и находить проблемы раньше, чем они отразятся на трафике. Час работы программы обычно экономит месяцы гаданий о том, почему раздел не растёт.

Если нужно SEO-продвижение сайтов — помогу вывести сайт в топ Яндекса и удержать позиции.

Увеличьте позиции и продажи вашего сайта

Профессиональное SEO-продвижение с гарантией результата. Выберите подходящую услугу:

Анатолий Кузнецов — SEO-оптимизатор

Остались вопросы по продвижению?

Меня зовут Анатолий Кузнецов, я SEO-оптимизатор с 20-летним стажем. Разберу ваш сайт, отвечу на вопросы и подскажу, что улучшить для роста позиций в Яндексе и Google.

Связаться со мной →

Оставьте комментарий

Ваш адрес email не будет опубликован. Обязательные поля помечены *

 Нажимая «оставить комментарий» вы принимаетеправила конфиденциальности 

Прокрутить вверх