
Сканер сайта за двадцать минут находит то, что владелец не замечает годами: закрытые от индексации разделы, сотни дублей, битые ссылки и страницы, до которых не доходит ни один посетитель. Я прогоняю этой программой каждый проект перед началом работ, и в семи случаях из десяти причина застоя обнаруживается именно в выгрузке, а не в текстах и не в ссылках. Ниже — как пользоваться инструментом и что искать в полученной таблице.
Отдельно подчеркну: сканер не даёт рекомендаций и не «улучшает» сайт. Он собирает факты. Ценность появляется на этапе, когда вы сортируете эти факты и превращаете их в список задач с приоритетами. Этому и посвящена большая часть разбора.
Что делает сканер и как он работает
Программа заходит на сайт, скачивает главную страницу, находит на ней все ссылки, переходит по каждой и повторяет процедуру. Так она обходит весь сайт — примерно так же, как это делает поисковый робот.
По каждому найденному адресу собираются данные: код ответа сервера, заголовок title, описание, H1, размер страницы, время ответа, атрибуты изображений, канонический адрес, директивы индексации, количество входящих и исходящих внутренних ссылок, глубина вложенности от главной.
На выходе получается таблица, где каждая строка — страница сайта, а колонки — её характеристики. Дальше вы сортируете и фильтруете, находя проблемы. Именно этот момент отличает полезное сканирование от бесполезного: программу запускают многие, а выгрузку читают единицы.
Важное свойство: сканер ходит по ссылкам, как робот. Значит, всё, до чего нельзя дойти по ссылкам с главной, он не найдёт — и поисковая система, скорее всего, тоже. Это само по себе диагностика: если раздел не попал в обход, у него проблема со связностью.
Чем сканирование отличается от данных Вебмастера
| Параметр | Сканер | Панель вебмастера |
|---|---|---|
| Что показывает | Все страницы, доступные по ссылкам | То, что система видит и как она это оценивает |
| Тип данных | Технические характеристики страниц | Индексация, показы, клики, ошибки, санкции |
| Чужие сайты | Можно сканировать | Только свой, с подтверждением прав |
| Скорость получения | Сразу, за минуты | С задержкой в дни |
| Глубина по странице | Полная техническая карточка | Ограниченный набор показателей |
Инструменты дополняют друг друга и не заменяют один другого. Сканер показывает состояние сайта; панель вебмастера — как это состояние отражается на поиске. Работать надо с обоими, и самое полезное — сопоставлять их между собой. Например, страница есть в сканере и отсутствует в индексе: значит, вопрос не в существовании страницы, а в том, почему система её отвергает.
Какие программы использовать
Принцип у всех одинаковый, различия — в интерфейсе, скорости и наборе готовых отчётов.
Screaming Frog SEO Spider. Самый распространённый вариант. Бесплатная версия обходит до 500 адресов, чего хватает большинству небольших сайтов. Работает на всех основных системах, требует установленной Java. Сильные стороны: скорость, гибкая настройка, интеграция с системами аналитики, удобная выгрузка в таблицы.
Netpeak Spider. Русскоязычный интерфейс, встроенные отчёты с готовыми выводами, подсветка ошибок по степени критичности. Платный, с пробным периодом. Удобен тем, кто не хочет разбираться в настройках: программа сама помечает найденное как критичное, важное или информационное.
Облачные сканеры. Работают через браузер, не требуют установки и мощного компьютера, часто входят в состав сервисов аудита. Удобны для регулярных проверок по расписанию, менее гибки в настройках.
Для первого знакомства бесплатной версии любого настольного сканера достаточно. Ограничение в 500 адресов кажется маленьким, но для сайта услуг оно чаще всего избыточно, а для магазина имеет смысл сканировать по разделам.
Тему разбирал отдельно: «Как проверить скорость сайта: PageSpeed, GTmetrix и Вебмастер дают три разные цифры».
Как настроить первый обход
Настройки по умолчанию годятся для пробного запуска, но несколько параметров стоит проверить заранее.
- Скорость обхода. По умолчанию программа может слать десятки запросов в секунду. На слабом хостинге это уронит сайт или приведёт к блокировке. Разумно начинать с двух-пяти запросов в секунду и следить за временем ответа.
- Учёт директив индексации. Полезно сделать два прогона: с соблюдением ограничений и с игнорированием их. Разница между результатами покажет, что именно закрыто от роботов — иногда обнаруживаются закрытые случайно важные разделы.
- Обработка параметров в адресах. Сортировки, фильтры и метки могут породить тысячи технических адресов. Если сканер уходит в бесконечность, ограничьте обход по маске.
- Мобильный агент. Стоит прогнать сайт и от имени мобильного робота: иногда мобильная версия отдаёт другое содержимое или другие коды ответов.
- Отрисовка скриптов. Если содержимое подгружается скриптами, обычный обход увидит пустые страницы. Включите режим с исполнением скриптов — он медленнее, зато показывает то, что видит поисковая система.
После прогона сохраните выгрузку с датой. Через месяц вы сделаете второй прогон, и сравнение двух файлов покажет, что изменилось и не появилось ли новых проблем.
Что искать в выгрузке в первую очередь
Помогу с продвижением: SEO-продвижение под ключ — вывожу сайты в топ Яндекса белыми методами.
Порядок разбора имеет значение: сначала то, что ломает доступность, потом то, что мешает индексации, и только в конце косметика.
Коды ответов. Отсортируйте по колонке с кодом. Всё, что не отвечает двумястами, требует внимания: несуществующие страницы, серверные ошибки, цепочки редиректов. Особенно важны два случая — битые ссылки внутри сайта, которые тратят обход робота и раздражают людей, и цепочки перенаправлений длиннее одного шага.
Директивы индексации. Проверьте, у каких страниц стоит запрет на индексацию и совпадает ли это с вашим замыслом. Классическая находка — запрет, оставшийся с этапа разработки на целом разделе.
Канонические адреса. Страница, указывающая каноническим адресом другую страницу, из индекса выпадает. Массовые ошибки в канонических адресах — частая причина того, что «половина сайта не в поиске».
Дубли заголовков и описаний. Отсортируйте по title и посмотрите повторы. Одинаковые заголовки у десятков страниц означают, что система не понимает, чем они отличаются, и выбирает одну, а остальные считает малополезными.
Пустые и слишком короткие страницы. Колонка с объёмом текста показывает страницы, где содержания практически нет. Это либо служебные адреса, которым не место в индексе, либо страницы, требующие наполнения.
Скорость ответа. Сортировка по времени ответа выявляет тяжёлые страницы. Обычно это несколько шаблонов, а не весь сайт: чинится точечно.
Смежный материал по теме — «Screaming Frog за 20 минут: технический аудит сайта, который найдёт битые ссылки и дубли».
Структура: глубина и страницы без входящих ссылок
Две колонки, которые смотрят реже всего, а пользы от них больше, чем от половины остальных.
Глубина вложенности показывает, за сколько кликов от главной достижима страница. Всё, что глубже четвёртого-пятого уровня, обходится роботом реже и получает меньше веса. Если важные коммерческие страницы лежат на шестом уровне, у вас проблема со структурой, а не с текстами.
Количество входящих внутренних ссылок. Отсортируйте по возрастанию. Страницы с нулём или единицей — сироты, до которых почти никто не доходит. В типовом сайте, который никогда не приводили в порядок, таких находится от трети до половины. Расстановка ссылок на них — самая дешёвая работа с самым быстрым эффектом из всех, что я знаю.
Отдельно посмотрите на обратную крайность: страницы с сотнями входящих ссылок. Обычно это служебные адреса вроде политики обработки данных, на которые ведёт сквозная ссылка из подвала. Они забирают внутренний вес, который лучше направить на коммерческие разделы.
Изображения, разметка и мелочи, которые копятся
После структурных находок доходит очередь до слоёв, которые по отдельности незаметны, а вместе дают заметный вес страницы и заметную долю ошибок.
Изображения. Сканер выгружает список всех картинок с их размером в килобайтах и наличием описания. Сортировка по весу почти всегда обнаруживает несколько фотографий по два-три мегабайта, залитых без сжатия, — они одни способны утроить время загрузки страницы. Второй столбец — отсутствующие описания: это и вопрос доступности, и потеря показов в поиске по картинкам. Третье, что видно из выгрузки, — битые изображения, ссылающиеся на удалённые файлы.
Разметка структурированных данных. Часть сканеров показывает, какие типы разметки найдены на странице и есть ли в них ошибки. Проверять стоит хотя бы наличие разметки хлебных крошек, организации и, для магазинов, товаров с ценой и наличием. Ошибки в разметке не наказываются, но и расширенный вид в выдаче вы не получите.
Заголовки внутри страницы. Колонки с H1 и H2 позволяют разом увидеть страницы без единственного главного заголовка, страницы с несколькими H1 и страницы, где заголовок дублирует заголовок другой страницы. Последнее особенно показательно для каталогов: если у сорока категорий одинаковый H1, система вправе счесть их одинаковыми.
Внешние исходящие ссылки. Отдельный отчёт показывает, куда ведут ссылки с вашего сайта. Раз в год его стоит просматривать: домены иногда меняют владельца, и ссылка, поставленная на полезный ресурс, через два года может вести на что-то совсем другое.
Как превратить находки в план работ
Выгрузка сама по себе бесполезна. Полезна таблица задач с приоритетами. Я обычно раскладываю находки так.
Если нужны детали, смотрите «Контент-план для сайта: как выбирать темы и не писать в пустоту».
| Приоритет | Что относится | Почему срочно |
|---|---|---|
| Критично | Серверные ошибки, случайные запреты индексации, неверные канонические адреса | Страницы физически не участвуют в поиске |
| Высокий | Битые внутренние ссылки, цепочки редиректов, дубли заголовков | Тратится обход, размываются сигналы |
| Средний | Страницы-сироты, избыточная вложенность, тонкое содержание | Недополученный трафик и вес |
| Низкий | Отсутствующие описания изображений, длина title, мелкая косметика | Улучшает, но не меняет картину |
Правило, которое экономит месяцы: не беритесь за нижние строки, пока не закрыты верхние. Заполнять описания к картинкам на сайте, где половина разделов закрыта от индексации, — распространённая форма имитации работы.
И второе правило: после внедрения правок прогоните сканер ещё раз и сверьте с сохранённой выгрузкой. Это единственный способ убедиться, что задачи действительно выполнены, а не отмечены выполненными.
Отдельно про то, как связать выгрузку с реальными деньгами. Технический список сам по себе не показывает, что важно, а что нет: страница с битой ссылкой в подвале и закрытая от индексации категория услуг стоят в таблице рядом. Поэтому к выгрузке стоит подтянуть два внешних источника. Первый — отчёт по страницам входа из системы аналитики: он покажет, какие адреса реально приводят людей. Второй — отчёт по запросам из панели вебмастера: он покажет, какие страницы уже набирают показы. Пересечение технических проблем с этими двумя списками и есть настоящий верх приоритетов: чинить в первую очередь надо то, что ломается на страницах, которые уже что-то приносят или почти начали приносить.
И практическое замечание про регулярность. Разовый аудит закрывает накопленное, но проблемы возвращаются: обновился движок, дизайнер поменял шаблон, контент-менеджер создал раздел без ссылок. Поэтому полезнее не героический разбор раз в два года, а короткий прогон раз в квартал по одному и тому же набору проверок. Занимает он полчаса, а ловит поломки, пока они не успели превратиться в потерю трафика.
Частые вопросы
Как часто нужно сканировать сайт?
Для небольшого сайта услуг — раз в квартал и обязательно после любых изменений на стороне разработки. Для магазина с меняющимся каталогом — раз в месяц. После переезда, смены движка или перестройки структуры — сразу и затем через две недели: часть проблем проявляется не мгновенно.
Можно ли сканировать сайты конкурентов?
Технически да, и это полезно для анализа структуры: вы увидите, какие разделы у них есть, как устроена вложенность, сколько страниц в каждой категории. Делать это надо аккуратно — на низкой скорости, чтобы не создавать нагрузку. Учтите, что часть площадок ограничивает такой обход, и это их право.
Сканер показал 4000 страниц, а я знаю, что у меня их 300. Что происходит?
Почти наверняка размножение адресов из-за параметров: фильтры, сортировки, метки, версии для печати, идентификаторы сессий. Каждая комбинация порождает новый адрес с тем же содержимым. Это классическая причина того, что робот тратит обход на мусор и не доходит до важных страниц. Лечится настройкой канонических адресов, запретом на индексацию параметрических адресов и правкой шаблонов.
Обязательно ли покупать платную версию?
Для сайта до 500 страниц — нет, бесплатной хватает с запасом. Платная нужна в трёх случаях: большой сайт, необходимость регулярных прогонов по расписанию и работа с интеграциями, когда к техническим данным подтягивается статистика посещаемости. Для разового аудита небольшого проекта покупка избыточна.
Программа не видит часть страниц. Почему?
Три типичные причины. Первая: на страницы нет внутренних ссылок — сканер, как и робот, ходит по ссылкам. Вторая: содержимое подгружается скриптами, и нужен режим с их исполнением. Третья: сервер ограничивает частоту запросов и начинает отдавать ошибки — снизьте скорость обхода и повторите. Кстати, если ограничение срабатывает на скорости в пять запросов в секунду, это само по себе повод разобраться с сервером: поисковый робот тоже упрётся в него.
Что делать, если сканер нашёл сотни проблем и непонятно, с чего начать?
Не пытаться закрыть всё. Возьмите три верхние категории из таблицы приоритетов и посчитайте, сколько страниц затрагивает каждая. Начинайте с той, что затрагивает больше всего страниц при наименьшей трудоёмкости — обычно это шаблонные ошибки, которые правятся один раз в коде и исчезают сразу на тысячах адресов. Точечные проблемы отдельных страниц оставляйте на потом.
Коротко
- Сканер обходит сайт по ссылкам, как поисковый робот, и собирает техническую карточку каждой страницы; всё, до чего нельзя дойти по ссылкам, он не найдёт — и это уже диагноз.
- Сканер и панель вебмастера не заменяют друг друга: первый показывает состояние сайта, вторая — как поиск это состояние оценивает.
- Перед первым прогоном стоит снизить скорость обхода, сделать два прохода с учётом и без учёта запретов индексации и ограничить параметрические адреса.
- Разбор выгрузки идёт по порядку: коды ответов, директивы индексации, канонические адреса, дубли заголовков, пустые страницы, скорость ответа.
- Самые недооценённые колонки — глубина вложенности и число входящих внутренних ссылок: страницы-сироты обычно составляют от трети до половины сайта.
- Находки превращаются в план с приоритетами, и нижние строки не трогаются, пока не закрыты верхние; после правок делается контрольный прогон и сравнение с прошлой выгрузкой.
Если нужно разобрать выгрузку по вашему сайту и понять, какие из находок действительно тормозят рост, а какие можно отложить, приходите на SEO-консультацию: пройдёмся по структуре, индексации и внутренним ссылкам и составим план работ с приоритетами.
Увеличьте позиции и продажи вашего сайта
Профессиональное SEO-продвижение с гарантией результата. Выберите подходящую услугу:
Остались вопросы по продвижению?
Меня зовут Анатолий Кузнецов, я SEO-оптимизатор с 20-летним стажем. Разберу ваш сайт, отвечу на вопросы и подскажу, что улучшить для роста позиций в Яндексе и Google.
Связаться со мной →
Комментарии
Артемий Сысоев
Прогнал сайт первый раз в жизни. Из 380 страниц у 94 стоял запрет на индексацию — остался с момента разработки полтора года назад. Мы всё это время платили за продвижение и не понимали, почему целый раздел не растёт. Разработчик просто забыл снять запрет после запуска.
Анатолий Кузнецов автор
Это самая частая находка первого прогона, и хорошо, что она нашлась. Снимите запрет и сразу сделайте три вещи, иначе раздел будет входить в индекс месяцами. Первое: проверьте, есть ли эти 94 адреса в карте сайта — обычно закрытые страницы туда не попадают. Второе: убедитесь, что на них ведут внутренние ссылки из живых разделов, а не только из карты. Третье: отправьте на переобход хотя бы главные страницы раздела через панель вебмастера, остальные подтянутся. И сохраните текущую выгрузку: через три недели прогоните ещё раз и сравните, сколько страниц реально вошло. Если войдёт меньше половины, значит, есть вторая причина — чаще всего канонические адреса или дубли, и её надо будет искать отдельно.
Есения Долгих
Про два прогона — с учётом запретов и без — не знала, попробовала. Разница оказалась в 200 с лишним адресов, из которых половина не должна была быть закрыта. Простой приём, а вскрыл больше, чем обычный аудит.
Данила Криворучко
Не соглашусь с тем, что бесплатной версии хватает. У нас магазин на 12 тысяч позиций, и по разделам сканировать неудобно: половина проблем как раз на стыке разделов, в фильтрах и пагинации. Тут без полноценной версии не обойтись, и это стоит сказать прямо.
Анатолий Кузнецов автор
Для вашего размера согласен полностью — оговорка про 500 адресов относится к небольшим сайтам, и для магазина она не работает. Добавлю к вашему замечанию практическую деталь: при таком объёме важнее не сам полный обход, а правильные ограничения. Двенадцать тысяч товаров с фильтрами легко разворачиваются в сотни тысяч адресов, и полный прогон будет идти сутками, забив память. Настройте исключения по маскам параметров сортировки, ограничьте глубину пагинации и сканируйте в несколько заходов: отдельно дерево категорий, отдельно карточки, отдельно служебные разделы. И обязательно подключите выгрузку списка адресов из карты сайта отдельным режимом — сравнение того, что в карте, с тем, что реально доступно по ссылкам, для магазина даёт больше всего находок.
Ника Бердникова
Вопрос по каноническим адресам. Сканер показал, что у трети страниц канонический адрес указывает на главную. Это точно ошибка или бывают случаи, когда так и надо? Разработчик утверждает, что это нормально.
Анатолий Кузнецов автор
Это ошибка, и довольно грубая. Канонический адрес говорит поисковой системе: «настоящая версия этого документа находится вот здесь». Если треть страниц указывает на главную, вы сообщаете, что все они — копии главной, и они закономерно выпадают из поиска. Нормальных случаев такой настройки практически не бывает: канонический адрес либо указывает на саму страницу, либо на её основную версию при наличии дублей с параметрами. Скорее всего, у вас в шаблоне жёстко прописан адрес главной вместо динамической подстановки текущего. Проверьте это на нескольких страницах разных типов и покажите разработчику: правка обычно занимает минуты. После исправления страницам понадобится время на возвращение в индекс — от двух недель до полутора месяцев в зависимости от того, как часто робот заходит на сайт.
Радмир Гилязов
Колонка с глубиной вложенности открыла глаза. Наши основные коммерческие страницы лежали на шестом уровне, потому что структура каталога выросла стихийно. Подняли главные категории в меню — обход роботом стал заметно чаще, это видно в статистике.
Полина Астахова
Совет сохранять выгрузку с датой недооценён. Мы делаем прогон раз в квартал и складываем файлы в одну папку. Когда полгода назад после обновления движка внезапно появились сотни редиректов, мы сравнили с прошлым файлом и за десять минут поняли, что именно сломалось.
Юстин Ковалёв
Хочу уточнить про цепочки редиректов. Насколько это критично на самом деле? У нас после двух переездов накопились цепочки по три-четыре шага, но конечная страница ведь всё равно открывается.
Анатолий Кузнецов автор
Открывается, но с потерями по трём направлениям. Первое: каждый шаг цепочки — отдельный запрос, и для человека это задержка, особенно на мобильном соединении. Второе: робот тратит на прохождение цепочки часть выделенного вам ресурса обхода, и при большом количестве таких адресов до новых страниц он доходит позже. Третье и главное: длинные цепочки со временем рвутся — кто-то удаляет промежуточный адрес, и вся ссылочная масса, которая шла по этому пути, теряется. Чинится это просто: возьмите из выгрузки все цепочки и перепишите правила так, чтобы первый адрес вёл сразу на конечный, одним шагом. Работа механическая, делается за пару часов, а результат виден и в скорости, и в стабильности. Особенно важно, если на старые адреса ведут внешние ссылки.
Эвелина Мазурова
Добавлю про сортировку по объёму текста. Нашла у себя 60 страниц, где текста было меньше двухсот знаков — остатки старых тегов и пустые категории. Они висели в индексе и тянули вниз общее впечатление о сайте. Закрыли, и через пару месяцев средняя позиция по сайту подросла.
Харитон Плюснин
А как быть, если сайт на конструкторе и доступа к коду нет? Сканер находит проблемы, а исправить шаблонные вещи невозможно — платформа не даёт. Есть ли смысл вообще сканировать в такой ситуации?
Анатолий Кузнецов автор
Смысл есть, просто выводы будут другими. Разделите находки на две группы: то, что вы можете изменить через интерфейс платформы, и то, что зашито в шаблон. В первую группу почти всегда попадает больше, чем кажется: заголовки страниц, описания, структура меню, внутренние ссылки, адреса страниц, тексты, наличие или отсутствие дублирующих разделов. Это уже немало, и именно тут лежит основная часть эффекта. Вторая группа — аргумент для решения о переезде: когда вы видите список из десяти неустранимых проблем, разговор о смене платформы перестаёт быть вопросом вкуса. И третье: часть платформ позволяет вставлять свой код в шапку страниц — этого хватает, чтобы поправить канонические адреса и разметку. Уточните у поддержки, есть ли такая возможность в вашем тарифе.
Софья Игнатенко
Про размножение адресов из-за параметров — попали в точку. У нас сканер насчитал 26 тысяч адресов при 900 реальных товарах. Оказалось, каждый фильтр по цвету и размеру порождал свою версию страницы, и все они были открыты для индексации. Робот годами ходил по мусору.
Ждан Ремнёв
Полезное про мобильного агента. Прогнал сайт от имени мобильного робота и обнаружил, что на телефонах часть меню вообще не отдаётся в разметке, а подставляется скриптом после загрузки. То есть половина внутренних ссылок для робота не существовала. Никогда бы не проверил, если бы не совет.
Азалия Фаттахова
Не хватило раздела про то, как читать выгрузку по изображениям: размеры, форматы, отсутствующие описания. У нас сайт с большим количеством фотографий, и подозреваю, что там есть что чинить, но по каким колонкам смотреть — непонятно.