Screaming Frog за 20 минут: технический аудит сайта, который найдёт битые ссылки и дубли

Screaming Frog за 20 минут: технический аудит сайта, который найдёт битые ссылки и дубли
Анатолий Кузнецов
Анатолий Кузнецов
SEO-оптимизатор с 20-летним стажем. Автор блога seo-prodvizhenie-biznesa.ru о продвижении и доработке сайтов.

Screaming Frog делает технический аудит сайта за 20 минут и показывает больше, чем панель вебмастера покажет за месяц. Причина простая: панель отчитывается о том, что робот уже успел обойти и переварить, а краулер на вашем компьютере проходит сайт прямо сейчас, по всем внутренним ссылкам, и складывает результат в таблицу. Владелец открывает свой сайт в браузере, видит красивые страницы и уверен, что всё в порядке. Краулер за те же двадцать минут выдаёт двести строк с кодом 404, полсотни одинаковых заголовков и три десятка страниц, закрытых от индексации ещё на этапе разработки — про которые все забыли.

Ниже — инструмент так, как я сам им пользуюсь с середины двухтысячных: что настроить до первого запуска, чтобы не положить хостинг и не получить мусорный отчёт, какие вкладки открывать первыми, и главное — как из трёхсот предупреждений вытащить пять проблем, которые реально стоят денег. Если разбираться самому некогда, есть продвижение сайта в Яндексе под ключ — техническую часть я в любом случае начинаю с полного обхода.

Что это за программа и чем она отличается от онлайн-сервисов

Screaming Frog SEO Spider — десктопная программа для Windows, macOS и Linux. Вы вводите адрес сайта, нажимаете Start, и программа начинает вести себя как поисковый робот: скачивает главную, вытаскивает из её кода все ссылки, идёт по ним, вытаскивает ссылки оттуда и так далее, пока не кончатся новые адреса. По каждому URL она запоминает код ответа сервера, заголовок, описание, H1, canonical, директивы robots, вес страницы, количество входящих и исходящих ссылок, глубину вложенности от главной.

Отличие от онлайн-краулеров принципиальное: программа работает с вашего компьютера и вашего IP. Значит, обход не ограничен тарифом сервиса, вы видите сырые данные, а не «оценку сайта по стобалльной шкале», и можете обойти закрытый тестовый домен, к которому у внешнего сервиса нет доступа.

Бесплатная версия ограничена 500 адресами за один обход. Для сайта-визитки, лендинга или небольшого корпоративного сайта этого хватает с запасом. Но в бесплатной версии нет рендеринга JavaScript, нет сохранения конфигурации, нет подключения внешних API и нет отчёта по страницам-сиротам. Платная лицензия годовая, цену уточняйте на сайте разработчика — она указана в фунтах и меняется. Лимита на количество адресов в платной версии нет, упираетесь только в оперативную память и терпение.

Пять настроек до первого обхода

Запуск «по умолчанию» на боевом сайте — самая частая ошибка новичка. Пять минут в настройках экономят потом час разбирательств с хостером.

Скорость обхода

Раздел Configuration → Speed. По умолчанию программа шлёт запросы в пять потоков без ограничения по количеству адресов в секунду. Для сайта на виртуальном хостинге это ощутимая нагрузка: краулер за минуту делает столько запросов, сколько живые посетители делают за час. Я ставлю Max Threads в 2 и Max URI/s в 2–3, если сайт на шаред-хостинге, и в 5 потоков — только на VPS с запасом по ресурсам.

Признак того, что вы перестарались: в отчёте начинают массово появляться коды 500, 502, 503 и «Connection Timeout». Это не ошибки сайта, это сайт лёг под вашим же краулером. Остановите обход, снизьте скорость и запустите заново. Если хостинг падает даже на двух потоках — проблема не в краулере, а в сервере: два одновременных запроса делает любой живой посетитель, открывший две вкладки.

User-Agent

Configuration → User-Agent. По умолчанию программа представляется как Screaming Frog SEO Spider. Многие защиты и CDN режут такой запрос или отдают капчу. Полезнее сделать два обхода: первый — под родным агентом, второй — представившись Googlebot или YandexBot. Если результаты расходятся, вы поймали клоакинг: сайт отдаёт роботам не то, что людям. Иногда это делает взломщик, иногда — сам плагин «оптимизации».

robots.txt: уважать или игнорировать

Configuration → robots.txt → Settings. Три режима: соблюдать, игнорировать, игнорировать но фиксировать в отчёте. Правильный порядок такой: первый обход — с соблюдением, вы видите сайт глазами робота. Второй — в режиме «игнорировать, но показывать», и вы видите, что именно спрятано за директивами Disallow. Регулярно нахожу там живые разделы каталога, закрытые случайно. Про то, какие строки в этом файле опаснее всего, я подробно писал в разборе опасных настроек robots.txt по умолчанию.

Рендеринг JavaScript

Configuration → Spider → Rendering. Режим Text Only читает только исходный HTML — так же, как его получает робот в первом приближении. Режим JavaScript запускает встроенный браузер и ждёт отрисовки. Разница между двумя обходами — это и есть ответ на вопрос, видит ли поисковик ваш контент. Если в текстовом режиме у страниц пустой H1 и нулевой объём текста, а в JS-режиме всё на месте — у вас классический красивый сайт на JavaScript, который робот видит пустым. JS-рендеринг медленнее раз в пять и требует памяти, поэтому включайте его осознанно, а не «на всякий случай».

Память и режим хранения

Configuration → System → Storage Mode. Memory Storage держит весь обход в оперативной памяти — быстро, но на сайте в 50 000 страниц программа упрётся в потолок и упадёт. Database Storage пишет на диск, работает медленнее, зато тянет сотни тысяч адресов и сохраняет обход между запусками. На SSD разница в скорости почти незаметна. Для всего, что крупнее пары тысяч страниц, я сразу включаю Database Storage.

Двадцать минут: маршрут по вкладкам

Обход небольшого сайта заканчивается за пару минут. Дальше начинается работа, и тут важно не открывать вкладки подряд слева направо — утонете. Есть порядок, который даёт максимум смысла за минимум времени.

Минуты Вкладка и фильтр Что ищем
0–3 Response Codes → Client Error (4xx) Битые внутренние ссылки: куда ведут и с каких страниц
3–5 Response Codes → Server Error (5xx) Страницы, которые сервер не отдаёт вообще
5–8 Reports → Redirects → Redirect Chains Цепочки и петли редиректов
8–11 Page Titles → Missing, Duplicate Пустые и одинаковые заголовки
11–13 H1 → Missing, Duplicate, Multiple Страницы без главного заголовка и с несколькими
13–15 Directives → Noindex, Nofollow Закрытое от индексации там, где не надо
15–17 Canonicals → Canonicalised Страницы, указывающие каноническим чужой адрес
17–19 Internal → сортировка по Crawl Depth Страницы глубже четвёртого уровня
19–20 Images → Missing Alt Text, Over 100 KB Картинки без описания и тяжёлые файлы

Response Codes — первая и главная вкладка

Фильтр Client Error (4xx) даёт список адресов, которые сервер не нашёл. Сам по себе список бесполезен: важно, откуда на них ссылаются. Выделяете строку, внизу открываете панель Inlinks — и видите список страниц-источников с анкорами. Вот это и есть рабочий документ: «на странице услуг ссылка на удалённый прайс, поправить href». Механику того, почему это не косметика, я разбирал в материале про битые ссылки и редиректы, которые крадут вес страниц.

Отчёт Redirect Chains вытаскивает цепочки: страница А ведёт на Б, Б на В, В на Г. Каждое звено — потеря части веса и лишний запрос робота. Отдельно ищите петли: адрес, который через два-три шага возвращается сам на себя, робот бросает такую страницу и больше к ней не возвращается. Подробнее — в разборе цепочек 301 редиректов.

Заголовки, описания и H1

Вкладка Page Titles с фильтром Duplicate — самый быстрый способ найти дубли страниц. Одинаковый title почти всегда означает одинаковый или почти одинаковый контент: карточки товара в разных категориях, пагинация без разметки, страницы с UTM-метками, версии для печати. Поисковик из такой группы выбирает одну страницу, остальные складывает в «дубли» и не показывает.

Фильтр Missing по Meta Description менее критичен: отсутствующее описание не мешает индексации, поисковик соберёт сниппет из текста сам. Но на коммерческих страницах — карточках, услугах, категориях — описание влияет на кликабельность, поэтому его отсутствие я всегда выношу в задачи, просто с низким приоритетом.

По H1 три полезных фильтра. Missing — страница без главного заголовка, чаще всего это шаблонная ошибка вёрстки на целом типе страниц. Duplicate — тот же признак дублей, что и по title. Multiple — несколько H1 на странице, обычно потому, что в H1 завёрнут логотип в шапке и заголовок статьи.

Canonicals, Directives и картинки

Вкладка Canonicals, фильтр Canonicalised — страницы, у которых canonical указывает не на себя. Каждая такая строка означает: «эту страницу в поиске не показывать, показывать вон ту». Иногда так и задумано, иногда это следствие настройки плагина, которую никто не проверял. Насколько дорого обходится опечатка в этом теге, видно из истории про то, как одна лишняя буква в canonical выбрасывает страницу из выдачи.

Вкладка Directives, фильтр Noindex — список страниц, закрытых мета-тегом robots. Сверьте его глазами. Типичная находка: разработчик закрыл сайт на время работ, потом открыл главную и забыл про раздел блога или про страницы фильтров, которые как раз и приносили трафик.

Вкладка Images: фильтр Missing Alt Text показывает изображения без атрибута alt, фильтр по размеру — файлы тяжелее 100 КБ. Атрибут alt даёт трафик из поиска по картинкам и помогает роботу понять содержимое. Вес картинок бьёт по скорости и по показателю LCP, порог которого — 2,5 секунды. Отдельная ловушка — ленивая загрузка: если картинки подставляются скриптом, в текстовом режиме краулер их просто не увидит, потому что в исходном HTML их нет. Пустая вкладка Images на сайте с сотней фотографий почти всегда означает именно это, а не отсутствие изображений.

Глубина вложенности и страницы-сироты

Вкладка Internal, колонка Crawl Depth — сколько кликов от главной до страницы. Всё, что глубже четвёртого уровня, робот обходит редко и неохотно. Если у вас коммерческие страницы лежат на шестом уровне, вопрос не в текстах, а в структуре. Это прямой расход краулингового бюджета — почему Яндекс не обходит половину сайта, чаще всего объясняется именно глубиной и мусорными URL.

Страницы-сироты — адреса, на которые внутри сайта не ведёт ни одной ссылки. Краулер сам по себе их не найдёт: он ходит по ссылкам, а ссылок нет. Чтобы их увидеть, нужно дать программе второй источник адресов: включить Configuration → Spider → Crawl → Crawl Linked XML Sitemaps либо подключить внешний API, а после обхода запустить Crawl Analysis. Тогда появится отчёт Orphan Pages. Именно поэтому карту сайта стоит держать в порядке — типичные ошибки sitemap, из-за которых страницы не попадают в индекс, заодно ломают и этот отчёт.

Пять проблем вместо трёхсот предупреждений

После обхода среднего сайта программа покажет сотни строк во всех вкладках. Если пытаться закрыть всё, работа встанет. Я делю находки на три корзины: «чинить сегодня», «в план на месяц», «не трогать».

Находка Приоритет Почему именно так
Noindex на коммерческих страницах Критично Страница физически не может ранжироваться, потеря — весь её трафик
5xx на живых разделах Критично Робот выкидывает такие страницы из индекса, посетитель уходит
Canonical на чужой адрес у важных страниц Критично Вы сами просите поисковик не показывать страницу
404 с внутренних ссылок в шапке, меню, каталоге Критично Ссылка есть на каждой странице — теряется много веса
Дубли title у коммерческих страниц Критично Группа страниц конкурирует между собой, в выдачу проходит одна
Цепочки редиректов в 2–3 шага В план Вес теряется, но страница доступна
Глубина вложенности 5+ В план Требует переделки структуры и перелинковки
Отсутствующие Meta Description В план Влияет на кликабельность, не на индексацию
Картинки без alt В план Потеря трафика с поиска по картинкам
Title длиннее 60 символов Шум Обрезается в сниппете, но страница ранжируется нормально
404 на внешних ссылках на чужие сайты Шум Чужой сайт закрылся, ваши позиции от этого не падают
Дубли title у страниц пагинации и тегов Шум Решается настройкой индексации, а не переписыванием заголовков
Noindex на служебных страницах (корзина, вход) Шум Так и должно быть

Правило, по которому я отделяю критичное от шума, звучит так: если находка мешает странице попасть в индекс или уводит с неё вес — это критично. Если она влияет только на то, как страница выглядит в выдаче, — это план. Если она касается страниц, которые вам и не нужны в поиске, — это шум, и его можно не трогать годами.

Screaming Frog и альтернативы

Screaming Frog — не единственный вариант и не всегда лучший. Вот честное сравнение по тому, что реально важно при выборе.

Инструмент Лимит бесплатно Что видит Чего не видит
Screaming Frog 500 URL, без JS-рендеринга и API Коды ответов, теги, canonical, директивы, глубину, рендеринг JS, данные подключённых API Реальный трафик и позиции без ручной склейки данных, поведение живых посетителей
Netpeak Spider Бесплатный тариф с урезанным набором функций Тот же набор технических параметров, интерфейс на русском, готовые сводки по ошибкам Работает под Windows, на macOS — только через виртуализацию
Яндекс.Вебмастер Бесплатно, только свой подтверждённый сайт Что робот реально обошёл и что взял в индекс, дубли заголовков, ошибки по мнению самого Яндекса Страницы, до которых робот ещё не дошёл; данные приходят с задержкой в дни
Онлайн-краулеры (аудит-сервисы) Обычно 100–500 URL в демо Базовые ошибки, отчёт в PDF для отправки клиенту Закрытые и тестовые сайты, тонкая настройка обхода, сырые данные для своей аналитики
Логи сервера Бесплатно, если есть доступ Что робот запрашивал на самом деле и как часто Ошибки в тегах и структуре — логи про них ничего не знают

На практике связка работает лучше любого одиночного инструмента: краулер показывает, что на сайте есть, Вебмастер — что из этого попало в индекс, а логи сервера показывают, что робот запрашивал в действительности. Расхождения между тремя источниками и есть самое интересное.

Как связать обход с Яндекс.Метрикой и Вебмастером

Сразу честно: встроенные подключения по API в Screaming Frog сделаны под сервисы Google и несколько зарубежных сервисов ссылочных данных. Родной кнопки «подключить Яндекс.Метрику» в программе нет, и обещать её не буду. Но задача решается за пятнадцать минут ручной склейкой, и результат стоит этих минут.

Порядок такой:

  1. После обхода экспортируйте вкладку Internal с фильтром HTML в CSV. Получите список всех страниц сайта с их кодами ответов и тегами.
  2. В Яндекс.Метрике откройте отчёт «Содержание → Страницы входа» за последние 3–6 месяцев, выставьте группировку по URL и выгрузите в CSV. Тот же отчёт вытаскивается через API Метрики по измерению страницы входа, если выгрузок нужно много и регулярно.
  3. В Яндекс.Вебмастере возьмите раздел «Индексирование → Страницы в поиске» и выгрузите список страниц, которые сейчас в индексе. Через Logs API того же Вебмастера доступны сырые обращения робота — что и когда он запрашивал.
  4. Сведите три таблицы по колонке URL обычной функцией ВПР в любом табличном редакторе.

Дальше читаете пересечения. Это самая полезная таблица, которая вообще получается из технического аудита.

Есть в обходе В индексе Есть трафик Что это значит
Да Да Да Норма, страница работает
Да Да Нет Индексируется, но не ранжируется: слабый контент или неверный запрос
Да Нет Нет Смотреть noindex, canonical, robots.txt, глубину вложенности
Нет Да Да Страница-сирота: на неё нет внутренних ссылок, трафик держится на честном слове
Нет Да Нет Мусор в индексе: старые адреса, дубли с параметрами, следы взлома
Да (код 404) Да Был Удалённая страница с трафиком — кандидат на восстановление или 301

Две последние строки почти всегда дают самые быстрые результаты. Мусор в индексе выедает краулинговый бюджет, а удалённые страницы, на которые ещё идут переходы, легко возвращаются редиректом на близкий по смыслу раздел.

Когда Screaming Frog не нужен

Инструмент хороший, но у него есть границы применимости, и продавать его как универсальное решение нечестно.

Сайт до 30 страниц. Лендинг, визитка, сайт услуг на десяток страниц. Обойти их руками и посмотреть исходный код через Ctrl+U быстрее, чем ставить программу и разбираться с настройками. Дубли title на десяти страницах видно и без краулера.

Сайт на конструкторе без доступа к коду. Краулер найдёт проблемы, которые вы не сможете починить: платформа не даёт править шаблон, ставить нужные заголовки или менять структуру URL. Отчёт превратится в список поводов для расстройства. Об этом честнее сразу — где заканчивается SEO конструктора, я разбирал отдельно.

Проблема в контенте, а не в технике. Если сайт технически исправен, но по коммерческим запросам его нет в первой сотне, краулер вам не поможет. Он не оценивает, отвечает ли текст на запрос, есть ли на странице цена, доставка и ответы на возражения. Гонять обход по второму кругу в такой ситуации — способ имитировать работу.

Нужно понять поведение робота во времени. Краулер даёт срез на сегодня. Вопросы вида «почему робот заходит на страницу раз в два месяца» решаются логами сервера и разделами Вебмастера, а не повторным обходом.

Сайт лежит или отдаёт ошибки. Сначала чините сервер, потом обходите. Иначе получите отчёт из тысячи строк 5xx, который не говорит ни о чём, кроме того, что хостинг не справляется.

Чеклист первого обхода

Печатайте и идите по пунктам. На незнакомом сайте у меня этот список занимает те самые двадцать минут плюс время самого обхода.

Шаг Действие Готово, если
1 Снизить скорость: Max Threads 2, Max URI/s 2–3 В отчёте нет массовых таймаутов и 5xx
2 Первый обход с соблюдением robots.txt Есть базовая карта того, что видит робот
3 Второй обход в режиме «игнорировать robots.txt, но фиксировать» Понятно, что скрыто за Disallow и не зря ли
4 Проверить Response Codes: 4xx и 5xx, посмотреть Inlinks Есть список битых ссылок с указанием страниц-источников
5 Выгрузить Redirect Chains Найдены цепочки длиннее одного шага и петли
6 Page Titles: Missing, Duplicate Дубли разнесены на «коммерческие» и «служебные»
7 H1: Missing, Duplicate, Multiple Понятно, шаблонная это ошибка или единичная
8 Directives: список Noindex сверен глазами Ни одной нужной страницы в списке не осталось
9 Canonicals: фильтр Canonicalised Каждая находка объяснена или вынесена в задачи
10 Internal: сортировка по Crawl Depth Известны страницы глубже 4 уровня
11 Images: Missing Alt Text и файлы больше 100 КБ Список картинок на сжатие и на alt готов
12 Включить обход sitemap, запустить Crawl Analysis Получен отчёт Orphan Pages
13 Обход в режиме JavaScript для сравнения Ясно, теряется ли контент без рендеринга
14 Сведение с Метрикой и Вебмастером по URL Видны страницы в индексе без трафика и трафик без страниц
15 Выписать 5 критичных проблем в задачи У каждой есть исполнитель и срок

Пятнадцатый пункт — единственный, ради которого делаются первые четырнадцать. Отчёт без списка задач с ответственными не меняет ничего. Если внутри некому этим заниматься, техническую часть можно отдать: доработка сайта по итогам аудита — это как раз закрытие таких списков руками, а не ещё один документ в почте.

Коротко

Screaming Frog обходит сайт так же, как поисковый робот, и складывает результат в таблицы, по которым видно всё техническое состояние сайта. Бесплатной версии на 500 адресов хватает большинству малых сайтов.

До первого запуска обязательно снижаете скорость обхода, выбираете User-Agent и решаете, соблюдать ли robots.txt. Иначе либо положите хостинг, либо получите отчёт, не имеющий отношения к тому, что видит робот.

За двадцать минут проходите маршрут: коды ответов → цепочки редиректов → заголовки → H1 → директивы → canonical → глубина → картинки. Из находок вытаскиваете пять критичных — тех, что мешают попасть в индекс или уводят вес.

Всё, что влияет только на вид сниппета, идёт в план. Всё, что касается страниц, которым в поиске не место, — шум, его можно игнорировать.

Родной интеграции с Яндекс.Метрикой и Вебмастером у программы нет, но выгрузка обхода склеивается с их отчётами по URL за пятнадцать минут — и показывает страницы в индексе без трафика, страницы-сироты и мусор, которого на сайте уже нет, а в индексе он есть.

Краулер бесполезен, когда сайт до 30 страниц, когда платформа не даёт править код и когда проблема не в технике, а в текстах и коммерческих факторах. Если не уверены, к какой категории относится ваш случай, начните с бесплатного аудита сайта — по нему сразу видно, техническая у вас проблема или содержательная.

Увеличьте позиции и продажи вашего сайта

Профессиональное SEO-продвижение с гарантией результата. Выберите подходящую услугу:

Анатолий Кузнецов — SEO-оптимизатор

Остались вопросы по продвижению?

Меня зовут Анатолий Кузнецов, я SEO-оптимизатор с 20-летним стажем. Разберу ваш сайт, отвечу на вопросы и подскажу, что улучшить для роста позиций в Яндексе и Google.

Связаться со мной →

Комментарии

Игорь

Поставил бесплатную версию, обошёл интернет-магазин — программа остановилась на 500 адресах, а у меня их около четырёх тысяч. Обход первых 500 вообще что-то даёт или это выброшенное время?

Анатолий Кузнецов автор

Даёт, но с оговоркой. Краулер идёт от главной вширь, поэтому в первые 500 попадают самые верхние уровни: главная, категории, начало каталога. Шаблонные ошибки — пустой H1 на типе страниц, кривой canonical, noindex в шаблоне — видны уже там, потому что они одинаковые на всём сайте. Чего вы не увидите — глубоких карточек и мусорных URL с параметрами, а именно там у магазинов основная масса дублей. Как временный обходной путь: в настройках ограничьте обход одной категорией через Include, тогда 500 адресов уйдут не на верхушку, а вглубь одного раздела.

Марина

Спасибо за таблицу с приоритетами, забрала себе. Единственное, что не поняла — как отличить «дубли title у коммерческих страниц» от дублей у пагинации, если в отчёте они вперемешку.

Анатолий Кузнецов автор

По адресу. Выгружаете вкладку в таблицу и фильтруете по кускам URL: page, ?page=, /tag/, ?sort=, utm_. Всё, что содержит эти фрагменты, уходит в отдельный лист — это техническая пагинация и сортировки, они лечатся настройками индексации. Что осталось — реальные страницы с одинаковыми заголовками, вот их и разбираете руками.

Дмитрий В.

Не согласен насчёт скорости обхода. Пять потоков — это ерунда для любого нормального сервера, современный хостинг такое даже не заметит. Вы перестраховываетесь.

Анатолий Кузнецов автор

Для нормального сервера — согласен, там и десять потоков пройдут. Речь про виртуальный хостинг с лимитом одновременных процессов PHP и сайт, где каждая страница собирается динамически без кэша. На таком стенде пять потоков дают ровно то, что описано: волна 503 и обрыв обхода. Проверяется просто — запустите на пяти, посмотрите первые сто строк. Если чисто, оставляйте пять. Совет с двумя потоками — это дефолт для незнакомого сайта, а не догма.

Ольга

А правда, что если обходить сайт под видом Googlebot, можно нарваться на бан по IP? Слышала такое.

Сергей

Ольга, некоторые защиты действительно проверяют обратную зону по IP: представился Googlebot, а адрес не из подсетей Google — запрос режется. Не бан, просто перестают отдавать страницы. У меня так было с одним CDN.

Павел

Вопрос по страницам-сиротам. У меня отчёт Orphan Pages пустой, хотя точно знаю, что на сайте есть страницы без ссылок. Что не так?

Анатолий Кузнецов автор

Две частые причины. Первая: не запущен Crawl Analysis после окончания обхода — без него отчёт не заполняется, программа делает этот расчёт отдельным шагом. Вторая: программе неоткуда взять «второй список» адресов. Она находит сироту только сравнением обхода с внешним источником — картой сайта или данными подключённого сервиса аналитики. Если ваши сироты не попали и в sitemap, то и в отчёте их не будет. Тогда сравнивайте выгрузку обхода со списком страниц из Вебмастера вручную.

Алексей Т.

Уточнение к разделу про JavaScript: в JS-режиме имеет смысл дополнительно поставить задержку перед снятием кода. По умолчанию программа ждёт несколько секунд, но на тяжёлых страницах с подгрузкой блоков этого не хватает, и получаете ложный «пустой контент».

Наталья

Купила лицензию, обошла сайт — 2 800 предупреждений. Руки опустились, если честно. Ваш подход с пятью проблемами реально работает или это упрощение для статьи?

Анатолий Кузнецов автор

Работает, потому что 2 800 предупреждений — это не 2 800 проблем. Программа честно перечисляет каждое вхождение, а причин за ними обычно 5–10. Один пункт в шаблоне карточки товара даёт тысячу строк в отчёте. Поэтому первым делом сортируйте не по количеству, а по типу: возьмите три-четыре строки из каждой группы, откройте их и посмотрите, одна ли это причина. Почти всегда одна. После этого список задач становится коротким и понятным.

Виктор

Netpeak Spider всё же удобнее для тех, кто на русском: там сразу написано, что за ошибка и чем грозит. В Screaming Frog надо знать, что искать.

Роман

Никогда не думал проверять Directives отдельно. Открыл — нашёл noindex на всём разделе с отзывами, который делали год назад на тестовом домене и перенесли как есть. Спасибо.

Екатерина

А есть смысл гонять обход регулярно, или это разовая история перед началом работ?

Тимур

Екатерина, у меня раз в месяц по расписанию и обязательно после любого обновления движка или темы. Именно после обновлений вылезают внезапные noindex и битые ссылки в меню — обход это ловит сразу, а из Вебмастера узнаешь через пару недель, когда позиции уже просели.

Прокрутить вверх