
Поисковые роботы ходят по вашему сайту каждый день, и почти всегда — незаметно для владельца. При этом именно их маршрут определяет, какие страницы окажутся в поиске, а какие останутся невидимыми. Пока вы правите заголовки и добавляете тексты, робот может неделями крутиться по страницам сортировки каталога и ни разу не дойти до карточек товара, ради которых сайт делался.
Знать, как устроен этот обход, полезно не из любопытства. Все технические работы по сайту сводятся к одному: убрать препятствия на пути робота и подсказать ему, куда идти в первую очередь. Без понимания механики любая доработка делается наугад — что-то поменяли, что-то стало лучше, почему именно, никто не знает.
Кто именно приходит на ваш сайт
Слово «робот» скрывает целый зоопарк программ с разными задачами. У поисковых систем их несколько, и ведут они себя по-разному.
- Основной обходчик. Скачивает HTML-код страниц и складывает его в очередь на обработку. Именно от его визитов зависит, окажется ли страница в базе поиска.
- Быстрый робот. Приходит за свежим: новости, обновления, только что опубликованные материалы. У живых сайтов бывает по нескольку раз в день.
- Робот изображений. Ходит за картинками отдельно, поэтому картинки индексируются со своим отставанием от текста.
- Мобильный обходчик. Смотрит на сайт глазами телефона. С переходом поисковых систем на приоритет мобильной версии это стало основным вариантом обхода.
- Проверяющие роботы. Приходят по вашей просьбе: при проверке страницы в Вебмастере или при отправке адреса на переобход.
Отдельно на сайт заходят программы, к поиску отношения не имеющие: анализаторы ссылок, парсеры цен конкурентов, сборщики контента, сканеры уязвимостей. На среднем коммерческом сайте они дают заметную долю нагрузки, и разделять эти потоки в статистике полезно — иначе непонятно, кто съедает ресурсы сервера.
Как робот узнаёт, что у вас появилась страница
Источников всего четыре, и все они управляемы.
Ссылки внутри сайта. Основной путь. Робот скачал страницу, нашёл в коде ссылки, добавил адреса в очередь. Отсюда важное следствие: страница, на которую не ведёт ни одна внутренняя ссылка, для робота почти не существует. Такие страницы называют сиротами, и в каталогах их бывают сотни.
Карта сайта. Файл sitemap.xml — список адресов, которые вы считаете важными. Он помогает найти страницы, до которых сложно дойти по ссылкам, но не заставляет их индексировать. Карта, где половина адресов отдаёт 404 или редирект, работает против вас: робот перестаёт ей доверять.
Внешние ссылки. Упоминание вашего адреса на чужом сайте приводит робота напрямую. Для новых доменов это часто самый быстрый способ первого визита.
Прямые сигналы. Отправка адреса на переобход в панели вебмастера и протокол мгновенного уведомления, когда сайт сам сообщает поисковой системе об изменении. Второй вариант надёжнее, потому что работает без ручных действий и без суточных лимитов.
Что происходит со страницей после скачивания
Робот не читает страницу как человек. Он разбирает код на части, и на каждом шаге может потерять то, ради чего вы страницу писали.
- Проверка кода ответа. Если сервер вернул 404, 500 или увёл редиректом, дальше ничего не происходит.
- Разбор HTML. Выделяются заголовок, мета-теги, текст, ссылки, разметка. Текст, спрятанный в атрибуты или в подгружаемые блоки, сюда не попадает.
- Исполнение скриптов. Отдельный, более дорогой шаг. Ставится в очередь и выполняется не всегда сразу.
- Оценка содержания. Сравнение с уже известными страницами: не дубль ли, есть ли смысл, отвечает ли хоть на какой-то запрос.
- Решение. Взять в базу, отложить или отбросить.
Самая частая потеря происходит на втором и третьем шаге. Владелец открывает сайт, видит красивый блок с описанием услуги — а в исходном коде на его месте пусто, потому что блок подгружается скриптом. Проверяется это за минуту: в браузере открыть исходный код страницы и поискать в нём кусок вашего текста. Не нашли — робот тоже может не найти.
Тему разбирал отдельно: «Как работают поисковые системы».
Где робот слепнет: скрипты, формы и бесконечная прокрутка
Современные роботы умеют исполнять JavaScript, но с двумя оговорками. Первая: это делается позже основного обхода, иногда с задержкой в дни. Вторая: качество исполнения ниже, чем в вашем браузере, — робот не кликает, не листает и не ждёт долгих ответов.
Отсюда конкретные ловушки:
- Товары, подгружаемые кнопкой «показать ещё». Робот кнопку не нажмёт. Всё, что за первым экраном списка, для него не существует, пока нет обычной постраничной навигации ссылками.
- Бесконечная прокрутка без ссылок на страницы. Та же беда: робот не прокручивает.
- Меню, которое строится скриптом. Если в исходном коде вместо ссылок пустой контейнер, робот не найдёт разделы сайта.
- Ссылки не ссылками. Переход, сделанный на элементе с обработчиком клика вместо тега со ссылкой, роботом не читается.
- Контент за фильтром или вкладкой. Текст во вкладке индексируется, если он есть в коде сразу. Если подгружается по клику — нет.
Помогу с продвижением: продвижение сайтов белыми методами — вывожу сайты в топ Яндекса белыми методами.
Проверка простая и бесплатная: отключите JavaScript в браузере и походите по сайту. То, что осталось видно, робот увидит гарантированно. То, что исчезло, — под вопросом.
Robots.txt: что этот файл может и чего не может
Файл в корне сайта, где перечислено, куда роботу заходить не нужно. Читается перед обходом, поэтому влияет на маршрут напрямую.
Что он делает: запрещает скачивать указанные адреса, указывает адрес карты сайта, может задавать отдельные правила разным роботам.
Чего он не делает: не удаляет страницы из поиска. Это главное заблуждение. Закрытая в файле страница может остаться в выдаче, если на неё ведут ссылки, — просто без описания. Для удаления нужен мета-тег noindex, а чтобы робот его прочитал, страница должна быть открыта для обхода.
Типовые ошибки, которые я вижу при проверках:
- Запрет на весь сайт, оставшийся с этапа разработки. Одна строка, и сайт невидим месяцами.
- Закрытые папки со стилями и скриптами. Робот не может отрисовать страницу и считает её сломанной или неадаптивной.
- Правило, написанное с опечаткой в пути — оно просто не работает, а владелец считает раздел закрытым.
- Разные наборы правил для разных роботов, накопившиеся годами и противоречащие друг другу.
Проверять файл нужно не глазами, а инструментом проверки в панели вебмастера: вставляете конкретный адрес и смотрите, разрешён он или нет. Проверять стоит не один адрес, а по одному представителю от каждого типа страниц: главную, раздел каталога, карточку товара, статью блога, страницу услуги. На большом сайте это пять минут, а находки бывают неожиданные — например, что закрыт весь раздел с товарами одной категории из-за совпадения куска пути с правилом, написанным для служебной папки.
Отдельно держите копию файла где-нибудь вне сайта. Обновление CMS, смена шаблона или переезд на другой хостинг регулярно переписывают robots.txt на стандартный, и обнаруживается это по падению числа страниц в поиске через месяц. Сверка с копией занимает минуту и сразу отвечает на вопрос, техническая проблема или содержательная.
Смежный материал по теме — «Оптимизация сайта под поисковые системы».
Сколько страниц робот берёт за визит
Ресурс обхода не бесконечен. Поисковая система распределяет его между миллионами сайтов, и вашему достаётся доля, зависящая от нескольких понятных вещей.
| Что влияет | Как влияет | Что можно сделать |
|---|---|---|
| Скорость ответа сервера | Чем быстрее отвечает, тем больше страниц робот успевает взять за визит | Кэширование, нормальный хостинг, оптимизация запросов к базе |
| Частота обновлений | Сайт, где регулярно появляется новое, обходится чаще | Публиковать по расписанию, а не рывками раз в полгода |
| Доля мусорных адресов | Фильтры, сортировки и параметры съедают ресурс вместо нужных страниц | Закрыть параметры, настроить canonical, убрать лишние ссылки |
| Глубина вложенности | Страница в пяти кликах от главной обходится реже страницы в двух | Плоская структура, ссылки на важное с главной и из меню |
| Ошибки и редиректы | Цепочки переадресаций и битые адреса тратят обход впустую | Убрать цепочки, чинить 404 в ссылках, обновлять карту сайта |
| Внешние ссылки | Сайт с упоминаниями воспринимается как более значимый | Работать с отраслевыми площадками и справочниками |
Проверяется всё это в разделе статистики обхода: там видно, сколько адресов робот взял за день, какие коды ответов получил и на что потратил визиты. Если в списке обойдённых адресов преобладают страницы с параметрами, а карточки товара встречаются редко — вы нашли главную техническую проблему сайта.
Как посмотреть, что делал робот у вас
Три источника с разной точностью и трудоёмкостью.
Панель вебмастера. Раздел статистики обхода показывает динамику, коды ответов и список адресов за период. Данных достаточно для большинства решений, выгрузка делается в файл.
Логи сервера. Самый честный источник. Каждая строка — обращение с временем, адресом, кодом ответа и подписью робота. Запрашиваются у хостинга. Именно в логах видны вещи, которые не покажет ни один отчёт: например, что робот заходит на сайт ночью, когда включается тяжёлая фоновая задача и сервер отвечает по десять секунд.
Собственный краулер. Программа, которая обходит сайт так же, как робот, и показывает, что он увидит: коды ответов, заголовки, дубли, сироты, глубину вложенности. Даёт картину до визита робота, а не после.
Если нужна помощь по теме — заказать сайт.
Быстро увидеть базовые препятствия — недоступные страницы, запреты индексации, ошибки ответа — помогает бесплатный аудит: он проходит по сайту тем же путём и показывает, где обход спотыкается.
Настоящий робот и подделка
Значительная часть нагрузки на коммерческие сайты создаётся программами, которые представляются поисковым роботом, но им не являются: парсеры цен, сборщики контактов, накрутчики поведения. Отличить их важно, потому что решения противоположные — настоящему роботу надо помогать, поддельному закрывать дверь.
Если нужны детали, смотрите «Оптимизация сайта под поисковые запросы».
| Признак | Настоящий поисковый робот | Подделка |
|---|---|---|
| Обратная проверка адреса | Адрес принадлежит поисковой системе, проверка по имени хоста сходится | Адрес случайного хостинга или домашнего провайдера |
| Поведение во времени | Плавное, с паузами, не создаёт пиков нагрузки | Сотни запросов в минуту, ровный поток без пауз |
| Уважение к robots.txt | Читает файл и соблюдает запреты | Игнорирует, идёт в закрытые разделы |
| Что запрашивает | Страницы, картинки, стили, скрипты — всё нужное для отрисовки | Только страницы товаров с ценами или только формы |
| Отражение в отчётах | Виден в статистике обхода панели вебмастера | В отчётах поисковой системы отсутствует |
Проверка подлинности делается через обратный запрос по адресу: узнаёте имя хоста, затем проверяете, что это имя действительно ведёт на тот же адрес. Совпало — робот настоящий. Не совпало — можно ограничивать.
Что мешает обходу чаще всего
Список по частоте встречаемости на реальных сайтах, от самого распространённого:
- Страницы-сироты. Есть в карте сайта, но ни одна внутренняя ссылка на них не ведёт. Робот их видит формально, но приоритет им даёт минимальный.
- Бесконечные адреса. Календари, фильтры с комбинациями параметров, сортировки. Порождают миллионы вариантов, робот честно пытается их обойти.
- Цепочки редиректов. Адрес ведёт на второй, тот на третий. Каждый шаг — потраченный визит.
- Медленный ответ. Если страница отдаётся дольше двух-трёх секунд, робот сокращает интенсивность, чтобы не уронить сервер.
- Одинаковые заголовки. Сотни страниц с идентичным title означают для системы, что смотреть здесь нечего.
- Разные версии одного сайта. С www и без, по http и https, с косой чертой в конце и без. Каждая версия обходится отдельно, ресурс делится.
Отдельно стоит помнить про приоритет мобильной версии: если на телефоне часть содержимого скрыта или подгружается иначе, робот увидит именно этот усечённый вариант. Подробнее про то, как это устроено, я писал в материале про индексацией с приоритетом мобильных.
Частые вопросы
Как часто робот должен приходить на сайт? Нормы нет, есть соответствие. Магазин, где ежедневно меняются остатки, должен обходиться ежедневно. Сайт услуг из десяти страниц, не менявшийся полгода, робот может навещать раз в неделю, и это нормально.
Можно ли попросить робота ходить чаще? Напрямую — нет, косвенно — да. Ускоряют регулярные публикации, быстрый сервер, подключение мгновенных уведомлений об изменениях и внешние ссылки. Директивы задержки в robots.txt современные системы игнорируют.
Робот нагружает сервер, сайт тормозит. Что делать? Сначала проверьте, настоящий ли это робот — в девяти случаях из десяти нагрузку дают парсеры. Если настоящий, поставьте ограничение скорости обхода в панели вебмастера и параллельно разберитесь, почему сервер не держит десяток запросов в секунду.
Что важнее для обхода — карта сайта или внутренние ссылки? Ссылки. Карта помогает найти адрес, ссылки объясняют, насколько он важен. Страница, на которую ведут ссылки из меню и из соседних материалов, обойдётся быстрее той, что есть только в карте.
Нужно ли закрывать от роботов страницы пагинации? Обычно нет: через них робот доходит до карточек. Закрывать имеет смысл сортировки и комбинации фильтров, которые не несут отдельного смысла и плодят одинаковые списки.
Правда ли, что в топ можно выйти без вложений в платный трафик? Правда, и это обычный сценарий, когда техническая часть в порядке и робот беспрепятственно обходит сайт. Про то, как это работает без ставки на бюджет, есть отдельный материал.
Логику обхода нагляднее один раз увидеть на живых отчётах. В коротком видео ниже показано, как читать статистику обхода и на что смотреть в первую очередь.
Коротко
- Роботов несколько, задачи у них разные; на большинстве сайтов основной обход давно идёт с приоритетом мобильной версии.
- Адреса робот берёт из внутренних ссылок, карты сайта, внешних упоминаний и прямых сигналов — страница без входящих ссылок для него почти не существует.
- Скрипты робот исполняет позже и хуже браузера: кнопки «показать ещё», бесконечная прокрутка и меню на скриптах прячут от него часть сайта.
- Robots.txt управляет обходом, но не удаляет страницы из поиска; для удаления нужен noindex на открытой для обхода странице.
- Ресурс обхода ограничен, и его съедают фильтры, сортировки, цепочки редиректов и медленный сервер — проверяется по статистике обхода и логам.
- Заметная доля нагрузки на коммерческих сайтах приходится на поддельных роботов; подлинность проверяется обратным запросом по адресу.
Если по отчётам видно, что робот ходит по сайту не туда, а нужные страницы месяцами остаются без внимания, приходите на SEO-консультацию. Посмотрим статистику обхода вашего сайта, найдём, где теряется ресурс, и составим порядок технических правок.
Увеличьте позиции и продажи вашего сайта
Профессиональное SEO-продвижение с гарантией результата. Выберите подходящую услугу:
Остались вопросы по продвижению?
Меня зовут Анатолий Кузнецов, я SEO-оптимизатор с 20-летним стажем. Разберу ваш сайт, отвечу на вопросы и подскажу, что улучшить для роста позиций в Яндексе и Google.
Связаться со мной →Комментарии
Станислав Овсиенко
Посмотрел статистику обхода: за неделю робот взял 11 тысяч адресов, из них карточек товара штук двести. Остальное — адреса с вопросительными знаками и параметрами сортировки. Каталог на 6 тысяч позиций, в поиске меньше тысячи. Понятно, куда всё уходит, но что конкретно делать?
Анатолий Кузнецов автор
Диагноз вы поставили верно, дальше работа в три приёма. Первый: выгрузите список обойдённых адресов и сгруппируйте по названию параметра — обычно выясняется, что девяносто процентов мусора порождают два-три параметра, например сортировка и вид отображения списка. Второй: на всех страницах с этими параметрами пропишите canonical на чистый адрес раздела без параметров. Это главное действие, оно объясняет системе, что все варианты — одна и та же страница. Третий: уберите со страниц ссылки, ведущие на такие адреса, или закройте их от перехода — робот берёт адреса из кода, и пока ссылки на месте, он будет ходить по ним снова. Правила в robots.txt добавляйте последними и осторожно, иначе робот не сможет прочитать canonical на уже известных ему адресах. Первые изменения в статистике обхода обычно видны через две-три недели.
Раиса Олюнина
Сайт на конструкторе, весь каталог подгружается кнопкой «загрузить ещё». Отключила JavaScript, как вы советуете, — осталось двенадцать товаров из четырёхсот. Конструктор менять не готовы. Есть выход?
Анатолий Кузнецов автор
Выход зависит от того, что позволяет ваш конструктор, но проверить стоит три вещи. Первая: почти у всех конструкторов в настройках каталога есть переключатель между подгрузкой по кнопке и обычной постраничной навигацией. Если он есть — переключите, это решает вопрос целиком. Вторая: даже при подгрузке кнопкой карточки товаров обычно имеют собственные адреса. Проверьте, открывается ли карточка по прямой ссылке и есть ли эти ссылки в карте сайта — тогда робот дойдёт до товаров в обход списка, просто медленнее. Третья: сделайте текстовые ссылки на подразделы каталога в описании раздела или в подвале. Даже десяток таких ссылок заметно меняет картину, потому что робот получает точки входа. Двенадцать видимых товаров из четырёхсот — это ситуация, при которой каталог для поиска существует на три процента, так что заниматься этим надо раньше, чем текстами.
Тарас Оноприенко
Хостинг жалуется на нагрузку и предлагает тариф дороже. В логах вижу кучу обращений от чего-то с названием, похожим на поисковый бот. Как понять, платить или блокировать?
Анатолий Кузнецов автор
Сначала проверка подлинности, она бесплатная и занимает пару минут. Возьмите из логов адрес, с которого идут запросы, и сделайте обратный запрос: узнайте имя хоста, а потом проверьте, что это имя ведёт обратно на тот же адрес. У настоящих роботов поисковых систем имя хоста принадлежит самой системе, и проверка сходится. Если не сходится — перед вами парсер, и его можно ограничивать без последствий для поиска. Дальше посмотрите на характер обращений: настоящий робот берёт разные типы страниц вперемешку и делает паузы, парсер долбит однотипные адреса ровным потоком. И третье: сверьтесь со статистикой обхода в панели вебмастера. Если поисковая система показывает тысячу обращений в сутки, а в логах их пятьдесят тысяч — разница и есть ваша нагрузка. Менять тариф из-за парсеров смысла нет, их надо отсекать.
Эдуард Ордынцев
Вопрос про сирот. У меня блог на 300 статей, ссылки между ними ставились как придётся. Как найти те, на которые никто не ссылается, без покупки платных программ?
Анатолий Кузнецов автор
Для трёхсот страниц хватит бесплатных средств. Возьмите любой десктопный краулер с бесплатным лимитом — на такой объём вы в него уложитесь, — запустите обход сайта и выгрузите отчёт по внутренним ссылкам. Там будет колонка с количеством входящих ссылок на каждый адрес: сортируете по возрастанию и получаете список сирот сверху. Дальше сверьте этот список с адресами из вашей карты сайта — то, что есть в карте, но не встретилось в обходе, и есть настоящие сироты. Лечится не механически: на каждую такую статью нужно поставить две-три осмысленные ссылки из родственных материалов, где переход по ним логичен для читателя. Блок «читайте также» в конце помогает, но ссылка из текста работает заметно сильнее. И заведите правило: публикуя новую статью, сразу ставьте на неё ссылку хотя бы из двух старых.
Нина Обносова
Проверила исходный код — весь текст на месте, а вот меню действительно пустое, разделы рисуются скриптом. Разработчик говорит, что современные роботы всё умеют и проблемы нет.
Анатолий Кузнецов автор
Умеют, но с задержкой и не всегда полностью — и это не теория, а то, что видно по статистике обхода на таких сайтах. Разница принципиальная: текст на странице робот получит при первом же визите, а ссылки из меню — только после отдельного шага с исполнением скриптов, который ставится в очередь и может выполниться через несколько дней. Для сайта из десяти страниц это некритично. Для каталога это означает, что карта переходов между разделами строится с большим опозданием, а вес с главной по этим ссылкам передаётся хуже. Компромисс, который обычно устраивает всех: оставить скриптовое меню для внешнего вида, но продублировать структуру обычными ссылками в подвале сайта. Это два часа работы и никаких изменений в дизайне.
Кирилл Павлюченко
А как быть с фильтрами, которые реально нужны людям? У нас по фильтру «диван угловой левый» ищут, и такая страница собирает трафик. Закрывать её жалко.
Оксана Падерина
Добавлю от себя: у нас была та же история с календарём бронирования. Робот честно ходил по датам вперёд на несколько лет, миллионы адресов. Закрыли параметр даты — обход нужных страниц вырос почти сразу.
Леонид Пазухин
Скажите, а логи сервера реально можно получить на обычном виртуальном хостинге? Спрашивал поддержку, ответили что-то невнятное про панель управления.
Галина Палагина
Сайт переехал на новый домен полгода назад, редиректы стоят. В логах вижу, что робот до сих пор регулярно ходит по старым адресам. Это нормально или что-то настроено неправильно?
Инна Палкина
У нас в robots.txt закрыты папки со стилями — так сделал прошлый подрядчик «для безопасности». Судя по статье, это плохо. Насколько срочно исправлять?
Юрий Пальчиков
Интересует вопрос глубины. Сколько кликов от главной допустимо для карточки товара в большом каталоге? У нас получается пять-шесть, и уменьшить сложно из-за структуры.
Антон Панарин
Проверил обратным запросом адреса из логов — половина «роботов» оказалась с хостингов в других странах. Заблокировал по маске. Есть риск случайно отрезать настоящего робота таким способом?
хорошая статья, зачет !
Жаль я не смог найти хорошую статью про то как скрейпить и уроки по скайпу только про SEO .
Собираюсь прокси для скрейпинга закупить, интересуют Smartproxy очень, но где кролера подобрать — не знаю))