Google и Яндекс видят ваш сайт по-разному: как проверить глазами робота

Google и Яндекс видят ваш сайт по-разному: как проверить глазами робота
Анатолий Кузнецов
Анатолий Кузнецов
SEO-оптимизатор с 20-летним стажем. Автор блога seo-prodvizhenie-biznesa.ru о продвижении и доработке сайтов.

312 байт. Столько текста получал робот Яндекса на главной странице интернет-магазина, у которого в браузере был красивый каталог на 240 товаров, слайдер, фильтры и отзывы. Владелец полгода платил за продвижение, смотрел на свой сайт в Chrome и не понимал, почему позиции стоят мёртво. А поиск всё это время индексировал пустую страницу с меню из футера.

Это не редкий случай. Примерно каждый третий сайт, который я разбираю впервые, показывает роботу не то, что показывает человеку. И почти всегда владелец об этом не знает, потому что проверяет сайт единственным доступным ему способом — открывает его в браузере.

Ниже — разбор того, чем отличается взгляд Яндекса от взгляда Google, и практический протокол: как за 15 минут посмотреть на свой сайт глазами обоих роботов, без платных сервисов и без программиста.

Почему «у меня всё открывается» ничего не доказывает

Когда вы заходите на сайт, работает связка из десятка вещей: браузер выполняет JavaScript, подгружает шрифты и картинки, применяет стили, держит вашу сессию, помнит куки, знает ваш город по IP. Робот приходит без всего этого. У него нет вашей истории, вашего региона, вашего разрешения экрана и вашего терпения.

Робот получает поток байтов от сервера и решает: что здесь текст, что заголовок, что ссылка, стоит ли это вообще класть в индекс. Если между вашим сервером и роботом стоит что-то, что меняет ответ — кэш, CDN, защита от ботов, файрвол хостинга, плагин оптимизации — робот получит другой документ. Не худший, не урезанный, а именно другой. И ранжироваться будет он, а не то, чем вы любуетесь в браузере.

Правило, которое я повторяю клиентам на каждом созвоне: поиск ранжирует не ваш сайт. Поиск ранжирует свою копию вашего сайта. Работать нужно с копией.

Дальше начинается самое интересное: копий две, и они не совпадают между собой.

Пять принципиальных различий между роботами Яндекса и Google

Разница не в «алгоритмах» — про алгоритмы любят рассуждать на конференциях. Разница в механике обхода, и она измерима.

1. JavaScript. Googlebot умеет рендерить страницы в headless-браузере на движке Chromium: сначала он забирает исходный HTML, потом ставит страницу в очередь на рендеринг и через какое-то время видит её уже с исполненным JS. Очередь — ключевое слово: задержка бывает от часов до недель. Яндекс тоже заявляет поддержку JavaScript, но на практике исполняет его выборочно и намного скупее. Я много раз наблюдал одну и ту же картину: карточки товаров, подгружаемые через AJAX, спокойно живут в индексе Google и полностью отсутствуют в индексе Яндекса. Для рунета вывод простой: если контент рождается в браузере, для Яндекса его нет.

2. Директивы robots.txt. Яндекс понимает Clean-param — директиву, которой можно централизованно погасить UTM-метки, сортировки и идентификаторы сессий. Google эту директиву не понимает вообще и пройдёт мимо. Обратная ситуация: Crawl-delay Яндекс перестал учитывать ещё в 2018 году (скорость обхода теперь задаётся в Вебмастере), а Google не поддерживал её никогда. Отдельная ловушка — тег <noindex>: это изобретение Яндекса, невалидный HTML, и для Google он просто мусор в разметке. Скрыть кусок текста от Google этим тегом невозможно.

3. Канонические адреса и дубли. Для Google rel="canonical" — рекомендация, не приказ. Он может выбрать другой адрес, и в Search Console вы увидите статус вроде «Страница является копией, Google выбрал другую каноническую». Яндекс относится к каноникалу строже, но зато агрессивнее склеивает похожие страницы сам, а лишнее выкидывает со статусом «Малоценная или маловостребованная страница» — формулировка, которой в Google не существует в принципе. Если у вас на сайте живут фильтры и сортировки, вы почти наверняка кормите роботов сотнями почти одинаковых документов, и это отдельная большая тема — я подробно разбирал, как искать и убирать дубли страниц на сайте.

4. Регион. У Яндекса регион — явная сущность: он присваивается сайту в Вебмастере, подтверждается карточкой организации и напрямую влияет на выдачу по геозависимым запросам. У Google такой ручки нет: он выводит географию из контента, адреса, языка и профиля организации. Поэтому один и тот же сайт может держать топ-3 по Петербургу в Яндексе и быть невидимым в Google — и это не поломка, это разная модель.

5. Мобильная версия. Google давно индексирует сайты в первую очередь мобильным роботом: то, чего нет в мобильной вёрстке, для него не существует. Яндекс держит и десктопного, и мобильного робота и сравнивает версии между собой. Классическая находка на аудите: на мобильной версии дизайнер спрятал текстовый блок и половину перелинковки «чтобы не мешали». Для Google этот текст исчез вместе с позициями. Тема глубже, чем кажется, — я разбирал её в материале про SEO под мобильную аудиторию.

ПараметрЯндексGoogle
Исполнение JavaScriptВыборочно, с задержкой, часто не исполняетРендерит в Chromium, но с очередью
Clean-param в robots.txtПоддерживаетИгнорирует
Тег <noindex>ПонимаетНе понимает
rel=»canonical»Учитывает строгоСчитает подсказкой, может выбрать другую
Регион сайтаЗадаётся вручную в ВебмастереОпределяется алгоритмом по контенту
Приоритетный роботДесктопный + мобильныйМобильный (mobile-first)
Инструмент просмотраПроверка ответа сервераПроверка URL с рендерингом и скриншотом
Список IP-адресов роботовНе публикуется, проверка через reverse DNSПубликуется официально в JSON

Протокол проверки за 15 минут: curl, Вебмастер, Search Console

Теория без рук бесполезна. Вот последовательность, которую я прогоняю на каждом новом проекте перед тем, как вообще обсуждать бюджет и сроки.

Шаг 1. Забрать страницу так, как её забирает робот. В терминале (на Windows — в PowerShell или Git Bash):

curl -A "Mozilla/5.0 (compatible; YandexBot/3.0; +http://yandex.com/bots)" -sL https://вашсайт.ru/ > yandex.html

curl -A "Mozilla/5.0 (compatible; Googlebot/2.1; +http://www.google.com/bot.html)" -sL https://вашсайт.ru/ > google.html

Теперь сравните два файла между собой и с тем, что видно в браузере. Различаются по размеру больше чем на пару процентов — у вас на сайте отдаётся разный контент разным агентам, и это повод разбираться немедленно. Совпадают, но оба подозрительно маленькие — контент рисует JavaScript.

Шаг 2. Посмотреть заголовки ответа. Ключ -I вместо -s покажет код ответа и служебные заголовки. Смотрите на три вещи: реальный код (200, 301, 404), цепочку редиректов и заголовок X-Robots-Tag. Последний закрывает страницу от индексации на уровне сервера, его не видно в исходном коде, и он выживает после любых правок в админке. Я находил такой заголовок на боевых сайтах, оставшийся с этапа разработки, — трафика не было год.

Шаг 3. Отключить JavaScript в браузере. В Chrome: DevTools → Ctrl+Shift+P → команда Disable JavaScript → обновить страницу. То, что осталось на экране, и есть база, с которой работает Яндекс. Если пропало меню, каталог, описания и телефон — вы нашли причину, по которой сайт не растёт.

Шаг 4. Яндекс.Вебмастер, «Проверка ответа сервера». Инструмент показывает код ответа и исходный HTML именно так, как его получил робот, с выбором десктопного или мобильного агента. Отдельно загляните в «Страницы в поиске»: раздел «Исключённые» — это прямой список претензий Яндекса к вашему сайту, где напротив каждого адреса написана причина.

Шаг 5. Google Search Console, «Проверка URL». После проверки нажмите «Изучить просканированную страницу» — там доступны отрендеренный HTML, скриншот и, что важнее всего, список ресурсов, которые Googlebot не смог загрузить. Заблокированные скрипты и стили — частая причина, по которой Google видит вашу страницу разъехавшимся набором блоков.

Шаг 6. Сверить Метрику и Вебмастер. Метрика считает людей и работает на JavaScript, Вебмастер считает роботов. Расхождение в логике здесь и вылезает: счётчик уверенно рисует посещения страницы, а в индексе её нет. Значит, страница физически доступна, но для поиска она не существует.

Главный убийца индексации в Google, о котором молчат хостеры

Отдельно вынесу находку, которая за последние два года попадалась мне не меньше десяти раз и почти никогда не диагностируется владельцем.

Российский хостинг или защита от ботов режет запросы с зарубежных IP-адресов. Логика админов понятна: перебор паролей, парсеры, DDoS — всё это идёт из-за рубежа, проще закрыть целые подсети. Но роботы Google ходят именно с зарубежных адресов. В результате Яндекс сайт видит прекрасно, а Googlebot получает 403 или таймаут и постепенно выбрасывает страницы из индекса.

Внешне это выглядит так: в Яндексе всё нормально, в Google трафик медленно съезжает к нулю, а в Search Console копятся «Ошибка сервера (5xx)» и «Обнаружена — не проиндексирована». На сайте сервиса по ремонту дизельных форсунок я разбирал ровно такую историю: 400+ страниц, идеальная структура, ноль обхода со стороны Google. Причина оказалась в одной галочке в панели защиты хостинга.

Проверяется просто: если curl с UA Googlebot отдаёт 200, а Search Console стабильно рапортует о недоступности — дело не в сайте, а в фильтрации на входе. Просите хостера показать логи блокировок и белым списком открывать подсети поисковых роботов. Такие вещи почти всегда всплывают на этапе технического SEO-аудита сайта, потому что снаружи их не видно вообще.

Как отличить настоящего робота от подделки и зачем это нужно

Половина «Googlebot» в ваших логах — не Googlebot. User-Agent подделывается одной строкой, и парсеры конкурентов, сборщики контента и накрутчики представляются поисковыми роботами, чтобы их не банили.

Проверка занимает минуту. Берёте IP из логов и делаете обратный DNS-запрос: host 66.249.66.1. Для настоящего робота Google имя закончится на googlebot.com или google.com, для робота Яндекса — на yandex.ru, yandex.net или yandex.com. Затем делаете прямой запрос по полученному имени и убеждаетесь, что он возвращает тот же IP. Не сошлось — перед вами самозванец. У Google дополнительно есть официально публикуемый список диапазонов, у Яндекса такого списка нет принципиально, и reverse DNS остаётся единственным честным способом.

Зачем это нужно практически? Во-первых, фейковые боты выедают ресурсы сервера и замедляют сайт для живых людей и настоящих роботов. Во-вторых, они портят статистику: вы смотрите на «рост обхода» и радуетесь, а обхода нет. В-третьих, накрутка поведенческих в чужой адрес — вещь неприятная, и понимать, кто у вас в логах, полезно. О том, как поиск вообще оценивает качество страницы и кто этим занимается, я писал в разборе про асессоров поисковых систем.

Что чаще всего находится при проверке: разбор реальных находок

Собрал самые частые находки из своей практики — по убыванию частоты, а не по красоте формулировок.

  • Меню на JavaScript. Для человека — красивое выпадающее меню. Для Яндекса — отсутствие ссылок на внутренние разделы. Итог: половина сайта не получает внутреннего веса и не индексируется. Почему это критично, я показывал в материале про оптимизацию навигации сайта.
  • Soft 404. Несуществующий адрес отдаёт код 200 и надпись «Страница не найдена». Робот считает такие страницы нормальными и складывает в индекс мусор. На сайтах с фильтрами их бывают тысячи.
  • Отсутствующий или дублирующийся H1. В браузере заголовок нарисован картинкой или стилизованным div. В коде H1 нет. Робот не понимает, о чём страница.
  • Каноникал на служебный адрес. Плагин проставляет canonical на /index.php?id=7, а продвигается человеческий ЧПУ-адрес. Вес уходит в никуда.
  • Разные версии по агенту. Кэш отдаёт роботу страницу месячной давности, а человеку свежую. Формально — не клоакинг, фактически — поиск ранжирует прошлогодний контент.
  • Ленивая подгрузка текста. Описание раскрывается по кнопке «Читать далее» и подгружается запросом. Человек читает, робот — нет.
  • Битая перелинковка после редизайна. Дизайн новый, адреса новые, редиректы забыли. Классика, из-за которой сайты теряют по 60–70% трафика за месяц; отдельно разбирал, как делать редизайн сайта без потери позиций.
  • Страницы-сироты. Есть в sitemap, но ни одной внутренней ссылки. Робот доходит до них в последнюю очередь, вес не получают вообще — механику я разбирал в статье про вес ссылки и распределение внутреннего веса.

Ни одна из этих проблем не видна человеку, который просто открывает сайт в браузере. Все они видны за 15 минут проверки описанным выше протоколом. И почти каждая стоит владельцу конкретных денег — не «позиций», а заявок и звонков.

Чек-лист: смотрим на сайт глазами робота

  1. Скачать главную и одну товарную страницу через curl с UA Яндекса и Google, сравнить размер и содержимое.
  2. Проверить коды ответа и цепочки редиректов, найти лишние 302 и промежуточные звенья.
  3. Проверить заголовок X-Robots-Tag и мета-тег robots на каждом типе страниц.
  4. Отключить JavaScript и посмотреть, что осталось: текст, меню, телефон, кнопки.
  5. Прогнать страницы через «Проверку ответа сервера» в Вебмастере — десктопным и мобильным роботом.
  6. В Search Console открыть отрендеренный HTML и список незагруженных ресурсов.
  7. Сверить число страниц в sitemap, в индексе Яндекса и в индексе Google — три разных числа расскажут больше любого отчёта.
  8. Изучить раздел «Исключённые страницы» в Вебмастере и прочитать причины по каждому адресу.
  9. Проверить IP роботов из логов через обратный DNS и вычистить самозванцев.
  10. Сравнить мобильную и десктопную вёрстку по объёму текста и количеству ссылок.

Новые глаза: как вас видит нейропоиск

К двум привычным роботам добавились новые. Алиса и Нейро в Яндексе, обзоры в поиске, ChatGPT, Perplexity, GigaChat — все они собирают ответ из текста, который смогли забрать и понять. И у них ограничений ещё больше, чем у классических краулеров: они почти не исполняют JavaScript, любят чёткую структуру, прямые формулировки, конкретные цифры и явные ответы на явные вопросы.

Практическое следствие простое. Сайт, который плохо читается роботом, в нейропоиске не появится вообще — он даже не попадёт в набор источников, из которых модель собирает ответ. Зато сайт с внятной структурой и однозначными фактами начинает цитироваться, и это уже отдельный канал трафика, за который сейчас почти никто не борется. Как готовить сайт под выдачу нейросетей, я разбираю в разделе про GEO-продвижение сайтов — там и про структуру, и про llms.txt, и про то, как попадать в ответы Алисы и ChatGPT.

Если проверка показала проблемы — что дальше

Проверка глазами робота почти всегда заканчивается одинаково: находится 5–15 проблем, из которых 2–3 критические и режут трафик прямо сейчас. Дальше вопрос не в знании, а в руках и времени: кто-то должен переписать шаблоны, вынести контент из JavaScript, настроить редиректы, закрыть мусор и снова показать сайт роботам.

Я веду проекты лично, без ассистентов и передачи менеджерам: сам делаю аудит, сам правлю технику, сам собираю семантику и сам отчитываюсь. В работе учитываю все основные факторы ранжирования — на сегодня их 1922, — но методику не раскрываю: это моё know-how, наработанное с 2005 года. Продаю не список работ, а результат, который видно в позициях и в звонках. Сайты, которые я веду, держат ТОП-1 Яндекса по 8 лет и дольше, а любому из моих клиентов вы можете позвонить и спросить напрямую — контакты открыты в портфолио кейсов с адресами сайтов и в видеоразборах проектов.

Что можно сделать прямо сейчас:

Если хотите просто задать вопрос по своему сайту — звоните напрямую: +7 (921) 333-77-45, отвечаю лично. Или напишите через форму обратной связи — разберу ситуацию и честно скажу, есть ли смысл вкладываться в продвижение именно вашего сайта или сначала нужно чинить фундамент. Ещё больше практических разборов — в блоге о SEO.

И маленький совет напоследок: заведите привычку раз в месяц открывать свой сайт через curl с User-Agent робота. Пять минут. Это единственный способ узнать о проблеме до того, как о ней сообщит падающий график трафика.

Увеличьте позиции и продажи вашего сайта

Профессиональное SEO-продвижение с гарантией результата. Выберите подходящую услугу:

Анатолий Кузнецов — SEO-оптимизатор

Остались вопросы по продвижению?

Меня зовут Анатолий Кузнецов, я SEO-оптимизатор с 20-летним стажем. Разберу ваш сайт, отвечу на вопросы и подскажу, что улучшить для роста позиций в Яндексе и Google.

Связаться со мной →

Оставьте комментарий

Ваш адрес email не будет опубликован. Обязательные поля помечены *

 Нажимая «оставить комментарий» вы принимаетеправила конфиденциальности 

Прокрутить вверх