Почти на каждом сайте, который я разбираю впервые, повторяется один сюжет: владелец уверен, что у него 300 страниц, а поисковая система знает про 2800. Разница — это дубли. Их никто не создаёт намеренно, их порождает сама CMS: фильтры, сортировки, метки, пагинация, версии для печати. Проблема в том, что дубли не дают явного симптома. Сайт работает, страницы открываются, ошибок нет. А позиции при этом плавают, нужная страница вылетает из индекса, и вместо неё в выдаче болтается адрес с вопросительным знаком.

Что поисковая система считает дублем
Дубль — это две и более страницы, которые с точки зрения поисковика решают одну задачу пользователя. Не «содержат одинаковый текст», а именно решают одну задачу. Побайтовое совпадение — частный и самый простой случай. Чаще встречается ситуация, когда тексты формально разные, но интент один: две страницы про монтаж тёплого пола, отличающиеся вступлением и порядком абзацев.
Поисковик не хочет показывать пять почти одинаковых результатов, поэтому выбирает из группы один документ и назначает его основным. Остальные получают статус дубля и исключаются из выдачи. Ключевой момент: выбирает он сам, и его выбор часто не совпадает с вашим. Если вы не указали главную страницу, канонической может стать адрес с UTM-меткой, версия для печати или вторая страница пагинации. Поэтому работа с дублями — это не столько «удалить лишнее», сколько явно сказать поисковику, что считать основным.
Виды дублей
| Вид | Что это | Пример | Сложность устранения |
|---|---|---|---|
| Полные внутренние | Один контент по разным URL вашего домена | /uslugi/ и /uslugi/index.php, со слэшем и без, http и https | Низкая, лечится за неделю |
| Частичные внутренние | Пересекающийся, но не идентичный контент | Карточки товара, отличающиеся цветом; услуги по соседним районам | Высокая, требует работы с текстами |
| Дубли метаданных | Разный контент, одинаковые title и h1 | Пагинация, теговые ленты, фильтры | Средняя |
| Внешние | Ваш контент на чужих доменах | Скопированные статьи, агрегаторы, зеркала | Зависит от площадки |
| Кросс-доменные свои | Один контент на нескольких ваших сайтах | Региональные поддомены с общим текстом услуг | Средняя |
Отдельно выделю то, что формально дублем не является, но ведёт себя так же, — каннибализацию. Две ваши страницы борются за один запрос, поочерёдно вылезая в выдачу. Тексты разные, дублем поисковик их не признаёт, но релевантность размазана между двумя документами, и обе стоят хуже, чем стояла бы одна.
Откуда дубли берутся
- Зеркала. Адрес с www и без, http и https одновременно, слэш на конце и без него.
- Главная по нескольким адресам. Домен, /index.php, /index.html, /home/.
- Параметры сортировки и отображения. ?sort=price, ?view=list — контент тот же, адресов десятки.
- Метки кампаний. UTM, yclid, gclid, партнёрские идентификаторы: каждая ссылка в рассылке порождает новый URL.
- Пагинация. Вторая и следующие страницы листинга с тем же title и описанием категории.
- Фильтры каталога. Самый плодовитый источник: комбинации дают тысячи адресов.
- Теги в блоге. Одна статья доступна из десятка теговых лент.
- Товар в нескольких категориях, если URL включает путь категории.
Чем дубли реально опасны
Сразу сниму мифологию: специального «фильтра за дубли», который обрушивает сайт целиком, не существует. Вред другой, менее эффектный, но ощутимый.
Расход краулингового бюджета. Робот обходит ограниченное число адресов за сеанс. Если из тысячи обойдённых URL восемьсот — комбинации фильтров, ваши новые товары попадут в индекс не через день, а через месяц.
Выбор не той страницы. По коммерческому запросу показывается адрес с сортировкой или теговая лента вместо посадочной. Позиции вроде есть, а заявок нет.
Размывание ссылочного веса. Внешние ссылки дорого получать, а половина из них ведёт на копию вместо основной страницы.
Нестабильность позиций. При большой группе дублей поисковик периодически меняет каноническую страницу, и это выглядит как необъяснимые скачки.
Как искать дубли: практический разбор
Яндекс.Вебмастер. Раздел «Индексирование», отчёт «Страницы в поиске», вкладка «Исключённые», фильтр по статусам «Дубль» и «Неканоническая». Поисковик сам перечисляет, что считает копиями. Выгрузите и сгруппируйте по шаблону URL — сразу видно, какой механизм порождает мусор.
Google Search Console. Отчёт «Индексирование страниц», категории про выбор другой канонической страницы. Особенно показательна ситуация, когда вы сами положили адрес в sitemap, а Google с вашим выбором не согласился.
Краулер. Обход сайта с отчётами по повторяющимся title, h1 и описаниям. Делать надо в двух режимах: с учётом robots.txt и без него — второй показывает, сколько адресов реально существует.
Ручная проверка. Откройте главную по всем вариантам написания: каждый должен приводить к одному адресу через 301.
База данных. Запрос, группирующий записи по совпадению заголовка или первых 200 символов текста. На блогах с сотнями статей это находит то, чего не видит ни один краулер.
| Инструмент | Что находит | Чего не покажет |
|---|---|---|
| Яндекс.Вебмастер | Прямой список дублей и неканонических адресов | Страницы, которые робот ещё не обошёл |
| Search Console | Расхождения с вашим canonical | Полный перечень существующих URL |
| Краулер | Совпадения title, h1, description, цепочки редиректов | Внешние копии и страницы без входящих ссылок |
| Логи сервера | Куда реально ходит робот и сколько тратит времени | Смысловое сходство страниц |
| Запросы к базе | Частичные дубли текстов и заголовков | Технические дубли на уровне URL |
Чем устранять: инструмент под ситуацию
| Метод | Когда применять | Чего нельзя делать |
|---|---|---|
| 301 редирект | Страница не нужна и не должна быть доступна: зеркала, index.php, объединение двух страниц | Склеивать страницы с разным содержимым, строить цепочки из трёх переходов |
| rel=canonical | Обе страницы нужны пользователю, но в индексе должна быть одна: сортировки, метки, товар в нескольких категориях | Указывать страницу с другим содержимым или закрытую от индексации |
| noindex | Страница нужна пользователю, но бесполезна в поиске: поиск по сайту, корзина, кабинет | Совмещать с запретом в robots.txt — робот не увидит директиву |
| Clean-param | Параметры, не меняющие контент: UTM, идентификаторы сессий | Закрывать параметры, формирующие разное содержимое |
| Disallow | Технические разделы, куда роботу незачем ходить | Удалять так уже проиндексированные страницы |
| Объединение страниц | Каннибализация: две страницы под один интент | Просто удалять слабую без переноса содержимого и редиректа |
Правило простое: если оба адреса должны существовать для пользователя — canonical или noindex. Если один существовать не должен — 301. Robots.txt закрывает только то, что не должно посещаться вообще. Вести работы стоит сверху вниз: сначала зеркала и протокол, затем главная, параметры, фильтры, пагинация и теги, и только потом частичные дубли контента. Часть задач потребует программиста, и это нормальная доработка сайта, а не разовая правка текстов.
Частичные дубли и внешние копии
Карточки товаров с описанием производителя. Один текст стоит на сотне сайтов. Переписывать тысячи карточек нереально, поэтому работают точечно: уникализируют первые 300–500 символов, добавляют свои фотографии, характеристики, отзывы, блок совместимости. Приоритет — по товарам, которые дают выручку.
Страницы услуг по городам. Шаблон с подстановкой названия города — прямая дорога к группе частичных дублей. Различаться должно то, что действительно различается: адрес офиса, зона выезда, местные ориентиры, цены с региональной поправкой, фото работ и отзывы клиентов из этого города. Если ничего этого нет, честнее сделать одну сильную страницу, чем двадцать пустых.
Статьи вокруг одного запроса. В блогах, которые росли годами, накапливается по три-четыре материала на тему. Нужен разбор: какая страница сильнее по трафику и ссылкам, перенести в неё уникальные фрагменты остальных, поставить 301. Обычно это входит в аудит сайта и даёт быстрый эффект. На будущее проблема снимается на входе: SEO-статьи должны готовиться с обязательной проверкой, нет ли уже страницы под этот же интент.
Внешние копии. Паника вокруг воровства контента преувеличена: обычно поисковик определяет первоисточник верно. Помогает быстрая индексация свежих материалов через переобход. При явном воровстве работает связка «письмо владельцу — жалоба хостеру».
Чего делать не стоит
- Закрывать в robots.txt то, что уже в индексе. Робот перестанет обходить страницы и не увидит ни canonical, ни noindex, ни редирект.
- Ставить canonical на главную со всех страниц. Встречается как «универсальное решение», приводит к выпадению нормальных страниц.
- Клеить редиректом страницы с разным смыслом. Поисковик расценит это как soft 404 и исключит адрес.
- Удалять дубли через 404 без разбора. Если на страницу вели ссылки и был трафик, вы теряете и то и другое.
- Править базу одним запросом без резервной копии. Ошибка в условии выборки правит не тот диапазон записей.
- Гнаться за стопроцентной уникальностью по программам проверки. Их показатель и оценка поисковика — разные вещи.
- Игнорировать каннибализацию. Формально это не дубли, но вреда часто больше.
Частые вопросы
Сколько дублей считается нормой? Формальной нормы нет. Ориентир: число страниц в поиске должно быть сопоставимо с числом ваших реальных посадочных страниц. Расхождение в разы — сигнал разбираться, небольшое количество исключённых есть на любом сайте.
Пагинацию закрывать или оставлять? Оставлять доступной для робота, иначе он не доберётся до товаров с дальних страниц. Уникализировать title вида «Категория — страница 3», описание категории показывать только на первой. Canonical со второй страницы на первую ставить не нужно.
Опасны ли UTM-метки? Сами по себе нет, опасно попадание таких адресов в индекс. Закрывайте Clean-param и ставьте canonical на чистый адрес. Проверьте заодно, не публикуете ли вы ссылки с метками на самом сайте.
Как быстро уходят дубли после исправления? Технические — от двух недель до двух месяцев, в зависимости от частоты обхода. Ускоряют переобход приоритетных адресов и корректный sitemap, где перечислены только канонические страницы.
Нужен ли текст под каждый фильтр каталога? Только для комбинаций, под которые есть реальный спрос и которые вы решили сделать посадочными. Для остальных — noindex. Генерация текстов на все комбинации создаёт ровно ту проблему, которую вы решаете.
Чеклист
- Сверьте число страниц в поиске с числом реальных посадочных страниц.
- Выгрузите исключённые страницы из Вебмастера со статусами «Дубль» и «Неканоническая».
- Проверьте отчёт индексации в Search Console на расхождения с вашим canonical.
- Откройте главную по всем вариантам адреса: каждый должен вести на один канонический через 301.
- Прогоните сайт краулером и разберите повторяющиеся title, h1 и description.
- Настройте canonical на страницах с сортировками, метками и товарами в нескольких категориях.
- Закройте noindex поиск по сайту, корзину, кабинет и служебные фильтры.
- Пропишите Clean-param для рекламных меток и идентификаторов сессий.
- Уникализируйте title пагинации, уберите повторяющееся описание категории.
- Найдите страницы-каннибалы, объедините их и поставьте 301 со слабой на сильную.
- Составьте план уникализации карточек и региональных страниц, начиная с приносящих выручку.
- Оставьте в sitemap.xml только канонические адреса с кодом 200.
- Через месяц повторите проверку и зафиксируйте динамику.
Если нужно заказать SEO-продвижение — помогу вывести сайт в топ Яндекса и удержать позиции.
Увеличьте позиции и продажи вашего сайта
Профессиональное SEO-продвижение с гарантией результата. Выберите подходящую услугу:
Остались вопросы по продвижению?
Меня зовут Анатолий Кузнецов, я SEO-оптимизатор с 20-летним стажем. Разберу ваш сайт, отвечу на вопросы и подскажу, что улучшить для роста позиций в Яндексе и Google.
Связаться со мной →