
Дублирование контента редко выглядит как проблема. Сайт открывается, страницы на месте, тексты написаны, владелец видит нормальную картину — а в поиске из десяти карточек товара показывается одна, да и та по адресу с рекламной меткой. Причина в том, что поисковая система нашла несколько одинаковых страниц, выбрала главную сама и выбрала не ту, на которую вы ставили ссылки.
Хуже всего то, что этот процесс не даёт никаких сигналов. Позиции не падают резко, письма из Вебмастера не приходят, ошибок в браузере нет. Просто новые страницы месяцами не попадают в поиск, а старые то появляются, то исчезают. Ниже — откуда дубли берутся, как их найти за один вечер и каким инструментом закрывать каждый тип, потому что универсального средства здесь нет и попытка закрыть всё одним способом обычно делает хуже.
Два вида дублей, и опасен не тот, о котором думают
Дубли делятся на внешние и внутренние, и владельцы сайтов почти всегда переживают не о том виде.
Внешние — ваш текст совпадает с текстом на чужом сайте. Скопировали описание у вас, или вы вместе с сотней магазинов взяли описание у поставщика. Об этом спрашивают чаще всего.
Внутренние — одна и та же страница вашего сайта доступна по нескольким адресам. Об этом не спрашивает почти никто, а именно они съедают обход, размывают внутренний вес и подменяют в выдаче нужные страницы адресами фильтров.
Пропорция такая: на типовом интернет-магазине внешних совпадений может не быть вовсе, а внутренних адресов-двойников — в десять-пятнадцать раз больше, чем реальных товаров. Каждый из них робот скачивает, обрабатывает и только потом выбрасывает, потратив на это квоту, которой не хватило новым карточкам.
Откуда берутся внутренние дубли
Источников немного, они типовые и повторяются от сайта к сайту почти без вариаций. Разница только в том, сколько адресов порождает каждый.
| Источник | Как выглядит | Сколько адресов создаёт |
|---|---|---|
| Адрес со слэшем и без | /uslugi/ и /uslugi | Удваивает весь сайт |
| Версия с www и без | www.site.ru и site.ru | Удваивает весь сайт |
| Протокол http и https | http://site.ru и https://site.ru | Удваивает весь сайт |
| Рекламные метки | /uslugi/?utm_source=direct | Десятки копий одной страницы |
| Сортировки и фильтры каталога | /katalog/?orderby=price&color=white | Сотни и тысячи адресов |
| Товар в нескольких категориях | /okna/tovar/ и /plastik/tovar/ | По числу категорий товара |
| Внутренний поиск по сайту | /?s=zapros | Неограниченно, растёт само |
| Пагинация без настройки | /blog/page/2/ с тем же title | По числу страниц списка |
| Версия для печати | /statya/print/ | Копия каждой статьи |
| Страницы вложений WordPress | Отдельный адрес на каждую картинку | Копия на каждый файл в галерее |
Первые три строки — технические и лечатся за полчаса одним правилом на сервере. Именно с них надо начинать, потому что они множатся на всё остальное: если у вас одновременно живут версии с www и без, а внутри каждой ещё и адреса с фильтрами, число копий перемножается.
Что дубли ломают на самом деле
Формулировка «за дубли понижают» неточная и мешает понять механику. Никто не наказывает сайт за то, что страница доступна по двум адресам. Проблема в трёх последствиях, и каждое стоит денег.
- Квота обхода уходит в мусор. Робот скачивает ограниченное число страниц в сутки. Если восемьдесят процентов адресов в очереди — копии, новая карточка товара попадёт в поиск не через три дня, а через три недели. На сайте, где ассортимент меняется еженедельно, это прямая потеря сезона.
- В выдачу попадает не та страница. Из нескольких копий система выбирает одну сама. Часто ей оказывается адрес с меткой из рекламной кампании или страница фильтра с обрезанным описанием. Посетитель приходит на неполную версию, а вы правите ту, которую никто не видит.
- Внутренний вес размывается. Ссылки из меню, из статей блога и из внешних источников распределяются между копиями. Каждая копия получает часть сигналов, и ни одна не набирает достаточно, чтобы конкурировать за первую страницу выдачи.
- Стоит ли набирать ссылочную массу без контента
- Как раскачать сайт контентом
Есть и четвёртое последствие, менее очевидное. Когда сотни адресов отличаются одним параметром и содержат один и тот же набор товаров, система помечает их как малоценные. Эта пометка относится к конкретным страницам, но накопленная в больших количествах она портит общее впечатление о разделе: качественная категория, вокруг которой висят пятьсот пустых вариаций, ранжируется хуже одинокой такой же категории у конкурента.
Как найти дубли за один вечер
Проверка не требует платных инструментов и делается по порядку от самого быстрого к самому подробному.
Шаг первый, руками, пять минут. Откройте главную страницу в вариантах и посмотрите код ответа каждого:
- с www и без www;
- по http и по https;
- со слэшем в конце и без слэша;
- с добавленной меткой вида
?utm_source=proverka; - с заглавной буквой в пути, если у вас есть вложенные разделы;
- с произвольным несуществующим хвостом — он обязан отдавать 404, а не 200.
Все варианты, кроме одного основного, должны вести на него перенаправлением 301. Если каждый отвечает кодом 200 — у вас минимум пять копий главной, и то же самое происходит с каждой страницей сайта.
Шаг второй, Яндекс.Вебмастер. Раздел «Страницы в поиске», вкладка исключённых. У каждого адреса указана причина, и дубли названы прямо. Отсортируйте по причине: если в списке тысяча адресов с пометкой о дубле, вы сразу увидите шаблон — все они с одним параметром, или все из одного раздела. Шаблон важнее отдельных адресов, потому что чинится он одним правилом.
Шаг третий, Google Search Console. Отчёт об индексировании, категории «Страница является копией, канонической версии нет» и «Страница является копией, Google выбрал другую каноническую». Вторая категория особенно полезна: там прямо написано, какой адрес система считает основным вместо вашего.
Шаг четвёртый, обход краулером. Screaming Frog в бесплатной версии или любой аналог. Смотрю два столбца: одинаковые title и одинаковые описания. Совпадающие заголовки у двадцати страниц — почти всегда признак того, что это одна страница по разным адресам либо шаблон не подставляет данные. Второе тоже надо чинить, но это уже другая задача.
Шаг пятый, статистика обхода. В Вебмастере есть список адресов, которые робот скачивал за последние дни. Это самая честная картина: вы видите не то, что думаете о своём сайте, а то, чем робот реально занимался. Если там сплошные адреса с параметрами — вопрос закрыт, приоритет найден.
Чем закрывать: четыре инструмента и границы каждого
Главная ошибка при чистке дублей — закрыть всё одним способом. Инструменты решают разные задачи, и подмена одного другим либо не работает, либо выбивает страницы из индекса.
| Инструмент | Когда применять | Что происходит со страницей | Когда применять нельзя |
|---|---|---|---|
| Перенаправление 301 | Технические варианты адреса: www, протокол, слэш, регистр | Дубль перестаёт существовать, вес переходит на основной адрес | Если обе версии должны работать для посетителя |
| Canonical | Фильтры, сортировки, товар в нескольких категориях, пагинация | Страница работает и открывается, но в поиск идёт указанный адрес | Как замена 301 для технических дублей — это рекомендация, а не команда |
| Clean-param | Рекламные метки и служебные параметры, только для Яндекса | Параметр отбрасывается, адрес склеивается с чистым | Для Google — он директиву не понимает |
| Метатег noindex | Страницы, которые в поиске не нужны совсем: корзина, личный кабинет, версия для печати | Страница выпадает из индекса, но обход продолжается | Вместе с запретом в robots.txt — робот не зайдёт и не увидит запрет |
| Disallow в robots.txt | Служебные разделы и результаты внутреннего поиска | Робот не обходит адрес, но может показать его в выдаче по внешним ссылкам | Для рекламных меток — страница выпадет целиком |
Две строки из этой таблицы стоит развернуть, потому что на них спотыкаются чаще всего.
Метки закрывают через Clean-param, а не через Disallow. Разница принципиальная. Запрет в robots.txt означает «не ходи по этому адресу» — и страница с меткой выпадает из индекса вместе со всем содержимым. Директива Clean-param означает «выброси этот параметр и считай, что адрес чистый» — страница остаётся в поиске, а дубль исчезает. Для сайта, куда идёт рекламный трафик, это существенно: ссылки с метками расходятся по мессенджерам и соцсетям, и закрыть их запретом — значит терять живые страницы. Закрывать метки через Disallow — распространённая ошибка, которая обнаруживается не сразу.
Canonical — это рекомендация, а не запрет. Система учитывает её, но может проигнорировать, если содержимое страниц заметно различается. Поэтому canonical хорошо работает там, где страницы действительно почти одинаковы (фильтр, сортировка), и плохо там, где вы пытаетесь склеить разные материалы. И ещё: canonical на несуществующий адрес или на страницу с перенаправлением просто не учитывается — проверяйте, что указанный адрес отдаёт код 200.
Дубли в интернет-магазине: где их всегда больше всего
Каталог с фильтрами — главный производитель адресов-двойников. Механика простая: каждое сочетание параметров порождает адрес, и число сочетаний растёт как произведение. Пять фильтров по четыре значения дают больше тысячи адресов на одну категорию, и почти во всех показан один и тот же набор товаров.
Здесь важно не рубить сплеча. Часть страниц фильтров — это ценные посадочные адреса с реальным спросом: «белые пластиковые окна», «диван угловой с ящиком». Их надо не закрывать, а наоборот, открывать для индексации, давать им уникальный title и описание. Остальные — технический мусор.
| Тип страницы каталога | Есть ли спрос в Вордстате | Что делать |
|---|---|---|
| Категория верхнего уровня | Да, высокий | Основная посадочная страница, свой текст и title |
| Фильтр по одному значимому признаку | Часто да | Открыть для индексации, задать свой title и описание |
| Сочетание двух и более фильтров | Обычно нет | Canonical на категорию или на однопараметровый фильтр |
| Сортировка по цене, названию, новизне | Нет | Canonical на категорию, параметр в Clean-param |
| Смена количества товаров на странице | Нет | Canonical на категорию |
| Страницы пагинации | Нет | Canonical на саму себя, уникальный title с номером страницы |
| Товар, доступный из нескольких категорий | Спрос на товар | Один основной адрес карточки, canonical с остальных |
Про пагинацию отдельно, потому что советы в интернете противоречат друг другу. Ставить canonical со второй страницы на первую не нужно: содержимое разное, товары разные, и система такую рекомендацию скорее проигнорирует, а заодно перестанет обходить товары со второй страницы. Правильный вариант — canonical на саму себя плюс разные title вида «Категория — страница 2». Тогда страницы не конкурируют друг с другом, а товары остаются доступными для обхода.
Товар в нескольких категориях лечится структурно: карточка живёт по одному адресу, не зависящему от раздела, а из категорий на неё ведут обычные ссылки. Если движок так не умеет, выбирается основная категория, её адрес указывается в canonical со всех остальных вариантов.
Внешние дубли: где риск настоящий, а где выдуманный
Про совпадение текстов с чужими сайтами существует много страхов, и большая часть не подтверждается практикой.
Описания от поставщика. Одинаковые карточки стоят у сотен магазинов. Санкций за это нет. Есть другое: такая карточка не даёт системе повода показать именно вас, поэтому в топе оказываются магазины, где к описанию добавлены размеры, комплектация, ответы на вопросы покупателей и отзывы. Задача не в том, чтобы переписать текст поставщика синонимами, а в том, чтобы добавить к нему то, чего нет ни у кого.
Ваш текст скопировали. Обычная ситуация, и в большинстве случаев она ничем не заканчивается: у вашей страницы старше дата, больше ссылок и лучше поведение, поэтому копия не обгоняет оригинал. Реагировать стоит, когда копия реально стоит выше вас в выдаче. Порядок действий: письмо владельцу сайта, потом обращение к хостеру по контактам из данных о домене, потом форма жалобы на нарушение авторских прав в поисковой системе. Помогает, если у вас есть подтверждение первенства — дата публикации, сохранённая копия в веб-архиве, оригинал в системе оригинальных текстов Вебмастера.
Один текст на нескольких своих сайтах. Частая ситуация у бизнеса с региональными поддоменами: один и тот же текст на двадцати адресах с подменой города. Формально это внешние дубли, фактически — они мешают, и сильно. Решается уникализацией: разные примеры, разные условия доставки, разные контакты и цены, разные тексты о работе в конкретном регионе.
Настоящий риск начинается там, где сайт целиком собран из чужих материалов. Здесь дело уже не в дублях как таковых, а в отсутствии собственной ценности — и вот за это фильтры действительно прилетают.
Порядок работ и как понять, что помогло
Чистка дублей — это не разовая уборка, а последовательность из пяти шагов с проверкой результата на каждом. Порядок важен: если начать с фильтров, а технические варианты адреса оставить, вы будете править копии копий.
- Технические варианты адреса. Выбрать основной вариант (с www или без, со слэшем или без) и настроить 301 со всех остальных. Проверить, что внутренние ссылки в меню и подвале ведут сразу на основной вариант, иначе каждый переход пойдёт через перенаправление.
- Рекламные метки. Добавить Clean-param в секцию для Яндекса, canonical — для Google. Проверить, что список параметров закрывает не только utm, но и метки рекламных систем и соцсетей.
- Фильтры и сортировки. Определить, какие страницы фильтров имеют спрос, и оставить их открытыми с собственными мета-тегами. С остальных поставить canonical.
- Служебные разделы. Корзина, оформление заказа, личный кабинет, результаты внутреннего поиска, версии для печати — метатег noindex, обход при этом не закрывать.
- Контроль через месяц. Открыть раздел исключённых страниц и сравнить с исходным числом.
По контролю есть нюанс, из-за которого многие решают, что работа не помогла. Число исключённых страниц после чистки сначала растёт, а не падает: робот переобходит адреса, видит перенаправления и canonical и перекладывает их из индекса в исключённые. Это правильное поведение. Смотреть надо на другое.
| Показатель | Где смотреть | Что считать успехом | Когда ждать эффект |
|---|---|---|---|
| Число страниц в поиске | Вебмастер, страницы в поиске | Растёт и приближается к числу нужных страниц | 1–2 месяца |
| Доля адресов с параметрами в обходе | Вебмастер, статистика обхода | Падает, робот берёт карточки и категории | 2–4 недели |
| Скорость попадания новых страниц в поиск | Вебмастер, дата обхода нового адреса | Дни вместо недель | 1–2 месяца |
| Адреса с метками в выдаче | Поиск по своему сайту | Исчезают, остаются чистые адреса | 2–6 недель |
| Совпадающие title | Обход краулером | Единичные случаи вместо сотен | Сразу после правок |
Частые вопросы
Сколько дублей считается нормой?
Нормы в процентах не существует, и попытка вывести её вредна. Значение имеет не число, а то, чем занят робот: если он тратит основную часть обхода на копии, проблема есть даже при небольшом их количестве. Смотрите статистику обхода, а не долю дублей от общего числа адресов.
Можно ли просто закрыть все параметры в robots.txt одной строкой?
Так делают, и это одна из самых дорогих ошибок. Строка вида Disallow: /*? закрывает вообще все адреса с вопросительным знаком, включая рабочие страницы фильтров со спросом и служебные вызовы, без которых страница не отрисуется. Кроме того, закрытый в robots адрес всё равно может попасть в выдачу по внешним ссылкам — только уже без описания.
Помогает ли переписывание текстов, если страницы дублируются технически?
Нет. Если одна и та же страница доступна по пяти адресам, переписывание текста создаст пять копий нового текста. Сначала чинится адресация, потом улучшается содержание — обратный порядок бессмысленный.
Как быстро исчезнут дубли после настройки перенаправлений?
От двух недель до трёх месяцев в зависимости от того, как часто робот обходит сайт. Ускорить можно: отправить основные адреса на переобход в Вебмастере, обновить карту сайта, убрать ссылки на старые варианты из меню и с внешних площадок, которыми вы управляете.
Что делать с региональными поддоменами, где текст одинаковый?
Уникализировать содержательно, а не синонимами. Разные цены, разные условия доставки по региону, разные примеры работ, местные контакты и адреса. Если наполнить действительно нечем, честнее сделать один сайт с разделами по городам, чем двадцать поддоменов с подменённым названием города.
Дубли в мобильной версии на отдельном поддомене — это проблема?
Да, если версии живут по разным адресам без взаимных указаний. Современное решение — адаптивная вёрстка, один адрес на обе версии. Если отдельный мобильный поддомен уже есть и переделать нельзя, страницы связываются взаимными указаниями: canonical с мобильной на основную, отдельный атрибут с основной на мобильную.
О чужих копиях вашего текста — как их находить и что делать дальше:
Коротко
- Внутренние дубли вредят чаще и сильнее внешних: они съедают квоту обхода, подменяют страницу в выдаче и делят вес между копиями.
- Начинают с технических вариантов адреса — www, протокол, слэш, регистр. Они множатся на все остальные дубли, поэтому чинятся первыми.
- Инструменты не взаимозаменяемы: 301 для адресов, canonical для фильтров, Clean-param для меток, noindex для служебных разделов.
- Закрывать рекламные метки через Disallow нельзя — страница выпадает из индекса целиком вместе с содержимым.
- Страницы фильтров со спросом не закрывают, а открывают и наполняют: там реальные запросы и реальный трафик.
- После чистки число исключённых страниц сначала растёт — это нормально. Смотреть надо на рост страниц в поиске и на состав обхода.
- Стоит ли набирать ссылочную массу без контента
- Как раскачать сайт контентом
Если картина сложнее описанной — каталог на десятки тысяч адресов, несколько поддоменов, старая система с самописными фильтрами — разбирать нужно конкретный сайт. Это SEO-консультация: смотрю структуру адресов, показываю, что именно порождает копии, и говорю, каким инструментом закрывать каждый тип. Быстрая первичная проверка доступна и без меня — бесплатный аудит сайта покажет очевидные варианты дублей главной.
Увеличьте позиции и продажи вашего сайта
Профессиональное SEO-продвижение с гарантией результата. Выберите подходящую услугу:
Остались вопросы по продвижению?
Меня зовут Анатолий Кузнецов, я SEO-оптимизатор с 20-летним стажем. Разберу ваш сайт, отвечу на вопросы и подскажу, что улучшить для роста позиций в Яндексе и Google.
Связаться со мной →
Комментарии
Вадим Дорошенко
У нас в Вебмастере 12 тысяч исключённых при 800 товарах. Разработчик предложил закрыть в robots все адреса с вопросительным знаком одной строкой. Сомневаюсь, но аргументов против нет.
Анатолий Кузнецов автор
Аргумент против простой: эта строка закроет не только мусор. Под неё попадут страницы фильтров, по которым есть спрос, служебные вызовы, без которых каталог не отрисуется, и адреса с рекламными метками — а вместе с последними уйдут из индекса живые страницы, на которые вы льёте трафик. Плюс закрытый в robots адрес всё равно может показаться в выдаче по внешней ссылке, только уже без описания, и выглядит это хуже дубля. Сделайте иначе: сначала посмотрите в статистике обхода, какие параметры реально едят квоту, потом на сортировки поставьте canonical на категорию, на метки — Clean-param, а фильтры разделите на те, что имеют спрос в Вордстате, и остальные. Двенадцать тысяч исключённых при восьмистах товарах — это почти наверняка сортировки и пагинация, они закрываются точечно за пару дней.
Оксана Дьяконова
Поставили canonical со второй и третьей страницы блога на первую, как советовали в одной статье. Через два месяца заметили, что старые записи вообще перестали появляться в поиске. Связано?
Анатолий Кузнецов автор
Связано напрямую. Указав первую страницу как основную для второй и третьей, вы сказали системе, что содержимое там одинаковое. Робот стал реже туда заходить, а ссылки на записи со второй страницы и дальше он видит гораздо хуже — значит, до самих записей доходит через раз. Верните canonical на саму себя и задайте разные title вида «Блог — страница 2»: страницы перестанут конкурировать, а ссылки на записи снова начнут работать. Дополнительно проверьте, откуда ещё ведут ссылки на старые записи — если только из пагинации, стоит сделать блок «Читайте также» или список по темам, чтобы у каждой записи было хотя бы два-три входа помимо ленты.
Никита Ерофеев
Вопрос про Clean-param: у нас метки не только utm, есть ещё свои внутренние для отслеживания баннеров на сайте. Их тоже туда писать или это лишнее?
Анатолий Кузнецов автор
Писать обязательно, иначе они порождают ровно такие же дубли, только вы про них не знаете. Возьмите статистику обхода за неделю, выпишите все параметры, которые там встречаются, и разделите на два списка: те, что меняют содержимое страницы, и те, что не меняют. Всё из второго списка идёт в Clean-param. Практически всегда там оказываются метки рекламных систем, идентификаторы переходов из соцсетей, параметры внутренней аналитики и метка ответа на комментарий, если сайт на WordPress. И помните, что директиву понимает только Яндекс — для Google те же адреса закрываются указанием основной версии в canonical, поэтому делать надо и то и другое.
Полина Ждановская
У нас производство, сайт один, а поддоменов по городам двенадцать. Тексты почти одинаковые, меняется только название города. Насколько это плохо и что делать, если писать про каждый город реально нечего?
Анатолий Кузнецов автор
Плохо ровно настолько, насколько поддомены не отличаются друг от друга ничем, кроме подстановки. Система видит двенадцать копий и держит в поиске одну-две, остальные помечает как малоценные — и вы платите за хостинг двенадцати сайтов ради трафика одного. Наполнить есть чем почти всегда: цены и сроки по региону отличаются, доставка отличается, выполненные работы в этом городе есть, местный телефон и адрес пункта выдачи тоже. Добавьте к этому раздел частых вопросов с местной спецификой и отзывы конкретных заказчиков из региона — этого хватает, чтобы страница перестала быть подстановкой. Если по трём городам из двенадцати наполнять действительно нечем, честнее свернуть их в разделы основного сайта, чем держать пустые поддомены.
Артём Зубарев
Нашёл наш текст на чужом сайте почти дословно. Они висят выше нас по этому запросу. Писать им бесполезно, отвечать не будут. Что реально работает?
Анатолий Кузнецов автор
Сначала соберите доказательства первенства: дата публикации у вас, сохранённая копия страницы в веб-архиве, оригинал текста, добавленный в соответствующий раздел Вебмастера. Дальше три шага по возрастанию давления. Письмо владельцу — пропускать его не стоит, отвечают чаще, чем кажется, особенно если текст ставил не он, а нанятый копирайтер. Затем обращение к хостеру по контактам из данных о домене: хостеры реагируют на жалобы о нарушении авторских прав, потому что не хотят разбирательств. Затем форма жалобы в поисковой системе. Параллельно сделайте вещь, которая работает независимо от их реакции: дополните свою страницу тем, чего в скопированной версии нет — таблицей, разделом вопросов, актуальными данными. Копия останется статичной, а ваша страница станет полнее, и через переобход разница будет видна.
Светлана Дементьева
Проверила главную по вашему списку — открывается и со слэшем, и без, обе с кодом 200. Хостинг обещал поправить за десять минут, но просит указать, какой вариант считать основным. Есть разница?
Кирилл Емельянов
Про страницы вложений в WordPress — это прямо про наш сайт. Тысяча картинок в галереях, тысяча адресов, о которых никто не знал. Отключили в настройках темы, посмотрим через месяц.
Наталья Жигунова
Не соглашусь насчёт описаний от поставщика. Мы дополняли карточки полгода — размеры, вопросы, фото. Сдвинулось не сильно, а времени ушло много. По-моему, дело всё-таки в ссылках.
Станислав Задорожный
Подскажите, а canonical на самого себя действительно имеет смысл ставить везде? Слышал мнение, что это лишний код и робот и так разберётся.
Ирина Долматова
Спасибо за таблицу по каталогу, забрала в работу. Особенно за строку про сочетание двух фильтров — у нас как раз открыты все комбинации, и я не понимала, зачем их вообще индексировать.
Пётр Евсеев
После настройки перенаправлений число исключённых выросло с четырёх тысяч до девяти. Прочитал у вас, что так и должно быть, но всё равно каждый день захожу и проверяю.
Ангелина Зверева
Вопрос по мобильной версии: у нас старый отдельный поддомен, переделывать на адаптив дорого. Какой canonical куда ставить, чтобы хотя бы не было дублей?