
Проверка текста на уникальность заканчивается цифрой, в которую верят сразу все: заказчик, автор и биржа. 87%, 94%, 100% — число выглядит объективным, его можно вставить в отчёт и по нему принять или отклонить работу. Беда в том, что ни Яндекс, ни Google такой метрики не считают вообще: поля «уникальность» нет ни в одном отчёте и ни в одном алгоритме ранжирования. Есть другие механизмы — определение почти-дубликатов, выбор канонического документа и оценка полезности страницы. Именно поэтому текст со ста процентами висит на пятой странице, а страница с восемьюдесятью пятью держит первую позицию третий год.
Что на самом деле показывает процент в сервисе проверки
Любой сервис работает по одной схеме. Текст нормализуется: убираются знаки препинания, приводится регистр, иногда слова приводятся к начальной форме. Дальше текст режется на перекрывающиеся цепочки слов — шинглы, классическая длина от трёх до пяти слов, каждая следующая цепочка начинается со второго слова предыдущей. Из цепочек считаются хеши и ищутся в выдаче или в собственном индексе сервиса.
Процент уникальности — это доля цепочек, для которых совпадений не нашлось. Ничего больше в этой цифре нет. Она не про смысл, не про пользу и не про то, писал текст человек или машина. Она про то, встречалась ли конкретная последовательность из четырёх слов где-то ещё. Подробный разбор самого механизма есть в отдельном материале про шингл текста — там показано, как одна и та же фраза даёт разное число совпадений при разной длине цепочки.
Отсюда три следствия, которые обычно упускают. Чем длиннее цепочка, тем выше процент. Перестановка слов внутри предложения ломает цепочки и поднимает процент, хотя смысл не меняется. И короткий текст всегда проверяется хуже длинного: цепочек мало, одно совпавшее предложение из пяти сразу снимает двадцать процентов.
Почему один и тот же текст получает разный процент в разных сервисах
Ситуация, знакомая каждому, кто заказывал тексты: автор присылает скриншот с 100%, заказчик проверяет своим сервисом и видит 79%. Обе стороны считают, что вторая жульничает. На самом деле обе правы, просто сервисы считают разное.
Отличий три. Длина шингла: у одних сервисов она фиксирована, у других настраивается, по умолчанию везде разная. Глубина индекса: сервис с собственной базой найдёт совпадение там, где сервис, работающий через поисковую выдачу, ничего не увидит. Обработка стоп-слов: одни выкидывают предлоги и союзы перед разбиением, другие оставляют, и цепочки сдвигаются.
| Подход сервиса | Как считает | Что искажает цифру | Для чего годится |
|---|---|---|---|
| Поиск по выдаче поисковых систем | Отправляет фрагменты как поисковые запросы и смотрит, есть ли точные вхождения | Зависит от лимитов на запросы, часто пропускает страницы вне первых результатов | Быстрая проверка на прямое воровство текста целиком |
| Собственный индекс сервиса | Сравнивает хеши шинглов с накопленной базой документов | Тексты, которых нет в базе, считаются уникальными, даже если скопированы | Приёмка работ у авторов, проверка бирж |
| Проверка с лемматизацией | Приводит слова к начальной форме до разбиения на цепочки | Занижает процент на текстах, где менялись только окончания и падежи | Отлов синонимизации и машинного рерайта |
Вывод простой: сравнивать проценты можно только внутри одного сервиса с одними настройками. Требование «уникальность не ниже 95%» без указания сервиса и длины шингла — требование ни о чём, и спор по нему выиграет тот, кто первым откроет нужную вкладку.
Что вместо процента считает поисковая система
У поиска другая задача. Ему не нужно оценивать текст по шкале от нуля до ста, ему нужно решить, какой из похожих документов показать пользователю и стоит ли вообще держать остальные в индексе. Механизмов для этого несколько, и работают они одновременно.
Первый — определение почти-дубликатов. Документы с совпадающей существенной частью содержимого объединяются в группу, из неё выбирается основной документ, остальные получают статус «дубль» или «малоценная страница». В Яндекс.Вебмастере это видно в разделе исключённых страниц, причина указана прямо. Группа схлопывается не по проценту, а по решению «это одно и то же или нет», и порог нигде не опубликован. Внутри сайта такое встречается чаще, чем между сайтами: как это устроено и чем лечится, разобрано в материале про дублирование контента.
Второй механизм — выбор первоисточника. Раньше в Вебмастере был отдельный инструмент, куда текст загружали до публикации; про его судьбу есть разбор оригинальные тексты Яндекс Вебмастер. Сегодня работают другие сигналы: дата первой индексации, авторитет площадки, скорость обхода, ссылки на документ. Отсюда неприятный эффект — крупный агрегатор, скопировавший вашу статью, может оказаться выше вас, если его робот обходит чаще.
Третий механизм — оценка полезности, и здесь уникальность не участвует вовсе. Оцениваются полнота ответа на запрос, наличие информации, которой нет у конкурентов, поведение пользователей, оформление, соответствие заголовка содержимому. Текст может быть уникален на сто процентов и попасть под фильтр за малополезность — так регулярно случается с массовыми генерациями под низкочастотные запросы.
Почему 100% уникальности не дают позиций
Сто процентов означают ровно одно: таких последовательностей слов в базе сервиса нет. Условие необходимое, но крайне слабое. Набор случайных слов даст сто процентов. Пересказ Википедии своими словами даст сто процентов. Статья нейросети без единого факта тоже даст сто, потому что генератор не копирует цепочки, а собирает их заново.
Ранжирование решает другую задачу — ищет документ, который лучше отвечает на запрос. Здесь работает то, что называют information gain: сколько нового ваш документ добавляет к уже имеющемуся в выдаче. Если десять страниц в топе рассказывают одно и то же, а вы написали одиннадцатую версию другими словами, прирост информации нулевой. Уникальность по шинглам — сто, ценность для поиска — ноль.
Второй разрыв между процентом и позициями — переоптимизация. Автор, которому в задании написали «уникальность 100% и вхождение ключа восемь раз», получает текст, где ключевая фраза натыкана в каждый абзац. По шинглам он уникален, по текстовым факторам — кандидат на понижение за спам. Яндекс работает с этим давно, и разбор конкретных признаков есть в статье как влияет уникальность текста на позиции сайта.
Почему 85% не мешают странице ранжироваться
Обратная ситуация встречается ещё чаще. Страница показывает 82–88% в сервисе, заказчик паникует и требует переписать. Смотрим, откуда берётся недостающая доля, и почти всегда находим одно из четырёх.
Первое — устойчивые формулировки. «Гарантийный срок составляет 24 месяца со дня продажи», «в соответствии с частью 1 статьи 26» — такие конструкции нельзя написать иначе, не потеряв точность. Они совпадут у всех, и это нормально.
Второе — цитаты и нормативные документы: кусок закона, выдержка из ГОСТа, официальное определение. Пересказ таких фрагментов своими словами качество не повышает, а снижает: вместо точной формулировки получается приблизительная.
Третье — технические характеристики: диагональ, вес, класс энергопотребления, состав материала. Совпадение здесь обязательное: если в характеристиках написано не то, что у производителя, это ошибка.
Четвёртое — сквозные блоки, если сервис проверяет не голый текст, а страницу по адресу: меню, подвал, условия доставки, форма связи. На короткой странице они занимают половину объёма и утаскивают процент вниз, хотя к содержимому статьи отношения не имеют.
Во всех четырёх случаях правильное действие — не переписывать, а проверять корректно: копировать в сервис только основной блок содержимого, без шапки, меню и подвала. Цифра обычно вырастает на десять-пятнадцать пунктов без единой правки. Если и после этого уникальность ниже семидесяти, тогда есть повод искать источник совпадений. За разбором приоритетов по сайту чаще приходят на SEO-продвижение сайтов у частного специалиста: уникальность почти никогда не главная проблема, она просто самая заметная.
Шаблонные блоки, которые сервис всегда пометит как заимствование
Есть категория текста, которая по определению не может быть уникальной, и попытка это исправить вредит бизнесу. Перечислю то, что встречается на каждом втором сайте.
Юридические документы: политика обработки персональных данных, пользовательское соглашение, публичная оферта. Формулировки в них должны соответствовать закону, поэтому уникальность будет в районе двадцати процентов, и это правильно. Такие страницы закрывают метатегом noindex: трафик они не приводят, а в индексе создают массу низкокачественных документов.
Условия доставки и оплаты. Если вы работаете с теми же службами, что и все, описание тарифов совпадёт. Уникализировать стоит только то, что действительно ваше: сроки сборки заказа, зоны, условия самовывоза, график.
Отраслевые определения и классификации. «Асинхронный двигатель — электрическая машина переменного тока» будет одинаково в любом источнике. Ценность вашей страницы не в определении, а в том, что идёт после него: применимость, подбор, ошибки, цены.
Описания поставщика в каталоге: что с ними делать
Самый частый случай, ради которого вообще заходит разговор про уникальность. Магазин выгружает каталог из прайса поставщика, вместе с товарами приезжают описания, которые уже стоят на сотне сайтов. Через полгода половина карточек висит в исключённых как малоценные, категории не растут, трафик идёт только на главную.
Первое, что надо принять: переписать двадцать тысяч карточек нельзя ни своими силами, ни за деньги — это бюджет годового продвижения, потраченный на текст, который читают единицы. Механика проблемы разобрана в материале описание товара, скопированное у поставщика: почему каталог не растёт в поиске, а здесь дам порядок действий.
Начинают не с карточек, а с категорий: их в десятки раз меньше, спрос на них выше, и они дают основной трафик каталога. Текст категории пишется один раз, руками, под конкретный кластер запросов — это единственное место в каталоге, куда осмысленно вкладывать деньги в копирайтинг. Если тексты нужны в объёме и по графику, проще заказать готовые SEO-статьи для сайта, чем держать вечно занятого автора на подряде.
Дальше карточки делятся по спросу. Товары с собственным частотным запросом — по модели, артикулу, названию — получают ручное описание. Обычно это первые сто-триста позиций, и они дают почти весь товарный трафик.
Для остальных карточек уникальность добирается не текстом, а структурой: развёрнутая таблица характеристик из своей базы вместо одной строки, комплектация, собственные фотографии вместо снимков поставщика, вопросы и ответы по товару, отзывы покупателей, блок совместимости и аналогов, наличие и срок доставки в разметке. Каждый элемент по отдельности мелочь, вместе они делают страницу непохожей на сотню чужих и полезной покупателю.
Когда переписывать, а когда не трогать
Решение о переписывании принимают не по проценту, а по тому, есть ли у страницы проблема в поиске. Порядок такой: сначала статус страницы в Вебмастере, потом позиции и показы, и только потом текст.
| Что вы видите | Как проверить | Решение |
|---|---|---|
| Уникальность 80–90%, страница в топ-10 и даёт заявки | Позиции и показы в Вебмастере за квартал стабильны | Не трогать. Правка текста в топе чаще роняет позиции, чем поднимает |
| Уникальность 100%, страница не показывается ни по одному запросу | Нулевые показы, при этом страница в индексе | Проблема не в уникальности: проверять релевантность запросу и полноту ответа |
| Страница исключена как дубль | Раздел исключённых страниц, указана исходная страница | Смотреть, чем страницы отличаются; либо развести содержимое, либо склеить canonical |
| Страница исключена как малоценная или малополезная | Причина исключения указана прямо в Вебмастере | Добавлять содержимое и структуру, а не менять формулировки существующего |
| Текст дословно найден на чужом сайте, там он выше | Поиск по точной фразе в кавычках, сравнение дат публикации | Если оригинал ваш — жалоба площадке; если чужой — переписывать полностью |
| Низкая уникальность за счёт характеристик, закона, цитат | Проверить только основной блок текста, без шапки и подвала | Не трогать. Переписывание таких фрагментов ухудшает точность |
| Текст читается как машинный, вода без фактов | Проверить, есть ли в тексте цифры, условия, ограничения, сроки | Переписывать, даже если уникальность 100% |
И правило, которое экономит больше всего денег: не переписывайте текст, пока не зафиксировали позиции по десяти запросам страницы, дату правки и объём. Без этого через два месяца вы не отличите эффект правки от движения выдачи и будете переписывать по кругу.
Частые вопросы
Какой процент уникальности требовать в техническом задании автору? Для информационной статьи — от 90% при длине шингла четыре слова и с обязательным указанием сервиса. Для карточек и категорий требование по проценту снимают и заменяют требованиями по содержанию: сколько характеристик, какие блоки и вопросы раскрыть. Процент там только мешает — автор начинает избегать точных терминов.
Может ли сайт получить санкции за низкую уникальность? Фильтра за процент не существует. Есть исключение страниц как дублей и как малополезных, есть понижение за переоптимизацию. Полностью скопированный чужой сайт под ограничения попасть может, но это уже не про проценты.
Влияет ли то, что мой текст растащили по другим сайтам? На позиции — обычно нет, если ваша страница проиндексирована первой и сайт не слабее копирующих. На цифру в сервисе — да: совпадения найдутся на копиях. Авторство проверяют по датам индексации, а не по проценту.
Считается ли текст, написанный нейросетью, уникальным? По шинглам — почти всегда да, около ста процентов. Для поиска это ничего не значит: типовая генерация без фактов и конкретики попадает в малополезные вне зависимости от происхождения. Нейросеть уместна как черновик, но факты, цены, условия и ограничения в текст добавляет человек.
Что делать, если поставщик запрещает менять описания? Оставить описание как есть, а уникальность набирать вокруг него: своими фотографиями, характеристиками из своей базы, блоком вопросов, отзывами, условиями доставки. Главное — не делать описание поставщика единственным содержимым страницы.
Коротко
- Процент уникальности — доля непересекающихся цепочек из трёх-пяти слов, а не оценка качества. У поисковых систем такой метрики нет.
- Разные сервисы дают разные числа из-за длины шингла, глубины индекса и обработки стоп-слов: сравнивать проценты можно только внутри одного сервиса.
- Сто процентов не гарантируют позиций: текст может быть уникальным, но не добавлять ничего нового к тому, что уже есть в выдаче, или быть переспамленным ключами.
- 85% почти всегда набираются из характеристик, цитат закона, устойчивых формулировок и сквозных блоков страницы. Переписывать такие фрагменты вредно.
- В каталоге сначала уникализируют категории и первые сотни карточек со спросом, остальным добирают непохожесть структурой: характеристики, комплектация, свои фото, вопросы, отзывы.
- Решение о переписывании принимают по статусу страницы в Вебмастере и по показам, а не по цифре из сервиса проверки.
Если не понимаете, что тормозит конкретные страницы — уникальность, структура или релевантность запросу, — начните с разбора, а не с переписывания. На SEO-консультации по вашему сайту за час проходим по исключённым страницам в Вебмастере, определяем, какие тексты требуют работы, а какие трогать нельзя, и составляем порядок правок по приоритету. В SEO с 2005 года, продвижение веду лично — вы общаетесь со мной напрямую, а не с менеджером.
Увеличьте позиции и продажи вашего сайта
Профессиональное SEO-продвижение с гарантией результата. Выберите подходящую услугу:
Остались вопросы по продвижению?
Меня зовут Анатолий Кузнецов, я SEO-оптимизатор с 20-летним стажем. Разберу ваш сайт, отвечу на вопросы и подскажу, что улучшить для роста позиций в Яндексе и Google.
Связаться со мной →
Комментарии
Викентий Заплатин
Автор прислал скрин со 100%, я проверил другим сервисом — 76%. Кто из нас неправ и как вообще ставить это в договор?
Анатолий Кузнецов автор
Неправы оба, потому что спорите о числе без общей системы отсчёта. Разница в семнадцать пунктов почти всегда объясняется двумя вещами: длиной шингла и тем, что один из вас проверял страницу целиком вместе с меню и подвалом, а второй — только текст статьи. Проверьте гипотезу за две минуты: возьмите тот же текст, скопируйте только основной блок без навигации и прогоните в обоих сервисах с длиной цепочки четыре слова. Числа сойдутся в пределах пяти пунктов. В договор пишите так: сервис по названию, длина шингла цифрой, порог процентом и оговорка, что цитаты нормативных документов и технические характеристики из проверки исключаются. Без этих четырёх пунктов требование неисполнимо, и любой спор вы проиграете.
Пелагея Шумбасова
У нас каталог сантехники, 14 тысяч позиций, описания из выгрузки поставщика. Половина карточек в Вебмастере в исключённых. Реально ли это вытащить без переписывания всего?
Анатолий Кузнецов автор
Реально, и переписывать четырнадцать тысяч карточек не надо ни в каком варианте. Сначала откройте в Вебмастере причину исключения — там разные статусы, и лечатся они по-разному: «дубль» означает, что робот нашёл вашу же похожую страницу, а «малоценная» — что страница сама по себе бедная. Дальше берёте выгрузку запросов и смотрите, у каких моделей вообще есть спрос по названию или артикулу: в сантехнике это обычно смесители и инсталляции известных брендов, две-три сотни позиций. Их описываете руками. Остальным карточкам добавляете то, что можно проставить автоматически из своей базы: полную таблицу характеристик вместо одной строки, комплектацию, размеры, совместимость, блок вопросов и отзывов. И параллельно приводите в порядок категории — они дадут трафика больше, чем все карточки вместе.
Устин Мещеряков-Ждан
Значит, если я прогоню текст через синонимайзер и получу 97%, для поиска это будет считаться новым текстом? Звучит слишком просто.
Анатолий Кузнецов автор
Не будет, и именно потому, что просто. Сервис проверки сравнивает последовательности слов, а поиск давно сравнивает векторные представления смысла — примерно так же, как человек понимает, что две новости об одном событии рассказывают одно и то же, даже если написаны разными редакциями. Синонимайзер ломает цепочки, но не меняет смысловое содержание ни на процент, поэтому документ по-прежнему попадает в ту же группу почти-дубликатов. Плюс вы получаете вторую проблему: машинная синонимизация портит устойчивые термины, и вместо «шаровой кран» в тексте появляется «сферический вентиль», по которому вас никто не ищет. Так что выигрыш только в отчёте перед заказчиком, а в выдаче — минус.
Лаврентий Обносов
Политика конфиденциальности и оферта дают 15% уникальности. Их вообще как-то надо лечить?
Аркадий Пивоваров
Заметил, что после переписывания страницы услуги позиции просели с 6 на 14 и не вернулись за два месяца. Текст стал уникальнее, а стало хуже.
Анатолий Кузнецов автор
Классический случай, и он же главный аргумент против правок ради процента. Когда страница уже в топ-10, поиск считает её релевантной конкретному набору запросов, и переписывание меняет как раз то, за что она там держалась: формулировки заголовков, вхождения, структуру абзацев, объём. Дальше странице нужно заново набирать поведенческие сигналы на новой редакции, и это занимает от месяца до квартала. Посмотрите, что именно изменилось: сравните старую версию через веб-архив или бэкап и проверьте, не пропали ли из текста фразы, по которым были показы. Если пропали — вернуть их, не откатывая всю правку. И на будущее: страницы в топе правят точечно, добавляя блоки, а не переписывая целиком.
Злата Верещака
Мою статью скопировали три агрегатора, теперь мой же текст показывает 40% уникальности. Есть смысл переписывать свой оригинал?
Тихон Колыванов
В ТЗ ставлю 95% и вхождение ключа 6 раз на 3000 знаков. Правильно ли это для карточек товара?
Ефросинья Бурмистрова
А как проверять уникальность у страниц категорий, если там текст размазан: часть сверху, часть под товарами, плюс фильтры?
Василиса Одинцова-Крайнова
Копирайтер сдал текст с уникальностью 100%, а читать невозможно — сплошные общие фразы. По формальным требованиям придраться не к чему. Как это ловить заранее?
Анатолий Кузнецов автор
Ловится это на этапе задания, а не приёмки. Уберите из требований процент как основной критерий и поставьте вместо него проверяемые элементы содержания: сколько конкретных числовых параметров должно быть в тексте, какие вопросы обязательно раскрыть, какие ограничения и исключения назвать, откуда взяты данные. Дальше приёмка становится механической: открываете текст и считаете, есть ли в нём цифры, сроки, условия, названия и версии. Если весь текст можно пересказать одним предложением без потери информации — это вода, и уникальность здесь роли не играет. Ещё один быстрый тест: попробуйте вставить в текст название конкурента вместо своего. Если ничего не сломалось и текст остался верным, значит, в нём нет ничего вашего.
Ростислав Шабалдин
Правильно понимаю, что закрывать оферту и политику в noindex безопасно и позиции других страниц от этого не пострадают?
Стефания Липатникова
У нас на 200 карточек одинаковый блок про гарантию и возврат внизу описания. Это считается внутренним дублем?
Демьян Заволокин
Существует ли порог, после которого поиск точно склеит две страницы как дубли? Хочется знать конкретное число.