
Кластеризация запросов отвечает на единственный вопрос, с которого начинается любой контентный бюджет: сколько страниц нужно сайту и о чём должна быть каждая. Ошибка здесь оплачивается дважды — сначала копирайтеру за тексты, которые не выйдут в топ, потом ещё раз за переделку структуры, когда становится ясно, что сорок статей должны были быть пятью разделами. Причём сам текст при этом может быть отличным: грамотным, полезным, с примерами. Просто он лежит не на той странице.
В аудитах эта картина повторяется настолько регулярно, что я перестал считать её частным случаем. Владелец показывает блог на полсотни материалов, годовой счёт от копирайтера и график трафика, который упрямо лежит. Разбор занимает полдня и почти всегда упирается в одно: группировку делали по здравому смыслу, а не по выдаче. Ниже — как устроен правильный порядок, как проверить свой сайт за вечер и что делать с уже написанным.
Кластеризация и группировка — разные вещи
Группировка — это когда список запросов раскладывают по смысловым кучкам: «про цены», «про доставку», «про виды». Делает её человек, опираясь на собственное понимание темы. Кластеризация — когда запросы объединяют по признаку, который задаёт поисковая система: если по двум фразам она показывает почти одинаковый набор сайтов, значит, для неё это одна тема, и одна страница закроет обе.
Разница принципиальная. Человеку кажется, что «купить шкаф-купе» и «шкаф-купе на заказ» — разные запросы: в одном покупают готовое, в другом заказывают по размерам. Поисковик может считать иначе, и проверяется это не рассуждением, а сравнением выдачи. Обратная ситуация встречается не реже: «ремонт рулевой рейки» и «ремонт рулевой рейки цена» выглядят как одно и то же, но по второму запросу в топе могут стоять страницы с прайсами, а по первому — описания услуги. Значит, это два документа.
Отсюда практическое правило: любое решение о структуре сайта принимается после того, как вы посмотрели, что уже стоит в топе по этим фразам. Не до, а после. Всё остальное — предположения, и они ошибаются примерно в половине случаев.
Три способа разложить семантику и почему работает один
Способов сгруппировать список запросов придумано много. Они дают разный результат, и разница между ними — это и есть разница между работающим блогом и складом текстов.
- По совпадению слов. Запросы с общим корнем складывают вместе. Быстро, бесплатно и ошибочно: «стоимость окон» и «окна цена» попадут в разные группы, зато «двери межкомнатные» и «двери входные» — в одну.
- По смыслу, вручную. Специалист читает список и раскладывает по логике темы. Лучше первого способа, но упирается в то, что логика темы у человека и у алгоритма не совпадает. Особенно в нишах, где автор не разбирается как покупатель.
- По пересечению выдачи. Для каждого запроса выгружается первая десятка URL, дальше сравнивается, сколько адресов совпадает. Совпало много — один кластер. Совпало мало — разные страницы. Это единственный способ, который опирается на факт, а не на мнение.
Третий способ обычно называют кластеризацией по SERP. Считать пересечения вручную можно для полусотни фраз, дальше нужен инструмент: Rush Analytics, Topvisor, Мегаиндекс — любой, который умеет снимать топ и считать совпадения. Инструмент здесь взаимозаменяем, метод — нет.
Порог кластеризации: жёсткий, мягкий и почему это не мелочь
При сравнении выдачи задаётся порог — сколько URL из десяти должны совпасть, чтобы запросы считались одной темой. От этой цифры зависит вся будущая структура сайта, и её выставляют не наугад.
| Порог | Что получается | Когда применять |
|---|---|---|
| 3 совпадения (мягкий) | Крупные кластеры, мало страниц, широкие темы | Информационные разделы, обзорные материалы, темы с размытой выдачей |
| 4–5 совпадений (средний) | Сбалансированная структура, пригодна для большинства сайтов | Услуги, каталоги среднего размера, блоги коммерческих сайтов |
| 6–7 совпадений (жёсткий) | Много мелких кластеров, детализация до подтипов | Интернет-магазины с большим ассортиментом, узкие ниши с высокой конкуренцией |
| 8+ (очень жёсткий) | Почти каждый запрос — отдельная страница | Практически не применяется: получается сетка почти одинаковых документов |
На практике порог подбирают за два прохода. Первый — средний, дальше смотрят глазами: если в кластере оказались фразы, которые вы сами никогда не поставили бы на одну страницу, порог ужесточают. Если получились кластеры из одной фразы, каждая из которых требует отдельной статьи, — ослабляют. Единственно верного значения не существует, оно зависит от того, насколько дробно устроена выдача в конкретной нише.
Подробнее об этом — в статье «Кластеризация запросов».
Ещё один параметр, который часто забывают, — регион съёма. Кластеры для Москвы и для города-миллионника в Сибири различаются: в столице выдача дробнее, потому что конкуренция выше и алгоритму есть из чего выбирать. Снимать топ надо в том регионе, где вы собираетесь продвигаться.
Куда именно утекает бюджет на тексты
Помогу с продвижением: раскрутка сайта в Яндексе — вывожу сайты в топ Яндекса белыми методами.
Понимание механики полезно, но владельцу нужен ответ на вопрос «где мои деньги». Вот четыре сценария, в которых текст оплачен, опубликован и не работает.
- Несколько страниц под один кластер. Классическая каннибализация. Поисковая система выбирает между вашими же документами, регулярно меняет решение, и ни один не закрепляется. Внешне выглядит как «позиции скачут».
- Один документ под несколько кластеров. Обратная ошибка: универсальная простыня на пятнадцать тысяч знаков, где под каждый интент отведён абзац. Релевантность размазана, страница не выходит в топ ни по одному направлению.
- Статьи под запросы без коммерческого продолжения. Материал собирает трафик, читатель уходит, потому что переход к услуге не предусмотрен вообще. Деньги за текст потрачены, отдачи нет.
- Статьи под запросы, где топ занят не такими сайтами. Если по фразе стоят маркетплейсы, справочники и агрегаторы, отдельная статья на корпоративном сайте туда не встанет — тип документа не совпадает. Проверяется до заказа текста, а не после.
Первые два сценария лечатся перестройкой структуры, третий — доработкой самих страниц, четвёртый — отказом от темы. Ни один не лечится переписыванием текста, поэтому попытка «улучшить статью» после провала почти всегда бесполезна.
Каннибализация: как найти за час
Проверка не требует платных сервисов и делается по любому сайту, у которого есть Вебмастер.
- Выгрузите отчёт по поисковым запросам за квартал: запрос, показы, клики, страница.
- Отсортируйте по запросу и найдите строки, где одна и та же фраза отдаёт показы двум и более адресам.
- Отфильтруйте случайный шум: если по фразе у второй страницы единицы показов, это не каннибализация, а разовое попадание.
- Для оставшихся пар откройте обе страницы и честно ответьте, чем они отличаются для читателя. Если ответ «ничем» — их надо склеивать.
- Проверьте по внутренним ссылкам, куда ведут анкоры с этой фразой. Обычно вес размазан по обеим страницам, и это часть проблемы.
Дальше решение простое: выбирается страница-победитель — та, у которой больше кликов, больше входящих ссылок и лучше отвечает интенту. Вторая склеивается в неё редиректом, полезные куски содержания переносятся, внутренние ссылки переставляются на победителя. Оставлять обе «на всякий случай» — худший из вариантов: ситуация не разрешится сама.
Слипшийся кластер: обратная ошибка
Диагностируется по другому признаку. Возьмите страницу, которая не растёт, и посмотрите в Вебмастере, по каким формулировкам она получает показы. Если это несколько заметно разных смысловых групп — например, «что такое», «сколько стоит», «какой выбрать» и «где купить» — страница пытается быть четырьмя документами сразу.
Проверка вторым способом: пройдите по этим формулировкам в выдаче и посмотрите, какие типы страниц стоят в топе по каждой. Если по одной группе там инструкции, по второй — прайсы, по третьей — карточки товаров, то одной страницей эти запросы не закрыть физически. Никакая доработка текста не сделает документ одновременно инструкцией и прайсом.
Тему разбирал отдельно: «Wordstat врёт вам про спрос: как читать цифры и не слить бюджет на пустые запросы».
Расшивается это разделением: основной интент остаётся на исходной странице, остальные выносятся в отдельные документы, между ними ставятся внутренние ссылки. Практический ориентир: если после разделения новая страница не набирает материала хотя бы на пять-шесть тысяч знаков осмысленного содержания, тему выделять рано — она пока часть родительской.
Как собрать кластеры руками
Порядок, который работает и на сайте услуг, и в интернет-магазине. Сервисы ускоряют шаги 3 и 4, остальное всё равно делается головой.
- Собрать спрос. Вордстат, подсказки поиска, «вместе с этим ищут», внутренний поиск по сайту, вопросы, которые задают по телефону. Последний источник обычно самый ценный и самый недооценённый.
- Отсеять мусор. Чужие бренды, другие регионы, запросы про работу и вакансии, формулировки с несовместимым намерением — «бесплатно», «своими руками», «б/у», если вы продаёте новое и за деньги.
- Снять топ. Для каждой оставшейся фразы — первая десятка URL в нужном регионе.
- Посчитать пересечения. Сгруппировать по выбранному порогу, получить черновые кластеры.
- Определить интент каждого кластера. Смотрят не на слова запроса, а на то, что стоит в топе: карточки товаров, разделы каталога, статьи, подборки, справочники.
- Отбраковать невозможные кластеры. Если топ занят типами документов, которых у вас в принципе не будет, кластер уходит в отложенные.
- Присвоить страницы. Каждому кластеру — один URL: существующий или новый. Здесь же становится видно, какие страницы уже есть, какие лишние и какие надо создать.
- Задать приоритет. Сначала кластеры с коммерческим намерением и реальным спросом, затем поддерживающие информационные.
Только после восьмого шага имеет смысл ставить задачу на тексты. Заказывать статьи до этого — то же самое, что закупать стройматериалы до проекта дома: что-то пригодится, большая часть останется лежать.
Есть ещё один разрез, который редко учитывают на этапе структуры, — коммерциализация запроса. Внутри одного кластера могут оказаться формулировки с разной готовностью человека платить: «как выбрать» и «купить» иногда попадают в одну группу по совпадению выдачи, но ведут себя по-разному. Такие кластеры помечают отдельно и на странице делают два уровня: сначала ответ на вопрос, ниже — предложение. Порядок именно такой, иначе человек, пришедший разбираться, уйдёт с первого экрана.
И последнее по этому разделу. Кластеризация не заканчивается на схеме в таблице — её результат должен превратиться в задание: адрес страницы, главная фраза, список сопутствующих формулировок, тип документа, что обязательно раскрыть, на какие страницы поставить ссылки. Без этого копирайтер получает список ключей и снова начинает угадывать, а вы возвращаетесь к тому, с чего начали.
Что делать, если статьи уже написаны
Если нужна помощь по теме — заказать SEO-тексты.
Ситуация, в которой оказывается большинство. Полный пересбор с нуля обычно не нужен, работает разбор по четырём корзинам.
Смежный материал по теме — «Фавикон поднимает кликабельность в выдаче, а у половины сайтов его просто нет».
| Состояние страницы | Признак | Что делать |
|---|---|---|
| Работает | Есть показы и клики, позиции стабильны | Не трогать, при необходимости дополнить |
| Дублирует другую | Обе получают показы по одной фразе | Склеить редиректом в сильнейшую, перенести содержание |
| Слиплась | Показы по нескольким разным группам, позиций нет | Разделить, оставив основной интент на месте |
| Не имеет спроса | Показов почти нет, запросов в Вордстате единицы | Оставить как есть или объединить в обзорный материал |
Порядок действий такой же, как в разборе любого запущенного сайта: сначала склейки, потом разделения, в последнюю очередь новые страницы. Склейка даёт результат быстрее всего, потому что возвращает поисковику однозначность там, где он полгода выбирал между двумя вашими документами.
И отдельно про удаление. Страницы без спроса удалять не нужно: они не мешают, а если по ним есть хотя бы единичные заходы и внешние ссылки, удаление только навредит. Мешают не слабые страницы, а конкурирующие между собой.
Отдельно стоит сказать про запросы с нулевой и околонулевой частотностью. Их часто выбрасывают на шаге отсева, и зря: в узких нишах именно они дают обращения, потому что формулируются людьми, которые точно знают, что им нужно. Правило простое — низкочастотную фразу не выкидывают, а прикрепляют к ближайшему кластеру и используют в подзаголовке или в разделе с вопросами. Отдельную страницу под неё делать не надо, а упомянуть внутри подходящего документа полезно.
Второй момент, который экономит месяцы, — проверка возраста и типа сайтов в топе. Если по кластеру стоят десять доменов старше десяти лет с тысячами страниц по теме, это не значит, что заходить нельзя, но значит, что одной страницей вопрос не решается: нужен раздел из нескольких материалов, связанных между собой. Такие кластеры отмечают отдельно и планируют не одной задачей копирайтеру, а серией. Разница в ожиданиях по срокам здесь двукратная, и лучше знать об этом заранее, чем удивляться через полгода.
Частые вопросы
Сколько запросов должно быть в кластере? Правильного числа нет. Бывают кластеры из тридцати формулировок и кластеры из двух. Значение имеет не количество, а то, что все фразы закрываются одним типом документа.
Можно ли обойтись без съёма выдачи? Для сайта на десять страниц — да, там ошибиться сложно. Начиная с полусотни фраз ручная группировка начинает промахиваться, и промахи вылезают через полгода в виде каннибализации.
Как часто пересобирать кластеры? Раз в год для стабильных ниш и раз в полгода там, где выдача перестраивается: услуги в крупных городах, товарные категории с активными маркетплейсами. Полный пересбор не нужен — достаточно проверить ключевые кластеры и посмотреть, не изменился ли тип документов в топе.
Кластеризация нужна интернет-магазину или только контентному сайту? Магазину нужна сильнее. Именно там решается, какие фильтры каталога выводить отдельными посадочными страницами, а какие закрывать от индексации, и цена ошибки измеряется тысячами адресов.
Что делать, если топ по кластеру занят маркетплейсами? Не идти туда фронтально. Смотреть на соседние, более узкие формулировки, где выдача ещё не консолидирована, и заходить через них. Плюс работать с теми площадками, где вы можете присутствовать напрямую.
Коротко
- Кластеризация определяет структуру сайта: сколько страниц нужно и о чём каждая. Тексты заказывают после неё, а не до.
- Единственный проверяемый метод — сравнение выдачи по запросам, а не группировка по словам или по здравому смыслу.
- Порог совпадений подбирают за два прохода и всегда в том регионе, где планируется продвижение.
- Две основные ошибки: несколько страниц на один кластер и один документ на несколько кластеров. Диагностируются по отчёту о запросах в Вебмастере.
- Уже написанные статьи разбирают по четырём корзинам: работает, дублирует, слиплась, без спроса. Сначала склейки, потом разделения.
- Кластер, где в топе стоят типы документов, которых у вас не будет, отбраковывают до заказа текста.
Если вы собираетесь вкладывать в контент и хотите заранее понимать, какие страницы вообще способны выйти в топ в вашей нише, приходите на SEO-консультацию: разберём спрос, посмотрим выдачу по вашим ключевым темам и составим структуру, под которую уже можно заказывать тексты.
Увеличьте позиции и продажи вашего сайта
Профессиональное SEO-продвижение с гарантией результата. Выберите подходящую услугу:
Остались вопросы по продвижению?
Меня зовут Анатолий Кузнецов, я SEO-оптимизатор с 20-летним стажем. Разберу ваш сайт, отвечу на вопросы и подскажу, что улучшить для роста позиций в Яндексе и Google.
Связаться со мной →Комментарии
Вениамин Загряжский
Выгрузил отчёт по запросам за квартал, как описано. Нашёл девять фраз, по которым показы делят две страницы: раздел услуги и статья в блоге, написанная годом позже. Статья при этом получает больше показов, но меньше обращений — она информационная. Склеивать в услугу или наоборот?
Анатолий Кузнецов автор
Здесь склейка не нужна вообще, у вас другой случай. Посмотрите, какой тип документов стоит в топе по этим девяти фразам: если статьи — оставляйте статью и убирайте с неё конкуренцию, если страницы услуг — наоборот. Скорее всего окажется, что часть фраз тянет к статье, часть к услуге, и правильное решение — развести их по формулировкам: со страницы услуги убрать текстовые блоки, отвечающие на информационные вопросы, а из статьи убрать всё, что похоже на прайс и оффер. Дальше поставьте с конца статьи ссылку на услугу с анкором, который совпадает с коммерческой фразой. Показы у статьи останутся, а обращения перестанут теряться. И проверьте заодно title обеих страниц: в половине таких пар они почти одинаковые, и это половина причины конкуренции.
Прохор Плещеев
Про порог совпадений — важное уточнение, которого нет почти нигде. Мы полгода работали на мягком пороге, получили десяток огромных кластеров и под каждый по одной страничке. Ничего не выросло. Переснял выдачу с порогом шесть, кластеров стало под сорок, картина сразу стала осмысленной.
Тимофей Хвостовский
Не согласен с тем, что ручная группировка ошибается в половине случаев. Я в своей нише двенадцать лет и выдачу знаю наизусть. Съём топа мне ничего нового не показал — совпало почти всё, что я и так разложил руками.
Анатолий Кузнецов автор
Это нормальный результат для человека, который годами смотрит выдачу в одной нише — вы фактически держите её модель в голове. Оговорка касается двух ситуаций. Первая: специалист приходит в незнакомую тематику, и тогда интуиция даёт как раз около половины попаданий, я это вижу по проверкам чужих ядер. Вторая: ниша меняется. Когда в выдачу заходят маркетплейсы или агрегаторы, старая модель перестаёт работать за пару месяцев, и заметить это без съёма невозможно — вы будете продолжать группировать по логике, которая была верна год назад. Поэтому даже в знакомой теме имеет смысл раз в полгода снимать топ по десятку опорных фраз: не ради структуры, а ради проверки, не перестроилась ли выдача. Если совпадает — отлично, потратили час.
Захар Ознобишин
Пункт про отбраковку кластеров, где в топе агрегаторы, сэкономил бы нам приличную сумму, попадись он раньше. Написали четырнадцать статей под запросы, где выдача целиком из маркетплейсов и справочников. Ни одна не поднялась выше пятидесятой позиции, и понятно почему.
Ефим Каверзнев
Вопрос по региону съёма. У нас производство, отгружаем по всей стране, офис в одном городе. Часть запросов геозависимая, часть нет. В каком регионе снимать топ, если для разных фраз ответ разный?
Анатолий Кузнецов автор
Снимайте в два прохода и сравнивайте. Первый проход — ваш город, второй — Москва или любой другой крупный город, где вас нет. Дальше смотрите на разницу: фразы, по которым выдача в двух регионах почти совпала, геонезависимые, их кластеризуете по любому из проходов. Фразы, где выдача разошлась, геозависимые — их кластеризуете по своему городу и учитываете, что конкурировать будете локально. Это же деление вам пригодится дальше: под геонезависимые фразы делают обычные страницы, а под геозависимые нужны либо региональные разделы, либо поддомены, и решение о структуре принимается один раз. Для производства с отгрузкой по стране обычно оказывается, что коммерческое ядро наполовину геонезависимое, и это хорошая новость — такие страницы работают на всю страну сразу.
Демьян Мошкарёв
Добавлю про источники спроса. Самое полезное, что мы сделали, — выгрузили запросы из внутреннего поиска по сайту. Там оказались формулировки, которых нет ни в Вордстате, ни в подсказках, потому что это профессиональный жаргон отрасли. Две страницы под них принесли больше, чем весь предыдущий блог.
Родион Прибытков
А что делать со страницами, которые слиплись, но при этом приносят обращения? Разделять страшно: вдруг после разбивки станет хуже. У нас одна такая тянет треть всех заявок с сайта.
Анатолий Кузнецов автор
Страницу, которая приносит треть заявок, не трогают. Правило простое: разделяют то, что не работает, а работающее наращивают. Ваш случай решается иначе — не разбивкой, а достройкой. Определите, какие интенты страница закрывает плохо, и сделайте под них новые документы, но исходную оставьте как есть, включая тексты. Новые страницы связываете с ней ссылками в обе стороны. Если через два-три месяца новые начали собирать свои показы, а старая не просела, тогда можно аккуратно почистить в ней то, что переехало. Если новые не пошли — вы ничего не потеряли. И обязательно снимите позиции по всем фразам этой страницы до начала работ: без замера вы не сможете отличить сезонное колебание от последствий своих правок.
Савелий Ретюнский
Таблица с порогами наглядная, но у меня после среднего порога половина кластеров вышла из одной фразы. Спрос в нише узкий, частотность у всего низкая. Ослаблять порог или всё-таки делать страницу на каждую фразу?
Гордей Скоблев
Отдельное спасибо за мысль, что улучшать текст после провала бесполезно. Мы дважды переписывали одну и ту же статью, платили за это, и оба раза ничего не менялось. Причина была в том, что рядом лежала вторая страница про то же самое, написанная тремя годами раньше и давно забытая.
Устин Тарханов
Насчёт удаления страниц без спроса не соглашусь. У нас после чистки блога от полусотни пустых материалов заметно улучшилась индексация остальных — робот перестал тратить обходы на мусор. Так что иногда удалять всё-таки стоит.
Мирон Ушаковский
Практическое наблюдение по восьмому шагу. Мы сначала делали информационные материалы, потому что их проще писать, и год копили трафик без обращений. Переставили приоритет на коммерческие кластеры — обращения пошли за полтора месяца. Порядок в статье указан верно, жаль, что мы дошли до него сами и дорого.
Клим Хлопонин
Вопрос про интернет-магазин и фильтры. Как понять, какие комбинации фильтров выводить отдельными страницами? У нас их технически можно нагенерировать несколько тысяч, и очевидно, что все не нужны.
Анатолий Кузнецов автор
Решение принимается по спросу, а не по технической возможности. Соберите все фразы, которые описывают комбинации ваших характеристик, и посмотрите частотность: те, у которых спрос есть, становятся кандидатами. Дальше по каждому кандидату проверьте выдачу — если в топе стоят такие же фильтрованные страницы магазинов, тему берём, если категории целиком, значит, поисковик не считает эту комбинацию отдельной темой. Остальные тысячи комбинаций закрываются от индексации, иначе вы получите сетку почти одинаковых страниц, которая съест обходы робота и утянет качество всего каталога. Практический ориентир: у среднего магазина осмысленных фильтровых посадочных получается несколько десятков, редко больше сотни. И каждой такой странице нужен свой заголовок и хотя бы небольшое собственное описание, иначе она останется дублем категории с параметром в адресе.
Спасибо, теперь понятно, почему бюджет на контент утекал, а трафик стоял на месте.
Согласен, добавлю: без нормального сбора семантики любая кластеризация это мусор на входе и мусор на выходе.
Полезно, но хотелось бы конкретный инструмент для кластеризации, а не только принципы.
Долго не мог понять, почему две наши статьи мешают друг другу, а это была классическая каннибализация кластера.
Порог по пересечению топов у каждой тематики свой, в коммерции жестче, в информационке мягче, подтверждаю.
У нас каннибализация съедала позиции, пока не склеили конкурирующие страницы в одну по кластеру.
Отличный текст, отправила SEO-подрядчику, чтобы объяснить, почему нам не нужно двести статей.
Скажите, а как часто нужно пересобирать кластеры заново, ведь выдача Яндекса меняется и группы запросов со временем расползаются по разным страницам?
Тимур, на живых проектах я пересобираю ядро раз в полгода, а по конкурентным коммерческим темам раз в квартал. Выдача действительно дрейфует, и кластеры расползаются. Но не гонитесь за каждым колебанием: переклеивать страницы каждый месяц вреднее, чем оставить структуру стабильной и трогать ее только при явных сдвигах в топах.
Не соглашусь, что копирайтинг впустую у восьмидесяти процентов. Проблема чаще в структуре, а не в самих текстах.
Свели десять слабых статей в две мощные посадочные, и позиции пошли вверх, метод рабочий.
По опыту: ручная кластеризация на больших ядрах это боль, без съема топов и группировки по пересечению никак.
А вы кластеризуете по выдаче Яндекса или по смыслу вручную, и что делать, когда эти два подхода дают разные группы запросов?
Константин, база всегда по выдаче, потому что именно она показывает, как поисковик понимает интент, а не как мы его придумали. Смысловую логику накладываю сверху как проверку. Когда подходы расходятся, доверяю топам: если Яндекс держит запросы на разных страницах, значит для него это разные потребности, и объединять их в одну посадочную не стоит.
Спасибо, очень отрезвляет. Поняла, что половина нашего контент-плана это распыление бюджета.
У нас после переклейки кластеров и объединения дублирующих статей трафик на разделе вырос почти вдвое.
Подскажите, а по какой близости топов вы рекомендуете объединять запросы в один кластер, чтобы не склеить в одну страницу принципиально разные интенты пользователей?
Жанна, я ориентируюсь на количество общих URL в топ-10 по проверяемым запросам. Для коммерции беру жесткий порог: три-четыре общих адреса, иначе интенты разные и склеивать нельзя. Для информационки порог мягче. И всегда финальную группировку проверяю глазами: алгоритм подсказывает, но решение о слиянии интентов принимает человек.
Прям в точку. Мы год писали статьи под запросы, которые Яндекс считает одной и той же интентой, и удивлялись, почему толку нет.