
Лемматизация приводит слово к начальной форме: «окнами», «окон», «окну» превращаются в «окно», а «бежал» и «бегущий» — в «бежать». Из-за этого механизма бессмысленно вписывать в текст все словоформы ключевой фразы: поиск и так сводит их воедино, а читатель спотыкается о косноязычие. Ниже — как устроен разбор, чем он отличается от стемминга, где даёт сбой и что из этого следует для текстов на сайте.
Тема кажется академической, но именно из непонимания этой механики растёт половина устаревших требований к текстам: точные вхождения, отдельные страницы под каждый падеж, подсчёт плотности ключей. Если понимать, как система приводит слова к базовой форме, все эти требования отпадают сами.
Как поиск приводит слова к начальной форме
Русский язык морфологически богат: у существительного больше десяти форм, у прилагательного — десятки, у глагола счёт идёт на сотни с учётом причастий и деепричастий. Без приведения к базовой форме поисковая система считала бы «купить окно» и «купил окна» разными запросами, а страницу с заголовком «Установка пластиковых окон» не нашла бы по запросу «установить пластиковое окно».
Лемматизация решает эту задачу с двух сторон одновременно. Текст страницы разбирается на слова, каждое приводится к лемме — словарной форме — и в таком виде попадает в индекс. Запрос человека проходит ту же процедуру. Сравнение идёт уже между леммами, а не между исходными строками.
Порядок разбора выглядит так:
- Разбиение на слова. Текст режется на токены, отделяются знаки препинания, обрабатываются дефисные написания и сокращения.
- Морфологический разбор. Для каждого слова определяются возможные части речи и грамматические признаки: род, число, падеж, время.
- Снятие неоднозначности. Если вариантов несколько, выбирается подходящий по контексту — соседние слова подсказывают, какой разбор верен.
- Приведение к лемме. Выбранному разбору сопоставляется словарная форма.
- Запись в индекс. В индекс идёт лемма, но исходная форма и позиция слова в тексте тоже сохраняются — они нужны для оценки соответствия и для подсветки в сниппете.
Последний пункт важен для понимания: система не выбрасывает исходную форму. Она помнит и то, что вы написали, и то, к чему это сводится. Поэтому естественный, грамматически правильный текст всегда предпочтительнее набора обрубков — он и разбирается корректнее, и в сниппете выглядит человеческим.
Лемматизация и стемминг: в чём разница
Обе процедуры решают одну задачу — свести формы слова к чему-то общему, — но разными способами и с разной точностью.
| Параметр | Стемминг | Лемматизация |
|---|---|---|
| Метод | Отсекает окончание и суффиксы по правилам | Определяет словарную форму с учётом грамматики |
| «бегущий» | «бегущ» | «бежать» |
| «лучше» | «лучш» | «хороший» |
| «окнами» | «окн» | «окно» |
| Что на выходе | Обрубок, которого нет в языке | Настоящее слово из словаря |
| Точность | Ниже: склеивает разные слова с похожим началом | Выше: различает омонимичные формы |
| Требования | Только правила, работает мгновенно | Словари, морфологический анализатор, контекст |
Классический пример провала стемминга на русском: «мыло» и «мыл» после отсечения превращаются в общий обрубок, хотя это разные слова. Или «косить» и «коса» — начало общее, смысл разный. Лемматизация таких склеек не допускает, потому что опирается на словарь, а не на длину окончания.
Для английского языка стемминг долгое время был приемлемым компромиссом: там форм мало, окончания предсказуемые. Для русского с его чередованиями, беглыми гласными и супплетивными формами вроде «человек — люди» отсечением окончаний не обойтись. Поэтому в русскоязычном поиске работает именно лемматизация, и она была там задолго до появления нейросетевых моделей.
Что из этого следует для текстов на сайте
Падежи подгонять не нужно
Это главный практический вывод. Требование вставить фразу «купить окна пластиковые Москва» именно в таком виде — наследие времён, когда системы сравнивали строки буквально. Сегодня «купить пластиковые окна в Москве» распознаётся как та же фраза, и текст от этого становится читаемым.
Более того, падежные уродства вредят дважды. Первый раз — когда человек спотыкается о неестественную конструкцию и уходит со страницы, а его поведение фиксируется. Второй — когда система оценивает текст как переоптимизированный: неестественные повторы одной и той же конструкции распознаются отдельным механизмом, и страница может попасть под фильтр.
Если нужны детали, смотрите «Основные понятия и принципы SEO».
Форма слова в заголовке не критична
Заголовок «Установка пластиковых окон» работает по запросам «установить пластиковое окно», «установка окон пластиковых» и десяткам других вариантов. Создавать отдельные страницы под каждую форму бессмысленно — получатся дубли, которые начнут конкурировать между собой, и система выберет одну, а остальные пометит как малоценные.
Помогу с продвижением: комплексное продвижение сайта — вывожу сайты в топ Яндекса белыми методами.
Разумный подход: одна страница на одно намерение. Если человек хочет заказать установку окон, все формулировки этого желания ведут на одну и ту же страницу. Разделять имеет смысл там, где меняется намерение: «установка окон» и «ремонт окон» — разные задачи и разные страницы.
Порядок слов имеет значение, но не такое, как думают
Лемматизация не отменяет порядок слов — он сохраняется в индексе и участвует в оценке. Но требование «ключ должен идти строго в заданном порядке» давно не абсолютно: система понимает перестановки и вставки. Разница между «доставка пиццы» и «пицца с доставкой» для неё несущественна, а вот между «ремонт квартир под ключ» и «ключ от квартиры после ремонта» — существенна, потому что меняется смысл.
Синонимы — отдельный механизм
Лемматизация работает с формами одного слова и не связывает разные слова. «Окно» и «стеклопакет» — разные леммы, «квартира» и «жильё» тоже. Их система соотносит другим механизмом, через анализ смысловой близости на больших текстовых массивах.
Отсюда практический вывод: синонимы и связанные термины в тексте нужны, но не для «разбавления ключей», а для полноты. Страница про установку окон, где ни разу не упомянуты стеклопакет, профиль, откосы, монтажный шов и подоконник, выглядит поверхностной рядом с той, где эти слова есть естественным образом.
Где механизм даёт сбой
Разбор не идеален, и понимание его слабых мест иногда объясняет странности в выдаче.
- Омонимы. «Стекло» — существительное или форма глагола «стечь»? «Три» — числительное или повелительное наклонение? Разрешается по контексту, но не всегда верно, особенно в коротких заголовках без окружения.
- Названия и бренды. Если марка совпадает с обычным словом, разбор уводит её к нарицательной лемме. Названия вроде «Заря», «Восход», «Лидер» регулярно теряют статус имени собственного.
- Профессиональный жаргон и новые слова. Их может не быть в словарях, тогда включается разбор по правилам, и результат бывает неожиданным.
- Аббревиатуры и написание латиницей. Смешанные написания вроде «SEO-продвижение» разбираются по частям, и часть смысла теряется.
- Опечатки. Обрабатываются отдельным механизмом исправления до морфологического разбора, но редкая опечатка в узком термине может остаться неисправленной.
- Составные термины. «Пластиковое окно» разбирается как два независимых слова, устойчивость сочетания учитывается другими механизмами.
Единственная ситуация, где это стоит учитывать на практике: если название вашей компании или продукта совпадает с обычным словом, добавляйте в текст уточнения — организационно-правовую форму, категорию товара, город. Так система получает контекст и не сводит имя к нарицательной лемме.
Как это меняет работу с семантикой
Понимание разбора напрямую влияет на то, как собирается и группируется ядро запросов. Если формы одного слова система сводит воедино, то и в вашей таблице запросов они должны быть в одной строке.
Подробнее об этом — в статье «Методы продвижения сайта в интернете».
| Устаревший подход | Что делать вместо |
|---|---|
| Собирать все словоформы как отдельные запросы и делить частотность между ними | Складывать формы в одну группу и оценивать суммарный спрос |
| Создавать страницу под каждую формулировку | Одна страница на одно намерение, все формулировки ведут на неё |
| Требовать точное вхождение фразы в текст | Естественное употребление темы страницы в заголовке, первом абзаце и подзаголовках |
| Считать плотность ключевых слов в процентах | Проверять полноту раскрытия темы и наличие связанных терминов |
| Разделять запросы по частотности и писать под каждый отдельный текст | Группировать по смыслу, проверять группировку по пересечению выдачи |
Проверка группировки по выдаче — самый надёжный способ. Если по двум запросам в топе стоят одни и те же страницы, система считает эти запросы близкими, и разводить их по разным страницам не нужно. Если наборы разные — намерения различаются, и страницы должны быть разные. Такую проверку делают Rush Analytics, Topvisor и аналогичные сервисы, частотность берётся в Вордстате.
Как проверить, что страница понята правильно
Косвенных способов несколько, и все они доступны без специальных инструментов.
- Посмотреть, по каким запросам страница уже показывается. В Вебмастере есть отчёт по запросам с разбивкой по страницам. Если формулировки в нём разнообразны по форме, но едины по смыслу — разбор работает как ожидается.
- Проверить сниппет. Подсветка в выдаче показывает, какие слова система сопоставила с запросом. Если подсвечивается не то, что вы ожидали, страница понята иначе.
- Задать запрос в другой форме. Наберите ту же мысль в другом падеже и числе. Если выдача практически совпадает, формы объединены корректно.
- Найти страницы-конкуренты внутри своего сайта. Если по одному запросу система показывает то одну вашу страницу, то другую, значит они для неё одинаковые. Это повод объединить материалы или развести их по смыслу.
Что осталось от старых требований к текстам
Раз морфология снимает вопрос вхождений, возникает встречный вопрос: а что вообще имеет значение в тексте страницы. Список получается короче прежнего и целиком состоит из вещей, которые проверяются глазами.
Заголовок называет предмет страницы прямо. Не метафорой, не общим словом, а тем, что человек ищет. Формулировать можно свободно, но предмет должен быть назван — иначе системе не из чего вывести тему.
Первый абзац отвечает на вопрос, а не разогревает. Если человек пришёл узнать цену, а первые три абзаца рассказывают про историю отрасли, он вернётся в выдачу. Это фиксируется, и никакая морфология тут не поможет.
Подзаголовки описывают реальные подтемы. Структура страницы — сильный сигнал полноты. Когда подзаголовки перечисляют вопросы, которые люди действительно задают, страница выигрывает у сплошного полотна текста с теми же словами.
Если нужна помощь по теме — курсы SEO-оптимизации.
В тексте есть проверяемая конкретика. Цены или хотя бы порядок цен, сроки, условия, ограничения, состав работ. Именно это отличает страницу, закрывающую вопрос, от страницы, которая его пересказывает.
Объём соответствует задаче, а не норме из техзадания. Требование «не менее 5000 знаков» на карточку товара порождает воду, а вода ухудшает поведение. Ориентир простой: текст закончен, когда закончены вопросы читателя.
Тему разбирал отдельно: «Белые SEO методы».
Практический вывод
Понимание лемматизации избавляет от целого пласта бессмысленной работы: подгонки падежей, создания отдельных страниц под формы одного запроса, требований вставить фразу «в точном вхождении», подсчёта процентов плотности. Всё это решает задачу, которой у поисковой системы нет уже много лет.
Освободившиеся силы уходят туда, где они дают результат: на полноту ответа, на структуру страницы, на реальные факты, цены и условия, на скорость и удобство. Текст, написанный нормальным языком и закрывающий вопрос до конца, выигрывает у текста с идеальными вхождениями — не потому что вхождения вредны, а потому что они давно перестали быть аргументом.
Частые вопросы
Значит, ключевые слова в тексте вообще не нужны?
Нужны, но не как вхождения, а как тема. Страница должна называть предмет своими словами: если она про установку окон, слово «окно» в ней будет встречаться естественно — в заголовке, подзаголовках, описании работ. Специально считать количество не требуется, специально избегать тоже.
Как быть с фразами, которые в правильной форме звучат коряво?
Писать в удобной форме. Запрос «окна пластиковые купить москва» — это то, как человек набирает на клавиатуре, а не то, как надо писать в тексте. Заголовок «Купить пластиковые окна в Москве» покрывает этот запрос полностью.
Google лемматизирует так же, как Яндекс?
Механика похожая, качество разбора русской морфологии исторически различалось, но для практических решений разницы нет: обе системы сводят формы одного слова воедино. Писать отдельные тексты «под Google» из-за морфологии не нужно.
Влияет ли лемматизация на анкоры ссылок?
Да, и это снимает давнее требование ставить анкор строго в именительном падеже. Ссылка с текстом «о пластиковых окнах» и ссылка с текстом «пластиковые окна» работают близко. Важнее другое: разнообразие анкоров и их естественность в предложении.
Нужно ли переписывать старые тексты с падежными вставками?
Если конструкции откровенно ломают язык — да, но не ради морфологии, а ради читателя и защиты от фильтра за переоптимизацию. Начинайте со страниц, которые приносят трафик или деньги: там правка окупается быстрее. Тексты, которые никто не читает, проще переписать целиком под реальный спрос.
Как проверить, что мои страницы не конкурируют между собой?
В отчёте Вебмастера по запросам посмотрите, меняется ли страница показа по одному и тому же запросу. Плавающий адрес — признак внутренней конкуренции. Лечится объединением материалов в один сильный или чётким разведением по разным намерениям.
Как собирать запросы и не плодить лишние страницы — показываю на разборе:
Коротко
- Лемматизация приводит слова к словарной форме, чтобы сравнивать запрос и текст по смыслу, а не по буквам.
- Для русского языка она точнее стемминга: учитывает чередования, исключения и снимает неоднозначность по контексту.
- Подгонять падежи в тексте не нужно — все формы распознаются как одно слово, а корявые конструкции вредят поведению и рискуют фильтром.
- Отдельные страницы под разные формы запроса создавать нельзя: получатся дубли, конкурирующие между собой.
- Синонимы обрабатываются другим механизмом, поэтому связанные термины в тексте нужны — для полноты, а не для разбавления.
- Группировку запросов проверяют по пересечению выдачи: одинаковый топ означает одно намерение и одну страницу.
Если нужно разобрать конкретный сайт: как сгруппировано ядро, не конкурируют ли страницы друг с другом и что переписывать в первую очередь — это SEO-консультация. Тексты, написанные нормальным языком под ваш спрос, тоже подготовлю отдельно.
Увеличьте позиции и продажи вашего сайта
Профессиональное SEO-продвижение с гарантией результата. Выберите подходящую услугу:
Остались вопросы по продвижению?
Меня зовут Анатолий Кузнецов, я SEO-оптимизатор с 20-летним стажем. Разберу ваш сайт, отвечу на вопросы и подскажу, что улучшить для роста позиций в Яндексе и Google.
Связаться со мной →Комментарии
Егор Бабенко
Копирайтер прислал техзадание от прошлого подрядчика: там прямо написано «вхождение «окна пластиковые купить недорого Москва» — 3 раза точно, без изменений». Тексты после этого читать невозможно. Как объяснить, что так не надо?
Анатолий Кузнецов автор
Проще всего показать на самой выдаче. Возьмите этот запрос, откройте первые пять результатов и найдите в их текстах точное вхождение в таком виде. Скорее всего, не найдёте ни в одном — там нормальные заголовки вроде «Пластиковые окна в Москве недорого». Дальше аргумент от механики: система приводит слова к начальной форме до сравнения, поэтому естественная формулировка покрывает и запрос из техзадания, и ещё десяток его вариантов. И третий довод, самый весомый для владельца: три неестественных вставки на страницу — это готовый признак переоптимизации, за который можно получить понижение. То есть требование не просто бесполезное, оно рискованное. Замените в задании строку про точные вхождения на список тем, которые текст обязан раскрыть, — результат станет и читаемым, и лучше по позициям.
Полина Багрова
У нас бренд называется «Родник», и по запросу с названием сайт вообще не находится — выдача про питьевую воду и источники. Это как раз тот сбой, про который вы пишете?
Анатолий Кузнецов автор
Ровно тот случай: имя собственное совпало с нарицательным, и система разбирает его как обычное слово. Лечится контекстом. Первое: везде на сайте пишите название вместе с категорией и формой — не «Родник», а «Родник, производство фильтров для воды». Второе: заполните микроразметку организации, там название задаётся явным полем, а не выводится из текста. Третье: заведите карточку в справочнике организаций с тем же написанием, адресом и телефоном — это самый сильный сигнал, что речь про компанию. Четвёртое: следите, чтобы внешние упоминания шли в связке с категорией. Полностью проблему это не снимет, конкуренция с нарицательным значением останется, но по запросам вида «Родник фильтры» и «Родник официальный сайт» вы выйдете вперёд, а именно так вас и будут искать после первого контакта.
Андрей Балашов
Вопрос по группировке. У меня два запроса: «ремонт стиральных машин» и «починить стиральную машину». Понимаю, что это одно и то же. А «ремонт стиральных машин на дому» — уже отдельная страница или нет?
Анатолий Кузнецов автор
Первые два — безусловно одна страница, там разница только в форме. Третий проверяется по выдаче, и это не отговорка, а рабочий способ: откройте топ по обоим запросам и посмотрите на пересечение. Если в первой десятке совпадают шесть-семь адресов, намерение одно, отдельная страница создаст дубль. Если совпадений два-три, значит система видит разные задачи и страницу делать стоит. По моему опыту в этой тематике «на дому» обычно не разводится в отдельную страницу, а закрывается блоком на основной: раздел про выезд мастера, условия, время приезда. Так вы получаете и уточнение в тексте, и не плодите почти одинаковые страницы. Отдельные страницы в ремонте техники разумнее делать по брендам и по типам поломок — там намерения действительно разные.
Лидия Барсукова
А как быть с анкорами внешних ссылок? Нам подрядчик настаивает, что анкор должен быть строго в именительном падеже, иначе ссылка «не считается».
Анатолий Кузнецов автор
Требование из тех же времён, что и точные вхождения. Формы слова сводятся к лемме и в анкоре тоже, поэтому «о пластиковых окнах» и «пластиковые окна» работают близко по смыслу. Проблема с настойчивостью подрядчика в другом: если все ссылки идут одинаковым анкором в именительном падеже, вы получаете однообразный профиль, который читается как покупной. Естественная картина выглядит иначе — часть ссылок с названием компании, часть с адресом сайта, часть с общими словами вроде «здесь» и «подробнее», и только часть с тематическими фразами в разных формах. Практический ориентир: анкор должен нормально читаться внутри предложения на странице-доноре. Если ради именительного падежа фраза выламывается из текста, вы жертвуете естественностью ради того, что перестало иметь значение.
Николай Батурин
Не соглашусь про порядок слов. У нас две страницы, тексты почти одинаковые, разница только в порядке слов в заголовке — и позиции отличаются на десять пунктов. Значит, порядок всё-таки важен?
Анатолий Кузнецов автор
Важен, я про это и писал: лемматизация снимает вопрос форм, а не порядка. Но в вашем случае я бы не спешил объяснять разрыв в десять пунктов одним заголовком. Проверьте несколько вещей. Первое: не конкурируют ли эти две страницы между собой — почти одинаковые тексты по одной теме обычно так и заканчиваются, и система произвольно выбирает одну. Второе: сравните входящие внутренние ссылки, у страницы повыше их наверняка больше. Третье: посмотрите на дату публикации и на поведение — старая страница с накопленной статистикой обгоняет новую при равном тексте. Заголовок влияет, порядок слов в нём тоже, но это фактор десятого ряда рядом с внутренней конкуренцией. Я бы объединил обе страницы в одну и оставил редирект — почти наверняка результат будет лучше, чем у любой из них по отдельности.
Алиса Бахметьева
Пример с «мыло» и «мыл» очень наглядный. Теперь понятно, почему в англоязычных инструментах русский разбирается так странно.
Владимир Бекетов
Подскажите, а если в тексте много профессиональных терминов, которых нет в обычных словарях, это как-то мешает странице ранжироваться?
Нина Белобородова
Проверила по вашему совету отчёт Вебмастера — по одному запросу действительно скачут три разные страницы. Не думала, что так можно диагностировать.
Тимофей Беляков
А сервисы проверки текста, которые считают тошноту и плотность, вообще имеет смысл использовать? Или это тоже наследие?
Галина Бердникова
У нас в тематике половина запросов пишется латиницей и кириллицей вперемешку. Делать две страницы или это тоже одна лемма?
Станислав Березин
Интересно, что исходная форма сохраняется в индексе вместе с леммой. Это объясняет, почему в сниппете иногда подсвечивается именно то слово, которое я написал.
Ирина Бессонова
Скажите, а на заголовок страницы в выдаче морфология влияет? Читала, что систему лучше не заставлять склонять за себя.
Отличная статья! Спасибо вам. Только вы не прикрепили инструмент по лемматицзации.