
Семантическое пространство укладывает смысл слов в координаты: близкие по значению слова оказываются рядом, далёкие — далеко, и всё это без единого словаря, написанного руками человека. Идея выглядит абстрактной ровно до момента, когда выясняется, что именно на ней держится современный поиск. Страница попадает в выдачу не потому, что содержит слова запроса, а потому, что её содержание оказалось в нужной области этого пространства. Отсюда растут и требования к текстам, и объяснение, почему приёмы вроде «повысить плотность ключа» перестали давать результат.
В SEO я с 2005 года и застал момент, когда поиск действительно искал совпадение строк. Тексты тогда писали под алгоритм: вхождение в первом абзаце, вхождение в заголовке, разбавленное вхождение в середине. Сегодня та же работа выглядит иначе, и понимание механики помогает не гадать. Ниже — как из обычных текстов получается пространство смыслов, как поиск им пользуется, что из этого следует для страниц на вашем сайте и какие популярные советы на этой механике не держатся.
Откуда берётся пространство смыслов
В основе лежит наблюдение, сформулированное лингвистами ещё в пятидесятые годы: значение слова проявляется в его окружении. Слова, которые встречаются в похожих контекстах, похожи по смыслу. «Кофе» и «чай» стоят рядом со словами «налить», «горячий», «кружка», «утро» — и потому оказываются соседями, хотя ни одно определение их не связывало.
Дальше это наблюдение превращают в арифметику. Каждому слову назначают вектор — набор чисел, координаты в пространстве с сотнями измерений. Числа подбираются обучением на огромном корпусе текстов так, чтобы слова из похожих контекстов получили похожие координаты. Никто не задаёт вручную, что означает каждое измерение: они не имеют человеческих названий и появляются как побочный результат подгонки.
Результат обучения выглядит неожиданно осмысленно. С векторами можно делать операции: разность между «королём» и «мужчиной», прибавленная к «женщине», даёт точку рядом с «королевой». Разность между «Москвой» и «Россией», прибавленная к «Франции», приводит к «Парижу». Это не запрограммировано — это следствие того, что отношения «столица — страна» и «мужской род — женский род» устойчиво повторяются в текстах.
Как измеряется близость
Расстояние между словами считают не линейкой, а углом между векторами — косинусной близостью. Значение лежит в диапазоне от минус единицы до единицы: чем ближе к единице, тем более схожи контексты употребления.
| Пара слов | Тип связи | Ожидаемая близость |
|---|---|---|
| ремонт — починка | Синонимы | Очень высокая |
| ремонт — обслуживание | Соседние понятия | Высокая |
| ремонт — гарантия | Связь по ситуации | Средняя |
| ремонт — крыжовник | Связи нет | Близкая к нулю |
| дорогой — дешёвый | Антонимы | Высокая — и это ловушка |
Последняя строка объясняет главное ограничение подхода. Антонимы употребляются в одинаковых контекстах: «дорогой телефон» и «дешёвый телефон» окружены одними и теми же словами. Поэтому в пространстве они оказываются соседями, хотя означают противоположное. Модель, построенная только на статистике соседства, различие между ними схватывает плохо — и это одна из причин, по которым от отдельных слов пришлось переходить к более сложным конструкциям.
Ещё одна особенность, которая объясняет странности выдачи: в пространстве оказываются рядом не только полноценные слова, но и опечатки, транслитерация, жаргон и профессиональные сокращения. «Ноутбук», «ноут», «notebook» и распространённые опечатки в этом слове живут в одной области, потому что употребляются в одинаковых контекстах. Поэтому отдельные страницы «под опечатки» и «под транслит», которые массово делали пятнадцать лет назад, сегодня не нужны и только плодят дубли.
От отдельных слов к смыслу фразы
У ранних моделей было ещё одно ограничение: одно слово — один вектор. «Замок» на двери и «замок» на холме получали одни координаты, усреднённые по всем употреблениям сразу. Для поиска это тупик: половина коротких запросов многозначна.
Решением стали контекстные модели. В них вектор слова вычисляется заново для каждого предложения, с учётом соседей. «Ключ от квартиры», «ключ к решению», «ключ бьёт из-под земли» получают три разных набора координат. Технически это делают архитектуры, которые смотрят на всё предложение сразу и взвешивают связи между словами независимо от расстояния между ними.
Если нужны детали, смотрите «Как составлять семантическое ядро для сайта».
Практическое следствие для владельца сайта: поиск понимает смысл слова из окружения на самой странице. Слово «доставка» на странице интернет-магазина и то же слово на странице транспортной компании трактуются по-разному, и уточнять это специальными вхождениями не требуется — достаточно, чтобы окружающий текст был содержательным.
Как этим пользуется поиск
Помогу с продвижением: вывод сайта в ТОП Яндекса — вывожу сайты в топ Яндекса белыми методами.
Переход поисковых систем от совпадения слов к сопоставлению смыслов занял несколько лет и шёл поэтапно.
Если интересно направление с сайтами — базу даю в своём курсе:
| Этап | Что появилось | Что изменилось на практике |
|---|---|---|
| До 2015 года | Совпадение слов, учёт словоформ и синонимов по словарям | Работали вхождения и плотность ключей |
| 2015–2016 | Нейросетевое сопоставление запроса и заголовка | Начали находиться ответы без общих слов с запросом |
| 2017–2019 | Сопоставление запроса со всем текстом страницы | Длинные и редкие запросы стали получать осмысленные ответы |
| 2020 и далее | Трансформерные модели в ранжировании | Учитывается порядок слов, отрицания, связи внутри предложения |
Сегодня запрос и страница превращаются в векторы, и близость между ними — один из факторов ранжирования. Именно поэтому по запросу «чем отмыть смолу с куртки» находится статья, где слова «отмыть» может не быть вовсе, а есть «как удалить пятно от сосновой смолы с одежды». Совпадения строк нет, совпадение смысла есть.
Важно понимать границу: близость векторов — не единственный фактор и даже не главный. Она отвечает за отбор кандидатов и за оценку соответствия запросу, но рядом работают коммерческие факторы, поведенческие сигналы, техническое состояние сайта и оценка доверия к нему. Идеально попавший в смысл текст на медленном сайте без цен и контактов в топ по коммерческому запросу не выйдет.
Что из этого следует для текстов на сайте
Практических выводов немного, но они меняют подход к написанию страниц целиком.
Подробнее об этом — в статье «Семантическое ядро сайта».
- Полнота темы важнее вхождений. Страница должна закрывать вопрос целиком: определения, условия, ограничения, цифры, порядок действий. Полнота считывается по составу понятий, а не по числу упоминаний ключа.
- Естественный язык выигрывает. Фразы вида «пластиковые окна купить недорого Москва» когда-то работали; сейчас они только ухудшают восприятие текста человеком, не давая ничего алгоритму.
- Сопутствующие понятия обязательны. В тексте про ремонт кровли должны естественно оказаться материалы, уклон, гидроизоляция, сроки, гарантия — не как список ключей, а потому что без них тема не раскрыта.
- Точность формулировок имеет значение. Современные модели различают «с гарантией» и «без гарантии», «можно» и «нельзя», порядок слов в фразе.
- Один смысл — одна страница. Две страницы, попавшие в одну область пространства, конкурируют друг с другом, и поиск выбирает одну, часто не ту.
- Структура помогает. Заголовки, списки и таблицы задают границы смысловых блоков, и модель опирается на них при разборе страницы.
Есть и обратная сторона, о которой предупреждают редко. Раз поиск понимает смысл, он понимает и то, что страница отвечает на запрос лишь наполовину. Раньше недостающую часть темы можно было компенсировать ссылками и вхождениями; сейчас страница, где раскрыт один аспект из пяти, конкурирует с материалами, где раскрыты все пять, и проигрывает им по составу — независимо от того, сколько на неё стоит ссылок. Именно поэтому короткие тексты «на триста слов под запрос» перестали приносить трафик даже на сайтах с сильным доменом.
Почему плотность ключей перестала работать
Показатель плотности — доля вхождений ключевой фразы от общего числа слов — имел смысл, пока релевантность считалась по частотным формулам. Логика была прямая: слово встречается чаще, чем в среднем по корпусу, значит, текст об этом.
В векторной модели этой связи нет. Смысл текста определяется составом и сочетанием понятий, а не частотой одного из них. Двадцать повторов фразы не сдвигают текст в пространстве ближе к запросу — они лишь делают его хуже для чтения, что отражается на поведении посетителей и уже через них на оценке страницы.
Сюда же относится популярный совет «довести до зелёного» в анализаторах текста. Такие сервисы считают частотные показатели: тошноту, водность, долю ключей. Все они измеряют форму, а не смысл, и текст, подогнанный под их шкалы, регулярно оказывается хуже написанного нормально.
Из той же логики следует, почему объединение нескольких слабых страниц в одну сильную часто даёт рост. Три коротких материала про одно и то же занимают почти одну точку пространства и делят между собой и внутренние ссылки, и внешние упоминания, и поведенческие данные. Собранные в один развёрнутый материал, они дают более выраженное попадание в тему и накапливают сигналы вместе, а не по третям.
Мифы вокруг темы
| Утверждение | Что не так |
|---|---|
| «LSI-копирайтинг — современный подход» | Латентно-семантическое индексирование — метод из 1990-х, в поиске в исходном виде не применяется; термин используют как маркетинговую обёртку для обычного требования раскрывать тему |
| «Нужно добавить LSI-слова из списка» | Списки собираются частотным анализом текстов конкурентов; механическая вставка таких слов не делает текст содержательнее |
| «Поиск понимает текст как человек» | Модель работает со статистикой употреблений; она не проверяет факты и не отличает правду от вымысла |
| «Синонимы обязательно нужно перечислять» | Синонимы распознаются автоматически; перечислять их подряд имеет смысл только там, где так говорят реальные люди |
| «Чем длиннее текст, тем полнее тема» | Полнота — это состав раскрытых вопросов, а не объём знаков; длина коррелирует с полнотой, но не создаёт её |
Как проверить, попадает ли страница в нужный смысл
Если нужна помощь по теме — заказать SEO-тексты.
Прямого доступа к векторам поисковой системы нет, но косвенных способов оценки достаточно.
- Посмотрите выдачу по своему запросу. Какие типы страниц там стоят: статьи, каталоги, карточки, форумы. Тип страницы — самый грубый и самый важный признак попадания в смысл запроса.
- Соберите состав понятий у первой десятки. Не частоты ключей, а перечень вопросов, которые они раскрывают. Пробел в вашем перечне — прямая задача на доработку.
- Проверьте отчёт по запросам в Вебмастере. Если страница показывается по группе запросов, которые вы не имели в виду, она попала не в ту область, и это чаще проблема заголовка и первого экрана.
- Проверьте, нет ли у вас двух страниц под один смысл. В Вебмастере видно, когда по одному запросу поиск чередует разные адреса вашего сайта.
- Дайте текст человеку из вашей отрасли. Если специалист говорит «тут не хватает про сроки и допуски», ровно этого не хватает и для алгоритма.
Отдельный полезный приём — проверка на подмену темы. Возьмите заголовок страницы, первый абзац и все подзаголовки, выпишите их подряд и прочитайте отдельно от остального текста. Если по такому конспекту нельзя понять, о чём страница и кому она адресована, то и модели опираться не на что: заголовки и начало текста весят при разборе страницы больше, чем середина. Это же объясняет, почему переписывание одного первого экрана иногда двигает страницу заметнее, чем добавление трёх тысяч знаков в конец.
Тему разбирал отдельно: «Продающие запросы и семантическое ядро».
Где машина всё ещё промахивается
Понимание смысла у поиска остаётся статистическим, и это порождает предсказуемые слабые места.
- Редкие термины. Слово, которое почти не встречалось в обучающих текстах, получает размытые координаты. Узкоспециальные и новые термины приходится пояснять прямо в тексте.
- Отрицания. Современные модели их учитывают лучше прежних, но «не требует фундамента» и «требует фундамента» по-прежнему различаются хуже, чем хотелось бы.
- Локальные значения. Одно и то же слово в разных регионах и отраслях означает разное; пространство усредняет.
- Достоверность. Близость к запросу не означает правильности ответа. Проверку фактов берут на себя другие механизмы — оценки асессоров, сигналы доверия к источнику.
- Свежие темы. Пока о явлении мало текстов, модели не на чем учиться, и поиск по таким запросам работает грубее.
Отсюда практическое правило для узких ниш: чем специфичнее тематика, тем важнее объяснять термины и связывать их с общеупотребительными словами. Это помогает и человеку, который читает впервые, и модели, которой не хватило примеров.
Частые вопросы
Это то же самое, что семантическое ядро? Нет. Семантическое ядро — список запросов, по которым вы продвигаетесь. Семантическое пространство — способ представления смысла слов внутри поисковых алгоритмов. Совпадает только первое слово в названии.
Нужно ли специально вставлять синонимы? Специально — нет. Синонимы полезны там, где они естественны для речи вашей аудитории. Перечисление ряда синонимов подряд читается как список ключей и работает против текста.
Помогают ли сервисы подбора «LSI-слов»? Как подсказка о том, какие подтемы раскрывают конкуренты, — да, это полезная разведка. Как список слов для механической вставки — нет.
Влияет ли грамотность текста? Опечатки поиск исправляет и на смысл они почти не влияют. А вот сбитая структура предложений мешает модели связать слова между собой — и мешает читателю, что важнее.
Можно ли писать тексты нейросетями? Технически да, и поиск не наказывает за способ создания. Проблема в другом: языковая модель уверенно выдаёт правдоподобные, но неверные детали, а проверять их всё равно придётся человеку, который в теме разбирается.
Нужно ли переписывать старые тексты, написанные под вхождения? Не все и не сразу. Начните с тех, что показываются в поиске, но не приносят переходов: там обычно виден разрыв между заголовком и содержанием. Тексты, которые исправно дают трафик, трогать не стоит, даже если они выглядят устаревшими по стилю.
Как понять, что тема раскрыта полностью? По составу вопросов, а не по объёму. Соберите вопросы, которые задают клиенты и которые видны в поисковых подсказках, и проверьте, на все ли отвечает страница.
Коротко
- Смысл слова в поисковых алгоритмах задаётся координатами в многомерном пространстве, а координаты выводятся из контекстов употребления в огромных корпусах текстов.
- Близость измеряется углом между векторами; метод хорошо схватывает синонимы и тематические связи и плохо — антонимы.
- Контекстные модели считают вектор слова заново для каждого предложения, поэтому многозначные слова перестали быть проблемой поиска.
- Поиск сопоставляет смысл запроса и смысл страницы, а не строки, — отсюда результаты без единого общего слова с запросом.
- Плотность вхождений потеряла смысл: текст сдвигается в пространстве составом понятий, а не частотой одного из них.
- «LSI-копирайтинг» и списки «LSI-слов» — маркетинговая обёртка требования раскрывать тему полностью; полезна разведка подтем, а не вставка слов.
- Слабые места остались: редкие термины, отрицания, узкоотраслевые значения и достоверность фактов.
Если непонятно, почему страница показывается не по тем запросам или проигрывает конкурентам при, казалось бы, лучшем тексте, приходите на SEO-консультацию: разберём состав подтем у вашей страницы и у первой десятки выдачи и определим, чего именно не хватает.
Увеличьте позиции и продажи вашего сайта
Профессиональное SEO-продвижение с гарантией результата. Выберите подходящую услугу:
Остались вопросы по продвижению?
Меня зовут Анатолий Кузнецов, я SEO-оптимизатор с 20-летним стажем. Разберу ваш сайт, отвечу на вопросы и подскажу, что улучшить для роста позиций в Яндексе и Google.
Связаться со мной →
Комментарии
Гавриил Хмуров
Пример с антонимами объясняет то, с чем мы бьёмся год. У нас страница про оборудование без предоплаты, и поиск упорно подмешивает её к запросам про предоплату. Всегда думал, что это наша ошибка в тексте, а выходит, это ограничение самого метода.
Анатолий Кузнецов автор
Ограничение метода тут действительно есть, но обойти его частично можно, и обходится оно не отрицанием, а утверждением. Замените конструкцию «без предоплаты» на положительную формулировку того же смысла: «оплата после установки», «расчёт по факту приёмки», «первый платёж — после запуска». Такие фразы попадают в другую область пространства, потому что окружены другими словами, и не тянут за собой контекст предоплаты. Второе: вынесите эту формулировку в заголовок страницы и в первый экран, а не в середину текста — начало весит больше. И проверьте через месяц отчёт по запросам в Вебмастере: если подмешивание сохранится, значит, тема предоплаты слишком подробно разобрана в теле страницы и её стоит сократить.
Евдокия Целищева
Наконец-то внятное объяснение, почему LSI-копирайтинг — это переупакованное «раскройте тему». Заказывали такие тексты три года, в ТЗ приходил список из сорока слов, которые надо вставить. Тексты получались нечитаемые, а результата не было ни разу.
Прохор Чапурин
Спорный момент про длину текста. По моим наблюдениям в конкурентных нишах в топе стоят именно длинные материалы, короткие не пробиваются вообще. Может, длина всё-таки фактор, просто про это не принято говорить?
Анатолий Кузнецов автор
В топе действительно чаще длинные материалы, но это следствие, а не причина, и разница здесь принципиальна для того, что вы будете делать дальше. Полно раскрытая тема требует места: определения, условия, исключения, порядок действий, цифры — всё это набирает знаки само. Поэтому полнота и длина коррелируют. Проверить направление связи легко: возьмите свой текст и допишите к нему три тысячи знаков рассуждений, не добавляющих ни одного нового вопроса. Позиции не сдвинутся. А теперь добавьте к короткому тексту раздел с ценами, сроками и ограничениями — сдвинутся, хотя знаков прибавится столько же. Ориентир объёма у конкурентов полезен как признак того, сколько подтем они закрыли, и вреден как цель сама по себе.
Нина Ходырева
Приём с чтением заголовка и подзаголовков отдельно от текста опробовала сразу на трёх своих страницах. На двух получился набор общих фраз вроде «Преимущества» и «Как мы работаем» — по такому конспекту действительно нельзя понять ни тему, ни аудиторию. Переписала подзаголовки, посмотрю динамику.
Захар Цепелев
Вопрос про узкие термины. У нас промышленная тематика, половина слов в текстах — обозначения по ГОСТ, которых нет нигде, кроме отраслевых справочников. Получается, поиск для нас просто не работает как надо?
Анатолий Кузнецов автор
Работает, но требует от вас лишнего шага — связать редкий термин с тем, как его называют покупатели. Практически это выглядит так. В заголовке и первом абзаце ставится обиходное название, обозначение по ГОСТ идёт рядом в скобках или отдельной строкой характеристик. В тексте один раз даётся расшифровка: что это, где применяется, чем отличается от соседнего типоразмера. Дальше можно пользоваться обозначением свободно. Проверьте заодно спрос в Вордстате по обеим формам: часто выясняется, что по обозначению ищут единицы, а по обиходному названию — сотни, и структура страниц должна строиться от второго. Отдельная польза от расшифровок в том, что они закрывают запросы вида «что такое», а это дешёвый информационный трафик в узкой нише.
Варвара Чижикова
Объединили четыре коротких статьи про одно и то же в один материал с редиректами, как описано в разделе про слабые страницы. Через полтора месяца объединённая страница показывается по всем запросам, по которым раньше чередовались четыре, и стоит выше, чем стояла лучшая из них.
Вениамин Холодов
Не понял разницу между семантическим ядром и семантическим пространством до конца. Ядро я собираю в Вордстате, это список фраз. Пространство — внутренняя штука поисковика, повлиять на неё я не могу. Тогда какая мне от этого знания практическая польза?
Анатолий Кузнецов автор
Польза в том, что меняется способ принимать решения по текстам. Пока считаешь, что поиск ищет совпадение строк, логика такая: собрал сто фраз, распихал по абзацам, проверил плотность. Когда понимаешь, что сопоставляются смыслы, логика другая: сгруппировал фразы по смыслу, на каждую группу завёл отдельную страницу, внутри страницы закрыл все вопросы этой группы. Ядро при этом никуда не девается — оно остаётся картой спроса. Меняется то, что вы делаете с ядром дальше: не список вхождений, а разметка на смысловые кластеры. И вторая практическая вещь — вы перестаёте платить за услуги, построенные на устаревшей модели: за списки LSI-слов, за доведение текста до зелёного цвета, за «переспам вычистили».
Клавдия Хвощёва
Про опечатки и транслит — у нас на сайте до сих пор живут страницы, сделанные в 2014 году под варианты написания названия бренда латиницей и кириллицей. Восемь адресов с одинаковым текстом. Теперь понятно, что их надо схлопывать, а не поддерживать.
Фадей Чубаров
Пример с королём и королевой знаю по учебникам, но никогда не связывал его с выдачей. Полезно, что вы довели цепочку до конца — от векторов до того, почему находятся статьи без общих слов с запросом. Обычно объяснение обрывается на середине.
Регина Храмова
Проверила отчёт по запросам в Вебмастере. Страница услуги показывается в основном по информационным запросам «как выбрать» и «чем отличается», а по коммерческим её нет вовсе. Похоже, текст ушёл не в ту область — он у нас на две трети обучающий.
Эдуард Цикунов
Вопрос про тексты нейросетями. Пишу черновики моделью, потом правлю руками. Поиск это как-то различает? Слышал про фильтры за машинный контент и не понимаю, насколько это реальная угроза.
Анатолий Кузнецов автор
Различить способ написания надёжно нельзя, и попытки строить фильтр по этому признаку упираются в ложные срабатывания на обычных редакторских текстах. Санкции прилетают не за машинность как таковую, а за то, что с ней обычно приходит: тексты ни о чём, штампованные страницы пачками, повторяющиеся структуры на сотнях адресов, фактические ошибки. Ваш порядок работы — черновик моделью, правка руками — как раз снимает основные риски, если правка настоящая: сверка цифр, добавление того, что модель знать не может, выбрасывание общих мест. Хуже всего работает промежуточный вариант, когда текст сгенерирован и опубликован без проверки, потому что тогда на сайте копятся правдоподобные неточности, а разгребать их приходится позже и дороже.
Алевтина Чертанова
Раздел про достоверность стоило бы вынести повыше. У нас конкурент собрал тексты, где половина фактов неверна, и они прекрасно ранжируются. Значит, близость к смыслу запроса поиск оценивает, а правдивость — нет. Обидно, но полезно знать, что рассчитывать на автоматическую справедливость не стоит.