Всем привет! В новой версии ВордЧекер добавлена возможность кластеризации запросов через LLM (эмбеддинги) с поддержкой вложенности групп, добавлено указание глубины сбора выдачи Google по ТОП 10-100, скорректирован расчет стоимости сбора позиций в Яндексе и Google с учетом глубины парсинга поисковой выдачи. Рассмотрим подробнее детали данного обновления.

1. Кластеризация запросов через LLM (эмбеддинги)
Добавлена возможность кластеризации запросов через LLM (эмбеддинги) – кластеризация фраз по смыслу, без сбора поисковой выдачи, с поддержкой вложенности групп.


Преимущества кластеризации через LLM:
- Нет необходимости выделять бюджет на сбор поисковой выдачи и частотностей запросов.
- Нет необходимости тратить время непосредственно на саму процедуру сбора выдачи / частностей.
- Поддержка автоматической группировки категорий / групп до 3-го уровня вложенности.
- Высокая скорость кластеризации – для примера: скорость кластеризации 10,000 запросов занимает порядка 3 секунд.
- Недорогая стоимость кластеризации – 0,005 руб. за поисковый запрос. Для примера: стоимость кластеризации 10,000 запросов будет стоить всего 50 рублей.
Принцип работы LLM-кластеризации
Обычная кластеризация судит о запросах не по ним самим, а по поисковой выдаче: чтобы понять, что «купить холодильник» и «холодильник цена» – это одна тема, нужно снять ТОП-10 по обеим фразам и посмотреть, сколько у них общих сайтов. Отсюда затраты по финансам и времени: каждая фраза требует обращения к поисковой системе.

LLM-кластеризация не спрашивает поисковик вообще. Она сравнивает не выдачу, а смысл самих фраз – так же, как это делает человек, который читает список поисковых запросов и распределяет их по папкам.
Шаг 1. Каждый запрос переводится в набор чисел
Языковая модель читает фразу и выдает ее «слепок смысла», который характеризауется сотнями чисел: то есть точку в пространстве, где похожие по значению фразы стоят рядом, а разные – далеко. Модель многоязычная, поэтому «айфон» и «iPhone» попадают почти в одну точку, а «наливной пол» и «половая доска» – в разные, хотя внешне слова похожи.
Шаг 2. Считается близость между точками
Расстояние между двумя фразами – это число от 0 до 1: чем ближе к единице, тем ближе смысл. Именно это число заменяет собой «количество общих сайтов в ТОПе» из старого метода (кластеризация методом SERP).
Шаг 3. Фразы собираются в группы по порогу близости
Порог задается ползунком «сила разбивки». Переместили влево – планка ниже, в одну папку попадает больше фраз, группы получаются крупные и обобщенные. Сдвинули вправо – планка выше, папки дробятся на более узкие. Логика аналогичная, что и порог общих URL в кластеризации по выдаче, только вместо сайтов – смысл.
Шаг 4. Выбирается строгость связи: Hard или Soft
В режиме Hard фраза попадает в группу, только если она близка ко всем ее участникам – папки выходят чище, но мельче. В режиме Soft достаточно близости к одной фразе из группы, и тогда связь передается дальше по цепочке – папки крупнее, но в них могут попадать соседние темы.
Шаг 5. Группы складываются в дерево
Затем та же процедура повторяется уровнем выше: теперь сравниваются уже не отдельные фразы, а получившиеся группы – близкие группы объединяются в категории. Так автоматически получается вложенность до 3-го уровня, без ручного разбора.
Шаг 6. Папки получают названия по запросам
Имя группы – это самый частотный запрос внутри нее. Если частотности не собирались или ни одна фраза не годится для заголовка, название собирается из слов, которые часто встречаются внутри группы и реже – за ее пределами (так, например, папка «газоанализатор метана» отличается от соседней «газоанализатор кислорода»).
Шаг 7. Названия переписывает языковая модель
У предыдущего шага есть потолок: он умеет складывать заголовок только из тех слов, которые люди реально набирали. Группу «туфли лодочки, босоножки, балетки, кеды женские» он назовет одной из этих фраз, хотя по смыслу это «женская обувь» – слова, которого нет ни в одном запросе. Поэтому поверх алгоритма добавлено переименование языковой моделью: она читает состав папки и дает короткое человеческое название в 2-4 слова, обобщая содержимое.
Модель идет по дереву сверху вниз, и вложенную папку называет, уже зная итоговое имя родителя, – поэтому в категории «женская обувь» подпапка называется «босоножки», а не «женская обувь босоножки». Каждое предложенное имя проверяется на: слишком ли оно длинное, повторяющее родителя или совпадающее с соседней папкой – если да, то отбрасывается, и группа остается с названием из шага 6. То есть переименование только улучшает результат и не может его испортить.
Почему это быстро и дешево?
Обе модели – и та, что считает смысл фраз, и та, что переименовывает папки, – работают только лишь на сервере: обращений к поисковым системам и к платным сервисам нет, платить за съем выдачи не нужно. «слепок смысла» для каждой фразы считается один раз и сохраняется: повторная кластеризация того же проекта с другим положением ползунка пересобирает только группы, не пересчитывая фразы заново.
Отсюда и скорость – 10 000 запросов кластеризуются примерно за 3 секунды
Когда какой метод уместнее?
Кластеризация по выдаче отвечает на вопрос «считает ли эти запросы одинаковыми сам поисковик» – это по-прежнему самый точный способ собрать структуру под продвижение. LLM-кластеризация отвечает на вопрос «про одно ли это по смыслу» и нужна там, где семантика большая, а бюджета и времени на съем частотностей и выдачи нет: быстро разложить свежесобранное ядро, разобрать выгрузку из вебмастера и оценить состав конкурентного ядра.
2. Указание глубины сбора поисковой выдачи Google
Для поисковой системы Google добавлена возможность указания глубины сбора поисковой выдачи по ТОП 10-30-50-100 (по умолчанию, сбор осуществляет по ТОП-10 Google). Для получения ТОП-100 отправляется 10 запросов. Чем больше глубина, тем выше стоимость проверки одного запроса.

Таким образом, теперь можно более гибко настраивать сбор данных для Google и более прозрачно распределять бюджет на сбор позиций для тех или иных проектов.
3. Отображение списка URL из выдачи ТОП-100
Добавлена возможность отображения списка URL из выдачи ТОП-100 Яндекса или Google (10-30-50-100) по конкретной поисковой фразе списком и на графике.

Данный функционал позволяет отобразить и проанализировать список сайтов-конкурентов из поисковой выдачи по ТОП-100 для выбранного запроса, а также отображает на графике % распределения в выдаче главных и внутренних страниц (что помогает косвенно оценить конкурентность и сложность продвижения запроса).
Прочие изменения
- Исправлено некорректное указание регионов Яндекса при импорте проектов из системы проверки позиций Топвизор.
- Скорректирован расчет стоимости сбора позиций в Яндексе и Google с учетом глубины парсинга поисковой выдачи.
Другие статьи

50
