50
17.08.2026 | Время чтения: 6 минут

Всем привет! В новой версии ВордЧекер добавлена возможность кластеризации запросов через LLM (эмбеддинги) с поддержкой вложенности групп, добавлено указание глубины сбора выдачи Google по ТОП 10-100, скорректирован расчет стоимости сбора позиций в Яндексе и Google с учетом глубины парсинга поисковой выдачи. Рассмотрим подробнее детали данного обновления.

Кластеризация запросов через LLM (эмбеддинги) с поддержкой вложенности групп - ВордЧекер 1.4

1. Кластеризация запросов через LLM (эмбеддинги)

Добавлена возможность кластеризации запросов через LLM (эмбеддинги) – кластеризация фраз по смыслу, без сбора поисковой выдачи, с поддержкой вложенности групп.

Кластеризация запросов через LLM (эмбеддинги)

Кластеризация запросов через LLM (эмбеддинги)

Преимущества кластеризации через LLM:

  • Нет необходимости выделять бюджет на сбор поисковой выдачи и частотностей запросов.
  • Нет необходимости тратить время непосредственно на саму процедуру сбора выдачи / частностей.
  • Поддержка автоматической группировки категорий / групп до 3-го уровня вложенности.
  • Высокая скорость кластеризации – для примера: скорость кластеризации 10,000 запросов занимает порядка 3 секунд.
  • Недорогая стоимость кластеризации – 0,005 руб. за поисковый запрос. Для примера: стоимость кластеризации 10,000 запросов будет стоить всего 50 рублей.

Принцип работы LLM-кластеризации

Обычная кластеризация судит о запросах не по ним самим, а по поисковой выдаче: чтобы понять, что «купить холодильник» и «холодильник цена» – это одна тема, нужно снять ТОП-10 по обеим фразам и посмотреть, сколько у них общих сайтов. Отсюда затраты по финансам и времени: каждая фраза требует обращения к поисковой системе.

Принцип работы LLM-кластеризации поисковых запросов

LLM-кластеризация не спрашивает поисковик вообще. Она сравнивает не выдачу, а смысл самих фраз – так же, как это делает человек, который читает список поисковых запросов и распределяет их по папкам.

Шаг 1. Каждый запрос переводится в набор чисел

Языковая модель читает фразу и выдает ее «слепок смысла», который характеризауется сотнями чисел: то есть точку в пространстве, где похожие по значению фразы стоят рядом, а разные – далеко. Модель многоязычная, поэтому «айфон» и «iPhone» попадают почти в одну точку, а «наливной пол» и «половая доска» – в разные, хотя внешне слова похожи.

Шаг 2. Считается близость между точками

Расстояние между двумя фразами – это число от 0 до 1: чем ближе к единице, тем ближе смысл. Именно это число заменяет собой «количество общих сайтов в ТОПе» из старого метода (кластеризация методом SERP).

Шаг 3. Фразы собираются в группы по порогу близости

Порог задается ползунком «сила разбивки». Переместили влево – планка ниже, в одну папку попадает больше фраз, группы получаются крупные и обобщенные. Сдвинули вправо – планка выше, папки дробятся на более узкие. Логика аналогичная, что и порог общих URL в кластеризации по выдаче, только вместо сайтов – смысл.

Шаг 4. Выбирается строгость связи: Hard или Soft

В режиме Hard фраза попадает в группу, только если она близка ко всем ее участникам – папки выходят чище, но мельче. В режиме Soft достаточно близости к одной фразе из группы, и тогда связь передается дальше по цепочке – папки крупнее, но в них могут попадать соседние темы.

Шаг 5. Группы складываются в дерево

Затем та же процедура повторяется уровнем выше: теперь сравниваются уже не отдельные фразы, а получившиеся группы – близкие группы объединяются в категории. Так автоматически получается вложенность до 3-го уровня, без ручного разбора.

Шаг 6. Папки получают названия по запросам

Имя группы – это самый частотный запрос внутри нее. Если частотности не собирались или ни одна фраза не годится для заголовка, название собирается из слов, которые часто встречаются внутри группы и реже – за ее пределами (так, например, папка «газоанализатор метана» отличается от соседней «газоанализатор кислорода»).

Шаг 7. Названия переписывает языковая модель

У предыдущего шага есть потолок: он умеет складывать заголовок только из тех слов, которые люди реально набирали. Группу «туфли лодочки, босоножки, балетки, кеды женские» он назовет одной из этих фраз, хотя по смыслу это «женская обувь» – слова, которого нет ни в одном запросе. Поэтому поверх алгоритма добавлено переименование языковой моделью: она читает состав папки и дает короткое человеческое название в 2-4 слова, обобщая содержимое.

Модель идет по дереву сверху вниз, и вложенную папку называет, уже зная итоговое имя родителя, – поэтому в категории «женская обувь» подпапка называется «босоножки», а не «женская обувь босоножки». Каждое предложенное имя проверяется на: слишком ли оно длинное, повторяющее родителя или совпадающее с соседней папкой – если да, то отбрасывается, и группа остается с названием из шага 6. То есть переименование только улучшает результат и не может его испортить.

Почему это быстро и дешево?

Обе модели – и та, что считает смысл фраз, и та, что переименовывает папки, – работают только лишь на сервере: обращений к поисковым системам и к платным сервисам нет, платить за съем выдачи не нужно. «слепок смысла» для каждой фразы считается один раз и сохраняется: повторная кластеризация того же проекта с другим положением ползунка пересобирает только группы, не пересчитывая фразы заново.

Отсюда и скорость – 10 000 запросов кластеризуются примерно за 3 секунды

Когда какой метод уместнее?

Кластеризация по выдаче отвечает на вопрос «считает ли эти запросы одинаковыми сам поисковик» – это по-прежнему самый точный способ собрать структуру под продвижение. LLM-кластеризация отвечает на вопрос «про одно ли это по смыслу» и нужна там, где семантика большая, а бюджета и времени на съем частотностей и выдачи нет: быстро разложить свежесобранное ядро, разобрать выгрузку из вебмастера и оценить состав конкурентного ядра.

2. Указание глубины сбора поисковой выдачи Google

Для поисковой системы Google добавлена возможность указания глубины сбора поисковой выдачи по ТОП 10-30-50-100 (по умолчанию, сбор осуществляет по ТОП-10 Google). Для получения ТОП-100 отправляется 10 запросов. Чем больше глубина, тем выше стоимость проверки одного запроса.

Указание глубины сбора поисковой выдачи Google

Таким образом, теперь можно более гибко настраивать сбор данных для Google и более прозрачно распределять бюджет на сбор позиций для тех или иных проектов.

3. Отображение списка URL из выдачи ТОП-100

Добавлена возможность отображения списка URL из выдачи ТОП-100 Яндекса или Google (10-30-50-100) по конкретной поисковой фразе списком и на графике.

Отображение списка URL из выдачи ТОП-100

Данный функционал позволяет отобразить и проанализировать список сайтов-конкурентов из поисковой выдачи по ТОП-100 для выбранного запроса, а также отображает на графике % распределения в выдаче главных и внутренних страниц (что помогает косвенно оценить конкурентность и сложность продвижения запроса).

Прочие изменения

  • Исправлено некорректное указание регионов Яндекса при импорте проектов из системы проверки позиций Топвизор.
  • Скорректирован расчет стоимости сбора позиций в Яндексе и Google с учетом глубины парсинга поисковой выдачи.
Подписывайтесь на наш канал в Телеграм! https://t.me/siteanalyzer

Оцените статью
5/5
1



<< Назад