Раздел: ИзмерениеТип: Раздел
Раздел · обновлено 2026-07-27

Измерение: от вопроса до повторного среза

Надёжное измерение AI-видимости начинается не с процента, а с протокола: фиксируются запросы, системы, язык, рынок, время и правила валидации ответов. Без этого динамика не сопоставима.

Калибровочная лаборатория Киберкошки разделяет потоки наблюдений и отбраковывает несопоставимые результаты.
Контур измерения

Процент появляется только после вопроса, выборки и проверки

Разные метрики используют разные знаменатели. Их нельзя складывать или сравнивать, не сохранив состав prompt bank и число валидных ответов.

  1. ВопросКакое пользовательское решение исследуется.
  2. ВыборкаКакие запросы, системы, режимы и даты входят в срез.
  3. МетрикаЧислитель и знаменатель соответствуют одному событию.

Четыре уровня контроля

  1. Постановка задачи: какой выбор пользователя исследуется.
  2. Дизайн выборки: какие запросы и AI-системы входят в проверку.
  3. Качество запуска: сколько ответов валидно и какие ошибки возникли.
  4. Интерпретация: что наблюдалось и какие причины ещё нужно проверить.

Сначала определить единицу наблюдения

В Киберкошке базовая единица — один промпт × одна AI-система × один запуск × одна дата. Режим поиска, язык, рынок и аккаунт также фиксируются, если меняют условия. Это позволяет понять, из чего сложился знаменатель.

Например, 10 запросов в пяти системах дают 50 ожидаемых ответов. Если три ответа технически не получены, отчёт должен показать 47 валидных ответов и полноту запуска 47 / 50, а не молча записать три отсутствия бренда.

Как строится prompt bank

Группа Назначение Пример
Core небрендовая проверить присутствие в категории без подсказки «Как отслеживать рекомендации бренда в нейросетях?»
Брендовая проверить знание и точность описания «Что такое Киберкошка и кому принадлежит?»
Контрольная наблюдать общий фон без целевых изменений заранее выбранный соседний вопрос
Исследовательская проверить новую тему или формулировку новый сценарий, не входящий в основной процент

Core-набор сохраняется между периодами. Если новый вопрос важен, его можно добавить в следующую версию банка, но граница версии должна быть видна в отчёте.

Какие знаменатели не смешивать

  • Mention Rate считается по валидным ответам.
  • Query Coverage считается по запросам утверждённого банка.
  • Model Coverage считается по проверенным AI-системам.
  • Stability считается по сопоставимым повторным запускам одной пары.
  • Citation Rate требует заранее определённого домена или списка URL.

Одинаковое значение 20% может описывать совершенно разные события. Поэтому рядом с процентом всегда показываются абсолютные числа и название метрики.

Что входит в baseline

Baseline — это не только итоговый процент. Минимальная фиксация включает:

  • версию prompt bank;
  • рынок, язык и временное окно;
  • список систем и режимов;
  • ожидаемое и валидное число ответов;
  • исходные тексты;
  • правила разметки;
  • агрегаты с числителем и знаменателем;
  • известные ограничения и технические ошибки.

Если отслеживание собственного домена не было настроено, нельзя задним числом объявлять точный Citation Rate, даже если в просмотренных источниках URL не встретился.

Почему повторяемость важнее красивого отчёта

Один удачный ответ нельзя превратить в устойчивый показатель. Сохранённый протокол позволяет повторить запуск и увидеть, сохранился ли сигнал без изменения условий.

Повторяемость в генеративной среде не означает одинаковый текст слово в слово. Сравниваются события: появился ли бренд, был ли рекомендован, показана ли ссылка, сохранился ли конкурент и осталось ли описание корректным.

Как проверять качество среза

  1. Сверить ожидаемое и валидное число ответов.
  2. Отделить ошибки, блокировки и пустые результаты.
  3. Проверить одинаковое применение определений.
  4. Нормализовать варианты написания брендов.
  5. Открыть исходные ответы для неоднозначных случаев.
  6. Пересчитать несколько агрегатов вручную.
  7. Зафиксировать версию методики и банка запросов.

Как интерпретировать изменение

Рост упоминаний после публикации страницы является наблюдаемым совпадением. Для более сильного вывода нужны подтверждённая доступность страницы, несколько запусков, стабильность сигнала и по возможности контроль. Появление цитаты, упоминания, перехода и лида остаётся разными этапами.

Практическое продолжение — методология Киберкошки с формулами и реальный baseline, где три сопоставимых дорелизных запуска отделены от первых нестабильных послерелизных сигналов.

Made on
Tilda