Четыре уровня контроля
- Постановка задачи: какой выбор пользователя исследуется.
- Дизайн выборки: какие запросы и AI-системы входят в проверку.
- Качество запуска: сколько ответов валидно и какие ошибки возникли.
- Интерпретация: что наблюдалось и какие причины ещё нужно проверить.
Сначала определить единицу наблюдения
В Киберкошке базовая единица — один промпт × одна AI-система × один запуск × одна дата. Режим поиска, язык, рынок и аккаунт также фиксируются, если меняют условия. Это позволяет понять, из чего сложился знаменатель.
Например, 10 запросов в пяти системах дают 50 ожидаемых ответов. Если три ответа технически не получены, отчёт должен показать 47 валидных ответов и полноту запуска 47 / 50, а не молча записать три отсутствия бренда.
Как строится prompt bank
| Группа | Назначение | Пример |
|---|---|---|
| Core небрендовая | проверить присутствие в категории без подсказки | «Как отслеживать рекомендации бренда в нейросетях?» |
| Брендовая | проверить знание и точность описания | «Что такое Киберкошка и кому принадлежит?» |
| Контрольная | наблюдать общий фон без целевых изменений | заранее выбранный соседний вопрос |
| Исследовательская | проверить новую тему или формулировку | новый сценарий, не входящий в основной процент |
Core-набор сохраняется между периодами. Если новый вопрос важен, его можно добавить в следующую версию банка, но граница версии должна быть видна в отчёте.
Какие знаменатели не смешивать
- Mention Rate считается по валидным ответам.
- Query Coverage считается по запросам утверждённого банка.
- Model Coverage считается по проверенным AI-системам.
- Stability считается по сопоставимым повторным запускам одной пары.
- Citation Rate требует заранее определённого домена или списка URL.
Одинаковое значение 20% может описывать совершенно разные события. Поэтому рядом с процентом всегда показываются абсолютные числа и название метрики.
Что входит в baseline
Baseline — это не только итоговый процент. Минимальная фиксация включает:
- версию prompt bank;
- рынок, язык и временное окно;
- список систем и режимов;
- ожидаемое и валидное число ответов;
- исходные тексты;
- правила разметки;
- агрегаты с числителем и знаменателем;
- известные ограничения и технические ошибки.
Если отслеживание собственного домена не было настроено, нельзя задним числом объявлять точный Citation Rate, даже если в просмотренных источниках URL не встретился.
Почему повторяемость важнее красивого отчёта
Один удачный ответ нельзя превратить в устойчивый показатель. Сохранённый протокол позволяет повторить запуск и увидеть, сохранился ли сигнал без изменения условий.
Повторяемость в генеративной среде не означает одинаковый текст слово в слово. Сравниваются события: появился ли бренд, был ли рекомендован, показана ли ссылка, сохранился ли конкурент и осталось ли описание корректным.
Как проверять качество среза
- Сверить ожидаемое и валидное число ответов.
- Отделить ошибки, блокировки и пустые результаты.
- Проверить одинаковое применение определений.
- Нормализовать варианты написания брендов.
- Открыть исходные ответы для неоднозначных случаев.
- Пересчитать несколько агрегатов вручную.
- Зафиксировать версию методики и банка запросов.
Как интерпретировать изменение
Рост упоминаний после публикации страницы является наблюдаемым совпадением. Для более сильного вывода нужны подтверждённая доступность страницы, несколько запусков, стабильность сигнала и по возможности контроль. Появление цитаты, упоминания, перехода и лида остаётся разными этапами.
Практическое продолжение — методология Киберкошки с формулами и реальный baseline, где три сопоставимых дорелизных запуска отделены от первых нестабильных послерелизных сигналов.

