Метрики для галочки против качественной обратной связи: где реальная отдача

Сценарий: два отчёта об одном и том же продукте
Совет директоров небольшого стартапа. На экране два документа об одном приложении за один и тот же месяц.
Документ А, подготовленный маркетингом:
- Установки: 18 400 (+42 % к прошлому месяцу)
- Всего зарегистрированных пользователей: 61 200
- Средний рейтинг в сторе: 4,3
- MAU: 9 100
- Просмотров страницы в сторе: 96 000
- Подписчиков в соцсетях: 11 300
Документ Б, подготовленный продактом:
- Из 45 новых пользователей, прошедших сценарий покупки, 19 остановились на экране выбора способа оплаты, потому что не нашли СБП, который ожидали увидеть первым
- 14 человек написали, что не поняли, чем платный тариф отличается от бесплатного, при этом 11 из них прочитали экран тарифов до конца
- Формулировка «Подключить расширенный доступ» была понята как «оформить пробный период» у 8 человек из 45
- Конверсия из просмотра тарифов в оплату: 4,1 %, при этом 71 % отвала происходит на одном экране
- После правки текста тарифов в тестовой волне конверсия на том же экране выросла до 9,8 %
Документ А выглядит солиднее. В нём большие числа и проценты роста. Документ Б выглядит как жалобы.
Но задайте вопрос: какой из двух документов говорит, что делать в понедельник?
Из документа А не следует ни одного действия. Из документа Б следуют три правки, одна из которых уже проверена и удваивает конверсию.
Эта статья — о том, как отличать метрики для галочки от метрик для решений, и почему качественная обратная связь даёт отдачу там, где дашборд только фиксирует состояние.
Определение: что делает метрику «для галочки»
Метрика для галочки (vanity metric) — не та, которая большая или красивая. Это метрика, у которой отсутствует связь с действием.
Проверка в три вопроса. Если метрика изменилась в худшую сторону:
- Знаю ли я, что именно изменить? Если нет — метрика не действенная.
- Могу ли я проверить, помогла ли правка? Если метрика слишком инерционна или зашумлена — она не годится для цикла обратной связи.
- Изменится ли моё решение в зависимости от её значения? Если я всё равно сделаю то же самое — метрика декоративная.
Прогоним по этому тесту «общее число зарегистрированных пользователей — 61 200». Упало? Не может упасть, это накопительный счётчик. Выросло? Хорошо, но непонятно, за счёт чего. Решение меняется? Нет. Метрика декоративная — она полезна только как иллюстрация масштаба.
Теперь «конверсия из просмотра тарифов в оплату — 4,1 %». Упала? Смотрю, на каком экране растёт отвал. Правку проверяю на следующей волне. Решение зависит напрямую. Метрика действенная.
| Метрика | Действенная? | Почему |
|---|---|---|
| Всего зарегистрировано | Нет | Накопительный счётчик, не может упасть |
| Установки за месяц | Частично | Говорит об объёме, не о продукте |
| Средний рейтинг в сторе | Слабо | Инерционен, агрегирует месяцы, не указывает причину |
| MAU | Частично | Полезен как масштаб, не как диагностика |
| Просмотры страницы в сторе | Частично | Полезен в связке с конверсией в установку |
| Подписчики в соцсетях | Нет | Не связано с продуктом |
| Retention D1 / D7 по когортам | Да | Реагирует на правки, сравнима между когортами |
| Конверсия в первое ключевое действие | Да | Прямо связана с онбордингом |
| Отвал на конкретном экране | Да | Указывает на место работы |
| Доля сессий с ошибкой | Да | Технический приоритет |
| Частотность конкретной проблемы в отчётах | Да | Указывает и место, и причину |

Почему даже хорошие количественные метрики недостаточны
Retention D1 — хорошая метрика. Она действенная, она сравнима, она реагирует на изменения. Но у неё есть фундаментальный предел: она говорит, что стало, но никогда не говорит, почему.
Представим: retention D1 упал с 31 % до 24 % после релиза. Метрика сработала как сигнализация — вы узнали о проблеме. Что дальше?
Дальше начинается перебор гипотез: новая версия онбординга, изменение в запросе разрешений, замедление загрузки, баг на определённых устройствах, сезонность, смена источника трафика. Каждую нужно проверить, и на это уходят недели.
Качественная обратная связь работает иначе: она не сигнализирует, а объясняет. 20 отчётов после релиза дадут вам не «retention упал», а «11 из 20 человек написали, что после обновления не нашли кнопку добавления — она переехала в другое меню».
Последняя строка объясняет, почему у молодых продуктов качественный подход обязателен: количественные метрики требуют объёма, которого у вас ещё нет. При 200 установках в месяц retention D7 — это шум. Отвечать на вопросы о продукте приходится другим способом.
Матрица: какой метрике какой вопрос задавать
Ошибка не в том, что команды смотрят на количественные метрики. Ошибка в том, что они задают им вопросы, на которые те не могут ответить.
| Вопрос | Правильный инструмент | Неправильный инструмент |
|---|---|---|
| Сколько людей затронуто проблемой? | Аналитика, когорты | Отчёты (малая выборка) |
| Почему люди уходят с экрана X? | Отчёты по сценарию | Retention, воронка |
| Какой вариант экрана конвертирует лучше? | A/B-тест на объёме | Отчёты (нет статистики) |
| Понятна ли ценность продукта? | Отчёты, шаг «первое впечатление» | Метрики (не измеряют понимание) |
| Работает ли оплата на всех устройствах? | Отчёты с матрицей устройств | Аналитика (мало данных по редким моделям) |
| Сходится ли экономика привлечения? | Аналитика + рекламные данные | Отчёты |
| Стало ли лучше после правки? | Отчёты (быстро) + метрики (подтверждение) | Только одно из двух |
| Как люди называют нашу функцию? | Отчёты, цитаты | Метрики |
| Какие устройства приоритетны? | Аналитика по распределению | Отчёты |
Обратите внимание: инструменты не конкурируют, а отвечают на разные классы вопросов. Правильная связка выглядит так: аналитика показывает, где болит и насколько сильно → отчёты объясняют, почему именно → правка → отчёты подтверждают, что причина устранена → аналитика подтверждает, что это повлияло на масштабе.
Отдача от качественной обратной связи: считаем на сценарии
Вернёмся к документу Б. Возьмём одну находку: 19 из 45 остановились на экране оплаты из-за отсутствия ожидаемого способа платежа, и после правки конверсия выросла с 4,1 % до 9,8 %.
Стоимость получения находки. Волна 45 прохождений: 99 ₽ × 45 × 1,15 = 5 123 ₽. Плюс повторная волна на 25 для проверки правки: 2 846 ₽. Итого 7 969 ₽.
Эффект. Допустим, в месяц экран тарифов просматривают 3 000 человек, средний чек подписки 490 ₽.
- До правки: 3 000 × 4,1 % = 123 оплаты → 60 270 ₽
- После правки: 3 000 × 9,8 % = 294 оплаты → 144 060 ₽
- Прирост: 83 790 ₽ в месяц
Вложено 7 969 ₽ единоразово, получено 83 790 ₽ ежемесячно. Это не типичный результат каждой волны — иногда находки мелкие. Но принцип устойчив: правка, найденная в качественном исследовании, действует на весь будущий поток пользователей.
Теперь сравним с типичным «улучшением метрики для галочки». Команда потратила те же 8 000 ₽ на продвижение в соцсетях, получила 400 новых подписчиков. Прирост выручки: неизвестен, вероятно близок к нулю. Метрика в документе А стала красивее.
Наведите / нажмите столбец — значение
Ловушка средних значений и агрегатов
Отдельно про рейтинг 4,3 из документа А. Это агрегат за всю историю приложения. Что он скрывает:
- Распределение: 4,3 может быть «много четвёрок и пятёрок» или «половина пятёрок и четверть единиц». Это принципиально разные ситуации.
- Динамику: свежие отзывы могут быть намного хуже средних, но средний почти не двигается из-за накопленной массы.
- Причины: даже прочитав все отзывы, вы получите эмоции, а не шаги воспроизведения.
То же с «MAU 9 100». Внутри могут быть 8 000 человек, открывающих приложение раз в месяц по уведомлению, и 1 100, использующих его ежедневно. Это два разных продукта в одной цифре.
Практическое правило: любой агрегат нужно уметь разложить, иначе он декоративен.
| Агрегат | Чем заменить или дополнить |
|---|---|
| Средний рейтинг | Распределение оценок + рейтинг последних 30 дней |
| MAU | DAU/MAU, распределение частоты использования |
| Среднее время сессии | Медиана и перцентили, разбивка по типам сессий |
| Общее число пользователей | Активные по когортам установки |
| Средний чек | Распределение по тарифам, доля первой покупки |
| «Пользователям нравится» | Частотность конкретных формулировок в отчётах |
Как собрать рабочий набор метрик: практика
Рабочая система для продукта на ранней стадии — небольшая. Шесть-восемь показателей плюс постоянный поток качественной обратной связи.
Блок здоровья продукта (3 метрики).
Crash-free сессии. Доля сессий с ошибкой API. Время до первого экрана. Всё техническое, всё действенное.
Блок входа (2 метрики).
Конверсия из установки в первое ключевое действие. Retention D1 по когортам. Именно здесь живёт большинство потерь у молодых продуктов.
Блок ценности (2 метрики).
Retention D7 или D30 по когортам. Частота выполнения ключевого действия у вернувшихся. Отвечают на вопрос, нужен ли продукт вообще.
Блок денег (1–2 метрики).
Конверсия в оплату. Доля продлений, если есть подписка.
Постоянный качественный контур.
Волна тестов после каждого значимого изменения входного потока; волна перед каждым релизом; повторная волна тем же чек-листом после правок. Плюс регулярное чтение свежих отзывов и обращений в поддержку — не для рейтинга, а как источник формулировок.
Всё, что не попало в этот список, — для презентаций, а не для работы. Показывать установки и MAU инвестору нормально: они описывают масштаб. Принимать по ним продуктовые решения — нет.
Наведите / нажмите столбец — значение
Типичные разговоры и как их разворачивать
«У нас рейтинг 4,3, значит продукт нравится».
Разворот: посмотрите распределение и последние 30 дней. Затем возьмите 20 отчётов по ключевому сценарию и сравните: то, что люди пишут в стор, и то, что они описывают при прохождении, обычно различается радикально. В стор пишут эмоцию, в отчёте — шаги.
«Нам нужно больше установок, тогда метрики выправятся».
Разворот: если конверсия в ключевое действие 29 %, то удвоение установок удваивает и число людей, которые не дошли. Проблема не в числителе.
«Давайте сначала вырастим, потом займёмся качеством».
Разворот: стоимость исправления растёт с масштабом. Проблема, найденная на 45 тестах, стоит часа работы. Та же проблема при 50 000 пользователей — это хотфикс, работа поддержки и испорченный рейтинг.
«Отчёты — это всего 45 человек, не выборка».
Разворот: верно, для статистики мало. Но задача отчётов — не оценить долю, а найти причину. Причину находят на 8–10 людях; 45 нужны для оценки частотности и покрытия устройств. Долю посчитает аналитика, когда вы уже будете знать, что искать.
«Инвестор смотрит на установки».
Разворот: показывайте и установки, и конверсию в ключевое действие, и список устранённых причин с подтверждением. Второе и третье сильнее: они демонстрируют, что команда умеет находить и устранять проблемы, а не только тратить бюджет.
FAQ
Значит, установки и MAU не нужно измерять вообще?
Нужно — как описание масштаба и для отчётности. Проблема начинается, когда по ним пытаются принимать продуктовые решения или когда их рост считают доказательством качества.
Сколько качественной обратной связи достаточно?
Ориентир для ранней стадии: волна 25–45 прохождений после каждого значимого изменения входного потока и перед каждым релизом. Это примерно 3–6 тысяч рублей на волну и два-три дня.
Можно ли заменить отчёты чтением отзывов в сторе?
Частично. Отзывы бесплатны, но они смещены к крайним эмоциям, приходят с задержкой, редко содержат шаги воспроизведения и почти никогда не описывают путь. Как дополнение — да, как основной источник — нет.
Что делать, если качественные находки противоречат метрикам?
Обычно противоречия нет, есть разный уровень наблюдения. Если метрика говорит «всё хорошо», а отчёты — «люди не понимают ценность», проверьте, не смотрите ли вы на агрегат, который скрывает распределение, и не измеряет ли метрика факт вместо смысла (открытие приложения вместо нахождения своей коллекции).
Как убедить команду перестать хвастаться накопительными счётчиками?
Введите правило: в любом отчёте рядом с числом должна стоять строка «какое решение из этого следует». Пустая строка — метрика уходит из отчёта в приложение.
Нужны ли качественные исследования зрелому продукту?
Да, и даже больше: у зрелого продукта каждое изменение затрагивает больше людей, а цена ошибки выше. Меняется только пропорция — больше A/B-тестов на объёме, но объяснять результаты всё равно нужно качественно.
Итоги
- Метрика для галочки — не та, которая большая, а та, из изменения которой не следует действия. Проверка: знаю ли что менять, могу ли проверить правку, изменится ли решение.
- Даже хорошие количественные метрики отвечают «что и насколько», но никогда «почему». Retention — сигнализация, не диагностика.
- Качественная обратная связь даёт причину за 2–3 дня на выборке 20–50 человек, тогда как перебор гипотез по аналитике занимает недели.
- Правильная связка: аналитика находит место и масштаб → отчёты объясняют причину → правка → отчёты подтверждают → метрики подтверждают на масштабе.
- Любой агрегат нужно уметь разложить, иначе он декоративен: средний рейтинг, MAU и среднее время сессии скрывают распределения.
- Отдача от качественной находки действует на весь будущий поток пользователей, поэтому единоразовые 8 000 ₽ могут давать эффект в десятки тысяч ежемесячно.
Заключение
Совет директоров в том сценарии закончился неожиданно: попросили объединить оба документа, но поставить документ Б первым, а документ А вынести в приложение как «контекст масштаба».
Это правильный порядок. Большие числа описывают, где вы находитесь. Качественная обратная связь описывает, куда двигаться. Первое интересно наблюдать, второе можно сделать в понедельник.
