Блог

Метрики для галочки против качественной обратной связи: где реальная отдача

~10 мин чтения
Метрики для галочки против качественной обратной связи: где реальная отдача

Сценарий: два отчёта об одном и том же продукте

Совет директоров небольшого стартапа. На экране два документа об одном приложении за один и тот же месяц.

Документ А, подготовленный маркетингом:

  • Установки: 18 400 (+42 % к прошлому месяцу)
  • Всего зарегистрированных пользователей: 61 200
  • Средний рейтинг в сторе: 4,3
  • MAU: 9 100
  • Просмотров страницы в сторе: 96 000
  • Подписчиков в соцсетях: 11 300

Документ Б, подготовленный продактом:

  • Из 45 новых пользователей, прошедших сценарий покупки, 19 остановились на экране выбора способа оплаты, потому что не нашли СБП, который ожидали увидеть первым
  • 14 человек написали, что не поняли, чем платный тариф отличается от бесплатного, при этом 11 из них прочитали экран тарифов до конца
  • Формулировка «Подключить расширенный доступ» была понята как «оформить пробный период» у 8 человек из 45
  • Конверсия из просмотра тарифов в оплату: 4,1 %, при этом 71 % отвала происходит на одном экране
  • После правки текста тарифов в тестовой волне конверсия на том же экране выросла до 9,8 %

Документ А выглядит солиднее. В нём большие числа и проценты роста. Документ Б выглядит как жалобы.

Но задайте вопрос: какой из двух документов говорит, что делать в понедельник?

Из документа А не следует ни одного действия. Из документа Б следуют три правки, одна из которых уже проверена и удваивает конверсию.

Эта статья — о том, как отличать метрики для галочки от метрик для решений, и почему качественная обратная связь даёт отдачу там, где дашборд только фиксирует состояние.

Определение: что делает метрику «для галочки»

Метрика для галочки (vanity metric) — не та, которая большая или красивая. Это метрика, у которой отсутствует связь с действием.

Проверка в три вопроса. Если метрика изменилась в худшую сторону:

  1. Знаю ли я, что именно изменить? Если нет — метрика не действенная.
  2. Могу ли я проверить, помогла ли правка? Если метрика слишком инерционна или зашумлена — она не годится для цикла обратной связи.
  3. Изменится ли моё решение в зависимости от её значения? Если я всё равно сделаю то же самое — метрика декоративная.

Прогоним по этому тесту «общее число зарегистрированных пользователей — 61 200». Упало? Не может упасть, это накопительный счётчик. Выросло? Хорошо, но непонятно, за счёт чего. Решение меняется? Нет. Метрика декоративная — она полезна только как иллюстрация масштаба.

Теперь «конверсия из просмотра тарифов в оплату — 4,1 %». Упала? Смотрю, на каком экране растёт отвал. Правку проверяю на следующей волне. Решение зависит напрямую. Метрика действенная.

МетрикаДейственная?Почему
Всего зарегистрированоНетНакопительный счётчик, не может упасть
Установки за месяцЧастичноГоворит об объёме, не о продукте
Средний рейтинг в стореСлабоИнерционен, агрегирует месяцы, не указывает причину
MAUЧастичноПолезен как масштаб, не как диагностика
Просмотры страницы в стореЧастичноПолезен в связке с конверсией в установку
Подписчики в соцсетяхНетНе связано с продуктом
Retention D1 / D7 по когортамДаРеагирует на правки, сравнима между когортами
Конверсия в первое ключевое действиеДаПрямо связана с онбордингом
Отвал на конкретном экранеДаУказывает на место работы
Доля сессий с ошибкойДаТехнический приоритет
Частотность конкретной проблемы в отчётахДаУказывает и место, и причину

Как отличить метрику для галочки от метрики, ведущей к действию
Как отличить метрику для галочки от метрики, ведущей к действию

Почему даже хорошие количественные метрики недостаточны

Retention D1 — хорошая метрика. Она действенная, она сравнима, она реагирует на изменения. Но у неё есть фундаментальный предел: она говорит, что стало, но никогда не говорит, почему.

Представим: retention D1 упал с 31 % до 24 % после релиза. Метрика сработала как сигнализация — вы узнали о проблеме. Что дальше?

Дальше начинается перебор гипотез: новая версия онбординга, изменение в запросе разрешений, замедление загрузки, баг на определённых устройствах, сезонность, смена источника трафика. Каждую нужно проверить, и на это уходят недели.

Качественная обратная связь работает иначе: она не сигнализирует, а объясняет. 20 отчётов после релиза дадут вам не «retention упал», а «11 из 20 человек написали, что после обновления не нашли кнопку добавления — она переехала в другое меню».

Количественные метрики
Качественная обратная связь
Отвечают: что и насколько
Отвечают: почему и как именно
Работают как сигнализация
Работают как диагностика
Нужна выборка в тысячах
Достаточно 20–50 человек
Измеряют результат
Объясняют механизм
Не различают «не смог» и «не захотел»
Различают явно
Дают приоритет по масштабу
Дают приоритет по причине
Инерционны: неделя-две на сигнал
Быстры: 2–3 дня на волну
Дёшевы при наличии трафика
Стоят денег, но не требуют трафика

Последняя строка объясняет, почему у молодых продуктов качественный подход обязателен: количественные метрики требуют объёма, которого у вас ещё нет. При 200 установках в месяц retention D7 — это шум. Отвечать на вопросы о продукте приходится другим способом.

Матрица: какой метрике какой вопрос задавать

Ошибка не в том, что команды смотрят на количественные метрики. Ошибка в том, что они задают им вопросы, на которые те не могут ответить.

ВопросПравильный инструментНеправильный инструмент
Сколько людей затронуто проблемой?Аналитика, когортыОтчёты (малая выборка)
Почему люди уходят с экрана X?Отчёты по сценариюRetention, воронка
Какой вариант экрана конвертирует лучше?A/B-тест на объёмеОтчёты (нет статистики)
Понятна ли ценность продукта?Отчёты, шаг «первое впечатление»Метрики (не измеряют понимание)
Работает ли оплата на всех устройствах?Отчёты с матрицей устройствАналитика (мало данных по редким моделям)
Сходится ли экономика привлечения?Аналитика + рекламные данныеОтчёты
Стало ли лучше после правки?Отчёты (быстро) + метрики (подтверждение)Только одно из двух
Как люди называют нашу функцию?Отчёты, цитатыМетрики
Какие устройства приоритетны?Аналитика по распределениюОтчёты

Обратите внимание: инструменты не конкурируют, а отвечают на разные классы вопросов. Правильная связка выглядит так: аналитика показывает, где болит и насколько сильно → отчёты объясняют, почему именно → правка → отчёты подтверждают, что причина устранена → аналитика подтверждает, что это повлияло на масштабе.

Отдача от качественной обратной связи: считаем на сценарии

Вернёмся к документу Б. Возьмём одну находку: 19 из 45 остановились на экране оплаты из-за отсутствия ожидаемого способа платежа, и после правки конверсия выросла с 4,1 % до 9,8 %.

Стоимость получения находки. Волна 45 прохождений: 99 ₽ × 45 × 1,15 = 5 123 ₽. Плюс повторная волна на 25 для проверки правки: 2 846 ₽. Итого 7 969 ₽.

Эффект. Допустим, в месяц экран тарифов просматривают 3 000 человек, средний чек подписки 490 ₽.

  • До правки: 3 000 × 4,1 % = 123 оплаты → 60 270 ₽
  • После правки: 3 000 × 9,8 % = 294 оплаты → 144 060 ₽
  • Прирост: 83 790 ₽ в месяц

Вложено 7 969 ₽ единоразово, получено 83 790 ₽ ежемесячно. Это не типичный результат каждой волны — иногда находки мелкие. Но принцип устойчив: правка, найденная в качественном исследовании, действует на весь будущий поток пользователей.

Теперь сравним с типичным «улучшением метрики для галочки». Команда потратила те же 8 000 ₽ на продвижение в соцсетях, получила 400 новых подписчиков. Прирост выручки: неизвестен, вероятно близок к нулю. Метрика в документе А стала красивее.

Сравнение

Наведите / нажмите столбец — значение

Ловушка средних значений и агрегатов

Отдельно про рейтинг 4,3 из документа А. Это агрегат за всю историю приложения. Что он скрывает:

  • Распределение: 4,3 может быть «много четвёрок и пятёрок» или «половина пятёрок и четверть единиц». Это принципиально разные ситуации.
  • Динамику: свежие отзывы могут быть намного хуже средних, но средний почти не двигается из-за накопленной массы.
  • Причины: даже прочитав все отзывы, вы получите эмоции, а не шаги воспроизведения.

То же с «MAU 9 100». Внутри могут быть 8 000 человек, открывающих приложение раз в месяц по уведомлению, и 1 100, использующих его ежедневно. Это два разных продукта в одной цифре.

Практическое правило: любой агрегат нужно уметь разложить, иначе он декоративен.

АгрегатЧем заменить или дополнить
Средний рейтингРаспределение оценок + рейтинг последних 30 дней
MAUDAU/MAU, распределение частоты использования
Среднее время сессииМедиана и перцентили, разбивка по типам сессий
Общее число пользователейАктивные по когортам установки
Средний чекРаспределение по тарифам, доля первой покупки
«Пользователям нравится»Частотность конкретных формулировок в отчётах

Как собрать рабочий набор метрик: практика

Рабочая система для продукта на ранней стадии — небольшая. Шесть-восемь показателей плюс постоянный поток качественной обратной связи.

Блок здоровья продукта (3 метрики).

Crash-free сессии. Доля сессий с ошибкой API. Время до первого экрана. Всё техническое, всё действенное.

Блок входа (2 метрики).

Конверсия из установки в первое ключевое действие. Retention D1 по когортам. Именно здесь живёт большинство потерь у молодых продуктов.

Блок ценности (2 метрики).

Retention D7 или D30 по когортам. Частота выполнения ключевого действия у вернувшихся. Отвечают на вопрос, нужен ли продукт вообще.

Блок денег (1–2 метрики).

Конверсия в оплату. Доля продлений, если есть подписка.

Постоянный качественный контур.

Волна тестов после каждого значимого изменения входного потока; волна перед каждым релизом; повторная волна тем же чек-листом после правок. Плюс регулярное чтение свежих отзывов и обращений в поддержку — не для рейтинга, а как источник формулировок.

Всё, что не попало в этот список, — для презентаций, а не для работы. Показывать установки и MAU инвестору нормально: они описывают масштаб. Принимать по ним продуктовые решения — нет.

Сравнение

Наведите / нажмите столбец — значение

Типичные разговоры и как их разворачивать

«У нас рейтинг 4,3, значит продукт нравится».

Разворот: посмотрите распределение и последние 30 дней. Затем возьмите 20 отчётов по ключевому сценарию и сравните: то, что люди пишут в стор, и то, что они описывают при прохождении, обычно различается радикально. В стор пишут эмоцию, в отчёте — шаги.

«Нам нужно больше установок, тогда метрики выправятся».

Разворот: если конверсия в ключевое действие 29 %, то удвоение установок удваивает и число людей, которые не дошли. Проблема не в числителе.

«Давайте сначала вырастим, потом займёмся качеством».

Разворот: стоимость исправления растёт с масштабом. Проблема, найденная на 45 тестах, стоит часа работы. Та же проблема при 50 000 пользователей — это хотфикс, работа поддержки и испорченный рейтинг.

«Отчёты — это всего 45 человек, не выборка».

Разворот: верно, для статистики мало. Но задача отчётов — не оценить долю, а найти причину. Причину находят на 8–10 людях; 45 нужны для оценки частотности и покрытия устройств. Долю посчитает аналитика, когда вы уже будете знать, что искать.

«Инвестор смотрит на установки».

Разворот: показывайте и установки, и конверсию в ключевое действие, и список устранённых причин с подтверждением. Второе и третье сильнее: они демонстрируют, что команда умеет находить и устранять проблемы, а не только тратить бюджет.

Retention D1 упал с 31 % до 24 % после релиза. Что сделать первым шагом?

FAQ

Значит, установки и MAU не нужно измерять вообще?

Нужно — как описание масштаба и для отчётности. Проблема начинается, когда по ним пытаются принимать продуктовые решения или когда их рост считают доказательством качества.

Сколько качественной обратной связи достаточно?

Ориентир для ранней стадии: волна 25–45 прохождений после каждого значимого изменения входного потока и перед каждым релизом. Это примерно 3–6 тысяч рублей на волну и два-три дня.

Можно ли заменить отчёты чтением отзывов в сторе?

Частично. Отзывы бесплатны, но они смещены к крайним эмоциям, приходят с задержкой, редко содержат шаги воспроизведения и почти никогда не описывают путь. Как дополнение — да, как основной источник — нет.

Что делать, если качественные находки противоречат метрикам?

Обычно противоречия нет, есть разный уровень наблюдения. Если метрика говорит «всё хорошо», а отчёты — «люди не понимают ценность», проверьте, не смотрите ли вы на агрегат, который скрывает распределение, и не измеряет ли метрика факт вместо смысла (открытие приложения вместо нахождения своей коллекции).

Как убедить команду перестать хвастаться накопительными счётчиками?

Введите правило: в любом отчёте рядом с числом должна стоять строка «какое решение из этого следует». Пустая строка — метрика уходит из отчёта в приложение.

Нужны ли качественные исследования зрелому продукту?

Да, и даже больше: у зрелого продукта каждое изменение затрагивает больше людей, а цена ошибки выше. Меняется только пропорция — больше A/B-тестов на объёме, но объяснять результаты всё равно нужно качественно.

Итоги

  • Метрика для галочки — не та, которая большая, а та, из изменения которой не следует действия. Проверка: знаю ли что менять, могу ли проверить правку, изменится ли решение.
  • Даже хорошие количественные метрики отвечают «что и насколько», но никогда «почему». Retention — сигнализация, не диагностика.
  • Качественная обратная связь даёт причину за 2–3 дня на выборке 20–50 человек, тогда как перебор гипотез по аналитике занимает недели.
  • Правильная связка: аналитика находит место и масштаб → отчёты объясняют причину → правка → отчёты подтверждают → метрики подтверждают на масштабе.
  • Любой агрегат нужно уметь разложить, иначе он декоративен: средний рейтинг, MAU и среднее время сессии скрывают распределения.
  • Отдача от качественной находки действует на весь будущий поток пользователей, поэтому единоразовые 8 000 ₽ могут давать эффект в десятки тысяч ежемесячно.

Заключение

Совет директоров в том сценарии закончился неожиданно: попросили объединить оба документа, но поставить документ Б первым, а документ А вынести в приложение как «контекст масштаба».

Это правильный порядок. Большие числа описывают, где вы находитесь. Качественная обратная связь описывает, куда двигаться. Первое интересно наблюдать, второе можно сделать в понедельник.

← Все статьиПопробовать Manica