Фейковые установки против отчётов тестировщиков: что происходит с метриками

Сценарий: две команды, один бюджет, разные решения
Два приложения вышли в один месяц. Оба — сервисы доставки продуктов в средних городах. Оба с бюджетом 60 000 ₽ на «раскачку». Оба под давлением: инвестор попросил показать динамику к концу квартала.
Команда А решила, что главное — цифры на дашборде. Они нашли подрядчика, который обещал «трафик с реальных устройств», и купили пакет установок. Логика: больше установок → выше позиция в сторе → больше органики → инвестор доволен.
Команда Б решила, что главное — понять, почему из первых 200 органических установок заказ сделали 11 человек. Они запустили кампанию честного тестирования по сценариям: 40 человек проходят путь от установки до оформления заказа и пишут отчёты.
Дальше — что произошло с метриками у каждой через неделю, через месяц и через квартал. Это не моральная притча: мы разберём механику, по которой фейковые установки технически ломают систему принятия решений. Статья не объясняет, как покупать такой трафик, и не рассматривает манипуляцию рейтингами как допустимую тактику — она объясняет, что именно ломается и как это выглядит в цифрах.
Неделя 1: дашборд Команды А выглядит лучше
Через семь дней у Команды А в аналитике 4 300 установок. У Команды Б — 240 органических плюс 40 тестовых прохождений.
Если смотреть только на график установок, А выигрывает с огромным отрывом. Инвестор видит кривую вверх. Внутри команды — эйфория.
Но посмотрим на второй слой метрик.
| Метрика, неделя 1 | Команда А (купленный поток) | Команда Б (честные тесты) |
|---|---|---|
| Установки | 4 300 | 240 |
| Открыли приложение | 3 900 | 232 |
| Дошли до каталога | 2 100 | 198 |
| Добавили товар в корзину | 180 | 96 |
| Оформили заказ | 12 | 21 |
| Retention D1 | 6 % | 27 % |
| Отчётов с описанием проблем | 0 | 34 |
| Средняя длина сессии | 34 сек | 4 мин 12 сек |
Обратите внимание на строку «оформили заказ»: у Команды А при 18-кратном объёме установок — меньше реальных заказов. И ноль информации о том, почему.
Ещё важнее retention D1 = 6 %. Эта цифра теперь в вашей исторической базе навсегда. Все последующие сравнения «как было / как стало» будут опираться на искажённый базис.
Что технически происходит с аналитикой
Аналитическая система не знает, что часть пользователей ненастоящая. Она честно усредняет всё, что получила. Последствия распределяются по нескольким уровням.
1. Когорты становятся нечитаемыми. Retention считается по когортам установки. Если 90 % когорты — пустышки, то retention когорты не описывает поведение никого: ни реальных пользователей (их сигнал утоплен), ни фейковых (у них нет поведения).
2. Средние значения теряют смысл. Средняя длина сессии 34 секунды — это не «пользователи быстро уходят». Это среднее между «открыл и закрыл» и «пользовался 8 минут». Медиана и перцентили спасают частично, но только если вы знаете, что нужно их смотреть — а вы не знаете, потому что не различаете источники.
3. Воронка показывает ложные узкие места. У Команды А отвал между «каталог» и «корзина» составил 91 %. Команда потратила две недели на переделку каталога. Настоящая проблема была на шаге выбора адреса доставки — но до него доходило слишком мало реальных людей, чтобы это стало заметно в графике.
4. A/B-тесты перестают работать. Если в обе группы попадает шум, разница между вариантами размывается. Тест, который раньше показал бы эффект за неделю, теперь не покажет его никогда: мощность теста убита дисперсией мусора.
5. Алгоритмы рекламных кабинетов учатся на мусоре. Если вы передаёте события в рекламные системы для оптимизации, а часть событий не соответствует реальному поведению, вы буквально описываете алгоритму профиль «идеального пользователя», который ничего не покупает. Он найдёт вам ещё таких же.
Наведите / нажмите столбец — значение

Месяц 1: расхождение становится очевидным
Команда Б за месяц провела три волны тестов (40 + 25 + 25 = 90 прохождений) и внесла изменения:
- На шаге выбора адреса 19 из 40 тестировщиков не смогли найти свой дом, потому что поле требовало точного формата улицы. Переделали на подсказки при вводе.
- 12 человек написали, что не поняли, откуда берётся цена доставки. Добавили пояснение до оформления, а не после.
- 8 человек столкнулись с тем, что корзина очищалась при смене города. Исправили баг.
- 22 человека отметили, что время доставки становится видно только на последнем экране. Перенесли наверх.
Retention D1 по органическим пользователям вырос с 27 % до 38 %. Конверсия в первый заказ — с 8,7 % до 16,1 %.
Команда А за месяц:
- Позиция в категории поднялась на несколько мест, потом вернулась.
- Органика выросла незначительно — потому что алгоритмы сторов учитывают не только объём установок, но и удержание, вовлечённость, удаления. Пустые установки дают плохие сигналы качества.
- Реальных отзывов почти нет, а рейтинг начал падать: настоящие пользователи, приходящие из органики, натыкались на ту же проблему с адресом.
- Бюджет закончился. Понимания продукта — ноль.
| Итог месяца | Команда А | Команда Б |
|---|---|---|
| Потрачено | 60 000 ₽ | ≈ 10 260 ₽ (90 тестов с комиссией) |
| Найдено и исправлено проблем | 0 подтверждённых | 4 существенных |
| Конверсия в первый заказ | 0,3 % | 16,1 % |
| Retention D1 (реальные пользователи) | неизвестно | 38 % |
| Остаток бюджета на рекламу | 0 ₽ | ≈ 49 700 ₽ |
| Риск по правилам платформ | Высокий | Отсутствует |
| Доверие к внутренней аналитике | Подорвано | Сохранено |
Строка «остаток бюджета» — самая недооценённая. Команда Б не просто узнала больше. Она сохранила 83 % бюджета, который теперь можно потратить на рекламу уже работающего продукта.
Квартал: последствия, которые не видны сразу
К третьему месяцу у Команды А появились проблемы второго порядка.
Потеря доверия к цифрам внутри команды. Когда все знают, что часть трафика ненастоящая, любой спор упирается в «а это реальные данные или нет?». Аналитик перестаёт быть арбитром. Решения принимаются по авторитету, а не по фактам.
Невозможность сравнить периоды. Инвестор просит: покажите динамику retention за квартал. Но первый месяц — с искусственным трафиком, второй — частично, третий — чистый. Retention «вырос» с 6 % до 19 % не потому, что продукт улучшился, а потому, что мусор вымылся из когорт. Это не достижение, но выглядит как достижение — и команда рискует сделать ложный вывод о том, какие действия помогли.
Риск со стороны платформ. App Store Review Guidelines и Google Play Developer Program Policies прямо запрещают манипуляцию установками, рейтингами и отзывами. Платформы располагают собственными системами выявления аномалий: неестественные паттерны установок, кластеры устройств, несоответствие поведения нормальным распределениям, синхронные оценки. Санкции варьируются от обнуления рейтинговых сигналов до удаления приложения и блокировки аккаунта разработчика. Важно понимать: риск не исчезает со временем — он реализуется, когда платформа решит проверить, а не когда команда решит остановиться.
Испорченный маркетинговый фундамент. Модели похожих аудиторий, обученные на мусорных событиях, придётся обнулять и переобучать. Это месяцы работы.
Команда Б к третьему месяцу имеет базу из 140 отчётов, в которых зафиксировано, как менялось восприятие продукта. Это уникальный материал: тексты для страницы в сторе, формулировки для онбординга, список того, что было непонятно, и подтверждение, что стало понятно.
Как отличить честный тест от искусственной установки на уровне данных
Полезное упражнение — понять, чем отличается «пользователь, который действительно прошёл сценарий» от записи в логах, которая просто существует.
Честный тестовый прогон в данных выглядит так:
- Сессия длиной несколько минут с неравномерными интервалами между событиями (человек читает, думает, ищет).
- Наличие «ошибочных» траекторий: заход не туда, возврат назад, повторное нажатие. Живое поведение всегда содержит шум навигации.
- Разнообразие устройств и версий ОС, соответствующее реальному распределению рынка.
- Наличие текстового артефакта вне приложения — отчёта с описанием и скриншотами.
- Скриншот, который совпадает с состоянием, зафиксированным в логах по времени.
Искусственная установка выглядит иначе: короткая сессия или её отсутствие, слишком ровные интервалы, отсутствие ошибочных траекторий, кластеризация по устройствам и времени, полное отсутствие внешнего артефакта.
Ключевая мысль: отчёт — это внешнее доказательство, которое нельзя подделать так же дешёво, как событие в логе. Именно поэтому модель «оплата за принятый отчёт» устойчивее, чем модель «оплата за установку». Событие стоит копейки и не требует человека. Отчёт со скриншотами и описанием шагов требует, чтобы человек действительно прошёл путь.
| Признак | Честное прохождение | Искусственная установка |
|---|---|---|
| Длина сессии | Минуты, неравномерно | Секунды или ноль |
| Траектория | С возвратами и ошибками | Прямая или отсутствует |
| Внешний артефакт | Отчёт, скриншоты | Нет |
| Устройства | Разнообразные | Кластеры |
| Проверяемость | Автор принимает или отклоняет | Нечего проверять |
| Влияние на метрики | Улучшает понимание | Разрушает базис |
Механика модерации как антифрод-контур
На платформе вроде Manica защита от «пустой работы» встроена в сам процесс, а не приделана сбоку.
Чек-лист задаёт проверяемые требования. Если шаг требует скриншот экрана оплаты, отчёт без него нельзя принять.
Автор кампании модерирует вручную. Он смотрит на соответствие отчёта чек-листу и решает: принять или отклонить с указанием причины.
Оплата и комиссия начисляются только за принятые отчёты. Это меняет экономику для исполнителя: халтура не приносит денег, поэтому нет смысла ею заниматься. Сравните с моделью «оплата за факт установки», где халтура — единственная экономически рациональная стратегия.
Спорные случаи разбираются по формальным критериям. Именно поэтому критерии приёмки важно публиковать заранее: без них модерация становится произволом, и система теряет доверие с обеих сторон.
История отчётов накапливается. Исполнитель с длинной историей принятых работ — сам по себе сигнал качества.
Наведите / нажмите столбец — значение
Цифра для Команды А получена простым делением: 60 000 ₽ на 12 заказов. Она абсурдна, и это главный аргумент: покупка объёма не решала задачу, для которой её покупали.
Что делать, если искусственный трафик уже попал в данные
Ситуация встречается: команда пришла в проект, а в истории уже есть сомнительный период. Практические шаги:
- Найдите и задокументируйте границы периода. Даты начала и конца, источники, объём. Без этого дальше работать нельзя.
- Пометьте затронутые когорты флагом в аналитике. Не удаляйте — исключайте из расчётов осознанно, чтобы решение было воспроизводимым.
- Постройте новую базовую линию на чистом периоде. Минимум 4 недели без искусственного трафика.
- Пересчитайте ключевые метрики только по органическим и проверяемым источникам. Сравнивайте будущие результаты с новым базисом, а не с историческим.
- Обнулите и переобучите модели похожих аудиторий, если события уходили в рекламные системы.
- Напишите внутренний changelog методики. Через полгода никто не вспомнит, почему в дашборде разрыв, и появится соблазн «дорисовать» историю.
- Замените источник данных о качестве. Вместо объёма — отчёты по сценариям, которые дают причины и не загрязняют когорты.
Это неприятная, но конечная работа. Гораздо хуже — продолжать принимать решения по испорченным данным.
FAQ
Разве нельзя просто «разбавить» купленные установки реальными и смотреть на реальных отдельно?
Теоретически — если бы вы могли надёжно разделить источники. На практике атрибуция неидеальна, часть мусора попадёт в «органику», а средние по продукту всё равно будут искажены. Плюс остаётся риск со стороны платформы, который не зависит от вашей внутренней разметки.
А если цель не аналитика, а только позиция в сторе?
Алгоритмы сторов учитывают удержание, вовлечённость и удаления, а не только установки. Пустые установки дают отрицательные сигналы качества, поэтому эффект нестабилен и обычно краткосрочен. Плюс это прямое нарушение правил платформ.
Сколько честных тестов нужно, чтобы заменить «объём»?
Они решают другую задачу, поэтому не заменяют. Для поиска причин отвала достаточно 20–50 прохождений. Для оценки экономики нужен реальный рекламный трафик — но уже после того, как причины устранены.
Инвестор просит показать рост установок. Что показывать?
Конверсию в ключевое действие, retention, стоимость реального заказа и список исправленных проблем с подтверждением. Это сильнее, чем график установок: он показывает, что команда умеет находить и устранять причины, а не только тратить бюджет.
Комиссия 15 % не делает честные тесты дороже покупки установок за единицу?
За единицу — да, отчёт дороже установки в десятки раз. Но считать надо не за единицу, а за результат. В сценарии выше стоимость одного реального заказа отличалась более чем в десять раз в пользу честных тестов.
Итоги
- Купленные установки улучшают график и одновременно уничтожают способность читать данные: когорты, средние, воронка, A/B-тесты и обучение рекламных алгоритмов страдают одновременно.
- Самое дорогое последствие — испорченная историческая база: все будущие сравнения «до / после» опираются на ложный базис.
- Отчёт с шагами и скриншотами — внешнее доказательство, которое нельзя подделать так же дешёво, как событие в логе. Поэтому оплата за принятый отчёт устойчивее оплаты за установку.
- Модерация с публичными критериями приёмки — рабочий антифрод-контур: халтура экономически невыгодна исполнителю.
- Правила App Store и Google Play прямо запрещают манипуляцию установками и рейтингами; риск реализуется по решению платформы, а не команды.
- Если искусственный трафик уже в данных — пометьте период, постройте новую базовую линию, задокументируйте методику.
Заключение
Через квартал Команда А имела красивый график за первый месяц, испорченную аналитику, нулевой бюджет и незакрытый риск. Команда Б — конверсию в заказ выше в несколько раз, 140 отчётов в базе знаний, почти весь бюджет нетронутым и понимание, на что его тратить.
Разница между ними не в морали и не в бюджете. Разница в том, что одна команда покупала цифру, а вторая покупала знание. Цифру можно нарисовать, но по ней нельзя работать. Знание неудобно, зато по нему можно написать код и заработать деньги.
