Самая коварная ошибка сравнения: группы изначально разные, а разницу приписывают воздействию. «У группы с подарком отток ниже» — а может, подарки давали самым лояльным?
Разница метрик = эффект воздействия + исходные различия групп. Чтобы отделить одно от другого: сравнивать похожие подгруппы (новые с новыми, старые со старыми), смотреть динамику «до» воздействия, а лучше всего — случайное разделение (об этом в A/B-тестах).
У пользователей с премиум-поддержкой удержание выше. Вывод «поддержка удерживает»? Или просто премиум покупают те, кто и так планирует остаться надолго?
Увидев разницу между группами, аналитик сначала ищет, чем ещё группы отличаются, — и лишь исключив это, говорит об эффекте.
Отток у группы А 6%, у группы B 9%. Что нужно проверить до вывода «А лучше»?