Тест закончился — начинается самое ответственное: сделать вывод, за который не будет стыдно. Здесь сходится весь курс.
Читаем результат по чек-листу: (1) главная метрика — рост есть? значим? достигает MDE? доверительный интервал эффекта не включает ноль? (2) guardrail-метрики не просели? (3) выборка добрана, SRM нет? Раскатываем, когда все три «да». Не раскатываем, если эффект незначим или меньше минимально полезного — даже если «в тесте чуть лучше».
Вывод аналитика в тикет: «В тестовой группе конверсия выше, но разница статистически незначима. Уверенно утверждать улучшение нельзя. Решение: продлить тест или отказаться от раскатки, если эффект меньше минимально полезного».
Двигай день эксперимента по 14-дневному журналу A/B-теста и смотри, как меняется p-value.
p-value: 0.42 — незначимо
Цель: найди ранний день (≤5), который выглядит значимым, а затем проверь день 14 — увидь, как ложная победа исчезает.
Хороший вывод пишется как комментарий в рабочий тикет: что видим, чего утверждать нельзя, что делаем. Понятно, аккуратно, без воды.
Тестовая группа лучше на 0.3 п.п., p = 0.4 (незначимо). Корректный вывод?