Большинство провальных A/B-тестов губит не математика, а нетерпение: остановили рано, домерили не то, выборка мала.
Размер выборки: чем меньше ожидаемый эффект, тем больше нужно людей, чтобы отличить его от шума. MDE — минимальный эффект, который тест способен поймать: до старта решают, какой прирост вообще интересен. A/A-тест (идея) — прогон «пустого» теста для проверки системы: различий быть не должно. SRM (идея) — перекос размеров групп против плана; если он есть, тесту нельзя верить. И главное: нельзя останавливать тест раньше срока из-за «уже красивых» цифр и нельзя выбирать метрику после эксперимента.
На третий день тестовая «побеждает» с p = 0.04, тимлид просит раскатить. Но тест спланирован на две недели: ранние p-value скачут, ранняя остановка — классический способ поймать ложную победу.
Дисциплина аналитика: срок, метрики и MDE зафиксированы до старта — и не пересматриваются по ходу, как бы ни хотелось.
Почему нельзя останавливать A/B-тест раньше запланированного срока?