Цифрократия
город данных
Уровень 10 / 100 XP
0
Антон
ур. 1
← Назад// анализ данных
🅰️ A/B-тесты
средний🪙 25 · ✦ 40

Размер выборки, MDE и дисциплина теста

Зачем это нужно

Большинство провальных A/B-тестов губит не математика, а нетерпение: остановили рано, домерили не то, выборка мала.

Как это работает

Размер выборки: чем меньше ожидаемый эффект, тем больше нужно людей, чтобы отличить его от шума. MDE — минимальный эффект, который тест способен поймать: до старта решают, какой прирост вообще интересен. A/A-тест (идея) — прогон «пустого» теста для проверки системы: различий быть не должно. SRM (идея) — перекос размеров групп против плана; если он есть, тесту нельзя верить. И главное: нельзя останавливать тест раньше срока из-за «уже красивых» цифр и нельзя выбирать метрику после эксперимента.

Пример

На третий день тестовая «побеждает» с p = 0.04, тимлид просит раскатить. Но тест спланирован на две недели: ранние p-value скачут, ранняя остановка — классический способ поймать ложную победу.

0.05день теста
p-value по дням теста: на 3-й день нырнул под 0.05 и вынырнул — ранняя остановка поймала бы ложную победу

🧠 Как думает аналитик

Дисциплина аналитика: срок, метрики и MDE зафиксированы до старта — и не пересматриваются по ходу, как бы ни хотелось.

🎯 Быстрый вопрос

Почему нельзя останавливать A/B-тест раньше запланированного срока?