Цифрократия
город данных
Уровень 10 / 100 XP
0
Антон
ур. 1
← Назад// анализ данных
📉 Линейная регрессия
сложный🪙 35 · ✦ 50

Границы регрессии

Зачем это нужно

Регрессия — сильный инструмент, но с теми же ловушками, что и корреляция. Большой коэффициент ≠ причинность, а хорошая модель на прошлых данных ≠ хороший прогноз на любых.

Как это работает

Три границы. (1) Причинность не доказывается автоматически: коэффициент фиксирует связь в модели, но третий фактор и скрытые различия групп никуда не делись. (2) Качество прогноза меряют ошибками — MAE/MSE (идея: средняя величина промаха модели). (3) Экстраполяция опасна: модель, обученная на 0–10 уроках, ничего не знает о студентах с 50 уроками.

Пример

has_gift получил большой коэффициент к удержанию. Причинность? Вспоминаем урок о скрытых различиях: подарки давали самым лояльным. Модель честно нашла связь — но связь не равна влиянию.

🧠 Как думает аналитик

К каждому коэффициенту аналитик задаёт тот же вопрос, что и к корреляции: «а не третий ли это фактор?» Для причинности — эксперимент (A/B), регрессия лишь указывает, где искать.

🎯 Быстрый вопрос

У фактора большой коэффициент в регрессии. Что можно утверждать?