Большинство задач «с учителем» сводятся к двум типам вопросов: «какой это класс?» и «какое это число?». Различать их — первый шаг постановки ML-задачи.
Классификация — предсказать категорию: кошка/собака, уйдёт/останется, спам/не спам. Регрессия (не путать с линейной регрессией из курса «Анализ данных» — идея та же, слово шире) — предсказать число: сумму следующего заказа, время доставки, вероятность оттока в процентах.
«Оплатит ли пользователь подписку?» — классификация (да/нет). «Сколько он потратит за год?» — регрессия (число).
У каждого животного есть «оценка кошачести» (0-100). Подвинь порог отсечения: справа — «кошка», слева — «собака».
Один пёс с «острыми ушами» (74) почти всегда попадёт в «кошки» — классы пересекаются, идеальной границы не существует.
Цель: найди порог, при котором точность достигает максимума для этих данных (92%).
Правильная постановка вопроса — работа менеджера. «Хотим предсказывать отток» — это класс (уйдёт/нет) или число (вероятность, дни до ухода)? От ответа зависят и модель, и метрики, и то, как результат встроится в процесс.
«Предсказать сумму следующего заказа клиента» — какая это задача?