Главная болезнь моделей: блестящий результат на обучающих данных и провал на новых. Модель не поняла закономерность — она вызубрила примеры.
Переобучение — модель подстроилась под случайные особенности обучающих данных, включая шум, и потеряла способность обобщать. Признак: на обучающей выборке точность 99%, на тестовой — 70%. Лечение: больше разнообразных данных, проще модель, честная проверка на отложенной выборке.
Студент, вызубривший ответы прошлогоднего экзамена, получает пятёрку по старым билетам и заваливает новые. Модель-«зубрилка» ведёт себя так же.
Подвинь сложность модели и посмотри на разрыв между точностью на обучающих и на новых данных.
⚠️ Переобучение: на обучении 99%, а на новых данных только 71%. Модель зазубрила примеры, а не поняла закономерность. Сдвинь сложность влево.
Цель: найди сложность, при которой разрыв train−test достигает 12 п.п. и больше — это переобучение.
Когда команда показывает «точность 99%», менеджер спрашивает: на каких данных? Если на тех же, где учились, — цифра ничего не значит. Верить можно только проверке на данных, которых модель не видела.
Точность 99% на обучающих данных и 70% на новых. Что это?