Модель — это отражение данных, на которых она училась. Мусор на входе — мусор на выходе, каким бы модным ни был алгоритм.
Данные для обучения — это признаки (что модель видит: пиксели фото, возраст клиента, сумма заказа) и разметка (правильные ответы). Данные делят на обучающую и тестовую части: учиться на одних, проверять на других — иначе проверка нечестная. Ошибки разметки, перекосы и нерепрезентативность прямиком переезжают в модель.
Если в обучающих фото все кошки сняты дома, а собаки — на улице, модель может выучить «фон», а не животное: любое фото на газоне станет «собакой».
Прежде чем обсуждать «какую модель взять», менеджер спрашивает: какие у нас данные, кто их разметил, насколько они похожи на реальный поток? Это определяет успех сильнее выбора алгоритма.
Зачем данные делят на обучающую и тестовую части?