У реальных данных бывают десятки и сотни признаков. С таким количеством измерений трудно и считать, и понимать, и рисовать. PCA сжимает их до немногих главных — почти без потери смысла.
Метод главных компонент (PCA) — способ сократить число признаков. Идея: многие признаки дублируют друг друга (рост и длина ноги, число заказов и сумма трат меняются вместе). PCA находит несколько новых осей — главных компонент, — вдоль которых данные разбросаны сильнее всего, и выражает всё через них. Первая компонента ловит больше всего «разнообразия» данных, вторая — меньше, и так далее. Оставив пару-тройку главных, часто сохраняешь 80-90% информации при кратном уменьшении размерности.
У клиента 20 поведенческих признаков. PCA сводит их к двум главным факторам — условно «общая активность» и «склонность к премиум-товарам». Теперь клиентов можно нарисовать на плоскости и увидеть сегменты глазами.
У датасета 8 признаков. Подвинь k — сколько главных компонент оставить — и посмотри, сколько «информации» (дисперсии) сохранится.
Сохранено информации: 100%
Цель: найди k в диапазоне 2-4 — заметное сжатие при почти сохранённой информации.
PCA — не самоцель, а подготовка: убрать дубли-признаки, ускорить модели, нарисовать многомерные данные на плоскости. Цена — интерпретируемость: главные компоненты это смеси исходных признаков, у них нет простого имени. Полезно как «объектив», а не как финальный ответ.
Зачем применяют метод главных компонент (PCA)?