Цифрократия
город данных
Уровень 10 / 100 XP
0
Антон
ур. 1
← Назад// ML и AI
🧭 Обучение без учителя
сложный🪙 35 · ✦ 50

Метод главных компонент (PCA)

Зачем это нужно

У реальных данных бывают десятки и сотни признаков. С таким количеством измерений трудно и считать, и понимать, и рисовать. PCA сжимает их до немногих главных — почти без потери смысла.

Как это работает

Метод главных компонент (PCA) — способ сократить число признаков. Идея: многие признаки дублируют друг друга (рост и длина ноги, число заказов и сумма трат меняются вместе). PCA находит несколько новых осей — главных компонент, — вдоль которых данные разбросаны сильнее всего, и выражает всё через них. Первая компонента ловит больше всего «разнообразия» данных, вторая — меньше, и так далее. Оставив пару-тройку главных, часто сохраняешь 80-90% информации при кратном уменьшении размерности.

Пример

У клиента 20 поведенческих признаков. PCA сводит их к двум главным факторам — условно «общая активность» и «склонность к премиум-товарам». Теперь клиентов можно нарисовать на плоскости и увидеть сегменты глазами.

🧪 Интерактивная лаборатория

У датасета 8 признаков. Подвинь k — сколько главных компонент оставить — и посмотри, сколько «информации» (дисперсии) сохранится.

Компонент (k)8
ГК142%
ГК226%
ГК314%
ГК48%
ГК55%
ГК63%
ГК71.4%
ГК80.6%

Сохранено информации: 100%

Цель: найди k в диапазоне 2-4 — заметное сжатие при почти сохранённой информации.

💼 Зачем это менеджеру

PCA — не самоцель, а подготовка: убрать дубли-признаки, ускорить модели, нарисовать многомерные данные на плоскости. Цена — интерпретируемость: главные компоненты это смеси исходных признаков, у них нет простого имени. Полезно как «объектив», а не как финальный ответ.

🎯 Быстрый вопрос

Зачем применяют метод главных компонент (PCA)?