До сих пор у примеров были правильные ответы («это кошка»). Но огромная часть данных не размечена. Как найти в них структуру, если никто не сказал, какие бывают группы?
Кластеризация — обучение без учителя: алгоритм сам делит объекты на группы (кластеры) похожих, без заранее заданных категорий. Он не знает, что «правильно» — он ищет естественные сгущения в данных. Популярный подход (k-means): задаёшь число групп k, алгоритм расставляет центры и относит каждый объект к ближайшему, повторяя, пока разбиение не устоится. Ответ — не «истина», а полезная гипотеза о структуре.
Магазину никто не размечал «типы покупателей». Кластеризация по частоте и сумме покупок сама выделяет: «редкие крупные», «частые мелкие», «спящие». Дальше с каждым сегментом работают по-своему.
Подвинь количество кластеров k и найди значение, при котором точки группируются наиболее «плотно» и естественно.
Внутрикластерная дисперсия: 41343
Цель: найди k, при котором данные группируются в 3 плотных, естественных кластера.
Кластеризация — рабочая лошадка сегментации. Но помни: число групп k задаёшь ты, и «правильного» k нет — есть полезное. И у кластеров нет имён: назвать и осмыслить сегменты — работа человека, а не алгоритма.
Чем кластеризация отличается от классификации?