Цифрократия
город данных
Уровень 10 / 100 XP
0
Антон
ур. 1
← Назад// ML и AI
🧭 Обучение без учителя
базовый🪙 20 · ✦ 30

Кластеризация: группы без ярлыков

Зачем это нужно

До сих пор у примеров были правильные ответы («это кошка»). Но огромная часть данных не размечена. Как найти в них структуру, если никто не сказал, какие бывают группы?

Как это работает

Кластеризация — обучение без учителя: алгоритм сам делит объекты на группы (кластеры) похожих, без заранее заданных категорий. Он не знает, что «правильно» — он ищет естественные сгущения в данных. Популярный подход (k-means): задаёшь число групп k, алгоритм расставляет центры и относит каждый объект к ближайшему, повторяя, пока разбиение не устоится. Ответ — не «истина», а полезная гипотеза о структуре.

Пример

Магазину никто не размечал «типы покупателей». Кластеризация по частоте и сумме покупок сама выделяет: «редкие крупные», «частые мелкие», «спящие». Дальше с каждым сегментом работают по-своему.

🧪 Интерактивная лаборатория

Подвинь количество кластеров k и найди значение, при котором точки группируются наиболее «плотно» и естественно.

k2

Внутрикластерная дисперсия: 41343

Цель: найди k, при котором данные группируются в 3 плотных, естественных кластера.

💼 Зачем это менеджеру

Кластеризация — рабочая лошадка сегментации. Но помни: число групп k задаёшь ты, и «правильного» k нет — есть полезное. И у кластеров нет имён: назвать и осмыслить сегменты — работа человека, а не алгоритма.

🎯 Быстрый вопрос

Чем кластеризация отличается от классификации?