Отзывы, жалобы, посты, стенограммы — люди постоянно говорят текстом. Python позволяет «прочитать» тысячи текстов разом и увидеть, о чём они на самом деле.
Базовый конвейер анализа текста: (1) очистка — убрать знаки препинания, привести к нижнему регистру; (2) стоп-слова — выбросить служебные «и, в, на, что»: они самые частые и самые пустые; (3) частотный анализ — посчитать оставшиеся слова и взять топ: он и есть «о чём текст»; (4) визуализация — столбчатая диаграмма или облако слов; (5) тональность — простейший способ: два словарика («отлично», «удобно» vs «ужасно», «сломалось») и подсчёт, каких слов больше. Это грубый, но честный первый инструмент; продвинутые методы (ML-тональность из курса ИИ) строятся на той же идее.
Прогнали 2000 отзывов о доставке: в топе после чистки — «курьер», «ждать», «час». Тональность: негативных слов вдвое больше. Не читая ни одного отзыва целиком, видно, куда смотреть: время ожидания курьера.
Ниже — отзывы о доставке (можно вставить любой свой текст). Отредактируй стоп-слова и нажми «Проанализировать» — конвейер из урока отработает вживую.
— нажми «Проанализировать», чтобы запустить конвейер —
Раз в месяц прогонять жалобы и отзывы через этот конвейер — час работы, а на выходе карта болей продукта в динамике: какие слова растут, какие уходят. Дёшево, воспроизводимо, без субъективности «я почитал отзывы».
Зачем перед частотным анализом убирают стоп-слова?