Вот сердце исследования — превратить обработанные тексты в измеримую картину. Здесь абстрактный вопрос из первого урока наконец получает числовой ответ. И здесь же прячется соблазн увидеть то, чего нет.
Основные аналитические ходы, из которых собирается почти любое такое исследование:
(1) Частотный анализ — какие слова/маркеры встречаются чаще: топ слов, облако слов. Показывает, о чём корпус.
(2) Собственный индекс — главный приём. Индекс = доля текстов, содержащих признак X (заданный маркерами из урока 1). «Индекс непонимания» = доля комментариев с маркерами непонимания. Так абстрактное понятие становится одним числом, которое можно сравнивать.
(3) Динамика во времени — как индекс или частота слова меняются по месяцам/годам. Скачок ключевого слова с десятков до десятков тысяч упоминаний за пару месяцев — это уже результат.
(4) Связь с внешними событиями — динамику сопоставляют с реальными событиями (выборы, законы, кризисы): всплеск совпал с чем? Это переводит «что происходило» в «что на что повлияло».
(5) Сравнение подгрупп — один и тот же индекс считают отдельно для разных групп, периодов или площадок и сравнивают: риторика разных администраций или периодов; тональность у разных сообществ. Различие между группами — часто и есть главный вывод.
(6) Тональность — доля позитивных/негативных текстов (из прошлого раздела: словарь или ML).
Главная ловушка всего этапа — корреляция не есть причинность. Всплеск хэштега совпал с ростом протестов — но твиты вызвали протесты, протесты вызвали твиты, или у обоих общая причина (само событие)? Данные о совпадении на этот вопрос не отвечают. Строгие работы проверяют связь статистически (регрессия), но даже значимая корреляция не доказывает направление причины.
Считаем индекс = доля текстов с маркером, отдельно по месяцам, и накладываем на календарь событий. Индекс политической лексики у движения подскочил в 2014-м — совпал с принятием закона. Вывод-наблюдение: движение среагировало на закон. Но осторожно: совпадение во времени — это гипотеза о связи, а не доказательство, что закон её вызвал.
Те же 12 комментариев, но разбиты по трём сообществам. Индекс = доля текстов с маркером непонимания. Задай маркеры и посмотри: общий индекс — одно число, но по сообществам он разный.
Цель: посчитай индекс и найди двух сообщества, чьи доли заметно различаются.
Рабочий рецепт этапа: посчитай частоты → построй индекс по своим маркерам → посмотри динамику → сравни подгруппы → сопоставь с событиями. Но каждый раз, увидев красивое совпадение, спрашивай: это причина, следствие или общий фактор? Формулируй выводы как «связано с», а не «вызвало», пока не доказал направление. Честный вывод с оговоркой сильнее эффектного, но необоснованного.
Всплеск хэштега во времени совпал с ростом уличных протестов. Что корректно заключить?