Модель не бывает «объективной» сама по себе: она наследует перекосы данных, на которых училась. Иногда — вместе с человеческими предрассудками.
Смещение (bias) возникает, когда данные не представляют реальность честно: одни группы недопредставлены, разметка отражает старые предвзятые решения, признаки-«прокси» тянут запрещённую информацию (район как прокси происхождения). Модель воспроизводит и масштабирует перекос — быстро, уверенно и на всех.
Модель отбора резюме, обученная на исторических наймах компании, где нанимали в основном мужчин, начинает занижать резюме женщин — не потому что «решила», а потому что выучила прошлое.
Вопросы менеджера перед внедрением: кого нет в данных? чьи прошлые решения зашиты в разметке? как мы проверим модель на разных группах? Для решений о людях это не опция, а обязанность.
Откуда чаще всего берётся предвзятость модели?