Из матрицы ошибок рождаются две главные метрики. Они отвечают на разные вопросы — и почти всегда тянут в разные стороны.
Precision (точность): из всех, кого модель назвала «собакой», какая доля — правда собаки? = TP/(TP+FP). Страдает от ложных тревог. Recall (полнота): из всех настоящих собак какую долю модель нашла? = TP/(TP+FN). Страдает от пропусков. Улучшая одно, обычно жертвуешь другим.
Спам-фильтр: важнее precision — пусть немного спама проскочит, но живое письмо в спам не попадёт. Поиск болезни: важнее recall — лучше лишний раз перепроверить здорового, чем пропустить больного.
Выбор «что важнее — точность или полнота» — управленческое решение о цене ошибок, а не техническая настройка. Его нельзя делегировать модели.
Система ищет опасную болезнь на ранней стадии. Какая метрика важнее?