Оценка неопределенности в машинном обучении

Материал из MachineLearning.

Перейти к: навигация, поиск
Статья написана с использованием LLM Gemini 3.1 Pro и проверена участником Arsen Temirov 22:08, 19 июля 2026 (MSD)

Промпт приводится полностью в Обсуждение: Оценка неопределённости в машинном обучении


Содержание

Введение

Оценка неопределённости (англ. Uncertainty Estimation или Uncertainty Quantification, UQ) — область машинного обучения (англ. machine learning, ML), изучающая алгоритмы количественной оценки степени уверенности искусственного интеллекта в собственных предсказаниях.

Модели глубокого обучения (англ. deep learning, DL) зачастую представляют собой «чёрные ящики» из-за отсутствия интерпретируемых правил принятия решений. Архитектуры на базе глубоких нейронных сетей склонны к излишней самоуверенности (англ. overconfidence) при обработке выбросов (англ. outliers) и аномальных данных. Интеграция методов оценки неопределённости позволяет выявлять ошибки моделей, валидировать результаты на этапе логического вывода и обеспечивать безопасность в критически важных приложениях.

Виды неопределённости

Полная неопределённость предсказания традиционно разделяется на две фундаментальные составляющие, имеющие различную физическую и математическую природу.

Алеаторическая неопределённость

Алеаторическая неопределённость (англ. aleatoric uncertainty), или неопределённость данных (англ. data uncertainty) описывает внутренний шум и случайные эффекты, присущие самому набору данных.

Данная неопределенность является неотъемлемым свойством распределения данных и не поддаётся устранению (англ. irreducible) путём сбора дополнительных примеров. Основные источники: физический шум в показаниях аппаратных датчиков, частичный объёмный эффект (англ. partial volume effect) в медицинских изображениях, а также высокая вариативность в разметке обучающей выборки различными экспертами (англ. inter-rater variability).

Эпистемическая неопределённость

Эпистемическая неопределённость (англ. epistemic uncertainty), или неопределённость модели (англ. model uncertainty) возникает вследствие недостатка знаний обучаемой модели о предметной области.

Этот тип неопределенности устраним (англ. reducible), поскольку его можно минимизировать, расширив обучающую выборку новыми данными. Эпистемическая неопределенность достигает высоких значений, когда алгоритм сталкивается с объектами, статистика которых значительно отличается от примеров из тренировочного набора (англ. out-of-distribution, OOD).

Основные методы оценки

Для вычисления неопределённости применяются вероятностные, ансамблевые и эвристические подходы.

Байесовские нейронные сети

В байесовских нейронных сетях (англ. Bayesian Neural Networks, BNN) каждый вес заменяется распределением вероятностей (например, гауссовским), а не детерминированным фиксированным значением. В процессе обучения модель оценивает апостериорное распределение параметров с учётом выборки и априорного распределения. Поскольку точное вычисление апостериорного распределения для перепараметризованных сетей аналитически нерешаемо, применяется Вариационный вывод (англ. Variational Inference, VI). Он аппроксимирует истинное распределение, решая задачу оптимизации через минимизацию дивергенции Кульбака-Лейблера или максимизацию нижней границы обоснованности (англ. Evidence Lower Bound, ELBO).

Монте-Карло Dropout (MC Dropout)

Метод аппроксимирует байесовский вывод без модификации архитектуры сети. Подход использует dropout-регуляризацию как во время обучения, так и на этапе логического вывода (англ. inference). Для каждого входного примера выполняется серия прямых проходов через сеть со случайно сгенерированными масками dropout, формируя распределение предсказаний. Дисперсия полученных ответов служит количественной мерой неопределенности.

Глубокие ансамбли (Deep Ensembles)

Метод заключается в параллельном обучении нескольких независимых нейронных сетей с идентичной архитектурой, но с различной случайной инициализацией весов. Расхождение в предсказаниях членов ансамбля выступает мерой неопределенности модели. Подход обеспечивает устойчивые оценки без изменения архитектуры, однако требует кратного увеличения вычислительных затрат на обучение и инференс.

Конформное прогнозирование (Conformal Prediction)

Статистический подход, преобразующий точечные предсказания модели в предсказательные множества (англ. predictive sets) для классификации или предсказательные интервалы (англ. predictive intervals) для регрессии. Метод гарантирует, что истинное значение будет находиться внутри предсказанного множества с заранее заданным уровнем достоверности. Подход не делает предположений о внутреннем устройстве модели, требуя лишь независимой репрезентативной выборки для калибровки.

Очевидное глубокое обучение (Evidential Deep Learning)

Метод базируется на теории свидетельств Демпстера-Шафера. Вместо генерации точечных вероятностей, выходы классификатора параметризуют распределение Дирихле. Это позволяет за один прямой проход моделировать вероятности второго порядка, вычисляя независимые оценки как для алеаторной, так и для эпистемической неопределенности.

Test-Time Augmentation (TTA)

Агностический к архитектуре метод, изучающий влияние аугментаций входных данных на итоговый результат. Во время вывода создаются варианты исходного изображения с помощью пространственных или цветовых трансформаций. Дисперсия ответов модели для этих вариантов интерпретируется как алеаторная неопределенность.

Оценка качества (Метрики валидации)

В реальных условиях истинные значения неопределенности (англ. ground-truth) недоступны, поэтому валидация опирается на специализированные прокси-оценки.

  • Калибровка (англ. Calibration): Оценивает соответствие предсказанных вероятностей (Softmax) реальной частоте правильных ответов. Для количественной оценки применяются ожидаемая ошибка калибровки (англ. Expected Calibration Error, ECE) и отрицательное логарифмическое правдоподобие (англ. Negative Log-Likelihood, NLL). Для устранения излишней уверенности современных сетей применяется процедура температурного масштабирования (англ. Temperature Scaling).
  • Обнаружение ошибок и отказ от предсказаний (англ. Error Detection and Referral): Предсказания делятся на «надежные» и «неопределенные» с помощью порога отсечения. Механизм имитирует сценарий, при котором система воздерживается от решения в неуверенных случаях и перенаправляет (англ. referral) задачу эксперту-человеку.
  • Обнаружение сдвига распределения (англ. Out-of-Distribution Detection): Проверка способности модели выдавать высокую эпистемическую неопределенность для данных, выходящих за рамки обучающей выборки (новые классы, артефакты, сторонние источники данных).
  • Контроль качества (англ. Quality Control): В задачах сегментации изображений пиксельные оценки неопределенности агрегируются до уровня целого скана для выявления данных, на которых качество предсказания будет гарантированно низким.

Практическое применение

  • Медицинская визуализация: Контроль качества сегментации анатомических структур и патологий. Пиксели с высокой неопределенностью или целые исследования маркируются для ручной проверки врачом, снижая риск диагностических ошибок.
  • Робототехника и беспилотный транспорт: Детектирование объектов и оценка оптического потока. В случае критической неуверенности алгоритм инициирует передачу управления человеку-оператору.
  • Обработка естественного языка (NLP): Анализ тональности, извлечение фактов, машинный перевод. Оценка степени достоверности фактов, извлеченных из неструктурированного текста (медицинские карты, социальные сети).
  • Активное обучение (Active Learning): Фильтрация массивов неразмеченных данных. На ручную разметку асессорам отправляются исключительно те примеры, в которых модель демонстрирует наивысшую эпистемическую неопределенность, оптимизируя бюджет на подготовку датасетов.

См. также

Литература

  • Abdar M., Pourpanah F., Hussain S. et al. A review of uncertainty quantification in deep learning: Techniques, applications and challenges // Information Fusion. — 2021. — Т. 76. — С. 243-297.
  • Lambert B., Forbes F., Doyle S. et al. Trustworthy clinical AI solutions: A unified review of uncertainty quantification in Deep Learning models for medical image analysis // Artificial Intelligence In Medicine. — 2024. — Т. 150. — С. 102830.
  • Gal Y., Ghahramani Z. Dropout as a Bayesian Approximation: Representing Model Uncertainty in Deep Learning // Proceedings of the 33rd International Conference on Machine Learning (ICML). — 2016. — С. 1050-1059.
  • Lakshminarayanan B., Pritzel A., Blundell C. Simple and Scalable Predictive Uncertainty Estimation using Deep Ensembles // Advances in Neural Information Processing Systems (NeurIPS). — 2017. — Т. 30.
  • Blundell C., Cornebise J., Kavukcuoglu K., Wierstra D. Weight Uncertainty in Neural Network // Proceedings of the 32nd International Conference on Machine Learning (ICML). — 2015. — С. 1613-1622.
  • Kendall A., Gal Y. What Uncertainties Do We Need in Bayesian Deep Learning for Computer Vision? // Advances in Neural Information Processing Systems (NeurIPS). — 2017. — Т. 30.
  • Sensoy M., Kaplan L., Kandemir M. Evidential Deep Learning to Quantify Classification Uncertainty // Advances in Neural Information Processing Systems (NeurIPS). — 2018. — Т. 31.
Личные инструменты