Распределение вероятностей
Материал из MachineLearning.
(Новая: '''Распределение вероятностей''' — это математическое описание того, какие значения может принимать [[...) |
|||
| Строка 1: | Строка 1: | ||
| - | + | {{TOCright}} | |
| - | В [[ | + | '''Распределение вероятностей''' — математическое описание того, какие значения может принимать [[случайная величина]] или случайный вектор и как [[вероятность]] распределена между этими значениями. Распределение характеризует не только наиболее вероятные исходы, но и разброс значений, вероятность редких событий и зависимость между величинами. |
| + | |||
| + | В [[Анализ данных|анализе данных]] и [[Машинное обучение|машинном обучении]] наблюдения обычно рассматриваются как значения, порождённые некоторым неизвестным распределением. Обучение модели можно понимать как оценивание этого распределения, приближение отдельных его характеристик или построение правила предсказания на его основе<ref name="bishop">{{книга |автор=Bishop C. M. |заглавие=Pattern Recognition and Machine Learning |место=New York |издательство=Springer |год=2006 |isbn=978-0-387-31073-2}}</ref><ref name="murphy">{{книга |автор=Murphy K. P. |заглавие=Probabilistic Machine Learning: An Introduction |место=Cambridge, MA |издательство=MIT Press |год=2022}}</ref>. | ||
== Основная идея == | == Основная идея == | ||
| - | Распределение вероятностей отвечает на вопрос | + | Распределение вероятностей отвечает на вопрос о том, как вероятность разделена между возможными результатами случайного эксперимента. Для дискретной величины можно непосредственно указать вероятность каждого значения. Для непрерывной величины вероятность обычно задаётся для интервалов и других областей значений. |
| - | Например, | + | Например, при броске правильной игральной кости каждое из шести значений имеет одинаковую вероятность. Рост случайно выбранного человека, напротив, изменяется практически непрерывно, поэтому его вероятностную модель удобнее описывать плотностью на числовой оси. |
| - | + | Распределение можно понимать как идеализированную карту неопределённости. [[Выборка]] содержит конечное число фактически полученных наблюдений, тогда как распределение описывает общий вероятностный закон, который мог породить эти наблюдения. Одно и то же распределение способно порождать различные выборки, а по одной конечной выборке обычно нельзя восстановить распределение без статистической погрешности. | |
== Формальное определение == | == Формальное определение == | ||
| - | В современной теории вероятностей распределение случайной величины | + | В современной [[Теория вероятностей|теории вероятностей]] распределение определяется как вероятностная мера на пространстве значений случайной величины. Если случайная величина задана на некотором вероятностном пространстве, то её распределение сопоставляет каждому допустимому множеству значений вероятность попадания в это множество<ref name="billingsley">{{книга |автор=Billingsley P. |заглавие=Probability and Measure |издание=3rd ed. |место=New York |издательство=Wiley |год=1995}}</ref>: |
| - | :<tex>P_X(A)=P(X \in A)</tex> | + | :<tex>P_X(A)=P(X\in A).</tex> |
| - | Эта формула означает, что распределение | + | Эта формула означает, что распределение переносит вероятности с пространства элементарных исходов на пространство значений случайной величины. Для использования распределения не обязательно знать внутреннее устройство исходного эксперимента: достаточно уметь вычислять вероятности множеств значений. |
| - | + | Распределение числовой случайной величины однозначно определяется её [[Функция распределения|функцией распределения]]: | |
| - | :<tex>F_X(x)=P(X \leq x)</tex> | + | :<tex>F_X(x)=P(X\leq x).</tex> |
| - | Функция распределения показывает вероятность того, что | + | Функция распределения показывает вероятность того, что случайная величина не превысит заданного порога. Она определена для дискретных, непрерывных, смешанных и других распределений. |
| - | + | Любая функция распределения не убывает, непрерывна справа и имеет предельные значения ноль и единица на соответствующих бесконечностях. Эти свойства позволяют отличить функцию распределения от произвольной функции действительного аргумента. | |
| - | + | == Способы задания распределения == | |
| - | + | === Дискретные распределения === | |
| - | + | '''Дискретное распределение''' описывает случайную величину, принимающую конечное или счётное множество значений. Оно задаётся [[Функция вероятности|функцией вероятности]]: | |
| - | :<tex> | + | :<tex>p_X(x)=P(X=x).</tex> |
| - | + | Значение функции равно вероятности того, что случайная величина примет конкретное значение. Все такие вероятности неотрицательны, а их сумма равна единице: | |
| - | + | :<tex>\sum_x p_X(x)=1.</tex> | |
| - | + | Условие нормировки означает, что одно из допустимых значений обязательно реализуется. | |
| - | + | ||
| - | + | ||
| - | + | ||
| - | + | К распространённым дискретным распределениям относятся: | |
| - | + | * '''[[Распределение Бернулли]]''' — модель одного испытания с двумя исходами; | |
| + | * '''категориальное распределение''' — модель выбора одной категории из конечного множества; | ||
| + | * '''[[Биномиальное распределение]]''' — распределение числа успехов в серии независимых испытаний; | ||
| + | * '''[[Распределение Пуассона]]''' — модель числа событий на заданном интервале времени или пространства; | ||
| + | * '''геометрическое распределение''' — модель числа испытаний до первого успеха. | ||
| - | + | В машинном обучении дискретные распределения используются для моделирования классов, категориальных признаков, последовательностей символов и числа наблюдаемых событий. | |
| - | + | === Абсолютно непрерывные распределения === | |
| - | Плотность | + | Распределение называется '''абсолютно непрерывным''', если вероятности можно вычислять с помощью [[Плотность вероятности|плотности вероятности]]: |
| - | :<tex>\ | + | :<tex>P(a\leq X\leq b)=\int_a^b f_X(x)\,dx.</tex> |
| - | + | Вероятность интервала равна площади под графиком плотности на этом интервале. При этом значение плотности в отдельной точке не является вероятностью этой точки. | |
| - | + | Плотность должна быть неотрицательной и нормированной: | |
| - | * ''' | + | :<tex>\int_{-\infty}^{\infty}f_X(x)\,dx=1.</tex> |
| - | * ''' | + | |
| + | Значение плотности может быть больше единицы, если она сосредоточена на достаточно узкой области. Ограничение единицей относится к вероятностям, а не к значениям плотности. | ||
| + | |||
| + | Для абсолютно непрерывного распределения функция распределения выражается через плотность: | ||
| + | |||
| + | :<tex>F_X(x)=\int_{-\infty}^{x}f_X(t)\,dt.</tex> | ||
| + | |||
| + | Если функция распределения дифференцируема, её производная почти всюду совпадает с плотностью. | ||
| + | |||
| + | К распространённым абсолютно непрерывным распределениям относятся: | ||
| + | |||
| + | * '''[[Равномерное распределение]]''' — распределение с постоянной плотностью на заданном интервале; | ||
| + | * '''[[Нормальное распределение]]''' — симметричное распределение, определяемое средним и дисперсией; | ||
* '''экспоненциальное распределение''' — модель времени ожидания до события; | * '''экспоненциальное распределение''' — модель времени ожидания до события; | ||
| - | * '''гамма-распределение''' — | + | * '''гамма-распределение''' — семейство распределений положительных величин; |
| - | * '''бета-распределение''' — | + | * '''бета-распределение''' — семейство распределений на единичном отрезке; |
| + | * '''распределение Стьюдента''' — симметричное распределение с более тяжёлыми хвостами, чем у нормального распределения. | ||
| - | + | В прикладной литературе абсолютно непрерывные распределения нередко называют просто непрерывными. Строго говоря, существуют непрерывные распределения, которые не имеют плотности, поэтому эти понятия не полностью совпадают. | |
| - | == Смешанные распределения == | + | === Смешанные распределения === |
| - | + | '''Смешанное распределение''' содержит как отдельные точки с положительной вероятностью, так и непрерывную составляющую. Например, размер страховой выплаты может с положительной вероятностью равняться нулю, а при наступлении страхового случая принимать положительные значения из непрерывного диапазона. | |
| - | + | Смешанные распределения встречаются при моделировании нулевых расходов, времени ожидания с возможностью немедленного события, цен, страховых выплат и показателей с большим числом нулевых наблюдений. | |
| - | + | Распределение в наиболее общей форме не обязано иметь ни функцию вероятности, ни плотность. Универсальным способом его задания остаётся вероятностная мера или функция распределения. | |
| - | + | == Совместные и маргинальные распределения == | |
| - | + | Для нескольких случайных величин используется '''совместное распределение'''. Оно описывает не только распределение каждой величины отдельно, но и вероятностную зависимость между ними. | |
| - | + | В дискретном случае совместная функция вероятности двух величин определяется как | |
| - | + | :<tex>p_{X,Y}(x,y)=P(X=x,Y=y).</tex> | |
| - | + | Она задаёт вероятность одновременного появления конкретной пары значений. | |
| - | + | Из совместного распределения можно получить отдельное, или '''маргинальное''', распределение одной величины: | |
| - | + | :<tex>p_X(x)=\sum_y p_{X,Y}(x,y).</tex> | |
| - | + | Суммирование исключает вторую величину из рассмотрения, учитывая все возможные её значения. | |
| - | : | + | Для распределения с совместной плотностью аналогичная операция выполняется интегрированием: |
| - | Совместные распределения особенно важны в | + | :<tex>f_X(x)=\int_{-\infty}^{\infty}f_{X,Y}(x,y)\,dy.</tex> |
| + | |||
| + | Совместные распределения особенно важны в анализе данных, поскольку один объект обычно описывается несколькими признаками. Такой набор признаков рассматривается как [[Случайный вектор|случайный вектор]], а зависимости между признаками являются свойствами его совместного распределения. | ||
== Условные распределения == | == Условные распределения == | ||
| - | '''Условное распределение''' описывает | + | '''Условное распределение''' описывает поведение одной случайной величины при наличии информации о другой. Для дискретных величин условная функция вероятности определяется формулой |
| - | :<tex> | + | :<tex>p_{Y\mid X}(y\mid x)=\frac{p_{X,Y}(x,y)}{p_X(x)},\quad p_X(x)>0.</tex> |
| - | + | Условие ограничивает рассмотрение теми случаями, в которых первая величина приняла заданное значение. После такого ограничения вероятности возможных значений второй величины заново нормируются. | |
| - | + | Совместное распределение можно восстановить из маргинального и условного распределений: | |
| - | :<tex> | + | :<tex>p_{X,Y}(x,y)=p_{Y\mid X}(y\mid x)p_X(x).</tex> |
| - | Это | + | Это равенство называется правилом произведения вероятностей. |
| - | + | С помощью [[Формула Байеса|формулы Байеса]] направление условия можно изменить: | |
| - | :<tex> | + | :<tex>p_{Y\mid X}(y\mid x)=\frac{p_{X\mid Y}(x\mid y)p_Y(y)}{p_X(x)}.</tex> |
| - | + | Формула позволяет перейти от распределения наблюдаемых признаков при заданной гипотезе к распределению гипотез при полученных признаках. На этом принципе основаны байесовские методы классификации. | |
| - | + | Для непрерывных величин при наличии соответствующих плотностей используется аналогичное отношение: | |
| - | :<tex> | + | :<tex>f_{Y\mid X}(y\mid x)=\frac{f_{X,Y}(x,y)}{f_X(x)}.</tex> |
| - | + | Поскольку отдельное значение непрерывной величины обычно имеет нулевую вероятность, условное распределение в общем случае определяется не через вероятность отдельного события, а с помощью условных мер или условных плотностей. | |
== Независимость и условная независимость == | == Независимость и условная независимость == | ||
| - | + | Случайные величины называются [[Независимость (теория вероятностей)|независимыми]], если знание одной из них не изменяет распределение другой. Для дискретных величин независимость равносильна разложению совместного распределения: | |
| - | :<tex> | + | :<tex>p_{X,Y}(x,y)=p_X(x)p_Y(y).</tex> |
| - | + | Если равенство не выполняется хотя бы для одной пары допустимых значений, величины зависимы. | |
| - | + | Зависимость не обязательно является линейной. Нулевая корреляция в общем случае не гарантирует независимость, хотя для некоторых специальных семейств распределений, в частности для совместно нормально распределённых величин, такое заключение возможно. | |
| - | + | В вероятностных моделях также используется '''условная независимость'''. Две величины условно независимы при известной третьей, если после её учёта совместное условное распределение раскладывается в произведение: | |
| - | + | :<tex>p(x,y\mid z)=p(x\mid z)p(y\mid z).</tex> | |
| - | == | + | Условная независимость позволяет компактно описывать сложные многомерные распределения. Она лежит в основе [[Байесовская сеть|байесовских сетей]], марковских сетей и других [[Вероятностная графическая модель|вероятностных графических моделей]]<ref name="koller">{{книга |автор=Koller D., Friedman N. |заглавие=Probabilistic Graphical Models: Principles and Techniques |место=Cambridge, MA |издательство=MIT Press |год=2009 |isbn=978-0-262-01319-2}}</ref>. |
| - | + | == Числовые характеристики распределения == | |
| - | + | Полное распределение содержит больше информации, чем несколько числовых характеристик, однако такие характеристики позволяют кратко описывать его основные свойства. | |
| - | + | '''[[Математическое ожидание]]''' характеризует среднее положение распределения. Для дискретной случайной величины оно определяется как | |
| - | + | :<tex>E[X]=\sum_x x\,p_X(x).</tex> | |
| - | + | Возможные значения усредняются с весами, равными их вероятностям. | |
| - | + | Для распределения с плотностью математическое ожидание имеет вид | |
| - | + | :<tex>E[X]=\int_{-\infty}^{\infty}x\,f_X(x)\,dx.</tex> | |
| - | + | Ожидание существует не для каждого распределения. Например, у распределения Коши обычное математическое ожидание не определено. | |
| - | + | '''[[Дисперсия]]''' характеризует средний квадрат отклонения от математического ожидания: | |
| - | + | :<tex>{\rm Var}(X)=E[(X-E[X])^2].</tex> | |
| - | + | Чем больше дисперсия, тем сильнее значения в среднем разбросаны относительно математического ожидания. Квадратный корень из дисперсии называется стандартным отклонением. | |
| + | |||
| + | Для нескольких величин зависимость может описываться [[Ковариация|ковариацией]] и [[Корреляция|корреляцией]]. Эти показатели характеризуют главным образом линейную зависимость и не определяют совместное распределение полностью. | ||
| + | |||
| + | К другим характеристикам относятся медиана, квантили, мода, асимметрия и эксцесс. Два разных распределения могут иметь одинаковые математические ожидания и дисперсии, поэтому краткие характеристики не заменяют полного распределения. | ||
== Эмпирическое распределение == | == Эмпирическое распределение == | ||
| - | + | Истинное распределение данных в прикладных задачах обычно неизвестно. Исследователь располагает только конечной выборкой. На её основе строится '''эмпирическое распределение''', которое присваивает одинаковую вероятностную массу каждому наблюдению: | |
| - | :<tex> | + | :<tex>\widehat{P}_n(A)=\frac{1}{n}\sum_{i=1}^{n}I(x_i\in A).</tex> |
| - | + | Индикатор в сумме равен единице, если наблюдение принадлежит заданному множеству, и нулю в противном случае. Поэтому эмпирическая вероятность события равна доле наблюдений, для которых оно произошло. | |
| - | + | Эмпирическая функция распределения определяется как | |
| - | + | :<tex>\widehat{F}_n(x)=\frac{1}{n}\sum_{i=1}^{n}I(x_i\leq x).</tex> | |
| - | + | Она показывает долю наблюдений, не превышающих заданный порог. По мере увеличения объёма независимой одинаково распределённой выборки эмпирическая функция при стандартных условиях приближается к истинной функции распределения<ref name="durrett">{{книга |автор=Durrett R. |заглавие=Probability: Theory and Examples |издание=5th ed. |место=Cambridge |издательство=Cambridge University Press |год=2019}}</ref>. | |
| + | |||
| + | Предположение о независимых одинаково распределённых наблюдениях является важным упрощением. Оно может нарушаться во временных рядах, пространственных данных, социальных сетях и системах, где поведение пользователей изменяется со временем. | ||
== Оценивание распределений == | == Оценивание распределений == | ||
| - | Оценивание распределения — одна из центральных задач статистики и | + | Оценивание неизвестного распределения — одна из центральных задач статистики. Подходы к оцениванию обычно разделяют на параметрические и непараметрические. |
| + | |||
| + | === Параметрический подход === | ||
| + | |||
| + | В параметрическом подходе предполагается, что распределение принадлежит известному семейству, но его параметры неизвестны. Например, измерения могут моделироваться нормальным распределением с неизвестными математическим ожиданием и дисперсией. | ||
| + | |||
| + | Распространённым способом оценивания является [[Метод максимального правдоподобия|метод максимального правдоподобия]]. Для независимых наблюдений функция правдоподобия имеет вид | ||
| + | |||
| + | :<tex>L(\theta)=\prod_{i=1}^{n}p(x_i\mid\theta).</tex> | ||
| + | |||
| + | Правдоподобие показывает, насколько хорошо различные значения параметра согласуются с наблюдаемой выборкой. Оно рассматривается как функция параметра при фиксированных данных и не является распределением вероятности параметра. | ||
| + | |||
| + | На практике обычно максимизируют логарифм правдоподобия: | ||
| + | |||
| + | :<tex>\ell(\theta)=\sum_{i=1}^{n}\log p(x_i\mid\theta).</tex> | ||
| - | + | Логарифм превращает произведение в сумму, облегчает дифференцирование и уменьшает риск численного переполнения или потери точности при умножении малых чисел. | |
| - | + | В [[Байесовский вывод|байесовском подходе]] параметру задаётся априорное распределение, которое после наблюдения данных преобразуется в апостериорное распределение. В результате неопределённость параметра описывается распределением, а не только одной точечной оценкой. | |
| - | + | === Непараметрический подход === | |
| - | + | Непараметрические методы не фиксируют конечномерное семейство распределений заранее. К ним относятся: | |
| - | + | * эмпирическая функция распределения; | |
| + | * гистограмма; | ||
| + | * [[Ядерная оценка плотности|ядерная оценка плотности]]; | ||
| + | * методы ближайших соседей; | ||
| + | * некоторые модели на основе процессов и смесей с изменяемым числом компонентов. | ||
| - | + | Непараметрические методы способны описывать более широкий класс форм распределения, но обычно требуют больше данных. В пространствах высокой размерности оценивание плотности становится особенно сложным из-за [[Проклятие размерности|проклятия размерности]]. | |
| - | + | Выбор между параметрическим и непараметрическим подходами зависит от объёма данных, размерности пространства, доступных предметных знаний и цели анализа. | |
== Распределения в машинном обучении == | == Распределения в машинном обучении == | ||
| - | Вероятностный взгляд на машинное обучение | + | Вероятностный взгляд на машинное обучение рассматривает признаки, ответы и параметры модели как случайные величины. В зависимости от задачи модель может оценивать совместное, маргинальное или условное распределение. |
| - | + | === Обучение с учителем === | |
| - | + | ||
| - | + | ||
| - | + | ||
| - | + | В [[Обучение с учителем|обучении с учителем]] по признакам объекта предсказывается целевая переменная. Вероятностная модель оценивает условное распределение ответа при наблюдаемых признаках. | |
| - | + | В классификации решение часто выбирается как класс с наибольшей условной вероятностью: | |
| - | + | :<tex>\widehat{y}(x)=\mathop{\rm arg\,max}_{y}p(y\mid x).</tex> | |
| - | + | Такое правило является оптимальным при условии, что все ошибки классификации имеют одинаковую стоимость и модель правильно описывает условные вероятности. | |
| - | + | В регрессии при квадратичной функции потерь оптимальным точечным прогнозом является условное математическое ожидание: | |
| - | + | :<tex>\widehat{y}(x)=E[Y\mid X=x].</tex> | |
| - | + | При других функциях потерь оптимальный прогноз может соответствовать условной медиане, квантилю или другой характеристике условного распределения. Поэтому выбор функции потерь связан с тем, какую характеристику распределения должна оценивать модель. | |
| - | + | === Дискриминативные и генеративные модели === | |
| - | + | '''Дискриминативная модель''' непосредственно описывает распределение целевой переменной при известных признаках или границу принятия решений. К таким моделям относятся логистическая регрессия и многие нейронные классификаторы. | |
| - | + | '''Генеративная модель''' описывает распределение наблюдаемых данных либо совместное распределение признаков и целевой переменной. Из совместного распределения можно получить условное распределение с помощью формулы Байеса. | |
| - | + | К генеративным моделям относятся смеси распределений, [[Наивный байесовский классификатор|наивный байесовский классификатор]], скрытые марковские модели, вариационные автоэнкодеры и вероятностные графические модели<ref name="bishop" />. | |
| - | + | Граница между двумя группами не всегда абсолютна: отдельные методы могут сочетать генеративные и дискриминативные компоненты. | |
| - | + | === Правдоподобие и функции потерь === | |
| - | : | + | Многие функции потерь в машинном обучении имеют вероятностную интерпретацию. Минимизация отрицательного логарифма правдоподобия соответствует выбору параметров, при которых обучающая выборка наиболее согласуется с моделью: |
| - | + | :<tex>-\ell(\theta)=-\sum_{i=1}^{n}\log p(x_i\mid\theta).</tex> | |
| - | [[ | + | В многоклассовой классификации этот принцип приводит к [[Перекрёстная энтропия|перекрёстной энтропии]]. В регрессии предположение о нормальном распределении ошибок с постоянной дисперсией приводит к минимизации суммы квадратов отклонений. |
| - | + | Вероятностная интерпретация помогает понять предположения, скрытые за функцией потерь. Замена распределения ошибок может привести к другой функции потерь и другой устойчивости к выбросам. | |
| - | + | === Вероятностные графические модели === | |
| - | + | [[Вероятностная графическая модель|Вероятностные графические модели]] представляют многомерное распределение с помощью графа. Структура графа кодирует условные зависимости и позволяет разложить сложное совместное распределение на более простые множители. | |
| - | + | В байесовской сети совместное распределение раскладывается по родительским узлам: | |
| + | |||
| + | :<tex>p(x_1,\ldots,x_d)=\prod_{j=1}^{d}p(x_j\mid {\rm pa}(x_j)).</tex> | ||
| + | |||
| + | Такое представление позволяет компактно задавать распределения большой размерности и выполнять вероятностный вывод при частично наблюдаемых данных<ref name="koller" />. | ||
| + | |||
| + | == Распределение и качество предсказаний == | ||
| + | |||
| + | Вероятностное предсказание должно не только часто приводить к правильному решению, но и корректно выражать степень уверенности. Если среди объектов, которым модель приписывает близкую вероятность некоторого события, это событие происходит примерно с такой же частотой, модель называется [[Калибровка вероятностей|калиброванной]]. | ||
| + | |||
| + | Высокая точность классификации не гарантирует хорошей калибровки. Экспериментальные исследования показали, что современные нейронные сети могут быть чрезмерно уверенными даже при высокой точности<ref name="guo">{{статья |автор=Guo C., Pleiss G., Sun Y., Weinberger K. Q. |заглавие=On Calibration of Modern Neural Networks |издание=Proceedings of the 34th International Conference on Machine Learning |год=2017 |том=70 |страницы=1321–1330}}</ref>. | ||
| + | |||
| + | Другая проблема возникает при [[Сдвиг распределения|сдвиге распределения]], когда данные во время применения модели отличаются от обучающих данных. При таком сдвиге значения вероятностей и оценки неопределённости могут стать ненадёжными, даже если модель уверенно выдаёт предсказания<ref name="ovadia">{{статья |автор=Ovadia Y., Fertig E., Ren J., Nado Z., Sculley D., Nowozin S., Dillon J. V., Lakshminarayanan B., Snoek J. |заглавие=Can You Trust Your Model's Uncertainty? Evaluating Predictive Uncertainty Under Dataset Shift |издание=Advances in Neural Information Processing Systems |год=2019 |том=32}}</ref>. | ||
| + | |||
| + | Поэтому вероятностные модели оценивают не только по доле правильных ответов. В зависимости от задачи дополнительно используют логарифмическую функцию потерь, оценку Брайера, калибровочные диаграммы и качество предсказаний при различных сдвигах данных. | ||
| + | |||
| + | == Выбор распределения в прикладных задачах == | ||
| + | |||
| + | Выбор распределения должен учитывать тип данных, механизм их возникновения и цель моделирования. | ||
| + | |||
| + | * '''Бинарный исход.''' Для события с двумя возможными результатами естественной базовой моделью является распределение Бернулли. | ||
| + | * '''Число успехов.''' При фиксированном числе независимых однотипных испытаний используется биномиальное распределение. | ||
| + | * '''Число событий за интервал.''' При определённых предположениях о независимости и постоянной интенсивности применяется распределение Пуассона. | ||
| + | * '''Время ожидания.''' Простейшей моделью времени до события является экспоненциальное распределение. | ||
| + | * '''Непрерывное измерение.''' Нормальное распределение часто используется для величин, возникающих как сумма большого числа малых воздействий. | ||
| + | * '''Положительная асимметричная величина.''' Могут использоваться гамма- или логнормальное распределения. | ||
| + | * '''Вероятность или доля.''' Для моделирования значений на единичном отрезке часто применяется бета-распределение. | ||
| + | * '''Данные с тяжёлыми хвостами.''' Вместо нормального распределения могут использоваться распределение Стьюдента или другие модели с повышенной вероятностью больших отклонений. | ||
| + | |||
| + | Соответствие распределения данным нельзя устанавливать только по внешнему сходству гистограммы. Необходимо учитывать предметный смысл, зависимость наблюдений, устойчивость оценок, поведение хвостов и качество предсказаний на новых данных. | ||
| + | |||
| + | == Отличие от смежных понятий == | ||
| + | |||
| + | * '''[[Выборка]]''' — конечный набор наблюдений. Распределение является вероятностной моделью процесса, который мог породить эту выборку. | ||
| + | * '''Функция распределения''' — один из способов полного задания распределения числовой случайной величины. Само распределение является более общим понятием вероятностной меры. | ||
| + | * '''Плотность вероятности''' — функция, с помощью которой задаётся абсолютно непрерывное распределение. Не каждое распределение имеет плотность. | ||
| + | * '''Функция вероятности''' задаёт вероятности отдельных значений дискретной случайной величины. | ||
| + | * '''Правдоподобие''' рассматривает вероятность или плотность фиксированных данных как функцию неизвестного параметра. Оно не является распределением параметра. | ||
| + | * '''Статистическая модель''' — множество возможных распределений, среди которых по данным выбирается или оценивается подходящее. | ||
| + | * '''Эмпирическое распределение''' строится непосредственно по выборке и служит оценкой неизвестного распределения генеральной совокупности. | ||
== Распространённые ошибки == | == Распространённые ошибки == | ||
| - | + | === Смешение распределения и выборки === | |
| - | + | Распределение является математической моделью неопределённости, а выборка — конкретным результатом наблюдений. Свойства одной выборки могут отличаться от свойств распределения из-за случайной изменчивости. | |
| - | + | === Интерпретация плотности как вероятности === | |
| - | + | Значение плотности в точке не является вероятностью. Для абсолютно непрерывной величины вероятность отдельного точного значения обычно равна нулю, а вероятность интервала вычисляется интегрированием плотности. | |
| + | |||
| + | === Вывод о независимости по нулевой корреляции === | ||
| + | |||
| + | Нулевая корреляция исключает только определённый вид линейной зависимости. Случайные величины могут быть некоррелированными, но зависимыми. | ||
| + | |||
| + | === Механический выбор известного распределения === | ||
| + | |||
| + | Нормальное распределение не является универсальной моделью для всех непрерывных данных. Асимметрия, ограниченная область значений, большое число нулей и тяжёлые хвосты могут требовать другого семейства распределений. | ||
| + | |||
| + | === Интерпретация вероятности как гарантии === | ||
| + | |||
| + | Высокая предсказанная вероятность не означает, что событие обязательно произойдёт. Кроме того, численная вероятность имеет практический смысл только при достаточной калибровке модели и соответствии условий применения обучающим данным. | ||
| + | |||
| + | === Игнорирование сдвига распределения === | ||
| + | |||
| + | Распределение будущих данных может отличаться от распределения обучающей выборки. Поэтому вероятностные модели требуют проверки на новых данных, мониторинга и повторного оценивания после изменения условий. | ||
== См. также == | == См. также == | ||
| - | * [[ | + | * [[Вероятность]] |
| - | * [[ | + | * [[Случайное событие]] |
| - | * [[ | + | * [[Случайная величина]] |
| - | * [[ | + | * [[Функция распределения]] |
| - | * [[ | + | * [[Плотность вероятности]] |
| - | * [[ | + | * [[Условная вероятность]] |
| - | * [[ | + | * [[Формула Байеса]] |
| - | * [[ | + | * [[Математическое ожидание]] |
| - | * [[ | + | * [[Дисперсия]] |
| - | * [[ | + | * [[Условная независимость]] |
| - | * [[ | + | * [[Вероятностная графическая модель]] |
| - | * [[ | + | * [[Метод максимального правдоподобия]] |
| - | * [[ | + | * [[Калибровка вероятностей]] |
| + | * [[Сдвиг распределения]] | ||
| - | == | + | == Примечания == |
| - | + | {{примечания}} | |
| + | |||
| + | == Литература == | ||
| - | + | * {{книга |автор=Billingsley P. |заглавие=Probability and Measure |издание=3rd ed. |место=New York |издательство=Wiley |год=1995}} | |
| - | + | * {{книга |автор=Bishop C. M. |заглавие=Pattern Recognition and Machine Learning |место=New York |издательство=Springer |год=2006 |isbn=978-0-387-31073-2}} | |
| - | + | * {{книга |автор=Durrett R. |заглавие=Probability: Theory and Examples |издание=5th ed. |место=Cambridge |издательство=Cambridge University Press |год=2019}} | |
| + | * {{книга |автор=Koller D., Friedman N. |заглавие=Probabilistic Graphical Models: Principles and Techniques |место=Cambridge, MA |издательство=MIT Press |год=2009 |isbn=978-0-262-01319-2}} | ||
| + | * {{книга |автор=Murphy K. P. |заглавие=Probabilistic Machine Learning: An Introduction |место=Cambridge, MA |издательство=MIT Press |год=2022}} | ||
| + | * {{статья |автор=Guo C., Pleiss G., Sun Y., Weinberger K. Q. |заглавие=On Calibration of Modern Neural Networks |издание=Proceedings of the 34th International Conference on Machine Learning |год=2017 |том=70 |страницы=1321–1330}} | ||
| + | * {{статья |автор=Ovadia Y., Fertig E., Ren J., Nado Z., Sculley D., Nowozin S., Dillon J. V., Lakshminarayanan B., Snoek J. |заглавие=Can You Trust Your Model's Uncertainty? Evaluating Predictive Uncertainty Under Dataset Shift |издание=Advances in Neural Information Processing Systems |год=2019 |том=32}} | ||
Текущая версия
Распределение вероятностей — математическое описание того, какие значения может принимать случайная величина или случайный вектор и как вероятность распределена между этими значениями. Распределение характеризует не только наиболее вероятные исходы, но и разброс значений, вероятность редких событий и зависимость между величинами.
В анализе данных и машинном обучении наблюдения обычно рассматриваются как значения, порождённые некоторым неизвестным распределением. Обучение модели можно понимать как оценивание этого распределения, приближение отдельных его характеристик или построение правила предсказания на его основе[1][1].
Основная идея
Распределение вероятностей отвечает на вопрос о том, как вероятность разделена между возможными результатами случайного эксперимента. Для дискретной величины можно непосредственно указать вероятность каждого значения. Для непрерывной величины вероятность обычно задаётся для интервалов и других областей значений.
Например, при броске правильной игральной кости каждое из шести значений имеет одинаковую вероятность. Рост случайно выбранного человека, напротив, изменяется практически непрерывно, поэтому его вероятностную модель удобнее описывать плотностью на числовой оси.
Распределение можно понимать как идеализированную карту неопределённости. Выборка содержит конечное число фактически полученных наблюдений, тогда как распределение описывает общий вероятностный закон, который мог породить эти наблюдения. Одно и то же распределение способно порождать различные выборки, а по одной конечной выборке обычно нельзя восстановить распределение без статистической погрешности.
Формальное определение
В современной теории вероятностей распределение определяется как вероятностная мера на пространстве значений случайной величины. Если случайная величина задана на некотором вероятностном пространстве, то её распределение сопоставляет каждому допустимому множеству значений вероятность попадания в это множество[1]:
Эта формула означает, что распределение переносит вероятности с пространства элементарных исходов на пространство значений случайной величины. Для использования распределения не обязательно знать внутреннее устройство исходного эксперимента: достаточно уметь вычислять вероятности множеств значений.
Распределение числовой случайной величины однозначно определяется её функцией распределения:
Функция распределения показывает вероятность того, что случайная величина не превысит заданного порога. Она определена для дискретных, непрерывных, смешанных и других распределений.
Любая функция распределения не убывает, непрерывна справа и имеет предельные значения ноль и единица на соответствующих бесконечностях. Эти свойства позволяют отличить функцию распределения от произвольной функции действительного аргумента.
Способы задания распределения
Дискретные распределения
Дискретное распределение описывает случайную величину, принимающую конечное или счётное множество значений. Оно задаётся функцией вероятности:
Значение функции равно вероятности того, что случайная величина примет конкретное значение. Все такие вероятности неотрицательны, а их сумма равна единице:
Условие нормировки означает, что одно из допустимых значений обязательно реализуется.
К распространённым дискретным распределениям относятся:
- Распределение Бернулли — модель одного испытания с двумя исходами;
- категориальное распределение — модель выбора одной категории из конечного множества;
- Биномиальное распределение — распределение числа успехов в серии независимых испытаний;
- Распределение Пуассона — модель числа событий на заданном интервале времени или пространства;
- геометрическое распределение — модель числа испытаний до первого успеха.
В машинном обучении дискретные распределения используются для моделирования классов, категориальных признаков, последовательностей символов и числа наблюдаемых событий.
Абсолютно непрерывные распределения
Распределение называется абсолютно непрерывным, если вероятности можно вычислять с помощью плотности вероятности:
Вероятность интервала равна площади под графиком плотности на этом интервале. При этом значение плотности в отдельной точке не является вероятностью этой точки.
Плотность должна быть неотрицательной и нормированной:
Значение плотности может быть больше единицы, если она сосредоточена на достаточно узкой области. Ограничение единицей относится к вероятностям, а не к значениям плотности.
Для абсолютно непрерывного распределения функция распределения выражается через плотность:
Если функция распределения дифференцируема, её производная почти всюду совпадает с плотностью.
К распространённым абсолютно непрерывным распределениям относятся:
- Равномерное распределение — распределение с постоянной плотностью на заданном интервале;
- Нормальное распределение — симметричное распределение, определяемое средним и дисперсией;
- экспоненциальное распределение — модель времени ожидания до события;
- гамма-распределение — семейство распределений положительных величин;
- бета-распределение — семейство распределений на единичном отрезке;
- распределение Стьюдента — симметричное распределение с более тяжёлыми хвостами, чем у нормального распределения.
В прикладной литературе абсолютно непрерывные распределения нередко называют просто непрерывными. Строго говоря, существуют непрерывные распределения, которые не имеют плотности, поэтому эти понятия не полностью совпадают.
Смешанные распределения
Смешанное распределение содержит как отдельные точки с положительной вероятностью, так и непрерывную составляющую. Например, размер страховой выплаты может с положительной вероятностью равняться нулю, а при наступлении страхового случая принимать положительные значения из непрерывного диапазона.
Смешанные распределения встречаются при моделировании нулевых расходов, времени ожидания с возможностью немедленного события, цен, страховых выплат и показателей с большим числом нулевых наблюдений.
Распределение в наиболее общей форме не обязано иметь ни функцию вероятности, ни плотность. Универсальным способом его задания остаётся вероятностная мера или функция распределения.
Совместные и маргинальные распределения
Для нескольких случайных величин используется совместное распределение. Оно описывает не только распределение каждой величины отдельно, но и вероятностную зависимость между ними.
В дискретном случае совместная функция вероятности двух величин определяется как
Она задаёт вероятность одновременного появления конкретной пары значений.
Из совместного распределения можно получить отдельное, или маргинальное, распределение одной величины:
Суммирование исключает вторую величину из рассмотрения, учитывая все возможные её значения.
Для распределения с совместной плотностью аналогичная операция выполняется интегрированием:
Совместные распределения особенно важны в анализе данных, поскольку один объект обычно описывается несколькими признаками. Такой набор признаков рассматривается как случайный вектор, а зависимости между признаками являются свойствами его совместного распределения.
Условные распределения
Условное распределение описывает поведение одной случайной величины при наличии информации о другой. Для дискретных величин условная функция вероятности определяется формулой
Условие ограничивает рассмотрение теми случаями, в которых первая величина приняла заданное значение. После такого ограничения вероятности возможных значений второй величины заново нормируются.
Совместное распределение можно восстановить из маргинального и условного распределений:
Это равенство называется правилом произведения вероятностей.
С помощью формулы Байеса направление условия можно изменить:
Формула позволяет перейти от распределения наблюдаемых признаков при заданной гипотезе к распределению гипотез при полученных признаках. На этом принципе основаны байесовские методы классификации.
Для непрерывных величин при наличии соответствующих плотностей используется аналогичное отношение:
Поскольку отдельное значение непрерывной величины обычно имеет нулевую вероятность, условное распределение в общем случае определяется не через вероятность отдельного события, а с помощью условных мер или условных плотностей.
Независимость и условная независимость
Случайные величины называются независимыми, если знание одной из них не изменяет распределение другой. Для дискретных величин независимость равносильна разложению совместного распределения:
Если равенство не выполняется хотя бы для одной пары допустимых значений, величины зависимы.
Зависимость не обязательно является линейной. Нулевая корреляция в общем случае не гарантирует независимость, хотя для некоторых специальных семейств распределений, в частности для совместно нормально распределённых величин, такое заключение возможно.
В вероятностных моделях также используется условная независимость. Две величины условно независимы при известной третьей, если после её учёта совместное условное распределение раскладывается в произведение:
Условная независимость позволяет компактно описывать сложные многомерные распределения. Она лежит в основе байесовских сетей, марковских сетей и других вероятностных графических моделей[1].
Числовые характеристики распределения
Полное распределение содержит больше информации, чем несколько числовых характеристик, однако такие характеристики позволяют кратко описывать его основные свойства.
Математическое ожидание характеризует среднее положение распределения. Для дискретной случайной величины оно определяется как
Возможные значения усредняются с весами, равными их вероятностям.
Для распределения с плотностью математическое ожидание имеет вид
Ожидание существует не для каждого распределения. Например, у распределения Коши обычное математическое ожидание не определено.
Дисперсия характеризует средний квадрат отклонения от математического ожидания:
Чем больше дисперсия, тем сильнее значения в среднем разбросаны относительно математического ожидания. Квадратный корень из дисперсии называется стандартным отклонением.
Для нескольких величин зависимость может описываться ковариацией и корреляцией. Эти показатели характеризуют главным образом линейную зависимость и не определяют совместное распределение полностью.
К другим характеристикам относятся медиана, квантили, мода, асимметрия и эксцесс. Два разных распределения могут иметь одинаковые математические ожидания и дисперсии, поэтому краткие характеристики не заменяют полного распределения.
Эмпирическое распределение
Истинное распределение данных в прикладных задачах обычно неизвестно. Исследователь располагает только конечной выборкой. На её основе строится эмпирическое распределение, которое присваивает одинаковую вероятностную массу каждому наблюдению:
Индикатор в сумме равен единице, если наблюдение принадлежит заданному множеству, и нулю в противном случае. Поэтому эмпирическая вероятность события равна доле наблюдений, для которых оно произошло.
Эмпирическая функция распределения определяется как
Она показывает долю наблюдений, не превышающих заданный порог. По мере увеличения объёма независимой одинаково распределённой выборки эмпирическая функция при стандартных условиях приближается к истинной функции распределения[1].
Предположение о независимых одинаково распределённых наблюдениях является важным упрощением. Оно может нарушаться во временных рядах, пространственных данных, социальных сетях и системах, где поведение пользователей изменяется со временем.
Оценивание распределений
Оценивание неизвестного распределения — одна из центральных задач статистики. Подходы к оцениванию обычно разделяют на параметрические и непараметрические.
Параметрический подход
В параметрическом подходе предполагается, что распределение принадлежит известному семейству, но его параметры неизвестны. Например, измерения могут моделироваться нормальным распределением с неизвестными математическим ожиданием и дисперсией.
Распространённым способом оценивания является метод максимального правдоподобия. Для независимых наблюдений функция правдоподобия имеет вид
Правдоподобие показывает, насколько хорошо различные значения параметра согласуются с наблюдаемой выборкой. Оно рассматривается как функция параметра при фиксированных данных и не является распределением вероятности параметра.
На практике обычно максимизируют логарифм правдоподобия:
Логарифм превращает произведение в сумму, облегчает дифференцирование и уменьшает риск численного переполнения или потери точности при умножении малых чисел.
В байесовском подходе параметру задаётся априорное распределение, которое после наблюдения данных преобразуется в апостериорное распределение. В результате неопределённость параметра описывается распределением, а не только одной точечной оценкой.
Непараметрический подход
Непараметрические методы не фиксируют конечномерное семейство распределений заранее. К ним относятся:
- эмпирическая функция распределения;
- гистограмма;
- ядерная оценка плотности;
- методы ближайших соседей;
- некоторые модели на основе процессов и смесей с изменяемым числом компонентов.
Непараметрические методы способны описывать более широкий класс форм распределения, но обычно требуют больше данных. В пространствах высокой размерности оценивание плотности становится особенно сложным из-за проклятия размерности.
Выбор между параметрическим и непараметрическим подходами зависит от объёма данных, размерности пространства, доступных предметных знаний и цели анализа.
Распределения в машинном обучении
Вероятностный взгляд на машинное обучение рассматривает признаки, ответы и параметры модели как случайные величины. В зависимости от задачи модель может оценивать совместное, маргинальное или условное распределение.
Обучение с учителем
В обучении с учителем по признакам объекта предсказывается целевая переменная. Вероятностная модель оценивает условное распределение ответа при наблюдаемых признаках.
В классификации решение часто выбирается как класс с наибольшей условной вероятностью:
Такое правило является оптимальным при условии, что все ошибки классификации имеют одинаковую стоимость и модель правильно описывает условные вероятности.
В регрессии при квадратичной функции потерь оптимальным точечным прогнозом является условное математическое ожидание:
При других функциях потерь оптимальный прогноз может соответствовать условной медиане, квантилю или другой характеристике условного распределения. Поэтому выбор функции потерь связан с тем, какую характеристику распределения должна оценивать модель.
Дискриминативные и генеративные модели
Дискриминативная модель непосредственно описывает распределение целевой переменной при известных признаках или границу принятия решений. К таким моделям относятся логистическая регрессия и многие нейронные классификаторы.
Генеративная модель описывает распределение наблюдаемых данных либо совместное распределение признаков и целевой переменной. Из совместного распределения можно получить условное распределение с помощью формулы Байеса.
К генеративным моделям относятся смеси распределений, наивный байесовский классификатор, скрытые марковские модели, вариационные автоэнкодеры и вероятностные графические модели[1].
Граница между двумя группами не всегда абсолютна: отдельные методы могут сочетать генеративные и дискриминативные компоненты.
Правдоподобие и функции потерь
Многие функции потерь в машинном обучении имеют вероятностную интерпретацию. Минимизация отрицательного логарифма правдоподобия соответствует выбору параметров, при которых обучающая выборка наиболее согласуется с моделью:
В многоклассовой классификации этот принцип приводит к перекрёстной энтропии. В регрессии предположение о нормальном распределении ошибок с постоянной дисперсией приводит к минимизации суммы квадратов отклонений.
Вероятностная интерпретация помогает понять предположения, скрытые за функцией потерь. Замена распределения ошибок может привести к другой функции потерь и другой устойчивости к выбросам.
Вероятностные графические модели
Вероятностные графические модели представляют многомерное распределение с помощью графа. Структура графа кодирует условные зависимости и позволяет разложить сложное совместное распределение на более простые множители.
В байесовской сети совместное распределение раскладывается по родительским узлам:
Такое представление позволяет компактно задавать распределения большой размерности и выполнять вероятностный вывод при частично наблюдаемых данных[1].
Распределение и качество предсказаний
Вероятностное предсказание должно не только часто приводить к правильному решению, но и корректно выражать степень уверенности. Если среди объектов, которым модель приписывает близкую вероятность некоторого события, это событие происходит примерно с такой же частотой, модель называется калиброванной.
Высокая точность классификации не гарантирует хорошей калибровки. Экспериментальные исследования показали, что современные нейронные сети могут быть чрезмерно уверенными даже при высокой точности[1].
Другая проблема возникает при сдвиге распределения, когда данные во время применения модели отличаются от обучающих данных. При таком сдвиге значения вероятностей и оценки неопределённости могут стать ненадёжными, даже если модель уверенно выдаёт предсказания[1].
Поэтому вероятностные модели оценивают не только по доле правильных ответов. В зависимости от задачи дополнительно используют логарифмическую функцию потерь, оценку Брайера, калибровочные диаграммы и качество предсказаний при различных сдвигах данных.
Выбор распределения в прикладных задачах
Выбор распределения должен учитывать тип данных, механизм их возникновения и цель моделирования.
- Бинарный исход. Для события с двумя возможными результатами естественной базовой моделью является распределение Бернулли.
- Число успехов. При фиксированном числе независимых однотипных испытаний используется биномиальное распределение.
- Число событий за интервал. При определённых предположениях о независимости и постоянной интенсивности применяется распределение Пуассона.
- Время ожидания. Простейшей моделью времени до события является экспоненциальное распределение.
- Непрерывное измерение. Нормальное распределение часто используется для величин, возникающих как сумма большого числа малых воздействий.
- Положительная асимметричная величина. Могут использоваться гамма- или логнормальное распределения.
- Вероятность или доля. Для моделирования значений на единичном отрезке часто применяется бета-распределение.
- Данные с тяжёлыми хвостами. Вместо нормального распределения могут использоваться распределение Стьюдента или другие модели с повышенной вероятностью больших отклонений.
Соответствие распределения данным нельзя устанавливать только по внешнему сходству гистограммы. Необходимо учитывать предметный смысл, зависимость наблюдений, устойчивость оценок, поведение хвостов и качество предсказаний на новых данных.
Отличие от смежных понятий
- Выборка — конечный набор наблюдений. Распределение является вероятностной моделью процесса, который мог породить эту выборку.
- Функция распределения — один из способов полного задания распределения числовой случайной величины. Само распределение является более общим понятием вероятностной меры.
- Плотность вероятности — функция, с помощью которой задаётся абсолютно непрерывное распределение. Не каждое распределение имеет плотность.
- Функция вероятности задаёт вероятности отдельных значений дискретной случайной величины.
- Правдоподобие рассматривает вероятность или плотность фиксированных данных как функцию неизвестного параметра. Оно не является распределением параметра.
- Статистическая модель — множество возможных распределений, среди которых по данным выбирается или оценивается подходящее.
- Эмпирическое распределение строится непосредственно по выборке и служит оценкой неизвестного распределения генеральной совокупности.
Распространённые ошибки
Смешение распределения и выборки
Распределение является математической моделью неопределённости, а выборка — конкретным результатом наблюдений. Свойства одной выборки могут отличаться от свойств распределения из-за случайной изменчивости.
Интерпретация плотности как вероятности
Значение плотности в точке не является вероятностью. Для абсолютно непрерывной величины вероятность отдельного точного значения обычно равна нулю, а вероятность интервала вычисляется интегрированием плотности.
Вывод о независимости по нулевой корреляции
Нулевая корреляция исключает только определённый вид линейной зависимости. Случайные величины могут быть некоррелированными, но зависимыми.
Механический выбор известного распределения
Нормальное распределение не является универсальной моделью для всех непрерывных данных. Асимметрия, ограниченная область значений, большое число нулей и тяжёлые хвосты могут требовать другого семейства распределений.
Интерпретация вероятности как гарантии
Высокая предсказанная вероятность не означает, что событие обязательно произойдёт. Кроме того, численная вероятность имеет практический смысл только при достаточной калибровке модели и соответствии условий применения обучающим данным.
Игнорирование сдвига распределения
Распределение будущих данных может отличаться от распределения обучающей выборки. Поэтому вероятностные модели требуют проверки на новых данных, мониторинга и повторного оценивания после изменения условий.
См. также
- Вероятность
- Случайное событие
- Случайная величина
- Функция распределения
- Плотность вероятности
- Условная вероятность
- Формула Байеса
- Математическое ожидание
- Дисперсия
- Условная независимость
- Вероятностная графическая модель
- Метод максимального правдоподобия
- Калибровка вероятностей
- Сдвиг распределения
Примечания
Литература
- Billingsley P. Probability and Measure. — 3rd ed.. — New York: Wiley, 1995.
- Bishop C. M. Pattern Recognition and Machine Learning. — New York: Springer, 2006. — ISBN 978-0-387-31073-2
- Durrett R. Probability: Theory and Examples. — 5th ed.. — Cambridge: Cambridge University Press, 2019.
- Koller D., Friedman N. Probabilistic Graphical Models: Principles and Techniques. — Cambridge, MA: MIT Press, 2009. — ISBN 978-0-262-01319-2
- Murphy K. P. Probabilistic Machine Learning: An Introduction. — Cambridge, MA: MIT Press, 2022.
- Guo C., Pleiss G., Sun Y., Weinberger K. Q. On Calibration of Modern Neural Networks // Proceedings of the 34th International Conference on Machine Learning. — 2017. — Т. 70. — С. 1321–1330.
- Ovadia Y., Fertig E., Ren J., Nado Z., Sculley D., Nowozin S., Dillon J. V., Lakshminarayanan B., Snoek J. Can You Trust Your Model's Uncertainty? Evaluating Predictive Uncertainty Under Dataset Shift // Advances in Neural Information Processing Systems. — 2019. — Т. 32.

