Распределение вероятностей

Материал из MachineLearning.

(Различия между версиями)
Перейти к: навигация, поиск
(Новая: '''Распределение вероятностей''' — это математическое описание того, какие значения может принимать [[...)
 
Строка 1: Строка 1:
-
'''Распределение вероятностей''' — это математическое описание того, какие значения может принимать [[случайная величина]] или случайный вектор и с какими [[вероятность|вероятностями]] эти значения связаны. В прикладном смысле распределение задаёт модель неопределённости: оно показывает не только наиболее вероятные исходы, но и разброс, редкие события, зависимость между величинами и степень уверенности в предсказаниях.
+
{{TOCright}}
-
В [[анализ данных|анализе данных]] и [[машинное обучение|машинном обучении]] распределения вероятностей играют центральную роль. Данные обычно рассматриваются как наблюдения, порождённые некоторым неизвестным распределением, а обучение модели можно понимать как попытку восстановить это распределение, аппроксимировать его отдельные свойства или научиться делать предсказания на его основе.<ref name="Bishop2006">Bishop C. M. ''Pattern Recognition and Machine Learning''. Springer, 2006.</ref><ref name="Murphy2012">Murphy K. P. ''Machine Learning: A Probabilistic Perspective''. MIT Press, 2012.</ref>
+
'''Распределение вероятностей''' — математическое описание того, какие значения может принимать [[случайная величина]] или случайный вектор и как [[вероятность]] распределена между этими значениями. Распределение характеризует не только наиболее вероятные исходы, но и разброс значений, вероятность редких событий и зависимость между величинами.
 +
 
 +
В [[Анализ данных|анализе данных]] и [[Машинное обучение|машинном обучении]] наблюдения обычно рассматриваются как значения, порождённые некоторым неизвестным распределением. Обучение модели можно понимать как оценивание этого распределения, приближение отдельных его характеристик или построение правила предсказания на его основе<ref name="bishop">{{книга |автор=Bishop C. M. |заглавие=Pattern Recognition and Machine Learning |место=New York |издательство=Springer |год=2006 |isbn=978-0-387-31073-2}}</ref><ref name="murphy">{{книга |автор=Murphy K. P. |заглавие=Probabilistic Machine Learning: An Introduction |место=Cambridge, MA |издательство=MIT Press |год=2022}}</ref>.
== Основная идея ==
== Основная идея ==
-
Распределение вероятностей отвечает на вопрос: как вероятность распределена между возможными исходами. Если случайная величина <tex>X</tex> описывает результат эксперимента, то её распределение определяет, какие значения <tex>x</tex> возможны и насколько они вероятны.
+
Распределение вероятностей отвечает на вопрос о том, как вероятность разделена между возможными результатами случайного эксперимента. Для дискретной величины можно непосредственно указать вероятность каждого значения. Для непрерывной величины вероятность обычно задаётся для интервалов и других областей значений.
-
Например, если <tex>X</tex> — результат броска правильной игральной кости, то каждое из значений <tex>1,2,3,4,5,6</tex> имеет вероятность <tex>1/6</tex>. Если <tex>X</tex> — рост случайно выбранного человека, то возможные значения образуют практически непрерывный диапазон, и вероятность описывается не отдельными точками, а плотностью на числовой оси.
+
Например, при броске правильной игральной кости каждое из шести значений имеет одинаковую вероятность. Рост случайно выбранного человека, напротив, изменяется практически непрерывно, поэтому его вероятностную модель удобнее описывать плотностью на числовой оси.
-
Интуитивно распределение можно понимать как идеализированную «карту неопределённости». Выборка данных показывает лишь конечный набор наблюдений, а распределение описывает общий закон, из которого эти наблюдения могли быть получены. Поэтому различают эмпирические свойства конкретного набора данных и вероятностные свойства предполагаемой генеральной совокупности.
+
Распределение можно понимать как идеализированную карту неопределённости. [[Выборка]] содержит конечное число фактически полученных наблюдений, тогда как распределение описывает общий вероятностный закон, который мог породить эти наблюдения. Одно и то же распределение способно порождать различные выборки, а по одной конечной выборке обычно нельзя восстановить распределение без статистической погрешности.
== Формальное определение ==
== Формальное определение ==
-
В современной теории вероятностей распределение случайной величины определяется через вероятностную меру. Пусть <tex>X</tex> — случайная величина, заданная на вероятностном пространстве. Тогда распределением <tex>X</tex> называется мера, которая каждому допустимому множеству значений <tex>A</tex> сопоставляет вероятность того, что <tex>X</tex> попадёт в это множество:<ref name="Kolmogorov1933">Kolmogorov A. N. ''Grundbegriffe der Wahrscheinlichkeitsrechnung''. Berlin: Springer, 1933.</ref><ref name="Billingsley1995">Billingsley P. ''Probability and Measure''. 3rd ed. Wiley, 1995.</ref>
+
В современной [[Теория вероятностей|теории вероятностей]] распределение определяется как вероятностная мера на пространстве значений случайной величины. Если случайная величина задана на некотором вероятностном пространстве, то её распределение сопоставляет каждому допустимому множеству значений вероятность попадания в это множество<ref name="billingsley">{{книга |автор=Billingsley P. |заглавие=Probability and Measure |издание=3rd ed. |место=New York |издательство=Wiley |год=1995}}</ref>:
-
:<tex>P_X(A)=P(X \in A)</tex>
+
:<tex>P_X(A)=P(X\in A).</tex>
-
Эта формула означает, что распределение <tex>P_X</tex> переносит вероятность с исходного пространства элементарных исходов на пространство значений случайной величины. На практике часто говорят просто «распределение <tex>X</tex>», имея в виду правило, по которому можно находить вероятности событий вида <tex>X \in A</tex>.
+
Эта формула означает, что распределение переносит вероятности с пространства элементарных исходов на пространство значений случайной величины. Для использования распределения не обязательно знать внутреннее устройство исходного эксперимента: достаточно уметь вычислять вероятности множеств значений.
-
Если случайная величина принимает числовые значения, её распределение часто задают с помощью функции распределения:
+
Распределение числовой случайной величины однозначно определяется её [[Функция распределения|функцией распределения]]:
-
:<tex>F_X(x)=P(X \leq x)</tex>
+
:<tex>F_X(x)=P(X\leq x).</tex>
-
Функция распределения показывает вероятность того, что значение случайной величины не превосходит заданного порога <tex>x</tex>. Она применима как к дискретным, так и к непрерывным распределениям.
+
Функция распределения показывает вероятность того, что случайная величина не превысит заданного порога. Она определена для дискретных, непрерывных, смешанных и других распределений.
-
== Дискретные распределения ==
+
Любая функция распределения не убывает, непрерывна справа и имеет предельные значения ноль и единица на соответствующих бесконечностях. Эти свойства позволяют отличить функцию распределения от произвольной функции действительного аргумента.
-
'''Дискретное распределение''' описывает случайную величину, принимающую конечное или счётное число значений. В этом случае распределение удобно задавать функцией вероятности:
+
== Способы задания распределения ==
-
:<tex>p_X(x)=P(X=x)</tex>
+
=== Дискретные распределения ===
-
Значение <tex>p_X(x)</tex> — это вероятность того, что случайная величина примет ровно значение <tex>x</tex>. Для всех возможных значений вероятности неотрицательны и в сумме дают единицу:
+
'''Дискретное распределение''' описывает случайную величину, принимающую конечное или счётное множество значений. Оно задаётся [[Функция вероятности|функцией вероятности]]:
-
:<tex>\sum_x p_X(x)=1</tex>
+
:<tex>p_X(x)=P(X=x).</tex>
-
Эта формула выражает простое требование: одно из возможных значений должно реализоваться, а суммарная вероятность всех взаимоисключающих вариантов равна единице.
+
Значение функции равно вероятности того, что случайная величина примет конкретное значение. Все такие вероятности неотрицательны, а их сумма равна единице:
-
К типичным дискретным распределениям относятся:
+
:<tex>\sum_x p_X(x)=1.</tex>
-
* '''распределение Бернулли''' — модель одного бинарного испытания, например успеха или неуспеха;
+
Условие нормировки означает, что одно из допустимых значений обязательно реализуется.
-
* '''категориальное распределение''' — модель выбора одного класса из нескольких;
+
-
* '''биномиальное распределение''' — модель числа успехов в серии независимых испытаний;
+
-
* '''распределение Пуассона''' — модель числа редких событий на фиксированном интервале времени или пространства.
+
-
В машинном обучении дискретные распределения возникают в задачах [[классификация|классификации]], моделирования категориальных признаков, языкового моделирования и оценки вероятностей классов.
+
К распространённым дискретным распределениям относятся:
-
== Непрерывные распределения ==
+
* '''[[Распределение Бернулли]]''' — модель одного испытания с двумя исходами;
 +
* '''категориальное распределение''' — модель выбора одной категории из конечного множества;
 +
* '''[[Биномиальное распределение]]''' — распределение числа успехов в серии независимых испытаний;
 +
* '''[[Распределение Пуассона]]''' — модель числа событий на заданном интервале времени или пространства;
 +
* '''геометрическое распределение''' — модель числа испытаний до первого успеха.
-
'''Непрерывное распределение''' описывает случайную величину, значения которой лежат на непрерывной шкале. Для таких величин вероятность отдельного точного значения обычно равна нулю, поэтому распределение задают не вероятностями точек, а плотностью вероятности:
+
В машинном обучении дискретные распределения используются для моделирования классов, категориальных признаков, последовательностей символов и числа наблюдаемых событий.
-
:<tex>P(a \leq X \leq b)=\int_a^b f_X(x) dx</tex>
+
=== Абсолютно непрерывные распределения ===
-
Плотность <tex>f_X(x)</tex> показывает, как вероятность распределена около точки <tex>x</tex>. Сама плотность не является вероятностью: она может быть больше единицы, но площадь под графиком плотности на всём пространстве значений должна равняться единице:
+
Распределение называется '''абсолютно непрерывным''', если вероятности можно вычислять с помощью [[Плотность вероятности|плотности вероятности]]:
-
:<tex>\int_{-\infty}^{\infty} f_X(x) dx=1</tex>
+
:<tex>P(a\leq X\leq b)=\int_a^b f_X(x)\,dx.</tex>
-
Эта формула означает, что вся вероятность сосредоточена где-то на числовой оси. Вероятность интервала равна площади под графиком плотности на этом интервале.
+
Вероятность интервала равна площади под графиком плотности на этом интервале. При этом значение плотности в отдельной точке не является вероятностью этой точки.
-
К распространённым непрерывным распределениям относятся:
+
Плотность должна быть неотрицательной и нормированной:
-
* '''равномерное распределение''' — все значения на заданном интервале имеют одинаковую плотность;
+
:<tex>\int_{-\infty}^{\infty}f_X(x)\,dx=1.</tex>
-
* '''нормальное распределение''' — симметричное распределение с характерной колоколообразной формой;
+
 
 +
Значение плотности может быть больше единицы, если она сосредоточена на достаточно узкой области. Ограничение единицей относится к вероятностям, а не к значениям плотности.
 +
 
 +
Для абсолютно непрерывного распределения функция распределения выражается через плотность:
 +
 
 +
:<tex>F_X(x)=\int_{-\infty}^{x}f_X(t)\,dt.</tex>
 +
 
 +
Если функция распределения дифференцируема, её производная почти всюду совпадает с плотностью.
 +
 
 +
К распространённым абсолютно непрерывным распределениям относятся:
 +
 
 +
* '''[[Равномерное распределение]]''' — распределение с постоянной плотностью на заданном интервале;
 +
* '''[[Нормальное распределение]]''' — симметричное распределение, определяемое средним и дисперсией;
* '''экспоненциальное распределение''' — модель времени ожидания до события;
* '''экспоненциальное распределение''' — модель времени ожидания до события;
-
* '''гамма-распределение''' — более гибкая модель положительных величин и времён ожидания;
+
* '''гамма-распределение''' — семейство распределений положительных величин;
-
* '''бета-распределение''' — распределение на отрезке <tex>[0,1]</tex>, часто используемое для вероятностей и долей.
+
* '''бета-распределение''' — семейство распределений на единичном отрезке;
 +
* '''распределение Стьюдента''' — симметричное распределение с более тяжёлыми хвостами, чем у нормального распределения.
-
Непрерывные распределения применяются при моделировании измерений, шумов, ошибок, времён ожидания, непрерывных признаков и параметров моделей.
+
В прикладной литературе абсолютно непрерывные распределения нередко называют просто непрерывными. Строго говоря, существуют непрерывные распределения, которые не имеют плотности, поэтому эти понятия не полностью совпадают.
-
== Смешанные распределения ==
+
=== Смешанные распределения ===
-
Не все распределения являются чисто дискретными или чисто непрерывными. В некоторых задачах возникает '''смешанное распределение''', содержащее и отдельные атомы вероятности, и непрерывную часть.
+
'''Смешанное распределение''' содержит как отдельные точки с положительной вероятностью, так и непрерывную составляющую. Например, размер страховой выплаты может с положительной вероятностью равняться нулю, а при наступлении страхового случая принимать положительные значения из непрерывного диапазона.
-
Например, время ожидания может иметь положительную вероятность быть равным нулю, если событие уже произошло, а для положительных значений описываться непрерывной плотностью. В анализе данных такие ситуации встречаются при моделировании нулевых значений, пропусков, цен, страховых выплат и счётчиков с большим числом нулей.
+
Смешанные распределения встречаются при моделировании нулевых расходов, времени ожидания с возможностью немедленного события, цен, страховых выплат и показателей с большим числом нулевых наблюдений.
-
== Совместные распределения ==
+
Распределение в наиболее общей форме не обязано иметь ни функцию вероятности, ни плотность. Универсальным способом его задания остаётся вероятностная мера или функция распределения.
-
Если рассматриваются несколько случайных величин, их поведение описывается '''совместным распределением'''. Для двух случайных величин <tex>X</tex> и <tex>Y</tex> совместное распределение задаёт вероятности или плотности пар значений.
+
== Совместные и маргинальные распределения ==
-
В дискретном случае:
+
Для нескольких случайных величин используется '''совместное распределение'''. Оно описывает не только распределение каждой величины отдельно, но и вероятностную зависимость между ними.
-
:<tex>p(x,y)=P(X=x,Y=y)</tex>
+
В дискретном случае совместная функция вероятности двух величин определяется как
-
Эта величина показывает вероятность того, что одновременно выполнены два условия: <tex>X</tex> приняла значение <tex>x</tex>, а <tex>Y</tex> — значение <tex>y</tex>.
+
:<tex>p_{X,Y}(x,y)=P(X=x,Y=y).</tex>
-
Из совместного распределения можно получить отдельные, или '''маргинальные''', распределения. В дискретном случае:
+
Она задаёт вероятность одновременного появления конкретной пары значений.
-
:<tex>p_X(x)=\sum_y p(x,y)</tex>
+
Из совместного распределения можно получить отдельное, или '''маргинальное''', распределение одной величины:
-
Здесь суммирование по всем значениям <tex>y</tex> означает, что для нахождения распределения <tex>X</tex> величина <tex>Y</tex> «исключается» из рассмотрения.
+
:<tex>p_X(x)=\sum_y p_{X,Y}(x,y).</tex>
-
В непрерывном случае аналогичная операция выполняется интегрированием:
+
Суммирование исключает вторую величину из рассмотрения, учитывая все возможные её значения.
-
:<tex>f_X(x)=\int f(x,y) dy</tex>
+
Для распределения с совместной плотностью аналогичная операция выполняется интегрированием:
-
Совместные распределения особенно важны в машинном обучении, потому что данные обычно состоят из многих признаков. Вектор признаков объекта можно рассматривать как случайный вектор, а зависимость между признаками — как часть совместного распределения.
+
:<tex>f_X(x)=\int_{-\infty}^{\infty}f_{X,Y}(x,y)\,dy.</tex>
 +
 
 +
Совместные распределения особенно важны в анализе данных, поскольку один объект обычно описывается несколькими признаками. Такой набор признаков рассматривается как [[Случайный вектор|случайный вектор]], а зависимости между признаками являются свойствами его совместного распределения.
== Условные распределения ==
== Условные распределения ==
-
'''Условное распределение''' описывает распределение одной случайной величины при известном значении другой. Для дискретных величин оно определяется формулой:
+
'''Условное распределение''' описывает поведение одной случайной величины при наличии информации о другой. Для дискретных величин условная функция вероятности определяется формулой
-
:<tex>p(y \mid x)=\frac{p(x,y)}{p_X(x)}</tex>
+
:<tex>p_{Y\mid X}(y\mid x)=\frac{p_{X,Y}(x,y)}{p_X(x)},\quad p_X(x)>0.</tex>
-
Эта формула показывает, как меняется распределение <tex>Y</tex>, если известно, что <tex>X=x</tex>. Условие не добавляет новую случайность, а ограничивает рассмотрение теми случаями, где наблюдается заданное значение <tex>X</tex>.
+
Условие ограничивает рассмотрение теми случаями, в которых первая величина приняла заданное значение. После такого ограничения вероятности возможных значений второй величины заново нормируются.
-
В машинном обучении условные распределения имеют фундаментальное значение. В задаче предсказания целевой переменной <tex>Y</tex> по признакам <tex>X</tex> модель часто стремится оценить распределение:
+
Совместное распределение можно восстановить из маргинального и условного распределений:
-
:<tex>P(Y \mid X)</tex>
+
:<tex>p_{X,Y}(x,y)=p_{Y\mid X}(y\mid x)p_X(x).</tex>
-
Это распределение описывает не только один прогноз, но и неопределённость вокруг него. Например, в классификации модель может выдавать вероятности классов, а в регрессии — распределение возможных значений ответа.
+
Это равенство называется правилом произведения вероятностей.
-
Связь между совместным, маргинальным и условным распределениями выражается правилом произведения:
+
С помощью [[Формула Байеса|формулы Байеса]] направление условия можно изменить:
-
:<tex>p(x,y)=p(y \mid x)p_X(x)</tex>
+
:<tex>p_{Y\mid X}(y\mid x)=\frac{p_{X\mid Y}(x\mid y)p_Y(y)}{p_X(x)}.</tex>
-
Смысл этой формулы состоит в том, что вероятность совместного наблюдения можно разложить на вероятность признака <tex>x</tex> и вероятность ответа <tex>y</tex> при данном признаке.
+
Формула позволяет перейти от распределения наблюдаемых признаков при заданной гипотезе к распределению гипотез при полученных признаках. На этом принципе основаны байесовские методы классификации.
-
Условные распределения связаны с [[формула Байеса|формулой Байеса]]:
+
Для непрерывных величин при наличии соответствующих плотностей используется аналогичное отношение:
-
:<tex>p(y \mid x)=\frac{p(x \mid y)p(y)}{p(x)}</tex>
+
:<tex>f_{Y\mid X}(y\mid x)=\frac{f_{X,Y}(x,y)}{f_X(x)}.</tex>
-
Эта формула позволяет перейти от распределения признаков при заданном классе к распределению классов при наблюдаемых признаках. На ней основаны байесовские методы классификации, включая [[наивный байесовский классификатор]].
+
Поскольку отдельное значение непрерывной величины обычно имеет нулевую вероятность, условное распределение в общем случае определяется не через вероятность отдельного события, а с помощью условных мер или условных плотностей.
== Независимость и условная независимость ==
== Независимость и условная независимость ==
-
Две случайные величины называются независимыми, если знание одной из них не меняет распределение другой. Для дискретного случая это записывается как:
+
Случайные величины называются [[Независимость (теория вероятностей)|независимыми]], если знание одной из них не изменяет распределение другой. Для дискретных величин независимость равносильна разложению совместного распределения:
-
:<tex>p(x,y)=p_X(x)p_Y(y)</tex>
+
:<tex>p_{X,Y}(x,y)=p_X(x)p_Y(y).</tex>
-
Формула означает, что совместное распределение распадается на произведение двух маргинальных распределений. Если такое равенство не выполняется, между величинами существует вероятностная зависимость.
+
Если равенство не выполняется хотя бы для одной пары допустимых значений, величины зависимы.
-
В более сложных моделях важна [[условная независимость]]. Случайные величины <tex>X</tex> и <tex>Y</tex> условно независимы при заданной <tex>Z</tex>, если после учёта <tex>Z</tex> знание <tex>X</tex> не даёт дополнительной информации о <tex>Y</tex>:
+
Зависимость не обязательно является линейной. Нулевая корреляция в общем случае не гарантирует независимость, хотя для некоторых специальных семейств распределений, в частности для совместно нормально распределённых величин, такое заключение возможно.
-
:<tex>p(x,y \mid z)=p(x \mid z)p(y \mid z)</tex>
+
В вероятностных моделях также используется '''условная независимость'''. Две величины условно независимы при известной третьей, если после её учёта совместное условное распределение раскладывается в произведение:
-
Условная независимость лежит в основе [[байесовская сеть|байесовских сетей]] и других вероятностных графических моделей. Она позволяет компактно задавать сложные совместные распределения через набор локальных условных распределений.<ref name="Pearl1988">Pearl J. ''Probabilistic Reasoning in Intelligent Systems: Networks of Plausible Inference''. Morgan Kaufmann, 1988.</ref><ref name="KollerFriedman2009">Koller D., Friedman N. ''Probabilistic Graphical Models: Principles and Techniques''. MIT Press, 2009.</ref>
+
:<tex>p(x,y\mid z)=p(x\mid z)p(y\mid z).</tex>
-
== Параметры распределения ==
+
Условная независимость позволяет компактно описывать сложные многомерные распределения. Она лежит в основе [[Байесовская сеть|байесовских сетей]], марковских сетей и других [[Вероятностная графическая модель|вероятностных графических моделей]]<ref name="koller">{{книга |автор=Koller D., Friedman N. |заглавие=Probabilistic Graphical Models: Principles and Techniques |место=Cambridge, MA |издательство=MIT Press |год=2009 |isbn=978-0-262-01319-2}}</ref>.
-
Многие распределения описываются небольшим числом параметров. Например, нормальное распределение задаётся математическим ожиданием и дисперсией, а распределение Бернулли — вероятностью успеха.
+
== Числовые характеристики распределения ==
-
'''Математическое ожидание''' характеризует центральное положение распределения:
+
Полное распределение содержит больше информации, чем несколько числовых характеристик, однако такие характеристики позволяют кратко описывать его основные свойства.
-
:<tex>E[X]=\sum_x x p_X(x)</tex>
+
'''[[Математическое ожидание]]''' характеризует среднее положение распределения. Для дискретной случайной величины оно определяется как
-
Для дискретной случайной величины это средневзвешенное значение, где веса равны вероятностям отдельных исходов.
+
:<tex>E[X]=\sum_x x\,p_X(x).</tex>
-
Для непрерывной случайной величины математическое ожидание записывается через плотность:
+
Возможные значения усредняются с весами, равными их вероятностям.
-
:<tex>E[X]=\int x f_X(x) dx</tex>
+
Для распределения с плотностью математическое ожидание имеет вид
-
Здесь интеграл играет ту же роль, что сумма в дискретном случае: он усредняет возможные значения с учётом их плотности.
+
:<tex>E[X]=\int_{-\infty}^{\infty}x\,f_X(x)\,dx.</tex>
-
'''Дисперсия''' описывает разброс значений вокруг математического ожидания:
+
Ожидание существует не для каждого распределения. Например, у распределения Коши обычное математическое ожидание не определено.
-
:<tex>Var(X)=E[(X-E[X])^2]</tex>
+
'''[[Дисперсия]]''' характеризует средний квадрат отклонения от математического ожидания:
-
Чем больше дисперсия, тем сильнее значения случайной величины обычно отклоняются от среднего. В анализе данных дисперсия помогает отличать устойчивые признаки от сильно изменчивых.
+
:<tex>{\rm Var}(X)=E[(X-E[X])^2].</tex>
-
Кроме ожидания и дисперсии используют медиану, квантили, асимметрию, эксцесс, ковариацию и корреляцию. Эти характеристики не заменяют распределение полностью, но дают краткое описание его важных свойств.
+
Чем больше дисперсия, тем сильнее значения в среднем разбросаны относительно математического ожидания. Квадратный корень из дисперсии называется стандартным отклонением.
 +
 
 +
Для нескольких величин зависимость может описываться [[Ковариация|ковариацией]] и [[Корреляция|корреляцией]]. Эти показатели характеризуют главным образом линейную зависимость и не определяют совместное распределение полностью.
 +
 
 +
К другим характеристикам относятся медиана, квантили, мода, асимметрия и эксцесс. Два разных распределения могут иметь одинаковые математические ожидания и дисперсии, поэтому краткие характеристики не заменяют полного распределения.
== Эмпирическое распределение ==
== Эмпирическое распределение ==
-
В прикладных задачах истинное распределение данных обычно неизвестно. Вместо него доступна выборка:
+
Истинное распределение данных в прикладных задачах обычно неизвестно. Исследователь располагает только конечной выборкой. На её основе строится '''эмпирическое распределение''', которое присваивает одинаковую вероятностную массу каждому наблюдению:
-
:<tex>x_1,x_2,\ldots,x_n</tex>
+
:<tex>\widehat{P}_n(A)=\frac{1}{n}\sum_{i=1}^{n}I(x_i\in A).</tex>
-
По выборке можно построить '''эмпирическое распределение''', которое присваивает равную массу каждому наблюдённому значению:
+
Индикатор в сумме равен единице, если наблюдение принадлежит заданному множеству, и нулю в противном случае. Поэтому эмпирическая вероятность события равна доле наблюдений, для которых оно произошло.
-
:<tex>\hat{P}_n(A)=\frac{1}{n}\sum_{i=1}^n I(x_i \in A)</tex>
+
Эмпирическая функция распределения определяется как
-
Эта формула означает, что вероятность события <tex>A</tex> оценивается как доля наблюдений, попавших в <tex>A</tex>. Эмпирическое распределение является базовой идеей статистики: многие оценки, графики и проверки гипотез можно рассматривать как способы изучения эмпирического распределения и его связи с неизвестным истинным распределением.<ref name="Feller1968">Feller W. ''An Introduction to Probability Theory and Its Applications''. Vol. 1. 3rd ed. Wiley, 1968.</ref><ref name="Durrett2019">Durrett R. ''Probability: Theory and Examples''. 5th ed. Cambridge University Press, 2019.</ref>
+
:<tex>\widehat{F}_n(x)=\frac{1}{n}\sum_{i=1}^{n}I(x_i\leq x).</tex>
-
В машинном обучении выборка обычно считается набором независимых наблюдений из одного распределения. Это предположение часто обозначают как i.i.d. — independent and identically distributed. Оно означает, что объекты независимы друг от друга и порождены одним и тем же распределением. На практике это предположение может нарушаться из-за временной зависимости, смещения выборки, изменения поведения пользователей или различий между обучающими и тестовыми данными.
+
Она показывает долю наблюдений, не превышающих заданный порог. По мере увеличения объёма независимой одинаково распределённой выборки эмпирическая функция при стандартных условиях приближается к истинной функции распределения<ref name="durrett">{{книга |автор=Durrett R. |заглавие=Probability: Theory and Examples |издание=5th ed. |место=Cambridge |издательство=Cambridge University Press |год=2019}}</ref>.
 +
 
 +
Предположение о независимых одинаково распределённых наблюдениях является важным упрощением. Оно может нарушаться во временных рядах, пространственных данных, социальных сетях и системах, где поведение пользователей изменяется со временем.
== Оценивание распределений ==
== Оценивание распределений ==
-
Оценивание распределения — одна из центральных задач статистики и машинного обучения. Существуют два основных подхода: параметрический и непараметрический.
+
Оценивание неизвестного распределения — одна из центральных задач статистики. Подходы к оцениванию обычно разделяют на параметрические и непараметрические.
 +
 
 +
=== Параметрический подход ===
 +
 
 +
В параметрическом подходе предполагается, что распределение принадлежит известному семейству, но его параметры неизвестны. Например, измерения могут моделироваться нормальным распределением с неизвестными математическим ожиданием и дисперсией.
 +
 
 +
Распространённым способом оценивания является [[Метод максимального правдоподобия|метод максимального правдоподобия]]. Для независимых наблюдений функция правдоподобия имеет вид
 +
 
 +
:<tex>L(\theta)=\prod_{i=1}^{n}p(x_i\mid\theta).</tex>
 +
 
 +
Правдоподобие показывает, насколько хорошо различные значения параметра согласуются с наблюдаемой выборкой. Оно рассматривается как функция параметра при фиксированных данных и не является распределением вероятности параметра.
 +
 
 +
На практике обычно максимизируют логарифм правдоподобия:
 +
 
 +
:<tex>\ell(\theta)=\sum_{i=1}^{n}\log p(x_i\mid\theta).</tex>
-
В '''параметрическом''' подходе предполагается, что распределение принадлежит известному семейству, но его параметры неизвестны. Например, можно предположить, что ошибки измерения имеют нормальное распределение, и оценивать его среднее и дисперсию.
+
Логарифм превращает произведение в сумму, облегчает дифференцирование и уменьшает риск численного переполнения или потери точности при умножении малых чисел.
-
Один из наиболее распространённых методов — [[метод максимального правдоподобия]]. Если наблюдения независимы, правдоподобие параметра <tex>\theta</tex> имеет вид:
+
В [[Байесовский вывод|байесовском подходе]] параметру задаётся априорное распределение, которое после наблюдения данных преобразуется в апостериорное распределение. В результате неопределённость параметра описывается распределением, а не только одной точечной оценкой.
-
:<tex>L(\theta)=\prod_{i=1}^n p(x_i \mid \theta)</tex>
+
=== Непараметрический подход ===
-
Правдоподобие показывает, насколько хорошо параметр <tex>\theta</tex> объясняет наблюдённые данные. На практике часто максимизируют логарифм правдоподобия:
+
Непараметрические методы не фиксируют конечномерное семейство распределений заранее. К ним относятся:
-
:<tex>\ell(\theta)=\sum_{i=1}^n \log p(x_i \mid \theta)</tex>
+
* эмпирическая функция распределения;
 +
* гистограмма;
 +
* [[Ядерная оценка плотности|ядерная оценка плотности]];
 +
* методы ближайших соседей;
 +
* некоторые модели на основе процессов и смесей с изменяемым числом компонентов.
-
Логарифм превращает произведение вероятностей в сумму, что обычно удобнее для вычислений и численной оптимизации.
+
Непараметрические методы способны описывать более широкий класс форм распределения, но обычно требуют больше данных. В пространствах высокой размерности оценивание плотности становится особенно сложным из-за [[Проклятие размерности|проклятия размерности]].
-
В '''непараметрическом''' подходе форма распределения заранее задаётся слабее. К таким методам относятся гистограммы, ядерные оценки плотности, эмпирическая функция распределения и некоторые виды ближайших соседей. Непараметрические методы гибче, но часто требуют больше данных и хуже работают в пространствах большой размерности.
+
Выбор между параметрическим и непараметрическим подходами зависит от объёма данных, размерности пространства, доступных предметных знаний и цели анализа.
== Распределения в машинном обучении ==
== Распределения в машинном обучении ==
-
Вероятностный взгляд на машинное обучение состоит в том, что данные и ответы рассматриваются как случайные величины. Пусть <tex>X</tex> — признаки объекта, а <tex>Y</tex> — целевая переменная. Тогда многие задачи можно описать через распределения:
+
Вероятностный взгляд на машинное обучение рассматривает признаки, ответы и параметры модели как случайные величины. В зависимости от задачи модель может оценивать совместное, маргинальное или условное распределение.
-
* в классификации оценивается <tex>P(Y \mid X)</tex>, то есть вероятность класса при данных признаках;
+
=== Обучение с учителем ===
-
* в регрессии можно оценивать не только точечный прогноз, но и распределение <tex>p(y \mid x)</tex>;
+
-
* в генеративном моделировании изучается распределение данных <tex>p(x)</tex> или совместное распределение <tex>p(x,y)</tex>;
+
-
* в обучении без учителя исследуются структура, плотность и скрытые факторы распределения признаков.
+
-
'''Дискриминативные модели''' напрямую оценивают условное распределение ответа при признаках. Примером служит логистическая регрессия, которая моделирует вероятность класса.
+
В [[Обучение с учителем|обучении с учителем]] по признакам объекта предсказывается целевая переменная. Вероятностная модель оценивает условное распределение ответа при наблюдаемых признаках.
-
'''Генеративные модели''' описывают распределение данных или совместное распределение признаков и ответов. К ним относятся смеси распределений, наивный байесовский классификатор, вариационные автоэнкодеры и некоторые вероятностные графические модели.<ref name="Goodfellow2016">Goodfellow I., Bengio Y., Courville A. ''Deep Learning''. MIT Press, 2016.</ref>
+
В классификации решение часто выбирается как класс с наибольшей условной вероятностью:
-
Многие функции потерь также имеют вероятностную интерпретацию. Например, минимизация отрицательного логарифма правдоподобия соответствует подбору модели, которая делает наблюдённые данные наиболее вероятными. В классификации эта идея приводит к кросс-энтропийной функции потерь, тесно связанной с информационной теорией.<ref name="CoverThomas2006">Cover T. M., Thomas J. A. ''Elements of Information Theory''. 2nd ed. Wiley, 2006.</ref>
+
:<tex>\widehat{y}(x)=\mathop{\rm arg\,max}_{y}p(y\mid x).</tex>
-
== Распределение, неопределённость и качество предсказаний ==
+
Такое правило является оптимальным при условии, что все ошибки классификации имеют одинаковую стоимость и модель правильно описывает условные вероятности.
-
Вероятностная модель должна не только часто выбирать правильный ответ, но и корректно выражать степень уверенности. Если модель предсказывает событие с вероятностью <tex>0.8</tex>, то среди большого числа похожих случаев такое событие должно происходить примерно в 80 процентах случаев. Это свойство связано с [[калибровка вероятностей|калибровкой вероятностей]].
+
В регрессии при квадратичной функции потерь оптимальным точечным прогнозом является условное математическое ожидание:
-
Современные нейронные сети могут достигать высокой точности, но при этом выдавать плохо откалиброванные вероятности, то есть быть чрезмерно уверенными в ошибочных предсказаниях.<ref name="Guo2017">Guo C., Pleiss G., Sun Y., Weinberger K. Q. On Calibration of Modern Neural Networks // ''Proceedings of the 34th International Conference on Machine Learning''. PMLR 70, 2017. P. 1321–1330.</ref> Поэтому в прикладных задачах важно различать точность классификации и качество вероятностных оценок.
+
:<tex>\widehat{y}(x)=E[Y\mid X=x].</tex>
-
Ещё одна проблема — [[сдвиг распределения]]. Она возникает, когда распределение данных на этапе применения модели отличается от распределения обучающей выборки. В этом случае модель может сохранять видимость уверенности, хотя её предсказания становятся менее надёжными.<ref name="Ovadia2019">Ovadia Y., Fertig E., Ren J., Nado Z., Sculley D., Nowozin S., Dillon J. V., Lakshminarayanan B., Snoek J. Can You Trust Your Model's Uncertainty? Evaluating Predictive Uncertainty Under Dataset Shift // ''Advances in Neural Information Processing Systems''. 2019.</ref>
+
При других функциях потерь оптимальный прогноз может соответствовать условной медиане, квантилю или другой характеристике условного распределения. Поэтому выбор функции потерь связан с тем, какую характеристику распределения должна оценивать модель.
-
Для оценки неопределённости также применяются методы conformal prediction. Они позволяют строить предсказательные множества или интервалы с формальными гарантиями покрытия при относительно слабых предположениях о распределении данных.<ref name="AngelopoulosBates2023">Angelopoulos A. N., Bates S. Conformal Prediction: A Gentle Introduction // ''Foundations and Trends in Machine Learning''. 2023. Vol. 16, No. 4. P. 494–591. doi:10.1561/2200000101.</ref>
+
=== Дискриминативные и генеративные модели ===
-
== Связь с информацией и дивергенциями ==
+
'''Дискриминативная модель''' непосредственно описывает распределение целевой переменной при известных признаках или границу принятия решений. К таким моделям относятся логистическая регрессия и многие нейронные классификаторы.
-
Распределения вероятностей позволяют количественно описывать неопределённость и информацию. Одной из основных величин является энтропия дискретного распределения:
+
'''Генеративная модель''' описывает распределение наблюдаемых данных либо совместное распределение признаков и целевой переменной. Из совместного распределения можно получить условное распределение с помощью формулы Байеса.
-
:<tex>H(X)=-\sum_x p_X(x)\log p_X(x)</tex>
+
К генеративным моделям относятся смеси распределений, [[Наивный байесовский классификатор|наивный байесовский классификатор]], скрытые марковские модели, вариационные автоэнкодеры и вероятностные графические модели<ref name="bishop" />.
-
Энтропия измеряет среднюю неопределённость случайной величины. Если один исход почти всегда реализуется, энтропия мала. Если много исходов имеют близкие вероятности, энтропия выше.
+
Граница между двумя группами не всегда абсолютна: отдельные методы могут сочетать генеративные и дискриминативные компоненты.
-
Для сравнения распределений часто используется дивергенция Кульбака — Лейблера:
+
=== Правдоподобие и функции потерь ===
-
:<tex>D_{KL}(P \parallel Q)=\sum_x p(x)\log \frac{p(x)}{q(x)}</tex>
+
Многие функции потерь в машинном обучении имеют вероятностную интерпретацию. Минимизация отрицательного логарифма правдоподобия соответствует выбору параметров, при которых обучающая выборка наиболее согласуется с моделью:
-
Эта величина показывает, насколько распределение <tex>Q</tex> отличается от распределения <tex>P</tex>, если <tex>P</tex> считать целевым. Она не является расстоянием в строгом математическом смысле, потому что обычно несимметрична.
+
:<tex>-\ell(\theta)=-\sum_{i=1}^{n}\log p(x_i\mid\theta).</tex>
-
[[Взаимная информация]] измеряет, насколько знание одной случайной величины уменьшает неопределённость о другой. В анализе данных она применяется для изучения зависимости признаков, отбора признаков и оценки связи между представлениями.
+
В многоклассовой классификации этот принцип приводит к [[Перекрёстная энтропия|перекрёстной энтропии]]. В регрессии предположение о нормальном распределении ошибок с постоянной дисперсией приводит к минимизации суммы квадратов отклонений.
-
== Примеры распределений в задачах анализа данных ==
+
Вероятностная интерпретация помогает понять предположения, скрытые за функцией потерь. Замена распределения ошибок может привести к другой функции потерь и другой устойчивости к выбросам.
-
В прикладной работе выбор распределения зависит не только от математического удобства, но и от смысла данных.
+
=== Вероятностные графические модели ===
-
Если целевая переменная бинарна, например «кликнул пользователь или нет», естественной моделью является распределение Бернулли. Если нужно предсказать один из нескольких классов, используется категориальное распределение. Если моделируется число событий за интервал, например число обращений в службу поддержки за час, может использоваться распределение Пуассона. Если наблюдаемая величина является результатом большого числа малых независимых факторов, нормальное распределение часто служит разумным приближением.
+
[[Вероятностная графическая модель|Вероятностные графические модели]] представляют многомерное распределение с помощью графа. Структура графа кодирует условные зависимости и позволяет разложить сложное совместное распределение на более простые множители.
-
Однако распределение не следует выбирать механически. Реальные данные могут иметь тяжёлые хвосты, выбросы, асимметрию, зависимость между наблюдениями и сдвиг во времени. Поэтому в анализе данных выбор распределения должен проверяться эмпирически: через графики, диагностические проверки, качество предсказаний и устойчивость модели.
+
В байесовской сети совместное распределение раскладывается по родительским узлам:
 +
 
 +
:<tex>p(x_1,\ldots,x_d)=\prod_{j=1}^{d}p(x_j\mid {\rm pa}(x_j)).</tex>
 +
 
 +
Такое представление позволяет компактно задавать распределения большой размерности и выполнять вероятностный вывод при частично наблюдаемых данных<ref name="koller" />.
 +
 
 +
== Распределение и качество предсказаний ==
 +
 
 +
Вероятностное предсказание должно не только часто приводить к правильному решению, но и корректно выражать степень уверенности. Если среди объектов, которым модель приписывает близкую вероятность некоторого события, это событие происходит примерно с такой же частотой, модель называется [[Калибровка вероятностей|калиброванной]].
 +
 
 +
Высокая точность классификации не гарантирует хорошей калибровки. Экспериментальные исследования показали, что современные нейронные сети могут быть чрезмерно уверенными даже при высокой точности<ref name="guo">{{статья |автор=Guo C., Pleiss G., Sun Y., Weinberger K. Q. |заглавие=On Calibration of Modern Neural Networks |издание=Proceedings of the 34th International Conference on Machine Learning |год=2017 |том=70 |страницы=1321–1330}}</ref>.
 +
 
 +
Другая проблема возникает при [[Сдвиг распределения|сдвиге распределения]], когда данные во время применения модели отличаются от обучающих данных. При таком сдвиге значения вероятностей и оценки неопределённости могут стать ненадёжными, даже если модель уверенно выдаёт предсказания<ref name="ovadia">{{статья |автор=Ovadia Y., Fertig E., Ren J., Nado Z., Sculley D., Nowozin S., Dillon J. V., Lakshminarayanan B., Snoek J. |заглавие=Can You Trust Your Model's Uncertainty? Evaluating Predictive Uncertainty Under Dataset Shift |издание=Advances in Neural Information Processing Systems |год=2019 |том=32}}</ref>.
 +
 
 +
Поэтому вероятностные модели оценивают не только по доле правильных ответов. В зависимости от задачи дополнительно используют логарифмическую функцию потерь, оценку Брайера, калибровочные диаграммы и качество предсказаний при различных сдвигах данных.
 +
 
 +
== Выбор распределения в прикладных задачах ==
 +
 
 +
Выбор распределения должен учитывать тип данных, механизм их возникновения и цель моделирования.
 +
 
 +
* '''Бинарный исход.''' Для события с двумя возможными результатами естественной базовой моделью является распределение Бернулли.
 +
* '''Число успехов.''' При фиксированном числе независимых однотипных испытаний используется биномиальное распределение.
 +
* '''Число событий за интервал.''' При определённых предположениях о независимости и постоянной интенсивности применяется распределение Пуассона.
 +
* '''Время ожидания.''' Простейшей моделью времени до события является экспоненциальное распределение.
 +
* '''Непрерывное измерение.''' Нормальное распределение часто используется для величин, возникающих как сумма большого числа малых воздействий.
 +
* '''Положительная асимметричная величина.''' Могут использоваться гамма- или логнормальное распределения.
 +
* '''Вероятность или доля.''' Для моделирования значений на единичном отрезке часто применяется бета-распределение.
 +
* '''Данные с тяжёлыми хвостами.''' Вместо нормального распределения могут использоваться распределение Стьюдента или другие модели с повышенной вероятностью больших отклонений.
 +
 
 +
Соответствие распределения данным нельзя устанавливать только по внешнему сходству гистограммы. Необходимо учитывать предметный смысл, зависимость наблюдений, устойчивость оценок, поведение хвостов и качество предсказаний на новых данных.
 +
 
 +
== Отличие от смежных понятий ==
 +
 
 +
* '''[[Выборка]]''' — конечный набор наблюдений. Распределение является вероятностной моделью процесса, который мог породить эту выборку.
 +
* '''Функция распределения''' — один из способов полного задания распределения числовой случайной величины. Само распределение является более общим понятием вероятностной меры.
 +
* '''Плотность вероятности''' — функция, с помощью которой задаётся абсолютно непрерывное распределение. Не каждое распределение имеет плотность.
 +
* '''Функция вероятности''' задаёт вероятности отдельных значений дискретной случайной величины.
 +
* '''Правдоподобие''' рассматривает вероятность или плотность фиксированных данных как функцию неизвестного параметра. Оно не является распределением параметра.
 +
* '''Статистическая модель''' — множество возможных распределений, среди которых по данным выбирается или оценивается подходящее.
 +
* '''Эмпирическое распределение''' строится непосредственно по выборке и служит оценкой неизвестного распределения генеральной совокупности.
== Распространённые ошибки ==
== Распространённые ошибки ==
-
Одна из частых ошибок — смешивать выборку и распределение. Выборка является конечным набором наблюдений, а распределение — математической моделью процесса, который мог эти наблюдения породить.
+
=== Смешение распределения и выборки ===
-
Вторая ошибка считать плотность вероятности вероятностью. Для непрерывной случайной величины вероятность отдельной точки обычно равна нулю; вероятность имеет интервал, а не точка. Плотность нужна для вычисления вероятностей через площадь под графиком.
+
Распределение является математической моделью неопределённости, а выборка конкретным результатом наблюдений. Свойства одной выборки могут отличаться от свойств распределения из-за случайной изменчивости.
-
Третья ошибка — интерпретировать высокую вероятность класса как гарантированную истинность ответа. Вероятность <tex>0.9</tex> означает высокую степень уверенности модели, но не исключает ошибки. Кроме того, сама вероятность может быть плохо откалибрована.
+
=== Интерпретация плотности как вероятности ===
-
Четвёртая ошибка — предполагать, что распределение обучающих данных совпадает с распределением будущих данных. В реальных системах это условие часто нарушается, поэтому модели требуют мониторинга, повторной проверки и иногда переобучения.
+
Значение плотности в точке не является вероятностью. Для абсолютно непрерывной величины вероятность отдельного точного значения обычно равна нулю, а вероятность интервала вычисляется интегрированием плотности.
 +
 
 +
=== Вывод о независимости по нулевой корреляции ===
 +
 
 +
Нулевая корреляция исключает только определённый вид линейной зависимости. Случайные величины могут быть некоррелированными, но зависимыми.
 +
 
 +
=== Механический выбор известного распределения ===
 +
 
 +
Нормальное распределение не является универсальной моделью для всех непрерывных данных. Асимметрия, ограниченная область значений, большое число нулей и тяжёлые хвосты могут требовать другого семейства распределений.
 +
 
 +
=== Интерпретация вероятности как гарантии ===
 +
 
 +
Высокая предсказанная вероятность не означает, что событие обязательно произойдёт. Кроме того, численная вероятность имеет практический смысл только при достаточной калибровке модели и соответствии условий применения обучающим данным.
 +
 
 +
=== Игнорирование сдвига распределения ===
 +
 
 +
Распределение будущих данных может отличаться от распределения обучающей выборки. Поэтому вероятностные модели требуют проверки на новых данных, мониторинга и повторного оценивания после изменения условий.
== См. также ==
== См. также ==
-
* [[вероятность]]
+
* [[Вероятность]]
-
* [[случайное событие]]
+
* [[Случайное событие]]
-
* [[случайная величина]]
+
* [[Случайная величина]]
-
* [[условная вероятность]]
+
* [[Функция распределения]]
-
* [[формула Байеса]]
+
* [[Плотность вероятности]]
-
* [[условная независимость]]
+
* [[Условная вероятность]]
-
* [[байесовская сеть]]
+
* [[Формула Байеса]]
-
* [[наивный байесовский классификатор]]
+
* [[Математическое ожидание]]
-
* [[калибровка вероятностей]]
+
* [[Дисперсия]]
-
* [[сдвиг распределения]]
+
* [[Условная независимость]]
-
* [[взаимная информация]]
+
* [[Вероятностная графическая модель]]
-
* [[энтропия]]
+
* [[Метод максимального правдоподобия]]
-
* [[метод максимального правдоподобия]]
+
* [[Калибровка вероятностей]]
 +
* [[Сдвиг распределения]]
-
== Литература ==
+
== Примечания ==
-
<references/>
+
{{примечания}}
 +
 
 +
== Литература ==
-
[[Категория:Теория вероятностей]]
+
* {{книга |автор=Billingsley P. |заглавие=Probability and Measure |издание=3rd ed. |место=New York |издательство=Wiley |год=1995}}
-
[[Категория:Машинное обучение]]
+
* {{книга |автор=Bishop C. M. |заглавие=Pattern Recognition and Machine Learning |место=New York |издательство=Springer |год=2006 |isbn=978-0-387-31073-2}}
-
[[Категория:Анализ данных]]
+
* {{книга |автор=Durrett R. |заглавие=Probability: Theory and Examples |издание=5th ed. |место=Cambridge |издательство=Cambridge University Press |год=2019}}
 +
* {{книга |автор=Koller D., Friedman N. |заглавие=Probabilistic Graphical Models: Principles and Techniques |место=Cambridge, MA |издательство=MIT Press |год=2009 |isbn=978-0-262-01319-2}}
 +
* {{книга |автор=Murphy K. P. |заглавие=Probabilistic Machine Learning: An Introduction |место=Cambridge, MA |издательство=MIT Press |год=2022}}
 +
* {{статья |автор=Guo C., Pleiss G., Sun Y., Weinberger K. Q. |заглавие=On Calibration of Modern Neural Networks |издание=Proceedings of the 34th International Conference on Machine Learning |год=2017 |том=70 |страницы=1321–1330}}
 +
* {{статья |автор=Ovadia Y., Fertig E., Ren J., Nado Z., Sculley D., Nowozin S., Dillon J. V., Lakshminarayanan B., Snoek J. |заглавие=Can You Trust Your Model's Uncertainty? Evaluating Predictive Uncertainty Under Dataset Shift |издание=Advances in Neural Information Processing Systems |год=2019 |том=32}}

Текущая версия

Содержание

Распределение вероятностей — математическое описание того, какие значения может принимать случайная величина или случайный вектор и как вероятность распределена между этими значениями. Распределение характеризует не только наиболее вероятные исходы, но и разброс значений, вероятность редких событий и зависимость между величинами.

В анализе данных и машинном обучении наблюдения обычно рассматриваются как значения, порождённые некоторым неизвестным распределением. Обучение модели можно понимать как оценивание этого распределения, приближение отдельных его характеристик или построение правила предсказания на его основе[1][1].

Основная идея

Распределение вероятностей отвечает на вопрос о том, как вероятность разделена между возможными результатами случайного эксперимента. Для дискретной величины можно непосредственно указать вероятность каждого значения. Для непрерывной величины вероятность обычно задаётся для интервалов и других областей значений.

Например, при броске правильной игральной кости каждое из шести значений имеет одинаковую вероятность. Рост случайно выбранного человека, напротив, изменяется практически непрерывно, поэтому его вероятностную модель удобнее описывать плотностью на числовой оси.

Распределение можно понимать как идеализированную карту неопределённости. Выборка содержит конечное число фактически полученных наблюдений, тогда как распределение описывает общий вероятностный закон, который мог породить эти наблюдения. Одно и то же распределение способно порождать различные выборки, а по одной конечной выборке обычно нельзя восстановить распределение без статистической погрешности.

Формальное определение

В современной теории вероятностей распределение определяется как вероятностная мера на пространстве значений случайной величины. Если случайная величина задана на некотором вероятностном пространстве, то её распределение сопоставляет каждому допустимому множеству значений вероятность попадания в это множество[1]:

P_X(A)=P(X\in A).

Эта формула означает, что распределение переносит вероятности с пространства элементарных исходов на пространство значений случайной величины. Для использования распределения не обязательно знать внутреннее устройство исходного эксперимента: достаточно уметь вычислять вероятности множеств значений.

Распределение числовой случайной величины однозначно определяется её функцией распределения:

F_X(x)=P(X\leq x).

Функция распределения показывает вероятность того, что случайная величина не превысит заданного порога. Она определена для дискретных, непрерывных, смешанных и других распределений.

Любая функция распределения не убывает, непрерывна справа и имеет предельные значения ноль и единица на соответствующих бесконечностях. Эти свойства позволяют отличить функцию распределения от произвольной функции действительного аргумента.

Способы задания распределения

Дискретные распределения

Дискретное распределение описывает случайную величину, принимающую конечное или счётное множество значений. Оно задаётся функцией вероятности:

p_X(x)=P(X=x).

Значение функции равно вероятности того, что случайная величина примет конкретное значение. Все такие вероятности неотрицательны, а их сумма равна единице:

\sum_x p_X(x)=1.

Условие нормировки означает, что одно из допустимых значений обязательно реализуется.

К распространённым дискретным распределениям относятся:

  • Распределение Бернулли — модель одного испытания с двумя исходами;
  • категориальное распределение — модель выбора одной категории из конечного множества;
  • Биномиальное распределение — распределение числа успехов в серии независимых испытаний;
  • Распределение Пуассона — модель числа событий на заданном интервале времени или пространства;
  • геометрическое распределение — модель числа испытаний до первого успеха.

В машинном обучении дискретные распределения используются для моделирования классов, категориальных признаков, последовательностей символов и числа наблюдаемых событий.

Абсолютно непрерывные распределения

Распределение называется абсолютно непрерывным, если вероятности можно вычислять с помощью плотности вероятности:

P(a\leq X\leq b)=\int_a^b f_X(x)\,dx.

Вероятность интервала равна площади под графиком плотности на этом интервале. При этом значение плотности в отдельной точке не является вероятностью этой точки.

Плотность должна быть неотрицательной и нормированной:

\int_{-\infty}^{\infty}f_X(x)\,dx=1.

Значение плотности может быть больше единицы, если она сосредоточена на достаточно узкой области. Ограничение единицей относится к вероятностям, а не к значениям плотности.

Для абсолютно непрерывного распределения функция распределения выражается через плотность:

F_X(x)=\int_{-\infty}^{x}f_X(t)\,dt.

Если функция распределения дифференцируема, её производная почти всюду совпадает с плотностью.

К распространённым абсолютно непрерывным распределениям относятся:

  • Равномерное распределение — распределение с постоянной плотностью на заданном интервале;
  • Нормальное распределение — симметричное распределение, определяемое средним и дисперсией;
  • экспоненциальное распределение — модель времени ожидания до события;
  • гамма-распределение — семейство распределений положительных величин;
  • бета-распределение — семейство распределений на единичном отрезке;
  • распределение Стьюдента — симметричное распределение с более тяжёлыми хвостами, чем у нормального распределения.

В прикладной литературе абсолютно непрерывные распределения нередко называют просто непрерывными. Строго говоря, существуют непрерывные распределения, которые не имеют плотности, поэтому эти понятия не полностью совпадают.

Смешанные распределения

Смешанное распределение содержит как отдельные точки с положительной вероятностью, так и непрерывную составляющую. Например, размер страховой выплаты может с положительной вероятностью равняться нулю, а при наступлении страхового случая принимать положительные значения из непрерывного диапазона.

Смешанные распределения встречаются при моделировании нулевых расходов, времени ожидания с возможностью немедленного события, цен, страховых выплат и показателей с большим числом нулевых наблюдений.

Распределение в наиболее общей форме не обязано иметь ни функцию вероятности, ни плотность. Универсальным способом его задания остаётся вероятностная мера или функция распределения.

Совместные и маргинальные распределения

Для нескольких случайных величин используется совместное распределение. Оно описывает не только распределение каждой величины отдельно, но и вероятностную зависимость между ними.

В дискретном случае совместная функция вероятности двух величин определяется как

p_{X,Y}(x,y)=P(X=x,Y=y).

Она задаёт вероятность одновременного появления конкретной пары значений.

Из совместного распределения можно получить отдельное, или маргинальное, распределение одной величины:

p_X(x)=\sum_y p_{X,Y}(x,y).

Суммирование исключает вторую величину из рассмотрения, учитывая все возможные её значения.

Для распределения с совместной плотностью аналогичная операция выполняется интегрированием:

f_X(x)=\int_{-\infty}^{\infty}f_{X,Y}(x,y)\,dy.

Совместные распределения особенно важны в анализе данных, поскольку один объект обычно описывается несколькими признаками. Такой набор признаков рассматривается как случайный вектор, а зависимости между признаками являются свойствами его совместного распределения.

Условные распределения

Условное распределение описывает поведение одной случайной величины при наличии информации о другой. Для дискретных величин условная функция вероятности определяется формулой

p_{Y\mid X}(y\mid x)=\frac{p_{X,Y}(x,y)}{p_X(x)},\quad p_X(x)>0.

Условие ограничивает рассмотрение теми случаями, в которых первая величина приняла заданное значение. После такого ограничения вероятности возможных значений второй величины заново нормируются.

Совместное распределение можно восстановить из маргинального и условного распределений:

p_{X,Y}(x,y)=p_{Y\mid X}(y\mid x)p_X(x).

Это равенство называется правилом произведения вероятностей.

С помощью формулы Байеса направление условия можно изменить:

p_{Y\mid X}(y\mid x)=\frac{p_{X\mid Y}(x\mid y)p_Y(y)}{p_X(x)}.

Формула позволяет перейти от распределения наблюдаемых признаков при заданной гипотезе к распределению гипотез при полученных признаках. На этом принципе основаны байесовские методы классификации.

Для непрерывных величин при наличии соответствующих плотностей используется аналогичное отношение:

f_{Y\mid X}(y\mid x)=\frac{f_{X,Y}(x,y)}{f_X(x)}.

Поскольку отдельное значение непрерывной величины обычно имеет нулевую вероятность, условное распределение в общем случае определяется не через вероятность отдельного события, а с помощью условных мер или условных плотностей.

Независимость и условная независимость

Случайные величины называются независимыми, если знание одной из них не изменяет распределение другой. Для дискретных величин независимость равносильна разложению совместного распределения:

p_{X,Y}(x,y)=p_X(x)p_Y(y).

Если равенство не выполняется хотя бы для одной пары допустимых значений, величины зависимы.

Зависимость не обязательно является линейной. Нулевая корреляция в общем случае не гарантирует независимость, хотя для некоторых специальных семейств распределений, в частности для совместно нормально распределённых величин, такое заключение возможно.

В вероятностных моделях также используется условная независимость. Две величины условно независимы при известной третьей, если после её учёта совместное условное распределение раскладывается в произведение:

p(x,y\mid z)=p(x\mid z)p(y\mid z).

Условная независимость позволяет компактно описывать сложные многомерные распределения. Она лежит в основе байесовских сетей, марковских сетей и других вероятностных графических моделей[1].

Числовые характеристики распределения

Полное распределение содержит больше информации, чем несколько числовых характеристик, однако такие характеристики позволяют кратко описывать его основные свойства.

Математическое ожидание характеризует среднее положение распределения. Для дискретной случайной величины оно определяется как

E[X]=\sum_x x\,p_X(x).

Возможные значения усредняются с весами, равными их вероятностям.

Для распределения с плотностью математическое ожидание имеет вид

E[X]=\int_{-\infty}^{\infty}x\,f_X(x)\,dx.

Ожидание существует не для каждого распределения. Например, у распределения Коши обычное математическое ожидание не определено.

Дисперсия характеризует средний квадрат отклонения от математического ожидания:

{\rm Var}(X)=E[(X-E[X])^2].

Чем больше дисперсия, тем сильнее значения в среднем разбросаны относительно математического ожидания. Квадратный корень из дисперсии называется стандартным отклонением.

Для нескольких величин зависимость может описываться ковариацией и корреляцией. Эти показатели характеризуют главным образом линейную зависимость и не определяют совместное распределение полностью.

К другим характеристикам относятся медиана, квантили, мода, асимметрия и эксцесс. Два разных распределения могут иметь одинаковые математические ожидания и дисперсии, поэтому краткие характеристики не заменяют полного распределения.

Эмпирическое распределение

Истинное распределение данных в прикладных задачах обычно неизвестно. Исследователь располагает только конечной выборкой. На её основе строится эмпирическое распределение, которое присваивает одинаковую вероятностную массу каждому наблюдению:

\widehat{P}_n(A)=\frac{1}{n}\sum_{i=1}^{n}I(x_i\in A).

Индикатор в сумме равен единице, если наблюдение принадлежит заданному множеству, и нулю в противном случае. Поэтому эмпирическая вероятность события равна доле наблюдений, для которых оно произошло.

Эмпирическая функция распределения определяется как

\widehat{F}_n(x)=\frac{1}{n}\sum_{i=1}^{n}I(x_i\leq x).

Она показывает долю наблюдений, не превышающих заданный порог. По мере увеличения объёма независимой одинаково распределённой выборки эмпирическая функция при стандартных условиях приближается к истинной функции распределения[1].

Предположение о независимых одинаково распределённых наблюдениях является важным упрощением. Оно может нарушаться во временных рядах, пространственных данных, социальных сетях и системах, где поведение пользователей изменяется со временем.

Оценивание распределений

Оценивание неизвестного распределения — одна из центральных задач статистики. Подходы к оцениванию обычно разделяют на параметрические и непараметрические.

Параметрический подход

В параметрическом подходе предполагается, что распределение принадлежит известному семейству, но его параметры неизвестны. Например, измерения могут моделироваться нормальным распределением с неизвестными математическим ожиданием и дисперсией.

Распространённым способом оценивания является метод максимального правдоподобия. Для независимых наблюдений функция правдоподобия имеет вид

L(\theta)=\prod_{i=1}^{n}p(x_i\mid\theta).

Правдоподобие показывает, насколько хорошо различные значения параметра согласуются с наблюдаемой выборкой. Оно рассматривается как функция параметра при фиксированных данных и не является распределением вероятности параметра.

На практике обычно максимизируют логарифм правдоподобия:

\ell(\theta)=\sum_{i=1}^{n}\log p(x_i\mid\theta).

Логарифм превращает произведение в сумму, облегчает дифференцирование и уменьшает риск численного переполнения или потери точности при умножении малых чисел.

В байесовском подходе параметру задаётся априорное распределение, которое после наблюдения данных преобразуется в апостериорное распределение. В результате неопределённость параметра описывается распределением, а не только одной точечной оценкой.

Непараметрический подход

Непараметрические методы не фиксируют конечномерное семейство распределений заранее. К ним относятся:

  • эмпирическая функция распределения;
  • гистограмма;
  • ядерная оценка плотности;
  • методы ближайших соседей;
  • некоторые модели на основе процессов и смесей с изменяемым числом компонентов.

Непараметрические методы способны описывать более широкий класс форм распределения, но обычно требуют больше данных. В пространствах высокой размерности оценивание плотности становится особенно сложным из-за проклятия размерности.

Выбор между параметрическим и непараметрическим подходами зависит от объёма данных, размерности пространства, доступных предметных знаний и цели анализа.

Распределения в машинном обучении

Вероятностный взгляд на машинное обучение рассматривает признаки, ответы и параметры модели как случайные величины. В зависимости от задачи модель может оценивать совместное, маргинальное или условное распределение.

Обучение с учителем

В обучении с учителем по признакам объекта предсказывается целевая переменная. Вероятностная модель оценивает условное распределение ответа при наблюдаемых признаках.

В классификации решение часто выбирается как класс с наибольшей условной вероятностью:

\widehat{y}(x)=\mathop{\rm arg\,max}_{y}p(y\mid x).

Такое правило является оптимальным при условии, что все ошибки классификации имеют одинаковую стоимость и модель правильно описывает условные вероятности.

В регрессии при квадратичной функции потерь оптимальным точечным прогнозом является условное математическое ожидание:

\widehat{y}(x)=E[Y\mid X=x].

При других функциях потерь оптимальный прогноз может соответствовать условной медиане, квантилю или другой характеристике условного распределения. Поэтому выбор функции потерь связан с тем, какую характеристику распределения должна оценивать модель.

Дискриминативные и генеративные модели

Дискриминативная модель непосредственно описывает распределение целевой переменной при известных признаках или границу принятия решений. К таким моделям относятся логистическая регрессия и многие нейронные классификаторы.

Генеративная модель описывает распределение наблюдаемых данных либо совместное распределение признаков и целевой переменной. Из совместного распределения можно получить условное распределение с помощью формулы Байеса.

К генеративным моделям относятся смеси распределений, наивный байесовский классификатор, скрытые марковские модели, вариационные автоэнкодеры и вероятностные графические модели[1].

Граница между двумя группами не всегда абсолютна: отдельные методы могут сочетать генеративные и дискриминативные компоненты.

Правдоподобие и функции потерь

Многие функции потерь в машинном обучении имеют вероятностную интерпретацию. Минимизация отрицательного логарифма правдоподобия соответствует выбору параметров, при которых обучающая выборка наиболее согласуется с моделью:

-\ell(\theta)=-\sum_{i=1}^{n}\log p(x_i\mid\theta).

В многоклассовой классификации этот принцип приводит к перекрёстной энтропии. В регрессии предположение о нормальном распределении ошибок с постоянной дисперсией приводит к минимизации суммы квадратов отклонений.

Вероятностная интерпретация помогает понять предположения, скрытые за функцией потерь. Замена распределения ошибок может привести к другой функции потерь и другой устойчивости к выбросам.

Вероятностные графические модели

Вероятностные графические модели представляют многомерное распределение с помощью графа. Структура графа кодирует условные зависимости и позволяет разложить сложное совместное распределение на более простые множители.

В байесовской сети совместное распределение раскладывается по родительским узлам:

p(x_1,\ldots,x_d)=\prod_{j=1}^{d}p(x_j\mid {\rm pa}(x_j)).

Такое представление позволяет компактно задавать распределения большой размерности и выполнять вероятностный вывод при частично наблюдаемых данных[1].

Распределение и качество предсказаний

Вероятностное предсказание должно не только часто приводить к правильному решению, но и корректно выражать степень уверенности. Если среди объектов, которым модель приписывает близкую вероятность некоторого события, это событие происходит примерно с такой же частотой, модель называется калиброванной.

Высокая точность классификации не гарантирует хорошей калибровки. Экспериментальные исследования показали, что современные нейронные сети могут быть чрезмерно уверенными даже при высокой точности[1].

Другая проблема возникает при сдвиге распределения, когда данные во время применения модели отличаются от обучающих данных. При таком сдвиге значения вероятностей и оценки неопределённости могут стать ненадёжными, даже если модель уверенно выдаёт предсказания[1].

Поэтому вероятностные модели оценивают не только по доле правильных ответов. В зависимости от задачи дополнительно используют логарифмическую функцию потерь, оценку Брайера, калибровочные диаграммы и качество предсказаний при различных сдвигах данных.

Выбор распределения в прикладных задачах

Выбор распределения должен учитывать тип данных, механизм их возникновения и цель моделирования.

  • Бинарный исход. Для события с двумя возможными результатами естественной базовой моделью является распределение Бернулли.
  • Число успехов. При фиксированном числе независимых однотипных испытаний используется биномиальное распределение.
  • Число событий за интервал. При определённых предположениях о независимости и постоянной интенсивности применяется распределение Пуассона.
  • Время ожидания. Простейшей моделью времени до события является экспоненциальное распределение.
  • Непрерывное измерение. Нормальное распределение часто используется для величин, возникающих как сумма большого числа малых воздействий.
  • Положительная асимметричная величина. Могут использоваться гамма- или логнормальное распределения.
  • Вероятность или доля. Для моделирования значений на единичном отрезке часто применяется бета-распределение.
  • Данные с тяжёлыми хвостами. Вместо нормального распределения могут использоваться распределение Стьюдента или другие модели с повышенной вероятностью больших отклонений.

Соответствие распределения данным нельзя устанавливать только по внешнему сходству гистограммы. Необходимо учитывать предметный смысл, зависимость наблюдений, устойчивость оценок, поведение хвостов и качество предсказаний на новых данных.

Отличие от смежных понятий

  • Выборка — конечный набор наблюдений. Распределение является вероятностной моделью процесса, который мог породить эту выборку.
  • Функция распределения — один из способов полного задания распределения числовой случайной величины. Само распределение является более общим понятием вероятностной меры.
  • Плотность вероятности — функция, с помощью которой задаётся абсолютно непрерывное распределение. Не каждое распределение имеет плотность.
  • Функция вероятности задаёт вероятности отдельных значений дискретной случайной величины.
  • Правдоподобие рассматривает вероятность или плотность фиксированных данных как функцию неизвестного параметра. Оно не является распределением параметра.
  • Статистическая модель — множество возможных распределений, среди которых по данным выбирается или оценивается подходящее.
  • Эмпирическое распределение строится непосредственно по выборке и служит оценкой неизвестного распределения генеральной совокупности.

Распространённые ошибки

Смешение распределения и выборки

Распределение является математической моделью неопределённости, а выборка — конкретным результатом наблюдений. Свойства одной выборки могут отличаться от свойств распределения из-за случайной изменчивости.

Интерпретация плотности как вероятности

Значение плотности в точке не является вероятностью. Для абсолютно непрерывной величины вероятность отдельного точного значения обычно равна нулю, а вероятность интервала вычисляется интегрированием плотности.

Вывод о независимости по нулевой корреляции

Нулевая корреляция исключает только определённый вид линейной зависимости. Случайные величины могут быть некоррелированными, но зависимыми.

Механический выбор известного распределения

Нормальное распределение не является универсальной моделью для всех непрерывных данных. Асимметрия, ограниченная область значений, большое число нулей и тяжёлые хвосты могут требовать другого семейства распределений.

Интерпретация вероятности как гарантии

Высокая предсказанная вероятность не означает, что событие обязательно произойдёт. Кроме того, численная вероятность имеет практический смысл только при достаточной калибровке модели и соответствии условий применения обучающим данным.

Игнорирование сдвига распределения

Распределение будущих данных может отличаться от распределения обучающей выборки. Поэтому вероятностные модели требуют проверки на новых данных, мониторинга и повторного оценивания после изменения условий.

См. также

Примечания

Литература

  • Billingsley P. Probability and Measure. — 3rd ed.. — New York: Wiley, 1995.
  • Bishop C. M. Pattern Recognition and Machine Learning. — New York: Springer, 2006. — ISBN 978-0-387-31073-2
  • Durrett R. Probability: Theory and Examples. — 5th ed.. — Cambridge: Cambridge University Press, 2019.
  • Koller D., Friedman N. Probabilistic Graphical Models: Principles and Techniques. — Cambridge, MA: MIT Press, 2009. — ISBN 978-0-262-01319-2
  • Murphy K. P. Probabilistic Machine Learning: An Introduction. — Cambridge, MA: MIT Press, 2022.
  • Guo C., Pleiss G., Sun Y., Weinberger K. Q. On Calibration of Modern Neural Networks // Proceedings of the 34th International Conference on Machine Learning. — 2017. — Т. 70. — С. 1321–1330.
  • Ovadia Y., Fertig E., Ren J., Nado Z., Sculley D., Nowozin S., Dillon J. V., Lakshminarayanan B., Snoek J. Can You Trust Your Model's Uncertainty? Evaluating Predictive Uncertainty Under Dataset Shift // Advances in Neural Information Processing Systems. — 2019. — Т. 32.
Личные инструменты