Маргинальное распределение
Материал из MachineLearning.
(Новая: '''Маргинальная вероятность''' (англ. marginal probability) — вероятность события, относящегося только к выбранн...) |
(Добавил дисклеймер) |
||
| Строка 1: | Строка 1: | ||
| + | {{well|Статья подготовлена с использованием модели [https://openai.com/index/gpt-5-6/ OpenAI GPT‑5.6 Sol] с уровнем рассуждений High и проверена участником [[Участник:Denis Kistanov|Д.О. Кистанов]] 20:57, 19 июля 2026 (MSK) | ||
| + | Промпт приводится полностью в [[Обсуждение:Маргинальное распределение]] | ||
| + | }} | ||
| + | {{TOCright}} | ||
'''Маргинальная вероятность''' (англ. marginal probability) — вероятность события, относящегося только к выбранной части совместно рассматриваемых [[Случайная величина|случайных величин]], без фиксации значений остальных величин. Её получают из [[Совместное распределение|совместного распределения]], суммируя вероятности или интегрируя плотность по исключаемым переменным. Соответствующий закон выбранных величин называется '''[[Маргинальное распределение|маргинальным распределением]]''', а сам переход — '''маргинализацией'''.<ref name="grimmett2001">{{книга | '''Маргинальная вероятность''' (англ. marginal probability) — вероятность события, относящегося только к выбранной части совместно рассматриваемых [[Случайная величина|случайных величин]], без фиксации значений остальных величин. Её получают из [[Совместное распределение|совместного распределения]], суммируя вероятности или интегрируя плотность по исключаемым переменным. Соответствующий закон выбранных величин называется '''[[Маргинальное распределение|маргинальным распределением]]''', а сам переход — '''маргинализацией'''.<ref name="grimmett2001">{{книга | ||
|автор = Grimmett, G. R.; Stirzaker, D. R. | |автор = Grimmett, G. R.; Stirzaker, D. R. | ||
Текущая версия
| | Статья подготовлена с использованием модели OpenAI GPT‑5.6 Sol с уровнем рассуждений High и проверена участником Д.О. Кистанов 20:57, 19 июля 2026 (MSK)
Промпт приводится полностью в Обсуждение:Маргинальное распределение |
|
Маргинальная вероятность (англ. marginal probability) — вероятность события, относящегося только к выбранной части совместно рассматриваемых случайных величин, без фиксации значений остальных величин. Её получают из совместного распределения, суммируя вероятности или интегрируя плотность по исключаемым переменным. Соответствующий закон выбранных величин называется маргинальным распределением, а сам переход — маргинализацией.[1]
Например, если известны совместные вероятности значений двух дискретных величин и
, то вероятность
не зависит от того, какое значение принято величиной
, и равна
Слово «маргинальная» связано с таблицами совместных вероятностей: суммы по строкам и столбцам традиционно записывают на полях, то есть в маргиналиях таблицы. В противопоставлении условной вероятности маргинальную вероятность часто называют безусловной. При этом маргинализация не предполагает независимости величин: зависимыми могут быть как исходные переменные, так и события, вероятности которых суммируются.
История
Суммирование вероятностей по взаимоисключающим исходам и формула полной вероятности появились раньше современной терминологии маргинальных распределений. Наглядное происхождение термина связано с развитием таблиц сопряжённости на рубеже XIX и XX веков. В работе 1904 года Карл Пирсон систематически исследовал сопряжённость категориальных признаков с помощью таблиц частот; суммы по их строкам и столбцам образуют поля таблицы.[1] В современной статистике термин относится не только к таблицам: маргинальным называют любой закон, полученный проектированием совместного распределения на подмножество координат.
Меро-теоретическая аксиоматика Андрея Колмогорова, опубликованная в 1933 году, дала единую основу для дискретных, непрерывных и смешанных распределений. В этой формализации маргинальное распределение является образом вероятностной меры при координатной проекции, а суммирование и интегрирование выступают частными вычислительными формами одной операции.[1]
Во второй половине XX века вычисление маргинальных вероятностей стало центральной алгоритмической задачей. Рекурсии для скрытых марковских моделей, развитые Леонардом Баумом и соавторами, позволили получать вероятности скрытых состояний и правдоподобие последовательности динамическим программированием.[1] В 1980-х годах методы локальных вычислений на разреженных графах сделали точную маргинализацию практичной для важных классов экспертных систем и вероятностных графических моделей.[1] Унифицирующее описание многих таких алгоритмов через фактор-графы и алгоритм сумма-произведение было дано Фрэнком Кшишангом, Бренданом Фреем и Хансом-Андреа Лёлигером.[1]
Для произвольных графических моделей точный вероятностный вывод в общем случае вычислительно труден: в 1990 году Грегори Купер доказал NP-трудность вывода в байесовских сетях.[1] Это обстоятельство стимулировало развитие выборочных, вариационных и иных приближённых методов маргинализации.
Основная идея
Суммирование по несущественным исходам
Пусть объект характеризуется двумя категориальными признаками: формой обучения и результатом экзамена
. Совместное распределение может быть представлено таблицей.
| Форма обучения | Экзамен сдан | Экзамен не сдан | Маргинальная вероятность формы |
|---|---|---|---|
| Очная | 0,36 | 0,14 | 0,50 |
| Дистанционная | 0,24 | 0,26 | 0,50 |
| Маргинальная вероятность результата | 0,60 | 0,40 | 1,00 |
Вероятность сдачи экзамена равна . При этом форма обучения не фиксируется: оба совместимых с событием исхода включены в сумму. Аналогично вероятность очной формы равна
. В таблице эти значения стоят на полях.
Интуитивно маргинализация «забывает» часть описания исхода. Если сначала различались пары , то после исключения
все пары с одинаковым
объединяются в один исход. Вероятности объединяемых взаимоисключающих событий складываются.
Совместная, условная и маргинальная вероятности
Для дискретных величин совместная вероятность , условная вероятность
и маргинальные вероятности связаны равенствами
Второе равенство является формулой полной вероятности. Оно показывает, что маргинальная вероятность представляет собой среднее условных вероятностей по распределению условия. Простая сумма обычно не является вероятностью: условные вероятности необходимо взвешивать величинами
.
Если и
независимы, то
для значений положительной вероятности. Однако равенство
справедливо независимо от наличия или отсутствия зависимости.
Вероятность, распределение и плотность
Следует различать три близких понятия.
- Маргинальная вероятность — число вида
для события
, заданного через выбранные переменные.
- Маргинальное распределение — функция или мера, сопоставляющая вероятности всем допустимым событиям для выбранных переменных.
- Маргинальная плотность
— производная маргинальной меры относительно выбранной базовой меры, обычно меры Лебега. Для непрерывной величины значение плотности в точке не является вероятностью этой точки.
В литературе словосочетание «маргинальная вероятность» иногда нестрого используют для функции вероятностей дискретной величины или для плотности. Контекст и обозначения должны показывать, идёт ли речь о вероятности события, функции масс или плотности.
Математические основы
Определение через образ меры
Пусть — случайный элемент со значениями в произведении измеримых пространств
и совместным распределением
. Координатная проекция
отображает пару в её первую компоненту. Маргинальное распределение
есть образ совместной меры при этой проекции:
Это определение не требует существования плотности и применимо к дискретным, непрерывным, смешанным и бесконечномерным моделям. Для вектора маргинализация на подмножество координат
определяется аналогично проекцией
.
Дискретный случай
Если и
дискретны и имеют совместную функцию вероятностей
, то
Для конечного числа величин оставляют интересующие координаты и суммируют по всем значениям остальных:
Здесь обозначает множество исключаемых координат. Неотрицательность и нормировка сохраняются:
Непрерывный и смешанный случаи
Если совместное распределение пары имеет плотность относительно меры Лебега, то маргинальные плотности равны
Вероятность события вычисляется уже из маргинальной плотности:
В смешанной модели вместо единого интеграла используют сумму, интеграл или их сочетание в соответствии с базовыми мерами. Теорема Тонелли гарантирует возможность изменения порядка интегрирования для неотрицательной совместной плотности; для знакопеременных интегрируемых функций соответствующее утверждение даёт теорема Фубини.
Закон полной вероятности
Для разбиения пространства событиями с положительными вероятностями
Непрерывный аналог записывается через условное распределение:
На языке условного математического ожидания это частный случай свойства башни:
Тем самым маргинализация может пониматься как усреднение условного закона по распределению переменной, на которую было наложено условие.
Моменты и утрата информации о зависимости
Маргинального распределения достаточно для вычисления любой интегрируемой функции только от
:
В частности, из него определяются среднее и дисперсия . Но ковариация, условные вероятности и вероятность совместных событий требуют сведений о совместном распределении. Даже полный набор одномерных маргинальных распределений в общем случае не определяет зависимость между компонентами.
Маргинализация в байесовском выводе
Пусть , где
— интересующий параметр, а
— вспомогательный параметр. Из совместного апостериорного распределения получают маргинальное распределение интересующего параметра:
Этот переход позволяет сообщать интервальные оценки и вероятности гипотез о , учитывая неопределённость всех остальных параметров. Аналогично апостериорное предиктивное распределение получается интегрированием по параметрам:
Наконец, маргинальное правдоподобие, или свидетельство модели,
также является результатом маргинализации, но выполняет специальную роль нормирующей константы и критерия сравнения моделей. Его не следует отождествлять с любым маргинальным распределением. В частности, при несобственном априорном распределении эта величина может быть неопределённой.[1]
Методы вычисления
Аналитическая маргинализация
Для некоторых семейств распределений интегралы и суммы вычисляются в замкнутом виде. Если совместно нормальный вектор разбит на части и
, а
и
обозначают соответствующие блоки вектора средних и ковариационной матрицы, то
В сопряжённых байесовских моделях интегрирование по параметрам также часто сводится к отношениям нормирующих констант. Аналитическое исключение переменных уменьшает размерность последующих вычислений и обычно устраняет часть ошибки Монте-Карло.
Если замкнутой формы нет, но размерность исключаемой переменной мала, применяют квадратурные формулы, адаптивное интегрирование или разложение Лапласа. Приближение Лапласа строится по моде и локальной кривизне логарифма подынтегральной функции; оно наиболее надёжно для гладких, хорошо концентрированных и близких к одномодальным распределений.[1]
Полный перебор и исключение переменных
Для конечной дискретной модели прямой алгоритм перечисляет все конфигурации исключаемых переменных и суммирует их вероятности. Его стоимость экспоненциально растёт с числом переменных. Если совместное распределение факторизуется,
порядок операций можно изменить: сначала перемножать только факторы, содержащие очередную исключаемую переменную, затем суммировать по ней. Этот алгоритм называется исключением переменных. Он использует дистрибутивность умножения относительно сложения и избегает построения полной таблицы совместного распределения.
Стоимость определяется не только количеством вершин, но и структурой графа и порядком исключения. Для дискретных моделей она экспоненциальна по индуцированной ширине, связанной с древесной шириной графа. Поэтому разреженная модель может допускать быстрый точный вывод, тогда как сравнительно небольшая, но плотно связанная модель — нет.[1]
Передача сообщений
В деревьях и деревьях сочленений маргинальные вероятности вычисляются локальной передачей сообщений. Для фактор-графа сообщение от фактора переменной
имеет вид
После поступления сообщений от соседних факторов маргинальная функция переменной пропорциональна их произведению. На ациклическом фактор-графе алгоритм сумма-произведение даёт точные маргинали после конечного числа сообщений. На графе с циклами тот же локальный алгоритм может использоваться как приближение, но сходимость и точность в общем случае не гарантированы.
В скрытой марковской модели частным случаем передачи сообщений является алгоритм прямого-обратного хода. Если — скрытое состояние, а
— наблюдения, то
где прямое сообщение суммирует вероятности прошлых скрытых траекторий, а обратное
— будущих. Перебор всех траекторий заменяется динамическим программированием.
Методы Монте-Карло
Если удаётся получить выборку из совместного распределения, маргинальная выборка выбранной компоненты образуется простым отбрасыванием остальных координат. Для любой интегрируемой функции
В байесовских моделях совместные выборки часто получают методом Монте-Карло по схеме марковских цепей. Гиббсовская выборка, выборка с перевзвешиванием и другие выборочные процедуры получили широкое применение именно как способы численно оценивать маргинальные апостериорные распределения.[1]
При выборке по значимости точки получают из удобного распределения и назначают им веса
Маргинальные вероятности и ожидания оценивают взвешенными суммами. Метод может быть очень точным при хорошем совпадении с целевым распределением, но несколько экстремальных весов способны сделать оценку неустойчивой.
Вариационные методы
Вариационный вывод заменяет трудное целевое распределение приближением
из вычислительно удобного семейства и превращает интегрирование в задачу оптимизации. Часто используют факторизацию среднего поля
Тогда факторы непосредственно служат приближениями к одномерным маргинальным распределениям. Ограниченная факторизация ускоряет вычисления, но удаляет часть зависимостей и может искажать дисперсии и хвосты. Минимизация дивергенции
, характерная для стандартного вариационного вывода, часто отдаёт предпочтение одной области высокой плотности и способна недооценивать неопределённость.[1]
Гибридные методы
На практике точную и приближённую маргинализацию сочетают. Дискретные состояния с небольшим числом значений можно точно просуммировать, а непрерывные параметры исследовать MCMC-методом; часть переменных интегрировать аналитически, а оставшиеся аппроксимировать вариационно. Такое исключение переменных до выборочного шага известно как частичная маргинализация или рао-блэкуэллизация и часто уменьшает дисперсию оценок, хотя может повысить стоимость одной итерации.
Диагностика и оценка точности
Качество вычисленной маргинальной вероятности зависит как от исходной модели, так и от численного алгоритма. Хорошее совпадение приближения с заданным совместным распределением не означает, что сама модель адекватно описывает данные.
Проверки точного вычисления
Для дискретного распределения проверяют неотрицательность и нормировку маргинальных вероятностей, а также совпадение результатов при разных допустимых порядках суммирования. Для плотности проверяют неотрицательность, единичный интеграл и согласование вычисленных моментов с моментами, полученными непосредственно из совместной модели. На малых тестовых задачах результат алгоритма передачи сообщений полезно сравнивать с полным перебором.
Численные вычисления вероятностей длинных последовательностей подвержены потере значащих разрядов и машинному обнулению. Используют масштабирование сообщений или вычисления в логарифмической шкале. После каждого шага нормировка должна быть учтена явно, иначе можно получить правдоподобно выглядящие, но неверные числа.
Диагностика Монте-Карло
Для независимой выборки стандартная ошибка оценки вероятности события убывает как
. В MCMC-наблюдениях автокорреляция уменьшает эффективный размер выборки. Поэтому оценивают эффективный размер выборки и ошибку Монте-Карло отдельно для интересующих вероятностей, квантилей и функций параметров.
Для нескольких MCMC-цепей анализируют смешивание, ранговые графики и статистику . Современная ранговая нормализация и локальные оценки эффективного размера выборки лучше обнаруживают проблемы в хвостах и при тяжёлых хвостах, чем классическая диагностика только по средним и дисперсиям.[1] Сходимость диагностик не доказывает правильность алгоритма или модели, но явные расхождения между цепями свидетельствуют о ненадёжности маргинальных оценок.
Диагностика выборки по значимости
Проверяют эффективный размер выборки, максимальные нормированные веса и устойчивость результата к удалению отдельных наблюдений. Сглаженная по Парето выборка по значимости использует оценку формы хвоста распределения весов как диагностику конечной выборки и одновременно стабилизирует экстремальные веса.[1] Тяжёлый правый хвост весов означает, что предложение недостаточно покрывает существенные области целевого распределения.
Оценка вариационных приближений
Значение вариационной нижней границы удобно для контроля оптимизации, но само по себе не гарантирует точности отдельных маргиналей. Применяют несколько начальных приближений, сравнение с MCMC на уменьшенной задаче, проверку известных моментов, моделирование из подогнанной модели и оценку чувствительности к расширению вариационного семейства. Особенно важны хвостовые вероятности: небольшая средняя ошибка плотности может сочетаться с большой относительной ошибкой редкого события.
Трудности и ограничения
Потеря информации о зависимости
Маргинализация намеренно удаляет сведения об исключаемых переменных и их зависимости с оставшимися. Например, две бинарные величины могут обе иметь распределение Бернулли с параметром , но быть независимыми, совпадать почти наверное или быть противоположными почти наверное. Одномерные маргинали во всех трёх случаях одинаковы, а совместные вероятности различны.
Следовательно, восстановить совместный закон по отдельным маргинальным законам без дополнительных предположений нельзя. Одним из способов отдельно моделировать зависимость при фиксированных маргиналях служат копулы.
Маргинальная и условная ассоциация
Связь между двумя признаками после усреднения по третьему признаку может ослабнуть, исчезнуть или изменить знак. Это явление известно как парадокс Симпсона.[1] Поэтому маргинальная вероятность ответа на вопрос о всей популяции не заменяет условные вероятности в подгруппах. Выбор между условным и маргинальным анализом определяется научным вопросом, схемой сбора данных и, в причинных задачах, предполагаемой причинной структурой.
Вычислительная сложность
Число суммируемых конфигураций экспоненциально растёт с количеством дискретных скрытых переменных, а многомерное численное интегрирование страдает от проклятия размерности. Разреженная факторизация помогает лишь тогда, когда граф допускает порядок исключения с небольшими промежуточными факторами. В моделях с сильными зависимостями, мультимодальностью или редкими событиями выборочные методы также могут исследовать пространство крайне медленно.
Плотность не является вероятностью точки
Для абсолютно непрерывной величины при каждом отдельном
, хотя
может быть положительной и даже больше единицы. Сравнение высот плотности допустимо только с учётом параметризации и меры, относительно которой плотность определена. Вероятности интервалов и других измеримых множеств инвариантны к корректной замене координат, а численные значения плотности — нет.
Неправильная нормировка и несобственные меры
Функция, заданная только с точностью до множителя, может использоваться во многих MCMC-алгоритмах, но для получения абсолютных вероятностей необходима конечная нормирующая константа. Несобственные априорные распределения иногда приводят к собственному апостериорному распределению, однако это требуется доказывать. Маргинальное правдоподобие при произвольно масштабируемом несобственном априорном распределении не определено.
Ошибка модели и ошибка алгоритма
Точная маргинализация неверно заданного совместного распределения даёт точный ответ на вопрос внутри неверной модели. И наоборот, разумная модель может сопровождаться плохим численным приближением. Эти источники ошибки проверяют раздельно: алгоритм — на эталонных задачах и диагностикой вычислений, модель — предиктивными проверками, анализом чувствительности и сопоставлением с предметными знаниями.
Современные направления исследований
Масштабируемый вариационный вывод
Стохастический вариационный вывод сочетает локальные приближения скрытых переменных с шумными градиентами по мини-пакетам и позволяет обрабатывать большие наборы данных и иерархические модели.[1] Исследования направлены на уменьшение смещения маргинальных дисперсий, построение более выразительных семейств и надёжную оценку качества без доступного точного ответа.
Нормализующие потоки задают гибкие плотности последовательностями обратимых преобразований. В амортизованном выводе нейронная сеть сразу предсказывает параметры приближённого распределения для нового наблюдения. Эти методы ускоряют повторный вывод, но добавляют ошибку амортизации и требуют проверки качества вне распределения обучающих задач.[1]
Автоматическая и дифференцируемая маргинализация
Системы вероятностного программирования отделяют описание совместной модели от алгоритма вывода. Компилятор может обнаруживать сопряжённые фрагменты, перечислять дискретные состояния, строить граф исключения или автоматически дифференцировать логарифм маргинализованной плотности. Это уменьшает объём ручных преобразований, но оптимальный порядок исключения и выбор между точным и приближённым выводом остаются трудными задачами.[1]
В дифференцируемых вероятностных моделях исследуются градиенты через суммы, интегралы и процедуры выборки. Точная сумма по небольшой дискретной переменной часто даёт градиент с меньшей дисперсией, чем оценка на основе случайного выбора одного состояния; для больших пространств применяют структурированные релаксации и последовательные методы Монте-Карло.
Сочетание точного и приближённого вывода
Современные алгоритмы стремятся автоматически выделять участки модели с малой древесной шириной и маргинализовать их точно, оставляя сложное ядро для MCMC или вариационного вывода. Такие схемы особенно важны для моделей со смешанными дискретными и непрерывными переменными, где прямое применение градиентных MCMC-методов к дискретным состояниям невозможно.
Диагностика приближённых маргиналей
Отдельное направление связано с диагностикой без знания нормирующей константы и точного распределения. Используются оценки эффективного размера выборки, ранговые проверки, сглаживание весов, симуляционная калибровка и сравнение нескольких классов приближений. Основная трудность состоит в том, что хорошее значение глобального критерия не гарантирует точность каждой интересующей хвостовой или многомерной маргинали.
Применения
Байесовское оценивание и прогнозирование
В байесовской регрессии и классификации совместное апостериорное распределение может включать тысячи коэффициентов, гиперпараметров и скрытых величин. Для интерпретации обычно нужны одномерные или двумерные маргинали отдельных эффектов, вероятности их знака, доверительные области и предиктивные вероятности. Интегрирование по всем параметрам переносит параметрическую неопределённость в прогноз вместо подстановки одной точечной оценки.
Классификация и усреднение моделей
Вероятность класса для нового объекта может требовать маргинализации скрытого представления, параметров модели и самой структуры модели:
В байесовском усреднении моделей дополнительно суммируют по индексу модели. Это позволяет учитывать неопределённость выбора модели, но результат зависит от априорных вероятностей моделей и корректности вычисления их свидетельств.
Графические модели и обработка последовательностей
В байесовских сетях и марковских случайных полях маргинальные вероятности вершин используются для диагностики, распознавания образов, обработки естественного языка, биоинформатики и систем поддержки решений. В скрытых марковских моделях и моделях пространства состояний фильтрация вычисляет маргиналь текущего состояния по прошлым наблюдениям, а сглаживание — маргиналь состояния с учётом всей последовательности.
Пропущенные данные и скрытые переменные
Если часть данных не наблюдается, правдоподобие наблюдаемой части
получают маргинализацией:
В EM-алгоритме эта задача обходится чередованием вычисления условного ожидания полного логарифмического правдоподобия и максимизации по параметрам. Классическая формулировка охватывает смеси распределений, факторный анализ, цензурированные и неполные данные.[1]
Надёжность, медицина и анализ риска
В анализе надёжности маргинальная вероятность отказа получается усреднением по неопределённым нагрузкам, параметрам материалов и скрытым состояниям компонентов. В медицинских моделях маргинальные риски описывают популяционный прогноз, тогда как условные риски относятся к подгруппам с заданными характеристиками. Их различие существенно при переносе результатов между популяциями и при интерпретации эффектов лечения.
Обучение без учителя и генеративные модели
В смесях распределений маргинальная плотность наблюдения получается суммированием по номеру компоненты. В тематических моделях, вариационных автоэнкодерах и других генеративных моделях наблюдаемое распределение получают интегрированием по скрытому представлению. Обучение и оценка качества таких моделей во многом сводятся к вычислению или ограничению логарифма этой маргинальной плотности.
См. также
- Маргинальное распределение
- Совместное распределение
- Условная вероятность
- Формула полной вероятности
- Независимость (теория вероятностей)
- Теорема Байеса
- Маргинальное правдоподобие
- Апостериорное распределение
- Вероятностная графическая модель
- Скрытая марковская модель
- Метод Монте-Карло марковских цепей
- Вариационный байесовский метод
- EM-алгоритм
- Парадокс Симпсона
Примечания
Литература
- Bishop, C. M. Pattern Recognition and Machine Learning. — New York: Springer, 2006. — 778 с. — ISBN 978-0-387-31073-2
- Gelman, A.; Carlin, J. B.; Stern, H. S.; Dunson, D. B.; Vehtari, A.; Rubin, D. B. Bayesian Data Analysis. — 3-е. — Boca Raton: CRC Press, 2013. — 675 с. — ISBN 978-1-4398-4095-5
- Grimmett, G. R.; Stirzaker, D. R. Probability and Random Processes. — 3-е. — Oxford: Oxford University Press, 2001. — ISBN 978-0-19-857223-7
- Koller, D.; Friedman, N. Probabilistic Graphical Models: Principles and Techniques. — Cambridge, Massachusetts: MIT Press, 2009. — 1272 с. — ISBN 978-0-262-01319-2
- Murphy, K. P. Probabilistic Machine Learning: Advanced Topics. — Cambridge, Massachusetts: MIT Press, 2023. — 1360 с. — ISBN 978-0-262-04843-9
- Blei, D. M.; Kucukelbir, A.; McAuliffe, J. D. Variational Inference: A Review for Statisticians // Journal of the American Statistical Association. — 2017. — Т. 112. — № 518. — С. 859—877.
- Gelfand, A. E.; Smith, A. F. M. Sampling-Based Approaches to Calculating Marginal Densities // Journal of the American Statistical Association. — 1990. — Т. 85. — № 410. — С. 398—409.
- Kschischang, F. R.; Frey, B. J.; Loeliger, H.-A. Factor Graphs and the Sum-Product Algorithm // IEEE Transactions on Information Theory. — 2001. — Т. 47. — № 2. — С. 498—519.
- Lauritzen, S. L.; Spiegelhalter, D. J. Local Computations with Probabilities on Graphical Structures and Their Application to Expert Systems // Journal of the Royal Statistical Society. Series B. — 1988. — Т. 50. — № 2. — С. 157—224.
- Vehtari, A.; Simpson, D.; Gelman, A.; Yao, Y.; Gabry, J. Pareto Smoothed Importance Sampling // Journal of Machine Learning Research. — 2024. — Т. 25. — № 72. — С. 1—58.
Ссылки
- Foundations of the Theory of Probability — свободно доступное издание книги А. Н. Колмогорова на сайте Американского математического общества.
- Pareto Smoothed Importance Sampling — статья и программные материалы по диагностике выборки по значимости на сайте Journal of Machine Learning Research.
- Probabilistic Machine Learning — открытые электронные материалы и код к книгам Кевина Мёрфи.

