Вероятностно-статистические методы

Материал из MachineLearning.

Перейти к: навигация, поиск
Статья написана с использованием LLM Claude Sonnet 5 и проверена участником Д. Жумабеков 21:28, 19 июля 2026 (MSD)


Содержание

Введение

Детерминированная постановка задачи обучения по прецедентам предполагает существование неизвестной функциональной зависимости y = y(x), которую алгоритм должен приблизить по обучающей выборке X^{\ell} = (x_i, y_i)_{i=1}^{\ell}. Вероятностно-статистическая постановка заменяет это предположение более общим: обучающая выборка рассматривается как реализация независимых одинаково распределённых наблюдений из некоторого неизвестного совместного распределения p(x,y) на множестве X \times Y, а не как набор точных значений детерминированной функции.

Это обобщение содержательно, а не формально, и даёт три практических следствия, отсутствующих в детерминированной постановке. Во-первых, вероятностная модель позволяет получить не только точечный ответ, но и оценку неопределённости этого ответа — апостериорную вероятность P(y \mid x), а не одно лишь наиболее вероятное значение класса. Во-вторых, вероятностная постановка естественно учитывает зашумлённость данных: объекты с одинаковым признаковым описанием x могут относиться к разным классам с ненулевой вероятностью — ситуация, несовместимая с детерминированной моделью y=y(x), но полностью согласующаяся с распределением p(x,y) общего вида. В-третьих, явное указание вероятностной модели данных позволяет систематически привлекать методы математической статистики для работы на малых выборках — байесовский вывод, разбираемый в разделах ниже, даёт формальный механизм включения априорных знаний о задаче в условиях, когда объёма данных недостаточно для надёжного частотного оценивания.

Все вероятностные методы классификации восстанавливают совместное распределение p(x,y) одним из двух принципиально различных способов — дискриминативным или генеративным, — рассматриваемых в следующих двух разделах.

Дискриминативный подход

Дискриминативный подход раскладывает совместное распределение как

p(x,y) = P(y \mid x; w)\, p(x)

где P(y \mid x; w) — параметрическая модель условного распределения класса при заданном объекте с вектором параметров w, а p(x) — безусловное распределение объектов, не моделируемое явно и не зависящее от w. Логарифм правдоподобия выборки при этом разложении:

\ln p(X^{\ell} \mid w) = \sum_{i=1}^{\ell} \ln P(y_i \mid x_i; w) + \sum_{i=1}^{\ell} \ln p(x_i)

Второе слагаемое не зависит от w, и потому критерий максимума правдоподобия для дискриминативной модели сводится к максимизации только первого слагаемого:

w_{\mathrm{ML}} = \arg\max_{w} \sum_{i=1}^{\ell} \ln P(y_i \mid x_i; w)

Структурная особенность этой оптимизационной задачи в том, что она решается как единая задача по всей выборке сразу: параметр w общий для всех классов, и его настройка происходит по объектам, лежащим вблизи разделяющей границы между классами, в максимальной степени влияющим на значение суммы. Типичные представители дискриминативного подхода — Логистическая регрессия, в которой P(y \mid x; w) задаётся сигмоидной (для двух классов) или softmax (для нескольких классов) функцией от линейной комбинации признаков, а также решающие деревья и леса с вероятностными оценками в листьях, где P(y \mid x) оценивается эмпирической частотой класса среди объектов, попавших в соответствующий лист.

Генеративный подход

Генеративный подход раскладывает то же совместное распределение иначе:

p(x,y) = P(y)\, p(x \mid y; w)

где P(y) — априорная вероятность класса, p(x \mid y;w) — параметрическая модель условного распределения признаков внутри класса y, как правило, со своим набором параметров w_y для каждого класса. Логарифм правдоподобия выборки при этом разложении:

\ln p(X^{\ell} \mid w) = \sum_{i=1}^{\ell} \ln P(y_i) + \sum_{i=1}^{\ell} \ln p(x_i \mid y_i; w_{y_i})

В отличие от дискриминативного случая, здесь оптимизационная задача распадается на независимые подзадачи: первое слагаемое максимизируется по P(y) отдельно (что даёт эмпирические частоты классов \widehat{P}(y) = \ell_y/\ell), а второе слагаемое распадается на сумму по классам, каждое из которых максимизируется по своему набору параметров w_y независимо, с использованием только объектов данного класса:

w_y = \arg\max_{w_y} \sum_{i:\, y_i = y} \ln p(x_i \mid y; w_y)

Эта структурная независимость задач по классам — принципиальное отличие от дискриминативного подхода, где параметр w настраивается совместно по всей выборке. Типичные представители генеративного подхода — Наивный байесовский классификатор, линейный и квадратичный дискриминантный анализ (восстанавливающие p(x\mid y;w_y) нормальным распределением с общей или индивидуальной для класса ковариационной матрицей), а также смеси распределений для моделирования многомодальных классов.

Сравнение подходов

Сопоставление дискриминативного и генеративного подходов
Критерий Дискриминативный подход Генеративный подход
Требуемый объём данных как правило, ниже: достаточно представительной выборки вблизи разделяющей границы как правило, выше: требуется надёжная оценка полной плотности p(x\mid y) во всей области каждого класса; при верно заданной модели плотности, однако, может обучаться эффективнее по меньшему числу объектов[1]
Устойчивость к нарушению модельных предположений выше: неверная функциональная форма P(y\mid x;w) сказывается в первую очередь вблизи границы классов ниже: неверная модель p(x\mid y;w) искажает классификатор во всей области признакового пространства, включая области, далёкие от границы
Интерпретируемость параметров как правило, ниже: параметры w не имеют прямого содержательного смысла вне контекста разделяющей функции как правило, выше: параметры w_y непосредственно описывают распределение признаков внутри класса (например, характерные средние значения и разброс) и допускают содержательную интерпретацию
Применимость при дисбалансе классов требует явной коррекции (перевзвешивание объектов, подбор порога принятия решения) естественна: P(y) оценивается и используется как отдельный, явно выделенный множитель, легко пересчитываемый под другое соотношение классов без переобучения p(x\mid y;w_y)

Метод максимального правдоподобия как общий инструмент оценивания

Оба рассмотренных подхода используют один и тот же общий принцип — Метод максимального правдоподобия: параметры модели выбираются так, чтобы максимизировать вероятность (плотность) наблюдения именно той выборки, которая была получена. Формально, для параметрической модели p(z \mid \theta) (где z обозначает либо пару (x,y), либо, после разложения совместного распределения, соответствующий сомножитель) точечная оценка максимального правдоподобия:

\theta_{\mathrm{ML}} = \arg\max_{\theta} \sum_{i=1}^{\ell} \ln p(z_i \mid \theta)

При выполнении стандартных регулярных условий оценка максимального правдоподобия состоятельна (\theta_{\mathrm{ML}} \to \theta^{*} при \ell \to \infty) и асимптотически эффективна (её асимптотическая дисперсия достигает нижней границы Крамера — Рао). Однако эти свойства — асимптотические: они гарантируют качество оценки лишь в пределе неограниченного роста объёма выборки и ничего не говорят о поведении оценки при конечном, тем более малом \ell. На малых выборках точечная ML-оценка систематически проявляет следующие ограничения: она не учитывает никакой информации о параметре \theta, кроме содержащейся в выборке, из-за чего чувствительна к случайным флуктуациям малой выборки; она может давать вырожденные или экстремальные значения (например, оценку вероятности события, равную нулю или единице, если событие ни разу не наблюдалось либо наблюдалось при каждом испытании); и она не даёт никакой характеристики собственной неопределённости — сама по себе точечная оценка не сообщает, насколько ей можно доверять. Эти ограничения устраняются переходом к байесовскому обучению, рассматриваемому в следующем разделе.

Байесовское обучение

Байесовское обучение рассматривает сам вектор параметров w как случайную величину, для которой заданная априорная плотность \mathrm{Prior}(w) отражает знания или предположения о правдоподобных значениях w до наблюдения выборки. По формуле Байеса апостериорное распределение параметров при условии наблюдённой выборки X^{\ell}:

p(w \mid X^{\ell}) = \frac{p(X^{\ell} \mid w)\, \mathrm{Prior}(w)}{p(X^{\ell})} \propto p(X^{\ell} \mid w)\, \mathrm{Prior}(w)

где p(X^{\ell}\mid w) = \prod_{i=1}^{\ell} p(z_i \mid w) — правдоподобие выборки при заданном w (то же выражение, что максимизируется в методе максимального правдоподобия), а p(X^{\ell}) — не зависящая от w нормировочная константа. Принципиальное отличие полного байесовского вывода от точечного оценивания состоит в том, что результатом обучения служит не единственное значение w, а целое распределение p(w\mid X^{\ell}), полностью характеризующее оставшуюся после наблюдения выборки неопределённость относительно параметров. Прогноз для нового объекта x при полном байесовском выводе получают усреднением (маргинализацией) по этому распределению, а не подстановкой единственного значения параметра:

p(y \mid x, X^{\ell}) = \int p(y \mid x, w)\, p(w \mid X^{\ell})\, dw

Такое усреднение по всем правдоподобным значениям w, взвешенным их апостериорной вероятностью, автоматически учитывает неопределённость в оценке параметров: если апостериорное распределение p(w\mid X^{\ell}) широкое (что типично для малых выборок), итоговый прогноз p(y\mid x, X^{\ell}) оказывается более сглаженным (менее категоричным) по сравнению с прогнозом, построенным по единственной точечной оценке параметра, — эффект, напрямую снижающий риск переобучения на малых выборках.

MAP-оценка и регуляризация

Вычисление интеграла маргинализации по w в общем случае аналитически неразрешимо и требует приближённых методов. Практический компромисс между точечным ML-оцениванием и полным байесовским выводом — MAP-оценка (maximum a posteriori): вместо усреднения по всему апостериорному распределению берётся точка его максимума:

w_{\mathrm{MAP}} = \arg\max_{w} p(w \mid X^{\ell}) = \arg\max_{w} \left[ \ln p(X^{\ell}\mid w) + \ln \mathrm{Prior}(w) \right]

Сопоставление с формулой ML-оценки показывает, что MAP-оценка отличается от неё ровно одним дополнительным слагаемым — логарифмом априорной плотности параметра:

w_{\mathrm{MAP}} = \arg\max_{w} \left[ \sum_{i=1}^{\ell} \ln p(z_i \mid w) + \ln \mathrm{Prior}(w) \right]

Первое слагаемое — логарифм правдоподобия, в точности совпадающий с максимизируемым в методе максимального правдоподобия; второе слагаемое — логарифм априорной плотности, играющий роль регуляризатора.

Отсюда следует точное соответствие между регуляризацией и байесовским априорным распределением: добавление к функционалу правдоподобия регуляризирующего слагаемого -\Omega(w) эквивалентно выбору априорного распределения

\mathrm{Prior}(w) \propto \exp(-\Omega(w))


Это позволяет рассматривать любую регуляризацию как неявный байесовский вывод с фиксированным, но не выписанным явно априорным распределением, и наоборот — выбор конкретной формы регуляризатора как способ задать содержательные априорные предположения о параметрах, не прибегая к полному байесовскому аппарату. Типичные пары «регуляризатор — априорное распределение»:

  • L_2-регуляризация (гребневая регрессия, weight decay), \Omega(w) = \frac{1}{2\tau^2}\|w\|^2, соответствует нормальному априорному распределению \mathrm{Prior}(w) \propto \exp(-\|w\|^2 / 2\tau^2) с нулевым средним и дисперсией \tau^2 — предположению, что параметры, скорее всего, невелики по абсолютной величине и симметрично распределены вокруг нуля.
  • L_1-регуляризация, \Omega(w) = \gamma\|w\|_1, соответствует априорному распределению Лапласа \mathrm{Prior}(w) \propto \exp(-\gamma\|w\|_1), более острому в нуле, чем нормальное распределение той же дисперсии, что и объясняет склонность L_1-регуляризации порождать разреженные (с точными нулевыми компонентами) решения.
  • Эластичная сеть (elastic net), сочетающая \Omega(w) = \gamma_1\|w\|_1 + \gamma_2\|w\|^2, соответствует смеси нормального и лапласовского приоров и объединяет свойства разреженности и устойчивости при коррелированных признаках.

Задачи на малых выборках

Рассмотрим геологическую задачу прогноза месторождений: по данным о геологическом строении участка (тип пород, характер тектонических нарушений, результаты предварительной разведки и тому подобные признаки, многие из которых качественные, экспертно оцениваемые и не допускающие точного количественного измерения) требуется оценить вероятность наличия промышленно значимого месторождения на данном участке. Специфика задачи в том, что число уже разведанных и подтверждённых объектов данного геологического типа, как правило, исчисляется единицами или, в лучшем случае, десятками — в отличие от типичных задач классификации с сотнями и тысячами прецедентов.

При таком объёме данных частотные (ML) оценки параметров становятся ненадёжными по нескольким причинам. Во-первых, при малом числе прецедентов n оценка доли \widehat{\theta} = k/n (где k — число подтверждённых месторождений среди n разведанных участков данного типа) обладает большой дисперсией: при n=5 изменение результата всего на одном участке меняет оценку на 0{,}2, то есть на пятую часть всего диапазона [0,1]. Во-вторых, малые n регулярно приводят к вырожденным оценкам \widehat{\theta} \in \{0, 1\} (если ни на одном или на всех разведанных участках месторождение подтвердилось), формально утверждающим невозможность либо гарантированность события — вывод, не оправданный столь скудными данными. В-третьих, качественная, экспертная природа многих признаков не позволяет напрямую применить методы, требующие точного числового описания объектов, и вынуждает работать с малым числом дискретных, часто разреженно представленных сочетаний признаков, что ещё больше уменьшает эффективный объём данных, приходящийся на каждое сочетание.

В таких условиях информативное априорное распределение предпочтительнее точечной ML-оценки по существу, а не только по формальным статистическим соображениям: геологическая экспертиза, как правило, располагает содержательными знаниями о базовой частоте месторождений для родственных геологических структур, накопленными по существенно большей совокупности прошлых разведок, — эти знания естественно кодируются как параметры априорного распределения и, в отличие от ML-оценки по единичным новым прецедентам, не обнуляются и не вырождаются при недостатке локальных данных. MAP-оценка, объединяющая скудную локальную статистику с содержательным априорным знанием, систематически даёт более устойчивый и более консервативный (менее подверженный случайным флуктуациям малой выборки) результат, что и демонстрирует численный пример следующего раздела.

Численный пример MAP-оценки с сопряжённым априорным распределением

Пусть \theta \in [0,1] — вероятность подтверждения месторождения для данного геологического типа участка, а результат разведки каждого участка — независимое испытание Бернулли с этой вероятностью. Правдоподобие выборки из n испытаний с k подтверждениями:

p(k \mid \theta, n) = \binom{n}{k} \theta^{k} (1-\theta)^{n-k}

В качестве сопряжённого априорного распределения для параметра испытаний Бернулли выбирается бета-распределение \mathrm{Prior}(\theta) = \mathrm{Beta}(\theta \mid \alpha, \beta) \propto \theta^{\alpha-1}(1-\theta)^{\beta-1}, где гиперпараметры \alpha, \beta > 0 кодируют априорные представления о \theta: априорное среднее равно \alpha/(\alpha+\beta), а сумма \alpha+\beta играет роль «эквивалентного числа наблюдений», задающих уверенность в этом среднем. Апостериорное распределение находится перемножением правдоподобия и приора:

p(\theta \mid k, n) \propto \theta^{k}(1-\theta)^{n-k} \cdot \theta^{\alpha-1}(1-\theta)^{\beta-1} = \theta^{\alpha+k-1} (1-\theta)^{\beta+n-k-1}

что с точностью до нормировки в точности бета-распределение с обновлёнными параметрами:

p(\theta \mid k, n) = \mathrm{Beta}(\theta \mid \alpha + k,\, \beta + n - k)

Сопряжённость приора означает именно это: апостериорное распределение принадлежит тому же параметрическому семейству, что и приор, с параметрами, обновлёнными простым добавлением наблюдённых успехов и неудач. MAP-оценка — мода этого бета-распределения:

\theta_{\mathrm{MAP}} = \frac{\alpha+k-1}{\alpha+\beta+n-2}

Численный пример. Пусть для рассматриваемого геологического типа разведано n=5 участков, из которых k=4 оказались месторождениями. Точечная ML-оценка:

\theta_{\mathrm{ML}} = k/n = 4/5 = 0{,}8

— величина, основанная всего на пяти испытаниях и статистически крайне ненадёжная. Пусть по совокупности прошлых разведок родственных геологических структур известно, что типичная (базовая) доля подтверждённых месторождений составляет около 0{,}3, и это знание кодируется приором \mathrm{Beta}(\alpha=3, \beta=7) (априорное среднее 3/10 = 0{,}3, эквивалент десяти условных наблюдений). Апостериорное распределение по формуле выше:

p(\theta \mid k{=}4, n{=}5) = \mathrm{Beta}(\theta \mid 3+4,\, 7+5-4) = \mathrm{Beta}(\theta \mid 7, 8)

MAP-оценка:

\theta_{\mathrm{MAP}} = \frac{7-1}{7+8-2} = \frac{6}{13} \approx 0{,}462

Апостериорное среднее (использующееся, если требуется не мода, а математическое ожидание апостериорного распределения) даёт близкое значение 7/15 \approx 0{,}467. Сопоставление \theta_{\mathrm{ML}} = 0{,}8 и \theta_{\mathrm{MAP}} \approx 0{,}462 наглядно демонстрирует эффект регуляризации малой выборки априорным знанием: ML-оценка, основанная исключительно на пяти локальных наблюдениях, оказывается почти вдвое выше MAP-оценки, «стянутой» в сторону типичной для родственных структур базовой частоты. При увеличении числа локальных наблюдений (росте n и k при сохранении их отношения) вклад приора относительно правдоподобия убывает, и MAP-оценка асимптотически сближается с ML-оценкой — иллюстрация общего принципа, согласно которому влияние априорного распределения существенно именно тогда, когда объём данных мал, и естественным образом ослабевает по мере накопления наблюдений.

Литература

Личные инструменты