Критерий хи-квадрат
Материал из MachineLearning.
(→Пример 2: -описка) |
|||
| (18 промежуточных версий не показаны.) | |||
| Строка 1: | Строка 1: | ||
| - | + | [[Изображение:Chi-square.png|thumb|right|400px|Плотности распределения хи-квадрат при различных числах степеней свободы]] | |
| - | + | ||
| - | Критерий <tex>\chi^2</tex> - | + | '''Критерий хи-квадрат''' (англ. ''chi-square test'', <tex>\chi^2</tex>-test) — семейство методов [[Проверка статистических гипотез|проверки статистических гипотез]], статистика которых при выполнении нулевой гипотезы имеет точное или приближённое [[Распределение хи-квадрат|распределение хи-квадрат]]. Чаще всего под этим названием понимают '''критерий хи-квадрат Пирсона''' (англ. ''Pearson's chi-square test''), сравнивающий наблюдаемые и ожидаемые частоты категориальных событий. |
| - | + | Критерий применяют для трёх основных задач: | |
| - | + | * проверки согласия наблюдаемого распределения с заданной вероятностной моделью; | |
| + | * проверки независимости двух категориальных признаков; | ||
| + | * проверки однородности распределений в нескольких выборках. | ||
| + | В [[Машинное обучение|машинном обучении]] критерий хи-квадрат используется при анализе категориальных данных, отборе признаков (англ. ''feature selection''), исследовании связи признаков с целевым классом, анализе ошибок классификаторов и обнаружении изменений распределения данных. | ||
| - | + | Критерий был предложен Карлом Пирсоном в 1900 году.<ref name="Pearson1900">Pearson K. [https://doi.org/10.1080/14786440009463897 On the criterion that a given system of deviations from the probable in the case of a correlated system of variables is such that it can be reasonably supposed to have arisen from random sampling] // ''The London, Edinburgh, and Dublin Philosophical Magazine and Journal of Science''. 1900. Vol. 50, no. 302. P. 157–175.</ref> | |
| - | < | + | |
| - | + | ||
| + | == Мотивация == | ||
| - | + | Пусть результаты наблюдений относятся к нескольким взаимоисключающим категориям. Даже если теоретическая модель верна, наблюдаемые количества объектов в категориях обычно не совпадают с ожидаемыми в точности. Например, при ста бросках правильной монеты не обязательно получится ровно 50 орлов и 50 решек. | |
| - | + | Небольшое расхождение может быть следствием случайных колебаний, тогда как слишком большое расхождение может указывать на неверность предполагаемой модели. Критерий хи-квадрат формализует вопрос: достаточно ли велико различие между наблюдаемыми и ожидаемыми частотами, чтобы считать его статистически значимым? | |
| - | Пусть | + | Пусть: |
| - | <tex> | + | * <tex>O_i</tex> — наблюдаемая частота (англ. ''observed frequency'') в категории <tex>i</tex>; |
| + | * <tex>E_i</tex> — ожидаемая частота (англ. ''expected frequency'') при выполнении нулевой гипотезы; | ||
| + | * <tex>k</tex> — число категорий. | ||
| - | + | Статистика критерия Пирсона определяется формулой | |
| - | + | ::<tex>X^2=\sum_{i=1}^{k}\frac{(O_i-E_i)^2}{E_i}.</tex> | |
| - | + | Здесь <tex>X^2</tex> обозначает значение статистики, вычисленное по данным, а <tex>\chi^2_\nu</tex> — теоретическое распределение хи-квадрат с <tex>\nu</tex> степенями свободы. | |
| - | + | ||
| - | + | ||
| - | + | Каждое слагаемое | |
| - | + | ::<tex>\frac{(O_i-E_i)^2}{E_i}</tex> | |
| - | + | характеризует вклад отдельной категории в общее расхождение. Возведение разности в квадрат не позволяет положительным и отрицательным отклонениям взаимно уничтожиться. Деление на <tex>E_i</tex> учитывает масштаб ожидаемых случайных колебаний: одинаковое абсолютное расхождение имеет различную значимость при малых и больших ожидаемых частотах. | |
| - | == | + | == Статистическая гипотеза и правило решения == |
| - | + | Для критерия согласия нулевая гипотеза имеет вид | |
| - | <tex>\ | + | ::<tex>H_0:\quad p_i=p_i^{(0)},\qquad i=1,\ldots,k,</tex> |
| - | + | где <tex>p_i^{(0)}</tex> — теоретическая вероятность попадания наблюдения в категорию <tex>i</tex>. Альтернативная гипотеза утверждает, что хотя бы одна вероятность отличается от предполагаемой: | |
| - | + | ::<tex>H_1:\quad \exists i:\;p_i\ne p_i^{(0)}.</tex> | |
| - | + | Если объём выборки равен <tex>n</tex>, ожидаемая частота категории равна | |
| - | <tex> | + | ::<tex>E_i=np_i^{(0)}.</tex> |
| - | + | При выполнении нулевой гипотезы, независимости наблюдений и выполнении условий асимптотического приближения статистика Пирсона имеет приближённое распределение хи-квадрат: | |
| + | ::<tex>X^2\ \longrightarrow\ \chi^2_\nu,\qquad n\to\infty.</tex> | ||
| - | ''' | + | Здесь <tex>\nu</tex> — число степеней свободы (англ. ''degrees of freedom'').<ref name="Cochran1952">Cochran W. G. [https://doi.org/10.1214/aoms/1177729380 The chi-square Test of Goodness of Fit] // ''The Annals of Mathematical Statistics''. 1952. Vol. 23, no. 3. P. 315–345.</ref> |
| - | <tex> | + | Критерий Пирсона является правосторонним: чем сильнее наблюдаемые частоты отличаются от ожидаемых, тем больше значение статистики. Достигаемый уровень значимости, или <tex>p</tex>-значение (англ. ''p-value''), определяется как |
| - | = | + | ::<tex>p=P\{\chi^2_\nu\geq X^2_{\mathrm{obs}}\mid H_0\}.</tex> |
| - | + | До анализа данных выбирают уровень значимости (англ. ''significance level'') <tex>\alpha</tex>. Правило решения имеет вид: | |
| - | + | * если <tex>p\leq\alpha</tex>, нулевая гипотеза отвергается; | |
| + | * если <tex>p>\alpha</tex>, оснований отвергнуть нулевую гипотезу недостаточно. | ||
| - | + | Эквивалентно нулевая гипотеза отвергается, если | |
| - | <tex> | + | ::<tex>X^2_{\mathrm{obs}}>\chi^2_{1-\alpha,\nu},</tex> |
| - | + | где <tex>\chi^2_{1-\alpha,\nu}</tex> — квантиль распределения хи-квадрат. | |
| - | + | Фраза «нулевая гипотеза не отвергается» не означает, что гипотеза доказана. Такой результат означает только, что наблюдаемое расхождение совместимо с гипотезой при выбранном уровне значимости и имеющемся объёме данных. | |
| - | + | Очень малое значение <tex>X^2</tex> также не является основанием для отклонения гипотезы в стандартном критерии Пирсона. Если требуется обнаруживать подозрительно точное совпадение частот, необходимо заранее определить отдельную статистическую процедуру. | |
| - | + | == Основные варианты критерия == | |
| - | + | === Критерий согласия === | |
| - | + | [[Критерии согласия|Критерий согласия]] (англ. ''goodness-of-fit test'') проверяет, соответствует ли распределение одного категориального признака заранее заданным вероятностям. | |
| - | Критерий <tex>\chi^2</tex> | + | Пусть независимые наблюдения <tex>X_1,\ldots,X_n</tex> могут попадать в категории <tex>A_1,\ldots,A_k</tex>. Проверяется гипотеза |
| + | |||
| + | ::<tex>H_0:\quad P\{X\in A_i\}=p_i,\qquad i=1,\ldots,k,</tex> | ||
| + | |||
| + | где | ||
| + | |||
| + | ::<tex>p_i\geq0,\qquad \sum_{i=1}^{k}p_i=1.</tex> | ||
| + | |||
| + | Наблюдаемая частота категории равна | ||
| + | |||
| + | ::<tex>O_i=\sum_{j=1}^{n}[X_j\in A_i],</tex> | ||
| + | |||
| + | а ожидаемая частота — | ||
| + | |||
| + | ::<tex>E_i=np_i.</tex> | ||
| + | |||
| + | Если все вероятности <tex>p_i</tex> заданы до анализа данных, число степеней свободы равно | ||
| + | |||
| + | ::<tex>\nu=k-1.</tex> | ||
| + | |||
| + | Единица вычитается вследствие ограничения | ||
| + | |||
| + | ::<tex>\sum_{i=1}^{k}O_i=\sum_{i=1}^{k}E_i=n.</tex> | ||
| + | |||
| + | Поэтому отклонения во всех <tex>k</tex> категориях не могут изменяться независимо. | ||
| + | |||
| + | === Проверка непрерывного распределения === | ||
| + | |||
| + | Критерий согласия хи-квадрат можно применять и для проверки гипотезы о непрерывном распределении. Область значений случайной величины разбивают на интервалы | ||
| + | |||
| + | ::<tex>A_i=(a_{i-1},a_i],\qquad i=1,\ldots,k.</tex> | ||
| + | |||
| + | Если проверяется распределение с функцией распределения <tex>F</tex>, вероятность попадания в интервал равна | ||
| + | |||
| + | ::<tex>p_i=F(a_i)-F(a_{i-1}),</tex> | ||
| + | |||
| + | а ожидаемая частота — | ||
| + | |||
| + | ::<tex>E_i=n\bigl(F(a_i)-F(a_{i-1})\bigr).</tex> | ||
| + | |||
| + | После этого вычисляют обычную статистику Пирсона: | ||
| + | |||
| + | ::<tex>X^2=\sum_{i=1}^{k}\frac{(O_i-E_i)^2}{E_i}.</tex> | ||
| + | |||
| + | Недостаток подхода состоит в зависимости результата от способа разбиения числовой оси. Изменение числа интервалов или их границ может изменить значение статистики и мощность критерия (англ. ''statistical power''). | ||
| + | |||
| + | При проверке непрерывных распределений вместе с критерием хи-квадрат часто рассматривают [[Критерий Колмогорова-Смирнова|критерий Колмогорова — Смирнова]], критерий Андерсона — Дарлинга (англ. ''Anderson–Darling test'') и графические методы.<ref name="NIST">NIST/SEMATECH. [https://www.itl.nist.gov/div898/handbook/eda/section3/eda35f.htm Chi-Square Goodness-of-Fit Test] // ''e-Handbook of Statistical Methods''.</ref> | ||
| + | |||
| + | === Сложная гипотеза === | ||
| + | |||
| + | Гипотеза называется сложной, если проверяемое распределение содержит неизвестные параметры: | ||
| + | |||
| + | ::<tex>H_0:\quad X\sim F(x;\theta),\qquad \theta\in\Theta.</tex> | ||
| + | |||
| + | Например, для [[Распределение Пуассона|распределения Пуассона]] может быть неизвестна интенсивность <tex>\lambda</tex>, а для нормального распределения — математическое ожидание и дисперсия. | ||
| + | |||
| + | Параметр <tex>\theta</tex> оценивают по выборке, например с помощью [[Принцип максимума правдоподобия|метода максимального правдоподобия]] (англ. ''maximum likelihood estimation'', MLE). Для сгруппированных данных оценка может быть записана как | ||
| + | |||
| + | ::<tex>\widehat{\theta}=\arg\max_{\theta\in\Theta}\sum_{i=1}^{k}O_i\ln p_i(\theta),</tex> | ||
| + | |||
| + | где | ||
| + | |||
| + | ::<tex>p_i(\theta)=F(a_i;\theta)-F(a_{i-1};\theta).</tex> | ||
| + | |||
| + | Ожидаемые частоты вычисляют по оценённым параметрам: | ||
| + | |||
| + | ::<tex>E_i=np_i(\widehat{\theta}).</tex> | ||
| + | |||
| + | Если по данным оценено <tex>s</tex> независимых параметров, то при стандартных условиях число степеней свободы обычно равно | ||
| + | |||
| + | ::<tex>\nu=k-1-s.</tex> | ||
| + | |||
| + | Каждый оценённый параметр уменьшает число степеней свободы, поскольку накладывает дополнительное ограничение на ожидаемые частоты.<ref name="Fisher1922">Fisher R. A. [https://doi.org/10.2307/2340521 On the Interpretation of chi-square from Contingency Tables, and the Calculation of P] // ''Journal of the Royal Statistical Society''. 1922. Vol. 85, no. 1. P. 87–94.</ref> | ||
| + | |||
| + | Формула <tex>\nu=k-1-s</tex> не является полностью универсальной. Результат зависит от способа оценивания параметров, структуры модели и выбора интервалов. Если параметры или границы интервалов выбирались после изучения данных, стандартное распределение хи-квадрат может оказаться неточным. В таких случаях нулевое распределение статистики оценивают с помощью параметрического бутстрепа (англ. ''parametric bootstrap'') или моделирования методом Монте-Карло (англ. ''Monte Carlo simulation''). | ||
| + | |||
| + | === Критерий независимости === | ||
| + | |||
| + | Критерий независимости (англ. ''chi-square test of independence'') проверяет наличие статистической связи между двумя категориальными признаками. Результаты наблюдений записывают в [[Таблица сопряженности|таблицу сопряжённости]] (англ. ''contingency table''). | ||
| + | |||
| + | Пусть первый признак принимает <tex>r</tex> значений, а второй — <tex>c</tex> значений. Обозначим: | ||
| + | |||
| + | * <tex>O_{ij}</tex> — наблюдаемое число объектов в ячейке <tex>(i,j)</tex>; | ||
| + | * <tex>O_{i\cdot}</tex> — сумма наблюдений в строке <tex>i</tex>; | ||
| + | * <tex>O_{\cdot j}</tex> — сумма наблюдений в столбце <tex>j</tex>; | ||
| + | * <tex>n</tex> — общий объём выборки. | ||
| + | |||
| + | Нулевая гипотеза имеет вид | ||
| + | |||
| + | ::<tex>H_0:\quad P\{A=i,B=j\}=P\{A=i\}P\{B=j\}.</tex> | ||
| + | |||
| + | При независимости признаков ожидаемая частота в ячейке равна | ||
| + | |||
| + | ::<tex>E_{ij}=\frac{O_{i\cdot}O_{\cdot j}}{n}.</tex> | ||
| + | |||
| + | Статистика критерия определяется выражением | ||
| + | |||
| + | ::<tex>X^2=\sum_{i=1}^{r}\sum_{j=1}^{c}\frac{(O_{ij}-E_{ij})^2}{E_{ij}}.</tex> | ||
| + | |||
| + | Число степеней свободы равно | ||
| + | |||
| + | ::<tex>\nu=(r-1)(c-1).</tex> | ||
| + | |||
| + | Отвержение гипотезы независимости означает, что распределение одного признака зависит от значения другого. Однако критерий не устанавливает направление причинной связи и не определяет автоматически, какие именно категории ответственны за обнаруженное различие.<ref name="Agresti2019">Agresti A. ''An Introduction to Categorical Data Analysis''. 3rd ed. Hoboken: Wiley, 2019.</ref> | ||
| + | |||
| + | === Критерий однородности === | ||
| + | |||
| + | Критерий однородности (англ. ''chi-square test of homogeneity'') проверяет, одинаково ли распределён категориальный признак в нескольких независимых совокупностях. | ||
| + | |||
| + | Например, с его помощью можно сравнивать: | ||
| + | |||
| + | * распределение ответов пользователей между несколькими версиями интерфейса; | ||
| + | * частоты классов в данных из разных источников; | ||
| + | * структуру категорий в обучающей и эксплуатационной выборках; | ||
| + | * распределение исходов в нескольких экспериментальных группах. | ||
| + | |||
| + | Формулы статистики и числа степеней свободы совпадают с критерием независимости. Различается содержательная интерпретация данных: | ||
| + | |||
| + | * при проверке независимости одна выборка классифицируется одновременно по двум признакам; | ||
| + | * при проверке однородности сравниваются несколько независимо полученных выборок. | ||
| + | |||
| + | == Порядок применения == | ||
| + | |||
| + | Корректное применение критерия включает следующие этапы. | ||
| + | |||
| + | # Сформулировать нулевую и альтернативную гипотезы. | ||
| + | # До анализа результатов выбрать уровень значимости <tex>\alpha</tex>. | ||
| + | # Определить взаимоисключающие категории. | ||
| + | # Вычислить наблюдаемые частоты <tex>O_i</tex> или <tex>O_{ij}</tex>. | ||
| + | # Вычислить ожидаемые частоты <tex>E_i</tex> или <tex>E_{ij}</tex>. | ||
| + | # Проверить независимость наблюдений. | ||
| + | # Проверить, достаточно ли велики ожидаемые частоты. | ||
| + | # Определить число степеней свободы. | ||
| + | # Вычислить статистику <tex>X^2</tex>. | ||
| + | # Найти <tex>p</tex>-значение или сравнить статистику с критическим значением. | ||
| + | # Сформулировать содержательный вывод. | ||
| + | # При необходимости исследовать отдельные ячейки и величину эффекта. | ||
| + | |||
| + | Последние два этапа особенно важны. Сам критерий показывает наличие общего расхождения, но не объясняет его структуру и практическую значимость. | ||
| + | |||
| + | == Примеры == | ||
| + | |||
| + | === Проверка заданных пропорций === | ||
| + | |||
| + | Рассмотрим выборку из 100 объектов. В первую категорию попало 46 объектов, во вторую — 54. Проверяется гипотеза о равных вероятностях: | ||
| + | |||
| + | ::<tex>H_0:\quad p_1=p_2=0{,}5.</tex> | ||
| + | |||
| + | Ожидаемые частоты равны | ||
| + | |||
| + | ::<tex>E_1=E_2=100\cdot0{,}5=50.</tex> | ||
| + | |||
| + | Статистика критерия: | ||
| + | |||
| + | ::<tex>X^2=\frac{(46-50)^2}{50}+\frac{(54-50)^2}{50}=0{,}64.</tex> | ||
| + | |||
| + | Число степеней свободы: | ||
| + | |||
| + | ::<tex>\nu=2-1=1.</tex> | ||
| + | |||
| + | Достигаемый уровень значимости составляет приблизительно | ||
| + | |||
| + | ::<tex>p\approx0{,}424.</tex> | ||
| + | |||
| + | При <tex>\alpha=0{,}05</tex> нулевая гипотеза не отвергается. Различие между частотами 46 и 54 совместимо со случайными колебаниями при равных вероятностях категорий. Этот результат не доказывает, что вероятности в генеральной совокупности равны в точности. | ||
| + | |||
| + | === Независимость признака и класса === | ||
| + | |||
| + | Рассмотрим задачу [[Классификация|классификации]] сообщений. Требуется проверить, связано ли наличие слова «скидка» с принадлежностью сообщения к спаму. | ||
| + | |||
| + | Получена таблица: | ||
| + | |||
| + | {| class="wikitable" style="text-align:center" | ||
| + | ! Наличие слова «скидка» | ||
| + | ! Спам | ||
| + | ! Обычное сообщение | ||
| + | ! Всего | ||
| + | |- | ||
| + | | Есть | ||
| + | | 60 | ||
| + | | 20 | ||
| + | | 80 | ||
| + | |- | ||
| + | | Нет | ||
| + | | 40 | ||
| + | | 80 | ||
| + | | 120 | ||
| + | |- | ||
| + | ! Всего | ||
| + | ! 100 | ||
| + | ! 100 | ||
| + | ! 200 | ||
| + | |} | ||
| + | |||
| + | При независимости признака и класса ожидаемые частоты равны: | ||
| + | |||
| + | {| class="wikitable" style="text-align:center" | ||
| + | ! Наличие слова «скидка» | ||
| + | ! Спам | ||
| + | ! Обычное сообщение | ||
| + | |- | ||
| + | | Есть | ||
| + | | 40 | ||
| + | | 40 | ||
| + | |- | ||
| + | | Нет | ||
| + | | 60 | ||
| + | | 60 | ||
| + | |} | ||
| + | |||
| + | Например, ожидаемая частота для первой ячейки вычисляется как | ||
| + | |||
| + | ::<tex>E_{11}=\frac{80\cdot100}{200}=40.</tex> | ||
| + | |||
| + | Статистика критерия равна | ||
| + | |||
| + | ::<tex>X^2=\frac{(60-40)^2}{40}+\frac{(20-40)^2}{40}+\frac{(40-60)^2}{60}+\frac{(80-60)^2}{60}\approx33{,}33.</tex> | ||
| + | |||
| + | Число степеней свободы: | ||
| + | |||
| + | ::<tex>\nu=(2-1)(2-1)=1.</tex> | ||
| + | |||
| + | Достигаемый уровень значимости: | ||
| + | |||
| + | ::<tex>p\approx7{,}8\cdot10^{-9}.</tex> | ||
| + | |||
| + | Гипотеза независимости отвергается. Наличие слова «скидка» статистически связано с классом сообщения. Однако из этого результата не следует, что слово является причиной попадания сообщения в спам или что одного этого признака достаточно для построения качественного классификатора. | ||
| + | |||
| + | === Бомбардировки Лондона === | ||
| + | |||
| + | Известный исторический пример связан с анализом падений немецких самолётов-снарядов Фау-1 в Южном Лондоне во время Второй мировой войны. Требовалось определить, согласуется ли пространственное распределение попаданий со случайным размещением или наблюдаемая группировка свидетельствует о точном наведении. | ||
| + | |||
| + | Р. Д. Кларк выбрал территорию площадью 144 км² и разделил её на 576 квадратов площадью 0,25 км². На этой территории было зарегистрировано 537 попаданий.<ref name="Clarke1946">Clarke R. D. [https://doi.org/10.1017/S0020268100035435 An Application of the Poisson Distribution] // ''Journal of the Institute of Actuaries''. 1946. Vol. 72, no. 3. P. 481.</ref> | ||
| + | |||
| + | При гипотезе пространственно однородного случайного размещения число попаданий в отдельный квадрат описывается распределением Пуассона: | ||
| + | |||
| + | ::<tex>P\{S=j\}=\frac{\lambda^j}{j!}e^{-\lambda}.</tex> | ||
| + | |||
| + | Параметр интенсивности оценивался как среднее число попаданий на квадрат: | ||
| + | |||
| + | ::<tex>\widehat{\lambda}=\frac{537}{576}\approx0{,}932.</tex> | ||
| + | |||
| + | Наблюдаемые и ожидаемые частоты имели вид: | ||
| + | |||
| + | {| class="wikitable" style="text-align:center" | ||
| + | ! Число попаданий в квадрат | ||
| + | ! Наблюдаемое число квадратов | ||
| + | ! Ожидаемое число квадратов | ||
| + | |- | ||
| + | | 0 | ||
| + | | 229 | ||
| + | | 226,74 | ||
| + | |- | ||
| + | | 1 | ||
| + | | 211 | ||
| + | | 211,39 | ||
| + | |- | ||
| + | | 2 | ||
| + | | 93 | ||
| + | | 98,54 | ||
| + | |- | ||
| + | | 3 | ||
| + | | 35 | ||
| + | | 30,62 | ||
| + | |- | ||
| + | | 4 | ||
| + | | 7 | ||
| + | | 7,14 | ||
| + | |- | ||
| + | | 5 и более | ||
| + | | 1 | ||
| + | | 1,57 | ||
| + | |} | ||
| + | |||
| + | Значение статистики составило | ||
| + | |||
| + | ::<tex>X^2=1{,}17.</tex> | ||
| + | |||
| + | Использовались шесть категорий и один оценённый параметр, поэтому | ||
| + | |||
| + | ::<tex>\nu=6-1-1=4.</tex> | ||
| + | |||
| + | Достигаемый уровень значимости равен приблизительно | ||
| + | |||
| + | ::<tex>p\approx0{,}88.</tex> | ||
| + | |||
| + | Данные не давали оснований отвергнуть пуассоновскую модель. Для исследованной территории распределение попаданий было совместимо с гипотезой случайного размещения. Вывод зависел от выбора территории, размера квадратов и предположения о постоянной средней интенсивности внутри анализируемой области. | ||
| + | |||
| + | == Интерпретация результата == | ||
| + | |||
| + | === Вклады категорий === | ||
| + | |||
| + | Статистику Пирсона можно представить как сумму вкладов отдельных категорий: | ||
| + | |||
| + | ::<tex>X^2=\sum_i C_i,\qquad C_i=\frac{(O_i-E_i)^2}{E_i}.</tex> | ||
| + | |||
| + | Большое значение <tex>C_i</tex> означает, что соответствующая категория вносит значительный вклад в общее расхождение. Для таблиц сопряжённости вклад ячейки равен | ||
| + | |||
| + | ::<tex>C_{ij}=\frac{(O_{ij}-E_{ij})^2}{E_{ij}}.</tex> | ||
| + | |||
| + | Анализ вкладов позволяет определить, в каких частях таблицы наблюдаемые частоты сильнее всего отличаются от ожидаемых. | ||
| + | |||
| + | === Остатки Пирсона === | ||
| + | |||
| + | Остаток Пирсона (англ. ''Pearson residual'') определяется как | ||
| + | |||
| + | ::<tex>r_{ij}=\frac{O_{ij}-E_{ij}}{\sqrt{E_{ij}}}.</tex> | ||
| + | |||
| + | Его квадрат совпадает со вкладом ячейки: | ||
| + | |||
| + | ::<tex>r_{ij}^2=\frac{(O_{ij}-E_{ij})^2}{E_{ij}}.</tex> | ||
| + | |||
| + | Положительный остаток означает, что сочетание категорий встречается чаще ожидаемого, отрицательный — реже ожидаемого. | ||
| + | |||
| + | Для таблиц сопряжённости используют также скорректированные стандартизованные остатки (англ. ''adjusted standardized residuals''): | ||
| + | |||
| + | ::<tex>r_{ij}^{\mathrm{adj}}=\frac{O_{ij}-E_{ij}}{\sqrt{E_{ij}(1-O_{i\cdot}/n)(1-O_{\cdot j}/n)}}.</tex> | ||
| + | |||
| + | При выполнении гипотезы независимости такие остатки приближённо сопоставимы со стандартным нормальным распределением.<ref name="Haberman1973">Haberman S. J. [https://doi.org/10.2307/2529686 The Analysis of Residuals in Cross-Classified Tables] // ''Biometrics''. 1973. Vol. 29, no. 1. P. 205–220.</ref> | ||
| + | |||
| + | Если исследуется большое число ячеек, необходимо учитывать множественную проверку гипотез (англ. ''multiple hypothesis testing''): даже при справедливости нулевой гипотезы некоторые остатки могут оказаться большими случайно. | ||
| + | |||
| + | === Величина эффекта === | ||
| + | |||
| + | Статистическая значимость не показывает практическую величину обнаруженной связи. При большом объёме выборки даже небольшое отклонение от независимости может привести к очень малому <tex>p</tex>-значению. | ||
| + | |||
| + | Для таблицы <tex>r\times c</tex> величину эффекта (англ. ''effect size'') часто оценивают с помощью коэффициента Крамера: | ||
| + | |||
| + | ::<tex>V=\sqrt{\frac{X^2}{n\min(r-1,c-1)}}.</tex> | ||
| + | |||
| + | Значение <tex>V</tex> близко к нулю при слабой связи и увеличивается по мере усиления зависимости между признаками.<ref name="Cramer1946">Cramér H. ''Mathematical Methods of Statistics''. Princeton: Princeton University Press, 1946.</ref> | ||
| + | |||
| + | Для таблицы <tex>2\times2</tex> коэффициент Крамера совпадает с модулем коэффициента <tex>\varphi</tex>: | ||
| + | |||
| + | ::<tex>\varphi=\sqrt{\frac{X^2}{n}}.</tex> | ||
| + | |||
| + | Универсальных границ для интерпретации коэффициента Крамера не существует. Практический смысл значения зависит от предметной области, объёма данных, числа категорий и последствий принимаемого решения. | ||
| + | |||
| + | == Условия применимости == | ||
| + | |||
| + | === Независимость наблюдений === | ||
| + | |||
| + | Классический критерий предполагает независимость отдельных наблюдений. Это условие нарушается, если: | ||
| + | |||
| + | * один объект представлен в данных несколько раз; | ||
| + | * наблюдения сгруппированы по пользователям, организациям или территориям; | ||
| + | * имеются повторные измерения одного объекта; | ||
| + | * данные обладают временной или пространственной зависимостью; | ||
| + | * части одного документа, изображения или сигнала рассматриваются как независимые объекты. | ||
| + | |||
| + | При наличии зависимости стандартный критерий может недооценивать неопределённость и давать слишком малые <tex>p</tex>-значения. В таких задачах применяют методы, учитывающие парность, кластеризацию или временную структуру наблюдений. Например, для парных бинарных результатов используют критерий Мак-Нимара (англ. ''McNemar's test''). | ||
| + | |||
| + | === Использование абсолютных частот === | ||
| + | |||
| + | В таблицу должны подставляться количества наблюдений, а не только проценты или доли. Например, распределение 40 % против 60 % имеет различную статистическую значимость при объёме выборки 10 и при объёме выборки 10 000. | ||
| + | |||
| + | Если известны проценты и общий объём выборки, перед применением критерия необходимо восстановить абсолютные частоты. | ||
| + | |||
| + | === Взаимоисключающие категории === | ||
| + | |||
| + | Каждое наблюдение должно попадать ровно в одну категорию каждой рассматриваемой классификации. Если один объект может одновременно относиться к нескольким категориям, стандартная мультиномиальная модель частот нарушается. В таком случае необходимо изменить представление данных или использовать другую вероятностную модель. | ||
| + | |||
| + | === Малые ожидаемые частоты === | ||
| + | |||
| + | Распределение хи-квадрат является асимптотическим приближением. Оно может быть неточным, если ожидаемые частоты слишком малы. | ||
| + | |||
| + | Часто используют практическое правило Кокрана: | ||
| + | |||
| + | * ни одна ожидаемая частота не должна быть меньше 1; | ||
| + | * не более 20 % ожидаемых частот должны быть меньше 5. | ||
| + | |||
| + | Это правило является эвристикой, а не строгой математической границей. Точность приближения зависит от структуры таблицы, числа категорий и распределения вероятностей.<ref name="Kroonenberg2018">Kroonenberg P. M., Verbeek A. [https://doi.org/10.1080/00031305.2017.1286260 The Tale of Cochran's Rule: My Contingency Table has so Many Expected Values Smaller than 5, What Am I to Do?] // ''The American Statistician''. 2018. Vol. 72, no. 2. P. 175–183.</ref> | ||
| + | |||
| + | Если ожидаемые частоты слишком малы, возможны следующие решения: | ||
| + | |||
| + | * увеличить объём выборки; | ||
| + | * объединить содержательно близкие категории; | ||
| + | * использовать точный критерий; | ||
| + | * оценить нулевое распределение перестановочным методом; | ||
| + | * использовать моделирование методом Монте-Карло; | ||
| + | * построить вероятностную модель для разреженных данных. | ||
| + | |||
| + | Категории нельзя объединять только потому, что объединение приводит к желаемому <tex>p</tex>-значению. Правило объединения должно иметь содержательное обоснование и по возможности задаваться до анализа отклонений. | ||
| + | |||
| + | === Выбор интервалов === | ||
| + | |||
| + | При проверке непрерывного распределения результат зависит от выбранного разбиения на интервалы. Слишком малое число интервалов может скрыть локальные отклонения от модели, а слишком большое приводит к малым ожидаемым частотам. | ||
| + | |||
| + | Один из возможных подходов состоит в выборе интервалов с приблизительно одинаковыми теоретическими вероятностями: | ||
| + | |||
| + | ::<tex>p_i\approx\frac{1}{k},\qquad E_i\approx\frac{n}{k}.</tex> | ||
| + | |||
| + | Однако такой выбор не устраняет зависимости мощности критерия от разбиения. | ||
| + | |||
| + | === Большой объём выборки === | ||
| + | |||
| + | При фиксированном отличии наблюдаемых пропорций от теоретических статистика <tex>X^2</tex> обычно растёт с увеличением объёма данных. Поэтому на очень больших выборках критерий может обнаруживать статистически значимые, но практически несущественные различия. | ||
| + | |||
| + | В отчёте рекомендуется указывать: | ||
| + | |||
| + | * значение <tex>X^2</tex>; | ||
| + | * число степеней свободы; | ||
| + | * <tex>p</tex>-значение; | ||
| + | * объём выборки; | ||
| + | * наблюдаемые и ожидаемые частоты; | ||
| + | * величину эффекта; | ||
| + | * наиболее крупные остатки. | ||
| + | |||
| + | === Структурные нули === | ||
| + | |||
| + | Некоторые сочетания категорий могут быть невозможны по определению. Такие ячейки называются структурными нулями (англ. ''structural zeros''). Их нельзя обрабатывать как обычные случайные нулевые наблюдения. Структурные ограничения должны учитываться при построении модели ожидаемых частот и определении числа степеней свободы. | ||
| + | |||
| + | == Поправка Йейтса == | ||
| + | |||
| + | Поправка Йейтса (англ. ''Yates's correction for continuity'') — поправка на непрерывность для таблиц сопряжённости <tex>2\times2</tex>, предложенная Фрэнком Йейтсом в 1934 году.<ref name="Yates1934">Yates F. [https://doi.org/10.2307/2983604 Contingency Tables Involving Small Numbers and the chi-square Test] // ''Supplement to the Journal of the Royal Statistical Society''. 1934. Vol. 1, no. 2. P. 217–235.</ref> | ||
| + | |||
| + | Статистика с поправкой определяется как | ||
| + | |||
| + | ::<tex>X^2_{\mathrm{Yates}}=\sum_{i,j}\frac{(|O_{ij}-E_{ij}|-0{,}5)^2}{E_{ij}}.</tex> | ||
| + | |||
| + | Вычитание <tex>0{,}5</tex> уменьшает значение статистики и обычно увеличивает <tex>p</tex>-значение. Поправка предназначена для компенсации ошибки, возникающей при приближении дискретного распределения частот непрерывным распределением хи-квадрат. | ||
| + | |||
| + | Поправка Йейтса '''не является''' процедурой объединения редких категорий. Объединение категорий и поправка на непрерывность — разные методы. | ||
| + | |||
| + | Поправка может быть слишком консервативной, то есть слишком редко отвергать ложную нулевую гипотезу. Поэтому она не считается универсально обязательной. Для малых таблиц могут использоваться точные или вычислительные методы.<ref name="Conover1974">Conover W. J. [https://doi.org/10.2307/2285661 Some Reasons for Not Using the Yates Continuity Correction on 2 × 2 Contingency Tables] // ''Journal of the American Statistical Association''. 1974. Vol. 69, no. 346. P. 374–376.</ref> | ||
| + | |||
| + | == Применение в машинном обучении == | ||
| + | |||
| + | === Отбор признаков === | ||
| + | |||
| + | Критерий хи-квадрат применяют как фильтровый метод отбора признаков (англ. ''filter feature selection'') в задачах классификации. Для каждого признака проверяется гипотеза о его независимости от метки класса. Признаки с большими значениями статистики рассматриваются как потенциально информативные. | ||
| + | |||
| + | Метод особенно естественен для: | ||
| + | |||
| + | * бинарных индикаторов; | ||
| + | * частот слов; | ||
| + | * частот символьных или словесных <tex>n</tex>-грамм; | ||
| + | * счётчиков событий; | ||
| + | * категориальных признаков; | ||
| + | * дискретизированных числовых признаков. | ||
| + | |||
| + | Например, в задаче классификации текстов можно проверить зависимость между наличием каждого слова и классом документа. Для каждого слова строят таблицу сопряжённости и вычисляют статистику <tex>X_j^2</tex>. Затем признаки ранжируют по значениям статистики или соответствующим <tex>p</tex>-значениям. | ||
| + | |||
| + | Метод имеет несколько ограничений. | ||
| + | |||
| + | Во-первых, каждый признак анализируется отдельно. Признак может быть полезен только во взаимодействии с другими признаками и при этом не иметь сильной индивидуальной связи с классом. | ||
| + | |||
| + | Во-вторых, критерий не устраняет избыточность. Несколько почти одинаковых признаков могут одновременно получить высокие оценки. | ||
| + | |||
| + | В-третьих, при проверке тысяч признаков возникает проблема множественных сравнений (англ. ''multiple comparisons''). Если проверить <tex>m</tex> независимых нулевых гипотез на уровне <tex>\alpha</tex>, ожидаемое число ложных отклонений приблизительно равно | ||
| + | |||
| + | ::<tex>m\alpha.</tex> | ||
| + | |||
| + | Для ограничения доли ложных обнаружений (англ. ''false discovery rate'', FDR) применяют специальные процедуры множественной проверки. | ||
| + | |||
| + | В-четвёртых, отбор признаков должен выполняться только по обучающей части данных. Если сначала отобрать признаки по всей выборке, а затем оценивать модель на отложенной выборке (англ. ''hold-out validation'') или с помощью [[Скользящий контроль|скользящего контроля]] (англ. ''cross-validation''), возникает утечка данных (англ. ''data leakage''). | ||
| + | |||
| + | Правильная вычислительная схема имеет вид: | ||
| + | |||
| + | # Разделить данные на обучающую и контрольную части. | ||
| + | # Оценить статистики признаков только по обучающим данным. | ||
| + | # Выбрать признаки. | ||
| + | # Обучить модель на выбранных признаках. | ||
| + | # Применить то же преобразование к контрольным данным. | ||
| + | # Оценить качество модели. | ||
| + | |||
| + | При скользящем контроле все этапы отбора повторяют отдельно внутри каждого разбиения. | ||
| + | |||
| + | === Анализ частот классов === | ||
| + | |||
| + | Критерий можно использовать для сравнения распределения классов: | ||
| + | |||
| + | * в обучающей и контрольной выборках; | ||
| + | * в данных из разных источников; | ||
| + | * в данных, собранных в разные периоды; | ||
| + | * в разных группах пользователей; | ||
| + | * до и после изменения системы сбора данных. | ||
| + | |||
| + | Например, проверяется гипотеза | ||
| + | |||
| + | ::<tex>H_0:\quad p_i^{\mathrm{train}}=p_i^{\mathrm{prod}},\qquad i=1,\ldots,k.</tex> | ||
| + | |||
| + | Отвержение гипотезы указывает на изменение частот классов. Такое изменение может быть проявлением сдвига распределения (англ. ''distribution shift''). Однако значимый результат сам по себе не показывает, ухудшится ли качество модели. Поэтому критерий следует использовать вместе с анализом метрик качества и практической величины изменения. | ||
| + | |||
| + | === Анализ ошибок классификатора === | ||
| + | |||
| + | Результаты классификации можно представить в виде таблицы частот, содержащей истинные и предсказанные классы. Критерий хи-квадрат позволяет исследовать: | ||
| + | |||
| + | * различия в структуре ошибок между группами объектов; | ||
| + | * зависимость типа ошибки от источника данных; | ||
| + | * изменение ошибок между версиями модели; | ||
| + | * различия в качестве между временными периодами. | ||
| + | |||
| + | Если сравниваются предсказания двух моделей на одних и тех же объектах, наблюдения являются парными. В таком случае обычный критерий независимости применять нельзя; для бинарных результатов используют критерий Мак-Нимара (англ. ''McNemar's test''). | ||
| + | |||
| + | === Анализ разреженных текстовых данных === | ||
| + | |||
| + | В текстовой классификации признаки часто представляют собой частоты терминов. Для терма <tex>t</tex> можно построить таблицу: | ||
| + | |||
| + | {| class="wikitable" style="text-align:center" | ||
| + | ! | ||
| + | ! Класс 1 | ||
| + | ! Класс 2 | ||
| + | |- | ||
| + | | Терм встречается | ||
| + | | <tex>a</tex> | ||
| + | | <tex>b</tex> | ||
| + | |- | ||
| + | | Терм не встречается | ||
| + | | <tex>c</tex> | ||
| + | | <tex>d</tex> | ||
| + | |} | ||
| + | |||
| + | Высокое значение статистики означает, что частота терма зависит от класса. Для редких терминов ожидаемые частоты могут оказаться малы, поэтому асимптотическое приближение может быть неточным. Возможные решения включают удаление крайне редких признаков, содержательное объединение признаков, точные критерии и регуляризованные вероятностные модели. | ||
| + | |||
| + | === Связь с вероятностными моделями === | ||
| + | |||
| + | Критерии хи-квадрат тесно связаны с логлинейными моделями (англ. ''log-linear models'') и [[Логистическая регрессия|логистической регрессией]]. В таких моделях для проверки ограничений используются статистика Пирсона и статистика отношения правдоподобий (англ. ''likelihood-ratio statistic''). При стандартных условиях обе статистики имеют асимптотическое распределение хи-квадрат. | ||
| + | |||
| + | Модельный подход позволяет учитывать несколько признаков одновременно, включать взаимодействия, анализировать сопутствующие переменные и проверять более сложные гипотезы, чем простая независимость двух признаков. | ||
| + | |||
| + | == Программная реализация == | ||
| + | |||
| + | === SciPy === | ||
| + | |||
| + | В библиотеке SciPy критерий согласия реализован функцией <tt>scipy.stats.chisquare</tt>, а критерий независимости для таблиц сопряжённости — функцией <tt>scipy.stats.contingency.chi2_contingency</tt>. | ||
| + | |||
| + | Функция <tt>chi2_contingency</tt> возвращает значение статистики, <tex>p</tex>-значение, число степеней свободы и таблицу ожидаемых частот. При одной степени свободы функция может применять поправку Йейтса; это поведение задаётся параметром <tt>correction</tt>.<ref name="SciPy">SciPy developers. [https://docs.scipy.org/doc/scipy/reference/generated/scipy.stats.contingency.chi2_contingency.html scipy.stats.contingency.chi2_contingency].</ref> | ||
| + | |||
| + | === Scikit-learn === | ||
| + | |||
| + | В библиотеке scikit-learn статистика хи-квадрат для отбора признаков реализована функцией <tt>sklearn.feature_selection.chi2</tt>. Она вычисляет значение статистики и <tex>p</tex>-значение для каждого признака относительно целевого класса. | ||
| + | |||
| + | Входные признаки должны быть неотрицательными. Наиболее естественные примеры — бинарные индикаторы, количества событий и частоты терминов. Непрерывные числовые признаки перед применением критерия обычно дискретизируют.<ref name="SklearnChi2">Scikit-learn developers. [https://scikit-learn.org/stable/modules/generated/sklearn.feature_selection.chi2.html sklearn.feature_selection.chi2].</ref> | ||
| + | |||
| + | Отбор признаков следует включать в единый программный конвейер (англ. ''pipeline'') вместе с обучением модели, чтобы исключить использование контрольных данных при вычислении статистик признаков.<ref name="SklearnLeakage">Scikit-learn developers. [https://scikit-learn.org/stable/common_pitfalls.html Common pitfalls and recommended practices].</ref> | ||
| + | |||
| + | == Типичные ошибки == | ||
| + | |||
| + | === Интерпретация незначимого результата как доказательства гипотезы === | ||
| + | |||
| + | Если <tex>p>\alpha</tex>, корректный вывод имеет вид: «оснований отвергнуть нулевую гипотезу недостаточно». Некорректно утверждать, что нулевая гипотеза доказана или что признаки точно независимы. Причиной незначимого результата может быть недостаточный объём данных или низкая мощность критерия. | ||
| + | |||
| + | === Использование критерия для зависимых наблюдений === | ||
| + | |||
| + | Нельзя рассматривать повторные измерения одного объекта как независимые. Это искусственно увеличивает эффективный объём выборки и может приводить к ложной статистической значимости. | ||
| + | |||
| + | === Использование процентов вместо частот === | ||
| + | |||
| + | При подстановке процентов без учёта объёма выборки теряется информация о статистической неопределённости. | ||
| + | |||
| + | === Игнорирование малых ожидаемых частот === | ||
| + | |||
| + | Даже большая наблюдаемая частота не гарантирует применимость критерия. Проверять необходимо именно ожидаемые частоты. | ||
| + | |||
| + | === Сравнение большого числа признаков без поправки === | ||
| + | |||
| + | Если независимо проверяются тысячи признаков, часть из них окажется значимой случайно. Необходимо контролировать множественные сравнения или рассматривать критерий только как ранжирующую эвристику с последующей независимой проверкой. | ||
| + | |||
| + | === Отбор признаков до разделения данных === | ||
| + | |||
| + | Отбор признаков по всей выборке приводит к утечке данных и завышенной оценке качества модели. | ||
| + | |||
| + | === Причинная интерпретация зависимости === | ||
| + | |||
| + | Статистическая зависимость не доказывает причинную связь. Обнаруженная ассоциация может быть обусловлена скрытой переменной, смещением выборки или особенностями сбора данных. | ||
| + | |||
| + | === Выбор категорий после просмотра результата === | ||
| + | |||
| + | Если категории объединяются или разделяются после изучения наблюдаемых отклонений, фактическая вероятность ошибки первого рода может превышать заявленный уровень <tex>\alpha</tex>. | ||
| + | |||
| + | == Альтернативы и связанные методы == | ||
| + | |||
| + | В зависимости от структуры данных вместо критерия Пирсона или совместно с ним используют: | ||
| + | |||
| + | * точный критерий Фишера (англ. ''Fisher's exact test'') — для малых таблиц, прежде всего <tex>2\times2</tex>; | ||
| + | * критерий Мак-Нимара — для связанных бинарных наблюдений; | ||
| + | * G-критерий (англ. ''likelihood-ratio G-test'') — критерий отношения правдоподобий; | ||
| + | * [[Критерий Колмогорова-Смирнова|критерий Колмогорова — Смирнова]] — для сравнения эмпирического и непрерывного теоретического распределений; | ||
| + | * критерий Андерсона — Дарлинга — критерий согласия, чувствительный к расхождениям в хвостах распределения; | ||
| + | * [[Критерий Шапиро-Уилка|критерий Шапиро — Уилка]] — специализированный критерий нормальности; | ||
| + | * перестановочный тест (англ. ''permutation test''); | ||
| + | * параметрический бутстреп; | ||
| + | * логлинейные модели; | ||
| + | * [[Логистическая регрессия|логистическая регрессия]]. | ||
| + | |||
| + | Критерий Пирсона и G-критерий во многих стандартных задачах асимптотически эквивалентны, но могут давать разные результаты на малых и разреженных выборках. | ||
| + | |||
| + | == История == | ||
| + | |||
| + | В 1900 году Карл Пирсон опубликовал работу, в которой предложил статистику для сравнения наблюдаемых и ожидаемых частот и получил её предельное распределение.<ref name="Pearson1900"/> | ||
| + | |||
| + | В ранней теории оставался спорным вопрос о числе степеней свободы в случаях, когда параметры распределения оцениваются по тем же данным. Рональд Фишер в 1920-х годах уточнил роль ограничений и оценённых параметров при анализе таблиц сопряжённости.<ref name="Fisher1922"/> | ||
| + | |||
| + | В 1934 году Фрэнк Йейтс предложил поправку на непрерывность для таблиц <tex>2\times2</tex> с малыми частотами.<ref name="Yates1934"/> | ||
| + | |||
| + | В 1946 году Р. Д. Кларк применил распределение Пуассона и критерий хи-квадрат к анализу попаданий самолётов-снарядов Фау-1 в Лондоне.<ref name="Clarke1946"/> | ||
| + | |||
| + | В дальнейшем критерии хи-квадрат стали одним из основных инструментов анализа категориальных данных и вошли в теорию логлинейных и обобщённых линейных моделей. | ||
| + | |||
| + | == См. также == | ||
| + | |||
| + | * [[Проверка статистических гипотез]] | ||
| + | * [[Критерии согласия]] | ||
| + | * [[Распределение хи-квадрат]] | ||
| + | * [[Таблица сопряженности]] | ||
| + | * [[Принцип максимума правдоподобия]] | ||
| + | * [[Распределение Пуассона]] | ||
| + | * [[Биномиальное распределение]] | ||
| + | * [[Критерий Колмогорова-Смирнова]] | ||
| + | * [[Критерий Шапиро-Уилка]] | ||
| + | * [[Парадокс хи-квадрат]] | ||
| + | * [[Классификация]] | ||
| + | * [[Скользящий контроль]] | ||
| + | * [[Логистическая регрессия]] | ||
| + | |||
| + | == Примечания == | ||
| + | |||
| + | <references/> | ||
== Литература == | == Литература == | ||
| + | |||
| + | * Pearson K. [https://doi.org/10.1080/14786440009463897 On the criterion that a given system of deviations from the probable in the case of a correlated system of variables is such that it can be reasonably supposed to have arisen from random sampling] // ''The London, Edinburgh, and Dublin Philosophical Magazine and Journal of Science''. 1900. Vol. 50, no. 302. P. 157–175. | ||
| + | * Fisher R. A. [https://doi.org/10.2307/2340521 On the Interpretation of chi-square from Contingency Tables, and the Calculation of P] // ''Journal of the Royal Statistical Society''. 1922. Vol. 85, no. 1. P. 87–94. | ||
| + | * Yates F. [https://doi.org/10.2307/2983604 Contingency Tables Involving Small Numbers and the chi-square Test] // ''Supplement to the Journal of the Royal Statistical Society''. 1934. Vol. 1, no. 2. P. 217–235. | ||
| + | * Cochran W. G. [https://doi.org/10.1214/aoms/1177729380 The chi-square Test of Goodness of Fit] // ''The Annals of Mathematical Statistics''. 1952. Vol. 23, no. 3. P. 315–345. | ||
| + | * Clarke R. D. [https://doi.org/10.1017/S0020268100035435 An Application of the Poisson Distribution] // ''Journal of the Institute of Actuaries''. 1946. Vol. 72, no. 3. P. 481. | ||
| + | * Cramér H. ''Mathematical Methods of Statistics''. Princeton: Princeton University Press, 1946. | ||
| + | * Haberman S. J. [https://doi.org/10.2307/2529686 The Analysis of Residuals in Cross-Classified Tables] // ''Biometrics''. 1973. Vol. 29, no. 1. P. 205–220. | ||
| + | * Agresti A. ''Categorical Data Analysis''. 3rd ed. Hoboken: Wiley, 2013. | ||
| + | * Agresti A. ''An Introduction to Categorical Data Analysis''. 3rd ed. Hoboken: Wiley, 2019. | ||
| + | * Greenwood P. E., Nikulin M. S. ''A Guide to Chi-Squared Testing''. New York: Wiley, 1996. | ||
| + | * Read T. R. C., Cressie N. A. C. ''Goodness-of-Fit Statistics for Discrete Multivariate Data''. New York: Springer, 1988. | ||
| + | * Кобзарь А. И. ''Прикладная математическая статистика''. М.: Физматлит, 2006. | ||
| + | |||
== Ссылки == | == Ссылки == | ||
| - | |||
| - | + | * [https://www.itl.nist.gov/div898/handbook/eda/section3/eda35f.htm Описание критерия согласия хи-квадрат в руководстве NIST] | |
| + | * [https://docs.scipy.org/doc/scipy/reference/generated/scipy.stats.chisquare.html Реализация критерия согласия в SciPy] | ||
| + | * [https://docs.scipy.org/doc/scipy/reference/generated/scipy.stats.contingency.chi2_contingency.html Анализ таблиц сопряжённости в SciPy] | ||
| + | * [https://scikit-learn.org/stable/modules/generated/sklearn.feature_selection.chi2.html Отбор признаков с помощью критерия хи-квадрат в scikit-learn] | ||
| + | |||
[[Категория:Прикладная статистика]] | [[Категория:Прикладная статистика]] | ||
| - | [[Категория: | + | [[Категория:Машинное обучение]] |
Текущая версия
Критерий хи-квадрат (англ. chi-square test, -test) — семейство методов проверки статистических гипотез, статистика которых при выполнении нулевой гипотезы имеет точное или приближённое распределение хи-квадрат. Чаще всего под этим названием понимают критерий хи-квадрат Пирсона (англ. Pearson's chi-square test), сравнивающий наблюдаемые и ожидаемые частоты категориальных событий.
Критерий применяют для трёх основных задач:
- проверки согласия наблюдаемого распределения с заданной вероятностной моделью;
- проверки независимости двух категориальных признаков;
- проверки однородности распределений в нескольких выборках.
В машинном обучении критерий хи-квадрат используется при анализе категориальных данных, отборе признаков (англ. feature selection), исследовании связи признаков с целевым классом, анализе ошибок классификаторов и обнаружении изменений распределения данных.
Критерий был предложен Карлом Пирсоном в 1900 году.[1]
Мотивация
Пусть результаты наблюдений относятся к нескольким взаимоисключающим категориям. Даже если теоретическая модель верна, наблюдаемые количества объектов в категориях обычно не совпадают с ожидаемыми в точности. Например, при ста бросках правильной монеты не обязательно получится ровно 50 орлов и 50 решек.
Небольшое расхождение может быть следствием случайных колебаний, тогда как слишком большое расхождение может указывать на неверность предполагаемой модели. Критерий хи-квадрат формализует вопрос: достаточно ли велико различие между наблюдаемыми и ожидаемыми частотами, чтобы считать его статистически значимым?
Пусть:
-
— наблюдаемая частота (англ. observed frequency) в категории
;
-
— ожидаемая частота (англ. expected frequency) при выполнении нулевой гипотезы;
-
— число категорий.
Статистика критерия Пирсона определяется формулой
Здесь обозначает значение статистики, вычисленное по данным, а
— теоретическое распределение хи-квадрат с
степенями свободы.
Каждое слагаемое
характеризует вклад отдельной категории в общее расхождение. Возведение разности в квадрат не позволяет положительным и отрицательным отклонениям взаимно уничтожиться. Деление на учитывает масштаб ожидаемых случайных колебаний: одинаковое абсолютное расхождение имеет различную значимость при малых и больших ожидаемых частотах.
Статистическая гипотеза и правило решения
Для критерия согласия нулевая гипотеза имеет вид
где — теоретическая вероятность попадания наблюдения в категорию
. Альтернативная гипотеза утверждает, что хотя бы одна вероятность отличается от предполагаемой:
Если объём выборки равен , ожидаемая частота категории равна
При выполнении нулевой гипотезы, независимости наблюдений и выполнении условий асимптотического приближения статистика Пирсона имеет приближённое распределение хи-квадрат:
Здесь — число степеней свободы (англ. degrees of freedom).[1]
Критерий Пирсона является правосторонним: чем сильнее наблюдаемые частоты отличаются от ожидаемых, тем больше значение статистики. Достигаемый уровень значимости, или -значение (англ. p-value), определяется как
До анализа данных выбирают уровень значимости (англ. significance level) . Правило решения имеет вид:
- если
, нулевая гипотеза отвергается;
- если
, оснований отвергнуть нулевую гипотезу недостаточно.
Эквивалентно нулевая гипотеза отвергается, если
где — квантиль распределения хи-квадрат.
Фраза «нулевая гипотеза не отвергается» не означает, что гипотеза доказана. Такой результат означает только, что наблюдаемое расхождение совместимо с гипотезой при выбранном уровне значимости и имеющемся объёме данных.
Очень малое значение также не является основанием для отклонения гипотезы в стандартном критерии Пирсона. Если требуется обнаруживать подозрительно точное совпадение частот, необходимо заранее определить отдельную статистическую процедуру.
Основные варианты критерия
Критерий согласия
Критерий согласия (англ. goodness-of-fit test) проверяет, соответствует ли распределение одного категориального признака заранее заданным вероятностям.
Пусть независимые наблюдения могут попадать в категории
. Проверяется гипотеза
где
Наблюдаемая частота категории равна
а ожидаемая частота —
Если все вероятности заданы до анализа данных, число степеней свободы равно
Единица вычитается вследствие ограничения
Поэтому отклонения во всех категориях не могут изменяться независимо.
Проверка непрерывного распределения
Критерий согласия хи-квадрат можно применять и для проверки гипотезы о непрерывном распределении. Область значений случайной величины разбивают на интервалы
Если проверяется распределение с функцией распределения , вероятность попадания в интервал равна
а ожидаемая частота —
После этого вычисляют обычную статистику Пирсона:
Недостаток подхода состоит в зависимости результата от способа разбиения числовой оси. Изменение числа интервалов или их границ может изменить значение статистики и мощность критерия (англ. statistical power).
При проверке непрерывных распределений вместе с критерием хи-квадрат часто рассматривают критерий Колмогорова — Смирнова, критерий Андерсона — Дарлинга (англ. Anderson–Darling test) и графические методы.[1]
Сложная гипотеза
Гипотеза называется сложной, если проверяемое распределение содержит неизвестные параметры:
Например, для распределения Пуассона может быть неизвестна интенсивность , а для нормального распределения — математическое ожидание и дисперсия.
Параметр оценивают по выборке, например с помощью метода максимального правдоподобия (англ. maximum likelihood estimation, MLE). Для сгруппированных данных оценка может быть записана как
где
Ожидаемые частоты вычисляют по оценённым параметрам:
Если по данным оценено независимых параметров, то при стандартных условиях число степеней свободы обычно равно
Каждый оценённый параметр уменьшает число степеней свободы, поскольку накладывает дополнительное ограничение на ожидаемые частоты.[1]
Формула не является полностью универсальной. Результат зависит от способа оценивания параметров, структуры модели и выбора интервалов. Если параметры или границы интервалов выбирались после изучения данных, стандартное распределение хи-квадрат может оказаться неточным. В таких случаях нулевое распределение статистики оценивают с помощью параметрического бутстрепа (англ. parametric bootstrap) или моделирования методом Монте-Карло (англ. Monte Carlo simulation).
Критерий независимости
Критерий независимости (англ. chi-square test of independence) проверяет наличие статистической связи между двумя категориальными признаками. Результаты наблюдений записывают в таблицу сопряжённости (англ. contingency table).
Пусть первый признак принимает значений, а второй —
значений. Обозначим:
-
— наблюдаемое число объектов в ячейке
;
-
— сумма наблюдений в строке
;
-
— сумма наблюдений в столбце
;
-
— общий объём выборки.
Нулевая гипотеза имеет вид
При независимости признаков ожидаемая частота в ячейке равна
Статистика критерия определяется выражением
Число степеней свободы равно
Отвержение гипотезы независимости означает, что распределение одного признака зависит от значения другого. Однако критерий не устанавливает направление причинной связи и не определяет автоматически, какие именно категории ответственны за обнаруженное различие.[1]
Критерий однородности
Критерий однородности (англ. chi-square test of homogeneity) проверяет, одинаково ли распределён категориальный признак в нескольких независимых совокупностях.
Например, с его помощью можно сравнивать:
- распределение ответов пользователей между несколькими версиями интерфейса;
- частоты классов в данных из разных источников;
- структуру категорий в обучающей и эксплуатационной выборках;
- распределение исходов в нескольких экспериментальных группах.
Формулы статистики и числа степеней свободы совпадают с критерием независимости. Различается содержательная интерпретация данных:
- при проверке независимости одна выборка классифицируется одновременно по двум признакам;
- при проверке однородности сравниваются несколько независимо полученных выборок.
Порядок применения
Корректное применение критерия включает следующие этапы.
- Сформулировать нулевую и альтернативную гипотезы.
- До анализа результатов выбрать уровень значимости
.
- Определить взаимоисключающие категории.
- Вычислить наблюдаемые частоты
или
.
- Вычислить ожидаемые частоты
или
.
- Проверить независимость наблюдений.
- Проверить, достаточно ли велики ожидаемые частоты.
- Определить число степеней свободы.
- Вычислить статистику
.
- Найти
-значение или сравнить статистику с критическим значением.
- Сформулировать содержательный вывод.
- При необходимости исследовать отдельные ячейки и величину эффекта.
Последние два этапа особенно важны. Сам критерий показывает наличие общего расхождения, но не объясняет его структуру и практическую значимость.
Примеры
Проверка заданных пропорций
Рассмотрим выборку из 100 объектов. В первую категорию попало 46 объектов, во вторую — 54. Проверяется гипотеза о равных вероятностях:
Ожидаемые частоты равны
Статистика критерия:
Число степеней свободы:
Достигаемый уровень значимости составляет приблизительно
При нулевая гипотеза не отвергается. Различие между частотами 46 и 54 совместимо со случайными колебаниями при равных вероятностях категорий. Этот результат не доказывает, что вероятности в генеральной совокупности равны в точности.
Независимость признака и класса
Рассмотрим задачу классификации сообщений. Требуется проверить, связано ли наличие слова «скидка» с принадлежностью сообщения к спаму.
Получена таблица:
| Наличие слова «скидка» | Спам | Обычное сообщение | Всего |
|---|---|---|---|
| Есть | 60 | 20 | 80 |
| Нет | 40 | 80 | 120 |
| Всего | 100 | 100 | 200 |
При независимости признака и класса ожидаемые частоты равны:
| Наличие слова «скидка» | Спам | Обычное сообщение |
|---|---|---|
| Есть | 40 | 40 |
| Нет | 60 | 60 |
Например, ожидаемая частота для первой ячейки вычисляется как
Статистика критерия равна
Число степеней свободы:
Достигаемый уровень значимости:
Гипотеза независимости отвергается. Наличие слова «скидка» статистически связано с классом сообщения. Однако из этого результата не следует, что слово является причиной попадания сообщения в спам или что одного этого признака достаточно для построения качественного классификатора.
Бомбардировки Лондона
Известный исторический пример связан с анализом падений немецких самолётов-снарядов Фау-1 в Южном Лондоне во время Второй мировой войны. Требовалось определить, согласуется ли пространственное распределение попаданий со случайным размещением или наблюдаемая группировка свидетельствует о точном наведении.
Р. Д. Кларк выбрал территорию площадью 144 км² и разделил её на 576 квадратов площадью 0,25 км². На этой территории было зарегистрировано 537 попаданий.[1]
При гипотезе пространственно однородного случайного размещения число попаданий в отдельный квадрат описывается распределением Пуассона:
Параметр интенсивности оценивался как среднее число попаданий на квадрат:
Наблюдаемые и ожидаемые частоты имели вид:
| Число попаданий в квадрат | Наблюдаемое число квадратов | Ожидаемое число квадратов |
|---|---|---|
| 0 | 229 | 226,74 |
| 1 | 211 | 211,39 |
| 2 | 93 | 98,54 |
| 3 | 35 | 30,62 |
| 4 | 7 | 7,14 |
| 5 и более | 1 | 1,57 |
Значение статистики составило
Использовались шесть категорий и один оценённый параметр, поэтому
Достигаемый уровень значимости равен приблизительно
Данные не давали оснований отвергнуть пуассоновскую модель. Для исследованной территории распределение попаданий было совместимо с гипотезой случайного размещения. Вывод зависел от выбора территории, размера квадратов и предположения о постоянной средней интенсивности внутри анализируемой области.
Интерпретация результата
Вклады категорий
Статистику Пирсона можно представить как сумму вкладов отдельных категорий:
Большое значение означает, что соответствующая категория вносит значительный вклад в общее расхождение. Для таблиц сопряжённости вклад ячейки равен
Анализ вкладов позволяет определить, в каких частях таблицы наблюдаемые частоты сильнее всего отличаются от ожидаемых.
Остатки Пирсона
Остаток Пирсона (англ. Pearson residual) определяется как
Его квадрат совпадает со вкладом ячейки:
Положительный остаток означает, что сочетание категорий встречается чаще ожидаемого, отрицательный — реже ожидаемого.
Для таблиц сопряжённости используют также скорректированные стандартизованные остатки (англ. adjusted standardized residuals):
При выполнении гипотезы независимости такие остатки приближённо сопоставимы со стандартным нормальным распределением.[1]
Если исследуется большое число ячеек, необходимо учитывать множественную проверку гипотез (англ. multiple hypothesis testing): даже при справедливости нулевой гипотезы некоторые остатки могут оказаться большими случайно.
Величина эффекта
Статистическая значимость не показывает практическую величину обнаруженной связи. При большом объёме выборки даже небольшое отклонение от независимости может привести к очень малому -значению.
Для таблицы величину эффекта (англ. effect size) часто оценивают с помощью коэффициента Крамера:
Значение близко к нулю при слабой связи и увеличивается по мере усиления зависимости между признаками.[1]
Для таблицы коэффициент Крамера совпадает с модулем коэффициента
:
Универсальных границ для интерпретации коэффициента Крамера не существует. Практический смысл значения зависит от предметной области, объёма данных, числа категорий и последствий принимаемого решения.
Условия применимости
Независимость наблюдений
Классический критерий предполагает независимость отдельных наблюдений. Это условие нарушается, если:
- один объект представлен в данных несколько раз;
- наблюдения сгруппированы по пользователям, организациям или территориям;
- имеются повторные измерения одного объекта;
- данные обладают временной или пространственной зависимостью;
- части одного документа, изображения или сигнала рассматриваются как независимые объекты.
При наличии зависимости стандартный критерий может недооценивать неопределённость и давать слишком малые -значения. В таких задачах применяют методы, учитывающие парность, кластеризацию или временную структуру наблюдений. Например, для парных бинарных результатов используют критерий Мак-Нимара (англ. McNemar's test).
Использование абсолютных частот
В таблицу должны подставляться количества наблюдений, а не только проценты или доли. Например, распределение 40 % против 60 % имеет различную статистическую значимость при объёме выборки 10 и при объёме выборки 10 000.
Если известны проценты и общий объём выборки, перед применением критерия необходимо восстановить абсолютные частоты.
Взаимоисключающие категории
Каждое наблюдение должно попадать ровно в одну категорию каждой рассматриваемой классификации. Если один объект может одновременно относиться к нескольким категориям, стандартная мультиномиальная модель частот нарушается. В таком случае необходимо изменить представление данных или использовать другую вероятностную модель.
Малые ожидаемые частоты
Распределение хи-квадрат является асимптотическим приближением. Оно может быть неточным, если ожидаемые частоты слишком малы.
Часто используют практическое правило Кокрана:
- ни одна ожидаемая частота не должна быть меньше 1;
- не более 20 % ожидаемых частот должны быть меньше 5.
Это правило является эвристикой, а не строгой математической границей. Точность приближения зависит от структуры таблицы, числа категорий и распределения вероятностей.[1]
Если ожидаемые частоты слишком малы, возможны следующие решения:
- увеличить объём выборки;
- объединить содержательно близкие категории;
- использовать точный критерий;
- оценить нулевое распределение перестановочным методом;
- использовать моделирование методом Монте-Карло;
- построить вероятностную модель для разреженных данных.
Категории нельзя объединять только потому, что объединение приводит к желаемому -значению. Правило объединения должно иметь содержательное обоснование и по возможности задаваться до анализа отклонений.
Выбор интервалов
При проверке непрерывного распределения результат зависит от выбранного разбиения на интервалы. Слишком малое число интервалов может скрыть локальные отклонения от модели, а слишком большое приводит к малым ожидаемым частотам.
Один из возможных подходов состоит в выборе интервалов с приблизительно одинаковыми теоретическими вероятностями:
Однако такой выбор не устраняет зависимости мощности критерия от разбиения.
Большой объём выборки
При фиксированном отличии наблюдаемых пропорций от теоретических статистика обычно растёт с увеличением объёма данных. Поэтому на очень больших выборках критерий может обнаруживать статистически значимые, но практически несущественные различия.
В отчёте рекомендуется указывать:
- значение
;
- число степеней свободы;
-
-значение;
- объём выборки;
- наблюдаемые и ожидаемые частоты;
- величину эффекта;
- наиболее крупные остатки.
Структурные нули
Некоторые сочетания категорий могут быть невозможны по определению. Такие ячейки называются структурными нулями (англ. structural zeros). Их нельзя обрабатывать как обычные случайные нулевые наблюдения. Структурные ограничения должны учитываться при построении модели ожидаемых частот и определении числа степеней свободы.
Поправка Йейтса
Поправка Йейтса (англ. Yates's correction for continuity) — поправка на непрерывность для таблиц сопряжённости , предложенная Фрэнком Йейтсом в 1934 году.[1]
Статистика с поправкой определяется как
Вычитание уменьшает значение статистики и обычно увеличивает
-значение. Поправка предназначена для компенсации ошибки, возникающей при приближении дискретного распределения частот непрерывным распределением хи-квадрат.
Поправка Йейтса не является процедурой объединения редких категорий. Объединение категорий и поправка на непрерывность — разные методы.
Поправка может быть слишком консервативной, то есть слишком редко отвергать ложную нулевую гипотезу. Поэтому она не считается универсально обязательной. Для малых таблиц могут использоваться точные или вычислительные методы.[1]
Применение в машинном обучении
Отбор признаков
Критерий хи-квадрат применяют как фильтровый метод отбора признаков (англ. filter feature selection) в задачах классификации. Для каждого признака проверяется гипотеза о его независимости от метки класса. Признаки с большими значениями статистики рассматриваются как потенциально информативные.
Метод особенно естественен для:
- бинарных индикаторов;
- частот слов;
- частот символьных или словесных
-грамм;
- счётчиков событий;
- категориальных признаков;
- дискретизированных числовых признаков.
Например, в задаче классификации текстов можно проверить зависимость между наличием каждого слова и классом документа. Для каждого слова строят таблицу сопряжённости и вычисляют статистику . Затем признаки ранжируют по значениям статистики или соответствующим
-значениям.
Метод имеет несколько ограничений.
Во-первых, каждый признак анализируется отдельно. Признак может быть полезен только во взаимодействии с другими признаками и при этом не иметь сильной индивидуальной связи с классом.
Во-вторых, критерий не устраняет избыточность. Несколько почти одинаковых признаков могут одновременно получить высокие оценки.
В-третьих, при проверке тысяч признаков возникает проблема множественных сравнений (англ. multiple comparisons). Если проверить независимых нулевых гипотез на уровне
, ожидаемое число ложных отклонений приблизительно равно
Для ограничения доли ложных обнаружений (англ. false discovery rate, FDR) применяют специальные процедуры множественной проверки.
В-четвёртых, отбор признаков должен выполняться только по обучающей части данных. Если сначала отобрать признаки по всей выборке, а затем оценивать модель на отложенной выборке (англ. hold-out validation) или с помощью скользящего контроля (англ. cross-validation), возникает утечка данных (англ. data leakage).
Правильная вычислительная схема имеет вид:
- Разделить данные на обучающую и контрольную части.
- Оценить статистики признаков только по обучающим данным.
- Выбрать признаки.
- Обучить модель на выбранных признаках.
- Применить то же преобразование к контрольным данным.
- Оценить качество модели.
При скользящем контроле все этапы отбора повторяют отдельно внутри каждого разбиения.
Анализ частот классов
Критерий можно использовать для сравнения распределения классов:
- в обучающей и контрольной выборках;
- в данных из разных источников;
- в данных, собранных в разные периоды;
- в разных группах пользователей;
- до и после изменения системы сбора данных.
Например, проверяется гипотеза
Отвержение гипотезы указывает на изменение частот классов. Такое изменение может быть проявлением сдвига распределения (англ. distribution shift). Однако значимый результат сам по себе не показывает, ухудшится ли качество модели. Поэтому критерий следует использовать вместе с анализом метрик качества и практической величины изменения.
Анализ ошибок классификатора
Результаты классификации можно представить в виде таблицы частот, содержащей истинные и предсказанные классы. Критерий хи-квадрат позволяет исследовать:
- различия в структуре ошибок между группами объектов;
- зависимость типа ошибки от источника данных;
- изменение ошибок между версиями модели;
- различия в качестве между временными периодами.
Если сравниваются предсказания двух моделей на одних и тех же объектах, наблюдения являются парными. В таком случае обычный критерий независимости применять нельзя; для бинарных результатов используют критерий Мак-Нимара (англ. McNemar's test).
Анализ разреженных текстовых данных
В текстовой классификации признаки часто представляют собой частоты терминов. Для терма можно построить таблицу:
| Класс 1 | Класс 2 | |
|---|---|---|
| Терм встречается | | |
| Терм не встречается | | |
Высокое значение статистики означает, что частота терма зависит от класса. Для редких терминов ожидаемые частоты могут оказаться малы, поэтому асимптотическое приближение может быть неточным. Возможные решения включают удаление крайне редких признаков, содержательное объединение признаков, точные критерии и регуляризованные вероятностные модели.
Связь с вероятностными моделями
Критерии хи-квадрат тесно связаны с логлинейными моделями (англ. log-linear models) и логистической регрессией. В таких моделях для проверки ограничений используются статистика Пирсона и статистика отношения правдоподобий (англ. likelihood-ratio statistic). При стандартных условиях обе статистики имеют асимптотическое распределение хи-квадрат.
Модельный подход позволяет учитывать несколько признаков одновременно, включать взаимодействия, анализировать сопутствующие переменные и проверять более сложные гипотезы, чем простая независимость двух признаков.
Программная реализация
SciPy
В библиотеке SciPy критерий согласия реализован функцией scipy.stats.chisquare, а критерий независимости для таблиц сопряжённости — функцией scipy.stats.contingency.chi2_contingency.
Функция chi2_contingency возвращает значение статистики, -значение, число степеней свободы и таблицу ожидаемых частот. При одной степени свободы функция может применять поправку Йейтса; это поведение задаётся параметром correction.[1]
Scikit-learn
В библиотеке scikit-learn статистика хи-квадрат для отбора признаков реализована функцией sklearn.feature_selection.chi2. Она вычисляет значение статистики и -значение для каждого признака относительно целевого класса.
Входные признаки должны быть неотрицательными. Наиболее естественные примеры — бинарные индикаторы, количества событий и частоты терминов. Непрерывные числовые признаки перед применением критерия обычно дискретизируют.[1]
Отбор признаков следует включать в единый программный конвейер (англ. pipeline) вместе с обучением модели, чтобы исключить использование контрольных данных при вычислении статистик признаков.[1]
Типичные ошибки
Интерпретация незначимого результата как доказательства гипотезы
Если , корректный вывод имеет вид: «оснований отвергнуть нулевую гипотезу недостаточно». Некорректно утверждать, что нулевая гипотеза доказана или что признаки точно независимы. Причиной незначимого результата может быть недостаточный объём данных или низкая мощность критерия.
Использование критерия для зависимых наблюдений
Нельзя рассматривать повторные измерения одного объекта как независимые. Это искусственно увеличивает эффективный объём выборки и может приводить к ложной статистической значимости.
Использование процентов вместо частот
При подстановке процентов без учёта объёма выборки теряется информация о статистической неопределённости.
Игнорирование малых ожидаемых частот
Даже большая наблюдаемая частота не гарантирует применимость критерия. Проверять необходимо именно ожидаемые частоты.
Сравнение большого числа признаков без поправки
Если независимо проверяются тысячи признаков, часть из них окажется значимой случайно. Необходимо контролировать множественные сравнения или рассматривать критерий только как ранжирующую эвристику с последующей независимой проверкой.
Отбор признаков до разделения данных
Отбор признаков по всей выборке приводит к утечке данных и завышенной оценке качества модели.
Причинная интерпретация зависимости
Статистическая зависимость не доказывает причинную связь. Обнаруженная ассоциация может быть обусловлена скрытой переменной, смещением выборки или особенностями сбора данных.
Выбор категорий после просмотра результата
Если категории объединяются или разделяются после изучения наблюдаемых отклонений, фактическая вероятность ошибки первого рода может превышать заявленный уровень .
Альтернативы и связанные методы
В зависимости от структуры данных вместо критерия Пирсона или совместно с ним используют:
- точный критерий Фишера (англ. Fisher's exact test) — для малых таблиц, прежде всего
;
- критерий Мак-Нимара — для связанных бинарных наблюдений;
- G-критерий (англ. likelihood-ratio G-test) — критерий отношения правдоподобий;
- критерий Колмогорова — Смирнова — для сравнения эмпирического и непрерывного теоретического распределений;
- критерий Андерсона — Дарлинга — критерий согласия, чувствительный к расхождениям в хвостах распределения;
- критерий Шапиро — Уилка — специализированный критерий нормальности;
- перестановочный тест (англ. permutation test);
- параметрический бутстреп;
- логлинейные модели;
- логистическая регрессия.
Критерий Пирсона и G-критерий во многих стандартных задачах асимптотически эквивалентны, но могут давать разные результаты на малых и разреженных выборках.
История
В 1900 году Карл Пирсон опубликовал работу, в которой предложил статистику для сравнения наблюдаемых и ожидаемых частот и получил её предельное распределение.[1]
В ранней теории оставался спорным вопрос о числе степеней свободы в случаях, когда параметры распределения оцениваются по тем же данным. Рональд Фишер в 1920-х годах уточнил роль ограничений и оценённых параметров при анализе таблиц сопряжённости.[1]
В 1934 году Фрэнк Йейтс предложил поправку на непрерывность для таблиц с малыми частотами.[1]
В 1946 году Р. Д. Кларк применил распределение Пуассона и критерий хи-квадрат к анализу попаданий самолётов-снарядов Фау-1 в Лондоне.[1]
В дальнейшем критерии хи-квадрат стали одним из основных инструментов анализа категориальных данных и вошли в теорию логлинейных и обобщённых линейных моделей.
См. также
- Проверка статистических гипотез
- Критерии согласия
- Распределение хи-квадрат
- Таблица сопряженности
- Принцип максимума правдоподобия
- Распределение Пуассона
- Биномиальное распределение
- Критерий Колмогорова-Смирнова
- Критерий Шапиро-Уилка
- Парадокс хи-квадрат
- Классификация
- Скользящий контроль
- Логистическая регрессия
Примечания
Литература
- Pearson K. On the criterion that a given system of deviations from the probable in the case of a correlated system of variables is such that it can be reasonably supposed to have arisen from random sampling // The London, Edinburgh, and Dublin Philosophical Magazine and Journal of Science. 1900. Vol. 50, no. 302. P. 157–175.
- Fisher R. A. On the Interpretation of chi-square from Contingency Tables, and the Calculation of P // Journal of the Royal Statistical Society. 1922. Vol. 85, no. 1. P. 87–94.
- Yates F. Contingency Tables Involving Small Numbers and the chi-square Test // Supplement to the Journal of the Royal Statistical Society. 1934. Vol. 1, no. 2. P. 217–235.
- Cochran W. G. The chi-square Test of Goodness of Fit // The Annals of Mathematical Statistics. 1952. Vol. 23, no. 3. P. 315–345.
- Clarke R. D. An Application of the Poisson Distribution // Journal of the Institute of Actuaries. 1946. Vol. 72, no. 3. P. 481.
- Cramér H. Mathematical Methods of Statistics. Princeton: Princeton University Press, 1946.
- Haberman S. J. The Analysis of Residuals in Cross-Classified Tables // Biometrics. 1973. Vol. 29, no. 1. P. 205–220.
- Agresti A. Categorical Data Analysis. 3rd ed. Hoboken: Wiley, 2013.
- Agresti A. An Introduction to Categorical Data Analysis. 3rd ed. Hoboken: Wiley, 2019.
- Greenwood P. E., Nikulin M. S. A Guide to Chi-Squared Testing. New York: Wiley, 1996.
- Read T. R. C., Cressie N. A. C. Goodness-of-Fit Statistics for Discrete Multivariate Data. New York: Springer, 1988.
- Кобзарь А. И. Прикладная математическая статистика. М.: Физматлит, 2006.


