Теоретическая функция распределения \(F_0(x)\) и эмпирическая функция распределения \(F_n^*(x)\) по выборке объёма \(n=12\). Статистика Колмогорова \(D_n=\sup_x|F_n^*(x)-F_0(x)|\) отмечена на графике.
Критерии согласия
Этот конспект ещё находится в процессе редактуры: в тексте могут встречаться опечатки, неточности и локально не проработанные места. Если что-то нашли — сообщите, пожалуйста, автору (контакты на странице курса).
Следующий класс гипотез, который мы рассмотрим в настоящем учебном пособии, – гипотезы о совпадении неизвестного распределения с известным. Иными словами, пусть \(X\) – наблюдение с неизвестным распределением \(\mathbb {P}\), функция распределения которого равна \(F\). Выдвигаются гипотезы
\[ H_0: \; \mathbb {P} = \mathbb {P}_0, \qquad H_1: \; \mathbb {P} \neq \mathbb {P}_0 \]
для некоторого заданного распределения \(\mathbb {P}_0\). Альтернативные распределения никак не конкретизируются, априори может быть ясен лишь тип распределения (например, дискретный или абсолютно непрерывный) и множество значений наблюдения \(X\). Критерии проверки таких гипотез называются критериями согласия. Наиболее известными среди них являются критерий Колмогорова и критерий хи-квадрат, о которых мы и поговорим в этой главе. Первый основывается на сравнении теоретической и эмпирической функции распределения, а второй на сравнении теоретической и эмпирической плотности.
В случае критериев согласия принято использовать те, которые обладают свойством состоятельности.
1 Сравнение теоретической и эмпирической функций распределения
Пусть имеется выборка \(X=\left(X_{1}, \ldots , X_{n}\right)\) из неизвестного распределения на \(\mathbb {R}\) с непрерывной функцией распределения \(F\). Построим критерий для проверки гипотезы \(H_{0}: \mathbb {P}=\mathbb {P}_{0}\). Если \(F_0\) – функция распределения \(\mathbb {P}_0\), то \(H_0\) можно эквивалентно переформулировать как \(H_0: F = F_0\).
1.1 Критерий согласия Колмогорова
Статистикой Колмогорова называется расстояние между функциями \(F_n^*\) и \(F_0\) в супремум-метрике:
\[ D_n := \sup _{x \in \mathbb {R}}\left|F_n^*(x) - F_{0}(x) \right|. \tag{1}\]
Распределение \(D_n\) зависит только от \(n\), однако для конечных \(n\) оно задается слишком громоздкими формулами. Несколько проще выглядит предельное распределение статистики \(D_n\).
Критерий Колмогорова УЗ \(\alpha\) записывается следующим образом: \(\left\{ \sqrt{n} D_{n}> Q_{\operatorname {K}}(1-\alpha )\right\}\), где \(Q_{\operatorname {K}}(\cdot )\) – квантильная функция распределения Колмогорова. Критерий Колмогорова – асимптотический, поскольку мы используем не точное распределение \(D_n\) при каждом \(n\), а лишь распределение в пределе. Критерий Колмогорова принято применять, если \(n \geq 20\).
Плотность распределения Колмогорова (предельного распределения статистики \(\sqrt n D_n\)).
1.2 Критерий Крамера — Мизеса — Смирнова
Статистикой Крамера — Мизеса — Смирнова называется квадрат расстояния между функциями \(F_n^*\) и \(F_0\) в пространстве \(L^{2}\left(\mathbb {R}, \mathscr {B}\left(\mathbb {R}\right), \mathbb {P}_0\right)\):
\[ \omega ^2 := \int _{\mathbb {R}} \left|F_n^*(t) - F_0(t)\right|^2 \mathbb {P}_0(dt) = \int _{-\infty }^\infty \left|F_n^*(t) - F_0(t)\right|^2 dF_0(t). \]
Последний интеграл – интеграл Лебега-Стилтьеса.
Как и распределение статистики Колмогорова, распределение статистики \(\omega^2\) не зависит от \(F_0\), если \(H_0\) верна.
Как и в случае с \(D_n\), распределение \(\omega^2\) для конечных \(n\) задается слишком громоздкими формулами, но предельное распределение выглядит более-менее просто.
Критерий Крамера — Мизеса — Смирнова УЗ \(\alpha\) записывается следующим образом: \(\left\{ n \omega^2>Q_{\operatorname {OS}}(1-\alpha )\right\}\), где \(Q_{\operatorname {OS}}(\cdot )\) – квантильная функция распределения омега-квадрат. Критерий Крамера — Мизеса — Смирнова, как и критерий Колмогорова, – асимптотический, поскольку мы используем не точное распределение \(\omega^2\) при каждом \(n\), а лишь распределение в пределе.
2 Сравнение теоретической и эмпирической плотностей: критерий хи-квадрат
2.1 Выборка из схемы Бернулли с известными исходами
Пусть \(X_{1}, \ldots , X_{n}\) – выборка из схемы Бернулли с \(m \geq 2\) известными исходами \(A = \left\{ a_1, \ldots , a_m\right\}\). Функция вероятности (обобщенная плотность относительно считающей меры на \(A\)):
\[ p_j := \mathbb {P}\left(X_1 = a_j\right), \; j = \overline{1,m} \]
Нам известны исходы \(a_1, \ldots , a_m\), но неизвестны вероятности \(p_1, \ldots , p_m\). Такое распределение еще называют категориальным и обозначают
\[ \operatorname {Cat}(A, \overrightarrow {p}), \qquad \overrightarrow {p} = \left(p_1, p_2, \ldots , p_m\right)^T \]
Оценим неизвестное распределение эмпирическим распределением. В таком случае оценка \(p_j\) будет равна частоте попадания выборки в \(a_j\):
\[ \widehat{p_j} = \overline{\; \mathbb {1}_{X = a_j}}, \qquad \widehat{\overrightarrow {p}} = \left(\widehat{p}_1, \widehat{p}_2, \ldots , \widehat{p}_m\right)^T \]
2.1.1 Простая гипотеза
Пусть \(A\) – фиксированное множество исходов, пусть имеем следующую параметрическую модель
\[ \mathcal{P} = \left\{ \operatorname {Cat}(A, \overrightarrow {p}): \; \overrightarrow {p}\in [0,1]^m, \sum _{i=1}^m p_i = 1\right\} . \]
Пусть \(\overrightarrow {p}^0 \in [0,1]^m\) – фиксированный вектор, такой что \(\sum_{i=1}^m p_i = 1\). Пусть имеем параметрические гипотезы
\[ H_0: \mathbb {P} = \mathbb {P}_0 = \operatorname {Cat}(A, \overrightarrow {p}^0), \qquad H_1: \mathbb {P} \in \mathcal{P}\setminus \left\{ \mathbb {P}_0\right\} = \left\{ \operatorname {Cat}(A, \overrightarrow {p}): \overrightarrow {p} \neq \overrightarrow {p}^0\right\} \]
Иначе:
\[ H_0: \overrightarrow {p} = \overrightarrow {p}_0, \qquad H_1 : \overrightarrow {p} \neq \overrightarrow {p}_0 \]
Критерий хи-квадрат Пирсона записывается следующим образом: \(\left\{ \widehat{\chi^2}> Q_{\chi^2_{m-1}}(1-\alpha )\right\}\), где \(Q_{\chi^2_{m-1}}(\cdot )\) – квантильная функция распределения \(\chi_{m-1}^{2}\). Критерий хи-квадрат – асимптотический, его принято применять, если \(n \geq 50\) и \(\mu_{j} \geq 5\) для всех \(j \in \{ 1, \ldots , m\}\).
2.1.2 Сложная гипотеза
Критерий хи-квадрат Пирсона можно применять и в случае сложных гипотез
\[ H_0: \overrightarrow {p} = \overrightarrow {p}^0(\overrightarrow {\theta }), \; \overrightarrow {\theta } \in \Theta \subset \mathbb {R}^{r}, \; r < m-1, \qquad H_1: \overrightarrow {p} \neq \overrightarrow {p}^0(\overrightarrow {\theta }) \]
При проверке таких гипотез используется также статистика \(\widehat{\chi^2} = \widehat{\chi^2}(\overrightarrow {\theta })\), при вычислении которой \(\overrightarrow {\theta }\) заменяется на оценку максимального правдоподобия
\[ \overrightarrow {\theta }^{*} = \operatorname *{arg\, max}_{\overrightarrow {\theta } \in \Theta } \prod _{j=1}^{m}\left(p_{j}^{0}(\overrightarrow {\theta })\right)^{\mu _{j}} . \]
2.2 Общий случай
Критерий хи-квадрат, как и критерий согласия Колмогорова, применяется для проверки гипотезы о равенстве распределения, из которого берется наша выборка, какому-то определённому распределению \(\mathbb {P}_0\). В отличие от критерия Колмогорова, критерий хи-квадрат не требует больших вычислений, но является менее “точным”. Работать с критерием хи-квадрат в случае произвольного класса распределений можно следующим образом: область значений выборки разбивается на несколько интервалов, после чего вычисляется число членов выборки, попавших в каждый интервал. Полученные значения берутся в качестве \(\mu_{j}\). В качестве \(p_{j}^{0}\) берутся вероятности попадания случайной величины с распределением \(\mathbb {P}_0\) в \(j\)-ый интервал. В сущности сравниваются гистограмма выборки и теоретическая гистограмма распределения \(\mathbb {P}_0\).
По поводу кол-ва классов см. (Kallenberg и др. 1985 г.).