Проверка статистических гипотез

Дата публикации

2 сентября 2026

ПредупреждениеЧерновик

Этот конспект ещё находится в процессе редактуры: в тексте могут встречаться опечатки, неточности и локально не проработанные места. Если что-то нашли — сообщите, пожалуйста, автору (контакты на странице курса).

1 Введение

Если при проведении экспериментов исследователь не имеет никаких ожиданий относительно возможных значений параметров модели, то в предыдущих главах он сможет найти ответы на многие свои вопросы: как оценить параметр, какими свойствами могут обладать эти оценки, как построить наилучшую оценку, как построить доверительный интервал для параметра и т.д. Однако во многих приложениях нам не нужно оценивать значение самого параметра \(\theta\).

Например, к нам поступило на исследование потенциальное новое лекарство от простуды, нам требуется оценить его работоспособность. Пусть нам известно, что в среднем больной простудой, не принимающий никаких лекарств, излечивается за счет своего иммунитета за \(\theta_0 := 6\) дней со ст. отклонением \(\sigma_0 := \sqrt{6} \approx 2.5\) дня. Изготовившие новый препарат химики-фармацевты утверждают, что при его приеме в среднем человек излечивается за \(\theta_1 := 4\) дня.

Пусть для проведения исследования были отобраны случайным образом \(100\) человек с простудой на ранней стадии, и они в течение периода болезни принимали новое лекарство (но не более \(13 \approx \theta_0 + 3\sigma_0\) дней, если болезнь не отходила за такой период, пациента переключали на лечение с доказанной эффективностью). В итоге больше \(13\) дней никто не болел, пациенты поправились в среднем за \(4.8\) дней.

\(4.8\) дней меньше, чем \(6\), однако нам как исследователям требуется понять, значимо ли это различие, действительно ли это эффект от лекарства. Или это различие в \(1.2\) дня можно просто списать на случайность, и на самом деле прием нового лекарства не оказывает никакого эффекта.

На языке математической статистики задачу можно сформулировать так: пусть \(\mathbb {P}_\theta\) – распределение количества дней, требующихся для выздоровления при приеме нового препарата, причем \(\theta\) – матожидание этого распределения. Пусть дана выборка \(X_1, \ldots , X_n\) из распределения \(\mathbb {P}_\theta\). Требуется по выборке дать ответ на бинарный вопрос:

  • или \(\theta = 6\) (прием лекарства никакого эффекта не оказывает);

  • или \(\theta = 4\) (прием лекарства оказывает эффект, описанный химиками, которые его создавали).

В более общем случае проверяется \(\theta \in \Theta_0\) против \(\theta \in \Theta_1\), причем \(\Theta_0\) не должно пересекаться с \(\Theta_1\).

2 непересекающихся предположения об истинном распределении называются (противоположными) гипотезами о распределении и обозначаются \(H_0\), \(H_1\). Проверка статистических гипотез – это исследование в попытке дать ответ на вопрос, верна ли \(H_0\) или \(H_1\).

1.1 Разный эффект от ошибок, разные гипотезы. Выделение базовой гипотезы

При проверке статистических гипотез можно совершить 2 разные ошибки: либо сказать, что верна гипотеза \(H_1: \theta \in \Theta_1\), когда на самом деле верна \(H_0: \theta \in \Theta_0\) (ошибка I рода), либо наоборот (ошибка II рода). Как правило, указанные ошибки не равнозначны для исследования, одна более опасна, чем другая.

Например, исследование нового препарата: к настоящему времени существует масса лекарств от простуды с доказанной эффективностью, и если исследователь скажет, что новый препарат не работает, когда он на самом деле работает, то это не будет критично для будущих пациентов, поскольку они вместо нового лекарства могут обратиться к проверенным старым и точно излечиться за короткое время. Если же исследователь заявит о работоспособности бесполезного препарата, и этот препарат появится на полках аптек, то будущие пациенты окажутся под угрозой, поскольку они будут покупать бесполезное лекарство, рассчитывая на скорое излечение.

Поскольку ошибки не равнозначны для исследователя, то и гипотезы не могут быть равнозначными: мы должны быть склонны принять ту гипотезу, ошибочное отвержение которой для нас более критично. Обычно эту гипотезу обозначают \(H_0\) и называют базовой, а противоположную ей \(H_1\) – альтернативной. В случае с медицинскими исследованиями, как правило, базовая гипотеза состоит в том, что новый препарат (или метод лечения) неэффективен, альтернатива – что эффективен.

Базовая гипотеза (\(H_0\))
Верна Неверна
Решение по нулевой гипотезе (\(H_0\)) Не отклонили Верное решение Ошибка II типа
Отклонили Ошибка I типа Верное решение

Таблица ошибок: возможные исходы проверки статистической гипотезы.

1.2 Значимость данных, p-значение, уровень значимости

Исследование статистических гипотез протекает так: исследователь изначально, до исследования считает верной базовую гипотезу \(H_0\). Далее он получает данные и исследует их, пытаясь ответить на вопрос: достаточно ли они критичные для \(H_0\), чтобы отвергнуть базовую гипотезу \(H_0\) в пользу альтернативной \(H_1\).

Как численно оценить критичность данных? Рассмотрим на описанном выше примере с исследованием нового препарата.

ExampleПример 1

Время излечения проще всего моделировать экспоненциальным распределением. Пусть \(X_1, \ldots , X_n, \; n = 100\) – выборка из экспоненциального распределения \(\operatorname {Exp}\left(\frac{1}{\theta }\right), \; \theta \in \left\{ 4,6\right\}\) (т.е. \(\mathbb {E}\left[X_1\right] = \theta\)). Пусть проведен конкретный эксперимент \(\omega_0\), причем \[ \overline{X}(\omega _0) = \frac{1}{n}\sum _{i=1}^n X_i(\omega _0) = 4.8 \] Пусть базовая гипотеза \(H_0: \theta = \theta_0 = 6\), альтернатива \(H_1: \theta = \theta_1 = 4\). Оцените критичность данных в эксперименте \(\omega_0\) на основе статистики \(\overline{X}\).

SolutionРешение

Плотность распределения статистики \(\overline{X} \sim \Gamma(100, 100/6)\) при верной \(H_0\) (\(\theta_0=6\)). Красная область под графиком слева от наблюдённого значения \(\overline{X}(\omega_0)=4.8\) — это p-значение эксперимента.

Изначально мы полагаем, что \(H_0\) верна, т.е. что \(\theta = 6\). Нам необходимо понять, насколько критичные данные мы получили, их статистическую значимость. Попробуем это понять на основе статистики \(\overline{X}\).

\(\theta\) – это матожидание. Чем ближе выборочное среднее к \(\theta_1\), по сравнению с \(\theta_0\), тем данные более критичны. В нашем случае параметр в альтернативной гипотезе \(\theta_1\) меньше, чем параметр \(\theta_0\) в базовой, значит чем меньше выборочное среднее, тем данные критичнее.

Практический смысл: чем меньше времени требуется на излечение принимающим новый препарат, тем это более невероятно, если мы предполагаем, что препарат не работает.

Как численно выразить критичность данных? Из свойств гамма-распределения известно, что \(\overline{X} \sim \Gamma (n, n/\theta )\), т.е. при верной \(H_0\) имеем \(\overline{X} \sim \Gamma (100, 100/6)\). Имеем

\[ \mathbb {P}_{\theta _0}\left(\overline{X} \leq 4.8\right) \approx 1.7\% \]

Это число называется p-значением эксперимента \(\omega_0\). В чем его смысл? Мы получили в ходе эксперимента значение статистики \(\overline{X}\). p-значение – это вероятность получить в ходе копии эксперимента такое же или более критическое значение статистики при верной гипотезе \(H_0\).

При помощи p-значения можно оценивать критичность данных в предположении гипотезы \(H_0\).

Сравнение гипотетических распределений времени излечения: \(H_0\) — \(\operatorname{Exp}(1/\theta_0)\), \(\theta_0=6\) (лекарство не действует), и \(H_1\) — \(\operatorname{Exp}(1/\theta_1)\), \(\theta_1=4\) (лекарство действует). Пунктиром отмечены средние \(\theta_0\), \(\theta_1\) и наблюдённое выборочное среднее \(\overline{X}(\omega_0)=4.8\).

AnswerОтвет

p-значение: \(1.7\%\).

Говорят, что данные эксперимента имеют статистическую значимость, если получение таких же данных в ходе независимой копии эксперимента было бы крайне маловероятным, в предположении верной базовой гипотезы. Если данные статистически значимы, то необходимо отвергнуть базовую гипотезу в пользу альтернативы.

Мы получили в ходе эксперимента некоторое p-значение. Как по нему понять, значимы ли данные, нужно ли нам отвергать гипотезу \(H_0\)? Для решения этого вопроса перед экспериментом устанавливают некоторую планку для p-значения, называемую уровнем значимости (обозн.: \(\alpha\)). Уровень значимости задает ту допустимую вероятность, с которой мы готовы отвергнуть \(H_0\), когда она верна. Т.е. уровень значимости – это допустимая вероятность совершить ошибку первого рода. Как правило, в качестве уровня значимости берут значение \(\alpha = 5\%\), хотя в медицинских исследованиях могут быть и \(1\%\), и \(0.1\%\), и \(0.01\%\).

ExampleПример 2

В условиях примера Пример 1 проверить \(H_0\) против \(H_1\) на уровнях значимости \(\alpha_1 = 5\%\), \(\alpha_2 = 1\%\).

SolutionРешение

(через p-значение). p-значение: \(1.7\%\).

Enum-item1.

\(1.7\% < 5\%\), следовательно данные значимы, достаточно критичны в предположении \(H_0\). Вариативность данных нельзя списать на случайность. Необходимо отвергнуть \(H_0\) в пользу \(H_1\), принять \(H_1\);

Enum-item2.

\(1.7\% > 1\%\), следовательно данные незначимы, недостаточно критичны в предположении \(H_0\). Их вариативность можно списать на случайность. Отвергать \(H_0\) не следует.

Альтернативное решение (через критические значения). Нам известны уровни значимости. Пусть \(q_1\) и \(q_2\) – такие значения статистики \(\overline{X}\), критичность которых в точности равна \(\alpha_1\) и \(\alpha_2\):

\[ \mathbb {P}_{\theta _0}\left(\overline{X} \leq q_i\right) = \alpha _i, \quad i \in \left\{ 1,2\right\} \]

При верной базовой гипотезе выполнено \(\overline{X} \sim \Gamma (100,100/6)\). Значит \(q_i\) – это квантиль уровня \(\alpha_i\) из этого распределения. Найдем их:

\[ q_1 = 5.05, \quad q_2 = 4.69 \]

Эти значения называются критическими значениями статистики (в данном случае выборочного среднего). Если статистика критичнее такого значения (в данном случае меньше), то следует отвергнуть \(H_0\).

Enum-item1.

\(\overline{X}(\omega_0) = 4.8 < 5.05 = q_1\), значит на УЗ \(\alpha_1= 5\%\) \(H_0\) следует отвергнуть;

Enum-item2.

\(\overline{X}(\omega_0) = 4.8 > 4.69 = q_2\), значит на УЗ \(\alpha_2= 1\%\) \(H_0\) не нужно отвергать.

Примечание. Обратите внимание, что во втором случае некорректно говорить, что мы принимаем \(H_0\), поскольку мы ее приняли изначально, до эксперимента. Корректнее говорить, что мы не отвергли \(H_0\).

AnswerОтвет

При УЗ равном \(5\%\) следует отвергнуть \(H_0\) в пользу \(H_1\). При \(1\%\) не следует отвергать \(H_0\).

Проверка статистических гипотез похожа на судебное заседание. Практически любая судебная система в современном мире исповедует принцип презумпции невиновности. Перед началом заседания подсудимый считается невиновным, в этом состоит, можно сказать, базовая гипотеза суда \(H_0\). Далее, в ходе заседания, обвинитель приводит суду улики, свидетельствующие в пользу виновности. Задача судьи – исследовать улики, понять, достаточны ли улики, чтобы отвергнуть базовое предположение о невиновности подсудимого и принять гипотезу о виновности, и вынести вердикт.

В матстатистике уликами является выборка, и исследователь должен понять, достаточно ли улики критичны, чтобы можно было отвергнуть \(H_0\) в пользу \(H_1\).

ProblemЗадача 1

Пусть \(X_1, \ldots , X_n, \; n = 225\) – выборка из нормального распределения \(\mathscr {N}\left(\theta , 1\right), \; \theta \in \left\{ 5,8\right\}\), причем \(\overline{X}(\omega_0) = 5.15\). Пусть базовая гипотеза \(H_0: \theta = \theta_0 = 5\), альтернатива \(H_1: \theta = \theta_1 = 8\). Найти p-значение для эксперимента \(\omega_0\), проверить гипотезу \(H_0\) против \(H_1\) на уровнях значимости \(\alpha_1 = 5\%\), \(\alpha_2 = 2\%\), \(\alpha_3 = 1\%\).

2 Общая постановка задачи

2.1 Критерий, критическая область

Как в общем случае формализовать проверку статистических гипотез? Пусть \(\vec{X} = (X_1, \ldots , X_n)^T\) – выборка из неизвестного распределения \(\mathbb {P} \in \mathcal{P}\). Часто мы имеем параметрическую модель, и тогда \(\mathcal{P} = \left\{ \mathbb {P}_\theta , \; \theta \in \Theta \right\}\), хотя в общем случае \(\mathcal{P}\) может быть любым семейством распределений.

Гипотезы:

  • в параметрической модели

    \[ H_0: \theta \in \Theta _0, \qquad H_1: \theta \in \Theta _1 \]

    где \(\Theta_0 \subset \Theta\), \(\Theta_1 = \Theta_0^{\complement }\)

  • в общем случае

    \[ H_0: \mathbb {P} \in \mathcal{P}_0, \qquad H_1: \mathbb {P} \in \mathcal{P}_1 \]

    где \(\mathcal{P}_0 \subset \mathcal{P}\), \(\mathcal{P}_1 = \mathcal{P}_0^{\complement }\).

В дальнейшем, для простоты, мы будем формулировать определения в основном для параметрического случая. Но их легко перенести и на непараметрический общий случай.

Если в гипотезе только один параметр (одно распределение), то она называется простой. В противном случае гипотеза называется сложной. Пока что в примерах (Пример 1) и задачах (Задача 1) мы проверяли только простую базовую гипотезу против простой альтернативы. Примеры со сложными гипотезами приводятся ниже.

Решение отвергать или не отвергать \(H_0\) в пользу \(H_1\) можно, как видно из примера Пример 1, принимать двумя способами: через p-значение и через критические значения. Рассмотрим второй способ, через критические значения. Мы отвергали \(H_0\), если выборочное среднее было меньше некоторого значения \(q\). Иначе этот способ можно так изложить: пусть

\[ S := \left\{ \vec{x} \in \mathbb {R}^{n} \; : \; \overline{x} \leq q\right\} \]

\(S\) – это некоторое подмножество \(\mathbb {R}^{n}\) (состоящее из тех вектор-столбцов, у которых ср. арифметическое координат не превосходит \(q\)), и мы отвергаем \(H_0\), если наша выборка \(\vec{X}\) попала в \(S\):

\[ \vec{X} \in S \; \Rightarrow \; \text{отвергаем }H_0 \text{ на УЗ }\alpha \]

\(S\) называют критическим множеством.

В общем случае не всегда понятно, какую статистику использовать при проверке гипотезы. Или, даже если статистика выбрана, не всегда понятно, что означает “критичность” статистики. Например, если в примере выше было бы не

\[ H_0: \theta \in \left\{ 6\right\} \text{ против } H_1: \theta \in \left\{ 4\right\} \]

а

\[ H_0: \theta \in \left\{ 3, 6\right\} \text{ против } H_1: \theta \in \left\{ 2,4,8\right\} \]

Какое значение выборочного среднего в данном случае более критично, а какое менее? Здесь “критичность” нельзя определить.

Вычисление p-значения и критического значения невозможно без понятия “критичности”. Поэтому в общем случае проверка гипотез формализуется именно через критические множества: мы отвергаем \(H_0\), если выборка \(\vec{X}\) попала в некоторое подмножество \(S \subset \mathcal{X}\) в пространстве \(\mathcal{X}\) всех возможных значений выборки (как правило, \(\mathcal{X} = \mathbb {R}^{n}\)). В противном случае мы не отвергаем \(H_0\). Повторим, область \(S \subset \mathcal{X}\) называется критической областью или просто критерием.

Определение 1 Пусть \(S \subset \mathcal{X}\) – это критерий.

  • Функцией мощности критерия \(S\) называется функция

    \[ \beta (\theta , S) := \mathbb {P}_{\theta }(\vec{X} \in S), \quad \theta \in \Theta \]

    Это вероятность отвергнуть \(H_0\), если истинный параметр – это \(\theta\).

  • Величина \(\alpha\) называется уровнем значимости критерия \(S\), если \(\alpha \geq \beta (\theta , S)\) для любого \(\theta \in \Theta_{0}\). Заметим, что если \(\theta \in \Theta_0\), то верна базовая гипотеза \(H_0\). В таком случае \(\beta (\theta , S)\) – это вероятность отвергнуть верную \(H_0\), т.е. совершить ошибку I рода. Уровень значимости таким образом – это верхняя граница для возможных вероятностей ошибок первого рода. Эти вероятности могут быть разными, поскольку в общем случае в \(\Theta_0\) содержится несколько элементов.

  • Минимальный уровень значимости при верной базовой гипотезе

    \[ \alpha _{0}=\sup _{\theta \in \Theta _{0}} \beta (\theta , S) \]

    называется размером критерия \(S\). Размер критерия – это точная верхняя граница для вероятностей ошибок первого рода.

    Зачастую размер критерия называют уровнем значимости и обозначают \(\alpha\).

ExampleПример 3

Пусть \(X\) – выборка объема 1. Пусть \(H_0: X \sim U[0,1], \; H_1: X \sim \mathrm{Exp}(1)\). Пусть \(\alpha \in (0,1)\) – произвольное. Построить все возможные критерии \(S\) уровня значимости (размера) \(\alpha \in (0,1)\).

SolutionРешение

В данном случае \(\mathcal{P} = \left\{ U[0,1], \operatorname {Exp}(1)\right\}\), \(\mathcal{P}_0 = \left\{ U[0,1]\right\} , \; \mathcal{P}_1 = \left\{ \operatorname {Exp}(1)\right\}\). Обозначим \(\mathbb {P}_0 := U[0,1], \; \mathbb {P}_1 := \operatorname {Exp}(1)\).

Заметим, что в данном случае область значений выборки \(\mathcal{X} = \mathbb {R}_+\). Пусть \(S \subset \mathcal{X}\) – критерий. Поскольку \(\mathcal{P}_0 = \left\{ \mathbb {P}_0\right\}\) состоит из одного распределения, супремум по \(\mathcal{P}_0\) берется тривиально: его уровень значимости

\[ \alpha = \sup _{\mathbb {P} \in \mathcal{P}_0} \beta (\mathbb {P}, S) = \beta (\mathbb {P}_0, S) = \mathbb {P}_{0}\left(X \in S\right). \]

Плотность распределения \(\mathbb {P}_0 = U[0,1]\) равна \(\; \mathbb {1}_{X \in [0,1]}\), поэтому

\[ \mathbb {P}_{0}\left(X \in S\right) = \int _S \; \mathbb {1}_{X \in [0,1]}dx = \int _{S \cap [0,1]} dx = \lambda \left(S \cap [0,1]\right), \]

где \(\lambda\) – мера Лебега.

AnswerОтвет

\(S\) – любое множество из \(\mathscr {B}\left(\mathbb {R}_+\right)\), такое, что \(\lambda (S \cap [0,1]) = \alpha\).

2.2 Мощность критерия

Если цель – как можно сильнее ограничить вероятность ошибки первого рода, то, вообще говоря, ее можно сделать нулевой, сделать уровень значимости \(\alpha\) равным нулю. При таком УЗ мы должны будем стоять на \(H_0\) какими бы ни были данные \(\vec{X}\), необходимо взять \(S = \varnothing\). В этом случае мы никогда не отвергнем \(H_0\), поскольку выборка никогда не попадет в критическое множество (т.к. оно пустое).

Однако во всех случаях, когда на самом деле верна \(H_1\), мы будем стоять на \(H_0\), совершая ошибку второго рода. Вероятность ошибки второго рода в этом случае будет равна \(100\%\).

Между вероятностями ошибок первого и второго рода существует обратная зависимость: чем меньше одна вероятность, тем больше другая, и наоборот. “Самого лучшего” критерия, который бы минимизировал одновременно ошибки первого и второго рода, не существует.

На практике при поиске “лучшего” критерия сначала фиксируют уровень значимости (вероятность совершить ошибку первого рода), а затем среди всех критериев с заданным уровнем значимости ищут лучший с точки зрения ошибки второго рода.

Определение 2 Верхнюю границу для возможных значений ошибок второго рода обозначают буквой \(\beta\). Обозначение совпадает с функцией мощности, но обычно путаницы не возникает.

Напомним, что ошибка второго рода возникает, когда верна \(H_1\), а исследователь не отвергает \(H_0\), т.е. когда \(\vec{X} \not\in S\):

\[ \begin{align} \beta & := \sup _{\theta \in \Theta _{1}} \mathbb {P}_{\theta }\left(\vec{X} \not\in S\right) = \sup _{\theta \in \Theta _{1}} \left[ 1 - \mathbb {P}_{\theta }\left(\vec{X} \in S\right)\right] = \\ & = \sup _{\theta \in \Theta _{1}} \left[ 1 - \beta (\theta , S)\right] \end{align} \]

Величину \(1-\beta\) называют мощностью статистического критерия. Мощность – это способность критерия обнаружить эффект (гипотезу \(H_1\)), в случае если этот эффект действительно существует. С точки зрения статистики, это нижняя граница вероятности справедливого опровержения нулевой гипотезы:

\[ 1 - \beta = \inf _{\theta \in \Theta _{1}} \mathbb {P}_{\theta }\left(\vec{X} \in S\right) = \inf _{\theta \in \Theta _{1}} \beta (\theta , S) \quad \left(1 - \beta = \inf _{\mathbb {P} \in \mathcal{P}_{1}} \beta (\mathbb {P}, S) \text{ в общем случае}\right) \]

Таблица ошибок Базовая гипотеза (\(H_0\))
Верна Неверна
Решение по нулевой гипотезе (\(H_0\)) Не отклонили Верное решение
True Negative (TN)
\(1-\alpha\)
Ошибка II типа
False Negative (FN)
\(\beta\)
Отклонили Ошибка I типа
False Positive (FP)
\(\alpha\)
Верное решение
True Positive (TP)
\(1-\beta\)

Таблица ошибок с указанием вероятностей ошибок I и II рода (\(\alpha\), \(\beta\)) и мощности критерия (\(1-\beta\)).

Проверяем \(H_0: \theta = 0\) против \(H_1: \theta = \theta_1\) по статистике \(\bar{X}\) для выборки объёма \(n\) из \(\mathcal{N}(\theta, 1)\), т.е. \(\bar{X} \sim \mathcal{N}(\theta, 1/n)\). Критерий: отвергаем \(H_0\), если \(\bar{x} \geq c\). Двигайте порог \(c\), чтобы увидеть обратную зависимость ошибок \(\alpha\) и \(\beta\); слайдеры \(n\) и \(\theta_1\) меняют форму плотностей.

α (ошибка I рода) = β (ошибка II рода) = мощность 1 − β =
ExampleПример 4

В условиях примера Пример 3 найдите для каждого критерия \(S\) его мощность. Найдите наиболее мощный критерий УЗ \(\alpha \in (0,1)\).

HintПодсказка

В данном случае в \(\mathcal{P}_1 = \left\{ \mathbb {P}_1\right\}\) только одно распределение. Расчет мощности упрощается: \[ \beta = \mathbb {P}_{1}\left(X \not\in S\right), \qquad 1 - \beta = \mathbb {P}_{1}\left(X \in S\right) \]

SolutionРешение

Вычислим мощность \(S\), т.е. вероятность верно отклонить \(H_0\). Плотность распределения \(\mathbb {P}_1 = \operatorname {Exp}(1)\) равна \(e^{-x}\) на \(\mathbb {R}_+\), поэтому

\[ \beta (\mathbb {P}_1, S) = \mathbb {P}_{1}\left(X \in S\right) = \int _S e^{-x} dx. \]

Множества \([0,1]\) и \((1, +\infty )\) образуют разбиение \(\mathcal{X} = \mathbb {R}_+\), поэтому интеграл по \(S\) распадается на 2 независимых слагаемых:

\[ \int _S e^{-x} dx = \int _{S \cap [0,1]}e^{-x} dx + \int _{S \cap (1, +\infty )}e^{-x} dx. \]

Заметим, что значения этих 2-х интегралов не зависят друг от друга. При этом на \(S \cap (1, +\infty )\) у нас нет вообще никаких ограничений. Следовательно, чтобы максимизировать мощность, нужно взять \(S\) таким, чтобы \(S \cap (1, +\infty ) = (1, +\infty )\).

Далее, рассмотрим интеграл \(\int_{S \cap [0,1]}e^{-x} dx\). \(e^{-x}\) строго убывает, следовательно, учитывая ограничение \(\lambda (S \cap [0,1]) = \alpha\), критерий \(S\) надо взять таким, чтобы \(S \cap [0,1] = [0, \alpha ]\).

\(H_0\!:X\sim U[0,1]\) против \(H_1\!:X\sim\operatorname{Exp}(1)\). Наиболее мощный критерий уровня значимости \(\alpha\): \(S=[0,\alpha]\cup(1,+\infty)\) (показано для \(\alpha=0.3\)). Фиолетовая зона — площадь под плотностью \(\operatorname{Exp}(1)\) над \(S\), т.е. мощность \(1-\beta\) самого мощного критерия.

AnswerОтвет

\([0, \alpha ] \cup (1, +\infty )\).

ProblemЗадача 2

Пусть \(X\) – выборка объема 1 из распределения \(\mathbb {P}\). Пусть

  1. \(H_0: X \sim U[1,4], \; H_1: X \sim \mathscr {N}\left(3, 1\right)\);

  2. \(H_0: X \sim \mathscr {N}\left(0, 1\right), \; H_1: X \sim \mathscr {N}\left(1, 1\right)\). Пусть \(\alpha \in (0,1)\) – произвольное. Найдите наиболее мощный критерий УЗ \(\alpha\).

HintПодсказка

Воспользуйтесь леммой Неймана-Пирсона: критическая область должна состоять из точек, где отношение правдоподобия \(f_1(x)/f_0(x)\) наибольшее.

Напомним, гипотеза называется простой, если в ней предполагается только один параметр или одно распределение. Пока что мы имели дело только с тестированием простых базовых гипотез против простых альтернатив. В следующей задаче требуется проверить простую базовую гипотезу против сложной альтернативы.

ProblemЗадача 3

Пусть \(X\) – выборка объема 1 из распределения \(\mathbb {P}\). Пусть

  1. \(H_0: X \sim U[-3,3], \; H_1: \mathbb {P} \in \left\{ \operatorname {TR}[-2,0], \operatorname {TR}[0,2]\right\}\), где \(\operatorname {TR}[a,b]\) – треугольное распределение с плотностью

\[ p(t) = \begin{cases} 0, & x < a \\ \frac{2(x-a)}{(b-a)\left(\frac{b+a}{2} - a\right)}, & x \in [a, \frac{a+b}{2}), \\ \frac{2(b-x)}{(b-a)\left(b - \frac{b+a}{2}\right)}, & x \in [\frac{a+b}{2}, b), \\ 0, & x \geq b \end{cases} \]

  1. \(H_0: X \sim U[-3,3], \; H_1: \mathbb {P} \in \left\{ \mathscr {N}\left(-1, 1\right), \mathscr {N}\left(1, 1\right)\right\}\). Пусть \(\alpha \in (0,1)\) – произвольное. Найдите наиболее мощный критерий УЗ \(\alpha\).

2.3 Равномерно наиболее мощные критерии

Пусть у нас имеется сложная альтернатива \(H_1\): \(\left|\Theta_1\right| > 1\). Напомним, что в такой ситуации мощность при разных параметрах \(\theta \in \Theta_1\) из \(H_1\) может получиться разная. Мощность самого критерия в таком случае определяется как инфимум этих значений. Критерии одинакового УЗ можно сравнивать, опираясь на найденный инфимум. Лучшим считается тот критерий, у которого мощность самая большая.

В некоторых случаях можно найти критерий с заданным УЗ, у которого не просто будет наибольшая мощность, но она будет равномерно по \(\theta \in \Theta_1\) наибольшая.

Определение 3 Если \(S\) и \(R\) – два критерия уровня значимости (размера) \(\alpha\), то \(S\) равномерно мощнее \(R\), если

\[ \beta (\theta , S) \geq \beta (\theta , R) \quad \forall \theta \in \Theta _1 \]

Это равносильно условию на вероятности ошибок второго рода

\[ 1 - \beta (\theta , S) \leq 1 - \beta (\theta , R) \quad \forall \theta \in \Theta _1 \]

Иначе говоря, \(S\) равномерно мощнее \(R\), если у \(S\) при любом значении истинного параметра из гипотезы \(H_1\) вероятность ошибки второго рода меньше. Иначе: вероятность ошибки второго рода критерия \(S\) меньше вероятности ошибки второго рода критерия \(R\) равномерно по \(\theta \in \Theta_1\).

Критерий \(S\) называется равномерно наиболее мощным критерием (РНМК) уровня значимости \(\alpha\), если он равномерно мощнее любого другого критерия уровня значимости \(\alpha\).

Отметим, что в случае простой альтернативы говорить о РНМК бессмысленно.

ExampleПример 5

Пусть \(\vec{X} = \left(X_{1}, \ldots , X_{n}\right)^T\) – выборка из равномерного распределения на отрезке \([0, \theta ], \theta >0\). Найдите РНМК для проверки гипотезы \(H_{0}: \theta =\theta_{0}\) против альтернативы \(H_{1}: \theta <\theta_{0}\), если он существует.

HintПодсказка

Рассмотрите критерии вида \(S_c = \left\{ \vec{x} \in \mathbb {R}^{n} \; : \; x_{(n)} \leq c \theta_0\right\}\). Т.е. отвергаем \(H_0\), когда максимум выборки меньше или равен \(c\theta_0\).

SolutionРешение

Найдем среди критериев \(\left\{ S_c\right\}\) критерий \(S_{c_0}\) требуемым уровнем значимости \(\alpha\). Имеем

\[ \begin{align} \alpha & = \mathbb {P}_{\theta _0}\left(\vec{X} \in S_{c_0}\right) = \mathbb {P}_{\theta _0}\left(X_{(n)} \leq c_0\theta _0\right) = \left(\frac{c_0\theta _0}{\theta _0}\right)^n = \\ & = c_0^n \end{align} \]

Следовательно, \(c_{0}=\sqrt[n]{\alpha }\). Критерий:

\[ S_{c_0} = \left\{ \vec{x} \in \mathbb {R}_+^n: x_{(n)} \leq \sqrt[n]{\alpha } \theta _0\right\} \]

Докажем, что \(S_{c_0}\) равномерно мощнее всех прочих критериев УЗ \(\alpha\). Пусть \(R\) – это произвольный критерий УЗ \(\alpha\).

  • Пусть истинный параметр \(\theta \leq c_0 \theta_0\). Мощность \(S_{c_0}\) равна 1, т.е. не меньше мощности любого другого критерия.

  • Пусть истинный параметр \(\theta \in (c_0\theta_0, \theta_0)\). Мощность \(S_{c_0}\):

    \[ \mathbb {P}_{\theta }\left(\vec{X} \in S_{c_0}\right) = \mathbb {P}_{\theta }\left(X_{(n)} \leq c_0 \theta _0\right) = \alpha \left(\frac{\theta _0}{\theta }\right)^n \]

    Мощность произвольного критерия \(R \subset \mathbb {R}_+^n\) УЗ \(\alpha\):

    \[ \begin{align} \mathbb {P}_{\theta }\left(\vec{X} \in R\right) & = \int _{[0,\theta ]^n} \frac{1}{\theta ^n} \; \mathbb {1}_{R}(\vec{x}) d\vec{x} =\frac{\theta _{0}^{n}}{\theta ^{n}} \int _{\left[0, \theta \right]^{n}} \frac{1}{\theta _{0}^{n}} \; \mathbb {1}_{R}(\vec{x}) d\vec{x} \leq \\ & \leq \frac{\theta _{0}^{n}}{\theta ^{n}} \int _{\left[0, \theta _0\right]^{n}} \frac{1}{\theta _{0}^{n}} \; \mathbb {1}_{R}(\vec{x}) d\vec{x} = \frac{\theta _{0}^{n}}{\theta ^{n}} \mathbb {P}_{\theta _0}\left(\vec{X} \in R\right) \leq \\ & \leq \alpha \frac{\theta _{0}^{n}}{\theta ^{n}} = \mathbb {P}_{\theta }\left(\vec{X} \in S_{c_0}\right) \end{align} \]

Доказано.

Функция мощности РНМК \(S_{c_0} = \{x_{(n)} \leq c_0\theta_0\}\), \(c_0 = \alpha^{1/n}\), для проверки \(H_0: \theta=\theta_0\) против \(H_1: \theta<\theta_0\) по выборке из \(U[0,\theta]\) (\(\theta_0=1\)): \(\beta(\theta, S_{c_0}) = \min\!\big(1, (c_0\theta_0/\theta)^n\big)\). Двигайте слайдеры \(n\) для двух кривых и общий \(\alpha\) — обе кривые пересчитываются. При \(\theta \leq c_0\theta_0\) критерий отвергает \(H_0\) наверняка (мощность \(=1\)); в точке \(\theta=\theta_0\) мощность равна ровно \(\alpha\), независимо от \(n\); чем больше \(n\), тем резче обрыв кривой около \(\theta_0\).

c₀(n₁) = c₀(n₂) =
AnswerОтвет

\(\left\{ \vec{x} \in \mathbb {R}_+^n: x_{(n)} \leq \sqrt[n]{\alpha } \theta_0\right\}\)

ProblemЗадача 4

\(X_1, \dots , X_n\) – выборка из \(U[0,\theta ], \; \theta > 0\). Построить РНМК У.З. \(\alpha\) проверки \(H_0: \theta = \theta_0\) против \(H_1: \theta \neq \theta_0\).

Если \(S\) – равномерно наиболее мощный критерий, то он будет самым мощным. Однако, в отличие от самого мощного критерия, РНМК не всегда существует.

ProblemЗадача 5

Докажите, что в условиях задачи Задача 3 РНМК не существует, как в пункте а), так и в пункте б).

ProblemЗадача 6

\(X_1, \dots , X_n\) – выборка из \(\mathrm{Bern}(\theta )\). Докажите, что не существует РНМК произвольного У.З. \(\alpha\) для проверки гипотезы \(H_0: \theta = \theta_0 \in (0,1)\) против \(H_1: \theta \neq \theta_0\).

3 Построение наиболее мощных критериев через отношение правдоподобия

Пусть \(\left\{ \mathbb {P}_{\theta }, \theta \in \Theta \right\}\) – доминируемое семейство распределений с плотностями \(\left\{ f_\theta \right\}\), причем носитель \(\mathbb {P}_\theta\) не зависит от параметра. Отношением правдоподобия называется отношение правдоподобия при базовом параметре к правдоподобию при альтернативном параметре:

\[ \frac{L(\theta _0)}{L(\theta _1)} = \frac{L(\theta _0, \vec{X})}{L(\theta _1, \vec{X})} \]

3.1 Простые гипотезы

Пусть дана простая гипотеза против простой альтернативы:

\[ H_0: \theta = \theta _0, \qquad H_1: \theta = \theta _1. \]

Рассмотри отношение правдоподобия. Если оно слишком мало, меньше какой-то границы \(c\), то параметр \(\theta_1\) ощутимо более правдоподобен, чем \(\theta_0\), и нам следует отвергнуть \(H_0\). Оказывается, построенный таким способом критерий будет самым мощным.

Лемма 1 (Нейман-Пирсон) Пусть существует такое число \(c>0\), что \[ \mathbb {P}_{\theta _{0}}\left(\frac{L(\theta _0, \vec{X})}{L(\theta _1, \vec{X})} < c\right) = \alpha . \] Иначе говоря, \[ \mathbb {P}_{\theta _0}\left(\vec{X} \in S\right) = \alpha . \] где \[ S := \left\{ \vec{x} \in \mathcal{X}: \frac{L(\theta _0, \vec{x})}{L(\theta _1, \vec{x})} < c\right\} \] Тогда критерий \(S \subset \mathcal{X}\) является критерием УЗ \(\alpha\) проверки \(H_0\) против \(H_1\) (это очевидно). При этом он является самым мощным критерием с таким уровнем значимости (неочевидно, в этом состоит открытие Неймана, Пирсона).

ExampleПример 6

Пусть \(X_{1}, \ldots , X_{n}\) – выборка из распределения \(\operatorname {Exp}(1/\theta )\) (\(\mathbb {E}\left[X_1\right] = \theta\)). Постройте наиболее мощный критерий для проверки гипотезы \(H_{0}: \theta =\theta_{0} \in (0,+\infty )\) против альтернативы \(H_{1}: \theta =\theta_{1} \in (0,+\infty )\), если \(\theta_{0} > \theta_{1}\).

SolutionРешение

Заметим, что \(\theta_0 > \theta_1 \iff \frac{1}{\theta_0} < \frac{1}{\theta_1}\).

Плотность:

\[ f_{\theta }(x) = \frac{1}{\theta }e^{-\frac{1}{\theta }x} \cdot \; \mathbb {1}_{\mathbb {R}_+}(x) \]

Правдоподобие:

\[ \begin{align} L(\theta ) & = L(\theta , X_1,\ldots ,X_n) = \prod _{i=1}^{n}f_{\theta }(X_i) = \\ & = \frac{1}{\theta ^n} \cdot e^{-\frac{1}{\theta }n\overline{X}} \cdot \; \mathbb {1}_{\mathbb {R}_+}(X_{(1)}) \end{align} \]

Отношение правдоподобия:

\[ \frac{L(\theta _0)}{L(\theta _1)} = \left(\frac{\theta _1}{\theta _0}\right)^{n} \mathrm{exp}\left(n\overline{X}\left(\frac{1}{\theta _1} - \frac{1}{\theta _0}\right)\right) \]

По лемме Неймана-Пирсона, наиболее мощный критерий состоит из точек, где отношение правдоподобия меньше \(c\):

\[ S = \left\{ \vec{X} \in \mathbb {R}_+^n: \mathrm{exp}\left(n\overline{x}\left(\frac{1}{\theta _1} - \frac{1}{\theta _0}\right)\right) \left(\frac{\theta _1}{\theta _0}\right)^{n} < c\right\} . \]

Прологарифмируем неравенство под фигурными скобками и перенесем не зависящее от \(\vec{x}\) слагаемое вправо:

\[ n\overline{x}\left(\frac{1}{\theta _1} - \frac{1}{\theta _0}\right) < \ln c - n\ln \left(\frac{\theta _1}{\theta _0}\right) = \ln \left(c \cdot \left(\frac{\theta _0}{\theta _1}\right)^{n}\right). \]

Поскольку \(\theta_0 > \theta_1\), коэффициент \(\frac{1}{\theta_1} - \frac{1}{\theta_0}\) положителен, и деление на него не меняет знак неравенства:

\[ S = \left\{ \vec{X} \in \mathbb {R}_+^n: n \overline{x} \; < \frac{1}{\frac{1}{\theta _1} - \frac{1}{\theta _0}} \ln \left(c \cdot \left(\frac{\theta _0}{\theta _1}\right)^{n} \right)\right\} . \]

Чтобы критерий \(S\) имел уровень значимости \(\alpha\), требуется, чтобы \(\mathbb {P}_{\theta_0}\left(\vec{X} \in S\right) = \alpha\):

\[ \alpha = \mathbb {P}_{\theta _0}\left(\vec{X} \in S\right) = \mathbb {P}_{\theta _0}\left(\overline{X} < \underbrace{\frac{1}{n}\frac{1}{\frac{1}{\theta _1} - \frac{1}{\theta _0}} \ln \left(c \cdot \left(\frac{\theta _0}{\theta _1}\right)^{n} \right)}_{ =: \tilde{c}}\right) \]

Вспомним, что \(\overline{X} \sim \Gamma \left(n, \frac{n}{\theta }\right)\). Следовательно, \(\tilde{c} = Q_{\Gamma \left(n, \frac{n}{\theta_0}\right)}(\alpha )\), где \(Q_{\Gamma \left(n, n/\theta_0\right)}(\cdot )\) – квантильная функция распределения \(\Gamma \left(n, \frac{n}{\theta_0}\right)\).

Из \(\tilde{c}\) можно вывести \(c\), однако это излишне, ответ можно сразу записать через \(\tilde{c}\):

\[ S = \left\{ \vec{x} \in \mathbb {R}_+^n \; : \; \overline{x} < Q_{\Gamma \left(n, n/\theta _0\right)}(\alpha )\right\} . \]

AnswerОтвет

\(S = \left\{ \vec{x} \in \mathbb {R}_+^n: \overline{x} < Q_{\Gamma \left(n, n/\theta_0\right)}(\alpha )\right\}\).

*Примечание.** Получается, что критерии на основе выборочного среднего, которыми мы пользовались в примерах Пример 1, Пример 2, были самыми мощными соответствующего уровня значимости.

ProblemЗадача 7

\(X_1, \dots , X_n\) – выборка из \(N(\theta , 1)\). Построить наиболее мощный критерия уровня значимости \(\alpha\) проверки \(H_0: \theta = \theta_0\) против \(H_1: \theta = \theta_1\), если

  1. \(\theta_0 > \theta_1\);

  2. \(\theta_0 < \theta_1\). Сверьте ответ в пункте б) с ответом в пункте б) задачи Задача 2.

Примечание. Каждый пункт стоит 0.5 балла.

ProblemЗадача 8

\(X_1, \dots , X_n\) – выборка из \(N(0, \theta )\). Построить наиболее мощный критерий У.З. \(\alpha\) проверки \(H_0: \theta = \theta_0\) против \(H_1: \theta = \theta_1\), найдите его мощность.

3.2 Cложные гипотезы: построение РНМК

Пусть у модели есть достаточная статистика \(T(\vec{X})\). Тогда по критерию факторизации Неймана-Фишера имеем

\[ L(\theta , \vec{X}) = \psi (T(\vec{X}), \theta )h(\vec{X}). \]

В таком случае отношение правдоподобия примет вид

\[ \frac{L(\theta ', \vec{X})}{L(\theta '', \vec{X})} = \frac{\psi (T(\vec{X}), \theta ')}{\psi (T(\vec{X}), \theta '')} \]

Определение 4 Семейство \(\left\{ \mathbb {P}_{\theta }, \theta \in \Theta \right\}\) обладает неубывающим отношением правдоподобия по статистике \(T(\vec{X})\), если отношение правдоподобия

\[ \frac{L(\theta ', \vec{X})}{L(\theta '', \vec{X})} = \frac{\psi (T(\vec{X}), \theta ')}{\psi (T(\vec{X}), \theta '')} =: L_{\theta ',\theta ''}(T(\vec{X})) \]

является неубывающей функцией от \(T\) для всех \(\theta '' < \theta '\), принадлежащих \(\Theta\).

Невозрастающее отношение правдоподобия определяется аналогично. В обоих случаях говорят, что модель обладает монотонным отношением правдоподобия.

Теорема 1 Пусть дана простая или сложная базовая гипотеза против сложной альтернативы вида

  1. \(H_0: \theta = \theta_0 \; (\text{или } \theta \geq \theta_0, \text{ это не важно}), \qquad H_1: \theta < \theta_0\);

  2. \(H_0: \theta = \theta_0 \; (\text{или } \theta \leq \theta_0, \text{ это не важно}), \qquad H_1: \theta > \theta_0\);

Пусть \(\left\{ \mathbb {P}_{\theta }, \theta \in \Theta \right\}\) – семейство с неубывающим отношением правдоподобия по статистике \(T(\vec{X})\). Пусть \(\alpha \in (0,1)\). Пусть существует такое \(c\), что

\[ \begin{array}{cc} \text{1 сл.)} & \mathbb {P}_{\theta _0}\left(T(\vec{X}) \leq c\right) = \alpha \\ \text{2 сл.)} & \mathbb {P}_{\theta _0}\left(T(\vec{X}) \geq c\right) = \alpha \end{array}.\qquad \text{Тогда критерий} \quad \begin{array}{cc} \text{1 сл.)} & \left\{ T \leq c\right\} \\ \text{2 сл.)} & \left\{ T \geq c\right\} \end{array} \]

является критерием УЗ \(\alpha\) проверки \(H_0\) против \(H_1\) (это очевидно). При этом он является РНМК с таким уровнем значимости (неочевидно).

ExampleПример 7

Пусть \(X_1, \ldots , X_n\) – выборка из \(\operatorname {Pois}\left(\theta \right)\). Постройте РНМК УЗ \(\alpha\) проверки \(H_0: \theta = \theta_0\) против \(H_1: \theta > \theta_0\).

SolutionРешение

Функция правдоподобия: \[ L(\theta , x) = \prod _{i=1}^n \frac{\theta ^{x_i}}{x_i!}e^{-\theta } = \frac{\theta ^{\sum _{i=1}^n x_i}}{\prod _{i=1}^n x_i!}e^{-n\theta }. \] Для \(\theta ' > \theta ''\) отношение правдоподобия \[ \frac{L(\theta ', x)}{L(\theta '', x)} = \left(\frac{\theta '}{\theta ''}\right)^{\sum _{i=1}^n x_i} e^{-n(\theta ' - \theta '')} \] неубывающе по статистике \(T(\vec{X}) = \sum_{i=1}^n X_i\) (поскольку \(\theta '/\theta '' > 1\)). Значит, семейство \(\left\{ \operatorname {Pois}\left(\theta \right), \theta > 0\right\}\) обладает неубывающим отношением правдоподобия по \(T\), и по теореме Теорема 1 (случай 2) можно применить теорему о монотонном отношении правдоподобия: РНМК имеет вид \(S = \left\{ T(\vec{X}) \geq c\right\}\), где \(c\) находится из условия \[ \mathbb {P}_{\theta _0}\left(T(\vec{X}) \geq c\right) = \alpha . \] Осталось заметить, что при верной \(H_0\) (т.е. \(\theta = \theta_0\)) сумма независимых пуассоновских величин снова пуассоновская: \(T(\vec{X}) = \sum_{i=1}^n X_i \sim \operatorname {Pois}\left(n\theta_0\right)\), так что \(c\) – это (ближайшее целое, обеспечивающее нужный УЗ) квантиль уровня \(1-\alpha\) распределения \(\operatorname {Pois}\left(n\theta_0\right)\).

Если отношение правдоподобия невозрастает по статистике \(T(\vec{X})\), то оно будет неубывающем по статистике \(\left(-T(\vec{X})\right)\). Т.е. в этом случае тоже можно воспользоваться теор. Теорема 1.

ProblemЗадача 9

\(X_1, \dots , X_n\) – выборка из \(\mathrm{Exp}(\theta )\). Построить РНМК проверки \(H_0: \theta = \theta_0\) против а) \(H_1: \theta > \theta_0\) б) \(H_1: \theta < \theta_0\).

Примечание. Каждый пункт стоит 0.5 балла.

ProblemЗадача 10

\(X_1, \dots , X_n\) – выборка из \(N(\theta , 1)\). Построить РНМК проверки

  1. \(H_0: \theta \geq \theta_0\) против \(H_1: \theta < \theta_0\);

  2. \(H_0: \theta \leq \theta_0\) против \(H_1: \theta > \theta_0\).

Примечание. Каждый пункт стоит 0.5 балла.