Проверка статистических гипотез

1 Проверка гипотез на конкретных примерах

Если при проведении экспериментов исследователь не имеет никаких ожиданий относительно возможных значений параметров модели, то в предыдущих главах он сможет найти ответы на многие свои вопросы: как оценить параметр, какими свойствами могут обладать эти оценки, как построить наилучшую оценку, как построить доверительный интервал для параметра и т.д. Однако во многих приложениях нам не нужно оценивать значение самого параметра \(\theta\).

Например, к нам поступило на исследование потенциальное новое лекарство от простуды, и нам требуется оценить его работоспособность. Пусть нам известно, что в среднем больной простудой, не принимающий никаких лекарств, излечивается за счет своего иммунитета за \(\theta_0 = 6\) дней со ст. отклонением \(\sigma_0 = \sqrt{6} \approx 2.5\) дня. Химики-фармацевты, изготовившие новый препарат, утверждают, что при его приеме в среднем человек излечивается за \(4\) дня. Пусть для проведения исследования были отобраны случайным образом 100 человек с простудой на ранней стадии, и они в течение периода болезни принимали новое лекарство (но не более \(13 \approx \theta_0 + 3\sigma_0\) дней, если болезнь не отходила за такой период, пациента переключали на лечение с доказанной эффективностью). В итоге пациенты поправились в среднем за \(4.8\) дней, больше \(13\) дней никто не болел. \(4.8\) дней меньше, чем \(6\), однако нам как исследователям требуется понять, значимо ли это различие, т.е. работает ли действительно лекарство, или это различие в \(1.2\) дня можно просто списать на случайность, и на самом деле прием нового лекарства не оказывает никакого эффекта.

Переводя на язык математической статистики, задачу можно сформулировать так: пусть \(\mathbb {P}_\theta\) – распределение количества дней, требующихся для выздоровления при приеме нового препарата, причем \(\theta\) – матожидание этого распределения. Пусть дана выборка \(X_1, \ldots , X_n\) из распределения \(\mathbb {P}_\theta\). Требуется по выборке дать ответ на бинарный вопрос: \(\theta = 6\) (прием лекарства никакого эффекта не оказывает) или \(\theta = 4\) (прием лекарства оказывает эффект, описанный химиками, которые его создавали). В более общем случае \(\theta \in \Theta_0 \subset \Theta\) или \(\theta \in \Theta_1 = \Theta \setminus \Theta_0\). 2 указанных (противоположных) предположения об истинном распределении называются (противоположными) гипотезами о распределении и обозначаются \(H_0\), \(H_1\). Исследование в попытке дать ответ на вопрос, \(H_0\) или \(H_1\) верна, – проверка статистических гипотез.

1.1 Неравнозначность ошибок, неравнозначность гипотез. Выделение базовой гипотезы

При проверке статистических гипотез можно совершить 2 разные ошибки: либо сказать, что верна гипотеза \(H_1: \theta \in \Theta_1\), когда на самом деле верна \(H_0: \theta \in \Theta_0\) (ошибка I рода), либо наоборот (ошибка II рода). Как правило, указанные ошибки не равнозначны для исследования, одна более опасна, чем другая. Например, случай исследования нового препарата: к настоящему времени существует масса лекарств от простуды с доказанной эффективностью, и если исследователь скажет, что новый препарат не работает, когда он на самом деле работает, то это не будет критично для будущих пациентов, поскольку они вместо нового лекарства могут обратиться к проверенным старым и точно излечиться за короткое время. Если же исследователь заявит о работоспособности бесполезного препарата, и этот препарат появится на полках аптек, то будущие пациенты окажутся под угрозой, поскольку они будут покупать бесполезное лекарство, рассчитывая на скорое излечение.

Поскольку ошибки не равнозначны для исследователя, то и гипотезы не могут быть равнозначными: мы должны быть склонны принять ту гипотезу, ошибочное отвержение которой для нас более критично. Обычно эту гипотезу обозначают \(H_0\) и называют базовой, а противоположную ей \(H_1\)альтернативной. В случае с медицинскими исследованиями, как правило, базовая гипотеза состоит в том, что новый препарат (или метод лечения) не эффективен, альтернатива – что эффективен.

2|l|2Таблица ошибок 2|l|Базовая гипотеза (\(H_0\)) 3-4 2|l| Верна Неверна 1-4 2Решение по нулевой гипотезе (\(H_0\)) Не отклонили Верное решение Ошибка II типа 2-4 Отклонили Ошибка I типа Верное решение 1-4

1.2 Значимость данных, p-значение, уровень значимости

Исследование статистических гипотез протекает так: исследователь изначально, до исследования считает верной базовую гипотезу \(H_0\). Далее он получает данные и исследует их, пытаясь ответить на вопрос: достаточно ли они критичные для \(H_0\), чтобы отвергнуть базовую гипотезу \(H_0\) в пользу альтернативной \(H_1\).

Как численно оценить критичность данных? Рассмотрим на описанном выше примере с исследованием нового препарата.

ExampleПример 1

Пусть \(X_1, \ldots , X_n, \; n = 100\) – выборка из экспоненциального распределения \(\operatorname {Exp}\left(\frac{1}{\theta }\right), \; \theta \in \left\{ 4,6\right\}\) (т.е. \(\mathbb {E}\left[X_1\right] = \theta\)). Пусть проведен конкретный эксперимент \(\omega_0\), причем \(\overline{X}(\omega_0) = \sum_{i=1}^n X_i(\omega_0) = 4.8\). Пусть базовая гипотеза \(H_0: \theta = \theta_0 = 6\), альтернатива \(H_1: \theta = \theta_1 = 4\). Оценить критичность данных в эксперименте \(\omega_0\) на основе статистики \(\overline{X}\).

l0.6

[width=0.58img/p-val.PNG Красная область под графиком – это p-значение. Источник.

Изначально мы полагаем, что \(H_0\) верна, т.е. что \(\theta = 6\). Нам необходимо понять, насколько критичные данные мы получили, их статистическую значимость. Попробуем это понять на основе статистики \(\overline{X}\). Учитывая, что альтернатива состоит в том, что параметр меньше \(\theta_0\), данные будут тем более критичными, чем их выборочное среднее ближе к \(\theta_1\) по сравнению с \(\theta_0\). Заметим, что \(\overline{X} \sim \Gamma (n, n/\theta )\), т.е. при верной \(H_0\) имеем \(\overline{X} \sim \Gamma (100, 100/6)\). Имеем

\[ \mathbb {P}_{H_0}\left(\overline{X} \leq 4.8\right) \approx 1.7\% \] Мы получили в ходе эксперимента значение статистики. Вероятность получить в ходе копии такого эксперимента такое же или более критическое значение статистики при верной гипотезе \(H_0\) называется p-значением. При помощи p-значения можно оценивать критичность данных в предположении гипотезы \(H_0\).

p-значение: \(1.7\%\).

Говорят, что данные эксперимента имеют статистическую значимость, если получение таких же данных в ходе независимой копии эксперимента было бы крайне маловероятным, в предположении верной базовой гипотезы. Если данные статистически значимы, то необходимо отвергнуть базовую гипотезу в пользу альтернативы.

Мы получили в ходе эксперимента некоторое p-значение. Как по нему понять, значимы ли данные, нужно ли нам отвергать гипотезу \(H_0\)? Для решения этого вопроса перед экспериментом устанавливают некоторую планку для p-значения, называемую уровнем значимости (обозн.: \(\alpha\)). Уровень значимости задает ту допустимую вероятность, с которой мы готовы отвергнуть \(H_0\), когда она верна. Т.е. уровень значимости – это допустимая вероятность совершить ошибку первого рода. Как правило, в качестве уровня значимости берут значение \(\alpha = 5\%\), хотя в медицинских исследованиях могут быть и \(1\%\), и \(0.1\%\), и \(0.01\%\).

ExampleПример 2

В условиях примера @StatHyp:Ex1 проверить \(H_0\) против \(H_1\) на уровнях значимости \(\alpha_1 = 5\%\), \(\alpha_2 = 1\%\).

p-значение: \(1.7\%\).

\(1.7\% < 5\%\), следовательно данные значимы, достаточно критичны в предположении \(H_0\). Вариативность данных нельзя списать на случайность. Необходимо отвергнуть \(H_0\) в пользу \(H_1\), принять \(H_1\);

\(1.7\% > 1\%\), следовательно данные незначимы, недостаточно критичны в предположении \(H_0\). Их вариативность можно списать на случайность. Отвергать \(H_0\) не следует.

Примечание. Обратите внимание, что во втором случае некорректно говорить о том, что мы принимаем \(H_0\), поскольку мы ее приняли изначально, до эксперимента. Корректнее говорить, что мы не отвергли \(H_0\).

Проверка статистических гипотез похожа на судебное заседание. Практически любая судебная система в современном мире исповедует принцип презумпции невиновности. Перед началом заседания подсудимый считается невиновным, в этом состоит, можно сказать, базовая гипотеза суда \(H_0\). Далее, в ходе заседания, обвинитель приводит суду улики, свидетельствующие в пользу виновности. Задача судьи состоит в исследовании улик и вынесении вердикта, достаточны ли улики, чтобы отвергнуть базовое предположение о невиновности подсудимого и принять гипотезу о виновности. В матстатистике уликами является выборка, и исследователь должен понять, достаточно ли улики критичны, чтобы можно было отвергнуть \(H_0\) в пользу \(H_1\).

ProblemЗадача 1

Пусть \(X_1, \ldots , X_n, \; n = 225\) – выборка из нормального распределения \(\mathscr {N}\left(\theta , 1\right), \; \theta \in \left\{ 5,8\right\}\), причем \(\overline{X}(\omega_0) = 5.15\). Пусть базовая гипотеза \(H_0: \theta = \theta_0 = 5\), альтернатива \(H_1: \theta = \theta_1 = 8\). Найти p-значение для эксперимента \(\omega_0\), проверить гипотезу \(H_0\) против \(H_1\) на уровнях значимости \(\alpha_1 = 5\%\), \(\alpha_2 = 2\%\), \(\alpha_3 = 1\%\).

2 Общая постановка задачи

2.1 Критерий, критическая область

Как в общем случае формализовать проверку статистических гипотез? Пусть \(\vect {X} = (X_1, \ldots , X_n)^T\) – выборка из неизвестного распределения \(\mathbb {P} \in \mathcal{P}\). Часто мы имеем параметрическую модель, и тогда \(\mathcal{P} = \left\{ \mathbb {P}_\theta , \; \theta \in \Theta \right\}\), хотя в общем случае \(\mathcal{P}\) может быть любым семейством распределений.

Гипотезы

\[ \begin{align} \text{в параметрической модели} \quad & H_0: \theta \in \Theta _0 \subset \Theta , \qquad H_1: \theta \in \Theta _1 = \Theta _0^\complement = \Theta \setminus \Theta _0 \\ \text{в общем случае} \quad & H_0: \mathbb {P} \in \mathcal{P}_0 \subset \mathcal{P}, \qquad H_1: \mathbb {P} \in \mathcal{P}_1 = \mathcal{P}_0^\complement = \mathcal{P} \setminus \mathcal{P}_0 \end{align} \]

Гипотеза, в которой предполагается только один параметр (одно распределение), называется простой. В противном случае гипотеза называется сложной. Пока что в примерах (@StatHyp:Ex1) и задачах (@StatHyp:NormalSimpleProb) мы проверяли только простую базовую гипотезу против простой альтернативы. Примеры со сложными гипотезами приводятся ниже.

Решение отвергать/не отвергать \(H_0\) в пользу \(H_1\) можно формализовать подмножеством \(S \subset \mathcal{X}\) (\(S \in \mathscr {B}\left(\mathcal{X}\right)\)) в пространстве \(\mathcal{X}\) всех возможных значений выборки: если \(\vect {X} \in S\), то мы отвергаем \(H_0\) в пользу \(H_1\). В противном случае мы не отвергаем \(H_0\). Область \(S \subset \mathcal{X}\) называется критической областью или просто критерием.

Определение 1  

  • Функцией мощности критерия \(S\) называется функция

    \[ \beta (\theta , S)=\mathbb {P}_{\theta }(\vect {X} \in S), \; \theta \in \Theta \qquad \left(\beta (\mathbb {P}, S) = \mathbb {P}(\vect {X} \in S) , \; \mathbb {P} \in \mathcal{P} \text{ в общ. случае}\right) \] Т.е. вероятность отвергнуть \(H_0\), если истинный параметр – это \(\theta\) (если истинное распределение – это \(\mathbb {P}\) соотв).

  • Величина \(\alpha\) называется уровнем значимости критерия \(S\), если \(\alpha \geq \beta (\theta , S)\) для любого \(\theta \in \Theta_{0}\). Заметим, что если \(\theta \in \Theta_0\), то верна \(H_0\) и \(\beta (\theta , S) = \mathbb {P}_{\theta }\left(\vect {X} \in S\right)\) – вероятность отвергнуть верную \(H_0\), т.е. совершить ошибку I рода. Уровень значимости таким образом – это верхняя граница для возможных вероятностей ошибок первого рода. Эти вероятности могут быть разными, поскольку в общем случае в \(\Theta_0\) содержится несколько элементов.

    Уровень значимости в общем случае вводится аналогично.

  • Минимальный уровень значимости

    \[ \alpha _{0}=\sup _{\theta \in \Theta _{0}} \beta (\theta , S) \qquad \left(\alpha _{0}=\sup _{\mathbb {P} \in \mathcal{P}_0} \beta (\mathbb {P}, S) \text{ в общ. случае}\right) \] называется размером критерия \(S\). Т.е. размер критерия – точная верхняя граница для вероятностей ошибок первого рода.

    Зачастую сам размер критерия называют уровнем значимости и обозначают \(\alpha\).

ExampleПример 3

Пусть \(X\) – выборка объема 1. Пусть \(H_0: X \sim U[0,1], \; H_1: X \sim \mathrm{Exp}(1)\). Пусть \(\alpha \in (0,1)\) – произвольное. Построить все возможные критерии \(S\) уровня значимости (размера) \(\alpha \in (0,1)\).

В данном случае \(\mathcal{P} = \left\{ U[0,1], \operatorname {Exp}(1)\right\}\), \(\mathcal{P}_0 = \left\{ U[0,1]\right\} , \; \mathcal{P}_1 = \left\{ \operatorname {Exp}(1)\right\}\). Обозначим \(\mathbb {P}_0 := U[0,1], \; \mathbb {P}_1 := \operatorname {Exp}(1)\).

Заметим, что в данном случае область значений выборки \(\mathcal{X} = \mathbb {R}_+\). Пусть \(S \subset \mathcal{X}\) – критерий. Его уровень значимости:

\[ \alpha = \sup _{\mathbb {P} \in \mathcal{P}_0} \beta (\mathbb {P}, S) = \beta (\mathbb {P}_0, S) = \mathbb {P}_{0}\left(X \in S\right) = \int _S \; \mathbb {1}_{X \in [0,1]}dx = \lambda \left(S \cap [0,1]\right), \] где \(\lambda\) – мера Лебега.

\(S\) – любое множество из \(\mathscr {B}\left(\mathbb {R}_+\right)\), такое, что \(\lambda (S \cap [0,1]) = \alpha\).

2.2 Мощность критерия

Если цель – как можно сильнее ограничить вероятность ошибки первого рода, то, вообще говоря, уровень значимости \(\alpha\) можно взять равным нулю. Однако при таком УЗ мы должны будем стоять на \(H_0\) какими бы ни были данные \(\vect {X}\), т.е. необходимо взять \(S = \varnothing\). Во всех случаях, когда на самом деле верна \(H_1\), мы будем стоять на \(H_0\), совершая ошибку второго рода. Вероятность ошибки второго рода будет равна \(100\%\).

Между вероятностями ошибок первого и второго рода существует обратная зависимость, чем меньше одна вероятность, тем больше другая. “Самого лучшего” критерия как с точки зрения вероятности ошибки первого рода, так и с точки зрения ошибки второго рода не существует. На практике при поиске “лучшего” критерия сначала фиксируют уровень значимости (вероятность совершить ошибку первого рода), а затем среди всех критериев с заданным уровнем значимости ищут лучший с точки зрения ошибки второго рода.

Определение 2 Верхнюю границу для возможных значений ошибок второго рода обозначают буквой \(\beta\). Обозначение совпадает с функцией мощности, но обычно путаницы не возникает.

Напомним, что ошибка второго рода возникает, когда верна \(H_1\), а исследователь не отвергает \(H_0\), т.е. когда \(\vect {X} \not\in S\). Таким образом,

\[ \begin{align} & \; \beta := \sup _{\theta \in \Theta _{1}} \mathbb {P}_{\theta }\left(\vect {X} \not\in S\right) = \sup _{\theta \in \Theta _{1}} \left[ 1 - \mathbb {P}_{\theta }\left(\vect {X} \in S\right)\right] = \sup _{\theta \in \Theta _{1}} \left[ 1 - \beta (\theta , S)\right] \\ & \left(\beta = \sup _{\mathbb {P} \in \mathcal{P}_{1}} \left[ 1 - \beta (\mathbb {P}, S)\right] \text{ в общем случае} \right) \end{align} \] Величину \(1-\beta\) называют мощностью статистического критерия. Мощность – это способность критерия обнаружить эффект (гипотезу \(H_1\)), в случае если этот эффект действительно существует. С точки зрения статистики, это нижняя граница вероятности справедливого опровержения нулевой гипотезы:

\[ 1 - \beta = \inf _{\theta \in \Theta _{1}} \mathbb {P}_{\theta }\left(\vect {X} \in S\right) = \inf _{\theta \in \Theta _{1}} \beta (\theta , S) \quad \left(1 - \beta = \inf _{\mathbb {P} \in \mathcal{P}_{1}} \beta (\mathbb {P}, S) \text{ в общем случае}\right) \]

2|l|2Таблица ошибок 2|l|Базовая гипотеза (\(H_0\)) 3-4 2|l| Верна Неверна 1-4 2Решение по нулевой гипотезе (\(H_0\)) Не отклонили Верное решение True Negative (TN) \(1 - \alpha\) Ошибка II типа False Negative (FN) \(\beta\) 2-4 Отклонили Ошибка I типа False Positive (FP) \(\alpha\) Верное решение True Positive (TP) \(1 - \beta\) 1-4

ExampleПример 4

В условиях примера @StatHyp:Ex3 найдите для каждого критерия \(S\) его мощность. Найдите наиболее мощный критерий УЗ \(\alpha \in (0,1)\). Примечание. Заметим, что в данном случае в \(\mathcal{P}_1 = \left\{ \mathbb {P}_1\right\}\) только одно распределение. Расчет мощности упрощается: \[ \beta = \mathbb {P}_{1}\left(X \not\in S\right), \qquad 1 - \beta = \mathbb {P}_{1}\left(X \in S\right) \]

Вычислим мощность \(S\), т.е. вероятность верно отклонить \(H_0\):

\[ \beta (\mathbb {P}_1, S) = \mathbb {P}_{1}\left(X \in S\right) = \int _S e^{-x} dx = \int _{S \cap [0,1]}e^{-x} dx + \int _{S \cap (1, +\infty )}e^{-x} dx \] Заметим, что значения этих 2-х интегралов не зависят друг от друга. При этом на \(S \cap (1, +\infty )\) у нас нет вообще никаких ограничений. Следовательно, чтобы максимизировать мощность, нужно взять \(S\) таким, чтобы \(S \cap (1, +\infty ) = (1, +\infty )\).

Далее, рассмотрим интеграл \(\int_{S \cap [0,1]}e^{-x} dx\). \(e^{-x}\) строго убывает, следовательно, учитывая ограничение \(\lambda (S \cap [0,1]) = \alpha\), критерий \(S\) надо взять таким, чтобы \(S \cap [0,1] = [0, \alpha ]\).

\([0, \alpha ] \cup (1, +\infty )\).

ProblemЗадача 2

Пусть \(X\) – выборка объема 1 из распределения \(\mathbb {P}\). Пусть

  1. \(H_0: X \sim U[1,4], \; H_1: X \sim \mathscr {N}\left(3, 1\right)\);

  2. \(H_0: X \sim \mathscr {N}\left(0, 1\right), \; H_1: X \sim \mathscr {N}\left(1, 1\right)\). Пусть \(\alpha \in (0,1)\) – произвольное. Найдите наиболее мощный критерий УЗ \(\alpha\).

Примечание. Каждый пункт оценивается в 0.5 балла.

Напомним, гипотеза называется простой, если в ней предполагается только один параметр или одно распределение. Пока что мы имели дело только с тестированием простых базовых гипотез против простых альтернатив. В следующей задаче требуется проверить простую базовую гипотезу против сложной альтернативы.

ProblemЗадача 3

Пусть \(X\) – выборка объема 1 из распределения \(\mathbb {P}\). Пусть

  1. \(H_0: X \sim U[-3,3], \; H_1: \mathbb {P} \in \left\{ \operatorname {TR}[-2,0], \operatorname {TR}[0,2]\right\}\), где \(\operatorname {TR}[a,b]\)треугольное распределение с плотностью
$$
  p(t) = \begin{cases}  0, & x < a \\ \frac{2(x-a)}{(b-a)\left(\frac{b+a}{2} - a\right)}, & x \in [a, \frac{a+b}{2}), \\ \frac{2(b-x)}{(b-a)\left(b - \frac{b+a}{2}\right)}, & x \in [\frac{a+b}{2}, b), \\ 0, & x \geq b \end{cases}  
$$
  1. \(H_0: X \sim U[-3,3], \; H_1: \mathbb {P} \in \left\{ \mathscr {N}\left(-1, 1\right), \mathscr {N}\left(1, 1\right)\right\}\). Пусть \(\alpha \in (0,1)\) – произвольное. Найдите наиболее мощный критерий УЗ \(\alpha\).

Примечание. Пункт а) оценивается в 1 балл, б) в 2 балла.

2.3 Равномерно наиболее мощные критерии

Пусть у нас имеется сложная альтернатива \(H_1\): \(\left|\Theta_1\right| > 1\). Напомним, что в такой ситуации мощность при разных параметрах \(\theta \in \Theta_1\) из \(H_1\) может получиться разная. Мощность самого критерия в таком случае определяется как инфимум этих значений. Критерии одинакового УЗ можно сравнивать, опираяся на найденный инфимум. Лучшим считается тот критерий, у которого этот инфимум самый большой.

В некоторых случаях можно найти критерий с заданным УЗ, у которого не просто будет наибольшая мощность, но она будет равномерно по \(\theta \in \Theta_1\) наибольшая.

Определение 3 Если \(S\) и \(R\) – два критерия уровня значимости (размера) \(\alpha\), то \(S\) равномерно мощнее \(R\), если

\[ \beta (\theta , S) \geq \beta (\theta , R) \; \; \forall \theta \in \Theta _1 \quad \left(\beta (\mathbb {P}, S) \geq \beta (\mathbb {P}, R) \; \; \forall \mathbb {P} \in \mathcal{P}_1 \text{ в общем случае}\right). \] Это равносильно условию на вероятности ошибок второго рода

\[ 1 - \beta (\theta , S) \leq 1 - \beta (\theta , R) \; \; \forall \theta \in \Theta _1 \quad \left( 1 - \beta (\mathbb {P}, S) \geq 1 - \beta (\mathbb {P}, R) \; \; \forall \mathbb {P} \in \mathcal{P}_1 \text{ в общем случае}\right) \] Т.е. \(S\) равномерно мощнее \(R\), если у него при любом значении истинного параметра из гипотезы \(H_1\) (истинного распределения в общ. случае) вероятность ошибки второго рода меньше. Иначе: вероятность ошибки второго рода критерия \(S\) меньше вероятности ошибки второго рода критерия \(R\) равномерно по \(\theta \in \Theta_1\) (равномерно по \(\mathbb {P} \in \mathcal{P}_1\) соотв.).

Критерий \(S\) называется равномерно наиболее мощным критерием (РНМК) уровня значимости \(\alpha\), если он равномерно мощнее любого другого критерия уровня значимости \(\alpha\).

ExampleПример 5

Пусть \(\vect {X} = \left(X_{1}, \ldots , X_{n}\right)^T\) – выборка из равномерного распределения на отрезке \([0, \theta ], \theta >0\). Найдите РНМК для проверки гипотезы \(H_{0}: \theta =\theta_{0}\) против альтернативы \(H_{1}: \theta <\theta_{0}\), если он существует.

Рассмотрите критерии вида \(S_c\left(X_{1}, \ldots , X_{n}\right)=\left\{ X_{(n)} \leq c \theta_{0}\right\}\)

Найдем среди критериев \(\left\{ S_c\right\}\) критерий \(S_{c_0}\) с УЗ \(\alpha\). Имеем

\[ \alpha = \mathbb {P}_{\theta _0}\left(\vect {X} \in S_{c_0}\right) = \mathbb {P}_{\theta _0}\left(X_{(n)} \leq c_0\theta _0\right) = \left(\frac{c_0\theta _0}{\theta _0}\right)^n = c_0^n \] Следовательно, \(c_{0}=\sqrt[n]{\alpha }\).

Докажем, что \(S_{c_0} = \left\{ \vect {X} \in \mathbb {R}_+^n: x_{(n)} \leq \sqrt[n]{\alpha } \theta_0\right\}\) равномерно мощнее всех прочих критериев \(R\) УЗ \(\alpha\):

\[ \mathbb {P}_{\theta }\left(\vect {X} \in S_{c_0}\right) \geq \mathbb {P}_{\theta }\left(\vect {X} \in R\right) \; \forall \theta < \theta _0, \; \forall R \subset \mathbb {R}_+^n: \; \mathbb {P}_{\theta _0}\left(\vect {X} \in R\right) = \alpha \] - Пусть истинный параметр \(\theta \leq c_0 \theta_0\). Мощность \(S_{c_0}\) равна 1, т.е. не меньше мощности любого другого критерия.

  • Пусть истинный параметр \(\theta \in (c_0\theta_0, \theta_0)\). Мощность \(S_{c_0}\):

    \[ \mathbb {P}_{\theta }\left(\vect {X} \in S_{c_0}\right) = \mathbb {P}_{\theta }\left(X_{(n)} \leq c_0 \theta _0\right) = \alpha \left(\frac{\theta _0}{\theta }\right)^n \] Мощность произвольного критерия \(R \subset \mathbb {R}_+^n\) УЗ \(\alpha\):

    \[ \begin{align} \mathbb {P}_{\theta }\left(\vect {X} \in R\right) & = \int _{[0,\theta ]^n} \frac{1}{\theta ^n} \; \mathbb {1}_{\vect {x} \in R} d\vect {x} =\frac{\theta _{0}^{n}}{\theta ^{n}} \int _{\left[0, \theta \right]^{n}} \frac{1}{\theta _{0}^{n}} \; \mathbb {1}_{\vect {x} \in R} d\vect {x} \leq \frac{\theta _{0}^{n}}{\theta ^{n}} \int _{\left[0, \theta _0\right]^{n}} \frac{1}{\theta _{0}^{n}} \; \mathbb {1}_{\vect {x} \in R} d\vect {x} = \\ & = \frac{\theta _{0}^{n}}{\theta ^{n}} \mathbb {P}_{\theta _0}\left(\vect {X} \in R\right) \leq \alpha \frac{\theta _{0}^{n}}{\theta ^{n}} = \mathbb {P}_{\theta }\left(\vect {X} \in S_{c_0}\right) \end{align} \]

\(\left\{ \vect {x} \in \mathbb {R}_+^n: x_{(n)} \leq \sqrt[n]{\alpha } \theta_0\right\}\)

ProblemЗадача 4

\(X_1, \dots , X_n\) – выборка из \(U[0,\theta ], \; \theta > 0\). Построить РНМК У.З. \(\alpha\) проверки \(H_0: \theta = \theta_0\) против \(H_1: \theta \neq \theta_0\).

Очевидно, если \(S\) – равномерно наиболее мощный критерий, то он будет самым мощным. Однако, в отличие от самого мощного критерия, РНМК не всегда существует.

ProblemЗадача 5

Докажите, что в условиях задачи @StatHyp:ProbCompositeHyp1 РНМК не существет, как в пункте а), так и в пункте б).

Примечание. Каждый пункт оценивается в 0.5 балла.

ProblemЗадача 6

\(X_1, \dots , X_n\) – выборка из \(\mathrm{Bern}(\theta )\). Докажите, что не существует РНМК произвольного У.З. \(\alpha\) для проверки гипотезы \(H_0: \theta = \theta_0 \in (0,1)\) против \(H_1: \theta \neq \theta_0\).

3 Построение наиболее мощных критериев на основе отношения правдоподобия

Пусть \(\left\{ \mathbb {P}_{\theta }, \theta \in \Theta \right\}\) – доминируемое семейство распределений с плотностями \(\left\{ p_\theta \right\}\), причем носитель \(\mathbb {P}_\theta\) не зависит от параметра. Отношением правдоподобия называется отношение правдоподобия при базовом параметре к правдоподобию при альтернативном параметре:

\[ \frac{f_{\theta _0}(\vect {X})}{f_{\theta _1}(\vect {X})} \]

3.1 Простые гипотезы

Пусть дана простая гипотеза против простой альтернативы:

\[ H_0: \theta = \theta _0, \qquad H_1: \theta = \theta _1. \]

Рассмотри отношение правдоподобия \(\frac{f_{\theta_0}(\vect {X})}{f_{\theta_1}(\vect {X})}\). Ясно, что если оно слишком мало, меньше какой-то границы \(c\), то параметр \(\theta_1\) ощутимо более правдоподобен, чем \(\theta_0\) и нам следует отвергнуть \(H_0\). Оказывается, построенный таким способом критерий будет самым мощным. [Лемма Неймана-Пирсона] Пусть существует такое число \(c>0\), что

\[ \mathbb {P}_{\theta _{0}}\left(\frac{f_{\theta _0}(\vect {X})}{f_{\theta _1}(\vect {X})} < c\right) = \mathbb {P}_{\theta _0}\left(\vect {X} \in S\right) = \alpha , \qquad \text{ где } \qquad S := \left\{ \vect {x} \in \mathcal{X}: \frac{f_{\theta _0}(\vect {x})}{f_{\theta _1}(\vect {x})} < c\right\} \]

Тогда критерий \(S \subset \mathcal{X}\) является критерием УЗ \(\alpha\) проверки \(H_0\) против \(H_1\) (это очевидно). При этом он является самым мощным критерием с таким уровнем значимости (неочевидно, в этом состоит открытие Неймана, Пирсона).

ExampleПример 6

Пусть \(X_{1}, \ldots , X_{n}\) – выборка из распределения \(\operatorname {Exp}(1/\theta )\) (\(\mathbb {E}\left[X_1\right] = \theta\)). Постройте наиболее мощный критерий для проверки гипотезы \(H_{0}: \theta =\theta_{0} \in (0,+\infty )\) против альтернативы \(H_{1}: \theta =\theta_{1} \in (0,+\infty )\), если \(\theta_{0} > \theta_{1}\).

\(\theta_0 > \theta_1 \iff \frac{1}{\theta_0} < \frac{1}{\theta_1}\).

Правдоподобие:

\[ f_{\theta }\left(X_{1}, \ldots , X_{n}\right)=\frac{1}{\theta ^{n}} e^{-n\overline{X}/\theta }. \] По лемме Неймана-Пирсона, наиболее мощный критерий имеет вид

\[ S = \left\{ \vect {X} \in \mathbb {R}_+^n: \exponent {n\overline{x}\left(\frac{1}{\theta _1} - \frac{1}{\theta _0}\right)} \left(\frac{\theta _1}{\theta _0}\right)^{n} < c\right\} = \left\{ \vect {X} \in \mathbb {R}_+^n: n \overline{x} \; < \frac{1}{\frac{1}{\theta _1} - \frac{1}{\theta _0}} \ln \left(c \cdot \left(\frac{\theta _0}{\theta _1}\right)^{n} \right)\right\} , \] Чтобы критерий \(S\) имел уровень значимости \(\alpha\), требуется, чтобы \(\mathbb {P}_{\theta_0}\left(\vect {X} \in S\right) = \alpha\):

\[ \alpha = \mathbb {P}_{\theta _0}\left(\vect {X} \in S\right) = \mathbb {P}_{\theta _0}\left(\overline{X} < \underbrace{\frac{1}{n}\frac{1}{\frac{1}{\theta _1} - \frac{1}{\theta _0}} \ln \left(c \cdot \left(\frac{\theta _0}{\theta _1}\right)^{n} \right)}_{ =: \tilde{c}}\right) \] Вспомним, что \(\overline{X} \sim \Gamma \left(n, \frac{n}{\theta }\right)\). Следовательно, \(\tilde{c} = Q_{\Gamma \left(n, \frac{n}{\theta_0}\right)}(\alpha )\), где \(Q_{\Gamma \left(n, n/\theta_0\right)}(\cdot )\) – квантильная функция распределения \(\Gamma \left(n, \frac{n}{\theta_0}\right)\).

Из \(\tilde{c}\) можно вывести \(c\), однако это излишне, ответ можно сразу записать через \(\tilde{c}\):

\(S = \left\{ \vect {x} \in \mathbb {R}_+^n: \overline{x} < Q_{\Gamma \left(n, n/\theta_0\right)}(\alpha )\right\}\). *Примечание.** Получается, что критерии на основе выборочного среднего, которыми мы пользовались в примерах @StatHyp:Ex1, @StatHyp:Ex2, были самыми мощными соответствующего уровня значимости.

ProblemЗадача 7

\(X_1, \dots , X_n\) – выборка из \(N(\theta , 1)\). Построить наиболее мощный критерия уровня значимости \(\alpha\) проверки \(H_0: \theta = \theta_0\) против \(H_1: \theta = \theta_1\), если

  1. \(\theta_0 > \theta_1\);

  2. \(\theta_0 < \theta_1\). Сверьте ответ в пункте б) с ответом в пункте б) задачи @StatHyp:ProbSimpleHyp1.

Примечание. Каждый пункт стоит 0.5 балла.

ProblemЗадача 8

\(X_1, \dots , X_n\) – выборка из \(N(0, \theta )\). Построить наиболее мощный критерий У.З. \(\alpha\) проверки \(H_0: \theta = \theta_0\) против \(H_1: \theta = \theta_1\), найдите его мощность.

3.2 Cложные гипотезы: построение РНМК

Пусть у модели есть достаточная статистика \(T(\vect {X})\). Тогда по критерию факторизации Неймана-Фишера имеем

\[ f_{\theta }(\vect {X}) = \psi (T(\vect {X})), \theta )h(\vect {X}). \]

В таком случае отношение правдоподобия примет вид

\[ \frac{f_{\theta '}(\vect {X})}{f_{\theta ''}(\vect {X})} = \frac{\psi (T(\vect {X}), \theta ')}{\psi (T(\vect {X}), \theta '')} \]

Определение 4 Семейство \(\left\{ \mathbb {P}_{\theta }, \theta \in \Theta \right\}\) обладает неубывающим отношением правдоподобия по статистике \(T(\vect {X})\), если отношение правдоподобия

\[ \frac{f_{\theta '}(\vect {X})}{f_{\theta ''}(\vect {X})} = \frac{\psi (T(\vect {X}), \theta ')}{\psi (T(\vect {X}), \theta '')} =: L_{\theta ',\theta ''}(T(\vect {X})) \] является неубывающей функцией от \(T\) для всех \(\theta '' < \theta '\), принадлежащих \(\Theta\).

Невозрастающее отношение правдоподобия определяется аналогично. В обоих случаях говорят, что модель обладает монотонным отношением правдоподобия.

Пусть дана простая или сложная базовая гипотеза против сложной альтернативы вида

  1. \(H_0: \theta = \theta_0 \; (\text{или } \theta \geq \theta_0, \text{ это не важно}), \qquad H_1: \theta < \theta_0\);

  2. \(H_0: \theta = \theta_0 \; (\text{или } \theta \leq \theta_0, \text{ это не важно}), \qquad H_1: \theta > \theta_0\);

Пусть \(\left\{ \mathbb {P}_{\theta }, \theta \in \Theta \right\}\) – семейство с неубывающим отношением правдоподобия по статистике \(T(\vect {X})\). Пусть \(\alpha \in (0,1)\). Пусть существует такое \(c\), что

\[ \begin{array}{cc} \text{1 сл.)} & \mathbb {P}_{\theta _0}\left(T(\vect {X}) \leq c\right) = \alpha \\ \text{2 сл.)} & \mathbb {P}_{\theta _0}\left(T(\vect {X}) \geq c\right) = \alpha \end{array}.\qquad \text{Тогда критерий} \quad \begin{array}{cc} \text{1 сл.)} & \left\{ T \leq c\right\} \\ \text{2 сл.)} & \left\{ T \geq c\right\} \end{array} \]

является критерием УЗ \(\alpha\) проверки \(H_0\) против \(H_1\) (это очевидно). При этом он является РНМК с таким уровнем значимости (неочевидно).

ExampleПример 7

Если отношение правдоподобия невозрастает по статистике \(T(\vect {X})\), то оно будет неубывающем по статистике \(\left(-T(\vect {X})\right)\). Т.е. в этом случае тоже можно воспользоваться теор. @StatHyp:ComplexAltUMPTtheorem.

ProblemЗадача 9

\(X_1, \dots , X_n\) – выборка из \(\mathrm{Exp}(\theta )\). Построить РНМК проверки \(H_0: \theta = \theta_0\) против а) \(H_1: \theta > \theta_0\) б) \(H_1: \theta < \theta_0\).

Примечание. Каждый пункт стоит 0.5 балла.

ProblemЗадача 10

\(X_1, \dots , X_n\) – выборка из \(N(\theta , 1)\). Построить РНМК проверки

  1. \(H_0: \theta \geq \theta_0\) против \(H_1: \theta < \theta_0\);

  2. \(H_0: \theta \leq \theta_0\) против \(H_1: \theta > \theta_0\).

Примечание. Каждый пункт стоит 0.5 балла.