В предыдущих главах мы изучали точечные оценки параметров. Разумеется, в большинстве случаев вероятность того, что истинное значение параметра совпадает с его оценкой, равна нулю. В этой связи удобнее в качестве оценки рассматривать целый интервал значений неизвестного параметра. При этом размер этого интервала, разумеется, должен быть как можно меньше, а вот вероятность попадания в него истинного значения параметра - наоборот, как можно больше. В этой главе мы и поговорим о таких интервалах.
Определение и методы построения доверительных интервалов
Пусть \(X-\) наблюдение с неизвестным распределением \(\mathbb {P} \in \mathcal{P}= \left\{ \mathbb {P}_\theta , \; \theta \in \Theta \right\}\).
Определение 1 Пара статистик \(\left(T_{1}(X), T_{2}(X)\right)\) (где \(X\) – выборка) называется доверительным интервалом уровня доверия \(\gamma\) для параметра \(\theta\), если для любого \(\theta \in \Theta \subset \mathbb {R}\) выполнено \[
\mathbb {P}_{\theta }\left(T_{1}(X)<\theta <T_{2}(X)\right) \geq \gamma
\] Доверительный интервал называется точным, если для любого \(\theta \in \Theta\) вместо последнего неравенства выполнено равенство.
Построение [неточных] доверительных интервалов с помощью неравенства Чебышева
Для нахождения доверительного интервала можно, например, воспользоваться неравенством Маркова или неравенством Чебышева.
Пусть \(X_{1}, \ldots X_{n}\)- выборка из пуассоновского распределения с параметром \(\lambda >0\). Постройте доверительный интервал для \(\lambda\) уровня доверия \(\gamma\).
В силу неравенства Чебышева,
\[
\mathbb {P}_{\lambda }\left(\left|\sum X_{i}-\lambda n\right| \geq \varepsilon n\right) < \frac{\lambda }{\varepsilon ^{2} n}
\] Следовательно,
\[
\mathbb {P}_{\lambda }\left(\lambda -\varepsilon < \overline{X} < \lambda +\varepsilon \right) \geq 1 - \frac{\lambda }{\varepsilon ^2 n} = \gamma
\] Из последнего равенства находим \(\varepsilon =\sqrt{\lambda /((1-\gamma ) n)}\). Решим неравенство \(\overline{X}<\lambda +\sqrt{\lambda ((1-\gamma ) n)}\) относительно \(\lambda\): для этого достаточно прибавить к левой и правой части неравенства \(\frac{1}{4(1-\gamma ) n}\), тем самым, в правой части образуется полный квадрат. Второе неравенство решается аналогично. Окончательно получаем
\[
\mathbb {P}_{\lambda }\left(\sqrt{\overline{X}+\frac{1}{4(1-\gamma ) n}}-\sqrt{\frac{1}{2(1-\gamma ) n}}< \lambda < \sqrt{\overline{X}-\frac{1}{4(1-\gamma ) n}}+\sqrt{\frac{1}{2(1-\gamma ) n}}\right) \geq \gamma
\] - Точный. Имеем \(\sum_{i=1}^n X_i \sim \PoisDistribution {n\lambda }.\)
Построение точных доверительных интервалов: метод центральной статистики
Неравенство Чебышева, как правило, предоставляет очень грубую оценку вероятности отклонения от среднего. Диаметр такого интервала обычно получается чрезмерно большим. Попробуем построить точный интервал.
Пусть \(X_{1}, \ldots , X_{n}\)- выборка из распределения \(\mathscr {N}\left(\theta , \sigma^2\right)\) с известным \(\sigma^2\). Постройте точный доверительный интервал для \(\theta\) уровня доверия \(\gamma\).
Заметим, что \(X_1 + \ldots + X_n \sim \mathscr {N}\left(n\theta , n\sigma^2\right)\) и \(\overline{X} \sim \mathscr {N}\left(\theta , \frac{\sigma^2}{n}\right)\). Следовательно,
\[
\overline{X} - \theta \sim \mathscr {N}\left(0, \frac{\sigma ^2}{n}\right), \qquad G(X, \theta ) := \frac{\overline{X} - \theta }{\sigma /\sqrt{n}} \sim \mathscr {N}\left(0, 1\right).
\] Обратите внимание, что распределение случайной величины \(G(X, \theta )\) не зависит от неизвестного параметра \(\theta\). Такую случайную величину называют центральной статистикой. Пусть \(u_{\frac{1-\gamma }{2}}, u_{\frac{1 + \gamma }{2}}\) – квантили уровней \(\frac{1-\gamma }{2}, \frac{1+\gamma }{2}\) из распределения \(\mathscr {N}\left(0, 1\right)\). Тогда
\[
\begin{align} \gamma & = \frac{1 + \gamma }{2} - \frac{1 - \gamma }{2} = \mathbb {P}\left(u_{\frac{1-\gamma }{2}} < \frac{\overline{X} - \theta }{\sigma /\sqrt{n}} < u_{\frac{1+\gamma }{2}}\right) = \\ & = \mathbb {P}\left( \overline{X} - \frac{1}{\sqrt{n}}u_{\frac{1+\gamma }{2}}\sigma < \theta < \overline{X} - \frac{1}{\sqrt{n}}u_{\frac{1-\gamma }{2}}\sigma \right) = \\ & = = \mathbb {P}\left(\theta \in \left( \overline{X} - \frac{1}{\sqrt{n}}u_{\frac{1+\gamma }{2}}\sigma , \; \overline{X} - \frac{1}{\sqrt{n}}u_{\frac{1-\gamma }{2}}\sigma \right)\right) \end{align}
\]
\(\left( \overline{X} - \frac{1}{\sqrt{n}}u_{\frac{1+\gamma }{2}}\sigma , \; \overline{X} - \frac{1}{\sqrt{n}}u_{\frac{1-\gamma }{2}}\sigma \right)\)
Итак, для нахождения точных доверительных интервалов необходимо знание точного значения вероятности, а значит, необходимо воспользоваться некоторой функцией \(G(X, \theta )\), распределение которой не зависит от \(\theta\). Повторим, эта функция называется центральной cтатистикой, а метод построения точного доверительного интервала на основе такой случайной функции – метод иентральной статистики. Опишем его в общем виде.
Пусть случайная величина \(G(X, \theta )\) такова, что её распределение известно и не зависит от \(\theta\). Пусть также \(G(X, \theta )\) строго монотонна (например, возрастает) и непрерывна по \(\theta\). Пусть \(0 \leq p_{1}<p_{2} \leq 1\) таковы, что \(p_{2}-p_{1}=\gamma\). Для каждого \(i \in \{ 1,2\}\) рассмотрим \(p_{i}\)-квантили \(u_{p_{i}}\) распределения \(G(X, \theta )\). Пусть \(T_{i}(X)\) – решения уравнений \(G\left(X, T_{i}(X)\right)=u_{p_{i}}, i \in \{ 1,2\}\). Тогда
\[
\mathbb {P}_{\theta }\left(T_{1}(X)<\theta <T_{2}(X)\right) = \mathbb {P}_{\theta }\left(u_{p_{1}}<G(X, \theta ) < u_{p_{2}}\right) =p_{2}-p_{1}=\gamma ,
\]
т.е. \(\left(T_{1}(X), T_{2}(X)\right)\) – доверительный интервал уровня доверия \(\gamma\).
В общем случае для заданного уровня доверия \(\gamma \in (0,1)\) при построении доверительного интервала можно брать квантили уровней \(p_1 = \frac{1}{2}-(1-\alpha ) \gamma\), \(p_2 = \frac{1}{2} + \alpha \gamma\), где \(\alpha \in \left(1 - \frac{1}{2\gamma }, \frac{1}{2\gamma }\right)\) – произвольное (последнее условие наложено, чтобы \(0 < \frac{1}{2}-(1-\alpha ) \gamma , \frac{1}{2}+\alpha \gamma < 1\)). Например, для \(\gamma = 95\%\) можно взять квантили \((u_{1\% }, u_{96\% }), (u_{4.5\% }, u_{99.5\% })\), и т.д. Однако для минимизации длины доверительного интервала уровни \(p_{1}\) и \(p_{2}\) в методе центральной статистики выбираются часто симметричными относительно \(0.5\), так как у распределения \(G(X, \theta )\) могут быть тяжелые хвосты. Для \(\gamma = 95\%\) это будут \(u_{2.5\% }, u_{97.5\% }\).
Пусть \(X_{1}, \ldots , X_{n}\)- выборка из распределения с плотностью \[
p_{\theta }(x)=e^{-(x-\theta )} \; \mathbb {1}_{x \geq \theta }
\] (экспоненциальное распределение со сдвигом \(\theta\)). Построить доверительный интервал уровня доверия \(\gamma\) методом.
1-й способ. Заметим, что \(X_{i}-\theta \sim \operatorname {Exp}(1) = \Gamma (1,1)\) (распределение не зависит от \(\theta\)). Далее
\[
\sum _{i=1}^n \left(X_{i}-\theta \right) = n\overline{X} - n\theta \sim \Gamma (n, 1), \qquad \overline{X} - \theta \sim \Gamma (n, n)
\] Возьмем в качестве центральной статистики \(G(X, \theta )=\sum X_{i}-n \theta\). Эта статистика имеет распределение \(\Gamma (n, 1)\), так как сумма независимых, одинаково распределенных экспоненциальных случайных величин имеет гамма-распределение. Рассмотрим \(\frac{1-\gamma }{2}-\) и \(\frac{1+\gamma }{2}\)-квантили \(u_{\frac{1-\gamma }{2}}\) и \(u_{\frac{1+\gamma }{2}}\) распределения \(\Gamma (n, 1)\). Имеем
\[
\begin{align} \gamma & = \frac{1+\gamma }{2}-\frac{1-\gamma }{2}=\mathbb {P}_{\theta }\left(u_{\frac{1-\gamma }{2}}<\sum X_{i}-n \theta <u_{\frac{1+\gamma }{2}}\right)= \\ & =\mathbb {P}_{\theta }\left(\overline{X}-\frac{u_{\frac{1+\gamma }{2}}}{n}<\theta <\overline{X}-\frac{u_{\frac{1-\gamma }{2}}}{n}\right) . \end{align}
\]
2-й способ. При помощи статистики \(X_{(1)}\). Заметим, что при \(x \geq \theta\):
\[
\begin{align} \mathbb {P}\left(X_{1} > x\right) & = \int _x^{+\infty } e^{-(x-\theta )} dx = e^{-(x-\theta )} \\ \mathbb {P}\left(X_{(1)} > x\right) & = e^{-n(x-\theta )} \\ X_{(1)} - \theta & \sim \operatorname {Exp}(n) = \Gamma (1, n) \end{align}
\]
3-й способ. Через неравенство Чебышева
\[
\begin{align} \mathbb {E}\left[X_1\right] = 1 + \theta , \quad \operatorname {Var}\left[X_1\right] = 1 \\ \mathbb {P}_{\theta }\left(\left|\overline{X} - (1 + \theta )\right| \geq \varepsilon \right) < \frac{1}{\varepsilon ^2 n} \\ \mathbb {P}_{\theta }\left(\overline{X} - 1 - \varepsilon \leq \theta \leq \overline{X} - 1 + \varepsilon \right) \geq 1 - \frac{1}{\varepsilon ^2 n} = \gamma , \quad \varepsilon = \frac{1}{\sqrt{n(1-\gamma )}}\\ \end{align}
\]
Пусть \(X_1, \dots , X_n\) – выборка из \(U[0, \theta ], \; \theta > 0\). Постройте доверительный интервал для \(\theta\) уровня доверия \(\gamma\), используя статистику
\(\overline{X}\);
\(X_{(1)}\);
\(X_{(n)}\). *Примечание.** Каждый пункт оценивается в 0.5 балла.
\(X_1, \ldots , X_n\) – выборка из распределения с плотностью \[
p_{\theta }(x) = \frac{3}{8\theta ^3}x^2 \; \mathbb {1}_{x \in [0, 2\theta ]}
\] С помощью статистики \(X_{(1)}\) постройте точный доверительный интервал уровня доверия \(\gamma\) для параметра \(\theta\).
Пусть \(X_1, \ldots , X_n\) – выборка из распределения, имеющего плотность \[
p_{\theta }(x) = \frac{1}{2}\exp \left(-\left|\left|x\right| - 6\theta \right|\right) \cdot \; \mathbb {1}_{\left|x\right| > 6\theta }
\] Постройте доверительный интервал для \(\theta > 0\) уровня доверия \(\gamma = 1 — \alpha\).
\(X_1, \dots , X_n\) – выборка из распределения \(\xi + \eta\), где \(\xi , \eta\) независимы и имеют распределение \(\sim U[0, \theta ]\), \(\theta \in \Theta = (0,1)\). Построить доверительный интервал для \(\theta\) уровня доверия \(1 - \alpha\) с помощью неравенства Чебышева.
Асимптотические доверительные интервалы
Доверительные интервалы малого размера построить удается далеко не всегда. В случае выборки большого размера от ограниченния размера выборки можно отойти и рассматривать асимптотическую задачу. При такой постановке доверительный интервал малого размера найти, как правило, проще.
Итак, пусть \(X_{1}, \ldots , X_{n}\)- выборка из \(\mathbb {P} \in \mathcal{P}=\left\{ \mathbb {P}_{\theta }, \theta \in \Theta \right\}\).
Определение 2 Последовательность интервалов
\[
\left(T_1^{(n)}, \; T_2^{(n)}\right) = \left(T_1^{(n)}(X_1, \ldots , X_n), \; T_2^{(n)}(X_1, \ldots , X_n)\right)
\] называется асимптотическим доверительным интервалом уровня доверия \(\gamma\) для \(\theta\), если для любого \(\theta \in \Theta\) выполнено
\[
\varliminf _{n \to \infty } \mathbb {P}\left(\theta \in \left(T_1^{(n)}, T_2^{(n)}\right)\right) = \varliminf _{n \to \infty } \mathbb {P}\left(T_1^{(n)}(X_1, \ldots , X_n) < \theta < T_2^{(n)}(X_1, \ldots , X_n)\right) \geq \gamma ,
\] Т.е. все предельные точки (их в общем случае может быть больше одной) последовательности \(\mathbb {P}\left(\theta \in \left(T_1^{(n)}, T_2^{(n)}\right)\right)\) лежат в отрезке \([\gamma , 1]\) для любого \(\theta \in \Theta\).
Асимптотический доверительный интервал называется точным, если для любого \(\theta \in \Theta\) выполнено
\[
\varliminf _{n \to \infty } \mathbb {P}\left(T_1^{(n)}(X_1, \ldots , X_n) < \theta < T_2^{(n)}(X_1, \ldots , X_n)\right) = \gamma
\]
Как построить асиптотический доверительный интервал? Пусть \(\widehat{\theta }_{n}\left(X_{1}, \ldots , X_{n}\right)\) – асимптотически нормальная оценка \(\theta\) с асимптотической дисперсией \(\sigma^{2}(\theta )\), т.е.
\[
\sqrt{n} \frac{\widehat{\theta }_{n}-\theta }{\sigma (\theta )} \xrightarrow [n \to \infty ]{d_\theta } \mathscr {N}\left(0, 1\right).
\]
Рассмотрим квантили \(z_{\frac{1-\gamma }{2}}\) и \(z_{\frac{1+\gamma }{2}}\) из распределения \(\mathscr {N}\left(0, 1\right)\) уровней \(\frac{1-\gamma }{2} = \frac{1}{2} - \frac{1}{2}\gamma\) и \(\frac{1+\gamma }{2} = \frac{1}{2} + \frac{1}{2}\gamma\) соответственно. Тогда имеем
\[
\lim _{n \to \infty } \mathbb {P}\left(z_{\frac{1-\gamma }{2}}<\sqrt{n} \frac{\widehat{\theta }_{n}-\theta }{\sigma (\theta )}<z_{\frac{1+\gamma }{2}}\right) = \mathbb {P}\left(z_{\frac{1-\gamma }{2}} < \mathscr {N}\left(0, 1\right) < z_{\frac{1+\gamma }{2}}\right) = \frac{1+\gamma }{2} - \frac{1-\gamma }{2} = \gamma
\]
Если нам повезло с функцией \(\sigma (\theta )\), то из последнего равенства можно извлечь точный асимптотический доверительный интервал. Если же нам повезло меньше – получить доверительный интервал не удается, но если функция \(\sigma (\theta )\) является непрерывной, то, по теореме о наследовании сходимости по вероятности,
\[
\frac{\sigma (\theta )}{\sigma \left(\widehat{\theta }_{n}\right)} \xrightarrow [n \to \infty ]{\mathbb {P}_\theta } 1.
\]
Тогда из леммы Слуцкого,
\[
\sqrt{n} \frac{\widehat{\theta }_{n}-\theta }{\sigma \left(\widehat{\theta }_n\right)} \xrightarrow [n \to \infty ]{d_\theta } \mathscr {N}\left(0, 1\right).
\]
откуда уже несложно получить точный асимптотический доверительный интервал для \(\theta\).
Пусть \(X_{1}, \ldots , X_{n}\) – выборка из \(\operatorname {Bern}(\theta )\). Постройте асимптотический доверительный интервал уровня доверия \(\gamma\) для параметра \(\theta\).
По центральной предельной теореме,
\[
\sqrt{n}\frac{\overline{X} - \theta }{\sqrt{\theta (1-\theta )}} \xrightarrow [n \to \infty ]{d_\theta } \mathscr {N}\left(0, 1\right)
\]
Заметим, что \(\overline{X}\) – состоятельная оценка \(\theta\), т.е. \(\overline{X} \xrightarrow [n \to \infty ]{\mathbb {P}_\theta } \theta , \; \forall \theta \in (0,1)\). Так как функция \(\sqrt{\theta (1-\theta )}\) непрерывна по \(\theta\) на \((0,1)\), то \(\sqrt{\overline{X}(1 - \overline{X})} \xrightarrow [n\to \infty ]{\mathbb {P}_\theta } \sqrt{\theta (1 - \theta )}, \; \forall \theta \in (0,1)\). Иначе
\[
\frac{ \sqrt{\theta (1 - \theta )} }{\sqrt{\overline{X}(1 - \overline{X})}} \xrightarrow [n\to \infty ]{\mathbb {P}_\theta } 1 \quad \forall \theta \in (0,1).
\]
Следовательно,
\[
\xi \left(X,\theta \right) := \sqrt{n}\frac{\overline{X} - \theta }{\sqrt{\theta (1-\theta )}} \cdot \frac{ \sqrt{\theta (1 - \theta )} }{\sqrt{\overline{X}(1 - \overline{X})}} = \sqrt{n}\frac{\overline{X} - \theta }{\sqrt{\overline{X}\left(1-\overline{X}\right)}} \xrightarrow [n \to \infty ]{d_\theta } \mathscr {N}\left(0, 1\right)
\]
Рассмотрим \(\frac{1-\gamma }{2}\)- и \(\frac{1+\gamma }{2}\)-квантили \(u_{\frac{1-\gamma }{2}}\) и \(u_{\frac{1+\gamma }{2}}\) распределения \(\mathcal{N}(0,1)\). Тогда
\[
\mathbb {P}\left(u_{\frac{1-\gamma }{2}} < \xi < u_{\frac{1+\gamma }{2}}\right) \xrightarrow [n \to \infty ]{} \gamma .
\] Далее,
\[
\begin{align} u_{\frac{1-\gamma }{2}} < \sqrt{n}\frac{\overline{X} - \theta }{\sqrt{\overline{X}\left(1-\overline{X}\right)}} < u_{\frac{1+\gamma }{2}} \iff \overline{X}-\sqrt{\frac{\overline{X}\left(1-\overline{X}\right)}{n}} u_{\frac{1+\gamma }{2}} < \theta < \overline{X}-\sqrt{\frac{\overline{X}\left(1-\overline{X}\right)}{n}} u_{\frac{1-\gamma }{2}} \end{align}
\] (обратите внимание, что больший квантиль оказался слева неравенства, а меньший справа). Положим
\[
T_1^{(n)} := \overline{X}-\sqrt{\frac{\overline{X}\left(1-\overline{X}\right)}{n}} u_{\frac{1+\gamma }{2}}, \qquad T_2^{(n)} := \overline{X}-\sqrt{\frac{\overline{X}\left(1-\overline{X}\right)}{n}} u_{\frac{1-\gamma }{2}}
\] Тогда имеем \(\mathbb {P}\left( T_{1}^{(n)}<\theta <T_{2}^{(n)}\right) \xrightarrow [n \to \infty ]{} \gamma\). Следовательно, \(\left(T_{1}^{(n)}, T_{2}^{(n)}\right)\) – асимптотический доверительный интервал уровня доверия \(\gamma\).
\(\left(T^{(n)}_1, T^{(n)}_2\right)\), где \[
T_1^{(n)} := \overline{X}-\sqrt{\frac{\overline{X}\left(1-\overline{X}\right)}{n}} u_{\frac{1+\gamma }{2}}, \qquad T_2^{(n)} := \overline{X}-\sqrt{\frac{\overline{X}\left(1-\overline{X}\right)}{n}} u_{\frac{1-\gamma }{2}}
\]
Пусть \(X_1, \dots , X_n\) – выборка из распределения Коши со сдвигом, т.е. \[
\begin{align} p_{\theta }(x) = \frac{1}{\pi (1+ (x - \theta )^2 )} \end{align}
\] Построить асимптотический доверительный интервал для \(\theta\) уровня доверия \(\alpha\).
Пусть \(X_1, \dots , X_n\) – выборка из \(\mathrm{Pois}(\theta )\). Построить ас. доверит. интервал для \(\theta\) уровня доверия \(\alpha\).
Пусть \(X_1, \dots , X_n\) – выборка из \(\Gamma (\theta , \lambda ), \; \theta , \lambda > 0\). построить ас. доверит. интервал для \(\lambda\) уровня доверия \(\alpha\), если
\(\theta\) известно (1 балл);
\(\theta\) неизвестно (2 балла).
Напомним, что если \(X_1 \sim \Gamma (\theta , \lambda )\), то \[
\begin{align} p_{X_1}(x) & = \frac{\lambda ^\theta }{\Gamma (\theta )} x^{\theta - 1}e^{-\lambda x} \; \mathbb {1}_{ x \geq 0}, \\ \mathbb {E}\left[X_1\right] & = \frac{\theta }{\lambda }, \quad \operatorname {Var}\left[X_1\right] = \frac{\theta }{\lambda ^2}, \quad \mathbb {E}\left[X_1^k\right] = \frac{1}{\lambda ^k}\theta (\theta + 1)(\theta +2)\cdot \dots \cdot (\theta + k - 1), \; k \in \mathbb {N} \end{align}
\]