Этот конспект ещё находится в процессе редактуры: в тексте могут встречаться опечатки, неточности и локально не проработанные места. Если что-то нашли — сообщите, пожалуйста, автору (контакты на странице курса).
1 Проверка простой гипотезы вида \(\overrightarrow {\theta } = \overrightarrow {\theta }_0\)
Например, \(\overrightarrow {\theta }_0 = \overrightarrow {0}\): в этом случае проверяется \(\overrightarrow {X} = \overrightarrow {\varepsilon }\) против \(\overrightarrow {X} = \mathbf{z}\overrightarrow {\theta } + \overrightarrow {\varepsilon }\), где \(\overrightarrow {\theta } \neq \overrightarrow {0}\). В сущности проверяется гипотеза о том, что данные регрессоры \(\mathbf{z}\) действительно влияют на значения зависимой переменной \(\overrightarrow {X}\). Базовая гипотеза в данном случае состоит в том, что \(\overrightarrow {X}\) – просто шум, не зависящий никак от регрессоров.
Геометрия проверки простой гипотезы \(\mathbf z\overrightarrow{\theta}=\overrightarrow{\theta}_0\) (вариант на Three.js): наблюдение \(X\), его проекция \(\widehat X=X_L=\mathbf z\widehat{\overrightarrow\theta}\) на подпространство \(L\), гипотетическая точка \(F=\mathbf z\overrightarrow{\theta}_0\) и вектор расхождения \(\overrightarrow{FB}=X_L-\mathbf z\overrightarrow{\theta}_0\). Прямой угол в вершине \(B\) треугольника \(OFB{\to}A\) иллюстрирует, что \(X-X_L\perp L\), а \(F\)-статистика при верной \(H_0\) сравнивает длину короткого расхождения \(\overrightarrow{FB}\) (лежит в \(L\)) с длиной ошибки \(\overrightarrow{BA}=\widehat{\overrightarrow\varepsilon}\) (перпендикулярна \(L\)) — по теореме Кокрена эти векторы независимы. Подписи — настоящий отрендеренный LaTeX (KaTeX), закреплённый на своей линии/векторе и повёрнутый вдоль него; при вращении сцены мышью они остаются на месте. Колесо мыши — приближение.
Как проверить \(H_0\) против \(H_1\)? Присмотримся к рис. @LinearRegrHypTest:GraphSimpelHyp: если базовая гипотеза верна, т.е. неизвестный истинный параметр \(\overrightarrow {\theta }\) равен \(\overrightarrow {\theta }_0\), то его оценка \(\widehat{\overrightarrow {\theta }}\) не должна сильно отличаться от \(\overrightarrow {\theta }_0\), поскольку
Удобно сравнивать \(\mathbf{z}\widehat{\overrightarrow {\theta }} - \mathbf{z}\overrightarrow {\theta }_0\) именно с последним вектором, с вектором \(\overrightarrow {X} -\widehat{\overrightarrow {X}} = \overrightarrow {X}_{L^\perp }\), поскольку в силу теор. Кокрена об ортогональном разложении гауссовского вектора эти векторы независимы. В силу той же теоремы найдем (в предположении верной \(H_0\)) и распределения квадратов длин этих векторов. Для вектора \(\overrightarrow {FB}\) заметим, что при верной \(H_0\)
Определение 1 Пусть \(\xi_{1}, \xi_{2}\) – независимые случайные величины, распределенные по законам \(\chi_{n_{1}}^{2}, \chi_{n_{2}}^{2}\) соответственно. Тогда случайная величина \[
\frac{\xi _{1} / n_{1}}{\xi _{2} / n_{2}}
\] имеет распределение Фишера со степенями свободы \(n_{1}, n_{2}\) (обозначается \(\operatorname {F}_{n_1, n_2}\)).
Плотность распределения Фишера \(\operatorname{F}_{d_1,d_2}\) — распределение отношения \(\frac{\xi_1/d_1}{\xi_2/d_2}\) независимых \(\chi^2_{d_1}, \chi^2_{d_2}\)-величин (см. опр. F-статистики выше). Двигайте ползунки \(d_1, d_2\) — плотность перестраивается непрерывно; кнопки задают четыре характерных примера. Если \(H_0\) верна, числитель и знаменатель \(F\)-статистики оценивают одну и ту же дисперсию \(\sigma^2\), и при росте \(d_1, d_2\) их отношение концентрируется около \(1\) (пунктирная вертикаль).
Согласно опр. Определение 1, она распределена по закону распределения Фишера с \(\tilde{k}, n - \tilde{k}\) степенями свободы: \(F \sim \operatorname {F}_{\tilde{k}, n - \tilde{k}}\).
Критерий УЗ \(\alpha\) проверки \(H_0\) против \(H_1\): если \(F\)-статистика слишком большая, больше квантиля уровня \(1-\alpha\) из распределения \(\operatorname {F}_{\tilde{k}, n - \tilde{k}}\), то \(H_0\) отвергаем. Т.е.
При верной \(H_0\) статистика \(F\) распределена по закону \(\operatorname {F}_{1,7}\). Нужные квантили: \(Q_{\operatorname {F}_{1,7}}(0.95) \approx 5.59\), \(Q_{\operatorname {F}_{1,7}}(0.99) \approx 12.25\). Поскольку \(5.59 < 9.25 < 12.25\), на УЗ \(5\%\) гипотезу \(H_0\) отвергаем, а на УЗ \(1\%\) отвергнуть не можем; \(p\)-значение равно
Итого умеренно строгий скептик решит, что автомат недоливает.
Заметим, что при \(\tilde{k} = 1\) построенный критерий – это в точности возведенный в квадрат двусторонний критерий Стьюдента для среднего нормальной выборки:
\[
F = T^2, \qquad T = \frac{\left(\overline{\overrightarrow {X}} - \theta _0\right)\sqrt{n}}{\sqrt{\operatorname {RSS}/(n-1)}} \approx -3.04 \sim T_{n-1} \text{ при верной } H_0,
\]
и \(\left|T\right| \approx 3.04 > Q_{T_7}(0.975) \approx 2.36\) – тот же вывод.
AnswerОтвет
На УЗ \(5\%\) гипотезу отвергаем, на УЗ \(1\%\) – отвергнуть нельзя (\(p\)-значение \(\approx 1.9\%\)).
ExampleПример 2
Служба такси заявляет тариф: \(100\) руб. за посадку плюс \(30\) руб. за каждый километр пути. Пассажиру кажется, что выходит дороже, и он записал стоимости семи поездок:
Расстояние\(d_i\), км
2
4
5
7
9
12
15
Стоимость\(P_i\), руб.
160
219
269
355
422
501
564
Считая, что стоимость поездки описывается моделью \(P_i = a + b \cdot d_i + \varepsilon_i\), где \(d_i\) – расстояние, а ошибки \(\varepsilon_i \sim \mathscr {N}\left(0, \sigma^2\right)\) независимы (\(\sigma^2\) неизвестна; шум возникает из-за платного ожидания, пробок и округлений), проверьте гипотезу о заявленном тарифе \[
H_0: \; \begin{pmatrix} a \\ b \end{pmatrix} = \begin{pmatrix} 100 \\ 30 \end{pmatrix}
\] на уровне значимости \(5\%\).
SolutionРешение
Это линейная гауссовская модель \(\overrightarrow {P} = \mathbf{z}\overrightarrow {\theta } + \overrightarrow {\varepsilon }\) со свободным параметром и одним регрессором: \[
\overrightarrow {\theta } = \begin{pmatrix} a \\ b\end{pmatrix}, \qquad \mathbf{z} = \begin{pmatrix} 1 & 1 & \ldots & 1 \\ d_1 & d_2 & \ldots & d_7 \end{pmatrix}^T, \qquad n = 7, \quad \tilde{k} = k + 1 = 2,
\] и проверяется простая гипотеза \(\overrightarrow {\theta } = \overrightarrow {\theta }_0 = (100, 30)^T\) о векторе параметров целиком. Имеем \[
\begin{align} \mathbf{z}^T\mathbf{z} & = \begin{pmatrix} n & \sum _i d_i \\ \sum _i d_i & \sum _i d_i^2\end{pmatrix} = \begin{pmatrix} 7 & 54 \\ 54 & 544 \end{pmatrix}, \qquad \mathbf{z}^T\overrightarrow {P} = \begin{pmatrix} \sum _i P_i \\ \sum _i d_iP_i \end{pmatrix} = \begin{pmatrix} 2490 \\ 23296 \end{pmatrix} \\ \widehat{\overrightarrow {\theta }} & = \left(\mathbf{z}^T\mathbf{z}\right)^{-1}\mathbf{z}^T\overrightarrow {P} = \frac{1}{892}\begin{pmatrix} 544 & -54 \\ -54 & 7 \end{pmatrix}\begin{pmatrix} 2490 \\ 23296 \end{pmatrix} \\ & = \frac{1}{892}\begin{pmatrix} 544 \cdot 2490 - 54 \cdot 23296 \\ -54 \cdot 2490 + 7 \cdot 23296\end{pmatrix} = \frac{1}{892}\begin{pmatrix} 96576 \\ 28612\end{pmatrix} \approx \begin{pmatrix} 108.27 \\ 32.08 \end{pmatrix} \end{align}
\] Посадка оценивается в \(108\) руб. вместо заявленных \(100\), километр – в \(32.1\) руб. вместо \(30\): похоже, пассажира действительно возят по завышенному тарифу. Проверим, значимо ли отклонение. \[
\begin{align} \operatorname {RSS} & = \left\| \overrightarrow {P} - \mathbf{z}\widehat{\overrightarrow {\theta }}\right\| ^2 \approx 2290.1 \\ \left|\overrightarrow {FB}\right|^2 & = \left(\widehat{\overrightarrow {\theta }} - \overrightarrow {\theta }_0\right)^T \mathbf{z}^T\mathbf{z} \left(\widehat{\overrightarrow {\theta }} - \overrightarrow {\theta }_0\right) \approx 4677.9 \\ F & = \frac{\left|\overrightarrow {FB}\right|^2 / \tilde{k}}{\operatorname {RSS}/(n - \tilde{k})} = \frac{4677.9/2}{2290.1/5} \approx 5.11 \end{align}
\] При верной \(H_0\) имеем \(F \sim \operatorname {F}_{2,5}\), при этом \(Q_{\operatorname {F}_{2,5}}(0.95) \approx 5.79 > 5.11\): на УЗ \(5\%\) гипотезу о заявленном тарифе отвергнуть нельзя; \(p\)-значение равно \[
\mathbb {P}\left( F > 5.11 \mid H_0 \right) \approx 6.2\% .
\] Семь поездок при шуме \(\widehat{\sigma } = \sqrt{\operatorname {RSS}/(n - \tilde{k})} \approx 21\) руб. – слишком мало данных, чтобы уверенно отличить \((108.27, 32.08)\) от \((100, 30)\). Заметим при этом, что \(Q_{\operatorname {F}_{2,5}}(0.9) \approx 3.78 < 5.11\), т.е. на УЗ \(10\%\) гипотеза уже была бы отвергнута. Неотвержение \(H_0\) здесь – не доказательство честности тарифа, а констатация нехватки данных: пассажиру стоит записать побольше поездок.
AnswerОтвет
\(F \approx 5.11 < Q_{\operatorname {F}_{2,5}}(0.95) \approx 5.79\): на УЗ \(5\%\) отвергнуть гипотезу нельзя (\(p\)-значение \(\approx 6.2\%\)).
ProblemЗадача 1
Пусть в модели нет свободного параметра, пусть проверяется гипотеза \(\theta_1 = \ldots = \theta_k = 0\). Выразите \(F\)-статистику для такой гипотезы и коэфф. детерминации \(R^2\) модели друг через друга.
2 Общий случай: проверка сложной гипотезы вида \(\mathbf{w}^T\overrightarrow {\theta } = \overrightarrow {\tau }_0\)
В условиях предыдущего параграфа рассмотрим сложную параметрическую базовую гипотезу против сложной параметрической альтернативы:
где \(\mathbf{w} \in \mathbb {R}^{\tilde{k} \times m}\) – некоторая фиксированная матрица размерности \(\tilde{k} \times m, \; m \leq \tilde{k}\) полного ранга: \(\operatorname {rk}(\mathbf{w}) = m\). \(\overrightarrow {\tau }_0 \in \mathbb {R}^{m}\) – некоторый фиксированный вектор.
ExampleПример 3
Выпущена новая партия монет. Перед их использованием было решено провести исследование с целью проверки того, что монеты одинаковы. На весах с ошибкой измерений, распределенной по закону \(\mathcal{N}\left(0, \sigma^{2}\right)\), были взвешены две монеты, причем первая была взвешена \(n_1\) раз, а вторая \(n_2\) раз. Все измерения были произведены независимо. Сформулируйте гипотезу о том, что массы монет одинаковы.
SolutionРешение
Пусть \(Y^{(1)}_{1}, \ldots , Y^{(1)}_{n_1}\) и \(Y^{(2)}_{1}, \ldots , Y^{(2)}_{n_2}\) – независимые выборки из распределений \(\mathcal{N}\left(a_{1}, \sigma^{2}\right)\) и \(\mathcal{N}\left(a_{2}, \sigma^{2}\right)\) соответственно. Рассматривается гипотеза \(H_{0}: a_{1}=a_{2}\).
Рассмотрим линейную модель \(\overrightarrow {X}= \mathbf{z} \overrightarrow {\theta } + \overrightarrow {\varepsilon }\), где
Стоит оговориться, что гипотеза \(H_0\) из LinearRegrHypTest:ComposHyp будет сложной только если в матрице \(\mathbf{w}^T\) строк меньше, чем столбцов, т.е. \(m < \tilde{k}\). Заметим, что простая гипотеза \(\overrightarrow {\theta } = \overrightarrow {\theta }_0\) из предыдущего параграфа – частный случай LinearRegrHypTest:ComposHyp: нужно просто взять \(\mathbf{w} = \mathbf{I}_{\tilde{k}}, \; \overrightarrow {\tau }_0 = \overrightarrow {\theta }_0\).
Геометрия проверки сложной гипотезы \(\mathbf w^T\overrightarrow{\theta}=\overrightarrow{\tau_0}\) (вариант на Three.js): подпространство \(L_1\) (условие \(\mathbf w^T\overrightarrow{\theta}=0\)) и его ортогональное дополнение \(L_2\) в \(L\), аффинные подпространства \(\mathcal L_1=L_1+\overrightarrow{l_2}\) и его оценка \(\widehat{\mathcal L}_1=L_1+X_{L_2}\), точки \(B=X_L=\mathbf z\widehat{\overrightarrow{\theta}}\) и \(F=X_{\mathcal L_1}\) (условная МНК-оценка). Прямые углы в вершинах \(B\) и \(F\) треугольника \(AFB\) иллюстрируют теорему Пифагора. Подписи — настоящий отрендеренный LaTeX (KaTeX), закреплённый на своей линии/векторе и повёрнутый вдоль него; при вращении сцены мышью они остаются на месте и корректно перестраивают угол. Колесо мыши — приближение, ползунок \(\tau_0\) ниже — двигает гипотезу.
Как проверить \(H_0\) против \(H_1\)? Присмотримся к рис. @LinearRegrHypTest:GraphCompositeHyp. Заметим, что условие \(\mathbf{w}^T \overrightarrow {\theta } = \overrightarrow {0}\) на вектор \(\mathbf{z}\overrightarrow {\theta } \in \mathbb {R}^{n}\) задает некоторое линейное подподпространство \(L_1\) в подпространстве
Поскольку ранг матрицы \(\mathbf{w}^T\) равен \(m\), т.е. количеству ее строк, то условие \(\mathbf{w}^T \overrightarrow {\theta } = \overrightarrow {0}\) задает \(m\) линейных ограничений на \(\tilde{k}\)-мерный вектор \(\overrightarrow {\theta }\). Следовательно,
\[
\dim (L_1) = \dim (L) - m = \tilde{k}-m.
\]
Обозначим \(L_2\) ортогональное дополнение к \(L_1\) в подпространстве \(L\). Имеем \(\dim (L_2) = \dim (L) - \dim (L_1) = m\).
Условие \(\mathbf{w}^T \overrightarrow {\theta } = \overrightarrow {\tau }_0\) на вектор \(\mathbf{z}\overrightarrow {\theta } \in \mathbb {R}^{n}\) задает, очевидно, некоторое аффинное подпространство \(\mathcal{L}_1\) с линейной частью \(L_1\). Пусть \(\overrightarrow {l}_2 := L_2 \cap \mathcal{L}_1\). Заметим, что \(\mathcal{L}_1 = L_1 + \overrightarrow {l}_2\).
Заметим, что \(\overrightarrow {X}_{\mathcal{L}_1} = \overrightarrow {X}_{L_1} + \overrightarrow {l}_2\)
Если \(H_0\) верна, то оценка \(\widehat{\overrightarrow {\tau }}\) должна быть близка к \(\overrightarrow {\tau }_0\), а \(\widehat{\mathcal{L}}_1\) должно быть близко к \(\mathcal{L}_1\). Расстояние между ними
как и в предыдущем параграфе, удобно сравнивать с \(\left|\overrightarrow {BA}\right| = \left\| \overrightarrow {X} - \overrightarrow {X_L}\right\| = \sqrt{\operatorname {RSS}}\), поскольку по теор. об ортогональном разложении гауссовского вектора векторы
Как находить \(\left|\overrightarrow {BA}\right|^2 = \left\| \overrightarrow {X} - \overrightarrow {X_L}\right\|^2 = \operatorname {RSS}\) и как распределено \(\operatorname {RSS}\) мы с вами уже знаем:
1. Случай ортонормальных столбцов в \(\mathbf{z}\) и в \(\mathbf{w}\). Рассмотрим сначала случай, когда в матрице \(\mathbf{z} \in \mathbb {R}^{n \times \tilde{k}}\) и в матрице \(\mathbf{w} \in \mathbb {R}^{\tilde{k} \times m}\) столбцы образуют ортонормальные системы в \(\mathbb {R}^{n}\) и \(\mathbb {R}^{\tilde{k}}\) соотв. Такие матрицы называют полуортогональными. В нашем случае имеем \(\mathbf{z}^T\mathbf{z} = \mathbf{I}_{\tilde{k}}, \; \mathbf{w}^T\mathbf{w} = \mathbf{I}_m\). Напоминаем, что \(n \geq \tilde{k} \geq m\).
Если \(\overrightarrow {\theta }\) – координаты произвольного вектора из \(L\) в базисе из столбцов \(\mathbf{z}\), то пусть \(\tilde{\overrightarrow {\theta }}\) – координаты того же вектора в базисе из столбцов \(\tilde{\mathbf{z}}\). Имеем
Несложно показать, что матрица \(\mathbf{w}' := \Lambda^{-1}_{\mathbf{z}} \mathbf{v}_{\mathbf{z}}^T \mathbf{w} \in \mathbb {R}^{\tilde{k} \times m}\) имеет тот же ранг, что и \(\mathbf{w}\), т.е. \(m\). Пусть
Вернемся от \(\tilde{\overrightarrow {\tau }}\) к исходному \(\overrightarrow {\tau }\): соответствие \(\tilde{\overrightarrow {\tau }} = \Lambda_{\mathbf{w}'}^{-1}\mathbf{v}^T_{\mathbf{w}'} \cdot \overrightarrow {\tau }\) линейно, поэтому связывает не только гипотетические значения \(\tilde{\overrightarrow {\tau }}_0\) и \(\overrightarrow {\tau }_0\), но и оценки \(\widehat{\tilde{\overrightarrow {\tau }}}\) и \(\widehat{\overrightarrow {\tau }}\). Следовательно,
Осталось узнать в матрице \(\mathbf{v}_{\mathbf{w}'}\Lambda_{\mathbf{w}'}^{-2}\mathbf{v}^T_{\mathbf{w}'}\) матрицу \(\mathbf{b}^{-1}\) из формулировки теоремы. Действительно,
(последнее равенство – по определению \(\mathbf{w}' = \Lambda^{-1}_{\mathbf{z}} \mathbf{v}_{\mathbf{z}}^T \mathbf{w}\), а перед ним мы просто разбили \(\Lambda_{\mathbf{z}}^{-2} = \Lambda^{-1}_{\mathbf{z}}\Lambda^{-1}_{\mathbf{z}}\) и собрали множители в транспонированную пару). Подставим сингулярное разложение \(\mathbf{w}' = \mathbf{u}_{\mathbf{w}'}\Lambda_{\mathbf{w}'}\mathbf{v}_{\mathbf{w}'}^T\) и воспользуемся полуортогональностью \(\mathbf{u}_{\mathbf{w}'}^T\mathbf{u}_{\mathbf{w}'} = \mathbf{I}_m\):
Если \(H_0\) верна, то согласно доказанному выше и опр. Определение 1, эта статистика распределена по закону распределения Фишера с \(m, n - \tilde{k}\) степенями свободы: \(F \sim \operatorname {F}_{m, n - \tilde{k}}\).
Критерий УЗ \(\alpha\) проверки \(H_0\) против \(H_1\): если \(F\)-статистика слишком большая, больше квантиля уровня \(1-\alpha\) из распределения \(\operatorname {F}_{m, n - \tilde{k}}\), то \(H_0\) отвергаем. Т.е.
Пусть в модели есть свободный параметр \(\theta_0\), пусть снова проверяется гипотеза \(\theta_1 = \ldots = \theta_k = 0\). Выразите \(F\)-статистику для такой гипотезы и коэфф. детерминации \(R^2\) данной модели друг через друга.
ExampleПример 5
В условиях примера Пример 3 постройте \(F\)-критерий УЗ \(\alpha\) для проверки гипотезы о том, что массы монет одинаковы.
Пусть \[
X_{i}=\theta _0+i \theta _1+\varepsilon _{0}+\ldots +\varepsilon _{i},
\]\(i=0,1, \ldots , n\), где \(\theta_0, \theta_1\) – неизвестные параметры, a случайные величины \(\varepsilon_{0}, \ldots , \varepsilon_{n}\) распределены независимо по закону \(\mathscr {N}\left(0, \sigma^2\right)\). Сведите задачу к линейной гауссовской модели и постройте \(F\)-критерий уровня значимости \(\alpha\) для проверки гипотезы \(H_{0}: \theta_0=\theta_1\).
В некоторых задачах подсчет статистики \(F\) затруднителен из-за того, что приходится вычислять обратную матрицу \(\mathbf{b}^{-1}\). В этих случаях удобно воспользоваться теоремой Пифагора в треугольнике \(AFB\) (см. рис. @LinearRegrHypTest:GraphCompositeHyp). Имеем
называют условной оценкой наименьших квадратов. Зачастую удобнее оказывается вычислить условную оценку наименьших квадратов, а затем выразить \(\left|\overrightarrow {FB}\right|^2\) как
Про измеряемую величину \(x\) известна зависимость от температуры \(t\): \[
x(t)=\theta _{1}+\theta _{2} t+\theta _{3} t^{2}.
\]
Произведена серия независимых экспериментов \(\omega_0\) при значениях температуры, равных \[
t_{1}=-1, \quad t_{2}=0, \quad t_{3}=1, \quad t_{4}=2, \quad t_{5}=3
\] Получены соответствующие результаты: \[
X_{1}(\omega _0)=1, \quad X_{2}(\omega _0)=6, \quad X_{3}(\omega _0)=10, \quad X_{4}(\omega _0)=14, \quad X_{5}(\omega _0)=19
\] Предполагается, что ошибки измерений независимы и распределены по закону \(\mathscr {N}\left(0, 1\right)\). Кроме того, найдена оптимальная оценка \(\widehat{\sigma^{2}}=0.4\) дисперсии ошибки \(\sigma^{2}\). С помощью \(F\)-критерия проверьте гипотезу \(H_{0}\) о том, что \(\theta_{1}=\theta_{2}\) и \(\theta_{3}=0\), на уровне значимости \(\alpha =0.1\).
SolutionРешение
Пусть \(\overrightarrow {X}=\left(X_{1}, \ldots , X_{5}\right)^{T}\). Рассмотрим линейную модель
Найдем \(F\)-статистику в данном эксперименте \(\omega_0\). При \(\theta_1=\theta_2=:\theta\) и \(\theta_3=0\) модель принимает вид \(X_i = \theta (1+t_i) + \varepsilon_i\), поэтому
Значит, требуется минимизировать по \(\theta\) квадратичную функцию \(30\theta^2 - 288\theta + 694\). Минимум функции \(a\theta^2+b\theta +c\) (\(a>0\)) достигается в точке \(\theta^* = -b/(2a)\) и равен \(c - b^2/(4a)\):
Плотность распределения \(\operatorname F_{2,2}\) и \(p\)-значение для наблюдённого значения статистики \(F(\omega_0)=2.5\): заштрихованная площадь под графиком справа от \(2.5\).
Если \(H_0\) верна, то \(F \sim \operatorname {F}_{2,2}\). Проверить \(H_0\) против \(H_1\) можно 2-мя эквивалентными способами.
Enum-item1.
Вычислить \(p\)-значение – вероятность получить в независимой копии проводимого эксперимента такое же (\(2.5\)) или более критическое (большее \(2.5\)) значение статистики при условии верности гипотезы \(H_0\), т.е. при \(F \sim \operatorname {F}_{2,2}\):
\[
p = \mathbb {P}\left( F > 2.5 \mid H_0 \right) \approx 28.6\% .
\]
\(p\)-значение больше уровня значимости, следовательно данные недостаточно критичны, незначимы. \(H_0\) отвергать не следует.
Enum-item2.
Вычислить критическую область для данного УЗ и посмотреть, попадает ли туда выборка (статистика). Сделать это можно при помощи квантильных таблиц. Например, для распределения \(\operatorname {F}_{2,2}\) квантиль уровня \(1 - \alpha = 0.9\) равна \(9\). Т.е. критическая область такая: \(\left\{ F > 9\right\}\). В нашем эксперименте \(F(\omega_0) = 2.5 < 9\), следовательно отвергать \(H_0\) не следует.
Квантили уровня \(1-\alpha=0.9\) распределения \(\operatorname F_{d_1,d_2}\) в зависимости от \(d_1,d_2\in\naturals\). Выделена ячейка \(d_1=2,\,d_2=2\), использованная в примере.
AnswerОтвет
Отвергать \(H_0\) не следует.
ProblemЗадача 4
\(Y^{(1)}_{1}, \ldots , Y^{(1)}_{n_1}\)- выборка из распределения \(\mathscr {N}\left(a_{1}, \sigma^{2}\right)\), \(Y^{(2)}_{1}, \ldots , Y^{(2)}_{n_2}\)- выборка из распределения \(\mathscr {N}\left(a_{2}, \sigma^{2}\right)\), \(Y^{(3)}_1, \ldots , Y^{(3)}_{n_3}\)- выборка из распределения \(\mathscr {N}\left(a_{3}, \sigma^{2}\right)\). Постройте \(F\)-критерий размера \(\alpha\) для проверки гипотезы а) \(H_{0}: a_{1}=a_{2}\) и \(a_{1}+a_{2}=a_{3}\), б) \(H_{0}: a_{1}=2 a_{2}\) и \(a_{1}+3 a_{2}=a_{3}\).
Примечание. Каждый пункт оценивается в 1 балл.
ProblemЗадача 5
Решите пример Пример 5 с помощью подсчета условной оценки наименьших квадратов.
ProblemЗадача 6
Пусть \(Y^{(1)}_{i} \sim \mathscr {N}\left(a, i\sigma^2\right) , \; i= 1, \ldots , n\), \(Y^{(2)}_{j} \sim \mathscr {N}\left(jb, \sigma^{2}\right), j=1, \ldots , m\) – независимые случайные величины, где \(a\), \(b\), \(\sigma^{2}\) – неизвестные одномерные параметры. Сведите задачу к линейной модели и постройте \(F\)-критерий размера \(\alpha\) для проверки гипотезы \(H_{0}: a+b=1\).
ProblemЗадача 7
Используя метод линейной регрессии, постройте приближение функции \(f(t)\) многочленом третьей степени \(a_0 + a_1t + a_2t^2 + a_3t^3\) по следующим данным:
Данные для приближения \(f(t)\) кубическим многочленом \(a_0+a_1t+a_2t^2+a_3t^3\)
Проверьте гипотезу \(H_0: a_1 = a_2 = a_3 = 0\) на уровне значимости
\(10\%\);
\(5\%\);
\(1\%\);
\[
\]
F = 4.64, p-значение 6.6,
\[
где $\operatorname {RSS}_0$ – условная (при $H_0$, т.е. для модели-константы) сумма квадратов. Итого: а) на УЗ $10\% $ гипотезу $H_0$ отвергаем; б) на УЗ $5\% $ и в) на УЗ $1\% $ – не отвергаем. Заметьте: по отдельности все коэффициенты незначимы по $t$-критериям (степени $t, t^2, t^3$ сильно коррелированы – мультиколлинеарность), но совместная $F$-проверка на $10\% $-м уровне эффект видит.
\]
ProblemЗадача 8
ProblemЗадача 9
Пусть \(X_{i j} \sim \mathscr {N}\left(\mu_{j}, \sigma^{2}\right), i=1, \ldots , n_{j}, j=1, \ldots , k,-\) независимые случайные величины, а \(\left\{ \mu_{j}\right\}_{j=1}^{k}, \sigma^{2}\) – неизвестные параметры. Обозначим \(N=\sum_{j=1}^{k} n_{j}\). Для проверки гипотезы однородности \(H_{0}: \mu_{1}=\ldots =\mu_{k}\) используется \(F\)-критерий однофакторного дисперсионного анализа со следующей статистикой \[
\] F =, \[
где
\] X_{. j}= {i=1}^{n{j}} X_{i j}, X_{. .}= {j=1}^{k} n_j X{. j} = {j=1}^k{i=1}^{n_j} X_{ij}, $$ т.е. \(X_{\cdot j}\) – это выборочное среднее в группе наблюдений \(j\), а \(X_{\cdot \cdot }\) – общее выборочное среднее по всем \(N\) наблюдениям (взвешенное среднее групповых средних с весами \(n_j\)). Выражение \(\sum _{j=1}^{k} n_{j}\left(X_{. j}-X_{. .}\right)^{2}\) в числителе \(F\) можно интерпретировать как меру межгруппового разброса. Выражение \(\sum _{i=1}^{n_{j}}\left(X_{i j}-X_{. j}\right)^{2}\) из знаменателя – мера разброса внутри группы \(j\).
Докажите, что при верности \(H_{0}\) выполнено \(F \sim \operatorname {F}_{k-1, N-k}\). $$
Примечание. Задача оценивается в 3 балла.
3 (*) Классические тесты как частные случаи линейной модели
Материала этой главы (вместе с главой о линейной регрессии) достаточно, чтобы «прочитать» почти весь стандартный набор тестов, зашитый в статистические пакеты. Для определенности будем ориентироваться на надстройку Excel «Пакет анализа» (Analysis ToolPak); в ней с линейной гауссовской моделью связаны инструменты:
три \(t\)-теста: «Парный двухвыборочный \(t\)-тест для средних», «Двухвыборочный \(t\)-тест с одинаковыми дисперсиями», «Двухвыборочный \(t\)-тест с различными дисперсиями»;
«Двухвыборочный \(z\)-тест для средних»;
«Двухвыборочный \(F\)-тест для дисперсии»;
три варианта дисперсионного анализа: «Однофакторный», «Двухфакторный с повторениями», «Двухфакторный без повторений»;
«Регрессия».
Почти все они – частные случаи \(F\)-критерия из этой главы, примененного к подходящей линейной модели (а немногие исключения – Уэлч и \(F\)-тест для дисперсий – собраны из тех же «кирпичей» теоремы Кокрена). Разберем их по очереди.
3.1\(t\)-форма \(F\)-критерия для одномерных гипотез
Все перечисленные \(t\)-статистики – это «корни» \(F\)-статистик. Точный смысл придает следующая теорема.
\[
При верной $H_0$ имеем $\mathbf{w}^T\overrightarrow {\theta } = \tau _0$, откуда
\]
N0, 1.
\[
По \hyperref[LinearRegr:CochranTheorem]{теореме Кокрена} статистики $\widehat{\overrightarrow {\theta }}$ (функция от $\overrightarrow {X}_L$) и $\operatorname {RSS}$ (функция от $\overrightarrow {X}_{L^\perp }$) независимы, причем
\]
^2 = ^2_n - k.
\[
По определению распределения Стьюдента (см. главу о линейной регрессии)
\]
T = = T_n - k.
\[
Наконец, при $m = 1$ матрица $\mathbf{b}$ -- это число $b$, и
\]
F = = = T^2.
\[
\]
ExampleПример 8
Критерий УЗ \(\alpha\) на основе \(T\) против двусторонней альтернативы \(H_1: \mathbf{w}^T\overrightarrow {\theta } \neq \tau_0\) совпадает с \(F\)-критерием:
\[
\]
S = T > Q_T_n-k1 - 2, p-значение = PT_n - k > T(x).
\[
Преимущество $t$-формы в том, что она, в отличие от $F = T^2$, «видит знак» отклонения, а значит позволяет тестировать и \textit{односторонние} альтернативы $H_1: \mathbf{w}^T\overrightarrow {\theta } > \tau _0$ (критерий $\left\{ T > Q_{T_{n-\tilde{k}}}(1 - \alpha )\right\} $) и $H_1: \mathbf{w}^T\overrightarrow {\theta } < \tau _0$ (критерий $\left\{ T < Q_{T_{n-\tilde{k}}}(\alpha )\right\} $). Именно поэтому Excel в выдаче $t$-тестов приводит по паре значений: «$t$ критическое одностороннее» и «$t$ критическое двухстороннее» (и соответствующие $p$-значения).
\]
ProblemЗадача 10
(Дуальность тестов и доверительных интервалов.) В условиях теоремы Теорема 2 покажите, что двусторонний \(t\)-критерий УЗ \(\alpha\) не отвергает \(H_0: \mathbf{w}^T\overrightarrow {\theta } = \tau_0\) тогда и только тогда, когда \(\tau_0\) накрывается доверительным интервалом уровня доверия \(1 - \alpha\) для \(\mathbf{w}^T\overrightarrow {\theta }\): \[
\] (- Q_{T_{n-}}(1 - ), ; ; + Q_{T_{n-}}(1 - )). \[
Таким образом, одномерные гипотезы можно тестировать «глазами» -- по доверительному интервалу.
\]
3.2 Одновыборочный \(t\)-тест
Дана выборка \(X_1, \ldots , X_n\) из \(\mathscr {N}\left(\theta , \sigma^2\right)\) (оба параметра неизвестны), проверяется \(H_0: \theta = \theta_0\). Модель нам уже встречалась в примере Пример 1 про кофейный автомат:
\[
\]
X = 1+ , k = 1, w = 1, b = 1T1-1 = , = = X.
\[
Здесь $\widehat{\sigma ^2} = \operatorname {RSS}/(n-1) = s^2$ -- несмещенная выборочная дисперсия, и теорема \ref{LinearRegrHypTest:TFormThm} дает знакомую по главе о доверительных интервалах статистику
\]
T = T_n-1 при верной H_0.
$$ В примере \(\ref{LinearRegrHypTest:EspressoExample}\) мы уже видели ее в деле (и связь \(F = T^2\)).
В «Пакете анализа» отдельной кнопки для одновыборочного теста нет: он получается из парного теста ниже, если в качестве второй «выборки» подать столбец из констант \(\theta _0\). $$
ExampleПример 9
Производитель пауэрбанков заявляет емкость \(10000\) мА\(\cdot\)ч. Техноблогер измерил фактическую емкость \(6\) экземпляров: \[
\] 9450, , , , , (). \[
Считая емкость гауссовской, проверьте на уровнях значимости $5\% $ и $1\% $ гипотезу $H_0: \theta = 10000$ против \emph{односторонней} альтернативы $H_1: \theta < 10000$ («емкость завышена»; отклонение в другую сторону покупателя, очевидно, не волнует).
\]
SolutionРешение
Имеем
\[
\]
X = 9650, s^2 = _i=1^6X_i - 9650^2 = 89000, s 298.3,
\[
\]
T = = -2.87.
\[
Альтернатива левосторонняя, поэтому критическая область -- левый хвост $\left\{ T < Q_{T_5}(\alpha )\right\} $. Имеем $Q_{T_5}(0.05) \approx -2.02$, $Q_{T_5}(0.01) \approx -3.36$ и
\]
-3.36 < -2.87 < -2.02,
\[
поэтому на УЗ $5\% $ гипотезу отвергаем (емкость значимо меньше заявленной), а на УЗ $1\% $ -- отвергнуть не можем; $p$-значение равно $\mathbb {P}\left(T_5 < -2.87\right) \approx 1.7\% $.
\]
ProblemЗадача 11
В примере Пример 1 мы тестировали кофейный автомат против двусторонней альтернативы и не смогли отвергнуть \(H_0\) на УЗ \(1\%\). Но скептика из примера волнует только недолив. Проверьте по тем же данным гипотезу \(H_0: \theta = 200\) против односторонней альтернативы \(H_1: \theta < 200\) на уровне значимости \(1\%\).
\[
\]
PT_7 < -3.04 0.94 < 1 (против 1.9 у двустороннего).
\[
Это общий эффект: отказавшись от «неинтересной» половины альтернативы, односторонний тест становится мощнее против оставшейся. Важно только фиксировать одностороннюю альтернативу \emph{до} взгляда на данные, а не подбирать ее по знаку полученного отклонения.
\]
ProblemЗадача 12
AnswerОтвет
\(T \approx -2.87 < Q_{T_5}(0.05) \approx -2.02\): на УЗ \(5\%\) отвергаем (емкость завышена), на УЗ \(1\%\) – отвергнуть нельзя (\(p \approx 1.7\%\)).
3.3 Парный \(t\)-тест
Инструмент «Парный двухвыборочный \(t\)-тест для средних». Данные – \(n\)пар\((X_i, Y_i)\): два измерения на одном и том же объекте (до/после лечения, левый/правый глаз, два прибора на одной детали). Внутри пары измерения зависимы, поэтому модель двух независимых выборок не годится. Вместо этого перейдем к разностям:
\[
\]
D_i := X_i - Y_i = + _i, _i N0, _D^2 независимы,
\[
и гипотеза «эффекта нет» превращается в $H_0: \delta = \delta _0$ (обычно $\delta _0 = 0$; Excel позволяет задать «гипотетическую среднюю разность»). Это одновыборочный $t$-тест для $\overrightarrow {D}$:
\]
T = T_n-1 при верной H_0, s_D^2 = _i=1^n D_i - D^2.
$$ В чем выигрыш парной схемы? Если у каждого объекта есть свой индивидуальный уровень \(\mu _i\), т.е. \(X_i = \mu _i + \xi _i\), \(Y_i = \mu _i - \delta + \eta _i\), то в разностях \(D_i = \delta + (\xi _i - \eta _i)\) индивидуальные уровни : межобъектный разброс \(\mu _i\) не попадает в дисперсию статистики.
$$ {#eq-LinearRegrHypTest:PulseExample}
D = (7, 1, 6, -1, 5, 2, 8, 0)^T, D = 3.5, s_D^2 = 11.71.
$$ поэтому на УЗ $5% $ гипотезу отвергаем: кофе значимо ускоряет пульс (в среднем на \(3.5\) уд./мин); \(p\)-значение $(|T_7| > 2.89) % $. На УЗ $1% $ отвергнуть не смогли бы (\(Q_{T_7}(0.995) \approx 3.50\)).
Поучительно посмотреть, что было бы, примени мы к этим же данным тест (следующий пункт), проигнорировав парность: \(\overline{X^{\text{после}}} - \overline{X^{\text{до}}} = 3.5\) - та же, но межиндивидуальный разброс пульса (от \(61\) до \(95\) уд./мин) попадает в оценку дисперсии: \(s_p \approx 9.6\), \(T \approx 0.73\), $p % $ – никакого эффекта не видно. Парная схема убирает этот разброс и делает эффект видимым. $$
ExampleПример 10
ProblemЗадача 13
Сервис чип-тюнинга обещает снижение расхода топлива. Для \(6\) автомобилей измерили средний расход (л\(/100\) км) до и после прошивки:
До
8.9
10.2
7.8
9.5
11.1
8.4
После
8.5
9.9
7.9
9.0
10.5
8.2
Считая разности гауссовскими, проверьте на уровне значимости \(5\%\) гипотезу «прошивка ничего не меняет» против альтернативы «расход снижается».
HintПодсказка
Парный \(t\)-тест с односторонней альтернативой.
\[
\]
D = 0.317, s_D^2 0.0617, T = 3.12.
\[
Альтернатива $H_1: \delta > 0$ (расход «до» больше), критическая область $\left\{ T > Q_{T_5}(0.95) \approx 2.02\right\} $: гипотезу отвергаем, снижение расхода значимо (в среднем $0.32$ л$/100$ км); $p$-значение $\mathbb {P}\left(T_5 > 3.12\right) \approx 1.3\% $.
\]
Это в точности модель из примера \(\ref{LinearRegrHypTest:CompositeExampleWithCoins}\) про взвешивание монет: \(\tilde{k} = 2\), \(\mathbf{w} = (1, -1)^T\), и, как посчитано в примере \(\ref{LinearRegrHypTest:CompositeExampleWithCoinsSol}\), $$
= X^(1)- X^(2), b = + , ^2 = = =: s_p^2,
\[
где $s_i^2$ -- несмещенные выборочные дисперсии. Оценку $s_p^2$ называют \textit{объединенной (pooled) дисперсией}: обе выборки складываются в общий «котел» для оценивания $\sigma ^2$. По теореме \ref{LinearRegrHypTest:TFormThm}
\]
T = T_n_1 + n_2 - 2 при верной H_0,
\[
а $F$-статистика из примера \ref{LinearRegrHypTest:CompositeExampleWithCoinsSol} – это ее квадрат (при $\delta _0 = 0$).
\]
ExampleПример 11
Интернет-магазин переделал форму оформления заказа и провел A/B-тест: случайной половине посетителей показывалась старая форма, остальным – новая. Время оформления заказа (секунды): \[
\]\[
\] (n_1 = 10)& : , ; 111, ; 72, ; 94, ; 104, ; 107, ; 101, ; 108, ; 98, ; 100 \ (n_2 = 12)& : , ; 75, ; 77, ; 88, ; 80, ; 96, ; 97, ; 101, ; 85, ; 97, ; 77, ; 78 \[
\]\[
Считая выборки гауссовскими с общей дисперсией, проверьте на уровне значимости $1\% $ гипотезу о том, что среднее время оформления не изменилось.
\]
SolutionРешение
В группах разные посетители (каждый видел ровно одну форму), выборки независимы – парная схема здесь невозможна в принципе, это честная двухвыборочная задача. Имеем
\[
Дисперсии близки, применяем тест с объединенной дисперсией:
\]
s_p^2 = 102.2, T = = 3.10.
\[
Поскольку $\left|T\right| = 3.10 > Q_{T_{20}}(0.995) \approx 2.85$, гипотезу отвергаем даже на УЗ $1\% $: новая форма ускоряет оформление (в среднем на $13$ секунд); $p$-значение $\approx 0.6\% $.
\]
AnswerОтвет
\(\left|T\right| \approx 3.10 > Q_{T_{20}}(0.995) \approx 2.85\): отвергаем даже на УЗ \(1\%\) (\(p \approx 0.6\%\)) – новая форма быстрее.
3.5 Двухвыборочный \(t\)-тест Уэлча: различные дисперсии
Инструмент «Двухвыборочный \(t\)-тест с различными дисперсиями». Если \(\sigma_1^2 \neq \sigma_2^2\), то нарушается гомоскедастичность – ключевое условие нашей линейной модели (\(\operatorname {Var}\left[\overrightarrow {\varepsilon }\right] = \sigma^2\mathbf{I}_n\)), и весь механизм этой главы перестает работать. Точного аналога теоремы Теорема 2 здесь нет (это знаменитая проблема Беренса–Фишера), но есть хорошее приближение – тест Уэлча (Welch):
\[
\]
T_W = T_, =
$$ (приближение Уэлча–Саттертуэйта: подбирается такое число степеней свободы $$, чтобы распределение Стьюдента наилучшим образом приближало истинное распределение знаменателя). Число $$ обычно нецелое, \(\min (n_1, n_2) - 1 \leq \nu \leq n_1 + n_2 - 2\); Excel в выдаче округляет его до целого.
Практические замечания. При \(s_1^2 \approx s_2^2\) и \(n_1 \approx n_2\) статистики и выводы двух двухвыборочных тестов почти совпадают. Если же дисперсии различаются заметно (особенно при разных \(n_i\)), тест с объединенной дисперсией может сильно врать с уровнем значимости, а Уэлч остается приближенно честным. Поэтому современная практическая рекомендация: сомневаетесь в равенстве дисперсий – используйте сразу Уэлча. $$
ExampleПример 12
Ресторан сравнивает две службы доставки. «Курьерская» возит предсказуемо, «эконом» – дешевле, но как повезет. Время доставки (минуты): \[
\]\[
\] (n_1 = 12)& : , ; 53, ; 36, ; 53, ; 45, ; 41, ; 41, ; 40, ; 44, ; 49, ; 48, ; 48 \ (n_2 = 6)& : , ; 29, ; 85, ; 74, ; 96, ; 79 \[
\]\[
Проверьте на уровне значимости $5\% $ гипотезу о равенстве средних времен доставки.
\]
SolutionРешение
Имеем
\[
\]
X^(1) 45.4, X^(2) 64.8, s_1^2 27.5, s_2^2 891.0.
\[
Дисперсии различаются в $30$ с лишним раз -- предпосылка об общей $\sigma ^2$ здесь очевидно неразумна, применяем Уэлча. Обозначим $u := s_1^2/n_1 = 27.5/12 \approx 2.29$ и $v := s_2^2/n_2 = 891.0/6 = 148.5$:
\]\[
\] T_W = = -1.58, = 5.2. \[
\] $$ Поскольку \(\left|T_W\right| = 1.58 < Q_{T_{5.2}}(0.975) \approx 2.55\), отвергнуть гипотезу нельзя ($p % $): да, «эконом» в среднем вез на \(19\) минут дольше, но при таком его разбросе и всего \(6\) наблюдениях это вполне может быть случайностью.
Поучительно, что тест с объединенной дисперсией на тех же данных дал бы \(T \approx -2.25\) и $p % $ – «значимо»! Объединенная оценка \(s_p^2 \approx 297\) усредняет огромную дисперсию «эконома» с маленькой дисперсией «курьерской» и переоценивает точность сравнения; маленькая выборка с большой дисперсией – худший случай для нее. Уэлч от этой ошибки защищает. $$
ProblemЗадача 15
Докажите границы для числа степеней свободы Уэлча: \[
\] (n_1, n_2) - 1 ; ; ; ; n_1 + n_2 - 2. \[
\]
Тест Уэлча: \(T_W \approx -1.58\), \(\nu \approx 5.2\), \(p \approx 17\%\) – отвергнуть нельзя (а тест с объединенной дисперсией дал бы ложно «значимые» \(p \approx 3.9\%\)).
3.6\(z\)-тесты: дисперсии известны
Инструмент «Двухвыборочный \(z\)-тест для средних». Если дисперсии \(\sigma_1^2, \sigma_2^2\)известны (Excel просит ввести их руками), то оценивать \(\sigma^2\) не нужно, стьюдентизация не требуется, и статистика при верной \(H_0: a_1 - a_2 = \delta_0\) имеет точное нормальное распределение:
\[
\]
Z = N0, 1.
$$ Заметьте: здесь разрешены \(\sigma _1^2 \neq \sigma _2^2\) – проблема предыдущего пункта возникала только из-за дисперсий. Одновыборочный вариант аналогичен: \(Z = \sqrt{n}\left(\overline{X} - \theta _0\right)/\sigma \sim \mathscr {N}\left(0, 1\right)\).
Когда дисперсию можно считать известной? Либо она задана паспортом измерительного прибора (выверена производителем на огромном материале), либо выборки настолько большие, что \(s_i^2\) можно подставить вместо \(\sigma _i^2\): тогда \(z\)-тест – асимптотический (по ЦПТ он, кстати, не требует и нормальности выборок), а \(t\)-тесты при больших \(n\) с ним практически совпадают (\(T_n \xrightarrow [n \to \infty ]{d} \mathscr {N}\left(0, 1\right)\)).
$$ {#eq-LinearRegrHypTest:SugarExample}
Z = = 2.50.
\[
Поскольку $\left|Z\right| = 2.50 > Q_{\mathscr {N}\left(0, 1\right)}(0.975) \approx 1.96$, на УЗ $5\% $ гипотезу отвергаем: дозаторы настроены на разный средний вес ($p$-значение $\approx 1.2\% $). Заметьте, насколько мала «значимая» разница -- $2.8$ г при $\sigma = 5$ г: выборки по $40$ пакетов делают тест чувствительным к небольшим расхождениям. Значимость -- не то же самое, что практическая важность: важна ли разница в $2.8$ г -- вопрос не к статистике, а к технологу.
\]
ExampleПример 13
3.7\(F\)-тест равенства дисперсий
Инструмент «Двухвыборочный \(F\)-тест для дисперсии». Здесь гипотеза уже не о среднем, а о дисперсиях двух независимых нормальных выборок: \(H_0: \sigma_1^2 = \sigma_2^2\). Из главы о линейной регрессии мы знаем (по сути – из теоремы Кокрена для модели-константы), что
\[
\]
^2_n_1 - 1, ^2_n_2 - 1,
\[
и эти величины независимы (выборки независимы). По определению \ref{LinearRegrHypTest:FisherDistrDef} распределения Фишера при верной $H_0$
\]
F = = F_n_1 - 1, n_2 - 1.
$$ Альтернатива двусторонняя (\(\sigma _1^2 \neq \sigma _2^2\)), поэтому отвергаем, если \(F \not\in \left(Q_{\operatorname {F}_{n_1-1,n_2-1}}\left(\frac{\alpha }{2}\right), Q_{\operatorname {F}_{n_1-1,n_2-1}}\left(1 - \frac{\alpha }{2}\right)\right)\). Excel выдает одностороннее \(p\)-значение \(\mathbb {P}\left(\operatorname {F} > F\right)\) – для двусторонней альтернативы его нужно удваивать (либо, как часто делают, заранее ставить большую из дисперсий в числитель).
Два предостережения. Во-первых, этим тестом часто «проверяют равенство дисперсий», чтобы выбрать между двумя двухвыборочными \(t\)-тестами; такая двухступенчатая процедура искажает итоговый уровень значимости, и проще сразу брать Уэлча. Во-вторых, в отличие от \(t\)-тестов (довольно устойчивых к негауссовости выборок благодаря ЦПТ), \(F\)-тест для дисперсий к отклонениям от нормальности очень чувствителен даже при больших \(n\). $$
ExampleПример 14
Рядом со старым кофейным автоматом из примера Пример 1 поставили новый. Тот же студент измерил \(8\) порций эспрессо нового автомата: \[
\] 199, , , , , , , (). \[
Проверьте на уровне значимости $5\% $ гипотезу о том, что автоматы наливают одинаково стабильно (дисперсии равны).
\]
SolutionРешение
Для старого автомата \(s_1^2 = \frac{218}{7} \approx 31.1\) (сумму квадратов отклонений \(218\) мы уже считали в примере Пример 1). Для нового \(\overline{X^{(2)}} = 200\) и
\[
\]
s_2^2 = 1 + 4 + 9 + 0 + 1 + 4 + 0 + 9 = 4.
\[
Статистика
\]
F = = 7.79 F_7,7 при верной H_0.
\[
Двусторонние квантили: $Q_{\operatorname {F}_{7,7}}(0.025) \approx 0.20$ и $Q_{\operatorname {F}_{7,7}}(0.975) \approx 5.00$; статистика $7.79 > 5.00$ попадает в критическую область -- гипотезу отвергаем: разброс старого автомата значимо больше ($p = 2\mathbb {P}\left(\operatorname {F}_{7,7} > 7.79\right) \approx 1.5\% $). Заметьте: недолив (сдвиг среднего) и нестабильность (разброс) -- разные дефекты, и проверяются они разными тестами; старый автомат, как выяснилось, грешит обоими.
\]
ProblemЗадача 16
Постройте по двум независимым нормальным выборкам доверительный интервал уровня доверия \(1 - \alpha\) для отношения дисперсий\(\sigma_1^2/\sigma_2^2\). Вычислите его для двух кофейных автоматов из примера Пример 14 (\(1 - \alpha = 0.95\)).
HintПодсказка
Найдите центральную статистику: величину, распределенную по закону \(\operatorname {F}_{n_1-1,n_2-1}\) при любых\(\sigma_1^2, \sigma_2^2\).
\[
и, разрешая неравенства относительно $\sigma _1^2/\sigma _2^2$, получаем доверительный интервал
\]
, .
\[
Для автоматов: $F \approx 7.79$, интервал $\left(7.79/5.00, \; 7.79/0.20\right) \approx (1.6, \; 38.9)$. Он не накрывает $1$ -- согласовано с отвержением $H_0$ (дуальность тестов и интервалов). Но обратите внимание, насколько интервал широк: два десятка наблюдений -- это очень мало для точных выводов об отношении дисперсий.
\]
«Однофакторный дисперсионный анализ» – это в точности задача Задача 9: \(k\) независимых групп наблюдений с общей дисперсией, гипотеза однородности \(H_0: \mu_1 = \ldots = \mu_k\) (\(m = k - 1\) линейных ограничений), статистика
\[
\]
F = F_k-1, N-k при верной H_0
$$ (межгрупповой разброс против внутригруппового). Excel выдает таблицу с \(\operatorname {SS}\), \(\operatorname {df}\), \(\operatorname {MS} = \operatorname {SS}/\operatorname {df}\), \(F\), \(p\)-значением и критическим значением.
$$ {#eq-LinearRegrHypTest:ANOVAvsTTestProblem}
X = , X^(1)- X = , X^(2)- X = -.
\[
Тогда
\]
SS_Treatments = n_1^2 + n_2^2 = ^2 = .
\[
При этом $\operatorname {SS}_{\text{Error}}/(N - 2) = s_p^2$ -- объединенная дисперсия. Итого
\]
F = = = T^2.
\[
\]
ProblemЗадача 18
ExampleПример 15
Сеть кофеен проверяет стандарты обслуживания в трех филиалах. Время от заказа до выдачи (минуты) у случайных посетителей:
Филиал А
8
8
9
8
7
Филиал Б
12
14
13
10
8
Филиал В
8
9
4
9
7
Считая время гауссовским с общей дисперсией, проверьте на уровне значимости \(5\%\) гипотезу об однородности филиалов.
SolutionРешение
Здесь \(k = 3\), \(n_1 = n_2 = n_3 = 5\), \(N = 15\). Групповые средние и общее среднее:
AnswerОтвет
\(F \approx 6.59 > Q_{\operatorname {F}_{2,12}}(0.95) \approx 3.89\): отвергаем (\(p \approx 1.2\%\)) – судя по средним, выбивается филиал Б.
$$ гипотезу однородности отвергаем (\(p\)-значение $% $): филиалы работают по-разному, и, судя по средним, «тормозит» филиал Б.
Осторожно с интерпретацией: дисперсионный анализ говорит лишь, что средние равны, но не говорит, различаются. Корректные попарные сравнения после общего \(F\)-теста – отдельная тема (множественные сравнения, поправки типа Бонферрони), выходящая за рамки конспекта. $$
ExampleПример 16
ProblemЗадача 19
В трех семинарских группах одну и ту же контрольную написали на следующие баллы (из \(10\)):
Группа 1
6
8
8
8
9
5
Группа 2
6
5
6
8
6
7
Группа 3
4
7
5
9
8
8
Семинарист группы 1 гордится, что его группа написала лучше всех. Проверьте гипотезу об однородности групп на уровне значимости \(5\%\).
\[
$p$-значение $\approx 54\% $: гипотезу однородности не отвергаем. Средний балл группы 1 действительно выше на балл, но разброс баллов внутри групп настолько велик, что такое отклонение легко возникает случайно. Гордиться пока нечем (как, впрочем, и стыдиться).
\]
ProblemЗадача 20
ProblemЗадача 21
(Дисперсионный анализ как регрессия.) Покажите, что однофакторный дисперсионный анализ – это \(F\)-тест значимости регрессии в целом (задача Задача 2) для модели с \(k - 1\)дамми-регрессорами принадлежности группам: \[
\] X = 0 + 1 ; { 2} + + {k-1}; _{ k} + . \[
\]
Примечание. Задача оценивается в 2 балла.
Двухфакторный дисперсионный анализ обобщает картину: наблюдения размечены сразу двумя факторами (например, урожайность: сорт \(\times\) удобрение). В сбалансированной модели «с повторениями» в каждой ячейке \((i, j)\) сделано \(r\) наблюдений:
\[
\]
X_ijl = + _i + _j + _ij + _ijl, i = 1,a, j = 1,b, l = 1,r,
\[
где $\alpha _i$ -- эффект уровня первого фактора, $\beta _j$ -- второго, $\gamma _{ij}$ -- их \textit{взаимодействие}, а для идентифицируемости наложены ограничения $\sum _i \alpha _i = \sum _j \beta _j = \sum _i \gamma _{ij} = \sum _j \gamma _{ij} = 0$. Это снова линейная гауссовская модель, а гипотезы «первый фактор не влияет» ($H_0^{A}$: все $\alpha _i = 0$), «второй не влияет» ($H_0^{B}$), «взаимодействия нет» ($H_0^{AB}$) -- линейные гипотезы вида $\mathbf{w}^T\overrightarrow {\theta } = \overrightarrow {0}$, к которым применима общая теория. Выпишем ответ (вывод -- прямое, хотя и громоздкое, применение схемы этой главы через условную ОНК; предлагаем читателю в качестве упражнения повышенной трудоемкости). В обозначениях средних по ячейке $\overline{X}_{ij\cdot }$, по уровням факторов $\overline{X}_{i\cdot \cdot }, \overline{X}_{\cdot j \cdot }$ и общего среднего $\overline{X}$:
\]
$$ (статистики \(F_B, F_{AB}\) строятся из \(\operatorname {SS}_{B}, \operatorname {SS}_{AB}\) аналогично). Инструмент «без повторений» – случай \(r = 1\): взаимодействие тогда неотличимо от шума (в ячейке одно наблюдение), поэтому модель берется аддитивной (\(\gamma _{ij} = 0\)), а роль \(\operatorname {SS}_{E}\) играет остаточная сумма \(\operatorname {SS}_{\text{res}} = \sum _{i,j}\left(X_{ij} - \overline{X}_{i\cdot } - \overline{X}_{\cdot j} + \overline{X}\right)^2\) с \((a-1)(b-1)\) степенями свободы.
$$ Обе статистики в критической области: значимо влияние и сорта ($p % \(), и поля (\)p % $).
Заметьте пользу двухфакторной схемы: если сравнивать сорта анализом, игнорируя фактор поля, то почвенный разброс уйдет в \(\operatorname {SS}_{\text{Error}} = \operatorname {SS}_{B} + \operatorname {SS}_{\text{res}} \approx 94\) (\(6\) ст. свободы), и эффект сорта размоется: \(F = \frac{122/2}{94/6} \approx 3.9 < Q_{\operatorname {F}_{2,6}}(0.95) \approx 5.14\) – уже незначимо. Учет второго фактора вычитает этот разброс явно (ср. с выигрышем парного \(t\)-теста). $$
ProblemЗадача 22
3.9 Инструмент <<Регрессия>>
Последний и самый содержательный инструмент «Пакета анализа» оценивает модель со свободным членом \(\overrightarrow {X} = \mathbf{z}\overrightarrow {\theta } + \overrightarrow {\varepsilon }\), \(\tilde{k} = k + 1\), и выдает три блока, целиком собирающиеся из результатов глав о линейной регрессии и о проверке гипотез. Обозначим, как обычно, \(\left(\mathbf{z}^T\mathbf{z}\right)^{-1} = (a_{i,j})\), \(\widehat{\sigma^2} = \operatorname {RSS}/(n - \tilde{k})\).
Блок «Регрессионная статистика»: коэффициент детерминации «\(R\)-квадрат» \(R^2 = \operatorname {ESS}/\operatorname {TSS}\); «Множественный \(R\)» \(= \sqrt{R^2}\) (как мы увидим в главе о коэффициентах корреляции, это выборочная корреляция между \(\overrightarrow {X}\) и \(\widehat{\overrightarrow {X}}\)); «Стандартная ошибка» \(= \sqrt{\widehat{\sigma^2}}\); «Нормированный \(R\)-квадрат»
\[
\]
R^2_adj = 1 - (1 - R^2)
\[
-- вариант $R^2$ со штрафом за число регрессоров: обычный $R^2$ при добавлении любого, даже бесполезного, регрессора не убывает, а $R^2_{adj}$ может и упасть (несмещенные оценки дисперсий остатка и отклика вместо смещенных). \item Блок «Дисперсионный анализ»: строки «Регрессия» / «Остаток» / «Итого» с $\operatorname {df} = k, \; n - k - 1, \; n-1$ и $\operatorname {SS} = \operatorname {ESS}, \operatorname {RSS}, \operatorname {TSS}$; статистика
\]
F = F_k, n-k-1 при H_0: _1 = = _k = 0
\[
-- $F$-тест \textit{значимости регрессии в целом} («объясняют ли регрессоры хоть что-нибудь»), знакомый нам по задаче \ref{LinearRegrHypTest:R2FreeParamProblem} (там же -- его выражение через $R^2$); «Значимость $F$» -- его $p$-значение. \item Таблица коэффициентов, по строке на каждый параметр $\theta _j$ (включая свободный член -- «$Y$-пересечение»): оценка $\widehat{\theta }_j$; ее \textit{стандартная ошибка} $\operatorname {se}_j := \sqrt{a_{j,j}\widehat{\sigma ^2}}$; «$t$-статистика»
\]
t_j = T_n - k при H_0: _j = 0
\[
\]
– тест значимости отдельного коэффициента: это теорема Теорема 2 с \(\mathbf{w} = \overrightarrow {e}_j\), \(\tau_0 = 0\), \(b = a_{j,j}\); «\(P\)-значение» (двустороннее) и границы доверительного интервала \(\widehat{\theta }_j \pm Q_{T_{n - \tilde{k}}}\left(1 - \frac{\alpha }{2}\right)\operatorname {se}_j\) уровня доверия \(95\%\) (совпадает с интервалом из главы о линейной регрессии).
ExampleПример 17
Прогоните через инструмент «Регрессия» данные о поездках на такси из примера Пример 2 и прочитайте выдачу.
SolutionРешение
Выдача инструмента (все числа пересчитаны по формулам выше):
Рисунок 1
Рисунок 2
Коэфф.
Ст. ошибка
\(t\)-стат.
\(P\)-значение
Нижние\(95\%\)
Верхние\(95\%\)
\(Y\)-пересечение
\(108.27\)
\(16.71\)
\(6.48\)
\(0.0013\)
\(65.31\)
\(151.23\)
\(d\) (км)
\(32.08\)
\(1.90\)
\(16.92\)
\(1.0 \cdot 10^{-5}\)
\(27.20\)
\(36.95\)
Читаем ее.
Модель объясняет данные отлично: \(R^2 \approx 0.983\) (и \(R^2_{adj} \approx 0.979\) недалеко ушел), типичный разброс цены вокруг прямой – «Стандартная ошибка» \(\sqrt{\widehat{\sigma^2}} \approx 21.4\) руб.
«Значимость \(F\)» \(\approx 10^{-5}\): гипотеза «расстояние вообще не влияет на цену» (\(\theta_1 = 0\)) с треском отвергается – ожидаемо. Заметьте: при \(k = 1\) этот \(F\)-тест эквивалентен \(t\)-тесту единственного коэффициента, и действительно \(F = 286.25 = 16.92^2 = t_1^2\), а \(p\)-значения совпадают.
По строкам коэффициентов: оба значимо отличны от нуля. Доверительный интервал посадки \((65.3, \; 151.2)\) накрывает заявленные \(100\) руб., интервал цены километра \((27.2, \; 36.9)\) накрывает заявленные \(30\) руб./км. Т.е. покоэффициентно претензий к тарифу нет.
Сравним с примером Пример 2, где совместная гипотеза \((a, b) = (100, 30)\) дала \(p \approx 6.2\%\) – гораздо ближе к границе. Противоречия нет: совместный \(F\)-критерий смотрит на пару параметров сразу (его «доверительная область» – эллипс в плоскости \((a,b)\), учитывающий отрицательную коррелированность оценок \(\widehat{a}\) и \(\widehat{b}\)), и точка \((100, 30)\) лежит близко к границе этого эллипса, хотя в прямоугольник из двух отдельных интервалов попадает свободно. Обратный эффект мы видели в задаче Задача 7 про кубическую регрессию: там каждый коэффициент по \(t\)-тесту незначим (мультиколлинеарность раздувает стандартные ошибки), а совместный\(F\)-тест эффект видит. Мораль: покоэффициентные \(t\)-тесты и совместный \(F\)-тест отвечают на разные вопросы, и подменять один другим нельзя.
Те же тесты под теми же именами живут во всех статистических пакетах: в python это scipy.stats.ttest_1samp, ttest_rel (парный), ttest_ind (двухвыборочный; флаг equal_var переключает объединенную дисперсию/Уэлча), f_oneway (однофакторный дисп. анализ) и statsmodels OLS (полная выдача регрессии), в R – t.test, var.test, aov, lm/summary.