Линейная регрессия

1 Постановка задачи

В этой главе мы рассмотрим достаточно специальную, но широко применимую задачу теории оценивания статистических параметров. Наблюдением в этой задаче уже будет являться не выборка (набор независимых случайных величин), а вектор, составленный из случайных величин, распределения которых различны.

1.1 Линейная регрессия без свободного параметра

ExampleПример 1

Имеется 2 монеты разного достоинства, их массы \(\theta_1\) и \(\theta_2\) неизвестны. На одних и тех же весах взвесили отдельно первую монету, отдельно вторую, и затем обе монеты вместе. Составьте статистическую модель эксперимента. Попробуйте оценить \(\theta_1\) и \(\theta_2\).

Обозначим результаты взвешиваний \(X_{1}, X_{2}, X_{3}\). Если бы весы весы показывали безошибочные измерения, то тогда бы выполнялось

\[ \vect {X} = \mathbf{z}\vect {\theta } = \vect {z}_{\cdot 1}\theta _1 + \vect {z}_{\cdot 2} \theta _2 , \quad \text{где} \quad \vect {X} = \begin{pmatrix} X_1 \\ X_2 \\ X_3 \end{pmatrix}, \quad \mathbf{z} = (\vect {z}_{\cdot 1} \; \vect {z}_{\cdot 2} ) = \begin{pmatrix} 1 & 0 \\ 0 & 1 \\ 1 & 1 \end{pmatrix}, \quad \vect {\theta } = \begin{pmatrix} \theta _1 \\ \theta _2 \end{pmatrix} \] В этом случае \(\vect {X}\) неслучаен, линейно зависим от \(\vect {\theta }\). 3-е измерение излишне, достаточно было первых 2-х для оценивания \(\vect {\theta }\).

На практике любые весы допускают ошибку, причем она будет немного отличаться в каждом эксперименте. Ошибки в различных экспериментах можно считать случайными величинами. Обозначим их \(\vect {\varepsilon } = (\varepsilon_1, \varepsilon_2, \varepsilon_3)^T\). Тогда стат. модель:

\[ \vect {X} = \mathbf{z}\vect {\theta } + \vect {\varepsilon }, \] где \(\mathbf{z}\vect {\theta }\) – неизвестный неслучайный вектор, \(\vect {\varepsilon }\) – случайный вектор ошибок. Благодаря \(\vect {\varepsilon }\) вектор наблюдений \(\vect {X}\) становится случайным.

В общем случае дан мешок монет \(k\) разных видов, \(\theta_{1}\) – масса монеты 1 вида, \(\ldots\), \(\theta_{k}\) – масса монеты \(k\) вида. Исследователь оценивает массы монет. Для этого он \(n\) раз взвешивает комбинации монет: на шаге \(i \in \overline{1,n}\) он взвешивает \(z_{i,1}\) монет вида 1, \(\ldots\), \(z_{i,k}\) монет вида \(k\). Если весы работают безошибочно, то значения измерений будут равны линейным комбинациям \(\theta_{1}, \ldots , \theta_{k}\). Но так как ошибки все же имеются, то наблюдаемая величина, полученная при \(i\)-ом взвешивании \((i \in \{ 1, \ldots , n\} )\) равна

\[ X_i = z_{i, 1} \theta _{1}+\ldots +z_{i, k} \theta _{k}+\varepsilon _{i}, \]

где \(z_{i, j} \in \mathbb {R}\) – известные коэффициенты линейной комбинации, \(k\) – количество монет, участвующих в \(i\)-ом взвешивании, \(\varepsilon_{i}\)- ошибка измерения при \(i\)-ом взвешивании. Вся выборка \(\vect {X}\):

\[ \vect {X} = \begin{pmatrix} X_1 \\ X_2 \\ \vdots \\ X_n \end{pmatrix} = \begin{pmatrix} z_{1, 1} \theta _{1}+\ldots +z_{1, k} \theta _{k} \\ z_{2, 1} \theta _{1}+\ldots +z_{2, k} \theta _{k} \\ \vdots \\ z_{n, 1} \theta _{1}+\ldots +z_{n, k} \theta _{k} \end{pmatrix} + \begin{pmatrix} \varepsilon _1 \\ \varepsilon _2 \\ \vdots \\ \varepsilon _n \end{pmatrix} = \vect {z}_{\cdot 1} \theta _1 + \ldots + \vect {z}_{\cdot k} \theta _k + \vect {\varepsilon } = \mathbf{z}\vect {\theta } + \vect {\varepsilon } = \vect {l} + \vect {\varepsilon }, \]

где

\[ \vect {z}_{\cdot 1} = \begin{pmatrix} z_{1,1} \\ z_{2,1} \\ \vdots \\ z_{n,1} \end{pmatrix}, \ldots , \vect {z}_{\cdot k} = \begin{pmatrix} z_{1,k} \\ z_{2,k} \\ \vdots \\ z_{n,k} \end{pmatrix}, \qquad \mathbf{z} = (\vect {z}_{\cdot 1} \; \vect {z}_{\cdot 2} \; \ldots \; \vect {z}_{\cdot k} ) = \begin{pmatrix} z_{1,1} & z_{1,2} & \ldots & z_{1,k} \\ z_{2,1} & z_{2,2} & \ldots & z_{2,k} \\ \vdots & \vdots & \vdots & \vdots \\ z_{n,1} & z_{n,2} & \ldots & z_{n,k} \end{pmatrix}, \qquad \vect {\theta } = \begin{pmatrix} \theta _1 \\ \vdots \\ \theta _k \end{pmatrix}, \quad \vect {l} = \mathbf{z}\vect {\theta } \]

Для \(i = \overline{1,n}\) \(X_i\) называют , \(z_{i,1}, \ldots , z_{i,k}\) называют или , \(\varepsilon_i\) называют или . Обратите внимание, что \(z_{i,1}, \ldots , z_{i,k}\) – известные неслучайные значения, хоть и называются независимыми переменными. Случайна в модели только ошибка \(\varepsilon_i\).

Предположим, что

${} , {} , , {k} $ линейно зависимы. Пусть \(\vect {z}_{\cdot i_1}, \vect {z}_{\cdot i_2}, \ldots , \vect {z}_{\cdot i_{k'}}\) – максимальный линейно независимый набор из ${} , , {k} $. Можно доказать, что исходная модель и модель \(\vect {X} = \vect {z}_{i_1}\theta_{\cdot i_1} + \ldots + \vect {z}_{\cdot i_{k'}}\theta_{i_{k'}} + \vect {\varepsilon }\) эквивалентны в том смысле, что какой бы способ оценивания неизв. коэффициентов и качества регрессии мы не выбрали (об этом ниже), в обоих случаях качество модели получится одинаковым. В дальнейшем будем считать для простоты записи, что исходный набор ${} , , _{k} $ уже сам по себе линейно независим. Причем будем считать, что все регрессоры в совокупности нетривиальны, а именно в пространстве \(L := \operatorname {span}(\vect {z}_{\cdot 1} , \ldots , \vect {z}_{\cdot k} )\) нет векторов, состоящих из одних констант. О регрессии с константным регрессором см. следующий параграф.

Как правило,

\(k\) много меньше, чем \(n\), и матрица \(\mathbf{z}\) получается чрезвычайно вытянутой по вертикали. Задача состоит в оценивании истинных значений \(\theta_{1}, \ldots , \theta_{k}\) по наблюдению \(X_{1}, \ldots , X_{n}\).

Наблюдение \(\vect {X} = (X_1, \ldots , X_n)^T\) – случайный вектор из \(\mathbb {R}^{n}\), причем \(\vect {l} = \vect {l}(\vect {\theta }) := \mathbf{z}\vect {\theta }\) – фиксированный неизвестный вектор, а \(\vect {\varepsilon }\) – случайный вектор.

Про вектор \(\vect {l} = \mathbf{z}\vect {\theta }\) известно, что \(\vect {l} = \mathbf{z}\vect {\theta } \in L\), где

\[ L=\left\langle \vect {z}_{\cdot 1}, \ldots , \vect {z}_{\cdot k}\right\rangle = \operatorname {span}\left(\vect {z}_{\cdot 1}, \ldots , \vect {z}_{\cdot k}\right) \]

– заданное линейное подпространство в \(\mathbb {R}^{n}\) размерности \(k<n\) (\((\vect {z}_{\cdot 1}, \ldots , \vect {z}_{\cdot k}\) – базисные вектор-столбцы пространтсва \(L\)). Параметрами описанной линейной регрессионной модели являются \(\vect {\theta }\) и \(\sigma^{2}\), об оценивании которых речь пойдет ниже.

Заметим, что в данном случае, строго говоря, согласно нашему определению \(\vect {X}\) не является выборкой размера \(n\), поскольку компоненты \(\vect {X}\) могут быть по-разному распределены. Однако \(\vect {X}\) можно рассматривать как выборку размера \(1\) из \(n\)-мерного распределения с параметрами \(\vect {\theta }, \sigma^2\). Поэтому, даже несмотря на отсутствие независимости, можно говорить, например, о существовании функции правдоподобия, применять критерии факторизации для поиска достаточных статистик и т.д. Функция правдоподобия в данном случае – это просто плотность \(n\)-мерного вектора \(\vect {X}\).

1.2 Линейная регрессия со свободным параметром

Модель

\[ X_i = \theta _0 + z_{i, 1} \theta _{1}+\ldots +z_{i, k} \theta _{k}+\varepsilon _{i}. \]

\(\theta_0\) называют свободным параметром регрессии. Имеем

\[ \vect {X} = \begin{pmatrix} X_1 \\ X_2 \\ \vdots \\ X_n \end{pmatrix} = \begin{pmatrix} 1 & z_{1,1} & \ldots & z_{1,k} \\ 1 & z_{2,1} & \ldots & z_{2,k} \\ \vdots & \vdots & \vdots \\ 1 & z_{n,1} & \ldots & z_{n,k} \end{pmatrix} \cdot \begin{pmatrix} \theta _0 \\ \theta _1 \\ \vdots \\ \theta _k \end{pmatrix} + \begin{pmatrix} \varepsilon _1 \\ \varepsilon _2 \\ \vdots \\ \varepsilon _n \end{pmatrix} = \vect {z}_{\cdot 0}\theta _0 + \vect {z}_{\cdot 1} \theta _1 + \ldots + \vect {z}_{\cdot k} \theta _k + \vect {\varepsilon } = \mathbf{z}\vect {\theta } + \vect {\varepsilon } \]

Вектор из единиц \(\vect {z}_{\cdot 0} = (1, \ldots , 1)^T\) удобно обозначать \(\overrightarrow {1}\).

1.3 Условия на ошибки \(\vect {\varepsilon }\)

На вектор ошибок \(\vect {\varepsilon }\), как правило, накладывают следующие условия:

  1. \(\mathbb {E}\left[\vect {\varepsilon }\right] = \overrightarrow {0} \in \mathbb {R}^{n}\), т.е. все ошибки центрированы;

  2. \(\operatorname {Var}\left[\vect {\varepsilon }\right] = \sigma^2 \mathbf{I}_n\), где \(\operatorname {Var}\left[\vect {\varepsilon }\right]\) – ковариационная матрица вектора \(\vect {\varepsilon }, \mathbf{I}_{n}\) – единичная диагональная матрица размера \(n \times n\). Т.е. у всех ошибок одинаковая дисперсия и разные ошибки некоррелированы. Это свойство еще называют гомоскедастичностью (homoscedasticity) от греч. ὁμός (гомос, одинаковый) + σκεδαστός (скедастос, разбросанный).

На практике указанные условия на ошибки выполнены далеко не всегда, однако зачастую исходную модель можно свести к модели, где бы условия @LinearRegr:ErrorCond2, @LinearRegr:ErrorCond3 выполнялись. Например, при выполнении прочих условий условие @LinearRegr:ErrorCond2 можно ослабить: пусть \(\mathbb {E}\left[\vect {\varepsilon }\right] = \mu \overrightarrow {1}\), т.е. у всех ошибок одинаковое, но теперь неизвестное ненулевое матожидание. Тогда от модели \(X_i = \theta_0 + z_{i, 1} \theta_{1}+\ldots +z_{i, k} \theta_{k}+\varepsilon_{i}\) можно перейти к модели

\[ X_i = \theta '_0 + z_{i, 1} \theta _{1}+\ldots +z_{i, k} \theta _{k}+\varepsilon '_{i}, \qquad \text{где} \qquad \theta '_0 = \theta _0 + \mu , \quad \varepsilon _i' = \varepsilon _i - \mu . \]

В ней уже ошибки \(\varepsilon '\) удовлетворяют условиям @LinearRegr:ErrorCond2, @LinearRegr:ErrorCond3. Подробнее о сведении модели к стандартной см. задачи ниже.

2 Оценивание параметров методом наименьших квадратов

ExampleПример 2

В условиях примера @LinearRegr:ExCoins1 попробуйте оценить \(\theta_1\) и \(\theta_2\).

Предположим для упрощения изложения, что \(\theta_1, \theta_2 \in \mathbb {R}\), т.е. массы могут быть отрицательными. Переберем все возможные значения \(\theta_1, \theta_2 \in \mathbb {R}\), тогда \(\vect {l}(\vect {\theta }) := \mathbf{z}\vect {\theta } = \vect {z}_{\cdot 1} \theta_1 + \vect {z}_{\cdot 2} \theta_2\) образует линейное подпространство \(L:= \operatorname {span}(\vect {z}_{\cdot 1} ,\vect {z}_{\cdot 2} )\) в пространстве \(\mathbb {R}^{3}\).

  • Пусть \(\vect {X} \in L\), т.е. ошибки измерений отсутствуют. \(\widehat{\theta }_1, \widehat{\theta }_2\) логично взять равными коэффициентам разложения \(\vect {X}\) по базису \(\vect {z}_{\cdot 1} , \vect {z}_{\cdot 2}\).

  • Пусть \(\vect {X} \not\in L\), т.е. ошибки измерений присутствуют. Обозначим

    \[ \widehat{\vect {X}} := \mathbf{z}\widehat{\vect {\theta }}, \qquad \widehat{\vect {\varepsilon }} := \vect {X} - \widehat{\vect {X}} = \vect {X} - \mathbf{z}\widehat{\vect {\theta }}. \] \(\widehat{\vect {X}}\) – оценка наблюдений, а \(\widehat{\vect {\varepsilon }}\) – вектор ошибок, которые получаются, если неизвестный параметр \(\vect {\theta }\) оценивать некоторой оценкой \(\widehat{\vect {\theta }} = \widehat{\vect {\theta }}(\vect {X})\). Учитывая условия на ошибки, мы хотим минимизировать \(\widehat{\vect {\varepsilon }}\).

    \(\widehat{\vect {\varepsilon }}\)\(n\)-мерная величина, соотв. необходимо выбрать некоторую норму в \(\mathbb {R}^{n}\), которую мы будем минимизировать. Наиболее удобный выбор – евклидова норма \(\left\| \vect {x}\right\| = \sqrt{x_1^2 + \ldots + x_n^2}\). В этом случае \(\widehat{\vect {X}}\) очевидно должен быть проекцией \(\vect {X}\) на \(L\), а \(\widehat{\vect {\theta }}\) – координатами этой проекции в базисе \(\vect {z}_{\cdot 1} , \vect {z}_{\cdot 2}\).

    Такая оценка параметра \(\vect {\theta }\) называется оценкой по методу наименьших квадратов, поскольку мы минимизируем суммы квадратов ошибок.

Итак, поставленная задача оценивания вектора \(\vect {\theta }\) решается с помощью метода наименьших квадратов (МНК). Оценка по методу наименьших квадратов равна

\[ \widehat{\theta }_{\text{МНК}} = \argmin _{\vect {\theta } \in \mathbb {R}^{k}}\left\| \vect {X} -\mathbf{z}\vect {\theta }\right\| ^2 \]

т.е. \(\widehat{\vect {X}}_{\text{МНК}} =\mathbf{z} \widehat{\vect {\theta }}_{\text{МНК}} = \vect {X}_{L}\) (проекция \(\vect {X}\) на \(L\)), а \(\widehat{\vect {\varepsilon }}_{\text{МНК}} = \vect {X} - \widehat{\vect {X}}_{\text{МНК}} = \vect {X} - \vect {X}_{L} = \vect {X}_{L^\perp }\). В дальнейшем для упрощения и сокращения записей везде, где будет идти речь об оценках параметров, наблюдений и ошибок, мы будем подразумевать, что оценивание производится по МНК и писать \(\widehat{\vect {\theta }}, \widehat{\vect {X}}, \widehat{\vect {\varepsilon }}\) вместо \(\widehat{\vect {\theta }}_{\text{МНК}} , \widehat{\vect {X}}_{\text{МНК}} , \widehat{\vect {\varepsilon }}_{\text{МНК}}\), хотя, вообще говоря, существуют и другие способы оценивания \(\vect {\theta }\) и моделирования выборки и ошибок.

2.1 Явная формула оценки по МНК

Найдем явную формулу для \(\widehat{\vect {\theta }}\). Решим задачу из линейной алгебры.

ExampleПример 3

Пусть \(\vect {x} \in \mathbb {R}^{n}\), пусть \(\vect {z}_{\cdot 1} , \ldots , \vect {z}_{\cdot k} \in \mathbb {R}^{n}\) – набор линейно независимых векторов. Найти \(\vect {t}\) – координаты проекции \(\vect {x}\) на \(L = \operatorname {span}(\vect {z}_{\cdot 1} , \ldots , \vect {z}_{\cdot k} )\) в базисе из \(\mathbf{z} = (\vect {z}_{\cdot 1} , \ldots , \vect {z}_{\cdot k} )\): \(\operatorname {proj}_L(\vect {x}) = \vect {x}_L = \mathbf{z}\vect {t}\).

Имеем

\[ \left\| \vect {x} - \mathbf{z}\vect {t}\right\| ^2 = \left\langle \vect {x} - \mathbf{z}\vect {t}, \vect {x} - \mathbf{z}\vect {t} \right\rangle = \left\| \vect {x}\right\| ^2 - \left\langle \vect {x}, \mathbf{z}\vect {t} \right\rangle + \left\| \mathbf{z}\vect {t}\right\| ^2 = \vect {x}^T\vect {x} - 2\vect {x}^T\mathbf{z}\vect {t} + \vect {t}^T\mathbf{z}^T\mathbf{z}\vect {t} \] Продифференцируем полученное выражение по \(t_{i}\) для каждого \(i \in \{ 1, \ldots , k\}\) и приравняем эти производные к нулю, чтобы найти искомый аргумент, при котором достигается минимум:

\[ \begin{align} -2\left(\vect {x}^T\mathbf{z}\right)_{i}+2\left(\vect {t}^T \mathbf{z}^T\mathbf{z}\right)_{i}=0 \; \iff \; \vect {x}^T\mathbf{z} - \vect {t}^T\mathbf{z}^T\mathbf{z} = 0 \; \iff \; \vect {t} = \left(\mathbf{z}^T\mathbf{z}\right)^{-1}\mathbf{z}^T\vect {x} \end{align} \] Матрицу \(\mathbf{z}\vect {t} = \mathbf{z}\left(\mathbf{z}^T\mathbf{z}\right)^{-1}\mathbf{z}^T\) называют матрицей проекции на подпространство \(L\) и обозначают \(\mathbf{P}_L\). Имеем \(\vect {x}_L = \mathbf{P}_L \vect {x}\).

\(\vect {t} = \left(\mathbf{z}^T\mathbf{z}\right)^{-1}\mathbf{z}^T\vect {x}\).

Итого, \(\widehat{\vect {\theta }} = \widehat{\vect {\theta }}(\vect {X}) = \left(\mathbf{z}^T\mathbf{z}\right)^{-1}\mathbf{z}^T\vect {X}\)

2.2 Геометрия МНК

2.2.1 Регрессия без свободного параметра

Чем лучше регрессия с подобранными по МНК оценками описывает поведение зависимой переменной \(\vect {X}\), тем меньше должна быть длина вектора ошибок \(\widehat{\vect {\varepsilon }} = \vect {X} - \vect {X}_{L}\) по сравнению с длиной вектора наблюдений \(\vect {X}\). Величина

\[ R^2 := 1 - \frac{\left\| \widehat{\vect {\varepsilon }}\right\| ^2}{\left\| \vect {X}\right\| ^2} = 1 - \frac{\sum _{i=1}^n \left(X_i - \widehat{X}_i\right)^2}{\sum _{i=1}^n X_i^2} \]

называется коэффициентом детерминации. Чем он ближе к \(1\), тем лучше регрессия.

Рассмотрим график @LinearRegr:GraphRegrWoParam. По теореме Пифагора имеем

\[ \left\| \vect {X}\right\| ^2 = \left\| \widehat{\vect {X}}\right\| ^2 + \left\| \widehat{\vect {\varepsilon }}\right\| ^2 = \left\| \vect {X}_{L}\right\| ^2 + \left\| \vect {X} - \vect {X}_{L}\right\| ^2 = \left\| \vect {X}_{L}\right\| ^2 + \left\| \vect {X}_{L^\perp }\right\| ^2 \]

  • Общую сумму квадратов наблюдений \(\left\| \vect {X}\right\|^2\) называют полной суммой квадратов или total sum of squares и обозначают \(\operatorname {TSS}\);

  • Сумму квадратов оценок наблюдений \(\left\| \widehat{\vect {X}}\right\|^2\) называют объясненной суммой квадратов или explained sum of squares и обозначают \(\operatorname {ESS}\);

  • Сумму квадратов ошибок \(\left\| \widehat{\vect {\varepsilon }}\right\|^2\) называют остаточной суммой квадратов или residual sum of squares и обозначают \(\operatorname {RSS}\).

Итого

\[ \operatorname {TSS} = \left\| \vect {X}\right\| ^2 = \sum _{i=1}^n X_i^2, \qquad \operatorname {ESS} = \left\| \widehat{\vect {X}}\right\| ^2 = \sum _{i=1}^n \widehat{X}_i^2, \qquad \operatorname {RSS} = \left\| \widehat{\vect {\varepsilon }}\right\| ^2 = \left\| \vect {X} - \widehat{\vect {X}}\right\| ^2 = \sum _{i=1}^n \left(X_i - \widehat{X}_i\right)^2 \]

По теореме Пифагора общая сумма квадратов распадается на объясненную сумму квадратов и квадраты ошибок: \(\operatorname {TSS} = \operatorname {ESS} + \operatorname {RSS}\). Коэффициент детерминации:

\[ R^2 = 1 - \frac{\left\| \widehat{\vect {\varepsilon }}\right\| ^2}{\left\| \vect {X}\right\| ^2} = 1 - \frac{\operatorname {RSS}}{\operatorname {TSS}} = 1 - \frac{\sum _{i=1}^n \left(X_i - \widehat{X}_i\right)^2}{\sum _{i=1}^n X_i^2} = \frac{\left\| \widehat{\vect {X}}\right\| ^2}{\left\| \vect {X}\right\| ^2} = \frac{\sum _{i=1}^n \widehat{X}_i^2}{\sum _{i=1}^n X_i^2} = \frac{\operatorname {ESS}}{\operatorname {TSS}} \]

У коэффициента детерминации есть несколько интерпретаций. С одной стороны это та доля разброса в зависимой переменной \(\vect {X}\), которую удалось “объяснить” нашей моделью: \(\operatorname {ESS}/\operatorname {TSS}\).

С другой стороны можно сказать, что наша построенная модель \(\widehat{\vect {X}}\) сравнивается с единственной моделью для объяснения \(\vect {X}\), которую можно предложить при отсутствии регрессоров, – с моделью \(\vect {X} = \overrightarrow {0} + \vect {\varepsilon }\), т.е. \(\vect {X}\) – просто шум из независимых одинаково распределенных центрированных ошибок. Коэффициент детерминации в этом подходе – это единица минус разброс в первой модели к разбросу во второй: \(1 - \operatorname {RSS}/\operatorname {TSS}\). Чем он ближе к единице, тем лучше наша модель работает по сравнению с самой тривиальной моделью.

Простую модель, с которой сравнивают более сложные модели, называют эталонной моделью или базовой моделью (англ. benchmark model). В данном случае базовая модель – независимый одинаково распределенный шум. \(\operatorname {TSS}\) – сумма квадратов ошибок при использовании такой модели. \(\operatorname {ESS}\) – сумма квадратов разницы меджу базовой моделью и нашей моделью.

2.2.2 Регрессия со свободным параметром

При наличии свободного параметра \(\theta_0\) меняется базовая модель для сравнений. Теперь при отсутствии регрессоров лучшая модель для объяснения \(\vect {X}\) – модель суммы константы \(\theta_0\) и шума \(\vect {\varepsilon }\). Оценка \(\theta_0\), минимизирующая сумму квадратов ошибок в такой модели, – выборочное среднее \(\overline{\vect {X}}\). Базовая модель для моделирования \(\vect {X}\):

\[ \left(\overline{\vect {X}}, \ldots , \overline{\vect {X}}\right)^T = \overline{\vect {X}} \cdot \overrightarrow {1}, \]

где \(\overrightarrow {1} = (1, \ldots , 1)^T\) – вектор из \(\mathbb {R}^{n}\), составленный из единиц.

\(\operatorname {TSS}\), \(\operatorname {ESS}\) – сумма квадратов ошибок при использовании базовой модели и сумма квадратов разницы между базовой моделью и нашей моделью соотв. Их расчет теперь тоже меняется. Расчет \(\operatorname {RSS}\) остается прежним. Имеем

\[ \operatorname {TSS} = \left\| \vect {X} - \overline{\vect {X}}\cdot \overrightarrow {1}\right\| ^2 = \sum _{i=1}^n (X_i - \overline{\vect {X}})^2, \qquad \operatorname {ESS} = \left\| \widehat{\vect {X}} - \overline{\vect {X}}\cdot \overrightarrow {1}\right\| ^2 = \sum _{i=1}^n (\widehat{X}_i- \overline{\vect {X}})^2, \qquad \operatorname {RSS} = \left\| \vect {X} - \widehat{\vect {X}}\right\| ^2 = \sum _{i=1}^n \left(X_i - \widehat{X}_i\right)^2 \]

Рассмотрим график @LinearRegr:GraphRegrWithParam. По теореме Пифагора для треугольника \(ABD\) снова имеем (помните, что \(\widehat{\vect {X}} = \vect {X}_{L}\) при построении модели по МНК):

\[ \operatorname {TSS} = \left\| \vect {X} - \overline{\vect {X}}\cdot \overrightarrow {1}\right\| ^2 = \left|AD\right|^2 = \left|BD\right|^2 + \left|AB\right|^2 = \left\| \widehat{\vect {X}} - \overline{\vect {X}}\cdot \overrightarrow {1}\right\| ^2 + \left\| \vect {X} - \widehat{\vect {X}}\right\| ^2 = \operatorname {ESS} + \operatorname {RSS} \]

Коэффициент детерминации:

\[ R^2 = 1 - \frac{\operatorname {RSS}}{\operatorname {TSS}} = 1 - \frac{\sum _{i=1}^n \left(X_i - \widehat{X}_i\right)^2}{\sum _{i=1}^n (X_i - \overline{\vect {X}})^2} = \frac{\operatorname {ESS}}{\operatorname {TSS}} = \frac{\sum _{i=1}^n \left(\overline{\vect {X}} - \widehat{X}_i\right)^2}{\sum _{i=1}^n (X_i - \overline{\vect {X}})^2} \]

Для одной и той же выборки коэффициент детерминации для модели со свободным параметром может оказаться как больше, так и меньше коэффициента детерминации модели без него, несмотря на то, что первая модель, очевидно, более вариативна.

2.3 Свойства оценок по МНК

Напомним, \(\widehat{\vect {\theta }} = \left(\mathbf{z}^T\mathbf{z}\right)^{-1}\mathbf{z}^T\vect {X}\). Обозначим \(\widetilde{k}\) количество столбцов матрицы \(\mathbf{z}\):

\[ \widetilde{k} := \begin{cases} k, & \text{ если в регрессии нет свободного параметра }\theta _0;\\ k+1 , & \text{ если в регрессии есть свободный параметр }\theta _0. \end{cases} \]

  1. Матожидание и ковариационная матрица \(\widehat{\vect {\theta }}\):

    \[ \mathbb {E}_{\vect {\theta }, \sigma ^2}\left[\widehat{\vect {\theta }}\right] = \vect {\theta }, \qquad \Var [\vect {\theta }, \sigma ^2]{\widehat{\vect {\theta }}} = \sigma ^2 \left(\mathbf{z}^T \mathbf{z}\right)^{-1} \] Таким образом, оценка по методу наименьших квадратов является несмещенной.

  2. Зная ковриационную матрицу вектора \(\widehat{\vect {\theta }}\), можно найти математическое ожидание расстояния от \(\vect {X}\) до подпространства \(L \subset \mathbb {R}^{n}\):

    \[ \mathbb {E}_{\vect {\theta }, \sigma ^2}\left[\left\| \vect {X} - \underbrace{\mathbf{z}\widehat{\vect {\theta }}}_{=\vect {X}_{L} = \widehat{\vect {X}}}\right\| ^2\right] = \mathbb {E}_{\vect {\theta }, \sigma ^2}\left[\left\| \underbrace{\widehat{\vect {\varepsilon }}}_{=\vect {X}_{L^\perp }}\right\| ^2\right] = \mathbb {E}_{\vect {\theta }, \sigma ^2}\left[\operatorname {RSS}\right] = \left(n-\widetilde{k}\right)\sigma ^2 \] Последнее равенство дает несмещенную оценку параметра \(\sigma^{2}\):

    \[ \widehat{\sigma ^{2}} = \frac{1}{n-\widetilde{k}}\| \vect {X}-\mathbf{z} \widehat{\vect {\theta }}\| ^{2} = \frac{\operatorname {RSS}}{n-\widetilde{k}}. \]

ExampleПример 4

Имеется 2 куска сыра с весами \(\theta_1\) и \(\theta_2\). На одних и тех же весах взвесили первый, второй и потом оба куска вместе. Найдите оценки наименьших квадратов для \(\theta_1\) и \(\theta_2\), а также несмещенную оценку дисперсии ошибки измерений. Найдите коэфф. детерминации.

Пусть взвешивания показали результаты \(X_{1}, X_{2}, X_{3}\). Положим \(\vect {X}=\left(X_{1}, X_{2}, X_{3}\right)^{T}\). Тогда

\[ \vect {X} =\mathbf{z}\vect {\theta } + \vect {\varepsilon }, \quad \text{где} \quad \mathbf{z} = \begin{pmatrix} 1 & 0 \\ 0 & 1 \\ 1 & 1 \end{pmatrix}, \quad \vect {\theta } = \begin{pmatrix} \theta _1 \\ \theta _2 \end{pmatrix}, \quad \vect {\varepsilon } = \begin{pmatrix} \varepsilon _1 \\ \varepsilon _2 \\ \varepsilon _3 \end{pmatrix} \] Тогда

\[ \begin{align} \widehat{\vect {\theta }} & = \left(\begin{array}{c} \widehat{\theta }_1 \\ \widehat{\theta }_2 \end{array}\right)=\left(\mathbf{z}^{T} \mathbf{z}\right)^{-1} \mathbf{z}^{T} \vect {X}=\left(\begin{array}{c} \frac{2}{3} X_{1}-\frac{1}{3} X_{2}+\frac{1}{3} X_{3} \\ -\frac{1}{3} X_{1}+\frac{2}{3} X_{2}+\frac{1}{3} X_{3} \end{array}\right) \\ \widehat{\vect {X}} & = \mathbf{z} \widehat{\vect {\theta }} = \begin{pmatrix} \widehat{\theta }_1 \\ \widehat{\theta }_2 \\ \widehat{\theta }_1 + \widehat{\theta }_2 \\ \end{pmatrix} = \begin{pmatrix} \frac{2}{3} X_{1}-\frac{1}{3} X_{2}+\frac{1}{3} X_{3} \\ -\frac{1}{3} X_{1}+\frac{2}{3} X_{2}+\frac{1}{3} X_{3} \\ \frac{1}{3} X_{1}+\frac{1}{3} X_{2}+\frac{2}{3} X_{3} \\ \end{pmatrix} \\ \widehat{\sigma ^{2}} & = \frac{1}{3-2}\operatorname {RSS} = \| \vect {X}-\mathbf{z} \widehat{\vect {\theta }}\| ^{2}=\left(X_{1}-\widehat{\theta }_1\right)^{2}+\left(X_{2}-\widehat{\theta }_2\right)^{2}+\left(X_{3}-\widehat{\theta }_1-\widehat{\theta }_2\right)^{2}= \\ & =\frac{X_{1}^{2}+X_{2}^{2}+X_{3}^{2}}{3}-\frac{2\left(X_{1} X_{2}+X_{1} X_{3}+X_{2} X_{3}\right)}{9} \end{align} \] Далее, мы имеем регрессию без свободного члена. Соотв.

\[ \begin{align} \operatorname {ESS} & = \sum _{i=1}^3 \widehat{X}_i^2 = \left(\frac{2}{3} X_{1}-\frac{1}{3} X_{2}+\frac{1}{3} X_{3}\right)^2 + \left(-\frac{1}{3} X_{1}+\frac{2}{3} X_{2}+\frac{1}{3} X_{3}\right)^2 + \left(\frac{1}{3} X_{1}+\frac{1}{3} X_{2}+\frac{2}{3} X_{3}\right)^2 = \\ & = \frac{2}{3}X_1^2 + \frac{2}{3}X_2^2 + \frac{2}{3}X_3^2 - \frac{2}{3}X_1X_2 + \frac{2}{3}X_1X_3 + \frac{2}{3}X_2X_3\\ \operatorname {TSS} & = \sum _{i=1}^3 X_i^2 = X_1^2 + X_2^2 + X_3^2\\ R^2 & = \frac{\operatorname {ESS}}{\operatorname {TSS}} = \frac{2}{3}\frac{X_1^2 + X_2^2 + X_3^2 - X_1X_2 + X_1X_3 + X_2X_3}{X_1^2 + X_2^2 + X_3^2} \end{align} \]

ProblemЗадача 1

В четырехугольнике \(A B C D\) независимые равные по точности измерения углов \[ A B D, D B C, A B C, B C D, C D B, B D A, C D A, D A B \] в градусах дали результаты \[ 50.78, 30.25,78.29,99.57,50.42,40.59,88.87,89.86 \] соответственно. Считая, что ошибки измерений распределены независимо, у них одинаковая дисперсия \(\sigma^2\) и нулевое матожидание, найдите оценки по МНК углов \(\beta_{1}=A B D, \beta_{2}=D B C, \beta_{3}=C D B, \beta_{4}=B D A\) и неизвестной дисперсии \(\sigma^{2}\). Найдите коэфф. детерминации.

ProblemЗадача 2

Пусть \[ X_{i}=\theta _0+i \theta _1+\varepsilon _{0}+\ldots +\varepsilon _{i}, \] \(i=0,1, \ldots , n\), где \(\theta_0, \theta_1\) – неизвестные параметры, a случайные величины \(\varepsilon_{0}, \ldots , \varepsilon_{n}\) распределены независимо, у них одинаковая дисперсия \(\sigma^2\) и нулевое матожидание. Сведите задачу к линейной модели и найдите оценки наименьших квадратов для \(\theta_0\) и \(\theta_1\), а также несмещенную оценку для \(\sigma^{2}\). Найдите коэфф. детерминации \(R^2\).

ProblemЗадача 3
  1. Докажите, что
$$
  \mathbb {E}_{\vect {\theta }, \sigma ^2}\left[\widehat{\vect {\theta }}\right] = \vect {\theta }, \qquad \Var [\vect {\theta }, \sigma ^2]{\widehat{\vect {\theta }}} = \sigma ^2 \left(\mathbf{z}^T \mathbf{z}\right)^{-1}  
$$
  1. Докажите, что
$$
  \mathbb {E}_{\vect {\theta }, \sigma ^2}\left[\underbrace{\left\| \vect {X} - \mathbf{z}\widehat{\vect {\theta }}\right\| ^2}_{=\operatorname {RSS}}\right] = (n-\widetilde{k})\sigma ^2 \qquad  
$$
и

$$
  \widehat{\sigma ^{2}} = \frac{1}{n-\widetilde{k}} \left\| \vect {X} - \mathbf{z}\widehat{\vect {\theta }}\right\| ^2  
$$
– это несмещенная оценка $\sigma^2$.

Если \(\vect {\xi }\) – случайный вектор размерности \(n\), то его ковариационную матрицу можно посчитать так: \[ \operatorname {Var}\left[\vect {\xi }\right] = \mathbb {E}\left[\vect {\xi } \cdot \vect {\xi }^T\right] - \mathbb {E}\left[\vect {\xi }\right] \cdot \left(\mathbb {E}\left[\vect {\xi }\right]\right)^T. \] Кроме того, если \(A \in \mathbb {R}^{m \times n}\) – матрица рказмерности \(m \times n\), то \(A\vect {\xi }\) – это новый случайный вектор размерности \(m\), причем его ковариационная матрица и ковариационная матрица исходного вектора связаны так: \[ \operatorname {Var}\left[A \vect {\xi }\right] = A \cdot \operatorname {Var}\left[\vect {\xi }\right] \cdot A^T \]

3 Гауссовская линейная регрессия

Вторую половину настоящей главы мы посвятим исключительно важному для приложения частному случаю линейной регрессионной модели, а именно гауссовской линейной модели. Речь идет о модели линейной регрессии \(\vect {X}=\mathbf{z}\vect {\theta }+\vect {\varepsilon }\), в которой \(\vect {\varepsilon } \sim \mathscr {N}\left(\overrightarrow {0}, \sigma^2 \mathbf{I}_n\right)\).

Заметим, что \(\vect {X} \sim \mathscr {N}\left(\mathbf{z}\vect {\theta }, \sigma^{2} \mathbf{I}_{n}\right)\) Как уже говорилось, \(\vect {X}\) можно рассматривать как выборку размера \(1\) из \(n\)-мерного распределения, в данном случае гауссовского. Оно имеет плотность относительно меры Лебега на \(\mathbb {R}^{n}\):

\[ p_{\vect {\theta }, \sigma ^2}(\vect {x}) = \frac{1}{\sqrt{(2\pi \sigma ^2)^n}} \exponent {-\frac{1}{2\sigma ^2}\left(\vect {x} - \mathbf{z}\vect {\theta }\right)^T \left(\vect {x} - \mathbf{z}\vect {\theta }\right)} = \frac{1}{\sqrt{(2\pi \sigma ^2)^n}} \exponent {-\frac{1}{2\sigma ^2} \left\| \vect {x} - \mathbf{z}\vect {\theta }\right\| ^2}, \qquad \vect {x} \in \mathbb {R}^{n} \]

3.1 Полная, достаточная статистика. Оптимальные оценки

В гауссовской линейной модели статистика \(\left(\vect {X}_{L}, \left\| \vect {X}_{L^\perp }\right\|^2\right)\) – полная и достаточная.

В гауссовской линейной модели статистика \(\left(\widehat{\vect {\theta }}, \widehat{\sigma^2}\right)\) – полная и достаточная.

ProblemЗадача 4

Докажите теор. @LinearRegr:GaussRegrCompleteSufStat. Докажите следствие @LinearRegr:GaussRegrCompleteSufStat2.

Из обычной модели регрессии известно, что

\[ \widehat{\vect {\theta }} = \argmin _{\vect {t} \in \mathbb {R}^{k}} \left\| \vect {X} - \mathbf{z}\vect {t}\right\| = \left(\mathbf{z}^T\mathbf{z}\right)^{-1}\mathbf{z}^T \vect {X}, \quad \widehat{\sigma ^2} = \frac{1}{n-\widetilde{k}} \left\| \vect {X} - \mathbf{z}\widehat{\vect {\theta }}\right\| ^2 = \frac{1}{n-\widetilde{k}} \left\| \vect {X} - \vect {X}_{L}\right\| ^2 = \frac{1}{n-\widetilde{k}}\left\| \vect {X}_{L^\perp }\right\| ^2 \]

являются несмещенными оценками \(\vect {\theta }, \sigma^2\). Они являются функциями от полной, достаточной статистики, следовательно, в силу теоремы Лемана-Шеффе, \(\widehat{\vect {\theta }}, \widehat{\sigma^2}\) – оптимальные оценки \(\vect {\theta }, \sigma^2\) в модели гауссовской регрессии.

ProblemЗадача 5

Взвешивание трех грузов массами \(a\) и \(b\) производится следующим образом: \(n_{1}\) раз взвешивается первый груз (все ошибки измерения имеют распределение \(\left.\mathscr {N}\left(0, \sigma^{2}\right)\right), n_{2}\) раза взвешивается второй груз на тех же самых весах, затем \(n_{3}\) раза на других весах взвешиваются первый и второй груз вместе, все ошибки измерения на которых имеют распределение \(\mathscr {N}\left(0, 3 \sigma^{2}\right)\). Сведите задачу к линейной модели и найдите оценки наименьших квадратов для \(a\) и \(b\), а также оптимальную оценку для \(\sigma^{2}\).

ProblemЗадача 6

Пусть вектор \(\vect {X}=\left(X_{1}, \ldots , X_{n}\right)^T\) имеет распределение \(\mathscr {N}\left(a \cdot \vect {b}, \sigma^{2} \vect {\Sigma }\right)\), где \(\vect {b}\) – известный вектор размерности \(n\), \(\vect {\Sigma }\) – известная положительно определённая матрица, \(a\) и \(\sigma^{2}\)- неизвестные параметры. Сведите задачу к линейной гауссовской модели и найти оценки наименьших квадратов параметров \(a\) и \(\sigma^{2}\).

3.2 Доверительные интервалы для параметров

Мы построили точечные несмещенные оценки параметров линейной модели, которые в гауссовском случае оказались оптимальными. Построим в этом случае доверительные интервалы для упомянутых параметров.

Введем для этого новые классы распределений.

Определение 1 Пусть \(X_1, X_2, \ldots\) – последовательность независимых ст. нормальных случайных величин.

  • Случайная величина \(\xi^{(n)} = X_1^2 + \ldots + X_n^2\) имеет распредеелние хи-квадрат с \(n\) степенями свободы. Обозначение: \(\xi^{(n)} \sim \chi^2_n\). Можно доказать, что хи-квадрат распределение – это частный случай гамма-распределения: \(\chi^2_n = \Gamma \left(\frac{n}{2}, \frac{1}{2}\right)\).

  • Пусть \(\xi , \eta\)- независимые случайные величины, распределенные по законам \(\mathcal{N}(0,1), \chi_{n}^{2}\) соответственно. Тогда случайная величина

    \[ \frac{\xi }{\sqrt{\eta / n}} \] имеет распределение Стьюдента с \(n\) степенями свободы (обозначается \(T_n\)).

Нам понадобится следующая теорема. [Теорема Кокрена (Cochran) об ортогональном разложении гауссовского вектора] Пусть

\[ \vect {X} \sim \mathscr {N}\left(\vect {a}, \sigma ^2 \mathbf{I}_n\right), \]

пусть \(L_{1} \oplus \ldots \oplus L_{r}\) – разложение \(\mathbb {R}^{n}\) в прямую сумму ортогональных подпространств. Для каждого \(j \in \{ 1, \ldots , r\}\) положим \(\vect {X}_{L_j} := \operatorname {proj}_{L_{j}} \vect {X}\). Тогда \(\vect {X}_{L_1}, \ldots , \vect {X}_{L_r}\) – независимые в совокупности, причем

\[ \frac{1}{\sigma ^2}\left\| \vect {X}_{L_j} - \mathbb {E}\left[\vect {X}_{L_j}\right]\right\| ^2 \sim \chi ^2_{\dim (L_j)} \]

ProblemЗадача 7

Пусть \(\vect {X} = \left(X_{1}, \ldots , X_{n}\right)^T\)- выборка из нормального распределения с параметрами \(\left(a, \sigma^{2}\right)\). Докажите, что статистики \(\bar{X}\) и \[ S^{2}=\frac{1}{n} \sum _{i=1}^{n}\left(X_{i}- \overline{\vect {X}}\right)^{2} \] независимы и вычислите распределение статистики \(n S^{2}\).

Воспользуемся теоремой @LinearRegr:CochranTheorem, разложим вектор \(\vect {X} \sim \mathscr {N}\left(\mathbf{z}\vect {\theta }, \sigma^2 \mathbf{I}_n\right)\) по подпространствам \(L, L^\perp \subset \mathbb {R}^{n}\), где

\[ \begin{align} L & = \operatorname {span}\left(\vect {z}_{\cdot 1}, \vect {z}_{\cdot 2}, \ldots , \vect {z}_{\cdot k}\right), \qquad \text{если в регрессии нет свободного параметра } \theta _0 \\ L & = \operatorname {span}\left(\overrightarrow {1}, \vect {z}_{\cdot 1}, \vect {z}_{\cdot 2}, \ldots , \vect {z}_{\cdot k}\right), \qquad \text{если в регрессии есть свободный параметр } \theta _0 \end{align} \]

Тогда векторы \(\vect {X}_{L}, \vect {X}_{L^\perp }\) – независимые гауссовские случайные векторы. Заметим, что \(\widehat{\vect {\theta }}\) линейно зависит от \(\vect {X}_{L}\), следовательно \(\widehat{\vect {\theta }}, \vect {X}_{L^\perp }\) – независимые гауссовские векторы. \(\widehat{\sigma^2}\) – функция от \(\vect {X}_{L^\perp }\), следовательно \(\widehat{\vect {\theta }}, \widehat{\sigma^2}\) – независимы. При этом

\[ \begin{align} \widehat{\vect {\theta }} & = \left(\mathbf{z}^T\mathbf{z}\right)^{-1}\mathbf{z}^T \vect {X} , \qquad \mathbb {E}\left[\vect {\theta }\right] = \vect {\theta }\\ \operatorname {Var}\left[\widehat{\vect {\theta }}\right] & = \left(\mathbf{z}^T\mathbf{z}\right)^{-1}\mathbf{z}^T \operatorname {Var}\left[\vect {X}\right] \mathbf{z} (\left(\mathbf{z}^T\mathbf{z}\right)^{-1})^T = \sigma ^2 \left(\mathbf{z}^T\mathbf{z}\right)^{-1}\mathbf{z}^T \mathbf{z} (\left(\mathbf{z}^T\mathbf{z}\right)^{-1})^T = \sigma ^2 (\left(\mathbf{z}^T\mathbf{z}\right)^{-1})^T = \sigma ^2 (\mathbf{z}^T \mathbf{z})^{-1} \\ \widehat{\vect {\theta }} & \sim \mathscr {N}\left(\vect {\theta }, \sigma ^2 (\mathbf{z}^T \mathbf{z})^{-1}\right)\\ \vect {X}_{L^\perp } & = \vect {X} - \mathbf{z}\widehat{\vect {\theta }}, \qquad \mathbb {E}\left[\vect {X}_{L^\perp }\right] = \mathbb {E}\left[\vect {X} - \mathbf{z} \widehat{\vect {\theta }}\right] = \mathbf{z}\vect {\theta } - \mathbf{z}\vect {\theta } = \Vec {0}\\ \frac{1}{\sigma ^2} \left\| \vect {X}_{L^\perp } - \mathbb {E}\left[\vect {X}_{L^\perp }\right]\right\| ^2 & = \frac{1}{\sigma ^2 } \left\| \vect {X}_{L^\perp }\right\| ^2 = \frac{n-\widetilde{k}}{\sigma ^2}\widehat{\sigma ^2} \sim \chi ^2_{n-\widetilde{k}} \end{align} \]

Пусть \(\left(\mathbf{z}^T\mathbf{z}\right)^{-1} =: (a_{i,j})\). Тогда

\[ \frac{\widehat{\vect {\theta }} - \vect {\theta }}{\sqrt{\sigma ^2}} \sim \mathscr {N}\left(\overrightarrow {0}, (\mathbf{z}^T \mathbf{z})^{-1}\right), \qquad \frac{\widehat{\theta }_i - \theta _i}{\sqrt{a_{i,i}\sigma ^2}} \sim \mathscr {N}\left(0, 1\right), \; \forall i \in \left\{ 1,\ldots ,n\right\} \]

Итого, \(\frac{\widehat{\theta }_i - \theta_i}{\sqrt{a_{i,i}\sigma^2}}, \frac{n-\widetilde{k}}{\sigma^2}\widehat{\sigma^2}\) – 2 независимые случайные величины, причем первая распределена по \(\mathscr {N}\left(0, 1\right)\), а вторая по \(\chi^2_{n-\widetilde{k}}\). Тогда, по определению распределения Стьюдента, имеем

\[ \begin{align} \frac{\frac{\widehat{\theta }_i - \theta _i}{\sqrt{a_{i,i}\sigma ^2}}}{\sqrt{\frac{n-\widetilde{k}}{\sigma ^2}\widehat{\sigma ^2}} / \sqrt{n-\widetilde{k}}} = \frac{\widehat{\theta }_i - \theta _i}{\sqrt{a_{i,i}\widehat{\sigma ^2}}} & \sim T_{n-\widetilde{k}} \end{align} \]

ExampleПример 5

В гауссовской линейной модели найдите доверительные интервалы для параметров \(\theta_{i}, i \in \{ 1, \ldots , k\}\), и \(\sigma^{2}\) уровня доверия \(\gamma\).

  • Обозначим \(a_{i, i}, i \in \{ 1, \ldots , n\}\), диагональный элемент матрицы \(\left(\mathbf{z}^{T} \mathbf{z}\right)^{-1}\), стоящий на \(i\)-ом месте. Тогда по теореме об ортогональном разложении случайная величина

    \[ \frac{\widehat{\theta }_{i}-\theta _{i}}{\sqrt{a_{i, i} \widehat{\sigma ^{2}}}} \] имеет распределение \(T_{n-\widetilde{k}}\). Пусть \(Q_{T_{n-\tilde{k}}}(\cdot )\) – квантильная функция распределения \(T_{n-\tilde{k}}\). Тогда

    \[ \mathbb {P}_{\vect {\theta }, \sigma ^{2}}\left(Q_{T_{n-\tilde{k}}}\left(\frac{1-\gamma }{2}\right)<\frac{\widehat{\theta }_{i}-\theta _{i}}{\sqrt{a_{i, i} \widehat{\sigma ^{2}}}} < Q_{T_{n-\tilde{k}}}\left(\frac{1+\gamma }{2}\right) \right) =\gamma , \] откуда получаем, что доверительный интервал уровня доверия \(\gamma\) для \(\theta_{i}\) равен

    \[ \left(\widehat{\theta }_{i}-\sqrt{a_{i, i} \widehat{\sigma ^{2}}}Q_{T_{n-\tilde{k}}}\left(\frac{1+\gamma }{2}\right), \widehat{\theta }_{i}-\sqrt{a_{i, i} \widehat{\sigma ^{2}}} Q_{T_{n-\tilde{k}}}\left(\frac{1-\gamma }{2}\right)\right) \]

  • Далее, пусть \(Q_{\chi_{n-\tilde{k}}^2}(\cdot )\) – квантильная функция распределения \(\chi_{n-\tilde{k}}^2\). Тогда

    \[ \mathbb {P}_{\vect {\theta }, \sigma ^{2}}\left(\frac{(n-\widetilde{k}) \widehat{\sigma ^{2}}}{\sigma ^{2}}>Q_{\chi _{n-\tilde{k}}^2}(1 - \gamma )\right) = \gamma \] Доверительный интервал уровня доверия \(\gamma\) для \(\sigma^{2}\) равен

    \[ \left(0, \frac{(n-\widetilde{k}) \widehat{\sigma ^{2}}}{Q_{\chi _{n-\tilde{k}}^2}(1 - \gamma )}\right). \]

ProblemЗадача 8

Пусть \(X_{1}, \ldots , X_{n}\) – выборка из \(\mathscr {N}\left(a, \sigma^{2}\right)\) (оба параметра неизвестны). Постройте точные доверительные интервалы для каждого из параметров \(a, \sigma^{2}\).

ProblemЗадача 9

Пусть \(X_{i}, i \in \{ 1, \ldots , n\}\) – независимые случайные величины, распределенные по нормальному закону с параметрами \(\left(a+b i, \sigma^{2}\right), \; a,b \in \mathbb {R}, \; \sigma^2 \in \mathbb {R}_+\). Постройте точные доверительные интервалы для параметров \(a, b, \sigma^{2}\).

4 Регрессия со случайными регрессорами

У исследователя не всегда есть возможность контролировать регрессоры \(\mathbf{z}\). В общем случае их тоже можно считать случайными:

\[ \vect {X} = \mathbf{Z}\vect {\theta } + \vect {\varepsilon }, \]

где \(\mathbf{Z}\) – случайный элемент со значениями в пространстве \(\mathbb {R}^{n \times \widetilde{k}}\). Предпосылки на ошибки здесь такие же, как в @LinearRegr:ErrorConds, но все матожидания меняются на условные по \(\mathbf{Z}\):

  1. \(\mathbb {E}\left[\vect {\varepsilon }\right][\mathbf{Z}] = \overrightarrow {0} \in \mathbb {R}^{n}\);

  2. \(\operatorname {Var}\left[\vect {\varepsilon }\right][\mathbf{Z}] = \mathbb {E}\left[\vect {\varepsilon }\vect {\varepsilon }^T\right][\mathbf{Z}] - \mathbb {E}\left[\vect {\varepsilon }\right][\mathbf{Z}] \cdot \mathbb {E}\left[\vect {\varepsilon }^T\right][\mathbf{Z}] = \sigma^2 \mathbf{I}_n\).

Все результаты, полученные выше, сохраняются, если заменить матожидания и распределения на условные матожидания и условные распределения по \(\mathbf{Z}\). Например, в случае гауссовской регрессии теперь имеем \(\operatorname {Law}\left(\widehat{\vect {\theta }} \mid \mathbf{Z}\right) = \mathscr {N}\left(\vect {\theta }, \sigma^2 \left(\mathbf{Z}^T\mathbf{Z}\right)^{-1}\right)\).

Отличие состоит в том, напрмер, что теперь не так просто получить безусловное распределение \(\operatorname {Law}\left(\widehat{\vect {\theta }}\right)\), поскольку распределение \(\mathbf{Z}\) может быть произвольным. Однако если условное распределение не зависит от \(\mathbf{Z}\), как, например, в этих случаях:

\[ \operatorname {Law}\left(\frac{n-\widetilde{k}}{\sigma ^2}\widehat{\sigma ^2} \right)[\mathbf{Z}][\bigg] = \chi ^2_{n-\widetilde{k}}, \qquad \operatorname {Law}\left(\frac{\widehat{\theta }_i - \theta _i}{\sqrt{a_{i,i}\widehat{\sigma ^2}}}\right)[\mathbf{Z}][\bigg] = T_{n-\widetilde{k}}, \]

то от условного распределения можно перейти к безуловному:

\[ \operatorname {Law}\left(\frac{n-\widetilde{k}}{\sigma ^2}\widehat{\sigma ^2} \right) = \chi ^2_{n-\widetilde{k}}, \qquad \operatorname {Law}\left(\frac{\widehat{\theta }_i - \theta _i}{\sqrt{a_{i,i}\widehat{\sigma ^2}}}\right) = T_{n-\widetilde{k}} \]