Линейная регрессия

Дата публикации

2 сентября 2026

ПредупреждениеЧерновик

Этот конспект ещё находится в процессе редактуры: в тексте могут встречаться опечатки, неточности и локально не проработанные места. Если что-то нашли — сообщите, пожалуйста, автору (контакты на странице курса).

В данной главе \(\vec{X}\) – это наблюдения.

1 Постановка задачи

В этой главе мы рассмотрим достаточно специальную, но широко применимую задачу теории оценивания статистических параметров. Наблюдением в этой задаче уже будет являться не выборка (набор независимых случайных величин), а вектор, составленный из случайных величин, распределения которых различны.

1.1 Линейная регрессия без свободного параметра

ExampleПример 1

Имеется 2 монеты разного достоинства, их массы \(\theta_1\) и \(\theta_2\) неизвестны. На одних и тех же весах взвесили отдельно первую монету, отдельно вторую, и затем обе монеты вместе. Составьте статистическую модель эксперимента. Попробуйте оценить \(\theta_1\) и \(\theta_2\).

SolutionРешение

Обозначим результаты взвешиваний \(X_{1}, X_{2}, X_{3}\). Если бы весы показывали безошибочные измерения, то тогда бы выполнялось

\[ \begin{pmatrix} X_1 \\ X_2 \\ X_3 \end{pmatrix} = \begin{pmatrix} \theta _1 \\ \theta _2 \\ \theta _1 + \theta _2 \end{pmatrix} = \theta _1 \cdot \begin{pmatrix} 1 \\ 0 \\ 1 \end{pmatrix} + \theta _2 \cdot \begin{pmatrix} 0 \\ 1 \\ 1 \end{pmatrix} \]

или кратко

\[ \vec{X} = \theta _1 \cdot \vec{z}_{\cdot 1} + \theta _2 \cdot \vec{z}_{\cdot 2} = \mathbf{z} \cdot \vec{\theta } \]

где

\[ \vec{X} = \begin{pmatrix} X_1 \\ X_2 \\ X_3 \end{pmatrix}, \quad \mathbf{z} = (\vec{z}_{\cdot 1} \; \vec{z}_{\cdot 2} ) = \begin{pmatrix} 1 & 0 \\ 0 & 1 \\ 1 & 1 \end{pmatrix}, \quad \vec{\theta } = \begin{pmatrix} \theta _1 \\ \theta _2 \end{pmatrix} \]

В этом случае \(\vec{X}\) неслучаен, линейно зависим от \(\vec{\theta }\). 3-е измерение излишне, достаточно было первых 2-х для оценивания \(\vec{\theta }\).

На практике любые весы допускают ошибку, причем она будет немного отличаться в каждом эксперименте. Ошибки в различных экспериментах можно считать случайными величинами. Обозначим их \(\vec{\varepsilon } = (\varepsilon_1, \varepsilon_2, \varepsilon_3)^T\). Тогда стат. модель:

\[ \vec{X} = \mathbf{z} \cdot \vec{\theta } + \vec{\varepsilon }, \]

где \(\mathbf{z}\vec{\theta }\) – неизвестный неслучайный вектор, \(\vec{\varepsilon }\) – случайный вектор ошибок. Благодаря \(\vec{\varepsilon }\) вектор наблюдений \(\vec{X}\) становится случайным.

В общем случае дан мешок монет \(k\) разных видов, \(\theta_{1}\) – масса монеты 1 вида, \(\ldots\), \(\theta_{k}\) – масса монеты \(k\) вида. Исследователь оценивает массы монет. Для этого он \(n\) раз взвешивает комбинации монет: на шаге \(i \in \left\{ 1,\ldots , n\right\}\) он взвешивает \(z_{i,1}\) монет вида 1, \(\ldots\), \(z_{i,k}\) монет вида \(k\). Если весы работают безошибочно, то значения измерений будут равны линейным комбинациям \(\theta_{1}, \ldots , \theta_{k}\). Но так как ошибки все же имеются, то наблюдаемая величина, полученная при \(i\)-ом взвешивании \((i \in \{ 1, \ldots , n\} )\) равна

\[ X_i = z_{i, 1} \theta _{1}+\ldots +z_{i, k} \theta _{k}+\varepsilon _{i}, \]

где \(z_{i, j} \in \mathbb {R}\) – известные коэффициенты линейной комбинации, \(k\) – количество монет, участвующих в \(i\)-ом взвешивании, \(\varepsilon_{i}\)- ошибка измерения при \(i\)-ом взвешивании. Вся выборка \(\vec{X}\):

\[ \begin{align} \begin{pmatrix} X_1 \\ X_2 \\ \vdots \\ X_n \end{pmatrix} & = \underbrace{\begin{pmatrix} z_{1, 1} \theta _{1}+\ldots +z_{1, k} \theta _{k} \\ z_{2, 1} \theta _{1}+\ldots +z_{2, k} \theta _{k} \\ \vdots \\ z_{n, 1} \theta _{1}+\ldots +z_{n, k} \theta _{k} \end{pmatrix}}_{= \vec{z}_{\cdot 1} \theta _1 + \ldots + \vec{z}_{\cdot k} \theta _k} + \underbrace{\begin{pmatrix} \varepsilon _1 \\ \varepsilon _2 \\ \vdots \\ \varepsilon _n \end{pmatrix}}_{=\vec{\varepsilon }} \end{align} \]

сокращенно:

\[ \vec{X} = \mathbf{z}\vec{\theta } + \vec{\varepsilon }, \]

где

\[ \begin{align} \vec{z}_{\cdot 1} & = \begin{pmatrix} z_{1,1} \\ z_{2,1} \\ \vdots \\ z_{n,1} \end{pmatrix}, \ldots , \vec{z}_{\cdot k} = \begin{pmatrix} z_{1,k} \\ z_{2,k} \\ \vdots \\ z_{n,k} \end{pmatrix}, \\ \mathbf{z} = (\vec{z}_{\cdot 1} \; \vec{z}_{\cdot 2} \; \ldots \; \vec{z}_{\cdot k} ) & = \begin{pmatrix} z_{1,1} & z_{1,2} & \ldots & z_{1,k} \\ z_{2,1} & z_{2,2} & \ldots & z_{2,k} \\ \vdots & \vdots & \vdots & \vdots \\ z_{n,1} & z_{n,2} & \ldots & z_{n,k} \end{pmatrix}, \\ \vec{\theta } & = \begin{pmatrix} \theta _1 \\ \vdots \\ \theta _k \end{pmatrix}, \quad \vec{l} = \mathbf{z}\vec{\theta } \end{align} \]

\(X_i\) называют зависимой переменной, \(z_{i,1}, \ldots , z_{i,k}\) называют независимыми переменными или регрессорами, \(\varepsilon_i\) называют ошибками или невязками. Обратите внимание, что \(z_{i,1}, \ldots , z_{i,k}\) – известные неслучайные значения, хоть и называются независимыми переменными. Случайна в модели только ошибка \(\varepsilon_i\), и за счет нее случайна \(X_i\).

Предположим, что вектор-столбцы \(\vec{z}_{\cdot 1} , \vec{z}_{\cdot 2} , \ldots , \vec{z}_{\cdot k}\) линейно зависимы. Пусть \(\vec{z}_{\cdot i_1}, \vec{z}_{\cdot i_2}, \ldots , \vec{z}_{\cdot i_{k'}}\) – максимальный линейно независимый набор из \(\vec{z}_{\cdot 1} , \ldots , \vec{z}_{\cdot k}\). Можно доказать, что исходная модель и модель \(\vec{X} = \vec{x}_{i_1}\theta_{\cdot i_1} + \ldots + \vec{z}_{\cdot i_{k'}}\theta_{i_{k'}} + \vec{\varepsilon }\) эквивалентны в том смысле, что какой бы способ оценивания неизв. коэффициентов и качества регрессии мы не выбрали (об этом ниже), в обоих случаях качество модели получится одинаковым. В дальнейшем будем считать для простоты записи, что исходный набор \(\vec{z}_{\cdot 1} , \ldots , \vec{z}_{\cdot k}\) уже сам по себе линейно независим. Причем будем считать, что все регрессоры в совокупности нетривиальны, а именно в пространстве \(L := \operatorname {span}(\vec{z}_{\cdot 1} , \ldots , \vec{z}_{\cdot k} )\) нет векторов, состоящих из одних констант. О регрессии с константным регрессором см. следующий параграф.

Как правило, \(k\) много меньше, чем \(n\), и матрица \(\mathbf{z}\) получается чрезвычайно вытянутой по вертикали. Задача состоит в оценивании истинных значений \(\theta_{1}, \ldots , \theta_{k}\) по наблюдению \(X_{1}, \ldots , X_{n}\).

Наблюдение \(\vec{X} = (X_1, \ldots , X_n)^T\) – случайный вектор из \(\mathbb {R}^{n}\), причем \(\vec{l} = \vec{l}(\vec{\theta }) := \mathbf{z}\vec{\theta }\) – фиксированный неизвестный вектор, а \(\vec{\varepsilon }\) – случайный вектор.

Про вектор \(\vec{l} = \mathbf{z}\vec{\theta }\) известно, что \(\vec{l} = \mathbf{z}\vec{\theta } \in L\), где

\[ L=\left\langle \vec{z}_{\cdot 1}, \ldots , \vec{z}_{\cdot k}\right\rangle = \operatorname {span}\left(\vec{z}_{\cdot 1}, \ldots , \vec{z}_{\cdot k}\right) \]

– заданное линейное подпространство в \(\mathbb {R}^{n}\) размерности \(k<n\) (\((\vec{z}_{\cdot 1}, \ldots , \vec{z}_{\cdot k}\) – базисные вектор-столбцы пространства \(L\)). Параметрами описанной линейной регрессионной модели являются \(\vec{\theta }\) и \(\sigma^{2}\), об оценивании которых речь пойдет ниже.

Заметим, что в данном случае, строго говоря, согласно нашему определению \(\vec{X}\) не является выборкой размера \(n\), поскольку компоненты \(\vec{X}\) могут быть по-разному распределены. Однако \(\vec{X}\) можно рассматривать как выборку размера \(1\) из \(n\)-мерного распределения с параметрами \(\vec{\theta }, \sigma^2\). Поэтому, даже несмотря на отсутствие независимости, можно говорить, например, о существовании функции правдоподобия, применять критерии факторизации для поиска достаточных статистик и т.д. Функция правдоподобия в данном случае – это просто плотность \(n\)-мерного вектора \(\vec{X}\).

1.2 Линейная регрессия со свободным параметром

Модель

\[ X_i = \theta _0 + z_{i, 1} \theta _{1}+\ldots +z_{i, k} \theta _{k}+\varepsilon _{i}. \]

называется линейной регрессией со свободным параметром. \(\theta_0\) называют свободным параметром регрессии. Имеем

\[ \begin{align} \vec{X} = \begin{pmatrix} X_1 \\ X_2 \\ \vdots \\ X_n \end{pmatrix} & = \begin{pmatrix} 1 & z_{1,1} & \ldots & z_{1,k} \\ 1 & z_{2,1} & \ldots & z_{2,k} \\ \vdots & \vdots & \vdots \\ 1 & z_{n,1} & \ldots & z_{n,k} \end{pmatrix} \cdot \begin{pmatrix} \theta _0 \\ \theta _1 \\ \vdots \\ \theta _k \end{pmatrix} + \begin{pmatrix} \varepsilon _1 \\ \varepsilon _2 \\ \vdots \\ \varepsilon _n \end{pmatrix} = \\ & = \vec{z}_{\cdot 0}\theta _0 + \vec{z}_{\cdot 1} \theta _1 + \ldots + \vec{z}_{\cdot k} \theta _k + \vec{\varepsilon } = \\ & = \mathbf{z}\vec{\theta } + \vec{\varepsilon } \end{align} \]

Вектор из единиц \(\vec{z}_{\cdot 0} = (1, \ldots , 1)^T\) удобно обозначать \(\overrightarrow {1}\).

1.3 Условия на ошибки \(\vec{\varepsilon }\)

На вектор ошибок \(\vec{\varepsilon }\), как правило, накладывают следующие условия: они квадратично интегрируемы (матожи и дисперсии существуют), причем

  1. \(\mathbb {E}\left[\vec{\varepsilon }\right] = \overrightarrow {0} \in \mathbb {R}^{n}\), т.е. все ошибки центрированы;

  2. \(\operatorname {Var}\left[\vec{\varepsilon }\right] = \sigma^2 \mathbf{I}_n\), где \(\operatorname {Var}\left[\vec{\varepsilon }\right]\) – ковариационная матрица вектора \(\vec{\varepsilon }\), а \(\mathbf{I}_{n}\) – единичная матрица \(n \times n\). Т.е. у всех ошибок одинаковая дисперсия \(\sigma^2\) и разные ошибки некоррелированы. Это свойство еще называют гомоскедастичностью (homoscedasticity) от греч. ὁμός (гомос, одинаковый) + σκεδαστός (скедастос, разбросанный).

На практике указанные условия на ошибки выполнены далеко не всегда, однако зачастую исходную модель можно свести к модели, где бы условия на ошибки выполнялись. Например, при выполнении гомоскедастичности условие центрированности ошибок можно ослабить: пусть \(\mathbb {E}\left[\vec{\varepsilon }\right] = \mu \overrightarrow {1}\), т.е. у всех ошибок одинаковое, но теперь неизвестное ненулевое матожидание. Тогда от модели \(X_i = \theta_0 + z_{i, 1} \theta_{1}+\ldots +z_{i, k} \theta_{k}+\varepsilon_{i}\) можно перейти к модели

\[ X_i = \theta '_0 + z_{i, 1} \theta _{1}+\ldots +z_{i, k} \theta _{k}+\varepsilon '_{i} \]

где

\[ \theta '_0 := \theta _0 + \mu , \quad \varepsilon _i' := \varepsilon _i - \mu . \]

В ней ошибки \(\varepsilon '\) стали центрированными. Подробнее о сведении модели к стандартной см. задачи ниже.

2 Метод наименьших квадратов (МНК) в оценке параметров

ExampleПример 2

В условиях примера Пример 1 попробуйте оценить \(\theta_1\) и \(\theta_2\).

SolutionРешение

Предположим для упрощения изложения, что \(\theta_1, \theta_2 \in \mathbb {R}\), т.е. массы могут быть отрицательными. Переберем все возможные значения \(\theta_1, \theta_2 \in \mathbb {R}\), тогда \(\vec{l}(\vec{\theta }) := \mathbf{z}\vec{\theta } = \vec{z}_{\cdot 1} \theta_1 + \vec{z}_{\cdot 2} \theta_2\) образует линейное подпространство \(L:= \operatorname {span}(\vec{z}_{\cdot 1} ,\vec{z}_{\cdot 2} )\) в пространстве \(\mathbb {R}^{3}\).

Предположим \(\vec{X} \in L\), т.е. ошибки измерений отсутствуют. \(\widehat{\vec{\theta }}_1, \widehat{\vec{\theta }}_2\) логично взять равными коэффициентам разложения \(\vec{X}\) по базису \(\vec{z}_{\cdot 1} , \vec{z}_{\cdot 2}\).

Предположим более реалистичную ситуацию: \(\vec{X} \not\in L\), т.е. ошибки измерений присутствуют. Обозначим

\[ \widehat{\vec{X}} := \mathbf{z} \cdot \widehat{\vec{\theta }}, \qquad \widehat{\vec{\varepsilon }} := \vec{X} - \widehat{\vec{X}} = \vec{X} - \mathbf{z}\widehat{\vec{\theta }}. \]

  • \(\widehat{\vec{X}}\) – оценка наблюдений, т.е. какими были бы наблюдения, если бы не было ошибок и вектор параметров \(\vec{\theta }\) совпал бы с нашей оценкой \(\widehat{\vec{\theta }}\). Заметим, что \(\widehat{\vec{X}}\) явл. линейной комбинацией столбцов \(\mathbf{z}\), т.е. \(\widehat{\vec{X}} \in L\).

  • \(\widehat{\vec{\varepsilon }}\) – это вектор оценок ошибок.

Учитывая условия на ошибки, мы хотим минимизировать \(\widehat{\vec{\varepsilon }}\), найти ближайший к \(\vec{X}\) вектор в подпространстве \(L\). \(\widehat{\vec{\varepsilon }}\) – \(n\)-мерная величина, соотв. необходимо выбрать некоторую норму в \(\mathbb {R}^{n}\), которую мы будем минимизировать. Наиболее естественный и удобный выбор – евклидова норма

\[ \left\| \vec{x}\right\| _2 = \sqrt{x_1^2 + \ldots + x_n^2} \]

Почему удобный? С одной стороны, евклидову норму легко дифференцировать для нахождения экстремумов. С другой стороны евклидова норма порождается скалярным произведением, мы работаем с \(\mathbb {R}^{n}\) как с евклидовым пространством, можно использовать геометрию евклидова пространства. Ближайший к \(\vec{X}\) вектор \(\widehat{\vec{X}}\) из подпространства \(L\) – это просто ортогональная проекция \(\vec{X}\) на \(L\):

\[ \widehat{\vec{X}} = \operatorname {proj}_{L}(X), \]

а \(\widehat{\vec{\theta }}\) – координаты этой проекции в базисе \(\vec{z}_{\cdot 1} , \vec{z}_{\cdot 2}\).

Такой метод оценивания параметра \(\vec{\theta }\) и построения модели называется методом наименьших квадратов, поскольку мы минимизируем суммы квадратов ошибок (евклидову норму).

Итак, поставленная задача оценивания вектора \(\vec{\theta }\) может быть решена с помощью метода наименьших квадратов (МНК). Оценка параметров по методу наименьших квадратов равна

\[ \widehat{\vec{\theta }}_{\text{МНК}} \; := \; \operatorname *{arg\, min}_{\vec{\theta } \in \mathbb {R}^{k}}\left\| \vec{X} -\mathbf{z}\vec{\theta }\right\| ^2 \]

Далее,

  • \(\widehat{\vec{X}}_{\text{МНК}} =\mathbf{z} \cdot \widehat{\vec{\theta }}_{\text{МНК}} = \vec{X}_{L}\) (ортогональная проекция \(\vec{X}\) на \(L\)),

  • \(\widehat{\vec{\varepsilon }}_{\text{МНК}} = \vec{X} - \widehat{\vec{X}}_{\text{МНК}} = \vec{X} - \vec{X}_{L} = \vec{X}_{L^\perp }\) (ортогональная проекция на \(L^{\perp }\)).

В дальнейшем для упрощения и сокращения записей везде, где будет идти речь об оценках параметров, наблюдений и ошибок, мы будем подразумевать, что оценивание производится по МНК и писать \(\widehat{\vec{\theta }}, \widehat{\vec{X}}, \widehat{\vec{\varepsilon }}\) вместо \(\widehat{\vec{\theta }}_{\text{МНК}} , \widehat{\vec{X}}_{\text{МНК}} , \widehat{\vec{\varepsilon }}_{\text{МНК}}\), хотя, вообще говоря, существуют и другие способы оценивания \(\vec{\theta }\), моделирования выборки и ошибок.

2.1 Явная формула оценки по МНК

Найдем явную формулу для \(\widehat{\vec{\theta }}\). Решим задачу из линейной алгебры.

ExampleПример 3

Пусть \(\vec{y} \in \mathbb {R}^{n}\), пусть \(\vec{z}_{\cdot 1} , \ldots , \vec{z}_{\cdot k} \in \mathbb {R}^{n}\) – набор линейно независимых векторов (\(k\leq n\)). Найти \(\vec{t} \in \mathbb {R}^{k}\) — координаты проекции \(\vec{y}\) на \(L = \operatorname {span}(\vec{z}_{\cdot 1} , \ldots , \vec{z}_{\cdot k} )\) в базисе из \(\mathbf{z} = (\vec{z}_{\cdot 1} , \ldots , \vec{z}_{\cdot k} )\): \[ \operatorname {proj}_L(\vec{y}) = \mathbf{z} \cdot \vec{t} = t_1\vec{z}_{\cdot 1} + \ldots + t_k\vec{z}_{\cdot k} \]

SolutionРешение

Имеем

\[ \begin{align} \left\| \vec{y} - \mathbf{z}\vec{t}\right\| ^2 & = \left\langle \vec{y} - \mathbf{z}\vec{t}, \vec{y} - \mathbf{z}\vec{t} \right\rangle = \\ & = \left\| \vec{y}\right\| ^2 - \underbrace{\left\langle \vec{y}, \mathbf{z}\vec{t} \right\rangle }_{=\vec{y}^T \cdot \mathbf{z} \cdot \vec{t}} + \left\| \mathbf{z}\vec{t}\right\| ^2 = \\ & = \left\| \vec{y}\right\| ^2 - \left\langle \mathbf{z}^T\vec{y}, \vec{t} \right\rangle + \left\| \mathbf{z}\vec{t}\right\| ^2 = \\ & = \sum _{i=1}^{n}y_i^2 - 2\sum _{i=1}^{k}\left(\mathbf{z}^T \vec{y}\right)_i \cdot t_i + \sum _{i=1}^{n}\left(\mathbf{z}\vec{t}\right)^2_i = \\ & = \sum _{i=1}^{n}y_i^2 - 2\sum _{i=1}^{k}\left(\mathbf{z}^T \vec{y}\right)_i \cdot t_i + \sum _{i=1}^{n}\left(\sum _{j=1}^{k}z_{i,j}t_j\right)^2 \end{align} \]

Продифференцируем полученное выражение по \(t_{m}\) для каждого \(m \in \{ 1, \ldots , k\}\) и упростим затем:

\[ \begin{align} \frac{\partial }{\partial t_m} \left(\left\| \vec{y} - \mathbf{z}\vec{t}\right\| ^2\right) & = -2\left(\mathbf{z}^T\vec{y}\right)_m + \sum _{i=1}^{n}2\left(\sum _{j=1}^{k}z_{i,j}t_j\right) \cdot z_{i,m} = \\ & = -2\left(\mathbf{z}^T\vec{y}\right)_m + 2\sum _{i=1}^{n} z_{i,m} \cdot \left(\mathbf{z} \cdot \vec{t}\right)_i = \\ & = -2\left(\mathbf{z}^T\vec{y}\right)_m + 2\left(\mathbf{z}^T \cdot \left(\mathbf{z} \cdot \vec{t}\right)\right)_m \end{align} \]

Приравняем эти производные к нулю, чтобы найти искомый аргумент, при котором достигается минимум:

\[ \begin{cases} \frac{\partial }{\partial t_1}\left(\left\| \vec{y} - \mathbf{z}\vec{t}\right\| ^2\right) = 0 \\ \vdots \\ \frac{\partial }{\partial t_k}\left(\left\| \vec{y} - \mathbf{z}\vec{t}\right\| ^2\right) = 0 \\ \end{cases} \iff \begin{cases} -2\left(\mathbf{z}^T\vec{y}\right)_1 + 2\left(\mathbf{z}^T \cdot \left(\mathbf{z} \cdot \vec{t}\right)\right)_1 = 0 \\ \vdots \\ -2\left(\mathbf{z}^T\vec{y}\right)_k + 2\left(\mathbf{z}^T \cdot \left(\mathbf{z} \cdot \vec{t}\right)\right)_k = 0 \\ \end{cases} \]

В матрично-векторной форме:

\[ -2\mathbf{z}^T\vec{y} + 2\mathbf{z}^T \cdot \mathbf{z} \cdot \vec{t} = 0 \]

Следовательно, \(\vec{t} = \left(\mathbf{z}^T\mathbf{z}\right)^{-1}\mathbf{z}^T\vec{y}\). Получили

\[ \operatorname {proj}_L(\vec{y}) = \mathbf{z}\left(\mathbf{z}^T\mathbf{z}\right)^{-1}\mathbf{z}^T \cdot \vec{y} \]

Матрицу \(\mathbf{z}\left(\mathbf{z}^T\mathbf{z}\right)^{-1}\mathbf{z}^T\) называют матрицей проекции на подпространство \(L\).

Если в \(\mathbf{z}\) столбцы ортонормированы, то \(\mathbf{z}^T\mathbf{z} = \left(\mathbf{z}^T\mathbf{z}\right)^{-1} = \mathbf{I}_{k}\) матрица проекции упрощается до \(\mathbf{z}\mathbf{z}^T\).

Контрольный вопрос. Где и как в решении использовалась линейная независимость вектор-столбцов \(\vec{z}_{\cdot 1}, \ldots , \vec{z}_{\cdot k}\)?

AnswerОтвет

\(\vec{t} = \left(\mathbf{z}^T\mathbf{z}\right)^{-1}\mathbf{z}^T\vec{y}\).

Итого, формула оценки по МНК для линейной регрессии:

\[ \widehat{\vec{\theta }} = \widehat{\vec{\theta }}(\vec{X}) = \left(\mathbf{z}^T\mathbf{z}\right)^{-1}\mathbf{z}^T \cdot \vec{X} \]

2.2 Геометрия МНК: регрессия без свободного параметра

Геометрия МНК-регрессии без свободного параметра (вариант на Three.js): \(\overrightarrow X\) — вектор наблюдений, \(\widehat{\overrightarrow X}=\overrightarrow X_L=\mathbf z\widehat{\overrightarrow\theta}\) — его ортогональная проекция на \(L=\operatorname{span}(\overrightarrow z_{\cdot 1},\ldots,\overrightarrow z_{\cdot k})\), \(\widehat{\overrightarrow\varepsilon}\) — вектор ошибок. Прямой угол в вершине \(B\) треугольника \(OBA\) иллюстрирует, что \(X-\widehat X\perp L\); коэффициент детерминации \(R^2=\cos^2\varphi=\operatorname{ESS}/\operatorname{TSS}\), где \(\varphi=\angle AOB\) — чем он больше, тем угол \(\varphi\) ближе к нулю и тем лучше линейная модель. Подписи — настоящий отрендеренный LaTeX (KaTeX), закреплённый на своей линии/векторе и повёрнутый вдоль него; при вращении сцены мышью они остаются на месте. Колесо мыши — приближение.

Рассмотрим график @LinearRegr:GraphRegrWoParam. По теореме Пифагора имеем

\[ \left\| \vec{X}\right\| ^2 = \left\| \widehat{\vec{X}}\right\| ^2 + \left\| \widehat{\vec{\varepsilon }}\right\| ^2 \]

  • Общую сумму квадратов наблюдений \(\left\| \vec{X}\right\|^2\) называют полной суммой квадратов или total sum of squares и обозначают \(\operatorname {TSS}\):

    \[ \operatorname {TSS} := \left\| \vec{X}\right\| ^2 = \sum _{i=1}^n X_i^2 \]

  • Сумму квадратов оценок наблюдений \(\left\| \widehat{\vec{X}}\right\|^2\) называют объясненной суммой квадратов или explained sum of squares и обозначают \(\operatorname {ESS}\):

    \[ \operatorname {ESS} := \left\| \widehat{\vec{X}}\right\| ^2 = \sum _{i=1}^n \widehat{X}_i^2 \]

  • Сумму квадратов ошибок \(\left\| \widehat{\vec{\varepsilon }}\right\|^2\) называют остаточной суммой квадратов или residual sum of squares и обозначают \(\operatorname {RSS}\):

    \[ \operatorname {RSS} := \left\| \widehat{\vec{\varepsilon }}\right\| ^2 = \left\| \vec{X} - \widehat{\vec{X}}\right\| ^2 = \sum _{i=1}^n \left(X_i - \widehat{X}_i\right)^2 \]

По теореме Пифагора общая сумма квадратов распадается на объясненную сумму квадратов и квадраты оценок ошибок:

\[ \operatorname {TSS} = \operatorname {ESS} + \operatorname {RSS} \]

2.2.1 Коэффициент детерминации

Чем лучше регрессия с подобранными по МНК оценками описывает поведение зависимой переменной \(\vec{X}\), тем меньше должна быть длина вектора ошибок \(\widehat{\vec{\varepsilon }} = \vec{X} - \vec{X}_{L}\) по сравнению с длиной вектора наблюдений \(\vec{X}\). Величина

\[ R^2 := 1 - \frac{\left\| \widehat{\vec{\varepsilon }}\right\| ^2}{\left\| \vec{X}\right\| ^2} = 1 - \frac{\sum _{i=1}^n \left(X_i - \widehat{X}_i\right)^2}{\sum _{i=1}^n X_i^2} \]

называется коэффициентом детерминации.

Коэффициент детерминации принимает значения от \(0\) до \(1\). Чем он ближе к \(1\), тем лучше регрессия.

Различные формулы для коэффициента детерминации:

\[ \begin{align} R^2 & = 1 - \frac{\left\| \widehat{\vec{\varepsilon }}\right\| ^2}{\left\| \vec{X}\right\| ^2} = 1 - \frac{\operatorname {RSS}}{\operatorname {TSS}} = \\ & = 1 - \frac{\sum _{i=1}^n \left(X_i - \widehat{X}_i\right)^2}{\sum _{i=1}^n X_i^2} = \\ & = \frac{\operatorname {ESS}}{\operatorname {TSS}} = \frac{\left\| \widehat{\vec{X}}\right\| ^2}{\left\| \vec{X}\right\| ^2} = \frac{\sum _{i=1}^n \widehat{X}_i^2}{\sum _{i=1}^n X_i^2} \end{align} \]

У коэффициента детерминации есть несколько близких интерпретаций. С одной стороны это та доля разброса в зависимой переменной \(\vec{X}\), которую удалось “объяснить” нашей моделью: \(\operatorname {ESS}/\operatorname {TSS}\).

С другой стороны можно сказать, что наша построенная модель \(\widehat{\vec{X}}\) сравнивается с единственной моделью для объяснения \(\vec{X}\), которую можно предложить при отсутствии регрессоров, – с моделью \(\vec{X} = \overrightarrow {0} + \vec{\varepsilon }\), т.е. \(\vec{X}\) – просто шум из независимых одинаково распределенных центрированных ошибок. Коэффициент детерминации в этом подходе – это единица минус разброс в первой модели к разбросу во второй:

\[ 1 - \frac{\operatorname {RSS}}{\operatorname {TSS}} \]

Чем он ближе к единице, тем лучше наша модель работает по сравнению с самой тривиальной моделью.

Простую модель, с которой сравнивают более сложные модели, называют эталонной моделью или базовой моделью (англ. benchmark model). В данном случае базовая модель – независимый одинаково распределенный шум. \(\operatorname {TSS}\) – сумма квадратов ошибок при использовании такой модели. \(\operatorname {ESS}\) – сумма квадратов разницы между базовой моделью и нашей моделью.

2.3 Геометрия МНК: регрессия со свободным параметром

При наличии свободного параметра \(\theta_0\) меняется базовая модель для сравнений. Теперь при отсутствии регрессоров лучшая модель для объяснения \(\vec{X}\) – модель суммы константы \(\theta_0\) и шума \(\vec{\varepsilon }\). Оценка \(\theta_0\), минимизирующая сумму квадратов ошибок в такой модели, – это выборочное среднее \(\overline{X}\). Базовая модель для моделирования \(\vec{X}\):

\[ \left(\overline{X}, \ldots , \overline{X}\right)^T = \overline{X} \cdot \overrightarrow {1}, \]

где \(\overrightarrow {1} = (1, \ldots , 1)^T\) – вектор из \(\mathbb {R}^{n}\), составленный из единиц.

\(\operatorname {TSS}\), \(\operatorname {ESS}\) – сумма квадратов ошибок при использовании базовой модели и сумма квадратов разницы между базовой моделью и нашей моделью соотв. Их расчет теперь тоже меняется. Расчет \(\operatorname {RSS}\) остается прежним.

  • Общая сумма квадратов:

    \[ \operatorname {TSS} = \left\| \vec{X} - \overline{X}\cdot \overrightarrow {1}\right\| ^2 = \sum _{i=1}^n (X_i - \overline{X})^2 \]

  • Объясненная сумма квадратов:

    \[ \operatorname {ESS} = \left\| \widehat{\vec{X}} - \overline{X}\cdot \overrightarrow {1}\right\| ^2 = \sum _{i=1}^n (\widehat{X}_i- \overline{X})^2 \]

  • Сумма квадратов ошибок:

    \[ \operatorname {RSS} = \left\| \vec{X} - \widehat{\vec{X}}\right\| ^2 = \sum _{i=1}^n \left(X_i - \widehat{X}_i\right)^2 \]

Геометрия МНК-регрессии со свободным параметром (вариант на Three.js): \(D\) — точка базовой модели \(\overline X\cdot\overrightarrow 1\), \(A\) — вектор наблюдений \(\overrightarrow X\), \(B\) — его проекция \(\widehat{\overrightarrow X}=\overrightarrow X_L=\mathbf z\widehat{\overrightarrow\theta}\) на \(L\). Прямой угол в вершине \(B\) треугольника \(DBA\) иллюстрирует, что \(X-\widehat X\perp L\); коэффициент детерминации \(R^2=\cos^2\varphi=\operatorname{ESS}/\operatorname{TSS}\), где \(\varphi=\angle ADB\) — чем он больше, тем угол \(\varphi\) ближе к нулю и тем лучше линейная модель. Подписи — настоящий отрендеренный LaTeX (KaTeX), закреплённый на своей линии/векторе и повёрнутый вдоль него; при вращении сцены мышью они остаются на месте. Колесо мыши — приближение.

Рассмотрим график @LinearRegr:GraphRegrWithParam. По теореме Пифагора для треугольника \(ABD\) снова имеем (помните, что \(\widehat{\vec{X}} = \vec{X}_{L}\) при построении модели по МНК):

\[ \begin{align} \operatorname {TSS} & = \left\| \vec{X} - \overline{X}\cdot \overrightarrow {1}\right\| ^2 = \left|AD\right|^2 = \\ & = \left|BD\right|^2 + \left|AB\right|^2 = \left\| \widehat{\vec{X}} - \overline{X}\cdot \overrightarrow {1}\right\| ^2 + \left\| \vec{X} - \widehat{\vec{X}}\right\| ^2 = \\ & = \operatorname {ESS} + \operatorname {RSS} \end{align} \]

Коэффициент детерминации:

\[ \begin{align} R^2 & = 1 - \frac{\operatorname {RSS}}{\operatorname {TSS}} = 1 - \frac{\sum _{i=1}^n \left(X_i - \widehat{X}_i\right)^2}{\sum _{i=1}^n (X_i - \overline{X})^2} = \\ & = \frac{\operatorname {ESS}}{\operatorname {TSS}} = \frac{\sum _{i=1}^n \left(\overline{X} - \widehat{X}_i\right)^2}{\sum _{i=1}^n (X_i - \overline{X})^2} \end{align} \]

Для одной и той же выборки коэффициент детерминации для модели со свободным параметром может оказаться как больше, так и меньше коэффициента детерминации модели без него, несмотря на то, что первая модель, очевидно, более вариативна.

Линейная регрессия с одним регрессором \(\vec{z}_{\cdot 1}\) и свободным параметром \(\theta_0\), \(n=6\) (параметры регрессии обозначены \(\theta_0, \theta_1\)). Оранжевые точки — точки выборки \((z_{1,i}, X_i)\). Зелёные точки — точки регрессии \((z_{1,i}, \widehat{X}_i)\). Суммарная площадь фиолетовых квадратов равна \(\operatorname{TSS}\), красных — \(\operatorname{RSS}\).

2.4 Свойства оценок по МНК

Напомним, \(\widehat{\vec{\theta }} = \left(\mathbf{z}^T\mathbf{z}\right)^{-1}\mathbf{z}^T\vec{X}\). Обозначим \(\widetilde{k}\) количество столбцов матрицы \(\mathbf{z}\):

\[ \widetilde{k} := \begin{cases} k, & \text{ если в регрессии нет свободного параметра }\theta _0;\\ k+1 , & \text{ если в регрессии есть свободный параметр }\theta _0. \end{cases} \]

  1. Матожидание и ковариационная матрица \(\widehat{\vec{\theta }}\):

    \[ \mathbb {E}_{\vec{\theta }, \sigma ^2}\left[\widehat{\vec{\theta }}\right] = \vec{\theta }, \qquad \operatorname {Var}_{\vec{\theta }, \sigma ^2}\left[\widehat{\vec{\theta }}\right] = \sigma ^2 \left(\mathbf{z}^T \mathbf{z}\right)^{-1} \]

    Таким образом, оценка по методу наименьших квадратов является несмещенной.

  2. Зная ковариационную матрицу вектора \(\widehat{\vec{\theta }}\), можно найти математическое ожидание расстояния от \(\vec{X}\) до подпространства \(L \subset \mathbb {R}^{n}\):

    \[ \mathbb {E}_{\vec{\theta }, \sigma ^2}\left[\left\| \vec{X} - \underbrace{\mathbf{z}\widehat{\vec{\theta }}}_{=\vec{X}_{L} = \widehat{\vec{X}}}\right\| ^2\right] = \mathbb {E}_{\vec{\theta }, \sigma ^2}\left[\left\| \underbrace{\widehat{\vec{\varepsilon }}}_{=\vec{X}_{L^\perp }}\right\| ^2\right] = \mathbb {E}_{\vec{\theta }, \sigma ^2}\left[\operatorname {RSS}\right] = \left(n-\widetilde{k}\right)\sigma ^2 \]

    Последнее равенство дает несмещенную оценку параметра \(\sigma^{2}\):

    \[ \widehat{\sigma ^{2}} := \frac{1}{n-\widetilde{k}}\left\| \vec{X}-\mathbf{z} \widehat{\vec{\theta }}\right\| ^{2} = \frac{\operatorname {RSS}}{n-\widetilde{k}}. \]

Выборочное распределение оценки МНК

Облако — оценки \((\hat\theta_0,\hat\theta_1)\) по \(800\) независимым повторениям эксперимента \(X_i=\theta_0+\theta_1 z_i+\varepsilon_i\), \(\varepsilon_i\sim\mathcal N(0,\sigma^2)\); звёздочка — истинное \(\theta=(2,\,0.5)\); красный эллипс — теоретический \(95\%\)-эллипс ковариационной матрицы \(\sigma^2(\vec z^T\vec z)^{-1}\).

Доля точек внутри \(95\%\)-эллипса: — (теоретически \(\approx 0.95\))
ExampleПример 4

Имеется 2 куска сыра с весами \(\theta_1\) и \(\theta_2\). На одних и тех же весах взвесили первый, второй и потом оба куска вместе. Найдите оценки наименьших квадратов для \(\theta_1\) и \(\theta_2\), а также несмещенную оценку дисперсии ошибки измерений. Найдите коэфф. детерминации.

SolutionРешение

Пусть взвешивания показали результаты \(X_{1}, X_{2}, X_{3}\). Положим \(\vec{X}=\left(X_{1}, X_{2}, X_{3}\right)^{T}\). Тогда

\[ \vec{X} =\mathbf{z}\vec{\theta } + \vec{\varepsilon }, \quad \text{где} \quad \mathbf{z} = \begin{pmatrix} 1 & 0 \\ 0 & 1 \\ 1 & 1 \end{pmatrix}, \quad \vec{\theta } = \begin{pmatrix} \theta _1 \\ \theta _2 \end{pmatrix}, \quad \vec{\varepsilon } = \begin{pmatrix} \varepsilon _1 \\ \varepsilon _2 \\ \varepsilon _3 \end{pmatrix} \]

Вычислим сначала \(\mathbf{z}^T\mathbf{z}\), обратную к ней матрицу и \(\mathbf{z}^T\vec{X}\):

\[ \mathbf{z}^T\mathbf{z} = \begin{pmatrix} 2 & 1 \\ 1 & 2 \end{pmatrix}, \qquad \left(\mathbf{z}^T\mathbf{z}\right)^{-1} = \frac13\begin{pmatrix} 2 & -1 \\ -1 & 2 \end{pmatrix}, \qquad \mathbf{z}^T\vec{X} = \begin{pmatrix} X_1+X_3 \\ X_2+X_3 \end{pmatrix}. \]

Тогда

\[ \begin{align} \widehat{\vec{\theta }} & = \left(\begin{array}{c} \widehat{\vec{\theta }}_1 \\ \widehat{\vec{\theta }}_2 \end{array}\right)=\left(\mathbf{z}^{T} \mathbf{z}\right)^{-1} \mathbf{z}^{T} \vec{X}= \frac13\begin{pmatrix} 2 & -1 \\ -1 & 2 \end{pmatrix}\begin{pmatrix} X_1+X_3 \\ X_2+X_3 \end{pmatrix} = \left(\begin{array}{c} \frac{2}{3} X_{1}-\frac{1}{3} X_{2}+\frac{1}{3} X_{3} \\ -\frac{1}{3} X_{1}+\frac{2}{3} X_{2}+\frac{1}{3} X_{3} \end{array}\right) \\ \widehat{\vec{X}} & = \mathbf{z} \widehat{\vec{\theta }} = \begin{pmatrix} \widehat{\vec{\theta }}_1 \\ \widehat{\vec{\theta }}_2 \\ \widehat{\vec{\theta }}_1 + \widehat{\vec{\theta }}_2 \\ \end{pmatrix} = \begin{pmatrix} \frac{2}{3} X_{1}-\frac{1}{3} X_{2}+\frac{1}{3} X_{3} \\ -\frac{1}{3} X_{1}+\frac{2}{3} X_{2}+\frac{1}{3} X_{3} \\ \frac{1}{3} X_{1}+\frac{1}{3} X_{2}+\frac{2}{3} X_{3} \\ \end{pmatrix} \\ \widehat{\sigma ^{2}} & = \frac{1}{3-2}\operatorname {RSS} = \| \vec{X}-\mathbf{z} \widehat{\vec{\theta }}\| ^{2}=\left(X_{1}-\widehat{\vec{\theta }}_1\right)^{2}+\left(X_{2}-\widehat{\vec{\theta }}_2\right)^{2}+\left(X_{3}-\widehat{\vec{\theta }}_1-\widehat{\vec{\theta }}_2\right)^{2} \end{align} \]

Подставим явные выражения для \(\widehat{\vec{\theta }}_1, \widehat{\vec{\theta }}_2\) (и для их суммы – третьей координаты \(\widehat{\vec{X}}\), найденной выше) и упростим каждую невязку по отдельности:

\[ \begin{align} X_1 - \widehat{\vec{\theta }}_1 & = X_1 - \left(\tfrac {2}{3} X_{1}-\tfrac {1}{3} X_{2}+\tfrac {1}{3} X_{3}\right) = \tfrac 13 \left(X_1+X_2-X_3\right), \\ X_2 - \widehat{\vec{\theta }}_2 & = X_2 - \left(-\tfrac {1}{3} X_{1}+\tfrac {2}{3} X_{2}+\tfrac {1}{3} X_{3}\right) = \tfrac 13 \left(X_1+X_2-X_3\right), \\ X_3 - \widehat{\vec{\theta }}_1 - \widehat{\vec{\theta }}_2 & = X_3 - \left(\tfrac {1}{3} X_{1}+\tfrac {1}{3} X_{2}+\tfrac {2}{3} X_{3}\right) = -\tfrac 13\left(X_1+X_2-X_3\right). \end{align} \]

Все три невязки равны по модулю \(\frac{\left|X_1 + X_2 - X_3\right|}{3}\), поэтому

\[ \widehat{\sigma ^2} = 3 \cdot \left(\frac{X_1 + X_2 - X_3}{3}\right)^2 = \frac{\left(X_{1}+X_{2}-X_{3}\right)^2}{3}. \]

Далее, мы имеем регрессию без свободного члена, поэтому по теореме Пифагора \(\operatorname {TSS} = \operatorname {ESS} + \operatorname {RSS}\), откуда \(\operatorname {ESS} = \operatorname {TSS} - \operatorname {RSS}\); при этом \(\operatorname {RSS} = (3-2)\widehat{\sigma^2} = \widehat{\sigma^2}\) уже найдена выше. Имеем

\[ \begin{align} \operatorname {TSS} & = \sum _{i=1}^3 X_i^2 = X_1^2 + X_2^2 + X_3^2, \\ \operatorname {ESS} & = \operatorname {TSS} - \operatorname {RSS} = \left(X_1^2+X_2^2+X_3^2\right) - \frac{\left(X_1+X_2-X_3\right)^2}{3} = \\ & = \left(X_1^2+X_2^2+X_3^2\right) - \frac{X_1^2+X_2^2+X_3^2+2X_1X_2-2X_1X_3-2X_2X_3}{3} = \\ & = \frac{2}{3}X_1^2 + \frac{2}{3}X_2^2 + \frac{2}{3}X_3^2 - \frac{2}{3}X_1X_2 + \frac{2}{3}X_1X_3 + \frac{2}{3}X_2X_3, \\ R^2 & = \frac{\operatorname {ESS}}{\operatorname {TSS}} = \frac{2}{3}\frac{X_1^2 + X_2^2 + X_3^2 - X_1X_2 + X_1X_3 + X_2X_3}{X_1^2 + X_2^2 + X_3^2}. \end{align} \]

ProblemЗадача 1

В четырехугольнике \(A B C D\) независимые равные по точности измерения углов \[ A B D, D B C, A B C, B C D, C D B, B D A, C D A, D A B \] в градусах дали результаты \[ 50.78, 30.25,78.29,99.57,50.42,40.59,88.87,89.86 \] соответственно. Считая, что ошибки измерений распределены независимо, у них одинаковая дисперсия \(\sigma^2\) и нулевое матожидание, найдите оценки по МНК углов \(\theta_{1}=A B D, \theta_{2}=D B C, \theta_{3}=C D B, \theta_{4}=B D A\) и неизвестной дисперсии \(\sigma^{2}\). Найдите коэфф. детерминации.

ProblemЗадача 2

Пусть \[ X_{i}=\theta _0+i \theta _1+\varepsilon _{0}+\ldots +\varepsilon _{i}, \] \(i=0,1, \ldots , n\), где \(\theta_0, \theta_1\) – неизвестные параметры, a случайные величины \(\varepsilon_{0}, \ldots , \varepsilon_{n}\) распределены независимо, у них одинаковая дисперсия \(\sigma^2\) и нулевое матожидание. Сведите задачу к линейной модели и найдите оценки наименьших квадратов для \(\theta_0\) и \(\theta_1\), а также несмещенную оценку для \(\sigma^{2}\). Найдите коэфф. детерминации \(R^2\).

ProblemЗадача 3
  1. Докажите, что

\[ \mathbb {E}_{\vec{\theta }, \sigma ^2}\left[\widehat{\vec{\theta }}\right] = \vec{\theta }, \qquad \operatorname {Var}_{\vec{\theta }, \sigma ^2}\left[\widehat{\vec{\theta }}\right] = \sigma ^2 \left(\mathbf{z}^T \mathbf{z}\right)^{-1} \]

  1. Докажите, что

\[ \mathbb {E}_{\vec{\theta }, \sigma ^2}\left[\underbrace{\left\| \vec{X} - \mathbf{z}\widehat{\vec{\theta }}\right\| ^2}_{=\operatorname {RSS}}\right] = (n-\widetilde{k})\sigma ^2 \qquad \]

и

\[ \widehat{\sigma ^{2}} = \frac{1}{n-\widetilde{k}} \left\| \vec{X} - \mathbf{z}\widehat{\vec{\theta }}\right\| ^2 \]

– это несмещенная оценка \(\sigma^2\).

HintПодсказка

Если \(\vec{\xi }\) – случайный вектор размерности \(n\), то его ковариационную матрицу можно посчитать так: \[ \operatorname {Var}\left[\vec{\xi }\right] = \mathbb {E}\left[\vec{\xi } \cdot \vec{\xi }^T\right] - \mathbb {E}\left[\vec{\xi }\right] \cdot \left(\mathbb {E}\left[\vec{\xi }\right]\right)^T. \] Кроме того, если \(A \in \mathbb {R}^{m \times n}\) – матрица размерности \(m \times n\), то \(A\vec{\xi }\) – это новый случайный вектор размерности \(m\), причем его ковариационная матрица и ковариационная матрица исходного вектора связаны так: \[ \operatorname {Var}\left[A \vec{\xi }\right] = A \cdot \operatorname {Var}\left[\vec{\xi }\right] \cdot A^T \]

3 Гауссовская линейная регрессия

Вторую половину настоящей главы мы посвятим исключительно важному для приложения частному случаю линейной регрессионной модели, а именно гауссовской линейной модели. Речь идет о модели линейной регрессии \(\vec{X}=\mathbf{z}\vec{\theta }+\vec{\varepsilon }\), в которой ошибки распределены по гауссовскому многомерному закону:

\[ \vec{\varepsilon } \sim \mathscr {N}\left(\overrightarrow {0}, \sigma ^2 \mathbf{I}_n\right) \]

Напомним, \(\mathbf{z}\vec{\theta }\) – это неслучайный \(n\)-мерный вектор, значит

\[ \vec{X} \sim \mathscr {N}\left(\mathbf{z}\vec{\theta }, \; \sigma ^{2} \mathbf{I}_{n}\right) \]

Как уже говорилось, \(\vec{X}\) можно рассматривать как выборку размера \(1\) из \(n\)-мерного распределения, в данном случае гауссовского. Оно имеет плотность относительно меры Лебега на \(\mathbb {R}^{n}\):

\[ \begin{align} f_{\vec{\theta }, \sigma ^2}(\vec{x}) & = \frac{1}{\sqrt{(2\pi \sigma ^2)^n}} \mathrm{exp}\left(-\frac{1}{2\sigma ^2}\left(\vec{x} - \mathbf{z}\vec{\theta }\right)^T \left(\vec{x} - \mathbf{z}\vec{\theta }\right)\right) = \\ & = \frac{1}{\sqrt{(2\pi \sigma ^2)^n}} \mathrm{exp}\left(-\frac{1}{2\sigma ^2} \left\| \vec{x} - \mathbf{z}\vec{\theta }\right\| ^2\right), \qquad \vec{x} \in \mathbb {R}^{n} \end{align} \]

3.1 Полная, достаточная статистика. Оптимальные оценки

Теорема 1 В гауссовской линейной модели статистика \(\left(\vec{X}_{L}, \left\| \vec{X}_{L^\perp }\right\|^2\right)\) – полная и достаточная.

Следствие 1 В гауссовской линейной модели статистика \(\left(\widehat{\vec{\theta }}, \widehat{\sigma^2}\right)\) – полная и достаточная.

ProblemЗадача 4

Докажите теор. Теорема 1. Докажите следствие Следствие 1.

Из обычной модели регрессии известно, что статистики

\[ \begin{align} \widehat{\vec{\theta }} & = \operatorname *{arg\, min}_{\vec{t} \in \mathbb {R}^{k}} \left\| \vec{X} - \mathbf{z}\vec{t}\right\| = \left(\mathbf{z}^T\mathbf{z}\right)^{-1}\mathbf{z}^T \vec{X}, \\ \widehat{\sigma ^2} & = \frac{1}{n-\widetilde{k}} \left\| \vec{X} - \mathbf{z}\widehat{\vec{\theta }}\right\| ^2 = \frac{1}{n-\widetilde{k}} \left\| \vec{X} - \vec{X}_{L}\right\| ^2 = \\ & = \frac{1}{n-\widetilde{k}}\left\| \vec{X}_{L^\perp }\right\| ^2 = \frac{1}{n -\tilde{k}}\operatorname {RSS} \end{align} \]

являются несмещенными оценками \(\vec{\theta }, \sigma^2\). Они являются функциями от полной, достаточной статистики, следовательно, в силу теоремы Лемана-Шеффе, \(\widehat{\vec{\theta }}, \widehat{\sigma^2}\) – оптимальные оценки \(\vec{\theta }, \sigma^2\) в модели гауссовской регрессии.

ProblemЗадача 5

Взвешивание двух грузов массами \(a\) и \(b\) производится следующим образом: \(n_{1}\) раз взвешивается первый груз (все ошибки измерения имеют распределение \(\left.\mathscr {N}\left(0, \sigma^{2}\right)\right), n_{2}\) раза взвешивается второй груз на тех же самых весах, затем \(n_{3}\) раза на других весах взвешиваются первый и второй груз вместе, все ошибки измерения на которых имеют распределение \(\mathscr {N}\left(0, 3 \sigma^{2}\right)\). Сведите задачу к линейной модели и найдите оценки наименьших квадратов для \(a\) и \(b\), а также оптимальную оценку для \(\sigma^{2}\).

ProblemЗадача 6

Пусть вектор \(\vec{X}=\left(X_{1}, \ldots , X_{n}\right)^T\) имеет распределение \(\mathscr {N}\left(a \cdot \vec{b}, \sigma^{2} \vec{\Sigma }\right)\), где \(\vec{b}\) – известный вектор размерности \(n\), \(\vec{\Sigma }\) – известная положительно определённая матрица, \(a\) и \(\sigma^{2}\)- неизвестные параметры. Сведите задачу к линейной гауссовской модели и найти оценки наименьших квадратов параметров \(a\) и \(\sigma^{2}\).

3.2 Доверительные интервалы для параметров

Мы построили точечные несмещенные оценки параметров линейной модели, которые в гауссовском случае оказались оптимальными. Построим в этом случае доверительные интервалы для упомянутых параметров.

Рассмотрим мотивирующий пример.

ExampleПример 5

Пусть \(X_1, \ldots , X_n\) – выборка из \(\mathscr {N}\left(\mu , \sigma^2\right)\), причем

  1. \(\mu\) неизвестно, \(\sigma^2\) известно;

  2. \(\mu\) известно, \(\sigma^2\) неизвестно;

  3. \(\mu\) неизвестно, \(\sigma^2\) неизвестно. Постройте для неизвестных параметров доверительные интервалы уровня доверия \(\alpha\).

SolutionРешение

Данная модель – простейший пример гауссовской линейной регрессии. А именно, пусть

\[ \vec{X} = \mathbf{z}\vec{\theta } + \vec{\varepsilon } \]

где мы вводим

\[ \vec{X} := \begin{pmatrix} X_1 \\ \vdots \\ X_n \end{pmatrix}, \quad \mathbf{z} := \begin{pmatrix} 1 \\ \vdots \\ 1 \end{pmatrix}, \quad \vec{\theta } := (\mu ), \quad \vec{\varepsilon } := \begin{pmatrix} X_1 - \mu \\ \vdots \\ X_n - \mu \end{pmatrix} \]

Почему это гауссовская регрессия? Самое главное – это проверить условия на ошибки. Из условия известно, что компоненты \(\vec{X}\) независимы и распределены по Гауссу. Значит \(\vec{X}\) – это гауссовский вектор, причем

\[ \vec{X} \sim \mathscr {N}\left(\mu \cdot \vec{1}, \sigma ^2 \cdot \mathbf{I}_{n}\right) \]

Значит

\[ \vec{\varepsilon } \sim \mathscr {N}\left(\vec{0}, \sigma ^2 \cdot \mathbf{I}_{n}\right) \]

Условия на ошибки (независимость, центрированность, одинаковая распределенность по Гауссу) выполнены.

Полностью модели регрессии соответствует случай в), когда неизвестны и \(\vec{\theta } = (\mu )\), и \(\sigma^2\).

Предварительно заметим, что \(\sum_{i=1}^n X_i \sim \mathscr {N}\left(n\mu , n\sigma^2\right)\), значит выборочное среднее имеет распределение

\[ \overline{X} = \frac{1}{n}\sum _{i=1}^n X_i \sim \mathscr {N}\left(\mu , \sigma ^2/n\right) \]

Если центрировать и нормировать (поделить на ст. отклонение), получим ст. нормальное распределение:

\[ \frac{\overline{X} - \mu }{\sigma /\sqrt{n}} \sim \mathscr {N}\left(0, 1\right) \]

Напомним, чтобы построить доверительный интервал, нужно найти центральную статистику: у нее распределение не должно зависеть от неизвестных параметров.

Enum-item(1)

\(\mu\) неизвестно, \(\sigma^2\) известно, значит мы можем свободно использовать \(\sigma\). Центральной статистикой для нас будет как раз

\[ \frac{\overline{X} - \mu }{\sigma /\sqrt{n}} \]

Enum-item(2)

\(\mu\) известно, \(\sigma^2\) неизвестно. Нужно оценить дисперсию. Хорошую оценку для дисперсии \(\sigma^2\) может дать выборочная дисперсия, посчитанная с использованием реального матожидания:

\[ \widehat{\sigma ^2} := \frac{1}{n}\sum _{i=1}^n \left(X_i - \mathbb {E}\left[X_i\right]\right)^2 = \frac{1}{n}\sum _{i=1}^n \left(X_i - \mu \right)^2 \]

Чтобы построить доверительный интервал, нужно найти распределение \(\widehat{\sigma^2}\). Заметим, что \(X_i - \mu \sim \mathscr {N}\left(0, \sigma^2\right)\), значит \(\frac{X_i - \mu }{\sigma } \sim \mathscr {N}\left(0, 1\right)\). Следовательно

\[ n\frac{\widehat{\sigma ^2}}{\sigma ^2} = \sum _{i=1}^n \left(\frac{X_i - \mu }{\sigma }\right)^2 \]

– сумма квадратов \(n\) независимых стандартных нормальных случайных величин.

Определение 1 Распределение случайной величины, равной сумме квадратов \(n\) независимых стандартных нормальных случайных величин, называется распределением хи-квадрат с \(n\) степенями свободы. Обозначение: \(\chi^2_n\). Можно доказать, что хи-квадрат распределение – это частный случай гамма-распределения: \(\chi^2_n = \Gamma \left(\frac{n}{2}, \frac{1}{2}\right)\).

У статистики \(n\frac{\widehat{\sigma^2}}{\sigma^2} \sim \chi^{2}_{n}\) распределение не зависит от параметра, значит это центральная статистика. Пусть \(Q_{\chi^2_n}(\alpha )\) – это квантиль уровня \(\alpha\). Тогда

\[ \mathbb {P}\left(0 \quad \leq \quad n\frac{\widehat{\sigma ^2}}{\sigma ^2} \quad \leq \quad Q_{\chi ^2_n}(\alpha )\right) = \alpha \]

Решим неравенство внутри вероятности относительно \(\sigma^2\). Получим

\[ \mathbb {P}\left(n \widehat{\sigma ^2} \cdot \frac{1}{Q_{\chi ^2_n}(\alpha )} \quad \leq \quad \sigma ^2 \quad < \quad +\infty \right) = \alpha \]

Enum-item(3)

\(\mu\) неизвестно, \(\sigma^2\) неизвестно. Если бы \(\sigma^2\) была известна, то построить доверительный интервал для \(\mu\) не составило бы никакого труда (см. пункт выше). В нашем случае \(\sigma^2\) неизвестна, попробуем оценить. Хорошую оценку для дисперсии \(\sigma^2\) дает выборочная дисперсия \(S^2\):

\[ \widehat{\sigma ^2} := S^2 = \frac{1}{n}\sum _{i=1}^n \left(X_i - \overline{X}\right)^2 \]

Теперь надо найти распределение \(\widehat{\sigma^2}\). Пусть \(L = \operatorname {span}(\vec{z}_{\cdot 1} ) = \operatorname {span}(\vec{1})\) – одномерное линейное подпространство в \(\mathbb {R}^{n}\), порожденное вектором из единиц. Как мы убедились выше, проекция \(\vec{X}\) на \(L\) – это вектор, состоящий из выб. средних:

\[ \vec{X}_{L} = \begin{pmatrix} \overline{X} \\ \vdots \\ \overline{X} \end{pmatrix} = \overline{X} \cdot \vec{1} \]

Тогда

\[ n\widehat{\sigma ^2} = \sum _{i=1}^n \left(X_i - \overline{X}\right)^2 = \left\| \vec{X} - \overline{X} \cdot \vec{1}\right\| ^2 = \left\| \vec{X}_{L^{\perp }}\right\| ^2 \]

\(\widehat{\sigma^2}\) – это функция от вектора \(\vec{X}_{L^{\perp }}\), а \(\overline{X}\) – функция от \(\vec{X}_{L}\).

Пусть \(\mathbf{z}_{L_2} \in \mathbb {R}^{n \times (n-1)}\) – это матрица, столбцы которой образуют ортонормированный базис подпространства \(L_2 := L^{\perp }\) (тогда \(\mathbf{z}_{L_2}\mathbf{z}_{L_2}^T\) – матрица проекции на \(L_2\), см. замечание об ортонормированных столбцах выше). Имеем

\[ \begin{align} n\widehat{\sigma ^2} & = \left\| \vec{X}_{L^{\perp }}\right\| ^2 = \left\langle \vec{X}_{L^{\perp }}, \vec{X}_{L^{\perp }} \right\rangle = \\ & = \left\langle \mathbf{z}_{L_2}\mathbf{z}_{L_2}^T \vec{X}, \mathbf{z}_{L_2}\mathbf{z}_{L_2}^T \vec{X} \right\rangle = \\ & = \left(\mathbf{z}_{L_2}\mathbf{z}_{L_2}^T \vec{X}\right)^T \cdot \mathbf{z}_{L_2}\mathbf{z}_{L_2}^T \vec{X} = \\ & = \vec{X}^T \mathbf{z}_{L_2} \underbrace{\mathbf{z}_{L_2}^T \cdot \mathbf{z}_{L_2}}_{=\mathbf{I}_{n-1}}\mathbf{z}_{L_2}^T \vec{X} = \\ & = \left\langle \mathbf{z}_{L_2}^T\vec{X}, \mathbf{z}_{L_2}^T\vec{X} \right\rangle = \\ & = \left\| \mathbf{z}_{L_2}^T\vec{X}\right\| ^2 \end{align} \]

Причем в последних 2-х строчках ск. произведение уже берется в \(\mathbb {R}^{n-1}\).

Нужно найти распределение \(\mathbf{z}_{L_2}^T\vec{X}\). Это линейное преобразование гауссовского вектора, т.е. это тоже гауссовский вектор, причем матожидание:

\[ \mathbb {E}\left[\mathbf{z}_{L_2}^T\vec{X}\right] = \mathbf{z}_{L_2}^T\mathbb {E}\left[\vec{X}\right] = \mathbf{z}_{L_2}^T \cdot \mu \cdot \underbrace{\vec{1}}_{\in \mathbb {R}^{n}} = \vec{0} \in \mathbb {R}^{n-1} \]

Почему получился \(\vec{0}\)? Потому что столбцы \(\mathbf{z}_{L_2}\) ортогональны \(L_1 = \operatorname {span}(\vec{1})\).

Ковариационная матрица:

\[ \begin{align} \operatorname {Var}\left[\mathbf{z}_{L_2}^T\vec{X}\right] & = \mathbf{z}_{L_2}^T \cdot \operatorname {Var}\left[\vec{X}\right] \cdot \mathbf{z}_{L_2} = \mathbf{z}_{L_2}^T \cdot \sigma ^2 \cdot \mathbf{I}_{n} \cdot \mathbf{z}_{L_2} = \sigma ^2 \cdot \mathbf{z}_{L_2}^T \cdot \mathbf{z}_{L_2} = \\ & = \sigma ^2 \cdot \mathbf{I}_{n-1} \end{align} \]

Итого,

\[ \mathbf{z}_{L_2}^T\vec{X} \sim \mathscr {N}\left(\vec{0}, \sigma ^2 \cdot \mathbf{I}_{n-1}\right) \]

Значит у \(\frac{1}{\sigma }\mathbf{z}_{L_2}^T\vec{X}\) компоненты – это независимые ст. нормальные случайные величины, всего \(n-1\) штук. Значит

\[ n\cdot \frac{\widehat{\sigma ^2}}{\sigma ^2} = \left\| \frac{1}{\sigma }\mathbf{z}_{L_2}^T \vec{X}\right\| ^2 \sim \chi ^2_{n-1} \]

Нашли распределение для \(\widehat{\sigma^2}\)!

Далее нужно найти центральную статистику для доверительного интервала для \(\mu\). В пункте выше мы использовали \(\frac{\overline{X} - \mu }{\sqrt{\sigma^2/n}}\). В данном случае \(\sigma^2\) неизвестно. Заменим \(\sigma^2\) на оценку \(\widehat{\sigma^2}\):

\[ \frac{\overline{X} - \mu }{\sqrt{\widehat{\sigma ^2}/n}} \]

Нужно найти распределение этого выражения. Преобразуем:

\[ \frac{\overline{X} - \mu }{\sqrt{\widehat{\sigma ^2}/n}} = \frac{(\overline{X} - \mu )/\sqrt{\sigma ^2 / n}}{\sqrt{\left(n \widehat{\sigma ^2}/\sigma ^2\right)/n}} = \frac{\xi }{\sqrt{\eta / n}} \]

где

\[ \xi := \frac{\overline{X} - \mu }{\sqrt{\sigma ^2/n}}, \qquad \eta := n\frac{\widehat{\sigma ^2}}{\sigma ^2} \]

Определение 2 Пусть \(\xi , \eta\)- независимые случайные величины, распределенные по законам \(\mathcal{N}(0,1), \chi_{n}^{2}\) соответственно. Тогда случайная величина \[ \frac{\xi }{\sqrt{\eta / n}} \] имеет распределение Стьюдента с \(n\) степенями свободы (обозначается \(T_n\)).

В нашем случае \(\xi \sim \mathscr {N}\left(0, 1\right)\) и \(\eta \sim \chi^2_{n-1}\) независимы (\(\xi\) – функция от \(\vec{X}_L\), \(\eta\) – от \(\vec{X}_{L^\perp }\); независимость обосновывает теорема Кокрена ниже), но в знаменателе у нас \(\sqrt{\eta /n}\), а не \(\sqrt{\eta /(n-1)}\). Поправим нормировку:

\[ \frac{\overline{X} - \mu }{\sqrt{\widehat{\sigma ^2}/(n-1)}} = \frac{\xi }{\sqrt{\eta /(n-1)}} \sim T_{n-1} \]

(эквивалентно, \(\frac{\overline{X} - \mu }{\sqrt{s^2/n}} \sim T_{n-1}\), где \(s^2 = \frac{n}{n-1}\widehat{\sigma^2}\) – несмещенная выборочная дисперсия). Это центральная статистика, и доверительный интервал для \(\mu\) уровня доверия \(\alpha\) получается стандартно:

\[ \mathbb {P}\left(\mu \in \left(\overline{X} - \sqrt{\tfrac {s^2}{n}}\, Q_{T_{n-1}}\left(\tfrac {1+\alpha }{2}\right), \; \; \overline{X} - \sqrt{\tfrac {s^2}{n}}\, Q_{T_{n-1}}\left(\tfrac {1-\alpha }{2}\right)\right)\right) = \alpha . \]

Интервал для \(\sigma^2\) при неизвестном \(\mu\) строится как в пункте б), только теперь \(n\widehat{\sigma^2}/\sigma^2 \sim \chi^2_{n-1}\), т.е. степеней свободы \(n-1\).

Плотности \(\chi^2_k\) и \(T_k\)

Слева: плотности \(\chi^2_k\) для \(k=1,2,3,5,10\). Справа: плотности \(T_k\) для \(k=1,3,10\) и предельная \(\mathcal N(0,1)\) (пунктир). Чёрная/бирюзовая кривая на каждой панели — текущее \(k\) со слайдера, пересчитываемое непрерывно.

Отклонение текущей \(T_k\) от \(\mathcal N(0,1)\): — (макс. \(|T_k(x)-\mathcal N(0,1)(x)|\) по сетке \(x\in[-4.6,4.6]\))

В общем случае верна следующая теорема.

Теорема 2 (Теорема Кокрена (Cochran) об ортогональном разложении гауссовского вектора) Пусть \(X_1, X_2, \ldots , X_n\) – независимые ст. нормальные случайные величины, т.е.

\[ \vec{X} \sim \mathscr {N}\left(\vec{0}, \mathbf{I}_n\right) \]

где \(\vec{X} = (X_1, \ldots , X_n)^T\). Пусть \(L_{1} \oplus \ldots \oplus L_{r}\) – произвольное разложение \(\mathbb {R}^{n}\) в прямую сумму ортогональных подпространств. Для каждого \(j \in \{ 1, \ldots , r\}\) положим \(\vec{X}_{L_j} := \operatorname {proj}_{L_{j}} \vec{X}\). Тогда

  • \(\vec{X}_{L_1}, \ldots , \vec{X}_{L_r}\) – независимые в совокупности случайные векторы;

  • \(\left\| \vec{X}_{L_j}\right\|^2 \sim \chi^2_{\dim (L_j)}\) для каждого \(j \in \{ 1, \ldots , r\}\).

Пусть

\[ \vec{X} \sim \mathscr {N}\left(\vec{a}, \sigma ^2 \mathbf{I}_n\right), \]

пусть \(L_{1} \oplus \ldots \oplus L_{r}\) – разложение \(\mathbb {R}^{n}\) в прямую сумму ортогональных подпространств. Для каждого \(j \in \{ 1, \ldots , r\}\) положим \(\vec{X}_{L_j} := \operatorname {proj}_{L_{j}} \vec{X}\). Тогда \(\vec{X}_{L_1}, \ldots , \vec{X}_{L_r}\) – независимые в совокупности, причем

\[ \frac{1}{\sigma ^2}\left\| \vec{X}_{L_j} - \mathbb {E}\left[\vec{X}_{L_j}\right]\right\| ^2 \sim \chi ^2_{\dim (L_j)} \]

ProblemЗадача 7

Пусть \(\vec{X} = \left(X_{1}, \ldots , X_{n}\right)^T\)- выборка из нормального распределения с параметрами \(\left(a, \sigma^{2}\right)\). Докажите, что статистики \(\bar{X}\) и \[ S^{2}=\frac{1}{n} \sum _{i=1}^{n}\left(X_{i}- \overline{X}\right)^{2} \] независимы и вычислите распределение статистики \(n S^{2}\).

В общем случае \(\vec{X} \sim \mathscr {N}\left(\mathbf{z}\vec{\theta }, \sigma^2 \mathbf{I}_n\right)\), необходимо построить доверительные интервалы для компонент \(\vec{\theta }\) и для \(\sigma^2\). Пусть

\[ L = \begin{cases} \operatorname {span}\left(\vec{z}_{\cdot 1}, \vec{z}_{\cdot 2}, \ldots , \vec{z}_{\cdot k}\right), & \text{если в модели нет св. пар-а } \theta _0 \\ \operatorname {span}\left(\overrightarrow {1}, \vec{z}_{\cdot 1}, \vec{z}_{\cdot 2}, \ldots , \vec{z}_{\cdot k}\right), & \text{если в модели есть св. пар-р } \theta _0 \end{cases} \]

Тогда векторы \(\vec{X}_{L}, \vec{X}_{L^\perp }\) – независимые гауссовские случайные векторы.

  • \(\widehat{\vec{\theta }}\) линейно зависит от \(\vec{X}_{L}\),

  • \(\widehat{\sigma^2}\) – функция от \(\vec{X}_{L^\perp }\)

Значит \(\widehat{\vec{\theta }}, \widehat{\sigma^2}\) – независимы. Матожидание и ковариационную матрицу \(\widehat{\vec{\theta }} = \left(\mathbf{z}^T\mathbf{z}\right)^{-1}\mathbf{z}^T \vec{X}\) мы уже вычисляли выше: \(\mathbb {E}\left[\widehat{\vec{\theta }}\right] = \vec{\theta }\), \(\operatorname {Var}\left[\widehat{\vec{\theta }}\right] = \sigma^2 (\mathbf{z}^T \mathbf{z})^{-1}\); в гауссовском случае это означает

\[ \widehat{\vec{\theta }} \sim \mathscr {N}\left(\vec{\theta }, \sigma ^2 (\mathbf{z}^T \mathbf{z})^{-1}\right). \]

Далее,

\[ \begin{align} \vec{X}_{L^\perp } & = \vec{X} - \mathbf{z}\widehat{\vec{\theta }}, \qquad \mathbb {E}\left[\vec{X}_{L^\perp }\right] = \mathbb {E}\left[\vec{X} - \mathbf{z} \widehat{\vec{\theta }}\right] = \mathbf{z}\vec{\theta } - \mathbf{z}\vec{\theta } = \vec{0}, \\ \frac{1}{\sigma ^2} \left\| \vec{X}_{L^\perp } - \mathbb {E}\left[\vec{X}_{L^\perp }\right]\right\| ^2 & = \frac{1}{\sigma ^2 } \left\| \vec{X}_{L^\perp }\right\| ^2 = \frac{n-\widetilde{k}}{\sigma ^2}\widehat{\sigma ^2} \sim \chi ^2_{n-\widetilde{k}}. \end{align} \]

Пусть \(\left(\mathbf{z}^T\mathbf{z}\right)^{-1} =: (a_{i,j})\). Тогда

\[ \frac{\widehat{\vec{\theta }} - \vec{\theta }}{\sqrt{\sigma ^2}} \sim \mathscr {N}\left(\overrightarrow {0}, (\mathbf{z}^T \mathbf{z})^{-1}\right), \qquad \frac{\widehat{\vec{\theta }}_i - \theta _i}{\sqrt{a_{i,i}\sigma ^2}} \sim \mathscr {N}\left(0, 1\right), \; \forall i \in \left\{ 1,\ldots ,\widetilde{k}\right\} \]

Итого, \(\frac{\widehat{\vec{\theta }}_i - \theta_i}{\sqrt{a_{i,i}\sigma^2}}, \frac{n-\widetilde{k}}{\sigma^2}\widehat{\sigma^2}\) – 2 независимые случайные величины, причем первая распределена по \(\mathscr {N}\left(0, 1\right)\), а вторая по \(\chi^2_{n-\widetilde{k}}\). Тогда, по определению распределения Стьюдента, имеем

\[ \begin{align} \frac{\frac{\widehat{\vec{\theta }}_i - \theta _i}{\sqrt{a_{i,i}\sigma ^2}}}{\sqrt{\frac{n-\widetilde{k}}{\sigma ^2}\widehat{\sigma ^2}} / \sqrt{n-\widetilde{k}}} = \frac{\widehat{\vec{\theta }}_i - \theta _i}{\sqrt{a_{i,i}\widehat{\sigma ^2}}} & \sim T_{n-\widetilde{k}} \end{align} \]

ExampleПример 6

В гауссовской линейной модели найдите доверительные интервалы для параметров \(\theta_{i}, i \in \{ 1, \ldots , k\}\), и \(\sigma^{2}\) уровня доверия \(\gamma\).

SolutionРешение
  • Обозначим \(a_{i, i}, i \in \{ 1, \ldots , \widetilde{k}\}\), диагональный элемент матрицы \(\left(\mathbf{z}^{T} \mathbf{z}\right)^{-1}\), стоящий на \(i\)-ом месте. Тогда по теореме об ортогональном разложении случайная величина

    \[ \frac{\widehat{\vec{\theta }}_{i}-\theta _{i}}{\sqrt{a_{i, i} \widehat{\sigma ^{2}}}} \]

    имеет распределение \(T_{n-\widetilde{k}}\). Пусть \(Q_{T_{n-\tilde{k}}}(\cdot )\) – квантильная функция распределения \(T_{n-\tilde{k}}\). Тогда

    \[ \mathbb {P}_{\vec{\theta }, \sigma ^{2}}\left(Q_{T_{n-\tilde{k}}}\left(\frac{1-\gamma }{2}\right)<\frac{\widehat{\vec{\theta }}_{i}-\theta _{i}}{\sqrt{a_{i, i} \widehat{\sigma ^{2}}}} < Q_{T_{n-\tilde{k}}}\left(\frac{1+\gamma }{2}\right) \right) =\gamma , \]

    откуда получаем, что доверительный интервал уровня доверия \(\gamma\) для \(\theta_{i}\) равен

    \[ \left(\widehat{\vec{\theta }}_{i}-\sqrt{a_{i, i} \widehat{\sigma ^{2}}}Q_{T_{n-\tilde{k}}}\left(\frac{1+\gamma }{2}\right), \widehat{\vec{\theta }}_{i}-\sqrt{a_{i, i} \widehat{\sigma ^{2}}} Q_{T_{n-\tilde{k}}}\left(\frac{1-\gamma }{2}\right)\right) \]

  • Далее, пусть \(Q_{\chi_{n-\tilde{k}}^2}(\cdot )\) – квантильная функция распределения \(\chi_{n-\tilde{k}}^2\). Тогда

    \[ \mathbb {P}_{\vec{\theta }, \sigma ^{2}}\left(\frac{(n-\widetilde{k}) \widehat{\sigma ^{2}}}{\sigma ^{2}}>Q_{\chi _{n-\tilde{k}}^2}(1 - \gamma )\right) = \gamma \]

    Доверительный интервал уровня доверия \(\gamma\) для \(\sigma^{2}\) равен

    \[ \left(0, \frac{(n-\widetilde{k}) \widehat{\sigma ^{2}}}{Q_{\chi _{n-\tilde{k}}^2}(1 - \gamma )}\right). \]

ProblemЗадача 8

Пусть \(X_{1}, \ldots , X_{n}\) – выборка из \(\mathscr {N}\left(a, \sigma^{2}\right)\) (оба параметра неизвестны). Постройте точные доверительные интервалы для каждого из параметров \(a, \sigma^{2}\).

ProblemЗадача 9

Пусть \(X_{i}, i \in \{ 1, \ldots , n\}\) – независимые случайные величины, распределенные по нормальному закону с параметрами \(\left(a+b i, \sigma^{2}\right), \; a,b \in \mathbb {R}, \; \sigma^2 \in \mathbb {R}_+\). Постройте точные доверительные интервалы для параметров \(a, b, \sigma^{2}\).

4 Регрессия со случайными регрессорами

У исследователя не всегда есть возможность контролировать регрессоры \(\mathbf{z}\). В общем случае их тоже можно считать случайными:

\[ \vec{X} = \mathbf{Z}\vec{\theta } + \vec{\varepsilon }, \]

где \(\mathbf{Z}\) – случайный элемент со значениями в пространстве \(\mathbb {R}^{n \times \widetilde{k}}\). Предпосылки на ошибки здесь такие же, как в Глава 1.3, но все матожидания меняются на условные по \(\mathbf{Z}\):

  1. \(\mathbb {E}\left[ \vec{\varepsilon } \mid \mathbf{Z} \right] = \overrightarrow {0} \in \mathbb {R}^{n}\);

  2. \(\operatorname {Var}\left[ \vec{\varepsilon } \mid \mathbf{Z} \right] = \mathbb {E}\left[ \vec{\varepsilon }\vec{\varepsilon }^T \mid \mathbf{Z} \right] - \mathbb {E}\left[ \vec{\varepsilon } \mid \mathbf{Z} \right] \cdot \mathbb {E}\left[ \vec{\varepsilon }^T \mid \mathbf{Z} \right] = \sigma^2 \mathbf{I}_n\).

Все результаты, полученные выше, сохраняются, если заменить матожидания и распределения на условные матожидания и условные распределения по \(\mathbf{Z}\). Например, в случае гауссовской регрессии теперь имеем \(\operatorname {Law}\left(\widehat{\vec{\theta }} \mid \mathbf{Z}\right) = \mathscr {N}\left(\vec{\theta }, \sigma^2 \left(\mathbf{Z}^T\mathbf{Z}\right)^{-1}\right)\).

Отличие состоит в том, например, что теперь не так просто получить безусловное распределение \(\operatorname {Law}\left(\widehat{\vec{\theta }}\right)\), поскольку распределение \(\mathbf{Z}\) может быть произвольным. Однако если условное распределение не зависит от \(\mathbf{Z}\), как, например, в этих случаях:

\[ \operatorname {Law}\left(\frac{n-\widetilde{k}}{\sigma ^2}\widehat{\sigma ^2} \mid \mathbf{Z}\right)[\bigg] = \chi ^2_{n-\widetilde{k}}, \qquad \operatorname {Law}\left(\frac{\widehat{\vec{\theta }}_i - \theta _i}{\sqrt{a_{i,i}\widehat{\sigma ^2}}} \mid \mathbf{Z}\right)[\bigg] = T_{n-\widetilde{k}}, \]

то от условного распределения можно перейти к безуловному:

\[ \operatorname {Law}\left(\frac{n-\widetilde{k}}{\sigma ^2}\widehat{\sigma ^2} \right) = \chi ^2_{n-\widetilde{k}}, \qquad \operatorname {Law}\left(\frac{\widehat{\vec{\theta }}_i - \theta _i}{\sqrt{a_{i,i}\widehat{\sigma ^2}}}\right) = T_{n-\widetilde{k}} \]