Этот конспект ещё находится в процессе редактуры: в тексте могут встречаться опечатки, неточности и локально не проработанные места. Если что-то нашли — сообщите, пожалуйста, автору (контакты на странице курса).
Продолжим говорить о свойствах оценок. Мы хотим найти лучшую оценку среди несмещенных. Критерий эффективности не решает задачу полностью: его условия могут нарушаться, в то время как наилучшая оценка может существовать.
Определение 1 Статистика \(S(X)\) – достаточная для семейства распределений \(\mathcal{P}\), если условное распределение \(\mathbb {P}_{\theta }\left(X \in B \mid S(X)=x\right)\) не зависит от \(\theta\).
Достаточная статистика содержит всю информацию о неизвестном параметре, которую нам может дать выборка. Наиболее очевидный пример достаточной статистики – сама выборка \(X\). Однако, как правило, существуют достаточные статистики размерности, гораздо меньшей, чем выборка. В этом случае при проведении какого-то долговременного исследования после сбора данных для исследования можно вычислить найденную статистику и сохранить ее у себя, а сами данные выбросить, сильно оптимизировав объем памяти, необходимый для хранения результатов исследования.
Далее мы сформулируем критерий того, что статистика является достаточной, но прежде, чтобы проиллюстрировать определение этого понятия, решим задачу на проверку достаточности.
ExampleПример 1
Пусть \(X_{1}, \ldots , X_{n}\) – выборка из распределения \(\operatorname {Bern}(\theta )\). Докажите, что \(\sum_{i=1}^{n} X_{i}\) – достаточная статистика.
SolutionРешение
Проверим определение достаточной статистики: \[
\begin{align} \mathbb {P}\left(X_{1}=x_{1}, \ldots , X_{n}=x_{n} \mid S(X)=s\right)= \\ =\frac{\mathbb {P}\left(X_{1}=x_{1}, \ldots , X_{n}=x_{n}, \sum X_{i}=s\right)}{\mathbb {P}\left(\sum X_{i}=s\right)}= \\ =\; \mathbb {1}_{\sum _{i=1}^{n} x_{i}=s} \frac{\theta ^{\sum x_{i}}(1-\theta )^{n-\sum x_{i}}}{C_{n}^{s} \theta ^{s}(1-\theta )^{n-s}} . \end{align}
\] На носителе индикатора \(\sum x_i = s\), поэтому \(\theta^{\sum x_i}(1-\theta )^{n-\sum x_i}=\theta^{s}(1-\theta )^{n-s}\) и эти множители сокращаются со знаменателем: \[
\mathbb {P}\left(X_{1}=x_{1}, \ldots , X_{n}=x_{n} \mid S(X)=s\right)=\frac{1}{C_{n}^{s}} \; \mathbb {1}_{\sum x_{i}=s} .
\] Видим, что условное распределение не зависит от \(\theta\), значит, статистика \(\sum_{i=1}^{n} X_{i}\) является достаточной для семейства распределений \(\operatorname {Bern}(\theta )\).
Теорема 1 (Критерий факторизации Неймана-Фишера) Пусть \(\mathcal{P}=\left\{ \mathbb {P}_{\theta }, \theta \in \Theta \right\}\) – доминируемое семейство распределений \(\mathbb {P}_{\theta }\) с “обобщенной” плотностью \(p_{\theta }\) (в случае дискретного распределения \(\left.p_{\theta }(x)=\mathbb {P}_{\theta }(X=x)\right), X\) – наблюдение с неизвестным распределением \(\mathbb {P}_{\theta } \in \mathcal{P}\). Тогда \(S(X)\) – достаточная статистика в том и только том случае, когда “обобщенная” плотность (функция правдоподобия) допускает представление \[
p_{\theta }(X)=\psi (S(X), \theta ) h(X),
\] где функция \(h\) не зависит от параметра \(\theta\).
и применив критерий факторизации, получим, что статистика \(S(X)=\left(\sum X_{i}^{2}, \sum X_{i}\right)\) является достаточной.
Примечание. Заметим, что любая биекция от достаточной статистики будет являться достаточной. В данном случае, например, помимо \(\left(\sum X_{i}^{2}, \sum X_{i}\right)\) достаточными статистиками будут, например, \(\left(\overline{X}, \overline{X^2}\right)\) и \(\left(\overline{X}, s^2\right)\).
ProblemЗадача 1
Найдите достаточные статистики для следующих параметрических распределений:
\(N(a, \sigma^2)\);
\(\Gamma (\alpha , \lambda )\);
\(U(a,b)\);
\(\mathrm{Pois}(\lambda )\);
\(\mathrm{Ber}(p)\);
\(\mathrm{Geom}(p)\).
Примечание. Каждый пункт оценивается в \(0.3\) балла.
Теорема является прямым следствием свойств условного матожидания. Переход от несмещенной оценки \(\widehat{\tau }\) к \(\tau^{*}=\mathbb {E}_{\theta }\left[\widehat{\tau } \mid S(X)\right]\) называется Рао-Блэкуэллизацией (Rao-Blackwellization) или улучшением Рао-Блэкуэлла оценки \(\widehat{\tau }\).
Заметим, что данная теорема позволяет лишь улучшить функцию риска несмещенной оценки \(\hat{\theta }\), а наилучшую оценку она позволяет найти, если на статистику \(S(X)\) наложить дополнительное условие, называемое полнотой. Если же полнота отсутствует, то в некоторых случаях улучшение Рао-Блэкуэлла-Колмогорова может не быть оптимальным, что показывает следующая задача.
ProblemЗадача 2
Пусть \(X_1, \ldots , X_n\) – выборка из распределения \(U[(1-k)\theta , (1+k)\theta ]\), с неизвестным параметром \(\mathbb {E}\left[X_1\right] = \theta > 0\) и известным параметром \(k \in (0,1)\).
Докажите, что \(\widehat{\theta }_1 := X_1, \; \widehat{\theta }_2 := \overline{X}\) – несмещенные оценки \(\theta\). Вычислите их дисперсии;
Докажите, что \(T(X) := (X_{(1)}, X_{(n)})^T\) – достаточная статистика;
Вычислите функцию риска (дисперсию) оценки \(\theta^*_1\). Покажите, что эта оценка, являющаяся улучшением Рао-Блэкуэлла-Колмогорова \(\widehat{\theta }_1\) и \(\widehat{\theta }_2\), равномерно лучше \(\widehat{\theta }_1, \widehat{\theta }_2\).
где \(T_1 \prec T_2\) означает, что оценка \(T_1\) лучше \(T_2\) в равномерном подходе с квадратичной функцией потерь.
Докажите, что статистика \(T = (X_{(1)}, X_{(n)})^T\) не является полной (см. определение в следующих параграфах), и поэтому \(\theta^*_1\) не является оптимальной оценкой.
*Примечание.** Вся задача оценивается в 3 балла. Если вы ее решили, решение нужно прислать в телеграм.
2 Полные статистики
Определение 2 Статистика \(S(X)\) называется полной для \(\left\{ \mathbb {P}_{\theta }, \theta \in \Theta \right\}\), если для всех функций \(f(x)\) со свойством \[
\forall \theta \in \Theta \quad \mathbb {E}_{\theta }\left[f(S(X))\right]=0
\] выполнено \(f(S(X)) = 0\)\(\mathbb {P}_\theta\)-п.н. \(\forall \theta \in \Theta\). Т.е. \(S\) – полная статистика, если не существует функции от нее \(f(S)\), которая бы являлась нетривиальной (не равной тождественно нулю) несмещенной оценкой нуля.
Полнота нужна для теоремы Лемана-Шеффе, которая утверждает, что если в условиях теоремы Рао-Блэкуэлла-Колмогорова брать не просто достаточную статистику \(S\), а полную и достаточную, то получающаяся после Рао-Блэкуэллизации оценка будет не просто лучше исходной в среднеквадратическом смысле, а она получится самой лучшей, т.е. оптимальной. Подробнее об этом в следующем параграфе. Пока немного разберемся с полнотой.
ExampleПример 3
Докажите, что статистика \(\sum_{i=1}^{n} X_{i}\) является не только достаточной, но и полной для семейства распределений \(\operatorname {Bern}(\theta ), \theta \in \Theta = (0,1)\).
Докажите, что двумерная статистика \((\sum_{i=1}^{n} X_{i}, X_1)\) является достаточной, но не является полной.
SolutionРешение
Достаточность была доказана выше.
Полнота: нужно доказать, что если для всех \(\theta \in (0,1)\) и какой-то функции \(f(x)\) выполнено \(\mathbb {E}_{\theta }\left[f\left(\sum X_{i}\right)\right]=0\), то \(f(x)=0\) для всех \(x \in \{ 0,1, \ldots , n\}\). Имеем
Мы получили в правой части многочлен не более чем \(n\)-ой степени от \(\theta\). Если не все его коэффициенты равны 0 , то он имеет не более чем \(n\) корней на \((0,1)\). Но этот многочлен равен 0 для всех \(\theta \in (0,1)\), т.е. все \(\theta\) из интервала \((0,1)\) являются его корнями. Следовательно, все коэффициенты этого многочлена равны 0 , а значит, \(f(k)=0\) для всех \(k \in \{ 0, \ldots , n\}\).
Для оценки \((\sum_{i=1}^{n} X_{i}, X_1)\): она достаточна, поскольку ее первая компонента является достаточной, а от расширения оценки достаточность, очевидно, потеряться не может. Полнота: построим из нее оценку
\[
T(X) = \sum _{i=1}^{n} X_{i} - nX_1
\]
Эта оценка является несмещенной оценкой нуля: \(\forall \theta \in (0,1)\) имеем
При этом она нетривиальна, т.е. не равна п.н. нулю при любом \(\theta\). Следовательно, \((\sum_{i=1}^{n} X_{i}, X_1)\) не является полной.
Как видно из примера, увеличение размерности оценки, добавление к ней новых компонент, может привести к потере полноты (достаточность при этом сохранится, если она изначально была). При этом полнота – это скорее свойство модели, чем свойство статистики. В этом можно наглядно убедиться, решив задачу ниже.
ProblemЗадача 3
Приведите пример параметрического семейства распределений \(\mathcal{P}\) и нетривиальной неполной достаточной статистики \(S(X_1, \ldots , X_n)\) размерности 1, где \(X_1, \ldots , X_n\) – выборка из неизвестного распределения \(\mathbb {P} \in \mathcal{P}\).
HintПодсказка
Возьмите \(\mathcal{P}\) равным набору распределений \(\operatorname {Bern}(\theta )\), т.е. как в примере выше. Но уменьшите параметрическое множество: пусть \(\Theta = \left\{ \frac{1}{3}, \frac{2}{3}\right\}\).
Таким образом, полнота может потеряться при расширении статистики или при сужении параметрического множества.
Разумеется, далеко не всегда статистика \(\sum_{i=1}^{n} X_{i}\) является полной. Как же найти полную статистику? Доказывать полноту по определению, как правило, достаточно сложно. Однако, как мы увидим далее, для достаточно широкого класса распределений полную статистику можно найти просто из функции правдоподобия.
Напомним понятие экспоненциального семейства, подробно введенное в §экспоненциальные семейства: набор распределений \(\mathcal{P} = \left\{ \mathbb {P}_{\theta }, \theta \in \Theta \subset \mathbb {R}^{k}\right\}\) называется экспоненциальным семейством, если его обобщенная плотность имеет вид
где число слагаемых \(a_i(\theta )u_i(x)\) не превосходит размерности \(\Theta\), а носитель распределения не зависит от параметра. Там же было доказано, что нормальное, экспоненциальное, биномиальное, пуассоновское и многие другие распределения принадлежат к экспоненциальному семейству (см. пример с \(\mathscr {N}\left(\mu , \sigma^2\right)\)).
Теорема 3 (об экспоненциальных семействах) Пусть \(\theta \in \Theta \subset \mathbb {R}^{k}\) и для семейства распределений \(\left\{ \mathbb {P}_{\theta }, \theta \in \Theta \right\}\) выполнено условие Уравнение 1. Пусть, кроме того, множество всех значений вектора \(\left(a_{1}(\theta ), \ldots , a_{k}(\theta )\right)\) при \(\theta \in \Theta\) содержит \(k\)-мерный шар пространства \(\mathbb {R}^{k}\). Тогда \(S(X)=\left(\overline{u_{1}(X)}, \ldots , \overline{u_{k}(X)}\right)\) – полная достаточная статистика.
Для нормального распределения, например, статистика \((\overline{X}, \overline{X^2})\) будет полной и достаточной. Заметим также, что любая биективная функция сохраняет полноту и достаточность. Т.е., например, для нормального распределения статистика \((\overline{X}, s^2) = (\overline{X}, \overline{X^2} - \overline{X}^2)\) тоже будет полной и достаточной.
Стоит заметить, что условие теоремы будет выполнено, если множество \(\Theta\) “телесно”, т.е. содержит свои внутренние точки, и функции \(a_{1}(\theta ), \ldots , a_{k}(\theta )\) в окрестности какой-нибудь внутренней точки \(\theta_{0} \in \Theta\) линейно независимые и гладкие (подробнее об этом – в терминах полноранговых и криволинейных экспоненциальных семейств – см. §экспоненциальные семейства).
ProblemЗадача 4
Применяя теорему об экспоненциальных семействах, найдите полные, достаточные статистики для следующих параметрических распределений:
\(\Gamma (\alpha , \lambda )\);
\(\mathrm{Pois}(\lambda )\);
\(\mathrm{Geom}(p)\).
*Примечание.** Каждый пункт оценивается в \(0.3\) балла.
ProblemЗадача 5
Докажите, что в модели \[
\mathscr {N}\left(\theta , \theta ^2\right), \quad \theta \in \mathbb {R},
\] статистика \((\overline{X}, s^2)\) является достаточной, но не является полной.
HintПодсказка
Для доказательства того, что статистика не является полной, подберите удачную функцию \(f\), посчитав математические ожидания \(\overline{X}\) и \(s^2\).
3 Оптимальные оценки
В этом разделе мы, наконец, приведем алгоритм нахождения наилучших в упомянутом смысле оценок, которые принято называть оптимальными.
Определение 3 Статистика \(\tau^{*}\) называется оптимальной оценкой \(\tau (\theta )\), если \(\tau^{*}\) – наилучшая в среднеквадратичном подходе в классе несмещенных оценка \(\tau (\theta )\) (заметим, что \(\tau (\theta )\) может, вообще говоря, иметь размерность, большую 1).
Напомним, что условное матожидание относительно случайной величины (или вектора) \(S\) всегда можно представить в виде борелевской функции от этой величины (вектора соотв.):
Из этого вытекает альтернативная формулировка теоремы Лемана-Шеффе.
Лемана-Шеффе Любая борелевская функция от полной, достаточной статистики является оптимальной оценкой своего матожидания.
Алгоритм нахождения оптимальной оценки:
Либо ищем достаточную статистику \(S(X)\) с помощью критерия факторизации и доказываем, что она является полной, либо сразу находим полную достаточную статистику, если данное семейство распределений является экспоненциальным.
Решаем относительно \(\varphi\) уравнение “несмещенности” \(\mathbb {E}_{\theta }\left[\varphi (S(X))\right]=\tau (\theta )\) (для любого \(\theta \in \Theta\)). Его решение \(\varphi (S(X))\) является оптимальной оценкой \(\tau (\theta )\).
Кликните по любому блоку, чтобы раскрыть соответствующее определение/теорему. Выберите модель, чтобы подсветить путь построения оптимальной оценки.
гарантий нет: может найтись оценка равномерно лучше \(\tau^*\)
\(\tau^{*}\) оптимальна и не зависит от выбора \(\widehat{\tau}\): \(\tau^{*} = \varphi(S)\), \(\mathbb{E}_\theta[\varphi(S)] = \tau(\theta)\)
Несмещённая оценка
Статистика \(\widehat{\tau}\) называется несмещённой оценкой \(\tau(\theta)\), если \(\mathbb{E}_\theta[\widehat{\tau}] = \tau(\theta)\) при любом \(\theta \in \Theta\). Это отправная точка конвейера — годится вообще любая несмещённая оценка, даже неэффективная: например, для \(\mathrm{Bern}(\theta)\) можно взять просто \(\widehat{\tau} = X_1\) (несмещена, но с большой дисперсией).
Теорема Рао-Блэкуэлла-Колмогорова
Пусть \(S(X)\) — достаточная статистика, \(\widehat{\tau}\) — несмещённая оценка \(\tau(\theta)\), квадратично интегрируемая при любом \(\theta \in \Theta\). Тогда \(\tau^{*}=\mathbb{E}_\theta[\widehat{\tau} \mid S(X)]\) — также несмещённая оценка \(\tau(\theta)\), которая равномерно лучше \(\widehat{\tau}\):
\[
\mathbb{E}_\theta\!\left[(\tau^{*} - \tau(\theta))^2\right] = \operatorname{Var}_\theta(\tau^*) \le \operatorname{Var}_\theta(\widehat{\tau}) = \mathbb{E}_\theta\!\left[(\widehat{\tau} - \tau(\theta))^2\right], \quad \forall \theta \in \Theta.
\]
Усреднение по достаточной статистике («Рао-Блэкуэллизация») никогда не увеличивает риск.
Полнота статистики
Статистика \(S(X)\) называется полной, если для любой борелевской функции \(f\) из \(\mathbb{E}_\theta[f(S(X))] = 0\) при всех \(\theta \in \Theta\) следует \(f(S(X)) = 0\) \(\;\mathbb{P}_\theta\)-п.н. при всех \(\theta\) — т.е. у полной статистики нет нетривиальных несмещённых оценок нуля. Полнота — это в первую очередь свойство модели (параметрического семейства), а не только самой статистики: одна и та же статистика может быть полной для одной модели и переставать быть полной для урезанного параметрического множества той же модели.
Если \(S\) не полна: гарантий нет
Пример: \(X_1,\dots,X_n \sim U[(1-k)\theta,(1+k)\theta]\), \(k \in (0,1)\) известно, \(\theta > 0\) неизвестно. Статистика \(S=(X_{(1)}, X_{(n)})\) достаточна (по критерию факторизации), но не полна. Рао-Блэкуэллизация любой из несмещённых оценок \(\widehat\theta_1=X_1\) или \(\widehat\theta_2=\overline{X}\) даёт одну и ту же улучшенную оценку \(\theta^{*}=\dfrac{X_{(1)}+X_{(n)}}{2}\), равномерно лучшую исходных — но, поскольку \(S\) не полна, теорема Лемана-Шеффе неприменима: доказать оптимальность \(\theta^{*}\) в классе всех несмещённых оценок нельзя, и в принципе может найтись оценка, равномерно лучшая, чем \(\theta^{*}\).
Теорема Лемана-Шеффе
Пусть \(S(X)\) — полная достаточная статистика, \(\widehat{\tau}\) — несмещённая оценка \(\tau(\theta)\). Тогда \(\tau^{*}=\mathbb{E}_\theta[\widehat{\tau} \mid S(X)]\) — оптимальная оценка \(\tau(\theta)\): наилучшая в среднеквадратичном смысле среди всех несмещённых оценок, причём результат один и тот же для любой исходной \(\widehat\tau\). Эквивалентная формулировка: любая борелевская функция от полной достаточной статистики является оптимальной оценкой своего матожидания. Поэтому на практике \(\widehat\tau\) искать не обязательно — можно сразу решать уравнение несмещённости \(\mathbb{E}_\theta[\varphi(S)]=\tau(\theta)\) относительно \(\varphi\).
Кликните по блоку схемы выше, чтобы посмотреть определение или теорему.
ExampleПример 4
Пусть \(X_{1}, \ldots X_{n}\) – выборка из равномерного распределения на \([0, \theta ]\). Найдите оптимальную оценку параметpa \(\theta\).
SolutionРешение
Функция правдоподобия равна \(\frac{1}{\theta^{n}} \; \mathbb {1}_{X_{(n)} \leq \theta }\), поэтому, по критерию факторизации, \(X_{(n)}\) – достаточная статистика. Проверим, что эта статистика является полной:
\[
\mathbb {E}_{\theta }\left[f\left(X_{(n)}\right)\right]=\int _{0}^{\theta } f(x) n \frac{x^{n-1}}{\theta ^{n}} d x
\]
По свойству интеграла Римана, последнее выражение равно 0 для любого \(\theta >0\) тогда и только тогда, когда \(f(x) x^{n-1}=0\) для почти всех \(x>0\) (мера Лебега множества таких \(x\), что последнее выражение отлично от 0 , равна 0 ). Поэтому \(f(x)=0\) ( \(\mathbb {P}_{\theta }\)-П.н.) для всех \(\theta \in \Theta\).
Итак, мы знаем, что \(X_{(n)}\) – полная достаточная статистика. Осталось решить уравнение “несмещенности” \(\mathbb {E}_{\theta }\left[\varphi \left(X_{(n)}\right)\right]=\theta\). Как известно,
Поэтому в качестве решения уравнения можно предложить функцию \(\varphi (x)=\frac{n+1}{n} x\). Следовательно, оценка \(\frac{n+1}{n} X_{(n)}\) является оптимальной.
ProblemЗадача 6
Найдите оптимальную оценку \(\theta > 0\) по выборке из распределения
*Примечание.** Каждый пункт оценивается в \(0.3\) балла.
ProblemЗадача 7
Пусть \(X_1, \ldots , X_n\) – выборка из нормального распределения с параметрами \((a,\sigma^2), \; a \in \mathbb {R}, \; \sigma > 0\). Найдите оптимальную оценку параметра \(\theta = (a, \sigma^2)\).
ProblemЗадача 8
Пусть \(X_1, X_2, \dots , X_n\) – выборка из \(\mathrm{Exp}(\theta )\), \(n \geq 2\). Найдите оптимальные оценки для \(\theta\) и для \(\sqrt{\theta }\).
ProblemЗадача 9
Пусть \(X_1, X_2, \dots , X_n\) – выборка из \(N(0, \theta^2)\). Найдите оптимальную оценку для \(\theta\).