Достаточные статистики и оптимальные оценки

В этой главе мы продолжим говорить о свойствах оценок. Нас по-прежнему будет интересовать вопрос существования оценки, наилучшей в среднеквадратичном подходе (т.е. “оптимальной” в смысле среднеквадратического отклонения) в классе всех несмещенных оценок. Разумеется, критерий эффективности не решает такую задачу полностью – его условия могут быть и не выполнены, в то время как наилучшая оценка может существовать. Прежде чем рассказать об алгоритме нахождения таких оценок, введем понятие достаточной статистики, а также понятие полной статистики.

1 Достаточные статистики

Пусть \(X\) – наблюдение (или выборка наблюдений \(X = (X_1, \ldots , X_n)\)) с неизвестным распределением \(\mathbb {P} \in \mathcal{P}=\left\{ \mathbb {P}_{\theta }\right\}_{\theta \in \Theta }\).

Определение 1 Статистика \(S(X)\)достаточная для семейства распределений \(\mathcal{P}\), если условное распределение \(\mathbb {P}_{\theta }\left(X \in B \mid S(X)=x\right)\) не зависит от \(\theta\).

Достаточная статистика содержит всю информацию о неизвестном параметре, которую нам может дать выборка. Наиболее очевидный пример достаточной статистики – сама выборка \(X\). Однако, как правило, существуют достаточные статистики размерности, гораздо меньшей, чем выборка. В этом случае при проведении какого-то долговременного исследования после сбора данных для исследования можно вычислить найденную статистику и сохранить ее у себя, а сами данные выбросить, сильно оптимизировав объем памяти, необходимый для хранения результатов исследования.

Далее мы сформулируем критерий того, что статистика является достаточной, но прежде, чтобы проиллюстрировать определение этого понятия, решим задачу на проверку достаточности.

ExampleПример 1

Пусть \(X_{1}, \ldots , X_{n}\) – выборка из распределения \(\operatorname {Bern}(\theta )\). Докажите, что \(\sum_{i=1}^{n} X_{i}\) – достаточная статистика.

Проверим определение достаточной статистики: \[ \begin{align} \mathbb {P}\left(X_{1}=x_{1}, \ldots , X_{n}=x_{n} \mid S(X)=s\right)= \\ =\frac{\mathbb {P}\left(X_{1}=x_{1}, \ldots , X_{n}=x_{n}, \sum X_{i}=s\right)}{\mathbb {P}\left(\sum X_{i}=s\right)}= \\ =\; \mathbb {1}_{\sum _{i=1}^{n} x_{i}=s} \frac{\theta ^{\sum x_{i}}(1-\theta )^{n-\sum x_{i}}}{C_{n}^{s} \theta ^{s}(1-\theta )^{n-s}}=\frac{1}{C_{n}^{s}} \; \mathbb {1}_{\sum x_{i}=s} . \end{align} \] Видим, что условное распределение не зависит от \(\theta\), значит, статистика \(\sum_{i=1}^{n} X_{i}\) является достаточной для семейства распределений \(\operatorname {Bern}(\theta )\).

[Критерий факторизации Неймана-Фишера] Пусть \(\mathcal{P}=\left\{ \mathbb {P}_{\theta }, \theta \in \Theta \right\}\) – доминируемое семейство распределений \(\mathbb {P}_{\theta }\) с “обобщенной” плотностью \(p_{\theta }\) (в случае дискретного распределения \(\left.p_{\theta }(x)=\mathbb {P}_{\theta }(X=x)\right), X\) – наблюдение с неизвестным распределением \(\mathbb {P}_{\theta } \in \mathcal{P}\). Тогда \(S(X)\) – достаточная статистика в том и только том случае, когда “обобщенная” плотность (функция правдоподобия) допускает представление

\[ p_{\theta }(X)=\psi (S(X), \theta ) h(X), \]

где функция \(h\) не зависит от параметра \(\theta\).

ExampleПример 2

Пусть \(X_{1}, \ldots , X_{n}\) – выборка из \(\mathscr {N}\left(a, \sigma^2\right)\), \(\theta =\left(a, \sigma^{2}\right)\). Найдите достаточную статистику.

Найдем правдоподобие выборки из \(\mathcal{N}\left(a, \sigma^{2}\right)\):

\[ \begin{align} f_{\theta }\left(X_{1}, \ldots , X_{n}\right)=\frac{1}{\left(2 \pi \sigma ^{2}\right)^{n / 2}} \exp \left\{ -\frac{1}{2 \sigma ^{2}} \sum \left(X_{i}-a\right)^{2}\right\} = \\ =\frac{1}{\left(2 \pi \sigma ^{2}\right)^{n / 2}} \exp \left\{ -\frac{1}{2 \sigma ^{2}} \sum X_{i}^{2}+\frac{a}{\sigma ^{2}} \sum X_{i}-\frac{n a^{2}}{2 \sigma ^{2}}\right\} . \end{align} \] Положив \(h(x)=1\),

\[ \psi \left(s_{1}, s_{2}, \theta \right)=\frac{1}{\left(2 \pi \sigma ^{2}\right)^{n / 2}} \exp \left\{ -\frac{1}{2 \sigma ^{2}} s_{1}+\frac{a}{\sigma ^{2}} s_{2}-\frac{n a^{2}}{2 \sigma ^{2}}\right\} \] и применив критерий факторизации, получим, что статистика \(S(X)=\left(\sum X_{i}^{2}, \sum X_{i}\right)\) является достаточной.

Примечание. Заметим, что любая биекция от достаточной статистики будет являться достаточной. В данном случае, например, помимо \(\left(\sum X_{i}^{2}, \sum X_{i}\right)\) достаточными статистиками будут, например, \(\left(\overline{X}, \overline{X^2}\right)\) и \(\left(\overline{X}, s^2\right)\).

ProblemЗадача 1

Найдите достаточные статистики для следующих параметрических распределений:

  1. \(N(a, \sigma^2)\);

  2. \(\Gamma (\alpha , \lambda )\);

  3. \(U(a,b)\);

  4. \(\mathrm{Pois}(\lambda )\);

  5. \(\mathrm{Ber}(p)\);

  6. \(\mathrm{Geom}(p)\). Примечание. Каждый пункт оценивается в \(0.3\) балла.

[Paо-Блэкуэлла-Колмогорова] Пусть \(S(X)\) – достаточная статистика, \(\widehat{\tau }\) – несмещённая оценка \(\tau (\theta )\), квадратично интегрируемая при любом \(\theta \in \Theta\). Тогда \(\tau^{*}=\mathbb {E}_{\theta }\left[\widehat{\theta } \mid S(X)\right]\) – также несмещенная оценка \(\tau (\theta )\), которая равномерно лучше \(\widehat{\tau }\):

\[ \mathbb {E}_{\theta }\left[\left(\tau ^{*} - \tau (\theta )\right)^2\right] = \Var [\theta ]{\tau ^*} \leq \Var [\theta ]{\widehat{\tau }} = \mathbb {E}_{\theta }\left[\left(\widehat{\tau } - \tau (\theta )\right)^2\right], \quad \forall \theta \in \Theta \]

Теорема является прямым следствием свойств условного матожидания. Переход от несмещенной оценки \(\widehat{\tau }\) к \(\tau^{*}=\mathbb {E}_{\theta }\left[\widehat{\theta } \mid S(X)\right]\) называется Рао-Блеквализацией (Rao-Blackwellization) или улучшением Paо-Блэкуэлла оценки \(\widehat{\tau }\).

Заметим, что данная теорема позволяет лишь улучшить функцию риска несмещенной оценки \(\hat{\theta }\), а наилучшую оценку она позволяет найти, если на статистику \(S(X)\) наложить дополнительное условие, называемое полнотой. Если же полнота отсутствует, то в некоторых случаях улучшение Рао-Блекуелла-Колмогорова может не быть оптимальным, что показывает следующая задача.

ProblemЗадача 2

Пусть \(X_1, \ldots , X_n\) – выборка из распределения \(U[(1-k)\theta , (1+k)\theta ]\), с неизвестным параметром \(\mathbb {E}\left[X_1\right] = \theta > 0\) и известным параметром \(k \in (0,1)\).

  1. Докажите, что \(\widehat{\theta }_1 := X_1, \; \widehat{\theta }_2 := \overline{X}\) – несмещенные оценки \(\theta\). Вычислите их дисперсии;

  2. Докажите, что \(T(X) := (X_{(1)}, X_{(n)})^T\) – достаточная статистика;

  3. Докажите, что \(\theta^*_1 := \mathbb {E}_{\theta }\left[\widehat{\theta }_1 \mid (X_{(1)}, X_{(n)})\right] = \mathbb {E}_{\theta }\left[\widehat{\theta }_2 \mid (X_{(1)}, X_{(n)})\right] = \frac{X_{(1)} + X_{(n)}}{2}\);

  4. Вычислите функцию риска (дисперсию) оценки \(\theta^*_1\). Покажите, что эта оценка, являющаяся улучшением Рао-Блекуелла-Колмогорова \(\widehat{\theta }_1\) и \(\widehat{\theta }_2\), равномерно лучше \(\widehat{\theta }_1, \widehat{\theta }_2\).

  5. Рассмотрим оценку

    \[ \theta _2^*(X) := \frac{1}{2\left(k^2 \frac{n-1}{n+1} + 1\right)} \left[(1-k)X_{(1)} + (1+k)X_{(n)}\right] \] Докажите, что \(\theta_2^*\) также является несмещенной оценкой \(\theta\). Покажите, что она равномерно лучше \(\theta_1^*\).

    Если подытоживать предыдущие пункты, необходимо показать, что

    \[ \theta _2^* \prec \theta _1^* \prec \widehat{\theta }_2 \prec \widehat{\theta }_1, \] где \(T_1 \prec T_2\) означает, что оценка \(T_1\) лучше \(T_2\) в равномерном подходе с квадратичной функцией потерь.

  6. Докажите, что статистика \(T = (X_{(1)}, X_{(n)})^T\) не является полной (см. определение в следующих параграфах), и поэтому \(\theta^*_1\) не является оптимальной оценкой. *Примечание.** Вся задача оценивается в 3 балла. Если вы ее решили, решение нужно прислать в телеграм.

2 Полные статистики

Определение 2 Статистика \(S(X)\) называется полной для \(\left\{ \mathbb {P}_{\theta }, \theta \in \Theta \right\}\), если для всех функций \(f(x)\) со свойством \[ \forall \theta \in \Theta \quad \mathbb {E}_{\theta }\left[f(S(X))\right]=0 \] выполнено \(f(S(X)) = 0\) $_$-п.н. $$. Т.е. \(S\) – полная статистика, если не существует функции от нее \(f(S)\), которая бы являлась нетривиальной (не равной тождественно нулю) несмещенной оценкой нуля.

Полнота нужна для теоремы Лемана-Шеффе, которая утверждает, что если в условиях теоремы Paо-Блэкуэлла-Колмогорова брать не просто достаточную статистику \(S\), а полную и достаточную, то получающаяся после Рао-Блеквализации оценка будет не просто лучше исходной в среднеквадратическом смысле, а она получится самой лучшей, т.е. оптимальной. Подробнее об этом в следующем параграфе. Пока немного разберемся с полнотой.

ExampleПример 3

Докажите, что статистика \(\sum_{i=1}^{n} X_{i}\) является не только достаточной, но и полной для семейства распределений \(\operatorname {Bern}(\theta ), \theta \in \Theta = (0,1)\). Докажите, что двумерная статистика \((\sum_{i=1}^{n} X_{i}, X_1)\) является достаточной, но не является полной.

Достаточность была доказана выше.

Полнота: нужно доказать, что если для всех \(\theta \in (0,1)\) и какойто функции \(f(x)\) выполнено \(\mathbb {E}_{\theta }\left[f\left(\sum X_{i}\right)\right]=0\), то \(f(x)=0\) для всех \(x \in \{ 0,1, \ldots , n\}\). Имеем

\[ \mathbb {E}_{\theta }\left[f\left(\sum X_{i}\right)\right]=\sum _{k=0}^{n} f(k) C_{n}^{k} \theta ^{k}(1-\theta )^{n-k} . \] Мы получили в правой части многочлен не более чем \(n\)-ой степени от \(\theta\). Если не все его коэффициенты равны 0 , то он имеет не более чем \(n\) корней на \((0,1)\). Но этот многочлен равен 0 для всех \(\theta \in (0,1)\), т.е. все \(\theta\) из интервала \((0,1)\) являются его корнями. Следовательно, все коэффициенты этого многочлена равны 0 , а значит, \(f(k)=0\) для всех \(k \in \{ 0, \ldots , n\}\).

Для оценки \((\sum_{i=1}^{n} X_{i}, X_1)\): она достаточна, поскольку ее первая компонента является достаточной, а от расширения оценки достаточность, очевидно, потеряться не может. Полнота: построим из нее оценку

\[ T(X) = \sum _{i=1}^{n} X_{i} - nX_1 \] Эта оценка является несмещенной оценкой нуля: \(\forall \theta \in (0,1)\) имеем

\[ \mathbb {E}_{\theta }\left[T\right] = \mathbb {E}_{\theta }\left[\sum _{i=1}^{n} X_{i} - nX_1\right] = n\theta - n\theta = 0. \] При этом она нетривиальна, т.е. не равна п.н. нулю при любом \(\theta\). Следовательно, \((\sum_{i=1}^{n} X_{i}, X_1)\) не является полной.

Как видно из примера, увеличение размерности оценки, добавление к ней новых компонент, может привести к потере полноты (достаточность при этом сохранится, если она изначально была). При этом полнота – это скорее свойство модели, чем свойство статистики. В этом можно наглядно убедиться, решив задачу ниже.

ProblemЗадача 3

Приведите пример параметрического семейства распределений \(\mathcal{P}\) и нетривиальной неполной достаточной статистики \(S(X_1, \ldots , X_n)\) размерности 1, где \(X_1, \ldots , X_n\) – выборка из неизвестного распределения \(\mathbb {P} \in \mathcal{P}\).

Возьмите \(\mathcal{P}\) равным набору распределений \(\operatorname {Bern}(\theta )\), т.е. как в примере выше. Но уменьшите параметрическое множество: пусть \(\Theta = \left\{ \frac{1}{3}, \frac{2}{3}\right\}\).

Таким образом, полнота может потеряться при расширении статистики или при сужении параметрического множества.

Разумеется, далеко не всегда статистика \(\sum_{i=1}^{n} X_{i}\) является полной. Как же найти полную статистику? Доказывать полноту по определению, как правило, достаточно сложно. Однако, как мы увидим далее, для достаточно широкого класса распределений полную статистику можно найти просто из функции правдоподобия.

Определение 3 Пусть есть доминируемый набор распределений \(\mathcal{P} = \left\{ \mathbb {P}_{\theta }, \theta \in \Theta \subset \mathbb {R}^{k}\right\}\). Пусть \(p_\theta\) – обобщенная плотность распределения \(\mathbb {P}_{\theta }, \; \theta \in \Theta\). Т.е. есть некоторая фиксированная мера \(\mu\) на \(\mathbb {R}\), такая, что \(\mathbb {P}_\theta (dx) = p_\theta (x) \mu (dx)\). Как правило, \(\mu\) – это мера Лебега \(\lambda\) (тогда \(\mathcal{P}\) – набор непрерывных распределений) или считающая мера \(\#\) на \(\mathbb {Z}\) (тогда \(\mathcal{P}\) – набор дискретных распределений).

Говорят, что набор \(\mathcal{P}\) принадлежит к экспоненциальному семейству, если “обобщенная” плотность распределения \(\mathbb {P}_{\theta }\) имеет вид

\[ \label{SuffStat:ExpFamily} p_{\theta }(x)=h(x) \exp \left(\sum _{i=1}^{k} a_{i}(\theta ) u_{i}(x)+v(\theta )\right) . \] Обратите внимание, что число слагаемых вида \(a_{i}(\theta ) u_{i}(x)\) в экспоненте не должно превосходить размерность параметрического множества. Кроме того, носитель распределения не может зависеть от параметра.

Заметим, что нормальное, экспоненциальное, биномиальное, пуассоновское и многие распределения (наборы параметризованных распределений) принадлежат к экспоненциальному семейству. Обратите внимание, что экспоненциальное распределение – лишь частный случай экспоненциального семейства.

ExampleПример 4

Докажите, что нормальное распределение \(\mathscr {N}\left(\mu , \sigma^2\right), \; \theta = (\mu , \sigma^2)^T \in \Theta = \mathbb {R} \times \mathbb {R}_+ \subset \mathbb {R}^{2}\) является экспоненциальным семейством.

Имеем \[ \begin{align} p_{\theta }(x) & = \frac{1}{\sqrt{2 \pi \sigma ^2}}e^{-\frac{(x-\mu )^2}{2\sigma ^2}} = \exp \left(-\frac{1}{2\sigma ^2}x^2 + \frac{\mu }{\sigma ^2}x - \frac{\mu ^2}{2\sigma ^2} - \frac{1}{2}\ln (2\pi \sigma ^2)\right) \\ \alpha _1(\theta ) & = -\frac{1}{2\sigma ^2} , \; u_1(x) = x^2 \\ \alpha _2(\theta ) & = \frac{\mu }{\sigma ^2} , \; u_2(x) = x \\ v(\theta ) & = - \frac{\mu ^2}{2\sigma ^2} - \frac{1}{2}\ln (2\pi \sigma ^2) \end{align} \]

[об экспоненциальных семействах] Пусть \(\theta \in \Theta \subset \mathbb {R}^{k}\) и для семейства распределений \(\left\{ \mathbb {P}_{\theta }, \theta \in \Theta \right\}\) выполнено условие Определение 3. Пусть, кроме того, множество всех значений вектора \(\left(a_{1}(\theta ), \ldots , a_{k}(\theta )\right)\) при \(\theta \in \Theta\) содежит \(k\)-мерный шар пространства \(\mathbb {R}^{k}\). Тогда \(S(X)=\left(\overline{u_{1}(X)}, \ldots , \overline{u_{k}(X)}\right)\) – полная достаточная статистика.

Для нормального распределения, например, статистика \((\overline{X}, \overline{X^2})\) будет полной и достаточной. Заметим также, что любая биективная фуннкция сохраняет полноту и достаточность. Т.е., напрмер, для нормального распределения статистика \((\overline{X}, s^2) = (\overline{X}, \overline{X^2} - \overline{X}^2)\) тоже будет полной и достаточной.

Стоит заметить, что условие теоремы будет выполнено, если множество \(\Theta\) “телесно”, т.е. содержит свои внутренние точки, и функции \(a_{1}(\theta ), \ldots , a_{k}(\theta )\) в окрестности какой-нибудь внутренней точки \(\theta_{0} \in \Theta\) линейно независимые и гладкие.

ProblemЗадача 4

Применяя теорему об экспоненциальных семействах, найдите полные, достаточные статистики для следующих параметрических распределений:

  1. \(\Gamma (\alpha , \lambda )\);

  2. \(\mathrm{Pois}(\lambda )\);

  3. \(\mathrm{Geom}(p)\). *Примечание.** Каждый пункт оценивается в \(0.3\) балла.

ProblemЗадача 5

Докажите, что в модели \[ \mathscr {N}\left(\theta , \theta ^2\right), \quad \theta \in \mathbb {R}, \] статистика \((\overline{X}, s^2)\) является достаточной, но не является полной.

Для доказательства того, что статистика не является полной, подберите удачную функцию \(f\), посчитав математические ожидания \(\overline{X}\) и \(s^2\).

3 Оптимальные оценки

В этом разделе мы, наконец, приведем алгоритм нахождения наилучших в упомянутом смысле оценок, которые принято называть оптимальными.

Определение 4 Статистика \(\tau^{*}\) называется оптимальной оценкой \(\tau (\theta )\), если \(\tau^{*}\) – наилучшая в среднеквадратичном подходе в классе несмещенных оценка \(\tau (\theta )\) (заметим, что \(\tau (\theta )\) может, вообще говоря, иметь размерность, большую 1).

[Лемана-Шеффе] Пусть \(S(X)\) – полная достаточная статистика, \(\widehat{\tau }\) – несмещённая оценка \(\tau (\theta )\), тогда \(\tau^{*}=\mathbb {E}_{\theta }\left[\widehat{\tau } \mid S(X)\right]\) – оптимальная оценка \(\tau (\theta )\).

Напомним, что условное матожидание относительно случайной величины (или вектора) \(S\) всегда можно представить в виде борелевской функции от этой величины (вектора соотв.):

\[ \mathbb {E}_{\theta }\left[\widehat{\tau } \mid S(X)\right] = \varphi (S(X)) \quad \mathbb {P}_\theta \text{-п.н.} \]

Из этого вытекает альтернативная формулировка теоремы Лемана-Шеффе.

[Лемана-Шеффе] Любая борелевская функция от полной, достаточной статистики является оптимальной оценкой своего матожидания.

Алгоритм нахождения оптимальной оценки:

  1. Либо ищем достаточную статистику \(S(X)\) с помощью критерия факторизации и доказываем, что она является полной, либо сразу находим полную достаточную статистику, если данное семейство распределений является экспоненциальным.

  2. Решаем относительно \(\varphi\) уравнение “несмещенности” \(\mathbb {E}_{\theta }\left[\varphi (S(X))\right]=\tau (\theta )\) (для любого \(\theta \in \Theta\)). Его решение \(\varphi (S(X))\) является оптимальной оценкой \(\tau (\theta )\).

ExampleПример 5

Пусть \(X_{1}, \ldots X_{n}\) – выборка из равномерного распределения на \([0, \theta ]\). Найдите оптимальную оценку параметpa \(\theta\).

Функция правдоподобия равна \(\frac{1}{\theta^{n}} \; \mathbb {1}_{X_{(n)} \leq \theta }\), поэтому, по критерию факторизации, \(X_{(n)}\) – достаточная статистика. Проверим, что эта статистика является полной:

\[ \mathbb {E}_{\theta }\left[f\left(X_{(n)}\right)\right]=\int _{0}^{\theta } f(x) n \frac{x^{n-1}}{\theta ^{n}} d x \] По свойству интеграла Римана, последнее выражение равно 0 для любого \(\theta >0\) тогда и только тогда, когда \(f(x) x^{n-1}=0\) для почти всех \(x>0\) (мера Лебега множества таких \(x\), что последнее выражение отлично от 0 , равна 0 ). Поэтому \(f(x)=0\) ( \(\mathbb {P}_{\theta }\)-П.н.) для всех \(\theta \in \Theta\).

Итак, мы знаем, что \(X_{(n)}\) – полная достаточная статистика. Осталость решить уравнение “несмещенности” \(\mathbb {E}_{\theta }\left[\varphi \left(X_{(n)}\right)\right]=\theta\). Как известно,

\[ \mathbb {E}_{\theta }\left[X_{(n)}\right]=\frac{n}{n+1} \theta . \] Поэтому в качестве решения уравнения можно предложить функцию \(\varphi (x)=\frac{n+1}{n} x\). Следовательно, оценка \(\frac{n+1}{n} X_{(n)}\) является оптимальной.

ProblemЗадача 6

Найдите оптимальную оценку \(\theta > 0\) по выборке из распределения

  1. \(N(\theta , 1)\);

  2. \(\mathrm{Pois}(\theta )\);

  3. \(\mathrm{Bern}(\theta ), \; \theta \in (0,1)\). *Примечание.** Каждый пункт оценивается в \(0.3\) балла.

ProblemЗадача 7

Пусть \(X_1, \ldots , X_n\) – выборка из нормального распределения с параметрами \((a,\sigma^2), \; a \in \mathbb {R}, \; \sigma > 0\). Найдите оптимальную оценку параметра \(\theta = (a, \sigma^2)\).

ProblemЗадача 8

Пусть \(X_1, X_2, \dots , X_n\) – выборка из \(\mathrm{Exp}(\theta )\). Найдите оптимальные оценки для \(\theta\) и для \(\sqrt{\theta }\).

ProblemЗадача 9

Пусть \(X_1, X_2, \dots , X_n\) – выборка из \(N(0, \theta^2)\). Найдите оптимальную оценку для \(\theta\).

ProblemЗадача 10

Пусть \(X_1, \dots , X_n\) – выборка из пуассоновского распределения с параметром \(\theta > 0\). Найдите \[ \mathbb {E}\left[X_1^2 \; \bigg| \; \sum _{i=1}^n X_i\right]. \]