Сравнение оценок и эффективные оценки
Этот конспект ещё находится в процессе редактуры: в тексте могут встречаться опечатки, неточности и локально не проработанные места. Если что-то нашли — сообщите, пожалуйста, автору (контакты на странице курса).
Мы рассмотрели удобные свойства оценок и научились находить оценки. Возникает естественный вопрос: какая из двух оценок, обладающих одинаковыми свойствами (например, состоятельностью, несмещенностью или асимптотической нормальностью), лучше? В этой главе мы поговорим о сравнении оценок.
1 Сравнение оценок, оптимальная оценка
Для простоты пусть параметр одномерный, \(\Theta \subset \mathbb {R}\). Пусть \(g: \mathbb {R}^{2} \rightarrow \mathbb {R}\) – некоторая симметричная функция, принимающая только неотрицательные значения. Такая функция \(g\) называется функцией потерь. Например, \(g(x, y)=|x-y|\). Или \(g(x,y)=(x-y)^{2}\) – такая функция называется квадратичной функцией потерь.
Итак, у нас появилась числовая характеристика <<качества>> оценки, и кажется естественным искать наилучшую оценку среди всех возможных в указанном смысле. Однако равномерность по \(\theta\) – весьма сильное требование. Как правило, для двух произвольных оценок \(\widehat{\theta }_1, \widehat{\theta }_2\) параметра \(\theta \in \Theta\) функция риска первой меньше на одной части множества \(\Theta\) и больше – на другой:
\[ \begin{align} \mathbb {E}_{\theta }\left[\left(\widehat{\theta }_1 - \theta \right)^2\right] & \leq \mathbb {E}_{\theta }\left[\left(\widehat{\theta }_2 - \theta \right)^2\right], \quad \theta \in \Theta _1, \\ \mathbb {E}_{\theta }\left[\left(\widehat{\theta }_1 - \theta \right)^2\right] & \geq \mathbb {E}_{\theta }\left[\left(\widehat{\theta }_2 - \theta \right)^2\right], \quad \theta \in \Theta _2, \end{align} \]
так что ни одну из них нельзя назвать равномерно лучше другой.
Двигайте слайдеры (n) и (_0) — кривые риска и зона выигрыша константной оценки пересчитываются, точки пересечения решаются заново.
Пересекающиеся функции риска: среднее против константы
Модель \(\mathrm{Bern}(\theta)\), \(n\) наблюдений. Сравниваются \(R_\theta(\bar X) = \dfrac{\theta(1-\theta)}{n}\) и \(R_\theta(\theta_0) = (\theta-\theta_0)^2\) — риск «глупой» константной оценки, не зависящей от данных.
Кроме того, множество всех мыслимых оценок параметра, как правило, слишком велико, чтобы вычислять функцию риска для каждой из них. Без ограничений на класс \(\mathcal{K}\) задача поиска наилучшей оценки (в равномерном среднеквадратичном подходе) зачастую неразрешима. Наконец, смещённая оценка иногда оказывается лучше несмещённой в этом смысле. По этим причинам класс \(\mathcal{K}\) принято сужать – например, ограничиваясь только несмещёнными оценками.
Пусть \(\widehat{\theta }\) – это несмещенная оценка \(\theta\), т.е.
\[ \mathbb {E}_{\theta }\left[\widehat{\theta }\right] = \theta , \qquad \forall \theta \in \Theta \]
Тогда функция риска (с квадратичной функцией потерь) просто равна дисперсии оценки:
\[ R_{\theta }\left(\widehat{\theta }\right) = \mathbb {E}_{\theta }\left[\left(\widehat{\theta } - \theta \right)^2\right] = \operatorname {Var}_{\theta }\left[\widehat{\theta }\right], \qquad \forall \theta \in \Theta \]
Оптимальную оценку еще называют несмещенной с минимальной дисперсией и используют сокращение НМД. В английской литературе для оптимальной оценки принято сокращение MVU estimator или UMVU estimator – uniformly minimum-variance unbiased estimator.
2 Эффективные оценки
При некоторых условиях на неизвестное распределение оптимальную оценку можно гарантированно найти. Пусть \(\vec{X}=\left(X_{1}, \ldots , X_{n}\right)\) – выборка из неизвестного одномерного распределения \(\mathbb {P}_{\theta }, \theta \in \Theta\). Пусть \(\theta\) – одномерный параметр, т.е. \(\Theta \subset \mathbb {R}\). Пусть, кроме того, существует функция правдоподобия \(L(\theta ) = L(\theta ; \vec{x})\), т.е. семейство доминируемо относительно некоторой меры \(\mu\) на прямой. Как правило, речь идет о мере Лебега \(\lambda\) на прямой (в этом случае имеем выборку из неизвестного непрерывного параметрического распределения) или о считающей мере \(\#\) на \(\mathbb {Z}\) (в этом случае имеем выборку из неизвестного дискретного распределения).
2.1 Вклад выборки
Функция правдоподобия \(L(\theta ; \vec{x})\) – это плотность, если при фиксированном \(\theta\) ее варьировать по \(\vec{x}\). Площадь под графиком плотности равна \(1\):
\[ \begin{align} 1 = \int _{\mathbb {R}^{n}} L(\theta ; \vec{x}) \; \; d\vec{x} , \qquad \forall \theta \in \Theta \end{align} \]
Пусть \(\Theta\) – это открытое множество. Продифференцируем обе части по \(\theta\), полагая, что дифференцирование по \(\theta\) и интегрирование по \(\vec{x}\) можно поменять местами:
\[ \begin{align} 0 & = \frac{\partial }{\partial \theta } \int _{\mathbb {R}^{n}} L(\theta ; \vec{x}) \; \; d\vec{x} = \int _{\mathbb {R}^{n}} \frac{\partial }{\partial \theta }L(\theta ; \vec{x}) \; \; d\vec{x} = \\ & = \int _{\mathbb {R}^{n}} \left[\underbrace{\left(\frac{\partial }{\partial \theta }L(\theta ; \vec{x})\right) \cdot \frac{1}{L(\theta ; \vec{x})} }_{= \frac{\partial }{\partial \theta } \ln (L(\theta ; \vec{x}))=\frac{\partial }{\partial \theta }\ell (\theta , \vec{x})}\right] \cdot L(\theta ; \vec{x}) \; \; d\vec{x} = \\ & = \int _{\mathbb {R}^{n}} \left(\frac{\partial }{\partial \theta }\ell (\theta , \vec{x})\right) \cdot \underbrace{L(\theta ; \vec{x})}_{\text{плотность}} \; \; d\vec{x} = \mathbb {E}_{\theta }\left[\frac{\partial }{\partial \theta } \ell (\theta , \vec{X})\right], \qquad \forall \theta \in \Theta , \end{align} \]
где \(\ell (\theta , \vec{x}) = \ln L(\theta , \vec{x})\) – логправдоподобие.
Как мы только что выяснили, матожидание вклада равно нулю при любом \(\theta \in \Theta\).
2.2 Нижняя оценка для дисперсии несмещенной оценки: неравенство Рао-Крамера
Пусть \(\widehat{\tau } = \widehat{\tau }(\vec{X})\) – несмещенная оценка какого-то сложного параметра \(\tau = \tau (\theta )\). Тогда, снова полагая, что дифференцирование по \(\theta\) и интегрирование по \(\vec{x}\) можно поменять местами, получаем
\[ \begin{align} \operatorname {Cov}_{\theta }\left[ \widehat{\tau }, V \right] & = \mathbb {E}_{\theta }\left[\widehat{\tau }V\right] - \mathbb {E}_{\theta }\left[\widehat{\tau }\right]\mathbb {E}_{\theta }\left[V\right] = \mathbb {E}_{\theta }\left[\widehat{\tau }V\right] = \\ & = \int _{\mathbb {R}^{n}} \widehat{\tau }(\vec{x}) V(\vec{x},\theta ) \cdot \underbrace{L(\theta ; \vec{x})}_{\text{плотность}}\; d\vec{x} = \\ & = \int _{\mathbb {R}^{n}} \widehat{\tau }(\vec{x}) \frac{\partial }{\partial \theta }L(\theta ; \vec{x})\; d\vec{x} = \\ & = \int _{\mathbb {R}^{n}} \frac{\partial }{\partial \theta } \left[\widehat{\tau }(\vec{x}) L(\theta ; \vec{x})\right]\; d\vec{x} = \frac{\partial }{\partial \theta } \int _{\mathbb {R}^{n}}\widehat{\tau }(\vec{x}) L(\theta ; \vec{x})\; d\vec{x} = \\ & = \frac{\partial }{\partial \theta } \mathbb {E}_{\theta }\left[\widehat{\tau }\right] = \frac{\partial }{\partial \theta }\tau (\theta ) = \tau '(\theta ) \end{align} \]
С другой стороны, применяя неравенство Коши-Буняковского-Шварца, получаем \(\left(\operatorname {Cov}_{\theta }\left[ \widehat{\tau }, V \right]\right)^2 \leq \operatorname {Var}_{\theta }\left[\widehat{\tau }\right]\operatorname {Var}_{\theta }\left[V\right]\). Таким образом, мы получили
Коэффициент \(\operatorname {Var}_{\theta }\left[V\right] = \mathbb {E}_{\theta }\left[V^2\right]\) называют информацией Фишера и обозначают \(I(\theta )\).
Если в неравенстве Рао-Крамера достигается равенство, то \(\widehat{\tau }\) называется эффективной оценкой \(\tau (\theta )\). Напомним, что равенство в неравенстве КБШ достигается, если 2 вектора линейно зависимы, т.е. один из векторов является вторым, умноженным на константу.
Равенство в неравенстве Рао-Крамера может быть выполнено только для одной несмещенной оценки, и эта оценка является наилучшей в среднеквадратичном подходе в классе всех несмещенных оценок \(\tau (\theta )\).
Эффективная оценка всегда будет оптимальной, т.е. наилучшей несмещенной. При этом оптимальная оценка не всегда эффективная: условия регулярности не всегда выполняются, и в таких случаях об эффективных оценках вообще говорить нельзя. При этом оптимальная в таких случаях может существовать, подробнее см. далее.
2.3 Условия регулярности
Полученные выше результаты верны, только если выполнены т.н. условия регулярности:
Информация Фишера всегда определена: для любого \(\vec{x}\), такого что \(L(\theta ; \vec{x}) > 0\), величина
\[ \frac{\partial }{\partial \theta } \ln \left(L(\theta ; \vec{x})\right) \]
определена и конечна для всех \(\theta \in \Theta\).
Операции интегрирования по \(x\) и дифференцирования по \(\theta\) можно поменять местами при вычислении матожидания \(\widehat{\tau }\), то есть выполнено
\[ \frac{\partial }{\partial \theta } \left[\int \widehat{\tau }(\vec{x}) L(\theta ; \vec{x}) \; d\vec{x}\right] = \int \widehat{\tau }(\vec{x}) \left[\frac{\partial }{\partial \theta }L(\theta ; \vec{x})\right] \; d\vec{x} \]
всегда, когда правая часть конечна.
Подробнее об условиях регулярности можно почитать в (Боровков 2010 г.). Скажем лишь, что если носитель неизвестного распределения зависит от параметра \(\theta\) (например, \(U[0,\theta ]\)), то условия регулярности не выполнены.
Условия регулярности выполнены в любом из следующих случаев:
у всех \(\mathbb {P}_{\theta }, \theta \in \Theta\) ограниченный носитель, который не зависит от \(\theta\);
семейство \(\left\{ \mathbb {P}_\theta , \theta \in \Theta \right\}\) – экспоненциальное (см. определение экспоненциального семейства выше), а \(\Theta\) – открытое множество: в этом случае плотность \(p_\theta (x) = h(x)\exp \left(\sum_i a_i(\theta ) u_i(x) + v(\theta )\right)\) достаточно гладко зависит от \(\theta\), носитель автоматически не зависит от \(\theta\), и дифференцирование под знаком интеграла законно.
2.4 Задачи
Пусть \(i(\theta )\) – количество информации, содержащейся в одном элементе выборки \(X_{1}\).
использованная литература
Сноски
Напомним, что неизвестный параметр \(\theta\) мы считаем константой, следовательно \(c(\theta )\) и \(\tau (\theta )\) тоже являются константами, хоть и неизвестными нам.↩︎