Сравнение оценок и эффективные оценки
Во второй главе мы рассмотрели свойства оценок, а в третьей главе научились находить оценки с такими свойствами. Возникает естественный вопрос: какая из двух оценок, обладающих одинаковыми свойствами (например, состоятельностью, несмещенностью или асимптотической нормальностью), лучше? В этой главе мы поговорим о сравнении оценок.
1 Сравнение оценок
Пусть \(\Theta \subset \mathbb {R}\). Пусть, кроме того, \(g: \mathbb {R}^{2} \rightarrow \mathbb {R}-\) некоторая функция (называемая функцией потерь, как правило, симметричная), принимающая только положительные значения (например, \(g(x, y)=|x-y|\) или \(\left.g(x, y)=(x-y)^{2}\right)\). Функция \(g(x, y)=(x-y)^{2}\) называется квадратичной функцией потерь.
Определение 1 Пусть \(\theta^{*}\) – оценка параметра \(\theta\). Функция \(R\left(\theta^{*}, \theta \right) = \mathbb {E}_{\theta }\left[g\left(\theta^{*}, \theta \right)\right]\) называется функцией риска оценки \(\theta^{*}\).
Говорят, что оценка \(\theta^{*}\) лучше оценки \(\hat{\theta }\) в равномерном подходе с функиией потерь \(g\), если для любого \(\theta \in \Theta\) выполнено \(R\left(\theta^{*}, \theta \right) \leq R(\hat{\theta }, \theta )\) и для некоторого \(\theta \in \Theta\) неравенство строгое. Если \(\theta^{*}\) лучше всех других оценок в равномерном подходе с функцией потерь \(g\) в некотором классе оценок \(\mathcal{K}\) параметра \(\theta\) (например, в классе всех несмещенных оценок), то оценку \(\theta^{*}\) называют наилучшей в классе \(\mathcal{K}\) в равномерном подходе \(c\) функиией потерь \(g\). Равномерный подход с квадратичной функцией потерь называется среднеквадратичным.
Если \(\Theta \subset \mathbb {R}^{k}\), где \(k>1\), то оценка \(\theta^{*}\) лучше оценки \(\hat{\theta }\) в среднеквадратичном подходе, если для любых \(\theta \in \Theta\) и \(a \in \mathbb {R}^{k}\) выполнено
\[ \mathbb {E}_{\theta }\left[\left\langle \theta ^{*}-\theta , a \right\rangle \right] \leq \mathbb {E}_{\theta }\left[\left\langle \hat{\theta }-\theta , a \right\rangle \right] \] и для некоторых \(\theta \in \Theta\) и \(a \in \mathbb {R}^{k}\) неравенство строгое.
Определения, данные выше, применимы не только к оценкам \(\left\{ \theta^*\right\}\) самого параметра \(\theta\), но и к оценкам \(\left\{ \tau^*\right\}\) произвольного сложного параметра \(\tau (\theta )\).
В последней задаче, разумеется, лишь одна оценка в классе является несмещенной (при \(c=n+1)\).
Итак, у нас появилась численная характеристика “хорошести” оценки. Если мы хотим оценить какой-то параметр для заданной модели, нужно, казалось бы, просто выбрать среди всех оценок наилучшую в указанном выше смысле. Однако равномерность по параметру \(\theta\) в определении выше – достаточно сильное условие. Как правило, если у нас есть 2 произвольные оценки \(\theta_1^*, \theta_2^*\) параметра \(\theta \in \Theta\), у первой из них функция риска меньше функции риска второй на одной части параметрического множества \(\Theta_1 \subset \Theta\), а на другой больше:
\[ \begin{align} \mathbb {E}_{\theta }\left[\left(\theta _1^* - \theta \right)^2\right] & \leq \mathbb {E}_{\theta }\left[\left(\theta _2^* - \theta \right)^2\right], \quad \theta \in \Theta _1, \\ \mathbb {E}_{\theta }\left[\left(\theta _1^* - \theta \right)^2\right] & \geq \mathbb {E}_{\theta }\left[\left(\theta _2^* - \theta \right)^2\right], \quad \theta \in \Theta _2. \end{align} \]
Т.е. ни про какую оценок \(\theta_1^*, \theta_2^*\) нельзя сказать, что она лучше другой в равномерном подходе. Кроме того, множество вообще всех возможных оценок \(\theta\) может оказаться слишком большим для рассмотрения, ведь нам надо для каждой из них вычислить функцию риска. Если не накладывать какие-то ограничения на класс \(\mathcal{K}\) оценок \(\theta\), задача нахождения наилучшей из них в равномерном подходе со среднеквадратической функцией потерь зачастую оказывается слишком сложной или вообще неразрешимой. Кроме того, смещенная оценка может оказаться лучше (в указанном выше смысле) несмещенной в некоторых случаях. Поэтому принято сужать класс \(\mathcal{K}\), рассматривать только несмещенные оценки.
Определение 2 Наилучшую оценку \(\theta^* = \theta^*(X_1, \ldots , X_n)\) параметра \(\theta (\theta )\) в классе несмещенных в равномерном подходе с квадратичной функцией потерь называют оптимальной.
Заметим, что в случае несмещенной оценки и квадратичной функции потерь функция риска просто равна дисперсии оценки: имеем \(\mathbb {E}_{\theta }\left[\theta^*\right] = \theta , \; \forall \theta \in \Theta\) и
\[ R(\theta ^*, \theta (\theta )) = \mathbb {E}_{\theta }\left[\left(\theta ^* - \theta \right)^2\right] = \Var [\theta ]{\theta ^*} \] В связи с этим оптимальную оценку еще называют несмещенной оценкой с минимальной дисперсией и используют сокращение НОМД. В английской литературе для оптимальной оценки принято сокращение MVUE (или UMVUE) – [uniformly] minimum-variance unbiased estimator.
Данное определение также применимо к оценкам \(\left\{ \theta^*\right\}\) самого параметра \(\theta\), но и к оценкам \(\left\{ \tau^*\right\}\) произвольного сложного параметра \(\tau (\theta )\).
2 Эффективные оценки
При некоторых условиях на неизвестное распределение оптимальную оценку можно найти. Пусть $\[$X=X_1, , X_n$-- выборка из неизвестного одномерного распределения$P_, $. Пусть\]– одномерный параметр, т.е.\(R\). Пусть, кроме того, существует функция правдоподобия\(f_(X) = f_(X_1, , X_n)\), т.е. семейство доминируемо относительно некоторой меры\[на прямой. Как правило, речь идет о мере Лебега\]на прямой (в этом случае имеем выборку из неизвестного непрерывного параметрического распределения) или о считающей мере\[на$Z$(в этом случае имеем выборку из неизвестного дискретного распределения). Для простоты будем считать, что мы имеем выборку из непрерывного распределения, хотя в общем случае мера\]может быть произвольной.$
2.1 Нижняя оценка для дисперсии несмещенной оценки
Заметим, что поскольку функция правдоподобия $\[$f_(X_1, , X_n)$является плотностью, если в качестве аргументов не использовать случайные величины, а использовать$(x_1, , x_n) = x\]$$, имеем
\[ \begin{align} 1 & = \int _{\mathbb {R}^{n}} \mathbb {P}_{(X_1, \ldots , X_n)}(dx) = \int _{\mathbb {R}^{n}} f_\theta (x) \lambda (dx) = \int _{\mathbb {R}^{n}} f_\theta (x) dx \\ 0 = \frac{\partial }{\partial \theta }1 & = \frac{\partial }{\partial \theta } \int _{\mathbb {R}^{n}} f_\theta (x) dx \end{align} \]
где \(x = (x_1, \ldots , x_n)\). Представим, что мы можем менять частное дифференцирование по \(\theta\) и знак интеграла. Тогда имеем
\[ 0 = \frac{\partial }{\partial \theta } \int _{\mathbb {R}^{n}} f_\theta (x) dx = \int _{\mathbb {R}^{n}} \frac{\partial }{\partial \theta }f_\theta (x) dx = \int _{\mathbb {R}^{n}} \left[\underbrace{\frac{1}{f_\theta (x)} \frac{\partial }{\partial \theta }f_\theta (x)}_{= \frac{\partial }{\partial \theta } \ln (f_{\theta }(x))}\right] \cdot f_\theta (x) dx = \mathbb {E}_{\theta }\left[\frac{\partial }{\partial \theta } \ln (f_{\theta }(X))\right] \]
Определение 3 Случайная величина \[ V(X, \theta ) = \frac{\partial }{\partial \theta } L_{\theta }(X) = \frac{\partial }{\partial \theta } \ln \left(f_\theta (X)\right) = \frac{1}{f_\theta (X)} \frac{\partial }{\partial \theta }f_\theta (X) \] называется вкладом выборки \(X\).
Как мы только что выяснили, матожидание вклада равно нулю.
Пусть \(T(X)\) – несмещенная оценка параметра \(\tau (\theta )\). Тогда
\[ \begin{align} \Covariance [\theta ]{T(X)}{V(X,\theta )} & = \mathbb {E}_{\theta }\left[TV\right] - \mathbb {E}_{\theta }\left[T\right]\mathbb {E}_{\theta }\left[V\right] = \mathbb {E}_{\theta }\left[TV\right] = \\ & = \int _{\mathbb {R}^{n}} T(x) V(x,\theta ) f_\theta (x)dx = \int _{\mathbb {R}^{n}} T(x) \frac{\partial }{\partial \theta }f_\theta (X)dx = \\ & = \int _{\mathbb {R}^{n}} \frac{\partial }{\partial \theta } \left[T(x) f_\theta (X)\right]dx \end{align} \]
Представим снова, что мы можем менять знаки дифференцирования и интегрирования. Тогда
\[ \Covariance [\theta ]{T}{V} = \int _{\mathbb {R}^{n}} \frac{\partial }{\partial \theta } \left[T(x) f_\theta (X)\right]dx = \frac{\partial }{\partial \theta } \int _{\mathbb {R}^{n}}T(x) f_\theta (X)dx = \frac{\partial }{\partial \theta } \mathbb {E}_{\theta }\left[T\right] = \frac{\partial }{\partial \theta }\tau (\theta ) = \tau '(\theta ) \]
С другой стороны, применяя неравенство Коши-Буняковского-Шварца, получаем \(\left(\Covariance [\theta ]{T}{V}\right)^2 \leq \Var [\theta ]{T}\Var [\theta ]{V}\). Таким образом, мы получили [Неравенство Рао-Крамера: нижняя граница для функции риска несмещенной оценки] Пусть \(T\) – несмещенная оценка \(\tau (\theta )\). Тогда для любого \(\theta \in \Theta\)
\[ \Var [\theta ]{T} \geq \frac{(\tau '(\theta ))^2}{\Var [\theta ]{V}} \]
Коэффициент \(\Var [\theta ]{V} = \mathbb {E}_{\theta }\left[V^2\right]\) называют информацией Фишера и обзначают \(I(\theta )\).
Если в неравенстве Рао-Крамера достигается равенство, то \(T\) называется эффективной оценкой \(\tau (\theta )\). Напомним, что равеноство в неравенстве КБШ достигается, если 2 вектора линейно зависимы, т.е. один из векторов является вторым, умноженным на константу. [Критерий эффективности] Равенство в неравенстве Рао-Крамера достигается тогда и только тогда, когда \(T-\tau (\theta ) = c(\theta ) V(X,\theta )\) для некоторого \(c(\theta )\), т.е. когда оценка \(T\) является линейной функцией от вклада1. Более того, по следнее равенство выполнено в том и только том случае, когда \(c(\theta )=\frac{\tau^{\prime }(\theta )}{n i(\theta )}\).
Заметим, что равенство в неравенстве Рао-Крамера может быть выполнено только для одной несмещенной оценки, и эта оценка является наилучшей в среднеквадратичном подходе в классе всех несмещенных оценок \(\tau (\theta )\).
Заметим, что (если выполнены условия регулярности) эффективная оценка всегда будет оптимальной. т.е. наилучшей несмещенной. При этом оптимальная оценка не всегда эффективная: условия регулярности не всегда выполняются, и в таких случаях об эффективных оценках вообще говорить нельзя. При этом оптимальная может существовать, подробнее см. в следующей главе.
2.2 Условия регулярности
Полученные выше оценки выполнены, только если выполнены т.н. условия регулярности:
Информация Фишера всегда определена: для любого \(x\), такого что \(f_\theta (x) > 0\),
\[ \frac{\partial }{\partial \theta } \ln \left(f_\theta (x)\right) \] определено и конечно.
Операции интегрирования по \(x\) и дифференцирования по \(\theta\) можно поменять местами при вычислении матожидания \(T\), то есть выполнено
\[ \frac{\partial }{\partial \theta } \left[\int T(x) f_\theta (x) dx\right] = \int T(x) \left[\frac{\partial }{\partial \theta }f_\theta (x)\right] dx \] всегда, когда правая часть конечна.
Подробнее об условиях регулярности можно почитать в . Скажем лишь, что если носитель неизвестного распределения зависит от параметра \(\theta\) (например, \(U[0,\theta ]\)), то условия регулярности невыполнены. Если же неизвестное семейство является экспоненциальным семейством (см. следующую главу), то условия регулярности будут выполнены.
Пусть \(i(\theta )\)- количество информации, содержащейся в одном элементе выборки \(X_{1}\).
Сноски
Напомним, что неизвестный параметр \(\theta\) мы считаем константой, следовательно \(c(\theta )\) и \(\tau (\theta )\) тоже являются константами, хоть и неизвестными нам.↩︎