Этот конспект ещё находится в процессе редактуры: в тексте могут встречаться опечатки, неточности и локально не проработанные места. Если что-то нашли — сообщите, пожалуйста, автору (контакты на странице курса).
Пусть \(\Theta \subset \mathbb {R}^{k}\). Рассмотрим некоторое семейство распределений (параметрическую модель) \(\left\{ \mathbb {P}_\theta , \; \theta \in \Theta \right\}\) и выборку \(X_{1}, \ldots , X_{n}\) из неизвестного распределения \(\mathbb {P}_{\theta }\). В данной главе рассмотрим 3 самых распространенных универсальных способа получения оценок параметра \(\theta\).
1 Метод моментов
Напомним, \(k\)-м моментом (\(k \in \mathbb {N}\)) случайной величины \(X\) называется матожидание \(\mathbb {E}\left[X^k\right]\). \(k\)-м выборочным моментом выборки \(X_1, \ldots , X_n\) называется величина
Идея метода моментов (сокр. MM, англ. Method of Moments) следующая: если какой-то момент сл. величины \(X_1\) легко выражается через \(\theta\), то можно заменить момент на выборочный момент, а \(\theta\) на оценку \(\widehat{\theta }\), и получить таким образом оценку.
ExampleПример 1
Пусть имеем выборку из экспоненциального распределения \(\operatorname {Exp}(\theta ), \; \theta > 0\) с плотностью \[
f_\theta (x) = \theta \cdot e^{-\theta x} \cdot \; \mathbb {1}_{\mathbb {R}_+}(x)
\] Постройте для \(\theta\) оценку по методу моментов.
SolutionРешение
В данном случае имеем \(\theta \in \Theta = (0, +\infty )\), параметр одномерный. Далее, \(\mathbb {E}_{\theta }\left[X_1\right] = \frac{1}{\theta }\). Заменим матожидание (1-й момент) на выборочное среднее (1-й выборочный момент), а \(\theta\) на \(\widehat{\theta }\), получим \[
\overline{X} = \frac{1}{\widehat{\theta }}
\] т.е. \(\widehat{\theta } = \frac{1}{\overline{X}}\).
В случае многомерного параметра можно использовать несколько моментов для поиска оценки.
ExampleПример 2
Найти оценки по методу моментов для семейства распределений \(\mathcal{N}\left(a, \sigma^{2}\right)\). Величину \(\sigma^{2}\) считайте при этом единым параметром. Т.е. требуется оценить именно дисперсию \(\sigma^{2}\) нормального распределения, не стандартное отклонение \(\sigma\).
В общем случае непосредственно моментов у распределения может не существовать. Однако если существуют другие матожидания \(\mathbb {E}_{\theta }\left[g(X_1)\right]\), например \(\mathbb {E}_{\theta }\left[\ln (X_1)\right]\), то можно попробовать построить оценку на их основе. \(g\) называют пробной функцией; если \(g(x) = x^k\), \(k\in \mathbb {N}\), то \(g\) называют стандартной пробной функцией. В примерах выше мы использовали стандартные пробные функции. Теперь попробуем использовать нестандартные.
ExampleПример 3
Пусть имеем выборку \(X_1,\ldots , X_n\) из лог-логистического распределения\(\operatorname {LL}(\alpha , \beta ), \; \alpha , \beta > 0\) с плотностью \[
p(x) = \frac{(\beta /\alpha ) (x/\alpha )^{\beta - 1}}{(1 + (x/\alpha )^\beta )^2} \; \mathbb {1}_{\mathbb {R}_+}(x)
\] Постройте для \(\alpha , \beta\) оценки по методу моментов.
SolutionРешение
В данном случае имеем \(\theta = (\alpha , \beta )^T \in \Theta = (0, +\infty ) \times (0, +\infty )\), параметр двумерный.
При \(\beta < 1\) матожидания \(\mathbb {E}_{\theta }\left[X_1\right]\) и, как следствие, всех прочих моментов у \(X_1\) не существует, невозможно построить оценку по методу моментов на основе стандартных пробных функций.
Однако известно, что случайная величина \(\ln (X_1)\) имеет логистическое распределение\(\operatorname {Logistic}(\mu , s)\) с параметрами \(\mu = \ln (\alpha ), \; s = 1/\beta\). Известно, что у данного распределения при любых значениях параметров матожидание и дисперсия существуют и равны \(\mu\), \(s^2 \pi^2/ 3\) соотв. Тогда
Дадим общее описание метода моментов построения оценки для \(\theta\). Для построения оценки выберем такие борелевские функции \(g_{1}, \ldots , g_{k}: \mathbb {R} \rightarrow \mathbb {R}\) (количество функций \(k\) равно размерности параметра \(\theta\)), что для любого \(i \in \left\{ 1, \ldots , k\right\}\) и любого \(\theta \in \Theta\) существует конечное матожидание \(\mathbb {E}_{\theta }\left[g_i(X_1)\right]\). Обозначим
Заменим параметр \(\theta\) на его оценку \(\widehat{\theta }\), а матожидания \(\mathbb {E}_{\theta }\left[g_i(X_1)\right]\) на выборочные матожидания
Предположим, что у этой системы существует единственное решение. Тогда это единственное решение \(\theta^{*}(X) = \widehat{\theta }_{\operatorname {MM}}(X)\) называется оценкой по методу моментов с пробными функциями \(g_{1}, \ldots , g_{k}\). Функции \(g_{i}(x)=x^{i}, i \in \{ 1, \ldots , k\}\), называются стандартными пробными функциями. В случае использования стандартных пробных функций \(\mathbb {E}\left[g_i(X_1)\right]\) – это какой-то момент случайной величины.
Теорема 1 Если \(m: \Theta \rightarrow m(\Theta )\)- биекция и функцию \(m^{-1}\) можно доопределить до функции, заданной на всем множестве \(\mathbb {R}^{k}\) и непрерывной в каждой точке множества \(m(\Theta )\), то оценка по методу моментов является сильно состоятельной.
Более того, утверждение этой теоремы можно дополнить следующим образом.
ExampleПример 4
Докажите, что в условиях теоремы выше оценка по методу моментов является асимптотически нормальной, если функцию \(m^{-1}\) можно доопределить до функции, заданной на всем множестве \(\mathbb {R}^{k}\) и дифференцируемой в каждой точке множества \(m(\Theta )\), и, кроме того, для любого \(i \in \{ 1, \ldots , k\}\) и любого \(\theta \in \Theta\) выполнено неравенство \[
0 < \operatorname {Var}_{\theta }\left[g_i(X_1)\right] < +\infty
\]
SolutionРешение
Итак, оценка по методу моментов равна \(\theta^{*}=m^{-1}\left(\overline{g(X)}\right)\), где \(\overline{g(X)}=\left(\overline{g_{1}(X)}, \ldots , \overline{g_{k}(X)}\right)^{T}\). По многомерной центральной предельной теореме, для любого \(\theta \in \Theta\) выполнено \[
\sqrt{n}\left(\overline{g(X)}-m(\theta )\right) \xrightarrow {d_{\theta }} \xi \sim \mathcal{N}(0, \Sigma (\theta )),
\] где \(\Sigma (\theta )\)- матрица ковариаций вектора \(\left(g_{1}\left(X_{1}\right), \ldots , g_{k}\left(X_{1}\right)\right)^{T}\). Согласно дельта-методу (\(h=m^{-1}\), \(b_{n}=1 / \sqrt{n}\), \(a=m(\theta )\), \(\xi_{n}=\sqrt{n}\left(\overline{g(X)}-m(\theta )\right)\)), при \(k = 1\) выполнено \[
\sqrt{n}\left(m^{-1}\left(\overline{g(X)}\right) - \theta \right) \xrightarrow []{d_\theta } \left\langle \xi , \nabla (m^{-1})\vert _{m(\theta )} \right\rangle ,
\] причем предельное распределение гауссовское: \[
\left\langle \xi , \nabla (m^{-1})\vert _{m(\theta )} \right\rangle \sim \mathscr {N}\left(0, \left(\nabla (m^{-1})\vert _{m(\theta )}\right)^T \cdot \Sigma (\theta ) \cdot \nabla (m^{-1})\vert _{m(\theta )}\right).
\] При \(k > 1\) рассуждение то же, только дельта-метод применяется к векторнозначной функции \(h = m^{-1}: \mathbb {R}^{k} \to \mathbb {R}^{k}\) (покомпонентно): градиент заменяется на матрицу Якоби \(J := \frac{\partial m^{-1}}{\partial x}\big\vert_{m(\theta )}\), и предельным распределением оказывается \(\mathscr {N}\left(0, J \Sigma (\theta ) J^T\right)\) – асимптотическая нормальность (теперь уже с асимптотической ковариационной матрицей) сохраняется.
Заметим, что оценка по методу моментов не обязательно является несмещённой.
Все \(\mathbb {P}_{\theta }\) – абсолютно непрерывные распределения. В этом случае пусть \(f_{\theta }(x)\) – это плотность распределения \(\mathbb {P}_{\theta }\).
Все \(\mathbb {P}_{\theta }\) – дискретные распределения (с носителем в \(\mathbb {Z}\)). В этом случае пусть \(f_{\theta }(x)\) – это функция вероятности распределения \(\mathbb {P}_{\theta }\).
В обоих случаях будем называть семейство \(\mathcal{P}\)доминируемым.
Пусть \(\mathcal{P}=\left\{ \mathbb {P}_{\theta }, \theta \in \Theta \right\}\) – доминируемое семейство распределений, \(\vec{X} = (X_{1}, \ldots , X_{n})^T\) – выборка из распределения \(\mathbb {P} \in \mathcal{P}\). Если \(f_\theta (x)\) – плотность (функция вероятности) \(X_1\), то плотность (функция вероятности) \(f\) вектора выборки \(X = (X_1, \ldots , X_n)^T\) равна произведению плотностей компонент, поскольку компоненты независимы:
где \(\overrightarrow {x} = \left(x_1, \ldots , x_n\right)^T\). Совместная плотность выборки \(f\) зависит от \(\theta\) и от \(\overrightarrow {x}\). Однако принято при рассмотрении плотности фиксировать параметр \(\theta\) и варьировать \(f\) по \(\overrightarrow {x}\).
Функцией правдоподобия выборки \(\vec{X}\) называется (совместная) плотность выборки, если считать \(\vec{x}\) фиксированным и варьировать ее по параметру \(\theta\):
Иногда вместо \(\vec{x}\) вставляют саму выборку \(\vec{X}\), и тогда правдоподобие \(L(\theta ; \vec{X})\) получается случайной функцией: при каждом \(\omega \in \Omega\) это какая-то своя функция \(\Theta \to \mathbb {R}\):
т.е. то значение \(\theta \in \Theta\), при котором достигается максимум функции правдоподобия при фиксированных \(X_{1}, \ldots , X_{n}\).
На практике искать максимум проще не от самого правдоподобия, а от логарифмической функции правдоподобия:
\[
\ell (\theta ) := \ln L\left(\theta \right)
\]
Логарифм – это строго возрастающая функция, значит точка достижения максимума от логарифмирования не меняется. С логарифмом проще работать, т.к. он произведение превращает в суммирование.
Будет ли \(\widehat{\theta } := \overline{X}\) точкой, в которой правдоподобие (или, что эквивалентно, логправдоподобие) достигает максимума? Заметим, что при \(0 < \theta < \overline{X}\) производная \(\frac{\partial \ell (\theta )}{\partial \theta }\) положительна, а при \(\overline{X} < \theta < 1\) производная отрицательна. Следовательно \(\widehat{\theta } = \overline{X}\) – точка глобального максимума функции \(\ell (\theta )\) при фиксированных \(X_1,\ldots , X_n\) и \(\theta \in (0,1)\).
Пусть \(X_1, \ldots , X_n\) – выборка из смещенного экспоненциального распределения с плотностью \[
f_{\alpha , \beta } = \frac{1}{\alpha } e^{\frac{\beta - x}{\alpha }} \; \mathbb {1}_{x \in [\beta , +\infty )},
\] где \(\theta = (\alpha , \beta )^T \in \mathbb {R}_+ \times \mathbb {R}\). Найдите для \(\theta\) оценку максимального правдоподобия. Докажите, что полученная для \(\alpha\) оценка \(\widehat{\alpha }\) является асимптотически нормальной, и найдите ее асимптотическую дисперсию.
ProblemЗадача 6
Найдите оценку максимального правдоподобия для параметра сдвига \(x_0\) в распределении Коши \(\operatorname {Cauchy}(x_0, 1)\), если выборка состоит из
одного наблюдения,
двух наблюдений.
ProblemЗадача 7
Пусть \(X_1, \ldots , X_n\) – выборка из распределения \(e^{U[0, \theta ]}, \; \theta > 0\). Т.е. если \(\xi \sim U[0, \theta ]\), то \(X_1 \sim e^\xi\). Найдите оценку максимального правдоподобия параметра \(\theta\) и проверьте ее на состоятельность.
ProblemЗадача 8
Пусть \(X_1, \ldots , X_n\) – выборка из распределения Лапласа с плотностью \[
f_\theta (x) = \frac{1}{2}e^{-\left|x - \theta \right|}
\] Найдите оценку параметра \(\theta\) методом максимального правдоподобия.
Обратимся к свойствам оценки максимального правдоподобия.
Теорема 2 Пусть \(\Theta \subset \mathbb {R}\), выполнены условия регулярности (см., например, (Ивченко и Медведев 2010 г., разд. 3.5.4)), функция правдоподобия имеет лишь один локальный максимум, лежащий внутри \(\Theta\) и совпадающий с оценкой максимального правдоподобия, и, наконец, функция правдоподобия трижды дифференцируема по \(\theta\) и при этом существует не зависящая от \(\theta\) функция \(M(x)\) такая, что для всех \(\theta \in \Theta\)\[
\left|\frac{\partial ^{3} f_{\theta }(x)}{\partial \theta ^{3}}\right| \leq M(x), \qquad \mathbb {E}_{\theta }\left[M(X_1)\right] < \infty
\] Тогда оценка максимального правдоподобия является асимптотически нормальной оценкой \(\theta\) с асимптотической дисперсией \[
n \left(\operatorname {Var}_{\theta }\left[\frac{\partial \ell (\theta )}{\partial \theta }\right]\right)^{-1},
\] где \(\ell (\theta ) = \ln L(\theta )\) – логарифмическая функция правдоподобия всей выборки (как и было определено выше).
\(Q(p)\) еще называют квантилью уровня \(p \in [0,1]\).
Медианой распределения \(F\) называется квантиль уровня \(\frac{1}{2}\), т.е. значение \(Q(0.5)\).
Если \(F\) биективна, т.е. возрастает строго и не имеет разрывов, то квантильная функция – это просто обратная функция к \(F\): \(Q = F^{-1}\). В общем же случае у \(F\) могут быть скачки и участки постоянства, и «обобщенность» обратной функции ровно в том, как \(Q\) с ними обращается:
Квантильная функция как обобщённая обратная
Слева — функция распределения \(F(x)\) со скачком в \(x=2\) и плато на \([4,5]\). Справа — квантильная функция \(Q(p) = \inf\{x : F(x) \geq p\}\) (те же оси, повёрнутые: по вертикали везде уровень \(p\)). Двигайте ползунок или нажимайте кнопки — красная точка на обоих графиках показывает пару \((Q(p), p)\).
\(F(x)\)
\(Q(p) = \inf\{x : F(x) \geq p\}\)
0.50Q(p) = 2.00
Определение 2 Пусть \(X_{1}, \ldots , X_{n}\) – выборка из неизвестного распределения \(\mathbb {P}\). Статистику \[
\widehat{Q}(p) := X_{(\lceil np \rceil )} = \begin{cases} X_{([n p]+1)}, & \text{ если } n p \notin \mathbb {Z} \\ X_{(n p)}, & \text{ если } n p \in \mathbb {Z}\end{cases}
\] называют выборочной \(p\)-квантилью.
Определение 3Выборочной медианой выборки \(X_{1}, \ldots X_{n}\) называют либо статистику \[
\widehat{\mu } := \widehat{Q}(0.5) = \begin{cases} X_{(k+1)}, & \text{ если } n=2 k+1 \\ X_{(k)}, & \text{ если } n=2 k\end{cases}
\] либо \[
\widehat{\mu } := \begin{cases} X_{(k+1)}, & \text{ если } n=2 k+1 \\ \frac{X_{(k)}+X_{(k+1)}}{2}, & \text{ если } n=2 k\end{cases}
\]
Определения выборочной медианы слегка отличаются, если \(n\) четно. В первом случае мы берем левое значение из 2-х центральных, а во втором полусумму 2-х центральных. Мы в основном будем пользоваться вторым способом, хотя разницы между ними практически нет, особенно с точки зрения асимптотических свойств.
Теорема 3 (об асимптотической нормальности выборочной квантили) Пусть \(X_{1}, \ldots X_{n}\) – выборка из абсолютно непрерывного одномерного распределения \(\mathbb {P}\) с плотностью \(f\). Пусть \(p \in (0,1)\) и \(Q(p)\) – это \(p\)-квантиль распределения \(\mathbb {P}\), причём функция \(f\) непрерывно дифференцируема в некоторой окрестности точки \(Q(p)\) и \(f\left(Q(p)\right)>0\). Тогда \(\widehat{Q}(p)\) – асимптотически нормальная оценка \(Q(p)\) с ас. дисперсией \(\frac{p(1-p)}{f^{2}\left(Q(p)\right)}\): \[
\sqrt{n} \left(\widehat{Q}(p) - Q(p)\right) \xrightarrow [n\to \infty ]{d} \mathcal{N}\left(0, \frac{p(1-p)}{f^{2}\left(Q(p)\right)}\right)
\]
В частности, для медианы (\(p = \frac12\)) асимптотическая дисперсия равна \(\frac{1}{4f^2\left(Q(0.5)\right)}\).
Асимптотическое поведение \(\widehat{\mu }\) совпадает с поведением \(\widehat{Q}(0.5)\), вне зависимости от способа задания \(\widehat{\mu }\).
ExampleПример 7
Пусть \(X_{1}, \ldots , X_{n}\) – выборка из \(\operatorname {Cauchy}(\theta , 1)\). Найдите асимптотически нормальную оценку параметра \(\theta\) и ее асимптотическую дисперсию.
Так как у случайной величины с таким распределением нет конечного математического ожидания, то воспользоваться центральной предельной теоремой нам не удастся.
Воспользуемся выборочной медианой. \(Q(0.5)=\theta\), поэтому, по теореме об асимптотической нормальности выборочной медианы, \(\hat{\mu }\) – асимптотически нормальная оценка \(\theta\) с асимптотической дисперсией
Переключайте распределение, двигайте ползунок (N), чтобы посмотреть на траектории при разном объёме выборки, или нажмите кнопку, чтобы перегенерировать выборку заново.
Выборочное среднее и выборочная медиана: устойчивость к тяжёлым хвостам
Одна реализация выборки, \(\theta = 0\). У Коши среднее время от времени совершает крупные скачки и не сходится, медиана — сходится всегда.
1
\(n =\) \(\bar X_n =\) медиана \(=\)
ProblemЗадача 10
Предложите асимптотически нормальную оценку параметра \(\theta^2\) в модели распределения Коши \(\operatorname {Cauchy}(\theta , 1)\) со сдвигом \(\theta\) (см. предыдущую задачу), а также найдите её асимптотическую дисперсию.