Универсальные методы нахождения оценок

Дата публикации

2 сентября 2026

ПредупреждениеЧерновик

Этот конспект ещё находится в процессе редактуры: в тексте могут встречаться опечатки, неточности и локально не проработанные места. Если что-то нашли — сообщите, пожалуйста, автору (контакты на странице курса).

Пусть \(\Theta \subset \mathbb {R}^{k}\). Рассмотрим некоторое семейство распределений (параметрическую модель) \(\left\{ \mathbb {P}_\theta , \; \theta \in \Theta \right\}\) и выборку \(X_{1}, \ldots , X_{n}\) из неизвестного распределения \(\mathbb {P}_{\theta }\). В данной главе рассмотрим 3 самых распространенных универсальных способа получения оценок параметра \(\theta\).

1 Метод моментов

Напомним, \(k\)-м моментом (\(k \in \mathbb {N}\)) случайной величины \(X\) называется матожидание \(\mathbb {E}\left[X^k\right]\). \(k\)-м выборочным моментом выборки \(X_1, \ldots , X_n\) называется величина

\[ \overline{X^k} := \frac{1}{n}\sum _{i=1}^n X_i^k \]

Идея метода моментов (сокр. MM, англ. Method of Moments) следующая: если какой-то момент сл. величины \(X_1\) легко выражается через \(\theta\), то можно заменить момент на выборочный момент, а \(\theta\) на оценку \(\widehat{\theta }\), и получить таким образом оценку.

ExampleПример 1

Пусть имеем выборку из экспоненциального распределения \(\operatorname {Exp}(\theta ), \; \theta > 0\) с плотностью \[ f_\theta (x) = \theta \cdot e^{-\theta x} \cdot \; \mathbb {1}_{\mathbb {R}_+}(x) \] Постройте для \(\theta\) оценку по методу моментов.

SolutionРешение

В данном случае имеем \(\theta \in \Theta = (0, +\infty )\), параметр одномерный. Далее, \(\mathbb {E}_{\theta }\left[X_1\right] = \frac{1}{\theta }\). Заменим матожидание (1-й момент) на выборочное среднее (1-й выборочный момент), а \(\theta\) на \(\widehat{\theta }\), получим \[ \overline{X} = \frac{1}{\widehat{\theta }} \] т.е. \(\widehat{\theta } = \frac{1}{\overline{X}}\).

AnswerОтвет

\(\widehat{\theta }_{\operatorname {MM}} = \frac{1}{\overline{X}}\)

В случае многомерного параметра можно использовать несколько моментов для поиска оценки.

ExampleПример 2

Найти оценки по методу моментов для семейства распределений \(\mathcal{N}\left(a, \sigma^{2}\right)\). Величину \(\sigma^{2}\) считайте при этом единым параметром. Т.е. требуется оценить именно дисперсию \(\sigma^{2}\) нормального распределения, не стандартное отклонение \(\sigma\).

SolutionРешение

Здесь \(\theta =\left(a, \sigma^{2}\right), \Theta =\mathbb {R} \times (0, \infty )\). Имеем \[ \begin{cases} \mathbb {E}_{\theta }\left[X_1\right] & = a \\ \mathbb {E}_{\theta }\left[X_1^2\right] & = \sigma ^2 + a^2 \end{cases} \] Заменим моменты на выборочные моменты, а параметры на оценки, получим систему \[ \begin{cases} \overline{X} & = \widehat{a} \\ \overline{X^2} & = \widehat{\sigma ^2} + \widehat{a}^2 \end{cases} \] Решим систему: \[ \begin{cases} \overline{X} & = \widehat{a} \\ \overline{X^2} & = \widehat{\sigma ^2} + \widehat{a}^2 \end{cases} \iff \begin{cases} \widehat{a} & = \overline{X} \\ \widehat{\sigma ^2} & = \overline{X^2} - \overline{X}^2 \end{cases} \]

AnswerОтвет

\(\widehat{a}_{\operatorname {MM}} = \overline{X}, \quad \widehat{\sigma^2}_{\operatorname {MM}} = \overline{X^2} - \overline{X}^2\).

ProblemЗадача 1

Найдите оценки по методу моментов для следующих распределений

  1. \(\mathscr {N}\left(a, \sigma^2\right), \; a \in \mathbb {R}, \sigma > 0\);

  2. \(\Gamma (\alpha , \beta )\). Напомним, что плотность гамма-распределения равна

\[ f_{\alpha , \beta } = \frac{\beta ^\alpha }{\Gamma (\alpha )}x^{\alpha - 1}e^{-\beta x} \; \mathbb {1}_{x \in [0, +\infty )}, \]

где \(\alpha , \beta > 0\). Гамма-функция: \(\Gamma (\alpha ) = \int_0^{\infty } x^{\alpha - 1}e^{-x}dx\). Это непрерывный аналог функции факториала, а именно \(\Gamma (n+1) = n!, \; n \in \mathbb {Z}_+\). В общем случае \(\Gamma (\alpha + 1) = \alpha \Gamma (\alpha ), \; \forall \alpha > 0\). Еще полезное значение: \(\Gamma (\frac{1}{2}) = \sqrt{\pi }\).

  1. \(U[a,b], \; -\infty < a < b < +\infty\)

  2. \(\operatorname {Pois}\left(\lambda \right), \; \lambda > 0\);

  3. \(\operatorname {Bin}\left(m, p\right), \; m \in \mathbb {N}, p \in (0,1)\);

  4. \(\operatorname {Geom}\left(p\right)\). Напомним, что \(\operatorname {Geom}\left(p\right)\) – дискретное распределение с носителем \(\mathbb {Z}_+\) со следующей функцией вероятности: \(f_{p}(k) = (1-p)^kp, \; k \in \mathbb {Z}_+\).

  5. \(\operatorname {Beta}(\lambda_1, \lambda_2)\). Напомним, плотность бета-распределения равна

\[ f_{\lambda _1, \lambda _2}(x) = \frac{x^{\lambda _1-1}(1 - x)^{\lambda _2 - 1}}{B(\lambda _1, \lambda _2)} \; \mathbb {1}_{x \in [0,1]}, \]

\(\lambda_1, \lambda_2 > 0\). Бета-функция \(B(\lambda_1, \lambda_2)\):

\[ B(\lambda _1, \lambda _2) = \int _0^1 x^{\lambda _1 - 1}(1 - x)^{\lambda _2 - 1} dx = \frac{\Gamma (\lambda _1)\Gamma (\lambda _2)}{\Gamma (\lambda _1 + \lambda _2)} \]

Примечание. Каждый пункт оценивается в 0.3 балла.

В общем случае непосредственно моментов у распределения может не существовать. Однако если существуют другие матожидания \(\mathbb {E}_{\theta }\left[g(X_1)\right]\), например \(\mathbb {E}_{\theta }\left[\ln (X_1)\right]\), то можно попробовать построить оценку на их основе. \(g\) называют пробной функцией; если \(g(x) = x^k\), \(k\in \mathbb {N}\), то \(g\) называют стандартной пробной функцией. В примерах выше мы использовали стандартные пробные функции. Теперь попробуем использовать нестандартные.

ExampleПример 3

Пусть имеем выборку \(X_1,\ldots , X_n\) из лог-логистического распределения \(\operatorname {LL}(\alpha , \beta ), \; \alpha , \beta > 0\) с плотностью \[ p(x) = \frac{(\beta /\alpha ) (x/\alpha )^{\beta - 1}}{(1 + (x/\alpha )^\beta )^2} \; \mathbb {1}_{\mathbb {R}_+}(x) \] Постройте для \(\alpha , \beta\) оценки по методу моментов.

SolutionРешение

В данном случае имеем \(\theta = (\alpha , \beta )^T \in \Theta = (0, +\infty ) \times (0, +\infty )\), параметр двумерный.

При \(m > 0\) имеем

\[ \begin{align} \mathbb {E}_{\theta }\left[X^m_1\right] & = \int _{0}^{\infty } \frac{(\beta /\alpha ) (x/\alpha )^{\beta - 1}}{(1 + (x/\alpha )^\beta )^2} \cdot x^m \cdot dx = \\ & = \beta \alpha ^m \int _{0}^{\infty } \frac{(x/\alpha )^{\beta - 1 + m}}{(1 + (x/\alpha )^\beta )^2} d(x/\alpha ) = \bigg\rvert y = x/\alpha \bigg\rvert = \\ & = \beta \alpha ^m \int _{0}^{\infty } \frac{y^{\beta - 1 + m}}{(1 + y^\beta )^2}dy \end{align} \]

Далее сделаем замену \(z = \frac{1}{1 + y^\beta }, \; y = \left(\frac{1 - z}{z}\right)^{\frac{1}{\beta }}, \; dy = -\frac{1}{\beta }\left(\frac{1 - z}{z}\right)^{\frac{1}{\beta } - 1} z^{-2} dz\) (при этом \(y : 0 \to \infty\) соответствует \(z : 1 \to 0\)). Получаем

\[ \begin{align} \mathbb {E}_{\theta }\left[X^m_1\right] & = \beta \alpha ^m \cdot \left(-\int _{1}^{0} \left(\frac{1 - z}{z}\right)^{1 - \frac{1}{\beta } + \frac{m}{\beta }} z^2 \frac{1}{\beta }\left(\frac{1 - z}{z}\right)^{\frac{1}{\beta } - 1} z^{-2} dz\right) \end{align} \]

Сменим знак вместе с порядком пределов интегрирования, сократим \(z^2 \cdot z^{-2} = 1\) и \(\beta \cdot \frac{1}{\beta } = 1\), а показатели степени при \(\frac{1-z}{z}\) сложим: \(\left(1 - \frac{1}{\beta } + \frac{m}{\beta }\right) + \left(\frac{1}{\beta } - 1\right) = \frac{m}{\beta }\). Получаем

\[ \begin{align} \mathbb {E}_{\theta }\left[X^m_1\right] & = \alpha ^m \int _0^1 \left(\frac{1-z}{z}\right)^{\frac{m}{\beta }} dz = \alpha ^m \int _0^1 z^{-\frac{m}{\beta }}\left(1 - z\right)^{\frac{m}{\beta }} dz = \\ & = \begin{cases} \alpha ^m B(1 - \frac{m}{\beta }, 1 + \frac{m}{\beta }), & \text{ если } 1 - \frac{m}{\beta } > 0 \iff \beta > m \\ \infty , & \text{ в прот. случае} \end{cases} \end{align} \]

При \(\beta < 1\) матожидания \(\mathbb {E}_{\theta }\left[X_1\right]\) и, как следствие, всех прочих моментов у \(X_1\) не существует, невозможно построить оценку по методу моментов на основе стандартных пробных функций.

Однако известно, что случайная величина \(\ln (X_1)\) имеет логистическое распределение \(\operatorname {Logistic}(\mu , s)\) с параметрами \(\mu = \ln (\alpha ), \; s = 1/\beta\). Известно, что у данного распределения при любых значениях параметров матожидание и дисперсия существуют и равны \(\mu\), \(s^2 \pi^2/ 3\) соотв. Тогда

\[ \begin{align} \mathbb {E}\left[\ln (X_1)\right] & = \mu = \ln (\alpha ), \\ \mathbb {E}\left[\ln ^2(X_1)\right] & = \operatorname {Var}\left[\ln (X_1)\right] + \left(\mathbb {E}\left[\ln (X_1)\right]\right)^2 = \frac{s^2\pi ^2}{3} + \mu ^2 = \\ & = \frac{\pi ^2}{3\beta ^2} + \ln ^2(\alpha ) \end{align} \]

Для построения оценок по методу моментов заменим матожидания на выборочные характеристики, а параметры на оценки:

\[ \begin{align} \mathbb {E}\left[\ln (X_1)\right] \; & \longrightarrow \; \overline{\ln (X)} = \frac{1}{n}\sum _{i=1}^n \ln (X_i), \\ \mathbb {E}\left[\ln ^2(X_1)\right] \; & \longrightarrow \; \overline{\ln ^2(X)} = \frac{1}{n}\sum _{i=1}^n \ln ^2(X_i) \\ \alpha \; & \longrightarrow \; \widehat{\alpha }, \\ \beta \; & \longrightarrow \; \widehat{\beta } \end{align} \]

Получим

\[ \begin{cases} \overline{\ln (X)} & = \ln (\widehat{\alpha }) \\ \overline{\ln ^2(X)} & = \frac{\pi ^2 }{3\widehat{\beta }^2} + \ln ^2(\widehat{\alpha }) \end{cases} \iff \begin{cases} \widehat{\alpha } & = e^{\overline{\ln (X)}} \\ \widehat{\beta } & = \pi \frac{1}{\sqrt{3\left( \overline{\ln ^2(X)} - \overline{\ln (X)}^2\right)}} \end{cases} \]

AnswerОтвет

\[ \widehat{\alpha }_{\operatorname {MM}} = e^{\overline{\ln (X)}}, \qquad \widehat{\beta }_{\operatorname {MM}} = \pi \frac{1}{\sqrt{3 \cdot \left( \overline{\ln ^2(X)} - \overline{\ln (X)}^2\right)}} \]

Напомним, что \(\operatorname {Pareto}(x_0, \alpha )\), \(x_0, \alpha > 0\) – непрерывное распределение с плотностью

\[ f_{x_0, \alpha }(x) = \frac{\alpha x_0^\alpha }{x^{\alpha + 1}}\; \mathbb {1}_{x \in [ x_0, +\infty )}. \]

\(x_0\) интерпретируется как сдвиг распределения, а \(\alpha\) как параметр формы.

Напомним, что \(\operatorname {Cauchy}(x_0, \gamma )\), \(x_0 \in \mathbb {R}\), \(\gamma > 0\) – непрерывное распределение с плотностью

\[ f_{x_0, \gamma }(x) = \frac{1}{\pi \gamma \left(1 + \left(\frac{x - x_0}{\gamma }\right)^2\right)} = \frac{\gamma }{\pi \left(\gamma ^2 + (x - x_0)^2\right)}. \]

\(x_0\) интерпретируется как сдвиг распределения, а \(\gamma\) как масштаб.

ProblemЗадача 2

Найдите оценки по методу моментов для параметров следующих распределений

  1. распределения \(\operatorname {Pareto}(1, \alpha ), \; \alpha > 0\) с плотностью \(f_{\alpha }(x) = \frac{\alpha }{x^{\alpha + 1}}\; \mathbb {1}_{[1, +\infty )}(x)\);

  2. распределения \(\operatorname {Cauchy}(0, \gamma ), \; \gamma > 0\) с плотностью \(f_{\gamma }(x) = \frac{\gamma }{\pi (\gamma^2 + x^2)}\).

Дадим общее описание метода моментов построения оценки для \(\theta\). Для построения оценки выберем такие борелевские функции \(g_{1}, \ldots , g_{k}: \mathbb {R} \rightarrow \mathbb {R}\) (количество функций \(k\) равно размерности параметра \(\theta\)), что для любого \(i \in \left\{ 1, \ldots , k\right\}\) и любого \(\theta \in \Theta\) существует конечное матожидание \(\mathbb {E}_{\theta }\left[g_i(X_1)\right]\). Обозначим

\[ \begin{cases} m_1(\theta ) & := \mathbb {E}_{\theta }\left[g_1(X_1)\right], \\ & \vdots \\ m_k(\theta ) & := \mathbb {E}_{\theta }\left[g_k(X_1)\right] \end{cases} \qquad \text{ или } \qquad m(\theta ) = \begin{pmatrix} \mathbb {E}_{\theta }\left[g_1(X_1)\right] \\ \vdots \\ \mathbb {E}_{\theta }\left[g_k(X_1)\right] \end{pmatrix}, \quad \text{ где } \quad m(\theta ) := \begin{pmatrix} m_1(\theta ) \\ \vdots \\ m_k(\theta ) \end{pmatrix} \]

Заменим параметр \(\theta\) на его оценку \(\widehat{\theta }\), а матожидания \(\mathbb {E}_{\theta }\left[g_i(X_1)\right]\) на выборочные матожидания

\[ \overline{g_i(X)} = \frac{1}{n}\sum _{j=1}^n g_i(X_j) \]

Получим систему уравнений относительно \(\widehat{\theta }\):

\[ \begin{cases} m_1(\widehat{\theta }) & = \overline{g_1(X)}, \\ & \vdots \\ m_k(\widehat{\theta }) & = \overline{g_k(X)} \end{cases} \]

Предположим, что у этой системы существует единственное решение. Тогда это единственное решение \(\theta^{*}(X) = \widehat{\theta }_{\operatorname {MM}}(X)\) называется оценкой по методу моментов с пробными функциями \(g_{1}, \ldots , g_{k}\). Функции \(g_{i}(x)=x^{i}, i \in \{ 1, \ldots , k\}\), называются стандартными пробными функциями. В случае использования стандартных пробных функций \(\mathbb {E}\left[g_i(X_1)\right]\) – это какой-то момент случайной величины.

Теорема 1 Если \(m: \Theta \rightarrow m(\Theta )\)- биекция и функцию \(m^{-1}\) можно доопределить до функции, заданной на всем множестве \(\mathbb {R}^{k}\) и непрерывной в каждой точке множества \(m(\Theta )\), то оценка по методу моментов является сильно состоятельной.

Более того, утверждение этой теоремы можно дополнить следующим образом.

ExampleПример 4

Докажите, что в условиях теоремы выше оценка по методу моментов является асимптотически нормальной, если функцию \(m^{-1}\) можно доопределить до функции, заданной на всем множестве \(\mathbb {R}^{k}\) и дифференцируемой в каждой точке множества \(m(\Theta )\), и, кроме того, для любого \(i \in \{ 1, \ldots , k\}\) и любого \(\theta \in \Theta\) выполнено неравенство \[ 0 < \operatorname {Var}_{\theta }\left[g_i(X_1)\right] < +\infty \]

SolutionРешение

Итак, оценка по методу моментов равна \(\theta^{*}=m^{-1}\left(\overline{g(X)}\right)\), где \(\overline{g(X)}=\left(\overline{g_{1}(X)}, \ldots , \overline{g_{k}(X)}\right)^{T}\). По многомерной центральной предельной теореме, для любого \(\theta \in \Theta\) выполнено \[ \sqrt{n}\left(\overline{g(X)}-m(\theta )\right) \xrightarrow {d_{\theta }} \xi \sim \mathcal{N}(0, \Sigma (\theta )), \] где \(\Sigma (\theta )\)- матрица ковариаций вектора \(\left(g_{1}\left(X_{1}\right), \ldots , g_{k}\left(X_{1}\right)\right)^{T}\). Согласно дельта-методу (\(h=m^{-1}\), \(b_{n}=1 / \sqrt{n}\), \(a=m(\theta )\), \(\xi_{n}=\sqrt{n}\left(\overline{g(X)}-m(\theta )\right)\)), при \(k = 1\) выполнено \[ \sqrt{n}\left(m^{-1}\left(\overline{g(X)}\right) - \theta \right) \xrightarrow []{d_\theta } \left\langle \xi , \nabla (m^{-1})\vert _{m(\theta )} \right\rangle , \] причем предельное распределение гауссовское: \[ \left\langle \xi , \nabla (m^{-1})\vert _{m(\theta )} \right\rangle \sim \mathscr {N}\left(0, \left(\nabla (m^{-1})\vert _{m(\theta )}\right)^T \cdot \Sigma (\theta ) \cdot \nabla (m^{-1})\vert _{m(\theta )}\right). \] При \(k > 1\) рассуждение то же, только дельта-метод применяется к векторнозначной функции \(h = m^{-1}: \mathbb {R}^{k} \to \mathbb {R}^{k}\) (покомпонентно): градиент заменяется на матрицу Якоби \(J := \frac{\partial m^{-1}}{\partial x}\big\vert_{m(\theta )}\), и предельным распределением оказывается \(\mathscr {N}\left(0, J \Sigma (\theta ) J^T\right)\) – асимптотическая нормальность (теперь уже с асимптотической ковариационной матрицей) сохраняется.

Заметим, что оценка по методу моментов не обязательно является несмещённой.

ProblemЗадача 3

Пусть \(X_1, \ldots , X_n\) – выборка из распределения \(\operatorname {Pois}\left(\lambda \right), \; \lambda > 0\). Найдите несмещённую оценку параметра \(\lambda^3\).

2 Метод максимального правдоподобия

Пусть \(\mathcal{P}=\left\{ \mathbb {P}_{\theta }, \theta \in \Theta \right\}\) – параметрическое семейство распределений. Будем рассматривать 2 случая:

  • Все \(\mathbb {P}_{\theta }\) – абсолютно непрерывные распределения. В этом случае пусть \(f_{\theta }(x)\) – это плотность распределения \(\mathbb {P}_{\theta }\).

  • Все \(\mathbb {P}_{\theta }\) – дискретные распределения (с носителем в \(\mathbb {Z}\)). В этом случае пусть \(f_{\theta }(x)\) – это функция вероятности распределения \(\mathbb {P}_{\theta }\).

В обоих случаях будем называть семейство \(\mathcal{P}\) доминируемым.

Пусть \(\mathcal{P}=\left\{ \mathbb {P}_{\theta }, \theta \in \Theta \right\}\) – доминируемое семейство распределений, \(\vec{X} = (X_{1}, \ldots , X_{n})^T\) – выборка из распределения \(\mathbb {P} \in \mathcal{P}\). Если \(f_\theta (x)\) – плотность (функция вероятности) \(X_1\), то плотность (функция вероятности) \(f\) вектора выборки \(X = (X_1, \ldots , X_n)^T\) равна произведению плотностей компонент, поскольку компоненты независимы:

\[ f_\theta (\overrightarrow {x}) = f(\overrightarrow {x} ; \theta ) := f_\theta (x_1) \cdot f_\theta (x_2) \cdot \ldots \cdot f_{\theta }(x_n) \]

где \(\overrightarrow {x} = \left(x_1, \ldots , x_n\right)^T\). Совместная плотность выборки \(f\) зависит от \(\theta\) и от \(\overrightarrow {x}\). Однако принято при рассмотрении плотности фиксировать параметр \(\theta\) и варьировать \(f\) по \(\overrightarrow {x}\).

Функцией правдоподобия выборки \(\vec{X}\) называется (совместная) плотность выборки, если считать \(\vec{x}\) фиксированным и варьировать ее по параметру \(\theta\):

\[ L(\theta ) = L(\theta ; \vec{x}) := f_\theta (x_1) \cdot \ldots \cdot f_{\theta }(x_n) \]

Иногда вместо \(\vec{x}\) вставляют саму выборку \(\vec{X}\), и тогда правдоподобие \(L(\theta ; \vec{X})\) получается случайной функцией: при каждом \(\omega \in \Omega\) это какая-то своя функция \(\Theta \to \mathbb {R}\):

\[ \left(L(\theta )\right)(\omega ) = L(\theta ; \vec{X}(\omega )) \]

При фиксированном \(\theta\) правдоподобие в таком случае – это случайная величина.

Оценкой максимального правдоподобия (ОМП или MLE от англ. Maximum Likelihood Estimator) параметра \(\theta\) называется

\[ \widehat{\theta }_{\operatorname {MLE}} := \operatorname *{arg\, max} _{\theta \in \Theta } L\left(\theta \right) \]

т.е. то значение \(\theta \in \Theta\), при котором достигается максимум функции правдоподобия при фиксированных \(X_{1}, \ldots , X_{n}\).

На практике искать максимум проще не от самого правдоподобия, а от логарифмической функции правдоподобия:

\[ \ell (\theta ) := \ln L\left(\theta \right) \]

Логарифм – это строго возрастающая функция, значит точка достижения максимума от логарифмирования не меняется. С логарифмом проще работать, т.к. он произведение превращает в суммирование.

ExampleПример 5

Пусть \(X_{1}, \ldots , X_{n}\) – выборка из распределения \(\operatorname {Bern}(\theta )\), \(\theta \in (0,1) = \Theta\). Найдите оценку максимального правдоподобия параметра \(\theta\).

SolutionРешение

Функция вероятностей для распределения Бернулли:

\[ f_{\theta }(x) = \mathbb {P}\left(X_1 = x\right) = \begin{cases} \theta , & \text{ если } x = 1 \\ 1 - \theta , & \text{ если } x = 0 \end{cases} \]

Получим для \(f_\theta\) удобное представление:

\[ f_\theta (x) = \theta ^x \cdot (1-\theta )^{1-x} \cdot \; \mathbb {1}_{\left\{ 0,1\right\} }(x) \]

Функция правдоподобия:

\[ L(\theta ) = \prod _{i=1}^{n}f_{\theta }(X_i) = \theta ^{\sum X_{i}}(1-\theta )^{n-\sum X_{i}} \]

а логарифмическая функция правдоподобия (которую, как правило, легче дифференцировать, чтобы найти точку максимума) равна

\[ \begin{align} \ell (\theta ) & = \sum _{i=1}^n X_{i} \ln \theta + \left(n-\sum _{i=1}^n X_{i}\right) \ln (1-\theta ) = \\ & = n \cdot \left(\overline{X}\ln (\theta ) + \left(1 - \overline{X}\right)\ln (1-\theta )\right) \end{align} \]

Чтобы найти оценку максимального правдоподобия, дифференцируем \(\ell\) по \(\theta\) (считая \(X_1, \ldots , X_n\) фиксированными):

\[ \frac{\partial \ell (\theta )}{\partial \theta } = n \cdot \left( \frac{\overline{X}}{\theta }-\frac{1-\overline{X}}{1-\theta }\right) \]

Приведем к общему знаменателю:

\[ \frac{\partial \ell (\theta )}{\partial \theta } = n \cdot \frac{\overline{X}(1-\theta ) - \theta (1-\overline{X})}{\theta (1-\theta )} = n \cdot \frac{\overline{X} - \theta }{\theta (1 - \theta )} \]

Приравняем производную к нулю:

\[ 0 = \frac{\partial \ell (\theta )}{\partial \theta } = n \cdot \frac{\overline{X} - \theta }{\theta (1 - \theta )} \iff \theta = \overline{X} \]

Будет ли \(\widehat{\theta } := \overline{X}\) точкой, в которой правдоподобие (или, что эквивалентно, логправдоподобие) достигает максимума? Заметим, что при \(0 < \theta < \overline{X}\) производная \(\frac{\partial \ell (\theta )}{\partial \theta }\) положительна, а при \(\overline{X} < \theta < 1\) производная отрицательна. Следовательно \(\widehat{\theta } = \overline{X}\) – точка глобального максимума функции \(\ell (\theta )\) при фиксированных \(X_1,\ldots , X_n\) и \(\theta \in (0,1)\).

AnswerОтвет

\(\widehat{\theta }_{\operatorname {MLE}} = \overline{X}\)

ProblemЗадача 4

Найдите оценки по методу максимального правдоподобия для следующих распределений:

  1. \(\mathscr {N}\left(a, \sigma^2\right)\) в трех случаях: когда неизвестен только один из параметров и когда неизвестны оба параметра;

  2. \(\Gamma (\alpha , \beta ), \; \alpha ,\beta > 0\), если параметр \(\alpha\) известен;

  3. \(U[a,b], \; -\infty < a < b < +\infty\)

  4. \(\operatorname {Pois}\left(\lambda \right), \; \lambda > 0\);

  5. \(\operatorname {Bin}\left(m, p\right), \; m \in \mathbb {N}, p \in (0,1)\), если параметр \(m\) известен;

  6. \(\operatorname {Geom}\left(p\right), \; p \in (0,1)\).

  7. \(\operatorname {Pareto}(\theta , 2), \; \theta > 0\).

Примечание. Каждый пункт оценивается в 0.3 балла.

ProblemЗадача 5

Пусть \(X_1, \ldots , X_n\) – выборка из смещенного экспоненциального распределения с плотностью \[ f_{\alpha , \beta } = \frac{1}{\alpha } e^{\frac{\beta - x}{\alpha }} \; \mathbb {1}_{x \in [\beta , +\infty )}, \] где \(\theta = (\alpha , \beta )^T \in \mathbb {R}_+ \times \mathbb {R}\). Найдите для \(\theta\) оценку максимального правдоподобия. Докажите, что полученная для \(\alpha\) оценка \(\widehat{\alpha }\) является асимптотически нормальной, и найдите ее асимптотическую дисперсию.

ProblemЗадача 6

Найдите оценку максимального правдоподобия для параметра сдвига \(x_0\) в распределении Коши \(\operatorname {Cauchy}(x_0, 1)\), если выборка состоит из

  1. одного наблюдения,

  2. двух наблюдений.

ProblemЗадача 7

Пусть \(X_1, \ldots , X_n\) – выборка из распределения \(e^{U[0, \theta ]}, \; \theta > 0\). Т.е. если \(\xi \sim U[0, \theta ]\), то \(X_1 \sim e^\xi\). Найдите оценку максимального правдоподобия параметра \(\theta\) и проверьте ее на состоятельность.

ProblemЗадача 8

Пусть \(X_1, \ldots , X_n\) – выборка из распределения Лапласа с плотностью \[ f_\theta (x) = \frac{1}{2}e^{-\left|x - \theta \right|} \] Найдите оценку параметра \(\theta\) методом максимального правдоподобия.

Обратимся к свойствам оценки максимального правдоподобия.

Теорема 2 Пусть \(\Theta \subset \mathbb {R}\), выполнены условия регулярности (см., например, (Ивченко и Медведев 2010 г., разд. 3.5.4)), функция правдоподобия имеет лишь один локальный максимум, лежащий внутри \(\Theta\) и совпадающий с оценкой максимального правдоподобия, и, наконец, функция правдоподобия трижды дифференцируема по \(\theta\) и при этом существует не зависящая от \(\theta\) функция \(M(x)\) такая, что для всех \(\theta \in \Theta\) \[ \left|\frac{\partial ^{3} f_{\theta }(x)}{\partial \theta ^{3}}\right| \leq M(x), \qquad \mathbb {E}_{\theta }\left[M(X_1)\right] < \infty \] Тогда оценка максимального правдоподобия является асимптотически нормальной оценкой \(\theta\) с асимптотической дисперсией \[ n \left(\operatorname {Var}_{\theta }\left[\frac{\partial \ell (\theta )}{\partial \theta }\right]\right)^{-1}, \] где \(\ell (\theta ) = \ln L(\theta )\) – логарифмическая функция правдоподобия всей выборки (как и было определено выше).

ExampleПример 6

Пусть \(X_1, \ldots , X_n\) – выборка из \(\operatorname {Pois}\left(\lambda \right)\), \(\lambda > 0\). Найдите асимптотическую дисперсию оценки максимального правдоподобия \(\widehat{\lambda }_{\operatorname {MLE}}\).

SolutionРешение

Логарифмическая функция правдоподобия выборки: \[ \ell (\lambda ) = \sum _{i=1}^n X_i \ln \lambda - n\lambda - \sum _{i=1}^n \ln (X_i!). \] Тогда \[ \frac{\partial \ell (\lambda )}{\partial \lambda } = \frac{\sum _{i=1}^n X_i}{\lambda } - n, \] откуда \[ \operatorname {Var}_{\lambda }\left[\frac{\partial \ell (\lambda )}{\partial \lambda }\right] = \frac{\sum _{i=1}^n \operatorname {Var}_{\lambda }\left[X_i\right]}{\lambda ^2} = \frac{n\lambda }{\lambda ^2} = \frac{n}{\lambda }. \] По теореме, асимптотическая дисперсия \(\widehat{\lambda }_{\operatorname {MLE}}\) равна \(n \cdot \left(\frac{n}{\lambda }\right)^{-1} = \lambda\). Убедиться в этом можно и напрямую: поскольку \(\widehat{\lambda }_{\operatorname {MLE}} = \overline{X}\) (см. метод моментов для пуассоновского распределения), по ЦПТ \[ \sqrt{n}\left(\overline{X} - \lambda \right) \xrightarrow [n \to \infty ]{d} \mathscr {N}\left(0, \operatorname {Var}\left[X_1\right]\right) = \mathscr {N}\left(0, \lambda \right), \] что в точности совпадает с ответом, полученным по общей теореме.

AnswerОтвет

Асимптотическая дисперсия равна \(\lambda\).

ProblemЗадача 9

Пусть \(X_1, \ldots , X_n\) – выборка из распределения \(U[0, \theta ], \; \theta > 0\), причем \(n \geq 2\). Найдите несмещённую оценку параметра \(\frac{1}{\theta }\).

3 Метод выборочных квантилей

Определение 1 Пусть \(\mathbf{P}\) – некоторое распределение, \(F\) – его функция распределения. Будем считать

\[ F: \mathbb {R} \cup \left\{ -\infty , +\infty \right\} \to [0,1] \]

Пусть, кроме того, \(p \in [0,1]\). Квантильной функцией распределения \(\mathbf{P}\) называют обобщенную обратную функцию к \(F\):

\[ Q: [0,1] \to \mathbb {R} \cup \left\{ -\infty , +\infty \right\} , \qquad Q(p) := \inf \{ x: F(x) \geq p\} \]

\(Q(p)\) еще называют квантилью уровня \(p \in [0,1]\).

Медианой распределения \(F\) называется квантиль уровня \(\frac{1}{2}\), т.е. значение \(Q(0.5)\).

Если \(F\) биективна, т.е. возрастает строго и не имеет разрывов, то квантильная функция – это просто обратная функция к \(F\): \(Q = F^{-1}\). В общем же случае у \(F\) могут быть скачки и участки постоянства, и «обобщенность» обратной функции ровно в том, как \(Q\) с ними обращается:

Квантильная функция как обобщённая обратная

Слева — функция распределения \(F(x)\) со скачком в \(x=2\) и плато на \([4,5]\). Справа — квантильная функция \(Q(p) = \inf\{x : F(x) \geq p\}\) (те же оси, повёрнутые: по вертикали везде уровень \(p\)). Двигайте ползунок или нажимайте кнопки — красная точка на обоих графиках показывает пару \((Q(p), p)\).

\(F(x)\)
\(Q(p) = \inf\{x : F(x) \geq p\}\)
0.50 Q(p) = 2.00

Определение 2 Пусть \(X_{1}, \ldots , X_{n}\) – выборка из неизвестного распределения \(\mathbb {P}\). Статистику \[ \widehat{Q}(p) := X_{(\lceil np \rceil )} = \begin{cases} X_{([n p]+1)}, & \text{ если } n p \notin \mathbb {Z} \\ X_{(n p)}, & \text{ если } n p \in \mathbb {Z}\end{cases} \] называют выборочной \(p\)-квантилью.

Определение 3 Выборочной медианой выборки \(X_{1}, \ldots X_{n}\) называют либо статистику \[ \widehat{\mu } := \widehat{Q}(0.5) = \begin{cases} X_{(k+1)}, & \text{ если } n=2 k+1 \\ X_{(k)}, & \text{ если } n=2 k\end{cases} \] либо \[ \widehat{\mu } := \begin{cases} X_{(k+1)}, & \text{ если } n=2 k+1 \\ \frac{X_{(k)}+X_{(k+1)}}{2}, & \text{ если } n=2 k\end{cases} \]

Определения выборочной медианы слегка отличаются, если \(n\) четно. В первом случае мы берем левое значение из 2-х центральных, а во втором полусумму 2-х центральных. Мы в основном будем пользоваться вторым способом, хотя разницы между ними практически нет, особенно с точки зрения асимптотических свойств.

Теорема 3 (об асимптотической нормальности выборочной квантили) Пусть \(X_{1}, \ldots X_{n}\) – выборка из абсолютно непрерывного одномерного распределения \(\mathbb {P}\) с плотностью \(f\). Пусть \(p \in (0,1)\) и \(Q(p)\) – это \(p\)-квантиль распределения \(\mathbb {P}\), причём функция \(f\) непрерывно дифференцируема в некоторой окрестности точки \(Q(p)\) и \(f\left(Q(p)\right)>0\). Тогда \(\widehat{Q}(p)\) – асимптотически нормальная оценка \(Q(p)\) с ас. дисперсией \(\frac{p(1-p)}{f^{2}\left(Q(p)\right)}\): \[ \sqrt{n} \left(\widehat{Q}(p) - Q(p)\right) \xrightarrow [n\to \infty ]{d} \mathcal{N}\left(0, \frac{p(1-p)}{f^{2}\left(Q(p)\right)}\right) \]

В частности, для медианы (\(p = \frac12\)) асимптотическая дисперсия равна \(\frac{1}{4f^2\left(Q(0.5)\right)}\).

Асимптотическое поведение \(\widehat{\mu }\) совпадает с поведением \(\widehat{Q}(0.5)\), вне зависимости от способа задания \(\widehat{\mu }\).

ExampleПример 7

Пусть \(X_{1}, \ldots , X_{n}\) – выборка из \(\operatorname {Cauchy}(\theta , 1)\). Найдите асимптотически нормальную оценку параметра \(\theta\) и ее асимптотическую дисперсию.

SolutionРешение

Плотность:

\[ f_{\theta }(x)=\frac{1}{\pi \left(1+(x-\theta )^{2}\right)} \]

Так как у случайной величины с таким распределением нет конечного математического ожидания, то воспользоваться центральной предельной теоремой нам не удастся.

Воспользуемся выборочной медианой. \(Q(0.5)=\theta\), поэтому, по теореме об асимптотической нормальности выборочной медианы, \(\hat{\mu }\) – асимптотически нормальная оценка \(\theta\) с асимптотической дисперсией

\[ \frac{1}{4 f_{\theta }^{2}(\theta )}=\frac{\pi ^{2}}{4} \]

Переключайте распределение, двигайте ползунок (N), чтобы посмотреть на траектории при разном объёме выборки, или нажмите кнопку, чтобы перегенерировать выборку заново.

Выборочное среднее и выборочная медиана: устойчивость к тяжёлым хвостам

Одна реализация выборки, \(\theta = 0\). У Коши среднее время от времени совершает крупные скачки и не сходится, медиана — сходится всегда.

1
\(n =\) \(\bar X_n =\) медиана \(=\)
ProblemЗадача 10

Предложите асимптотически нормальную оценку параметра \(\theta^2\) в модели распределения Коши \(\operatorname {Cauchy}(\theta , 1)\) со сдвигом \(\theta\) (см. предыдущую задачу), а также найдите её асимптотическую дисперсию.

использованная литература

Ивченко, Г. И., и Ю. И. Медведев. 2010 г. Введение в математическую статистику. ЛКИ. https://disk.yandex.ru/i/CwMvHKeSVCbYHA.