Байесовские оценки

1 Частотный и байесовский подходы к оцениванию параметров

До этого момента при оценивании параметра \(\theta\) мы предполагали, что он является хоть и неизвестной, но константной величиной из некоторого множества \(\Theta\). В этом заключается частотный подход к параметрическому оцениванию в статистике. При таком подходе мы не предполагали никаких изначальных различий между возможными значениями параметра из множества \(\Theta\). На практике у исследователя зачастую есть некоторая информация о параметре до проведения самого эксперимента.

Представим, что у нас есть монетка, и мы хотим оценить, насколько она честная, т.е. хотим оценить вероятность выпадения орла. Для получения оценки вероятности проводится эксперимент: исследователь подкидывает монетку несколько раз, и затем анализирует результаты. На языке математической статистики можно сказать, что у нас есть выборка \(X_1, \ldots , X_n\) из распределения Бернулли \(\operatorname {Ber}(\theta )\) с неизвестным параметром \(0 < \theta < 1\). В частотном подходе мы бы считали, что \(\theta \in \Theta = (0,1)\), т.е. перед опытом мы считаем, что \(\theta\) может быть как \(0.5\), так и \(0.00001\), никакой разницы между возможными значениями параметра для нас до опыта нет. Но ясно, что если мы держим в руках обычную монетку со здачи в магазине, отчеканенную каким-то государством исключительно чтобы быть платежным средством, а не для того, чтобы быть инструментом в руках жулика, то ее вероятность выпадения орла \(\theta\) приблизительно равна \(0.5\) и не может сильно отклоняться от этого значения. В данном случае у нас есть некоторое предположение, знание о параметре перед экспериментом. Такое знание называют априорным (от лат. a priori, букв. — «от предшествующего»). При такой постановке вопроса цель исследования – обновить знание, пересмотреть его с учетом результатов эксперимента. На философском языке из априорного знания получить апостериорное знание (от лат. a posteriori, букв. — «от последующего»).

Как математически формализовать априорную и апостериорную информации о параметре? Можно представить, что \(\theta\) – это случайная величина, заданная на том же пространстве, что и выборка \(X\), с некоторым заранее заданным распределением \(\operatorname {Law}\left(\theta \right) = \mathbb {Q}\) на параметрическом множестве \(\Theta\), отвечающем нашему априорному знанию, и называемым априорным распределением. Если выборка \(X\) принимает значения в \(\mathcal{X}\) (обычно \(\mathcal{X}\) – это \(\mathbb {Z}_+^n\) или \(\mathbb {R}^{n}\)), а \(\theta\) в \(\Theta\), то \((X,\theta )\) можно представить как случайный элемент со значениями в пространстве

\[ (\mathcal{X} \times \Theta , \mathscr {B}\left(\mathcal{X}\right) \otimes \mathscr {B}\left(\Theta \right), \tilde{\mathbb {P}}), \]

причем \(\mathbb {Q}(A) = \tilde{\mathbb {P}}(\mathcal{X}, A)\).

В примере с монеткой логично было бы взять в качестве априорного распределения \(\mathbb {Q}\) некоторое распределение на \([0,1]\), которое было бы непрерывным и симметричным относительно \(0.5\) (с матожиданием \(0.5\) соотв.). Самое удобное распределение такого вида – это бета распределение \(B(\alpha , \alpha ), \; \alpha > 0\)1. В этом случае \(\operatorname {Var}\left[\theta \right] = \frac{1}{4(2\alpha + 1)}\), и чем сильнее мы изначально уверены в слабом отклонении \(\theta\) от \(\frac{1}{2}\), тем большим можно брать априорное значение \(\alpha\).

Если \(\theta\) – это случайная величина, то выборка \(X = (X_1, \ldots , X_n)\) из распределения \(\mathbb {P}_\theta = \operatorname {Ber}(\theta )\) в таком подходе – это набор условно по \(\theta\) независимых случайных величин с условным по \(\theta\) распределением \(\mathbb {P}_\theta = \operatorname {Ber}(\theta )\):

\[ \operatorname {Law}\left(X \mid \theta \right) = \mathbb {P}_\theta \otimes \ldots \otimes \mathbb {P}_\theta = \left(\mathbb {P}_\theta \right)^{\otimes n} = \left(\operatorname {Ber}(\theta )\right)^{\otimes {n}} \]

Как и в случае с частотным подходом, для простоты записи распределение \(\left(\mathbb {P}_\theta \right)^{\otimes n}\) удобно обозначать просто как \(\mathbb {P}_\theta\).

Цель исследования – обновить знание о распределении параметра \(\theta\) при помощи выборки \(X\). На математическом языке это означает перейти от априорного, безусловного распределения \(\operatorname {Law}\left(\theta \right) = \mathbb {Q}\) параметра \(\theta\) к распределению, которое учитывает выборку, к условному распределению \(\operatorname {Law}\left(\theta \mid X\right)\). Распределение \(\operatorname {Law}\left(\theta \mid X\right)\) называют апостериорным распределением.

2 Как получить апостериорное распределение

2.1 Формула Байеса для плотности

Как найти апостериорное распределение \(\operatorname {Law}\left(\theta \mid X\right)\)? Как правило, распределение \(\theta\) на \(\Theta\) и условное по \(\theta\) распределение \(\mathbb {P}_\theta\) выборки \(X\) на \(\mathcal{X}\) абсолютно непрерывны (доминируемы) относительно каких-то мер \(\mu_\Theta , \mu_{\mathcal{X}}\) на \(\Theta\) и на \(\mathcal{X}\) и благодаря этому обладают плотностями \(q(t)\), \(p_{X | \theta }(x|t)\). Два самых распространенных варианта доминирующих мер и пространств, на которых они заданы: мера Лебега \(\lambda\) на \(\mathbb {R}\) (\(\lambda^n\) на \(\mathbb {R}^{n}\)) и считающая мера \(\#\) на \(\mathbb {Z}\) (\(\#^n\) на \(\mathbb {Z}^n\)). В таком случае совместное распределение \((X,\theta )\) на пространстве \(\mathcal{X} \otimes \Theta\) доминируемо произведением мер \(\mu_{\mathcal{X}} \otimes \mu_\Theta\), а задача нахождения \(\operatorname {Law}\left(\theta \mid X\right)\) сводится к задаче нахождения условной плотности \(p_{\theta | X}(t | x)\). Напомним, что условная плотность равна совместной плотности, поделенной на плотность компоненты, по которой берется условие. Последнюю называют маргинальной плотностью соотв. компоненты (англ. margin — «край», «грань»). Имеем

\[ p_{\theta | X}(t | x) = \frac{p_{(X, \theta )}(x, t)}{p_X(x)} \]

При этом по тому же определению

\[ p_{(X, \theta )}(x, t) = p_{X | \theta }(x|t) p_{\theta }(t) = p_{X | \theta }(x|t) q(t). \]

Маргинальную плотность можно вычислить, проинтегрировав совместную плотность по остальным компонентам:

\[ p_X(x) = \int _{\Theta } p_{(X, \theta )}(x, t) \mu _\Theta (dt). \]

В итоге приходим к формуле

\[ p_{\theta | X}(t | x) = \frac{p_{X | \theta }(x|t) q(t)}{\int _{\Theta } p_{X | \theta }(x|t) q(t) \mu _\Theta (dt) }, \]

которая является аналогом формулы Байеса для плотностей. Заметим, что (условную) плотность выборки \(p_{X|\theta }(x|t)\) так же, как и в частотном подходе, называют функцией правдоподобия.

ExampleПример 1

Пусть \(X_1, \ldots , X_n\) – выборка из \(\operatorname {Ber}(\theta )\), причем априорное распределение \(\theta\) равно \(\operatorname {Law}\left(\theta \right) = B(\alpha , \alpha ), \; \alpha > 0\). Найти апостериорное распределение \(\theta\).

В данном случае \(\mathcal{X} = \left\{ 0,1\right\}^n, \mu_{\mathcal{X}} = \#^n, \; \Theta = [0,1], \mu_\Theta = \lambda\). Априорная плотность: \[ q(t) = \frac{1}{B(\alpha , \alpha )}t^{\alpha - 1}(1-t)^{\alpha - 1}. \] Функция правдоподобия: \[ p_{X|\theta }(x|t) = \prod _{i=1}^n p_{X_i|\theta }(x_i | t) = \prod _{i=1}^n t^{x_i}(1-t)^{1-x_i} = t^{n\overline{x}}(1-t)^{n-n\overline{x}} \] Найдем совместное распределение выборки и параметра \((X,\theta )\) на пространстве \(\left\{ 0,1\right\}^n \times [0,1]\). Поскольку оно доминируемо произведением мер \(\#^n \otimes \lambda\), найдем их совместную плотность относительно этого произведения: \[ p_{X,\theta }(x, t) = p_{X|\theta }(x|\theta ) \cdot q(t) = \frac{1}{B(\alpha , \alpha )} t^{\alpha + n\overline{x} - 1} (1-t)^{\alpha + n(1-\overline{x}) - 1} \] Найдем маргинальную (безусловную) плотность выборки \(X\): \[ p_X(x) = \int _{\Theta } p_{(X, \theta )}(x, t) \mu _\Theta (dt) = \int _0^1 \frac{1}{B(\alpha , \alpha )} t^{\alpha + n\overline{x} - 1} (1-t)^{\alpha + n(1-\overline{x}) - 1} dt = \frac{B(\alpha + n\overline{x}, \alpha + n(1-\overline{x}))}{B(\alpha , \alpha )} \] Найдем наконец апостериорную (условную) плотность \(\theta\) по \(X\): \[ p_{\theta | X}(t | x) = \frac{p_{X,\theta }(x, t)}{p_X(x)} = \frac{1}{B(\alpha + n\overline{x}, \alpha + n(1-\overline{x}))}t^{\alpha + n\overline{x} - 1} (1-t)^{\alpha + n(1-\overline{x}) - 1} \] Таким образом, условное распределение \(\theta \mid X\) – это тоже бета-распределение, только с другими параметрами: \[ \operatorname {Law}\left(\theta \mid X\right) = B(\alpha + \overline{X}, \alpha + n(1 - \overline{X})) \]

\(B(\alpha + \overline{X}, \alpha + n(1 - \overline{X}))\)

2.2 Использование пропорциональности

Если носитель плотности и доминирующая мера известены, то характер плотности \(p(t)\) определяется только теми множителями, где присутствует \(t\). Остальные множители играют лишь роль нормирующих констант. Например, гамма-распределение \(\Gamma (\alpha , \lambda )\) задано на \(\mathbb {R}_+\), доминируется мерой Лебега и имеет плотность

\[ p_{\Gamma (\alpha , \lambda )}(t) = \frac{\lambda ^\alpha }{\Gamma (\alpha )}t^{\alpha - 1}e^{-\lambda t}. \]

Учитывая известный носитель и доминирующую меру, эта плотность задается лишь \(t^{\alpha - 1}e^{-\lambda t}\). Множитель \(\frac{\lambda^\alpha }{\Gamma (\alpha )}\) нормирует плотность, однозначно задается так, чтобы \(\int_0^\infty p_{\Gamma (\alpha , \lambda )}(t) dt = 1\):

\[ \frac{\lambda ^\alpha }{\Gamma (\alpha )} = \frac{1}{\int _0^\infty t^{\alpha - 1}e^{-\lambda t} dt} \]

В примере @Bayes:CoinExample для апостериорной плотности \(p_{\theta | X}(t | x)\) роль нормирующей константы играл множитель \(\frac{1}{B(\alpha + n\overline{x}, \alpha + n(1-\overline{x}))}\). Мы знали, что апостериорное распределение \(\operatorname {Law}\left(\theta \mid X\right)\) задано на том же множестве и доминируется той же мерой, что и априорное распределение \(\operatorname {Law}\left(\theta \right)\): на \([0,1]\) и мерой Лебега. Чтобы понять, что \(p_{\theta | X}(t | x)\) – это плотность бета-распределения с параметрами \(\alpha + \overline{X}, \alpha + n(1 - \overline{X})\), нам в принципе можно было только посчитать \(t^{\alpha + n\overline{x} - 1} (1-t)^{\alpha + n(1-\overline{x}) - 1}\). В этой связи при нахождении апостериорного распределения удобно использовать значок пропорциональности “\(\propto\)”:

\[ f_1(t) \; \propto \; f_2(t) \stackrel{\text{def}}{\iff } \; \exists c \in \mathbb {R}\setminus \left\{ 0\right\} : f_1(t) = c f_2(t) \]

Плотности гамма-распределения и бета-распределения можно переписать так:

\[ p_{\Gamma (\alpha , \lambda )}(t) \; \propto \; t^{\alpha - 1}e^{-\lambda t}, \qquad p_{B(\alpha , \beta )}(t) \; \propto \; t^{\alpha - 1}(1-t)^{\beta - 1} \]

Формулу Байеса можно переписать так:

\[ p_{\theta | X}(t | x) = \frac{p_{X | \theta }(x|t) q(t)}{\int _{\Theta } p_{X | \theta }(x|t) q(t) \mu _\Theta (dt) } \; \propto \; p_{X | \theta }(x|t) q(t), \]

поскольку знаменатель \(\int_{\Theta } p_{X | \theta }(x|t) q(t) \mu_\Theta (dt)\) не зависит от \(t\) и играет роль нормирующей константы.

:::{.callout-example #expl-cstm7.1, сокращенное решение} Number: 7.1, сокращенное решение

Пусть \(X_1, \ldots , X_n\) – выборка из \(\operatorname {Ber}(\theta )\), причем априорное распределение \(\theta\) равно \(\operatorname {Law}\left(\theta \right) = B(\alpha , \alpha ), \; \alpha > 0\). Найти апостериорное распределение \(\theta\).

Имеем

\[ \begin{align} q(t) \; & \propto \; t^{\alpha - 1}(1-t)^{\alpha - 1} \\ p_{X|\theta }(x|t) \; & \propto \; t^{n\overline{x}}(1-t)^{n-n\overline{x}} \\ p_{\theta | X}(t | x) \; & \propto \; p_{X|\theta }(x|t) q(t) \; \propto \; t^{\alpha + n\overline{x} - 1}(1-t)^{\alpha + n-n\overline{x} - 1} \end{align} \] Носитель распределения \(\theta \mid X\) такой же, как и у \(\theta\), т.е. \([0,1]\). Доминирующая мера прежняя – мера Лебега. Следовательно, \(\operatorname {Law}\left(\theta \mid X\right) = B(\alpha + n\overline{X}, \alpha + n(1 - \overline{X}))\).

\(B(\alpha + n\overline{X}, \alpha + n(1 - \overline{X}))\)

:::

ProblemЗадача 1

Пусть \(X_1, \dots , X_n\) – выборка из нормального распределения с параметрами \((\theta ,1)\). Найдите апостериорное распределение параметра \(\theta\), если априорное распределение \(\theta\) есть \(\mathscr {N}\left(b, \sigma^2\right)\).

ProblemЗадача 2

Пусть \(X_1, \ldots , X_n\) – выборка из распределения \(U[0,\theta ]\). Найдите апостериорное распределение параметра \(\theta\), если \(\theta\) имеет априорное распределение

  1. \(U[0,1]\);

  2. с плотностью \(q(t) = \frac{1}{t^2} \; \mathbb {1}_{t \geq 1}\).

3 Оценки и их сравнение в байесовском подходе

3.1 Оценивание в байесовском подходе

Пусть требуется оценить параметр \(\theta\). Если исследование еще не состоялось и у нас есть пока только априорное (безусловное) распределение \(\theta\), то наиболее логичная оценка \(\theta\) получится, если взять матожидание \(\mathbb {E}\left[\theta \right] = \int_\Theta t \mathbb {Q}(dt)\) по априорному распределению (предполагаем, что матожидание существует). Действуя аналогично после проведения опыта и получения апостериорного распределения, наиболее разумным выглядит оценивание \(\theta\) (условным) матожиданием по апостериорному, условному распределению \(\operatorname {Law}\left(\theta | X\right)\):

\[ \theta ^* = \theta ^*(X) := \mathbb {E}\left[\theta \mid X\right] = \int _\Theta t \; \cdot \operatorname {Law}\left(\theta | X\right)(dt) \]

Такая оценка называется байесовской оценкой.

Если распределения \(\theta\) и \(X\) доминируемы и \(q(t)\), \(p_{X|\theta }(x|t)\) – плотность \(\theta\) и условная плотность (функция правдоподобия) \(X\), то байесовскую оценку можно найти в 2 этапа:

  1. найти функцию \(\varphi (x) := \mathbb {E}\left[\theta \mid X = x\right] = \int_\Theta t \cdot p_{\theta | X}(t|x) \mu_\Theta (dt)\);

  2. подставить \(X\) в \(\varphi\): \(\theta^* = \mathbb {E}\left[\theta \mid X\right] = \varphi (X)\).

Как найти апостериорную плотность \(p_{\theta | X}(t|x)\) мы обсуждали выше.

ExampleПример 2

Пусть \(X_1, \ldots , X_n\) – выборка из \(\operatorname {Ber}(\theta )\), причем априорное распределение \(\theta\) равно \(\operatorname {Law}\left(\theta \right) = B(\alpha , \alpha ), \; \alpha > 0\). Найти байесовскую оценку \(\theta\).

Имеем

\[ \begin{align} p_{\theta | X}(t | x) & = \frac{1}{B(\alpha + n\overline{x}, \alpha + n(1-\overline{x}))}t^{\alpha + n\overline{x} - 1} (1-t)^{\alpha + n(1-\overline{x}) - 1} \\ \varphi (x) & = \mathbb {E}\left[\theta \mid X = x\right] = \int _0^1 t \frac{1}{B(\alpha + n\overline{x}, \alpha + n(1-\overline{x}))}t^{\alpha + n\overline{x} - 1} (1-t)^{\alpha + n(1-\overline{x}) - 1} dt = \\ & = \frac{B(\alpha + n\overline{x} + 1, \alpha + n(1-\overline{x}))}{B(\alpha + n\overline{x}, \alpha + n(1-\overline{x}))} = \frac{\alpha + n\overline{x}}{2 \alpha + n} \end{align} \] Последнее равенство получено, исходя из свойств бета-функции. Итого,

\[ \mathbb {E}\left[\theta \mid X\right] = \varphi (X) = \frac{\alpha + n\overline{X}}{2\alpha + n} \] Заметим, что решить задачу можно было проще. Нам известно, что \(\theta \mid X \sim B(\alpha + n\overline{X}, \alpha + n(1 - \overline{X}))\). При этом известно, что матожидание бета-распределения \(B(\gamma_1, \gamma_2)\) равно \(\frac{\gamma_1}{\gamma_1 + \gamma_2}\). Значит

\[ \mathbb {E}\left[\theta \mid X\right] = \frac{\alpha + n\overline{X}}{2\alpha + n} \]

\(\frac{\alpha + n\overline{X}}{2\alpha + n}\).

ProblemЗадача 3

Пусть \(X_1, \dots , X_n\) – выборка из нормального распределения с параметрами \((\theta ,1)\). Найдите байесовскую оценку параметра \(\theta\), если априорное распределение \(\theta\) есть \(\mathscr {N}\left(b, \sigma^2\right)\).

ProblemЗадача 4

Пусть \(X_1, \ldots , X_n\) – выборка из распределения \(U[0,\theta ]\). Найдите байесовскую оценку параметра \(\theta\), если \(\theta\) имеет априорное распределение

  1. \(U[0,1]\);

  2. с плотностью \(q(t) = \frac{1}{t^2} \; \mathbb {1}_{t \geq 1}\).

3.2 Состоятельность оценок

Как и в частотном подходе, в байесовском подходе оценка \(\widehat{\theta }\) является состоятельной оценкой \(\theta\), если \(\widehat{\theta } \xrightarrow [n \to \infty ]{\mathbb {P}} \theta\). Разница состоит в том, что \(\theta\) в данном случае – это не константа, а случайная величина. Сходимость по вероятности к случайной величине не равносильна сходимости по распределению. Нельзя сводить состоятельность к сходимости по распределению. Можно лишь при помощи отсутствия сходимости по распределению доказывать отсутствие состоятельности.

Условный закон больших чисел может помочь доказать состоятельность.

Теорема 1 (Условный закон больших чисел) Пусть \(X_1, X_2, \dots\) – последовательность случайных величин, которые имеют независимые одинаковые распределения условно относительно сл. вел. \(\theta\). Пусть \(\mu (\theta ) := \mathbb {E}\left[X_i | \theta \right], \; \sigma^2(\theta ) := \operatorname {Var}\left[X_i | \theta \right]\) и пусть \(\sigma^2(\theta )\) интегрируема, т.е. \(\mathbb {E}\left[\sigma^2(\theta )\right] < \infty\). Тогда \[ \begin{align} \overline{X} \xrightarrow [n \to \infty ]{\mathbb {P}} \mu (\theta ) \end{align} \]

ExampleПример 3

Исследуйте оценку из примера @Bayes:BernExmpl на состоятельность.

Имеем \(\mathbb {E}\left[X_1 \mid \theta \right] = \theta , \; \sigma^2(\theta ) = \operatorname {Var}\left[X_1 \mid \theta \right] = \theta (1-\theta )\). При этом

\[ \mathbb {E}\left[\sigma ^2(\theta )\right] = \mathbb {E}\left[\theta (1-\theta )\right] = \int _0^1 t(1-t) t^{\alpha - 1}(1-t)^{\alpha - 1}dt = B(\alpha + 1, \beta + 1) < \infty \] Следовательно, по условному ЗБЧ, \(\overline{X} \xrightarrow [n \to \infty ]{\tilde{\mathbb {P}}} \theta\).

Далее, \(\frac{\alpha }{n} \xrightarrow [n \to \infty ]{} 0\), следовательно, по теореме о наследовании сходимостей,

\[ \theta ^* = \mathbb {E}\left[\theta \mid X\right] = \frac{\frac{\alpha }{n} + \overline{X}}{2\frac{\alpha }{n} + 1} \xrightarrow [n \to \infty ]{\tilde{\mathbb {P}}} \theta \]

Состоятельна.

ProblemЗадача 5

Пусть \(X_1, \dots , X_n \sim \mathscr {N}\left(\theta , 1\right), \; \theta \sim \mathscr {N}\left(b, \sigma^2\right)\). Проверьте байесовскую оценку \(\theta^*\) параметра \(\theta\) на состоятельность

ProblemЗадача 6

Пусть \(X_1, \ldots , X_n\) – выборка из распределения \(U[0,\theta ]\). Проверьте байесовскую байесовскую оценку \(\theta^*\) параметра \(\theta\) на состоятельность, если \(\theta\) имеет априорное распределение

  1. \(U[0,1]\);

  2. с плотностью \(q(t) = \frac{1}{t^2} \; \mathbb {1}_{t \geq 1}\). *Примечание.** Каждый пункт оценивается в 2 балла.

ProblemЗадача 7

Докажите условный закон больших чисел.

3.3 Сравнение оценок

Поговорим о сравнении оценок в байесовском подходе. О сравнении оценок мы уже говорили и использовали для этого равномерный подход с квадратичной функцией потерь. При таком подходе одна оценка считается лучше другой, если дисперсия первой не больше дисперсии второй для любого значения параметра. Разумеется, если мы обладаем некоторыми априорными знаниями о значении параметра, то мы можем ослабить “требование наилучшести”, сравнив только усредненные значения дисперсий.

Определение 1 Пусть \(\theta^{*} = \theta^{*}(X), \widehat{\theta } = \widehat{\theta }(X)\) – две оценки случайного параметра \(\theta\). Говорят, что оценка \(\theta^{*}\) лучше оценки \(\widehat{\theta }\) в байесовском подходе с функцией потерь \(g(\cdot , \cdot )\), если

\[ \label{Bayes:BestEstim1} \int _{\mathcal{X} \times \Theta } g\left(\theta ^*(x), t\right) \cdot \tilde{\mathbb {P}}(dx, dt) = \mathbb {E}\left[g(\theta ^*, \theta )\right] < \mathbb {E}\left[g(\widehat{\theta }, \theta )\right] = \int _{\mathcal{X} \times \Theta } g\left(\widehat{\theta }(x), t\right) \cdot \tilde{\mathbb {P}}(dx, dt) \] Заметим, что матожидание берется в пространстве \((\mathcal{X} \times \Theta , \mathscr {B}\left(\mathcal{X}\right) \otimes \mathscr {B}\left(\Theta \right), \tilde{\mathbb {P}})\) – том пространстве, в котором заданы выборка и параметр \((X,\theta )\). Учитывая, что \(\tilde{\mathbb {P}}(dx, dt)\) – это произведение априорного распределения \(\mathbb {Q}\) и распределения выборки \(\mathbb {P}_\theta\):

\[ \tilde{\mathbb {P}}(dx,dt) = \mathbb {Q}(dt) \cdot \mathbb {P}_t(dx), \] формлу Определение 1 можно переписать как

\[ \label{Bayes:BestEstim2} \int _\Theta \mathbb {E}_{t}\left[g(\theta ^*, t)\right] \mathbb {Q}(dt) < \int _\Theta \mathbb {E}_{t}\left[g(\widehat{\theta }, t)\right] \mathbb {Q}(dt), \] где \(\mathbb {E}_{t}\left[\cdot \right] = \mathbb {E}\left[\cdot \mid \theta = t\right]\) – матожидание, которое берется по (условному) распределению выборки \(\operatorname {Law}\left(X\mid \theta = t\right) = \mathbb {P}_t\).

Следующая теорема — прямое следствие свойств условного матожидания.

Теорема 2 Байесовская оценка – наилучшая оценка \(\theta\) в байесовском подходе с квадратичной функцией потерь.

ExampleПример 4

Найдите байесовскую оценку параметра \(\theta\) по выборке \(X = (X_{1}, \ldots , X_{n})\) из равномерного распределения \(U[\theta , \theta +1]\), если априорное распределение \(\theta\) равно \(\mathbb {Q} = \operatorname {Pois}(1)\). Является ли полученная оценка состоятельной оценкой параметра \(\theta\)?

Имеем \(q(t) = \frac{1}{t!}e^{-1}\). Функция правдоподобия – это условная плотность \(X\) по \(\theta\): \[ p_{X \mid \theta }(x \mid t) = \prod _{i=1}^n \; \mathbb {1}_{x_i \in [t, t + 1]} = \; \mathbb {1}_{t \leq x_{(1)}, \; x_{(n)} \leq t + 1} \] Положим \(X=\left(X_{1}, \ldots , X_{n}\right)\). Так как \(\mathbb {P}\left(0 \leq X_{(n)}-X_{(1)}<\right.\) 1) \(=1\), то имеем \[ \begin{align} p_{\theta | X}(t | x) \; \propto \; p_{X \mid \theta }(x \mid t) q(t) = \; \mathbb {1}_{t \leq x_{(1)}, \; x_{(n)} \leq t + 1}\frac{1}{t!} = \; \mathbb {1}_{[x_{(1)]} = t} \end{align} \] Теперь найдем байесовскую оценку: \[ \theta ^{*}= \mathbb {E}\left[\theta \mid X\right] = \sum _{t=0}^{\infty } t \; \mathbb {1}_{[ X_{(1)}] =t} = [ X_{(1)}] \] Проверим полученную оценку на состоятельность. Разумеется, \(\mathbb {P}\left(\left[ X_{(1)}\right]=\theta \right)=1\). Поэтому байесовская оценка является сильно состоятельной.

ProblemЗадача 8

Пусть \(X_1, \ldots , X_n\) – выборка из нормального распределения с параметрами \((\theta ,1)\). Найдите байесовскую оценку параметра \(\theta\), если априорное распределение \(\theta\) есть \(\operatorname {Ber}(p)\). Будет ли полученная оценка состоятельной оценкой параметра \(\theta\)?

4 Сопряженные распределения

В статистических задачах часто предполагается, что априорное распределение \(\mathbb {Q} = \operatorname {Law}\left(\theta \right)\) и апостериорное распределение \(\operatorname {Law}\left(\theta \mid X\right)\) принадлежат одному и тому же семейству распределений. В этом случае семейство распределений, которому принадлежит \(\mathbb {Q}\), называется сопряженным априорным распределением к семейству распределений выборки \(\mathcal{P} = \left\{ \mathbb {P}_\theta \right\}\). Разумеется, с произвольным семейством распределений \(\mathcal{P}\) выборки сопряжено семейство всех возможных распределений на \(\Theta\). Однако в некоторых моделях \(\mathcal{P}\) семейство сопряженных априорных распределений удается значительно сузить.

Рассмотрим пример @Bayes:CoinExample. В нем

\[ \operatorname {Law}\left(\theta \right) = B(\alpha , \alpha ), \qquad X_1, \ldots , X_n \text{ -- выборка из } \operatorname {Ber}(\theta ) \quad \; \Rightarrow \; \quad \operatorname {Law}\left(\theta \mid X\right) = B\left(\alpha + n\overline{X}, \alpha + n(1-\overline{X})\right). \]

Ясно, что в общем случае

\[ \operatorname {Law}\left(\theta \right) = B(\alpha , \beta ), \qquad X_1, \ldots , X_n \text{ -- выборка из } \operatorname {Ber}(\theta ) \quad \; \Rightarrow \; \quad \operatorname {Law}\left(\theta \mid X\right) = B\left(\alpha + n\overline{X}, \beta + n(1-\overline{X})\right). \]

Бета распределение \(B(\alpha , \beta )\) – сопряженное априорное распределение к \(\operatorname {Ber}(\theta )\).

ExampleПример 5

Найдите сопряженное априорное распределение к распределению выборки \(\operatorname {Exp}(\theta )\).

Заранее заметим, что параметр \(\theta\) должен быть неотрицательным, т.е. носитель сопряженного априорного распределения должен быть не больше \(\mathbb {R}_+ = [0 , +\infty )\).

Имеем \(X_i \mid \theta \sim \operatorname {Exp}(\lambda ), \; i \in \left\{ 1,\ldots , n\right\}\). Функция правдоподобия на \(\mathbb {R}^{n}_+\):

\[ p_{X|\theta }(x|t) = \prod _{i=1}^n te^{-tx_i} \; \mathbb {1}_{x_i \geq 0} = t^n e^{-tn\overline{x}} \] Требуется, чтобы \(\operatorname {Law}\left(\theta \right)\) и \(\operatorname {Law}\left(\theta \mid X\right)\) принадлежали к одному классу, т.е. чтобы априорная \(q(t)\) и апостериорная \(p_{\theta | X}(t | x)\) плотности были аналогичного вида. Апостериорная плотность:

\[ p_{\theta | X}(t | x) \; \propto \; p_{X|\theta }(x|t) q(t) = t^n e^{-tn\overline{x}}q(t) \] Априорную и апостериорную плотности связывает умножение на степенную и экспоненциальную функции \(t^n e^{-tn\overline{x}}\), с точностью до пропорциональности. Заметим, что если \(q(t)\) будет пропорциональна тем же функциям, произведению степенной и экспоненциальной, то и \(p_{\theta | X}(t | x)\) будет такого же вида:

\[ q(t) \; \propto \; t^{\alpha - 1}e^{-\lambda t} \quad \; \Rightarrow \; \quad p_{\theta | X}(t | x) \; \propto \; t^{n + \alpha - 1}e^{-(\lambda + n\overline{x}) t} \] Распределение, плотность которого пропорциональна \(t^{\alpha - 1}e^{-\lambda t}\), с носителем \(\mathbb {R}_+\), – это, например, гамма-распределение \(\Gamma (\alpha , \lambda )\).

Сопряженное априорное распределение: \(\operatorname {Law}\left(\theta \right) = \Gamma (\alpha , \lambda )\). Апостериорное распределение: \(\operatorname {Law}\left(\theta \mid X\right) = \Gamma (n + \alpha , \lambda + n\overline{X})\).

ExampleПример 6

Найдите байесовскую оценку параметра \(\theta\) по выборке \(X_{1}, \ldots , X_{n}\) из экспоненциального распределения с параметром \(\theta\), имеющим сопряженное априорное распределение.

Апостериорное распределение параметра \(\theta\): \(\operatorname {Law}\left(\theta \mid X\right) = \Gamma (n + \alpha , \lambda + n\overline{X})\). Известно, что если \(\xi \sim \Gamma (\beta_1, \beta_2)\), то \(\mathbb {E}\left[\xi \right] = \frac{\beta_1}{\beta_2}\). Тогда байесовская оценка параметра \(\theta\) равна \[ \theta ^* = \mathbb {E}\left[\theta \mid X\right] = \frac{n + \alpha }{\lambda + n\overline{X}} \]

ProblemЗадача 9

По выборке \(X_1, \ldots , X_n\) из пуассоновского распределения с параметром \(\theta\) найдите

  1. сопряженное априорное распределение для параметра \(\theta\);

  2. наилучшую оценку в байесовском подходе с квадратичной функцией потерь считая априорным распределение, найденное в предыдущем пункте. *Примечание.** Каждый пункт оценивается в 0.5 балла.

ProblemЗадача 10

Пусть \(X_1, \dots , X_n\) – выборка из распределения

  1. \(\mathscr {N}\left(\theta , 1\right)\);

  2. \(\mathscr {N}\left(0, \theta^2\right)\);

  3. \(\operatorname {Bin}(m,\theta )\), \(m \in \mathbb {N}\) – известное. Подберите сопряженное распределение для параметра \(\theta\) и найдите байесовскую оценку. *Примечание.** Пункты а), в) оцениваются в 0.5 балла. Пункт б) оценивается в 1 балл.

ProblemЗадача 11

Проверьте оценку из примера @Bayes:ExpGammaProblem на состоятельность. *Примечание.** Эта задача стоит 3 балла.

Сноски

  1. Напомним, что если \(\xi \sim B(\alpha , \beta ), \; \alpha , \beta > 0\), то плотность равна \[ \begin{align} p_\xi (x) & = \frac{1}{B(\alpha , \beta )} x^{\alpha - 1}(1-x)^{\beta - 1} \; \mathbb {1}_{x \in [0,1]}, \qquad B(\alpha , \beta ) = \int _0^1 t^{\alpha - 1}(1-t)^{\beta - 1}dt = \frac{\Gamma (\alpha )\Gamma (\beta )}{\Gamma (\alpha + \beta )}, \\ \mathbb {E}\left[\xi \right] & = \frac{\alpha }{\alpha + \beta }, \qquad \operatorname {Var}\left[\xi \right] =\frac{\alpha \beta }{(\alpha + \beta )^2 (\alpha + \beta + 1)}. \end{align} \] Если \(\beta = \alpha\), то \(\mathbb {E}\left[\xi \right] = \frac{1}{2}, \; \operatorname {Var}\left[\xi \right] = \frac{1}{4(2\alpha + 1)}\). Заметим, что \(B(1, 1) = U[0,1]\).↩︎