Введение. Статистики и оценки
Этот конспект ещё находится в процессе редактуры: в тексте могут встречаться опечатки, неточности и локально не проработанные места. Если что-то нашли — сообщите, пожалуйста, автору (контакты на странице курса).
1 Математическая статистика: введение
1.1 Теория вероятностей VS математическая статистика
В теории вероятностей мы предполагали, что нам известна природа некоторого явления, эксперимента (распределение случайной величины), и это знание позволяло нам изучать поведение различных производных величин. Имея распределение некоторой случайной величины \(\xi\), мы, например, находили распределение \(\xi^2\), находили, как зависят друг от друга матожидания, дисперсии, распределения для суммы зависимых/независимых случайных величин, и т.д. – то есть мы шли от известного распределения к свойствам и поведению связанных с ним величин.
В математической статистике все наоборот: данными являются результаты экспериментов (значения случайной величины), и требуется понять природу изучаемого явления (распределение величины).
Пусть \(\xi\) — случайная величина, принимающая значения в множестве \(\mathbb {R}\) и имеющая распределение \(\mathbb {P}\)1. Будем называть случайную величину \(\xi\) наблюдением. Одна из основных задач математической статистики, которой мы в основном и будем заниматься, состоит в следующем:
По набору наблюдений выяснить какую-либо информацию о распределении \(\mathbb{P}\), которое предполагается неизвестным.
Как правило, для выяснения природы изучаемого явления удается провести независимые эксперименты. Говоря математическим языком, восстановить распределение нужно по набору независимых наблюдений, который называется выборкой. Т.е. выборка – это вектор \(\left(X_{1}, \ldots , X_{n}\right)^T\) (или просто \(X_{1}, \ldots , X_{n}\)) составленный из независимых случайных величин, распределенных по \(\mathbb {P}\), т.е. так же, как и \(\xi\). Такой вектор принимает значения в множестве \(\mathbb {R}^{n}\), а его распределение \(\mathbb {P}^{n}\) задано на борелевской \(\sigma\)-алгебре \(\mathscr {B}\left(\mathbb {R}^{n}\right)\).
Есть несколько подходов к задаче оценки распределения. Рассмотрим основные.
1.2 Параметрический VS непараметрический подходы
В реальных экспериментах, как правило, перед проведением исследования удается несколько сузить возможные значения \(\mathbb {P}\), т.е. найти какое-то семейство распределений \(\mathcal{P}\), которому заведомо должно принадлежать \(\mathbb {P}\). Тройка \((\mathbb {R}, \mathcal{B}(\mathbb {R}), \mathcal{P})\) называется вероятностно-статистической моделью.
В параметрическом подходе мы предполагаем, что семейство распределений \(\mathcal{P}\), которому принадлежит наше неизвестное распределение \(\mathbb {P}\), состоит только из распределений, заданных каким-то параметром.
1.3 Частотный VS байесовский подходы
Вспомним, что в теории вероятностей существует несколько способов понимать слово «вероятность». Простой пример: вы подкинули монетку, она приземлилась вам на руку, но вы тут же закрыли её рукой. Какова вероятность, что выпал орёл?
Частотная интерпретация вероятности. Вероятность события – это предел относительной частоты его появления при неограниченном повторении одного и того же случайного эксперимента:
\[ \mathbb {P}(A) = \lim _{n \to \infty } \frac{\text{число успехов}}{n}. \]
Чтобы говорить о вероятности чего-либо, нужно представлять себе (хотя бы мысленно) серию повторений эксперимента. Поэтому вероятностные утверждения имеет смысл формулировать только для случайных, повторяемых событий.
В примере с монеткой «вероятность» с этой точки зрения смысла не имеет: монетка уже приземлилась вам на руку, она уже как-то выпала. Здесь нет повторяемости: вы откроете руку 1000 раз, и все 1000 раз увидите один и тот же результат (вы его, правда, ещё не знаете, но заведомо понятно, что он будет одним и тем же).
Когда в рамках частотного подхода говорят «у честной монетки вероятность выпадения орла равна \(\frac{1}{2}\)», имеется в виду, что если вы подкинете монетку 1000 раз, то примерно в половине случаев выпадет орёл.
Байесовская интерпретация вероятности. Вероятность – это степень уверенности (степень правдоподобия, степень доверия) в истинности некоторого утверждения, основанная на имеющейся информации. Такую вероятность можно приписывать любому утверждению, в том числе одноразовому, неповторяемому событию.
С точки зрения байесовского подхода вопрос о вероятности того, что уже подкинутая монета легла орлом или решкой, вполне имеет смысл: вы с вероятностью около \(1/2\) уверены, что выпал орёл.
Отсюда, кстати, любопытный вывод: обычный человек, не посвящённый в математические тонкости, на вопрос о вероятности орла у уже выпавшей монеты, скорее всего, уверенно ответит \(1/2\). Точно так же его не смутит вопрос «с какой вероятностью завтра будет дождь», хотя здесь никакой повторяемости нет и частотный подход неприменим. То есть обывательская интерпретация вероятности – по сути байесовская.
Ещё один любопытный момент: поскольку в байесовском подходе вероятность – это степень уверенности, её можно обновлять по мере поступления новой, даже косвенной, информации. Допустим, изначально (априори) у вас не было никакой информации о монете, и вы были уверены, что она честная. Тогда после подкидывания и закрытия рукой вероятность (степень уверенности) орла для вас равна \(\frac{1}{2}\). Далее вы можете не открывать руку, а попытаться на ощупь определить, что выпало. Допустим, вам кажется, что сверху вы чувствуете орла – тогда вероятность (степень уверенности) орла можно сдвинуть, скажем, до \(\frac{2}{3}\). Затем, допустим, выясняется, что монету вам одолжил товарищ, который говорит, что она нечестная и более склонна к выпадению решки. После этой новой информации вы можете снова обновить свою вероятность (степень уверенности), сдвинув её, скажем, до \(\frac{3}{8}\). Вероятность, полученная после учёта новой информации, называется апостериорной. И так далее: байесовский подход позволяет последовательно «обновлять» вероятности по мере поступления данных.
Рассмотрим разницу частотного и байесовского подходов на примере оценки параметра в параметрической модели. В частотном подходе параметр считается фиксированным, но неизвестным числом – он не случаен, и говорить о “вероятности того, что параметр лежит в каком-то фиксированном интервале” формально некорректно: либо параметр там лежит, либо нет. Случайность в этом подходе связана только с данными – с тем, что если повторить эксперимент много раз, выборка будет каждый раз получаться разной.
В байесовском подходе параметр сам объявляется случайной величиной. Это не означает, что эксперимент “на самом деле” каждый раз проводится с новым параметром – просто наше знание о параметре до и после эксперимента описывается распределением вероятностей. До того, как мы увидели данные, это знание выражается априорным распределением (от лат. a priori – “до опыта”) – это распределение, которое мы выбираем сами, исходя из того, что нам известно о параметре заранее (или из соображений удобства, если ничего не известно). После того как данные получены, априорное распределение пересчитывается в апостериорное (a posteriori – “после опыта”) по формуле Байеса – это и есть обновлённое знание о параметре с учётом наблюдений.
Мы в нашем курсе в основном будем заниматься параметрической частотной статистикой. Хотя непараметрические и байесовские методы мы тоже затронем.
Параметрическая статистика сводится к построению и исследованию оценок параметров, чем мы и будем заниматься на ближайших семинарах.
2 Статистики: определение, примеры
Пусть мы работаем с параметрической моделью, т.е. семейство распределений параметризовано как \(\mathcal{P}=\left\{ \mathbb {P}_{\theta }, \theta \in \Theta \right\}\). Как правило, параметр – это число или вектор (как, например, в случае нормального распределения, где \(\theta = (\mu , \sigma^2)^T\)), т.е. \(\Theta \subset \mathbb {R}\) (или \(\mathbb {R}^{k}\)), и в этом случае предполагается, что на \(\Theta\) задана борелевская сигма-алгебра \(\mathscr {B}\left(\Theta \right)\). Измеримое (\(\mathscr {B}\left(\mathbb {R}^{n}\right) \mid \mathscr {B}\left(\Theta \right)\)-измеримое) отображение \(S: \mathbb {R}^{n} \to \Theta\) называется оценкой параметра \(\theta\).
Как правило, оценка параметра \(\theta\) обозначается \(\widehat{\theta } = \widehat{\theta }(X)\). Заметим, что оценка параметра – случайная величина, поскольку она зависит от выборки, т.е. от случайных величин. При этом сам параметр – неслучайная константа, она просто нам не известна.
Итого, если \(X=\left(X_{1}, \ldots , X_{n}\right)\) – выборка, то статистикой \(S(X)\) называется измеримая функция от выборки. Оценкой параметра \(\theta \in \Theta\) называется такая статистика, которая принимает значения в \(\Theta\).
В случае параметрической модели задача отыскания “истинного” распределения сводится к нахождению “истинного” значения параметра. Для этого находится удачная (в каком-нибудь смысле) оценка параметра. В настоящей главе мы поговорим о том, какие оценки принято считать “удачными”.
Пусть \(X_{1}, \ldots , X_{n}\) – выборка из неизвестного распределения \(\mathbb {P}\).
Пусть \(g: \mathbb {R} \to \mathbb {R}\) – борелевская функция. Величина
\[ \overline{g(X)} = \frac{1}{n} \sum _{i=1}^{n} g(X_i) \]
называется выборочной характеристикой \(g(x)\). Например,
\[ \overline{X} := \frac{1}{n} \sum _{i=1}^{n} X_{i} \]
называется выборочным средним (здесь \(g\) – это тождественная функция), а
\[ \overline{X^k} := \frac{1}{n} \sum _{i=1}^{n} X_{i}^{k} \]
– выборочным \(k\)-ым моментом. Или, например, можно говорить о выборочном логарифме:
\[ \overline{\ln X} := \frac{1}{n} \sum _{i=1}^{n} \ln (X_{i}) \]
Пусть у неизвестного распределения \(\mathbb {P}\) (\(\xi \sim \mathbb {P}\)) есть дисперсия \(\sigma^2 := \operatorname {Var}\left[\xi \right]\), которую будем рассматривать как параметр. Как ее оценить? Напомним, что \(\operatorname {Var}\left[\xi \right] = \mathbb {E}\left[\xi^2\right] - \left(\mathbb {E}\left[\xi \right]\right)^2\). Статистика
\[ s^2 = \overline{X^2} - \left(\overline{X}\right)^2 \]
называется (смещенной) выборочной дисперсией. Почему эта статистика называется смещенной, станет понятно ниже.
Упорядочим значения выборки \(\left(X_{1}, \ldots , X_{n}\right)\) по возрастанию:
\[ X_{(1)} \leq X_{(2)} \leq \ldots \leq X_{(n)} \]
Полученная совокупность статистик называется вариационным рядом, а его член \(X_{(k)}\) – \(k\)-ой порядковой статистикой. В частности, \(X_{(1)}\) – это минимум:
\[ X_{(1)} = \min _{k \in \left\{ 1,\ldots ,n\right\} }X_k, \]
а \(X_{(n)}\) – это максимум выборки:
\[ X_{(n)} = \max _{k \in \left\{ 1,\ldots ,n\right\} }X_k, \]
Выборочной медианой называется статистика, которая делит вариационный ряд (отсортированную по возрастанию выборку) пополам:
\[ X_{\mathrm{med}} := \begin{cases} X_{(m+1)}, & n = 2m + 1 \\ \frac{1}{2}\left(X_{(m)} + X_{(m+1)}\right), & n = 2m \end{cases} \]
3 Свойства оценок
3.1 Неасимптотические свойства
Пусть \(X = (X_1, \ldots , X_n)\) – наблюдение из неизвестного распределения \(\mathbb {P} \in \left\{ \mathbb {P}_{\theta }, \theta \in \Theta \right\}\).
Следующая задача показывает, что далеко не для всех (сложных) параметров существуют несмещенные оценки.
3.2 Асимптотические свойства
В данном разделе мы предполагаем, что у нас имеется бесконечно большая выборка \(X_1, X_2, X_3, \ldots\) из неизвестного распределения \(\mathbb {P}\). Можно доказать, что существует вероятностное пространство \(\left(\mathbb {R}^{\infty }, \mathscr {B}\left(\mathbb {R}^{\infty }\right), \mathbb {P}^{\infty }\right)\), на котором можно задать бесконечную последовательность случайных величин \(X_{1}, X_{2}, \ldots\) (выборку бесконечного размера), распределенных так же, как и \(\xi\)3. Тем самым, на этом пространстве задана выборка любого размера \(n\). В дальнейшем мы для простоты обозначений будем писать \((\mathbb {R}, \mathscr {B}\left(\mathbb {R}\right), \mathbb {P})\) вместо \(\left(\mathbb {R}^{\infty }, \mathscr {B}\left(\mathbb {R}^{\infty }\right), \mathbb {P}^{\infty }\right)\) соответственно.
Пусть у нас есть последовательность оценок, построенных по одинаковому принципу, причем \(n\)-я оценка в последовательности зависит только от первых \(n\) элементов выборки: \(\widehat{\theta }_1 = \widehat{\theta }_1(X_1)\), \(\widehat{\theta }_2 = \widehat{\theta }_2(X_1,X_2)\), \(\ldots\),
\[ \widehat{\theta }_n = \widehat{\theta }_n(X_1, \ldots , X_n), \quad \ldots , \]
Например, выборочное среднее: \(\widehat{\theta }_n = \frac{1}{n}\sum_{k=1}^{n}X_k\). Или максимум: \(\widehat{\theta }_n = \max_{1 \leq k \leq n}X_k\). В таких случаях принято опускать зависимость от \(n\), и говорить просто об оценке \(\widehat{\theta }\).
Все определения выше переносятся и на случай, когда \(\theta\) – многомерный параметр. В этом случае в определении асимптотической нормальности асимптотическая дисперсия \(\sigma^2(\theta )\) заменяется на асимптотическую ковариационную матрицу \(\Sigma (\theta )\).
Основными инструментами доказательства того, что оценка является состоятельной или асимптотически нормальной, являются законы больших чисел, центральная предельная теорема, теорема о наследовании сходимостей, а также теорема о наследовании асимптотической нормальности, сформулированная ниже.
4 Выборка VS реализация выборки
Скажем пару слов о том, в чём состоит это отличие. Представьте, что вы проводите реальное исследование — например, собираете данные об интервалах между визитами клиентов. В реальной жизни вы получаете конкретные данные, конкретные числа. Числа — это, разумеется, не случайные величины. Так почему же математическая статистика работает именно со случайными величинами?
Суть в том, что мы рассуждаем как бы непосредственно перед проведением эксперимента. Эксперимент уже спланирован, и мы вот-вот пойдём собирать данные — но пока ещё не собрали. Для нас в этот момент данные неизвестны, то есть представляют собой случайные величины. И именно в этот момент мы хотим заранее понять, какими свойствами будут обладать наши будущие данные: будет ли, например, выборочное среднее хорошо приближать интересующий нас параметр (будет ли выполняться несмещенность, асимпт. свойства), и так далее.
Иными словами, математическая статистика работает с выборкой — набором случайных величин
\[ X_1, X_2, X_3, \ldots , X_n, \]
тогда как в результате реального эксперимента, то есть при фиксированном исходе \(\omega_0 \in \Omega\), эти случайные величины превращаются в конкретные числа — в реализацию выборки
\[ X_1(\omega _0), X_2(\omega _0), X_3(\omega _0), \ldots , X_n(\omega _0). \]
5 Популярные семейства распределений
Мы будем рассматривать два основных макросемейства (т.е. семейства семейств) моделей: групповые и экспоненциальные. Вместе они охватывают большую часть из распространенных статистических моделей.
5.1 Групповые семейства
Напомним, множество с операцией \((G, \cdot )\) называется группой, если
\(G\) замкнуто относительно операции: \(g_1 \cdot g_2 \in G\) для любых \(g_1, g_2 \in G\);
выполнена ассоциативность: \((g_1 \cdot g_2) \cdot g_3 = g_1 \cdot (g_2 \cdot g_3)\);
существует единица: в \(G\) есть элемент, обозначаемый \(e\) или \(\operatorname {id}\), такой что \(g \cdot e = e \cdot g = g\) для любого \(g \in G\);
у каждого элемента существует обратный: для любого элемента \(g \in G\) существует элемент в \(G\), обозначаемый \(g^{-1}\), такой что \(g \cdot g^{-1} = g^{-1} \cdot g = e\).
В статистике основной интерес представляют группы преобразований (с операцией композиции). Напомним, что преобразованием называется отображение множества в себя. Примеры
преобразования сдвига на \(\mathbb {R}\):
\[ \operatorname {TL} := \left\{ x \mapsto a + x \; : \; a \in \mathbb {R}\right\} ; \]
в случае \(\mathbb {R}^{m}\):
\[ \operatorname {TL}_{m} := \left\{ \vec{x} \mapsto \vec{a} + \vec{x} \; : \; \vec{a} \in \mathbb {R}^{m}\right\} \]
линейные отображения на \(\mathbb {R}^{m}\):
\[ \operatorname {GL}_m := \left\{ f: \mathbb {R}^{m} \to \mathbb {R}^{m} \; : \; f \text{ линейно и биективно}\right\} \]
\(\operatorname {GL}_m\) называется полной линейной группой. Она, как известно, изоморфна группе невырожденных матриц порядка \(m\) с операцией умножения. А именно,
\[ \operatorname {GL}_m = \left\{ \vec{x} \mapsto \mathbf{b}\vec{x}\; : \; \mathbf{b} \in \mathbb {R}^{m \times m} \text{ -- невырожд. матрица}\right\} \]
Зачастую \(\operatorname {GL}_m\) отождествляют с группой матриц.
Подгруппа предыдущей группы:
\[ \operatorname {GL}^+_m := \left\{ \vec{x} \mapsto \mathbf{b}\vec{x}\; : \; \mathbf{b} \in \mathbb {R}^{m \times m} , \; \operatorname {det}\mathbf{b} > 0\right\} \]
Все возможные композиции линейных преобразований и сдвигов (параллельных переносов). Такие преобразования называются аффинными:
\[ \operatorname {Aff}_m := \left\{ \vec{x} \mapsto \vec{a} + \mathbf{b}\vec{x} \; : \; \vec{a} \in \mathbb {R}^{m}, \; \mathbf{b} \in \mathbb {R}^{m \times m}, \; \operatorname {det}\mathbf{b} \neq 0\right\} \]
Также будем рассматривать ее подгруппу
\[ \operatorname {Aff}^+_m := \left\{ \vec{x} \mapsto \vec{a} + \mathbf{b}\vec{x} \; : \; \vec{a} \in \mathbb {R}^{m}, \; \mathbf{b} \in \mathbb {R}^{m \times m}, \; \operatorname {det}\mathbf{b} > 0\right\} \]
Все возможные непрерывные биекции (т.е. гомеоморфизмы) на \(\mathbb {R}\). Обозначение: \(\operatorname {Homeo}(\mathbb {R})\). Можно доказать, что
\[ \operatorname {Homeo}(\mathbb {R}) = \left\{ g \in C(\mathbb {R}) \; : \; \left[\begin{array}{ll} g \text{ строго возрастает, } & \lim \limits _{x \to \pm \infty }g(x) = \pm \infty \\ g \text{ строго убывает, } & \lim \limits _{x \to \pm \infty }g(x) = \mp \infty \\ \end{array}\right.\right\} \]
Подгруппа предыдущей группы: все возможные гомеоморфизмы, сохраняющие ориентацию:
\[ \operatorname {Homeo}_+(\mathbb {R}) = \left\{ g \in C(\mathbb {R}) \; :\; g \text{ строго возрастает, } \lim \limits _{x \to \pm \infty }g(x) = \pm \infty \right\} \]
Подгруппа предыдущей группы: все возможные гомеоморфизмы, сохраняющие ориентацию и симметрию относительно нуля:
\[ \operatorname {Homeo}^{\operatorname {odd}}_+(\mathbb {R}) = \left\{ g \in C(\mathbb {R}) \; :\; g \text{ нечетна, строго возрастает, } \lim \limits _{x \to \pm \infty }g(x) = \pm \infty \right\} \]
Почему это группы? Ассоциативность для произвольного набора преобразований выполнена всегда, поскольку она выполнена для композиции. Необходимо проверять 3 оставшихся свойства: замкнутость отн. композиции, наличие тождественного преобразования в наборе, наличие обратного преобразования. Последний пункт распадается на 2: нужно для каждого преобразования проверять биективность и то, что обратное отображение тоже попадает в набор.
Докажем групповые свойства на одном примере.
5.1.1 Одномерные семейства сдвига-масштаба
Пусть \(U\) – случайная величина с фиксированным распределением \(F\), имеющим (если оно существует) плотность \(f\) относительно меры Лебега. Помимо уже введенной группы сдвигов \(\operatorname {TL}\), нам понадобится группа масштабных преобразований – это в точности уже знакомая нам группа \(\operatorname {GL}^+_1\) (одномерный частный случай \(\operatorname {GL}^+_m\)):
\[ \operatorname {GL}^+_1 = \left\{ x \mapsto bx \; : \; b > 0\right\} . \]
Группа, порожденная \(\operatorname {TL}\) и \(\operatorname {GL}^+_1\) вместе, – это в точности уже знакомая нам группа
\[ \operatorname {LS} := \left\{ x \mapsto a + bx \; : \; a \in \mathbb {R}, \, b > 0\right\} = \operatorname {Aff}^+_1, \]
поэтому то, что \(\operatorname {LS}\) и \(\operatorname {GL}^+_1\) – действительно группы, по сути, уже доказано выше (это одномерные частные случаи групп \(\operatorname {Aff}^+_m\) и \(\operatorname {GL}^+_m\)).
Если у \(F\) есть плотность \(f\), то плотность \(X = a+bU\) равна
\[ \frac{1}{b}f\left(\frac{x-a}{b}\right). \]
Ниже перечислены наиболее употребительные семейства сдвига-масштаба на \(\mathbb {R}\), которые будут неоднократно встречаться в дальнейшем.
| Название | Плотность | Носитель | Обозначение |
|---|---|---|---|
| Нормальное | \(\dfrac{1}{\sqrt{2\pi}\,b}e^{-(x-a)^2/2b^2}\) | \(\mathbb{R}\) | \(\mathcal{N}(a,b^2)\) |
| Двойное экспоненциальное (Лапласа) | \(\dfrac{1}{2b}e^{-|x-a|/b}\) | \(\mathbb{R}\) | \(DE(a,b)\) |
| Коши | \(\dfrac{b}{\pi}\cdot\dfrac{1}{b^2+(x-a)^2}\) | \(\mathbb{R}\) | \(C(a,b)\) |
| Логистическое | \(\dfrac{1}{b}\cdot\dfrac{e^{-(x-a)/b}}{\left(1+e^{-(x-a)/b}\right)^2}\) | \(\mathbb{R}\) | \(L(a,b)\) |
| Экспоненциальное | \(\dfrac{1}{b}e^{-(x-a)/b}\,\mathbb{1}_{[a,+\infty)}(x)\) | \((a, +\infty)\) | \(E(a,b)\) |
| Равномерное | \(\dfrac{1}{b}\,\mathbb{1}_{[a-b/2,\,a+b/2]}(x)\) | \(\left(a-\dfrac{b}{2},\ a+\dfrac{b}{2}\right)\) | \(U\!\left(a-\dfrac{b}{2},\ a+\dfrac{b}{2}\right)\) |
(здесь \(-\infty < a < \infty\) – параметр сдвига, \(b > 0\) – параметр масштаба; связь со стандартными обозначениями распределений из теории вероятностей приведена в последних двух столбцах таблицы).
5.1.2 Многомерные семейства сдвига-масштаба
Все семейства из предыдущего пункта естественно обобщаются на случай, когда \(U\) – случайный вектор \(\vec{U} = (U_1, \ldots , U_n)\). Если \(U_1,\ldots ,U_n\) н.о.р.(например, согласно одному из распределений таблицы выше), можно рассмотреть покоординатное действие группы \(\operatorname {LS}\): \(\vec X = a \vec{1} + b\vec U\) (т.е. один и тот же элемент \(g\in \operatorname {LS}\) применяется сразу ко всем координатам). Более широкое семейство получится, если разрешить разный сдвиг и масштаб для каждой координаты:
\[ X_i = a_i + b_i U_i, \quad i = 1,\ldots ,n, \]
т.е. если использовать группу
\[ \operatorname {LS}_n := \left\{ \vec x \mapsto \vec a + \mathbf{b}\vec x \; : \; \vec a \in \mathbb {R}^{n}, \; \mathbf{b} = \operatorname {diag}(b_1,\ldots ,b_n), \; b_i > 0\right\} \subset \operatorname {Aff}_n. \]
Отдельного внимания заслуживают семейства, порожденные не покоординатным, а полным линейным преобразованием – это приводит к следующему важному примеру.
Еще один важный пример – линейная модель (в частности, линейная регрессия, которую мы подробно обсудим позже). Пусть \(\vec U = (U_1,\ldots ,U_n)\) имеет фиксированное распределение (чаще всего, \(U_i\) н.о.р.\(\sim \mathscr {N}\left(0, 1\right)\)), и пусть
\[ X_i = a_i + bU_i, \quad i=1,\ldots ,n, \]
где вектор сдвига \(\vec a = (a_1,\ldots ,a_n)\) обязан лежать в некотором фиксированном \(s\)-мерном подпространстве \(\Omega \subset \mathbb {R}^{n}\) (т.е. \(a_i = \sum_{j=1}^s d_{ij}\beta_j\) для некоторой известной матрицы \(D=(d_{ij})\) ранга \(s\) и произвольных \(\beta_j \in \mathbb {R}\)), а масштаб \(b>0\) – общий для всех координат. Соответствующая группа преобразований
\[ \left\{ \vec x \mapsto \vec a + b\vec x \; : \; \vec a \in \Omega , \; b > 0\right\} \]
– подгруппа \(\operatorname {Aff}_n\). В нормальном случае совместная плотность \(\vec X\) имеет вид
\[ \frac{1}{(\sqrt{2\pi }b)^n}\exp \left[-\frac{1}{2b^2}\sum _{i=1}^n (x_i - a_i)^2\right], \qquad \vec a \in \Omega . \]
5.1.3 (*) Непараметрические групповые семейства
В отличие от предыдущих двух пунктов, где семейства фактически параметризовались небольшим числом чисел (\(a\) и \(b\); элементами \(\vec a\) и \(\mathbf{b}\)), группы преобразований могут порождать и гораздо более “бедные” на структуру, непараметрические семейства.
Аналогично можно строить и другие непараметрические групповые семейства. Например, если взять \(U_i\) н.о.р.\(\operatorname {U}[0,1]\), а в качестве \(g\) – все возрастающие непрерывные биекции \((0,1)\) на себя с \(g(0)=0\), \(g(1)=1\) (это тоже группа преобразований), а затем добавить сдвиг-масштаб \(X_i = a + bg(U_i)\), получится класс всех непрерывных распределений, носителем которых является некоторый интервал.
Отдельный, третий тип групповых семейств возникает в выборочных обследованиях (survey sampling). Пусть имеется конечная генеральная совокупность из \(N\) элементов со значениями \(v_1,\ldots ,v_N\), и случайная выборка размера \(n\) без возвращения дает пары «значение-номер» \((U_1,J_1),\ldots ,(U_n,J_n)\) (все \(\binom {N}{n}\) вариантов выбора равновероятны). Группа сдвигов
\[ X_i = U_i + a_{J_i}, \quad i=1,\ldots ,n, \qquad (a_1,\ldots ,a_N) \in \mathbb {R}^{N}, \]
превращает эту модель в групповое семейство: при \(y_i = v_i + a_i\) пары \((X_1,J_1),\ldots ,(X_n,J_n)\) – это просто случайная выборка без возвращения из совокупности \((y_1,1),\ldots ,(y_N,N)\) с произвольными (неизвестными) значениями \(y_i\).
5.2 Экспоненциальные семейства
Заметим, что нормальное, экспоненциальное, биномиальное, пуассоновское и многие распределения (наборы параметризованных распределений) принадлежат к экспоненциальному семейству. Обратите внимание, что экспоненциальное распределение – лишь частный случай экспоненциального семейства.
| Название | Плотность в стандартном виде | Стандартная параметризация | Стандартное парам. мн-во | Плотность в виде из определения выше | Каноническая параметризация | Каноническая парам. мн-во | \(k\) | Носитель | Обозначение |
|---|---|---|---|---|---|---|---|---|---|
| Гамма | \(\dfrac{1}{\Gamma(a)b^a}x^{a-1}e^{-x/b}\) | \((a,b)\) | \((0,+\infty)^2\) | \(\mathbb{1}_{(0,+\infty)}(x)\exp\left[(a-1)\ln x - \dfrac{x}{b} - \ln\Gamma(a) - a\ln b\right]\) | \(\alpha_1 = a-1,\ \alpha_2 = -\dfrac{1}{b}\) | \((-1,+\infty)\times(-\infty,0)\) | 2 | \((0,+\infty)\) | \(\Gamma(a,b)\) |
| Хи-квадрат | \(\dfrac{1}{\Gamma(f/2)2^{f/2}}x^{f/2-1}e^{-x/2}\) | \((f)\) | \((0,+\infty)\) | \(e^{-x/2}\mathbb{1}_{(0,+\infty)}(x)\exp\left[\left(\dfrac{f}{2}-1\right)\ln x - \ln\Gamma\!\left(\dfrac{f}{2}\right) - \dfrac{f}{2}\ln 2\right]\) | \(\alpha_1 = \dfrac{f}{2} - 1\) | \((-1,+\infty)\) | 1 | \((0,+\infty)\) | \(\chi^2_f\) |
| Бета | \(\dfrac{\Gamma(a+b)}{\Gamma(a)\Gamma(b)}x^{a-1}(1-x)^{b-1}\) | \((a,b)\) | \((0,+\infty)^2\) | \(\mathbb{1}_{(0,1)}(x)\exp\left[(a-1)\ln x + (b-1)\ln(1-x) + \ln\Gamma(a+b) - \ln\Gamma(a) - \ln\Gamma(b)\right]\) | \(\alpha_1 = a-1,\ \alpha_2 = b-1\) | \((-1,+\infty)^2\) | 2 | \((0,1)\) | \(B(a,b)\) |
| Бернулли | \(p^x(1-p)^{1-x}\) | \((p)\) | \((0,1)\) | \(\exp\left[x\ln\dfrac{p}{1-p} + \ln(1-p)\right]\) | \(\alpha_1 = \ln\dfrac{p}{1-p}\) | \(\mathbb{R}\) | 1 | \(\{0,1\}\) | \(\mathrm{Ber}(p)\) |
| Биномиальное | \(\dbinom{n}{x}p^x(1-p)^{n-x}\) | \((p)\); \(n\) известно | \((0,1)\) | \(\dbinom{n}{x}\exp\left[x\ln\dfrac{p}{1-p} + n\ln(1-p)\right]\) | \(\alpha_1 = \ln\dfrac{p}{1-p}\) | \(\mathbb{R}\) | 1 | \(\{0,1,\ldots,n\}\) | \(\mathrm{Bin}(p, n)\) |
| Пуассоновское | \(\dfrac{\lambda^x}{x!}e^{-\lambda}\) | \((\lambda)\) | \((0,+\infty)\) | \(\dfrac{1}{x!}\exp\left[x\ln\lambda - \lambda\right]\) | \(\alpha_1 = \ln\lambda\) | \(\mathbb{R}\) | 1 | \(\{0,1,\ldots\}\) | \(\mathrm{Pois}(\lambda)\) |
| Отрицательное биномиальное | \(\dbinom{m+x-1}{m-1}p^m q^x\) | \((p)\); \(m\) известно | \((0,1)\) | \(\dbinom{m+x-1}{m-1}\exp\left[x\ln(1-p) + m\ln p\right]\) | \(\alpha_1 = \ln(1-p)\) | \((-\infty,0)\) | 1 | \(\{0,1,\ldots\}\) | \(Nb(p,m)\) |
(первые три строки — плотности относительно меры Лебега, последние четыре — относительно считающей меры; \(q := 1-p\). Столбец \(k\) — размерность семейства, т.е. число слагаемых \(\alpha_i(\theta)u_i(x)\) в определении выше; «каноническая параметризация» — это как раз величины \(\alpha_i(\theta)\) из этого определения, а «каноническая парам. мн-во» — множество значений, которое вектор \((\alpha_1(\theta),\ldots,\alpha_k(\theta))\) пробегает, когда \(\theta\) пробегает стандартное парам. мн-во.)
Часто вместо \(\theta\) бывает удобно параметризовать семейство непосредственно величинами \(\eta_i := a_i(\theta )\), \(i=1,\ldots ,k\), – их называют естественными (каноническими) параметрами. В этих обозначениях плотность Уравнение 1 принимает каноническую форму
\[ p(x \mid \eta ) = h(x)\exp \left(\sum _{i=1}^k \eta _i u_i(x) + v(\eta )\right), \qquad \eta = (\eta _1,\ldots ,\eta _k) \in \mathbb {R}^{k}. \]
Множество
\[ \Xi := \left\{ \eta \in \mathbb {R}^{k} \; : \; \int e^{\sum _{i=1}^k \eta _i u_i(x)} h(x)\, \mu (dx) < \infty \right\} \]
называется естественным параметрическим множеством: это в точности множество тех \(\eta\), для которых можно подобрать нормирующую добавку \(v(\eta )\), чтобы \(p(x\mid \eta )\) была плотностью. Можно показать, что \(\Xi\) всегда выпукло.
Обратите внимание, что представление Уравнение 1 не единственно: например, можно домножить \(u_i\) на константу \(c \neq 0\), одновременно поделив \(\eta_i\) на \(c\); более общо, можно делать одновременные (одинаковые) линейные преобразования наборов \((u_1,\ldots ,u_k)\) и \((\eta_1,\ldots ,\eta_k)\).
Не всякое представление вида Уравнение 1 экономно – этим и объясняется оговорка в определении о том, что число слагаемых “не должно превосходить размерность параметрического множества”.
Именно линейная независимость \(\eta_1(\theta ), \ldots , \eta_k(\theta )\) (т.е. полноранговость) и есть то условие, которое требуется в теореме ниже. Если же параметры \(\eta_i(\theta )\), формально образуя \(k\)-мерное семейство, на самом деле как функции \(\theta\) лежат на подмногообразии меньшей размерности, представление не минимально; такое семейство называют криволинейным (curved) экспоненциальным семейством.
Для нормального распределения, например, статистика \((\overline{X}, \overline{X^2})\) будет полной и достаточной. Заметим также, что любая биективная функция сохраняет полноту и достаточность. Т.е., например, для нормального распределения статистика \((\overline{X}, s^2) = (\overline{X}, \overline{X^2} - \overline{X}^2)\) тоже будет полной и достаточной.
Стоит заметить, что условие теоремы будет выполнено, если множество \(\Theta\) “телесно”, т.е. содержит свои внутренние точки, и функции \(a_{1}(\theta ), \ldots , a_{k}(\theta )\) в окрестности какой-нибудь внутренней точки \(\theta_{0} \in \Theta\) линейно независимые и гладкие.
5.2.1 Замкнутость относительно выборки
Экспоненциальная структура устойчива относительно объединения независимых наблюдений. А именно, если \(X\) и \(Y\) независимы и их плотности записаны в каноническом виде с одним и тем же набором естественных параметров \(\eta\):
\[ p(x\mid \eta ) = h(x)\exp \left(\sum _{i=1}^k \eta _i T_i(x) + v(\eta )\right), \qquad q(y\mid \eta ) = g(y)\exp \left(\sum _{i=1}^k \eta _i U_i(y) + w(\eta )\right), \]
то совместное распределение пары \((X,Y)\) снова является \(k\)-мерным экспоненциальным семейством с теми же \(\eta\), а статистики при этом складываются: \(T_i(x) + U_i(y)\). По индукции это переносится на любое (конечное) число независимых слагаемых.
В частности, если \(X_1,\ldots ,X_n\) – выборка (н.о.р.) из семейства Уравнение 1, то совместная плотность выборки равна
\[ \exp \left(\sum _{i=1}^k a_i(\theta )\sum _{j=1}^n u_i(X_j) + nv(\theta )\right)\prod _{j=1}^n h(X_j) = \exp \left(n\sum _{i=1}^k a_i(\theta )\overline{u_i(X)} + nv(\theta )\right)\prod _{j=1}^n h(X_j), \]
т.е. выборка тоже образует \(k\)-мерное экспоненциальное семейство – с тем же числом параметров \(k\), не зависящим от объема выборки \(n\)! – и его естественными статистиками служат в точности \(\overline{u_1(X)},\ldots ,\overline{u_k(X)}\). Это как раз статистики, из которых составлена \(S(X)\) в теореме выше: теорема утверждает, что при полноранговости они не просто достаточны, но и полны.
5.2.2 Моменты в каноническом виде
Каноническая форма записи позволяет находить моменты статистик \(u_i(X)\) без явного интегрирования – прямо по функции \(v(\eta )\).
Доказывается это дифференцированием по \(\eta_j\) тождества \(\int p(x\mid \eta )\, \mu (dx) = 1\) (законность дифференцирования под знаком интеграла здесь не обсуждаем):
\[ \int u_j(x)\, p(x\mid \eta )\, \mu (dx) + \frac{\partial v(\eta )}{\partial \eta _j} \underbrace{\int p(x\mid \eta )\, \mu (dx)}_{=1} = 0 \quad \Longrightarrow \quad \mathbb {E}_{\eta }\left[u_j(X)\right] = -\frac{\partial v(\eta )}{\partial \eta _j}. \]
Формула для ковариации получается ещё одним дифференцированием, теперь уже по \(\eta_k\) (проделайте это самостоятельно).
Ниже перечислены еще несколько классических одно- и двупараметрических экспоненциальных семейств.
Семейство нормальных распределений \(\mathscr {N}\left(\xi , \sigma^2\right)\) при фиксированном \(\sigma\) – это одновременно и (одномерное) семейство сдвига, и экспоненциальное семейство. Оказывается, эти два примера, по существу, исчерпывают все семейства, обладающие сразу обоими свойствами: Дынкин (1951) и Фергюсон (1962) показали, что экспоненциальными семействами сдвига являются в точности \(\mathscr {N}\left(\xi , \sigma^2\right)\) (по параметру \(\xi\), при фиксированном \(\sigma\)) и \(c\ln Y\), где \(Y \sim \Gamma (a,b)\), \(\theta = \ln b\) – параметр сдвига, а \(c \neq 0\) – произвольная фиксированная константа. Так экспоненциальные и групповые (сдвига-масштаба) семейства – два, на первый взгляд, независимых способа построения моделей – оказываются тесно связаны между собой.
5.3 Прочие семейства
Закончим примером, показывающим, что не всякое естественное параметрическое семейство – групповое или экспоненциальное.
Сноски
\(\xi\) может быть и случайным вектором, принимающим значения в \(\mathbb {R}^{k}\), с неизвестным \(k\)-мерным распределением \(\mathbb {P}\). В этом случае модель строится аналогично. Далее, для простоты изложения, теория излагается для одномерного случая.↩︎
Напомним, что отображение называется измеримым, если для любого множества \(A \in \mathcal{E}\) выполнено \(\left\{ x \; : \; S(x) \in A\right\} \in \mathscr {B}\left(\mathbb {R}^{n}\right)\)↩︎
Можно даже доказать, что выборку бесконечного размера из произвольного распределения можно задать на \(([0,1], \mathscr {B}\left([0,1]\right), \operatorname {U}[0,1])\).↩︎