Введение. Статистики и оценки

Дата публикации

2 сентября 2026

ПредупреждениеЧерновик

Этот конспект ещё находится в процессе редактуры: в тексте могут встречаться опечатки, неточности и локально не проработанные места. Если что-то нашли — сообщите, пожалуйста, автору (контакты на странице курса).

1 Математическая статистика: введение

1.1 Теория вероятностей VS математическая статистика

В теории вероятностей мы предполагали, что нам известна природа некоторого явления, эксперимента (распределение случайной величины), и это знание позволяло нам изучать поведение различных производных величин. Имея распределение некоторой случайной величины \(\xi\), мы, например, находили распределение \(\xi^2\), находили, как зависят друг от друга матожидания, дисперсии, распределения для суммы зависимых/независимых случайных величин, и т.д. – то есть мы шли от известного распределения к свойствам и поведению связанных с ним величин.

В математической статистике все наоборот: данными являются результаты экспериментов (значения случайной величины), и требуется понять природу изучаемого явления (распределение величины).

Пусть \(\xi\) — случайная величина, принимающая значения в множестве \(\mathbb {R}\) и имеющая распределение \(\mathbb {P}\)1. Будем называть случайную величину \(\xi\) наблюдением. Одна из основных задач математической статистики, которой мы в основном и будем заниматься, состоит в следующем:

По набору наблюдений выяснить какую-либо информацию о распределении \(\mathbb{P}\), которое предполагается неизвестным.

Как правило, для выяснения природы изучаемого явления удается провести независимые эксперименты. Говоря математическим языком, восстановить распределение нужно по набору независимых наблюдений, который называется выборкой. Т.е. выборка – это вектор \(\left(X_{1}, \ldots , X_{n}\right)^T\) (или просто \(X_{1}, \ldots , X_{n}\)) составленный из независимых случайных величин, распределенных по \(\mathbb {P}\), т.е. так же, как и \(\xi\). Такой вектор принимает значения в множестве \(\mathbb {R}^{n}\), а его распределение \(\mathbb {P}^{n}\) задано на борелевской \(\sigma\)-алгебре \(\mathscr {B}\left(\mathbb {R}^{n}\right)\).

Есть несколько подходов к задаче оценки распределения. Рассмотрим основные.

1.2 Параметрический VS непараметрический подходы

В реальных экспериментах, как правило, перед проведением исследования удается несколько сузить возможные значения \(\mathbb {P}\), т.е. найти какое-то семейство распределений \(\mathcal{P}\), которому заведомо должно принадлежать \(\mathbb {P}\). Тройка \((\mathbb {R}, \mathcal{B}(\mathbb {R}), \mathcal{P})\) называется вероятностно-статистической моделью.

В параметрическом подходе мы предполагаем, что семейство распределений \(\mathcal{P}\), которому принадлежит наше неизвестное распределение \(\mathbb {P}\), состоит только из распределений, заданных каким-то параметром.

ExampleПример 1

Предположим, мы хотим оценить интенсивность посещения магазина покупателями. Пусть \(\xi\) — это время между визитами соседних покупателей, то есть сколько времени проходит между визитом одного покупателя и следующего. Пусть \(\mathbb {P}\) — это распределение \(\xi\).

Ясно, что \(\xi\) — неотрицательная случайная величина с непрерывным распределением, то есть заведомо понятно, что \(\mathbb {P} \in \mathcal{P}\), где \(\mathcal{P}\) — это класс всех непрерывных распределений с носителем \([0, +\infty )\). Нам требуется оценить плотность \(f_0\) распределения \(\mathbb {P}\).

Для оценки \(\mathbb {P}\) собрана выборка (точнее, её реализация): \[ \begin{pmatrix} X_1(\omega ) \\ X_2(\omega ) \\ \vdots \\ X_{20}(\omega ) \end{pmatrix} = \left(\begin{smallmatrix} 0.5 \\ 0.8 \\ 1.2 \\ 5.8 \\ 8.5 \\ 7.2 \\ 1.5 \\ 1.8 \\ 2.0 \\ 2.3 \\ 2.6 \\ 3.5 \\ 3.9 \\ 4.5 \\ 5.2 \\ 6.4 \\ 6.8 \\ 7.6 \\ 9.2 \\ 9.8 \end{smallmatrix}\right) \] (время измеряется в минутах). Оцените \(\mathbb {P}\), используя параметрический и непараметрический подходы.

SolutionРешение
Enum-item1.

Параметрический подход. Нам нужно сузить \(\mathcal{P}\), то есть сделать дополнительное предположение о виде \(\mathbb {P}\). Обычно для моделирования времени между повторяющимися событиями используют экспоненциальное распределение, поскольку оно обладает свойством отсутствия памяти. Итак, полагаем \(\mathcal{P} = \{ \operatorname {Exp}(\theta ) : \theta > 0\}\), то есть \(\xi \sim \mathbb {P} = \operatorname {Exp}(\theta )\) для некоторого неизвестного \(\theta > 0\). Плотность:

\[ f(x) = f(x,\theta ) = \theta e^{-\theta x} \cdot \; \mathbb {1}_{[0,+\infty )}(x) \]

Задача оценки плотности свелась к построению оценки параметра \(\theta\).

Имеем \(\mathbb {E}\left[\xi \right] = 1/\theta\), т.е. \(\theta = \frac{1}{\mathbb {E}\left[\xi \right]}\). Матожидание \(\mathbb {E}\left[\xi \right]\) разумно оценить средним арифметическим выборки \(\frac{1}{n}\sum_{k=1}^{n}X_k\) (мы об этом будем говорить подробнее далее). Значит, естественной оценкой \(\theta\) является

\[ \widehat{\theta } = \frac{1}{\frac{1}{n}\sum _{k=1}^{n}X_k}. \]

В нашем конкретном случае:

\[ \frac{1}{n}\sum _{k=1}^{n}X_k(\omega _0) = \frac{0.5 + 0.8 +\ldots + 9.8}{20} = \frac{91.1}{20} = 4.555, \]

откуда \(\widehat{\theta }(\omega_0) \approx 0.220\).

Параметрическая оценка плотности:

\[ \widehat{f}^{\mathrm{P}}(x) = \widehat{\theta }\, e^{-\widehat{\theta }\, x} \cdot \; \mathbb {1}_{[0,+\infty )}(x), \]

где P от parametric. В нашем конкретном случае:

\[ \widehat{f}^{\mathrm{P}}(x, \omega _0) \approx 0.220 \cdot e^{-0.220 \cdot x} \cdot \; \mathbb {1}_{[0,+\infty )}(x) \]

Enum-item2.

Непараметрический подход. Здесь мы не делаем предположений о форме распределения. Воспользуемся следующим методом: над каждой точкой выборки \(X_i\) раздуем симметричный «бугор» площади \(\frac{1}{n}\). Форма бугра задаётся ядром \(K\) — функцией, удовлетворяющей \(K(u) \geq 0\), \(\int K(u)\, du = 1\), \(K(u) = K(-u)\). Популярные ядра:

  • ядро Епанечникова \(K(u) = \frac{3}{4}(1 - u^2) \cdot \; \mathbb {1}_{[-1,1]}(u)\);

  • гауссово ядро \(K(u) = \frac{1}{\sqrt{2\pi }} e^{-u^2/2}\);

  • равномерное ядро \(K(u) = \frac{1}{2}\cdot \; \mathbb {1}_{[-1,1]}(u)\).

Ширина бугра регулируется параметром \(h > 0\) (шириной окна). Предварительная оценка плотности:

\[ \widehat{f}_0^{\mathrm{NP}}(x) = \sum _{i=1}^{n} \frac{1}{n} \cdot \frac{1}{h} \cdot K\! \left(\frac{x - X_i}{h}\right). \]

где \(\frac{1}{h} \cdot K\! \left(\frac{x - X_i}{h}\right)\) – это бугор ширины \(h\) с центром в \(X_i\). Множитель \(\frac{1}{h}\) добавлен, чтобы площадь под графиком осталась равной \(1\).

Это так называемая ядерная оценка плотности, от англ. Kernel Density Estimation (сокр. KDE).

Поскольку ядро \(K\) симметрично, часть площади \(\widehat{f}_0^{\mathrm{NP}}\) иногда «утекает» на отрицательную полуось, что противоречит тому, что \(\xi \geq 0\). Обозначим эту утёкшую площадь

\[ s = \int _{-\infty }^{0} \widehat{f}_0^{\mathrm{NP}}(x)\, dx. \]

Скорректируем оценку, перенормировав её на \([0, +\infty )\):

\[ \widehat{f}^{\mathrm{NP}}(x) = \begin{cases} \dfrac {1}{1 - s}\, \widehat{f}_0^{\mathrm{NP}}(x), & x \geq 0, \\ 0, & x < 0, \end{cases} \]

где NP от non-parametric. Тогда \(\int_0^{+\infty } \widehat{f}^{\mathrm{NP}}(x)\, dx = 1\).

Оценка плотности: непараметрический и параметрический подходы

Оранжевые точки — это наблюдения. Перетаскивайте наблюдения. Клик на пустом месте — добавить наблюдение. Двойной клик или правый клик — удалить наблюдение.

1.7
\(\hat{f}_0^{\mathrm{NP}}\) — предварительная KDE (все \(x\))
\(\hat{f}^{\mathrm{NP}}\) — скорректированная KDE (\(x \ge 0\))
\(\hat{f}^{\mathrm{P}}\) — \(\mathrm{Exp}(\hat{\theta})\), \(\hat{\theta} = \bar{X}\)
Объём выборки: \(\bar{X} =\) \(\hat{\theta} =\) \(s =\)

Как видно из графика, оценки плотности сильно отличаются. Параметрическая оценка более грубая, она не учитывает, что у распределения 2 пика: около точки \(2\) и около точки \(7\). С другой стороны параметрическая оценка более простая.

1.3 Частотный VS байесовский подходы

Вспомним, что в теории вероятностей существует несколько способов понимать слово «вероятность». Простой пример: вы подкинули монетку, она приземлилась вам на руку, но вы тут же закрыли её рукой. Какова вероятность, что выпал орёл?

  • Частотная интерпретация вероятности. Вероятность события – это предел относительной частоты его появления при неограниченном повторении одного и того же случайного эксперимента:

    \[ \mathbb {P}(A) = \lim _{n \to \infty } \frac{\text{число успехов}}{n}. \]

    Чтобы говорить о вероятности чего-либо, нужно представлять себе (хотя бы мысленно) серию повторений эксперимента. Поэтому вероятностные утверждения имеет смысл формулировать только для случайных, повторяемых событий.

    В примере с монеткой «вероятность» с этой точки зрения смысла не имеет: монетка уже приземлилась вам на руку, она уже как-то выпала. Здесь нет повторяемости: вы откроете руку 1000 раз, и все 1000 раз увидите один и тот же результат (вы его, правда, ещё не знаете, но заведомо понятно, что он будет одним и тем же).

    Когда в рамках частотного подхода говорят «у честной монетки вероятность выпадения орла равна \(\frac{1}{2}\)», имеется в виду, что если вы подкинете монетку 1000 раз, то примерно в половине случаев выпадет орёл.

  • Байесовская интерпретация вероятности. Вероятность – это степень уверенности (степень правдоподобия, степень доверия) в истинности некоторого утверждения, основанная на имеющейся информации. Такую вероятность можно приписывать любому утверждению, в том числе одноразовому, неповторяемому событию.

    С точки зрения байесовского подхода вопрос о вероятности того, что уже подкинутая монета легла орлом или решкой, вполне имеет смысл: вы с вероятностью около \(1/2\) уверены, что выпал орёл.

    Отсюда, кстати, любопытный вывод: обычный человек, не посвящённый в математические тонкости, на вопрос о вероятности орла у уже выпавшей монеты, скорее всего, уверенно ответит \(1/2\). Точно так же его не смутит вопрос «с какой вероятностью завтра будет дождь», хотя здесь никакой повторяемости нет и частотный подход неприменим. То есть обывательская интерпретация вероятности – по сути байесовская.

    Ещё один любопытный момент: поскольку в байесовском подходе вероятность – это степень уверенности, её можно обновлять по мере поступления новой, даже косвенной, информации. Допустим, изначально (априори) у вас не было никакой информации о монете, и вы были уверены, что она честная. Тогда после подкидывания и закрытия рукой вероятность (степень уверенности) орла для вас равна \(\frac{1}{2}\). Далее вы можете не открывать руку, а попытаться на ощупь определить, что выпало. Допустим, вам кажется, что сверху вы чувствуете орла – тогда вероятность (степень уверенности) орла можно сдвинуть, скажем, до \(\frac{2}{3}\). Затем, допустим, выясняется, что монету вам одолжил товарищ, который говорит, что она нечестная и более склонна к выпадению решки. После этой новой информации вы можете снова обновить свою вероятность (степень уверенности), сдвинув её, скажем, до \(\frac{3}{8}\). Вероятность, полученная после учёта новой информации, называется апостериорной. И так далее: байесовский подход позволяет последовательно «обновлять» вероятности по мере поступления данных.

Рассмотрим разницу частотного и байесовского подходов на примере оценки параметра в параметрической модели. В частотном подходе параметр считается фиксированным, но неизвестным числом – он не случаен, и говорить о “вероятности того, что параметр лежит в каком-то фиксированном интервале” формально некорректно: либо параметр там лежит, либо нет. Случайность в этом подходе связана только с данными – с тем, что если повторить эксперимент много раз, выборка будет каждый раз получаться разной.

В байесовском подходе параметр сам объявляется случайной величиной. Это не означает, что эксперимент “на самом деле” каждый раз проводится с новым параметром – просто наше знание о параметре до и после эксперимента описывается распределением вероятностей. До того, как мы увидели данные, это знание выражается априорным распределением (от лат. a priori – “до опыта”) – это распределение, которое мы выбираем сами, исходя из того, что нам известно о параметре заранее (или из соображений удобства, если ничего не известно). После того как данные получены, априорное распределение пересчитывается в апостериорное (a posteriori – “после опыта”) по формуле Байеса – это и есть обновлённое знание о параметре с учётом наблюдений.

ExampleПример 2

Монету подбросили \(n = 10\) раз, выпало \(k = 8\) орлов. Оцените вероятность \(p\) выпадения орла: а) частотным подходом (точечная оценка и доверительный интервал); б) байесовским подходом (апостериорное распределение и доверительный интервал).

SolutionРешение

а) Частотный подход.

Оценка максимального правдоподобия:

\[ \hat{p} = \frac{k}{n} = \frac{8}{10} = 0{,}8. \]

Приближённый 95-й доверительный интервал (Вальда):

\[ \hat{p} \pm 1{,}96 \sqrt{\frac{\hat{p}(1-\hat{p})}{n}} = 0{,}8 \pm 1{,}96 \cdot \sqrt{\frac{0{,}8 \cdot 0{,}2}{10}} \approx 0{,}8 \pm 0{,}248, \]

то есть \((0{,}55;\ 1{,}0)\) (с учётом обрезания по границе \(1\)).

Интерпретация: если повторить эксперимент (10 бросков) много раз и каждый раз строить такой интервал, то в 95 случаев он накроет истинное значение \(p\). Сам \(p\) при этом не меняется и не случаен – случаен сам интервал (от выборки к выборке).

б) Байесовский подход.

Нужно задать априорное распределение для \(p\). Возьмём

\[ p \sim \mathrm{Beta}(\alpha =1,\ \beta =1), \]

то есть равномерное распределение на \([0,1]\) – оно отражает ситуацию, когда заранее у нас нет предпочтений: любое значение \(p\) от 0 до 1 считается априори равновозможным.

Правдоподобие данных при биномиальной модели:

\[ L(p) \propto p^{k}(1-p)^{n-k}. \]

По формуле Байеса апостериорная плотность пропорциональна произведению априорной плотности и правдоподобия; для пары Beta-Binomial это снова бета-распределение:

\[ p \mid \text{данные} \sim \mathrm{Beta}(\alpha + k,\ \beta + n - k) = \mathrm{Beta}(9, 3). \]

Апостериорное математическое ожидание:

\[ \mathbb {E}[p \mid \text{данные}] = \frac{9}{9+3} = 0{,}75. \]

95-й доверительный интервал (по квантилям \(\mathrm{Beta}(9,3)\) уровней \(2{,}5\%\) и \(97{,}5\%\)):

\[ (0{,}48;\ 0{,}94). \]

Интерпретация: после того как мы увидели данные и обновили своё знание о \(p\), мы можем сказать – с вероятностью 95 истинное значение \(p\) лежит в этом интервале. Здесь это законное вероятностное утверждение про сам параметр, потому что в этом подходе \(p\) – случайная величина с апостериорным распределением \(\mathrm{Beta}(9,3)\).

Байесовское обновление: монета

Слайдеры данных \(n\) (число бросков) и \(k\) (число орлов) и параметров априорного \(\mathrm{Beta}(\alpha_0,\beta_0)\) распределения — апостериорная плотность, доверительный интервал и метки пересчитываются мгновенно.

апостериорное: Beta(9, 3) апост. среднее = 0.750 \(\hat p_{\mathrm{MLE}} = k/n\) = 0.800 95% байесовский ДИ = (0.482, 0.940)

Сравнение. Точечная оценка в байесовском подходе (\(0{,}75\)) немного смещена к центру априорного распределения (\(0{,}5\)) по сравнению с чисто эмпирической оценкой \(0{,}8\) – это и есть влияние априорного распределения. Если взять более “уверенное” априорное распределение, например \(\mathrm{Beta}(50,50)\) (сильное ожидание, что \(p \approx 0{,}5\), скажем, из предыдущих экспериментов с похожими монетами), смещение апостериорной оценки было бы намного сильнее. Частотная же оценка \(\hat p = k/n\) от выбора какого-либо априорного распределения вообще не зависит – в этом подходе такого объекта просто не существует.

Мы в нашем курсе в основном будем заниматься параметрической частотной статистикой. Хотя непараметрические и байесовские методы мы тоже затронем.

Параметрическая статистика сводится к построению и исследованию оценок параметров, чем мы и будем заниматься на ближайших семинарах.

2 Статистики: определение, примеры

Определение 1 Пусть у нас есть выборка размера \(n\). Любое \((\mathscr {B}\left(\mathbb {R}^{n}\right) \mid \mathcal{E})\)-измеримое отображение \(S: \mathbb {R}^{n} \rightarrow E\) называется статистикой, где \((E, \mathcal{E})\) – произвольное измеримое пространство2.

Пусть мы работаем с параметрической моделью, т.е. семейство распределений параметризовано как \(\mathcal{P}=\left\{ \mathbb {P}_{\theta }, \theta \in \Theta \right\}\). Как правило, параметр – это число или вектор (как, например, в случае нормального распределения, где \(\theta = (\mu , \sigma^2)^T\)), т.е. \(\Theta \subset \mathbb {R}\) (или \(\mathbb {R}^{k}\)), и в этом случае предполагается, что на \(\Theta\) задана борелевская сигма-алгебра \(\mathscr {B}\left(\Theta \right)\). Измеримое (\(\mathscr {B}\left(\mathbb {R}^{n}\right) \mid \mathscr {B}\left(\Theta \right)\)-измеримое) отображение \(S: \mathbb {R}^{n} \to \Theta\) называется оценкой параметра \(\theta\).

Как правило, оценка параметра \(\theta\) обозначается \(\widehat{\theta } = \widehat{\theta }(X)\). Заметим, что оценка параметра – случайная величина, поскольку она зависит от выборки, т.е. от случайных величин. При этом сам параметр – неслучайная константа, она просто нам не известна.

Итого, если \(X=\left(X_{1}, \ldots , X_{n}\right)\) – выборка, то статистикой \(S(X)\) называется измеримая функция от выборки. Оценкой параметра \(\theta \in \Theta\) называется такая статистика, которая принимает значения в \(\Theta\).

В случае параметрической модели задача отыскания “истинного” распределения сводится к нахождению “истинного” значения параметра. Для этого находится удачная (в каком-нибудь смысле) оценка параметра. В настоящей главе мы поговорим о том, какие оценки принято считать “удачными”.

Пусть \(X_{1}, \ldots , X_{n}\) – выборка из неизвестного распределения \(\mathbb {P}\).

  • Пусть \(g: \mathbb {R} \to \mathbb {R}\) – борелевская функция. Величина

    \[ \overline{g(X)} = \frac{1}{n} \sum _{i=1}^{n} g(X_i) \]

    называется выборочной характеристикой \(g(x)\). Например,

    \[ \overline{X} := \frac{1}{n} \sum _{i=1}^{n} X_{i} \]

    называется выборочным средним (здесь \(g\) – это тождественная функция), а

    \[ \overline{X^k} := \frac{1}{n} \sum _{i=1}^{n} X_{i}^{k} \]

    – выборочным \(k\)-ым моментом. Или, например, можно говорить о выборочном логарифме:

    \[ \overline{\ln X} := \frac{1}{n} \sum _{i=1}^{n} \ln (X_{i}) \]

  • Пусть у неизвестного распределения \(\mathbb {P}\) (\(\xi \sim \mathbb {P}\)) есть дисперсия \(\sigma^2 := \operatorname {Var}\left[\xi \right]\), которую будем рассматривать как параметр. Как ее оценить? Напомним, что \(\operatorname {Var}\left[\xi \right] = \mathbb {E}\left[\xi^2\right] - \left(\mathbb {E}\left[\xi \right]\right)^2\). Статистика

    \[ s^2 = \overline{X^2} - \left(\overline{X}\right)^2 \]

    называется (смещенной) выборочной дисперсией. Почему эта статистика называется смещенной, станет понятно ниже.

  • Упорядочим значения выборки \(\left(X_{1}, \ldots , X_{n}\right)\) по возрастанию:

    \[ X_{(1)} \leq X_{(2)} \leq \ldots \leq X_{(n)} \]

    Полученная совокупность статистик называется вариационным рядом, а его член \(X_{(k)}\) – \(k\)-ой порядковой статистикой. В частности, \(X_{(1)}\) – это минимум:

    \[ X_{(1)} = \min _{k \in \left\{ 1,\ldots ,n\right\} }X_k, \]

    а \(X_{(n)}\) – это максимум выборки:

    \[ X_{(n)} = \max _{k \in \left\{ 1,\ldots ,n\right\} }X_k, \]

    Выборочной медианой называется статистика, которая делит вариационный ряд (отсортированную по возрастанию выборку) пополам:

    \[ X_{\mathrm{med}} := \begin{cases} X_{(m+1)}, & n = 2m + 1 \\ \frac{1}{2}\left(X_{(m)} + X_{(m+1)}\right), & n = 2m \end{cases} \]

3 Свойства оценок

3.1 Неасимптотические свойства

Пусть \(X = (X_1, \ldots , X_n)\) – наблюдение из неизвестного распределения \(\mathbb {P} \in \left\{ \mathbb {P}_{\theta }, \theta \in \Theta \right\}\).

Определение 2 Оценка \(\widehat{\theta } = \widehat{\theta }(X)\) называется несмещенной оценкой параметра \(\theta\), если для любого \(\theta \in \Theta\) выполнено равенство \[ \mathbb {E}_{\theta }\left[\widehat{\theta }\right] = \theta \] Т.е. какой бы ни был истинный параметр \(\theta \in \Theta\), матожидание случайной величины \(\widehat{\theta }\) совпадает с \(\theta\). При этом обратите внимание, что матожидание, вообще говоря, зависит от \(\theta\), поскольку от \(\theta\) зависит распределение \(\mathbb {P}_\theta\), а матожидание – это интеграл Лебега по неизвестному распределению. Отсюда индекс \(\theta\) у значка \(\mathbb {E}\).

ExampleПример 3

Пусть \(X_{1}, \ldots , X_{n}\) – выборка из неизвестного распределения \(\mathbb {P} \in \left\{ \mathbb {P}_{\theta }, \theta \in \Theta \right\}\), \(\Theta \subset \mathbb {R}\), причем параметр \(\theta\) равен матожиданию распределения: \(\mathbb {E}_{\theta }\left[X_1\right] = \theta\) для любого \(\theta \in \Theta\). Докажите, что \(\overline{X}\) – несмещенная оценка параметра \(\theta\).

SolutionРешение

В силу линейности математического ожидания, \[ \mathbb {E}_{\theta }\left[\overline{X}\right] = \frac{1}{n}\sum _{i=1}^n \mathbb {E}_{\theta }\left[X_i\right] = \mathbb {E}_{\theta }\left[X_1\right] = \theta , \] для любого \(\theta \in \Theta\).

ProblemЗадача 1

Пусть \(X_{1}, \ldots , X_{n}\) выборка из неизвестного распределения \(\mathbb {P}_{\sigma^2}\) с параметром \(\sigma^{2}\), дисперсия которого существует и равна \(\sigma^2\). Рассмотрим (смещенную) выборочную дисперсию \[ s^2 = \overline{X^2} - \left(\overline{X}\right)^2 \]

  1. Докажите, что

\[ s^2 = \frac{1}{n} \sum _{i=1}^n \left(X_i - \overline{X}\right)^2. \]

  1. Докажите, что

\[ \mathbb {E}_{\sigma ^2}\left[s^2\right] = \frac{n-1}{n} \sigma ^2, \quad \forall \sigma ^2 > 0, \]

т.е. \(s^2\) – действительно смещенная оценка.

  1. Докажите, что оценка

\[ S^2 = \frac{n}{n-1}s^2 = \frac{1}{n-1}\sum _{i=1}^n \left(X_i - \overline{X}\right)^2, \]

называемая несмещенной выборочной дисперсией, действительно является несмещенной оценкой \(\sigma^2\).

Следующая задача показывает, что далеко не для всех (сложных) параметров существуют несмещенные оценки.

ProblemЗадача 2

Пусть \(X_{1}, \ldots , X_{n}\) – выборка из распределения \(\operatorname {Ber}(\theta )\), \(\theta \in \Theta = [0,1]\). Для каких функций \(\tau (\theta )\) существуют несмещенные оценки?

3.2 Асимптотические свойства

В данном разделе мы предполагаем, что у нас имеется бесконечно большая выборка \(X_1, X_2, X_3, \ldots\) из неизвестного распределения \(\mathbb {P}\). Можно доказать, что существует вероятностное пространство \(\left(\mathbb {R}^{\infty }, \mathscr {B}\left(\mathbb {R}^{\infty }\right), \mathbb {P}^{\infty }\right)\), на котором можно задать бесконечную последовательность случайных величин \(X_{1}, X_{2}, \ldots\) (выборку бесконечного размера), распределенных так же, как и \(\xi\)3. Тем самым, на этом пространстве задана выборка любого размера \(n\). В дальнейшем мы для простоты обозначений будем писать \((\mathbb {R}, \mathscr {B}\left(\mathbb {R}\right), \mathbb {P})\) вместо \(\left(\mathbb {R}^{\infty }, \mathscr {B}\left(\mathbb {R}^{\infty }\right), \mathbb {P}^{\infty }\right)\) соответственно.

Пусть у нас есть последовательность оценок, построенных по одинаковому принципу, причем \(n\)-я оценка в последовательности зависит только от первых \(n\) элементов выборки: \(\widehat{\theta }_1 = \widehat{\theta }_1(X_1)\), \(\widehat{\theta }_2 = \widehat{\theta }_2(X_1,X_2)\), \(\ldots\),

\[ \widehat{\theta }_n = \widehat{\theta }_n(X_1, \ldots , X_n), \quad \ldots , \]

Например, выборочное среднее: \(\widehat{\theta }_n = \frac{1}{n}\sum_{k=1}^{n}X_k\). Или максимум: \(\widehat{\theta }_n = \max_{1 \leq k \leq n}X_k\). В таких случаях принято опускать зависимость от \(n\), и говорить просто об оценке \(\widehat{\theta }\).

Определение 3 Пусть \(\widehat{\theta }\) – это оценка (последовательность оценок) неизвестного параметра \(\theta\).

  • \(\widehat{\theta }\) называется состоятельной оценкой \(\theta\), если какой бы ни был истинный параметр \(\theta\), \(\widehat{\theta }\) будет к нему сходиться по вероятности:

    \[ \widehat{\theta } \xrightarrow [n \to \infty ]{\mathbb {P}_{\theta }} \theta \]

    для любых \(\theta \in \Theta\).

  • \(\widehat{\theta }\) называется сильно состоятельной оценкой \(\theta\), если \(\forall \theta \in \Theta\) выполнено

    \[ \widehat{\theta } \xrightarrow [n \to \infty ]{\mathbb {P}_{\theta }\text{-п.н.}} \theta \]

  • \(\widehat{\theta }\) называется асимптотически нормальной оценкой \(\theta\), если \(\forall \theta \in \Theta\) выполнено

    \[ \sqrt{n}\left(\widehat{\theta } - \theta \right) \xrightarrow [n \to \infty ]{d_\theta } \mathscr {N}\left(0, \sigma ^2(\theta )\right) \]

    для некоторой функции \(\sigma^{2}(\theta )\), которая называется асимптотической дисперсией оценки \(\widehat{\theta }\).

    В определении выше мы использовали запись \(d_{\theta }\), которая означает сходимость по распределению при условии, что элементы выборки имеют распределение \(\mathbb {P}_{\theta }\).

Все определения выше переносятся и на случай, когда \(\theta\) – многомерный параметр. В этом случае в определении асимптотической нормальности асимптотическая дисперсия \(\sigma^2(\theta )\) заменяется на асимптотическую ковариационную матрицу \(\Sigma (\theta )\).

ExampleПример 4

Пусть задана выборка \(X_{1}, \ldots , X_{n}\) из неизвестного распределения \(\mathbb {P} \in \mathcal{P}\). Пусть, кроме того, \(k \in \mathbb {N}\) и \[ 0 < \mathbb {E}_{\mathbb {P}}\left[\left|X_1\right|^{2k}\right] <\infty \] для всех \(\mathbb {P} \in \mathcal{P}\), т.е. какое бы ни было неизвестное распределение, заведомо известно, что у него существует конечный \(2k\)-ый момент. Доказать, что выборочный \(k\)-ый момент \(\overline{X^k}\) является несмещённой, сильно состоятельной и асимптотически нормальной оценкой \(\mathbb {E}_{\mathbb {P}}\left[X_1^{k}\right]\).

SolutionРешение
  • Несмещенность, как и в предыдущей разобранной задаче, следует из линейности математического ожидания.

  • Сильная состоятельность следует из усиленного закона больших чисел (Колмогорова): величины \(X_1^k, X_2^k, \ldots\) независимы, одинаково распределены, и \(\mathbb {E}_{\mathbb {P}}\left[\left|X_1^k\right|\right] = \mathbb {E}_{\mathbb {P}}\left[\left|X_1\right|^{k}\right] < \infty\) (конечность следует из конечности \(2k\)-го момента), поэтому

    \[ \overline{X^k} = \frac{1}{n} \sum _{i=1}^{n} X_{i}^{k} \xrightarrow [n \to \infty ]{\text{п.н.}} \mathbb {E}_{\mathbb {P}}\left[X_{1}^{k}\right], \quad \forall \mathbb {P} \in \mathcal{P}. \]

    Из сходимости п.н. следует сходимость по вероятности, т.е. попутно получена и (обычная) состоятельность.

  • Асимптотическая нормальность следует из центральной предельной теоремы: применяем ЦПТ к \(X_1^k, X_2^k, \ldots\). Действительно, \(X_1, X_2, \ldots\) независимы и одинаково распределены, следовательно и последовательность \(X_1^k, X_2^k, \ldots\) состоит из независимых одинаково распределенных случайных величин, причем

    \[ \operatorname {Var}_{\mathbb {P}}\left[X_1^k\right] = \mathbb {E}_{\mathbb {P}}\left[X_1^{2k}\right] - \left(\mathbb {E}_{\mathbb {P}}\left[X_1^k\right]\right)^2 < \infty . \]

    Таким образом, можем применить ЦПТ. Применяем:

    \[ \sqrt{n}\left(\overline{X^{k}} - \mathbb {E}_{\mathbb {P}}\left[X_{1}^{k}\right]\right) \stackrel{d}{\rightarrow } \mathscr {N}\left(0, \operatorname {Var}_{\mathbb {P}}\left[X_1^k\right]\right). \]

Основными инструментами доказательства того, что оценка является состоятельной или асимптотически нормальной, являются законы больших чисел, центральная предельная теорема, теорема о наследовании сходимостей, а также теорема о наследовании асимптотической нормальности, сформулированная ниже.

ProblemЗадача 3

Пусть \(X_1, \ldots , X_n\) – выборка из распределения \(\operatorname {U}[0,\theta ]\), \(\theta \in \Theta = (0,+\infty )\). Проверьте на несмещенность, состоятельность и сильную состоятельность оценку

  1. \(2\overline{X}\),

  2. \(\overline{X} + \frac{X_{(n)}}{2}\),

  3. \((n+1)X_{(1)}\),

  4. \(X_{(1)} + X_{(n)}\),

  5. \(\frac{n+1}{n}X_{(n)}\).

HintПодсказка

\(X_{(n)} = \max (X_1, \ldots , X_n)\), значит \(X_{(n)} \leq t\) выполнено тогда и только тогда, когда \(X_1, X_2\ldots ,X_n \leq t\). Имеем \[ \begin{align} \mathbb {P}\left(X_{(n)} \leq t\right) & = \mathbb {P}\left(X_1 \leq t, X_2 \leq t, \ldots , X_n \leq t\right) \stackrel{*}{=} \\ & \stackrel{*}{=}\mathbb {P}\left(X_1 \leq t\right) \cdot \ldots \cdot \mathbb {P}\left(X_n \leq t\right) \stackrel{**}{=} \\ & \stackrel{**}{=} \left(\mathbb {P}\left(X_1 \leq t\right)\right)^n, \end{align} \] где \(*\) – в силу независимости выборки, \(**\) – в силу одинаковой распределенности \(X_1, \ldots , X_n\).

ProblemЗадача 4

Докажите, что из асимптотической нормальности следует состоятельность. Т.е. пусть \(\widehat{\theta }(X) = \widehat{\theta }_{n}(X_1, \ldots , X_n)\) – асимптотически нормальная оценка параметра \(\theta\) с асимптотической дисперсией \(\sigma^{2}(\theta )\). Докажите, что тогда \(\widehat{\theta }(X)\) является состоятельной оценкой \(\theta\).

HintПодсказка

Применить теорему Слуцкого из следующей главы.

4 Выборка VS реализация выборки

Скажем пару слов о том, в чём состоит это отличие. Представьте, что вы проводите реальное исследование — например, собираете данные об интервалах между визитами клиентов. В реальной жизни вы получаете конкретные данные, конкретные числа. Числа — это, разумеется, не случайные величины. Так почему же математическая статистика работает именно со случайными величинами?

Суть в том, что мы рассуждаем как бы непосредственно перед проведением эксперимента. Эксперимент уже спланирован, и мы вот-вот пойдём собирать данные — но пока ещё не собрали. Для нас в этот момент данные неизвестны, то есть представляют собой случайные величины. И именно в этот момент мы хотим заранее понять, какими свойствами будут обладать наши будущие данные: будет ли, например, выборочное среднее хорошо приближать интересующий нас параметр (будет ли выполняться несмещенность, асимпт. свойства), и так далее.

Иными словами, математическая статистика работает с выборкой — набором случайных величин

\[ X_1, X_2, X_3, \ldots , X_n, \]

тогда как в результате реального эксперимента, то есть при фиксированном исходе \(\omega_0 \in \Omega\), эти случайные величины превращаются в конкретные числа — в реализацию выборки

\[ X_1(\omega _0), X_2(\omega _0), X_3(\omega _0), \ldots , X_n(\omega _0). \]

5 Популярные семейства распределений

Мы будем рассматривать два основных макросемейства (т.е. семейства семейств) моделей: групповые и экспоненциальные. Вместе они охватывают большую часть из распространенных статистических моделей.

5.1 Групповые семейства

Напомним, множество с операцией \((G, \cdot )\) называется группой, если

  1. \(G\) замкнуто относительно операции: \(g_1 \cdot g_2 \in G\) для любых \(g_1, g_2 \in G\);

  2. выполнена ассоциативность: \((g_1 \cdot g_2) \cdot g_3 = g_1 \cdot (g_2 \cdot g_3)\);

  3. существует единица: в \(G\) есть элемент, обозначаемый \(e\) или \(\operatorname {id}\), такой что \(g \cdot e = e \cdot g = g\) для любого \(g \in G\);

  4. у каждого элемента существует обратный: для любого элемента \(g \in G\) существует элемент в \(G\), обозначаемый \(g^{-1}\), такой что \(g \cdot g^{-1} = g^{-1} \cdot g = e\).

В статистике основной интерес представляют группы преобразований (с операцией композиции). Напомним, что преобразованием называется отображение множества в себя. Примеры

  • преобразования сдвига на \(\mathbb {R}\):

    \[ \operatorname {TL} := \left\{ x \mapsto a + x \; : \; a \in \mathbb {R}\right\} ; \]

    в случае \(\mathbb {R}^{m}\):

    \[ \operatorname {TL}_{m} := \left\{ \vec{x} \mapsto \vec{a} + \vec{x} \; : \; \vec{a} \in \mathbb {R}^{m}\right\} \]

  • линейные отображения на \(\mathbb {R}^{m}\):

    \[ \operatorname {GL}_m := \left\{ f: \mathbb {R}^{m} \to \mathbb {R}^{m} \; : \; f \text{ линейно и биективно}\right\} \]

    \(\operatorname {GL}_m\) называется полной линейной группой. Она, как известно, изоморфна группе невырожденных матриц порядка \(m\) с операцией умножения. А именно,

    \[ \operatorname {GL}_m = \left\{ \vec{x} \mapsto \mathbf{b}\vec{x}\; : \; \mathbf{b} \in \mathbb {R}^{m \times m} \text{ -- невырожд. матрица}\right\} \]

    Зачастую \(\operatorname {GL}_m\) отождествляют с группой матриц.

  • Подгруппа предыдущей группы:

    \[ \operatorname {GL}^+_m := \left\{ \vec{x} \mapsto \mathbf{b}\vec{x}\; : \; \mathbf{b} \in \mathbb {R}^{m \times m} , \; \operatorname {det}\mathbf{b} > 0\right\} \]

  • Все возможные композиции линейных преобразований и сдвигов (параллельных переносов). Такие преобразования называются аффинными:

    \[ \operatorname {Aff}_m := \left\{ \vec{x} \mapsto \vec{a} + \mathbf{b}\vec{x} \; : \; \vec{a} \in \mathbb {R}^{m}, \; \mathbf{b} \in \mathbb {R}^{m \times m}, \; \operatorname {det}\mathbf{b} \neq 0\right\} \]

    Также будем рассматривать ее подгруппу

    \[ \operatorname {Aff}^+_m := \left\{ \vec{x} \mapsto \vec{a} + \mathbf{b}\vec{x} \; : \; \vec{a} \in \mathbb {R}^{m}, \; \mathbf{b} \in \mathbb {R}^{m \times m}, \; \operatorname {det}\mathbf{b} > 0\right\} \]

  • Все возможные непрерывные биекции (т.е. гомеоморфизмы) на \(\mathbb {R}\). Обозначение: \(\operatorname {Homeo}(\mathbb {R})\). Можно доказать, что

    \[ \operatorname {Homeo}(\mathbb {R}) = \left\{ g \in C(\mathbb {R}) \; : \; \left[\begin{array}{ll} g \text{ строго возрастает, } & \lim \limits _{x \to \pm \infty }g(x) = \pm \infty \\ g \text{ строго убывает, } & \lim \limits _{x \to \pm \infty }g(x) = \mp \infty \\ \end{array}\right.\right\} \]

  • Подгруппа предыдущей группы: все возможные гомеоморфизмы, сохраняющие ориентацию:

    \[ \operatorname {Homeo}_+(\mathbb {R}) = \left\{ g \in C(\mathbb {R}) \; :\; g \text{ строго возрастает, } \lim \limits _{x \to \pm \infty }g(x) = \pm \infty \right\} \]

  • Подгруппа предыдущей группы: все возможные гомеоморфизмы, сохраняющие ориентацию и симметрию относительно нуля:

    \[ \operatorname {Homeo}^{\operatorname {odd}}_+(\mathbb {R}) = \left\{ g \in C(\mathbb {R}) \; :\; g \text{ нечетна, строго возрастает, } \lim \limits _{x \to \pm \infty }g(x) = \pm \infty \right\} \]

Почему это группы? Ассоциативность для произвольного набора преобразований выполнена всегда, поскольку она выполнена для композиции. Необходимо проверять 3 оставшихся свойства: замкнутость отн. композиции, наличие тождественного преобразования в наборе, наличие обратного преобразования. Последний пункт распадается на 2: нужно для каждого преобразования проверять биективность и то, что обратное отображение тоже попадает в набор.

Докажем групповые свойства на одном примере.

ExampleПример 5

Покажите, что \(\operatorname {Aff}^+_{m}\) – это действительно группа.

SolutionРешение
  • Замкнутость относительно композиции? Пусть \(\vec{a}_1, \vec{a}_2 \in \mathbb {R}^{m}\), пусть \(\mathbf{b}_1, \mathbf{b}_2 \in \mathbb {R}^{m \times m}\), \(\operatorname {det}\left(\mathbf{b}_1\right), \operatorname {det}\left(\mathbf{b}_2\right) > 0\). Пусть \(f_{i}(\vec{x}) = \vec{a}_i + \mathbf{b}_i\vec{x}\), \(i = 1, 2\). Тогда

    \[ \begin{align} (f_1 \circ f_2)(\vec{x}) & = f_1 \left(f_2(\vec{x})\right) = \vec{a}_1 + \mathbf{b}_1 \cdot \left(\vec{a}_2 + \mathbf{b}_2 \cdot \vec{x}\right) = \\ & = \vec{a}_1 + \mathbf{b}_1\vec{a}_2 + \mathbf{b}_1\mathbf{b}_2 \cdot \vec{x} \end{align} \]

    Это снова преобразование вида \(\vec{x} \mapsto \vec{a} + \mathbf{b}\vec{x}\) с \(\vec{a} = \vec{a}_1 + \mathbf{b}_1\vec{a}_2\), \(\mathbf{b} = \mathbf{b}_1\mathbf{b}_2\), причем \(\operatorname {det}\left(\mathbf{b}_1\mathbf{b}_2\right) = \operatorname {det}\left(\mathbf{b}_1\right) \cdot \operatorname {det}\left(\mathbf{b}_2\right) > 0\), т.е. \(f_1 \circ f_2 \in \operatorname {Aff}^+_m\).

  • Наличие тождественного преобразования? Достаточно взять \(\vec{a} = \vec{0}\), \(\mathbf{b} = \mathbf{e}\), где \(\mathbf{e}\) – это \(m\)-мерная единичная матрица. Действительно, \(\operatorname {det}\mathbf{e} = 1 > 0\).

  • Наличие обратного преобразования? Пусть \(f(\vec{x}) = \vec{a} + \mathbf{b}\vec{x}\), \(\operatorname {det}\left(\mathbf{b}\right) > 0\). Тогда \(\mathbf{b}\) обратима, и уравнение \(\vec{y} = \vec{a} + \mathbf{b}\vec{x}\) однозначно разрешимо относительно \(\vec{x}\):

    \[ \vec{x} = \mathbf{b}^{-1}\left(\vec{y} - \vec{a}\right) = -\mathbf{b}^{-1}\vec{a} + \mathbf{b}^{-1}\vec{y}, \]

    т.е. \(f\) – биекция и \(f^{-1}(\vec{y}) = -\mathbf{b}^{-1}\vec{a} + \mathbf{b}^{-1}\vec{y}\) – снова преобразование того же вида, причем \(\operatorname {det}\left(\mathbf{b}^{-1}\right) = \frac{1}{\operatorname {det}\left(\mathbf{b}\right)} > 0\). Значит, \(f^{-1} \in \operatorname {Aff}^+_m\).

Определение 4 Пусть \(\mu\) – это мера на измеримом пространстве \((\mathcal{X}, \mathcal{F})\), \(g: \mathcal{X} \to \mathcal{X}\) – некоторое измеримое преобразование \(\mathcal{X}\). Тогда образ меры \(\mu\) – это мера \(\mu \circ g^{-1}\), также обозначаемая \(g_{\sharp }\mu\). Иначе говоря,

\[ g_{\sharp }\mu (B) := \left(\mu \circ g^{-1}\right)(B) = \mu \left(g^{-1}(B)\right), \quad B \in \mathcal{F} \]

Определение 5 Пусть \(G\) – некоторая группа преобразований множества \(\mathcal{X}\). Семейство \(\mathcal{P}\) распределений на \(\mathcal{X}\) называется групповым семейством с группой преобразований \(G\) на \(\mathcal{X}\), если \(\mathcal{P}\) является орбитой некоторого распределения \(\mathbb {P}_0\) под действием \(G\): \[ \mathcal{P} = \left\{ g_{\sharp }\mathbb {P}_0 \; : \; g \in G\right\} . \] В частности, \(\mathcal{P}\) замкнуто относительно преобразований из \(G\) (\(g_{\sharp }\mathbb {P} \in \mathcal{P}\) для любых \(g \in G\), \(\mathbb {P} \in \mathcal{P}\)), и любые два распределения из \(\mathcal{P}\) переводятся друг в друга каким-то преобразованием из \(G\): если \(\mathbb {P}_1 = g_{1\sharp }\mathbb {P}_0\) и \(\mathbb {P}_2 = g_{2\sharp }\mathbb {P}_0\), то \(\mathbb {P}_2 = \left(g_2 g_1^{-1}\right)_{\sharp }\mathbb {P}_1\).

5.1.1 Одномерные семейства сдвига-масштаба

Пусть \(U\) – случайная величина с фиксированным распределением \(F\), имеющим (если оно существует) плотность \(f\) относительно меры Лебега. Помимо уже введенной группы сдвигов \(\operatorname {TL}\), нам понадобится группа масштабных преобразований – это в точности уже знакомая нам группа \(\operatorname {GL}^+_1\) (одномерный частный случай \(\operatorname {GL}^+_m\)):

\[ \operatorname {GL}^+_1 = \left\{ x \mapsto bx \; : \; b > 0\right\} . \]

Группа, порожденная \(\operatorname {TL}\) и \(\operatorname {GL}^+_1\) вместе, – это в точности уже знакомая нам группа

\[ \operatorname {LS} := \left\{ x \mapsto a + bx \; : \; a \in \mathbb {R}, \, b > 0\right\} = \operatorname {Aff}^+_1, \]

поэтому то, что \(\operatorname {LS}\) и \(\operatorname {GL}^+_1\) – действительно группы, по сути, уже доказано выше (это одномерные частные случаи групп \(\operatorname {Aff}^+_m\) и \(\operatorname {GL}^+_m\)).

Определение 6 Пусть \(U \sim F\).

  • Групповое семейство с группой преобразований \(\operatorname {TL}\) (т.е. \(\mathcal{P} = \left\{ g_{\sharp }\mathbb {P}_U \; : \; g \in \operatorname {TL}\right\}\)) называется семейством сдвига. Если \(X = U + a\), то

    \[ \mathbb {P}\left(X \leq x\right) = F(x - a). \]

  • Групповое семейство с группой \(\operatorname {GL}^+_1\) называется семейством масштаба. Если \(X = bU\), \(b>0\), то

    \[ \mathbb {P}\left(X \leq x\right) = F(x/b). \]

  • Групповое семейство с группой \(\operatorname {LS} = \operatorname {Aff}^+_1\) называется семейством сдвига-масштаба. Если \(X = a + bU\), то

    \[ \mathbb {P}\left(X \leq x\right) = F\left(\frac{x-a}{b}\right). \]

Если у \(F\) есть плотность \(f\), то плотность \(X = a+bU\) равна

\[ \frac{1}{b}f\left(\frac{x-a}{b}\right). \]

Ниже перечислены наиболее употребительные семейства сдвига-масштаба на \(\mathbb {R}\), которые будут неоднократно встречаться в дальнейшем.

Название Плотность Носитель Обозначение
Нормальное \(\dfrac{1}{\sqrt{2\pi}\,b}e^{-(x-a)^2/2b^2}\) \(\mathbb{R}\) \(\mathcal{N}(a,b^2)\)
Двойное экспоненциальное (Лапласа) \(\dfrac{1}{2b}e^{-|x-a|/b}\) \(\mathbb{R}\) \(DE(a,b)\)
Коши \(\dfrac{b}{\pi}\cdot\dfrac{1}{b^2+(x-a)^2}\) \(\mathbb{R}\) \(C(a,b)\)
Логистическое \(\dfrac{1}{b}\cdot\dfrac{e^{-(x-a)/b}}{\left(1+e^{-(x-a)/b}\right)^2}\) \(\mathbb{R}\) \(L(a,b)\)
Экспоненциальное \(\dfrac{1}{b}e^{-(x-a)/b}\,\mathbb{1}_{[a,+\infty)}(x)\) \((a, +\infty)\) \(E(a,b)\)
Равномерное \(\dfrac{1}{b}\,\mathbb{1}_{[a-b/2,\,a+b/2]}(x)\) \(\left(a-\dfrac{b}{2},\ a+\dfrac{b}{2}\right)\) \(U\!\left(a-\dfrac{b}{2},\ a+\dfrac{b}{2}\right)\)

(здесь \(-\infty < a < \infty\) – параметр сдвига, \(b > 0\) – параметр масштаба; связь со стандартными обозначениями распределений из теории вероятностей приведена в последних двух столбцах таблицы).

5.1.2 Многомерные семейства сдвига-масштаба

Все семейства из предыдущего пункта естественно обобщаются на случай, когда \(U\) – случайный вектор \(\vec{U} = (U_1, \ldots , U_n)\). Если \(U_1,\ldots ,U_n\) н.о.р.(например, согласно одному из распределений таблицы выше), можно рассмотреть покоординатное действие группы \(\operatorname {LS}\): \(\vec X = a \vec{1} + b\vec U\) (т.е. один и тот же элемент \(g\in \operatorname {LS}\) применяется сразу ко всем координатам). Более широкое семейство получится, если разрешить разный сдвиг и масштаб для каждой координаты:

\[ X_i = a_i + b_i U_i, \quad i = 1,\ldots ,n, \]

т.е. если использовать группу

\[ \operatorname {LS}_n := \left\{ \vec x \mapsto \vec a + \mathbf{b}\vec x \; : \; \vec a \in \mathbb {R}^{n}, \; \mathbf{b} = \operatorname {diag}(b_1,\ldots ,b_n), \; b_i > 0\right\} \subset \operatorname {Aff}_n. \]

Отдельного внимания заслуживают семейства, порожденные не покоординатным, а полным линейным преобразованием – это приводит к следующему важному примеру.

ExampleПример 6

Многомерное нормальное распределение.

SolutionРешение

Пусть \(\vec U \sim \mathscr {N}\left(\vec0, \mathbf{I}_p\right)\) (т.е. координаты \(U_i\) независимы и \(U_i \sim \mathscr {N}\left(0, 1\right)\)). Подействуем на \(\vec U\) уже знакомой нам группой \(\operatorname {Aff}_p\):

\[ \vec X = \vec a + \mathbf{b} \vec U, \qquad g(\vec x) = \vec a + \mathbf{b} \vec x \in \operatorname {Aff}_p. \]

Полученное групповое семейство – это в точности семейство всех невырожденных \(p\)-мерных нормальных распределений \(\mathscr {N}\left(\vec a, \Sigma \right)\), \(\Sigma = \mathbf{b} \mathbf{b}^T\): вектор \(\vec a\) пробегает весь \(\mathbb {R}^{p}\), а \(\mathbf{b} \mathbf{b}^T\), когда \(\mathbf{b}\) пробегает все невырожденные матрицы, пробегает в точности все положительно определенные матрицы.

Это групповое семейство устроено немного не так, как предыдущие: разные элементы группы \(\operatorname {Aff}_p\) могут порождать одно и то же распределение. А именно, \(\vec a_1 + \mathbf{b}_1 \vec U\) и \(\vec a_2 + \mathbf{b}_2 \vec U\) распределены одинаково тогда и только тогда, когда \(\vec a_1 = \vec a_2\) и \(\mathbf{b}_1 \mathbf{b}_1^T = \mathbf{b}_2 \mathbf{b}_2^T\), т.е. когда \(\mathbf{b}_2^{-1}\mathbf{b}_1\) – ортогональная матрица. Поэтому то же самое семейство распределений можно получить, ограничившись гораздо меньшей подгруппой \(G \subset \operatorname {Aff}_p\) – например, взяв в качестве \(\mathbf{b}\) только нижнетреугольные матрицы (с этим связано разложение Холецкого матрицы \(\Sigma\)).

Еще один важный пример – линейная модель (в частности, линейная регрессия, которую мы подробно обсудим позже). Пусть \(\vec U = (U_1,\ldots ,U_n)\) имеет фиксированное распределение (чаще всего, \(U_i\) н.о.р.\(\sim \mathscr {N}\left(0, 1\right)\)), и пусть

\[ X_i = a_i + bU_i, \quad i=1,\ldots ,n, \]

где вектор сдвига \(\vec a = (a_1,\ldots ,a_n)\) обязан лежать в некотором фиксированном \(s\)-мерном подпространстве \(\Omega \subset \mathbb {R}^{n}\) (т.е. \(a_i = \sum_{j=1}^s d_{ij}\beta_j\) для некоторой известной матрицы \(D=(d_{ij})\) ранга \(s\) и произвольных \(\beta_j \in \mathbb {R}\)), а масштаб \(b>0\) – общий для всех координат. Соответствующая группа преобразований

\[ \left\{ \vec x \mapsto \vec a + b\vec x \; : \; \vec a \in \Omega , \; b > 0\right\} \]

– подгруппа \(\operatorname {Aff}_n\). В нормальном случае совместная плотность \(\vec X\) имеет вид

\[ \frac{1}{(\sqrt{2\pi }b)^n}\exp \left[-\frac{1}{2b^2}\sum _{i=1}^n (x_i - a_i)^2\right], \qquad \vec a \in \Omega . \]

5.1.3 (*) Непараметрические групповые семейства

В отличие от предыдущих двух пунктов, где семейства фактически параметризовались небольшим числом чисел (\(a\) и \(b\); элементами \(\vec a\) и \(\mathbf{b}\)), группы преобразований могут порождать и гораздо более “бедные” на структуру, непараметрические семейства.

ExampleПример 7

Непараметрическое н.о.р.  семейство.

SolutionРешение

Пусть \(U_1,\ldots ,U_n\) независимы и одинаково распределены с некоторым фиксированным непрерывным распределением, носитель которого – вся числовая прямая (например, \(\mathscr {N}\left(0, 1\right)\)). Рассмотрим уже знакомую нам группу \(\operatorname {Homeo}_+(\mathbb {R})\) строго возрастающих гомеоморфизмов \(\mathbb {R}\) на себя, действующую одинаково на каждую координату: \[ X_i = g(U_i), \quad i = 1,\ldots ,n, \qquad g \in \operatorname {Homeo}_+(\mathbb {R}). \] Величины \(X_1,\ldots ,X_n\) по-прежнему н.о.р., с некоторой общей функцией распределения \(F_g\). Соответствующее групповое семейство \(\left\{ F_g \; : \; g \in \operatorname {Homeo}_+(\mathbb {R})\right\}\) совпадает с классом всех непрерывных распределений с носителем \(\mathbb {R}\) (т.е. с непрерывной строго возрастающей на \(\mathbb {R}\) функцией распределения) – никакого конечномерного параметра здесь уже нет.

ExampleПример 8

Симметричные распределения.

SolutionРешение

Ограничим группу из предыдущего примера до подгруппы нечетных функций – это в точности уже определенная выше группа \(\operatorname {Homeo}_+^{\operatorname {odd}}(\mathbb {R})\). Тогда \(X_i = g(U_i)\), \(g\in \operatorname {Homeo}_+^{\operatorname {odd}}(\mathbb {R})\), порождает класс всех распределений с носителем \(\mathbb {R}\), симметричных относительно нуля. Если дополнительно разрешить сдвиг, т.е. рассмотреть \[ X_i = a + g(U_i), \quad a \in \mathbb {R}, \; g \in \operatorname {Homeo}_+^{\operatorname {odd}}(\mathbb {R}), \] то получится класс всех распределений с носителем \(\mathbb {R}\), симметричных относительно (неизвестной) точки \(a\). Такие семейства часто используются в задачах об оценивании центра симметрии, когда сама форма распределения не считается известной.

Аналогично можно строить и другие непараметрические групповые семейства. Например, если взять \(U_i\) н.о.р.\(\operatorname {U}[0,1]\), а в качестве \(g\) – все возрастающие непрерывные биекции \((0,1)\) на себя с \(g(0)=0\), \(g(1)=1\) (это тоже группа преобразований), а затем добавить сдвиг-масштаб \(X_i = a + bg(U_i)\), получится класс всех непрерывных распределений, носителем которых является некоторый интервал.

Отдельный, третий тип групповых семейств возникает в выборочных обследованиях (survey sampling). Пусть имеется конечная генеральная совокупность из \(N\) элементов со значениями \(v_1,\ldots ,v_N\), и случайная выборка размера \(n\) без возвращения дает пары «значение-номер» \((U_1,J_1),\ldots ,(U_n,J_n)\) (все \(\binom {N}{n}\) вариантов выбора равновероятны). Группа сдвигов

\[ X_i = U_i + a_{J_i}, \quad i=1,\ldots ,n, \qquad (a_1,\ldots ,a_N) \in \mathbb {R}^{N}, \]

превращает эту модель в групповое семейство: при \(y_i = v_i + a_i\) пары \((X_1,J_1),\ldots ,(X_n,J_n)\) – это просто случайная выборка без возвращения из совокупности \((y_1,1),\ldots ,(y_N,N)\) с произвольными (неизвестными) значениями \(y_i\).

5.2 Экспоненциальные семейства

Определение 7 Пусть есть доминируемый набор распределений \(\mathcal{P} = \left\{ \mathbb {P}_{\theta }, \theta \in \Theta \subset \mathbb {R}^{k}\right\}\). Пусть \(p_\theta\) – обобщенная плотность распределения \(\mathbb {P}_{\theta }, \; \theta \in \Theta\). Т.е. есть некоторая фиксированная мера \(\mu\) на \(\mathbb {R}\), такая, что \(\mathbb {P}_\theta (dx) = p_\theta (x) \mu (dx)\). Как правило, \(\mu\) – это мера Лебега \(\lambda\) (тогда \(\mathcal{P}\) – набор непрерывных распределений) или считающая мера \(\#\) на \(\mathbb {Z}\) (тогда \(\mathcal{P}\) – набор дискретных распределений).

Говорят, что набор \(\mathcal{P}\) принадлежит к экспоненциальному семейству, если “обобщенная” плотность распределения \(\mathbb {P}_{\theta }\) имеет вид

\[ p_{\theta }(x)=h(x) \exp \left(\sum _{i=1}^{k} a_{i}(\theta ) u_{i}(x)+v(\theta )\right) . \tag{1}\]

Обратите внимание, что число слагаемых вида \(a_{i}(\theta ) u_{i}(x)\) в экспоненте не должно превосходить размерность параметрического множества. Кроме того, носитель распределения не может зависеть от параметра.

Заметим, что нормальное, экспоненциальное, биномиальное, пуассоновское и многие распределения (наборы параметризованных распределений) принадлежат к экспоненциальному семейству. Обратите внимание, что экспоненциальное распределение – лишь частный случай экспоненциального семейства.

ExampleПример 9

Докажите, что нормальное распределение \(\mathscr {N}\left(\mu , \sigma^2\right), \; \theta = (\mu , \sigma^2)^T \in \Theta = \mathbb {R} \times \mathbb {R}_+ \subset \mathbb {R}^{2}\) является экспоненциальным семейством.

SolutionРешение

Занесем множитель \(\frac{1}{\sqrt{2\pi \sigma^2}}\) под экспоненту (через логарифм) и раскроем квадрат в показателе: \[ \begin{align} p_{\theta }(x) & = \frac{1}{\sqrt{2 \pi \sigma ^2}}e^{-\frac{(x-\mu )^2}{2\sigma ^2}} = \exp \left(-\frac{(x-\mu )^2}{2\sigma ^2} - \frac{1}{2}\ln (2\pi \sigma ^2)\right) = \\ & = \exp \left(-\frac{x^2 - 2\mu x + \mu ^2}{2\sigma ^2} - \frac{1}{2}\ln (2\pi \sigma ^2)\right) = \\ & = \exp \left(-\frac{1}{2\sigma ^2}x^2 + \frac{\mu }{\sigma ^2}x - \frac{\mu ^2}{2\sigma ^2} - \frac{1}{2}\ln (2\pi \sigma ^2)\right) \end{align} \] Отсюда \[ \begin{align} \alpha _1(\theta ) & = -\frac{1}{2\sigma ^2} , \; u_1(x) = x^2 \\ \alpha _2(\theta ) & = \frac{\mu }{\sigma ^2} , \; u_2(x) = x \\ v(\theta ) & = - \frac{\mu ^2}{2\sigma ^2} - \frac{1}{2}\ln (2\pi \sigma ^2) \end{align} \]

Название Плотность в стандартном виде Стандартная параметризация Стандартное парам. мн-во Плотность в виде из определения выше Каноническая параметризация Каноническая парам. мн-во \(k\) Носитель Обозначение
Гамма \(\dfrac{1}{\Gamma(a)b^a}x^{a-1}e^{-x/b}\) \((a,b)\) \((0,+\infty)^2\) \(\mathbb{1}_{(0,+\infty)}(x)\exp\left[(a-1)\ln x - \dfrac{x}{b} - \ln\Gamma(a) - a\ln b\right]\) \(\alpha_1 = a-1,\ \alpha_2 = -\dfrac{1}{b}\) \((-1,+\infty)\times(-\infty,0)\) 2 \((0,+\infty)\) \(\Gamma(a,b)\)
Хи-квадрат \(\dfrac{1}{\Gamma(f/2)2^{f/2}}x^{f/2-1}e^{-x/2}\) \((f)\) \((0,+\infty)\) \(e^{-x/2}\mathbb{1}_{(0,+\infty)}(x)\exp\left[\left(\dfrac{f}{2}-1\right)\ln x - \ln\Gamma\!\left(\dfrac{f}{2}\right) - \dfrac{f}{2}\ln 2\right]\) \(\alpha_1 = \dfrac{f}{2} - 1\) \((-1,+\infty)\) 1 \((0,+\infty)\) \(\chi^2_f\)
Бета \(\dfrac{\Gamma(a+b)}{\Gamma(a)\Gamma(b)}x^{a-1}(1-x)^{b-1}\) \((a,b)\) \((0,+\infty)^2\) \(\mathbb{1}_{(0,1)}(x)\exp\left[(a-1)\ln x + (b-1)\ln(1-x) + \ln\Gamma(a+b) - \ln\Gamma(a) - \ln\Gamma(b)\right]\) \(\alpha_1 = a-1,\ \alpha_2 = b-1\) \((-1,+\infty)^2\) 2 \((0,1)\) \(B(a,b)\)
Бернулли \(p^x(1-p)^{1-x}\) \((p)\) \((0,1)\) \(\exp\left[x\ln\dfrac{p}{1-p} + \ln(1-p)\right]\) \(\alpha_1 = \ln\dfrac{p}{1-p}\) \(\mathbb{R}\) 1 \(\{0,1\}\) \(\mathrm{Ber}(p)\)
Биномиальное \(\dbinom{n}{x}p^x(1-p)^{n-x}\) \((p)\); \(n\) известно \((0,1)\) \(\dbinom{n}{x}\exp\left[x\ln\dfrac{p}{1-p} + n\ln(1-p)\right]\) \(\alpha_1 = \ln\dfrac{p}{1-p}\) \(\mathbb{R}\) 1 \(\{0,1,\ldots,n\}\) \(\mathrm{Bin}(p, n)\)
Пуассоновское \(\dfrac{\lambda^x}{x!}e^{-\lambda}\) \((\lambda)\) \((0,+\infty)\) \(\dfrac{1}{x!}\exp\left[x\ln\lambda - \lambda\right]\) \(\alpha_1 = \ln\lambda\) \(\mathbb{R}\) 1 \(\{0,1,\ldots\}\) \(\mathrm{Pois}(\lambda)\)
Отрицательное биномиальное \(\dbinom{m+x-1}{m-1}p^m q^x\) \((p)\); \(m\) известно \((0,1)\) \(\dbinom{m+x-1}{m-1}\exp\left[x\ln(1-p) + m\ln p\right]\) \(\alpha_1 = \ln(1-p)\) \((-\infty,0)\) 1 \(\{0,1,\ldots\}\) \(Nb(p,m)\)

(первые три строки — плотности относительно меры Лебега, последние четыре — относительно считающей меры; \(q := 1-p\). Столбец \(k\) — размерность семейства, т.е. число слагаемых \(\alpha_i(\theta)u_i(x)\) в определении выше; «каноническая параметризация» — это как раз величины \(\alpha_i(\theta)\) из этого определения, а «каноническая парам. мн-во» — множество значений, которое вектор \((\alpha_1(\theta),\ldots,\alpha_k(\theta))\) пробегает, когда \(\theta\) пробегает стандартное парам. мн-во.)

Часто вместо \(\theta\) бывает удобно параметризовать семейство непосредственно величинами \(\eta_i := a_i(\theta )\), \(i=1,\ldots ,k\), – их называют естественными (каноническими) параметрами. В этих обозначениях плотность Уравнение 1 принимает каноническую форму

\[ p(x \mid \eta ) = h(x)\exp \left(\sum _{i=1}^k \eta _i u_i(x) + v(\eta )\right), \qquad \eta = (\eta _1,\ldots ,\eta _k) \in \mathbb {R}^{k}. \]

Множество

\[ \Xi := \left\{ \eta \in \mathbb {R}^{k} \; : \; \int e^{\sum _{i=1}^k \eta _i u_i(x)} h(x)\, \mu (dx) < \infty \right\} \]

называется естественным параметрическим множеством: это в точности множество тех \(\eta\), для которых можно подобрать нормирующую добавку \(v(\eta )\), чтобы \(p(x\mid \eta )\) была плотностью. Можно показать, что \(\Xi\) всегда выпукло.

Обратите внимание, что представление Уравнение 1 не единственно: например, можно домножить \(u_i\) на константу \(c \neq 0\), одновременно поделив \(\eta_i\) на \(c\); более общо, можно делать одновременные (одинаковые) линейные преобразования наборов \((u_1,\ldots ,u_k)\) и \((\eta_1,\ldots ,\eta_k)\).

ExampleПример 10

В \(n\) независимых испытаниях с \(s+1\) возможными исходами вероятность \(i\)-го исхода равна \(p_i\), \(i=0,1,\ldots ,s\) (\(\sum_{i=0}^s p_i = 1\)). Пусть \(X_i\) – число испытаний, закончившихся исходом \(i\); вектор \((X_0,\ldots ,X_s)\) имеет полиномиальное (мультиномиальное) распределение \(M(p_0,\ldots ,p_s;n)\): \[ \mathbb {P}\left(X_0=x_0,\ldots ,X_s=x_s\right) = \frac{n!}{x_0!\cdots x_s!}\, p_0^{x_0}\cdots p_s^{x_s}. \] Докажите, что это \(s\)-мерное (а не \((s+1)\)-мерное!) экспоненциальное семейство.

SolutionРешение

Перепишем вероятность как \[ \frac{n!}{x_0!\cdots x_s!}\exp \left(x_0\ln p_0 + \ldots + x_s \ln p_s\right). \] Поскольку испытания складываются в \(n\), т.е. \(x_0 = n - x_1 - \ldots - x_s\), экспоненту можно переписать так, чтобы там участвовали только \(x_1,\ldots ,x_s\): \[ x_0 \ln p_0 + \sum _{i=1}^s x_i \ln p_i = n\ln p_0 + \sum _{i=1}^s x_i \ln \frac{p_i}{p_0}. \] Значит, \[ \mathbb {P}\left(X_0=x_0,\ldots ,X_s=x_s\right) = \frac{n!}{x_0!\cdots x_s!}\exp \left(\sum _{i=1}^s \eta _i x_i + v(\eta )\right), \] где \(\eta_i = \ln (p_i/p_0)\), \(u_i(x)=x_i\), \(i=1,\ldots ,s\), а \(v(\eta ) = n\ln p_0 = -n\ln \left(1+\sum_{i=1}^s e^{\eta_i}\right)\) (последнее равенство – следствие условия \(\sum_i p_i=1\)). Это действительно \(s\)-мерное семейство: несмотря на то, что исходов \(s+1\), линейное ограничение \(\sum_i x_i = n\) на статистики “срезает” одно измерение.

Не всякое представление вида Уравнение 1 экономно – этим и объясняется оговорка в определении о том, что число слагаемых “не должно превосходить размерность параметрического множества”.

Определение 8  

  • Пусть \(X \sim \mathbb {P}_\theta\). Параметр \(\theta\) называется неразличимым (unidentifiable) по \(X\), если найдутся \(\theta_1 \neq \theta_2\) такие, что \(\mathbb {P}_{\theta_1} = \mathbb {P}_{\theta_2}\).

  • Если статистики \(u_1,\ldots ,u_k\) либо параметры \(\eta_1(\theta ),\ldots ,\eta_k(\theta )\) связаны линейным соотношением, число слагаемых в Уравнение 1 можно сократить; в противном случае представление называется минимальным, а само семейство – полноранговым (full rank).

Именно линейная независимость \(\eta_1(\theta ), \ldots , \eta_k(\theta )\) (т.е. полноранговость) и есть то условие, которое требуется в теореме ниже. Если же параметры \(\eta_i(\theta )\), формально образуя \(k\)-мерное семейство, на самом деле как функции \(\theta\) лежат на подмногообразии меньшей размерности, представление не минимально; такое семейство называют криволинейным (curved) экспоненциальным семейством.

ExampleПример 11

Покажите, что нормальное семейство \(\mathscr {N}\left(\xi , \xi^2\right)\), \(\xi > 0\) (т.е. \(\sigma = \xi\) в примере выше), формально задается двумя каноническими параметрами, но фактически является криволинейным одномерным экспоненциальным семейством.

SolutionРешение

Подставляя \(\mu =\xi , \sigma^2=\xi^2\) в пример выше, получаем \[ p_\xi (x) = \exp \left(\frac1\xi x - \frac{1}{2\xi ^2}x^2 - \frac12\right)\cdot \frac{1}{\sqrt{2\pi }\, \xi }. \] Формально это по-прежнему запись вида Уравнение 1 с \(k=2\), \(\eta_1(\xi )=1/\xi\), \(\eta_2(\xi )=-1/(2\xi^2)\). Однако \(\theta =\xi\) здесь всего один параметр, и точка \((\eta_1,\eta_2)\) при варьировании \(\xi\) пробегает не открытое подмножество плоскости, а одномерную кривую \(\eta_2 = -\eta_1^2/2\). Представление не минимально – семейство криволинейное, и, в частности, теорема ниже к нему неприменима.

Теорема 1 (об экспоненциальных семействах) Пусть \(\theta \in \Theta \subset \mathbb {R}^{k}\) и для семейства распределений \(\left\{ \mathbb {P}_{\theta }, \theta \in \Theta \right\}\) выполнено условие Уравнение 1. Пусть, кроме того, множество всех значений вектора \(\left(a_{1}(\theta ), \ldots , a_{k}(\theta )\right)\) при \(\theta \in \Theta\) содержит \(k\)-мерный шар пространства \(\mathbb {R}^{k}\). Тогда \(S(X)=\left(\overline{u_{1}(X)}, \ldots , \overline{u_{k}(X)}\right)\) – полная достаточная статистика.

Для нормального распределения, например, статистика \((\overline{X}, \overline{X^2})\) будет полной и достаточной. Заметим также, что любая биективная функция сохраняет полноту и достаточность. Т.е., например, для нормального распределения статистика \((\overline{X}, s^2) = (\overline{X}, \overline{X^2} - \overline{X}^2)\) тоже будет полной и достаточной.

Стоит заметить, что условие теоремы будет выполнено, если множество \(\Theta\) “телесно”, т.е. содержит свои внутренние точки, и функции \(a_{1}(\theta ), \ldots , a_{k}(\theta )\) в окрестности какой-нибудь внутренней точки \(\theta_{0} \in \Theta\) линейно независимые и гладкие.

5.2.1 Замкнутость относительно выборки

Экспоненциальная структура устойчива относительно объединения независимых наблюдений. А именно, если \(X\) и \(Y\) независимы и их плотности записаны в каноническом виде с одним и тем же набором естественных параметров \(\eta\):

\[ p(x\mid \eta ) = h(x)\exp \left(\sum _{i=1}^k \eta _i T_i(x) + v(\eta )\right), \qquad q(y\mid \eta ) = g(y)\exp \left(\sum _{i=1}^k \eta _i U_i(y) + w(\eta )\right), \]

то совместное распределение пары \((X,Y)\) снова является \(k\)-мерным экспоненциальным семейством с теми же \(\eta\), а статистики при этом складываются: \(T_i(x) + U_i(y)\). По индукции это переносится на любое (конечное) число независимых слагаемых.

В частности, если \(X_1,\ldots ,X_n\) – выборка (н.о.р.) из семейства Уравнение 1, то совместная плотность выборки равна

\[ \exp \left(\sum _{i=1}^k a_i(\theta )\sum _{j=1}^n u_i(X_j) + nv(\theta )\right)\prod _{j=1}^n h(X_j) = \exp \left(n\sum _{i=1}^k a_i(\theta )\overline{u_i(X)} + nv(\theta )\right)\prod _{j=1}^n h(X_j), \]

т.е. выборка тоже образует \(k\)-мерное экспоненциальное семейство – с тем же числом параметров \(k\), не зависящим от объема выборки \(n\)! – и его естественными статистиками служат в точности \(\overline{u_1(X)},\ldots ,\overline{u_k(X)}\). Это как раз статистики, из которых составлена \(S(X)\) в теореме выше: теорема утверждает, что при полноранговости они не просто достаточны, но и полны.

5.2.2 Моменты в каноническом виде

Каноническая форма записи позволяет находить моменты статистик \(u_i(X)\) без явного интегрирования – прямо по функции \(v(\eta )\).

Утверждение 1 (Моменты через \(v(\eta )\)) Пусть плотность \(X\) имеет канонический вид \(p(x\mid \eta ) = h(x)\exp \left(\sum_{i=1}^k \eta_i u_i(x) + v(\eta )\right)\), а \(\eta\) – внутренняя точка естественного параметрического множества \(\Xi\). Тогда \[ \mathbb {E}_{\eta }\left[u_j(X)\right] = -\frac{\partial v(\eta )}{\partial \eta _j}, \qquad \operatorname {Cov}\left[u_j(X), u_k(X)\right] = -\frac{\partial ^2 v(\eta )}{\partial \eta _j \partial \eta _k}. \]

Доказывается это дифференцированием по \(\eta_j\) тождества \(\int p(x\mid \eta )\, \mu (dx) = 1\) (законность дифференцирования под знаком интеграла здесь не обсуждаем):

\[ \int u_j(x)\, p(x\mid \eta )\, \mu (dx) + \frac{\partial v(\eta )}{\partial \eta _j} \underbrace{\int p(x\mid \eta )\, \mu (dx)}_{=1} = 0 \quad \Longrightarrow \quad \mathbb {E}_{\eta }\left[u_j(X)\right] = -\frac{\partial v(\eta )}{\partial \eta _j}. \]

Формула для ковариации получается ещё одним дифференцированием, теперь уже по \(\eta_k\) (проделайте это самостоятельно).

ExampleПример 12

Пуассоновское распределение \(\operatorname {Pois}\left(\lambda \right)\), \(\lambda > 0\), можно записать в каноническом виде с \(\eta = \ln \lambda\), \(u(x) = x\), \(v(\eta ) = -e^{\eta }\). Пользуясь утверждением Утверждение 1, найдите \(\mathbb {E}\left[X\right]\) и \(\operatorname {Var}\left[X\right]\) для \(X \sim \operatorname {Pois}\left(\lambda \right)\).

SolutionРешение

Действительно, \(\mathbb {P}\left(X=x\right) = \frac{\lambda^x}{x!}e^{-\lambda } = \frac{1}{x!}\exp \left(x\ln \lambda - \lambda \right)\), откуда видно, что \(h(x)=1/x!\), \(\eta =\ln \lambda\), \(u(x)=x\), \(v(\eta ) = -\lambda = -e^{\eta }\). По утверждению Утверждение 1, \[ \mathbb {E}\left[X\right] = -v'(\eta ) = e^{\eta } = \lambda , \qquad \operatorname {Var}\left[X\right] = -v''(\eta ) = e^{\eta } = \lambda , \] что совпадает с хорошо известными формулами \(\mathbb {E}\left[X\right] = \operatorname {Var}\left[X\right] = \lambda\) для пуассоновского распределения – но получено без единого интегрирования или суммирования ряда.

Ниже перечислены еще несколько классических одно- и двупараметрических экспоненциальных семейств.

Семейство нормальных распределений \(\mathscr {N}\left(\xi , \sigma^2\right)\) при фиксированном \(\sigma\) – это одновременно и (одномерное) семейство сдвига, и экспоненциальное семейство. Оказывается, эти два примера, по существу, исчерпывают все семейства, обладающие сразу обоими свойствами: Дынкин (1951) и Фергюсон (1962) показали, что экспоненциальными семействами сдвига являются в точности \(\mathscr {N}\left(\xi , \sigma^2\right)\) (по параметру \(\xi\), при фиксированном \(\sigma\)) и \(c\ln Y\), где \(Y \sim \Gamma (a,b)\), \(\theta = \ln b\) – параметр сдвига, а \(c \neq 0\) – произвольная фиксированная константа. Так экспоненциальные и групповые (сдвига-масштаба) семейства – два, на первый взгляд, независимых способа построения моделей – оказываются тесно связаны между собой.

5.3 Прочие семейства

Закончим примером, показывающим, что не всякое естественное параметрическое семейство – групповое или экспоненциальное.

ExampleПример 13

Пусть \(X\) имеет распределение Пуассона с избытком нулей (zero-inflated Poisson, ZIP) с параметрами \(\pi \in [0,1)\), \(\lambda >0\): с вероятностью \(\pi\) наблюдается «структурный» нуль, а с вероятностью \(1-\pi\) – значение из \(\operatorname {Pois}\left(\lambda \right)\). То есть \[ p_\theta (0) = \pi + (1-\pi )e^{-\lambda }, \qquad p_\theta (k) = (1-\pi )\frac{\lambda ^k}{k!}e^{-\lambda }, \; k=1,2,\ldots , \] где \(\theta = (\pi ,\lambda ) \in \Theta = [0,1) \times (0,+\infty )\). Такая модель часто используется для счетных данных с «избыточным» числом нулей (число обращений к врачу, число страховых случаев и т.п.): часть наблюдений – гарантированные нули (скажем, часть застрахованных вообще не подвержена риску), а остальные ведут себя как обычный пуассоновский счетчик.

Образует ли семейство \(\mathcal{P}_{\mathrm{ZIP}} = \left\{ \mathrm{ZIP}(\theta ) \; : \; \theta \in \Theta \right\}\) групповое семейство? Если да – укажите порождающую группу преобразований; если нет – докажите это.

SolutionРешение

Нет, не образует. Установим сначала общий факт, который затем и применим.

Пусть \(\mathcal X\) – счетное множество (здесь \(\mathcal X = \left\{ 0,1,2,\ldots \right\}\)) и \(g: \mathcal X \to \mathcal X\) – произвольное \(1{:}1\) преобразование. В дискретном случае на \(g\) не накладывается никаких дополнительных ограничений вроде непрерывности или монотонности (в отличие от \(\mathbb {R}\), любая биекция счетного множества с дискретной топологией автоматически непрерывна). Если \(Q = g_{\sharp }P\), то по определению \(q(g(x)) = p(x)\) для всех \(x \in \mathcal X\), т.е. плотность \(q\) – это плотность \(p\) с переставленными (по правилу \(g\)) точками, в которых она принимает значения. Значит, мультимножество значений \(\left\{ p(x) \; : \; x \in \mathcal X\right\}\) не меняется при действии любой биекции \(g\), а с ним не меняется и любая симметричная функция от него, например

\[ M(P) := \sup _{x \in \mathcal X} p(x). \]

Если \(\mathcal P\) – групповое семейство с группой \(G\), т.е. \(\mathcal P = \left\{ g_\sharp \mathbb {P}_0 \; : \; g \in G\right\}\) для некоторого \(\mathbb {P}_0 \in \mathcal P\), то для любых \(P_1 = g_{1\sharp }\mathbb {P}_0,\, P_2 = g_{2\sharp }\mathbb {P}_0 \in \mathcal P\) элемент \(g := g_2 g_1^{-1} \in G\) переводит \(P_1\) в \(P_2\). Отсюда получаем полезный общий принцип: для группового семейства на счетном \(\mathcal X\) величина \(M(P)\) должна быть одной и той же для всех \(P \in \mathcal P\).

Проверим это для \(\mathcal P_{\mathrm{ZIP}}\), взяв два конкретных члена семейства.

  • \(\theta_1 = (0,1)\) (обычное \(\operatorname {Pois}\left(1\right)\), без избытка нулей): \(p_{\theta_1}(0) = p_{\theta_1}(1) = e^{-1} \approx 0{,}368\), и это максимум (при \(k\geq 2\) значения \(p_{\theta_1}(k)\) только убывают). Значит, \(M(P_{\theta_1}) = e^{-1} \approx 0{,}368\).

  • \(\theta_2 = (1/2,1)\): \(p_{\theta_2}(0) = \frac12 + \frac12 e^{-1} \approx 0{,}684\), тогда как \(p_{\theta_2}(k) = \frac12 p_{\theta_1}(k) \leq \frac12 e^{-1} \approx 0{,}184\) при \(k \geq 1\). Значит, \(M(P_{\theta_2}) = p_{\theta_2}(0) \approx 0{,}684\).

Итак, \(M(P_{\theta_1}) \neq M(P_{\theta_2})\), хотя оба \(\theta_1,\theta_2 \in \Theta\). По принципу выше, никакая биекция \(\mathcal X \to \mathcal X\) не может перевести \(\mathrm{ZIP}(\theta_1)\) в \(\mathrm{ZIP}(\theta_2)\) – а значит, тем более не найдется группы преобразований \(G\), которая связала бы эти два распределения. Семейство \(\mathcal P_{\mathrm{ZIP}}\) не является групповым.

Содержательно это неудивительно: параметр \(\pi\) отвечает не за симметричное преобразование носителя (как сдвиг или масштаб), а за подмешивание вырожденного распределения \(\delta_0\), которое качественно меняет форму распределения, а не просто переставляет его значения – мода \(\operatorname {Pois}\left(\lambda \right)\) может находиться в любой точке \(\lfloor \lambda \rfloor\), а у ZIP с большим \(\pi\) вся масса стягивается к точке \(0\) независимо от \(\lambda\).

Сноски

  1. \(\xi\) может быть и случайным вектором, принимающим значения в \(\mathbb {R}^{k}\), с неизвестным \(k\)-мерным распределением \(\mathbb {P}\). В этом случае модель строится аналогично. Далее, для простоты изложения, теория излагается для одномерного случая.↩︎

  2. Напомним, что отображение называется измеримым, если для любого множества \(A \in \mathcal{E}\) выполнено \(\left\{ x \; : \; S(x) \in A\right\} \in \mathscr {B}\left(\mathbb {R}^{n}\right)\)↩︎

  3. Можно даже доказать, что выборку бесконечного размера из произвольного распределения можно задать на \(([0,1], \mathscr {B}\left([0,1]\right), \operatorname {U}[0,1])\).↩︎