Ковариация, сходимости случайных величин, предельные теоремы
Этот конспект ещё находится в процессе редактуры: в тексте могут встречаться опечатки, неточности и локально не проработанные места. Если что-то нашли — сообщите, пожалуйста, автору (контакты на странице курса).
1 Ковариация, корреляция
Корреляция является в некотором смысле мерой зависимости случайных величин \(\xi , \eta\). Так, если случайные величины \(\xi , \eta\) независимы, то \(\operatorname {Corr}\left[ \xi , \eta \right] =0\). Если же \(\operatorname {Corr}\left[ \xi , \eta \right] = \pm 1\), то случайные величины линейно зависимы.
Свойства ковариации
Ковариация симметрична: \(\operatorname {Cov}\left[ \xi , \eta \right] = \operatorname {Cov}\left[ \eta , \xi \right]\);
Ковариация билинейна:
\[ \begin{align} \operatorname {Cov}\left[ a_1\xi _1 + a_2\xi _2, \eta \right] & = a_1\operatorname {Cov}\left[ \xi _1, \eta \right] + a_2 \operatorname {Cov}\left[ \xi _2, \eta \right] \\ \operatorname {Cov}\left[ \xi , b_1\eta _1 + b_2\eta _2 \right] & = b_1\operatorname {Cov}\left[ \xi , \eta _1 \right] + b_2 \operatorname {Cov}\left[ \xi , \eta _2 \right] \end{align} \]
\(\operatorname {Cov}\left[ \xi , \xi \right] = \operatorname {Var}\left[\xi \right]\);
\(\operatorname {Cov}\left[ \xi , \eta \right] = \mathbb {E}\left[\xi \eta \right] - \mathbb {E}\left[\xi \right]\mathbb {E}\left[\eta \right]\);
если \(\xi , \eta\) независимы, то \(\operatorname {Cov}\left[ \xi , \eta \right]=0\);
если \(c\in \mathbb {R}\) – некоторая константа, то \(\operatorname {Cov}\left[ \xi + c, \eta \right] = \operatorname {Cov}\left[ \xi , \eta \right]\);
\(\operatorname {Var}\left[\xi_{1}+\ldots +\xi_{n}\right]=\operatorname {Var}\left[\xi_{1}\right]+\ldots +\operatorname {Var}\left[\xi_{n}\right]+\sum_{i \neq j} \operatorname {Cov}\left[ \xi_i, \xi_j \right]\).
2 Индикаторный метод
3 Сходимости случайных величин
В предельных теоремах, ради которых затевается эта глава (ЗБЧ, ЦПТ, закон редких событий – см. следующий раздел), участвуют два вида сходимости последовательностей случайных величин: сходимость по вероятности и сходимость по распределению. Определим их, пользуясь только теми средствами, которые у нас уже есть: вероятностями событий и функциями распределения.
3.1 Сходимость по вероятности
Смысл: с ростом \(n\) случайная величина \(\xi_n\) всё реже отклоняется от \(\xi\) больше, чем на любую наперёд заданную ошибку \(\varepsilon\). Именно эта сходимость появится в ЗБЧ: среднее арифметическое \(\frac{S_n}{n}\) сходится по вероятности к матожиданию.
Обратите внимание: чтобы выражение \(\left|\xi_n - \xi \right|\) имело смысл, случайные величины \(\xi_n\) и \(\xi\) обязаны быть заданы на одном и том же \(\Omega\).
3.2 Сходимость по распределению
Второй вид сходимости отвечает на другой вопрос: не <<близки ли значения \(\xi_n\) и \(\xi\) как функций на \(\Omega\)>>, а <<похоже ли распределение \(\xi_n\) на распределение \(\xi\)>>. Так, в ЦПТ утверждается, что распределение нормированной суммы приближается к нормальному распределению; сами случайные величины при этом ни к какой конкретной случайной величине не <<прижимаются>> – сходятся именно их распределения.
Распределение на \(\mathbb {R}\) полностью описывается своей функцией распределения (см. главу о случайных величинах и функции распределения), поэтому сходимость распределений естественно определять через сходимость функций распределения. Единственная тонкость – в каких точках требовать сходимость. Рассмотрим пример: пусть \(\xi_n \equiv \frac{1}{n}\) – константные случайные величины. Разумно ожидать, что \(\xi_n\) сходятся (в любом осмысленном смысле) к \(\xi \equiv 0\). Посмотрим на функции распределения:
\[ F_{\xi _n}(x) = \; \mathbb {1}_{x \geq \tfrac {1}{n}} \xrightarrow [n \to \infty ]{} \begin{cases} 1, & x > 0 \\ 0, & x \leq 0\end{cases}, \qquad \text{при этом} \qquad F_{\xi }(x) = \; \mathbb {1}_{x \geq 0} \]
Пределы совпадают всюду, кроме единственной точки \(x = 0\): \(F_{\xi_n}(0) = 0 \not\to 1 = F_{\xi }(0)\). Заметим, что \(x=0\) – это в точности точка разрыва (скачка) предельной функции распределения. Чтобы такие естественные примеры не ломали определение, в точках разрыва предельной \(F\) сходимость не требуют.
Поскольку в определении участвуют только функции распределения, случайные величины \(\xi_1, \xi_2, \ldots\) и \(\xi\) могут быть заданы на совершенно разных вероятностных пространствах – в отличие от сходимости по вероятности. По той же причине вместо предельной случайной величины можно указывать сразу предельное распределение и писать, например, \(\xi_n \xrightarrow [n \to \infty ]{d} \mathscr {N}\left(0, 1\right)\) (так мы и сделаем в ЦПТ).
3.3 Связь двух сходимостей
3.4 Взгляд вперёд: сходимость на языке мер (необязательное)
сходимость распределений как мерweak-convergence Определение сходимости по распределению через функции распределения – рабочее, но выглядит привязанным к прямой \(\mathbb {R}\): в \(\mathbb {R}^{n}\) и тем более в бесконечномерных пространствах функций распределения в привычном виде нет, а сходимость распределений определять нужно. <<Правильное>> определение формулируется на языке самих распределений, т.е. вероятностных мер, и опирается на понятия, которые мы строго введём лишь в главах о системах множеств и борелевской сигма-алгебре–о мере Лебега (борелевские множества, мера на сигма-алгебре). Этот подраздел – необязательный анонс: при первом чтении его можно пропустить и вернуться после глав о теории меры.
Предположим, у нас есть последовательность распределений (вероятностных мер) \(\mathbf{P}_1, \mathbf{P}_2, \ldots\) на \((\mathbb {R}, \mathscr {B}\left(\mathbb {R}\right))\). Говорят, что эта последовательность сильно сходится (или сходится помножественно, т.е. сходится на каждом множестве) к распределению \(\mathbf{P}\), если
\[ \mathbf{P}_{n}\left(B\right) \xrightarrow [n \to \infty ]{} \mathbf{P}\left(B\right), \quad \forall B \in \mathscr {B}\left(\mathbb {R}\right) \]
Обозначение:
\[ \mathbf{P}_n \xrightarrow [n \to \infty ]{s} \mathbf{P}, \]
от англ. strong (сильный).
Сильная сходимость не очень удобна. Например, если \(\mathbf{P}_n = \delta_{1/n}\), т.е. это единичные массы в точках \(\frac{1}{n}\), то такая последовательность сильно никуда не сходится, в частности, она не сходится к \(\delta_0\). Действительно, если взять \(B = \left\{ 0\right\}\), то
\[ \delta _{1/n}(\left\{ 0\right\} ) = 0 \not\to 1 = \delta _{0}(\left\{ 0\right\} ) \]
при \(n \to \infty\). (Сравните с примером \(\xi_n \equiv \frac{1}{n}\) выше: это те же самые распределения!) В связи с этим вводят слабую сходимость. Говорят, что \(\mathbf{P}_1, \mathbf{P}_2, \ldots\) слабо сходятся к \(\mathbf{P}\), если
\[ \mathbf{P}_{n}\left(B\right) \xrightarrow [n \to \infty ]{} \mathbf{P}\left(B\right), \quad \forall B \in \mathscr {B}\left(\mathbb {R}\right), \; \mathbf{P}\left(\partial B\right) = 0 \]
Отличие от сильной сходимости в том, что теперь мы должны проверять сходимость не на всех борелевских множествах, но только на т.н. множествах непрерывности для \(\mathbf{P}\), т.е. на таких множествах, предельная мера границы которых равна \(0\). Обозначение:
\[ \mathbf{P}_n \xrightarrow [n \to \infty ]{w} \mathbf{P}, \]
от англ. weak (слабый).
Интегралы во втором пункте – это интегралы Лебега по мерам \(\mathbf{P}_n\), \(\mathbf{P}\); их мы построим в главе о построении интеграла Лебега. Обратите внимание на третий пункт: именно его мы приняли выше за определение сходимости по распределению. Т.е. наша <<элементарная>> сходимость через функции распределения – это в точности слабая сходимость распределений:
\[ \xi _{n} \xrightarrow [n \to \infty ]{d} \xi \quad \iff \quad \mathbf{P}_{\xi _n} \xrightarrow [n \to \infty ]{w} \mathbf{P}_{\xi } \]
На языке случайных величин теорема выше переписывается так.
4 Предельные теоремы
4.1 Закон больших чисел
Пусть даны \(\xi_1, \xi_2, \ldots\) – независимые одинаково распределенные случайные величины (сокращенно НОРСВ) с матожиданием \(\mu := \mathbb {E}\left[\xi_1\right]\). Закон больших чисел (ЗБЧ) обуславливает сходимость их среднего арифметического \(\frac{S_n}{n}\) к \(\mu\), где \(S_n = \xi_1 + \ldots + \xi_n\).
Есть много разных вариантов ЗБЧ. Мы сформулируем ЗБЧ в самой простой формулировке.
Статус честности: ЗБЧ мы сейчас докажем полностью строго – с той оговоркой, что свойства матожидания и дисперсии, используемые в доказательстве (линейность, дисперсия суммы независимых), мы обосновали пока только для дискретных распределений (см. долг @debt:expectation). После главы о свойствах интеграла Лебега доказательство станет честным в полной общности – ни одна его строчка при этом не изменится.
Для доказательства нам понадобятся следующие известные оценки.
Оба неравенства будут доказаны в общем виде в главе о свойствах интеграла Лебега, когда матожидание станет интегралом Лебега. Для дискретных случайных величин, впрочем, всё доказывается уже сейчас.
4.2 Доказательство ЗБЧ
Рассмотрим \(\frac{1}{n}S_n = \frac{1}{n}\sum_{k=1}^n X_k\). По линейности матожидания имеем \[ \mathbb {E}\left[\frac{1}{n}S_n\right] = \mu . \] Найдём дисперсию: \[ \operatorname {Var}\left[\frac{1}{n}S_n\right] = \frac{1}{n^2}\operatorname {Var}\left[\sum _{k=1}^n X_k\right] \] Так как \(X_k\) независимы и одинаково распределены, \[ \operatorname {Var}\left[\sum _{k=1}^n X_k\right] = n \cdot \operatorname {Var}\left[X_1\right] = n\sigma ^2. \] Следовательно, \[ \operatorname {Var}\left[\frac{1}{n}S_n\right] = \frac{\sigma ^2}{n}. \] По неравенству Чебышева для любого \(\varepsilon > 0\): \[ \mathbb {P}\! \left(\left|\frac{1}{n}S_n - \mu \right| \geq \varepsilon \right) \leq \frac{\operatorname {Var}\left[\frac{1}{n}S_n\right]}{\varepsilon ^2} = \frac{1}{n^2} \cdot \frac{\operatorname {Var}\left[S_n\right]}{\varepsilon ^2} = \frac{1}{n^2} \cdot \frac{n \sigma ^2}{\varepsilon ^2} = \frac{\sigma ^2}{n\varepsilon ^2}. \] Правая часть стремится к \(0\) при \(n \to \infty\), откуда следует, что \[ \frac{1}{n}S_n \xrightarrow {\mathbb {P}} \mu . \] Так как предел константа, то имеем также сходимость по распределению. Теорема доказана.
Заметим, что некоторые условия из ЗБЧ можно ослабить.
Вместо независимости требовать некоррелированность. Действительно, независимость нам была нужна, чтобы представить дисперсию суммы как сумму дисперсий. Но для этого достаточно попарной некоррелированности.
Вместо одинаковой распределенности требовать, чтобы
матожидания сходились к какой-то константе \(\mu\): \(\mathbb {E}\left[X_n\right] \to \mu\) при \(n \to \infty\)
дисперсии были равномерно ограниченны: существует \(M > 0\), такое что \(\operatorname {Var}\left[X_n\right] \leq M\) для всех \(n \in \mathbb {N}\)
(проверьте самостоятельно, что это действительно так)
Если формулировать ЗБЧ как
\[ \frac{1}{n} \left(S_n - \mathbb {E}\left[S_n\right]\right) \xrightarrow [n \to \infty ]{d,\mathbb {P}} 0 \]
то вместо \(\frac{1}{n}\) можно брать \(\frac{1}{n^{\alpha }}\), \(\alpha > 0.5\) – произвольное.
Пусть \(Y_i = X_i - \mathbb {E}\left[X_i\right]\). Тогда \(\mathbb {E}\left[Y_i\right] = 0\), \(\operatorname {Var}\left[Y_i\right] = \operatorname {Var}\left[X_i\right]\), \[ S_n - \mathbb {E}\left[S_n\right] = \sum _{i=1}^n X_i - \mathbb {E}\left[\sum _{i=1}^n X_i \right] = \sum _{i=1}^n Y_i \] Далее, по неравенству Чебышева, \[ \begin{align} \mathbb {P}\left(\left|\frac{1}{n^{\alpha }}\left(S_n - \mathbb {E}\left[S_n\right]\right) \right| > \varepsilon \right) & = \mathbb {P}\left(\left|\frac{1}{n^{\alpha }}\sum _{i=1}^n Y_i\right| > \varepsilon \right) \leq \frac{1}{n^{2\alpha }} \cdot \frac{\operatorname {Var}\left[\sum _{1}^n Y_i\right]}{\varepsilon ^2} = \frac{1}{n^{2\alpha }} \cdot \frac{\sum _{1}^n\operatorname {Var}\left[ Y_i\right]}{\varepsilon ^2} \leq \\ & \leq \frac{M}{n^{2\alpha - 1} \varepsilon ^2} \to 0 \end{align} \] Дисперсия суммы распалась в сумму дисперсий благодаря некоррелированности.
4.3 Центральная предельная теорема
Центрируем и нормируем \(X_i\): \(Y_i := \frac{X_i - \mu }{\sigma }\) (тогда \(\mathbb {E}\left[Y_i\right] = 0\), \(\operatorname {Var}\left[Y_i\right] = 1\)). Тогда для \(\tilde{S}_n = Y_1 + \ldots + Y_n\) ЦПТ будет выглядеть так:
\[ \frac{\tilde{S}_n}{\sqrt{n}} \xrightarrow [n \to \infty ]{d} \mathscr {N}\left(0, 1\right) \]
Отличие ЦПТ от ЗБЧ в том, что в ЗБЧ сумма \(S_n\) скалируется на \(n\), а в ЦПТ на \(\sqrt{n}\).
Статус честности: ЦПТ мы принимаем без доказательства, причём этот долг будет возвращён не в нашем курсе, а в следующем – в курсе теории вероятностей. Стандартное доказательство использует аппарат характеристических функций, который сам строится на интеграле Лебега (глава о построении интеграла Лебега) от комплекснозначных функций. Здесь ЦПТ для нас – витрина: она показывает, ради каких результатов возводится вся машинерия второй части курса. Отметим также, что предельный объект – нормальное распределение \(\mathscr {N}\left(0, 1\right)\) – это распределение с плотностью, т.е. строго определить его мы сможем тоже только после построения интеграла (см. долг @debt:densities); пока понимаем \(\Phi (x)\) как <<площадь под колоколом Гаусса от \(-\infty\) до \(x\)>> в смысле интеграла Римана.
Неформально: если нам дана последовательность НОРСВ \(X_1,X_2, \ldots\) с матожиданием \(\mu\) и дисперсией \(\sigma^2\), то
\[ \operatorname {Law}(S_n) = \mathbf{P}_{S_n} \approx \mathscr {N}\left(n\mu , n\sigma ^2\right) \]
где \(\operatorname {Law}(S_n)\), \(\mathbf{P}_{S_n}\) – различные обозначения распределения \(S_n = X_1 + X_2 + \ldots + X_n\).
4.4 Закон редких событий
Теорема Пуассона кратко:
\[ \operatorname {Bin}(n,p_n) \xrightarrow [n \to \infty ]{w} \operatorname {Pois}(\lambda ) \quad \text{ если } \lambda := \lim _{n \to \infty }np_n > 0 \]
Статус честности: в отличие от ЦПТ, закон редких событий полностью доказуем уже сейчас, элементарными средствами – это единственная предельная теорема этой главы, у которой долгов нет вовсе.
4.5 ЦПТ VS ЗРС
Рассмотрим распределение \(\operatorname {Bin}(n,p)\). В каких случаях использовать аппроксимацию из ЦПТ, а в каких из ЗРС? При сравнительно большом \(\lambda := np\) (обычно при \(\lambda > 9\)) для аппроксимации \(\operatorname {Bin}(n,p)\) используется нормальное распределение:
\[ \operatorname {Bin}(n,p) \approx \mathscr {N}\left(np, np(1-p)\right) \]
При малых \(\lambda = np\) (\(\lambda < 9\)) для аппроксимации можно использовать пуассоновское распределение:
\[ \operatorname {Bin}(n,p) \approx \operatorname {Pois}(\lambda ) \]
5 Итог трёх недель: инвентаризация долгов
Первые три главы построены на честном фундаменте лишь частично. Всюду, где пространство исходов не более чем счётно, наши определения и доказательства полны. Но в общем случае мы набрали долгов – и вся вторая часть курса будет их планомерным возвратом:
| Долг~ \(\ref{debt:borel-lebesgue}\): что такое борелевские множества и мера Лебега (длина, площадь)? Почему нельзя измерять множества? | Главы~ –: системы множеств, мера, теорема Каратеодори, мера Лебега |
| Долг~ \(\ref{debt:measurability}\): что такое измеримость случайной величины? | Глава~ : измеримые функции |
| Долг~ \(\ref{debt:cdf-defines-distrib}\): почему функция распределения однозначно задаёт распределение? | Главы~ –: теорема Каратеодори, мера Лебега–Стилтьеса |
| Долг~ \(\ref{debt:densities}\): что такое плотность и непрерывные распределения? | Главы~ – (интеграл Лебега) и глава~ (теорема Радона–Никодима) |
| Долг~ \(\ref{debt:expectation}\): что такое\(\mathbb {E}\left[\xi \right]\) для произвольной случайной величины? Почему матожидание линейно? | Главы~ –: интеграл Лебега и его свойства (в т.ч. неравенство Маркова в общем виде) |
| Долг~ \(\ref{debt:weak-convergence}\): что такое сходимость распределений <<по-настоящему>>, на языке мер? | Главы~ – дают язык мер; сходимости измеримых функций – глава~ |
| ЦПТ принята без доказательства | Следующий курс (теория вероятностей): характеристические функции |
Начиная со следующей главы мы забудем на время про вероятность и займёмся фундаментом: множествами, которые можно измерять, и мерами на них.