Лебеговы пространства \(L^p(\mu )\)
Этот конспект ещё находится в процессе редактуры: в тексте могут встречаться опечатки, неточности и локально не проработанные места. Если что-то нашли — сообщите, пожалуйста, автору (контакты на странице курса).
До сих пор мы работали с интегралом Лебега по фиксированной измеримой функции. Сейчас мы посмотрим на множество измеримых функций как на единый объект – векторное пространство – и снабдим его нормой
\[ \left\| f\right\| _{p} = \left(\int \left|f\right|^p \, d\mu \right)^{1/p}. \]
Это доставляет нам пространства \(L^p(\mu )\) – главный герой этой главы и одни из важнейших примеров бесконечномерных функциональных пространств во всём анализе, теории вероятностей, математической статистике и теории случайных процессов. Например:
случайные величины с конечным вторым моментом образуют пространство \(L^2(\mathbb {P})\), а \(L^2\)-геометрия (ортогональность, проекции, наилучшее приближение в среднеквадратичном) – это в точности язык, на котором формулируются условное математическое ожидание и линейная регрессия;
сходимость в \(L^p\) – один из основных видов сходимости случайных величин, наряду со сходимостью п.в. и по вероятности;
в математической статистике асимптотика оценок часто изучается через \(L^p\)-сходимость, а многие статистические критерии опираются на эмпирические процессы, естественно живущие в банаховых пространствах непрерывных функций;
в теории случайных процессов сами траектории процесса (скажем, броуновского движения) – это, как правило, элементы некоторого функционального банахова пространства (типично \(C[0,T]\)), и вопросы сходимости распределений процессов формулируются как сходимость вероятностных мер именно на таком пространстве.
Чтобы разобраться с \(L^p(\mu )\) по-настоящему, нам понадобятся две дополнительные структуры, которым посвящены §2 и §3 этой главы: структура банахова пространства (полнота – без нее не работали бы предельные переходы, необходимые для сходимости в \(L^p\) и для функциональных предельных теорем в теории случайных процессов) и, для случая \(p=2\) отдельно, структура гильбертова пространства (геометрия ортогональности и проекций – на ней держится, например, определение условного математического ожидания). Изложение этой главы следует (Axler 2020 г., гл. 6–8), хотя мы существенно сократим материал про теорему Бэра – это тема отдельного курса функционального анализа, здесь мы лишь обозначим её существование.
1 Определение и основные свойства \(L^p(\mu )\)
1.1 Определения: пространство интегрируемых функций \(\mathcal{L}^p(\mu )\) и фактор-пространство \(L^p(\mu )\)
Зафиксируем пространство с мерой \((X, \mathcal F, \mu )\) и число \(0 < p \leq \infty\).
Слово “норма” в определении Определение 1 пока условно: как мы увидим, \(\left\| \cdot \right\|_{p}\) часто не является нормой на \(\mathcal L^p(\mu )\) в строгом смысле – нарушена положительная определенность. А именно, если существует непустое множество \(E \in \mathcal{F}\) такое, что \(\mu (E)=0\), то \(p\)-норма индикаторной функции \(\; \mathbb {1}_{E}\) нулевая, при этом сама эта функция отлична от нуля. Следовательно, в этом случае форма \(\left\| \cdot \right\|_{p}\) не является положительно определенной (не выполняется \(\left\| f\right\|_{p} = 0 \iff f = 0_{V}\)), т.е. она не является нормой на \(V = \mathcal{L}^p(\mu )\). Стандартный способ решения этой проблемы — отождествить функции, которые отличаются только на множестве с \(\mu\)-мерой \(0\).
Множество \(\mathcal{Z}(\mu )\) замкнуто относительно умножения на скаляры. Кроме того, \(\mathcal{Z}(\mu )\) замкнуто относительно сложения, поскольку объединение двух множеств с \(\mu\)-мерой \(0\) является множеством с мерой \(\mu\) \(0\). Таким образом, \(\mathcal{Z}(\mu )\) является подпространством в \(\mathcal{L}^p(\mu )\).
Обратите внимание, что если \(f, g \in \mathcal{L}^p(\mu )\), то \([f] = [g]\) тогда и только тогда, когда \(f(x)=g(x)\) для почти всех \(x \in X\).
Предположим, что \(\mu\) — мера, и \(0<p \leq \infty\).
Пусть \(L^p(\mu )\) обозначает совокупность подмножеств \(\mathcal{L}^p(\mu )\), определяемую соотношением
\[ L^p(\mu )=\left\{ [f] \; : \; f \in \mathcal{L}^p(\mu )\right\} . \]
\([f], [g] \in L^p(\mu )\) и \(\alpha \in \mathbb {F}\) определим \([f]+[g]\) и \(\alpha [f]\) следующим образом:
\[ [f]+[g]=[f + g] \quad \text{ и } \quad \alpha [f]= [\alpha f]. \]
Элементы \(L^p(\mu )\) можно рассматривать как классы эквивалентности функций в \(\mathcal{L}^p(\mu )\), где две функции эквивалентны, если они совпадают почти всюду.
В функциональном анализе часто элементы \(L^p(\mu )\) называют функциями, где две функции считаются равными, если они различаются только на множестве с мерой \(\mu\) \(0\). Это злоупотребление обозначениями безвредно при условии, что операции, выполняемые с такими «функциями», дают одинаковые результаты при изменении функций на множестве с мерой \(0\).
Обратите внимание на типографское различие между \(\mathcal{L}^p(\mu )\) и \(L^p(\mu )\). Элемент каллиграфического \(\mathcal{L}^p(\mu )\) — это функция; элемент \(L^p(\mu )\) — это множество функций, любые две из которых совпадают почти всюду.
Предположим, что \(\mu\) — мера, и \(0<p \leq \infty\). Определим \(\| \cdot \|_p\) на \(L^p(\mu )\) следующим образом:
\[ \| [f]\| _p := \| f\| _p \]
где \(f \in \mathcal{L}^p(\mu )\) – произвольный представитель из \([f]\). Обратите внимание, что если \(f, g \in \mathcal{L}^p(\mu )\) и \([f] = [g]\), то \(\left\| f\right\|_{p} = \left\| g\right\|_{p}\). Таким образом, приведённое выше определение корректно: оно не зависит от конкретного представителя.
Для читателей, знакомых с факторпространствами: вы можете заметить, что \(L^p(\mu )\) — это факторпространство
\[ \mathcal{L}^p(\mu ) / \mathcal{Z}(\mu ). \]
1.2 Неравенства Гёльдера и Минковского
Теперь неравенство Минковского, восполняющее ту самую “недостачу” константы \(2^p\) из леммы Лемма 1.
1.3 Включения между \(L^p\)-пространствами. Неравенство Ляпунова
На пространствах конечной меры (в частности, на вероятностных пространствах) \(L^p\)-пространства вложены друг в друга – и притом в направлении, которое поначалу может показаться неожиданным: чем больше \(p\), тем меньше пространство.
Это (в частности) объясняет, почему в теории вероятностей существование более высоких моментов – более сильное требование: например, если \(\mathbb {E}\left[X^4\right]<\infty\), то автоматически \(\mathbb {E}\left[X^2\right]<\infty\) и \(\mathbb {E}\left[\left|X\right|\right]<\infty\), но не наоборот.
Само собой, включение \(L^t\subset L^s\) (\(s<t\)) в общем случае строгое: в \(L^s([0,1])\) (по мере Лебега) есть функции, не лежащие в \(L^t([0,1])\).
На пространствах бесконечной меры (например, со считающей мерой) ситуация с включениями ровно противоположная.
Напомним (следствие Следствие 1), что \(L^p(\mu )\) уже известно нам как нормированное пространство. В частности, при \(\mu = \#\) (считающая мера на \(\mathbb {N}\)) \(L^p(\# ) = \mathcal L^p(\# ) = \ell^p\) – никакого перехода к классам эквивалентности не требуется, поскольку у считающей меры нет множеств нулевой меры, кроме пустого (ср. пример Пример 1).
2 Банахово пространство \(L^p(\mu )\)
Слово “норма” в предыдущем разделе было оправдано (неравенство Минковского). Но чтобы говорить о сходимости в \(L^p(\mu )\) – а тем более о том, что предел вообще существует, а не только о том, что записана формула нормы, – нужно понять абстрактное понятие полноты. Это классическая тема функционального анализа – банаховы пространства; применим её здесь к нашему главному объекту, пространству \(L^p(\mu )\).
2.1 Метрические пространства: необходимый минимум
Стандартный пример – это \(\mathbb {R}^{n}\) с \(d(x,y) = \left|x-y\right|\). Но нас будут интересовать в первую очередь метрики на пространствах функций: скажем, на множестве непрерывных функций \(C[a,b]\) можно положить \(d(f,g) = \sup_{x \in [a,b]}\left|f(x)-g(x)\right|\).
Как и в \(\mathbb {R}\), каждая сходящаяся последовательность является последовательностью Коши (неравенство треугольника). Обратное, вообще говоря, неверно – и именно те пространства, где оно верно, будут нас интересовать.
Например, \(\mathbb {R}\) (с обычной метрикой) полно – это, по сути, аксиома полноты действительных чисел, известная из курса анализа. А вот \(\mathbb {Q}\) не полно: последовательность рациональных чисел, приближающая \(\sqrt2\) (скажем, десятичные приближения), является последовательностью Коши в \(\mathbb {Q}\), но не сходится ни к какому рациональному числу.
Больше о метрических пространствах (открытые/замкнутые множества, компактность и т.д.) нам не понадобится – всё, что нужно, это понятия предела, последовательности Коши и полноты, применённые к пространствам функций.
2.2 Нормированные и банаховы пространства
Напомним, что векторное пространство над полем \(\mathbb F\) (у нас \(\mathbb F = \mathbb {R}\) или \(\mathbb F = \mathbb {C}\)) – это множество с операциями сложения и умножения на скаляр, удовлетворяющими стандартным аксиомам (коммутативность и ассоциативность сложения, существование нуля и противоположного элемента, аксиомы для умножения на скаляр). В интересующих нас примерах \(V\) всегда будет некоторым пространством функций \(X \to \mathbb F\) с поточечными операциями, где все аксиомы векторного пространства можно легко проверить.
Всякое нормированное пространство автоматически становится метрическим:
Таким образом, все понятия предыдущего параграфа (предел, последовательность Коши, полнота) автоматически переносятся на нормированные пространства: например, \(f_k \to f\) означает \(\left\| f_k - f\right\| \to 0\), а последовательность Коши – это последовательность, для которой \(\left\| f_j - f_k\right\| \to 0\) при \(j,k \to \infty\).
Разберемся, какие из наших примеров – банаховы пространства.
Второе утверждение (банаховость с любой нормой) следует из стандартного факта линейной алгебры: все нормы на конечномерном пространстве эквивалентны, т.е. для любых двух норм \(\left\| \cdot \right\|_a, \left\| \cdot \right\|_b\) на \(\mathbb {R}^{n}\) найдутся константы \(0<c\leq C\), такие что \(c\left\| x\right\|_a \leq \left\| x\right\|_b \leq C \left\| x\right\|_a\) для всех \(x\); эквивалентные нормы порождают одни и те же последовательности Коши, так что полнота относительно одной нормы равносильна полноте относительно любой другой.
А что с бесконечномерными пространствами функций? Здесь выбор нормы уже принципиально важен.
Идея доказательства: покоординатный (точнее, поточечный) предел последовательности Коши в \(\left\| \cdot \right\|_{\infty }\) существует в каждой точке \(x\in [a,b]\) (числовая последовательность Коши в \(\mathbb F\)), и сходимость Коши в равномерной норме превращается в равномерную сходимость \(f_k \to f\); равномерный предел непрерывных функций непрерывен – стандартный факт математического анализа.
2.3 зачем это нужно теории случайных процессов
Пространство \(C[a,b]\) возникает в теории вероятностей не только как учебный пример нормированного пространства, но и как фазовое пространство случайного процесса с непрерывными траекториями. Скажем, траектория броуновского движения на \([0,T]\) – это (почти наверное) непрерывная функция, т.е. случайный элемент пространства \(C[0,T]\). Многие центральные результаты теории случайных процессов и математической статистики – это утверждения о сходимости по распределению случайных элементов пространства \(C[0,T]\): скажем, принцип инвариантности Донскера (функциональная центральная предельная теорема) утверждает, что нормированные траектории случайного блуждания сходятся по распределению к траектории броуновского движения именно в смысле слабой сходимости вероятностных мер на банаховом пространстве \((C[0,T], \left\| \cdot \right\|_{\infty })\). Полнота этого пространства (только что доказанная теорема) – необходимая техническая предпосылка для того, чтобы такая сходимость вообще была содержательно определена: нужно уметь говорить о пределе последовательности траекторий как о новой траектории, а не только о пределе значений в каждой точке по отдельности. В математической статистике то же самое пространство (или его аналог \(D[0,1]\) со скачками – пространство Скорохода) – естественная среда обитания для эмпирических процессов, лежащих в основе многих непараметрических статистических критериев.
А вот с \(L^1\)-нормой на том же пространстве непрерывных функций все ломается.
Следующий критерий полноты формально аналогичен критерию абсолютной сходимости числовых рядов и будет для нас основным техническим инструментом при доказательстве полноты \(L^p(\mu )\) ниже.
(Идея: направление “банахово \(\Rightarrow\) ряды сходятся” – частичные суммы образуют последовательность Коши по неравенству треугольника; обратное направление – любую последовательность Коши можно проредить до подпоследовательности с геометрически убывающими расстояниями между соседними членами, представить её как частичные суммы ряда и применить условие теоремы, что и даёт сходимость.)
2.4 Линейные функционалы. Теорема Хана–Банаха
Множество ограниченных линейных функционалов на \(V\) называется сопряженным (двойственным) пространством и обозначается \(V'\); это само по себе нормированное (и даже банахово) пространство с нормой \(\left\| \varphi \right\| = \sup \left\{ \left|\varphi (f)\right|: \left\| f\right\| \leq 1\right\}\).
Существование разрывных линейных функционалов на бесконечномерных пространствах – это, как ни странно, довольно тонкий факт, требующий базиса Гамеля и леммы Цорна (мы не будем на этом останавливаться). Гораздо более полезен для анализа следующий результат – о существовании непрерывных (=ограниченных) функционалов “в достаточном количестве”.
Одно из самых полезных следствий теоремы Хана–Банаха – то, что на любом нетривиальном нормированном пространстве достаточно много функционалов, чтобы “чувствовать” норму любого вектора.
Действительно, достаточно определить \(\psi\) на одномерном подпространстве \(U = \left\{ \alpha f: \alpha \in \mathbb F\right\}\) формулой \(\psi (\alpha f) = \alpha \left\| f\right\|\) (тогда \(\left\| \psi \right\| =1\), \(\psi (f)=\left\| f\right\|\)) и продолжить по теореме Хана–Банаха.
Тема линейных функционалов и банаховых пространств гораздо шире описанного здесь: есть еще теорема Бэра о категориях и ее следствия – теорема об открытом отображении, теорема о замкнутом графике, принцип равномерной ограниченности (принцип Банаха–Штейнгауза). Эти результаты составляют ядро классического функционального анализа, но выходят за рамки нашего курса; желающие могут ознакомиться с ними, например, в (Axler 2020 г., разд. 6E) или в любом учебнике по функциональному анализу.
2.5 Полнота: теорема Рисса–Фишера
Вот теперь мы можем воспользоваться критерием полноты через ряды (теорема Теорема 6) и получить одно из важнейших свойств \(L^p\)-пространств.
(Идея, для \(1\leq p<\infty\): по критерию Теорема 6 достаточно взять произвольный ряд \(\sum_k g_k\) с \(\sum_k\left\| g_k\right\|_{p}<\infty\) и предъявить его сумму. Мажоранта \(G:=\sum_k\left|g_k\right|\) лежит в \(\mathcal L^p(\mu )\) по неравенству Минковского и теореме о монотонной сходимости, значит конечна п.в.; там, где она конечна, ряд \(\sum_k g_k(x)\) сходится абсолютно к некоторому \(f(x)\), и \(\left|f-F_N\right|^p\leq G^p\) дает по теореме о мажорируемой сходимости \(\left\| f-F_N\right\|_{p}\to 0\).)
2.6 Плотность простых функций
2.7 Сходимость в \(L^p\) и другие виды сходимости
Сходимость \(f_n \to f\) в \(L^p(\mu )\) (т.е. \(\left\| f_n-f\right\|_{p}\to 0\)) – третий вид сходимости измеримых функций, который мы встречаем в курсе (после сходимости п.в. и сходимости по мере из главы о сходимостях измеримых функций). Как эти сходимости связаны?
В частности, по теореме Ф. Рисса о сходимости по мере (глава о сходимостях измеримых функций), из \(L^p\)-сходимости следует существование подпоследовательности, сходящейся к \(f\) п.в. – полностью аналогично тому, как это было со сходимостью по мере. Обратное, разумеется, неверно: сходимость п.в. (и даже равномерная сходимость) не обязана влечь \(L^p\)-сходимость без дополнительных условий (мажорируемости и т.п.) – вспомните контрпримеры к лемме Фату и теореме о мажорируемой сходимости из главы о свойствах интеграла Лебега.
3 Гильбертово пространство \(L^2(\mu )\)
В §2 мы ввели банаховы пространства и, в частности, пространства \(L^p(\mu )\) с нормой \(\left\| \cdot \right\|_{p}\). Среди всех \(L^p(\mu )\) особое место занимает случай \(p=2\): именно тогда норма порождается некоторой билинейной (в комплексном случае – полуторалинейной) формой – скалярным произведением, и в пространстве, помимо длин, появляется геометрия углов и ортогональности. Такие (полные) пространства называются гильбертовыми.
Главная причина, по которой они нам понадобятся в курсе теории вероятностей, статистики и случайных процессов: условное математическое ожидание \(\mathbb {E}\left[X\mid \mathcal G\right]\) для \(X\in L^2\) есть в точности ортогональная проекция \(X\) на замкнутое подпространство \(L^2(\Omega ,\mathcal G,\mathbb {P})\). Мы вернемся к этому наблюдению ниже, сразу после того как докажем теорему о проекции – главный результат этого раздела.
3.1 Скалярное произведение
Из аксиом 2-3 несложно вывести линейность по второму аргументу с сопряжением: \(\left\langle f, g+h \right\rangle = \left\langle f, g \right\rangle +\left\langle f, h \right\rangle\), \(\left\langle f, \alpha g \right\rangle = \bar\alpha \left\langle f, g \right\rangle\).
Все примеры этого курса, идущие из теории вероятностей, вещественны, поэтому везде далее в этом разделе мы полагаем \(\mathbb F=\mathbb {R}\), если явно не оговорено иное. В этом случае аксиома 3 превращается в обычную симметрию \(\left\langle f, g \right\rangle = \left\langle g, f \right\rangle\), а все сопряжения в формулах ниже можно просто убрать. Все определения и теоремы этого раздела дословно переносятся на комплексный случай (с появлением черты комплексного сопряжения там, где это уместно); мы будем изредка отмечать это в замечаниях.
Примеры.
Пусть \((X,\mathcal F,\mu )\) – пространство с мерой. На \(L^2(\mu )\) определим
\[ \left\langle f, g \right\rangle := \int fg \; d\mu . \]
Это корректно определено: по неравенству Гёльдера при \(p=q=2\) (доказанному в §1) для \(f,g\in L^2(\mu )\) выполнено \(\int \left|fg\right|\; d\mu \leq \left\| [\right\| 2]f\cdot \left\| [\right\| 2]g <\infty\), так что интеграл \(\int fg\; d\mu\) абсолютно сходится и конечен. Скалярное произведение \(\left\langle f, g \right\rangle = \int fg\, d\mu\) – это в точности та форма, которая порождает норму \(\left\| \cdot \right\|_{2}\) из §1 (см. ниже определение нормы, порожденной скалярным произведением). Это главный для нас пример: почти всё, что нам понадобится далее из теории вероятностей, – частный случай именно этого пространства.
Взяв \(\mu = \#\) – считающую меру на \(\left\{ 1,\ldots ,n\right\}\) – получаем \(\mathbb {R}^{n}\) со стандартным скалярным произведением \(\left\langle (a_1,\ldots ,a_n), (b_1,\ldots ,b_n) \right\rangle = \sum_{i=1}^n a_ib_i\).
Взяв \(\mu =\#\) – считающую меру на \(\mathbb {N}\) – получаем \(\ell^2 := \left\{ (a_k)_{k=1}^\infty \; : \; \sum_k a_k^2 <\infty \right\}\) со скалярным произведением \(\left\langle (a_k), (b_k) \right\rangle = \sum_{k=1}^\infty a_kb_k\).
В комплексном случае (\(\mathbb F=\mathbb {C}\)) те же три примера дают \(\mathbb {C}^{n}\), \(\ell^2\) и \(L^2(\mu )\) над \(\mathbb {C}\) со скалярными произведениями \(\left\langle f, g \right\rangle = \int f\overline g\; d\mu\) и т.д. (черта – комплексное сопряжение).
Из аксиомы 1 сразу следует \(\left\| f\right\| \geq 0\) и \(\left\| f\right\| = 0 \iff f=0\); из линейности и эрмитовой симметрии – однородность \(\left\| \alpha f\right\| = \left|\alpha \right|\left\| f\right\|\) (проверьте: \(\left\| \alpha f\right\|^2 = \left\langle \alpha f, \alpha f \right\rangle = \alpha \bar\alpha \left\langle f, f \right\rangle = \left|\alpha \right|^2\left\| f\right\|^2\)). Осталось неравенство треугольника – оно последует из следующего фундаментального неравенства.
В комплексном случае доказательство почти дословно повторяется: нужно взять \(t=\overline{\left\langle f, g \right\rangle }/\left\| g\right\|^2 \in \mathbb {C}\) вместо вещественного параметра (эквивалентно – применить только что доказанный вещественный случай к паре \(f, e^{i\theta }g\) для такого \(\theta\), что \(\left\langle f, e^{i\theta }g \right\rangle \in \mathbb {R}\)).
Геометрически: сумма квадратов диагоналей параллелограмма равна сумме квадратов всех его сторон. Тождество параллелограмма – это ровно то свойство нормы, которое отличает нормы, порожденные скалярным произведением, от произвольных норм: можно показать (мы не будем это доказывать – см. Axler, упражнение 8A.16), что норма на векторном пространстве порождена некоторым скалярным произведением тогда и только тогда, когда она удовлетворяет тождеству параллелограмма.
Примеры. \(\mathbb {R}^{n}\) и \(\ell^2\) со стандартными скалярными произведениями – гильбертовы пространства (полнота – стандартный факт линейной алгебры / анализа). Главный для нас пример: \(L^2(\mu )\) – гильбертово пространство для любого пространства с мерой \((X,\mathcal F,\mu )\), поскольку оно уже известно нам как полное (теорема Рисса–Фишера из §2), а его норма \(\left\| \cdot \right\|_{2}\) порождена скалярным произведением \(\left\langle f, g \right\rangle =\int fg\; d\mu\), введенным выше.
3.2 Ортогональность. Теорема о проекции
(Пункты (b)–(d) – прямые следствия определения; в (a) линейность также очевидна, а замкнутость следует из непрерывности скалярного произведения: если \(h_n\in U^\perp\), \(h_n\to h\), то \(\left|\left\langle g, h \right\rangle \right|=\left|\left\langle g, h-h_n \right\rangle \right|\leq \left\| g\right\| \left\| h-h_n\right\| \to 0\) по неравенству Коши–Буняковского–Шварца для любого \(g\in U\).)
Каждое линейное подпространство выпукло (проверьте!), но не наоборот (например, шар).
Следующая теорема – технический центр этого раздела. Именно в ней впервые по-настоящему используется полнота: без нее (т.е. в произвольном пространстве со скалярным произведением, не гильбертовом) утверждение, вообще говоря, неверно – ближайшей точки может не существовать.
Специализируем теорему о проекции на случай, когда \(U\) – замкнутое линейное подпространство (а не просто выпуклое множество). Именно этот случай нам понадобится для теоремы Рисса и (в дальнейшем курсе теории вероятностей) для условного математического ожидания.
(Идея: (a) следует из того, что \(P_Uf\) минимизирует \(\left\| f-\cdot \right\|\) вдоль всей прямой \(P_Uf+\alpha g\subset U\), \(\alpha \in \mathbb {R}\) – квадратичная функция от \(\alpha\) с минимумом в \(0\) обязана иметь нулевую производную там, что и дает ортогональность. (b) – переформулировка (a): характеристическое свойство “\(f-h\perp U\)” однозначно определяет \(h=P_Uf\). (c) – линейность \(P_U\) следует из (b), примененного к \(h=P_Uf_1+\alpha P_Uf_2\). (d) – теорема Пифагора для \(f=(f-P_Uf)+P_Uf\), с ортогональными слагаемыми по (a).)
Теперь – ключевой геометрический факт: замкнутое подпространство и его ортогональное дополнение “расщепляют” всё пространство.
(Существование: \(f=P_Uf+(f-P_Uf)\), где первое слагаемое в \(U\), а второе в \(U^\perp\) по теореме Теорема 15(a). Единственность: если \(f=g_1+h_1=g_2+h_2\) – два таких разложения, то \(g_1-g_2=h_2-h_1\in U\cap U^\perp =\left\{ 0\right\}\) по лемме Лемма 4(b).)
3.3 зачем всё это нужно теории вероятностей
Пусть \((\Omega ,\mathcal F,\mathbb {P})\) – вероятностное пространство, \(\mathcal G\subseteq \mathcal F\) – под-\(\sigma\)-алгебра. Пространство \(L^2(\Omega ,\mathcal G,\mathbb {P})\) естественно вкладывается в \(L^2(\Omega ,\mathcal F,\mathbb {P})\) как замкнутое линейное подпространство, так что для любого \(X\in L^2(\Omega ,\mathcal F,\mathbb {P})\) по теореме Теорема 16 корректно определена его ортогональная проекция на это подпространство – и именно так лучше всего понимать условное математическое ожидание: \(\mathbb {E}\left[X\mid \mathcal G\right] := P_{L^2(\Omega ,\mathcal G,\mathbb {P})}X\) (эта конструкция затем распространяется с \(L^2\) на все интегрируемые случайные величины уже другими средствами; мы не развиваем эту теорию здесь – это тема отдельного курса теории вероятностей). Отметим лишь сам факт: одна из центральных конструкций теории вероятностей – буквально частный случай ортогональной проекции в гильбертовом пространстве.
3.4 регрессия, предсказание, разложение Карунена–Лоэва
Та же геометрическая картина стоит за несколькими другими центральными конструкциями статистики и теории случайных процессов.
Наилучший в среднеквадратичном смысле прогноз. Пусть \(X, Y \in L^2(\Omega ,\mathcal F,\mathbb {P})\). Величина \(g(X)\), минимизирующая среднеквадратичную ошибку прогноза \(\mathbb {E}\left[(Y-g(X))^2\right]\) по всем измеримым \(g\) (с \(g(X) \in L^2\)), – это в точности проекция \(Y\) на подпространство \(L^2(\Omega ,\sigma (X),\mathbb {P}) \subset L^2(\Omega ,\mathcal F,\mathbb {P})\), т.е. \(\mathbb {E}\left[Y\mid X\right]\) из предыдущего замечания. Линейная регрессия – та же самая экстремальная задача, только проекция берется не на всё \(L^2(\Omega ,\sigma (X),\mathbb {P})\), а на его (конечномерное, а значит автоматически замкнутое) подпространство \(\left\langle 1,X\right\rangle\) линейных функций от \(X\); явная формула для коэффициентов линейной регрессии – это в точности уравнения (a) из теоремы Теорема 15, записанные для этого подпространства.
Разложение Карунена–Лоэва. Пусть \((X_t)_{t\in [0,T]}\) – случайный процесс с \(\mathbb {E}\left[X_t^2\right]<\infty\) при всех \(t\) и непрерывной ковариационной функцией. Оказывается, траекторию такого процесса можно представить в виде ряда
\[ X_t \; = \; \sum _{k=1}^\infty \xi _k \, e_k(t), \qquad t \in [0,T], \]
где \((e_k)\) – некоторый ортонормированный базис (в подходящем \(L^2\)-пространстве функций на \([0,T]\), построенный из собственных функций оператора ковариации), а случайные величины \(\xi_k := \left\langle X, e_k \right\rangle\) попарно некоррелированы. Формально это в точности формула для разложения элемента гильбертова пространства по ортонормированному базису (см. тождество Парсеваля, теорема Теорема 20, и замечание после нее), примененная к траектории \(X\) как к одному элементу подходящего \(L^2\)-пространства. Мы не развиваем эту теорию здесь – построение самого базиса \((e_k)\) требует отдельной техники (теории интегральных операторов) – но подчеркнем: без гильбертовой геометрии эту конструкцию пришлось бы каждый раз изобретать заново.
3.4.1 Теорема Рисса о представлении
Следующий результат – красивая и практически важная теорема, полностью описывающая, как выглядят ограниченные линейные функционалы на гильбертовом пространстве.
В частности, для \(H=L^2(\mu )\) теорема Рисса означает: каждый ограниченный линейный функционал на \(L^2(\mu )\) имеет вид \(\varphi (f) = \int fu\; d\mu\) для единственной \(u\in L^2(\mu )\). Иначе говоря, \(L^2(\mu )\) – это (в некотором точном смысле) “двойственное пространство самому себе”; это специфика именно \(p=2\), при других \(p\) двойственным к \(L^p(\mu )\) является \(L^{p'}(\mu )\) (\(p'\) – сопряженный показатель) для другой, вообще говоря, функции \(u\).
3.5 Ортонормированные системы и базисы
Всюду в этом параграфе речь идет только о счетных (конечных или бесконечных) семействах – этого достаточно для всех вероятностных приложений (см. замечание после определения ортонормированного базиса).
Примеры. Стандартные базисные векторы \(e_k=(0,\ldots ,0,1,0,\ldots )\) (единица на \(k\)-м месте) образуют ортонормированную систему в \(\mathbb {R}^{n}\) и в \(\ell^2\).
3.5.1 Процесс Грама–Шмидта. Неравенство Бесселя
(Идея, для конечного набора индексов \(1,\ldots ,n\) – счетный случай следует предельным переходом: пусть \(g:=\sum_{k=1}^n\left\langle f, e_k \right\ranglee_k\); прямой проверкой \(f-g\perp e_j\) для каждого \(j\), а значит \(f-g\perp g\), и теорема Пифагора для \(f=(f-g)+g\) дает \(\left\| f\right\|^2 = \left\| f-g\right\|^2+\left\| g\right\|^2 \geq \left\| g\right\|^2 = \sum_{k=1}^n\left|\left\langle f, e_k \right\rangle \right|^2\).)
3.5.2 Ортонормированный базис. Тождество Парсеваля
В произвольном (не обязательно сепарабельном) гильбертовом пространстве ортонормированный базис (в смысле определения ниже) существует всегда, но доказательство в общем случае существенно опирается на лемму Цорна (см. Axler, теорема 8.75). Нам это не понадобится: во всех вероятностных приложениях достаточно рассматривать сепарабельные гильбертовы пространства (т.е. содержащие счетное всюду плотное подмножество) – например, \(L^2(\Omega ,\mathcal F,\mathbb {P})\) для счетно порожденной \(\sigma\)-алгебры \(\mathcal F\). Для таких пространств ортонормированный базис можно построить явно процессом Грама–Шмидта (теорема Теорема 18), примененным к счетному плотному множеству. Поэтому далее мы говорим только о счетных ортонормированных базисах.
Несмотря на название, ортонормированный базис (при бесконечном \(H\)) не является базисом в смысле линейной алгебры: элемент \(f\in H\) представляется не конечной линейной комбинацией \(e_k\), а – как показывает следующая теорема – сходящимся рядом.
(Идея: положим \(S_n:=\sum_{k=1}^n\left\langle f, e_k \right\ranglee_k\). По неравенству Бесселя ряд \(\sum_k\left|\left\langle f, e_k \right\rangle \right|^2\) сходится, откуда (по теореме Пифагора для хвостов) \((S_n)\) – последовательность Коши, а значит сходится к некоторому \(s\in H\) (\(H\) полно); из ортогональности \(f-S_n\perp e_j\) при \(n\geq j\) и непрерывности скалярного произведения получаем \(f-s\perp e_j\) для всех \(j\), т.е. \(f-s\in \left(\overline{\left\langle e_k:k\right\rangle }\right)^\perp = H^\perp =\left\{ 0\right\}\) – это и дает (a); (b),(c) немедленно следуют из (a) предельным переходом.)
3.6 проекция через ортонормированный базис
Если \((e_k)\) – ортонормированный базис замкнутого подпространства \(U\subseteq H\) (не обязательно всего \(H\)), то тем же рассуждением, что в доказательстве тождества Парсеваля (примененным внутри гильбертова пространства \(U\)), получаем формулу для ортогональной проекции: \[ P_Uf = \sum _k \left\langle f, e_k \right\ranglee _k, \qquad f\in H. \] В частности, это дает практический способ вычисления условного матожидания: если известен ортонормированный базис \((e_k)\) пространства \(L^2(\Omega ,\mathcal G,\mathbb {P})\), то \(\mathbb {E}\left[X\mid \mathcal G\right] = \sum_k\left\langle X, e_k \right\ranglee_k\).
4 Двойственность (анонс)
Закончим главу коротким анонсом одного из центральных фактов теории пространств \(L^p\) – он свяжет всё, что мы обсудили в этой главе, воедино.
4.1 теорема Рисса о представлении, б/д
Пусть \(\mu\) – \(\sigma\)-конечная мера, \(1<p<\infty\), \(p'\) – сопряженный показатель. Тогда отображение \(h \mapsto \varphi_h\), где \(\varphi_h(f) := \int fh\, d\mu\), устанавливает изометрический изоморфизм между \(L^{p'}(\mu )\) и сопряженным пространством \(\left(L^p(\mu )\right)'\). Короче говоря, “\(\left(L^p\right)' = L^{p'}\)”. (При \(p=1\) это тоже верно, если \(\mu\) \(\sigma\)-конечна; при \(p=\infty\) – уже нет, сопряженное к \(L^\infty\) пространство устроено существенно сложнее, чем \(L^1\).)
Частный случай \(p=p'=2\) этого факта – это теорема Рисса о представлении для гильбертова пространства \(L^2(\mu )\) (теорема Теорема 17 из §3 этой же главы), которую мы, в отличие от общего случая, полностью доказали – используя лишь геометрию проекций, без всякого Хана–Банаха. Это же наблюдение станет ключевым шагом в доказательстве теоремы Радона–Никодима в следующей главе.