8.5: Оцінка байєсівських наборів
- Page ID
- 99149
Основна теорія
Як завжди, нашою відправною точкою є випадковий експеримент з базовим простором вибірки та мірою ймовірності\(\P\). У базовій статистичній моделі ми маємо спостережувану випадкову величину,\(\bs{X}\) яка приймає значення в множині\(S\). В цілому,\(\bs{X}\) може мати досить складну будову. Наприклад, якщо експеримент полягає в тому, щоб вибірка\(n\) об'єктів з населення і запис різних вимірювань, що цікавлять, то\[ \bs{X} = (X_1, X_2, \ldots, X_n) \] де\(X_i\) знаходиться вектор вимірювань для\(i\) го об'єкта.
Припустимо також, що розподіл\(\bs{X}\) залежить від параметра, який\(\theta\) приймає значення в просторі параметрів\(\Theta\). Параметр також може бути векторним значенням, в такому випадку\(\Theta \subseteq \R^k\) для деяких\(k \in \N_+\) і параметр має вигляд\(\bs{\theta} = (\theta_1, \theta_2, \ldots, \theta_k)\).
Байєсівське формулювання
Нагадаємо, що в байєсівському аналізі невідомий параметр\(\theta\) трактується як випадкова величина. Зокрема, припустимо, що функція умовної щільності ймовірності\(\bs{X}\) заданого вектора даних\(\theta\ \in \Theta\) позначається\( f(\bs{x} \mid \theta) \) для\( \bs{x} \in S \). Крім того, параметру\(\theta\) дається попередній розподіл з включеною функцією щільності\(h\) ймовірності\(\Theta\). (Попередній розподіл часто є суб'єктивним і вибирається, щоб відобразити наші знання, якщо такі є, параметра.) Спільна функція щільності ймовірності вектора даних і параметра\[ (\bs{x}, \theta) \mapsto h(\theta) f(\bs{x} \mid \theta); \quad (\bs{x}, \theta) \in S \times \Theta \] Далі, (безумовна) функція щільності ймовірності\(\bs{X}\) є функцією,\(f\) заданою\[ f(\bs{x}) = \sum_{\theta \in \Theta} h(\theta) f(\bs{x} \mid \theta), \quad \bs{x} \in S \] якщо параметр має дискретний розподіл, або\[ f(\bs{x}) = \int_\Theta h(\theta) f(\bs{x} \mid \theta) \, d\theta, \quad \bs{x} \in S \] якщо параметр має неперервний дистрибутив. Нарешті, за теоремою Байєса функція густини задньої ймовірності\(\theta\)\(\bs{x} \in S\) заданої\[ h(\theta \mid \bs{x}) = \frac{h(\theta) f(\bs{x} \mid \theta)}{f(\bs{x})}, \quad \theta \in \Theta \]
У деяких випадках ми можемо розпізнати задній розподіл від функціональної форми\(\theta \mapsto h(\theta) f(\bs{x} \mid \theta)\) без необхідності фактично обчислювати нормалізуючу константу\(f(\bs{x})\), і, таким чином, значно зменшуючи обчислювальне навантаження. Зокрема, це часто буває, коли у нас є спряжене параметричне сімейство розподілів\(\theta\). Нагадаємо, що це означає, що при попередньому розподілі\(\theta\) належить сімейству, так само відбувається і задній розподіл\(\bs{x} \in S\).
Набори довіри
Тепер нехай\(C(\bs{X})\) буде довірчий набір (тобто підмножина простору параметрів, що залежить від змінної даних,\(\bs{X}\) але не невідомих параметрів). Одне з можливих визначень\(1 - \alpha\) рівня байєсівської довіри вимагає, щоб\[ \P\left[\theta \in C(\bs{x}) \mid \bs{X} = \bs{x}\right] = 1 - \alpha \] У цьому визначенні лише\(\theta\) випадково, і, таким чином, ймовірність вище обчислюється за допомогою функції щільності задньої ймовірності\(\theta \mapsto h(\theta \mid \bs{x})\). Інше можливе визначення вимагає, що\[ \P\left[\theta \in C(\bs{X})\right] = 1 - \alpha \] в цьому\(\theta\) визначенні\(\bs{X}\) і є випадковими, і тому ймовірність вище буде обчислена за допомогою спільної функції щільності ймовірності\((\bs{x}, \theta) \mapsto h(\theta) f(\bs{x} \mid \theta)\). Якими б не були філософські аргументи, перше визначення, безумовно, є простішим з обчислювальної точки зору, і, отже, є найбільш часто використовуваним.
Порівняємо класичний і байесівський підходи. У класичному підході параметр\(\theta\) детермінований, але невідомий. Перед тим, як дані будуть зібрані,\(C(\bs{X})\) довірчий набір (який є випадковим в силу\(\bs{X}\)) буде містити параметр з ймовірністю\(1 - \alpha\). Після збору даних обчислений набір\(C(\bs{x})\) довіри або містить,\(\theta\) або не містить, і ми, як правило, ніколи не дізнаємося, який. На відміну від байєсової довірчої множини, випадковий параметр\(\theta\) потрапляє в обчислений детермінований набір довіри\(C(\bs{x})\) з ймовірністю\(1 - \alpha\).
Реальні параметри
Припустимо,\(\theta\) що реально цінується, так що\(\Theta \subseteq \R\). Для\(r \in (0, 1)\), ми можемо обчислити\(1 - \alpha\) рівень байєсівського довірчого інтервалу, як\(\left[U_{(1 - r) \alpha}(\bs{x}), U_{1 - r \alpha}(\bs{x})\right]\) де\(U_p(\bs{x})\) квантиль порядку\(p\) для заднього розподілу\(\theta\) заданого\(\bs{X} = \bs{x}\). Як і в минулих відділах,\(r\) є фракцією\(\alpha\) в правому хвості заднього розподілу і\(1 - r\) є часткою\(\alpha\) в лівому хвості заднього розподілу. Як завжди,\(r = \frac{1}{2}\) дає симетричний, двосторонній довірчий інтервал; дозволяючи\(r \to 0\) надає впевненості нижню межу; і дозволяючи\(r \to 1\) надає впевненості верхню межу.
Випадкові зразки
З точки зору нашого вектора даних\(\bs{X}\) найважливіший особливий випадок виникає, коли у нас є базова змінна\(X\) зі значеннями у\(R\) множині\(\theta\),\(\bs{X} = (X_1, X_2, \ldots, X_n)\) і задана випадкова вибірка розміру\(n\) від\(X\). Тобто задано послідовність незалежних\(\theta\),\(\bs{X}\) однаково розподілених змінних, кожна з тим же розподілом, що і\(X\) задано\(\theta\). Таким чином,\(S = R^n\) і якщо\(X\) має функцію умовної щільності ймовірності\(g(x \mid \theta)\), то\[f(\bs{x} \mid \theta) = g(x_1 \mid \theta) g(x_2 \mid \theta) \cdots g(x_n \mid \theta), \quad \bs{x} = (x_1, x_2, \ldots, x_n) \in S\]
Додатки
Розподіл Бернуллі
Припустимо,\(\bs{X} = (X_1, X_2, \ldots, X_n)\) що випадкова вибірка розміру\(n\) з розподілу Бернуллі з невідомим параметром успіху\(p \in (0, 1)\). Звичайною мовою достовірності,\(X_i = 1\) означає успіх на суді\(i\) і\(X_i = 0\) означає невдачу на суді\(i\). Дистрибутив названий на честь Якова Бернуллі. Нагадаємо, що розподіл Бернуллі має функцію щільності ймовірності (наведено\(p\))\[ g(x \mid p) = p^x (1 - p)^{1-x}, \quad x \in \{0, 1\} \] Відзначимо, що кількість успіхів у\(n\) випробуваннях дорівнює\(Y = \sum_{i=1}^n X_i\). Дано\(p\), випадкова величина\(Y\) має біноміальний розподіл з параметрами\(n\) і\(p\).
У нашому попередньому обговоренні байєсівської оцінки ми показали, що бета-розподіл є кон'югованим для\(p\). Зокрема, якщо попередній розподіл бета-версії з лівим параметром\(a \gt 0\) і правим параметром\(b \gt 0\), то задній розподіл\(p\) заданого\(\bs{X}\) є бета-з лівим параметром\(a + Y\) і правим параметром\(b + (n - Y)\); лівий параметр збільшується на кількість\(p\) успіхи і правильний параметр за кількістю відмов. Звідси випливає, що\(1 - \alpha\) рівень байєсівського довірчого інтервалу для\(U_r(y)\) -\(p\) це\(\left[U_{\alpha/2}(y), U_{1-\alpha/2}(y)\right]\) де квантиль порядку\(r\) для заднього бета-розподілу. В особливому випадку\(a = b = 1\) попередній розподіл є рівномірним\((0, 1)\) і відображає відсутність попередніх знань про\(p\).
Припустимо, що у нас є монета з невідомою\(p\) ймовірністю голів, і що ми даємо\(p\) рівномірний пріор, що відображає нашу відсутність знань про\(p\). Потім підкидаємо монетку 50 разів, дотримуючись 30 голів.
- Знайдіть задній розподіл\(p\) заданих даних даних.
- Побудувати 95% байєсового довірчого інтервалу.
- Побудувати класичний довірчий інтервал Вальда на рівні 95%.
Відповідь
- Бета з лівим параметром 31 і правим параметром 21.
- \([0.461, 0.724\)
- \([0.464, 0.736]\)
Розподіл Пуассона
Припустимо,\(\bs{X} = (X_1, X_2, \ldots, X_n)\) що випадкова вибірка розміру\(n\) з розподілу Пуассона з параметром\(\lambda \in (0, \infty)\). Нагадаємо, що розподіл Пуассона часто використовується для моделювання кількості випадкових точок
в області часу або простору і більш детально вивчається в розділі, присвяченому процесу Пуассона. Розподіл названий на честь неповторного Симеона Пуассона і задано\(\lambda\), має функцію щільності ймовірності\[ g(x \mid \theta) = e^{-\lambda} \frac{\lambda^x}{x!}, \quad x \in \N \] Як завжди, ми позначимо суму значень вибірки по\(Y = \sum_{i=1}^n X_i\). Дано\(\lambda\), випадкова величина\(Y\) також має розподіл Пуассона, але з параметром\(n \lambda\).
У нашому попередньому обговоренні байєсової оцінки ми показали, що гамма-розподіл є кон'югованим для\(\lambda\). Зокрема, якщо попередній розподіл\(\lambda\) є гамма з параметром форми\(k \gt 0\) та параметром швидкості\(r \gt 0\) (так що параметр шкали\(1 / r\)), то заднім розподілом\(\lambda\) заданого\(\bs{X}\) є гамма з параметром форми\(k + Y\) та параметром швидкості\(r + n\). Звідси випливає, що\(1 - \alpha\) рівень байєсівського довірчого інтервалу для\(U_p(y)\) -\(\lambda\) це\(\left[U_{\alpha/2}(y), U_{1-\alpha/2}(y)\right]\) де квантиль порядку\(p\) для заднього гамма-розподілу.
Розглянемо дані альфа-викидів, які, на нашу думку, походять від розподілу Пуассона з невідомим параметром\(\lambda\). Припустимо, що апріорі ми вважаємо, що\(\lambda\) це близько 5, тому ми даємо\(\lambda\) попередній гамма-розподіл з параметром форми\(5\) і параметром швидкості 1. (Таким чином, середнє значення становить 5 і стандартне відхилення\(\sqrt{5} = 2.236\).)
- Знайдіть задній розподіл\(\lambda\) заданих даних даних.
- Побудувати 95% байєсового довірчого інтервалу.
- Побудувати класичний\(t\) довірчий інтервал на рівні 95%.
Відповідь
- Гамма з параметром форми 10104 та параметром швидкості 1208.
- \((8.202, 8.528)\)
- \((8.324, 8.410)\)
Нормальний розподіл
Припустимо, що\(\bs{x} = (X_1, X_2, \ldots, X_n)\) це випадкова вибірка розміру\(n\) з нормального розподілу з невідомим середнім\(\mu \in \R\) і відомою дисперсією\(\sigma^2 \in (0, \infty)\). Звичайно, нормальний розподіл відіграє особливо важливу роль в статистиці, частково через центральну граничну теорему. Нормальний розподіл широко використовується для моделювання фізичних величин, що піддаються численним малим випадковим помилкам. Нагадаємо, що нормальна функція щільності ймовірності (з урахуванням параметрів)\[ g(x \mid \mu, \sigma) = \frac{1}{\sqrt{2 \pi} \sigma} \exp\left[-\left(\frac{x - \mu}{\sigma}\right)^2 \right], \quad x \in \R \] позначаємо суму значень вибірки по\(Y = \sum_{i=1}^n X_i\). Нагадаємо, що\(Y\) теж має нормальний розподіл (дано\(\mu\) і\(\sigma\)), але зі середнім\(n \mu\) і дисперсійним\(n \sigma^2\).
У нашому попередньому обговоренні байєсівської оцінки ми показали, що нормальний розподіл є сполученим для\(\mu\) (з\(\sigma\) відомим). Зокрема, якщо попередній розподіл\(\mu\) є нормальним із середнім\(a \in \R\) та стандартним відхиленням\(b \in (0, \infty)\), то задній розподіл\(\mu\) даного також\(\bs{X}\) є нормальним, з Звідси\[\E(\mu \mid \bs{X}) = \frac{Y b^2 + a \sigma^2}{\sigma^2 + n b^2}, \quad \var(\mu \mid \bs{X}) = \frac{\sigma^2 b^2}{\sigma^2 + n b^2}\] випливає, що\(1 - \alpha\) рівень байєсового довірчого інтервалу для\(\mu\) є \(\left[U_{\alpha/2}(y), U_{1-\alpha/2}(y)\right]\)де\(U_p(y)\) - квантиль порядку\(p\) для заднього нормального розподілу. Цікавим є особливий випадок\(b = \sigma\), коли, так що стандартне відхилення попереднього розподілу\(\mu\) таке ж, як стандартне відхилення розподілу вибірки. При цьому заднє середнє є,\((Y + a) \big/ (n + 1)\) а задня дисперсія -\(\sigma^2 \big/ (n + 1)\)
Довжина певної оброблюваної деталі повинна становити 10 сантиметрів, але через недоліки в процесі виготовлення фактична довжина зазвичай розподіляється із середнім\(\mu\) та дисперсійним значенням\(\sigma^2\). Дисперсія обумовлена притаманними в процес факторами, які з часом залишаються досить стабільними. З історичних даних відомо, що\(\sigma = 0.3\). З іншого боку,\(\mu\) може бути встановлений шляхом регулювання різних параметрів у процесі і, отже, може змінюватися на невідоме значення досить часто. Таким чином, припустимо, що ми\(\mu\) наводимо з попереднім нормальним розподілом із середнім значенням 10 і стандартним відхиленням 0,03 Вибірка з 100 частин має середнє значення 10.2.
- Знайдіть задній розподіл\(\mu\) заданих даних даних.
- Побудувати 95% байєсового довірчого інтервалу.
- Побудувати класичний\(z\) довірчий інтервал на рівні 95%.
Відповідь
- Нормальний з середнім значенням 10.198 і стандартним відхиленням 0.0299.
- \((10.14, 10.26)\)
- \((10.14, 10.26)\)
Бета-дистрибутив
Припустимо,\(\bs{X} = (X_1, X_2, \ldots, X_n)\) що випадкова вибірка розміру\(n\) з бета-розподілу з невідомим параметром лівої форми\(a \in (0, \infty)\) та параметром правої форми\(b = 1\). Бета-розподіл широко використовується для моделювання випадкових пропорцій і ймовірностей та інших змінних, які приймають значення в обмежених інтервалах. Нагадаємо, що функція щільності ймовірності (задана\(a\))\[ g(x \mid a) = a x^{a-1}, \quad x \in (0, 1) \] позначаємо добуток значень вибірки на\(W = X_1 X_2 \cdots X_n\).
У нашому попередньому обговоренні байєсової оцінки ми показали, що гамма-розподіл є кон'югованим для\(a\). Зокрема, якщо попередній розподіл\(a\) є гамма з параметром форми\(k \gt 0\) та параметром швидкості\(r \gt 0\), то заднім розподілом\(a\) заданого також\(\bs{X}\) є гамма, з параметром форми\(k + n\) та параметром швидкості\(r - \ln(W)\). Звідси випливає, що\(1 - \alpha\) рівень байєсівського довірчого інтервалу для\(U_p(w)\) -\(a\) це\(\left[U_{\alpha/2}(w), U_{1-\alpha/2}(w)\right]\) де квантиль порядку\(p\) для заднього гамма-розподілу. В особливому випадку\(k = 1\), що, попередній розподіл\(a\) є експоненціальним з параметром швидкості\(r\).
Припустимо, що опір електричної складової (в Омах) має бета-розподіл з невідомим лівим параметром\(a\) і правим параметром\(b = 1\). Ми вважаємо, що це\(a\) може бути близько 10, тому ми даємо\(a\) попередній гамма-розподіл з параметром форми 10 і параметром швидкості 1. Відбираємо 20 компонентів і спостерігаємо за даними\[0.98, 0.93, 0.99, 0.89, 0.79, 0.99, 0.92, 0.97, 0.88, 0.97, 0.86, 0.84, 0.96, 0.97, 0.92, 0.90, 0.98, 0.96, 0.96, 1.00\]
- Знайдіть заднє розподіл\(a\).
- Побудувати 95% байєсового довірчого інтервалу для\(a\).
Відповідь
- Гамма з параметром форми 30 та параметром швидкості 2.424.
- \((8.349, 17.180)\)
Розподіл Парето
Припустимо,\(\bs{X} = (X_1, X_2, \ldots, X_n)\) що випадкова вибірка розміру\(n\) з розподілу Парето з параметром форми\(a \in (0, \infty)\) та параметром масштабу\(b = 1\). Розподіл Парето використовується для моделювання певних фінансових змінних та інших змінних з великохвостим розподілом і названий на честь Вільфредо Парето. Нагадаємо, що функція щільності ймовірності (задана\(a\))\[ g(x \mid a) = \frac{a}{x^{a+1}}, \quad x \in [1, \infty) \] позначаємо добуток значень вибірки на\(W = X_1 X_2 \cdots X_n\).
У нашому попередньому обговоренні байєсової оцінки ми показали, що гамма-розподіл є кон'югованим для\(a\). Зокрема, якщо попередній розподіл\(a\) є гамма з параметром форми\(k \gt 0\) та параметром швидкості\(r \gt 0\), то заднім розподілом\(a\) заданого також\(\bs{X}\) є гамма, з параметром форми\(k + n\) та параметром швидкості\(r + \ln(W)\). Звідси випливає, що\(1 - \alpha\) рівень байєсівського довірчого інтервалу для\(U_p(w)\) -\(a\) це\(\left[U_{\alpha/2}(w), U_{1-\alpha/2}(w)\right]\) де квантиль порядку\(p\) для заднього гамма-розподілу. В особливому випадку\(k = 1\), що, попередній розподіл\(a\) є експоненціальним з параметром швидкості\(r\).
Припустимо, що фінансова змінна має розподіл Парето з невідомим параметром форми\(a\) та параметром масштабу\(b = 1\). Ми вважаємо, що це\(a\) може бути близько 4, тому ми даємо\(a\) попередній гамма-розподіл з параметром форми 4 та параметром швидкості 1. Випадкова вибірка розміром 20 зі змінної дає дані\[1.09, 1.13, 2.00, 1.43, 1.26, 1.00, 1.36, 1.03, 1.46, 1.18, 2.16, 1.16, 1.22, 1.06, 1.28, 1.23, 1.11, 1.03, 1.04, 1.05\]
- Знайдіть заднє розподіл\(a\).
- Побудувати 95% байєсового довірчого інтервалу для\(a\).
Відповідь
- Гамма з параметром форми 24 і параметром швидкості 5.223.
- \((2.944, 6.608)\)
