Skip to main content
LibreTexts - Ukrayinska

7.6: Достатня, повна та допоміжна статистика

  • Page ID
    99260
  • \( \newcommand{\vecs}[1]{\overset { \scriptstyle \rightharpoonup} {\mathbf{#1}} } \) \( \newcommand{\vecd}[1]{\overset{-\!-\!\rightharpoonup}{\vphantom{a}\smash {#1}}} \)\(\newcommand{\id}{\mathrm{id}}\) \( \newcommand{\Span}{\mathrm{span}}\) \( \newcommand{\kernel}{\mathrm{null}\,}\) \( \newcommand{\range}{\mathrm{range}\,}\) \( \newcommand{\RealPart}{\mathrm{Re}}\) \( \newcommand{\ImaginaryPart}{\mathrm{Im}}\) \( \newcommand{\Argument}{\mathrm{Arg}}\) \( \newcommand{\norm}[1]{\| #1 \|}\) \( \newcommand{\inner}[2]{\langle #1, #2 \rangle}\) \( \newcommand{\Span}{\mathrm{span}}\) \(\newcommand{\id}{\mathrm{id}}\) \( \newcommand{\Span}{\mathrm{span}}\) \( \newcommand{\kernel}{\mathrm{null}\,}\) \( \newcommand{\range}{\mathrm{range}\,}\) \( \newcommand{\RealPart}{\mathrm{Re}}\) \( \newcommand{\ImaginaryPart}{\mathrm{Im}}\) \( \newcommand{\Argument}{\mathrm{Arg}}\) \( \newcommand{\norm}[1]{\| #1 \|}\) \( \newcommand{\inner}[2]{\langle #1, #2 \rangle}\) \( \newcommand{\Span}{\mathrm{span}}\)

    \(\newcommand{\R}{\mathbb{R}}\)\(\newcommand{\N}{\mathbb{N}}\)\(\newcommand{\Z}{\mathbb{Z}}\)\(\newcommand{\E}{\mathbb{E}}\)\(\newcommand{\P}{\mathbb{P}}\)\(\newcommand{\var}{\text{var}}\)\(\newcommand{\sd}{\text{sd}}\)\(\newcommand{\cov}{\text{cov}}\)\(\newcommand{\cor}{\text{cor}}\)\(\newcommand{\bias}{\text{bias}}\)\(\newcommand{\MSE}{\text{MSE}}\)\(\newcommand{\bs}{\boldsymbol}\)

    Основна теорія

    Основна статистична модель

    Розглянемо ще раз основну статистичну модель, в якій ми маємо випадковий експеримент зі спостережуваної випадковою величиною, що\(\bs X\) приймає значення в множині\(S\). Знову ж таки, експеримент, як правило, полягає у вибірці\(n\) об'єктів із населення та запису одного або декількох вимірювань для кожного елемента. При цьому змінна результату має вигляд,\[ \bs X = (X_1, X_2, \ldots, X_n) \] де\(X_i\) знаходиться вектор вимірювань для\(i\) го пункту. Загалом, ми припускаємо, що розподіл\(\bs X\) залежить від параметра, який\(\theta\) приймає значення в просторі параметрів\(T\). Параметр також\(\theta\) може бути векторним. Іноді ми будемо використовувати індекси в функціях щільності ймовірності, очікуваних значень тощо для позначення залежності від\(\theta\).

    Як завжди, найважливіший особливий випадок -\(\bs X\) це послідовність незалежних, однаково розподілених випадкових величин. В даному випадку\(\bs X\) - випадкова вибірка із загального розподілу.

    Достатня статистика

    \(U = u(\bs X)\)Дозволяти статистикою прийняття значень у наборі\(R\). Інтуїтивно,\(U\) достатньо,\(\theta\) якщо\(U\) містить всю інформацію про те\(\theta\), що є у всій змінній даних\(\bs X\). Ось формальне визначення:

    Статистика\(U\) є достатньою для того,\(\theta\) якщо умовний розподіл\(\bs X\) даних\(U\) не залежить від\(\theta \in T\).

    Достатність пов'язана з поняттям скорочення даних. Припустимо, що\(\bs X\) приймає значення в\(\R^n\). Якщо ми зможемо знайти достатню статистику\(\R^j\),\(\bs U\) яка приймає значення, то ми можемо зменшити вихідний вектор даних\(\bs X\) (розмір\(n\) якого зазвичай великий) до вектора статистики\(\bs U\) (розмір\(j\) якого зазвичай набагато менший) без втрати інформації про параметр\(\theta\).

    Наступний результат дає умову достатності, рівнозначну цьому визначенню.

    \(U = u(\bs X)\)Дозволяти статистикою, приймаючи значення в\(R\),\(f_\theta\) і нехай і\(h_\theta\) позначають функції щільності ймовірності\(\bs X\) і\(U\) відповідно. Тоді\(U\) достатньо,\(\theta\) якщо і тільки якщо функція,\( S \) наведена нижче, не залежить від\( \theta \in T \):\[ \bs x \mapsto \frac{f_\theta(\bs x)}{h_\theta[u(\bs x)]} \]

    Доказ

    Спільний розподіл\((\bs X, U)\) концентрується на знімальному майданчику\(\{(\bs x, y): \bs x \in S, y = u(\bs x)\} \subseteq S \times R\). Умовний PDF-файл\(\bs X\)\(U = u(\bs x)\) вказано\(f_\theta(\bs x) \big/ h_\theta[u(\bs x)]\) на цьому наборі, а в іншому випадку дорівнює 0.

    Визначення точно фіксує інтуїтивне поняття достатності, наведене вище, але може бути важко застосувати. Ми повинні заздалегідь знати статистику кандидата\(U\), і тоді ми повинні вміти обчислити умовний розподіл\(\bs X\) даного\(U\). Теорема факторизації Фішера-Неймана, наведена далі, часто дозволяє ідентифікувати достатню статистику за формою функції щільності ймовірностей\(\bs X\). Він названий на честь Рональда Фішера і Єжи Неймана.

    Теорема про факторизацію Фішера-Неймана. Давайте\(f_\theta\) позначимо функцію щільності ймовірності\(\bs X\) і припустимо, що\(U = u(\bs X)\) це статистика, що приймає значення в\(R\). Тоді\(U\) достатньо,\(\theta\) якщо і тільки якщо існує\(G: R \times T \to [0, \infty)\) і\(r: S \to [0, \infty)\) таке, що\[ f_\theta(\bs x) = G[u(\bs x), \theta] r(\bs x); \quad \bs x \in S, \; \theta \in T \]

    Доказ

    \( h_\theta \)Дозвольте позначити PDF\( U \) для\( \theta \in T \). Якщо\( U \) достатньо для\( \theta \), то від попередньої теореми функція\( r(\bs x) = f_\theta(\bs x) \big/ h_\theta[u(\bs x)] \) for\( \bs x \in S\) не залежить від\( \theta \in T \). Звідси\( f_\theta(\bs x) = h_\theta[u(\bs x)] r(\bs x) \) для\( (\bs x, \theta) \in S \times T \) і так\((\bs x, \theta) \mapsto f_\theta(\bs x) \) має форму, наведену в теоремі. І навпаки, припустимо, що\( (\bs x, \theta) \mapsto f_\theta(\bs x) \) має форму, наведену в теоремі. Тоді існує позитивна константа\( C \) така, що\( h_\theta(y) = C G(y, \theta) \) для\( \theta \in T \) і\( y \in R \). Звідси\( f_\theta(\bs x) \big/ h_\theta[u(x)] = r(\bs x) / C\) для\( \bs x \in S \), незалежні від\( \theta \in T \).

    Зверніть увагу, що\(r\) залежить тільки від даних\(\bs x\), але не від параметра\(\theta\). Менш\(u(\bs X)\) технічно, достатньо,\(\theta\) якщо функція щільності ймовірності\(f_\theta(\bs x)\) залежить від вектора даних\(\bs x\) і параметра\(\theta\) тільки наскрізний\(u(\bs x)\).

    Якщо\(U\) і\(V\) є рівнозначною статистикою і\(U\)\(V\) є достатньою для\(\theta\) цього достатньо\(\theta\).

    Мінімальна достатня статистика

    Вся змінна даних\(\bs X\) тривіально достатня для\(\theta\). Однак, як зазначалося вище, зазвичай існує статистика\(U\), достатня для\(\theta\) та має менший вимір, щоб ми могли досягти реального скорочення даних. Природно, ми хотіли б знайти статистику\(U\), яка має найменший можливий вимір. У багатьох випадках цей найменший вимір\(j\) буде таким же, як\(k\) розмірність вектора параметра\(\theta\). Однак, як ми побачимо, це не обов'язково так;\(j\) може бути меншим або більшим, ніж\(k\). Приклад, заснований на рівномірному розподілі, наведено в (38).

    Припустимо, що статистика\(U\) є достатньою для\(\theta\). Тоді\(U\) мінімально достатньо, якщо\(U\) є функцією будь-якої іншої статистики\(V\), достатньої для\(\theta\).

    Знову ж таки, визначення точно фіксує поняття мінімальної достатності, але його важко застосувати. Наступний результат дає еквівалентну умову.

    Давайте\(f_\theta\) позначимо функцію щільності ймовірності,\(\bs X\) відповідної значенню параметра,\(\theta \in T\) і припустимо, що\(U = u(\bs X)\) це статистика, що приймає значення в\(R\). Тоді\(U\) мінімально достатньо,\(\theta\) якщо дотримується наступна умова: для\(\bs x \in S\) і\(\bs y \in S\)\[ \frac{f_\theta(\bs x)}{f_\theta(\bs{y})} \text{ is independent of } \theta \text{ if and only if } u(\bs x) = u(\bs{y}) \]

    Доказ

    Припустимо, що умова в теоремі виконана. Тоді PDF-файл\(f_\theta\)\( \bs X \) повинен мати форму, наведену в теоремі факторизації (3),\(U\) тому достатньо для\(\theta\). Далі, припустимо, що\(V = v(\bs X)\) є ще одна достатня статистика для\( \theta \), приймаючи значення в\( R \). З теореми факторизації існує\( G: R \times T \to [0, \infty) \) і\( r: S \to [0, \infty) \) таке, що\( f_\theta(\bs x) = G[v(\bs x), \theta] r(\bs x) \) для\( (\bs x, \theta) \in S \times T \). Значить, якщо\( \bs x, \bs y \in S \) і\( v(\bs x) = v(\bs y) \) то\[\frac{f_\theta(\bs x)}{f_\theta(\bs{y})} = \frac{G[v(\bs x), \theta] r(\bs x)}{G[v(\bs{y}), \theta] r(\bs{y})} = \frac{r(\bs x)}{r(\bs y)}\] не залежить від\( \theta \in \Theta \). Звідси з умови в теоремі,\( u(\bs x) = u(\bs y) \) і випливає, що\( U \) є функцією\( V \).

    Якщо\(U\) і\(V\) є\(U\) рівнозначною статистикою і мінімально достатня для\(\theta\) цього\(V\) мінімально достатня для\(\theta\).

    Властивості достатньої статистики

    Достатність пов'язана з декількома методами побудови оцінювачів, які ми вивчили.

    Припустимо,\(U\) що достатньо для\(\theta\) і що існує максимальна ймовірність оцінки\(\theta\). Тоді існує оцінка максимальної ймовірності\(V\), яка є функцією\(U\).

    Доказ

    З теореми факторизації (3), функція ймовірності журналу для\( \bs x \in S \) є\[\theta \mapsto \ln G[u(\bs x), \theta] + \ln r(\bs x)\] Отже, значення,\(\theta\) яке максимізує цю функцію, якщо вона існує, повинна бути функцією\(u(\bs x)\).

    Зокрема, припустимо, що\(V\) це унікальна оцінка максимальної ймовірності\(\theta\) і цього\(V\) достатньо для\(\theta\). Якщо\(U\) достатньо для\(\theta\) цього\(V\) є функцією\(U\) за попередньою теоремою. Звідси випливає,\(V\) що мінімально достатньо для\(\theta\). Наш наступний результат стосується байєсового аналізу.

    Припустимо, що статистика\(U = u(\bs X)\) є достатньою для параметра\(\theta\) і що\( \theta \) моделюється випадковою величиною\( \Theta \) зі значеннями в\( T \). Тоді задній розподіл\( \Theta \) даного\( \bs X = \bs x \in S \) є функцією\( u(\bs x) \).

    Доказ

    \( h \)Дозвольте позначити попередній PDF\( \Theta \) і\( f(\cdot \mid \theta) \) умовний PDF\( \bs X \) даного\( \Theta = \theta \in T \). За теоремою факторизації (3) цей умовний PDF має вигляд\( f(\bs x \mid \theta) = G[u(\bs x), \theta] r(\bs x) \) для\( \bs x \in S \) і\( \theta \in T \). Задній PDF\( \Theta \) заданого\( \bs X = \bs x \in S \) є\[ h(\theta \mid \bs x) = \frac{h(\theta) f(\bs x \mid \theta)}{f(\bs x)}, \quad \theta \in T \] де функція в знаменнику є граничним PDF або просто нормалізує константа для функції\( \theta \) в чисельнику.\( \bs X \) Припустимо, що\( \Theta \) має безперервний розподіл на\( T \), так що\( f(\bs x) = \int_T h(t) G[u(\bs x), t] r(\bs x) dt \) для\( \bs x \in S \). Тоді задній PDF спрощує, до\[ h(\theta \mid \bs x) = \frac{h(\theta) G[u(\bs x), \theta]}{\int_T h(t) G[u(\bs x), t] dt} \] якого залежить\(\bs x \in S \) тільки наскрізний\( u(\bs x) \).

    Продовжуючи установку байєсового аналізу, припустимо, що\( \theta \) це реально-значний параметр. Якщо використовувати звичайну функцію середньоквадратних втрат, то байєсівський оцінювач є\( V = \E(\Theta \mid \bs X) \). За попереднім результатом,\( V \) є функція достатньої статистики\( U \). Тобто,\( \E(\Theta \mid \bs X) = \E(\Theta \mid U) \).

    Наступний результат - теорема Рао-Блеквелла, названа на честь КР Рао і Девіда Блеквелла. Теорема показує, як можна використовувати достатню статистику для вдосконалення неупередженої оцінки.

    Теорема Рао-Блеквелла. Припустимо, що\(U\) достатньо для\(\theta\) і що\(V\) є неупередженим оцінювачем реального параметра\(\lambda = \lambda(\theta)\). Тоді також\(\E_\theta(V \mid U)\) є неупередженим оцінювачем\( \lambda \) і рівномірно краще, ніж\(V\).

    Доказ

    Це випливає з основних властивостей умовного очікуваного значення та умовної дисперсії. По-перше, оскільки\(V\) є функцією\(\bs X\) і\(U\) є достатньою для\(\theta\),\(\E_\theta(V \mid U)\) є достовірною статистикою; тобто вона не залежить від\(\theta\), незважаючи на формальну\(\theta\) залежність від очікуваного значення. Далі,\(\E_\theta(V \mid U)\) є функція\(U\) і\(\E_\theta[\E_\theta(V \mid U)] = \E_\theta(V) = \lambda\) для\(\theta \in \Theta\). Таким чином,\(\E_\theta(V \mid U)\) є неупередженим оцінювачем\(\lambda\). Нарешті\(\var_\theta[\E_\theta(V \mid U)] = \var_\theta(V) - \E_\theta[\var_\theta(V \mid U)] \le \var_\theta(V)\) для будь-якого\(\theta \in T\).

    Повна статистика

    Припустимо, що\(U = u(\bs X)\) це статистика, що приймає значення в наборі\(R\). Тоді\(U\) є повною статистикою для\(\theta\) якщо для будь-якої функції\(r: R \to \R\)\[ \E_\theta\left[r(U)\right] = 0 \text{ for all } \theta \in T \implies \P_\theta\left[r(U) = 0\right] = 1 \text{ for all } \theta \in T \]

    Щоб зрозуміти цей досить дивний вигляд умова, припустимо,\(U\) що це статистика побудована з того, що використовується як оцінка 0 (розглядається як функція\(\theta\)).\(r(U)\) Умова повноти означає, що єдиним таким неупередженим оцінювачем є статистика, яка дорівнює 0 з ймовірністю 1.

    Якщо\(U\) і\(V\) є еквівалентною статистикою і\(U\) є\(V\) повним для\(\theta\) потім завершено\(\theta\).

    Наступний результат показує важливість статистики, яка є як повною, так і достатньою; вона відома як теорема Лемана-Шеффе, названа на честь Еріха Лемана та Генрі Шеффе.

    Теорема Леманна-Шеффе. Припустимо, що\(U\) є достатнім\(\theta\) і повним для і що\(V = r(U)\) є неупередженим оцінювачем реального параметра\(\lambda = \lambda(\theta)\). Потім\(V\) проводиться рівномірно мінімальна дисперсія неупередженої оцінки (УМВУЕ)\(\lambda\).

    Доказ

    Припустимо, що\(W\) є неупередженим оцінювачем\(\lambda\). За теоремою Рао-Блеквелла (10), також\(\E(W \mid U)\) є неупередженим оцінювачем\(\lambda\) і рівномірно краще, ніж\(W\). Оскільки\(\E(W \mid U)\) є функцією\(U\), то з повноти випливає, що\(V = \E(W \mid U)\) з ймовірністю 1.

    Допоміжна статистика

    Припустимо, що\(V = v(\bs X)\) це статистика, що приймає значення в наборі\(R\). Якщо розподіл\(V\) не залежить від\(\theta\), то\(V\) називається допоміжною статистикою для\(\theta\).

    Таким чином, поняття допоміжної статистики доповнює поняття достатньої статистики. Достатня статистика містить всю доступну інформацію про параметр; допоміжна статистика не містить інформації про параметр. Наступний результат, відомий як теорема Басу і названий на честь Дебабрата Басу, робить цю точку більш точною.

    Теорема Басу. Припустимо, що\(U\) є повним і достатнім для параметра,\(\theta\) і що\(V\) є допоміжною статистикою для\( \theta \). Тоді\(U\) і\(V\) є незалежними.

    Доказ

    \(g\)Позначимо функцію щільності ймовірності\(V\) і\(v \mapsto g(v \mid U)\) позначимо умовну функцію щільності ймовірності\(V\) заданої\(U\). З властивостей умовного очікуваного значення,\(\E[g(v \mid U)] = g(v)\) для\(v \in R\). Але потім від повноти,\(g(v \mid U) = g(v)\) з ймовірністю 1.

    Якщо\(U\) і\(V\) є еквівалентною статистикою і\(U\) є допоміжним для\(\theta\) то\(V\) є допоміжним для\(\theta\).

    Додатки та спеціальні дистрибутиви

    У цьому підрозділі ми вивчимо достатню, повну та допоміжну статистику для ряду спеціальних дистрибутивів. Як завжди, обов'язково спробуйте проблеми самостійно, перш ніж дивитися на рішення.

    Розподіл Бернуллі

    Нагадаємо, що розподіл Бернуллі з параметром\(p \in (0, 1)\) є дискретним розподілом на\( \{0, 1\} \) з функцією густини ймовірності,\( g \) визначеною\[ g(x) = p^x (1 - p)^{1-x}, \quad x \in \{0, 1\} \] Припустимо, що\(\bs X = (X_1, X_2, \ldots, X_n)\) є випадковою вибіркою розміру\(n\) з розподілу Бернуллі з параметром\(p\). Рівнозначно,\(\bs X\) це послідовність випробувань Бернуллі, так що в звичайній мові надійності,\(X_i = 1\) якщо судовий процес\(i\) є успішним, а\(X_i = 0\) якщо\(i\) судовий процес - невдалим. Розподіл Бернуллі названий на честь Якова Бернуллі і більш детально вивчається в розділі про випробування Бернуллі.

    Нехай\(Y = \sum_{i=1}^n X_i\) позначимо кількість успіхів. Нагадаємо, що\(Y\) має біноміальний розподіл з параметрами\(n\) і\(p\), і має функцію щільності ймовірності,\( h \) визначену\[ h(y) = \binom{n}{y} p^y (1 - p)^{n-y}, \quad y \in \{0, 1, \ldots, n\} \]

    \(Y\)достатньо для\(p\). Зокрема, для\( y \in \{0, 1, \ldots, n\} \), умовний розподіл\(\bs X\) заданого\(Y = y\) є рівномірним на множині точок\[ D_y = \left\{(x_1, x_2, \ldots, x_n) \in \{0, 1\}^n: x_1 + x_2 + \cdots + x_n = y\right\} \]

    Доказ

    Спільний PDF-файл\( f \)\( \bs X \) визначається\[ f(\bs x) = g(x_1) g(x_2) \cdots g(x_n) = p^y (1 - p)^{n-y}, \quad \bs x = (x_1, x_2, \ldots, x_n) \in \{0, 1\}^n \] де\( y = \sum_{i=1}^n x_i \). Тепер давайте\( y \in \{0, 1, \ldots, n\} \). З огляду на\( Y = y \),\( \bs X \) зосереджена на\( D_y \) і\[ \P(\bs X = \bs x \mid Y = y) = \frac{\P(\bs X = \bs x)}{\P(Y = y)} = \frac{p^y (1 - p)^{n-y}}{\binom{n}{y} p^y (1 - p)^{n-y}} = \frac{1}{\binom{n}{y}}, \quad \bs x \in D_y \] Звичайно,\( \binom{n}{y} \) є кардинальність\(D_y\).

    Цей результат інтуїтивно привабливий: у послідовності випробувань Бернуллі вся інформація про ймовірність успіху\(p\) міститься в кількості успіхів\(Y\). Особливий порядок успіхів і невдач не дає додаткової інформації. Звичайно, достатність більш легко\(Y\) випливає з теореми факторизації (3), але умовний розподіл забезпечує додаткове розуміння.

    \(Y\)є\(p\) повним для параметра простір\( (0, 1) \).

    Доказ

    Якщо\(r: \{0, 1, \ldots, n\} \to \R\),\[\E[r(Y)] = \sum_{y=0}^n r(y) \binom{n}{k} p^y (1 - p)^{n-y} = (1 - p)^n \sum_{y=0}^n r(y) \binom{n}{y} \left(\frac{p}{1 - p}\right)^y\] то Остання сума - многочлен в змінній\(t = \frac{p}{1 - p} \in (0, \infty)\). Якщо цей многочлен дорівнює 0 для всіх\(t \in (0, \infty)\), то всі коефіцієнти повинні бути 0. Отже, ми повинні мати\( r(y) = 0 \) для\( y \in \{0, 1, \ldots, n\} \).

    Доказ останнього результату насправді показує, що якщо простір параметрів є будь-яким підмножиною,\( (0, 1) \) що містить інтервал додатної довжини, то\( Y \) є повним для\( p \). Але поняття повноти дуже сильно залежить від параметра простору. Наступний результат розглядає випадок, коли\(p\) має скінченну множину значень.

    Припустимо, що параметр space\( T \subset (0, 1) \) є скінченною множиною з\( k \in \N_+ \) елементами. Якщо розмір\(n \) вибірки хоча б\( k \),\(Y\) то не повний для\(p\).

    Доказ

    Припустимо, що\( r: \{0, 1, \ldots, n\} \to \R \) і що\( \E[r(Y)] = 0 \) для\( p \in T \). Тоді ми маємо\[ \sum_{y=0}^n \binom{n}{y} p^y (1 - p)^{n-y} r(y) = 0, \quad p \in T \] Це набір\( k \) лінійних, однорідних рівнянь у змінних\( (r(0), r(1), \ldots, r(n)) \). Так як\( n \ge k \), у нас є хоча б\( k + 1 \) змінні, тому нетривіальних рішень нескінченно багато.

    Середнє значення вибірки\(M = Y / n\) (вибіркова частка успіхів) явно еквівалентно\( Y \) (кількості успіхів), а отже, також є достатнім для\( p \) і є повним для\(p \in (0, 1)\). Нагадаємо, що\( M \) вибіркове середнє значення є методом оцінки моментів і є оцінювачем максимальної ймовірності\( p \) на просторі параметрів\( (0, 1) \).\( p \)

    У байєсівському аналізі звичайним підходом є моделювання\( p \) з випадковою величиною\( P \), яка має попередній бета-розподіл з лівим параметром\( a \in (0, \infty) \) та правим параметром\( b \in (0, \infty) \). Тоді задній розподіл\( P \) заданого\( \bs X \) є бета-версією з лівим параметром\( a + Y \) і правим параметром\( b + (n - Y) \). Задній розподіл залежить від даних лише через достатню статистику\( Y \), що гарантується теоремою (9).

    Вибіркова\( S^2 \) дисперсія є UMVUE дисперсії розподілу\( p (1 - p) \) для\( p \in (0, 1) \), і може бути записана як\[ S^2 = \frac{Y}{n - 1} \left(1 - \frac{Y}{n}\right) \]

    Доказ

    Нагадаємо, що вибіркова дисперсія може бути записана як\[S^2 = \frac{1}{n - 1} \sum_{i=1}^n X_i^2 - \frac{n}{n - 1} M^2\] Але\(X_i^2 = X_i\) оскільки\(X_i\) є індикаторною змінною, і\(M = Y / n\). Підстановка дає подання вище. Загалом,\(S^2\) є неупередженим оцінювачем дисперсії розподілу\(\sigma^2\). Але в цьому випадку\(S^2\) є функцією повної, достатньої статистики\(Y\), а отже, за теоремою Лемана Шеффе (13),\(S^2\) є UMVUE\(\sigma^2 = p (1 - p)\).

    Розподіл Пуассона

    Нагадаємо, що розподіл Пуассона з параметром\(\theta \in (0, \infty)\) є дискретним розподілом на\( \N \) з функцією щільності ймовірності,\( g \)\[ g(x) = e^{-\theta} \frac{\theta^x}{x!}, \quad x \in \N \] визначеною розподілом Пуассона, названо на честь Симеона Пуассона і використовується для моделювання кількості випадкових точок в області. часу або простору, за певних ідеальних умов. Параметр\(\theta\) пропорційний розміру області, і є як середнім, так і дисперсією розподілу. Більш детально розподіл Пуассона вивчено в розділі про процес Пуассона.

    Припустимо, що тепер\(\bs X = (X_1, X_2, \ldots, X_n)\) це випадкова вибірка розміру\(n\) з розподілу Пуассона з параметром\(\theta\). Нагадаємо, що сума балів\(Y = \sum_{i=1}^n X_i\) також має розподіл Пуассона, але з параметром\(n \theta\).

    \(Y\)Статистичних даних достатньо для\(\theta\). Зокрема\( y \in \N \), для умовного розподілу\( \bs X \) даного\( Y = y \) є багатономіальний розподіл із\( y \) випробуваннями,\( n \) пробними значеннями та рівномірними пробними ймовірностями.

    Доказ

    Спільний PDF-файл\( f \)\( \bs X \) визначається\[ f(\bs x) = g(x_1) g(x_2) \cdot g(x_n) = \frac{e^{-n \theta} \theta^y}{x_1! x_2! \cdots x_n!}, \quad \bs x = (x_1, x_2, \ldots, x_n) \in \N^n \] де\( y = \sum_{i=1}^n x_i \). Задано\( Y = y \in \N \), випадковий вектор\( \bs X \) приймає значення в множині\(D_y = \left\{\bs x = (x_1, x_2, \ldots, x_n) \in \N^n: \sum_{i=1}^n x_i = y\right\}\). Більш\[\P(\bs X = \bs x \mid Y = y) = \frac{\P(\bs X = \bs x)}{\P(Y = y)} = \frac{e^{-n \theta} \theta^y / (x_1! x_2! \cdots x_n!)}{e^{-n \theta} (n \theta)^y / y!} = \frac{y!}{x_1! x_2! \cdots x_n!} \frac{1}{n^y}, \quad \bs x \in D_y\] того, останнім виразом є PDF багатономіального розподілу, викладеного в теоремі. Звичайно, важливим моментом є те, що умовний розподіл не залежить від\( \theta \).

    Як і раніше, простіше використовувати теорему факторизації для доведення достатності\( Y \), але умовний розподіл дає деяке додаткове розуміння.

    \(Y\)є повним для\(\theta \in (0, \infty)\).

    Доказ

    Якщо\(r: \N \to \R\) тоді Остання\[\E\left[r(Y)\right] = \sum_{y=0}^\infty e^{-n \theta} \frac{(n \theta)^y}{y!} r(y) = e^{-n \theta} \sum_{y=0}^\infty \frac{n^y}{y!} r(y) \theta^y\] сума є степеневим рядом в\(\theta\) з коефіцієнтами\( n^y r(y) / y! \) для\( y \in \N \). Якщо цей ряд дорівнює 0 для всіх\(\theta\) у відкритому інтервалі, то коефіцієнти повинні бути 0 і, отже,\( r(y) = 0 \) для\( y \in \N \).

    Як і в нашому обговоренні випробувань Бернуллі, середнє значення\( M = Y / n \) зразка явно еквівалентно\( Y \) і, отже, також є достатнім для\( \theta \) і повним для\( \theta \in (0, \infty) \). Нагадаємо, що\( M \) є методом оцінки моментів\( \theta \) і є оцінювачем максимальної правдоподібності на просторі параметрів\( (0, \infty) \).

    UMVUE параметру\(\P(X = 0) = e^{-\theta}\) для\( \theta \in (0, \infty) \) є\[ U = \left( \frac{n-1}{n} \right)^Y \]

    Доказ

    Функція генерації ймовірності\(Y\) є\[ P(t) = \E(t^Y) = e^{n \theta(t - 1)}, \quad t \in \R \]\[ \E\left[\left(\frac{n - 1}{n}\right)^Y\right] = \exp \left[n \theta \left(\frac{n - 1}{n} - 1\right)\right] = e^{-\theta}, \quad \theta \in (0, \infty) \] Отже\( U = [(n - 1) / n]^Y \), є неупередженим оцінювачем\( e^{-\theta} \). Оскільки\( U \) є функцією повної, достатньої статистики\( Y \), з теореми Лемана Шеффе (13) випливає, що\( U \) є UMVUE\( e^{-\theta} \).

    Нормальний розподіл

    Нагадаємо, що нормальний розподіл із середнім\(\mu \in \R\) та дисперсійним\(\sigma^2 \in (0, \infty)\) є безперервним розподілом на\( \R \) з функцією щільності ймовірності,\( g \)\[ g(x) = \frac{1}{\sqrt{2 \, \pi} \sigma} \exp\left[-\frac{1}{2}\left(\frac{x - \mu}{\sigma}\right)^2\right], \quad x \in \R \] визначеною Нормальний розподіл часто використовується для моделювання фізичних величин, схильних до малих, випадкових похибок, і Більш детально вивчається в розділі про спеціальні дистрибутиви. Через центральну граничну теорему нормальний розподіл є, мабуть, найважливішим розподілом у статистиці.

    Припустимо, що\(\bs X = (X_1, X_2, \ldots, X_n)\) це випадкова вибірка з нормального розподілу із середнім\(\mu\) та дисперсійним значенням\(\sigma^2\). Тоді кожної з наступних пар статистики мінімально достатньо для\( (\mu, \sigma^2) \)

    1. \((Y, V)\)де\(Y = \sum_{i=1}^n X_i\) і\(V = \sum_{i=1}^n X_i^2\).
    2. \(\left(M, S^2\right)\)де\(M = \frac{1}{n} \sum_{i=1}^n X_i\) - середнє значення\(S^2 = \frac{1}{n - 1} \sum_{i=1}^n (X_i - M)^2\) зразка і дисперсія вибірки.
    3. \( (M, T^2) \)де\( T^2 = \frac{1}{n} \sum_{i=1}^n (X_i - M)^2 \) - упереджена дисперсія вибірки.
    Доказ
    1. Спільний PDF\( f \) з\( \bs X \) дається\[ f(\bs x) = g(x_1) g(x_2) \cdots g(x_n) = \frac{1}{(2 \pi)^{n/2} \sigma^n} \exp\left[-\frac{1}{2 \sigma^2} \sum_{i=1}^n (x_i - \mu)^2\right], \quad \bs x = (x_1, x_2 \ldots, x_n) \in \R^n \] Після деякої алгебри, це можна записати так, як\[ f(\bs x) = \frac{1}{(2 \pi)^{n/2} \sigma^n} e^{-n \mu^2 / \sigma^2} \exp\left(-\frac{1}{2 \sigma^2} \sum_{i=1}^n x_i^2 + \frac{2 \mu}{\sigma^2} \sum_{i=1}^n x_i \right), \quad \bs x = (x_1, x_2 \ldots, x_n) \in \R^n\] випливає з теореми факторизації (3), яка\( (Y, V) \) є достатньою для\(\left(\mu, \sigma^2\right)\). Мінімальна достатність випливає з умови теореми (6).
    2. Зауважте, що\( M = \frac{1}{n} Y, \; S^2 = \frac{1}{n - 1} V - \frac{n}{n - 1} M^2\). Отже\(\left(M, S^2\right)\), еквівалентно\( (Y, V) \) і\(\left(M, S^2\right)\) тому також мінімально достатньо для\(\left(\mu, \sigma^2\right)\).
    3. Аналогічно\( M = \frac{1}{n} Y \) і\( T^2 = \frac{1}{n} V - M^2 \). Отже\( (M, T^2) \), еквівалентно\( (Y, V) \) і\( (M, T^2) \) тому також мінімально достатньо для\( (\mu, \sigma^2) \).

    Нагадаємо, що\( M \) і\( T^2 \) є методом оцінки моментів\( \mu \) і\( \sigma^2 \), відповідно, а також є оцінками максимальної правдоподібності на просторі параметрів\( \R \times (0, \infty) \).

    Запустіть нормальний експеримент оцінки 1000 разів з різними значеннями параметрів. Порівняйте оцінки параметрів за зміщенням і середньою квадратичною похибкою.

    Іноді відома\( \sigma^2 \) дисперсія нормального розподілу, але не середнє\( \mu \). Це рідко випадок, який\( \mu \) відомий, але ні\( \sigma^2 \). Тим не менш, ми можемо дати достатню статистику в обох випадках.

    Припустимо ще раз, що\( \bs X = (X_1, X_2, \ldots, X_n) \) це випадкова вибірка з нормального розподілу із середнім\( \mu \in \R \) і дисперсійним значенням\( \sigma^2 \in (0, \infty)\). Якщо

    1. Якщо\( \sigma^2 \) відомо,\( Y = \sum_{i=1}^n X_i \) то мінімально достатньо для\( \mu \).
    2. Якщо\( \mu \) відомо, то\( U = \sum_{i=1}^n (X_i - \mu)^2 \) досить для\( \sigma^2 \).
    Доказ
    1. Ці результати випливають з другого відображеного рівняння для PDF\( f(\bs x) \)\( \bs X \) у доведенні попередньої теореми.
    2. Цей результат випливає з першого відображеного рівняння для PDF\( f(\bs x) \)\( bs X \) у доведенні попередньої теореми.

    Звичайно, за еквівалентністю, частково (а) середнє значення\( M = Y / n \) зразка мінімально достатнє для\( \mu \), а частково (b) спеціальна дисперсія\( W = U / n \) зразка мінімально достатня для\( \sigma^2 \). Крім того, частково (а),\( M \) є повним для\( \mu \) на просторі параметрів\( \R \) і дисперсія зразка\( S^2 \) є допоміжною для\( \mu \) (Нагадаємо, що\( (n - 1) S^2 / \sigma^2 \) має хі-квадратний розподіл зі\( n - 1 \) ступенями свободи.) З теореми Басу (15) випливає, що середнє значення вибірки\( M \) та дисперсія вибірки\( S^2 \) є незалежними. Ми довели це більш прямим шляхом в розділі про особливі властивості нормальних зразків, але формулювання з точки зору достатньої та допоміжної статистики дає додаткове розуміння.

    Гамма-розподіл

    Нагадаємо, що гамма-розподіл з параметром форми\(k \in (0, \infty)\) та параметром масштабу\(b \in (0, \infty)\) є неперервним розподілом на\( (0, \infty) \) з функцією щільності ймовірності,\( g \) заданою. Гамма-розподіл часто використовується для моделювання випадкових часів та деяких інших типів\[ g(x) = \frac{1}{\Gamma(k) b^k} x^{k-1} e^{-x / b}, \quad x \in (0, \infty) \] позитивні випадкові величини, і більш детально вивчається в розділі про спеціальні розподіли.

    Припустимо, що\(\bs X = (X_1, X_2, \ldots, X_n)\) це випадкова вибірка з гамма-розподілу з параметром форми\(k\) та параметром масштабу\(b\). Кожна з наступних пар статистики мінімально достатня для\((k, b)\)

    1. \((Y, V)\)де\(Y = \sum_{i=1}^n X_i\) - сума балів і\(V = \prod_{i=1}^n X_i\) добуток балів.
    2. \((M, U)\)де\(M = Y / n\) - вибіркове (арифметичне) середнє\(\bs X\) і\(U = V^{1/n}\) є зразком середнє геометричне значення\(\bs X\).
    Доказ
    1. Спільний PDF-файл\( f \)\( \bs X \) наведено теоремою From факторизації (3),\( (Y, V) \) достатньо для\( (k, b) \).\[ f(\bs x) = g(x_1) g(x_2) \cdots g(x_n) = \frac{1}{\Gamma^n(k) b^{nk}} (x_1 x_2 \ldots x_n)^{k-1} e^{-(x_1 + x_2 + \cdots + x_n) / b}, \quad \bs x = (x_1, x_2, \ldots, x_n) \in (0, \infty)^n \] Мінімальна достатність випливає з умови (6).
    2. \( M = Y / n \)Ясно\( U = V^{1/n} \) еквівалентно\( Y \) і еквівалентно\( V \). Отже\( (M, U) \), також мінімально достатньо для\( (k, b) \).

    Нагадаємо, що метод оцінювачів моментів\( k \) і\( b \) є\( M^2 / T^2 \) і\( T^2 / M \), відповідно, де\( M = \frac{1}{n} \sum_{i=1}^n X_i \) є вибірковим середнім і\( T^2 = \frac{1}{n} \sum_{i=1}^n (X_i - M)^2 \) є упередженою дисперсією вибірки. Якщо параметр\( k \) форми відомий, то\( \frac{1}{k} M \) є як методом оцінки моментів, так\( b \) і оцінювачем максимальної правдоподібності на просторі параметрів\( (0, \infty) \). Зверніть увагу, що не\( T^2 \) є функцією достатньої статистики\( (Y, V) \), а значить, оцінювачі на основі\( T^2 \) страждають від втрати інформації.

    Виконати експеримент з оцінки гамми 1000 разів з різними значеннями параметрів і розміром вибірки\( n \). Порівняйте оцінки параметрів за зміщенням і середньою квадратичною похибкою.

    Доказ останньої теореми насправді показує, що\( Y \) достатньо для того,\( b \) якщо\( k \) відомо, і цього\( V \) достатньо для того,\( k \) якщо\( b \) відомо.

    Знову припустимо, що\(\bs X = (X_1, X_2, \ldots, X_n)\) це випадкова вибірка розміру\(n\) з гамма-розподілу з параметром форми\( k \in (0, \infty) \) та параметром масштабу\(b \in (0, \infty)\). Потім\(Y = \sum_{i=1}^n X_i\) завершено для\(b\).

    Доказ

    \( Y \)має гамма-розподіл з параметром форми\( n k \) та параметром масштабу\( b \). Отже, якщо\(r: [0, \infty) \to \R\), то\[\E\left[r(Y)\right] = \int_0^\infty \frac{1}{\Gamma(n k) b^{n k}} y^{n k-1} e^{-y/b} r(y) \, dy = \frac{1}{\Gamma(n k) b^{n k}} \int_0^\infty y^{n k - 1} r(y) e^{-y / b} \, dy\] Останній інтеграл можна інтерпретувати як перетворення Лапласа функції, що\( y \mapsto y^{n k - 1} r(y) \) оцінюється в\( 1 / b \). Якщо це перетворення дорівнює 0 для всіх\(b\) у відкритому інтервалі, то\( r(y) = 0 \) майже скрізь в\( (0, \infty) \).

    Знову припустимо, що\(\bs X = (X_1, X_2, \ldots, X_n)\) це випадкова вибірка з гамма-розподілу на\( (0, \infty) \) з параметром форми\( k \in (0, \infty) \) та параметром масштабу\(b \in (0, \infty)\). Нехай\( M = \frac{1}{n} \sum_{i=1}^n X_i \) позначають середнє значення зразка і\( U = (X_1 X_2 \ldots X_n)^{1/n} \) середнє геометричне зразок, як і раніше. Тоді

    1. \( M / U \)є допоміжним для\( b \).
    2. \( M \)і\( M / U \) є незалежними.
    Доказ
    1. Ми можемо взяти\( X_i = b Z_i \) для\( i \in \{1, 2, \ldots, n\} \) де\( \bs{Z} = (Z_1, X_2, \ldots, Z_n) \) випадкову вибірку розміру з гамма-розподілу\( n \) з параметром форми\( k \) та параметром масштабу 1 (стандартний гамма-розподіл з параметром shape\( k \)). Тоді\[ \frac{M}{U} = \frac{1}{n} \sum_{i=1}^n \frac{X_i}{(X_1 X_2 \cdots X_n)^{1/n}} = \frac{1}{n} \sum_{i=1}^n \left(\frac{X_i^n}{X_1 X_2 \cdots X_n}\right)^{1/n} = \frac{1}{n} \sum_{i=1}^n \left(\prod_{j \ne i} \frac{X_i}{X_j}\right)^{1/n} \] Але\( X_i / X_j = Z_i / Z_j\) за\( i \ne j \), і розподіл\( \left\{Z_i / Z_j: i, j \in \{1, 2, \ldots, n\}, \; i \ne j\right\} \) не залежить від\( b \). Звідси розподіл\( M / U \) не залежить від\( b \).
    2. Це випливає з теореми Басу (15), оскільки\( M \) є повним і достатнім для\( b \) і\( M / U \) є допоміжним для\( b \).

    Бета-дистрибутив

    Нагадаємо, що бета-розподіл з лівим параметром\(a \in (0, \infty)\) і правим параметром\(b \in (0, \infty)\) є безперервним розподілом на\( (0, 1) \) з функцією щільності ймовірності,\( g \) заданої\[ g(x) = \frac{1}{B(a, b)} x^{a-1} (1 - x)^{b-1}, \quad x \in (0, 1)\] де\( B \) бета-функція. Бета-розподіл часто використовується для моделювання випадкових пропорцій та інших випадкових величин, які приймають значення в обмежених інтервалах. Більш докладно вона вивчена в розділі, присвяченому спеціальному розподілу

    Припустимо, що\(\bs X = (X_1, X_2, \ldots, X_n)\) це випадкова вибірка з бета-розподілу з лівим параметром\(a\) і правим параметром\(b\). Тоді\((P, Q)\) мінімально достатньо для того\((a, b)\), де\(P = \prod_{i=1}^n X_i\) і\(Q = \prod_{i=1}^n (1 - X_i)\).

    Доказ

    Спільний PDF-файл\( f \)\( \bs X \) дається\[ f(\bs x) = g(x_1) g(x_2) \cdots g(x_n) = \frac{1}{B^n(a, b)} (x_1 x_2 \cdots x_n)^{a - 1} [(1 - x_1) (1 - x_2) \cdots (1 - x_n)]^{b-1}, \quad \bs x = (x_1, x_2, \ldots, x_n) \in (0, 1)^n \] з теореми факторизації (3), випливає, що\( (U, V) \) достатньо для\( (a, b) \). Мінімальна достатність випливає з умови (6).

    Доказ також показує, що\( P \) достатньо для того,\( a \) якщо\( b \) відомо, і цього\( Q \) достатньо для того,\( b \) якщо\( a \) відомо. Нагадаємо, що метод оцінювачів моментів\( a \) і\( b \) є\[ U = \frac{M\left(M - M^{(2)}\right)}{M^{(2)} - M^2}, \quad V = \frac{(1 - M)\left(M - M^{(2)}\right)}{M^{(2)} - M^2} \] відповідно, де\( M = \frac{1}{n} \sum_{i=1}^n X_i \) є вибірковим середнім і\( M^{(2)} = \frac{1}{n} \sum_{i=1}^n X_i^2 \) є вибірковим середнім порядком другого порядку. Якщо\( b \) відомо, метод оцінки моментів\( a \) є\( U_b = b M / (1 - M) \), тоді як якщо\( a \) відомо, метод оцінки моментів\( b \) є\( V_a = a (1 - M) / M \). Жоден з цих оцінювачів не є функцією достатньої статистики\( (P, Q) \) і тому всі страждають від втрати інформації. З іншого боку, якщо\( b = 1 \), оцінка максимальної ймовірності\( a \) на інтервалі\( (0, \infty) \) є\( W = -n / \sum_{i=1}^n \ln X_i \), яка є функцією\( P \) (як вона повинна бути).

    Запустіть експеримент бета-оцінки 1000 разів з різними значеннями параметрів. Порівняйте оцінки параметрів.

    Розподіл Парето

    Нагадаємо, що розподіл Парето з параметром форми\(a \in (0, \infty)\) та параметром масштабу\(b \in (0, \infty)\) є неперервним розподілом на\( [b, \infty) \) з функцією щільності ймовірності,\( g \) заданої розподілом Парето, названим на честь Вільфредо Парето, часто є важкохвостим розподілом\[ g(x) = \frac{a b^a}{x^{a+1}}, \quad b \le x \lt \infty \] використовується для моделювання доходу і деяких інших типів випадкових величин. Більш детально вона вивчена в розділі, присвяченому спеціальному розподілу.

    Припустимо, що\(\bs X = (X_1, X_2, \ldots, X_n)\) це випадкова вибірка з розподілу Парето з параметром форми\(a\) та параметром масштабу\( b \). Тоді\( \left(P, X_{(1)}\right) \) мінімально достатньо для\( (a, b) \) де\(P = \prod_{i=1}^n X_i\) добуток змінних вибірки,\( X_{(1)} = \min\{X_1, X_2, \ldots, X_n\} \) а де статистика першого порядку.

    Доказ

    Задано спільний PDF\( f \)\( \bs X \) at\( \bs x = (x_1, x_2, \ldots, x_n) \), за допомогою\[ f(\bs x) = g(x_1) g(x_2) \cdots g(x_n) = \frac{a^n b^{n a}}{(x_1 x_2 \cdots x_n)^{a + 1}}, \quad x_1 \ge b, x_2 \ge b, \ldots, x_n \ge b \] якого можна переписати як\[ f(\bs x) = g(x_1) g(x_2) \cdots g(x_n) = \frac{a^n b^{n a}}{(x_1 x_2 \cdots x_n)^{a + 1}} \bs{1}\left(x_{(n)} \ge b\right), \quad (x_1, x_2, \ldots, x_n) \in (0, \infty)^n \] Отже, результат випливає з теореми факторизації (3). Мінімальна достатність випливає з умови (6).

    Доказ також показує, що\( P \) достатньо для того,\( a \) якщо\( b \) відомо (що часто буває), і цього\( X_{(1)} \) достатньо для того,\( b \) якщо\( a \) відомо (набагато рідше). Нагадаємо, що метод моментів оцінювачів\( a \) і\( b \) є\[U = 1 + \sqrt{\frac{M^{(2)}}{M^{(2)} - M^2}}, \quad V = \frac{M^{(2)}}{M} \left( 1 - \sqrt{\frac{M^{(2)} - M^2}{M^{(2)}}} \right)\] відповідно, де як і раніше\( M = \frac{1}{n} \sum_{i=1}^n X_i \) є вибірковим середнім і вибірковим\( M^{(2)} = \sum_{i=1}^n X_i^2 \) середнім порядком другого порядку. Ці оцінювачі не є функціями достатньої статистики і, отже, страждає від втрати інформації. З іншого боку, оцінки максимальної ймовірності\( a \) та\( b \) на\( (0, \infty) \) інтервалі\[W = \frac{n}{\sum_{i=1}^n \ln X_i - n \ln X_{(1)}}, \quad X_{(1)}\] відповідно. Це функції достатньої статистики, якими вони і повинні бути.

    Запустіть експеримент оцінки Парето 1000 разів з різними значеннями параметрів\( a \)\( b \) та розміру вибірки\( n \). Порівняти метод моментних оцінок параметрів з оцінками максимальної ймовірності в терміні емпіричного зміщення та середньої квадратичної похибки.

    Рівномірний розподіл

    Нагадаємо, що безперервний рівномірний розподіл на інтервалі\( [a, a + h] \), де\( a \in \R \) є параметром розташування і\( h \in (0, \infty) \) є параметром масштабу, має функцію щільності ймовірності,\( g \) задану\[ g(x) = \frac{1}{h}, \quad x \in [a, a + h] \] безперервними рівномірними розподілами, широко використовуються в додатках для моделювання число, вибране випадковим чином з інтервалу. Безперервні рівномірні розподіли більш детально вивчені в розділі про спеціальні розподіли. Розглянемо спочатку випадок, коли обидва параметри невідомі.

    Припустимо, що\(\bs X = (X_1, X_2, \ldots, X_n)\) це випадкова вибірка з рівномірного розподілу на інтервалі\([a, a + h]\). Тоді\(\left(X_{(1)}, X_{(n)}\right)\) мінімально достатньо для того\((a, h)\), де\( X_{(1)} = \min\{X_1, X_2, \ldots, X_n\} \) знаходиться статистика першого замовлення і\( X_{(n)} = \max\{X_1, X_2, \ldots, X_n\} \) статистика останнього замовлення.

    Доказ

    PDF\( f \) з\( \bs X \) дається\[ f(\bs x) = g(x_1) g(x_2) \cdots g(x_n) = \frac{1}{h^n}, \quad \bs x = (x_1, x_2, \ldots x_n) \in [a, a + h]^n \] Ми можемо переписати PDF, як\[ f(\bs x) = \frac{1}{h^n} \bs{1}[x_{(1)} \ge a] \bs{1}[x_{(n)} \le a + h], \quad \bs x = (x_1, x_2, \ldots, x_n) \in \R^n \] це випливає з теореми факторизації (3), яка\(\left(X_{(1)}, X_{(n)}\right) \) є достатньою для\( (a, h) \). Далі припустимо, що\( \bs x, \, \bs y \in \R^n \) і те\( x_{(1)} \ne y_{(1)} \) або\( x_{(n)} \ne y_{(n)} \). Для даного\( h \in (0, \infty) \), ми легко можемо знайти значення\( a \in \R \) таких, що\( f(\bs x) = 0 \) і\( f(\bs y) = 1 / h^n \), і інших значень\( a \in \R \) такого, що\( f(\bs x) = f(\bs y) = 1 / h^n \). За умовою (6),\(\left(X_{(1)}, X_{(n)}\right) \) мінімально достатня.

    Якщо параметр location\( a \) відомий, то для параметра масштабу достатньо найбільшої статистики порядку\( h \). Але якщо параметр масштабу\( h \) відомий, нам все одно потрібні обидві статистики замовлення для параметра location\( a \). Таким чином, в цьому випадку, у нас є один параметр реального значення, але мінімально достатньою статистикою є пара реальних випадкових величин.

    Припустимо ще раз, що\( \bs X = (X_1, X_2, \ldots, X_n) \) це випадкова вибірка з рівномірного розподілу на інтервалі\( [a, a + h] \).

    1. Якщо\( a \in \R \) відомо, то\( X_{(n)} \) досить для\( h \).
    2. Якщо\( h \in (0, \infty) \) відомо,\( \left(X_{(1)}, X_{(n)}\right) \) то мінімально достатньо для\( a \).
    Доказ

    Обидві частини легко випливають з аналізу, наведеного в доказі останньої теореми.

    Виконати однорідну оцінку експерименту 1000 разів з різними значеннями параметра. Порівняйте оцінки параметра.

    Нагадаємо, що якщо обидва параметри невідомі, то метод оцінювачів моментів\( a \) і\( h \) є\( U = 2 M - \sqrt{3} T \) і\( V = 2 \sqrt{3} T \), відповідно, де\( M = \frac{1}{n} \sum_{i=1}^n X_i \) середнє значення вибірки і\( T^2 = \frac{1}{n} \sum_{i=1}^n (X_i - M)^2 \) є упередженою дисперсією вибірки. Якщо\( a \) відомо, метод оцінки моментів\( h \) є\( V_a = 2 (M - a) \), тоді як якщо\( h \) відомо, метод оцінки моментів\( h \) є\( U_h = M - \frac{1}{2} h \). Жоден з цих оцінювачів не є функцією мінімально достатньої статистики, а отже, призводить до втрати інформації.

    Гіпергеометрична модель

    Поки що у всіх наших прикладах базові змінні сформували випадкову вибірку з розподілу. У цьому підрозділі наші базові змінні будуть залежними.

    Нагадаємо, що в гіпергеометричній моделі ми маємо сукупність\( N \) об'єктів,\( r \) а об'єкти - тип 1, а решта\( N - r \) - тип 0. Розмір популяції\( N \) є натуральним числом, а розмір типу 1\( r \) - невід'ємне ціле число с\( r \le N \). Зазвичай один або обидва параметри невідомі. Ми вибираємо випадкову вибірку\( n \) об'єктів, без заміни з населення, і нехай\( X_i \) буде тип\( i \) обраного об'єкта. Таким чином, наша основна послідовність випадкових величин\( \bs X = (X_1, X_2, \ldots, X_n) \). Змінні є однаково розподіленими змінними індикатора з\( \P(X_i = 1) = r / N \) for\( i \in \{1, 2, \ldots, n\} \), але залежні. Звичайно, розмір вибірки\( n \) є додатним цілим числом с\( n \le N \).

    Змінна\( Y = \sum_{i=1}^n X_i \) - це кількість об'єктів типу 1 у вибірці. Ця змінна має гіпергеометричний розподіл з параметрами\( N \), і\( r \)\( n \), і має функцію щільності ймовірності,\( h \) задану\[ h(y) = \frac{\binom{r}{y} \binom{N - r}{n - y}}{\binom{N}{n}} = \binom{n}{y} \frac{r^{(y)} (N - r)^{(n - y)}}{N^{(n)}}, \quad y \in \{\max\{0, N - n + r\}, \ldots, \min\{n, r\}\} \] (Відкликати позначення падаючої потужності\( x^{(k)} = x (x - 1) \cdots (x - k + 1) \)). Більш детально гіпергеометричний розподіл вивчено в розділі про моделі скінченної вибірки.

    \( Y \)достатньо для\( (N, r) \). Зокрема, для\( y \in \{\max\{0, N - n + r\}, \ldots, \min\{n, r\}\} \), умовний розподіл\( \bs X \) заданого\( Y = y \) є рівномірним на множині точок\[ D_y = \left\{(x_1, x_2, \ldots, x_n) \in \{0, 1\}^n: x_1 + x_2 + \cdots + x_n = y\right\} \]

    Доказ

    Шляхом простого застосування правила множення комбінаторики, PDF\( f \) of\( \bs X \) задається\[ f(\bs x) = \frac{r^{(y)} (N - r)^{(n - y)}}{N^{(n)}}, \quad \bs x = (x_1, x_2, \ldots, x_n) \in \{0, 1\}^n \] де\( y = \sum_{i=1}^n x_i \). Якщо\( y \in \{\max\{0, N - n + r\}, \ldots, \min\{n, r\}\} \), умовний розподіл\( \bs X \) даного\( Y = y \) концентрується на\( D_y \) і\[ \P(\bs X = \bs x \mid Y = y) = \frac{\P(\bs X = \bs x)}{\P(Y = y)} = \frac{r^{(y)} (N - r)^{(n-y)}/N^{(n)}}{\binom{n}{y} r^{(y)} (N - r)^{(n - y)} / N^{(n)}} = \frac{1}{\binom{n}{y}}, \quad \bs x \in D_y \] Звичайно,\( \binom{n}{y} \) це кардинальність\( D_y \).

    Існує явно сильна подібність між гіпергеометричною моделлю та моделлю випробувань Бернуллі вище. Дійсно, якби вибірка була з заміною, застосовувалася\( p = r / N \) б модель випробувань Бернуллі, а не гіпергеометрична модель. Також цікаво відзначити, що у нас є єдина реальна статистика, достатня для двох реальних параметрів.

    Знову ж таки, середнє значення\( M = Y / n \) зразка еквівалентно\( Y \) і, отже, також достатньо для\( (N, r) \). Нагадаємо, що метод оцінки моментів\( r \) з\( N \) відомим є\( N M \) і метод оцінки моментів\( N \) з\( r \) відомим є\( r / M \). Оцінювач\( r \) - це той, який використовується в експерименті захоплення та відновлення.

    Експоненціальні сім'ї

    Припустимо тепер, що наш вектор даних\(\bs X\) приймає значення в\(S\) множині, і що розподіл\(\bs X\) залежить від вектора параметра, що\(\bs{\theta}\) приймає значення в просторі параметрів\(\Theta\). Розподіл\(\bs X\) є\(k\) -параметром експоненціальної сім'ї, якщо\(S\) не залежить від\(\bs{\theta}\) і якщо функція щільності ймовірності\(\bs X\) може бути записана як

    \[ f_\bs{\theta}(\bs x) = \alpha(\bs{\theta}) r(\bs x) \exp\left(\sum_{i=1}^k \beta_i(\bs{\theta}) u_i(\bs x) \right); \quad \bs x \in S, \; \bs{\theta} \in \Theta \]

    де\(\alpha\) і\(\left(\beta_1, \beta_2, \ldots, \beta_k\right)\) є реальними функціями на\(\Theta\), а де\(r\) і\(\left(u_1, u_2, \ldots, u_k\right)\) є реальними функціями на\(S\). Більш того,\(k\) вважається найменшим таким цілим числом. Вектор параметрів іноді\(\bs{\beta} = \left(\beta_1(\bs{\theta}), \beta_2(\bs{\theta}), \ldots, \beta_k(\bs{\theta})\right)\) називають природним параметром розподілу, а випадковий вектор іноді\(\bs U = \left(u_1(\bs X), u_2(\bs X), \ldots, u_k(\bs X)\right)\) називають природною статистикою розподілу. Хоча визначення може виглядати залякуючим, експоненціальні сім'ї корисні, оскільки вони мають багато приємних математичних властивостей, і тому, що багато спеціальних параметричних сімей є експоненціальними сім'ями. Зокрема, розподіли вибірки з розглянутих вище Бернуллі, Пуассона, гамма, нормалі, бета та Парето є експоненціальними сім'ями. Експоненціальні сім'ї розподілів більш детально вивчаються в розділі про спеціальні розподіли.

    \(\bs U\)мінімально достатня для\(\bs{\theta}\).

    Доказ

    \( U \)Цього достатньо, щоб\( \theta \) випливає відразу з теореми факторизації. \( U \)Це мінімально достатньо, оскільки\( k \) є найменшим цілим числом в експоненціальній формулюванні.

    \(\bs U\)Виявляється, що це\(\bs{\theta}\) також повно, хоча докази складніше.