Skip to main content
LibreTexts - Ukrayinska

9.2: Центральна гранична теорема для дискретних незалежних випробувань

  • Page ID
    98400
  • \( \newcommand{\vecs}[1]{\overset { \scriptstyle \rightharpoonup} {\mathbf{#1}} } \) \( \newcommand{\vecd}[1]{\overset{-\!-\!\rightharpoonup}{\vphantom{a}\smash {#1}}} \)\(\newcommand{\id}{\mathrm{id}}\) \( \newcommand{\Span}{\mathrm{span}}\) \( \newcommand{\kernel}{\mathrm{null}\,}\) \( \newcommand{\range}{\mathrm{range}\,}\) \( \newcommand{\RealPart}{\mathrm{Re}}\) \( \newcommand{\ImaginaryPart}{\mathrm{Im}}\) \( \newcommand{\Argument}{\mathrm{Arg}}\) \( \newcommand{\norm}[1]{\| #1 \|}\) \( \newcommand{\inner}[2]{\langle #1, #2 \rangle}\) \( \newcommand{\Span}{\mathrm{span}}\) \(\newcommand{\id}{\mathrm{id}}\) \( \newcommand{\Span}{\mathrm{span}}\) \( \newcommand{\kernel}{\mathrm{null}\,}\) \( \newcommand{\range}{\mathrm{range}\,}\) \( \newcommand{\RealPart}{\mathrm{Re}}\) \( \newcommand{\ImaginaryPart}{\mathrm{Im}}\) \( \newcommand{\Argument}{\mathrm{Arg}}\) \( \newcommand{\norm}[1]{\| #1 \|}\) \( \newcommand{\inner}[2]{\langle #1, #2 \rangle}\) \( \newcommand{\Span}{\mathrm{span}}\)

    Ми проілюстрували центральну граничну теорему у випадку випробувань Бернуллі, але ця теорема застосовується до набагато більш загального класу випадкових процесів. Зокрема, це стосується будь-якого процесу незалежних випробувань таким чином, що окремі випробування мають кінцеву дисперсію. Для такого процесу справедливі як нормальне наближення для окремих членів, так і Центральна гранична теорема.

    \(S_n = X_1 + X_2 +\cdots+ X_n\)Дозволяти суму\(n\) незалежних дискретних випадкових величин незалежного процесу випробувань із загальною функцією розподілу,\(m(x)\) визначеною на цілих числах, із середнім\(\mu\) та дисперсійним\(\sigma^2\). Ми можемо запобігти цьому так само, як і для випробувань Бернуллі.

    Стандартизовані суми

    Розглянемо стандартизовану випадкову величину\[S_n^* = \frac {S_n - n\mu}{\sqrt{n\sigma^2}}\ .\]

    Це стандартизує\(S_n\) очікуване значення 0 та дисперсію 1. Якщо\(S_n = j\), то\(S_n^*\) має значення\(x_j\) з\[x_j = \frac {j - n\mu}{\sqrt{n\sigma^2}}\ .\] Ми можемо побудувати шип-графік так само, як ми робили для випробувань Бернуллі. Кожен шип зосереджений у деяких\(x_j\). Відстань між послідовними шипами дорівнює\[b = \frac 1{\sqrt{n\sigma^2}}\ ,\] і висоті шипа дорівнює\[h = \sqrt{n\sigma^2} P(S_n = j)\ .\]

    Випадок розглядів Бернуллі - це особливий випадок, для якого,\(X_j = 1\) якщо результат є успішним, а 0 в іншому випадку; тоді\(\mu = p\) і\(\sigma^2 = \sqrt {pq}\).\(j\)

    Зараз ми проілюструємо цей процес для двох різних дискретних дистрибутивів. Перший - це розподіл\(m\), що дається\[m = \pmatrix{ 1 & 2 & 3 & 4 & 5 \cr .2 & .2 & .2 & .2 & .2\cr}\ .\]

    На малюнку [рис. 9.5] ми показуємо стандартизовані суми для цього розподілу для випадків\(n = 2\) і\(n = 10\). Навіть для\(n = 2\) наближення це дивно добре.

    Для нашого другого дискретного розподілу ми вибираємо\[m = \pmatrix{ 1 & 2 & 3 & 4 & 5 \cr .4 & .3 & .1 & .1 & .1\cr}\ .\]

    Цей розподіл досить асиметричний і наближення не дуже добре для\(n = 3\), але\(n = 10\) ми знову маємо відмінне наближення (див. Рис. [рис. 9.5.5]). Малюнки [рис. 9.5] і [рис. 9.5.5] були отримані програмою CLTindTrialsPlot.

    Теорема про наближення

    Як і у випадку випробувань Бернуллі, ці графіки припускають наступну теорему наближення для окремих ймовірностей.

    [thm 9.3.5] Нехай\(X_1\),\(X_2\),...,\(X_n\) бути незалежним процесом випробувань і нехай\(S_n = X_1 + X_2 +\cdots+ X_n\). Припустимо, що найбільший спільний дільник відмінностей всіх значень, які\(X_j\) може приймати на це 1. Нехай\(E(X_j) = \mu\) і\(V(X_j) = \sigma^2\). Тоді для\(n\) великих,\[P(S_n = j) \sim \frac {\phi(x_j)}{\sqrt{n\sigma^2}}\ ,\] де\(x_j = (j - n\mu)/\sqrt{n\sigma^2}\), і\(\phi(x)\) є стандартною нормальною щільністю.

    Програма CLTindTrialsLocal реалізує це наближення. Коли ми запускаємо цю програму для 6 рулонів матриці, і запитуємо ймовірність того, що сума рулонів дорівнює 21, ми отримуємо фактичне значення 0,09285, а нормальне значення наближення 0,09537. Якщо запустити цю програму для 24 рулонів матриці, і запитати ймовірність того, що сума валків дорівнює 72, то отримаємо фактичне значення 0,1724 і нормальне значення наближення 0,01705. Ці результати показують, що нормальні наближення досить хороші.

    Центральна гранична теорема для процесу дискретних незалежних випробувань

    Центральна гранична теорема для процесу дискретних незалежних випробувань полягає в наступному.

    (Центральна гранична теорема) [thm 9.3.6]\(S_n = X_1 + X_2 +\cdots+ X_n\) Дозволяти бути сумою\(n\) дискретних незалежних випадкових величин із загальним розподілом, що мають очікуване значення\(\mu\) та дисперсію\(\sigma^2\). Тоді, для того\(a < b\),\[\lim_{n \to \infty} P\left( a < \frac {S_n - n\mu}{\sqrt{n\sigma^2}} < b\right) = \frac 1{\sqrt{2\pi}} \int_a^b e^{-x^2/2}\, dx\ .\]

    Тут ми розглянемо кілька прикладів.

    Приклади

    Прокочується плашка 420 разів. Яка ймовірність того, що сума рулонів лежить між 1400 і 1550?

    Сума є випадковою величиною\[S_{420} = X_1 + X_2 +\cdots+ X_{420}\ ,\], де кожен\(X_j\) має розподіл\[m_X = \pmatrix{ 1 & 2 & 3 & 4 & 5 & 6 \cr 1/6 & 1/6 & 1/6 & 1/6 & 1/6 & 1/6 \cr}\] Ми бачили, що\(\mu = E(X) = 7/2\) і\(\sigma^2 = V(X) = 35/12\). Таким чином,\(E(S_{420}) = 420 \cdot 7/2 = 1470\),\(\sigma^2(S_{420}) = 420 \cdot 35/12 = 1225\), і\(\sigma(S_{420}) = 35\). Тому\[\begin{aligned} P(1400 \leq S_{420} \leq 1550) &\approx& P\left(\frac {1399.5 - 1470}{35} \leq S_{420}^* \leq \frac {1550.5 - 1470}{35} \right) \\ &=& P(-2.01 \leq S_{420}^* \leq 2.30) \\ &\approx& \mbox{NA}(-2.01, 2.30) = .9670\ . \end{aligned}\] відзначимо, що програма CLTindTrialsGlobal може бути використана для обчислення цих ймовірностей.

    Приклад\(\PageIndex{6}\):

    Середній бал студента - це середнє значення його оцінок у 30 курсах. Оцінки базуються на 100 можливих балах і записуються як цілі числа. Припустимо, що в кожному курсі інструктор робить помилку в оцінюванні\(k\) з ймовірністю\(|p/k|\), де\(k = \pm1\),\(\pm2\),\(\pm3\),\(\pm4\),\(\pm5\). Імовірність відсутності помилки тоді\(1 - (137/30)p\). (Параметр\(p\) представляє неточність оцінювання інструктора.) Таким чином, в кожному курсі є дві оцінки для учня, а саме «правильна» оцінка і записана оцінка. Отже, існує дві середні оцінки для учня, а саме середнє значення правильних оцінок і середнє за записаними оцінками.

    Ми хочемо оцінити ймовірність того, що ці дві середні оцінки відрізняються менш ніж на 0,05 для даного учня. Тепер ми припускаємо, що\(p = 1/20\). Ми також припускаємо, що загальна похибка - це сума\(S_{30}\) 30 незалежних випадкових величин,\(E(X) = 0\) кожна з яких має розподіл\[m_X: \left\{ \begin{array}{ccccccccccc} -5 & -4 & -3 & -2 & -1 & 0 & 1 & 2 & 3 & 4 & 5 \\ \frac1{100} & \frac1{80} & \frac1{60} & \frac1{40} & \frac1{20} & \frac{463}{600} & \frac1{20} & \frac1{40} & \frac1{60} & \frac1{80} & \frac1{100} \end{array} \right \}\ .\]\(\sigma^2(X) = 1.5\). Тоді у нас є

    \[\begin{array}{ll} P\left(-.05 \leq \frac {S_{30}}{30} \leq .05 \right) &= P(-1.5 \leq S_{30} \leq1.5) \\ & \\ &= P\left( \frac{-1.5}{\sqrt{30\cdot1.5}} \leq S_{30}^* \leq \frac{1.5}{\sqrt{30\cdot1.5}} \right) \\ & \\ &= P(-.224 \leq S_{30}^* \leq .224) \\ & \\ & \approx \mbox{NA}(-.224, .224) = .1772\ . \end{array}\]

    Це означає, що існує лише 17.7% шанс, що середній бал даного студента є точним до 0,05. (Так, наприклад, якщо два кандидати на valedictorian записали середні значення 97,1 і 97,2, є помітна ймовірність, що їх правильні середні значення знаходяться в зворотному порядку.) Для подальшого обговорення цього прикладу дивіться статтю Козелки Р.М. 5

    A Більш загальна центральна гранична теорема

    У теоремі\(\PageIndex{1}\) дискретні випадкові величини, які підсумовувалися, вважалися незалежними та однаково розподіленими. Виходить, що припущення про однакових розподілах можна істотно послабити. Багато роботи було зроблено в цій галузі, при цьому важливий внесок зробив Дж. Ліндеберг знайшов умову послідовності,\(\{X_n\}\) яка гарантує, що розподіл суми\(S_n\) асимптотично нормально розподілений. Феллер показав, що умова Ліндеберга також необхідна, в тому сенсі, що якщо умова не\(S_n\) дотримується, то сума не асимптотично нормально розподіляється. Для точного твердження теореми Ліндеберга ми посилаємо читача до Феллера. 6 Достатня умова, яка сильніше (але легше констатувати), ніж умова Ліндеберга, і слабкіше, ніж умова в теоремі\(\PageIndex{1}\), наведено в наступній теоремі.

    Теорема\(\PageIndex{2}\)

    (Центральна гранична теорема)\(X_1,\ X_2,\ \ldots,\ X_n\ ,\ \ldots\) Дозволяти бути послідовність незалежних дискретних випадкових величин, і нехай\(S_n = X_1 + X_2 +\cdots+ X_n\). Для кожного\(n\) позначають середнє значення і дисперсію\(X_n\) по\(\mu_n\) і\(\sigma^2_n\), відповідно. Визначте середнє значення і\(S_n\) дисперсію бути\(m_n\) і\(s_n^2\), відповідно, і припустити, що\(s_n \rightarrow \infty\). Якщо існує константа\(A\), така, що\(|X_n| \le A\) для всіх\(n\), то для\(a < b\),\[\lim_{n \to \infty} P\left( a < \frac {S_n - m_n}{s_n} < b\right) = \frac 1{\sqrt{2\pi}} \int_a^b e^{-x^2/2}\, dx\ .\]

    Умова, яка\(|X_n| \le A\) для всіх\(n\) іноді описується, кажучи,\(\{X_n\}\) що послідовність рівномірно обмежена. Умова, яка\(s_n \rightarrow \infty\) необхідна (див. Вправа [exer 9.2.114]).

    Проілюструємо цю теорему шляхом генерації послідовності\(n\) випадкових розподілів на інтервалі\([a, b]\). Потім ми згортаємо ці розподіли, щоб знайти розподіл суми\(n\) незалежних експериментів, керованих цими розподілами. Нарешті, ми стандартизуємо розподіл, щоб сума мала середнє значення 0 і стандартне відхилення 1 і порівняємо його з нормальною щільністю. Програма CLTGeneral проводить цю процедуру.

    На малюнку [рис. 9.6] ми показуємо результат запуску цієї програми для\([a, b] = [-2, 4]\),\(n = 1,\ 4,\) і 10. Ми бачимо, що наш перший випадковий розподіл досить асиметричний. До моменту вибору суми десяти таких експериментів ми дуже добре підходимо до нормальної кривої.

    Вищезазначена теорема по суті говорить про те, що все, що можна вважати складеною як суму багатьох невеликих незалежних частин, приблизно нормально розподіляється. Це підводить нас до одного з найважливіших питань, яке задавали про генетику в 1800-х роках.

    Нормальний розподіл і генетика

    Коли хтось дивиться на розподіл висот дорослих однієї статі в певній популяції, не можна не помітити, що цей розподіл виглядає як нормальний розподіл. Приклад цього наведено на малюнку [рис. 9.61]. Ця цифра показує розподіл зросту 9593 жінок у віці від 21 до 74 років. Ці дані надходять з обстеження здоров'я та харчування I (HANES I). Для цього опитування було обрано вибірку цивільного населення США. Опитування проводилося між 1971 і 1974 роками.

    Природне питання, яке потрібно задати, - «Як це відбувається?». Френсіс Галтон, англійський вчений в 19 столітті, вивчив це питання та інші пов'язані питання, а також побудував моделі ймовірності, які мали велике значення в поясненні генетичного впливу на такі ознаки, як висота. Насправді одна з найважливіших ідей в статистиці, ідея регресії до середнього, була придумана Галтоном в його спробах зрозуміти ці генетичні ефекти.

    Галтон зіткнувся з явним протиріччям. З одного боку, він знав, що нормальний розподіл виникає в ситуаціях, в яких підсумовується багато невеликих незалежних ефектів. З іншого боку, він також знав, що на багато кількісні ознаки, такі як зріст, сильно впливають генетичні фактори: високі батьки, як правило, мають високе потомство. Таким чином, в цьому випадку, здається, є два великих ефекту, а саме батьки. Галтон, безумовно, усвідомлював той факт, що негенетичні фактори відігравали певну роль у визначенні зростання індивіда. Тим не менш, якщо ці негенетичні фактори не переповнюють генетичні, тим самим спростовуючи гіпотезу про те, що спадковість важлива при визначенні висоти, наборам батьків заданих висот не здавалося можливим мати потомство, висоти якого нормально розподілялися.

    Вищенаведену проблему можна висловити символічно наступним чином. Припустимо, що ми вибираємо два конкретних позитивних дійсних числа\(x\) і\(y\), а потім знаходимо всі пари батьків, один з яких\(x\) одиниць високий, а інший з яких\(y\) одиниць високий. Потім ми дивимося на все потомство цих пар батьків. Можна постулювати існування функції,\(f(x, y)\) яка позначає генетичний вплив висоти батьків на висоту потомства. Потім можна дозволити\(W\) позначити вплив негенетичних факторів на висоту потомства. Потім для заданого набору висот випадкова величина\(\{x, y\}\), яка представляє висоти потомства, задається\[H = f(x, y) + W\ ,\] де\(f\) є детермінованою функцією, тобто вона дає один вихід для пари входів\(\{x, y\}\). Якщо припустити, що ефект великий в порівнянні з ефектом\(W\), то дисперсія\(W\) невелика.\(f\) Але оскільки f є детермінованим, дисперсія\(H\) дорівнює дисперсії\(W\), тому дисперсія\(H\) невелика. Однак Галтон спостерігав за своїми даними, що дисперсія висот потомства даної пари батьківських висот не мала. Це, здавалося б, означає, що спадщина відіграє невелику роль у визначенні зростання індивіда. Пізніше в цьому розділі ми опишемо, яким чином Галтон обійшов цю проблему.

    Ми зараз розглянемо сучасне пояснення того, чому певні риси, такі як висоти, приблизно нормально розподілені. Для цього нам потрібно ввести деяку термінологію з області генетики. Клітини в живому організмі, які не беруть безпосередньої участі в передачі генетичного матеріалу потомству, називаються соматичними, а решта - статевими клітинами. Організми даного виду мають свою генетичну інформацію, закодовану в наборах фізичних осіб, званих хромосомами. Хромосоми парні в кожній соматичній клітині. Наприклад, у людини є 23 пари хромосом в кожній соматичній клітині. Статеві клітини містять по одній хромосомі з кожної пари. При статевому розмноженні дві статеві клітини, по одній від кожного з батьків, вносять свої хромосоми для створення набору хромосом для потомства.

    Хромосоми містять багато субодиниць, званих генами. Гени складаються з молекул ДНК, а один ген має, закодовану в його ДНК, інформацію, яка призводить до регуляції білків. У цьому контексті ми розглянемо ті гени, що містять інформацію, яка впливає на деякі фізичні риси, такі як висота організму. Спарювання хромосом породжує спарювання генів на хромосомах.

    У даного виду кожен ген може бути будь-яким з декількох форм. Ці різні форми називаються алелями. Слід думати про різні алелі як потенційно спричиняючи різний вплив на відповідну фізичну рису. З двох алелів, які знаходяться в даній парі генів в організмі, один з алелів походить від одного з батьків, а інший алель - від іншого батька. Можливі види пар алелей (без урахування порядку) називаються генотипами.

    Якщо припустити, що висота людини в значній мірі контролюється певним геном, то ми стикаємося з тими ж труднощами, що і Галтон. Ми припускаємо, що кожен з батьків має пару алелей, які значною мірою контролюють їх висоту. Оскільки кожен батько вносить один алель цієї генної пари кожному своєму потомству, у цьому місці гену існує чотири можливі пари алелів для потомства. Припущення полягає в тому, що ці пари алелів значною мірою контролюють висоту потомства, і ми також припускаємо, що генетичні фактори переважують негенетичні фактори. Звідси випливає, що серед потомства ми повинні бачити кілька режимів в висотному розподілі потомства, один режим, відповідний кожній можливій парі алелей. Цей розподіл не відповідає спостережуваному розподілу висот.

    Альтернативною гіпотезою, яка пояснює спостереження нормально розподілених висот у потомства даної статі, є багатогенна гіпотеза. За цією гіпотезою ми припускаємо, що існує безліч генів, які впливають на зростання індивіда. Ці гени можуть відрізнятися за кількістю своїх ефектів. Таким чином, ми можемо представляти кожну пару генів випадковою величиною\(X_i\), де значенням випадкової величини є вплив пари аллелів на висоту індивіда. Так, наприклад, якщо у кожного з батьків в розглянутій генній парі є два різних алелі, то потомство має одну з чотирьох можливих пар алелів на цьому місці розташування гена. Тепер висота потомства - це випадкова величина, яка може виражатися так,\[H = X_1 + X_2 + \cdots + X_n + W\ ,\] ніби є\(n\) гени, що впливають на висоту. (Тут, як і раніше, випадкова величина\(W\) позначає негенетичні ефекти.) Хоча\(n\) є фіксованою, якщо вона досить велика, то теорема\(\PageIndex{2}\) має на увазі, що сума\(X_1 + X_2 + \cdots + X_n\) приблизно нормально розподілена. Тепер, якщо ми припустимо, що вони мають значно більший кумулятивний ефект, ніж\(W\) робить, то\(H\) приблизно нормально розподіляється.\(X_i\)

    Ще однією спостережуваною особливістю розподілу висот дорослих однієї статі в популяції є те, що дисперсія, здається, не збільшується або зменшується від одного покоління до наступного. Це було відомо ще за часів Галтона, і його спроби пояснити це привели його до ідеї регресії до середнього. Ця ідея буде розглянута далі в історичних зауваженнях в кінці розділу. (Причина, по якій ми розглядаємо лише одну стать, полягає в тому, що людські висоти чітко пов'язані з сексом, і загалом, якщо у нас є дві популяції, які нормально розподілені, то їх союз не повинен бути нормально розподілений.)

    Використовуючи багатогенну гіпотезу, легко пояснити, чому дисперсія повинна бути постійною від покоління до покоління. Почнемо з припущення, що для конкретного розташування гена існують\(k\) алелі, якими ми і будемо позначати\(A_1,\ A_2,\ \ldots,\ A_k\). Припускаємо, що потомство виробляється шляхом випадкового спарювання. Під цим ми маємо на увазі, що, враховуючи будь-яке потомство, однаково ймовірно, що воно прийшло від будь-якої пари батьків у попередньому поколінні. Є ще один спосіб подивитися на випадкове спаровування, який полегшує розрахунки. Розглянуто\(S\) сукупність всіх алелів (при даному генному розташуванні) у всіх статевих клітині всіх особин батьківського покоління. З точки зору набору\(S\), під випадковим спаровуванням ми маємо на увазі, що кожна пара алелів в\(S\) однаковій мірі може проживати в якомусь конкретному потомстві. (Читач може заперечити проти такого способу мислення про випадкове спаровування, оскільки це дозволяє двом алелям одного і того ж батька опинитися в потомстві; але якщо кількість особин у батьківській популяції велика, то чи дозволяємо ми цю подію, не впливає на ймовірності дуже сильно.)

    Бо\(1 \le i \le k\),\(p_i\) позначимо частку алелей в материнській популяції, які відносяться до типу\(A_i\). Зрозуміло, що це те саме, що і частка алелів в статевих клітині материнської популяції, припускаючи, що кожен з батьків виробляє приблизно однакову кількість мікробних клітин. Розглянемо розподіл алелей у потомства. Оскільки кожна статева клітина з однаковою ймовірністю буде обрана для якогось конкретного потомства, розподіл алелів у потомства такий же, як і у батьків.

    Далі ми розглянемо розподіл генотипів у двох поколіннях. Доведемо наступний факт: розподіл генотипів у генерації потомства залежить тільки від розподілу алелей в материнському поколінні (зокрема, не залежить від розподілу генотипів в материнському поколінні). Розглянемо можливі генотипи;\(k(k+1)/2\) є їх. За нашими припущеннями, генотип\(A_iA_i\) буде відбуватися з частотою\(p_i^2\), а генотип\(A_iA_j\), з\(i \ne j\), відбуватиметься з частотою\(2p_ip_j\). Таким чином, частоти генотипів залежать лише від частот алелів у батьківському поколінні, як стверджується.

    Це означає, що якщо ми почнемо з певного покоління, і певного розподілу алелів, то у всіх поколіннях після того, з якого ми почали, буде зафіксовано і розподіл алелів, і розподіл генотипу. Це останнє твердження відоме як Закон Харді-Вайнберга.

    Можна описати наслідки цього закону для розподілу висот серед дорослих однієї статі в популяції. Нагадаємо, що висота потомства задавалася випадковою величиною\(H\), де\[H = X_1 + X_2 + \cdots + X_n + W\ ,\] з відповідними генам, що впливають на висоту, і випадковою величиною, що\(W\) позначає негенетичні ефекти.\(X_i\) Закон Харді-Вайнберга говорить\(X_i\), що для кожного розподіл в поколінні потомства таке ж, як розподіл в материнському поколінні. Таким чином, якщо припустити, що розподіл приблизно однаковий з покоління в покоління (або якщо припустити, що його ефекти невеликі), то розподіл\(H\) відбувається однаково від покоління до покоління.\(W\) (Насправді дієтичні ефекти є частиною\(W\), і зрозуміло, що в багатьох людських популяціях дієти останнім часом змінилися зовсім небагато від покоління до наступного. Вважається, що ця зміна є однією з причин того, що люди, в середньому, стають вищими. Це також так, що наслідки\(W\) вважаються невеликими щодо генетичних наслідків батьків.)

    Обговорення

    Взагалі кажучи, Центральна гранична теорема містить більше інформації, ніж Закон великих чисел, оскільки вона дає нам детальну інформацію про розподіл\(S_n^*\); для великих\(n\) форма приблизно така ж, як форма стандартної нормальної щільності. Більш конкретно, Центральна гранична теорема говорить, що якщо ми стандартизуємо і висоту-коригуємо розподіл\(S_n\), то нормальна функція щільності є дуже хорошим наближенням до цього розподілу, коли\(n\) велика. Таким чином, ми маємо обчислювальну апроксимацію для розподілу\(S_n\), яка надає нам потужну техніку генерації відповідей на всілякі питання про суми незалежних випадкових величин, навіть якщо окремі випадкові величини мають різні розподіли.

    Історичні зауваження

    У середині 1800-х років бельгійський математик Кетле 7 емпірично показав, що нормальний розподіл відбувається в реальних даних, а також дав метод підгонки нормальної кривої до заданого набору даних. Лаплас 8 показав набагато раніше, що сума багатьох незалежних однаково розподілених випадкових величин є приблизно нормальною. Галтон знав, що певні фізичні риси в популяції виявилися приблизно нормально розподіленими, але він не вважав результат Лапласа хорошим поясненням того, як відбувається цей розподіл. Наведемо цитату Галтона, яка фігурує в захоплюючій книзі С.Стіглера 9 з історії статистики:

    По-перше, дозвольте мені зазначити факт, який Кетле та всі письменники, які пішли на його шляху, безперечно не помітили, і який має інтимне відношення до нашої роботи вночі. Справа в тому, що, хоча характеристики рослин і тварин відповідають закону, причина їх цього поки що абсолютно незрозуміла. Суть закону полягає в тому, що відмінності повинні бути повністю обумовлені колективними діями безлічі самостійних впливів в різних поєднаннях... Зараз процеси спадковості... не дрібні впливи, а дуже важливі... висновок... що процеси спадковості повинні гармонійно працювати з закон відхилення, і бути самі в деякому сенсі відповідними йому.

    Галтон винайшов пристрій, відомий як quincunx (тепер зазвичай називається дошкою Галтона), який ми використовували в прикладі 3.2.1, щоб показати, як фізично отримати біноміальний розподіл. Звичайно, Центральна гранична теорема говорить про те\(n\), що при великих значеннях параметра біноміальний розподіл приблизно нормальний. Галтон використовував квінкункс, щоб пояснити, як спадкування впливає на розподіл ознаки серед потомства.

    Ми вважаємо, як це робив Галтон, що станеться, якщо на деякій проміжній висоті перервати хід пострілу, який падає в квінкункс. Читач посилається на рис. [рис. 9.62]. Ця цифра є малюнком Карла Пірсона, 10 на основі нот Галтона. На цьому малюнку постріл тимчасово розділяється на відсіки на лінії АВ. (Лінія A\(^{\prime}\) B\(^{\prime}\) утворює платформу, на якій може спиратися постріл.) Якщо лінія АВ знаходиться не дуже близько до вершини квінкункса, то постріл буде приблизно нормально розподілений на цій лінії. Тепер припустимо, що відкрито одне відділення, як показано на малюнку. Постріл з цього відсіку впаде, утворюючи нормальний розподіл внизу квінкункса. Якщо тепер всі відсіки будуть відкриті, то весь постріл впаде, виробляючи такий же розподіл, який відбувся б, якби постріл тимчасово не був зупинений на лінії АВ. Але дія зупинки пострілу на лінії АВ, а потім звільнення відсіків по одному, якраз те ж саме, що звивисті два нормальних розподілу. Нормальні розподіли внизу, відповідні кожному відсіку на лінії AB, змішуються, причому їх вага - це кількість пострілу в кожному відсіку. З іншого боку, вже відомо, що якщо постріл безперешкодний, остаточний розподіл приблизно нормальний. Таким чином, даний пристрій показує, що згортка двох нормальних розподілів знову нормальна.

    Галтон також розглядав квінкункс з іншої точки зору. Він розділив на сім груп, по вазі, набір з 490 насіння запашного гороху. Він дав по 10 насіння з кожної з семи груп кожному з семи друзів, які вирощували рослини з насіння. Галтон виявив, що кожна група виробляла насіння, вага яких зазвичай розподілялася. (Розмножується запашний горошок самозапиленням, тому йому не потрібно було розглядати можливість взаємодії між різними групами.) Крім того, він виявив, що розбіжності ваг потомства були однаковими для кожної групи. Ця поділ на групи відповідає відсікам на лінії AB в квінкунксі. Таким чином, запашний горошок діяв так, ніби їм керувала згортка нормальних розподілів.

    Тепер він зіткнувся з проблемою. Ми показали в главі 7 і Галтон знав, що згортка двох нормальних розподілів виробляє нормальний розподіл з більшою дисперсією, ніж будь-який з вихідних розподілів. Але його дані про насіння запашного гороху показали, що дисперсія популяції потомства була такою ж, як і дисперсія материнської популяції. Його відповідь на цю проблему полягала в тому, щоб постулювати механізм, який він називав, і зараз називається. Як стверджує Стиглер: 11

    Сім груп потомства були нормально розподілені, але не про вагу батьків. Швидше вони в кожному випадку розподілялися про значення, яке було ближче до середньої ваги населення, ніж у батьків. Крім того, ця реверсія слідувала за «найпростішим можливим законом», тобто він був лінійним. Середнє відхилення потомства від середньої чисельності населення було в тому ж напрямку, що і у батька, але тільки на третину менше. Середнє потомство повернулося до типу, і збільшена варіація була достатньо для підтримки мінливості популяції.

    Галтон ілюстрував реверсію ілюстрацією, наведеною на малюнку [рис. 9.63]. 12 Батьківська популяція показана у верхній частині малюнка, а похилі лінії призначені для відповідності ефекту реверсії. Популяція потомства показана внизу малюнка.

    Вправа\(\PageIndex{1}\)

    Плашка прокочується 24 рази. Використовуйте центральну граничну теорему для оцінки ймовірності того, що

    1. сума більше 84.
    2. сума дорівнює 84.

    Вправа\(\PageIndex{2}\)

    Випадковий ходок починається з 0 на\(x\) -осі і кожного разу блок рухається на 1 крок вправо або 1 крок вліво з ймовірністю 1/2. Оцініть ймовірність того, що після 100 кроків ходок знаходиться більш ніж на 10 кроків від вихідного положення.

    Вправа\(\PageIndex{3}\)

    Шматок мотузки складається з 100 пасом. Припустимо, що міцність на розрив мотузки - це сума міцності на розрив окремих пасом. Припустимо далі, що ця сума може вважатися сумою незалежного процесу випробувань з 100 експериментів, кожен з яких має очікуване значення 10 фунтів і стандартне відхилення 1. Знайдіть приблизну ймовірність того, що мотузка витримає вагу

    1. 1000 фунтів.
    2. 970 фунтів.

    Вправа\(\PageIndex{4}\)

    Напишіть програму, щоб знайти середнє значення 1000 випадкових цифр 0, 1, 2, 3, 4, 5, 6, 7, 8 або 9. Проведіть тест програми, щоб перевірити, чи лежить середнє значення в межах трьох стандартних відхилень від очікуваного значення 4.5. Змініть програму так, щоб вона повторювала це моделювання 1000 разів і відстежувала кількість разів проходження тесту. Чи згоден ваш результат з центральною граничною теоремою?

    Вправа\(\PageIndex{5}\)

    Штампу кидають до першого разу загальна сума номіналів матриці 700 або більше. Оцініть ймовірність того, що, щоб це сталося,

    1. потрібно більше 210 підкидань.
    2. потрібно менше 190 підкидань.
    3. між 180 і 210 кидками, включно, обов'язкові.

    Вправа\(\PageIndex{6}\)

    Банк приймає рулони копійок і дає 50 центів кредит клієнту без підрахунку вмісту. Припустимо, що рулон містить 49 копійки 30 відсотків часу, 50 копійок 60 відсотків часу та 51 копійки 10 відсотків часу.

    1. Знайдіть очікуване значення і дисперсію для суми, яку банк втрачає на типовому рулоні.
    2. Оцініть ймовірність того, що банк втратить більше 25 центів в 100 рулонів.
    3. Оцініть ймовірність того, що банк втратить рівно 25 центів в 100 рулонів.
    4. Оцініть ймовірність того, що банк втратить будь-які гроші в 100 рулонів.
    5. Скільки рулонів банку потрібно зібрати, щоб мати 99 відсотків шансів на чистий збиток?

    Вправа\(\PageIndex{7}\)

    Геодезичний прилад робить похибку\(-2\)\(-1\), 0, 1 або 2 фути з однаковими ймовірностями при вимірюванні висоти 200-футової вежі.

    1. Знайдіть очікуване значення і дисперсію для висоти, отриманої за допомогою цього приладу один раз.
    2. Оцініть ймовірність того, що в 18 незалежних вимірах цієї вежі середнє значення вимірювань становить від 199 до 201 включно.

    Вправа\(\PageIndex{8}\)

    Наприклад,\(\PageIndex{9}\) кошторис\(P(S_{30} = 0)\). Тобто оцініть ймовірність того, що помилки скасовуються, а середній бал учня є правильним.

    Вправа\(\PageIndex{9}\)

    Доведіть закон великих чисел за допомогою центральної граничної теореми.

    Вправа\(\PageIndex{10}\)

    Петра і Павла збігаються копійки 10 000 разів. Опишіть коротко, що кожна з наступних теорем розповідає вам про стан Петра.

    1. Закон великих чисел.
    2. Центральна гранична теорема.

    Вправа\(\PageIndex{11}\)

    Туриста в Лас-Вегасі приваблювала певна азартна гра, в якій клієнт робить ставку 1 долар на кожну гру; виграш потім платить клієнту 2 долари плюс повернення її частки, хоча втрата коштує їй лише її частку. Інсайдери Лас-Вегаса та попередження студентів теорії ймовірностей знають, що ймовірність виграшу в цій грі становить 1/4. Коли зганяли зі столів голодом, турист зіграв у цю гру 240 разів. Припускаючи, що ніяких чудес поблизу не сталося, про те, наскільки біднішим був турист після виходу з казино? Яка ймовірність того, що вона не втратила грошей?

    Вправа\(\PageIndex{12}\)

    Ми бачили, що, граючи в рулетку в Монте-Карло (приклад [іспит 6.7]), ставки 1 долар на червоний або 1 долар на 17 становить вибір між розподілами\[m_X = \pmatrix{ -1 & -1/2 & 1 \cr 18/37 & 1/37 & 18/37\cr }\] або\[m_X = \pmatrix{ -1 & 35 \cr 36/37 & 1/37 \cr }\] Ви плануєте вибрати один з цих методів і використовувати його, щоб зробити 100 1-доларові ставки, використовуючи обраний метод. Використовуючи центральну теорему про ліміти, оцініть ймовірність виграшу будь-яких грошей за кожну з двох ігор. Порівняйте свої оцінки з фактичними ймовірностями, які можуть бути показані, з точних обчислень, до рівних .437 і .509 до трьох знаків після коми.

    Вправа\(\PageIndex{13}\)

    У прикладі\(\PageIndex{9}\) знайдіть найбільше значення\(p\), яке дає ймовірність .954, що перший десятковий знак є правильним.

    Вправа\(\PageIndex{14}\)

    Було висловлено\(\PageIndex{9}\) припущення, що Example нереальний, в тому сенсі, що ймовірність помилок занадто низька. Складіть власну (розумну) оцінку для розподілу та визначте ймовірність того\(m(x)\), що середній бал учня є точним до 0,05. Також визначте ймовірність того, що вона точна з точністю до 0,5.

    Вправа\(\PageIndex{15}\)

    Знайти послідовність рівномірно обмежених дискретних незалежних випадкових величин\(\{X_n\}\) так, щоб дисперсія їх суми не була схильна до\(\infty\) як\(n \rightarrow \infty\), і така, щоб їх сума не була асимптотично нормально розподілена.