9.3: Центральна гранична теорема для безперервних незалежних випробувань
- Page ID
- 98387
У розділі 1.2 ми бачили, що функція розподілу для суми великої кількості\(n\) незалежних дискретних випадкових величин із середнім\(\mu\) та дисперсійним значенням\(\sigma^2\) має тенденцію виглядати як нормальна щільність із середнім\(n\mu\) та дисперсійним значенням\(n\sigma^2\). Що примітно в цьому результаті, це те, що він тримається для будь-якого розподілу з кінцевим середнім і дисперсією. У цьому розділі ми побачимо, що той самий результат також відповідає дійсності для неперервних випадкових величин, що мають загальну функцію щільності.
Почнемо з розгляду деяких прикладів, щоб зрозуміти, чи є такий результат навіть правдоподібним.
Стандартизовані суми
Припустимо, ми вибираємо\(n\) випадкові числа з інтервалу\([0,1]\) з рівномірною щільністю. Нехай\(X_1\),\(X_2\),...,\(X_n\) позначають ці варіанти, і\(S_n = X_1 + X_2 +\cdots+ X_n\) їх суму.
Ми побачили в прикладі [іспит 7.12], що функція щільності для\(S_n\) має тенденцію мати нормальну форму, але по центру\(n/2\) і сплющена. Для того, щоб порівняти форми цих функцій щільності для різних значень\(n\), ми продовжуємо, як і в попередньому розділі: ми\(S_n\) визначаємо\[S_n^* = \frac {S_n - n\mu}{\sqrt n \sigma}\ .\] Тоді ми бачимо, що для всіх у\(n\) нас є\[\begin{aligned} E(S_n^*) & = & 0\ , \\ V(S_n^*) & = & 1\ .\end{aligned}\] Функція щільності для\(S_n^*\) є лише стандартизованою версією щільності функція for\(S_n\) (див. Рис. [рис. 9.7]).
Зробимо те ж саме, але тепер вибираємо числа з інтервалу\([0,+\infty)\) з експоненціальною щільністю з параметром\(\lambda\). Потім (див. Приклад [іспит 6.21])
\[\begin{aligned} \mu & = & E(X_i) = \frac 1\lambda\ , \\ \sigma^2 & = & V(X_j) = \frac 1{\lambda^2}\ .\end{aligned}\]
Тут ми знаємо функцію щільності для\(S_n\) явно (див. Розділ [сек. 7.2]). Ми можемо використовувати Corollary [cor 5.1] для обчислення функції щільності для\(S_n^*\). Отримуємо
\[\begin{aligned} f_{S_n}(x) & = & \frac {\lambda e^{-\lambda x}(\lambda x)^{n - 1}}{(n - 1)!}\ , \\ f_{S_n^*}(x) & = & \frac {\sqrt n}\lambda f_{S_n} \left( \frac {\sqrt n x + n}\lambda \right)\ .\end{aligned}\]Графік функції щільності для\(S_n^*\) показаний на малюнку [рис. 9.9].
Ці приклади дозволяють здатися правдоподібним, що функція щільності для нормованої випадкової величини\(S_n^*\) для великих\(n\) буде виглядати дуже схожа на нормальну щільність із середнім значенням 0 та дисперсією 1 як у неперервному випадку, так і в дискретному випадку. Центральна гранична теорема робить це твердження точним.
Центральна гранична теорема
[thm 9.4.7] (Центральна гранична теорема)\(S_n = X_1 + X_2 +\cdots+ X_n\) Дозволяти бути сумою\(n\) незалежних неперервних випадкових величин із загальною функцією щільності,\(p\) що має очікуване значення\(\mu\) та дисперсію\(\sigma^2\). Нехай\(S_n^* = (S_n - n\mu)/\sqrt n \sigma\). Тоді у нас, для всіх\(a < b\),\[\lim_{n \to \infty} P(a < S_n^* < b) = \frac 1{\sqrt{2\pi}} \int_a^b e^{-x^2/2}\, dx\ .\]
Доказ цієї теореми ми наведемо в Розділі [сек. 10.3]. Ми зараз розглянемо деякі приклади.
[іспит 9.10] Припустимо, що геодезист хоче виміряти відому відстань, скажімо, 1 миля, використовуючи транзит і якийсь метод тріангуляції. Він знає, що через можливий рух транзиту, атмосферних спотворень та людської помилки будь-яке одне вимірювання може бути трохи помилковим. Він планує зробити кілька вимірів і взяти середнє. Він припускає, що його вимірювання є незалежними випадковими величинами із загальним розподілом середнього\(\mu = 1\) і стандартного відхилення\(\sigma = .0002\) (так, якщо похибки приблизно нормально розподілені, то його вимірювання знаходяться в межах 1 фута від правильної відстані близько 65% часу). Що він може сказати про середньостатистичний?
Він може сказати, що якщо великий,\(n\) то середній\(S_n/n\) має функцію щільності, яка є приблизно нормальною, з середньою\(\mu = 1\) милею, і стандартним відхиленням\(\sigma = .0002/\sqrt n\) миль.
Скільки вимірювань він повинен зробити, щоб бути розумно впевненим, що його середнє значення лежить в межах 0,0001 від істинного значення? Нерівність Чебишева говорить\[P\left(\left| \frac {S_n}n - \mu \right| \geq .0001 \right) \leq \frac {(.0002)^2}{n(10^{-8})} = \frac 4n\ ,\] так, що ми повинні мати\(n \ge 80\) перед тим, як ймовірність того, що його похибка менше 0,0001 перевищує 0,95.
Ми вже помітили, що оцінка в нерівності Чебишева не завжди хороша, і ось приклад. Якщо припустити, що\(n\) досить великий, щоб щільність для була\(S_n\) приблизно нормальною, то у нас
\[\begin{aligned} P\left(\left| \frac {S_n}n - \mu \right| < .0001 \right) &=& P\bigl(-.5\sqrt{n} < S_n^* < +.5\sqrt{n}\bigr) \\ &\approx& \frac 1{\sqrt{2\pi}} \int_{-.5\sqrt{n}}^{+.5\sqrt{n}} e^{-x^2/2}\, dx\ ,\end{aligned}\]і цей останній вираз більше, ніж .95, якщо\(.5\sqrt{n} \ge 2.\) Це говорить про те, що достатньо провести\(n = 16\) вимірювання для тих же результатів. Цей другий розрахунок сильніший, але залежить від припущення, яке\(n = 16\) є досить великим, щоб встановити нормальну щільність як хороше наближення до\(S_n^*\), а значить і до\(S_n\). Центральна гранична теорема тут нічого не говорить про те, наскільки великим\(n\) має бути. У більшості випадків, пов'язаних із сумами незалежних випадкових величин, хорошим правилом є те\(n \ge 30\), що для, наближення є хорошим. У даному випадку, якщо припустити, що помилки приблизно нормально розподілені, то наближення, ймовірно, досить добре навіть для\(n = 16\).
Оцінка середнього
(Продовження Прикладу [іспит 9.10]) Тепер припустимо, що наш геодезист вимірює невідому відстань з тими ж інструментами в тих же умовах. Він робить 36 вимірювань і усереднює їх. Наскільки він може бути впевненим, що його вимірювання лежить в межах 0,0002 від істинного значення?
Знову використовуючи нормальне наближення, отримуємо\[\begin{aligned} P\left(\left|\frac {S_n}n - \mu\right| < .0002 \right) &=& P\bigl(|S_n^*| < .5\sqrt n\bigr) \\ &\approx& \frac 2{\sqrt{2\pi}} \int_{-3}^3 e^{-x^2/2}\, dx \\ &\approx& .997\ .\end{aligned}\]
Це означає, що геодезист може бути на 99,7 відсотків впевнений, що його середнє значення знаходиться в межах 0,0002 від істинного значення. Щоб підвищити свою впевненість, він може робити більше вимірювань, або вимагати меншої точності, або поліпшити якість своїх вимірювань (тобто зменшити дисперсію\(\sigma^2\)). У кожному випадку центральна гранична теорема дає кількісну інформацію про довіру процесу вимірювання, припускаючи завжди, що нормальне наближення є дійсним.
Тепер припустимо, що геодезист не знає середнього або стандартного відхилення своїх вимірювань, але припускає, що вони незалежні. Як він повинен вчинити?
Знову ж таки, він робить кілька вимірювань відомої відстані і усереднює їх. Як і раніше, середня похибка приблизно нормально розподіляється, але тепер з невідомим середнім і дисперсією.
Середнє значення зразка
Якщо він знає дисперсію\(\sigma^2\) розподілу похибки 0,0002, то він може оцінити середнє значення,\(\mu\) взявши або, скажімо, 36 вимірювань:\[\bar \mu = \frac {x_1 + x_2 +\cdots+ x_n}n\ ,\] де\(n = 36\). Потім, як і раніше,\(E(\bar \mu) = \mu\). Крім того, попередній аргумент показує, що\[P(|\bar \mu - \mu| < .0002) \approx .997\ .\] Інтервал\((\bar \mu - .0002, \bar \mu + .0002)\) викликається\(\mu\) (див. Приклад [іспит 9.4.1]).
Дисперсія зразка
Якщо він не знає\(\sigma^2\) дисперсії розподілу помилок, то він може оцінити\(\sigma^2\) по:\[\bar \sigma^2 = \frac {(x_1 - \bar \mu)^2 + (x_2 - \bar \mu)^2 +\cdots+ (x_n - \bar \mu)^2}n\ ,\] де\(n = 36\). Закон великих чисел, застосований до випадкових величин\((X_i - \bar \mu)^2\), говорить\(n\), що для великих дисперсія вибірки\(\bar \sigma^2\) лежить близько до дисперсії\(\sigma^2\), так що геодезист може використовувати\(\bar \sigma^2\)\(\sigma^2\) замість аргументу вище.
Досвід показав, що в більшості практичних задач цього типу дисперсія вибірки є хорошою оцінкою для дисперсії і може бути використана замість дисперсії для визначення довірчих рівнів для середнього зразка. Це означає, що ми можемо покладатися на Закон великих чисел для оцінки дисперсії та Центральну граничну теорему для оцінки середнього.
Ми можемо перевірити це в деяких особливих випадках. Припустимо, ми знаємо, що розподіл помилок з невідомим середнім і дисперсією. Потім ми можемо взяти зразок\(n\) вимірювань, знайти середнє значення зразка\(\bar \mu\) і дисперсію зразка\(\bar \sigma^2\), і сформувати\[T_n^* = \frac {S_n - n\bar\mu}{\sqrt{n}\bar\sigma}\ ,\] де\(n = 36\). Ми\(T_n^*\) очікуємо, що буде хорошим наближенням\(S_n^*\) для великих\(n\).
\(t\)-Щільність
Статист В.С. Госсет 13 показав, що в цьому випадку\(T_n^*\) має функцію щільності, яка не є нормальною, а скоріше зі\(n\) ступенями свободи. (Кількість\(n\) ступенів свободи - це просто параметр, який говорить нам, який\(t\) -density використовувати.) У цьому випадку ми можемо використовувати\(t\) -density замість нормальної щільності для визначення рівня довіри для\(\mu\). \(n\)Зі збільшенням\(t\) -щільність наближається до нормальної щільності. Дійсно, навіть для\(n = 8\)\(t\) -щільності і нормальної щільності практично однакові (див. Рис.
Вправи
Примітки про проблеми з комп'ютером
- (а)
-
\(\\)Моделювання: Згадати (див. Слідство [кор 5.2]), яке\[X = F^{-1}(rnd)\] буде імітувати випадкову величину з щільністю\(f(x)\) та розподілом\[F(X) = \int_{-\infty}^x f(t)\, dt\ .\] У випадку, якщо\(f(x)\) це нормальна функція щільності із середнім\(\mu\) та стандартним відхиленням\(\sigma\), де ні\(F\) ні \(F^{-1}\)може виражатися в закритому вигляді, використовувати замість\[X = \sigma\sqrt {-2\log(rnd)} \cos 2\pi(rnd) + \mu\ .\]
- (б)
-
\(\\)Гістограми: ви повинні прагнути приблизно від 20 до 30 смуг (однакової ширини) у вашому графіку. Ви можете досягти цього за допомогою гарного вибору діапазону\([x{\rm min}, x{\rm min}]\) та кількості барів (наприклад,\([\mu - 3\sigma, \mu + 3\sigma]\) з 30 барів буде працювати у багатьох випадках). Експериментуйте!
Вправи\(\PageIndex{1}\)
\(X\)Дозволяти бути безперервна випадкова величина зі\(\mu(X)\) середнім і дисперсією\(\sigma^2(X)\), і нехай\(X^* = (X - \mu)/\sigma\) буде її стандартизована версія. Перевірте безпосередньо, що\(\mu(X^*) = 0\) і\(\sigma^2(X^*) = 1\).
Вправи\(\PageIndex{2}\)
Дозволяти\(\{X_k\}\)\(1 \leq k \leq n\), бути послідовність незалежних випадкових величин, все з середнім 0 і дисперсія 1, і нехай\(S_n\),\(S_n^*\), і\(A_n\) бути їх сума, стандартизована сума, і середнє, відповідно. Переконайтеся безпосередньо, що\(S_n^* = S_n/\sqrt{n} = \sqrt{n} A_n\).
Вправи\(\PageIndex{3}\)
Дозволяти\(\{X_k\}\)\(1 \leq k \leq n\), бути послідовність випадкових величин, все із середнім\(\mu\) і дисперсією\(\sigma^2\), і\(Y_k = X_k^*\) бути їх стандартизовані версії. Нехай\(S_n\) і\(T_n\) буде сума\(X_k\) і\(Y_k\),\(S_n^*\) і\(T_n^*\) їх стандартизований варіант. Покажіть, що\(S_n^* = T_n^* = T_n/\sqrt{n}\).
Вправи\(\PageIndex{4}\)
Припустимо, ми вибираємо самостійно 25 чисел випадково (рівномірна щільність) з інтервалу\([0,20]\). Напишіть нормальні щільності, які наближають щільності їх суми\(S_{25}\), їх стандартизовану суму\(S_{25}^*\) та середню\(A_{25}\).
Вправи\(\PageIndex{5}\)
Напишіть програму, щоб вибрати самостійно 25 чисел у випадковому\([0,20]\) порядку з, обчислити їх суму\(S_{25}\) і повторити цей експеримент 1000 разів. Складіть гістограму для щільності\(S_{25}\) і порівняйте її з нормальним наближенням вправи [exer 9.4.4]. Наскільки хороша посадка? Тепер зробіть те ж саме для стандартизованої суми\(S_{25}^*\) і середньої\(A_{25}\).
Вправи\(\PageIndex{6}\)
Загалом, Центральна гранична теорема дає кращу оцінку, ніж нерівність Чебишева для середньої суми. Щоб побачити це,\(A_{25}\) нехай середнє значення обчислюється у Вправі [exer 9.4.5], і нехай\(N\) буде нормальним наближенням для\(A_{25}\). Змініть свою програму в Exercise [exer 9.4.5], щоб надати таблицю\(F(x) = P(|A_{25} - 10| \geq x) = {}\) фракції функції загальної кількості 1000 випробувань, для яких\(|A_{25} - 10| \geq x\). Те ж саме виконайте для функції\(f(x) = P(|N - 10| \geq x)\). (Для цього можна використовувати звичайну таблицю, таблицю [табл 9.1] або процедуру NormalArea.) Тепер побудуйте на тих же осях графи\(F(x)\)\(f(x)\), і функцію Чебишева\(g(x) = 4/(3x^2)\). Як зробити\(f(x)\) і\(g(x)\) порівняти в якості оцінок для\(F(x)\)?
Вправи\(\PageIndex{7}\)
Центральна гранична теорема говорить, що суми незалежних випадкових величин, як правило, виглядають нормально, незалежно від того, який божевільний розподіл мають окремі змінні. Давайте перевіримо це за допомогою комп'ютерного моделювання. Виберіть самостійно 25 чисел з інтервалу\([0,1]\) з щільністю ймовірності,\(f(x)\) наведеною нижче, і обчислити їх суму\(S_{25}\). Повторіть цей експеримент 1000 разів, і складіть гістограму результатів. Тепер побудуйте на цьому ж графіку щільність\(\phi(x) = \mbox {normal \,\,\,}(x,\mu(S_{25}),\sigma(S_{25}))\). Наскільки добре нормальна щільність відповідає вашій гістограмі в кожному конкретному випадку?
- \(f(x) = 1\).
- \(f(x) = 2x\).
- \(f(x) = 3x^2\).
- \(f(x) = 4|x - 1/2|\).
- \(f(x) = 2 - 4|x - 1/2|\).
Вправи\(\PageIndex{8}\)
Повторіть експеримент, описаний у розділі Вправа [exer 9.4.7], але тепер виберіть 25 чисел з\([0,\infty)\), використовуючи\(f(x) = e^{-x}\).
Вправи\(\PageIndex{9}\)
Наскільки великим повинен\(n\) бути, перш ніж\(S_n = X_1 + X_2 +\cdots+ X_n\) це приблизно нормально? Це число часто дивно мало. Давайте досліджуємо це питання за допомогою комп'ютерного моделювання. Виберіть\(n\) числа\([0,1]\) з щільністю ймовірності\(f(x)\), де\(n = 3\), 6, 12, 20, і\(f(x)\) є кожною з щільностей у Вправі [exer 9.4.7]. Обчислити їх суму\(S_n\), повторити цей експеримент 1000 разів і скласти гістограму з 20 стовпчиків результатів. Наскільки великим повинен\(n\) бути, перш ніж ви отримаєте хорошу посадку?
Вправи\(\PageIndex{10}\)
Геодезист вимірює висоту скелі, як відомо, близько 1000 футів. Він припускає, що його прилад належним чином відкалібрований і що його похибки вимірювання є незалежними, із середнім\(\mu = 0\) та дисперсійним значенням\(\sigma^2 = 10\). Він планує зняти\(n\) виміри і сформувати середнє значення. Оцініть, використовуючи (а) нерівність Чебишева і (б) нормальне наближення, наскільки великим\(n\) має бути, якщо він хоче бути на 95 відсотків впевненим, що його середнє значення потрапляє в межах 1 фута від істинного значення. Тепер оцініть, використовуючи (а) і (б), яке значення має\(\sigma^2\) мати, якщо він хоче зробити тільки 10 вимірювань з однаковою впевненістю?
Вправи\(\PageIndex{11}\)
Ціна однієї акції акції в Пивній компанії Pilsdorff (див. Вправа [сек. 8.2]. [Exer 8.2.12]) дається в\(n\) день року.\(Y_n\) Фінн зауважує, що відмінності\(X_n = Y_{n + 1} - Y_n\) представляють собою незалежні випадкові величини із загальним розподілом, що мають середнє\(\mu = 0\) значення та дисперсію\(\sigma^2 = 1/4\). Якщо\(Y_1 = 100\), оцініть ймовірність того,\(Y_{365}\) що
- \({} \geq 100\).
- \({} \geq 110\).
- \({} \geq 120\).
Вправи\(\PageIndex{1}\)
Перевірте свої висновки у Вправи [exer 9.4.11] за допомогою комп'ютерного моделювання. Спочатку виберіть 364 числа\(X_i\) з щільністю\(f(x) = \mbox {normal}(x,0,1/4)\). Тепер сформуйте суму\(Y_{365} = 100 + X_1 + X_2 +\cdots+ X_{364}\), і повторіть цей експеримент 200 разів. Складіть\([50,150]\) гістограму на основі отриманих результатів, накладаючи на графік наближення нормальної щільності. Що говорить цей графік про ваші відповіді у вправі [exer 9.4.11]?
Вправи\(\PageIndex{1}\)
Фізики стверджують, що частинки в довгій трубці постійно рухаються взад-вперед по трубці, кожна зі швидкістю\(V_k\) (в см/сек) в будь-який даний момент, яка нормально розподіляється, зі середнім\(\mu = 0\) і дисперсійним\(\sigma^2 = 1\). Припустимо, в трубці є\(10^{20}\) частинки.
- Знайдіть середнє значення і дисперсію середньої швидкості частинок.
- Яка ймовірність того, що середня швидкість дорівнює\({} \geq 10^{-9}\) см/сек?
Вправи\(\PageIndex{1}\)
Астроном робить\(n\) вимірювання відстані між Юпітером і певним з його супутників. Досвід роботи з використовуваними інструментами змушує її вважати, що для відповідних одиниць вимірювання будуть нормально розподілені із середнім\(d\), істинною відстанню та дисперсією 16. Вона виконує ряд\(n\) вимірювань. \[A_n = \frac {X_1 + X_2 +\cdots+ X_n}n\]Дозволяти бути середнім показником цих вимірювань.
- Покажіть, що\[P\left(A_n - \frac 8{\sqrt n} \leq d \leq A_n + \frac 8{\sqrt n}\right) \approx .95.\]
- Коли було проведено дев'ять вимірів, середнє значення відстаней виявилося 23,2 одиниці. Введення спостережуваних значень у (a) дає невідому відстань\(d\). Обчислити цей інтервал.
- Чому б не сказати в (b) простіше, що ймовірність становить .95, що значення\(d\) лежить в обчисленому довірчому інтервалі?
- Які зміни ви б внесли в вищезазначену процедуру, якби ви хотіли обчислити 99-відсотковий довірчий інтервал?
Вправи\(\PageIndex{1}\)
Побудуйте гістограму, подібну до діаграми на малюнку [рис. 9.61] для висот середніх батьків у даних Галтона, як зазначено в Додатку B, і порівняйте цю гістограму з відповідною нормальною кривою.
