第5章 大数定律与中心极限定理
🔔 课前激活(花30秒想想再往下读)
你抛一枚硬币,抛10次和抛10000次——哪种情况正面频率更稳定?直觉告诉你10000次更稳。但为什么?中间有什么数学定理在撑腰?
再想一个事:你班上同学的身高——为什么大多数人的身高都在平均值附近,特别高和特别矮的都很罕见?为什么成绩分布通常也是中间多两头少?
这两个问题看似不同,但背后有两条数学铁律在回答它们。本章就来揭开这两条铁律的面纱。
📌 学完这章你能回答:
- 切比雪夫不等式是什么?为什么说它是"不知道分布时的最后一道防线"?
- "抛硬币次数越多,频率越接近0.5"的数学定理叫什么?需要什么条件?
- 三个大数定律(伯努利、辛钦、切比雪夫)分别适用于什么场景?条件各是什么?
- 为什么现实生活中到处都是"钟形曲线"?中心极限定理是怎么解释的?
- 用中心极限定理近似计算概率的完整步骤是什么?
本章考什么
考纲要求:数三概率论理论的"顶峰"——前四章是描述工具,本章揭示大量随机现象背后的通用规律。大数定律给出了"稳定性",中心极限定理给出了"分布形态",合起来构成统计推断的理论基础。
| 题型 | 大纲要求 | 考频 | 说明 |
|---|---|---|---|
| 切比雪夫不等式的应用 | 理解 | ⭐⭐ | 选择或大题第一问,给期望和方差估计概率 |
| 中心极限定理近似计算概率 | 掌握 | ⭐⭐⭐ | 每年必考,大题常客,二项分布正态近似 |
| 大数定律条件辨析 | 理解 | ⭐⭐ | 选择题或判断题,对比三个定律条件 |
① 核心知识
第4章末尾我们学了"矩"和"协方差矩阵"——矩是概括数据特征的数字(平均数是一阶矩,方差是二阶中心矩),协方差矩阵是把多个变量之间的相关性打包成一张表。那些工具让我们能精确描述随机变量的"位置"和"分散程度"。
换句话说,第4章你学会了用期望和方差描述一个随机变量长什么样。第5章你要用这两个数字去做更大胆的事——预测大量重复后的结果。从"描述单个"到"预测大量",这是一次认知升级。
现在第5章要回答一个更宏大的问题:如果我反复做同一件事很多很多次,结果会怎样? 具体来说,我们关心两件事:
- 稳定性问题(大数定律):反复抽样,样本平均值会稳定在哪个数附近?
- 分布形态问题(中心极限定理):大量因素叠加在一起,最终结果的波动呈现什么形状?
而理解这一切的钥匙,就是本章第一个工具——切比雪夫不等式。它就像"不知道分布时的最后一道防线":即使你对数据一无所知,只要知道平均数和方差,就能给"极端情况发生的概率"画一条上限。它也是证明大数定律的数学基础。
5.1 切比雪夫不等式与伯努利大数定律(公式+应用)
本节核心:记住两个结论公式并会套用——切比雪夫不等式(不知道分布也能估概率上界)和伯努利大数定律(频率依概率收敛于概率)。推导过程考研不考,直接看结论。
5.1.1 切比雪夫不等式
🏭 ① 生活场景——工厂质检:不用全检也能画"最坏情况"
你在薯片工厂当质检员。每袋薯片标称100克,但机器有误差——有时99克,有时102克。你知道所有薯片的平均重量是100克,方差是4克²(大致相当于大多数薯片在96到104克之间摇摆)。
老板问你:"不拆每一袋检查,你能告诉我——随机抽一袋,它的重量偏离100克超过5克的概率,最大可能有多少?"
你可能想:"又不知道每袋重量的分布是什么形状,怎么答?"
切比雪夫不等式的惊人之处就在这里:不需要知道分布长什么样,只要知道均值100和方差4,就能算出概率的上限。你回答老板:"偏离超过5克的概率最多16%。"老板很满意——虽然不知道精确值,但至少知道"最坏情况不会超过16%"。
这就是切比雪夫不等式的全部价值:它是在你对分布一无所知时,能给出的最靠谱的保守估计。好比天气预报说"明天下雨概率不超过80%"——虽然粗糙,但比"完全不知道"强一万倍。
📐 ② 正式陈述
设随机变量 X 的数学期望 E(X) = μ,方差 Var(X) = σ²。则对任意 ε > 0,有:
$$\boxed{P(|X - \mu| \geq \varepsilon) \leq \frac{\sigma^2}{\varepsilon^2}}$$
等价形式(落在区间内的概率下界):
$$\boxed{P(|X - \mu| < \varepsilon) \geq 1 - \frac{\sigma^2}{\varepsilon^2}}$$
符号速查:
| 符号 | 叫什么 | 大白话 |
|---|---|---|
| μ | 期望 / 均值 | 数据的"中心",所有值的平均 |
| σ² | 方差 | 数据"有多散",偏离中心的平方的平均 |
| ε | epsilon | 你关心的"偏离门槛"——偏离超过多少算异常 |
| |X−μ| | 偏离距离 | X 离中心有多远(只看距离,不管正负) |
| σ²/ε² | 概率上界 | "偏离≥ε"的概率的天花板 |
⚠️ ⑤ 易错边界——每个坑都能让你考试翻车
| 坑 | 错误姿势 | 正确姿势 | 记忆口诀 |
|---|---|---|---|
| ① ε 取整个区间宽度 | P(a<X<b) 中直接令 ε=b−a | 区间关于 μ 对称时 ε=(b−a)/2(半宽) | ε 是半径,不是直径 |
| ② 上界>1不处理 | σ²/ε²=4 直接写"概率≤4" | 上界取 min(σ²/ε², 1),下界取 max(1−σ²/ε², 0) | 概率是百分比,天花板高不过100% |
| ③ ε 太小还硬套 | ε≤σ 时 σ²/ε²≥1,等于白算 | ε>σ 时切比雪夫才有信息量 | 门槛太低,切比雪夫不管用 |
| ④ 以为给的是精确值 | "偏离概率就是 σ²/ε²" | 给的是上界(天花板),实际概率可能远小于此 | 保守估计 ≠ 精确值 |
| ⑤ 忘了条件 | 方差不存在的分布也硬套 | 期望和方差必须都存在! | 没期望和方差,切比雪夫玩不转 |
🛑 停下来想一想:如果 ε = σ(偏离门槛恰好等于标准差),σ²/ε² = 1,上界是 1。这等于说"偏离超过一个标准差的概率不超过100%"。这句话有没有错?——没有错,因为任何概率都不超过100%。但它有没有用?——完全没用!这就是为什么 ε 必须大于 σ,切比雪夫才有实际价值。
✍️ 立刻练一道(趁热,用刚发现的"天花板"法)
练1:已知随机变量 X 的 E(X)=6,Var(X)=1。用切比雪夫不等式估计 P(|X − 6| < 2) 的下界。
点击看解答
第1步:μ = 6,σ² = 1
第2步:题目直接给了 "|X − 6| < 2",所以 ε = 2
第3步:用形式②(落在区间内的下界)
P(|X − 6| < 2) ≥ 1 − σ²/ε² = 1 − 1/4 = 0.75
答案:下界为 0.75(不管 X 是什么分布,落在 (4, 8) 内的概率至少 75%)
练2:已知随机变量 X 的 E(X)=20,Var(X)=9。用切比雪夫不等式估计 P(16 < X < 24) 的下界。(提示:区间关于期望 20 对称,先把区间翻译成 |X − 20| < ε。)
点击看解答
第1步:μ = 20,σ² = 9
第2步:"16 < X < 24" ⇔ "|X − 20| < 4",所以 ε = 4(半宽,不是全宽 8)
第3步:用形式②
P(16 < X < 24) ≥ 1 − σ²/ε² = 1 − 9/16 = 7/16 ≈ 0.4375
答案:下界为 7/16(约 0.4375)。注意 ε=4 > σ=3,所以这个下界是有用的。
📝 本节配套练习(题型一·切比雪夫不等式,就近挪到本节)
下面四道题是本知识点专属的配套练习——方法刚学完,正好趁热刷。
题A(切比雪夫不等式·直接代入)
已知随机变量 X 的 E(X)=3,Var(X)=0.04。用切比雪夫不等式估计 P(2.5 < X < 3.5) 的下界。
📌 对应模板:题型一·子类型①(直接代入)
点击看答案
μ = E(X) = 3
σ² = Var(X) = 0.04
"2.5 < X < 3.5" 等价于 "|X − 3| < 0.5"
所以 ε = 0.5
由切比雪夫不等式(形式②):
P(|X − 3| < 0.5) ≥ 1 − σ² / ε²
= 1 − 0.04 / 0.25
= 1 − 0.16
= 0.84
答案:下界为 0.84
解读:不管 X 是什么分布,X 落在 (2.5, 3.5) 内的概率至少是 84%。
题B(切比雪夫不等式·上界)
已知随机变量 Y 的 E(Y)=10,Var(Y)=9。用切比雪夫不等式估计 P(|Y − 10| ≥ 6) 的上界。
📌 对应模板:题型一·子类型①(直接代入)
点击看答案
μ = E(Y) = 10
σ² = Var(Y) = 9
ε = 6(题目直接给了"|Y − 10| ≥ 6",ε=6)
由切比雪夫不等式(形式①):
P(|Y − 10| ≥ 6) ≤ σ² / ε² = 9 / 36 = 1/4 = 0.25
答案:上界为 0.25
解读:偏离期望超过6的概率,最多不超过25%。
题C(切比雪夫不等式·上界超过1的处理)
已知 X 的 E(X)=0,Var(X)=4。用切比雪夫不等式估计 P(|X| ≥ 1) 的上界。
📌 对应模板:题型一·子类型①(注意边界处理)
点击看答案
μ = E(X) = 0
σ² = Var(X) = 4
ε = 1("|X| ≥ 1" = "|X − 0| ≥ 1")
由切比雪夫不等式:
P(|X| ≥ 1) ≤ σ² / ε² = 4 / 1 = 4
但概率怎么可能大于1?所以实际取 min(4, 1) = 1。
答案:上界为 1(这个结果没有提供有价值的信息,因为概率天然就不超过1。
这说明当 ε 太小(小于标准差)时,切比雪夫不等式给出的上界没有用。)
切比雪夫不等式在 ε > σ(偏差超过一个标准差)时才有实际价值。
当 ε ≤ σ 时,上界可能 ≥ 1,此时只能说"概率不超过 1"——等于没给信息。
题D(切比雪夫不等式·先求期望和方差)
设 X 服从区间 [0, 6] 上的均匀分布。用切比雪夫不等式估计 P(|X − 3| ≥ 2) 的上界,并与精确概率比较。
📌 对应模板:题型一·子类型②(自求期望和方差)
点击看解答
第1步:求期望和方差
X ~ U[0, 6]
μ = E(X) = (0 + 6) / 2 = 3
σ² = Var(X) = (6 − 0)² / 12 = 36 / 12 = 3
第2步:ε = 2
第3步:切比雪夫不等式
P(|X − 3| ≥ 2) ≤ σ² / ε² = 3 / 4 = 0.75
第4步:精确概率(因为知道是均匀分布,可以直接算)
|X − 3| ≥ 2 ⇔ X ≤ 1 或 X ≥ 5
在 [0, 6] 上,X 的密度是 1/6
P(X ≤ 1) = (1−0) × 1/6 = 1/6
P(X ≥ 5) = (6−5) × 1/6 = 1/6
精确概率 = 1/6 + 1/6 = 1/3 ≈ 0.3333
比较:切比雪夫上界 0.75 > 精确值 0.3333
→ 切比雪夫没有错(0.3333 ≤ 0.75),但估计很保守。
答案:切比雪夫上界为 0.75,精确概率为 1/3 ≈ 0.3333。
🔗 ⑥ 在整条链中的位置
切比雪夫不等式 ──→ 证明大数定律(5.1.2 马上要做的)
↑
│
只需要期望和方差,不需要知道分布
→ "不知道分布时的最后一道防线"
从哪里来:第4章给了你期望 μ 和方差 σ²。切比雪夫不等式是连接这两个数字和"概率"的桥梁——它说:光凭 μ 和 σ²,不需要任何分布信息,就能给极端事件的概率画天花板。
到哪里去:马上你就会看到——把样本平均值 X̄(就是第4章题15里"n 个数据的平均",正式术语"样本均值"第6章才讲)的期望和方差代入切比雪夫不等式,右边出现 1/n,取极限 → 0,得到"样本平均值依概率收敛于期望"。这就是大数定律的证明!切比雪夫不等式是本章所有定理的"发动机"。
5.1.2 伯努利大数定律——切比雪夫不等式的经典应用
🎲 ① 生活场景——抛硬币的数学证明
你抛一枚硬币。抛10次,可能7次正面(频率70%);抛100次,可能55次正面(频率55%);抛10000次,大概约5050次正面(频率约50.5%)。
为什么次数越多,频率越稳定在50%附近?这件事几乎所有成年人都"知道"——但数学凭什么"证明"它?
1713年,瑞士数学家雅各布·伯努利给出了人类历史上第一个严格证明。他的思路本质上就是我们刚学的切比雪夫不等式——只不过那时候切比雪夫还没出生,伯努利用了更原始的工具。现在我们用切比雪夫不等式,四步就能走完伯努利花了几十年才完成的证明。
下面直接给结论公式——推导过程考研不考(思路:把切比雪夫不等式套在"频率"上,取个极限,大数定律应声而出)。
📐 ② 正式陈述(伯努利大数定律)
设 n 次独立重复的伯努利试验中,事件 A 发生了 n_A 次,每次 A 发生的概率为 p。则对任意 ε > 0:
$$\boxed{\lim_{n \to \infty} P\left(\left|\frac{n_A}{n} - p\right| \geq \varepsilon\right) = 0}$$
用大白话说:频率 n_A/n 偏离真实概率 p 超过任意小正数 ε 的概率,随着试验次数 n 增大而趋近于 0。 即:频率依概率收敛于概率。
✍️ 立刻练一道(用刚推导出的上界,亲手算算"频率多稳")
练1:抛一枚均匀硬币(p=0.5)100 次。用上界公式 p(1−p)/(nε²),估计 P(|频率 − 0.5| ≥ 0.1) 的上界。(即正面频率偏离 50% 超过 10 个百分点这件事,概率最多是多大?)
点击看解答
n = 100,p = 0.5,ε = 0.1
上界 = p(1−p)/(nε²) = 0.25 / (100 × 0.01) = 0.25 / 1 = 0.25
答案:最多 25%。也就是说——只抛 100 次,频率偏出 10 个百分点以上
(比如不到 40% 或超过 60%)的概率,最多有四分之一。
练2:同样的问题,如果抛 400 次,上界会变成多少?对比练1,你发现 n 变 4 倍后上界发生了什么变化?(对比发现:n 翻一倍,上界砍一半。)
点击看解答
n = 400,p = 0.5,ε = 0.1
上界 = p(1−p)/(nε²) = 0.25 / (400 × 0.01) = 0.25 / 4 = 0.0625
答案:最多 6.25%。n 从 100 变 400(4 倍),上界从 25% 降到 6.25%
(1/4)——因为上界跟 1/n 成正比。次数越多,频率真的越稳!
🔗 ⑥ 在整条链中的位置
切比雪夫不等式(5.1.1)──→ 伯努利大数定律(5.1.2)──→ 辛钦大数定律(5.3)──→ 中心极限定理(5.4)
↑ ↑ ↑ ↑
"最后一道防线" "频率稳定性的证明" "扩展到任何分布" "波动形态是什么形状"
不需要知道分布 只适用于0-1分布 只需期望存在 标准化后趋近正态
从哪来:5.1.1 的切比雪夫不等式是证明工具,5.1.2 的伯努利大数定律是这个工具的第一次实战应用。
到哪去:伯努利大数定律只适用于 0-1 分布。5.3 节会把它推广——如果分布不限于 0-1(任何分布),条件放宽或收紧,就得到辛钦和切比雪夫大数定律。而 5.4 节的中心极限定理回答的是另一个问题——不仅知道"稳定在哪儿",还知道"波动的形状"。
在整个概率论中的位置:第5章是前4章和统计推断(第6-7章)之间的桥梁。大数定律是从"描述单个随机变量"到"预测大量重复结果"的第一次认知升级。
5.2 依概率收敛
🎯 ① 生活场景——射手练靶:从"碰运气"到"稳如老狗"
你刚开始学射箭。第一天射10箭,可能2箭中靶心(20%)。射了一个月后,每天10箭基本稳定在7-8箭中靶心(70%-80%)。
问题是:怎么用数学语言精确描述"越来越稳定"这件事?你说"稳定在70%左右"——但"左右"是多大?偶尔有一天只中5箭算不算"不稳定"?
数学家给这个现象起了个名字叫依概率收敛。它不要求你每天都恰好中70%,只要求"偏离70%很多"这件事的概率越来越小。就像射箭——练了100天后,某天发挥失常中靶率掉到30%的可能性不是零,但小到可以忽略不计。
这就是依概率收敛要精确表达的东西:不是"确定等于",而是"大概率接近"。
📐 ② 正式陈述
设随机变量序列 X₁, X₂, ..., Xₙ, ... 和常数 a。如果对任意 ε > 0,有:
$$\boxed{\lim_{n \to \infty} P(|X_n - a| < \varepsilon) = 1}$$
则称 Xₙ 依概率收敛于 a,记作:
$$\boxed{X_n \xrightarrow{P} a}$$
逐字拆解:
| 符号 | 叫什么 | 大白话 |
|---|---|---|
| Xₙ | 随机变量序列 | 第 n 次的结果(随机的) |
| a | 目标常数 | 想要"稳定到"的那个数 |
| ε | 允许误差 | 你愿意接受的"偏差容忍度"——多近算"接近" |
| |Xₙ−a| < ε | "接近"的数学表达 | Xₙ 落在 a 的 ε-邻域内 |
| P(|Xₙ−a| < ε) | "接近"的概率 | 第 n 次结果"达标"的可能性 |
| lim_{n→∞} ... = 1 | 概率的极限为 1 | n 越大,达标概率越接近 100% |
"概率的极限 = 1"怎么理解? 这是最容易卡住的地方——概率本身是一个数(比如0.8、0.95),怎么还对"概率"取极限?这样想就通了:你先固定一个精度要求(比如"离靶心不超过1毫米"),然后不断增加 n。每个 n 都对应一个"达标概率"——这些达标概率排成一串:0.6, 0.78, 0.92, 0.988, 0.9994……这一串数越来越接近 1。极限是对 n 取的,不是对概率本身取的——概率只是随着 n 变化的一个数列。
依概率收敛 vs 微积分极限——核心区别:
| 微积分极限 | 依概率收敛 | |
|---|---|---|
| 本质 | 确定性:数列 aₙ=1/n,n→∞ 时确定等于 0 | 随机性:Xₙ 还是随机的,只是"大幅偏离"的概率趋近于 0 |
| 比喻 | 你离墙的距离每天精确减半——板上钉钉 | 你每天随机往前走(有时多有时少)——大概率接近 |
| 允许偶尔"翻车"吗? | 不允许,每步都按规定来 | 允许!翻车概率越来越小,但不为零 |
| 举反例 | aₙ=1/n 中没有任何一项会"跳"到 100 | Xₙ 依概率收敛于 0,但 X₁₀₀₀ 仍有可能 = 100(概率极小) |
🎯 先打个招呼:这里提到的"总体、样本、样本均值",是第6章《数理统计基础》才会正式定义的术语。现在先按字面意思理解就行——总体 = 全体数据(比如全班所有同学的身高),样本 = 从总体里抽出来的那部分数据(比如随机抽 30 个人量的身高),样本均值 = 把抽出来的数求平均。不必深究,第6章会系统讲,先记住这三个词是"全体数据 / 抽出来的一部分 / 那部分的平均值"就够了。
举例:X̄ₙ = (X₁+...+Xₙ)/n,若 X_i 独立同分布且期望 = μ,则 X̄ₙ 依概率收敛于 μ。这就是辛钦大数定律的结论——n 越大,样本均值"大概率"接近 μ。
依概率收敛的运算性质(做题有用):
- 若 Xₙ →^P a,Yₙ →^P b,则 Xₙ+Yₙ →^P a+b,XₙYₙ →^P ab,Xₙ/Yₙ →^P a/b(b≠0)
- 连续函数保持依概率收敛:若 Xₙ →^P a,g(x) 是连续函数,则 g(Xₙ) →^P g(a)。比如 Xₙ →^P μ,则 Xₙ² →^P μ²,1/Xₙ →^P 1/μ(μ≠0)
🚨 翻车现场:把依概率收敛当成"确定等于"
- ❌ 错误理解:Xₙ 依概率收敛于 a → "n 大了以后 Xₙ 就一定等于 a"
- ✅ 正确理解:依概率收敛说的是"偏离很多"这件事的概率趋近于零,不是"偏离"本身等于零。总存在很小的可能性(虽然趋近于零),Xₙ 会偏离 a 很远。就像投篮——练100天还是可能某天手感极差。
- 💡 怎么记:依概率收敛 = "几乎可以确定"(大概率接近),不是"绝对确定"。这也是自检清单中判断7和判断9反复考的核心区别。
📝 ④ 白话复盘
依概率收敛就讲了三个意思:
第一:它是一种"大概率接近"的收敛,不是"确定等于"。n 大了以后,随机变量大概率落在目标值附近——但偶尔跑偏的可能性依然存在(只是概率趋近于零)。
第二:它跟微积分极限的本质区别在于"随不随机"。微积分极限是确定性的——数列每一项都是固定的数。依概率收敛是随机性的——Xₙ 每次取值还是一个随机结果,只是"不靠谱"的概率越来越小。
第三:它是大数定律的"官方语言"。大数定律说"样本均值稳定在期望附近"——什么叫"稳定"?数学上的精确表达就是"依概率收敛"。三个大数定律(伯努利、辛钦、切比雪夫)本质上都是用依概率收敛的语言,在不同条件下证明同一件事:样本均值 → 期望。
💡 一句记死:依概率收敛 = "几乎可以确定"(大概率接近),不是"绝对确定"。这也是自检清单中判断7和判断9反复考的核心区别。
✍️ 立刻练一道(用刚浮现出的概念,当一回"挑刺的读者")
练1:判断下面这句话对不对——"若 Xₙ 依概率收敛于 a,那么当 n 足够大时,Xₙ 一定等于 a。"(提示:对照刚才"大概率接近 ≠ 确定等于"那句记死的话。)
点击看答案
❌ 错。依概率收敛说的是"偏离 a 很多"这件事的概率趋近于 0,
不是说"偏离本身"等于 0。n 足够大时,Xₙ 仍然可能偏离 a,
只是这个可能性小到可以忽略。这正是它和微积分极限的本质区别——
练100天投篮也可能某天手感极差。
练2:观察下面这串"达标概率":n=1 时是 0.6,n=2 时是 0.78,n=3 时是 0.92,n=4 时是 0.988……这串数越来越接近几?这说明 Xₙ 依概率收敛于 a 吗?(提示:对照"概率的极限 = 1"那段话。)
点击看答案
这串数越来越接近 1。P(|Xₙ − a| < ε) 的极限等于 1,
正是"Xₙ 依概率收敛于 a"的定义——所以是的。
概率是对 n 取极限的一个数列,不是对概率本身取极限。
🧠 ③ 推导思路——从切比雪夫不等式到依概率收敛
依概率收敛的定义看起来有点抽象,但如果你已经理解了切比雪夫不等式,它的推导就非常自然。
场景:设 X_n 的期望为 a,方差 Var(X_n) → 0(n→∞ 时趋于 0)。
由切比雪夫不等式:
$$P(|X_n - a| \geq \varepsilon) \leq \frac{Var(X_n)}{\varepsilon^2}$$
当 n → ∞ 时,右边 Var(X_n)/ε² → 0(因为分子 → 0,分母 ε² 固定不变)。而概率 P ≥ 0 天然成立。中间的概率被夹在 0 和一个趋近于 0 的量之间 → 概率本身必须趋近于 0。
所以 P(|X_n - a| < ε) = 1 − P(|X_n - a| ≥ ε) → 1 − 0 = 1。这就是依概率收敛!
大白话:如果你能证明方差趋向于 0,那么"偏离很多"的概率也趋向于 0——自然就"依概率收敛"了。切比雪夫不等式是方差和概率之间的桥梁。
这一步在想什么:依概率收敛不是凭空造出来的概念——它是切比雪夫不等式取极限的自然结果。理解了"方差 → 0 意味着概率 → 0",就理解了依概率收敛的全部直觉。
🔗 ⑥ 在整条链中的位置
切比雪夫不等式 ──→ 依概率收敛 ──→ 大数定律
↑ ↑ ↑
桥梁(工具) 官方语言 具体应用
方差→概率 "稳定"的 伯努利/辛钦/
数学定义 切比雪夫LLN
从哪来:切比雪夫不等式(5.1.1)——把方差的信息转化为概率的边界,再取极限就是依概率收敛。
到哪去:三个大数定律(5.3)——它们本质上都是用依概率收敛的语言在不同条件下说同一句话:"样本均值依概率收敛于期望"。依概率收敛是大数定律的"官方语言"——不先建立这个概念,大数定律就只能用大白话讲而不能用数学精确表达。
在整个概率论中的位置:依概率收敛是连接"描述单个随机变量"(第2-4章)和"描述大量重复的规律"(第5章及以后)的关键桥梁。它是概率论从"静态"走向"动态"(n → ∞)的转折点。
5.3 大数定律
有了依概率收敛这个数学工具,现在可以正式讨论大数定律了——大数定律说的就是,在什么条件下,样本均值会依概率收敛于期望。
回忆一下——大数定律说"样本均值稳定在期望附近"。但"稳定"这个词口说无凭,需要数学语言来精确表达。"依概率收敛"就是这句数学语言——它把"稳定"翻译成了"偏离很多的概率趋近于零"。接下来的三个大数定律,本质上就是用依概率收敛的语言,在不同条件下证明同一件事:样本均值→期望。
整体理解:"抛硬币次数越多,正面频率越接近0.5"——这就是大数定律最家喻户晓的版本。
但再想深一层:为什么一定是0.5?因为你每次抛硬币正面的真实概率就是0.5。所以大数定律说的是:大量重复试验得到的"频率",会趋近于"真实概率"。
你可能会问:"那我抛10000次,正面一定是5000次吗?"——不一定!可能是4987次,也可能是5012次。但频率离0.5差很多(比如差0.1以上)的概率,几乎为零。
"大数"就是"大量重复试验"。大数定律用一句话概括就是:实践出真知——试的次数够多,结果自然会逼近真相。
大数定律是一类定理的总称,它们讨论的是:在什么条件下,大量随机变量的算术平均值会"稳定"于一个常数(通常是期望值)。考研主要学三个版本,它们条件不同、适用场景不同。
5.3.1 伯努利大数定律(回顾5.1.2)
生活比喻:这就是"抛硬币"的数学证明!抛 n 次硬币,正面出现了 k 次,频率 = k/n。伯努利大数定律告诉你:n 越大,频率 k/n 离真实概率 p 差很多(超过任意 ε)的概率,趋近于零。它在1713年被严格证明,为"用频率估计概率"提供了理论基础。
正式定义(高频):
设 n_A 是 n 重伯努利试验中事件 A 发生的次数,P(A) = p。则对任意 ε > 0:
$$\boxed{\lim_{n \to \infty} P\left(\left|\frac{n_A}{n} - p\right| \geq \varepsilon\right) = 0}$$
即:频率 n_A/n 依概率收敛于概率 p。
条件:n 重伯努利试验(每次独立,每次成功概率相同)。
5.3.2 辛钦大数定律(最常用)
🎲 ① 生活场景——从"抛硬币"到"随便什么分布"
伯努利大数定律只能管一种情况:抛硬币(0-1分布)。可现实世界不只有硬币——全班同学的身高(正态分布)、超市每天的顾客数(泊松分布)、公交车的到站间隔(指数分布)……这些都不是0-1分布。
辛钦大数定律就是来解决这个问题的:不管原始分布长什么样,只要独立同分布且期望存在,样本均值就会稳定到期望。
换句话说,辛钦是伯努利的"升级版"——把"0-1分布"这个狭窄的条件换成了"任何分布",适用范围一下子从"抛硬币"扩展到了"几乎所有实际问题"。
更妙的是:伯努利需要方差(0-1分布的方差自动存在),辛钦连方差都不需要!只要期望存在就够了。这意味着即使分布的"波动幅度"非常大(方差无穷大),只要"中心"在,样本均值照样稳定。
📐 ② 正式陈述
设 X₁, X₂, ..., Xₙ, ... 是独立同分布的随机变量,且 E(X_i) = μ 存在。则对任意 ε > 0:
$$\boxed{\lim_{n \to \infty} P\left(\left|\frac{1}{n}\sum_{i=1}^{n} X_i - \mu\right| < \varepsilon\right) = 1}$$
即样本均值依概率收敛于期望:
$$\boxed{\frac{1}{n}\sum_{i=1}^{n} X_i \xrightarrow{P} \mu}$$
条件(两个,缺一不可):
- 独立同分布(每次抽样互不影响,来自同一总体)
- 期望 μ 存在(不需要方差存在!)
🧠 ③ 推导思路——不用特征函数也能"信"
辛钦大数定律的严格证明需要特征函数(一种比分布函数更高级的工具,考研不要求)。但这不妨碍我们理解它为什么是对的。下面三步走帮你建立牢不可破的直觉。
第1步:先看最简单的情形——方差也存在时
如果方差 σ² 也存在(这是比"只要求期望存在"更强的条件),那辛钦大数定律几乎就是切比雪夫不等式的直接推论:
- 样本均值 X̄ₙ = (X₁+...+Xₙ)/n
- E(X̄ₙ) = μ,Var(X̄ₙ) = σ²/n
- 由切比雪夫不等式:P(|X̄ₙ−μ| ≥ ε) ≤ Var(X̄ₙ)/ε² = σ²/(nε²)
- 当 n→∞ 时,右边 → 0,所以左边 → 0,即 P(|X̄ₙ−μ| < ε) → 1
大白话:方差存在时,辛钦就是切比雪夫不等式套在样本均值上 + 取极限——跟伯努利大数定律一模一样的套路!只不过伯努利套的是0-1分布,辛钦套的是"任意分布"。
这一步在想什么:方差存在时的证明跟5.1节的推导链完全一致——把样本均值的方差(σ²/n)代入切比雪夫不等式,1/n 让上界趋近于 0。这说明辛钦在"方差也存在"时是切比雪夫大数定律的特例。
第2步:辛钦的厉害之处——方差不存在也行!
但辛钦真正厉害的地方是:方差可以不存在。比如某些"厚尾分布"(尾巴特别厚的分布,极端值出现概率比正态分布大得多),方差公式 ∫(x−μ)²f(x)dx 是无穷大——没法用切比雪夫不等式(因为公式里有 σ²)。
那辛钦是怎么绕过这个坑的?核心思路叫截尾法:
- 把每个 X_i 切成两段:正常部分(|X_i| ≤ M)和"尾巴"部分(|X_i| > M)
- 正常部分方差有限 → 可以用切比雪夫那套方法
- "尾巴"部分虽然方差无穷大,但发生的概率极小(因为期望存在意味着尾巴必须"足够薄")
- M 取得足够大 → 尾巴的影响可以忽略不计
大白话:方差不存在就像有些人的身高极端到"不可描述"(比如偶尔出现一个3米高的人)。但辛钦说——没关系!我把极端值"截掉"(当成正常范围内的值处理),反正极端值出现的概率非常低,n 大了以后对平均值的影响微乎其微。期望存在这个条件,恰好保证了"尾巴足够薄"——极端值虽然可能很大,但不常出现。
这一步在想什么:辛钦的证明比伯努利和切比雪夫更高明——它不要求方差存在,但利用"期望存在"这个更根本的条件,证明了即使方差无穷大,样本均值照样稳定。这就是为什么辛钦被称为"最常用的大数定律"——它的条件最贴合大多数实际场景。
第3步:辛钦 vs 伯努利——从特例到通例的飞跃
伯努利大数定律只适用于 0-1 分布(成功/失败),辛钦适用于任何分布。两者啥关系?
- 把伯努利试验的每次结果写成 0-1 变量:成功=1,失败=0
- 这些 0-1 变量独立同分布,期望=p
- 套进辛钦大数定律 → 样本均值(即频率)依概率收敛于 p
- 这正是伯努利大数定律的结论!
大白话:伯努利是辛钦的"特例版"——当分布恰好是0-1分布时,辛钦退化成了伯努利。辛钦把"抛硬币"推广到了"任何分布",就像从"只能切苹果的水果刀"升级成了"什么都能切的瑞士军刀"。
这一步在想什么:三个大数定律不是三座孤岛,而是一条演化链——伯努利(1713年,只适用于0-1)→ 辛钦(1929年,推广到任何分布)→ 切比雪夫(1867年,另一个方向的推广——不要求同分布但要求方差有界)。辛钦是这条链上最重要的里程碑——它把条件降到了"最低配置":独立同分布+期望存在。
📝 ④ 白话复盘
辛钦大数定律就讲了三层意思:
第一层"放宽条件":伯努利只适用于 0-1 分布,辛钦把适用范围扩展到任何分布——只要你从同一个总体独立抽样,期望存在,样本均值就会稳定到期望。
第二层"砍掉方差":辛钦不需要方差存在!这是它比切比雪夫大数定律更强大的地方。切比雪夫要求方差一致有界,辛钦连方差都可以不要——只要期望存在就够了。
第三层"为什么成立":用截尾法——把随机变量切成"正常部分"和"尾巴"。正常部分方差有限,用传统方法处理;尾巴虽然可能很大但概率极低(期望存在保证的),n 大了以后影响趋于零。
💡 一句记死:独立同分布 + 期望存在 → 样本均值依概率收敛于期望。不需要方差!
⚠️ ⑤ 易错边界——辛钦大数定律最常被误用的五个坑
🔎 脚注:柯西分布是什么? 只需知道:柯西分布的期望不存在(作为反例用),不用深究它的密度公式长什么样。
| 坑 | 错误姿势 | 正确姿势 | 记忆口诀 |
|---|---|---|---|
| ① 以为"独立同分布"就够了 | 独立同分布 → 大数定律自动成立 | 还必须期望存在!柯西分布独立同分布但期望不存在→不成立 | 两项缺一不可 |
| ② 把辛钦和切比雪夫条件搞混 | 辛钦需要方差一致有界 | 辛钦不需要方差!切比雪夫才需要方差一致有界 | 辛钦不管方差,切比雪夫不管同分布 |
| ③ 以为辛钦是"万能"的 | 任何序列都满足辛钦 | 必须独立同分布!不同分布不能用辛钦(得用切比雪夫) | 不同分布找切比雪夫 |
| ④ 对"期望存在"的理解太窄 | 正态、均匀、泊松的期望当然存在 | 柯西分布的期望不存在(∫xf(x)dx 是 ∞−∞ 不定式)——这是经典反例 | 柯西=期望不存在=大数定律失效 |
| ⑤ 混淆"依概率收敛"和"普通极限" | X̄ₙ → μ 确定地等于 μ | X̄ₙ 还是随机的!只是偏离很多的概率趋近于零 | 大概率接近≠确定等于 |
🛑 停下来想一想:方差存在是不是一定意味着期望也存在?——是的!方差公式 Var(X) = E[(X−μ)²] 本身就用了期望符号 E,而且里面还嵌着 μ=E(X)。如果期望不存在,方差公式根本写不出来。所以"方差存在"自动保证"期望存在"——也就是说,如果题目给了方差,辛钦的条件自动满足。
✍️ 立刻练一道(辛钦的条件,是选择题最爱挖的坑)
练1:判断下列说法是否正确——"若 X₁, X₂, ..., Xₙ 独立同分布,则样本均值依概率收敛于期望。"(提示:辛钦的三个条件,对照着逐条打勾。)
点击看答案
❌ 错误。
分析:辛钦大数定律要求三个条件同时满足:
① 独立 ✓(题目给了)
② 同分布 ✓(题目给了)
③ 期望存在 ✗(题目没说!)
如果期望不存在(比如 X_i 服从柯西分布),
即使独立同分布,大数定律也不成立。
正确说法应该是:"若 X₁, X₂, ..., Xₙ 独立同分布且期望存在,
则样本均值依概率收敛于期望。"
这是考研选择题的高频陷阱:
"独立同分布"四个字容易让人产生"大数定律自动成立"的错觉。
必须加一句"期望存在"!
🔗 ⑥ 在整条链中的位置
伯努利大数定律(1713)──→ 辛钦大数定律(1929)──→ 切比雪夫大数定律(1867)
↑ ↑ ↑
只适用于0-1分布 推广到任何分布 另一个方向:不要求同分布
频率→概率 样本均值→期望 但要求方差一致有界
│ │ │
└──────────────────────────┴──────────────────────────┘
│
三者共同构成大数定律家族
回答同一问题:"大量重复后结果稳定在哪儿?"
只是条件不同、适用范围不同
从哪来:伯努利大数定律(5.1.2)是辛钦在 0-1 分布上的特例。切比雪夫不等式(5.1.1)在方差存在时也能证明辛钦。
到哪去:大数定律回答了"稳定在哪儿",但没回答"波动长什么样"。接下来 5.4 节的中心极限定理补上这块拼图——标准化后的波动近似正态分布。两者合在一起,构成了第6章统计推断的理论基础。
5.3.3 切比雪夫大数定律——数据来源五花八门时怎么办?
🏭 ① 先想一个困境——辛钦"挑食"了
辛钦大数定律有一个前提:同分布——你得从"同一个总体"反复抽样。可现实里经常不是这样:
你是一个大区经理,要评估三个工厂的平均日产量。三个厂设备不同、产品不同、产量波动也不同:A 厂机器稳定(方差小)、B 厂设备老化时好时坏(方差大)、C 厂流水线刚调试(方差居中)。三个厂的分布各不相同——你没法用辛钦(它只认同分布的数据)。
问题来了:数据来源五花八门、分布各不相同,样本均值还能稳定吗?
这就是切比雪夫大数定律要回答的困境。它和辛钦走了相反的路:辛钦放掉了"方差",守住了"同分布";切比雪夫放掉了"同分布",守住了一个新条件——每项的方差不许失控。
📐 ② 正式陈述(高频,考过概念辨析):
设 X₁, X₂, ..., Xₙ, ... 是相互独立的随机变量,各自的期望 E(X_i) = μ_i,方差 Var(X_i) = σᵢ²。
如果方差一致有界(即存在常数 C > 0,使得对所有 i,σᵢ² ≤ C),则对任意 ε > 0:
$$\boxed{\lim_{n \to \infty} P\left(\left|\frac{1}{n}\sum_{i=1}^{n} X_i - \frac{1}{n}\sum_{i=1}^{n} E(X_i)\right| < \varepsilon\right) = 1}$$
条件总结(必考,选择题常出):
- 相互独立
- 方差一致有界
🧠 ③ 为什么"方差一致有界"就够了?——一个快速直觉
回忆伯努利推导链里最关键的"弹药"——样本均值的方差。若各项方差都被同一个 C 罩住(都 ≤ C),那么:
$$Var(\bar{X}_n) = \frac{1}{n^2}\left(Var(X_1) + \cdots + Var(X_n)\right) \leq \frac{1}{n^2} \cdot n \cdot C = \frac{C}{n} \to 0$$
方差趋向 0 → 由切比雪夫不等式(5.1.1)→ "偏离很多"的概率趋向 0 → 依概率收敛成立。
大白话:只要每项方差不"发疯"(都被 C 管住),n 越大,平均值的方差就被 n² 的分母压得越小——跟辛钦/伯努利一模一样的"1/n 魔法",只是这次弹药来源换成了"方差一致有界"。
💡 一句记死:切比雪夫大数定律 = 独立 + 方差一致有界 → 样本均值依概率收敛于期望平均(不要求同分布!)。
✍️ 立刻练一道(拿"方差一致有界"亲手验一验)
练1:设 X₁, X₂, ... 相互独立,且第 i 个变量的方差为 Var(X_i) = 3 + 1/i²(i = 1, 2, 3, …)。问:这组变量满足切比雪夫大数定律的"方差一致有界"条件吗?如果满足,可取常数 C 为多少?
点击看解答
Var(X_i) = 3 + 1/i²,当 i ≥ 1 时 1/i² ≤ 1,
所以每个方差都 ≤ 3 + 1 = 4。
取 C = 4 即可(比 4 大的常数也行)。
条件满足 → 切比雪夫大数定律成立:
样本均值依概率收敛于期望平均 (1/n)ΣE(X_i)。
练2:设 X₁, X₂, ... 相互独立,且 E(X_i) = 2 + 1/i(i = 1, 2, 3, …),各变量的方差都 ≤ 4。(1)判断能否用切比雪夫大数定律。(2)若成立,样本均值 (1/n)ΣX_i 依概率收敛于哪个数?
点击看解答
(1) 条件检查:
· 独立 ✓
· 方差一致有界 ✓(都 ≤ 4)
→ 切比雪夫大数定律成立。(注意:这些 X_i 期望各不相同,不是同分布,
所以不能套辛钦——只能用切比雪夫。)
(2) 切比雪夫大数定律的结论是"样本均值收敛于期望平均":
(1/n)Σ E(X_i) = (1/n)Σ (2 + 1/i) = 2 + (1/n)Σ(1/i)
当 n → ∞ 时,(1/n)Σ(1/i) → 0(1/i 的和只长到约 ln n,除以 n 后趋向 0)
所以期望平均 → 2。
答案:样本均值依概率收敛于 2。
5.3.4 三种大数定律的对比
🧭 ① 应用场景——三个定律,三种"安全标准"
你手里有三个大数定律。该用哪个?取决于你面对的数据长什么样:
- 伯努利:你只知道这是"成功/失败"二选一的情况——抛硬币、产品合格/不合格、投票赞成/反对。最具体,但最直观。
- 辛钦:你从一个固定总体反复抽样——全班身高、工厂日产量、超市日销售额。这是最常用的场景(独立同分布抽样),也是条件最"省"的(只要求期望存在)。
- 切比雪夫:你的数据来源五花八门,分布各不相同——比如你要综合三个不同工厂、不同产品的数据做平均。此时不能用辛钦(因为不同分布),只能用切比雪夫(但必须确保方差不要太大,要"被控制住")。
三个定律就像三个不同等级的"安全标准"——条件越强,适用范围越窄,但越"保险";条件越弱,适用范围越宽,但越容易被滥用。
📐 ② 正式对比陈述
三个大数定律的形式化陈述并排如下(方便对比条件差异):
伯努利:n 重伯努利试验,P(A)=p → 频率 n_A/n 依概率收敛于 p。
$$\lim_{n \to \infty} P\left(\left|\frac{n_A}{n} - p\right| \geq \varepsilon\right) = 0$$
辛钦:X_i 独立同分布,E(X_i)=μ 存在 → 样本均值依概率收敛于 μ。
$$\frac{1}{n}\sum_{i=1}^{n} X_i \xrightarrow{P} \mu$$
切比雪夫:X_i 独立,Var(X_i) ≤ C 一致有界 → 样本均值依概率收敛于期望平均。
$$\lim_{n \to \infty} P\left(\left|\frac{1}{n}\sum_{i=1}^{n} X_i - \frac{1}{n}\sum_{i=1}^{n} E(X_i)\right| < \varepsilon\right) = 1$$
三个公式长得像,但条件一条比一条"偏":伯努利偏"分布类型"(必须是0-1),辛钦偏"整体一致"(必须同分布),切比雪夫偏"波动控制"(方差必须有上界)。
🧠 ③ 方法——三步选对定律(先做一道,再总结招数)
先看一道真题模样的选择题,看完先别急着看答案,试着用前面的知识想一想:
试一试:设 X₁, X₂, ..., Xₙ 是独立同分布的随机变量,且 E(X_i) = μ。下列哪个大数定律一定成立?
A. 切比雪夫大数定律 B. 伯努利大数定律 C. 辛钦大数定律 D. 都不一定成立
看到这题,先别慌。它难在哪?——题目只告诉你三件事:独立、同分布、期望存在。你手上有三个定律,每个要求的条件都不一样。不能拍脑袋选,得拿题给的条件,一个一个去"对号入座"。
动手试探——先把题目给的"已知"列出来当坐标轴:
- 独立 ✓ 同分布 ✓ 期望 μ 存在 ✓
- 但是:题目没说是不是 0-1 分布,也没说方差存不存在。
🧠 这一步在想什么:三个定律就是三把不同钥匙,得看锁眼长什么样。伯努利认"0-1分布"这个锁眼,切比雪夫认"方差有界"这个锁眼,辛钦认"独立+同分布+期望存在"这个锁眼。逐把试一下:
- 钥匙 A(切比雪夫)要"方差一致有界"——题目没说方差存在,更没说有界 → 打不开
- 钥匙 B(伯努利)要"0-1 分布"——题目没说是抛硬币这种 → 打不开
- 钥匙 C(辛钦)要"独立+同分布+期望存在"——恰好三个都齐 → 打开了!
🔍 回头看看我们做了什么:先看"是否同分布",再看"是不是0-1",最后逐条核对条件——这不就是一套三步筛查嘛。把它写成以后能照抄的流程:
📌 以后就这么办——三步选对定律:
第1步:看分布——同分布吗?
- 同分布(来自同一总体)→ 辛钦或伯努利
- 不同分布 → 只能用切比雪夫
第2步:看类型——是0-1分布吗?
- 是 0-1(成功/失败)→ 伯努利(同时也是辛钦的特例)
- 不是 0-1 → 辛钦
第3步:看条件满足吗?
- 辛钦:独立 ✓ 同分布 ✓ 期望存在 ✓ → 可用
- 切比雪夫:独立 ✓ 方差一致有界 ✓ → 可用(不需要同分布!)
- 伯努利:n 重伯努利试验 ✓ → 可用
大白话:先看是不是同一类数据(同分布),是的话优先辛钦;不同类数据看方差有没有天花板(有界),有的话用切比雪夫;特殊情况是0-1数据,用伯努利最直观。
对比表(必背):
| 伯努利 | 辛钦 | 切比雪夫 | |
|---|---|---|---|
| 条件 | n重伯努利试验 | 独立同分布 | 独立 |
| 期望 | p | μ 存在 | μᵢ 存在 |
| 方差要求 | 不需要(二项分布自动满足) | 不需要 | 方差一致有界 |
| 分布要求 | 0-1 分布 | 同分布 | 不必同分布 |
| 结论 | 频率→概率 | 样本均值→μ | 样本均值→期望平均 |
| 关系 | 是辛钦的特例(0-1分布) | — | — |
- 伯努利:抛硬币,频率收敛到概率
- 辛钦:反复抽样,样本均值收敛到总体均值(最常用)
- 切比雪夫:不同来源的数据,只要波动别太大,平均起来也稳定
✍️ 立刻练一道(用刚悟出的三步筛查,独立做一遍)
练1:设随机变量序列 X₁, X₂, ..., Xₙ, ... 满足以下条件,分别判断大数定律是否成立,若成立说明是哪个大数定律:
(1) X_i 独立同分布于正态分布 N(μ, σ²)
(2) X_i 独立,X_i ~ U(−i, i)(即 X_i 在 [−i, i] 上均匀分布)
(3) X_i 是 n 重伯努利试验中第 i 次的成功次数(即 X_i ~ B(1, p))
点击看解答
(1) X_i 独立同分布于 N(μ, σ²)
独立 ✓,同分布 ✓,期望 E(X_i)=μ 存在 ✓,方差 σ² 有限
→ 辛钦大数定律成立 ✓
→ 切比雪夫大数定律也成立 ✓(因为方差一致有界 σ²)
答案:成立(同时满足辛钦和切比雪夫条件)
(2) X_i 独立,X_i ~ U(−i, i)
E(X_i) = (−i+i)/2 = 0
Var(X_i) = (i−(−i))²/12 = (2i)²/12 = i²/3
(均匀分布方差公式:Var = (区间长度)² / 12)
当 i→∞ 时,Var(X_i) → ∞(方差发散,没有共同上界)
检查三个定律的条件:
· 伯努利:不是 0-1 分布 ✗
· 辛钦:不同分布(均匀分布的范围随 i 变化)✗
· 切比雪夫:独立 ✓,但方差没有一致上界 ✗
三个大数定律的条件都不满足!
答案:不成立(方差无界,三个定律条件都不满足)
(3) X_i ~ B(1, p),即 0-1 分布
独立 ✓(伯努利试验假设),同分布 ✓(都是 0-1 分布),期望 p 存在 ✓
→ 伯努利大数定律成立 ✓(这正是伯努利场景)
→ 辛钦大数定律也成立 ✓(伯努利是辛钦特例)
答案:成立(伯努利大数定律,同时也是辛钦的特例)
这题的核心启发:
(2) 说明"独立"单独不够,方差必须有界(切比雪夫)或同分布(辛钦)。
当两者都不满足时,大数定律可能失效。
📝 ④ 白话复盘
三个大数定律的选择,就一句话:"同分布用辛钦,不同分布用切比雪夫,抛硬币用伯努利。"
- 辛钦最常用:因为大多数实际问题都是"从一个固定总体反复抽样",天然满足独立同分布。而且不需要方差——这是它最大的优势。
- 切比雪夫最"宽容"分布:不要求同分布。但代价是必须要求方差一致有界——当方差发散时不能用。
- 伯努利最直观但最窄:只适用于0-1分布。但它的结论"频率→概率"是统计学最底层的直觉——"实践出真知"的数学表达。
💡 三个定律的关系:伯努利 ⊂ 辛钦(伯努利是辛钦在0-1分布上的特例)。切比雪夫与辛钦是"交叉关系"——各有对方的条件不要求的东西(辛钦不要求方差有界,切比雪夫不要求同分布)。
⚠️ ⑤ 易错边界——选错定律,全题白做
| 坑 | 错误姿势 | 正确姿势 |
|---|---|---|
| "辛钦需要方差存在" | ❌ 把辛钦和切比雪夫的条件搞混 | ✅ 辛钦只需要期望存在,不需要方差 |
| "切比雪夫需要同分布" | ❌ 把切比雪夫和辛钦的条件搞混 | ✅ 切比雪夫不要求同分布,只要求方差一致有界 |
| "独立同分布 = 大数定律必成立" | ❌ 忘了期望存在这个条件 | ✅ 柯西分布独立同分布但期望不存在,大数定律不成立 |
| "三个定律选哪个都行" | ❌ 不看条件瞎选 | ✅ 按三步法:同分布→辛钦,不同分布→切比雪夫,0-1→伯努利 |
| "方差存在则辛钦一定成立" | ❌ 方差存在≠期望存在 | ⚠️ 方差存在自动保证期望存在,所以实际上方差存在+独立同分布→辛钦确实成立。但不代表方差是"必须"的——辛钦可以没有方差 |
🔗 ⑥ 在整条链中的位置
切比雪夫不等式(5.1.1)──→ 伯努利大数定律(5.1.2)
│
├── 辛钦大数定律(推广到任何分布)
├── 切比雪夫大数定律(另一个方向:不同分布)
│
三种大数定律对比(本节)← 把三条线合在一起看
│
↓
中心极限定理(5.4)
"波动的形状是什么"
从哪来:前面分别讲了伯努利(5.1.2)、辛钦(5.3)、切比雪夫(5.3)三个大数定律。本节把三者并排放在一起,让你一眼看出条件差异和适用场景。
到哪去:选对定律是做对题的前提。接下来 5.4 中心极限定理回答大数定律没回答的问题——不仅知道"稳定在哪儿",还要知道"波动的形状"。
5.4 中心极限定理——为什么世界是"钟形"的
大数定律回答"稳定在哪儿",中心极限定理回答"波动的形状长什么样"。前者给统计推断以"准头",后者给统计推断以"尺子"。合在一起,就是从概率论走向统计学的两把钥匙。
👥 ① 生活场景——为什么到处都是"钟形曲线"?
看看你身边这些现象:
- 班上同学的身高——大多数人集中在平均身高附近,特别高和特别矮的都很少
- 考试成绩——大部分人考中等分数,学霸和学渣是极少数
- 超市每天卖出的牛奶瓶数——大多数日子在平均值附近,偶尔爆单或惨淡
- 测量误差——大多数误差很小,大误差罕见
这些现象的共同点是什么?它们都是大量独立的小因素叠加起来的结果。
一个人的身高 = 基因A的影响 + 基因B的影响 + 营养的影响 + 运动的影响 + 睡眠的影响 + ... 几百个因素,每个影响一点点,有些往上拉、有些往下拽。大量小因素叠加后——不管每个因素单独是什么形状——最终结果的分布几乎一定是"钟形"的(正态分布)。
这就是中心极限定理告诉我们的惊天事实:大自然中正态分布无处不在,不是巧合,是数学必然。
📐 ② 正式陈述(林德伯格-莱维中心极限定理)
设 X₁, X₂, ..., Xₙ, ... 是独立同分布的随机变量,E(X_i) = μ,Var(X_i) = σ² > 0。则对任意实数 x:
$$\boxed{\lim_{n \to \infty} P\left(\frac{\sum_{i=1}^{n} X_i - n\mu}{\sqrt{n}\sigma} \leq x\right) = \Phi(x)}$$
其中 Φ(x) 是标准正态分布 N(0, 1) 的分布函数(就是第2章讲的——标准正态曲线下、x 左边的面积)。
等价形式(用样本均值 X̄ = (1/n)ΣX_i 表达):
$$\boxed{\frac{\bar{X} - \mu}{\sigma/\sqrt{n}} \xrightarrow{d} N(0, 1)}$$
其中 $$\xrightarrow{d}$$ 表示"依分布收敛"——意思是分布函数的形状越来越接近正态分布函数的形状。
条件(两个,缺一不可):
- 独立同分布(每次抽样互不影响,来自同一个总体)
- 期望 μ 和方差 σ² 都存在(σ² > 0,等于0的话所有值都一样,没啥好研究的)
🧠 ③ 直觉推导——用大白话讲清楚"为什么"(不求严格证明,但要让你"信")
严格证明中心极限定理需要特征函数(一种比分布函数更高级的工具,考研不要求)。但这不妨碍我们理解它为什么是对的。下面三步帮你建立牢不可破的直觉。
第1步:先搞清楚"总和"的期望和方差怎么变
n 个独立同分布随机变量的总和 Y = ΣX_i:
- E(Y) = nμ(期望线性叠加——n 个 μ 加起来)
- Var(Y) = nσ²(方差也线性叠加——n 个 σ² 加起来,因为独立所以没有协方差项)
大白话:单个人的身高期望 170cm,100 个人的总身高期望就是 17000cm。单人身高方差 36cm²,100 个人的总身高方差就是 3600cm²。
这一步在想什么:总和会"放大"——期望放大 n 倍,方差放大 n 倍。但标准差只放大 √n 倍(因为标准差 = √方差)。这里已经暗示了标准化的分母会是 √n 而不是 n——因为方差放大 n 倍意味着标准差放大 √n 倍。
第2步:标准化——"消掉"均值和方差的增长
总和 Y 的期望和方差都在随 n 增长,没法直接比较不同 n 下的分布。所以要标准化:
$$Z_n = \frac{Y - E(Y)}{\sqrt{Var(Y)}} = \frac{\sum X_i - n\mu}{\sqrt{n}\sigma}$$
标准化后的 Z_n:
- E(Z_n) = 0(消掉了期望的增长)
- Var(Z_n) = 1(消掉了方差的增长)
大白话:标准化就像"统一度量衡"——不管原来是什么分布、n 有多大,标准化后都变成均值 0、方差 1。这样不同 n 的结果就可以放在一起比较了。就像把"中国高考分数""美国 SAT 分数""法国 Bac 分数"都换算成"排名的百分位"——统一尺度后才能比较。
这一步在想什么:为什么分母是 √n σ 而不是 nσ?因为:
- 总和 Y 的方差 = nσ² → 标准差 = √n σ
- 标准化永远是 (值 − 期望) / 标准差
- 所以分母是 √n σ
💡 方差像"面积",n 块地拼在一起面积 n 倍。标准差像"边长",面积 n 倍边长只有 √n 倍。这是标准差和方差关系最直观的理解方式。
第3步:直觉核心——为什么标准化后的分布一定趋近"钟形"?
这是最难但最重要的一步。我们来做一个思想实验:
想象你有 1000 个独立的小因素,每个因素以相同概率使结果 +1 或 −1(就像 1000 次抛硬币,正面 +1,反面 −1)。总和的范围是 −1000 到 +1000。
现在问:总和恰好等于 0 有多少种组合方式?等于 +2 有多少种?等于 +1000 有多少种?
- 总和 = 0:需要 500 个 +1 和 500 个 −1。组合数 = C(1000, 500) ≈ 2.7 × 10²⁹⁹——极大的数字!
- 总和 = +2:需要 501 个 +1 和 499 个 −1。组合数 = C(1000, 501) ≈ 2.7 × 10²⁹⁹——跟上面差不多大
- 总和 = +1000:需要 1000 个 +1 和 0 个 −1。组合数 = C(1000, 1000) = 1——只有一种方式!
大白话:极端结果(全 +1 或全 −1)只有极少的组合方式能达到。中间的温和结果有海量的组合方式——因为大量 +1 和 −1 互相抵消,形成钟形曲线的"鼓包"。两端因为"能抵达的路太少"而概率极低——形成钟形曲线的"尾巴"。
这就是为什么不管原始分布长什么样,大量独立因素叠加后一定是钟形:
- 📊 你可以从任意形状的分布出发(均匀分布、指数分布、甚至完全不对称的分布)
- 🔄 每次从里面随机抽 n 个数,算它们的平均
- 🔁 重复几千次,画出这几千个"平均值"的直方图
- 🔔 你会发现——随着 n 增大,直方图的形状越来越像正态分布!
用文字画图:
原始分布(可以是任何形状):
██
██████ ← 比如指数分布,严重偏斜
██████████
取 n=2 的样本均值,重复10000次:
██
██████
██████████ ← 开始往中间聚拢
██████████████
取 n=5 的样本均值,重复10000次:
██
██████
██████████ ← 更对称了
████████████
██████████████
取 n=30 的样本均值,重复10000次:
██
██████
██████████ ← 几乎完美的钟形!
██████████████
████████████████
██████████████████
大白话:原始分布可以是歪七扭八的形状,但随着样本量 n 增大,样本均值的分布会自动"挤"成钟形。这不是魔法——是组合数学的必然:中间值有无数条路可达,极端值寥寥无几。
这一步在想什么:不需要严格证明也能"信"中心极限定理。核心直觉就一句话——极端结果只有少数路径,温和结果有海量路径。叠加越多,概率就往中间挤,形成钟形。
📝 ④ 推导复盘——用大白话把整个逻辑串一遍
中心极限定理讲了三层意思:
第一层"放大":n 个独立变量加在一起,期望放大 n 倍,方差放大 n 倍(标准差放大 √n 倍)。
第二层"标准化":把总和"压缩"成均值 0、方差 1——消掉了 n 的影响,让不同样本量的结果可以公平比较。
第三层"趋近正态":标准化后的分布,无论原始分布长什么样,随着 n 增大一定会变成标准正态 N(0,1)。原因是——中间值有海量组合方式,极端值寥寥无几。
一句话总结:大量独立小因素的叠加 → 不管每个因素是什么形状 → 总和的波动一定近似钟形。
这跟大数定律形成了完美的互补:
- 大数定律说:样本均值 "稳定在" 期望附近(一个点)
- 中心极限定理说:样本均值 "怎样波动在" 期望附近(一个钟形分布)
⚠️ ⑤ 易错边界——中心极限定理最常踩的六个坑
坑1:以为"总和本身"趋近正态——错!是"标准化后"才趋近正态!
- ❌ ΣX_i 趋近正态分布
- ✅ (ΣX_i − nμ)/(√n σ) 趋近标准正态 N(0,1)。等价地说,ΣX_i 近似服从 N(nμ, nσ²),X̄ 近似服从 N(μ, σ²/n)。
- 💡 原始总和没标准化前,期望和方差都在随 n 变大——不是固定的正态分布。
坑2:标准化时分母用 nσ——大错特错!
- ❌ (ΣX_i − nμ)/(nσ)
- ✅ (ΣX_i − nμ)/(√n σ)
- 💡 方差放大 n 倍(nσ²),标准差放大 √n 倍(√n σ),标准化永远用标准差。
- 🔑 终极记忆法:方差像面积(n 倍),标准差像边长(√n 倍)。
坑3:以为"n≥30 就万事大吉"——不是绝对的!
- n≥30 是经验法则,不是数学定理。
- 如果原始分布严重偏斜(比如指数分布),可能需要 n≥50 甚至更大。
- 如果原始分布本身就接近正态(比如均匀分布),n=5 就差不多了。
- 💡 判断标准:原始分布越对称、越"像"正态,需要的 n 越小;越偏斜、越厚尾,需要的 n 越大。
坑4:忘了条件——独立同分布 + 方差存在!
- 如果变量不独立(比如股票价格之间有相关性),CLT 不一定成立——需要更复杂的版本。
- 如果方差不存在(比如柯西分布),CLT 完全不成立——不管 n 多大,标准化和都不会趋近正态。
坑5(极其隐蔽):把中心极限定理和大数定律搞混!
- 大数定律 → "样本均值趋近于一个数"(期望 μ)→ 回答"稳定在哪儿"
- 中心极限定理 → "样本均值的波动近似正态分布"→ 回答"怎样波动的"
- 一个是"点"(收敛到一个数),一个是"形状"(收敛到一个分布)。完全不同!
坑6:把依分布收敛($$\xrightarrow{d}$$)和依概率收敛($$\xrightarrow{P}$$)搞混
- 依概率收敛(大数定律):随机变量本身趋近于一个固定常数
- 依分布收敛(中心极限定理):随机变量的分布函数趋近于另一个分布函数
- 两者说的不是一回事!中心极限定理用 $$\xrightarrow{d}$$,大数定律用 $$\xrightarrow{P}$$。
✍️ 立刻练一道(把"标准化 + 查表"的套路亲手走一遍)
练1:设随机变量 X 的期望 E(X)=100,方差 Var(X)=64。X₁, X₂, ..., X₁₀₀ 独立同分布。用中心极限定理近似计算总和 S = X₁ + X₂ + ... + X₁₀₀ 超过 10200 的概率。
点击看解答
⚠️ 前置检查:n=100,独立同分布,期望方差都存在,条件满足。
第1步:设 Y = X₁ + ... + X₁₀₀(总和)
E(Y) = nμ = 100 × 100 = 10000
Var(Y) = nσ² = 100 × 64 = 6400
标准差 = √6400 = 80
第2步:标准化
Z = (Y − 10000) / 80 ≈ N(0, 1)
第3步:转化概率
P(Y > 10200) = P(Z > (10200 − 10000)/80)
= P(Z > 200/80)
= P(Z > 2.5)
第4步:查表
P(Z > 2.5) = 1 − Φ(2.5) = 1 − 0.9938 = 0.0062
答案:约 0.0062(即约 0.62%)
练2:某厂生产的一批零件重量 X 的期望为 500 克,方差为 36 克²。独立抽取 n=100 个零件,用中心极限定理近似计算样本平均重量超过 501 克的概率。
点击看解答
⚠️ 前置检查:n=100,独立同分布,条件满足。
第1步:直接用样本均值公式:
样本均值 X̄
E(X̄) = μ = 500
Var(X̄) = σ²/n = 36/100 = 0.36
标准差 = 0.6
第2步:标准化
Z = (X̄ − 500) / 0.6 ≈ N(0, 1)
第3步:转化概率
P(X̄ > 501) = P(Z > (501 − 500)/0.6) = P(Z > 1.667)
第4步:查表
Φ(1.667) ≈ 0.9522(Φ(1.66)≈0.9515,Φ(1.67)≈0.9525,线性插值)
P(Z > 1.667) = 1 − 0.9522 = 0.0478
答案:约 0.0478(即约 4.78%)
📝 本节配套练习(题型二·中心极限定理,就近挪到本节)
下面几道题从章末题型区就近挪到这里——刚学完"总和/均值标准化 + 查表",正好趁热刷。题目和答案一字未改。
题1(中心极限定理·求总和概率)
某商店每天售出两种商品(记为商品A和商品B),每种商品每天的销售量独立同分布,分布律为:
| 销量(件) | 0 | 1 | 2 |
|---|---|---|---|
| 概率 | 0.2 | 0.5 | 0.3 |
隐含的独立性假设:本题假设 (1) 商品A和商品B之间每天的销售量相互独立(A卖多少不影响B卖多少);(2) 每天的销售情况相互独立(今天卖多少不影响明天)。这两层独立性是后面计算"每天总销量方差=Var(A)+Var(B)"以及"100天累计总销量方差=100×Var(每天总销量)"的前提。在考试中,除非题目明确说"不独立",否则默认这些独立性成立。
该商店独立经营100天。每天的总销量 = 当天商品A销量 + 当天商品B销量。设100天的累计总销量为 S。用中心极限定理近似计算 P(S > 130)。
📌 对应模板:题型二·子类型①(求总和的概率)
点击看解答
第1步:先求单种商品每天销量的期望和方差
E(单种商品销量) = 0×0.2 + 1×0.5 + 2×0.3 = 0 + 0.5 + 0.6 = 1.1
E((单种商品销量)²) = 0²×0.2 + 1²×0.5 + 2²×0.3 = 0 + 0.5 + 1.2 = 1.7
Var(单种商品销量) = 1.7 − 1.1² = 1.7 − 1.21 = 0.49
第2步:每天的总销量 D = 商品A销量 + 商品B销量(两种商品独立)
E(D) = 1.1 + 1.1 = 2.2
Var(D) = Var(商品A) + Var(商品B) = 0.49 + 0.49 = 0.98
第3步:100天的累计总销量 S = D₁ + D₂ + ... + D₁₀₀(每天独立)
E(S) = 100 × 2.2 = 220
Var(S) = 100 × 0.98 = 98
标准差 = √98 ≈ 9.899
Z = (S − 220) / √98 ≈ N(0, 1)
P(S > 130) = P(Z > (130 − 220) / √98)
= P(Z > −90 / 9.899)
= P(Z > −9.092)
查表:Z ~ N(0,1),P(Z > −9.092) = 1 − Φ(−9.092)
Φ(−9.092) 非常接近 0(偏离均值超过9个标准差,概率极低)
所以 P(S > 130) ≈ 1
答案:约等于 1(几乎必然大于 130)
实际上 E(S)=220,130 远低于期望,所以 S > 130 几乎必然发生。
这题的核心是"正确识别每天的总销量是两种商品销量之和,然后算对期望和方差"。
题2(中心极限定理·给定概率反求 n)
某电子元件寿命 X 的期望为1000小时,标准差为200小时。需要抽取多少个元件测试,才能有95%的把握保证样本平均寿命与真实平均寿命1000小时之差不超过50小时?(用中心极限定理)
📌 对应模板:题型二·子类型③(反求 n)
点击看解答
已知:μ = 1000,σ = 200,求 n
第1步:样本均值 X̄_n = (1/n) Σ X_i
E(X̄_n) = 1000
Var(X̄_n) = σ²/n = 40000/n
标准差 = 200/√n
第2步:标准化
Z = (X̄_n − 1000) / (200/√n) ≈ N(0, 1)
第3步:条件 "|X̄_n − 1000| ≤ 50 的概率 ≥ 95%"
P(|X̄_n − 1000| ≤ 50) ≥ 0.95
用中心极限定理近似:
P(|X̄_n − 1000| ≤ 50) = P(|Z| ≤ 50 / (200/√n))
= P(|Z| ≤ √n / 4)
≥ 0.95
第4步:查表,P(|Z| ≤ z) ≥ 0.95 时,z ≥ 1.96
所以 √n / 4 ≥ 1.96
√n ≥ 4 × 1.96 = 7.84
n ≥ 7.84² = 61.47
n 取整数,所以 n ≥ 62
答案:至少抽取 62 个元件。
实际含义:抽62个测平均寿命,有95%把握平均值的误差不超过50小时。
注意:标准差 σ 越大,需要的 n 越大;允许的误差50越小,需要的 n 越大。
题3(概念综合题·大数定律与统计推断的联系)
某工厂生产灯泡,声称平均寿命 μ = 2000 小时。消费者协会随机抽取了100只灯泡测试,得到平均寿命 X̄ = 1950 小时,标准差 σ = 150 小时(σ 在此当作已知的总体的标准差)。
(1) 如果工厂声称属实(μ = 2000),用中心极限定理计算"抽100只灯泡平均寿命 ≤ 1950"的概率大约是多少?
(2) 根据(1)的结果,你对工厂的声称有什么看法?(用大数定律和中心极限定理的思想来解释)
📌 对应模板:题型二 + 概念理解(统计思想)
点击看解答
(1) 计算概率
如果 μ = 2000 属实,X̄ 近似 N(2000, 150²/100) = N(2000, 225)
标准差 = 15
P(X̄ ≤ 1950) = P(Z ≤ (1950 − 2000)/15)
= P(Z ≤ −50/15)
= P(Z ≤ −3.333)
= Φ(−3.333)
= 1 − Φ(3.333)
查表:Φ(3.33) ≈ 0.9996
所以 Φ(−3.333) ≈ 0.0004
答案:约 0.0004(即万分之四,非常小)
(2) 统计推断思路
根据中心极限定理,如果工厂声称属实,
"抽100只平均寿命 ≤ 1950"的概率只有万分之四。
这是一个极其罕见的事件。
根据"小概率事件原理"(大数定律思想的延伸):
在一次抽样中,小概率事件几乎不可能发生。
但这次抽样中,这种"几乎不可能"的事情居然发生了。
这说明两种可能之一:
· 要么真的是运气极差(万分之四的倒霉事碰上了)
· 要么工厂的声称不属实(实际的 μ 比 2000 低)
按照统计学的常规判断标准,万分之四远小于1%,
我们有充分理由怀疑工厂的声称是不真实的。
这道题实际上就是"假设检验"的核心思想——
用中心极限定理算"在假设成立时观察到这种结果有多奇怪",
如果太奇怪,就推翻假设。
大数定律(频率稳定性)+ 中心极限定理(知道抽样分布形态)
= 统计推断的理论基础。
题4(综合·大数定律 + 中心极限定理辨析)
判断下列说法是否正确,并简述理由:
(1) 大数定律说明:大量随机变量的和近似服从正态分布。
(2) 若 X₁, ..., Xₙ 独立同分布且期望为 μ,方差为 σ²,则 n 很大时,约95%的样本均值 X̄ 落在 μ ± 2σ/√n 范围内。
(3) 辛钦大数定律比切比雪夫大数定律的条件更弱。
📌 对应模板:题型三 综合辨析
点击看解答
(1) ❌ 错误。
大数定律说的是"样本均值稳定到期望"(稳定性),
而不是"和的分布趋近正态分布"。
"和近似正态分布"是中心极限定理的结论。
两者容易混淆但回答不同的问题:
· 大数定律 → "结果稳定吗?稳定到什么值?"
· 中心极限定理 → "波动的分布是什么形状?"
(2) ⚠️ 基本正确但不够精确。
中心极限定理告诉我们:X̄ 近似 N(μ, σ²/n)。
标准化后,(X̄−μ)/(σ/√n) ≈ N(0,1)。
所以 P(μ − 1.96σ/√n < X̄ < μ + 1.96σ/√n) ≈ 0.95。
注意正确的是 1.96 倍,不是 2 倍。
关于2和1.96的区别:
- 如果题目说"用中心极限定理近似"或"近似计算" → 用 1.96(精确值)
- 如果题目说"根据经验法则"或没有给正态分布表 → 用 2 也可以
- 安全做法:一律用 1.96,这是标准正态分布双侧95%分位数的精确值
(3) ✅ 正确(但有细节需要厘清)。
辛钦大数定律的条件:①独立 ②同分布 ③期望存在
切比雪夫大数定律的条件:①独立 ②方差一致有界
从"方差"的角度看:
辛钦不要求方差存在 → 条件更弱(放宽了方差限制)
从"同分布"的角度看:
切比雪夫不要求同分布 → 条件更弱(放宽了分布限制)
所以实际上两者条件各有强弱——不是"全面的"更弱。
数三考题中的"条件更弱"通常指的是:辛钦不要求方差存在,
这是辛钦最大的优势。
答案:(1)❌ (2)❌ (3)✅(在"不要求方差存在"的意义上)
🔗 ⑥ 在整条链中的位置
第4章(期望/方差)
↓
5.1 切比雪夫不等式 ──→ 5.3 大数定律(频率→概率)
↓ ↓
| "结果稳定在哪儿"
| ↓
└──────────→ 5.4 中心极限定理 ←──┐
↓ |
"波动的形状是什么" |
↓ |
标准化后趋近正态 |
↓ |
第7章 参数估计 ──────────────┘
(区间估计+假设检验的引擎)
从哪来:大数定律(5.1, 5.3)告诉你样本均值会"稳定"在期望附近——但它没告诉你稳定下来之后的波动长什么样。中心极限定理补上了这块拼图——波动是钟形的。
到哪去:第7章"参数估计"中,区间估计和假设检验全部建立在中心极限定理之上——因为你只有知道估计量的分布是正态,才能算出"置信区间"、才能判断"这个差异是不是显著的"。
在概率论全局中的位置:中心极限定理是概率论"理论篇"的收官之作——它解释了为什么正态分布是"分布之王"。第6章开始,你将用这个定理去做真正的统计推断——从数据反推真相。
5.4.1 棣莫弗-拉普拉斯中心极限定理(二项分布专用——CLT最经典的应用)
📊 ① 应用场景——二项分布算到吐血怎么办?
你要算"抛硬币10000次,正面次数在4900到5100之间的概率"。理论上二项分布 B(10000, 0.5) 有精确公式——但 C(10000, k) 这个组合数大到电脑都算不动(10000! 是个天文数字)。
棣莫弗和拉普拉斯在18世纪就发现了解决方案:n 足够大时,二项分布的形状跟正态分布几乎一样。直接用正态分布近似算,查个表就搞定。
这就是棣莫弗-拉普拉斯中心极限定理——它是上一节林德伯格-莱维 CLT 在二项分布上的"定制版"。林德伯格-莱维说"任何独立同分布的总和标准化后趋近正态",棣莫弗-拉普拉斯把这个通用结论翻译成了二项分布的语言:Y~B(n,p) → 标准化后 ≈ N(0,1),等价于 Y ≈ N(np, np(1−p))。
📐 ② 正式陈述(棣莫弗-拉普拉斯中心极限定理)
设 Yₙ ~ B(n, p),则对任意实数 x:
$$\boxed{\lim_{n \to \infty} P\left(\frac{Y_n - np}{\sqrt{np(1-p)}} \leq x\right) = \Phi(x)}$$
其中 Φ(x) 是标准正态分布 N(0, 1) 的分布函数。
等价形式:n 足够大时,Y 近似服从 N(np, np(1−p)),标准化后 (Y−np)/√(np(1−p)) ≈ N(0,1)。
条件(两个,缺一不可):
- Y ~ B(n, p)(二项分布)
- np ≥ 5 且 n(1−p) ≥ 5(经验法则,保证近似精度)
与林德伯格-莱维 CLT 的关系:
| 林德伯格-莱维 | 棣莫弗-拉普拉斯 | |
|---|---|---|
| 适用范围 | 任何独立同分布 | 仅二项分布 |
| 条件 | 期望和方差都存在 | np 和 n(1−p) 足够大 |
| 结论 | 标准化总和 → N(0,1) | 标准化二项 → N(0,1) |
| 实用性 | 最通用(理论上) | 算二项概率最常用(考试上) |
棣莫弗-拉普拉斯 = 把林德伯格-莱维中的 X_i 取成 0-1 分布(期望 p,方差 p(1−p)),代入标准化公式,正好得到 (Y−np)/√(np(1−p)) → N(0,1)。它不是新定理,而是 CLT 在二项分布上的"应用手册"。
🧠 ③ 方法——二项分布正态近似(先做一道,再总结招数)
先看一道真题模样的题,看完先别急着看答案,试着动手算一算:
试一试:抛一枚均匀硬币400次。用正态近似计算正面次数在190到210之间的概率。
看到这题,先别慌。它难在哪?——"正面次数在190到210之间",理论上可以写成 P(190 ≤ Y ≤ 210),其中 Y ~ B(400, 0.5)。精确算要 ∑ C(400,k) 求和——400 重伯努利的组合数,算到天荒地老。但上节刚学的 CLT 说:大量独立同分布变量之和,标准化后近似正态。二项分布本身就是 400 个独立的 0-1 变量之和,正好用得上!
动手试探——先把"弹药"备齐:二项分布的期望和方差早就背过
- E(Y) = np = 400 × 0.5 = 200
- Var(Y) = np(1−p) = 400 × 0.5 × 0.5 = 100,标准差 = 10
然后照搬上一节 CLT 的标准化套路:
$$Z = \frac{Y - np}{\sqrt{np(1-p)}} = \frac{Y - 200}{10} \approx N(0, 1)$$
P(190 ≤ Y ≤ 210) = P(−1 ≤ Z ≤ 1) = Φ(1) − Φ(−1) = 2Φ(1) − 1 = 0.6826。
🧠 这一步在想什么:没有任何新东西!期望/方差换成了二项分布自带的一套(np 和 np(1−p)),其余全是上一节 CLT 的标准操作。二项分布 ⊂ 独立同分布之和,所以 CLT 自动适用——棣莫弗-拉普拉斯只是"二项分布的 CLT 换皮版"。
🔍 回头看看我们做了什么:先检查 n 够不够大(np 和 n(1−p) 是否 ≥ 5)→ 套期望方差 → 标准化 → 转化概率查表。这不就是一套三步流程嘛:
📌 以后就这么办——二项分布正态近似三步走:
第1步:验证条件——n 够大吗?
经验法则:np ≥ 5 且 n(1−p) ≥ 5。更保守:np ≥ 10 且 n(1−p) ≥ 10。
大白话:期望成功次数 np 和期望失败次数 n(1−p) 都不能太小——太小说明数据太"偏",正态近似不准。比如 p=0.99、n=100 时,np=99 很大但 n(1−p)=1<5——失败次数太少,近似的误差会比较大。
第2步:标准化
Y ~ B(n, p),E(Y)=np,Var(Y)=np(1−p),标准差 = √(np(1−p))
$$\frac{Y - np}{\sqrt{np(1-p)}} \approx N(0, 1)$$
等价地:Y 近似服从 N(np, np(1−p))
大白话:把二项分布的 Y 减去它的期望 np,再除以它的标准差 √(np(1−p)),结果近似标准正态。这跟上一节 CLT 的标准化操作完全一样——只不过把通用公式里的 nμ 换成了 np,nσ² 换成了 np(1−p)。
第3步:转化概率 + 查表
把题目中的概率不等式用标准化后的 Z 表示,查标准正态分布表得结果。
比如:P(a ≤ Y ≤ b) = P((a−np)/√(np(1−p)) ≤ Z ≤ (b−np)/√(np(1−p))) ≈ Φ((b−np)/√(np(1−p))) − Φ((a−np)/√(np(1−p)))
大白话:三步跟上一节 CLT 完全一样——只不过把通用公式"翻译"成了二项分布的语言。棣莫弗-拉普拉斯不是新定理,而是林德伯格-莱维在二项分布上的"应用手册"。
✍️ 立刻练一道(用刚悟出的三步,独立做一遍)
练1:某产品的不合格率为 5%,独立抽取 400 件检验。用正态近似计算不合格件数在 15 到 25 之间的概率。(提示:Y ~ B(400, 0.05),先验证 np、n(1−p) 够不够大。)
点击看解答
⚠️ 前置检查:Y ~ B(400, 0.05)
np = 400 × 0.05 = 20 ≥ 5,n(1−p) = 400 × 0.95 = 380 ≥ 5,条件满足。
第1步:E(Y) = np = 20
Var(Y) = np(1−p) = 400 × 0.05 × 0.95 = 19
标准差 = √19 ≈ 4.359
第2步:标准化 Z = (Y − 20) / √19 ≈ N(0, 1)
第3步:转化概率
P(15 ≤ Y ≤ 25) = P((15−20)/4.359 ≤ Z ≤ (25−20)/4.359)
= P(−1.147 ≤ Z ≤ 1.147)
= Φ(1.147) − Φ(−1.147)
= 2Φ(1.147) − 1
第4步:查表 Φ(1.15) ≈ 0.8749,Φ(1.14) ≈ 0.8729,线性插值 Φ(1.147) ≈ 0.8743
P = 2 × 0.8743 − 1 = 0.7486
答案:约 0.7486(即约 74.9%)
练2:某大型超市每天接待 5000 位顾客,每位顾客购买某种特定商品(比如酸奶)的概率为 0.1,且互相独立。用正态近似计算一天内购买酸奶的人数在 480 到 530 之间的概率。
点击看解答
⚠️ 前置检查:Y ~ B(5000, 0.1)
np = 5000 × 0.1 = 500 ≥ 5,n(1−p) = 5000 × 0.9 = 4500 ≥ 5,条件满足。
第1步:E(Y) = np = 500
Var(Y) = np(1−p) = 5000 × 0.1 × 0.9 = 450
标准差 = √450 ≈ 21.213
第2步:标准化 Z = (Y − 500) / √450 ≈ N(0, 1)
第3步:转化概率
P(480 ≤ Y ≤ 530) = P((480−500)/21.213 ≤ Z ≤ (530−500)/21.213)
= P(−0.943 ≤ Z ≤ 1.414)
= Φ(1.414) − Φ(−0.943)
= Φ(1.414) − (1 − Φ(0.943))
第4步:查表
Φ(1.41) ≈ 0.9207,Φ(1.42) ≈ 0.9222,线性插值 Φ(1.414) ≈ 0.9213
Φ(0.94) ≈ 0.8264,Φ(0.95) ≈ 0.8289,线性插值 Φ(0.943) ≈ 0.8272
P = 0.9213 − (1 − 0.8272) = 0.9213 − 0.1728 = 0.7485
答案:约 0.7485(即约 74.9%)
📝 本节配套练习(题型二·二项近似 + 综合,就近挪到本节)
下面几道题是二项分布正态近似的"真题难度"配套练习,以及一道切比雪夫+CLT综合题——题目和答案一字未改。
题5(二项分布正态近似·含校正)
一台设备由200个独立工作的元件组成,每个元件正常工作的概率为0.98。设备正常运行需要至少190个元件正常工作。求设备正常运行的概率。
(1) 用中心极限定理近似计算。
(2) 用中心极限定理 + 连续性校正计算。
📌 对应模板:题型二·子类型④(二项分布正态近似·含校正)
点击看解答
设 Y = 正常工作的元件数,Y ~ B(200, 0.98)
检查条件:np = 200×0.98 = 196 ≥ 5 ✓
n(1−p) = 200×0.02 = 4 < 5
n(1−p)=4 略小于经验阈值5,这意味着正态近似的精度会有所下降。
不过考试中一般仍然可以用正态近似,只需知道近似精度不是最优即可。
如果追求更精确的结果,建议使用连续性校正(见第(2)问)。
E(Y) = np = 196
Var(Y) = np(1−p) = 200×0.98×0.02 = 3.92
标准差 = √3.92 ≈ 1.980
(1) 不校正:
P(Y ≥ 190) = P(Z ≥ (190 − 196) / 1.980)
= P(Z ≥ −6 / 1.980)
= P(Z ≥ −3.030)
= 1 − Φ(−3.030)
= 1 − (1 − Φ(3.030))
= Φ(3.030)
查表:Φ(3.03) ≈ 0.9988
答案(1):约 0.9988
(2) 连续性校正:
P(Y ≥ 190) ≈ P(Y > 189.5) (因为 ≥190 相当于 >189.5)
= P(Z > (189.5 − 196) / 1.980)
= P(Z > −6.5 / 1.980)
= P(Z > −3.283)
= Φ(3.283)
查表:Φ(3.28) ≈ 0.9995
答案(2):约 0.9995
两个结果差异不大(都接近1),因为 n 很大时连续性校正的影响较小。
关于条件 n(1−p)=4<5:严格来说,n(1−p) 略小于5,
正态近似的精度会有所下降。但在考研数三中一般不会
因此扣分,只要步骤对即可。
题6(真题型·二项分布 + CLT 全流程综合)
某保险公司有10000个投保人,每人保费200元。根据历史数据,每年每人索赔的概率为0.005,且各人是否索赔相互独立。索赔发生时,保险公司需赔付30000元。
(1) 求保险公司当年赔付总次数的期望和方差。
(2) 用中心极限定理近似计算保险公司当年亏损的概率。
(3) 如果保险公司希望亏损概率不超过1%,至少需要收多少保费?(保持其他条件不变,保费四舍五入到整数元)
📌 对应模板:题型二·综合应用
点击看解答
(1) 赔付次数
设 Y = 当年赔付总次数
Y ~ B(10000, 0.005)
E(Y) = np = 10000 × 0.005 = 50
Var(Y) = np(1−p) = 10000 × 0.005 × 0.995 = 49.75
答案(1):期望 50 次,方差 49.75
(2) 亏损分析
收入 = 10000 × 200 = 2,000,000 元
赔付支出 = Y × 30000 元
亏损 ⇔ 赔付支出 > 收入
⇔ 30000Y > 2,000,000
⇔ Y > 66.666...
⇔ Y ≥ 67(因为 Y 是整数)
用中心极限定理:
Z = (Y − 50) / √49.75 ≈ N(0, 1)
√49.75 ≈ 7.053
P(Y ≥ 67) = P(Z ≥ (67 − 50) / 7.053)
= P(Z ≥ 17 / 7.053)
= P(Z ≥ 2.411)
= 1 − Φ(2.411)
查表:Φ(2.41) ≈ 0.9920
所以 P(Y ≥ 67) = 1 − 0.9920 = 0.0080
答案(2):约 0.008(即约 0.8%,亏损风险很低)
(3) 反求保费
设每位保费为 a 元
收入 = 10000a
亏损 ⇔ 30000Y > 10000a
⇔ Y > a/3
要求:P(Y > a/3) ≤ 0.01
标准化:
P(Z > (a/3 − 50) / √49.75) ≤ 0.01
查表:P(Z > z) ≤ 0.01 时,z ≥ 2.326
(查找过程:需要 z 使 Φ(z) = 0.99。查标准正态分布表,
Φ(2.32) = 0.9898,Φ(2.33) = 0.9901。0.99 在两者之间,
线性插值得 z ≈ 2.326。
线性插值操作:0.99 离 0.9898 的距离是 0.0002,
整个区间宽度是 0.9901−0.9898 = 0.0003,比例 = 0.0002/0.0003 ≈ 0.667。
z 的区间宽度是 0.01,走 66.7% 就是 2.32 + 0.667×0.01 ≈ 2.327。
四舍五入得 2.326。)
所以:(a/3 − 50) / √49.75 ≥ 2.326
a/3 − 50 ≥ 2.326 × √49.75
a/3 − 50 ≥ 2.326 × 7.053
a/3 − 50 ≥ 16.40
a/3 ≥ 66.40
a ≥ 199.2
由于保费通常取整,a ≥ 200
答案(3):至少收 200 元
本题的巧妙之处:原来的保费就是200元,刚好满足亏损概率不超过1%。
这说明定价是合理的——既不太贵(对客户友好),
也不会太容易亏损(亏损概率仅约0.8%)。
题7(切比雪夫 + CLT 综合对比·题型一题5挪到本节)
抛一枚不均匀硬币100次,每次正面概率为0.6。设正面次数为 Y。
(1) 用切比雪夫不等式估计 P(50 < Y < 70) 的下界。
(2) 用中心极限定理近似计算 P(50 < Y < 70),并与切比雪夫下界比较。
📌 对应模板:题型一·子类型② + 题型二·子类型④(综合)
点击看解答
(1) 切比雪夫不等式
Y ~ B(100, 0.6)
μ = E(Y) = 100 × 0.6 = 60
σ² = Var(Y) = 100 × 0.6 × 0.4 = 24
"50 < Y < 70" ⇔ "|Y − 60| < 10",所以 ε = 10
P(50 < Y < 70) = P(|Y − 60| < 10) ≥ 1 − σ²/ε²
= 1 − 24/100
= 1 − 0.24
= 0.76
答案(1):下界 0.76
(2) 中心极限定理近似
标准化:Z = (Y − 60) / √24 ≈ N(0, 1)
√24 ≈ 4.899
P(50 < Y < 70) = P((50−60)/4.899 < Z < (70−60)/4.899)
= P(−2.041 < Z < 2.041)
= Φ(2.041) − Φ(−2.041)
= Φ(2.041) − (1 − Φ(2.041))
= 2Φ(2.041) − 1
查表:Φ(2.04) ≈ 0.9793
所以 2 × 0.9793 − 1 = 0.9586
答案(2):约 0.9586
比较:CLT 近似 0.9586 > 切比雪夫下界 0.76
→ 切比雪夫下界确实偏保守(0.76),实际概率要高出很多(约 0.96)。
→ 这体现了:有分布信息时用 CLT,没有分布信息时用切比雪夫。
📝 ④ 白话复盘
棣莫弗-拉普拉斯中心极限定理就讲了一件事:二项分布 n 大了以后就是正态分布。
- 为什么? 因为二项分布本质就是 n 个独立的 0-1 变量之和——而林德伯格-莱维 CLT 说:大量独立同分布变量之和标准化后趋近正态。二项分布恰好满足这个条件。
- 怎么用? 验证 np≥5 且 n(1−p)≥5 → 套标准化公式 Z=(Y−np)/√(np(1−p)) → 查表。
- 跟上一节 CLT 的关系? 棣莫弗-拉普拉斯是"特例版",林德伯格-莱维是"通用版"。考试中算二项概率时直接用棣莫弗-拉普拉斯更方便——不需要先翻译成 0-1 变量再套通用公式。
💡 一句记死:二项分布 B(n,p),当 n 足够大时 ≈ 正态分布 N(np, np(1−p))。标准化后查表搞定。
⚠️ ⑤ 易错边界
| 坑 | 错误姿势 | 正确姿势 |
|---|---|---|
| ① 不检查 np 和 n(1−p) | 不管 n 多大、p 多偏,直接套正态近似 | 先检查 np≥5 且 n(1−p)≥5。p 接近0或1时需要更大的 n |
| ② 标准化分母写错 | (Y−np)/np(1−p) | (Y−np)/√(np(1−p))——分母是标准差,不是方差! |
| ③ 忘记这是近似 | 把"≈N(0,1)"当成"=N(0,1)" | n 是有限的,所以是近似。n 越大越准。二项分布精确值可以通过求和算(但 n 大时太麻烦) |
| ④ 混淆与 CLT 的关系 | 以为棣莫弗-拉普拉斯是独立于 CLT 的新定理 | 它就是 CLT 在二项分布上的特例。本质是同一个定理的两种表述 |
🔗 ⑥ 在整条链中的位置
林德伯格-莱维 CLT(5.4 主定理)
│
├── 通用版:任何独立同分布 → 标准化和 → N(0,1)
│
└── 棣莫弗-拉普拉斯 CLT(本节)← 特例版:X_i 取 0-1 分布
│
├── Y ~ B(n,p) → 标准化 (Y−np)/√(np(1−p)) ≈ N(0,1)
│
└──→ 第7章:二项分布的正态近似 → 总体比例的区间估计
从哪来:林德伯格-莱维中心极限定理(5.4 主定理)——棣莫弗-拉普拉斯只是把它用在二项分布上。
到哪去:第7章"总体比例的区间估计"——这是棣莫弗-拉普拉斯 CLT 最经典的应用场景。当你用样本比例 p̂ 估计总体比例 p 时,p̂ 的标准化形式近似 N(0,1),这背后就是棣莫弗-拉普拉斯 CLT。
在整个概率论中的位置:棣莫弗-拉普拉斯是连接"伯努利大数定律"(告诉你频率稳定在 p 附近)和"中心极限定理"(告诉你频率的波动近似正态)的桥梁——两者合在一起,就是"用频率估计概率"的完整理论基础。
② 题型与练习(讲练合一)
🧭 导航:下面按本章学习顺序排列三个题型——题型一(切比雪夫不等式)、题型二(中心极限定理计算)、题型三(大数定律条件辨析)。本节只保留每个题型的解题方法 + 经典例题(配套练习已就近挪到各知识点后面:题型一 → 5.1.1 与 5.4.1,题型二 → 5.4 与 5.4.1,题型三 → 5.3.2 与 5.3.4)。刚学完5.4中心极限定理的同学可以直接跳到题型二先练CLT,再回来看切比雪夫条件辨析,不必按顺序刷。
题型一:切比雪夫不等式的应用(⭐⭐)
先看一道真题模样的题,看完先别急着看答案,试着动手算一算:
试一试:已知随机变量 X 的 E(X)=100,Var(X)=25。用切比雪夫不等式估计 P(90 < X < 110) 的下界。
看到这题,先别慌。它难在哪?——题目只给了期望和方差,没给分布。你学的"算概率"套路(密度积分、查表)全都用不上——因为根本不知道 X 长什么样。但5.1.1的切比雪夫不等式恰恰就专治这种"没分布"的题。
动手试探——按5.1.1的形式②(落在区间内的下界)一步一步来:
第1步:把"90 < X < 110"翻译成"|X − μ| < ε"
μ = 100,所以 "90 < X < 110" ⇔ "|X − 100| < 10",ε = 10。
🧠 这一步在想什么:先认 μ 和 σ²——切比雪夫只认识这两个数。E(X)=100 就是 μ,Var(X)=25 就是 σ²。再找 ε:区间关于 100 对称,所以 ε 取半宽 10。
第2步:代入形式②
P(|X − 100| < 10) ≥ 1 − σ²/ε² = 1 − 25/100 = 0.75。
结果 0.75 在 [0,1] 内,OK。答案:下界为 0.75。
🔍 回头看看我们做了什么:认 μ、认 σ² → 找 ε → 判断用形式①还是② → 代入 → 检查结果在 [0,1]。这不就是一套解题模板嘛!
📌 以后就这么办——切比雪夫不等式四步模板:
第1步:从题目中识别 μ = E(X) 和 σ² = Var(X)
第2步:确定 ε —— "偏离多远"算作"偏离"
技巧:如果题目问 P(a < X < b),则区间关于期望对称时 ε = (b−a)/2;
如果不对称,转化为 |X−μ| < ε 的形式
第3步:代入公式
· 求"偏离超过某值"的上界 → 用形式①(P(|X−μ|≥ε) ≤ σ²/ε²)
· 求"落在某个范围内"的下界 → 用形式②(P(|X−μ|<ε) ≥ 1 − σ²/ε²)
第4步(自检):结果必须在 [0, 1] 之间
· 形式① 的结果:如果 σ²/ε² > 1,则上界取 1
· 形式② 的结果:如果 1−σ²/ε² < 0,则下界取 0
怎么一眼认出是这题:题目里出现**"估计概率""估计次数""概率不小于/不大于"**,只要给出了期望和方差(或能算出),但不告诉你具体分布,十有八九就是切比雪夫不等式。
翻车现场:
- 混淆 ε 的含义——ε 是"偏离期望的距离",是半个区间宽度,不是整个区间宽度
- 忘记取 min(1, …) 或 max(0, …)——概率不可能超过1也不能小于0
- ε 太小(小于标准差)时,上界可能≥1,此时切比雪夫给出的信息没有用
子类型①:直接给期望和方差,估计概率(上面的"试一试"就是这个子类型,已亲手做过一遍)
子类型②:需要自己算出期望和方差
例题1:设 X 服从参数 λ = 4 的泊松分布。用切比雪夫不等式估计 P(|X − 4| ≥ 3) 的上界。
点击看解答
第1步:X ~ P(4)
μ = E(X) = λ = 4
σ² = Var(X) = λ = 4
第2步:题目问 |X − 4| ≥ 3,所以 ε = 3
第3步:用形式①
P(|X − 4| ≥ 3) ≤ σ²/ε² = 4/9 ≈ 0.4444
第4步:4/9 在 [0,1] 内,OK
答案:上界为 4/9(约 0.4444)
补充:泊松分布 P(4) 的精确概率 P(|X−4|≥3) ≈ 0.2023,确实 ≤ 4/9。
切比雪夫上界没有错,但比精确值宽一倍多——这正说明切比雪夫
不等式的估计比较"粗糙"。
子类型③:反求 n(样本量)
例题2:从某总体中独立抽取 n 个样本 X₁, X₂, ..., Xₙ。已知 E(X_i)=μ,Var(X_i)=σ²。用切比雪夫不等式确定:要使样本均值 X̄ 与 μ 的偏差超过 ε 的概率不超过 α,n 至少取多大?
点击看解答
第1步:样本均值 X̄ = (1/n) Σ X_i
E(X̄) = μ
Var(X̄) = σ²/n
第2步:用切比雪夫不等式(形式①)
P(|X̄ − μ| ≥ ε) ≤ Var(X̄) / ε² = (σ²/n) / ε² = σ²/(nε²)
第3步:要使 P(|X̄ − μ| ≥ ε) ≤ α,只需 σ²/(nε²) ≤ α
反解:n ≥ σ²/(αε²)
答案:至少抽取 n = ⌈σ²/(αε²)⌉ 个
这里的⌈·⌉叫"天花板"符号,表示向上取整——比如⌈3.2⌉=4,⌈5⌉=5。
意思是算出来的数如果有小数,就往大的方向取整数,因为人数必须是整数
而且"至少"意味着不能往小了取。
🛑 途中停顿:已知 X 的期望为 5,方差为 9。用切比雪夫不等式估计 P(|X − 5| ≥ 6) 的上界。如果上界算出来大于 1,应该怎么处理?(先自己做,再点开下面验证)
点击看解答
μ = 5,σ² = 9,ε = 6
P(|X − 5| ≥ 6) ≤ σ²/ε² = 9/36 = 0.25
上界 0.25 ≤ 1,在合法范围内,无需 clamp。
只有当 σ²/ε² > 1 时才取 min(·, 1)(比如 ε ≤ σ 时)。
📌 配套练习已就近挪到知识点后面:本题型的配套练习(原题1
题4)已挪到 5.1.1 切比雪夫不等式 小节末尾的"本节配套练习"(题A题D);综合题(原题5)已挪到 5.4.1 棣莫弗-拉普拉斯 小节末尾(题7)。想刷题直接翻回对应小节。
题型二:中心极限定理近似计算概率(⭐⭐⭐)
先看一道真题模样的题,看完先别急着看答案,试着动手算一算:
试一试:一袋种子有300颗,每颗发芽的概率为0.9,各颗是否发芽相互独立。用中心极限定理近似计算发芽总数不超过260颗的概率。
看到这题,先别慌。它难在哪?——发芽总数 Y ~ B(300, 0.9),精确算要 ∑ C(300,k) 求和,组合数大到没边。但5.4学的 CLT 说:大量独立同分布变量之和,标准化后近似正态。这题正好是 300 颗独立种子的叠加,可以近似!
动手试探——按5.4的"标准化"套路一步一步来:
第1步:把 Y 的期望、方差算出来
Y = 发芽总数 = 300 颗独立 0-1 变量之和。E(Y) = np = 270,Var(Y) = np(1−p) = 27,标准差 = √27 ≈ 5.196。
🧠 这一步在想什么:二项分布本身就是 CLT 的对象——300 颗种子就是 300 个独立的 0-1 变量,套 CLT 时把"总和 Y"当主角。
第2步:标准化
Z = (Y − 270) / √27 ≈ N(0, 1)。
第3步:把"发芽总数 ≤ 260"翻译成 Z 的不等式
P(Y ≤ 260) = P(Z ≤ (260 − 270)/√27) = P(Z ≤ −1.924)。
第4步:查表
Φ(−1.924) = 1 − Φ(1.924) ≈ 1 − 0.9728 = 0.0272。答案:约 2.72%。
大白话:每颗发芽率高达90%,但300颗里不到260颗发芽的概率仍不到3%——因为 n 大了结果会集中在期望270附近。
🔍 回头看看我们做了什么:验证条件 → 算总和的期望方差 → 标准化 → 转化概率 → 查表。这不就是一套通用模板嘛!
📌 以后就这么办——CLT 通用四步模板:
⚠️ 前置检查(验证条件):
· 随机变量是否独立同分布?
· n 是否足够大?(一般 n ≥ 30;二项分布要 np≥5 且 n(1−p)≥5)
第1步(设总和):
设 Y = X₁ + X₂ + ... + Xₙ
E(Y) = nμ
Var(Y) = nσ²
标准差 = √n σ
第2步(标准化):
构造 Z = (Y − nμ) / (√n σ)
则 Z 近似服从 N(0, 1)
(说"近似"而不是"等于",是因为中心极限定理是一个极限结论——
只有 n→∞ 时才精确等于正态分布。实际应用中 n 是有限的,
所以只是近似。n 越大,近似越准确。)
第3步(转化概率):
把题目要求的概率,用 Z 的不等式表示出来。
例如:
· P(Y > a) = P(Z > (a − nμ)/(√n σ))
· P(Y < b) = P(Z < (b − nμ)/(√n σ))
· P(a < Y < b) = P((a−nμ)/(√n σ) < Z < (b−nμ)/(√n σ))
第4步(查表):
查标准正态分布表,得结果。
常用值要记住:
· Φ(0) = 0.5
· Φ(1) ≈ 0.8413
· Φ(1.645) ≈ 0.95
· Φ(1.96) ≈ 0.975
· Φ(2) ≈ 0.9772
· Φ(2.576) ≈ 0.995
· Φ(−z) = 1 − Φ(z)(对称性)
怎么一眼认出是这题:题目里出现**"n 较大""用中心极限定理近似计算""求总和的概率""求平均值的概率""二项分布近似计算"**。关键是看到 n 比较大(n ≥ 30 通常就够用),且随机变量独立同分布。
为什么标准化这招这么神? 它的核心是——把任何正态近似问题统一转化为查 N(0, 1) 表。
💡 回忆第4章:任何正态分布 X~N(μ,σ²) 都可以通过 Z=(X−μ)/σ 变成标准正态 N(0,1)。中心极限定理的标准化就是同一套操作,只不过标准化对象从"单个 X"变成了"总和 ΣX_i"。
标准化的含义(生活比喻):
你班上平均身高170cm,标准差6cm。小明身高182cm。问"小明在全班是什么水平?"你不是直接看182,而是算:182比平均高了多少个"标准差"?(182−170)/6 = 2。也就是说,小明比平均身高高了2个标准差。
这个"2"就是标准化后的值。标准化做的事情是:把不同分布的数据,统一转换到同一个尺度(标准正态 N(0,1))上。不同科目的考试成绩、不同单位的测量数据,标准化后都可以直接比较。
翻车现场:
- 标准化时分母是 √n σ 不是 nσ——方差加n倍,标准差加√n倍,两个概念别搞混
- 问样本均值 X̄ 时,标准化用 X̄ 的期望和方差更直接:Z = (X̄ − μ)/(σ/√n),不要先算总和再除以n
- 连续性校正——二项分布是离散的,正态分布是连续的,直接近似时边界处会有误差
子类型①:求总和的概率(最经典)(上面的"试一试"就是这个子类型,已亲手做过一遍,答案是 2.72%)
子类型②:求样本均值的概率
例题3:从期望 μ=50、方差 σ²=100 的总体中独立抽取 n=100 个样本。用中心极限定理近似计算样本均值 X̄ 大于52的概率。
点击看解答
⚠️ 前置检查:n=100,独立同分布,条件满足。
第1步:直接用样本均值公式(推荐,更直接):
样本均值 X̄
E(X̄) = μ = 50
Var(X̄) = σ²/n = 100/100 = 1
标准差 = 1
第2步:标准化
Z = (X̄ − 50) / 1 ≈ N(0, 1)
第3步:转化概率
P(X̄ > 52) = P(Z > (52 − 50)/1) = P(Z > 2)
第4步:查表
P(Z > 2) = 1 − Φ(2) = 1 − 0.9772 = 0.0228
答案:约 0.0228(即约 2.28%)
注意:题目问的是"样本均值 X̄"而不是"总和 Y"。
标准化时用 X̄ 的期望和方差更直接。
子类型③:给定概率反求区间或 n
例题4:某品牌灯泡寿命 X 的期望为2000小时,标准差为200小时。现独立抽取64只灯泡,求有95%把握认为这64只灯泡的平均寿命与2000小时之差不超过多少小时?(用中心极限定理)
点击看解答
⚠️ 前置检查:n=64,独立同分布,n 足够大,条件满足。
第1步:样本均值 X̄
E(X̄) = 2000
Var(X̄) = 200²/64 = 40000/64 = 625
标准差 = 25
第2步:标准化
Z = (X̄ − 2000) / 25 ≈ N(0, 1)
第3步:题意是求 d,使得 P(|X̄ − 2000| ≤ d) = 0.95
P(|X̄ − 2000| ≤ d) = P(−d/25 ≤ Z ≤ d/25) = 0.95
查表:P(−z ≤ Z ≤ z) = 0.95 时,z = 1.96
(因为 Φ(1.96) − Φ(−1.96) = 0.975 − 0.025 = 0.95)
所以 d/25 = 1.96,d = 25 × 1.96 = 49
答案:不超过 49 小时
实际含义:抽64只灯泡测平均寿命,有95%的把握说平均值离真实值
2000小时不超过49小时。这是置信区间的核心思想。
子类型④:二项分布正态近似(棣莫弗-拉普拉斯)
例题5:抛一枚均匀硬币400次。用正态近似计算正面次数在190到210之间的概率。
点击看解答
⚠️ 前置检查:Y ~ B(400, 0.5)
np = 200 ≥ 5,n(1−p) = 200 ≥ 5,条件满足。
第1步:E(Y) = np = 200
Var(Y) = np(1−p) = 400 × 0.5 × 0.5 = 100
标准差 = 10
第2步:标准化 Z = (Y − 200) / 10 ≈ N(0, 1)
第3步:转化概率
P(190 ≤ Y ≤ 210) = P((190−200)/10 ≤ Z ≤ (210−200)/10)
= P(−1 ≤ Z ≤ 1)
= Φ(1) − Φ(−1)
= Φ(1) − (1 − Φ(1))
= 2Φ(1) − 1
第4步:查表 Φ(1) ≈ 0.8413
P = 2 × 0.8413 − 1 = 0.6826
答案:约 0.6826
若用连续性校正:P(189.5 < Y < 210.5) = P(−1.05 < Z < 1.05)
= 2Φ(1.05) − 1 = 2 × 0.8531 − 1 = 0.7062
二项分布精确值约 0.7065,校正后的结果更接近。
但考研数三通常不要求校正,直接用近似即可。
📊 精度对比:不用校正→0.6826,用校正→0.7062,精确值→0.7065。校正让误差从约2.4%降到了约0.04%,这就是连续性校正的价值所在。
📌 【拓展阅读·考研可不看】 以下是连续性校正的原理。考研数三试卷上直接近似即可,不校正不扣分。想深入理解的同学可以继续读。
关于连续性校正的说明:
二项分布是离散的(只能取整数),但正态分布是连续的(可以取任何值)。当你用连续分布去近似离散分布时,就像用光滑的曲线去描锯齿状的折线——在边界处需要"适当放宽边界"。这个操作叫做连续性校正(也叫"半校正")。
核心原则:把二项分布的整数 k 想象成连续区间 [k−0.5, k+0.5]。然后所有"≤、<、≥、>"都可以统一转化:
- "Y ≤ k" 就是 "Y 在区间 (−∞, k+0.5] 内"
- "Y ≥ k" 就是 "Y 在区间 [k−0.5, +∞) 内"
- "Y = k" 就是 "Y 在区间 [k−0.5, k+0.5] 内"
背后的道理很简单:连续分布(正态)没有"恰好等于某个数"这回事——概率是面积。所以我们把离散的每一个整数点扩展成宽度为1的小区间,就自然衔接上了。
考研提醒:数三大多数题目不需要连续性校正(直接近似),但如果题目明确要求"用正态近似估计二项概率"且 n 不太大,校正会让结果更精确。具体看题目要求。
标准解题步骤(二项分布正态近似):
⚠️ 前置检查:确认 Y ~ B(n, p),检查 np ≥ 5 且 n(1−p) ≥ 5
第1步:E(Y) = np,Var(Y) = np(1−p)
第2步:标准化 Z = (Y − np) / √(np(1−p)) ≈ N(0,1)
第3步:转换概率并用正态表
【核心提醒】 考研数三试卷上直接近似即可,不校正不扣分。以上连续性校正内容供想深入理解的同学参考,跳过不影响做题。
🛑 途中停顿:中心极限定理标准化时,分母为什么是 √n σ 而不是 nσ?如果题目问的是样本均值 X̄ 而不是总和 ΣX_i,标准化公式应该怎么写?试着用自己的话回答,再点开下面验证。
点击看解答
① 为什么分母是 √n σ:总和 Y 的方差 = nσ²(方差加 n 倍),
标准差 = √(nσ²) = √n σ。标准化永远除以"标准差",不是"方差"。
② 问样本均值 X̄ 时:E(X̄)=μ,Var(X̄)=σ²/n,标准差 = σ/√n,
所以 Z = (X̄ − μ) / (σ/√n) ≈ N(0,1)。
直接用 X̄ 的期望和方差更直接,不必先算总和再除以 n。
📌 配套练习已就近挪到知识点后面:本题型的配套练习已挪到——5.4 中心极限定理 小节末尾的"本节配套练习"(原题1商店累计销量、原题2反求n、原题5灯泡推断、原题型三题3的LLN与CLT辨析),5.4.1 棣莫弗-拉普拉斯 小节末尾(原题3设备校正、原题4保险公司综合)。想刷题直接翻回对应小节。
题型三:大数定律条件辨析题(⭐⭐)
先看一道真题模样的选择题,看完先别急着看答案,试着动手分析:
试一试:以下哪个条件不能保证大数定律成立?
A. X₁, ..., Xₙ 独立同分布,E(X_i) 存在
B. X₁, ..., Xₙ 独立,Var(X_i) ≤ 10 对任意 i 成立
C. X₁, ..., Xₙ 独立同分布,Var(X_i) 存在
D. X₁, ..., Xₙ 独立同分布
看到这题,先别慌。它难在哪?——四个选项的条件各不相同,要逐个判断"能不能保证大数定律成立"。判断的唯一依据,就是5.3.4那张三定律条件表——先读题,把题目给的条件列出来,再逐条对照。
动手试探——拿选项逐个"对表":
- A:独立 ✓、同分布 ✓、期望存在 ✓ → 辛钦条件齐了 → 能保证 ✓
- B:独立 ✓、方差一致有界(都≤10)✓ → 切比雪夫条件齐了 → 能保证 ✓
- C:独立同分布 ✓、方差存在 → 方差存在自动保证期望存在 → 辛钦条件齐了 → 能保证 ✓
- D:独立同分布 → 没说期望是否存在! 如果是柯西分布(期望不存在),大数定律不成立 → 不能保证 ✗
🧠 这一步在想什么:每个选项都是一套"条件组合",拿它去匹配三个定律各自的"条件清单"。哪套清单被完全满足,哪个定律就成立。而"独立同分布 ≠ 大数定律成立",还差一个"期望存在"——这正是陷阱所在。
🔍 回头看看我们做了什么:读题提取条件 → 对照三定律条件表逐项匹配 → 排除干扰项。这不就是一套辨析模板嘛!
📌 以后就这么办——大数定律条件辨析三步:
第1步:读题,判断题目中随机变量序列的特征——
它们独立吗?同分布吗?期望/方差存在吗?
第2步:对照下表,逐一匹配:
· 独立同分布,期望存在 → 辛钦大数定律(最常用)
· 独立同分布,且是 0-1 分布 → 伯努利大数定律(也是辛钦的特例)
· 独立但不同分布,方差一致有界 → 切比雪夫大数定律
第3步:排除常见干扰项:
✗ "大数定律要求方差存在" → 错!辛钦不需要方差
✗ "独立同分布就一定满足大数定律" → 错!还需要期望存在
✗ "切比雪夫大数定律要求同分布" → 错!切比雪夫不需要同分布
✗ "伯努利大数定律要求方差一致有界" → 错!伯努利是辛钦的特例
怎么一眼认出是这题:选择题或判断题,给出几个命题,问哪个大数定律成立、哪个不成立、或者"以下哪个是大数定律成立的条件"。标志性关键词:"大数定律""依概率收敛""独立同分布""方差存在/不存在""有界"。
核心考点:三个大数定律的条件对比——这是选择题最爱出的内容,混淆条件等于必错。
| 条件 | 伯努利 | 辛钦 | 切比雪夫 |
|---|---|---|---|
| 独立 | ✓(伯努利试验自动满足) | ✓ | ✓ |
| 同分布 | ✓(0-1分布) | ✓ | 不需要 |
| 期望存在 | ✓(p 存在) | ✓(μ 存在) | ✓(各 μᵢ 存在) |
| 方差存在且有界 | 自动满足 | 不需要 | ✓(一致有界) |
| 结论 | 频率 → 概率 p | 样本均值 → μ | 样本均值 → 期望平均 |
例题6(判断题):下列命题是否正确?"若 X₁, X₂, ..., Xₙ 独立同分布且方差存在,则样本均值依概率收敛于期望。"
点击看答案
✅ 正确。方差能算出来,前提是期望先算出来(方差本身就是"偏离期望的平方的平均值"——如果连期望都不知道,方差也无从算起)。所以方差存在自动保证期望也存在。加上独立同分布,辛钦大数定律条件全部满足,所以样本均值依概率收敛于期望。
即使从切比雪夫角度验证也对:独立✓、同分布✓(自然方差一致有界✓),同样满足。
🛑 途中停顿:下面四个条件中,哪些是辛钦大数定律必须的、哪些不是?①独立 ②同分布 ③期望存在 ④方差存在。如果只满足①②但③不满足,大数定律还成立吗?(试着对照三个定律的条件表回答,再点开下面验证)
点击看解答
①独立 ✓必须 ②同分布 ✓必须 ③期望存在 ✓必须 ④方差存在 ✗不必需
辛钦只需要独立 + 同分布 + 期望存在,不需要方差。
如果只满足①②(独立、同分布)但③不满足(期望不存在),
大数定律不成立——柯西分布就是反例(独立同分布但期望不存在)。
📌 配套练习已就近挪到知识点后面:本题型的配套练习已挪到——5.3.2 辛钦大数定律(原题1:独立同分布判断题,即"立刻练一道"练1),5.3.4 三定律对比(原题2:三定律条件辨析,即"立刻练一道"练1),5.4 中心极限定理(原题3:LLN与CLT综合辨析,即"本节配套练习"题4)。想刷题直接翻回对应小节。
🧠 概念辨析自检(10道判断题)
下面的说法有的是对的,有的是错的。先自己判断,再看答案。这些是学生最容易踩的坑。
判断1:切比雪夫不等式给出的是概率的精确值。
点击看答案
❌ 错误。 切比雪夫不等式给出的是概率的上界(上限),不是精确值。它说"概率不超过某个数",实际概率可能比这个数小很多。它是"不知道分布时的保守估计"。
判断2:辛钦大数定律要求随机变量序列的方差存在。
点击看答案
❌ 错误。 辛钦大数定律的条件是:
- 独立同分布
- 期望存在
它不需要方差存在!只需要期望存在就够了。这是辛钦比切比雪夫大数定律条件更宽松的地方。
判断3:伯努利大数定律是辛钦大数定律的特例。
点击看答案
✅ 正确。 伯努利试验中的每次结果可以看作一个0-1随机变量(成功为1,失败为0),每次独立同分布,期望为 p。n次试验的成功次数除以 n 就是样本均值。所以伯努利大数定律就是把辛钦大数定律应用到0-1分布的特例。
判断4:切比雪夫大数定律要求随机变量同分布。
点击看答案
❌ 错误。 切比雪夫大数定律不要求同分布,只要求:
- 相互独立
- 方差一致有界(存在共同上界)
各随机变量可以来自完全不同的分布,只要方差都"被控制住"。这一点恰好和辛钦大数定律相反——辛钦要求同分布但不要求方差有界(只要求期望存在)。
判断5:中心极限定理的结论是:大量独立随机变量的和本身服从正态分布。
点击看答案
❌ 错误。 这个说法不够准确。中心极限定理说的是:大量独立随机变量和的标准化形式近似服从标准正态分布 N(0,1)。
更准确地说:
- 总和 Y = ΣX_i 近似服从 N(nμ, nσ²)(不是直接等于,是近似!)
- 标准化后 (Y − nμ)/(√n σ) 近似服从 N(0, 1)
关键词是"标准化"和"近似/极限"。它是当 n→∞ 时的极限结论,实际应用中 n 足够大时近似成立。
判断6:n 很大时,二项分布 B(n, p) 可以直接当作正态分布 N(np, np(1−p)) 来计算概率。
点击看答案
✅ 正确(但有注意事项)。 这是棣莫弗-拉普拉斯中心极限定理的直接应用。当 n 足够大(通常要求 np ≥ 5 且 n(1−p) ≥ 5)时,二项分布可以很好地用正态分布近似。
不过要注意:二项分布是离散的,正态分布是连续的。对于取单个点的概率(如 P(Y = k)),需要用连续性校正。对于区间概率(如 P(a ≤ Y ≤ b)),在大 n 下直接近似通常就够了。考研数三中,大部分题目直接近似即可,不需要连续性校正。
判断7:依概率收敛意味着随机变量最终确定地等于目标常数。
点击看答案
❌ 错误。 依概率收敛 ≠ 确定地等于。依概率收敛说的是:对于任意小的 ε > 0,当 n 充分大时,Xₙ 落在 (a − ε, a + ε) 内的概率任意接近1。
但总存在很小的可能性(虽然趋近于零),Xₙ 会偏离 a 很远。这跟微积分中确定性的极限不同。
通俗说:依概率收敛 = "几乎可以确定"(大概率接近),而不是"绝对确定"。
判断8:切比雪夫不等式可以用来证明切比雪夫大数定律。
点击看答案
✅ 正确。 切比雪夫大数定律的证明正是利用了切比雪夫不等式。
证明思路:对样本均值 X̄ = (1/n) ΣX_i 应用切比雪夫不等式:
$$P(|X̄ - E(X̄)| \geq \varepsilon) \leq \frac{Var(X̄)}{\varepsilon^2}$$
如果 X_i 独立且方差一致有界(Var(X_i) ≤ C),则 Var(X̄) = (1/n²) Σ Var(X_i) ≤ C/n → 0,于是不等式右边趋近于0,从而 P(|X̄ − E(X̄)| < ε) → 1。
这就是切比雪夫大数定律的证明过程——也体现了切比雪夫不等式的理论价值。
判断9:依概率收敛和微积分中的极限收敛是一回事,只是叫法不同。
点击看答案
❌ 错误。 两者有本质区别:
- 微积分极限:数列 aₙ = 1/n,当 n→∞ 时,aₙ 确定地等于0——是"板上钉钉的收敛",没有随机性。
- 依概率收敛:每次 n 增大,随机变量 Xₙ 的值还是随机的,只是"偏离很远"这件事的概率趋向于零——是"大概率接近的收敛"。
关键区别:依概率收敛允许偶尔出现大的偏差(虽然概率趋近于零),而普通极限是确定性的。就像投篮——微积分极限是球"必须"进,依概率收敛是"几乎肯定"进。
判断10:只要随机变量足够多(n 足够大),它们的和就一定可以用中心极限定理近似为正态分布。
点击看答案
❌ 错误。 中心极限定理有明确的适用条件,不是"n大就行":
- 随机变量必须独立(或至少近似独立)
- 通常要求同分布(林德伯格-莱维定理),或者满足更一般的林德伯格条件
- 期望和方差必须存在——如果随机变量来自柯西分布(期望和方差都不存在),不管 n 多大,中心极限定理都不成立
此外,即使条件满足,n 多大算"足够大"也取决于原始分布的形状——分布越偏斜,需要的 n 越大。一般来说 n ≥ 30 是一个经验参考值,但不是绝对标准。
③ 综合混搭练习
打乱题型,逼你自己判断该用哪个方法。这四道题混合了本章的多个知识点。
混搭1 🎲(切比雪夫 + CLT 对比)
某随机变量 X 的 E(X)=50,Var(X)=25。
(1) 用切比雪夫不等式估计 P(40 < X < 60) 的下界。
(2) 如果已知 X 服从正态分布 N(50, 25),求 P(40 < X < 60) 的精确值。
(3) 比较(1)和(2)的结果,说明切比雪夫不等式的特点和局限。
📌 对应模板:题型一 + 题型二(概念对比)
点击看答案
(1) 切比雪夫不等式
μ = 50,σ² = 25
"40 < X < 60" ⇔ "|X − 50| < 10",所以 ε = 10
P(40 < X < 60) ≥ 1 − 25/100 = 1 − 0.25 = 0.75
答案(1):下界 0.75
(2) 正态分布精确值
X ~ N(50, 25),标准差 = 5
P(40 < X < 60) = P((40−50)/5 < Z < (60−50)/5)
= P(−2 < Z < 2)
= Φ(2) − Φ(−2)
= Φ(2) − (1 − Φ(2))
= 2Φ(2) − 1
= 2 × 0.9772 − 1
= 0.9544
答案(2):约 0.9544
(3) 比较
切比雪夫下界 0.75 < 精确值 0.9544
切比雪夫没有错(0.9544 ≥ 0.75),但给出的下界非常保守。
特点:不需要知道分布就能估计,但估计很粗糙。
局限:当 ε 较小(小于标准差)时,估计完全失去价值。
混搭2 🔄(大数定律条件判断 + CLT 计算)
某工厂有三条独立的生产线,每条生产线每天的产量为 X₁, X₂, X₃,但它们的分布不同:
- 生产线A:日产量服从正态分布 N(100, 25)
- 生产线B:日产量服从泊松分布 P(100)
- 生产线C:日产量服从均匀分布 U(80, 120)
(1) 这三条生产线每天的日总产量 T = X₁ + X₂ + X₃。判断该场景是否满足大数定律的条件?如果满足,是哪个大数定律?
(2) 工厂连续运营100天,每天三条生产线独立运行且每天之间相互独立。用中心极限定理近似计算100天累计总产量超过30300件的概率。
📌 对应模板:题型三(条件辨析)+ 题型二·子类型①
点击看答案
(1) 大数定律条件判断
每天三条生产线的日总产量 T = X₁ + X₂ + X₃
T 的期望 = 100 + 100 + 100 = 300(三种分布的期望都是100)
T 的方差 = 25 + 100 + (120−80)²/12 = 25 + 100 + 133.33 ≈ 258.33
100天的总产量 = T₁ + T₂ + ... + T₁₀₀(每天独立)
这里每天的产量 T_i 是独立同分布的吗?
→ 每天的三条生产线分布固定,所以每天的 T_i 同分布 ✓
→ 每天之间独立 ✓
→ 期望存在 ✓(E(T_i)=300)
→ 方差存在 ✓(Var(T_i)≈258.33)
满足辛钦大数定律的条件:独立同分布 + 期望存在。
所以样本均值(100天的日均产量)依概率收敛于 300。
同时也满足切比雪夫大数定律的条件(方差一致有界)。
答案(1):满足,辛钦大数定律(和切比雪夫大数定律都满足)
(2) CLT 近似计算
设 S = T₁ + T₂ + ... + T₁₀₀
E(S) = 100 × 300 = 30000
Var(S) = 100 × 258.33 = 25833
标准差 = √25833 ≈ 160.73
Z = (S − 30000) / 160.73 ≈ N(0, 1)
P(S > 30300) = P(Z > (30300 − 30000) / 160.73)
= P(Z > 300 / 160.73)
= P(Z > 1.867)
= 1 − Φ(1.867)
查表:Φ(1.87) ≈ 0.9693,Φ(1.86) ≈ 0.9686
线性插值:Φ(1.867) ≈ 0.9690
所以 P = 1 − 0.9690 = 0.0310
答案(2):约 0.0310(即约 3.1%)
混搭3 🧩(概念辨析混合题)
判断下列说法是否正确,并说明理由:
(1) "大数定律说明大量随机变量的和近似服从正态分布。"
(2) "辛钦大数定律不要求方差存在,所以条件比切比雪夫大数定律更弱(在所有方面都更宽松)。"
(3) "如果 X₁, X₂, ..., Xₙ 独立同分布,且 E(X_i) = μ,Var(X_i) = σ² 都存在,那么当 n 很大时,X̄ 近似服从 N(μ, σ²/n)。"
📌 对应模板:题型三(综合概念辨析)
点击看答案
(1) ❌ 错误。
"和近似正态分布"是中心极限定理的结论,不是大数定律的。
大数定律回答的是"稳定性"问题——大量重复后结果稳定在什么值(期望)。
中心极限定理回答的是"分布形态"问题——大量因素叠加后波动的形状(正态)。
两者相辅相成,但回答不同的问题。
(2) ⚠️ 不完全正确。
辛钦和切比雪夫各有强弱:
· 辛钦不要求方差存在 → 在这一点上比切比雪夫更宽松
· 切比雪夫不要求同分布 → 在这一点上比辛钦更宽松
所以不能简单说"辛钦在所有方面条件更弱"。
在数三考试中,"辛钦条件更弱"通常特指"辛钦不要求方差存在"。
(3) ✅ 正确。
独立同分布 ✓,期望和方差都存在 ✓
→ 满足林德伯格-莱维中心极限定理的条件
→ (X̄ − μ)/(σ/√n) 近似服从 N(0, 1)
→ 所以 X̄ 近似服从 N(μ, σ²/n)
当 n 足够大时(通常 n ≥ 30),这个近似成立。
混搭4 🎯(二项分布 + CLT + 全流程分析)
某电商平台大促期间,有2000个独立访客。每个访客下单购买的概率为0.3,且各访客之间相互独立。
(1) 用中心极限定理近似计算购买人数在580到620之间的概率。
(2) 已知该平台每单利润为50元,大促期间的固定成本(服务器、推广费等)为30000元。用中心极限定理近似计算该平台在大促期间盈利的概率。
(3) 如果该平台希望盈利概率至少达到99%,在保持每单利润50元和其他条件不变的情况下,固定成本最多不能超过多少元?
📌 对应模板:题型二·子类型④ + 综合应用
点击看答案
(1) 购买人数区间概率
设 Y = 购买人数,Y ~ B(2000, 0.3)
检查条件:np = 2000×0.3 = 600 ≥ 5 ✓
n(1−p) = 2000×0.7 = 1400 ≥ 5 ✓
E(Y) = np = 600
Var(Y) = np(1−p) = 2000×0.3×0.7 = 420
标准差 = √420 ≈ 20.494
P(580 ≤ Y ≤ 620) = P((580−600)/20.494 ≤ Z ≤ (620−600)/20.494)
= P(−0.976 ≤ Z ≤ 0.976)
= Φ(0.976) − Φ(−0.976)
= 2Φ(0.976) − 1
查表:Φ(0.98) ≈ 0.8365,Φ(0.97) ≈ 0.8340
线性插值:Φ(0.976) ≈ 0.8355
所以 P = 2 × 0.8355 − 1 = 0.671
答案(1):约 0.671(即约 67.1%)
(2) 盈利概率
利润 = 50Y − 30000
盈利 ⇔ 50Y − 30000 > 0 ⇔ Y > 600
P(盈利) = P(Y > 600)
= P(Z > (600 − 600) / 20.494)
= P(Z > 0)
= 0.5
答案(2):约 0.5(正好一半的概率)
(3) 反求固定成本上限
设固定成本为 C 元
盈利 ⇔ 50Y − C > 0 ⇔ Y > C/50
要求:P(Y > C/50) ≥ 0.99
即 P(Z > (C/50 − 600) / 20.494) ≥ 0.99
等价于 P(Z ≤ (C/50 − 600) / 20.494) ≤ 0.01
查表:Φ(z) ≤ 0.01 时,z ≤ −2.326
所以 (C/50 − 600) / 20.494 ≤ −2.326
C/50 − 600 ≤ −2.326 × 20.494
C/50 − 600 ≤ −47.67
C/50 ≤ 552.33
C ≤ 27616.5
答案(3):固定成本最多不超过 27616 元
启示:原本固定成本30000元时盈利概率只有50%;
如果把固定成本降到约27616元以下,盈利概率就能达到99%以上。
回马枪 🔙(回顾第2、4章)
检索练习:把前面学的和老知识混在一起,逼大脑主动回忆。
已知随机变量 X 与 Y 的联合分布律为:
| X\Y | 0 | 1 |
|---|---|---|
| 0 | 0.3 | 0.2 |
| 1 | 0.1 | 0.4 |
(1)(回顾第2章)求 E(X)、Var(X)、E(Y)、Var(Y) 和 Cov(X, Y)。
(2)(本章·切比雪夫不等式)设 Z = X + Y,用切比雪夫不等式估计 P(|Z − E(Z)| ≥ 1) 的上界。
(3)(回顾第4章)求 E(Z) 和 Var(Z) 的精确值,与(2)中切比雪夫上界比较,说明切比雪夫不等式的保守性。
📌 对应模板:第2章·期望方差 + 第4章·协方差 + 本章·切比雪夫不等式(跨章检索)
点击看解答
(1) 求期望、方差和协方差
X 的边缘分布:P(X=0)=0.5,P(X=1)=0.5
E(X) = 0×0.5 + 1×0.5 = 0.5
E(X²) = 0²×0.5 + 1²×0.5 = 0.5
Var(X) = 0.5 − 0.5² = 0.25
Y 的边缘分布:P(Y=0)=0.4,P(Y=1)=0.6
E(Y) = 0×0.4 + 1×0.6 = 0.6
E(Y²) = 0²×0.4 + 1²×0.6 = 0.6
Var(Y) = 0.6 − 0.6² = 0.24
E(XY) = 0×0×0.3 + 0×1×0.2 + 1×0×0.1 + 1×1×0.4 = 0.4
Cov(X,Y) = E(XY) − E(X)E(Y) = 0.4 − 0.5×0.6 = 0.4 − 0.3 = 0.1
(2) 切比雪夫不等式
Z = X + Y
E(Z) = E(X) + E(Y) = 0.5 + 0.6 = 1.1
Var(Z) = Var(X) + Var(Y) + 2Cov(X,Y)
= 0.25 + 0.24 + 2×0.1
= 0.69
ε = 1
P(|Z − 1.1| ≥ 1) ≤ Var(Z)/ε² = 0.69/1 = 0.69
答案(2):上界为 0.69
(3) 精确值比较
Z = X+Y 的可能取值:0, 1, 2
P(Z=0) = P(X=0,Y=0) = 0.3
P(Z=1) = P(X=0,Y=1) + P(X=1,Y=0) = 0.2 + 0.1 = 0.3
P(Z=2) = P(X=1,Y=1) = 0.4
E(Z) = 0×0.3 + 1×0.3 + 2×0.4 = 0 + 0.3 + 0.8 = 1.1 ✓
Var(Z) = E(Z²) − [E(Z)]²
E(Z²) = 0²×0.3 + 1²×0.3 + 2²×0.4 = 0 + 0.3 + 1.6 = 1.9
Var(Z) = 1.9 − 1.1² = 1.9 − 1.21 = 0.69 ✓
精确概率:|Z − 1.1| ≥ 1 ⇔ Z ≤ 0.1 或 Z ≥ 2.1
Z 只能取 0,1,2:
· Z=0:|0−1.1| = 1.1 ≥ 1 ✓(偏离1.1,超过门槛)
· Z=1:|1−1.1| = 0.1 < 1 ✗(偏离0.1,不到门槛)
· Z=2:|2−1.1| = 0.9 < 1 ✗(偏离0.9,不到门槛)
P(|Z−1.1| ≥ 1) = P(Z=0) = 0.3
比较:切比雪夫上界 0.69,精确概率 0.3。0.69 ≥ 0.3,不等式成立 ✓。
切比雪夫上界是精确值的约 2.3 倍——保守但并不离谱。
这也体现了切比雪夫不等式的典型表现:给出的是"天花板",实际概率可能远低于天花板。知道分布时精确算得 0.3,不知道分布时切比雪夫至少告诉你"不超过 69%"。
回顾要点:这道题把第2章(期望方差计算)、第4章(协方差与方差展开)、
本章(切比雪夫不等式应用)的知识串联在一起,逼你同时调用多个章节的工具。
回马枪2 🔄(回顾第1章·全概率公式+大数定律)
检索练习:把第1章的全概率公式和本章大数定律串起来。
某工厂有三台机器生产同一种螺丝,产量占比和次品率如下:
| 机器 | 产量占比 | 次品率 |
|---|---|---|
| A | 50% | 1% |
| B | 30% | 2% |
| C | 20% | 3% |
所有螺丝混合堆放,外观无法区分。
(1) (回顾第1章) 随机抽取1个螺丝,它是次品的概率是多少?用全概率公式计算。
(2) (本章·大数定律) 从混合螺丝中每次随机抽取1个,记录是否次品后放回,独立抽取 n 次。当 n → ∞ 时,样本中的次品频率会稳定在哪个值附近?这个结论由哪个大数定律保证?该定律需要哪些条件?本题是否满足?
(3) (思考) 如果把三个机器的螺丝分开存放(不混合),从每台机器各自抽取 n 个螺丝。此时"所有 3n 个螺丝的次品频率"还满足大数定律吗?如果满足,是哪个大数定律?
📌 对应模板:第1章·全概率公式 + 第5章·伯努利/辛钦大数定律(跨章检索)
点击看解答
(1) 全概率公式
设事件 D = "抽到次品"
P(D) = P(D|A)P(A) + P(D|B)P(B) + P(D|C)P(C)
= 0.01×0.5 + 0.02×0.3 + 0.03×0.2
= 0.005 + 0.006 + 0.006
= 0.017
答案(1):1.7%
(2) 大数定律
混合后有放回抽样 → 每次抽到次品的概率恒为 p=0.017
n 次独立抽取 = n 重伯努利试验
由伯努利大数定律:次品频率收敛于 p=0.017
(同时也是辛钦大数定律的特例——每次结果 X_i~B(1, 0.017),独立同分布,期望存在)
条件检查:
· 独立 ✓(有放回抽取)
· 同分布 ✓(每次 B(1, 0.017))
· 期望存在 ✓(E(X_i) = 0.017)
答案(2):稳定在 0.017(即 1.7%),伯努利大数定律(也是辛钦特例)
(3) 分层抽样
从三台机器分别抽取 → 不同机器的次品率不同(1% vs 2% vs 3%)
每个螺丝的分布不同 → 不是同分布!
辛钦大数定律要求同分布 → 不满足
但切比雪夫大数定律不要求同分布!只要:
· 独立 ✓
· 方差一致有界 ✓(二项分布的方差最大为 p(1-p) ≤ 0.25,有上界)
所以切比雪夫大数定律成立:样本均值依概率收敛于期望平均。
期望平均 = (0.01 × n + 0.02 × n + 0.03 × n) / 3n = 0.02 = 2%
答案(3):满足,切比雪夫大数定律。收敛到 2%(三台机器次品率的平均值)
💡 启示:(2)和(3)虽然都是"抽螺丝、看次品率",但因为抽样方式不同
(混合 vs 分层),数据分布不同(同分布 vs 不同分布),
适用的大数定律也不同(辛钦 vs 切比雪夫)。
这是大数定律选择题的经典考点。
回马枪3 🔄(回顾第2章·正态标准化+CLT应用)
检索练习:从单个人的正态标准化,升级到样本均值的CLT标准化——同一套操作,不同对象。
某标准化考试的成绩 X 服从正态分布 N(500, 100²)(均值500分,标准差100分)。
(1) (回顾第2章) 随机抽1名考生,他的成绩在400到600之间的概率是多少?
(2) (回顾第2章) 随机抽1名考生,他的成绩超过700分的概率是多少?用标准化公式写出计算过程。
(3) (本章·中心极限定理) 随机抽取64名考生,他们的平均成绩超过520分的概率是多少?
(4) (对比思考) 比较"(1)中单人在400-600之间"和"(3)中64人平均>520"的概率差异。为什么单个人超过520分很常见(概率约42%),而64人的平均分超过520分却很难(概率约5%)?用标准差 σ/√n 来解释。
📌 对应模板:第2章·正态标准化 + 第5章·中心极限定理(跨章检索)
点击看解答
(1) 单人在400~600之间
标准化:Z = (X − 500) / 100 ~ N(0, 1)
P(400 < X < 600) = P((400−500)/100 < Z < (600−500)/100)
= P(−1 < Z < 1)
= Φ(1) − Φ(−1)
= Φ(1) − (1 − Φ(1))
= 2Φ(1) − 1
= 2 × 0.8413 − 1
= 0.6826
答案(1):约 68.26%(正态分布经典的"68-95-99.7"法则)
(2) 单人超过700分
P(X > 700) = P(Z > (700−500)/100) = P(Z > 2)
= 1 − Φ(2) = 1 − 0.9772 = 0.0228
答案(2):约 2.28%
(3) 64人平均超过520分
样本均值 X̄ 的分布:
E(X̄) = 500
Var(X̄) = σ²/n = 100²/64 = 10000/64 = 156.25
标准差 = √156.25 = 12.5
标准化:Z = (X̄ − 500) / 12.5 ≈ N(0, 1)
P(X̄ > 520) = P(Z > (520−500)/12.5)
= P(Z > 20/12.5)
= P(Z > 1.6)
= 1 − Φ(1.6)
= 1 − 0.9452
= 0.0548
答案(3):约 5.48%
(4) 对比分析
单个人超过520分:P(X > 520) = P(Z > (520−500)/100) = P(Z > 0.2) = 1 − 0.5793 = 0.4207
64人平均超过520分:P(X̄ > 520) = 0.0548(上面算的)
为什么差这么多?
· 单个人的标准差 = 100(个体差异大,520只比500高0.2个标准差,很常见)
· 64人平均的标准差 = 100/√64 = 12.5(平均后差异被"抹平"了,520比500高1.6个标准差,很罕见)
核心直觉:平均就像"和稀泥"——极端个体被平均掉了,平均值比任何一个个体都更靠近中心。
这就是 σ/√n 的魔力——n 越大,平均值越稳定,偏离期望的概率越小。
💡 从第2章到第5章的升级路线:
第2章:X ~ N(μ, σ²) → Z = (X−μ)/σ (标准化一个变量)
第5章:X̄ ≈ N(μ, σ²/n) → Z = (X̄−μ)/(σ/√n) (标准化样本均值)
同一套操作,只是对象从"单个"变成了"平均"。
回马枪4 🔄(回顾第3章·联合分布+依概率收敛)
检索练习:从联合分布表出发,一步步走到大数定律——中间每个工具都是前面章节学过的。
设随机变量 X 和 Y 的联合分布律为:
| X\Y | 0 | 1 |
|---|---|---|
| 0 | 0.1 | 0.3 |
| 1 | 0.4 | 0.2 |
(1) (回顾第3章) 求 X 和 Y 的边缘分布。X 和 Y 是否独立?计算 Cov(X, Y)。
(2) (回顾第3章) 设 Z = X + Y。求 E(Z) 和 Var(Z)。计算 Var(X+Y) 时为什么要加 2Cov(X,Y)?
(3) (本章·依概率收敛) 设 (X₁, Y₁), (X₂, Y₂), ..., (Xₙ, Yₙ) 独立同分布于上面的联合分布。定义 Z_i = X_i + Y_i。当 n → ∞ 时,样本均值 (1/n) ΣZ_i 依概率收敛于哪个数?由哪个定理保证?
📌 对应模板:第3章·联合分布与协方差 + 第5章·依概率收敛/大数定律(跨章检索)
点击看解答
(1) 边缘分布和独立性
X 的边缘分布:
P(X=0) = 0.1 + 0.3 = 0.4
P(X=1) = 0.4 + 0.2 = 0.6
Y 的边缘分布:
P(Y=0) = 0.1 + 0.4 = 0.5
P(Y=1) = 0.3 + 0.2 = 0.5
独立性检查:
P(X=0, Y=0) = 0.1
P(X=0)×P(Y=0) = 0.4×0.5 = 0.2 ≠ 0.1
所以 X 和 Y 不独立。
E(X) = 0×0.4 + 1×0.6 = 0.6
E(Y) = 0×0.5 + 1×0.5 = 0.5
E(XY) = 0×0×0.1 + 0×1×0.3 + 1×0×0.4 + 1×1×0.2 = 0.2
Cov(X,Y) = E(XY) − E(X)E(Y) = 0.2 − 0.6×0.5 = 0.2 − 0.3 = −0.1
答案(1):边缘分布见上,不独立,Cov=−0.1(负相关)
(2) Z = X + Y 的期望和方差
E(Z) = E(X) + E(Y) = 0.6 + 0.5 = 1.1
Var(X) = E(X²) − [E(X)]²
E(X²) = 0²×0.4 + 1²×0.6 = 0.6
Var(X) = 0.6 − 0.6² = 0.6 − 0.36 = 0.24
Var(Y) = E(Y²) − [E(Y)]²
E(Y²) = 0²×0.5 + 1²×0.5 = 0.5
Var(Y) = 0.5 − 0.5² = 0.5 − 0.25 = 0.25
Var(Z) = Var(X+Y) = Var(X) + Var(Y) + 2Cov(X,Y)
= 0.24 + 0.25 + 2×(−0.1)
= 0.49 − 0.20
= 0.29
为什么加 2Cov?因为方差展开:
Var(X+Y) = E[(X+Y−μ_X−μ_Y)²]
= E[(X−μ_X)² + (Y−μ_Y)² + 2(X−μ_X)(Y−μ_Y)]
= Var(X) + Var(Y) + 2Cov(X,Y)
如果 X,Y 独立(Cov=0),交叉项消失;不独立时,必须加协方差项。
答案(2):E(Z)=1.1,Var(Z)=0.29
(3) 依概率收敛
Z_i = X_i + Y_i 独立同分布(因为 (X_i,Y_i) 独立同分布)
E(Z_i) = 1.1(由(2)),期望存在
由辛钦大数定律:独立同分布 + 期望存在
→ (1/n)ΣZ_i 依概率收敛于 E(Z_i) = 1.1
即:(1/n) ΣZ_i →^P 1.1
答案(3):依概率收敛于 1.1,辛钦大数定律保证
💡 从联合分布表出发,走了第3章(边缘分布、独立性、协方差)→
第4章(期望方差性质、Var(X+Y)展开)→ 第5章(依概率收敛、大数定律)。
每一步都依赖前一步的结果——E(Z)算不对,收敛的值就搞错了。
这就是概率论"工具链"的威力。
回马枪5 🔄(回顾第4章·期望方差性质+切比雪夫不等式)
检索练习:先调用第4章的性质算出期望和方差,再喂给第5章的切比雪夫不等式。
设随机变量 X 的期望 E(X) = 5,方差 Var(X) = 4。定义 Y = 2X − 3。
(1) (回顾第4章) 求 E(Y) 和 Var(Y)。每一步用到了期望和方差的什么运算性质?如果 X 的分布未知,这些性质还成立吗?
(2) (本章·切比雪夫不等式) 用切比雪夫不等式估计 P(|Y − E(Y)| ≥ 8) 的上界。
(3) (对比精确值) 若已知 X ~ N(5, 4)(从而 Y 也服从正态分布),求 P(|Y − E(Y)| ≥ 8) 的精确值。比较切比雪夫上界和精确值,说明切比雪夫不等式"保守"到什么程度。
📌 对应模板:第4章·期望与方差运算性质 + 第5章·切比雪夫不等式(跨章检索)
点击看解答
(1) E(Y) 和 Var(Y)
E(Y) = E(2X − 3)
= 2E(X) − 3 (用到:E(aX+b) = aE(X)+b,线性性质)
= 2×5 − 3
= 7
Var(Y) = Var(2X − 3)
= 2² Var(X) (用到:Var(aX+b) = a²Var(X),常数平移不影响方差)
= 4 × 4
= 16
这些性质不需要知道 X 的具体分布——只要期望和方差存在,
线性性质和方差平移不变性恒成立。这正是切比雪夫不等式的
前置条件:只需要 μ 和 σ²,不管分布。
答案(1):E(Y)=7,Var(Y)=16,标准差=4
(2) 切比雪夫不等式
μ_Y = E(Y) = 7,σ²_Y = Var(Y) = 16
ε = 8(偏离超过8)
P(|Y − 7| ≥ 8) ≤ σ²_Y / ε² = 16 / 64 = 0.25
答案(2):上界为 0.25
(3) 正态分布精确值
X ~ N(5, 4) → Y = 2X−3 ~ N(2×5−3, 2²×4) = N(7, 16)
(正态分布的线性变换仍为正态分布)
标准差 = √16 = 4
P(|Y − 7| ≥ 8) = P(|Z| ≥ 8/4) = P(|Z| ≥ 2)
= 2 × (1 − Φ(2))
= 2 × (1 − 0.9772)
= 2 × 0.0228
= 0.0456
比较:
· 切比雪夫上界:0.25
· 精确值:0.0456
· 切比雪夫上界是精确值的约 5.5 倍——非常保守!
但注意:切比雪夫在"完全没有分布信息"时给出 0.25 这个上界,
而精确值 0.0456 需要知道 X 是正态分布才能算。
切比雪夫用"信息少"换来了"结论弱"——这是它的本质。
💡 第4章→第5章的工具链:
第4章给你期望和方差的性质 → 算出 μ 和 σ²
第5章的切比雪夫不等式 → 用 μ 和 σ² 给概率画"天花板"
回马枪6 🔄(回顾第4章·协方差+大数定律)
检索练习:当随机变量之间不独立(有相关性)时,大数定律还成立吗?协方差是关键。
设随机变量序列 X₁, X₂, ..., Xₙ, ... 满足:
- 每个 X_i 的期望为 μ,方差为 σ²
- 相邻两项之间有协方差:Cov(X_i, X_{i+1}) = γ(γ 是某个常数)
- 不相邻的(|i − j| > 1)相互独立,协方差为 0
(1) (回顾第4章) n 个变量中有多少对"相邻的"?写出总和 S_n = X₁ + ... + Xₙ 的方差 Var(S_n),用 σ²、γ 和 n 表示。
(2) (回顾第4章) 求样本均值 X̄_n = S_n / n 的方差 Var(X̄_n)。当 n → ∞ 时,Var(X̄_n) 是否趋近于 0?
(3) (本章·大数定律) 样本均值 X̄_n 是否依概率收敛于 μ?为什么?这个结果和独立同分布情形有什么异同?
📌 对应模板:第4章·协方差与和的方差 + 第5章·大数定律(跨章检索)
点击看解答
(1) Var(S_n)
n 个变量中,相邻对有 (n−1) 对:
(X₁,X₂), (X₂,X₃), ..., (X_{n−1},X_n)
每对相邻的协方差 = γ,不相邻的协方差 = 0
Var(S_n) = ΣVar(X_i) + 2 Σ_{i<j} Cov(X_i, X_j)
第一项 ΣVar(X_i) = nσ²(n 个 σ² 相加)
第二项:只有相邻对贡献协方差,共 (n−1) 对,每对贡献 2γ
所以 2 Σ Cov = 2 × (n−1) × γ = 2(n−1)γ
Var(S_n) = nσ² + 2(n−1)γ
答案(1):Var(S_n) = nσ² + 2(n−1)γ
(2) Var(X̄_n)
X̄_n = S_n / n
Var(X̄_n) = Var(S_n) / n² = [nσ² + 2(n−1)γ] / n²
= σ²/n + 2γ(n−1)/n²
= σ²/n + 2γ/n − 2γ/n²
当 n → ∞ 时:
· σ²/n → 0
· 2γ/n → 0
· 2γ/n² → 0
所以 Var(X̄_n) → 0 ✓
答案(2):Var(X̄_n) = σ²/n + 2γ(n−1)/n² → 0(n→∞时)
(3) 依概率收敛
Var(X̄_n) → 0 意味着:由切比雪夫不等式,
P(|X̄_n − μ| ≥ ε) ≤ Var(X̄_n)/ε² → 0
所以 P(|X̄_n − μ| < ε) → 1
即 X̄_n 依概率收敛于 μ ✓
大数定律仍然成立!
与独立同分布情形的比较:
· 独立时:Var(X̄_n) = σ²/n(只有一项)
· 有相邻相关时:Var(X̄_n) ≈ (σ²+2γ)/n(多了 2γ/n)
· 但都是 O(1/n) → 都趋于 0,所以大数定律都成立!
为什么相关没"破坏"大数定律?因为协方差的总量是 O(n),
除以 n² 后变成 O(1/n),仍然趋于 0。
只要相关"不要太强"(比如所有变量两两高度相关),
大数定律就还能工作。
💡 反过来想:如果所有 X_i 都完全相等(相关系数=1),
那 Cov(X_i,X_j)=σ² 对每对都成立,
Var(S_n) = nσ² + n(n−1)σ² ≈ n²σ²,
Var(X̄_n) ≈ σ²(不随 n 减小!)→ 大数定律失效。
这就是"相关太强会破坏大数定律"的直观理解。
答案(3):收敛,因为 Var(X̄_n)→0。与独立情形类似,只要协方差不堆积得太快。
🎯 考试导航
| 题型 | 考频 | 常见出题形式 | 核心方法 | 易错点 |
|---|---|---|---|---|
| 切比雪夫不等式 | ⭐⭐ | 选择或大题第一问 | P(|X−μ|≥ε) ≤ σ²/ε² | ε是半个区间宽;概率不能超[0,1] |
| 中心极限定理·总和概率 | ⭐⭐⭐ | 大题 | Z=(Y−nμ)/(√n σ)→查表 | 标准化时分母是√n σ不是nσ |
| CLT·均值概率 | ⭐⭐⭐ | 大题 | Z=(X̄−μ)/(σ/√n)→查表 | Var(X̄)=σ²/n,标准差=σ/√n |
| CLT·二项近似 | ⭐⭐⭐ | 大题或选择 | Z=(Y−np)/√(npq)→查表 | np≥5且n(1−p)≥5才可近似 |
| 大数定律判断 | ⭐⭐ | 选择题 | 对照三定律条件表 | 辛钦不要方差!切比雪夫不要同分布! |
常用标准正态分布表值(必记):
| z | Φ(z) | 含义 |
|---|---|---|
| 0 | 0.5000 | 中位数 |
| 1.0 | 0.8413 | 84%分位点 |
| 1.645 | 0.9500 | 单侧95%分位点 |
| 1.96 | 0.9750 | 双侧95%分位点(置信区间用) |
| 2.0 | 0.9772 | 97.7%分位点 |
| 2.576 | 0.9950 | 双侧99%分位点 |
三种大数定律条件速查:
伯努利:n重伯努利试验(独立、同分布0-1、期望p)
辛钦: 独立 + 同分布 + 期望存在(不需要方差!)
切比雪夫:独立 + 方差一致有界(不需要同分布!)
🧪 学完自测(4选择 + 2判断 + 4简答)
混搭全章知识点。先独立做,再点开答案核对。每道题都标注了考察的知识点。
选择题(4道)
第1题(切比雪夫不等式·概念理解)
关于切比雪夫不等式,以下说法正确的是:
A. 它给出了"偏离期望超过ε"的概率精确值
B. 不论随机变量的分布是什么,只要期望和方差存在就能用
C. 必须知道随机变量的具体分布类型才能使用
D. 当ε取很小值时,不等式给出的估计最精确
点击看答案
B。
- A错:切比雪夫不等式给的是上界(保守估计),不是精确值。
- B对:这是它最大的价值——"不知道分布时的最后一道防线"。
- C错:恰恰相反,不需要知道分布。
- D错:ε越小,上界 σ²/ε² 越大,当 ε≤σ 时上界≥1,完全失去价值。
第2题(大数定律·条件辨析)
以下哪个条件组合能保证辛钦大数定律一定成立?
A. 独立 + 同分布
B. 独立 + 同分布 + 期望存在
C. 独立 + 同分布 + 方差存在
D. 独立 + 方差一致有界
点击看答案
B。
辛钦大数定律的三个条件:①独立 ②同分布 ③期望存在。
- A缺少"期望存在"——比如柯西分布就独立同分布但期望不存在,大数定律失效。
- C的"方差存在"比"期望存在"更强(方差存在自动保证期望存在),所以C也满足辛钦条件,但B才是"最精确"的描述——辛钦只需要期望存在,不强制要求方差存在。
- D是切比雪夫大数定律的条件(不需要同分布!)。
第3题(中心极限定理·标准化)
中心极限定理标准化时分母是 √n σ 而不是 nσ,根本原因是:
A. 为了凑出标准正态分布 N(0,1)
B. 总和 Y=ΣX_i 的方差是 nσ²,标准差是 √n σ
C. nσ 计算起来太复杂
D. 这是数学家的习惯约定
点击看答案
B。
总和 Y 的方差 = n 个独立变量的方差之和 = nσ²。标准差是方差的平方根 = √(nσ²) = √n σ。这是一个数学事实,不是约定或习惯。A虽然结果是对的(标准化后确实趋近 N(0,1)),但不是"为什么会这样"的根本原因。
第4题(二项分布正态近似·适用条件)
用棣莫弗-拉普拉斯定理将二项分布近似为正态分布时,通常要求:
A. n ≥ 30 即可,不需要其他条件
B. np ≥ 5 且 n(1−p) ≥ 5
C. p = 0.5 且 n ≥ 50
D. 仅要求每次试验独立
点击看答案
B。
二项分布正态近似的经验条件是 np ≥ 5 且 n(1−p) ≥ 5。如果 p 非常接近0或1(比如 p=0.01),即使 n 很大,np 也可能很小,此时正态近似不准确。A忽略了 p 的影响,C条件太强(不需要 p=0.5 也能用),D缺少关键的量级条件。
判断题(2道)
第5题(大数定律·条件辨析)
切比雪夫大数定律要求随机变量序列同分布。( )
点击看答案
错误。切比雪夫大数定律不要求同分布——这正是它和辛钦大数定律的核心区别之一。切比雪夫只要求:①相互独立 ②方差一致有界。各随机变量可以来自完全不同的分布,只要方差都"被控制住"。反过来,辛钦要求同分布但不要求方差有界。
第6题(依概率收敛·概念辨析)
依概率收敛意味着当 n 足够大时,随机变量一定等于目标常数。( )
点击看答案
错误。依概率收敛 ≠ 确定等于。依概率收敛说的是"偏离很多"这件事的概率趋近于零,不是"偏离"本身等于零。总存在很小的可能性(虽然趋近于零),随机变量会大幅偏离目标值。就像投篮——练了100天还是可能某天手感极差。这是依概率收敛和微积分极限的本质区别。
简答题(4道)
第7题(依概率收敛·概念理解)
用自己的话解释"依概率收敛"和微积分中"极限"的本质区别。举一个生活中的例子来说明。
点击看答案
本质区别:微积分极限是确定性的——数列 aₙ=1/n,当 n→∞ 时,aₙ 确定地等于0。依概率收敛是随机性的——随机变量 Xₙ 还是随机的,只是"大幅偏离"的概率趋近于零。
生活例子:微积分极限像你每天把离墙的距离精确减半(第一天1米→第二天0.5米→第三天0.25米),确定地逼近零。依概率收敛像你每天随机往前走(有时多有时少),走很多天后大概率离墙很近,但不排除某天倒退了几步。
第8题(大数定律·条件对比)
三个大数定律(伯努利、辛钦、切比雪夫)的条件分别是什么?为什么说辛钦在实际中最常用?
点击看答案
条件对比:
- 伯努利:n重伯努利试验(独立、0-1分布、p存在)
- 辛钦:独立 + 同分布 + 期望存在(不需要方差!)
- 切比雪夫:独立 + 方差一致有界(不需要同分布!)
辛钦最常用的原因:在绝大多数实际场景中,我们从一个固定总体反复抽样,样本自然独立同分布。辛钦只要求期望存在(不需要方差),条件最贴合实际。相比之下,伯努利只适用于0-1分布太局限,切比雪夫要求方差有界有时不满足。
第9题(中心极限定理·核心理解)
什么是中心极限定理的"标准化"操作?如果题目问的是样本均值 X̄ 而不是总和 ΣX_i,标准化公式应该怎么写?
点击看答案
标准化:把任何正态近似问题统一转化为查标准正态 N(0,1) 表。公式为 Z = (总和 − nμ) / (√n σ)。
样本均值的标准化:
- X̄ 的期望 = μ,方差 = σ²/n,标准差 = σ/√n
- 标准化公式:Z = (X̄ − μ) / (σ/√n) ≈ N(0,1)
两种方法等价,但直接用 X̄ 的公式更直接——不需要先算总和再除以 n。
第10题(全章·框架理解)
大数定律和中心极限定理分别回答什么问题?它们合在一起构成了什么理论的基础?
点击看答案
- 大数定律回答"稳定性"问题:大量重复后,结果稳定在什么值?(答案是期望)
- 中心极限定理回答"分布形态"问题:大量因素叠加后,波动的分布长什么样?(答案是正态)
两者合在一起构成统计推断的理论基础:
- 大数定律保证"用样本均值估计总体均值"这件事在大量重复后是靠谱的
- 中心极限定理告诉我们在"估计"过程中,误差的分布规律——从而可以算置信区间、做假设检验
通俗说:大数定律让统计有"准头",中心极限定理让统计有"尺子"。
📊 全章推导链关系图
切比雪夫不等式 P(|X-μ|≥ε)≤σ²/ε²
│
├──→ 伯努利大数定律 ──→ 依概率收敛
│ │
│ ├── 条件:n重伯努利试验(独立+0-1分布)
│ └── 结论:频率依概率收敛于概率
│
├──→ 辛钦大数定律(独立同分布+期望存在)
│ │
│ ├── 条件:独立同分布+期望存在(不需要方差!)
│ ├── 结论:样本均值依概率收敛于期望
│ └── 伯努利是辛钦在0-1分布上的特例
│
└──→ 切比雪夫大数定律(独立+方差一致有界)
│
├── 条件:独立+方差一致有界(不需要同分布!)
└── 结论:样本均值依概率收敛于期望平均
═══════ 三种LLN对比 ═══════
伯努利 ⊂ 辛钦(特例关系)
辛钦 vs 切比雪夫(交叉关系:辛钦不要求方差有界,切比雪夫不要求同分布)
中心极限定理(林德伯格-莱维)
│
├── 条件:独立同分布+期望和方差存在
├── 结论:(ΣX_i−nμ)/(√n σ) 依分布收敛于 N(0,1)
│
└──→ 棣莫弗-拉普拉斯CLT(伯努利特例)
│
├── 条件:Y~B(n,p),np≥5且n(1−p)≥5
└── 结论:(Y−np)/√(np(1−p)) ≈ N(0,1)
═══════ LLN与CLT互补关系 ═══════
大数定律 = "样本均值趋于期望" → 给方向(往哪儿走)
中心极限定理 = "均值的波动≈正态分布" → 给精度(走多准)
LLN让统计有"准头",CLT让统计有"尺子"
合在一起 → 第7章参数估计(点估计+区间估计+假设检验)
🔗 章末过渡
本章讲完了。你现在手里有了两件武器:
大数定律告诉你"大量重复后结果稳定在哪儿"——不管单个结果多么随机,只要试的次数够多,平均值一定会稳在期望附近。这给了统计推断"底气":用样本推断总体,这件事在理论上是靠谱的。
中心极限定理告诉你"波动的分布长什么样"——大量独立因素叠加后,不管每个因素各自是什么形状,总和一定接近钟形曲线。这给了统计推断"工具":有了正态分布这张表,就能算出"估计误差超过某个值"的概率。
下一章(第6章)要走进"数理统计"——用本章的两件武器,从样本数据反推总体真相。
你会发现:
- 大数定律的"样本均值稳定在期望附近" → 在第7章变成了"点估计"的理论依据
- 中心极限定理的"标准化后近似正态" → 在第7章变成了"区间估计"和"假设检验"的核心引擎
第5章是概率论的终点,也是统计学的起点。你站在分界线上——往前是描述随机现象,往后是用随机现象做决策。翻过这一页,你就不再只是"算概率",而是开始"用概率做判断"。
💡 思考题:大数定律用的是"依概率收敛"而不是普通极限。如果大数定律用普通极限来描述,会出什么问题?(提示:想想样本均值本身是随机的还是确定的?如果每次抽样得到不同的样本均值,它们能"确定地等于"同一个期望值吗?)