📖 概率论

# 第7章 参数估计

🔔 课前激活(花30秒想想再往下读)

你在食堂打了一碗汤,想知道整锅汤咸不咸——你不可能把整锅喝光,只能舀一勺尝尝,然后推断整锅的咸淡。这就是"估计":用一小部分(样本)去推断整体(总体)。

参数估计更进一步:你不仅想知道"这锅汤大概是什么味",还想知道"这锅汤的咸度误差范围有多大"。比如你说"这锅汤的含盐量大约在0.3%到0.5%之间,我有95%的把握"——这就从"点估计"(一个数)到了"区间估计"(一个范围)。

带着这个问题往下读:如果我只称了10个包子就推断整笼包子的平均重量,我的推断到底有多可靠?

📌 学完这章你能回答:

  • "矩估计"和"极大似然估计"到底有什么区别?什么时候用哪个?
  • 为什么有时候样本方差要除以 n-1 而不是 n?
  • 如果我说"有95%的把握,平均寿命在1500到1600小时之间"——这句话到底是什么意思?
  • 总体方差已知和未知时,算置信区间的公式为什么不一样?
  • 为什么均匀分布的极大似然估计不能用求导法?那该怎么算?

本章考什么

考纲要求:参数估计是考研数学三概率论中每年必考的一道大题(11分),通常包含矩估计和极大似然估计两个方法,有时还会结合无偏性验证或区间估计。

题型 考频 难度
矩估计——一个参数 ⭐⭐⭐ ★★
矩估计——两个参数 ⭐⭐ ★★★
极大似然估计——离散型 ⭐⭐⭐ ★★★
极大似然估计——连续型 ⭐⭐⭐ ★★★
估计量无偏性验证 ⭐⭐ ★★
估计量有效性比较 ⭐ ★★
正态均值区间估计(σ²已知) ⭐⭐ ★★
正态均值区间估计(σ²未知) ⭐⭐ ★★
正态方差区间估计 ⭐ ★★

① 核心知识

1.1 为什么要参数估计?

先想一个困境:整笼包子有多重?

你开了一家包子铺,想知道今天整批包子的平均重量。难在哪?——你不可能把几百个包子都称一遍(太多了,客人还等着吃)。可你手里只有一笼,一共 10 个包子。

🧠 先想:如果只能称 10 个包子,你能给老板一个"整批大概多重"的说法吗?你称出来这 10 个平均 48 克——那你愿不愿意说"整批就是 48 克"?还是说"整批大概在 46~50 克之间"更稳妥?

这两种说法,就是本章两大主角的雏形:点估计(猜一个数:48 克)和区间估计(给一个范围:46~50 克)。这个"用一小部分(样本)去推断整体(总体)"的过程,就是参数估计。

生活比喻:你去一家包子铺,想知道今天整批包子的平均重量。你不可能把所有包子都称一遍(太多了),于是随机拿了10个包子称了一下,平均是48克。你根据这10个包子,推断整批包子的平均重量大约在46~50克之间——这就是"参数估计"。

这里面有几个关键概念:

正式定义:参数估计是统计推断的核心内容之一。我们研究的总体分布类型已知(比如知道总体服从正态分布),但分布中的某些参数未知(比如均值 μ 和方差 σ²)。参数估计的任务就是:根据从总体中抽取的样本,构造合适的统计量,去估计总体分布中的未知参数。

参数估计分为两大类:

✍️ 立刻练一道(先别翻答案,试着用大白话说):一箱矿泉水标称每瓶 550 毫升,你随手抽查了 12 瓶,平均实测 548.5 毫升。请问:
(1) "548.5 毫升"属于点估计还是区间估计?
(2) "整箱的平均大约在 547~550 毫升之间"呢?
(3) 这里"未知参数"指什么?

点开看答案

(1) 点估计——给了一个具体数字。 (2) 区间估计——给了一个范围。 (3) 未知参数是"整箱 550 瓶的真实平均毫升数"——你永远没法把所有 550 瓶都测一遍,只能靠这 12 瓶去推断它。这正是"参数估计"四个字的含义:参数(真实平均)估计(用样本猜它)。


1.2 点估计的基本概念

先想一个困境:白菜到底多少钱一斤?

你想知道今天白菜的"市场价"——但这又是一个看不见摸不着的"总体特征"。你问了 5 个摊位的报价:2.0、2.2、1.9、2.1、2.0 元/斤,算了个平均 2.04 元。

🧠 先想:现在你说"今天白菜大概 2.04 元一斤"——这个 2.04 是从哪来的?它就是一个点估计:用一个具体数字去猜那个未知的真实价格。

生活比喻:你去菜市场买菜,想知道今天白菜的"市场价"。你问了5个摊位,价格分别是2.0、2.2、1.9、2.1、2.0元/斤。你算了一下平均价是2.04元,就认为今天白菜大概是2.04元一斤。这里"2.04元"就是一个点估计——用一个具体数字来估计那个未知的真实价格。

正式定义:设总体 X 的分布函数为 F(x; θ),其中 θ 是未知参数。从总体中抽取样本 X₁, X₂, ..., Xₙ,构造一个统计量 θ̂ = θ̂(X₁, ..., Xₙ) 作为 θ 的估计量,这个统计量就称为 θ 的点估计量,简称估计量。

需要区分两个容易混淆的概念:

考研中常考的两种构造点估计的方法:矩估计法和极大似然估计法。这两种方法可能会给出相同的结果(比如估计正态分布的均值),也可能给出不同的结果(比如估计均匀分布的参数)。

✍️ 立刻练一道:判断下面说法是"估计量"还是"估计值"——
(1) 你造出一个公式"平均价 = 5 个价格加起来除以 5",这个公式叫什么?
(2) 你把 5 个数字代进去,算出 2.04,这个算出来的数叫什么?

点开看答案

(1) 估计量——它还是带"未知"的式子(还没代入数据),本身是个随机变量;公式写在答题纸上就是它。 (2) 估计值——代入具体观测数据后得到的那个数(2.04),是具体的数字。口诀:公式=估计量,算出来的数=估计值。


1.3 矩估计——"照猫画虎"的智慧

① 生活场景

🛒 你开了一家包子铺,想知道今天整批包子的平均重量。全部称一遍太费劲了,你随机拿了 30 个称,平均 48 克。然后你心想:"这 30 个的平均是 48 克,整批应该也差不多是 48 克吧。"

更进一步——你还想知道包子重量的"波动大不大"(方差)。你又想:"这 30 个的重量波动,应该也能代表整批的波动。"

这就是矩估计的直觉:随机抽出来的样本,它的各种"平均特征"应该和总体的对应特征差不多。 你不用知道包子重量服从什么分布——你只需要知道"总体的平均数"和"参数"之间的关系(比如均匀分布的均值 = 区间中点),然后拿样本算出来的平均数去反推参数。

大白话:矩估计就像"照猫画虎"——你看到猫长什么样(样本),就照着画老虎(推断总体)。不需要知道老虎的完整基因图谱(分布函数),只需要知道"猫和老虎都有四条腿"这种粗略特征就够了。

② 一个必须卡住你的题目:均匀分布的 θ 到底是多少?

先看这道题——看到这题,先别慌,试着做一下,卡住了正好:

题目:总体 X ~ U(0, θ),密度 f(x) = 1/θ(0 < x < θ),θ > 0 未知。你抽了 5 个样本:3, 7, 2, 9, 4。用矩估计求 θ̂。

难在哪? 你不知道 θ 是多少,只知道数据"均匀地分布在 0 到 θ 之间"。手里唯一的工具是样本——你算得出 x̄ = 5。可"算得出平均值"和"θ 是多少"之间,隔着一层:平均值跟 θ 有什么关系?

🧠 这一步在想什么:既然我不知道 θ,我就先问一个第4章就学过的问题——"总体均值 E(X) 用 θ 怎么表达?" 均匀分布 U(0,θ) 的均值是区间正中点:E(X) = θ/2。这一步一写完,θ 就"浮出水面"了——因为它藏进了 E(X) 里。

然后呢? 矩估计的灵魂只有一句话:样本算出来的平均数 ≈ 总体真正的平均数。样本均值 X̄ 我算得出,总体均值 E(X) = θ/2 我也能写出来,那就画等号:

$$X̄ = θ/2 \quad ⇒ \quad θ̂ = 2X̄$$

抽了 5 个样本:3, 7, 2, 9, 4,则 x̄ = 5,θ̂ = 10。矩估计说"数据范围大概从 0 到 10"。

🔍 回头看看我们做了什么:我们其实只做了三件事——① 用未知参数写出总体均值 E(X);② 令"样本均值 = 总体均值";③ 解方程把参数倒出来。这就是矩估计的全部套路:一个参数一个方程就够。就像初中解方程——"样本均值 = 总体均值"是一条线索,总体均值又可以用未知参数表达,两者画等号,参数就暴露了。

③ 正式陈述

设总体 X 有 k 个未知参数 θ₁, ..., θₖ。矩估计的操作核心就一句话:有几个未知参数,就列几个"样本矩 = 总体矩"的方程,然后解出参数。

矩估计的最大优点是不需要知道总体的完整分布——只要知道总体矩和参数之间的关系就够了。缺点是只用到了样本的部分信息(矩),不如极大似然估计精确。

④ 完整推导

🧠 第1步:认识"矩"——别被名字唬住

"矩"听着吓人,其实就是各种形式的"平均值"。就像"碳水化合物"听着高大上,其实就是淀粉和糖。

先把这些"矩"分清楚。下面这张表帮你一目了然:

总体(你永远不知道真值) 样本(你能算出来的)
原点矩(从 0 开始算) 一阶:E(X) — 平均数 一阶:X̄ = (1/n)∑Xᵢ
二阶:E(X²) — 平方的平均数 二阶:(1/n)∑Xᵢ²
中心矩(从均值开始算) 二阶:D(X) = E[(X-EX)²] — 方差 二阶:S² = [1/(n-1)]∑(Xᵢ-X̄)²

记忆口诀:"原点从零起,中心从均值起;总体是理想,样本是现实。"

大白话:总体是你永远摸不到真面目的"理想国",样本是你手里实实在在能算出来的"现实"。矩估计做的事就是拿"现实"去猜"理想"——你觉得现实的样子应该和理想差不多。

🛑 停一下:矩就是各种平均数,先记住上面的表格分清楚"总体 vs 样本"、"原点 vs 中心"。后面做题时用多了自然熟,不用死背。

🧠 第2步:建立方程——"样本矩 = 总体矩"

这一步在第②步的题目里已经走过一遍:令样本矩等于总体矩,然后解出未知参数。

有几个未知参数,就需要几个方程。一个未知数一个方程,两个未知数两个方程——和初中解方程组道理一样。如果只有一个方程却有两个未知数,那就有无穷多组解,没法确定唯一答案。

🧠 第3步:回到刚才那题,看一眼"矩估计会翻车"的一面

刚在②里我们用矩估计做出 U(0,θ) 的 θ̂ = 2X̄。现在专门看看这个方法什么时候会出洋相——记住这个"缺陷",是你将来判断"该不该用矩估计"的重要线索:

矩估计的一个缺陷:θ̂ = 2X̄ 可能很荒谬。比如抽了 5 个样本:1, 1, 1, 1, 100,则 x̄ = 20.8,θ̂ = 41.6——但最大样本已经是 100 了!θ̂ = 41.6 连最大样本都包不住,显然有问题。而同一题用 MLE 做,结果是 θ̂ = max(Xᵢ) = 100,至少保证了所有样本都在 (0, θ̂) 内。

这引出了矩估计和 MLE 的根本差别:矩估计只用了样本的部分信息(矩),忽略了很多其他信息(比如最大值);MLE 利用了样本的全部信息(通过完整的密度函数)。所以 MLE 通常更精确,但需要知道总体的完整分布。

🧠 第4步:两个参数的情况(快速扩充)

如果有两个未知参数,就需要两个方程。通常用一阶矩和二阶原点矩联立:

  1. 第一个方程:X̄ = E(X)(一阶原点矩)
  2. 第二个方程:(1/n)∑Xᵢ² = E(X²)(二阶原点矩)

实用技巧:用 E(X²) = D(X) + [E(X)]² 来算二阶原点矩——很多分布给的是 D(X) 而不是 E(X²)。

大白话:两个未知数就要两个方程,就像二元一次方程组。为什么用原点矩而不用中心矩(方差)?因为原点矩写出来的方程形式更简单——E(X²) 可以直接用参数表达,而方差 D(X) 的表达式里往往混着 E(X),写方程时多绕一步。

快速示例——正态分布 N(μ, σ²):

⑤ 📝 复盘:矩估计的套路永远三步走

不论一个参数还是两个参数,矩估计永远是这三板斧:

步骤 操作 关键词
1 写出总体矩 E(X)、E(X²)... 用未知参数表达 查公式表(章末附录有常用分布速查)
2 令样本矩 = 总体矩 有几个参数就列几个方程
3 解方程,得出参数的表达式 中学代数,不要怕

矩估计 vs MLE 一句话总结:

矩估计 MLE
需要什么 只需要知道总体矩与参数的关系 需要完整的密度函数/分布律
怎么想 "样本长啥样,总体就长啥样"(照猫画虎) "参数取啥值最像能产生这组数据"(选最合理的)
操作难度 简单——列方程、解方程 较复杂——写似然、取对数、求导
精度 粗糙(只用部分信息) 更精确(用全部信息)
什么时候不能用 MLE — 似然函数单调时求导法失效(如 U(0,θ))

⑥ ⚠️ 易错边界

⚠️ 易错1:矩估计的分母是 n,不是 n-1!

矩估计的原理是用样本矩代替总体矩。总体矩的定义是 (1/n)∑,所以样本矩跟着用 n。n-1 只出现在样本方差 S² 中(为了无偏性修正)。矩估计一律用 n。

口诀:矩估计 = 除以 n(照搬总体矩定义);讨论无偏性时样本方差 = 除以 n-1(修正偏差)。

⚠️ 易错2:E(X²) ≠ D(X)!

E(X²) 是二阶原点矩(平方的平均),D(X) 是二阶中心矩(方差)。关系是 E(X²) = D(X) + [E(X)]²。很多人漏掉 [E(X)]² 这一项,直接写 E(X²) = D(X)——大错特错。

⚠️ 易错3:方程数量要对,不能多也不能少

有几个未知参数就需要几个方程。一个参数只需 X̄ = E(X);两个参数需要 X̄ = E(X) 加上 (1/n)∑Xᵢ² = E(X²)。多了方程矛盾(无解),少了方程无穷多解。

⚠️ 易错4:矩估计不一定唯一

有时候用一阶原点矩和用一阶中心矩会得到不同的估计量。考研通常指定用"一阶、二阶原点矩",按题目要求来。

⑦ 在整条链中的位置

第4章 数字特征                矩估计(本节)
  E(X)、D(X)、E(X²)      ←──  用样本矩代替总体矩
  的各种计算公式               解出未知参数
                                    ↓
                              与 MLE 对比(1.6 节)
                              评价估计量好坏(1.11 节)

矩估计是统计推断的第一种武器。它需要的原料是"总体矩与参数的函数关系"——这些关系在第4章数字特征中已经全部学过了(E(X)、D(X)、E(X²) 的公式)。矩估计做的事就是把这些公式倒过来用:以前是"已知 θ → 算 E(X)",现在是"已知样本算出的 X̄ → 反推 θ"。

和 MLE 的关系:矩估计是"粗估",MLE 是"精估"。有些分布中两者结果相同(如正态均值),有些则截然不同(如均匀分布 U(0,θ))。后面 1.6 节讲完 MLE 后,1.10 节会专门对比两者的异同。

✍️ 立刻练一道(把刚悟出的三步走直接使一遍):

设总体 X 服从指数分布,密度 f(x; λ) = λe^{-λx},已知 E(X) = 1/λ。你抽了 4 个样本:1.5, 2.3, 0.7, 3.1,用矩估计求 λ̂。

提示:套刚才的三步——① 写出总体均值 E(X)(用 λ 表达);② 令 X̄ = E(X);③ 解出 λ̂。

点开看答案

① E(X) = 1/λ。② x̄ = (1.5+2.3+0.7+3.1)/4 = 7.6/4 = 1.9,令 1.9 = 1/λ。③ λ̂ = 1/1.9 ≈ 0.526。三步走,和刚才均匀分布那题一模一样——只是把"E(X) = θ/2"换成了"E(X) = 1/λ"。你已经掌握了矩估计的核心操作。


1.4 矩估计——一个参数(快速操作卡)

先回顾一下:1.3 节你已经亲手做过均匀分布和指数分布两个矩估计了。把它们摆在一起看,你会发现套路完全一样——这不就是一张可以反复用的"操作卡"吗?

🔍 回头看看:上一节的题目和刚才的立刻练一道,都只做了一件事——写 E(X) → 令 X̄ = E(X) → 解出参数。把这条反复成功的路子提炼成一张卡,就是本节:

卡(一个参数):

  1. 写出总体均值:E(X),用未知参数 θ 表达
  2. 建立方程:令 X̄ = E(X)
  3. 解出参数:θ̂ = 用 X̄ 表达的式子

举例:总体 X ~ Exp(λ),密度 f(x; λ) = λe^{-λx},已知 E(X) = 1/λ。令 X̄ = 1/λ → λ̂ = 1/X̄。

📌 卡上每个"看到什么→做什么",都能在 1.3 节找到出处:看到"求一个参数的矩估计"→ 只列一个方程(1.3 ②"一个参数一个方程就够");看到 E(X) 里藏着参数 → 写成"样本均值=总体均值"(1.3 ③);最后解方程(1.3 ③)。

🛑 停一下:抽了 4 个样本:1.5, 2.3, 0.7, 3.1,求 λ 的矩估计值。(答案:x̄ = 1.9,λ̂ = 1/1.9 ≈ 0.526。你已经掌握了矩估计的核心操作。)——等等,这题刚才在"立刻练一道"里已经亲手做过一遍了!所以这张卡你其实已经用过一次、验证过有效,现在只是把它正式命名、存档。


1.5 矩估计——两个参数(快速操作卡)

先卡一下:如果总体有两个未知参数(比如正态 N(μ, σ²) 里的 μ 和 σ²),只有"X̄ = E(X)"这一个方程够吗?

🧠 这一步在想什么:1.3 ② 说过"一个未知数一个方程,两个未知数两个方程"。一个方程两个未知数,解不唯一——所以必须再凑一个方程。第二个方程从哪来?样本和总体能对上号的特征不止"平均值"一个,还有"平方的平均值"(二阶原点矩)——用它再列一个等式:

卡(两个参数):

  1. 写出 E(X) 和 E(X²)——用未知参数表达。技巧:E(X²) = D(X) + [E(X)]²
  2. 建立方程组:{ X̄ = E(X); (1/n)∑Xᵢ² = E(X²) }
  3. 联立解出两个参数

举例——正态分布 N(μ, σ²):E(X) = μ,E(X²) = σ² + μ²。令 X̄ = μ 和 (1/n)∑Xᵢ² = σ² + μ²,解得 μ̂ = X̄,σ̂² = (1/n)∑(Xᵢ - X̄)²。

📌 这张卡的两个方程,同样都有 1.3 节的出处:第一个方程 X̄ = E(X) 就是 1.3 ② 那题用过的;第二个方程 (1/n)∑Xᵢ² = E(X²) 在 1.3 ④(两个参数快速扩充)里推导过——当时就是用"E(X²) = D(X) + [E(X)]²"把方差换算成二阶原点矩的。

🛑 停一下:矩估计两个参数时,为什么用一阶原点矩+二阶原点矩,而不是一阶矩+方差?提示:哪种方程的代数形式更简单?(答案:原点矩的方程写起来更简单——E(X²) = D(X) + [E(X)]² 直接代入即可,不需要绕弯。)

两张卡刚到手,立刻上两道真题练手(趁热打铁,做完再看答案):

二-1(正态分布两参数矩估计)⭐⭐⭐

设总体 X ~ N(μ, σ²),μ 与 σ² 均未知。X₁, ..., Xₙ 为样本。

(1) 写出 E(X) 和 E(X²) 的表达式;
(2) 列出矩估计方程组;
(3) 解出 μ 和 σ² 的矩估计量。

📌 对应模板:题型二(两个参数矩估计)

点击看答案

(1) E(X) = μ, E(X²) = D(X) + [E(X)]² = σ² + μ²

(2) 令:{ X̄ = μ; (1/n)∑Xᵢ² = σ² + μ² }

(3) 解得:μ̂ = X̄, σ̂² = (1/n)∑Xᵢ² - X̄² = (1/n)∑(Xᵢ - X̄)²

注意分母是 n,不是 n-1!矩估计一律除以 n。


二-2(均匀分布两参数矩估计)⭐⭐⭐

设总体 X ~ U(a, b),a 和 b 均未知。X₁, ..., Xₙ 为样本。已知 E(X) = (a+b)/2,D(X) = (b-a)²/12。

(1) 利用 E(X²) = D(X) + [E(X)]² 写出 E(X²) 的表达式;
(2) 列出矩估计方程组并解出 a 和 b 的矩估计量。

点击看答案

(1) E(X²) = (b-a)²/12 + [(a+b)/2]² = (a²+ab+b²)/3

(2) 令:
{ X̄ = (a+b)/2
{ (1/n)∑Xᵢ² = (a²+ab+b²)/3

记 A₁ = X̄,A₂ = (1/n)∑Xᵢ²,解得:

â = A₁ - √(3(A₂ - A₁²)),b̂ = A₁ + √(3(A₂ - A₁²))

其中 A₂ - A₁² = (1/n)∑(Xᵢ - X̄)² = Sₙ²(分母为n的样本方差)。

所以简洁形式:â = X̄ - √3·Sₙ,b̂ = X̄ + √3·Sₙ


以上是矩估计的全部。下面来看另一种完全不同的点估计方法——极大似然估计(MLE)。矩估计是"照猫画虎"——样本的平均值 ≈ 总体的平均值;MLE 是"选最合理的"——哪个参数能让已经发生的数据概率最大?两种思路完全不同,但有时候会得到相同的结果。


1.6 极大似然估计——"最合理的解释"(六段式推导)

① 生活场景

🦶 你在沙滩上看到一个巨大的脚印——脚掌比你两个手掌还长,五指分明,深深陷进沙子里。

你会怎么想?你自然会说:"留下这个脚印的人一定很高大。"为什么?因为脚印(数据)已经摆在那里了——身高不到一米五的人不可能踩出这样的脚印,只有身高一米九以上的人才"最可能"留下它。

这就是极大似然估计(MLE)的灵魂:数据已经发生了,倒推回去,什么参数值会让这组数据"看起来最合理"? 脚印 = 样本数据,身高 = 未知参数 θ,MLE 选那个"最像能踩出这脚印"的身高。

② 正式陈述

设总体X的概率函数(离散型)或密度函数(连续型)为 f(x; θ),θ 为未知参数。样本 X₁, X₂, ..., Xₙ 的似然函数为:

$$L(θ) = \prod_{i=1}^{n} f(x_i; θ)$$

L(θ) 的含义:在参数取值为 θ 时,观测到当前这一组样本的"可能性"大小。

极大似然估计 θ̂ 就是让这个可能性最大的那个 θ 值:

$$\hat{θ} = \arg\max_{θ} L(θ)$$

③ 完整推导

🧠 第1步:认清数据是"已发生的事实"

你手里有一组具体的样本数据 x₁, x₂, ..., xₙ。它们不是"可能发生的事"——它们已经发生了,板上钉钉。

大白话:就像花瓶已经碎了、脚印已经在了——你先承认这个事实,然后问"什么原因最可能造成这个结果?"

🧠 第2步:不同θ下,同一组数据出现的"可能性"不同

假设有两个候选参数值 θ₁ 和 θ₂。把它们分别代入 f(x;θ),算一算各自"产生这组数据"的联合可能性。θ₁ 产生的可能性大,还是 θ₂ 大?

这个"联合可能性"就是似然函数 L(θ) = f(x₁;θ) × f(x₂;θ) × ... × f(xₙ;θ)。每个 f(xᵢ;θ) 是"在θ下观测到 xᵢ 的可能性"——n 个乘在一起就是"同时观测到这一整组数据的可能性"。

大白话:好比问"一个硬币正面概率是 0.3 还是 0.7?",你抛了 10 次有 7 次正面——0.7 显然比 0.3"更说得通"。L(0.7) > L(0.3),因为 C₁₀⁷ × 0.7⁷ × 0.3³ > C₁₀⁷ × 0.3⁷ × 0.7³。

🧠 第3步:MLE的哲学——"既然数据已被观测到,θ应该让这个可能性最大"

这是 MLE 最核心的一步思想跳跃:不是问"θ 可能是多少",而是反过来问"数据已经这样了,哪个 θ 最合理"。我们不问"参数等于 θ 时数据出现的概率",而是问"数据已经出现了,哪个 θ 最像那么回事"。

这就是"似然"与"概率"的区别:

大白话:女朋友生气了(数据),你猜原因。不是因为"你没洗碗"这件事发生概率高,而是"在生气这个事实下,没洗碗是最合理的解释"。方向反过来了。

🧠 第4步:数学操作——三步解决

因为 L(θ) 是 n 个函数相乘,直接求导极其繁琐(n 个因子乘在一起的导数要用乘法法则拆 n 次)。所以标准操作分三步:

第一步——写似然:L(θ) = ∏ f(xᵢ; θ)

第二步——取对数:ln L(θ) = ∑ ln f(xᵢ; θ)

取对数的好处:乘积变求和(ln(ab) = ln a + ln b),指数变系数(ln(eˣ) = x)。而且 ln 是单调递增函数——L(θ) 的最大值点和 ln L(θ) 的最大值点是同一个点,放心取。

第三步——求导、令导数为零、解出 θ̂:令 d(ln L)/dθ = 0,解方程。

用一个 n=2 的微型例子对比取不取对数的差别——f(x;θ)=θe^{-θx},x₁=1, x₂=2:

当 n=100 时,不取对数意味着 100 个因子相乘的导数——没人能干。取对数后只是一串加法,永远轻松。

大白话:取对数就像把"一长串数字相乘"变成"一长串数字相加"——乘法做求导要命,加法做求导轻松。

🧠 第5步:拿一个具体数字例子完整走一遍

例:泊松分布求 λ 的MLE

商店每小时进店人数 X ~ P(λ),P(X=k) = λᵏe^{-λ}/k!。随机观察了 5 个小时,每小时进店人数分别是:3人、5人、2人、4人、6人。用 MLE 估计 λ。

(1) 写似然:

L(λ) = (λ³e^{-λ}/3!) × (λ⁵e^{-λ}/5!) × (λ²e^{-λ}/2!) × (λ⁴e^{-λ}/4!) × (λ⁶e^{-λ}/6!)

合并:λ 的指数 = 3+5+2+4+6 = 20,e^{-λ} 乘了 5 次 = e^{-5λ}

L(λ) = λ²⁰ · e^{-5λ} / (3!5!2!4!6!)

(2) 取对数:

ln L(λ) = 20·ln λ - 5λ - ln(3!5!2!4!6!)

注意:ln(3!5!2!4!6!) 是常数,对 λ 求导时直接消失——不用算具体值!

(3) 求导解方程:

d(ln L)/dλ = 20/λ - 5 = 0

20/λ = 5 → λ̂ = 20/5 = 4

(4) 结论:λ̂ = 4(人/小时)= 样本均值 x̄ = (3+5+2+4+6)/5 = 4。MLE 给出的估计就是样本均值——这并非巧合,泊松分布的 λ 本身等于总体均值 E(X),MLE 总是给出样本均值。

大白话:这 5 个小时平均每小时来 4 人,MLE 说"每小时平均来店人数就是 4"——和你直接算平均数一样。因为泊松分布的参数 λ 本身就是均值,所以 MLE 和"直接算平均"不谋而合。

✍️ 立刻练一道(把刚看过的三步走,自己走一遍):

商店每小时进店人数 X ~ P(λ)。你又观察了另外 4 个小时,进店人数分别是 2、3、1、4 人。用 MLE 求 λ̂。

提示:① 写似然(把 λ^xᵢe^{-λ}/xᵢ! 乘起来,λ 的指数是 2+3+1+4,e^{-λ} 乘 4 次);② 取对数;③ 求导解方程。你甚至可以先猜答案——再验证。

点开看答案

① L(λ) = λ²e^{-λ}/2! × λ³e^{-λ}/3! × λe^{-λ}/1! × λ⁴e^{-λ}/4! = λ¹⁰·e^{-4λ}/(2!·3!·1!·4!);② lnL = 10·lnλ - 4λ - 常数;③ d lnL/dλ = 10/λ - 4 = 0 → λ̂ = 10/4 = 2.5。而样本均值 x̄ = (2+3+1+4)/4 = 2.5——MLE 又给出样本均值,和刚才 3,5,2,4,6 那题一个道理。

④ 📝 复盘:MLE的套路就是三步

无论离散还是连续、一个参数还是两个参数,MLE 的操作永远是这三板斧:

步骤 操作 关键词
1 写出似然函数 L(θ) = ∏ f(xᵢ;θ) 联合分布 = 各样本的乘积
2 取对数 ln L(θ) = ∑ ln f(xᵢ;θ) 乘积变求和,指数变系数
3 求导 d(ln L)/dθ = 0,解出 θ̂ 找最大值点

两个参数时,第三步变成求偏导、联立方程组——思路一样,只是多解一个未知数。

均匀分布等特殊情况下,第三步的"求导 = 0"会失效——因为最大值在边界上,不在导数零点。这时候换用单调性分析(见 1.9 节)。

⑤ ⚠️ 易错边界

⚠️ 易错1:似然函数不是概率分布——方向是反的!

概率分布是"参数固定 → 数据随机",问"出现这组数据的概率"。似然函数是"数据固定 → 参数可变",问"哪个参数最合理"。两者方向相反。所以 L(θ) 不满足概率的归一化条件(对 θ 积分不等于 1),它不是概率分布。

类比:体重的概率分布问"随机一个人超过 80kg 的概率",似然函数问"我已经称出 80kg 了,这个秤最可能是准的还是偏的"。

⚠️ 易错2:求导 = 0 可能找到的是极小值,不是最大值!

d(ln L)/dθ = 0 只是驻点条件,既可能是最大值也可能是最小值。正常分布的 MLE 中,似然函数通常是上凸(∩ 形)的,驻点 = 最大值。但保险起见,可以用二阶导数验证:d²(ln L)/dθ² < 0 才是最大值。考研一般不需要二阶验证,但脑子里要有这根弦。

⚠️ 易错3:忘记取对数,直接对乘积求导!

L(θ) = ∏ f(xᵢ;θ) 是 n 个函数的乘积,直接求导要用乘法法则拆 n 次——n=5 时已经很难,n=100 时根本不可能。一定先取对数!ln 是单调递增的,不会改变最大值的位置。

⚠️ 易错4:MLE 估计量不一定无偏!

不要以为 MLE 给出的估计量自动就是无偏的。正态分布 N(μ,σ²) 中 μ̂_MLE = X̄ 是无偏的,但 σ̂²_MLE = (1/n)∑(Xᵢ-X̄)² 是有偏的(系统偏低)。无偏性需要单独验证,不能想当然。

⑥ 在整条链中的位置

概率论(正向):   已知θ → 推断数据分布 → P(X≤x)
                          ↓ 反过来
统计推断(反向): 已知数据 → 推断θ → 点估计(MLE / 矩估计)→ 区间估计(置信区间)

MLE 是统计推断的第一站——"点估计"的两种方法之一。有了点估计之后,才能评价它好不好(无偏 / 有效 / 一致),以及进一步做区间估计(下一站)。整条链的逻辑是:先猜一个点(MLE 或矩估计),再评价这个点猜得好不好,最后给一个范围(区间估计)说"我有 95% 把握真值在这个范围内"。

✍️ 立刻练一道(独立走一遍 MLE 三步走):

设总体 X 服从几何分布 P(X = k) = (1/θ)^(k-1) · (1 - 1/θ),k = 1, 2, 3, …。抽得一个样本 X₁ = 2。用 MLE 求 θ̂。

提示:① 写似然 L(θ)(只有一个样本,就是它自己);② 取对数;③ 求导解方程。

点开看答案

① L(θ) = (1/θ)^(2-1)·(1 - 1/θ) = (1/θ)·(1 - 1/θ) = (θ-1)/θ²。② lnL = ln(θ-1) - 2lnθ。③ d lnL/dθ = 1/(θ-1) - 2/θ = 0 → 1/(θ-1) = 2/θ → θ = 2(θ-1) → θ̂ = 2。注意:这里用的是分布律(离散型),不是密度函数——离散型 MLE 的 f(xᵢ;θ) 就是概率函数 P(X=xᵢ)。


1.7 离散型随机变量的MLE怎么做

先卡一下:硬币正面概率到底是多少?

生活比喻:抛一枚硬币10次,7次正面、3次反面。硬币正面朝上的概率 p 是多少?你自然会猜 p=0.7,因为 p=0.7 时,出现"7正3反"的概率 C₁₀⁷p⁷(1-p)³ 最大。这就是离散型极大似然估计。

🧠 这一步在想什么:注意"C₁₀⁷p⁷(1-p)³"——这正是上一节 MLE 的核心操作在"抛硬币"这个场景里的样子:写出"这组数据出现的概率"(写似然),再找让它最大的 p。唯一的变化是——硬币是离散的,所以 L(θ) 里的每个因子是概率函数 P(X=xᵢ),而不是密度函数。

正式写法:对于离散型总体,似然函数中的 f(xᵢ; θ) 是概率函数(或称分布律)P(X=xᵢ)。

举例——泊松分布的MLE:总体 X ~ P(λ),P(X=k)=λᵏe^{-λ}/k!。

三步走:

  1. 写似然:L(λ)=∏ λ^{xᵢ}e^{-λ}/xᵢ! = λ^{∑xᵢ}·e^{-nλ}/∏(xᵢ!)
  2. 取对数:lnL(λ)=(∑xᵢ)lnλ - ∑ln(xᵢ!) - nλ
  3. 求导:d lnL/dλ=(∑xᵢ)/λ - n=0,解得 λ̂ = X̄

这说明泊松分布参数 λ 的极大似然估计就是样本均值。

注意:xᵢ! 是常数,对 λ 求导时为0。

🛑 停一下:极大似然估计中,离散型用概率函数,连续型用密度函数。如果 X~B(1,p)(0-1分布,P(X=1)=p,P(X=0)=1-p),写出 n 个样本的似然函数 L(p)。(提示:每个样本的取值要么是0要么是1,似然函数是各样本概率的乘积。)

✍️ 立刻练一道:设 X ~ B(1, p)(0-1分布),抽得样本 1, 1, 0, 1(即 3 个 1、1 个 0)。用 MLE 求 p̂。

提示:按"写似然→取对数→求导"走。P(X=1)=p、P(X=0)=1-p,n 个样本乘起来。

点开看答案

① L(p) = p·p·(1-p)·p = p³(1-p);② lnL = 3lnp + ln(1-p);③ d lnL/dp = 3/p - 1/(1-p) = 0 → 3(1-p) = p → 3 - 3p = p → p̂ = 3/4 = 0.75。直观验证:4 次里成功 3 次,MLE 给出的成功概率就是样本成功频率 3/4——和抛硬币猜 p=0.7 是同一个直觉。

离散型 MLE 的两道配套练习(趁热打铁):

三-1(泊松分布MLE)⭐⭐

设总体 X ~ P(λ),分布律 P(X=k)=λᵏe^{-λ}/k!。X₁,...,Xₙ 为样本,观测值为 x₁,...,xₙ。求 λ 的极大似然估计值。

📌 对应模板:题型三(离散型MLE)

点击看答案

第一步——写似然:L(λ)=∏ λ^{xᵢ}e^{-λ}/xᵢ! = λ^{∑xᵢ}·e^{-nλ}/∏(xᵢ!)

第二步——取对数:lnL=(∑xᵢ)lnλ - ∑ln(xᵢ!) - nλ

第三步——求导并令其为零:d lnL/dλ=(∑xᵢ)/λ - n=0

解得:λ̂ = (1/n)∑xᵢ = x̄

λ 的极大似然估计值就是样本均值。

补充:矩估计也会给出同样的结果 λ̂=X̄(因为 E(X)=λ)。


三-2(二项分布MLE)⭐⭐

设 X~B(m,p),m已知 p未知。X₁,...,Xₙ为样本,求 p 的极大似然估计。

📌 对应模板:题型三(离散型MLE)

点击看答案

第一步——写似然:
L(p)=∏C_m^{Xᵢ}p^{Xᵢ}(1-p)^{m-Xᵢ} = (∏C_m^{Xᵢ})·p^{∑Xᵢ}·(1-p)^{nm-∑Xᵢ}

第二步——取对数:
lnL=∑lnC_m^{Xᵢ} + (∑Xᵢ)lnp + (nm-∑Xᵢ)ln(1-p)

第三步——求导并令其为零:
d lnL/dp = (∑Xᵢ)/p - (nm-∑Xᵢ)/(1-p)=0

解得:p̂ = (∑Xᵢ)/(nm) = X̄/m

直观解释:样本中平均成功次数除以试验次数就是成功概率的估计。


1.8 连续型随机变量的MLE

先卡一下:指数分布的 λ 怎么估计?

上一节算的都是"离散型"(硬币、泊松)。现在换一种:连续型——灯泡寿命服从指数分布 Exp(λ),你测出 n 只灯泡的寿命 x₁, ..., xₙ,想估计 λ。

🧠 这一步在想什么:和离散型唯一的不同是——"数据出现的可能性"怎么写?离散型用概率函数 P(X=xᵢ),连续型只能用密度函数 f(xᵢ; θ)。虽然连续型随机变量取任何具体值的概率都是0,但联合密度的大小反映了"这组数据出现的相对可能性"。于是 L(θ) = ∏ f(xᵢ; θ),三步走与离散型完全相同。

举例——指数分布的MLE:X ~ Exp(λ),密度 f(x;λ)=λe^{-λx}。

  1. 写似然:L(λ)=∏ λe^{-λxᵢ} = λⁿ·e^{-λ∑xᵢ}
  2. 取对数:lnL(λ)=n lnλ - λ∑xᵢ
  3. 求导:d lnL/dλ = n/λ - ∑xᵢ = 0,解得 λ̂ = n/∑xᵢ = 1/X̄

与矩估计结果相同!这并不总是成立,但在指数分布中碰巧一致。

另一个重要例子——正态分布N(μ, σ²)的MLE(两个参数):

密度函数 f(x; μ, σ²) = (1/√(2πσ²))exp(-(x-μ)²/(2σ²))

  1. 写似然:L(μ,σ²) = (2πσ²)^{-n/2}·exp(-(1/(2σ²))∑(xᵢ-μ)²)
  2. 取对数:lnL = -(n/2)ln(2π) - (n/2)ln(σ²) - (1/(2σ²))∑(xᵢ-μ)²
  3. 求偏导解方程组(两个参数所以要偏导):
    • 对 μ 求偏导:∂lnL/∂μ = (1/σ²)∑(xᵢ-μ)=0 → μ̂ = X̄
    • 对 σ² 求偏导(把 σ² 看作一个整体):∂lnL/∂σ² = -n/(2σ²) + (1/(2σ⁴))∑(xᵢ-μ)²=0 → σ̂² = (1/n)∑(xᵢ-X̄)²

结果:μ̂ = X̄,σ̂² = (1/n)∑(Xᵢ-X̄)²

🛑 停一下:趁热打铁试试——指数分布X~Exp(λ),密度f(x;λ)=λe^{-λx},抽了3个样本:x₁=0.5, x₂=1.0, x₃=1.5。写出似然函数L(λ),取对数,求导,解出λ̂。做完再看答案。(答案:L(λ)=λ³e^{-3λ},lnL=3lnλ-3λ,求导:3/λ-3=0,λ̂=1/x̄=1/1=1。如果做对了,标准三步走你已经掌握了。下面看一个"三步走失效"的特殊情况。)

✍️ 立刻练一道(连续型 MLE 独立走一遍):

设总体 X 的密度函数为 f(x; θ) = (θ+1)x^θ(0 < x < 1,θ > -1)。X₁, ..., Xₙ 为样本。求 θ 的极大似然估计量。

提示:① 写似然(θ+1 出现 n 次,xᵢ^θ 连乘);② 取对数(注意 ∑lnxᵢ 这一项);③ 求导解方程。做完再翻答案。

点开看答案

① L(θ) = ∏(θ+1)xᵢ^θ = (θ+1)ⁿ·(∏xᵢ)^θ;② lnL = n·ln(θ+1) + θ·∑lnxᵢ;③ d lnL/dθ = n/(θ+1) + ∑lnxᵢ = 0 → θ̂ = -n/∑lnxᵢ - 1。因为 xᵢ<1 所以 ∑lnxᵢ<0,θ̂>-1,落在参数范围内,成立。标准三步走,你已经独立会用了。

连续型 MLE 的配套练习(三道,由易到难):

四-1(纯连续型MLE——非标准分布)⭐⭐⭐

设总体 X 的密度函数为 f(x; θ) = θx^{θ-1}(0 < x < 1,θ > 0)。X₁, ..., Xₙ 为样本。

(1) 写出似然函数 L(θ);
(2) 求 θ 的极大似然估计量。

📌 对应模板:题型四(连续型MLE)

点击看答案

(1) 写似然
L(θ) = ∏ θxᵢ^{θ-1} = θⁿ · (∏xᵢ)^{θ-1}

(2) 取对数
lnL = n·lnθ + (θ-1)·∑lnxᵢ = n·lnθ + (θ-1)·∑lnxᵢ

(3) 求导解方程
d lnL/dθ = n/θ + ∑lnxᵢ = 0 → θ̂ = -n/∑lnxᵢ

注意:这个参数不出现在取值范围里,所以可以用标准三步走。


一-1(指数分布矩估计与MLE)⭐⭐⭐

设总体 X 服从指数分布,密度函数为 f(x;λ)=λe^{-λx}(x>0)。X₁,...,Xₙ 为样本。

(1) 求 λ 的矩估计量;
(2) 求 λ 的极大似然估计量;
(3) 两种方法结果是否相同?

📌 对应模板:题型一(矩估计)+ 题型四(连续型MLE)

点击看答案

(1) 矩估计

指数分布的总体均值:E(X) = 1/λ

令 X̄ = 1/λ,解得:λ̂_M = 1/X̄ = n/∑Xᵢ

(2) 极大似然估计

第一步——写似然:L(λ) = ∏ λe^{-λXᵢ} = λⁿ·e^{-λ∑Xᵢ}

第二步——取对数:lnL = n lnλ - λ∑Xᵢ

第三步——求导并令其为零:d lnL/dλ = n/λ - ∑Xᵢ = 0

解得:λ̂_L = n/∑Xᵢ = 1/X̄

(3) 结论:两种方法结果相同,λ̂ = 1/X̄。


一-2(完整大题——矩+MLE)⭐⭐⭐

某种电子元件寿命(千小时)X服从指数分布,密度 f(x;θ)=(1/θ)e^{-x/θ}。随机取10个,数据:
0.8, 1.2, 0.9, 1.5, 1.1, 0.7, 1.3, 1.0, 1.4, 0.6

(1) 求θ的矩估计值;
(2) 求θ的极大似然估计值。

(注意:E(X)=θ,D(X)=θ²)

📌 对应模板:题型一(矩估计单参数)+ 题型四(连续型MLE)

点击看答案

∑xᵢ=0.8+1.2+0.9+1.5+1.1+0.7+1.3+1.0+1.4+0.6=10.5
x̄=10.5/10=1.05

(1) 矩估计
E(X)=θ,令 X̄=θ,得 θ̂_M=1.05(千小时)

(2) 极大似然估计

第一步——写似然:L(θ)=∏(1/θ)e^{-Xᵢ/θ}=θ^{-n}·e^{-∑Xᵢ/θ}

第二步——取对数:lnL=-n lnθ - (1/θ)∑Xᵢ

第三步——求导解方程:
d lnL/dθ=-n/θ+(1/θ²)∑Xᵢ=0 → (1/θ²)∑Xᵢ=n/θ → θ̂_L=(1/n)∑Xᵢ=X̄=1.05

两种方法结果相同(因为θ恰好等于总体均值)。


1.9 边界情况:均匀分布的MLE(特殊处理)

生活比喻——侦探在房间里找凶手:你是一个侦探,在一个房间里找凶手。房间只有一个门,凶手只能从这个门出去。你沿着走廊找(求导),结果发现越走越找不到——因为凶手根本没走走廊,而是藏在房间的角落里(边界)。均匀分布的MLE就像这个案子:最优解不在"导数=0"的地方(走廊中间),而在约束的边界(房间角落)。

为什么均匀分布的MLE不能用求导法?

设总体 X ~ U(0, θ),密度为 f(x;θ)=1/θ(0<x<θ)。写似然:
L(θ) = ∏(1/θ) = 1/θⁿ,但这里有一个约束条件:θ > max(x₁, ..., xₙ)(因为所有样本必须在 (0,θ) 范围内,所以 θ 必须大于每个样本值)。

L(θ)=1/θⁿ 随 θ 增大而单调递减——也就是说,θ 越小,似然越大。就像在一个下坡路上找最高点:最高点不在坡中间(导数为0处),而在路的起点(边界)。但θ能不能取非常小?不行,因为 θ 不能小于任何观测值(否则那些观测值就不可能在(0,θ)内出现)。

所以最优解在约束的边界处:
θ̂ = max(X₁, ..., Xₙ)

关键判断:参数是否出现在密度的"取值范围"里?θ 既是密度表达式 1/θ 的一部分,也是取值范围 0<x<θ 的一部分。这种情况下,最大值不在导数=0处,而在边界处。

拓展一下:如果似然函数单调递增呢?比如密度为 f(x;θ)=1/(b-a),想估计a——L(θ)随a增大而增大,但a不能大于样本最小值,所以â=min(Xᵢ)。规律是:

✍️ 立刻练一道(把"边界规律"用一遍):

设总体 X ~ U(0, θ),抽得样本 1.2, 0.8, 2.5, 1.9。
(1) 用 MLE 求 θ̂;(2) 用矩估计求 θ̂(E(X) = θ/2);(3) 比较两个结果,谁更大?

点开看答案

(1) MLE:θ̂ = max(1.2, 0.8, 2.5, 1.9) = 2.5。理由:L(θ) = 1/θ⁴ 单调递减,θ 越小似然越大,但 θ 不能小于最大样本 2.5(否则 2.5 就不在 (0,θ) 里了)→ 取边界 max。 (2) 矩估计:x̄ = (1.2+0.8+2.5+1.9)/4 = 6.4/4 = 1.6,θ̂ = 2x̄ = 3.2。 (3) 3.2 > 2.5——矩估计更大。这道题的 MLE 答案 2.5 是不是正好等于最大样本?这就是"单调减取 max"规律的实战应用。


1.10 矩估计 vs MLE:什么时候一样,什么时候不同

生活比喻:你要估计一家餐厅的"平均消费水平"。

什么时候两种方法结果相同?
当待估参数恰好是总体均值(或可表达为样本均值的简单函数)时,两种方法可能给出相同结果:

什么时候结果不同?
最典型的例子是均匀分布 U(0, θ):

考研非常喜欢考这个对比。

两种方法的适用条件对比:

对比维度 矩估计 极大似然估计(MLE)
需要什么信息 只需要知道总体矩(如E(X))与参数的关系 需要知道总体完整的密度函数/分布律
操作难度 简单——列方程、解方程 较复杂——写似然、取对数、求导
什么时候不能用 基本都能用 似然函数单调时求导法失效(如U(0,θ))
考研定位 通常大题第一问,容易得分 通常大题第二问,11分核心

🛑 停一下:如果题目只给了"E(X)=2θ"这一个信息,没给密度函数的具体形式——那你只能用矩估计,没法用MLE。反过来,如果题目给了完整的f(x;θ)但没给E(X)表达式,你就得自己积分算E(X)来做矩估计,或者直接用MLE三步走。记住:矩估计靠"总体矩=样本矩"这个等式,MLE靠"让数据出现概率最大"这个思路。

✍️ 立刻练一道(判断该用哪种方法):

下面两种情境,各该用矩估计还是 MLE?为什么?
(1) 题目只告诉你"总体均值 E(X) = 3θ",其余一概不知;
(2) 题目给出了完整密度 f(x; θ) = θe^{-θx}(x>0)。

点开看答案

(1) 只能用矩估计——你没有完整密度,写不出似然函数;但"总体均值=样本均值"这个等式不需要密度,直接 X̄ = 3θ → θ̂ = X̄/3。 (2) 两种都行——矩估计要自己积分算 E(X) = 1/θ(碰巧和第4章指数分布一致),MLE 走标准三步走也得到 λ̂ = 1/X̄。小结:只给均值信息→矩估计;给了完整密度→两招都使,MLE 更常用。

说完了两种点估计方法,下面来思考一个重要问题:我们辛辛苦苦构造出一个估计量,它到底好不好?怎么评价?这就需要用估计量的评价标准——无偏性、有效性、一致性。这三个性质各自回答了不同的问题:它有没有系统偏差?它稳定吗?样本越多越准吗?下面逐一来看。


1.11 估计量怎么评价好坏?——无偏、有效、一致

① 生活场景

⚖️ 你去菜市场买菜,怀疑摊主的秤不准。摊主拿来一个标准 1 公斤的砝码让你检查:

三把秤摆在面前,你显然最喜欢秤 A——它的三个特点恰好对应估计量的三个评价标准:(1) 不偏(无偏性);(2) 稳定(有效性);(3) 而且你会发现,称的次数越多,平均越接近 1.00(一致性)。

② 正式陈述

对于未知参数 θ,设 θ̂ = θ̂(X₁, ..., Xₙ) 是由样本构造的估计量。评价估计量好不好,有三个标准:

性质 数学定义 一句话
无偏性 E(θ̂) = θ 长期平均等于真值,没有系统性偏差
有效性 若 E(θ̂₁)=E(θ̂₂)=θ 且 D(θ̂₁) < D(θ̂₂),则 θ̂₁ 更有效 两个都不偏的估计量,方差小的更稳定
一致性(相合性) 当 n → ∞ 时,θ̂ →ᵖ θ(依概率收敛) 样本越大,估计越准,最终逼近真值

三个标准是递进关系:先问偏不偏(无偏)→ 两个不偏的再比谁更稳(有效)→ 最后问加大样本能不能无限逼近真值(一致)。

③ 完整推导

🧠 第1步:无偏性——"长期平均准不准"

如果 E(θ̂) = θ,则称 θ̂ 是 θ 的无偏估计量。换句话说:你把同一个估计方法重复用无数次,每次得到一个估计值,这些估计值的平均正好等于真值。

大白话:无偏 = 人品正。他不是每次都猜对,但长期来看他不骗你——不会系统性地高估或低估。

经典验证:样本均值 X̄ 是 μ 的无偏估计

$$E(\bar{X}) = E\left(\frac{1}{n}\sum X_i\right) = \frac{1}{n}\sum E(X_i) = \frac{1}{n} \cdot n\mu = \mu$$

每一步都只用期望的线性性质——把常数提出来、把求和拆开。就这么简单,X̄ 无偏。

经典验证:为什么样本方差分母是 n-1 而不是 n?

这是整个概率论中最经典的问题之一。先看分母用 n 的版本:

$$\hat{\sigma}^2_n = \frac{1}{n}\sum(X_i - \bar{X})^2$$

它的期望是(推导从略,但结论极其重要):

$$E(\hat{\sigma}^2_n) = \frac{n-1}{n}\sigma^2 \neq \sigma^2$$

大白话:分母用 n 的方差估计,系统性地偏小——它总是低估了真实的方差。为什么呢?因为你在用 X̄ 代替 μ 来算偏差的平方和。X̄ 本身就是从这组数据算出来的,它天然地"靠近"数据点——比真正的 μ 更靠近。所以每个 (Xᵢ - X̄)² 都比你想象的小一点,n 个加起来、除以 n,结果系统性地小于 σ²。

怎么办?补偿——把分母从 n 改成 n-1:

$$S^2 = \frac{1}{n-1}\sum(X_i - \bar{X})^2, \quad E(S^2) = \sigma^2$$

大白话:因为 X̄ "偷吃"了一个自由度(它自己就是从数据里算出来的),所以除以 n-1 把亏空补回来。n-1 不是随便取的——是精确算出来的补偿。

翻车现场:

🚨 不要盲目套用 n-1! 小明说:"样本方差分母用 n-1 是为了无偏性,那我所有估计量都除以 n-1 不就好了?"——大错特错!无偏性是算 E(θ̂) 验证出来的,不是"都除以 n-1"就能保证的。矩估计里分母必须用 n(因为矩估计的原理是样本矩 = 总体矩,总体矩定义就是除以 n)。只有样本方差 S² 为了无偏性才用 n-1。口诀:矩估计 = 除以 n(照搬定义),无偏 S² = 除以 n-1(修正偏差)。

重要提醒:无偏性不意味着单次估计准确!它只说"长期平均是准的",某一次可能差得很远。就像抛硬币——正面概率 50%(无偏),但你抛 10 次可能只有 3 次正面。

✍️ 立刻练一道(亲手验一次无偏性):

设 X₁, X₂, X₃, X₄ 来自总体 X(E(X) = μ)。考虑估计量 θ̂ = (2X₁ + X₂ + X₃ + X₄)/5。它是 μ 的无偏估计吗?

提示:算 E(θ̂),用期望的线性性质把 1/5 提出来、把求和拆开。

点开看答案

E(θ̂) = E[(2X₁ + X₂ + X₃ + X₄)/5] = [2E(X₁) + E(X₂) + E(X₃) + E(X₄)]/5 = (2μ + μ + μ + μ)/5 = 5μ/5 = μ。恰好等于 μ,所以无偏 ✓。它无偏的"秘诀"是系数加起来等于 1:(2 + 1 + 1 + 1)/5 = 1。这题和你刚学的那句话对上了——"长期平均是准的",尽管单次可能偏。

🧠 第2步:有效性——"两个无偏估计,谁更稳"

有了无偏性还不够——两把秤都不偏,但一把每次在 0.981.02 晃,另一把在 0.901.10 晃,显然前者更好。

如果 θ̂₁ 和 θ̂₂ 都是无偏的,且 D(θ̂₁) ≤ D(θ̂₂),则 θ̂₁ 比 θ̂₂ 更有效。 方差最小的无偏估计称为最小方差无偏估计(MVUE)。

大白话:有效性 = 情绪稳。两个人都诚实(无偏),但一个情绪稳定(方差小),一个忽冷忽热(方差大)——你选哪个?

经典例子:X̄ vs X₁

估计正态总体均值 μ:

两者都无偏,但 X̄ 的方差只有 X₁ 的 1/n——用了 n 个样本的平均,比只用 1 个样本稳定得多。n 越大优势越明显。

大白话:用 1 个人的身高猜全城平均 vs 用 100 人的平均身高——显然 100 人更稳定。多收集信息,方差就小。

致命前提:有效性比较只在"两者都无偏"时才有意义!

🚨 翻车现场:拿一个无偏估计和一个有偏估计比方差,然后说"方差小的更有效"——这是错的!一把永远偏轻的秤,称一万次都一样偏轻,方差是零,但它不"有效"。必须先验证无偏,再比方差。口诀:"先问偏不偏,再比稳不稳。"

✍️ 立刻练一道(亲手比一次有效性):

设 X₁, X₂, X₃ 来自 N(μ, σ²)。比较两个估计量谁更有效:θ̂₁ = (X₁+X₂+X₃)/3,θ̂₂ = (X₁+X₂)/2。

提示:先确认两个都无偏,再算 D(θ̂₁) 和 D(θ̂₂)。

点开看答案

无偏:E(θ̂₁) = (μ+μ+μ)/3 = μ ✓;E(θ̂₂) = (μ+μ)/2 = μ ✓,两个都无偏,可以比。方差:D(θ̂₁) = 3σ²/9 = σ²/3;D(θ̂₂) = 2σ²/4 = σ²/2。σ²/3 < σ²/2,所以 θ̂₁(取三个的平均)更有效——和正文里"X̄ 比 X₁ 有效"是同一个道理:样本越多,平均得越多,方差就越小。

🧠 第3步:一致性(相合性)——"样本越多越准"

如果当样本量 n → ∞ 时,θ̂ₙ 以概率收敛到 θ(误差大的概率趋于 0),则 θ̂ₙ 是 θ 的一致估计量。

大白话:一致性 = 越相处越了解你。问了 10 个人身高,可能不太准;问了 1000 个人,基本就接近真相了。只要你一直收集信息,最终一定能逼近真值。

样本均值 X̄ 为什么是一致估计? 根据大数定律:当 n → ∞ 时,X̄ → μ。不需要正态假设——只要总体期望存在,样本均值就一致。

一个重要的反直觉事实:可以有偏但相合!

分母为 n 的样本方差 σ̂²_n = (1/n)∑(Xᵢ-X̄)²:

大白话:小样本时它故意低估了方差,但随着样本越来越多,低估得越来越少,最终逼近真值。所以"有偏"不一定"不能用"——大样本下偏差消失了,而它的计算更简单(除以 n 比除以 n-1 好算)。

✍️ 立刻练一道(三把尺子一起用):

设 X₁, ..., Xₙ 来自总体 X(E(X) = μ, D(X) = σ²)。对估计量 θ̂ = X̄,用一句话分别说出:
(1) 它是否无偏?依据是什么?
(2) 它是否相合(一致)?依据是什么?
(3) 无偏性和相合性各自保证"好"在哪一方面?

点开看答案

(1) 无偏:E(X̄) = μ(用期望线性性质,正文第1步刚验证过)。 (2) 相合:大数定律保证 X̄ →ᵖ μ(正文第3步)。 (3) 无偏保证"长期平均不骗人、没有系统偏差";相合保证"样本越多越接近真值"。所以 X̄ 是"人品正 + 越相处越懂你"两全的估计量——这也是为什么样本均值这么受宠。

④ 📝 复盘:三个标准一张表

性质 生活比喻 数学表达 回答的问题
无偏性 秤不偏——长期平均准 E(θ̂) = θ 估计量有系统偏差吗?
有效性 秤稳定——每次差不多 D(θ̂₁) < D(θ̂₂) 两个无偏估计谁更稳?
一致性 样本越多越准 θ̂ₙ →ᵖ θ (n→∞) 加大样本量能无限逼近真值吗?

三者是独立的:一个估计量可以无偏但不相合(如只用第一个样本——永远不准),可以有偏但相合(如分母 n 的方差——大样本下偏差消失),也可以既有偏又不相合。

生活总结:就像找对象的三个标准——无偏 = 人品正(长期诚实)、有效 = 情绪稳(不忽冷忽热)、一致 = 越相处越懂你。最好是三者都有,但有时得取舍。比如均匀分布 MLE(max(Xᵢ))——有偏,但修正后比无偏的矩估计(2X̄)更有效(方差更小)。大样本下通常倾向 MLE(修正偏差后),小样本下要具体分析。

⑤ ⚠️ 易错边界

⚠️ 易错1:n-1 只救得了 S²,救不了矩估计!

矩估计 σ̂² = (1/n)∑(Xᵢ-X̄)² 分母必须是 n——矩估计的原理是样本矩 = 总体矩,而总体矩定义里就是除以 n。如果你在矩估计里擅自把分母改成 n-1,就违背了矩估计的基本原理。无偏性不是矩估计追求的目标——矩估计追求的是"照猫画虎"(样本特征 ≈ 总体特征)。

⚠️ 易错2:有偏 vs 无偏——选哪个?没有绝对答案!

很多 MLE 在小样本下是有偏的,但大样本下偏差消失(一致性保证了这一点)。而且 MLE 通常更有效(方差更小)。所以实际中:小样本时有时倾向无偏估计,大样本时 MLE 几乎总是更好。考研一般只要求你"验证是否无偏"和"比较两无偏估计的有效性",不要求你在有偏和无偏之间选。

⚠️ 易错3:无偏 ≠ 单次准!不要过度解读。

E(θ̂) = θ 说的是"如果把这种估计重复无数次,平均值是 θ"。但这并不意味着你这一次的估计值一定接近真值。就像抛硬币——正面的期望概率是 50%,但你抛 10 次可能 3 正 7 反。

⑥ 在整条链中的位置

矩估计(1.3)    MLE(1.6)
      ↘            ↙
       估计量评价(本节)
      "你造出来的估计量靠谱吗?"
            ↓
    无偏 → 有效 → 一致(三步审查)
            ↓
       区间估计(1.12 起)
     "点估计不够,再给个范围"

这三个评价标准是从"构造估计量"到"使用估计量"的必经关卡。它们用的工具全部来自第4章——无偏性靠算期望 E(θ̂),有效性靠算方差 D(θ̂),一致性靠大数定律(第5章)。可以说,第4章和第5章的功夫,在本节全部派上了用场。

特别提醒:无偏、有效、一致是三个独立的标准。一个估计量可以有偏但一致(分母为 n 的方差),也可以无偏但不一致(只用第一个样本估计均值)。评估时要三个标准分别检查,不要混为一谈。

评价估计量的配套练习(从"只会套定义"到"综合应用",六道):

五-1(非标准分布矩估计+无偏性)⭐⭐⭐

设总体X的概率密度为:f(x;θ)=2x/θ²,0<x<θ。X₁,...,Xₙ为样本。

(1) 求θ的矩估计量;
(2) θ̂是否为θ的无偏估计?

📌 对应模板:题型一 + 题型五

点击看答案

(1) 矩估计

先求总体均值:E(X)=∫₀ᶿ x·(2x/θ²)dx = (2/θ²)∫₀ᶿ x²dx = (2/θ²)·(θ³/3) = 2θ/3

令 X̄ = 2θ/3,解得 θ̂ = (3/2)X̄

(2) 无偏性验证

E(θ̂)=E(3X̄/2)=(3/2)E(X̄)=(3/2)·E(X)=(3/2)·(2θ/3)=θ

所以 θ̂=(3/2)X̄ 是 θ 的无偏估计。✓

本题展示了一个非标准分布的矩估计。核心还是:先算E(X)(可能需要积分),再令X̄=E(X),最后解出参数。


五-2(相合性验证)⭐⭐

设 X₁,...,Xₙ 来自总体 X,E(X)=μ,D(X)=σ² 均有限。

(1) 用切比雪夫不等式证明样本均值 X̄ 是 μ 的相合估计量;
(2) 说明 X̄ 同时具有无偏性和相合性——这两个性质分别保证了什么?

📌 对应模板:题型五 + 题型六(扩展)

点击看答案

(1) 相合性证明

要证明 X̄ →ᵖ μ,即对任意 ε>0:lim_{n→∞} P(|X̄-μ|≥ε)=0

由切比雪夫不等式:
P(|X̄-μ|≥ε) ≤ D(X̄)/ε² = (σ²/n)/ε² = σ²/(nε²)

当 n→∞ 时,σ²/(nε²)→0。因此 X̄→ᵖ μ,即 X̄ 是 μ 的相合估计量。✓

(2) 无偏性与相合性的分工

  • 无偏性 E(X̄)=μ:保证估计量"没有系统偏差"——不管样本大小,多次重复的平均值都瞄准真值。但它不保证某一次估计就准。
  • 相合性 X̄→ᵖ μ:保证"样本越大,估计越准"——随着样本量增加,估计量一定逼近真值。

注意:一个估计量可以相合但有偏。例如分母为 n 的样本方差 Sₙ²=(1/n)∑(Xᵢ-X̄)²:E(Sₙ²)=((n-1)/n)σ²≠σ²(有偏),但当 n→∞ 时 Sₙ²→ᵖ σ²(相合)。这说明"有偏"不一定"不好"——大样本下偏差会消失。


三-3(非标准离散分布的矩+MLE)⭐⭐⭐

设总体 X 的分布律为:
P(X=1)=θ²,P(X=2)=2θ(1-θ),P(X=3)=(1-θ)²,其中 0<θ<1。

X₁,...,Xₙ 为样本,设取值1、2、3的频数分别为 n₁, n₂, n₃(n₁+n₂+n₃=n)。

(1) 求θ的矩估计量;
(2) 求θ的极大似然估计量;
(3) 判断矩估计量是否无偏。

📌 对应模板:题型一(矩估计单参数)+ 题型三(离散型MLE)+ 题型五(无偏性)

点击看答案

(1) 矩估计

先求总体均值:
E(X)=1·θ² + 2·2θ(1-θ) + 3·(1-θ)²
= θ² + 4θ - 4θ² + 3(1-2θ+θ²)
= θ²+4θ-4θ²+3-6θ+3θ² = 3-2θ

令 X̄=3-2θ,解得 θ̂_M=(3-X̄)/2

(2) 极大似然估计(利用频数简化)

L(θ)= (θ²)^{n₁}·[2θ(1-θ)]^{n₂}·[(1-θ)²]^{n₃}
= 2^{n₂}·θ^{2n₁+n₂}·(1-θ)^{n₂+2n₃}

取对数:lnL = n₂ln2 + (2n₁+n₂)lnθ + (n₂+2n₃)ln(1-θ)

求导:d lnL/dθ = (2n₁+n₂)/θ - (n₂+2n₃)/(1-θ)=0

解得:θ̂_L = (2n₁+n₂)/(2n)

(3) 无偏性判断

E(θ̂_M)=E((3-X̄)/2)=(3-E(X̄))/2=(3-(3-2θ))/2=θ

所以 θ̂_M 是θ的无偏估计。✓

本题关键技巧:将样本按取值分组(n₁,n₂,n₃),大幅简化似然函数的书写。


四-2(U(0,θ)——矩估计与MLE对比)⭐⭐⭐

设 X~U(0,θ),θ>0 未知。X₁,...,Xₙ 为样本。

(1) 求θ的矩估计量;
(2) 求θ的极大似然估计量;
(3) 两者是否都是θ的无偏估计?如果不是,请修正。

📌 对应模板:题型一 + 题型四 + 题型五

点击看答案

(1) 矩估计
E(X)=θ/2,令 X̄=θ/2,解得 θ̂_M=2X̄

(2) 极大似然估计
密度 f(x;θ)=1/θ,0<x<θ
L(θ)=∏1/θ=1/θⁿ,约束 θ>max(Xᵢ)
L(θ)=1/θⁿ随θ增大单调递减,所以最大值在边界处:
θ̂_L = max(X₁,...,Xₙ)

(3) 无偏性验证

矩估计:E(θ̂_M)=E(2X̄)=2·θ/2=θ,无偏 ✓

MLE:令 Y=max(Xᵢ),Y的密度 f_Y(y)=n·y^{n-1}/θⁿ,0<y<θ
E(Y)=∫₀ᶿ y·(ny^{n-1}/θⁿ)dy = nθ/(n+1)
所以 E(θ̂_L)=nθ/(n+1)≠θ,有偏(系统偏低)✗

修正:令 θ̂*=(n+1)/n·max(Xᵢ),则 E(θ̂*)=θ,无偏 ✓


四-3(正态两参数MLE)⭐⭐⭐

设 X~N(μ,σ²),μ与σ²均未知。X₁,...,Xₙ为样本。

(1) 求 μ 和 σ² 的极大似然估计量;
(2) μ̂ 和 σ̂² 是否分别是 μ 和 σ² 的无偏估计?

📌 对应模板:题型四 + 题型五

点击看答案

(1) 极大似然估计

密度:f(x;μ,σ²)=(1/√(2πσ²))exp(-(x-μ)²/(2σ²))

第一步——写似然:L=(2πσ²)^{-n/2}·exp(-(1/(2σ²))∑(Xᵢ-μ)²)

第二步——取对数:lnL=-(n/2)ln(2π)-(n/2)ln(σ²)-(1/(2σ²))∑(Xᵢ-μ)²

第三步——求偏导:
对μ:∂lnL/∂μ=(1/σ²)∑(Xᵢ-μ)=0 → μ̂=X̄
对σ²:∂lnL/∂σ²=-n/(2σ²)+(1/(2σ⁴))∑(Xᵢ-μ)²=0 → 代入μ̂得:
σ̂²=(1/n)∑(Xᵢ-X̄)²

(2) 无偏性验证

μ̂=X̄:E(μ̂)=E(X̄)=μ,无偏 ✓

σ̂²=(1/n)∑(Xᵢ-X̄)²:
E(σ̂²)=((n-1)/n)σ²≠σ²,有偏(系统偏低)✗

修正:S²=[1/(n-1)]∑(Xᵢ-X̄)² 才是 σ² 的无偏估计。


六-1(加权平均vs简单平均的有效性比较)⭐⭐⭐

设 X₁,...,Xₙ 来自正态总体 N(μ,σ²)。考虑两个估计量:
μ̂₁ = X̄ = (1/n)∑Xᵢ,μ̂₂ = (1/n)∑aᵢXᵢ(其中 aᵢ≥0 且 ∑aᵢ=n)

(1) μ̂₂ 是否为 μ 的无偏估计?
(2) 比较 μ̂₁ 和 μ̂₂ 的有效性,哪个更好?

📌 对应模板:题型五 + 题型六

点击看答案

(1) 无偏性验证

E(μ̂₂)=E((1/n)∑aᵢXᵢ)=(1/n)∑aᵢE(Xᵢ)=(μ/n)∑aᵢ=μ(因为∑aᵢ=n)

所以μ̂₂也是无偏的。✓

(2) 有效性比较

D(μ̂₁)=σ²/n

D(μ̂₂)=D((1/n)∑aᵢXᵢ)=(1/n²)∑aᵢ²D(Xᵢ)=(σ²/n²)∑aᵢ²

μ̂₁更有效当且仅当 D(μ̂₁)≤D(μ̂₂),即 σ²/n ≤ (σ²/n²)∑aᵢ²,即 n ≤ ∑aᵢ²

由柯西-施瓦茨不等式:(∑aᵢ)² ≤ n∑aᵢ²,即 n² ≤ n∑aᵢ²,所以 n ≤ ∑aᵢ² 恒成立。

等式成立当且仅当所有 aᵢ 都相等,即 a₁=a₂=...=aₙ=1,此时 μ̂₂=X̄=μ̂₁。

结论:简单平均总是比任何加权平均更有效(方差更小),除非所有权重相等(此时两者相同)。这说明等权重平均是估计均值的最优方式。


六-2(无偏估计构造+有效性比较)⭐⭐⭐

设 X~U(0,θ),已知 θ̂_L=max(Xᵢ)是θ的MLE但它是有偏的。

(1) 构造一个基于 θ̂_L 的θ的无偏估计量;
(2) 再构造一个基于 X̄ 的θ的无偏估计量;
(3) 当 n=2 时,比较这两个无偏估计量的有效性。

📌 对应模板:题型五 + 题型六

点击看答案

(1) 基于 max(Xᵢ) 的无偏估计

令 Y=max(X₁,...,Xₙ),密度 f_Y(y)=n·y^{n-1}/θⁿ,0<y<θ
E(Y)=∫₀ᶿ y·(ny^{n-1}/θⁿ)dy = nθ/(n+1)

所以 θ̂₁=[(n+1)/n]·max(Xᵢ),E(θ̂₁)=θ,无偏 ✓

(2) 基于 X̄ 的无偏估计

E(X̄)=θ/2,所以 θ̂₂=2X̄,E(θ̂₂)=θ,无偏 ✓

(3) n=2时的有效性比较

θ̂₁=(3/2)Y(Y=max(X₁,X₂)):
E(Y²)=∫₀ᶿ y²·(2y/θ²)dy = θ²/2
D(Y)=E(Y²)-[E(Y)]²=θ²/2-(2θ/3)²=θ²/18
D(θ̂₁)=(9/4)·(θ²/18)=θ²/8

θ̂₂=2X̄:
D(X̄)=D(X)/2=(θ²/12)/2=θ²/24
D(θ̂₂)=4·(θ²/24)=θ²/6

比较:D(θ̂₁)=θ²/8=0.125θ²,D(θ̂₂)=θ²/6≈0.167θ²
D(θ̂₁)<D(θ̂₂),所以 θ̂₁(基于最大值修正的无偏估计)更有效。

启示:虽然矩估计 θ̂₂=2X̄ 天然无偏,但在均匀分布中,基于最大值的修正估计量 θ̂₁ 更有效(方差更小)。


以上讲的全是点估计——给出一个具体的数值来猜参数。但点估计有一个天然的缺点:你不知道它离真值到底有多远。比如你估计平均重量是 48 克,但真实值可能是 50 克,可能是 46 克——你完全没概念。下面要讲的区间估计就是为了解决这个问题:既然没法保证一个点恰好猜中,那就干脆给一个范围,同时告诉你这个范围的把握有多大。


1.12 置信区间的构造逻辑——枢轴量法

① 生活场景

🌤️ 早上听天气预报:"今天气温 22°C 到 28°C,降水概率 5%。"你听了之后知道两件事:第一,今天大概在 22 到 28 度之间(一个范围,而不是一个孤零零的数字);第二,预报说这个范围有 95% 的把握(不是 100%)。

为什么天气预报不直接说"今天 26°C"?因为天气是波动的——预报员也知道自己不可能精确到一个点。给一个范围更诚实:"我没法说一定是 26 度,但 22 到 28 度这个范围我有 95% 的把握。"

这就是区间估计的核心思想:与其猜一个点(然后几乎一定猜错),不如给一个范围,同时告诉你这个范围有多靠谱。就像用渔网捞鱼——网覆盖一个范围,网越大捞到鱼的概率越高,但网太大也没意义(你说"鱼在太平洋里"虽然 100% 正确,但等于没给信息)。

② 正式陈述

对于未知参数 θ,给定置信水平 1-α(0 < α < 1),如果由样本确定的两个统计量 θ̂_L 和 θ̂_U 满足:

$$P(\hat{θ}_L \leq θ \leq \hat{θ}_U) = 1-α$$

则称区间 [θ̂_L, θ̂_U] 为 θ 的置信水平为 1-α 的置信区间。

在数学三中,区间估计只考单个正态总体的情况(均值和方差的区间估计)。

③ 构造推导——枢轴量法

构造置信区间的通用方法是枢轴量法。整个思路分三步:

🧠 第1步:找一个"枢纽"——枢轴量

枢轴量是一个由样本和未知参数 θ 共同构成的量,但它的分布是完全已知的(不依赖于任何未知参数)。

最常见的例子:X₁, ..., Xₙ ~ N(μ, σ²),σ² 已知。

考虑 (X̄ - μ) / (σ/√n) —— 这里面含有 μ(未知参数)和 X̄(样本),但它服从标准正态分布 N(0,1)(完全已知,不依赖 μ)。

大白话:枢轴量就像一个"已知刻度的尺子"。我不知道尺子上"我的身高"在哪个刻度(μ 未知),但我确切知道这把尺子每一厘米的标记在哪儿(分布已知——N(0,1))。我可以用这把尺子反向"量"出 μ 的位置。

🧠 第2步:用已知分布写概率不等式

既然枢轴量 ~ N(0,1),那它落在 [-z_{α/2}, z_{α/2}] 之间的概率就是 1-α:

$$P\left(-z_{\alpha/2} \leq \frac{\bar{X} - \mu}{\sigma/\sqrt{n}} \leq z_{\alpha/2}\right) = 1-\alpha$$

这一步把所有的不确定性都"转嫁"到了已知的 N(0,1) 分布上——z_{α/2} 是可以查表得到的常数(如 95% 时 z_{0.025}=1.96)。

大白话:我知道"距离均值不超过 1.96 个标准差"这件事的概率是 95%——这是标准正态分布的性质,不依赖任何未知数。我利用这个"已知真相"来框住未知的 μ。

🧠 第3步:解不等式,把 θ "解放"到中间

把不等式从"枢轴量在中间"的形式,通过代数变形变成"θ 在中间"的形式。

从 P(-z_{α/2} ≤ (X̄-μ)/(σ/√n) ≤ z_{α/2}) = 1-α 出发:

三行推导(看三行就明白区间为什么长这样):

第1行——两边同乘 σ/√n(正数,不等号方向不变):
$$P\left(-z_{\alpha/2} \cdot \frac{\sigma}{\sqrt{n}} \leq \bar{X}-\mu \leq z_{\alpha/2} \cdot \frac{\sigma}{\sqrt{n}}\right) = 1-\alpha$$

第2行——两边同减 X̄(把 μ 前面的负号翻过来):
$$P\left(-\bar{X} - z_{\alpha/2} \cdot \frac{\sigma}{\sqrt{n}} \leq -\mu \leq -\bar{X} + z_{\alpha/2} \cdot \frac{\sigma}{\sqrt{n}}\right) = 1-\alpha$$

第3行——同乘 -1(不等号方向反转,左右对调):
$$P\left(\bar{X} - z_{\alpha/2} \cdot \frac{\sigma}{\sqrt{n}} \leq \mu \leq \bar{X} + z_{\alpha/2} \cdot \frac{\sigma}{\sqrt{n}}\right) = 1-\alpha$$

于是 μ 的 1-α 置信区间为:

$$\bar{X} \pm z_{\alpha/2} \cdot \frac{\sigma}{\sqrt{n}}$$

大白话:三步代数变形就是"把 μ 从公式中间挖出来"。最开始 μ 被 X̄、σ、√n 层层包住;我一步步把包在外面的东西移到不等号两侧,最后 μ 一个人站在中间——两边的边界就是置信区间的上下限。

用一个具体数字跑一遍:滚珠直径 X ~ N(μ, 0.06),抽了 n=6 个,x̄=14.95。求 μ 的 95% 置信区间。

✍️ 立刻练一道(把"三行推导"反过来走一遍):

滚珠直径 X ~ N(μ, 0.06),又抽了 n=9 个,x̄ = 15.02。求 μ 的 90% 置信区间(已知 z_{0.05} = 1.645)。

提示:套路就是"X̄ ± z_{α/2} · σ/√n"——σ = √0.06,n = 9,α/2 = 0.05。

点开看答案

X̄ ± z_{0.05}·σ/√n = 15.02 ± 1.645 × √0.06/3 = 15.02 ± 1.645 × (0.245/3) = 15.02 ± 1.645 × 0.0816 ≈ 15.02 ± 0.134 → 区间 [14.886, 15.154]。和你刚看的例题对比:置信水平从 95% 降到 90%(z 从 1.96 变小到 1.645),区间就变窄了——这就是"置信水平与区间宽窄"的取舍。

④ 📝 复盘:枢轴量法的本质

枢轴量法的核心思想用一句话概括:"把对 θ 的不确定转嫁到已知分布的随机变量上"。

我不知道 μ 是多少——这是不确定性的来源。但我发现 (X̄-μ)/(σ/√n) 服从标准正态——这个事实不容置疑。于是我利用这个"已知事实"写出一个概率等式,再把 θ 从不等式中解出来。

流程就是三步循环:找枢轴量(分布已知的量)→ 写概率不等式(用已知分布的分位数)→ 解出 θ 范围(代数变形)。

不同的参数估计问题,只是枢轴量不同:

估计目标 条件 枢轴量 服从分布
均值 μ σ² 已知 (X̄-μ)/(σ/√n) N(0,1)
均值 μ σ² 未知 (X̄-μ)/(S/√n) t(n-1)
方差 σ² 总体正态 (n-1)S²/σ² χ²(n-1)

⑤ ⚠️ 易错边界

⚠️ 易错1:置信水平不是"θ 有 95% 的概率落入区间"!

这是最常见的误解。正确的理解是:θ 是固定的常数(虽然你不知道),区间是随机的(依赖样本)。 95% 置信水平的意思是:如果你重复抽样 100 次,每次都算一个区间,大约 95 个区间会包含 θ,大约 5 个不包含。

类比:靶子是固定的(μ),你射出的箭是一段线段(区间)。95% 置信水平 = 射 100 箭,大约 95 箭盖住靶子。靶子本身不会"以某种概率移动"。

⚠️ 易错2:σ² 已知用 Z 分布,σ² 未知用 t 分布!

这是考试中最容易丢分的地方。判断标准不是"题目有没有提 σ²",而是"题目有没有给 σ² 的具体数值":

道理:z 需要真实的 σ 代入公式。不知道 σ 就只能用 S 凑合,但 S 本身有误差 → 分布从精确的 z 变成尾巴更厚的 t → 区间更宽。

⚠️ 易错3:单侧和双侧用的分位数不同!

理由:双侧把 5% 的错误率分成左右各 2.5%,两侧都要控制;单侧把 5% 全放在一边。单侧的分位数更小,区间界限更"紧"。

⚠️ 易错4:置信区间不是唯一的——宽窄是取舍

同一个置信水平下,你可以构造不同的置信区间。但好的置信区间要在保证置信水平的前提下,尽可能窄(精确)。比如用 X̄ 构造的区间比只用 X₁ 构造的区间更窄——因为 X̄ 利用了全部 n 个样本的信息。

⑥ 在整条链中的位置

第6章 抽样分布                  枢轴量法(本节)
  Z ~ N(0,1)             ←──    找"分布已知的量"
  t ~ t(n-1)                    用它框住未知参数
  χ² ~ χ²(n-1)                        ↓
  F ~ F(n₁-1,n₂-1)             具体场景区间估计
                               σ²已知(1.13)/ σ²未知(1.14)
                               方差(1.15)/ 单侧(1.16)/ 双总体(1.17)

枢轴量法是整个区间估计的"发动机"。没有它,后面所有具体场景的置信区间公式都无从推导。它的核心思想——"把对参数的未知转嫁到对分布的已知上"——是统计推断中最漂亮的思路之一。本节用 Z 分布做示范,后面每种场景只是换了一把"尺子"(t/χ²/F),操作流程完全一样。


1.13 σ²已知时,正态均值μ的置信区间

生活比喻:你知道一台机器生产的产品重量服从正态分布,而且这台机器的"稳定性"(方差 σ²)是已知的(比如出厂说明书上写了标准差是5克)。由于你知道σ,你可以确定样本均值 X̄ 偏离真值 μ 的程度不会太大。

先看一道题,试着做一下:

题目:某种电子元件使用寿命 X~N(μ,400)。随机抽取25个,测得平均寿命 x̄=1600小时。求 μ 的95%置信区间。(已知 z_{0.025}=1.96)

难在哪? 上节 1.12 已经帮你推导出了"X̄ ± z_{α/2}·σ/√n"这个公式——现在只需把它当"菜谱"照做:找出 σ(题目给的是方差 400,所以 σ=20)、n(25)、置信水平(95% → z_{0.025}=1.96),然后代进去。

🧠 这一步在想什么:这种题就是"套公式",但套之前要练就一双火眼金睛——σ² 是"已知"还是"未知"? 判断标准不是题目有没有提 σ²,而是有没有给 σ² 的具体数字。这题给了"400",那就是已知 → 用 z 分布。这个判断是后面几节反复要用的岔路口,先记住。

公式(使用标准正态分布 z 分布):
μ 的 1-\alpha 置信区间:X̄ ± z_{\alpha/2} · σ/√n

其中 z_{\alpha/2} 是标准正态分布的上 \alpha/2 分位数。

常用 z_{\alpha/2} 值:

置信水平 1-\alpha \alpha z_{\alpha/2}
90% 0.10 1.645
95% 0.05 1.96
99% 0.01 2.576

整体思路是这样的:我们知道 (X̄-μ)/(σ/√n) 服从标准正态分布 N(0,1),所以它落在 [-z_{\alpha/2}, z_{\alpha/2}] 之间的概率是 1-\alpha。

👁️→🧠→✍️ 推导过程(看三行,你就明白区间为什么长这样):

$$P\left(-z_{\alpha/2} \leq \frac{\bar{X}-\mu}{\sigma/\sqrt{n}} \leq z_{\alpha/2}\right) = 1-\alpha$$

第1行——两边同乘 σ/√n(把分母消掉):
$$P\left(-z_{\alpha/2} \cdot \frac{\sigma}{\sqrt{n}} \leq \bar{X}-\mu \leq z_{\alpha/2} \cdot \frac{\sigma}{\sqrt{n}}\right) = 1-\alpha$$

第2行——两边同减 X̄(把 μ 前面的负号翻过来):
$$P\left(-\bar{X} - z_{\alpha/2} \cdot \frac{\sigma}{\sqrt{n}} \leq -\mu \leq -\bar{X} + z_{\alpha/2} \cdot \frac{\sigma}{\sqrt{n}}\right) = 1-\alpha$$

第3行——同乘 -1(不等号方向反转,左右对调):
$$P\left(\bar{X} - z_{\alpha/2} \cdot \frac{\sigma}{\sqrt{n}} \leq \mu \leq \bar{X} + z_{\alpha/2} \cdot \frac{\sigma}{\sqrt{n}}\right) = 1-\alpha$$

于是置信区间就是 X̄ ± z_{\alpha/2} · σ/√n。三行推导,核心就是"解不等式把 μ 放中间"。

回到刚才那道题——用刚学完的公式把它算完(这就是配套练习七-1,答案藏在折叠里,先自己算一遍再看):

七-1(σ²已知的均值区间估计)⭐⭐

某种电子元件使用寿命 X~N(μ,400)。随机抽取25个,测得平均寿命 x̄=1600小时。求 μ 的95%置信区间。(已知 z_{0.025}=1.96)

📌 对应模板:题型七(σ²已知的均值区间估计)

点击看答案

已知:σ²=400(σ=20),n=25,x̄=1600,\alpha=0.05,z_{0.025}=1.96

σ²已知,用 z 分布公式:
x̄ ± z_{\alpha/2}·σ/√n = 1600 ± 1.96×20/√25 = 1600 ± 1.96×4 = 1600 ± 7.84

置信区间:[1592.16, 1607.84]

在95%置信水平下,该元件平均使用寿命在1592.16到1607.84小时之间。

✍️ 立刻练一道(换个数字,把 z 公式再使一遍):

某型号灯泡寿命 X ~ N(μ, 64),抽 n = 36 只,平均寿命 x̄ = 980 小时。求 μ 的 99% 置信区间(已知 z_{0.005} = 2.576)。

提示:σ = √64 = 8,n = 36,99% → z_{α/2} = z_{0.005} = 2.576,套 X̄ ± z_{α/2}·σ/√n。

点开看答案

980 ± 2.576×8/√36 = 980 ± 2.576×8/6 = 980 ± 2.576×1.333 ≈ 980 ± 3.435 → 置信区间 [976.565, 983.435]。注意:置信水平越高(99% 的 z = 2.576 大于 95% 的 z = 1.96),区间越宽——"把握越大,范围越宽"。


1.14 σ²未知时,正态均值μ的置信区间

生活比喻:现实中更常见的情况是:你不仅不知道均值 μ,你也不知道方差 σ²(机器说明书丢了)。这时候前面的公式用不了——因为你不知道 σ 是多少。

先卡一下:σ 不知道,公式还能用吗?

上节公式 X̄ ± z_{α/2}·σ/√n 里明晃晃地躺着一个 σ——可你现在不知道 σ。怎么办?

🧠 这一步在想什么:巧了,我们手里有样本——可以算一个"样本标准差 S"来顶替 σ。但天下没有免费的午餐:S 每次抽样都在"乱晃"(运气好时偏小,运气差时偏大),用它代替 σ 就多了一份不确定性。所以 (X̄-μ)/(S/√n) 不再服从标准正态分布,而是服从 t 分布(自由度为 n-1)——这就是第6章引入 t 分布的原因。

t 分布是什么? t 分布看起来和标准正态分布很像(也是钟形、对称的),但它的"尾巴更厚"——这意味着用 S 代替 σ 带来了额外的不确定性,所以置信区间要比 σ 已知时宽一些。

"尾巴更厚"到底意味着什么? 想象你用样本标准差 S 代替 σ——S 本身每次抽样都在"乱晃"(运气好时 S 偏小,运气差时 S 偏大),所以 X̄ 的波动比你想象中更大。t 分布比 z 分布在两端(极端值区域)给了更高的概率,就是为了"兜住"这种额外的波动。付出的代价就是:t 的分位数比 z 大(如 t₀.₀₂₅(10)=2.228 > z₀.₀₂₅=1.96),置信区间就更宽。当样本量 n 很大时(n>30),S 基本就稳定了,t 分布也就趋近于标准正态分布,两者的差距消失。

公式(使用 t 分布):
μ 的 1-\alpha 置信区间:X̄ ± t_{\alpha/2}(n-1) · S/√n

注意这里的 S 是样本标准差:S = √[1/(n-1)]∑(Xᵢ-X̄)²,分母是 n-1 的版本。

两个公式的对比:

条件 使用分布 公式
σ² 已知 标准正态 N(0,1) X̄ ± z_{\alpha/2} · σ/√n
σ² 未知 t 分布 t(n-1) X̄ ± t_{\alpha/2}(n-1) · S/√n

例题:同上题数据但 σ² 未知,样本标准差 S=0.2258。
解:14.95 ± 2.571 × 0.2258/√6 = 14.95 ± 0.237,即 [14.713, 15.187]
对比 σ² 已知时的 [14.754, 15.146],未知时的区间更宽。

📌 傻瓜判断法(把刚才的"火眼金睛"总结成一句):有数字用 z,没数字用 t。 题目给了 σ 或 σ² 的具体数值 → 用 z;没给、只给了样本标准差 S 或要你自己算 → 用 t。

✍️ 立刻练一道(σ² 未知的完整流程,这就是配套练习八-1):

八-1(σ²未知的均值区间估计)⭐⭐

同上题数据,但假设总体方差未知。25个元件的样本标准差 S=22 小时。求 μ 的95%置信区间。(已知 t_{0.025}(24)=2.064)

📌 对应模板:题型八(σ²未知的均值区间估计)

点击看答案

已知:n=25,x̄=1600,S=22,df=24,t_{0.025}(24)=2.064

σ²未知,用 t 分布公式:
x̄ ± t_{\alpha/2}(n-1)·S/√n = 1600 ± 2.064×22/√25 = 1600 ± 2.064×4.4 = 1600 ± 9.082

置信区间:[1590.92, 1609.08]

对比:σ²已知时的区间 [1592.16, 1607.84] 更窄,而未知时的区间更宽。这是因为用 S 代替 σ 付出了"代价"——t值(2.064)大于 z 值(1.96)。

✍️ 立刻练一道(σ² 未知,自己走一遍 t 公式):

某批次零件长度 X ~ N(μ, σ²),σ² 未知。抽 n = 9 个,样本均值 x̄ = 52,样本标准差 S = 3。求 μ 的 95% 置信区间(已知 t_{0.025}(8) = 2.306)。

提示:自由度 n-1 = 8,套 X̄ ± t_{α/2}(n-1)·S/√n。

点开看答案

52 ± 2.306×3/√9 = 52 ± 2.306×1 = 52 ± 2.306 → 置信区间 [49.694, 54.306]。如果误用了 z 公式(z_{0.025}=1.96),会得到 52 ± 1.96 = [50.04, 53.96]——区间明显更窄,但那是不诚实的:你低估了"用 S 代替 σ"的额外不确定性。


1.15 正态方差σ²的置信区间

① 生活场景

🏭 你是一家螺丝厂的质量检测员。你不光关心螺丝的平均长度(μ)是否达标——你还关心每批螺丝长度是否均匀(σ²)。一台好机器做出的螺丝,长度应该都差不多(σ² 小);一台老化的机器,做出的螺丝忽长忽短(σ² 大)。

你随机抽了 20 个螺丝,算出它们的长度波动程度 S² = 0.04。但 S² 只是这批样本的波动——整批螺丝真正的波动 σ² 可能是多少?你希望说"整批螺丝的方差在 0.02 到 0.09 之间,95% 把握"。

这就是方差的区间估计。和估计均值不同,方差用的枢轴量服从卡方分布(χ²)——而且卡方分布是偏的(右边拖一条长尾巴,不对称),所以上下限的处理和均值完全不同。

② 正式陈述

设总体 X ~ N(μ, σ²),样本方差 S² = [1/(n-1)]∑(Xᵢ-X̄)²。枢轴量为:

$$\frac{(n-1)S^2}{\sigma^2} \sim \chi^2(n-1)$$

利用卡方分布的分位数,σ² 的 1-α 置信区间为:

$$\sigma^2 \in \left[\frac{(n-1)S^2}{\chi^2_{\alpha/2}(n-1)},; \frac{(n-1)S^2}{\chi^2_{1-\alpha/2}(n-1)}\right]$$

关键差异:和均值的置信区间(形式为"X̄ ± 分位数 × 标准误")不同,方差区间不对称——上下限是分别用两个不同的分位数算出来的,不存在"±"这种对称写法。原因是卡方分布本身不对称(右偏)。

③ 完整推导

🧠 第1步:找枢轴量

对于正态总体 N(μ, σ²),样本方差 S² 满足:

$$\frac{(n-1)S^2}{\sigma^2} \sim \chi^2(n-1)$$

大白话:(n-1)S²/σ² 这个量,不依赖任何未知参数,它服从自由度为 n-1 的卡方分布——这是已知的、确定的。它就是估计 σ² 的"枢轴量"。

卡方分布长什么样? 它是若干个独立标准正态随机变量的平方和服从的分布。形状右偏——左边被 0 截断(方差不能为负),右边拖一条长尾巴。关键是:它不对称! 所以取分位数时,左右两边用不同的值,不像 z 分布两边对称都用 ±z_{α/2}。

🧠 第2步:用已知分布写概率不等式

既然枢轴量 ~ χ²(n-1),它落在两个分位数之间的概率是 1-α:

$$P\left(\chi^2_{1-\alpha/2}(n-1) \leq \frac{(n-1)S^2}{\sigma^2} \leq \chi^2_{\alpha/2}(n-1)\right) = 1-\alpha$$

大白话:"这个枢轴量有 95% 的概率落在卡方分布的两个分位数之间"——这是卡方分布的性质,铁板钉钉。χ²_{α/2} 是右边的分位数(数值较大),χ²_{1-α/2} 是左边的分位数(数值较小)。因为分布不对称,两边数值不一样。

🧠 第3步:解不等式,把 σ² 翻到中间

从 P(χ²_{1-α/2} ≤ (n-1)S²/σ² ≤ χ²_{α/2}) = 1-α 出发。

不等式中 σ² 在分母——需要用倒数不等式技巧:a ≤ 1/x ≤ b(其中 a, b > 0)等价于 1/b ≤ x ≤ 1/a。

大白话:σ² 在分母上,倒数回去要把不等号方向反过来,左右也会对调。解出来的结果:σ² 在上面、分位数在下面——"大的分位数做分母得小值(下限),小的分位数做分母得大值(上限)"。

最终结果:

$$\sigma^2 \in \left[\frac{(n-1)S^2}{\chi^2_{\alpha/2}(n-1)},; \frac{(n-1)S^2}{\chi^2_{1-\alpha/2}(n-1)}\right]$$

用一个数字例子走一遍:n = 16,S² = 6.25,95% 置信水平。

结果:σ² 的 95% 置信区间为 [3.411, 14.971]。

大白话:9 号分位数(27.488)大 → 做分母 → 商小 → 下限 3.411。9 号分位数(6.262)小 → 做分母 → 商大 → 上限 14.971。大小互换:大分位数得小商(下限),小分位数得大商(上限)。

✍️ 立刻练一道(把"大小互换"用一遍):

从正态总体 N(μ, σ²) 中抽取容量 n=8 的样本,测得 S² = 0.36。求 σ² 的 95% 置信区间(已知 χ²_{0.025}(7) = 16.013,χ²_{0.975}(7) = 1.690)。

提示:三步走——① 确认总体正态、确定枢轴量 (n-1)S²/σ² ~ χ²(n-1);② 两个分位数:大 16.013 / 小 1.690;③ 代入公式,注意"大小互换"。

点开看答案

下限(用较大的分位数做分母):(7×0.36)/16.013 = 2.52/16.013 ≈ 0.157;上限(用较小的分位数做分母):(7×0.36)/1.690 = 2.52/1.690 ≈ 1.491。所以 σ² 的 95% 置信区间为 [0.157, 1.491]。这就是"大分位数得下限、小分位数得上限"——和你刚看懂的例题同一个套路。

方差区间估计的配套练习(真题原貌):

九-1(方差区间估计)⭐⭐

从正态总体 N(μ,σ²) 中抽取容量16的样本,测得 S²=6.25。求 σ² 的95%置信区间。
(已知 χ²_{0.025}(15)=27.488,χ²_{0.975}(15)=6.262)

📌 对应模板:题型九(方差区间估计)

点击看答案

n=16,df=15,S²=6.25

下限(用较大的分位数做分母):(15×6.25)/27.488 = 93.75/27.488 ≈ 3.411

上限(用较小的分位数做分母):(15×6.25)/6.262 = 93.75/6.262 ≈ 14.971

σ²的95%置信区间:[3.411, 14.971]

延伸:如果要 σ 的置信区间,只需对上下限分别开平方:
σ ∈ [√3.411, √14.971] ≈ [1.847, 3.869]

④ 📝 复盘:方差区间估计三步走

步骤 操作 关键词
1 确认总体正态,确定枢轴量 (n-1)S²/σ² ~ χ²(n-1) 卡方分布
2 查表得两个分位数:χ²_{α/2}(大)和 χ²_{1-α/2}(小) 不对称,两个值
3 代入公式,注意"大小互换"——大分位得下限,小分位得上限 最容易搞反的一步!

对比均值区间估计:均值用了 z 或 t,对称分布,上下限是"X̄ ± 分位数 × 标准误",形式对称。方差用卡方,不对称,上下限是两个独立的商,不存在"±"这种对称形式。

⑤ ⚠️ 易错边界

⚠️ 易错1:上下限搞反!(最高频翻车点)

这是整个区间估计中最容易犯的错误。记住口诀:大小互换——大的分位数(χ²_{α/2})做分母得到小的商(下限),小的分位数(χ²_{1-α/2})做分母得到大的商(上限)。很多同学顺手把大的分位数放到上限位置——这是错的!

验算技巧:算完后检查——上限应该大于下限。如果上限 < 下限,说明你搞反了。

⚠️ 易错2:卡方分布不对称,不能像 z/t 那样写"±"!

均值区间是 X̄ ± 分位数 × 标准误,上下限对称。方差区间没有"±"——上下限是分别算出来的两个独立的数,因为它们用的分位数不同。

⚠️ 易错3:自由度是 n-1,不是 n!

和 t 分布一样,卡方分布的自由度也是 n-1(因为用 X̄ 代替 μ 损失了一个自由度)。公式里是 χ²(n-1),不是 χ²(n)。

⚠️ 易错4:求 σ 的置信区间只需开根号

如果需要 σ(标准差)而不是 σ²(方差)的置信区间,只需对方差区间的上下限分别开平方:σ ∈ [√下限, √上限]。不需要重新构造区间。

⑥ 在整条链中的位置

第6章 χ² 分布                方差区间估计(本节)
  (n-1)S²/σ² ~ χ²(n-1)  ←──  用卡方分布做枢轴量
                                    ↓
枢轴量法(1.12)                  和均值区间对比:
  三步:找枢轴→写概率→解不等式      均值用 Z/t(对称,写 ±)
                                   方差用 χ²(不对称,上下限分开算)

方差区间估计是区间估计中最容易搞反上下限的一节。原因在于 χ² 分布不对称——不像 Z/t 分布那样左右对称可以直接写"±",必须分别用大分位数和小分位数做分母。和前面的均值区间估计(1.13、1.14)对照着学,记住"均值对称写 ±,方差不对称分开算"即可。


1.16 单侧置信区间——"只防一边"

① 生活场景

🔋 你买了一个充电宝,商家宣传"充满电后至少能用 8 小时"。这里的"至少 8 小时"就是一个单侧置信下限——你只关心最少能用多久,不关心最多能用多久。比你预期的长当然更好,不用设上限。

反过来:食品安全检测中某有害物质"不得超过 0.5 mg/kg"——这是单侧置信上限,只关心最多含多少。比 0.5 低当然更好,不用设下限。

而前面 1.12-1.15 讲的都是双侧置信区间——"平均寿命在 1500 到 1600 小时之间",两边都要控制。双侧回答的是"在什么范围之间",单侧回答的是"至少/至多是多少"。

大白话:双侧 = 你同时防左边和右边("大概在哪儿");单侧 = 你只防一边("至少怎样"或"至多怎样")。什么时候用单侧?当你只关心"够不够好"(寿命下限)或"有没有超标"(污染上限)的时候。

② 正式陈述

对于未知参数 θ,给定置信水平 1-α:

与双侧的核心区别:

双侧 单侧
错误率 α 的分配 左右各 α/2 全部放在关心的一侧
分位数(σ²已知) z_{α/2}(如 95%→1.96) z_α(如 95%→1.645)
区间形式 [L, U] 两端有限 [L, +∞) 或 (-∞, U] 一端无限

因为单侧不劈半(z_α < z_{α/2}),所以单侧界限比双侧更"紧"(更靠近 X̄)——代价是你完全放弃了另一边的保护。

③ 完整推导

🧠 第1步:单侧和双侧的本质区别——错误率放在哪里

双侧区间把总错误率 α 分成两半——左右各 α/2。因为你要同时保证"不太小"和"不太大"。

单侧区间只关心一边,所以把全部 α 都放在你关心的那一边。你只关心下限时,全部 α 压在左边(怕低估);只关心上限时,全部 α 压在右边(怕高估)。

大白话:双侧 = 5% 的错误率劈成左右各 2.5%("两边都防")。单侧 = 5% 全部堆在一边("只防这一头")。因为单侧不用分一半,所以分位数更小,界限更"紧"。

🧠 第2步:分位数的选择——这是最常考的区别

双侧区间 单侧区间
分位数 z_{α/2} z_α
95% 时用的值 z_{0.025} = 1.96 z_{0.05} = 1.645

大白话:双侧用的是"劈半"后的分位数(0.025),单侧用原值(0.05)。因为单侧不劈半,所以 1.645 < 1.96——单侧的界限比双侧更"紧"(更靠近 X̄)。

🧠 第3步:公式对比——只改分位数,结构不变

双侧(σ² 已知):
$$\bar{X} \pm z_{\alpha/2} \cdot \frac{\sigma}{\sqrt{n}}$$

单侧下限(σ² 已知):至少是多少?
$$\mu \geq \bar{X} - z_{\alpha} \cdot \frac{\sigma}{\sqrt{n}} \quad \Rightarrow \quad [\bar{X} - z_{\alpha} \cdot \frac{\sigma}{\sqrt{n}},; +\infty)$$

单侧上限(σ² 已知):至多是多少?
$$\mu \leq \bar{X} + z_{\alpha} \cdot \frac{\sigma}{\sqrt{n}} \quad \Rightarrow \quad (-\infty,; \bar{X} + z_{\alpha} \cdot \frac{\sigma}{\sqrt{n}}]$$

大白话:公式结构和双侧一样,只是 z_{α/2} 换成了 z_α,区间从"双向有限"变成了"一头无限"。σ² 未知时,z 换成 t 即可——同样的逻辑。

用一个数字例子走一遍:电池续航 X ~ N(μ, 100),n = 25,x̄ = 480 小时。

注意:单侧下限 476.71 > 双侧下限 476.08。因为单侧不劈半(1.645 < 1.96),所以下限更高、更"紧"。

✍️ 立刻练一道(单侧 vs 双侧的分位数,用一遍):

奶粉罐标注净含量 X ~ N(μ, 25),监管部门抽了 n=100 罐,平均实测 x̄ = 498 克,要确保"平均净含量不少于 497 克"。求 μ 的 95% 单侧置信下限(已知 z_{0.05} = 1.645),并判断"497 克"这条线是否被满足。

提示:单侧下限 = x̄ - z_α·σ/√n,注意用的是 z_α(0.05)不是 z_{α/2}(0.025)。

点开看答案

单侧置信下限:498 - 1.645×5/√100 = 498 - 1.645×0.5 = 498 - 0.8225 = 497.18 → μ 的 95% 单侧置信区间为 [497.18, +∞)。因为 497.18 > 497,满足"不少于 497 克"这条线。要是不小心用了双侧的 z_{0.025}=1.96,下限会算成 497.02——数值看着差别不大,但考场上分位选错就是整道题扣分。

④ 📝 复盘:什么时候用单侧?

场景 用单侧哪个 为什么
产品寿命、电池续航、灯泡使用时间 单侧下限 只关心"至少能用多久",越长越好
污染物含量、零件误差、不良率 单侧上限 只关心"最多超标多少",越低越好
均值的一般性估计、学术研究报告 双侧 需要同时给出上下限,更完整

核心判断:问自己——"我只在乎一边吗?" 如果答案是"是",用单侧;如果是"我想知道大概在什么范围之间",用双侧。

单侧区间的配套练习(真题原貌):

八-2(单侧置信区间)⭐⭐

某种电池续航 X~N(μ,100)。随机取 n=25 个,测得平均续航 x̄=480 小时。

(1) 求 μ 的95%单侧置信下限(至少多少);
(2) 求 μ 的95%单侧置信上限(至多多少)。(已知 z_{0.05}=1.645)

📌 对应模板:题型七(变体——单侧)

点击看答案

单侧与双侧的关键区别:双侧用 z_{\alpha/2},单侧用 z_\alpha。

(1) 单侧置信下限:
x̄ - z_\alpha·σ/√n = 480 - 1.645×10/√25 = 480 - 3.29 = 476.71
μ的95%单侧置信区间:[476.71, +∞),有95%把握认为电池平均续航至少476.71小时。

(2) 单侧置信上限:
x̄ + z_\alpha·σ/√n = 483.29
μ的95%单侧置信区间:(-∞, 483.29]

对比双侧:双侧95%置信区间为 [476.08, 483.92],比单侧的组合范围更宽——因为双侧需要两边同时控制错误率。

⑤ ⚠️ 易错边界

⚠️ 易错1:单侧也用 z_{α/2}!(最高频翻车点)

🚨 求 95% 单侧置信下限时,习惯性地用 z_{0.025} = 1.96——这是错的!单侧只防一边,不需要把 α 劈成两半。95% 单侧用 z_{0.05} = 1.645,双侧才用 z_{0.025} = 1.96。

口诀:"双侧劈两半,单侧全放一边。" 双侧 5% → 左右各 2.5% → z_{0.025} = 1.96。单侧 5% → 全放一边 → z_{0.05} = 1.645。

⚠️ 易错2:单侧下限和双侧下限的数值关系

因为 z_α < z_{α/2}(如 1.645 < 1.96),所以单侧下限比双侧下限更大(更靠近 X̄),单侧上限比双侧上限更小。单侧给的范围更"紧"——但代价是你完全放弃了另一边的保护。

⑥ 在整条链中的位置

双侧区间(1.12-1.15)          单侧区间(本节)
  "大概在什么范围之间"     ←──  只关心一边时用
  错误率 α 左右各半              错误率 α 全放一边
  z_{α/2}、t_{α/2}              z_α、t_α(不劈半!)
                                    ↓
                              实际工程应用
                              寿命下限 / 污染上限 / 强度至少多少

单侧区间不是"新方法",而是双侧区间的"变体"。唯一的变化是:不把 α 劈成两半,而是全部压在关心的一侧。公式结构完全一样,只是分位数从 z_{α/2} 换成 z_α。考研中偶尔以选择题出现,关键是记住"双侧劈两半,单侧全放一边"。


1.17 两个正态总体——均值差和方差比的置信区间

⚠️ 低频考点:本节在考研数学三中近10年未直接考查,了解即可(与第6章"两总体补充结论"口径一致)。重点是 1.12~1.16 的单总体区间估计。

① 生活场景

🏭 工厂有两条生产线 A 和 B,都生产同一种螺丝。你想知道两条件产线的平均长度是否有差别——是 A 线更长还是 B 线更长?差别有多大?或者你想知道两条产线哪条更稳定(方差更小)?

你从 A 线抽 n₁ 个螺丝,从 B 线抽 n₂ 个螺丝。两个样本、两个总体——前面 1.12-1.16 讲的全是单个总体,现在要同时处理两个。

🧠 这一步在想什么:别慌,思路一点没变——还是那三步**"找枢轴量 → 写概率不等式 → 解出参数"**(1.12 节的发动机)。唯一的新东西是:待估参数从"一个人的身高"变成了"两个人的身高差",枢轴量里多装了一个样本。至于怎么把 X̄₁ - X̄₂ 的方差写对,用的是第3章/第4章的旧知识——独立随机变量的差的方差 = 方差之和。

大白话:前面是"猜一个人的身高",现在是"猜两个人的身高差"——你需要同时用到两个样本的信息。思路不变(枢轴量法),只是枢轴量变成了包含两个样本统计量的形式。

② 正式陈述

设两个独立正态总体:X₁ ~ N(μ₁, σ₁²),X₂ ~ N(μ₂, σ₂²)。样本量分别为 n₁、n₂。

场景一:均值差 μ₁-μ₂ 的置信区间(σ₁², σ₂² 已知)

枢轴量服从标准正态:
$$\frac{(\bar{X}_1 - \bar{X}_2) - (\mu_1 - \mu_2)}{\sqrt{\frac{\sigma_1^2}{n_1} + \frac{\sigma_2^2}{n_2}}} \sim N(0, 1)$$

置信区间:
$$\mu_1 - \mu_2 \in \left[(\bar{X}_1 - \bar{X}2) \pm z{\alpha/2} \cdot \sqrt{\frac{\sigma_1^2}{n_1} + \frac{\sigma_2^2}{n_2}}\right]$$

场景二:方差比 σ₁²/σ₂² 的置信区间

枢轴量服从 F 分布:
$$\frac{S_1^2/\sigma_1^2}{S_2^2/\sigma_2^2} \sim F(n_1-1,; n_2-1)$$

置信区间(注意"大小互换"——和卡方同样的不对称逻辑):
$$\frac{\sigma_1^2}{\sigma_2^2} \in \left[\frac{S_1^2/S_2^2}{F_{\alpha/2}(n_1-1, n_2-1)},; \frac{S_1^2/S_2^2}{F_{1-\alpha/2}(n_1-1, n_2-1)}\right]$$

核心规律:双总体和单总体的区别,仅仅是标准误从一项变成了两项的叠加。单总体是 σ/√n,双总体是 √(σ₁²/n₁ + σ₂²/n₂)。其余逻辑(枢轴量 → 分位数 → 解不等式)和单总体完全一样。

③ 完整推导

下面讲两个最常用的场景。考研数学三通常只考均值差(σ² 已知/未知两种情况),方差比偶尔涉及。


场景一:两个正态均值差 μ₁-μ₂ 的置信区间(σ₁², σ₂² 已知)

🧠 第1步:枢轴量是什么

两个独立正态总体 X₁ ~ N(μ₁, σ₁²),X₂ ~ N(μ₂, σ₂²)。σ₁² 和 σ₂² 都已知。

样本均值差 X̄₁ - X̄₂ 服从正态分布:
$$(\bar{X}_1 - \bar{X}_2) \sim N\left(\mu_1 - \mu_2,; \frac{\sigma_1^2}{n_1} + \frac{\sigma_2^2}{n_2}\right)$$

标准化后得到枢轴量:
$$\frac{(\bar{X}_1 - \bar{X}_2) - (\mu_1 - \mu_2)}{\sqrt{\frac{\sigma_1^2}{n_1} + \frac{\sigma_2^2}{n_2}}} \sim N(0, 1)$$

大白话:两个样本的均值差,其方差是各自方差的"叠加"(σ₁²/n₁ + σ₂²/n₂)。两个不确定性合在一起,根号下是两个方差的和——不是差。

🧠 第2步:写概率不等式

枢轴量 ~ N(0,1),所以:
$$P\left(-z_{\alpha/2} \leq \frac{(\bar{X}_1 - \bar{X}2) - (\mu_1 - \mu_2)}{\sqrt{\frac{\sigma_1^2}{n_1} + \frac{\sigma_2^2}{n_2}}} \leq z{\alpha/2}\right) = 1-\alpha$$

🧠 第3步:解出 μ₁-μ₂

和单总体完全一样的代数操作——把 μ₁-μ₂ 解到中间:

$$\mu_1 - \mu_2 \in \left[(\bar{X}_1 - \bar{X}2) - z{\alpha/2} \cdot \sqrt{\frac{\sigma_1^2}{n_1} + \frac{\sigma_2^2}{n_2}},; (\bar{X}_1 - \bar{X}2) + z{\alpha/2} \cdot \sqrt{\frac{\sigma_1^2}{n_1} + \frac{\sigma_2^2}{n_2}}\right]$$

大白话:结构 = (样本均值差) ± z_{α/2} × (均值差的标准误)。和单总体 X̄ ± z_{α/2}·σ/√n 结构一模一样,只是标准误从 σ/√n 变成了 √(σ₁²/n₁ + σ₂²/n₂)——因为现在是两个样本的差,方差是两者之和。

数字例子:A 线 n₁=25, x̄₁=50, σ₁²=16;B 线 n₂=30, x̄₂=47, σ₂²=9。求 μ₁-μ₂ 的 95% 置信区间。

结论:A 线平均比 B 线长 1.1 到 4.9 个单位(95% 置信)。区间不包含 0,说明两条线的均值确实有差异。

✍️ 立刻练一道(双总体均值差,自己算一遍):

两家奶茶店,各测 20 杯珍珠奶茶的容量(毫升):甲店 x̄₁ = 492,σ₁² = 36;乙店 x̄₂ = 487,σ₂² = 25(σ₁²、σ₂² 已知)。求 μ₁ - μ₂ 的 95% 置信区间(z_{0.025} = 1.96),并判断两店容量是否有显著差异。

提示:套 (X̄₁-X̄₂) ± z_{α/2}·√(σ₁²/n₁ + σ₂²/n₂),注意标准误里是"两个方差之和"。

点开看答案

均值差 = 492 - 487 = 5;标准误 = √(36/20 + 25/20) = √(1.8 + 1.25) = √3.05 ≈ 1.747;区间:5 ± 1.96×1.747 = 5 ± 3.424 → [1.576, 8.424]。区间不包含 0,说明 95% 置信水平下两店平均容量确实有差异(甲店明显更大)。


场景二:两个正态方差比 σ₁²/σ₂² 的置信区间

🧠 第1步:找枢轴量——F 分布登场

对于两个独立正态总体,方差比的枢轴量是:
$$\frac{S_1^2/\sigma_1^2}{S_2^2/\sigma_2^2} \sim F(n_1-1,; n_2-1)$$

F 分布是什么? 它是两个独立卡方变量(各除以其自由度)的比值服从的分布。形状右偏(和卡方一样不对称)。这里只需要知道:①它是用来比较两个方差的专用分布,②它有两个自由度(分子自由度 n₁-1,分母自由度 n₂-1),③和卡方一样不对称,所以上下限分位数不同。

大白话:如果两条产线方差相同(σ₁² = σ₂²),那么 S₁²/S₂² 应该接近 1。如果 S₁²/S₂² 远离 1,说明方差比不等于 1——即两条产线稳定性不同。

🧠 第2步:用 F 分布写概率不等式

$$P\left(F_{1-\alpha/2}(n_1-1, n_2-1) \leq \frac{S_1^2/\sigma_1^2}{S_2^2/\sigma_2^2} \leq F_{\alpha/2}(n_1-1, n_2-1)\right) = 1-\alpha$$

🧠 第3步:解出 σ₁²/σ₂²

把 σ₁²/σ₂² 从不等式中解出来:
$$\frac{\sigma_1^2}{\sigma_2^2} \in \left[\frac{S_1^2/S_2^2}{F_{\alpha/2}(n_1-1, n_2-1)},; \frac{S_1^2/S_2^2}{F_{1-\alpha/2}(n_1-1, n_2-1)}\right]$$

大白话:和卡方完全一样的"大小互换"逻辑!F_{α/2}(上分位数,大值)在分母 → 得下限(小商);F_{1-α/2}(下分位数,小值)在分母 → 得上限(大商)。如果区间包含 1,说明不能拒绝"方差相等";如果区间在 1 的某一侧,说明一个总体的方差显著大于另一个。

F 分布的一个便利公式(查表时常用):
$$F_{1-\alpha}(m, n) = \frac{1}{F_{\alpha}(n, m)}$$

大白话:F 分布表通常只给上分位数(右尾)。需要下分位数时,把分子分母的自由度交换、取倒数即可——不需要另一张表。


📌 考研范围提示

数学三通常只要求均值差 σ² 已知/未知两种情况。方差比的 F 区间偶尔在选择题中出现,了解公式结构即可。如果题目没给 σ 的具体数字,用 t 分布替代 z,公式变为:

$$\mu_1 - \mu_2 \in \left[(\bar{X}_1 - \bar{X}2) \pm t{\alpha/2}(n_1+n_2-2) \cdot S_p \cdot \sqrt{\frac{1}{n_1} + \frac{1}{n_2}}\right]$$

其中 S_p² = [(n₁-1)S₁² + (n₂-1)S₂²] / (n₁+n₂-2) 是合并样本方差(假设两总体方差相等时使用)。

④ 📝 复盘:双总体区间估计一览

估计目标 条件 枢轴量分布 公式结构
μ₁-μ₂ σ₁², σ₂² 已知 N(0,1) (X̄₁-X̄₂) ± z_{α/2}·√(σ₁²/n₁ + σ₂²/n₂)
μ₁-μ₂ σ₁², σ₂² 未知(假设相等) t(n₁+n₂-2) (X̄₁-X̄₂) ± t_{α/2}·S_p·√(1/n₁ + 1/n₂)
σ₁²/σ₂² 两总体正态 F(n₁-1, n₂-1) 两个分位数分别做分母,注意"大小互换"

核心规律:双总体和单总体的区别,仅仅是标准误的计算方式变了。单总体是 σ/√n,双总体是两个 σ²/n 的叠加(和再开根号)。其余逻辑(枢轴量 → 分位数 → 解不等式)完全一样。

⑤ ⚠️ 易错边界

⚠️ 易错1:方差是相加不是相减!

均值差 X̄₁ - X̄₂ 的方差是 σ₁²/n₁ + σ₂²/n₂,不是 σ₁²/n₁ - σ₂²/n₂。两个独立随机变量的差的方差 = 方差之和。很多人在这里写减号——错!

⚠️ 易错2:F 分布上下限和卡方一样会搞反

F 分布的置信区间公式和卡方结构相似:都是 (n-1)S²/分位数。F_{α/2}(大)在分母得下限,F_{1-α/2}(小)在分母得上限。和卡方一样的"大小互换"口诀。

⚠️ 易错3:t 分布的自由度计算

均值差 σ² 未知时的 t 分布自由度为 n₁ + n₂ - 2(合并方差 S_p² 损失了两个自由度,因为分别用 X̄₁ 和 X̄₂ 代替了 μ₁ 和 μ₂)。不是 n₁-1 或 n₂-1。

⑥ 在整条链中的位置

单总体区间(1.13-1.16)        双总体区间(本节)
  一把尺子量一个人              两把尺子量两个人的差距
  Z/t/χ²                        Z/t/F(多了一把 F 尺)
      ↓                              ↓
  第3章 多维随机变量           全书终点
  联合分布 → 独立正态的         概率论(正向)+ 统计推断(逆向)
  线性组合仍是正态              完整闭环在此合龙

双总体区间是参数估计的最后一站,也是全书概率论工具的"大汇演":第3章的多维随机变量(两个样本放一起)、第4章的数字特征(方差叠加)、第6章的三大抽样分布(Z/t/χ²/F 全部登场)、第7章的枢轴量法——前面学的所有工具,在本节一个不落地全部用上。


② 题型与练习(讲练合一)

经验、口诀、避坑提示都集中在这里。每个题型讲完立刻跟配套练习题——趁热打铁,学完就练。

题型一:矩估计——一个参数(⭐⭐⭐)

先抛一道题(看到这题,先别慌,试着做):

设 X ~ Exp(λ),密度 f(x;λ)=λe^{-λx},求 λ 的矩估计量。

试探:矩估计怎么起步?——问自己"总体均值 E(X) 用 λ 怎么表达"。第4章背过:E(X) = 1/λ。然后呢?"样本均值 = 总体均值",令 X̄ = 1/λ。

悟出模板:回头看这一步,其实是三件事,从此遇到"求单参数矩估计"就照这个走:

第1步:写出总体均值 E(X),用未知参数表达
第2步:令 X̄ = E(X)
第3步:解出参数 θ̂ = 用 X̄ 表达的式子

解:E(X)=1/λ,令 X̄=1/λ,得 λ̂=1/X̄。

📌 这张模板你已经在 1.3 节亲手悟出来过、在 1.8 节的一-1/一-2 里练过——这里只是把它正式命名为"题型一"。配套练习已随知识点就近安放,学完 1.8 就做。

识别特征:题目中出现"求θ的矩估计量",且只有一个未知参数;给出了总体分布形式和 E(X) 的表达式。

翻车现场:

  1. 记错 E(X) 公式——这是最不应该丢分的地方,考前一定把常见分布期望背熟(见章末附录)。
  2. 混淆"估计量"和"估计值"——估计量保留大写 Xᵢ,是一个公式;估计值代入具体数字。
  3. 移项出错——指数分布中 λ̂ = 1/X̄,不要写成 λ̂ = X̄。
  4. 矩估计的分母是 n,不是 n-1——矩估计的原理是用样本矩代替总体矩,总体矩的定义里没有 n-1。做题时一律除以 n,不要因为习惯了 S² 的分母 n-1 而搞混。

🛑 途中停顿:指数分布 E(X)=1/λ,如果样本均值 x̄=5,矩估计 λ̂ 是多少?反过来如果 λ̂=0.2,x̄ 是多少?(答案:1/5=0.2;1/0.2=5。矩估计就是"样本均值=总体均值",解方程即可。)


题型二:矩估计——两个参数(⭐⭐⭐)

先抛一道题(试着做,卡住了正好):

X ~ N(μ,σ²),μ 和 σ² 都未知。求 μ 和 σ² 的矩估计量。

试探:一个方程解不出两个未知数(1.3 节说过"两个未知数两个方程")。第一个方程还是老规矩——"样本均值 = 总体均值":X̄ = μ。第二个方程从哪来?样本和总体能对上的"平均特征"还有一个:平方的平均(二阶原点矩)——(1/n)∑Xᵢ² = E(X²)。而 E(X²) = D(X) + [E(X)]² = σ² + μ²。

悟出模板:

第1步:写出 E(X) 和 E(X²),用两个未知参数表达
       💡 技巧:用 E(X²)=D(X)+[E(X)]² 计算 E(X²)
第2步:令 { X̄ = E(X); (1/n)∑Xᵢ² = E(X²) }
第3步:联立解出两个参数

解:E(X)=μ,E(X²)=σ²+μ²
令 { X̄=μ; (1/n)∑Xᵢ²=σ²+μ² }
解得 μ̂=X̄,σ̂²=(1/n)∑(Xᵢ-X̄)²

均匀分布 U(a,b) 的矩估计(经典考题):
E(X)=(a+b)/2,E(X²)=D(X)+[E(X)]²=(b-a)²/12+[(a+b)/2]²=(a²+ab+b²)/3
最终结果的简洁形式:â = X̄ - √3·Sₙ,b̂ = X̄ + √3·Sₙ,其中 Sₙ²=(1/n)∑(Xᵢ-X̄)²。

🛑 途中停顿:矩估计两个参数时,为什么通常用一阶矩和二阶原点矩,而不是一阶矩和方差(二阶中心矩)?提示:想想哪个更容易写出关于参数的方程。(答案:原点矩的方程形式更简单——E(X²) 可以直接用参数表达,而方差 D(X) 的表达式中混有 E(X),写方程时多绕一步。)

📌 配套练习二-1(正态)、二-2(均匀)已随 1.5 节"两张卡"就近安放,学完 1.5 就做。


题型三:极大似然估计——离散型(⭐⭐⭐)

先抛一道题(试着做,这是 1.7 节那道硬币题的真身):

抛一枚硬币 10 次,7 次正面、3 次反面。硬币正面朝上的概率 p 是多少?

试探:硬币是离散的——"数据出现的可能性"要用概率函数 P(X=xᵢ) 写。出现"7 正 3 反"的概率 = C₁₀⁷p⁷(1-p)³。MLE 说:让这个"已发生数据的可能性"最大的 p 就是答案(1.6 节的核心思想)。

悟出模板:

第1步:写似然函数 L(θ) = ∏ P(X=xᵢ; θ)   ← 离散型用概率函数
第2步:取对数 lnL(θ) = ∑ lnP(X=xᵢ; θ)
第3步:求导并令其为零 d lnL/dθ = 0,解出 θ̂

💡 取对数的三个好处:

  1. 乘积变求和,求导简单
  2. 指数函数(如 e^{-λ})变成线性项
  3. ln 单调递增,最大值点不变

例题:X ~ P(λ),P(X=k)=λᵏe^{-λ}/k!,求 λ 的MLE。

解:结果 λ̂ = X̄(与矩估计相同,因为 E(X)=λ)。

翻车现场:

  1. 概率函数写错——常见离散分布(二项、泊松、几何)的概率函数必须牢记。
  2. 忽略了常数项——如 xᵢ! 虽然对参数来说是常数(求导时为0),但要正确写出并消去。
  3. 似然函数单调时不能机械求导——如果似然函数关于参数是单调的(如均匀分布),最大值在边界处,不在导数=0处。

🛑 途中停顿:极大似然估计中,离散型用概率函数,连续型用密度函数。如果 X~B(1,p)(0-1分布,P(X=1)=p,P(X=0)=1-p),写出 n 个样本的似然函数 L(p)。(提示:每个样本的取值要么是0要么是1,似然函数是各样本概率的乘积。)

📌 配套练习三-1(泊松)、三-2(二项)已随 1.7 节就近安放;三-3(非标准离散矩+MLE+无偏)是综合题,放在了 1.11 节。


题型四:极大似然估计——连续型(⭐⭐⭐)

先抛一道题(试着做,这是 1.8 节做过的"连续三步走"):

设 X ~ Exp(λ),密度 f(x;λ)=λe^{-λx}。求 λ 的 MLE。

试探:和离散型唯一的区别——"数据出现的可能性"这次用密度函数 f(xᵢ; θ) 写。写似然 → 取对数 → 求导,三步和离散型一模一样:L(λ) = ∏λe^{-λxᵢ} = λⁿe^{-λ∑xᵢ}。

悟出模板:三步走与离散型完全相同,只是 f(xᵢ;θ) 是密度函数而非概率函数。

识别特征:总体是连续型随机变量(正态、指数、均匀等),题目给出密度函数 f(x;θ)。

翻车现场(特别重要):

  1. 忘记约束条件——特别是均匀分布的参数有范围限制,最大值可能在边界,不在导数为0处。
  2. 单调函数直接求导——L(θ)=1/θⁿ,求导得 dL/dθ=-n/θ^{n+1},对任何 θ>0 都不可能为0。这说明内部无极值点。
  3. 正态分布求 σ² 时——注意是对 σ²(看作一个整体)求导,不是对 σ 求导。
  4. 两个参数时——规范写法应该用偏导符号 ∂,不是 d。

MLE方法选择判断流程(遇到MLE题目按这个顺序判断,不会在"求导"还是"不用求导"上纠结):

  1. 拿到一个MLE题目,先问:参数是否出现在密度的"取值范围"里?
    • 是(如U(0,θ),θ同时在密度1/θ和范围0<x<θ中)
      → ⚠️ 不能机械求导!
      • 单调减 → 参数越小越好 → 但不能小于样本最大值 → 取max(Xᵢ)
      • 单调增 → 参数越大越好 → 但不能大于样本最小值 → 取min(Xᵢ)
    • 否(如指数分布λe^{-λx},参数只出现在表达式里)
      → ✅ 标准三步走(写似然→取对数→求导解方程)
  2. 特殊情况:参数有约束
    → 先求导找到无约束最优解,再看约束是否被满足

均匀分布U(0,θ)的MLE(最经典考题!):

🛑 途中停顿:指数分布的密度函数是 f(x;λ)=λe^{-λx},写出 n 个样本的似然函数 L(λ)。然后判断:这个似然函数能不能用求导法找最大值?(答案:L(λ)=λⁿe^{-λ∑Xᵢ},参数 λ 只出现在表达式里,不在取值范围约束中,可以用标准三步走求导。)

📌 配套练习四-1(非标准连续)、一-1/一-2(指数矩+MLE)已随 1.8 节就近安放;四-2(U(0,θ)对比)、四-3(正态两参数)是带无偏性评价的综合题,放在了 1.11 节。


题型五:估计量无偏性验证(⭐⭐)

先抛一道题(试着做):

设 θ̂ = (X₁ + X₂)/2 是 μ 的估计量(X₁, X₂ 来自 E(X) = μ 的总体)。验证它是否无偏。

试探:无偏的定义是"E(θ̂) = θ"(1.11 节秤的比喻:长期平均不骗人)。那就算 E(θ̂) ——用期望的线性性质,把常数提出来、把求和拆开:E[(X₁+X₂)/2] = (μ+μ)/2 = μ。

悟出模板:

第1步:写出 θ̂ 的表达式(用 X₁,...,Xₙ 表达)
第2步:利用期望的线性性质 E(aX+bY) = aE(X)+bE(Y) 计算 E(θ̂)
第3步:将 E(Xᵢ) 替换为总体的期望值,看结果是否等于 θ

识别特征:给出一个估计量 θ̂ 的表达式,要求"验证 θ̂ 是否为 θ 的无偏估计"或"证明 θ̂ 是 θ 的无偏估计量"。

翻车现场:

🚨 翻车现场:把"无偏"当成"每次都准"

  • ❌ 错误理解:既然 θ̂ 是无偏的(E(θ̂)=θ),那我用一次估计出来的结果就应该很准。
  • ✅ 正确理解:无偏 = 长期平均准,不保证这一次就准。就像抛硬币——正面概率是50%("无偏"),但你抛10次可能只有3次正面。单次估计可能差得远,但如果你重复做100次估计再取平均,就会非常接近真值。
  • 💡 怎么记:无偏是"人品",不是"这一次的运气"。人品好的人长期可靠,但这一次也可能说错话。

经典必记结论:

🛑 途中停顿:样本方差的分母为什么是 n-1 而不是 n?如果分母用 n,估计量是有偏的还是无偏的?偏大还是偏小?(答案:分母用 n-1 是为了保证无偏性——E(S²)=σ²。分母用 n 会系统偏低,因为 E((1/n)∑(Xᵢ-X̄)²)=((n-1)/n)σ²<σ²。想想:用样本均值代替总体均值,损失了一个"自由度",所以要除以 n-1 来补偿。)

📌 配套练习五-1(非标准矩+无偏)、五-2(相合性)已随 1.11 节就近安放。


题型六:估计量有效性比较(⭐)

先抛一道题(试着做):

估计正态总体均值 μ 时,比较 X̄ 和 X₁(只用第一个样本)哪个更有效。

试探:有效性的前提是两者都无偏(1.11 节"先问偏不偏,再比稳不稳")。X̄ 和 X₁ 都无偏 ✓。再算方差:D(X̄) = σ²/n,D(X₁) = σ²。方差小的更稳定 → X̄ 更有效。

悟出模板:

第1步:验证两个估计量都是无偏的(如果不都无偏,不能简单比较)
第2步:分别计算 D(θ̂₁) 和 D(θ̂₂)
第3步:方差更小的更有效

识别特征:给出两个(或更多)无偏估计量,要求比较哪个"更有效"。

例题:比较 X̄ 和 X₁ 的有效性。

🛑 途中停顿:比较两个估计量的有效性,前提条件是什么?如果一个有偏、一个无偏,能不能直接比方差?(答案:前提是两者都无偏。有偏的估计量即使方差再小也不能说"更有效"——偏了再稳也没用,就像一把永远偏轻的秤,称一百次都很一致但全都偏轻。)

🚨 翻车现场:拿有偏估计比有效性

  • ❌ 错误做法:拿一个无偏估计和一个有偏估计比方差,然后说"方差小的更有效"。
  • ✅ 正确做法:有效性比较的前提是两者都无偏。有偏的估计量即使方差为零也不能说更有效——一把永远偏轻的秤,称一万次都一样偏轻,方差是零,但它不"有效"。必须先验证无偏性,再比方差。
  • 💡 怎么记:"先问偏不偏,再比稳不稳。"偏了就没资格参加有效性比赛。

📌 配套练习六-1(加权 vs 简单平均)、六-2(构造无偏+比较)已随 1.11 节就近安放。


题型七:σ²已知时的均值区间估计(⭐⭐)

先抛一道题(试着做,这是 1.13 节那道元件寿命题):

某种电子元件使用寿命 X~N(μ,400)。随机抽取25个,测得平均寿命 x̄=1600小时。求 μ 的95%置信区间。(已知 z_{0.025}=1.96)

试探:题目给了方差"400"这个具体数字 → σ² 已知 → 用 z 分布(1.13 节练过的火眼金睛)。套公式 X̄ ± z_{α/2}·σ/√n,把 σ=20、n=25、z=1.96 代进去。

悟出模板:

第1步:确认条件——总体正态,σ²已知
第2步:找出数据——X̄、σ、n、1-\alpha
第3步:查表得 z_{\alpha/2}
第4步:代入公式计算

公式:
μ的1-\alpha置信区间:X̄ ± z_{\alpha/2} · σ/√n

识别特征:总体正态,σ²已知(题目明确给出了σ或σ²的值),求μ的置信区间。

翻车现场:

🛑 途中停顿:σ²已知时用 z 分布,σ²未知时用 t 分布。为什么已知时区间更窄?想清楚再往下。(答案:因为你确切知道 σ,没有额外的不确定性。未知时用样本 S 代替 σ,S 本身有误差,t 分布的尾巴比 z 分布更厚,分位数更大,所以区间更宽——这是为"不知道 σ"付出的代价。)

📌 配套练习七-1 已随 1.13 节就近安放。


题型八:σ²未知时的均值区间估计(⭐⭐)

先抛一道题(试着做,这是 1.14 节那道题):

25个元件的样本标准差 S=22 小时,x̄=1600,求 μ 的95%置信区间。(已知 t_{0.025}(24)=2.064)

试探:题目没给 σ 的具体数字,只给了样本标准差 S → σ² 未知 → 用 t 分布(1.14 节"有数字用 z,没数字用 t")。自由度 n-1 = 24,套 X̄ ± t_{α/2}(n-1)·S/√n。

悟出模板:

第1步:确认条件——总体正态,σ²未知
第2步:找出数据——X̄、S、n、1-\alpha,自由度 n-1
第3步:查表得 t_{\alpha/2}(n-1)
第4步:代入公式计算

公式:
μ的1-\alpha置信区间:X̄ ± t_{\alpha/2}(n-1) · S/√n

🔑 傻瓜判断法:有数字用z,没数字用t。

做题时快速判断用哪个公式:

背后的道理:z 公式需要 σ(总体标准差)这个确切数字;如果你不知道 σ,只能拿样本自己算出来的 S 凑合着用——但 S 本身也有误差,所以分布从精确的 z 变成了更"保守"(区间更宽)的 t。

翻车现场:

  1. 用错分布——σ已知用z,σ未知用t,别混。
  2. 自由度算错——t分布的自由度是 n-1,不是 n。
  3. 样本标准差公式用错——S 是除以 n-1 的版本,不是除以 n 的版本。

🛑 途中停顿:t 分布的自由度是 n-1 还是 n?如果样本量 n=10,查表时自由度是多少?如果 n=30,t_{0.025}(29)≈?(答案:自由度=n-1。n=10 时查 df=9。n=30 时 t_{0.025}(29)≈2.045,比 z_{0.025}=1.96 略大;n 越大 t 越接近 z。)

📌 配套练习八-1(σ²未知区间)已随 1.14 节就近安放;八-2(单侧)随 1.16 节就近安放。


题型九:方差σ²的区间估计(⭐)

先抛一道题(试着做,这是 1.15 节那道题):

从正态总体 N(μ,σ²) 中抽取容量16的样本,测得 S²=6.25。求 σ² 的95%置信区间。(已知 χ²_{0.025}(15)=27.488,χ²_{0.975}(15)=6.262)

试探:这次求的是方差——枢轴量是 (n-1)S²/σ² ~ χ²(n-1)(1.15 节的卡方分布)。关键点:卡方不对称,所以上下限分别用两个不同的分位数,还要"大小互换"。

悟出模板:

第1步:确认总体正态
第2步:找出 S²(样本方差)、n、\alpha
第3步:查卡方分布表得两个分位数:
        · χ²_{\alpha/2}(n-1):上\alpha/2分位数(较大值)
        · χ²_{1-\alpha/2}(n-1):下\alpha/2分位数(较小值)
第4步:代入计算

公式:
σ²的1-\alpha置信区间:[(n-1)S²/χ²_{\alpha/2}(n-1), (n-1)S²/χ²_{1-\alpha/2}(n-1)]

⚠️ 特别注意:卡方分布不对称(右尾长)。

记忆口诀:大小互换——大的分位数(χ²_{\alpha/2})得下限(小值),小的分位数(χ²_{1-\alpha/2})得上限(大值)。很多同学搞反,请特别注意!

🛑 途中停顿:卡方分布不对称,上下限用的分位数不同。为什么"大的分位数做分母得下限,小的分位数做分母得上限"?(答案:公式是 (n-1)S²/χ²,分位数在分母。χ² 越大,整个分数越小→得下限;χ² 越小,整个分数越大→得上限。所以"大小互换"——记住这个口诀就行!)

📌 配套练习九-1 已随 1.15 节就近安放。


🧪 学完自测(4选择 + 2判断 + 4简答)

混搭全章知识点。先自己做,再点开答案。建议用时:15分钟。


选择题1:设总体 X ~ U(0, θ),θ > 0 未知。则 θ 的矩估计量和极大似然估计量分别为( )

A. 2X̄ 和 X̄
B. X̄ 和 2X̄
C. 2X̄ 和 max(Xᵢ)
D. max(Xᵢ) 和 2X̄

点击看答案

C。 矩估计:E(X)=θ/2,令 X̄=θ/2,θ̂_M=2X̄。MLE:L(θ)=1/θⁿ 单调递减,在边界取最大值,θ̂_L=max(Xᵢ)。这是考研最高频的对比题。


选择题2:在估计正态总体均值 μ 时,以下哪种情况置信区间最窄?

A. σ² 未知,n=10
B. σ² 未知,n=30
C. σ² 已知,n=10
D. σ² 已知,n=30

点击看答案

D。 两个因素让区间变窄:(1)σ² 已知(消除 S 的不确定性,z < t);(2)n 大(标准误 σ/√n 小)。D 两个优势都占了。


选择题3:设 X₁, X₂, X₃ 来自正态总体 N(μ, σ²),下列哪个估计量是 μ 的无偏估计且方差最小?

A. μ̂₁ = X₁
B. μ̂₂ = (X₁+X₂)/2
C. μ̂₃ = (X₁+X₂+X₃)/3
D. μ̂₄ = (X₁+2X₂+X₃)/4

点击看答案

C。 四个都是无偏的(因为系数和=1)。比较方差:D(μ̂₁)=σ²,D(μ̂₂)=σ²/2,D(μ̂₃)=σ²/3,D(μ̂₄)=(1+4+1)σ²/16=6σ²/16=0.375σ²。μ̂₃ 方差最小(σ²/3 ≈ 0.333σ² < 0.375σ²),所以 C 最有效。等权重平均总是最优的。


选择题4:求 σ² 的 95% 置信区间时,上限使用的卡方分位数是( )

A. χ²_{0.025}(n-1)(较大的分位数)
B. χ²_{0.975}(n-1)(较小的分位数)
C. χ²_{0.05}(n-1)
D. 无法确定

点击看答案

B。 置信区间公式为 [(n-1)S²/χ²_{\alpha/2}, (n-1)S²/χ²_{1-\alpha/2}]。上限用较小的分位数 χ²_{1-\alpha/2}(即 χ²_{0.975})做分母→得较大商→上限。"大小互换"口诀:大的分位数得下限,小的分位数得上限。


判断题1:矩估计法不需要知道总体完整的密度函数,只需要知道总体矩与参数的函数关系。而极大似然估计需要完整的密度函数或分布律。

点击看答案

✅ 正确。 矩估计靠"总体矩=样本矩"这个等式,不需要完整的 f(x;θ)。MLE 需要写似然函数 L(θ)=∏f(xᵢ;θ),所以必须知道 f 的完整形式。这也是为什么"只给E(X)表达式"的题只能用矩估计。


判断题2:"μ 的 95% 置信区间为 [9.9, 10.1]"意味着 μ 有 95% 的概率落在 9.9 到 10.1 之间。

点击看答案

❌ 错误。 正确理解:如果重复抽样100次,每次算一个置信区间,大约95个区间会包含 μ。μ 是固定的常数,区间是随机的——应该说"区间有95%的把握包含 μ",不能说"μ 有95%的概率落在区间里"。


简答题1:用自己的话说说"95%置信区间"到底是什么意思。不准用数学公式,用生活中的比喻解释。

点击看答案

参考回答:想象你在一个完全黑暗的房间里,有一个固定的靶子(μ,真值)。你有一把能射出"范围箭"的弓——每次射出去的不是一个点,而是一段线段(置信区间)。"95%置信水平"的意思是:如果你射100箭,大约95箭的线段能覆盖住靶子,5箭没盖住。靶子是固定的,箭(区间)是随机的。你的区间 [9.9, 10.1] 就是其中一箭——你有95%的把握这一箭盖住了靶子。


简答题2:均匀分布 U(0,θ) 的 MLE 为什么不能用求导法?矩估计和 MLE 的结果有什么区别?

点击看答案

参考回答:因为 L(θ)=1/θⁿ 随 θ 增大而单调递减——像一个下坡,最高点在坡的起点(边界),不在坡中间(导数为零处)。约束条件 θ ≥ max(Xᵢ) 决定了边界位置。矩估计 θ̂=2X̄(用样本均值推断),MLE θ̂=max(Xᵢ)(用样本最大值推断)。两者完全不同——这是考研最喜欢考的区分点。


简答题3:在估计正态总体均值 μ 的置信区间时,σ² 已知和 σ² 未知用的分布不同。请问各用什么分布?为什么未知时区间更宽?

点击看答案

参考回答:σ² 已知用 z 分布(标准正态),σ² 未知用 t 分布。未知时区间更宽的原因是:用样本标准差 S 代替 σ 引入了额外的不确定性——S 本身每次抽样都在波动(有时偏大有时偏小),导致 X̄ 的波动比你想象的大。t 分布的尾巴比 z 分布更厚,就是为了兜住这种额外波动,所以 t 的分位数比 z 大(如 t₀.₀₂₅ > z₀.₀₂₅),区间就更宽。


简答题4:一个估计量可以"有偏但相合"吗?如果可以,请举一个例子并解释这意味着什么。

点击看答案

参考回答:可以。例如分母为 n 的样本方差 σ̂² = (1/n)∑(Xᵢ-X̄)²。它有偏(E(σ̂²) = ((n-1)/n)σ² < σ²,系统偏低),但相合(当 n→∞ 时 σ̂²→σ²,偏差消失)。这意味着:小样本时它故意低估了方差(有偏),但随着样本量增大,低估得越来越少,最终逼近真值。所以"有偏"不一定"不能用"——大样本下偏差可以忽略。


③ 综合混搭练习

打乱题型,逼你自己判断用哪个方法。这五道题混合了本章的多个题型。

混搭0 🧭(方法选择判断)

给你一个陌生分布 f(x; θ) = 2x/θ²(0 < x < θ),请回答:

(1) 能不能用矩估计?需要什么信息?
(2) 能不能用MLE?能不能机械求导?为什么?
(3) 你打算用哪种方法?简要说明理由。

点击看答案

(1) 能用矩估计。需要知道E(X)与θ的关系。计算E(X)=∫₀ᶿ x·(2x/θ²)dx = 2θ/3,然后令X̄=2θ/3,得θ̂_M=3X̄/2。

(2) 能用MLE,但不能机械求导!因为θ出现在了取值范围0<x<θ中(密度表达式里也有θ)。写L(θ)=∏2xᵢ/θ²=2ⁿ(∏xᵢ)/θ²ⁿ,约束θ>max(Xᵢ)。L(θ)随θ增大而单调递减→最大值在边界→θ̂_L=max(Xᵢ)。

(3) MLE更优(虽然需要修正偏差),因为θ̂_L=max(Xᵢ)利用了"所有样本必须在(0,θ)内"这个约束信息,而矩估计只用到了样本均值。大样本下修正偏差后MLE更有效。

关键能力:看到陌生分布,先判断参数是否在取值范围里→决定MLE能不能求导。


混搭1 🎲

某工厂有两台机器A和B生产同一种零件。A生产60%的零件,次品率2%;B生产40%,次品率5%。现从总产品中随机抽取100个零件检测,发现有3个次品。

(1) 求次品率 p 的矩估计值。
(2) 在正态近似下,求 p 的95%置信区间(设 p 已知 = 0.032 用于计算标准误)。
(3) 如果将题目改成"不知道p,也不知道次品数服从什么分布,只知道样本均值和样本标准差",还能用z公式吗?应该用什么?

📌 对应模板:题型一(矩估计)+ 题型七(σ已知的区间估计)+ 题型八(σ未知)

点击看答案

(1) 矩估计
次品率 p 的矩估计直接用样本比例:
p̂ = 次品数/总数 = 3/100 = 0.03

(2) 正态近似下的置信区间
对于比例 p 的区间估计,大样本下用正态近似:
p̂ = 0.03,标准误 = √(p̂(1-p̂)/n) = √(0.03×0.97/100) ≈ 0.0171
z_{0.025}=1.96
置信区间:0.03 ± 1.96×0.0171 = [−0.0035, 0.0635]
实际下限取0(p不能为负),所以近似为 [0, 0.0635]

(3) 不能用z公式
如果不知道总体分布且样本量较小,需要用到非参数方法。但在考研范围内,大样本(≥30)可以用中心极限定理近似,用样本标准差代替σ,用z公式。如果样本量小,则需用t分布。简单判断——σ未知用t公式。


混搭2 🔄

设总体 X~N(μ,σ²),X₁,...,Xₙ 为样本。矩估计给出 μ̂=X̄,σ̂²=(1/n)∑(Xᵢ-X̄)²。

(1) σ̂² 是否是无偏估计?如果不是,请写出 σ² 的一个无偏估计。
(2) 比较 μ̂₁=X̄ 和 μ̂₂=(X₁+X₂)/2(只用前两个样本的平均)的有效性。
(3) 如果要估计 μ,矩估计和极大似然估计哪种更好?

📌 对应模板:题型五(无偏性)+ 题型六(有效性)+ 题型一/四(方法选择)

点击看答案

(1) σ̂² 有偏。E(σ̂²)=((n-1)/n)σ²≠σ²。无偏估计是 S²=[1/(n-1)]∑(Xᵢ-X̄)²。

(2) D(μ̂₁)=σ²/n,D(μ̂₂)=D((X₁+X₂)/2)=σ²/2
当 n>2 时,D(μ̂₁)=σ²/n < σ²/2=D(μ̂₂),所以 X̄ 更有效(n越大优势越明显)。

(3) 对于正态分布的均值 μ,矩估计和MLE都给出 μ̂=X̄,结果完全相同。所以两种方法一样好。


混搭3 🧩

某产品的重量 X 服从正态分布,但参数未知。随机抽取9个产品,测得重量(克):
98, 102, 100, 97, 101, 99, 103, 98, 102

(1) 求总体均值 μ 和方差 σ² 的矩估计值。
(2) 求 μ 的95%置信区间。
(3) 如果已知 σ²=4,上面算的置信区间会变窄还是变宽?算出来验证。

📌 对应模板:题型二(两个参数矩估计)+ 题型七/八(区间估计)

点击看答案

(1) 矩估计
x̄=(98+102+100+97+101+99+103+98+102)/9 = 900/9 = 100
σ̂²=(1/9)[(98-100)²+(102-100)²+(100-100)²+...+(102-100)²]
偏差平方:4+4+0+9+1+1+9+4+4=36
σ̂²=36/9=4
矩估计值:μ̂=100,σ̂²=4

(2) μ的95%置信区间(σ²未知,用t分布)
n=9,df=8,S²=(1/8)×36=4.5,S≈2.121
t_{0.025}(8)=2.306
置信区间:100 ± 2.306×2.121/√9 = 100 ± 2.306×0.707 = 100 ± 1.631
即:[98.369, 101.631]

(3) 如果已知σ²=4(σ=2),用z公式
z_{0.025}=1.96
置信区间:100 ± 1.96×2/√9 = 100 ± 1.96×0.667 = 100 ± 1.307
即:[98.693, 101.307]

果然更窄!因为σ已知消除了S带来的不确定性。


混搭4 🎯

某电子元件的寿命 X 服从指数分布,密度 f(x;λ)=λe^{-λx}。随机抽取 n 个进行测试。

(1) 写出 λ 的极大似然估计量的表达式。
(2) 如果测得5个元件的寿命分别为:0.5, 1.2, 0.8, 2.0, 1.5(千小时),求 λ 的MLE值。
(3) 指数分布中,λ 的矩估计和MLE结果相同吗?为什么?
(4) 如果要估计元件的平均寿命 1/λ,应该用 X̄ 还是 1/λ̂?哪个是无偏的?

📌 对应模板:题型一 + 题型四 + 题型五

点击看答案

(1) λ̂_MLE = 1/X̄ = n/∑Xᵢ

(2) x̄=(0.5+1.2+0.8+2.0+1.5)/5=6.0/5=1.2
λ̂=1/1.2≈0.833

(3) 相同。因为指数分布的均值 E(X)=1/λ,矩估计令 X̄=1/λ 得 λ̂=1/X̄;MLE同样得到 λ̂=1/X̄。

(4) 要估计平均寿命 θ=1/λ,矩估计和MLE都给出 θ̂=X̄(因为 E(X)=θ)。对于指数分布,E(X̄)=E(X)=θ,所以 X̄ 是 θ 的无偏估计。直接用 X̄ 即可。


🔄 回马枪1(回顾第1章:贝叶斯公式 + 参数估计)

某电子厂有两条生产线 A 和 B。A 线生产 70% 的产品,次品率 1%;B 线生产 30%,次品率 3%。质检员随机抽了一个产品,发现是次品。

(1) 这个次品来自 A 线的概率是多少?(第1章贝叶斯公式)
(2) 如果质检员又抽了 100 个产品,发现 4 个次品——用矩估计估算整批产品的次品率 p̂。(第7章矩估计)
(3) 比较一下:贝叶斯公式是在"已知次品"后倒推原因(哪条线生产的),矩估计是在"看到抽样结果"后推断总体特征(整批次品率)。这两种"倒推"有什么相同和不同?用你自己的话说说。

📌 这道题打通了第1章的"逆概思想"和第7章的"统计推断"——两者都是从结果反推原因,只是一者推的是"来源",一者推的是"参数"。

点击看答案

(1) 贝叶斯公式:
P(A|次品) = P(次品|A)·P(A) / P(次品)
= 0.01 × 0.70 / (0.01×0.70 + 0.03×0.30) = 0.007 / 0.016 = 0.4375

也就是说:抽到一个次品,它有 43.75% 的可能来自 A 线(虽然 A 线生产量大,但次品率低,所以概率反而没想象中那么高)。

(2) 矩估计:p̂ = 4/100 = 0.04 = 4%

(3) 相同点:都是从"看到的结果"反推"背后的真相"——贝叶斯用条件概率公式,矩估计用"样本矩 = 总体矩"。

不同点:贝叶斯必须有"先验信息"(A 线和 B 线的生产比例)才能算,没有先验寸步难行。矩估计不需要先验——只靠样本数据自己就能算。另外,贝叶斯给出"来源概率"的精确值,矩估计给出的是"参数估计值"。


🔄 回马枪2(回顾第2章:正态分布 + MLE 计算)

设总体 X ~ N(μ, σ²),其中 σ² 已知为 4。从总体中抽取了 n 个样本。

(1) 写出 X 的密度函数 f(x; μ)。(第2章:正态分布的密度函数必须烂熟)
(2) 写出 μ 的似然函数 L(μ),并求 μ 的极大似然估计 μ̂。(第7章MLE)
(3) μ̂ 服从什么分布?写出它的期望和方差。(第2章:正态分布的性质 + 第4章期望方差)

📌 这道题让你看到:第2章学正态分布密度函数,就是为了在第7章能写出似然函数。前面不背密度公式,后面 MLE 一步都走不了。

点击看答案

(1) 正态分布密度函数(σ²=4,σ=2):
f(x; μ) = (1/√(8π)) · exp(-(x-μ)²/8)

(2) 似然函数:
L(μ) = ∏ f(xᵢ; μ) = (2π×4)^{-n/2} · exp(-(1/8)∑(xᵢ-μ)²)

取对数:ln L(μ) = 常数 - (1/8)∑(xᵢ-μ)²

求导:d lnL/dμ = (1/4)∑(xᵢ-μ) = 0 → μ̂ = X̄

(3) X̄ 是 n 个独立 N(μ, 4) 的平均,由第2章正态分布的可加性:
X̄ ~ N(μ, 4/n),即 E(X̄) = μ,D(X̄) = 4/n

所以 μ̂ 也是无偏的,且方差随 n 增大而减小(一致性)。


🔄 回马枪3(回顾第3章:联合分布 + 置信区间)

设 X₁, X₂ 为来自正态总体 N(μ, 1) 的两个独立样本。

(1) 写出 X₁ 和 X₂ 的联合密度函数 f(x₁, x₂)。(第3章:独立随机变量的联合密度 = 各自密度的乘积)
(2) 样本均值 X̄ = (X₁+X₂)/2 服从什么分布?(第3章:独立正态的线性组合仍是正态)
(3) 基于 X₁, X₂,求 μ 的 95% 置信区间。(第7章:σ²已知用 z 公式)

📌 这道题让你看到:第3章"多个随机变量放一起"就是似然函数 L(θ) = ∏ f(xᵢ;θ) 的数学基础——每个 f(xᵢ;θ) 相乘,本质就是联合密度。

点击看答案

(1) 由独立性,联合密度 = 各自密度的乘积:
f(x₁, x₂) = f(x₁) · f(x₂)
= [1/√(2π)]·exp(-(x₁-μ)²/2) × [1/√(2π)]·exp(-(x₂-μ)²/2)
= (1/2π)·exp(-[(x₁-μ)² + (x₂-μ)²]/2)

(2) X̄ = (X₁+X₂)/2,由第3章性质:独立正态的线性组合仍是正态。
E(X̄) = (μ+μ)/2 = μ,D(X̄) = (1+1)/4 = 1/2
所以 X̄ ~ N(μ, 1/2)。

(3) σ²=1 已知(来自 X₁, X₂ ~ N(μ, 1)),但注意这里的"总体方差"是 1,而 X̄ 的方差是 1/n = 1/2。

z_{0.025} = 1.96
置信区间:X̄ ± 1.96 × 1/√2 = X̄ ± 1.386

如果 x₁=9.5, x₂=10.5,则 x̄=10.0,区间:[8.614, 11.386]。


🔄 回马枪4(回顾第4章:期望方差 + 估计量评价)

设总体 X 的期望 E(X) = μ,方差 D(X) = σ²。考虑三个估计量:

(1) 验证三个估计量是否都是 μ 的无偏估计。(第4章:算期望就是套用线性性质)
(2) 分别计算三个估计量的方差。(第4章:方差计算)
(3) 三个估计量中哪个最有效?μ̂₃ 比 μ̂₂ 差多少?这说明什么?(第7章:有效性比较)

📌 这道题打通了第4章"数字特征"和第7章"估计量评价"——算 E 验无偏、算 D 比有效,全是从第4章拿来的基本功。

点击看答案

(1) 无偏性验证:

E(μ̂₁) = E(X₁) = μ ✓
E(μ̂₂) = E(X̄) = μ ✓
E(μ̂₃) = E((X₁+2X₂+X₃)/4) = (μ+2μ+μ)/4 = μ ✓

三个都无偏。

(2) 方差计算:

D(μ̂₁) = D(X₁) = σ²

D(μ̂₂) = D(X̄) = σ²/3(n=3)

D(μ̂₃) = (1/16)[D(X₁) + 4D(X₂) + D(X₃)] = (1/16)(σ²+4σ²+σ²) = 6σ²/16 = 0.375σ²

(3) 有效性比较:

D(μ̂₂) = σ²/3 ≈ 0.333σ² < 0.375σ² = D(μ̂₃) < σ² = D(μ̂₁)

μ̂₂(等权重平均)最有效——方差最小。μ̂₃ 虽然也是无偏的,但因为给 X₂ 更大权重,方差反而增加了。这说明:等权重利用全部样本,是估计均值的最优方式。 给某些样本更高权重(除非有特殊理由)只会徒增方差。


🔄 回马枪5(回顾第5章:中心极限定理 + 大样本置信区间)

一家网店的日订单数服从某分布(分布形式未知),已知总体标准差 σ = 20 单。随机记录了 100 天的订单数,平均每天 250 单。

(1) 虽然总体分布未知,为什么我们仍然可以求 μ(真实日均订单数)的置信区间?依赖了哪个定理?(第5章:中心极限定理 CLT)
(2) 求 μ 的 95% 置信区间。(第7章:大样本下用 z 公式)
(3) 如果只记录了 9 天(n=9),还能用同样的方法吗?为什么?(第5章 + 第7章:CLT 需要 n 够大)

📌 这道题打通了第5章 CLT 和第7章区间估计——正是因为 CLT 告诉你"不管原来什么分布,n 够大时 X̄ 近似正态",区间估计才能走出正态总体的限制!

点击看答案

(1) 依赖的是中心极限定理(CLT):不管总体原来服从什么分布,只要样本量 n 够大,样本均值 X̄ 就近似服从正态分布 N(μ, σ²/n)。

所以虽然不知道日订单数服从什么具体分布,但 n=100 足够大,X̄ ≈ N(μ, 400/100) = N(μ, 4)。

(2) n=100,σ=20,x̄=250,z_{0.025}=1.96

标准误 = σ/√n = 20/10 = 2

置信区间:250 ± 1.96×2 = 250 ± 3.92 → [246.08, 253.92]

有 95% 把握,真实日均订单数在 246 到 254 单之间。

(3) n=9 太小了!CLT 是"大样本"近似——n 越大近似越好,n=9 时 CLT 近似效果不好,而且总体分布未知,没法知道小样本下 X̄ 的精确分布。如果总体本来就不正态,n=9 用 z 公式是不靠谱的。通常要求 n ≥ 30 才能放心用 CLT 近似。


🔄 回马枪6(回顾第6章:t 分布 + 小样本置信区间)

一位营养师想估计某种食品的平均热量 μ。她随机测了 8 份样品,数据如下(单位:千卡):
120, 115, 122, 118, 119, 121, 116, 117

(1) 计算样本均值 X̄ 和样本标准差 S。(基本计算,第4章)
(2) 第6章告诉我们:当 σ 未知时,(X̄-μ)/(S/√n) 服从什么分布?自由度是多少?(第6章抽样分布)
(3) 求 μ 的 95% 置信区间。(第7章:σ²未知用 t 分布,t_{0.025}(7)=2.365)
(4) 如果第6章没有引入 t 分布,用 z 分布来算这个区间,结果会差多少?这说明了第6章 t 分布的什么意义?

📌 这道题是第6章和第7章的"合体题"——没有第6章的 t 分布,第7章小样本下的区间估计根本无从下手。

点击看答案

(1) 基本计算:
∑xᵢ = 120+115+122+118+119+121+116+117 = 948
X̄ = 948/8 = 118.5

偏差平方和 = (120-118.5)²+(115-118.5)²+(122-118.5)²+(118-118.5)²+(119-118.5)²+(121-118.5)²+(116-118.5)²+(117-118.5)²
= 2.25+12.25+12.25+0.25+0.25+6.25+6.25+2.25 = 42.0

S² = 42.0/7 = 6.0(注意:样本方差分母是 n-1=7)
S = √6.0 ≈ 2.449

(2) 当 σ 未知时,(X̄-μ)/(S/√n) 服从t 分布,自由度为 n-1 = 7。

这是第6章的核心结论之一。用 S 代替 σ 后,分布从精确的 N(0,1) 变成了尾巴更厚的 t(7)——额外的不确定性需要更宽的分位数来兜住。

(3) 用 t 分布:
t_{0.025}(7) = 2.365
标准误 = S/√n = 2.449/√8 ≈ 0.866
置信区间:118.5 ± 2.365 × 0.866 = 118.5 ± 2.048 → [116.45, 120.55]

(4) 如果用 z 分布(错误做法):
z_{0.025} = 1.96
区间:118.5 ± 1.96 × 0.866 = 118.5 ± 1.697 → [116.80, 120.20]

对比:

  • t 区间:[116.45, 120.55],宽度 ≈ 4.1
  • 错误 z 区间:[116.80, 120.20],宽度 ≈ 3.4

错误用 z 的区间比正确的 t 区间窄了约 17%——这意味着你过度自信了!你以为有 95% 的把握,但因为没考虑 S 替代 σ 带来的额外误差,实际把握可能只有 90% 左右。

第6章引入 t 分布的意义:让你在"不知道 σ 只好用 S 凑合"的时候,给出"诚实"的置信区间——比 z 区间更宽,但更靠谱。自由度越小(样本越少),t 和 z 的差距越大,t 分布的价值越明显。


🎯 考试导航

考频排名(从高到低)

题型 考频 常见出题形式 备考建议
矩估计(一个参数) ⭐⭐⭐ 大题第一问,容易得分 背熟常见分布 E(X) 公式,三步走即可
MLE(离散型/连续型) ⭐⭐⭐ 大题第二问,11分大题必考 三步走写全,注意均匀分布不能求导
无偏性验证 ⭐⭐ 大题第三问或选择 算 E(θ̂) 看是否等于 θ
σ²已知/未知的区间估计 ⭐⭐ 大题或选择 傻瓜判断法:有数字用z,没数字用t
两个参数矩估计 ⭐⭐ 大题(正态/均匀) 联立两个方程,注意分母是n
有效性比较 ⭐ 选择或大题一小问 前提:两者都无偏,比方差大小
方差区间估计 ⭐ 偶尔大题 卡方分布,注意"大小互换"
单侧置信区间 ⭐ 偶尔选择 单侧用 z_\alpha 不是 z_{\alpha/2}

核心公式速查表

目标 条件 分布 公式
矩估计(1个参数) 已知 E(X) 与 θ 关系 — X̄ = E(X),解出 θ̂
矩估计(2个参数) 已知 E(X)、E(X²) — { X̄=E(X); (1/n)∑Xᵢ²=E(X²) }
MLE(通用) 需要完整 f(x;θ) — L=∏f → lnL → 求导=0
均匀分布MLE 边界分布 — 不能求导!用单调性+边界
均值μ(σ²已知) σ²已知 z分布 X̄ ± z_{\alpha/2}·σ/√n
均值μ(σ²未知) σ²未知 t分布 X̄ ± t_{\alpha/2}(n-1)·S/√n
均值μ(单侧下限) σ²已知 z分布 X̄ - z_\alpha·σ/√n
方差σ² 总体正态 χ²分布 [(n-1)S²/χ²_{\alpha/2}, (n-1)S²/χ²_{1-\alpha/2}]

估计量评价速查

性质 验证方法 判据
无偏性 计算 E(θ̂) E(θ̂) = θ
有效性 比较 D(θ̂) 方差小者更有效(前提:两者均无偏)
相合性 切比雪夫不等式 lim_{n→∞} P(

常用分位数速记

置信水平 z_{\alpha/2}(双侧) z_\alpha(单侧)
90% 1.645 1.282
95% 1.96 1.645
99% 2.576 2.326

t分布常用值(\alpha=0.05)

自由度 df 5 10 15 20 30 ∞
t_{0.025} 2.571 2.228 2.131 2.086 2.042 1.96

易混淆点一览

混淆项 区分
分母 n vs n-1 矩估计和MLE用 n;样本方差 S² 用 n-1(为保证无偏)
z_{\alpha/2} vs z_\alpha 双侧区间用 \alpha/2;单侧区间用 \alpha
t分布 vs z分布 σ²未知用 t;σ²已知用 z
均匀分布 MLE 不能求导!用单调性+边界分析
χ²区间上下限 较大分位数在分母得下限,较小分位数在分母得上限(不对称!)

考试策略

时间分配建议:参数估计大题(11分)建议用时15~20分钟:

解题顺序建议:通常一个大题第一问求矩估计(容易,先做),第二问求MLE(稍难,后做),可能第三问评价无偏性或求置信区间。建议按顺序做,先拿容易的分。

交卷前检查清单:

考前最后看的三件事(最高频翻车点排名):

  1. MLE能不能求导? → 检查参数是否在取值范围里 → 单调性判断
  2. 置信区间用z还是t? → 有数字(σ已知)用z,没数字(σ未知)用t
  3. 方差区间上下限 → 大小互换(大分位数得下限,小分位数得上限)

📋 自检清单

学完这章,你应该能回答下面这些问题。如果哪个答不上来,回到对应小节重新看。


附录:常见分布的期望与方差速查

分布 记号 E(X) D(X) E(X²)=D(X)+[E(X)]²
二项分布 B(n,p) np np(1-p) —
泊松分布 P(λ) λ λ λ+λ²
几何分布 G(p) 1/p (1-p)/p² —
均匀分布 U(a,b) (a+b)/2 (b-a)²/12 (a²+ab+b²)/3
指数分布 Exp(λ) 1/λ 1/λ² 2/λ²
正态分布 N(μ,σ²) μ σ² σ²+μ²

🔗 章末过渡:回顾来路

本章是概率论的最后一站。走到这里,你已经从"什么都不懂"变成了"能用数据反推真相"。

回头看看你走过的路:一开始你学会了"数事件"(第1章)——掷骰子、抽扑克牌,搞清楚一件事发生的概率有多大。接着你学会了用数学函数描述随机现象(第2章、第3章)——一个骰子也好、两个骰子也好,都能用分布函数、密度函数精确刻画。然后你学会了不必知道完整分布、只需要几个"平均特征"就能把握大局(第4章)——期望、方差这些数字特征,像一个人的身高体重,三两下勾勒出总体轮廓。

有了这些基础,你才理解了大数定律和中心极限定理(第5章)——为什么样本多了就稳定、为什么正态分布无处不在。接着你搞清楚了"从总体里舀一勺样本,这勺样本服从什么规律"(第6章)——t分布、卡方分布、F分布,三大抽样分布成了做推断的"标尺"。最后,你来到了本章(第7章)——用样本反推总体,完成了统计推断的完整闭环。

这条"从概率到统计"的路,就是整个概率论的主线。下面这张全景图帮你把所有章节串在一起——每一个前面学过的工具,都在参数估计这里找到了用武之地。


📐 学完回顾:本章推导链

下面这条链把第7章所有的"为什么"串成一条线。从上往下读,每一步都是下一步的前提——就像搭积木,下面那块不稳,上面就没法搭。

第一环:从样本到估计(两种思路)

矩估计:样本矩 = 总体矩 → 解出 θ̂
         ↑ 核心直觉:"样本长啥样,总体就长啥样"

MLE:写似然 L(θ) → 取对数 → 求导 → 解出 θ̂
      ↑ 核心直觉:"已经发生的事,背后一定有个最合理的解释"

两条路有时殊途同归(如正态分布的 μ̂ = X̄),有时分道扬镳(如均匀分布 U(0,θ):矩估计 θ̂=2X̄,MLE θ̂=max(Xᵢ))。矩估计不需要完整的分布——只要知道总体均值怎么用参数表达就行;MLE 需要完整的密度函数,但它利用了全部信息,通常更精确。

第二环:评价估计量好不好(三个标准)

无偏性 E(θ̂) = θ  →  有效性 D(θ̂) 最小  →  一致性 θ̂ →ᴾ θ
  "秤偏不偏"           "秤稳不稳"            "样本越多越准"

三个标准是递进的:先问"偏不偏"(无偏),再问"两个无偏的谁更稳"(有效),最后问"加大样本能不能无限逼近真值"(一致)。一个估计量可以有偏但相合(如分母为 n 的方差——小样本时故意低估,大样本时偏差消失),也可以无偏但不相合(如只用第一个样本估计均值——永远不准,再多样本也救不了)。

第三环:从点估计到区间估计(枢轴量法)

找枢轴量 → 用已知分布写概率不等式 → 解出 [L, U]
    ↑                    ↑                    ↑
 "找一把刻度      "这个量有95%        "把θ从不等式中
  已知的尺子"      的概率落在这       挖出来,放到中间"
                  两个数之间"

枢轴量法把"对参数的未知"转嫁到"对分布的已知"上——我不知道 μ 是多少,但我知道 (X̄-μ)/(σ/√n) 服从标准正态。利用这个铁板钉钉的事实,反向框住 μ。

第四环:不同场景用不同的"尺子"

正态均值 CI:
  σ 已知 → 用 Z 分布(尺子精确,区间窄)
  σ 未知 → 用 t 分布(尺子有误差,区间宽)
            ↑ 用 S 代替 σ 付出的代价——t 的尾巴比 z 更厚

正态方差 CI → 用 χ² 分布
            ↑ 卡方不对称!大小互换——大分位数得下限,小分位数得上限

两总体均值差 CI → 用 Z 或 t(结构不变,标准误变成两个方差之和的平方根)
两总体方差比 CI → 用 F 分布(和卡方一样不对称,同样大小互换)

整条链一句话总结:从"猜一个数"(点估计)到"给一个范围、附一个把握"(区间估计),从"一种方法"(矩估计/MLE)到"多种评价标准"(无偏/有效/一致),从"一把尺子"(Z 分布)到"多把尺子"(t/χ²/F)——参数估计的本质就是:拿已知的数学规律,去丈量未知的现实世界。


🗺️ 全书回顾:概率论推导全景图

下面这张图把第1章到第7章串成一条完整的链。看完你就明白:原来每一章都不是孤立的——前面学的每个工具,都在为后面的"参数估计"铺路。

第1章 事件概率基础
  ┃  学会了:数事件、算概率、条件概率、全概率公式、贝叶斯公式
  ┃  贡献给参数估计:贝叶斯的思想——"先有个初步判断(先验),
  ┃                   看到数据后更新判断(后验)"→ 这是MLE的哲学前身
  ┃
  ▼
第2章 一维随机变量
  ┃  学会了:分布函数、密度函数、常见分布(正态/指数/均匀/泊松...)
  ┃  贡献给参数估计:正态分布 → 区间估计的主角
  ┃                   指数分布 → 矩估计和MLE的经典例题
  ┃                   均匀分布 → 两种方法结果不同的最佳演示
  ┃                   泊松/二项分布 → 离散型MLE的练习题
  ┃
  ▼
第3章 多维随机变量
  ┃  学会了:联合分布、边缘分布、条件分布、独立性的判定
  ┃  贡献给参数估计:多个样本放在一起(X₁, X₂, ..., Xₙ)
  ┃                   就是"多维随机变量"——写似然函数时
  ┃                   L(θ)=f(x₁;θ)f(x₂;θ)... 本质就是联合分布
  ┃                   两总体均值差/方差比也用到了"多元"的思想
  ┃
  ▼
第4章 数字特征
  ┃  学会了:期望 E(X)、方差 D(X)、协方差、相关系数
  ┃  贡献给参数估计:矩估计的核心——E(X)、E(X²) 与参数的关系
  ┃                   无偏性验证——直接算 E(θ̂) 是否等于 θ
  ┃                   有效性比较——直接算 D(θ̂) 比大小
  ┃                   样本均值 X̄ 的方差 σ²/n → 区间宽窄由它决定
  ┃
  ▼
第5章 大数定律 + 中心极限定理
  ┃  学会了:样本均值稳定到总体均值(大数定律)
  ┃           不管原来什么分布,样本均值近似正态(CLT)
  ┃  贡献给参数估计:一致性(相合性)的理论基础 → 大数定律
  ┃                   大样本下"X̄ 近似正态" → 即使总体非正态,
  ┃                   只要 n 够大,z/t 区间估计仍然能用(CLT的威力!)
  ┃
  ▼
第6章 抽样分布
  ┃  学会了:三大抽样分布——χ² 分布、t 分布、F 分布
  ┃           (n-1)S²/σ² ~ χ²(n-1)
  ┃           (X̄-μ)/(S/√n) ~ t(n-1)
  ┃           (S₁²/σ₁²)/(S₂²/σ₂²) ~ F(n₁-1, n₂-1)
  ┃  贡献给参数估计:枢轴量的"弹药库"!没有这些分布,
  ┃                   区间估计一步都走不了。置信区间的分位数
  ┃                   全来自这一章——z/t/χ²/F 一个都不能少
  ┃
  ▼
第7章 参数估计(终点站)
    ┃  完成了:点估计(矩估计 + MLE)→ 评价(无偏/有效/一致)
    ┃          → 区间估计(Z/t/χ²/F 四种枢轴量)
    ┃  整条链到此闭环:概率论(已知θ → 算数据概率)正向走完,
    ┃                   统计推断(已知数据 → 反推θ)逆向也走通了。
    ┃                   从"掷骰子"到"用数据反推真相"——全套工具齐了。

一句话记住整本书:概率论教你用数学描述"不确定",统计推断教你用数据反推"不确定背后的真相"——两条路方向相反、工具相通,合在一起,就是"面对不确定的世界,仍然能做出靠谱判断"的完整本事。

← 上一章