# 第4章 随机变量的数字特征
🔔 课前激活(花30秒想想再往下读)
上一章我们学了怎么同时看两个随机变量——联合分布是"全家福"(两人一起看),边缘分布是"单人照"(只看一个人),条件分布是加了筛选条件后的样子,独立性则告诉你两个人是不是各过各的。这些都是"描述关系"的工具。
这一章要给这些关系配上数字——就像第3章说"这两个人是有关系的",第4章说"关系有多密切?打个分,0到1之间"。你还会发现,第3章的联合分布和边缘分布是计算这些数字的"原材料"。
你每天早上出门,打开天气App,第一眼看的是什么?大概率是"今日平均气温23度"——而不是一整天的气温变化曲线。你买了两只基金,一个平均年化8%、波动很小,另一个平均年化8%、但今年涨50%明年跌30%——你会觉得它们"一样"吗?当然不会。
生活里我们经常用"平均多少"和"稳不稳定"来快速描述一件事的特征。这一章就是把这两个直觉——平均水平和波动程度——变成精确的数学工具。你还会学到"两个东西一起变动的程度"(气温高时冰淇淋卖得多),以及"没线性关系不代表没关系"这个反直觉的结论。
带着这些生活直觉往下读。读完这章,你就能用量化的方式回答这些问题了。
📌 学完这章你能回答:
- 期望和普通平均有什么区别?为什么骰子期望3.5,但骰子根本没有这个点数?
- 方差为什么用"平方"而不用"绝对值"来衡量波动?
- "协方差"和"相关系数"解决的是同样的问题吗?为什么不能只用协方差?
- "独立"和"不相关"是一回事吗?如果是 Y = X²,X和Y相关系数可能为0,但它们独立吗?
- 全班身高每人加5cm,方差变不变?每人翻倍,方差怎么变?
本章考什么
考纲要求:第4章是概率论"计算量最大"的一章。期望和方差的计算贯穿后续所有章节(大数定律、参数估计、假设检验全部要用)。注意:正态分布 N(μ, σ²) 中第二个参数是方差 σ²,不是标准差 σ,这是最容易被误读的地方。
| 题型 | 考纲要求 | 考频 |
|---|---|---|
| 离散型随机变量的期望和方差 | 掌握 | ⭐⭐⭐ |
| 连续型随机变量的期望和方差 | 掌握 | ⭐⭐⭐ |
| 随机变量函数的期望 | 掌握 | ⭐⭐⭐ |
| 利用期望和方差的性质简化计算 | 掌握 | ⭐⭐⭐ |
| 协方差和相关系数的计算 | 理解 | ⭐⭐ |
| 利用常见分布的期望方差公式 | 掌握 | ⭐⭐⭐ |
| 独立与不相关的判断 | 理解 | ⭐⭐⭐ |
① 核心知识
本章在学什么?(先看清全貌)
前面三章我们学了随机变量的分布。第1-2章学的是一维随机变量的分布——也就是"随机变量取不同值的概率分别是多少";第3章把它推广到了两个变量——联合分布、边缘分布、条件分布,回答"两个随机变量同时取什么值的概率是多少"。有了分布,就完全了解了一个(或一对)随机变量。
但是,一个完整的分布信息太多,人们往往只关心几个关键数字:
- 你查天气预报,不会看每一天完整的气温分布曲线,只想知道"平均气温多少度"
- 你炒股,不关心每天的完整价格分布,只想知道"平均收益多少"和"波动大不大"
- 你称体重,不关心体重波动的完整概率分布,只想知道"平均多重"和"最近是胖了还是瘦了"
这些能概括随机变量关键特征的数字,就是本章要学的数字特征。
本章学五个东西:
- 期望 — 随机变量的"平均水平"(类似加权平均)
- 方差 — 随机变量的"波动程度"(类似起伏大小)
- 协方差 — 两个随机变量"一起变化的程度"
- 相关系数 — 把协方差标准化后的东西(方便比较)
- 矩 — 更高阶的数字特征(了解即可)
整章都是重点,没有可以跳过的内容。
4.1 数学期望(期望值)
📌 学完本节你能回答:期望和普通"平均数"有什么区别?为什么骰子的期望是 3.5,但骰子根本没有 3.5 这个面?
先看一道题:掷一枚公平骰子,平均点数是多少?
看到这题,先别慌。骰子掷一次可能出 1、也可能出 6——"平均点数"到底怎么算?这就是"随机变量的平均",也是本节的主角。先想清楚它难在哪:
🧠 难在哪? ① 每次结果都变(1 到 6 都有可能),没有一个"固定总数"可以拿来除以次数;② 就算亲手掷 100 次求平均,也只是"这一次实验的平均",不是理论上的平均。我们需要一个光凭概率就能算出的理论平均。
先别急着掷骰子,我们换一个更熟悉的角度——班级平均身高。
生活比喻一:班级平均身高(加权平均)
假设班里有两个小组:
- A组有30个人,平均身高165cm
- B组有10个人,平均身高175cm
全班平均身高怎么算?不是 (165 + 175) / 2 = 170!因为人数不一样多。
正确算法是:165 和 175 要按人数来"加权"——
$$\text{全班平均身高} = 165 \times \frac{30}{40} + 175 \times \frac{10}{40} = 165 \times 0.75 + 175 \times 0.25 = 167.5$$
165 的权重是 0.75(因为A组人多),175 的权重只有 0.25。这就是"加权平均"。
🧠 这一步在想什么:身高加权平均的秘诀,是用"人数占比"当权重。掷骰子一模一样——把"人数占比"换成"出现概率":点数 1~6 每个出现的概率都是 1/6。于是平均点数就该是——每个点数 × 它的概率,再加起来:
$$E(X) = 1 \times \frac{1}{6} + 2 \times \frac{1}{6} + \cdots + 6 \times \frac{1}{6} = 3.5$$
($E(X)$ 是"期望"的记号——Expected 的首字母。)
🔍 回头看看我们做了什么:原来"期望"就是所有可能取值 × 各自出现概率的加权和。概率大的结果出现得频繁,对"平均"的贡献就大——权重就是概率。
随机变量的期望,其实就是把所有可能的取值,用各自出现的概率做权重,算出的加权平均。
生活比喻二:跷跷板的支点(重心)
想象一根木棍,上面在不同位置挂了不同重量的砝码:
- 在位置 x₁=1 处挂了 2kg
- 在位置 x₂=3 处挂了 1kg
- 在位置 x₃=5 处挂了 2kg
如果要在木棍下面放一个支点,让木棍平衡——支点位置就是"重心"。这个重心的位置就是期望!把重量换成概率,把位置换成取值——道理完全一样。
正式定义(核心):
离散型随机变量的期望
$$\boxed{E(X) = \sum_{i} x_i \cdot p_i = x_1 p_1 + x_2 p_2 + \cdots + x_n p_n}$$
其中 $x_i$ 是随机变量 X 的各个可能取值,$p_i = P(X = x_i)$ 是对应的概率。
连续型随机变量的期望
$$\boxed{E(X) = \int_{-\infty}^{+\infty} x \cdot f(x) , dx}$$
其中 $f(x)$ 是 X 的概率密度函数。这里用积分代替了求和——因为连续变量有无穷多个取值,没法一个个加,只能用积分这种"连续求和"的工具。
从离散到连续的过渡(帮你在脑中画图):
想象你把连续变量的取值范围切成很多很细的小条,每一条的宽度是 $\Delta x$(比如 0.01、0.001、越切越细)。在位置 $x$ 附近这一小条里,随机变量取值的概率大约是 $f(x) \cdot \Delta x$(密度乘宽度 ≈ 这一小条的面积 ≈ 概率)。于是:
$$\text{期望} \approx \sum x \cdot f(x) \cdot \Delta x$$
这和离散型的 $\sum x_i p_i$ 完全对应——$f(x)\Delta x$ 就是连续版的 $p_i$。然后让 $\Delta x \to 0$(小条无限细),求和号就变成了积分号:
$$\sum x \cdot f(x) \cdot \Delta x ;\longrightarrow; \int x \cdot f(x) , dx$$
和离散型唯一的区别:加号变积分号,概率 $p_i$ 换成"密度 × dx"($f(x)dx$)。
一句话记住:期望 = 以概率为权重的加权平均。它反映的是随机变量取值的"中心位置"。
举例:掷骰子的期望
掷一颗均匀的六面骰子,点数的期望是多少?
| 点数 $x_i$ | 1 | 2 | 3 | 4 | 5 | 6 |
|---|---|---|---|---|---|---|
| 概率 $p_i$ | 1/6 | 1/6 | 1/6 | 1/6 | 1/6 | 1/6 |
代入期望公式:
$$E(X) = 1 \times \frac{1}{6} + 2 \times \frac{1}{6} + 3 \times \frac{1}{6} + 4 \times \frac{1}{6} + 5 \times \frac{1}{6} + 6 \times \frac{1}{6}$$
$$= \frac{1+2+3+4+5+6}{6} = \frac{21}{6} = 3.5$$
期望是 3.5。有意思的是:骰子根本不会出现 3.5 这个点数!这说明——期望不一定是随机变量能取到的值。期望只是一个"中心位置",就像一家人的平均年龄可能是 28.3 岁,但家里没有人正好是 28.3 岁。
✍️ 立刻练一道:摸奖箱里 3 张票,奖金分别为 1 元、1 元、10 元,随机抽一张。求期望奖金。
点击看答案
把 3 张票看成每个取值等概率:抽到 1 元的概率是 2/3,抽到 10 元的概率是 1/3。所以:
$$E = 1 \times \frac{2}{3} + 10 \times \frac{1}{3} = \frac{2}{3} + \frac{10}{3} = \frac{12}{3} = 4$$
答案:期望奖金是 4 元。
举例:均匀分布的期望(连续型)
设 $X$ 在区间 $[0, 10]$ 上均匀分布:每个点的"可能性密度"都一样。概率密度函数是:
$$f(x) = \begin{cases} \frac{1}{10}, & 0 \leq x \leq 10 \ 0, & \text{其他地方} \end{cases}$$
求期望:
$$E(X) = \int_{0}^{10} x \cdot \frac{1}{10} , dx = \frac{1}{10} \cdot \frac{x^2}{2} \Big|_{0}^{10} = \frac{1}{10} \cdot \frac{100}{2} = 5$$
期望是 5。直觉上,在 0 到 10 上均匀分布,"中心"当然是正中间 5!
✍️ 立刻练一道:设 $X$ 在区间 $[0, 4]$ 上均匀分布,求 $E(X)$。
点击看答案
$$E(X) = \int_{0}^{4} x \cdot \frac{1}{4} , dx = \frac{1}{4} \cdot \frac{x^2}{2} \Big|_{0}^{4} = \frac{1}{4} \cdot \frac{16}{2} = 2$$
答案:2(均匀分布的期望正好在区间正中间)。
4.2 随机变量函数的期望
📌 学完本节你能回答:求 $E(X^2)$ 需要先把 $X^2$ 的分布求出来吗?为什么可以直接用 X 的分布算?
先看一道题:掷骰子,平均能掷出多少个"点数的平方"?
上一节我们算了骰子点数的期望。现在问一个更麻烦的:如果想知道 $X^2$ 的期望(比如 $E(X^2)$),需不需要先把 $X^2$ 的分布求出来?
看到这题,先别慌。它难在哪?
🧠 难在哪? 按期望的定义,求期望的前提是"知道随机变量的分布"。$X^2$ 是一个新的随机变量,它的分布($X^2$ 取 1、4、9、16、25、36 的概率分别是多少)看起来要先算出来,才能套定义求期望——这会多出整整一步。能不能绕开这一步,直接用 X 的分布算?
先动手试探。试一种"笨办法":先把 $X^2$ 的分布列出来。
骰子点数 1、2、3、4、5、6 各占 1/6,那么 $X^2$ 取 1²、2²、3²、4²、5²、6² 对应的概率还是各 1/6($X$ 取哪个点,$X^2$ 就取哪个点的平方——概率不动)。于是:
$$E(X^2) = 1^2 \times \frac{1}{6} + 2^2 \times \frac{1}{6} + 3^2 \times \frac{1}{6} + 4^2 \times \frac{1}{6} + 5^2 \times \frac{1}{6} + 6^2 \times \frac{1}{6}$$
$$= \frac{1 + 4 + 9 + 16 + 25 + 36}{6} = \frac{91}{6} \approx 15.17$$
🧠 这一步在想什么:注意看——我们在算的时候,根本没有额外求 $X^2$ 的分布!只是在原来 X 的每个取值上,把 $x_i$ 换成 $x_i^2$,概率 $p_i$ 原封不动。为什么可以这样?因为"$X^2$ 取 $x_i^2$" 和 "$X$ 取 $x_i$" 是同一件事——概率没变,变的只是这个值本身。
🔍 回头看看我们做了什么:原来要求 $g(X)$(比如 $X^2$、$3X+1$、$e^X$)的期望,直接用 X 的分布算就行——把 X 的每个取值 $x_i$ 换成 $g(x_i)$,概率权重 $p_i$ 不动。
生活比喻:你手里有一个班级每个学生的体重数据。现在想知道"体重平方的平均值"——你只需要把每个人的体重平方一下,然后直接算平均就行。你不需要重新去称体重,也不需要重新整理一份"体重平方"的数据表。
正式定义:
离散型
$$\boxed{E[g(X)] = \sum_{i} g(x_i) \cdot p_i}$$
连续型
$$\boxed{E[g(X)] = \int_{-\infty}^{+\infty} g(x) \cdot f(x) , dx}$$
关键理解:概率权重 $p_i$(或密度 $f(x)$)还是原来 X 的,只是把 $x_i$ 换成了 $g(x_i)$。
举例:继续骰子的例子,求 $E(X^2)$:
$$E(X^2) = 1^2 \times \frac{1}{6} + 2^2 \times \frac{1}{6} + 3^2 \times \frac{1}{6} + 4^2 \times \frac{1}{6} + 5^2 \times \frac{1}{6} + 6^2 \times \frac{1}{6}$$
$$= \frac{1 + 4 + 9 + 16 + 25 + 36}{6} = \frac{91}{6} \approx 15.17$$
这个 $E(X^2)$ 后面计算方差时直接用。
✍️ 立刻练一道:
(1) 设 X 的分布律为 $P(X=0)=0.2$,$P(X=2)=0.3$,$P(X=3)=0.5$,求 $E(X^2)$。
(2) 设 $X \sim U[0, 2]$(均匀分布),求 $E(X^2)$。
点击看答案
(1) 离散型,套 $E[g(X)] = \sum g(x_i) \cdot p_i$:
$$E(X^2) = 0^2 \times 0.2 + 2^2 \times 0.3 + 3^2 \times 0.5 = 0 + 1.2 + 4.5 = 5.7$$
(2) 连续型,$f(x) = 1/2$($0 \le x \le 2$):
$$E(X^2) = \int_0^2 x^2 \cdot \frac{1}{2} , dx = \frac{1}{2} \cdot \frac{x^3}{3} \Big|_0^2 = \frac{1}{2} \cdot \frac{8}{3} = \frac{4}{3}$$
答案:(1) 5.7;(2) 4/3。
题3(函数的期望·离散型)
设 X 的分布律同题1(即 $P(X=0)=0.2$,$P(X=1)=0.5$,$P(X=2)=0.3$)。求 E(3X+2) 和 E(X²−1)。
📌 对应模板:题型三(随机变量函数的期望)
点击看答案
法一:直接套公式
E(3X+2) = 3E(X) + 2 = 3×1.1 + 2 = 5.3
E(X²−1) = E(X²) − 1 = 1.7 − 1 = 0.7
法二:分布律法(验证)
(3X+2) 的取值:2, 5, 8 对应概率 0.2, 0.5, 0.3
E(3X+2) = 2×0.2 + 5×0.5 + 8×0.3 = 0.4 + 2.5 + 2.4 = 5.3 ✓
答案:E(3X+2)=5.3,E(X²−1)=0.7
4.3 数学期望的性质
📌 学完本节你能回答:$E(X+Y) = E(X) + E(Y)$ 需要 X 和 Y 独立吗?$E(XY) = E(X)E(Y)$ 呢?为什么"和"比"积"更容易拆?
先想一个问题:给每个人涨工资,平均工资怎么变?
你是一家公司的 HR,想把每份工资都翻倍,再加 500 块钱补贴。你不想逐个算 1000 个人的新工资再求平均——太累了。能不能只用"原来的平均工资"一步算出"新平均工资"?
看到这题,先别慌。难在哪?
🧠 难在哪? "先平均再翻倍" 和 "先翻倍再平均" 是不是一回事?直觉说应该是——但直觉不算数,得验证。更麻烦的是第二件事:如果公司有两个部门,"两个部门的平均工资加起来" 和 "把两个部门的工资合在一起算平均" 是不是也一回事?——这次直觉有点拿不准了,因为部门人数可能不一样。
先动手试探一个具体例子。全班两个小组,A组 30 人平均 165cm,B组 10 人平均 175cm,全班平均 167.5cm(4.1 节算过)。现在每个人都加 5cm——新全班平均是多少?
- 直接算:每个人加 5cm,全班平均也加 5cm → 167.5 + 5 = 172.5
- 用"平均"算:旧平均 167.5 + 5 = 172.5 ✓
🔍 回头看看我们做了什么:两种算法结果一样——"先平均再线性变换" = "先线性变换再平均"。给平均工资翻倍再加补贴,就是:新平均 = 2 × 旧平均 + 500。这就是期望的线性性质,它让"求平均"变得异常好拆。
掌握期望的运算规则很重要——它特别好拆,这是它比中位数、众数等其他"中心"指标都好用的原因。
性质1:常数的期望就是它自己
$$\boxed{E(C) = C}$$
(一个确定不变的数字,它的"平均"当然就是这个数字本身。)
性质2:常数倍可以提出来
$$\boxed{E(aX) = a \cdot E(X)}$$
性质3:和的期望等于期望的和(最重要的性质)
$$\boxed{E(X + Y) = E(X) + E(Y)}$$
这个公式永远成立!不需要 X 和 Y 独立!
性质4:线性性质(性质2+3的合并)
$$\boxed{E(aX + bY) = a \cdot E(X) + b \cdot E(Y)}$$
推广到多个变量:
$$E(a_1 X_1 + a_2 X_2 + \cdots + a_n X_n) = a_1 E(X_1) + a_2 E(X_2) + \cdots + a_n E(X_n)$$
性质5:独立时乘积的期望等于期望的乘积
$$\boxed{\text{当 } X, Y \text{ 独立时:} E(XY) = E(X) \cdot E(Y)}$$
注意:反过来不成立!$E(XY) = E(X)E(Y)$ 成立,并不能推出 X 和 Y 独立。这是高频易错点,后面 4.9 节会详细辨析。
总结一下:和的期望可以拆(性质3)永远成立,不需要任何条件。但乘积的期望可以拆(性质5)只有独立时才成立。
为什么"和"比"积"更容易拆?直观理解:平均身高加平均体重 = 平均(身高+体重),这不需要身高和体重有什么关系。但平均(身高×体重)一般不等于平均身高×平均体重——除非身高和体重完全没关系。
✍️ 立刻练一道:
(1) 已知 E(X) = 5,求 E(2X + 3)。
(2) 已知 E(X) = 2,E(Y) = 4,且 X 和 Y 独立。求 E(XY);若不独立,E(XY) 还能拆吗?
点击看答案
(1) 线性性质:$E(2X+3) = 2E(X) + 3 = 2 \times 5 + 3 = 13$。
(2) X 和 Y 独立时,$E(XY) = E(X)E(Y) = 2 \times 4 = 8$。若不独立,E(XY) 不能拆成 E(X)E(Y)——乘积的期望只有独立才能拆,这是 4.9 节的重点。
答案:(1) 13;(2) 独立时 8,不独立时不能拆。
期望线性性质的推导(定理级六段式)
🎲 生活场景:公司给每个员工发工资——基础工资3000,绩效系数1.5。如果平均绩效分是80分,那平均工资就是 3000 + 1.5 × 80 = 3120。这个心算过程你每天都在做,它就是期望线性性质的日常版——"先平均再线性变换"和"先线性变换再平均"结果一样。下面把这条直觉正式证明出来,然后看另一条更反直觉的性质:两件事的"平均之和"永远等于"和的平均"——哪怕这两件事互相影响。
② 正式陈述:设 $X, Y$ 为任意随机变量,$a, b, c$ 为常数。
$$
\boxed{E(aX + b) = a \cdot E(X) + b} \qquad \text{(线性变换——可以先变换再求平均,也可以先求平均再变换)}
$$
$$
\boxed{E(X + Y) = E(X) + E(Y)} \qquad \text{(和的期望等于期望的和——永远成立,不需要独立!)}
$$
$$
\boxed{E(aX + bY + c) = a \cdot E(X) + b \cdot E(Y) + c} \qquad \text{(上面两条合并)}
$$
③ 完整推导:
🧠 第1步:从离散型开始——推导 $E(aX+b) = aE(X)+b$
设 $X$ 的分布律为 $P(X = x_i) = p_i$。那么 $aX+b$ 的取值是 $a x_i + b$,对应的概率还是 $p_i$($X$ 取哪个值,变换后的变量就取对应的值——概率不变)。
$$E(aX+b) = \sum_i (a x_i + b) \cdot p_i$$
大白话:把变换后的每个可能值,乘以原来的概率,再加起来。
🧠 第2步:拆括号,提常数
$$E(aX+b) = \sum_i (a x_i \cdot p_i + b \cdot p_i) = a\sum_i x_i p_i + b\sum_i p_i$$
大白话:就像拆括号 $(2 \times 3 + 5) \times 0.1 + (2 \times 4 + 5) \times 0.9$——先把每一项里的 $a$ 提到求和号外面,$b$ 也提到外面。
🧠 第3步:两个关键事实收尾
- $\sum_i x_i p_i = E(X)$ —— 这正好是期望的定义
- $\sum_i p_i = 1$ —— 所有概率加起来等于 1(概率的基本公理)
$$E(aX+b) = a \cdot E(X) + b \cdot 1 = aE(X) + b$$
大白话:这是认知转折点——$b$ 那一项乘的就是 1(概率之和),不是什么奇怪的系数。正是因为"概率之和等于 1"这个基本事实,常数才能"直接加"而不打折。
🧠 第4步:连续型验证(完全平行的推导)
把 $\sum$ 换成 $\int$,$p_i$ 换成 $f(x)dx$,步骤一模一样:
$$E(aX+b) = \int_{-\infty}^{+\infty} (ax+b) \cdot f(x) , dx = a\int x f(x)dx + b\int f(x)dx = aE(X) + b$$
大白话:连续型只是"把加号换成积分号",逻辑链和离散型完全一样。关键依然是 $\int f(x)dx = 1$(密度函数的总面积等于 1)。
🧠 第5步:推导 $E(X+Y) = E(X)+E(Y)$——本章最重要的证明
这是期望最强大的性质。用连续型推导(离散型同理,把积分换求和即可):
$$E(X+Y) = \iint (x+y) \cdot f(x,y) , dx , dy$$
大白话:求 $X+Y$ 的期望,需要用联合密度 $f(x,y)$——因为 $X$ 和 $Y$ 是"同时"出现的。
$$E(X+Y) = \iint x \cdot f(x,y) , dx , dy + \iint y \cdot f(x,y) , dx , dy$$
大白话:把 $(x+y)$ 拆成 $x$ 和 $y$ 分别积分——这一步不需要任何条件,因为积分运算本身就是线性的,对两个函数和的积分永远等于各自积分的和。
接下来先对"另一个变量"积分——把联合密度压扁成一维的边缘密度:
$$\iint x \cdot f(x,y) , dx , dy = \int x \left[ \int f(x,y) , dy \right] dx = \int x \cdot f_X(x) , dx = E(X)$$
$$\iint y \cdot f(x,y) , dx , dy = \int y \left[ \int f(x,y) , dx \right] dy = \int y \cdot f_Y(y) , dy = E(Y)$$
大白话:关键洞察——不管 $f(x,y)$ 里面 $X$ 和 $Y$ 有什么样的联动关系,当你先对 $y$ 积分时,$X$ 的贡献就回到了 $X$ 自己的边缘密度;对 $x$ 积分同理。联动关系在这个"压缩"的过程中被消化掉了。
所以:$E(X+Y) = E(X) + E(Y)$——永远成立,不需要独立。
🧠 第6步:对比——$E(XY)=E(X)E(Y)$ 为什么需要独立?
$$E(XY) = \iint xy \cdot f(x,y) , dx , dy$$
要把这个拆成 $E(X) \cdot E(Y) = \left(\int x f_X(x)dx\right) \cdot \left(\int y f_Y(y)dy\right)$,需要满足:
$$f(x,y) = f_X(x) \cdot f_Y(y)$$
而上面这个等式恰好就是 $X$ 和 $Y$ 独立的定义!只有联合密度等于边缘密度的乘积,二重积分 $\iint xy \cdot f_X(x)f_Y(y) , dx , dy$ 才能拆成 $\int x f_X(x)dx \cdot \int y f_Y(y)dy = E(X)E(Y)$。
大白话总结:和 $(x+y)$ 天然可分——加法本身就能拆成两项;积 $xy$ 不能天然分开——除非联合分布恰好等于"边缘分布的乘积"(也就是独立)。
📝 推导复盘(用大白话把整个逻辑串一遍):
公式一 $E(aX+b)=aE(X)+b$:你把全班每个人的分数都乘 1.5 再加 10 分,新平均分就是旧平均分乘 1.5 再加 10。证明只用到"拆括号"和"概率和等于 1"。
公式二 $E(X+Y)=E(X)+E(Y)$:不管 $X$ 和 $Y$ 的联合分布长什么样——先对 $y$ 积分就把联合分布压成了 $X$ 的边缘分布,$X$ 的期望就自然出来了;$Y$ 那边同理。整个推导没有任何一步用到了独立——这就是为什么它是"永远成立"的。
公式三 $E(XY)=E(X)E(Y)$ 需要独立:因为 $xy$ 乘在一起分不开,除非联合分布 = 边缘分布的乘积(即独立)。加法天然可拆,乘法不行——这是小学数学就有的直觉,在概率论里依然成立。
⚠️ 易错边界:
- 最经典的混淆:把 $E(X+Y)=E(X)+E(Y)$(永远成立)和 $E(XY)=E(X)E(Y)$(独立才成立)搞反。记住口诀:加法不挑食(不挑独立不独立),乘法挑独立。
- $E(aX+b)=aE(X)+b$ 中的 $b$ 为什么是"直接加":因为 $\sum b \cdot p_i = b \cdot \sum p_i = b \cdot 1 = b$——概率和等于 1 保证了常数项不受打折。
- 离散和连续的推导完全平行:积分号和求和号在"线性拆开"这点上性质完全一样,不用被积分号吓到。
- 推广到多个变量:$E(X_1+X_2+\cdots+X_n) = E(X_1)+E(X_2)+\cdots+E(X_n)$ 永远成立。这在后面二项分布 $E(X)=np$ 的推导和样本均值的期望推导中要反复用到。
🪢 在整条链中的位置:
- 上游依赖:期望的定义(4.1 节:离散用求和、连续用积分)
- 同一节内:性质 1-3 是性质 4-5 的基石
- 下游应用:方差计算公式推导(4.4 节,"逐项求期望"就是线性性质);二项分布 $E(X)=np$ 的推导($n$ 次伯努利之和的期望 = $n$ 个 $p$ 相加);样本均值 $\bar{X}$ 的无偏性(第 6-7 章核心)
4.4 方差的定义与计算
📌 学完本节你能回答:方差为什么用"平方"而不用"绝对值"来衡量波动?$Var(X) = E(X^2) - [E(X)]^2$ 是怎么从定义推导出来的?
先看一个困境:两个班平均分一样,你选哪个班?
甲班和乙班的平均分都是 75 分。但甲班人人都是 70-80 分,很整齐;乙班有人满分、有人不及格,差距很大。只看平均分,两个班完全没区别——但你要替孩子选班,显然会选甲班。
看到这个困境,先别慌。难在哪?
🧠 难在哪? "平均水平"这个数(期望)只告诉我们"中心在 75",没告诉我们"大家散得多开"。可"散开程度"恰恰是选班、选股票、选基金时最关心的信息。能不能造一个数字来量"离散程度"?
先动手试探。怎么量"大家离平均有多远"?最自然的想法是:每个成绩减去平均分 75,看看差多少。甲班每个差都很小(0-5 分),乙班差得很大(有人差 25 分)。于是"平均差距"就能区分两个班了。
但这里有个坑:有人 80(比 75 高 5),有人 70(比 75 低 5)——直接把"差距"加起来,5 和 -5 就抵消了!平均差距算出来是 0,什么也区分不了。
怎么绕过这个坑?有两条路:一是取绝对值($|X-75|$),二是取平方($(X-75)^2$)。绝对值算起来直观,但没法展开化简,数学上"难伺候";平方虽然数值变大,但可以展开成多项式,而且会放大偏离大的极端值——就像吵架时最激烈的那一下更让人记得住。所以数学界选了平方。
于是"离散程度"这个数字就浮现出来了——把每个取值离期望的距离平方,再取期望。这就是方差。
期望告诉我们"平均水平",但世界上很多事情光看平均是不够的。这就引出了方差——衡量波动程度。
生活比喻一:两个班的平均分都是 75 分:
- A班:每个人都差不多 70-80 分,很整齐
- B班:有人满分,有人不及格,差距很大
只看平均分,两个班没区别。但你显然知道这两个班的情况完全不同!差的那一个信息就是:大家的成绩离平均分有多远——这就是方差要衡量的东西。
生活比喻二:两只股票平均年收益都是 8%——但一只每年稳定在 7%-9%,另一只今年赚 50% 明年亏 30%。哪只更适合存养老钱?显然是稳定的那只。方差就是衡量这种"稳定性"的指标。
正式定义(核心):
$$\boxed{Var(X) = E\left[(X - E(X))^2\right]}$$
方差 =(每个取值离期望的距离)的平方,再取期望。
为什么用平方而不用绝对值? 两个原因:
- 平方在数学上更好处理——可以展开成多项式来化简,而绝对值没法这样拆开
- 平方会"放大"偏离较大的值,更突出那些远离中心的极端情况
方差大 → 数据分散、波动大、不稳定
方差小 → 数据集中、波动小、稳定
方差的计算公式(六段式推导)
🎯 生活场景:你在比较两支股票的稳定性。A股票每天涨跌都在1%以内,B股票有时暴涨5%有时暴跌4%。光看"平均涨幅"看不出区别,你需要一个数字来衡量"距离平均有多远"——这就是方差的计算公式要解决的问题。定义公式 $E[(X-\mu)^2]$ 很直观("每个值离平均的距离平方,再求平均"),但每次都要"先减、再平方、再求和",太麻烦。下面推导一个更省力的公式。
② 正式陈述:设随机变量 $X$ 的期望为 $\mu = E(X)$,则方差的计算公式为:
$$\boxed{Var(X) = E(X^2) - [E(X)]^2}$$
③ 完整推导(从定义 $Var(X)=E[(X-\mu)^2]$ 出发):
🧠 第1步:展开平方
$$(X - \mu)^2 = X^2 - 2\mu X + \mu^2$$
大白话:就和二项式 $(a-b)^2 = a^2 - 2ab + b^2$ 完全一样——把 $\mu$ 当成常数展开。
🧠 第2步:逐项求期望
$$Var(X) = E(X^2 - 2\mu X + \mu^2) = E(X^2) - E(2\mu X) + E(\mu^2)$$
大白话:利用期望的线性性质——和的期望 = 期望的和,三项分别处理。
🧠 第3步:代入 $\mu = E(X)$,处理常数项
- $E(2\mu X)$:$2\mu$ 是常数,提到外面 → $2\mu \cdot E(X) = 2\mu \cdot \mu = 2\mu^2$
- $E(\mu^2)$:$\mu^2$ 是常数,常数的期望就是它自己 → $\mu^2$
大白话:这一步是"认知转折点"——$\mu = E(X)$ 是一个确定的数字(比如掷骰子 $\mu = 3.5$),不是随机变量!所以它可以像普通数字一样被提到期望符号外面。
🧠 第4步:合并化简
$$Var(X) = E(X^2) - 2\mu^2 + \mu^2 = E(X^2) - \mu^2 = E(X^2) - [E(X)]^2$$
大白话:中间两项 $-2\mu^2 + \mu^2 = -\mu^2$,最后把 $\mu$ 写回 $E(X)$。
📝 推导复盘:整个推导只有两个关键动作——① 展开平方(初中代数);② 把 $E(X)$ 当常数提出来(这是最容易滑过去的认知跳跃)。最终结果用大白话记:方差 = 平方的平均 − 平均的平方。
⚠️ 易错边界:
- $[E(X)]^2$ 和 $E(X^2)$ 是完全不同的两样东西:$[E(X)]^2$ 是先算平均、再把平均这个数平方;$E(X^2)$ 是先把每个值平方、再求平均。顺序完全不同!比如掷骰子:$E(X)=3.5$,$[E(X)]^2 = 12.25$;但 $E(X^2) \approx 15.17$。两者之差才是方差。
- 写公式时最容易犯的笔误:把 $[E(X)]^2$ 写成 $E(X)^2$(丢了中括号),或者干脆忘写平方写成 $E(X)$。一定要记住:减号后面是"期望的平方",不是"直接写期望"。
- $E(X)$ 是常数,$X$ 才是随机变量:推导中能提出来的是 $E(X)$(确定的数字),而不是 $X$ 本身。
🪢 在整条链中的位置:
- 上游依赖:期望的定义(4.1节)→ 随机变量函数的期望(4.2节,用来算 $E(X^2)$)→ 期望的线性性质(4.3节,用来拆开三项)
- 本章内部:这个公式是 4.5 节方差性质($Var(aX+b)=a^2Var(X)$)的证明基础;也是 4.7 节协方差计算公式 $Cov(X,Y)=E(XY)-E(X)E(Y)$ 的"亲兄弟"——两者推导套路完全一样(展开→拆期望→常数项合并)
- 下游应用:第5章切比雪夫不等式直接用期望和方差估计概率;第6-7章参数估计和假设检验的几乎所有公式(样本方差、标准误、置信区间)都依赖这个计算式
举例:掷骰子的方差
第一步:算 $E(X) = 3.5$
第二步:算 $E(X^2) = \frac{91}{6} \approx 15.1667$
第三步:代入计算公式
$$Var(X) = E(X^2) - [E(X)]^2 = \frac{91}{6} - \left(\frac{7}{2}\right)^2 = \frac{91}{6} - \frac{49}{4}$$
通分(公分母 12):
$$= \frac{182}{12} - \frac{147}{12} = \frac{35}{12} \approx 2.917$$
骰子点数的方差约为 2.917。
✍️ 立刻练一道:设 X 的分布律为:P(X=−1)=0.2,P(X=1)=0.8。求 E(X) 和 Var(X)。
点击看答案
E(X) = (−1)×0.2 + 1×0.8 = −0.2 + 0.8 = 0.6
E(X²) = (−1)²×0.2 + 1²×0.8 = 0.2 + 0.8 = 1.0
Var(X) = E(X²) − [E(X)]² = 1.0 − 0.36 = 0.64
答案:E(X)=0.6,Var(X)=0.64。
题1(离散型期望方差)
设 X 的分布律为:P(X=0)=0.2,P(X=1)=0.5,P(X=2)=0.3。求 E(X) 和 Var(X)。
📌 对应模板:题型一(离散型期望方差)
点击看答案
E(X) = 0×0.2 + 1×0.5 + 2×0.3 = 0 + 0.5 + 0.6 = 1.1
E(X²) = 0²×0.2 + 1²×0.5 + 2²×0.3 = 0 + 0.5 + 1.2 = 1.7
Var(X) = E(X²) − [E(X)]² = 1.7 − 1.21 = 0.49
答案:E(X)=1.1,Var(X)=0.49
题2(连续型期望方差)
设 X ~ U[0, 2](均匀分布),求 E(X) 和 Var(X)。并和公式对照验证。
📌 对应模板:题型二(连续型期望方差)+ 题型六(常见分布套公式)
点击看答案
积分法:
E(X) = ∫₀² x·(1/2) dx = (1/2)·[x²/2]₀² = (1/2)·2 = 1
E(X²) = ∫₀² x²·(1/2) dx = (1/2)·[x³/3]₀² = (1/2)·(8/3) = 4/3
Var(X) = 4/3 − 1² = 1/3 ≈ 0.3333
公式法验证:
U[a,b]:E(X) = (a+b)/2 = (0+2)/2 = 1 ✓
Var(X) = (b−a)²/12 = 4/12 = 1/3 ✓
答案:E(X)=1,Var(X)=1/3
标准差
方差的单位是原单位的平方——比如身高单位是"厘米",方差的单位就是"平方厘米"。这很难直观理解。
标准差就是方差开平方:
$$\boxed{\sigma_X = \sqrt{Var(X)}}$$
标准差的单位和原始数据一致(都是厘米),更直观,也是实际中最常用的波动性指标。
掷骰子的标准差:$\sigma = \sqrt{\frac{35}{12}} \approx 1.708$。可以这样理解:掷骰子的点数,平均偏离期望大约 1.7 个点。
标准化变换
生活比喻:两个人比工资——
- 张三在A公司,平均工资 5000,他拿 6000(比平均高 1000)
- 李四在B公司,平均工资 20000,他拿 22000(比平均高 2000)
谁在公司里"更突出"?只看高出的绝对值(1000 vs 2000),李四高出更多。但A公司工资波动小(比如大家基本都在 4000-6000),B公司波动大(有人拿 10000 有人拿 30000)。标准化就是用一个统一的尺子来衡量——"你高出平均值的部分,相当于几个'波动单位'?"
正式定义:
$$\boxed{X^* = \frac{X - E(X)}{\sqrt{Var(X)}} = \frac{X - \mu}{\sigma}}$$
这个变换叫做"标准化"(有时也泛称"归一化",但严格来说,"归一化"更多指缩放到 [0,1] 区间,而这里的"标准化"是变成均值 0 方差 1),变换后的变量 $X^*$ 有两个特征:
- 期望为 0:$E(X^*) = 0$
- 方差为 1:$Var(X^*) = 1$
为什么要做这个? 两个好处:
- 让不同单位、不同量级的变量可以放在一起比较(把"厘米"和"公斤"都变成"偏离了几个标准差"这种无量纲的数字)
- 任何正态分布标准化后都变成标准正态分布 N(0,1),方便查表计算概率(第5章大量使用)
考研中频繁用到标准化——尤其是正态分布相关题目,"先标准化再查表"是固定流程。
4.5 方差的性质
📌 学完本节你能回答:全班每人加 5cm,方差变不变?全班每人翻倍,方差怎么变?$Var(X+Y)$ 和 $E(X+Y)$ 的拆分条件有什么不同?
先猜两个问题:全班身高每人加 5cm / 每人翻倍,方差怎么变?
你已经知道全班同学的身高分布和方差了。现在问两个生活问题:
- 全班每人长高 5cm(吃了增高药),方差变不变?
- 全班每人翻倍(换计量单位),方差怎么变?
看到这题,先别慌。难在哪?
🧠 难在哪? 方差是"距离的平方"——但这里的"距离"是"每个人离平均值的距离"。加 5cm 时,平均值也涨了 5cm——每个人和平均值的差距纹丝不动,所以方差不变。翻倍时,每个人离平均值的距离变成 2 倍,而方差是"距离的平方"——所以方差变成 2² = 4 倍,不是 2 倍!
这个"先猜后证"的过程,正是本节要系统化的内容——方差怎么随"加常数、乘系数"变化,以及两个变量相加时方差怎么拆。先记住两条直觉:
生活比喻:
- 全班同学身高每个人都加 5cm(吃了增高药)——方差不变,因为大家还是原来那样散开
- 全班同学身高每个人都翻倍(换了计量单位)——方差变成原来的 4 倍,因为差距也被放大了
性质1:常数的方差为0
$$\boxed{Var(C) = 0}$$
(一个确定的数字,没有任何波动,方差当然是 0。)
性质2:平移不影响方差(加常数,方差不变)
$$\boxed{Var(X + b) = Var(X)}$$
性质3:缩放量影响方差(乘常数,方差乘其平方)
$$\boxed{Var(aX) = a^2 \cdot Var(X)}$$
性质2+3合并:
$$\boxed{Var(aX + b) = a^2 \cdot Var(X)}$$
注意:加 b 方差不变,但乘 a 方差变成 $a^2$ 倍。为什么是平方?因为方差是用"距离的平方"定义的——乘 a 以后,距离变成 a 倍,平方后自然是 $a^2$ 倍。
性质4:独立时,和的方差等于方差的和
$$\boxed{\text{当 } X, Y \text{ 独立时:} Var(X + Y) = Var(X) + Var(Y)}$$
这里要求独立!和期望不同——$E(X+Y)=E(X)+E(Y)$ 永远成立,但方差的和要独立才能拆。
独立时减法也一样:
$$Var(X - Y) = Var(X) + Var(Y)$$
注意减法的方差也是加——因为 $(-1)^2 = 1$。
🔑 和期望对比——方差的"脾气"比期望"差":
期望 E 方差 Var 和的拆分 $E(X+Y)=E(X)+E(Y)$ 永远成立 $Var(X+Y)=Var(X)+Var(Y)$ 需要独立才行 为什么? 加法本身就可以拆,不需要联动信息 方差涉及平方,展开后多了一个交叉项 $2Cov(X,Y)$,独立时这项才消掉 记住 期望是"好脾气"——永远可拆 方差是"坏脾气"——挑条件,不独立时多一项
性质5:不独立时的通式(提前预告协方差)
$$\boxed{Var(X + Y) = Var(X) + Var(Y) + 2 , Cov(X, Y)}$$
多出来的 $2Cov(X,Y)$ 就是协方差那一节要学的内容——它衡量的是 X 和 Y 的"联动效应"。如果 X 和 Y 一起变大一起变小,$Cov$ 为正,$Var(X+Y)$ 比各自方差之和更大。
✍️ 立刻练一道:
(1) 已知 Var(X) = 4,求 Var(2X + 3)。
(2) 已知 Var(X) = 2,Var(Y) = 5,且 X 和 Y 独立。求 Var(X + Y) 和 Var(X − Y)。
点击看答案
(1) $Var(2X+3) = 2^2 \times Var(X) = 4 \times 4 = 16$。注意:加 3(平移)对方差无影响,乘 2 的系数要平方。
(2) X 和 Y 独立 → 协方差为 0:
$Var(X+Y) = Var(X) + Var(Y) = 2 + 5 = 7$
$Var(X-Y) = Var(X) + Var(Y) = 2 + 5 = 7$
注意减法也是加——$(-1)^2 = 1$,这是最容易踩的坑。
答案:(1) 16;(2) 都是 7。
题4(方差性质)
已知 E(X)=5,Var(X)=4。求 Var(3X−2)。
📌 对应模板:题型四(期望方差性质)
点击看答案
Var(aX+b) = a²·Var(X)
Var(3X−2) = 3² × 4 = 9×4 = 36
注意:减2不影响方差!(方差衡量的是"波动",整体平移不改变波动)
答案:36
题8(期望方差性质·线性组合)
已知 E(X)=2,E(Y)=3,Var(X)=1,Var(Y)=4,Cov(X,Y)=1。求 E(2X−3Y+1) 和 Var(2X−3Y+1)。
📌 对应模板:题型四(期望方差性质)
点击看答案
E(2X−3Y+1) = 2E(X) − 3E(Y) + 1
= 2×2 − 3×3 + 1
= 4 − 9 + 1 = −4
Var(2X−3Y+1) = Var(2X−3Y) ← 加常数不影响方差
= 2²Var(X) + (−3)²Var(Y) + 2·2·(−3)·Cov(X,Y)
= 4×1 + 9×4 + (−12)×1
= 4 + 36 − 12
= 28
答案:E=−4,Var=28
题15(期望方差性质·独立情况)
设 X₁, X₂, ..., Xₙ 独立同分布,E(X_i)=μ,Var(X_i)=σ²。求 X̄ = (1/n)ΣX_i 的期望和方差。(这里先把 X̄ 当成"抽到的 n 个数据的平均"——样本/总体/无偏是第6-7章概念,此处不用多想。)
📌 对应模板:题型四(期望方差性质·线性组合)
点击看答案
E(X̄) = E((1/n)ΣX_i) = (1/n)·ΣE(X_i) = (1/n)·n·μ = μ
Var(X̄) = Var((1/n)ΣX_i) = (1/n²)·ΣVar(X_i) ← 独立所以协方差为0
= (1/n²)·n·σ² = σ²/n
答案:E(X̄)=μ,Var(X̄)=σ²/n
💡 核心结论:把 X̄ 当成"抽到的 n 个数据的平均"——
X̄ 的期望 = 这 n 个数共同的均值 μ;
X̄ 的方差 = σ²/n(数据越多,平均越精确)。
("样本/总体/无偏"是第6-7章才正式讲的概念,这里 X̄ 就是 n 个数据的平均。)
这是所有统计推断的基石!
题12(切比雪夫不等式·期望方差结合)
⚠️ 此题用到第5章的知识! 如果你还没学第5章,可以先跳过,学完切比雪夫不等式再回来做。
前置知识:什么是切比雪夫不等式?
白话解释(先建立直觉):就像你知道一个班级的平均分和方差,虽然不知道每个学生的具体分数,但你可以说"分数偏离平均分超过 20 分的人,最多不超过全班人数的 25%"。方差越小,这个上限越紧——数据越集中,偏离很远的人就越少。切比雪夫不等式不需要知道分布的具体形状!这就像你不需要知道全班每个人的具体成绩,也能给出"考砸的人数最多有多少"的上限。
公式:$P(|X - E(X)| \geq \varepsilon) \leq \frac{Var(X)}{\varepsilon^2}$
(详见第5章。)
已知随机变量 X 的 E(X)=10,Var(X)=4。用切比雪夫不等式估计 P(|X−10| ≥ 4) 的上界。
📌 对应模板:切比雪夫不等式(第5章)
点击看答案
切比雪夫不等式:P(|X−E(X)| ≥ ε) ≤ Var(X)/ε²
ε = 4
P(|X−10| ≥ 4) ≤ 4/16 = 0.25
即 X 偏离均值 4 以上的概率不超过 25%。
答案:上界为 0.25
方差性质的推导(定理级六段式)
📏 生活场景:你有两把尺子——厘米尺和米尺。用厘米尺量全班身高,方差是 100 cm²;改用米尺量,方差变成 0.01 m²。两个数差了一万倍,但说的其实是同一件事!方差缩放性质的秘密就在于单位也跟着平方了。还有一个反直觉的事实:给全班每人发 500 块钱补贴——工资的方差完全不变。因为"大家一起平移"不影响"彼此之间的差距"。下面从定义出发,把每条性质背后的"为什么"一步步推出来。
② 正式陈述:设 $X, Y$ 为任意随机变量,$a, b$ 为常数。
$$
\boxed{Var(aX + b) = a^2 \cdot Var(X)} \qquad \text{(缩放平方变,平移完全不变)}
$$
$$
\boxed{Var(X \pm Y) = Var(X) + Var(Y) \pm 2,Cov(X,Y)} \qquad \text{(通用式——不要求独立)}
$$
$$
\boxed{\text{当 } X, Y \text{ 独立时: } Var(X \pm Y) = Var(X) + Var(Y)} \qquad \text{(协方差项消失,且减法也是加!)}
$$
③ 完整推导:
🧠 第1步:推导平移不变性 $Var(X+b) = Var(X)$
从定义出发,设 $\mu = E(X)$:
$$Var(X+b) = E\left[ (X+b) - E(X+b) \right]^2$$
大白话:方差的定义是"偏离自己期望的距离的平方的期望"。先算 $X+b$ 的期望。
用期望线性性质:$E(X+b) = E(X) + b = \mu + b$。
$$Var(X+b) = E\left[ (X+b) - (\mu + b) \right]^2 = E\left[ X - \mu \right]^2 = Var(X)$$
大白话:平移不变性的核心秘密——$X$ 加了 $b$,期望也跟着加了 $b$,两者相减时 $b$ 恰好消掉!偏离距离 $(X+b)-(\mu+b) = X-\mu$ 和没加之前完全一样。就像全班每人长高 5cm,平均身高也涨了 5cm——每个人和平均值的差距纹丝不动,方差当然不变。
🧠 第2步:推导缩放性质 $Var(aX) = a^2 Var(X)$
$$Var(aX) = E\left[ aX - E(aX) \right]^2 = E\left[ aX - a\mu \right]^2$$
大白话:$E(aX) = aE(X) = a\mu$,同样用期望线性性质。
$$Var(aX) = E\left[ a(X - \mu) \right]^2 = E\left[ a^2 (X - \mu)^2 \right] = a^2 \cdot E[(X - \mu)^2] = a^2 Var(X)$$
大白话:平方的来源——$X-\mu$ 被乘了 $a$ 倍,然后外面还要平方:$(a \times \text{距离})^2 = a^2 \times \text{距离}^2$。就像把身高单位从厘米换成米——每个数值缩小到 1/100,距离缩小到 1/100,距离的平方就缩小到 $1/10000$。
🧠 第3步:合并——$Var(aX+b) = a^2 Var(X)$
$$Var(aX+b) = Var(aX) + 0 = a^2 Var(X)$$
大白话:先缩放(平方变),再平移(不变)。两步合起来——加常数对方差零影响,乘系数以平方形式改变方差。记住一句话:方差只看"波动"(差距),不关心"位置"(整体在哪)。
🧠 第4步:推导 $Var(X+Y)$ 通用式——交叉项如何出现
设 $\mu_X = E(X)$, $\mu_Y = E(Y)$,从定义出发:
$$Var(X+Y) = E\left[ (X+Y) - (\mu_X + \mu_Y) \right]^2$$
大白话:把 $X+Y$ 看成一个整体,算它偏离自己期望的平方的期望。
$$= E\left[ (X - \mu_X) + (Y - \mu_Y) \right]^2$$
大白话:把 $X+Y$ 的偏离拆成"$X$ 的偏离 + $Y$ 的偏离"。关键在下一步——平方展开!
🧠 第5步:展开平方——协方差诞生
$$= E\left[ (X-\mu_X)^2 + (Y-\mu_Y)^2 + 2(X-\mu_X)(Y-\mu_Y) \right]$$
大白话:$(a+b)^2 = a^2 + b^2 + 2ab$,中学知识。这里的 $2ab$ 项——$2(X-\mu_X)(Y-\mu_Y)$——就是协方差的来源!
逐项求期望:
$$= E[(X-\mu_X)^2] + E[(Y-\mu_Y)^2] + 2 \cdot E[(X-\mu_X)(Y-\mu_Y)]$$
大白话:前两项就是 $Var(X)$ 和 $Var(Y)$,第三项 $E[(X-\mu_X)(Y-\mu_Y)]$ 恰好是协方差的定义 $Cov(X,Y)$。
$$Var(X+Y) = Var(X) + Var(Y) + 2 , Cov(X,Y)$$
🧠 第6步:独立(或不相关)时,协方差项消失
当 $X$ 和 $Y$ 独立时,$E(XY) = E(X)E(Y)$,代入协方差公式:
$$Cov(X,Y) = E(XY) - E(X)E(Y) = 0$$
所以 $Var(X+Y) = Var(X) + Var(Y)$。
对于减法:展开 $(X-\mu_X) - (Y-\mu_Y)$ 的平方,交叉项变成 $-2(X-\mu_X)(Y-\mu_Y)$:
$$Var(X-Y) = Var(X) + Var(Y) - 2 , Cov(X,Y)$$
独立时 $Cov=0$,$Var(X-Y) = Var(X) + Var(Y)$
大白话:减法的方差也是加! 因为 $(-1)^2 = 1$,$Y$ 前面是减号但平方后系数是 $(−1)^2=1$。这非常反直觉——两个人身高的差距($X-Y$)的波动,等于各自波动的和,不是差。
📝 推导复盘(大白话重新讲一遍):
平移不变性:方差衡量的是"离平均有多远"。你平移了整个数据,平均值也跟着平移了同样的量——每个人和平均值的差距完全不变,方差自然不变。就像全班排队整体向前走一步——每个人之间的间距没有任何变化。
缩放平方变:把数据放大 $a$ 倍,每个人离平均值的距离也放大 $a$ 倍。方差是"距离的平方",所以放大 $a^2$ 倍。
和/差的方差:把两个变量加在一起,展开平方时出现了一个交叉项 $2(X-\mu_X)(Y-\mu_Y)$——双方"一起偏离"的部分。如果 $X$ 和 $Y$ 同涨同跌(正相关),这个交叉项为正,总波动比各自波动加起来更大(叠加效应)。如果它们一个涨一个跌(负相关),交叉项为负,总波动反而变小(对冲效应)。独立时这项恰好为零——总波动 = 各自波动之和。
⚠️ 易错边界:
- $Var(aX+b) = a^2 Var(X)$,不是 $a Var(X)$:系数的平方是最容易被忘记的地方。记忆技巧:方差是"距离的平方"——缩放 $a$ 倍后距离变成 $a$ 倍,平方就是 $a^2$。
- 减法方差也是加! 独立时 $Var(X-Y) = Var(X) + Var(Y)$,是加号不是减号。因为 $(-1)^2 = 1$。这个坑几乎每届学生都踩过。
- $Var(X+Y)=Var(X)+Var(Y)$ 不是"永远成立":这是方差和期望最关键的区别。$E(X+Y)=E(X)+E(Y)$ 永远成立(期望"好脾气");$Var(X+Y)=Var(X)+Var(Y)$ 需要独立或不相关(方差"坏脾气")。
- 通用式中协方差系数的符号:$Var(aX+bY) = a^2Var(X) + b^2Var(Y) + 2ab,Cov(X,Y)$。交叉项系数是 $2ab$,如果 $a$ 和 $b$ 中有一个是负的(比如 $X-Y$ 中 $b=-1$),协方差项也跟着变号。
🪢 在整条链中的位置:
- 上游依赖:方差的定义(4.4 节)→ 期望线性性质(4.3 节,推导中需要 $E(aX)=aE(X)$)→ 协方差定义(4.7 节,通用式中出现)
- 本章内部:性质 4(独立时方差可加)是二项分布 $Var(X)=np(1-p)$ 推导的核心($n$ 次独立伯努利,方差直接相加);性质 5(通用式)是协方差"为什么重要"的直接证据——只要不独立,方差计算就绕不开协方差
- 下游应用:第 5 章切比雪夫不等式和中心极限定理大量使用 $Var(aX+b)$ 和独立求和场景;第 6 章样本方差、第 7 章估计量方差的计算
4.6 常见分布的期望和方差(必须记住)
📌 学完本节你能回答:0-1、二项、泊松、均匀、指数、正态——这六种分布的期望和方差各是多少?能不看表默写出来吗?
先想一个问题:抛一枚硬币 10 次,平均正面几次?
假设你做 10 次独立抛硬币,每次正面概率 p=0.5。问你:平均能抛出几次正面? 几乎人人都能秒答"5 次"——但你能说清楚这个"5"是怎么来的吗?
看到这题,先别慌。难在哪?
🧠 难在哪? 回答"5 次"很容易,但如果让你把理由写出来,很多人只会说"直觉"。更麻烦的是:如果换成泊松分布、指数分布、正态分布,它们各自的期望方差长什么样?一长串公式死记硬背,背完就忘。
这就是本节要解决的问题:每个分布都配一个生活场景,让你"秒懂为什么公式长这样"——而不是死记硬背。
先看最简单的:抛 1 次硬币,正面次数记为 $X_1$。它只能取 0 或 1,取 1 的概率是 p。于是它的期望:
$$E(X_1) = 1 \times p + 0 \times (1-p) = p$$
🔍 回头看看我们做了什么:"抛 10 次硬币,正面次数" = 第 1 次的正面次数 + 第 2 次的正面次数 + …… + 第 10 次的正面次数(每次只能是 0 或 1)。期望的加法永远可拆(4.3 节性质3),所以:
$$E(X) = E(X_1) + E(X_2) + \cdots + E(X_{10}) = \underbrace{p + p + \cdots + p}_{10 个} = 10p$$
平均正面 5 次——这就是二项分布 $E(X) = np$ 的由来。用这个思路,本节下面六种分布都能"推出来"而不是"背出来"。
这张表是"必背内容",全书用到它们的次数非常多。别被表的长度吓到——先背前六种(就像背乘法口诀),后两种浏览即可。
🔑 这六种分布就像乘法口诀,背熟以后全书计算都能快三倍。 每种都配了生活例子,不是死记硬背。
第一层:必背六种(⭐⭐⭐ 考试核心)
| 分布名称 | 记号 | 期望 $E(X)$ | 方差 $Var(X)$ | 生活例子帮助记忆 | 助记技巧 |
|---|---|---|---|---|---|
| 0-1分布 | $X \sim B(1, p)$ | $p$ | $p(1-p)$ | 抛一次硬币看正反面。正面出现次数的期望值就是 $p$ | $p(1-p)$ 在 $p=0.5$ 时最大(最不确定) |
| 二项分布 | $X \sim B(n, p)$ | $np$ | $np(1-p)$ | 抛 $n$ 次硬币,正面出现次数。期望是 $n$ 次中平均出现 $np$ 次 | 0-1分布的 $n$ 倍:把 $n$ 次独立伯努利加起来 |
| 泊松分布 | $X \sim P(\lambda)$ | $\lambda$ | $\lambda$ | 一小时内来银行办业务的人数。$\lambda$ 就是平均每小时来的人数 | 唯一期望=方差的分布,两者都是 $\lambda$ |
| 均匀分布 | $X \sim U(a, b)$ | $\dfrac{a+b}{2}$ | $\dfrac{(b-a)^2}{12}$ | 公交车在 a 到 b 分钟之间随机到达。平均等候时间正好在中间 | 期望在正中间;方差分母是 12 |
| 指数分布 | $X \sim E(\lambda)$ | $\dfrac{1}{\lambda}$ | $\dfrac{1}{\lambda^2}$ | 灯泡的寿命。如果平均寿命是 1000 小时($1/\lambda=1000$) | 期望和参数成反比;$\lambda$ 越大等待越短 |
| 正态分布 | $X \sim N(\mu, \sigma^2)$ | $\mu$ | $\sigma^2$ | 全班考试成绩。$\mu$ 就是平均分,$\sigma^2$ 就是方差 | 参数直接就是期望和方差!注意第二个是方差不是标准差 |
第二层:了解即可(⭐ 考研数学三超纲)
点击展开几何分布和超几何分布
| 分布名称 | 记号 | 期望 $E(X)$ | 方差 $Var(X)$ | 生活例子 |
|---|---|---|---|---|
| 几何分布 | $p$ | $1/p$ | $(1-p)/p^2$ | 不断扔硬币直到第一次成功。成功概率越高,平均等待越短 |
| 超几何分布 | $N,M,n$ | $n\cdot M/N$ | 见下注 | 不放回抽样的二项分布变体 |
超几何分布方差:$n\cdot (M/N) \cdot (1-M/N) \cdot (N-n)/(N-1)$,考研数学三超纲,了解即可。
记忆技巧:
- 二项 = 0-1 的 n 倍:$np$ 和 $np(1-p)$
- 泊松的期望和方差相等,都等于 $\lambda$
- 均匀分布期望在区间正中间,方差分母是 12
- 指数分布期望是 $1/\lambda$,方差有平方
- 正态分布的 $\mu$ 和 $\sigma^2$ 就是期望和方差本身
补充:二项分布的期望 $np$ 怎么来的?(直觉理解)
二项分布就是 $n$ 次独立的伯努利试验。每次伯努利试验的期望是 $p$(因为 $E(X_1)=p$)。$n$ 次加起来:$E(X)=E(X_1+X_2+...+X_n)=E(X_1)+E(X_2)+...+E(X_n)=np$。
这里不需要 $X_i$ 之间独立(求和拆期望永远成立),所以这个推导很简洁。
同理方差:每次方差 $p(1-p)$,独立可加,$n$ 次加起来就是 $np(1-p)$。
三种核心分布的期望方差推导(从定义出发)
下面从定义出发,完整推导泊松分布、指数分布、二项分布的期望和方差。这三个推导覆盖了"级数求和""分部积分""独立拆分"三种核心技巧。其余分布的公式可直接查表套用。
推导一:泊松分布 $E(X)=\lambda$, $Var(X)=\lambda$
🎯 为什么选它:泊松是全章唯一一个"期望 = 方差"的分布——这个巧合背后有漂亮的数学。泊松的级数求和技巧(提出 $\lambda$、和阶乘约分)也是离散型分布推导的通用套路。
先求 $E(X)$:
$$E(X) = \sum_{k=0}^{\infty} k \cdot P(X=k) = \sum_{k=0}^{\infty} k \cdot \frac{\lambda^k e^{-\lambda}}{k!}$$
代入泊松分布概率公式 $P(X=k) = \frac{\lambda^k e^{-\lambda}}{k!}$。$k=0$ 那一项是 $0 \times \cdots = 0$,直接去掉,求和从 $k=1$ 开始。
$$E(X) = e^{-\lambda} \sum_{k=1}^{\infty} \frac{\lambda^k}{(k-1)!}$$
关键一步:$k/k! = k/[k \cdot (k-1)!] = 1/(k-1)!$。$k$ 和分母的 $k!$ 约掉了一个 $k$,分母降了一阶。
把 $\lambda^k$ 拆成 $\lambda \cdot \lambda^{k-1}$:
$$E(X) = \lambda e^{-\lambda} \sum_{k=1}^{\infty} \frac{\lambda^{k-1}}{(k-1)!}$$
令 $j = k-1$,求和从 $j=0$ 到 $\infty$:
$$E(X) = \lambda e^{-\lambda} \sum_{j=0}^{\infty} \frac{\lambda^{j}}{j!}$$
认知转折点:$\sum_{j=0}^{\infty} \frac{\lambda^j}{j!} = e^{\lambda}$——这就是指数函数 $e^x$ 的泰勒级数展开!($e^x = 1 + x + x^2/2! + x^3/3! + \cdots$,把 $x$ 换成 $\lambda$ 就是了。)
$$E(X) = \lambda e^{-\lambda} \cdot e^{\lambda} = \lambda$$
收尾:$e^{-\lambda} \cdot e^{\lambda} = 1$,完美消掉。泊松分布的参数 $\lambda$ 恰好就是期望——设计得非常漂亮。
再求 $Var(X)$:先求 $E(X^2)$,再用 $Var=E(X^2)-[E(X)]^2$。
处理 $k^2$ 的技巧:$k^2 = k(k-1) + k$,这样每一项都可以和阶乘约分。
$$E(X^2) = \sum_{k=0}^{\infty} k^2 \cdot \frac{\lambda^k e^{-\lambda}}{k!} = e^{-\lambda} \left[ \sum_{k=0}^{\infty} \frac{k(k-1)\lambda^k}{k!} + \sum_{k=0}^{\infty} \frac{k\lambda^k}{k!} \right]$$
第二项 $\sum \frac{k\lambda^k}{k!}$ 前面在求期望时算过,等于 $\lambda e^{\lambda}$。
第一项:$k(k-1)/k! = 1/(k-2)!$($k=0,1$ 时该项为 0,从 $k=2$ 开始):
$$\sum_{k=2}^{\infty} \frac{\lambda^k}{(k-2)!} = \lambda^2 \sum_{j=0}^{\infty} \frac{\lambda^j}{j!} = \lambda^2 e^{\lambda}$$
所以 $E(X^2) = e^{-\lambda} [\lambda^2 e^{\lambda} + \lambda e^{\lambda}] = \lambda^2 + \lambda$
$$Var(X) = E(X^2) - [E(X)]^2 = (\lambda^2 + \lambda) - \lambda^2 = \lambda$$
🎉 结论:$E(X)=\lambda$, $Var(X)=\lambda$。期望 = 方差 = $\lambda$,泊松是唯一拥有这个性质的常见分布。
推导二:指数分布 $E(X)=1/\lambda$, $Var(X)=1/\lambda^2$
🎯 为什么选它:指数分布需要分部积分法计算——这是连续型分布推导的标准技巧。掌握它就掌握了所有连续型分布期望方差的通用方法。
指数分布 $X \sim Exp(\lambda)$ 的密度函数:$f(x) = \lambda e^{-\lambda x}$($x > 0$)。
先求 $E(X)$:
$$E(X) = \int_0^{\infty} x \cdot \lambda e^{-\lambda x} , dx$$
需要分部积分法:$\int u , dv = uv - \int v , du$。
令 $u = x$, $dv = \lambda e^{-\lambda x} dx$,则 $du = dx$, $v = -e^{-\lambda x}$。
$$E(X) = \left[ x \cdot (-e^{-\lambda x}) \right]_0^{\infty} - \int_0^{\infty} (-e^{-\lambda x}) , dx$$
中括号部分:$x \to \infty$ 时 $x e^{-\lambda x} \to 0$(指数衰减比线性增长快得多);$x=0$ 时 $0 \times (-1) = 0$。所以中括号 = 0。
$$E(X) = 0 + \int_0^{\infty} e^{-\lambda x} , dx = \left[ -\frac{1}{\lambda} e^{-\lambda x} \right]_0^{\infty} = 0 - \left(-\frac{1}{\lambda}\right) = \frac{1}{\lambda}$$
$E(X) = 1/\lambda$。$\lambda$ 越大(事件越频繁),平均等待时间越短——直觉吻合。
再求 $E(X^2)$:
$$E(X^2) = \int_0^{\infty} x^2 \cdot \lambda e^{-\lambda x} , dx$$
再次分部积分,令 $u = x^2$, $dv = \lambda e^{-\lambda x} dx$:
$$E(X^2) = \left[ x^2 \cdot (-e^{-\lambda x}) \right]_0^{\infty} - \int_0^{\infty} (-e^{-\lambda x}) \cdot 2x , dx = 2 \int_0^{\infty} x \cdot e^{-\lambda x} , dx$$
注意到 $\int_0^{\infty} x \cdot e^{-\lambda x} dx$ 和刚才求 $E(X)$ 的积分只差一个 $\lambda$ 系数。实际上:
$$2 \int_0^{\infty} x \cdot e^{-\lambda x} , dx = \frac{2}{\lambda} \int_0^{\infty} x \cdot \lambda e^{-\lambda x} , dx = \frac{2}{\lambda} \cdot E(X) = \frac{2}{\lambda^2}$$
$$Var(X) = E(X^2) - [E(X)]^2 = \frac{2}{\lambda^2} - \left(\frac{1}{\lambda}\right)^2 = \frac{1}{\lambda^2}$$
🎉 结论:$E(X) = 1/\lambda$, $Var(X) = 1/\lambda^2$。方差 = 期望的平方,波动程度和平均水平在同一数量级。
推导三:二项分布 $E(X)=np$, $Var(X)=np(1-p)$(独立拆分法)
🎯 为什么选它:二项分布展示了概率论最优雅的技巧——把复杂随机变量拆成独立简单随机变量之和。直接从二项分布概率公式硬算极繁琐,但用"$n$ 次独立伯努利之和"这条桥梁,几步就出结果。
核心思路:设 $X \sim B(n, p)$。把 $X$ 写成 $n$ 个独立 0-1 变量之和:
$$X = X_1 + X_2 + \cdots + X_n$$
其中每个 $X_i \sim B(1, p)$($P(X_i=1)=p$, $P(X_i=0)=1-p$),且 $X_1, \ldots, X_n$ 相互独立。
大白话:抛 $n$ 次硬币,正面次数 = 第 1 次正面次数 + 第 2 次正面次数 + ... + 第 $n$ 次正面次数。每次的"正面次数"只能是 0 或 1。
推导期望:
$$E(X) = E(X_1 + X_2 + \cdots + X_n) = E(X_1) + E(X_2) + \cdots + E(X_n)$$
关键:期望的加法永远可拆,不需要独立!
每个 $X_i$ 是 0-1 分布:$E(X_i) = 1 \times p + 0 \times (1-p) = p$
$$E(X) = \underbrace{p + p + \cdots + p}_{n \text{ 个}} = np$$
$n$ 次试验,每次成功概率 $p$,平均成功 $np$ 次——直觉满分。
推导方差:
这次不能直接用"永远可拆"——方差拆和需要独立。好在 $X_i$ 之间确实是独立的。
$$Var(X) = Var(X_1 + \cdots + X_n) = Var(X_1) + \cdots + Var(X_n) \qquad \text{(独立,方差可加)}$$
每个 $X_i$ 的方差:$E(X_i^2) = 1^2 \times p + 0^2 \times (1-p) = p$,$Var(X_i) = p - p^2 = p(1-p)$
$$Var(X) = \underbrace{p(1-p) + \cdots + p(1-p)}_{n \text{ 个}} = np(1-p)$$
方差在 $p=0.5$ 时最大(最不确定),在 $p=0$ 或 $p=1$ 时为零(完全确定)——直觉吻合。
🎉 结论:$E(X) = np$, $Var(X) = np(1-p)$。
✍️ 立刻练一道:
(1) 设 X ~ B(12, 0.25)(二项分布),求 E(X) 和 Var(X)。
(2) 设 X ~ P(3)(泊松分布),求 E(X) 和 Var(X)。
(3) 设 X ~ Exp(4)(指数分布),求 E(X) 和 Var(X)。
点击看答案
(1) 二项分布:$E(X) = np = 12 \times 0.25 = 3$;$Var(X) = np(1-p) = 12 \times 0.25 \times 0.75 = 2.25$。
(2) 泊松分布:$E(X) = Var(X) = \lambda = 3$(泊松是唯一期望=方差的分布)。
(3) 指数分布:$E(X) = 1/\lambda = 1/4$;$Var(X) = 1/\lambda^2 = 1/16$。
答案:(1) E=3, Var=2.25;(2) E=3, Var=3;(3) E=1/4, Var=1/16。
题5(常见分布期望方差·二项)
已知 X ~ B(10, 0.3),求 E(X) 和 Var(X)。
📌 对应模板:题型六(常见分布套公式)
点击看答案
二项分布 B(n,p):
E(X) = np = 10×0.3 = 3
Var(X) = np(1−p) = 10×0.3×0.7 = 2.1
答案:E(X)=3,Var(X)=2.1
题9(连续型期望·指数分布)
设 X ~ Exp(2)(参数 λ=2 的指数分布)。求 E(X),Var(X),和 E(e^{−X})。
📌 对应模板:题型二+题型三(连续型期望 + 函数期望)
点击看答案
X ~ Exp(2):f(x) = 2e^{−2x},x > 0
套公式:
E(X) = 1/λ = 1/2
Var(X) = 1/λ² = 1/4
E(e^{−X}) = ∫₀^∞ e^{−x}·2e^{−2x} dx
= 2∫₀^∞ e^{−3x} dx
= 2·[−e^{−3x}/3]₀^∞
= 2·(0 − (−1/3))
= 2/3
答案:E(X)=0.5,Var(X)=0.25,E(e^{−X})=2/3
题11(正态分布+期望性质·真题型)
设 X ~ N(1, 4),Y ~ N(2, 9),且 X 和 Y 独立。求:
(1) E(2X−Y) 和 Var(2X−Y);
(2) P(2X−Y > 0)。(Φ(0)=0.5)
📌 对应模板:题型四+题型六(性质 + 正态分布)
点击看答案
X ~ N(1,4):E(X)=1,Var(X)=4
Y ~ N(2,9):E(Y)=2,Var(Y)=9
X, Y 独立 → Cov(X,Y)=0
(1) Z = 2X−Y
E(Z) = 2×1 − 2 = 0
Var(Z) = 4×4 + 1×9 = 16 + 9 = 25
因为 X, Y 都服从正态且独立,Z = 2X−Y 也服从正态:
Z ~ N(0, 25)
(2) P(Z > 0) = P(N(0,25) > 0)
标准化:(Z−0)/5 ~ N(0,1)
P(Z > 0) = P(N(0,1) > 0) = 1 − Φ(0) = 1 − 0.5 = 0.5
答案:(1) E=0,Var=25;(2) 0.5
💡 正态分布的线性组合仍然是正态分布。
均值0的正态分布大于0的概率恰好是50%。
题14(正态分布·标准差含义)
某考试成绩 X ~ N(72, σ²),已知 90% 的学生成绩在 60 到 84 分之间。求标准差 σ。(Φ⁻¹(0.95)≈1.645)
📌 对应模板:题型六(正态分布应用)
点击看答案
P(60 < X < 84) = 0.9
标准化:
P((60−72)/σ < Z < (84−72)/σ) = 0.9
P(−12/σ < Z < 12/σ) = 0.9
由于正态对称:P(Z < −12/σ) = P(Z > 12/σ) = (1−0.9)/2 = 0.05
所以 P(Z < 12/σ) = 0.95
12/σ = Φ⁻¹(0.95) = 1.645
σ = 12/1.645 ≈ 7.29
答案:σ ≈ 7.29
💡 这就是利用"对称区间概率"反推标准差的经典方法。
📝 三个推导的复盘:
| 分布 | 核心技巧 | 一句话 |
|---|---|---|
| 泊松 | 级数求和 + $k/k! = 1/(k-1)!$ + $e^x$ 泰勒展开 | 离散型的"提 $\lambda$、约阶乘"套路 |
| 指数 | 分部积分 $\int u,dv = uv - \int v,du$ | 连续型的标准方法,两次分部积分出结果 |
| 二项 | 拆成 $n$ 个独立 0-1 变量之和 | 概率论最优雅的技巧——复杂 = 简单之和 |
🪢 在整条链中的位置:
- 上游依赖:期望定义(4.1节)→ 随机变量函数的期望(4.2节,求 $E(X^2)$ 时用到)→ 方差计算公式(4.4节,$Var=E(X^2)-[E(X)]^2$)→ 方差性质(4.5节,$Var(aX+b)=a^2Var(X)$ 用于二项分布推导的系数提取)→ 期望线性性质(4.3节,二项分布拆成 $n$ 个伯努利之和的基石)
- 本章内部:这六组公式是 4.4 和 4.5 的"实战化"——前面学的定义和性质,在这里落地成可以直接套用的数字。三种推导(泊松/指数/二项)覆盖了离散求和、连续积分、独立拆分三大计算范式,后续任何分布推导都逃不出这三招
- 下游应用:第5章切比雪夫不等式直接用期望和方差估计概率($P(|X-\mu|\geq\varepsilon) \leq \sigma^2/\varepsilon^2$,需要知道 $\mu$ 和 $\sigma^2$ 的具体值);第6章三大抽样分布(卡方/t/F)的定义和性质全部建立在这些分布的期望方差之上;第7章矩估计和最大似然估计中,总体期望和方差的表达式是构造估计量的出发点
4.7 协方差
📌 学完本节你能回答:协方差 > 0、< 0、= 0 分别代表什么含义?为什么协方差的计算公式 $Cov(X,Y) = E(XY) - E(X)E(Y)$ 比定义好用?
先看一个困境:气温和冰淇淋销量,怎么量"联动"?
期望和方差都是关于"一个"随机变量的。那如果有两个随机变量呢?比如气温和冰淇淋销量——它们会不会一起变动?想想看,怎么用一个数字来量"两个东西一起变动的程度"?
看到这个困境,先别慌。难在哪?
🧠 难在哪? "联动"不是一个现成的量——你说"气温高的时候销量也高",但"高"本身有歧义:是"气温高于平均值"时"销量高于平均值"?两个变量各有各的期望和单位,怎么把"一起偏离各自平均"这件事压进一个数字?
先动手试探。回顾 4.4 节"方差"的思路:单变量偏离期望用 $(X - E(X))$ 量。现在两个变量,自然的想法是把两个"偏离"乘起来:$(X - E(X)) \cdot (Y - E(Y))$——然后取期望。
为什么乘起来合理?分三种情况看:
- X 和 Y 同涨同跌:X 高于平均值时 Y 也高于平均值(两个括号都正),X 低于平均值时 Y 也低(两个括号都负)。正正得正、负负得正 → 乘积经常为正
- X 和 Y 一涨一跌:X 高时 Y 低(一正一负)→ 乘积经常为负
- X 和 Y 没联动:乘积正负参半 → 加起来互相抵消,接近 0
🔍 回头看看我们做了什么:把"同涨同跌"变成了"偏离的乘积的期望"——乘积的符号天然区分了同向和反向。这个量就是协方差。
生活比喻:
想象你观察两个东西:
- 气温和冰淇淋销量——天气越热,冰淇淋卖得越多(同涨同跌)
- 气温和羽绒服销量——天气越热,羽绒服卖得越少(一个涨一个跌)
- 气温和你的学号——完全没有关系
协方差就是用一个数字来刻画:两个变量是不是"同涨同跌"。
- 协方差 > 0:X 涨时 Y 也涨(正相关)
- 协方差 < 0:X 涨时 Y 反而跌(负相关)
- 协方差 = 0:X 和 Y 没有"同涨同跌"的线性关系
正式定义:
$$\boxed{Cov(X, Y) = E\left[(X - EX)(Y - EY)\right]}$$
读作:协方差 =(X 离自己期望的距离)×(Y 离自己期望的距离)的期望。
如果 X 和 Y 经常同时大于各自的期望(两个括号都为正),或者同时小于各自的期望(两个括号都为负,负负得正),协方差就是正的。
如果 X 大于期望时 Y 往往小于期望(一个为正一个为负),乘积为负,协方差就是负的。
✍️ 立刻练一道:已知 X 的分布律为 $P(X=-1)=1/3$,$P(X=0)=1/3$,$P(X=1)=1/3$,令 Y = X²。求 E(X),E(Y),E(XY),Cov(X, Y)。
点击看答案
$E(X) = (-1+0+1)/3 = 0$(对称分布,正负抵消)。
Y 的取值:当 X=−1 或 1 时 Y=1(占 2/3),当 X=0 时 Y=0(占 1/3),所以 $E(Y) = 0 \times \frac{1}{3} + 1 \times \frac{2}{3} = \frac{2}{3}$。
$E(XY) = E(X \cdot X^2) = E(X^3) = \frac{(-1)^3 + 0^3 + 1^3}{3} = 0$(三次方还是对称,正负抵消)。
$Cov(X,Y) = E(XY) - E(X)E(Y) = 0 - 0 \times \frac{2}{3} = 0$。
答案:E(X)=0,E(Y)=2/3,E(XY)=0,Cov(X,Y)=0。
💡 注意:X 和 Y 完全不独立(Y 由 X 决定),协方差却是 0——这就是"不相关 ≠ 独立"的伏笔,4.9 节会详细讲。
协方差的计算公式(六段式推导)
🎯 生活场景:你发现气温高的日子,冰淇淋销量也高——两者似乎"同涨同跌"。协方差的定义 $E[(X-\mu_X)(Y-\mu_Y)]$ 虽然直观("X偏离平均"×"Y偏离平均"的期望),但计算时要分别减两个期望,太繁琐。下面的公式会帮你省掉一半的力气——和方差的推导几乎一模一样。
② 正式陈述:设 $\mu_X = E(X)$,$\mu_Y = E(Y)$,则协方差的计算公式为:
$$\boxed{Cov(X, Y) = E(XY) - E(X) \cdot E(Y)}$$
③ 完整推导(从定义 $Cov(X,Y)=E[(X-\mu_X)(Y-\mu_Y)]$ 出发):
🧠 第1步:展开括号乘积
$$(X - \mu_X)(Y - \mu_Y) = XY - X \cdot \mu_Y - \mu_X \cdot Y + \mu_X \cdot \mu_Y$$
大白话:和 $(a-b)(c-d)=ac-ad-bc+bd$ 完全一样——四项相乘展开。
🧠 第2步:逐项求期望
$$Cov(X,Y) = E(XY) - E(X \cdot \mu_Y) - E(\mu_X \cdot Y) + E(\mu_X \cdot \mu_Y)$$
大白话:利用期望的线性性质,和拆成四项分别求期望。
🧠 第3步:常数项提到期望外面
- $E(X \cdot \mu_Y)$:$\mu_Y$ 是常数 → $\mu_Y \cdot E(X)$
- $E(\mu_X \cdot Y)$:$\mu_X$ 是常数 → $\mu_X \cdot E(Y)$
- $E(\mu_X \cdot \mu_Y)$:$\mu_X \mu_Y$ 都是常数 → $\mu_X \cdot \mu_Y$
大白话:和方差推导一样——$\mu_X = E(X)$ 和 $\mu_Y = E(Y)$ 都是确定的数字,不是随机变量,可以像普通常数一样处理。
🧠 第4步:合并,得到最终公式
$$Cov(X,Y) = E(XY) - \mu_Y \cdot E(X) - \mu_X \cdot E(Y) + \mu_X \cdot \mu_Y$$
$$= E(XY) - \mu_X \cdot \mu_Y - \mu_X \cdot \mu_Y + \mu_X \cdot \mu_Y$$
$$= E(XY) - \mu_X \cdot \mu_Y = E(XY) - E(X) \cdot E(Y)$$
大白话:后三项消掉了两项,只剩 $-E(X)E(Y)$。
📝 推导复盘:协方差公式的推导和方差公式是"同一个模子刻出来的"——都是"展开→求期望→提常数→合并"。事实上,$Var(X)$ 就是 $Cov(X,X)$ 的特殊情况:代入 $Y=X$,$Cov(X,X)=E(X^2)-[E(X)]^2=Var(X)$。协方差是"两个不同变量"的版本,方差是"同一个变量自己跟自己"的版本——家族关系一目了然。
⚠️ 易错边界:
- $Cov=0$ 不等于 X 和 Y 独立:协方差只衡量"直线型联动",没有直线联动不代表没关系。经典反例:设 $X \sim N(0,1)$(标准正态),令 $Y = X^2$。因为 $E(X)=0$ 且正态分布左右对称,$E(X^3)=0$,所以 $Cov(X,X^2)=E(X^3)-E(X)E(X^2)=0-0=0$。但 Y 完全由 X 决定——知道了 X 就 100% 知道 Y。这个反例的秘诀在于利用了"对称分布 + 期望为 0"的条件把协方差"恰好抵消"成了 0。4.9 节会详细展开。
- 计算 $E(XY)$ 必须用联合分布:不能用 X 和 Y 各自的边缘分布分别算再乘起来——那样得到的是 $E(X)E(Y)$,不是 $E(XY)$。边缘分布丢失了 X 和 Y "同时取值"的联动信息。
- 协方差有单位:如果 X 是"厘米"、Y 是"公斤",协方差的单位是"厘米 × 公斤"——很难直观理解。这正是 4.8 节相关系数要解决的问题。
🪢 在整条链中的位置:
- 上游依赖:期望的线性性质(4.3节)+ 方差的计算公式(4.4节,两者推导套路完全相同)
- 家族关系:$Cov(X,X) = Var(X)$ ——协方差是"泛化版方差",方差是"自己跟自己的协方差"
- 下游应用:方差通式 $Var(X+Y)=Var(X)+Var(Y)+2Cov(X,Y)$(4.5节性质5);相关系数 $\rho = Cov/(\sigma_X\sigma_Y)$(4.8节,协方差除以标准差乘积)
协方差的性质(方法级:每条的直觉 + 推导 + 易错提醒)
🔧 生活场景:协方差就像两个人之间的"默契指数"。如果把他们各自的表现放大(比如两人都更努力了),默契指数跟着成倍放大。如果两个人组成一个"组合"和第三方互动——组合的默契指数 = 各自默契指数的和。下面把每条性质的直觉和推导都讲清楚。
🧠 性质1:对称性 — $Cov(X, Y) = Cov(Y, X)$
大白话:$X$ 对 $Y$ 的联动和 $Y$ 对 $X$ 的联动是同一件事。从公式 $Cov(X,Y)=E(XY)-E(X)E(Y)$ 来看,乘法 $XY=YX$ 可交换,对称性自然成立。就像"你的步调跟不跟得上我"和"我跟不跟得上你的步调"——描述的是同一种默契。
🧠 性质2:自己和自己的协方差就是方差 — $Cov(X, X) = Var(X)$
推导:$Cov(X,X) = E(X \cdot X) - E(X)E(X) = E(X^2) - [E(X)]^2 = Var(X)$
大白话:你自己跟自己的"默契"当然是 100%——但协方差把它量化成了方差!这解释了为什么方差公式 $E(X^2)-[E(X)]^2$ 和协方差公式 $E(XY)-E(X)E(Y)$ 长得一模一样——协方差是"泛化版"(两个不同变量),方差是协方差把 $Y$ 换成 $X$ 的特例。记住这个关系可以自检:算完一组协方差后,把 $Y$ 换成 $X$,看结果是不是等于已知的 $Var(X)$。
🧠 性质3:系数的提取 — $Cov(aX, bY) = ab \cdot Cov(X, Y)$
推导:$Cov(aX, bY) = E(aX \cdot bY) - E(aX)E(bY) = ab \cdot E(XY) - aE(X) \cdot bE(Y) = ab[E(XY) - E(X)E(Y)] = ab \cdot Cov(X,Y)$
大白话:把 $X$ 放大 $a$ 倍、$Y$ 放大 $b$ 倍——测量出的"联动程度"放大 $ab$ 倍。两个系数都提到了外面。就像把尺子的刻度分别放大——协方差的数值跟着两个系数的乘积变化。
🧠 性质4:常数的协方差为 0 — $Cov(X, C) = 0$
推导:$Cov(X,C) = E(X \cdot C) - E(X) \cdot E(C) = C \cdot E(X) - E(X) \cdot C = 0$
大白话:一个永远不变的常数,没有任何波动,和任何人都不可能有"同涨同跌"的默契。就像你和一块石头的默契——石头永远不会动,谈不上"同步"。
🧠 性质5:可加性 — $Cov(X_1+X_2, Y) = Cov(X_1,Y) + Cov(X_2,Y)$(永远成立!)
推导:$Cov(X_1+X_2, Y) = E[(X_1+X_2)Y] - E(X_1+X_2)E(Y)$
$= E(X_1 Y + X_2 Y) - [E(X_1)+E(X_2)]E(Y)$
$= E(X_1 Y) + E(X_2 Y) - E(X_1)E(Y) - E(X_2)E(Y)$
$= [E(X_1 Y) - E(X_1)E(Y)] + [E(X_2 Y) - E(X_2)E(Y)] = Cov(X_1,Y) + Cov(X_2,Y)$
大白话:把 $X_1$ 和 $X_2$ 打包成一组——这组和 $Y$ 的"组合默契" = 各自的默契之和。注意:和期望的加法一样,协方差的加法也永远成立、不需要独立!在这一条上协方差"脾气很好"——不像方差,拆和需要独立。
另外,第二个位置同样可加:$Cov(X, Y_1+Y_2) = Cov(X,Y_1) + Cov(X,Y_2)$。推导完全对称。
🧠 性质6:方差通式 — $Var(X \pm Y) = Var(X) + Var(Y) \pm 2Cov(X,Y)$
大白话:这是协方差最重要的"出场理由"——只要 $X$ 和 $Y$ 不独立,算总波动就必须带上协方差。正协方差让总波动变大(两股浪叠加),负协方差让总波动变小(两股浪抵消)。
📝 速记口诀:协方差是"好脾气"——对称(谁先谁后一样)、系数可提(两个一起提)、加法可拆(和期望一样永远成立,不需要独立)。算完协方差记得用 $Cov(X,X)=Var(X)$ 验证有没有算错。
⚠️ 易错边界:
- 系数提取——两个都提:$Cov(aX, bY) = ab \cdot Cov(X,Y)$,是两个系数的乘积,不能只提一个。
- 加法拆分比方差简单:$Cov(X_1+X_2, Y) = Cov(X_1,Y) + Cov(X_2,Y)$ 永远成立——协方差的"加法脾气"像期望(好脾气),不像方差(方差拆和要独立)。这条在复杂协方差计算中非常实用。
- 协方差不是联动强度的好尺子:$Cov$ 的数值受 $X$ 和 $Y$ 单位大小的影响——同一组关系,用厘米量身高还是用米量身高,协方差的数字天差地别。这就是下一节相关系数必须存在的理由——把它变成 $[-1,1]$ 之间的"纯数字"。
4.8 相关系数
📌 学完本节你能回答:协方差已经能看出"同涨同跌"了,为什么还需要相关系数?相关系数的取值范围是多少?$|\rho|=1$ 意味着什么?
先看一个困境:两对情侣,谁的"默契度"更高?
你想比较两组"默契程度"——
- 张三和李四:用"厘米"量身高、"公斤"量体重,协方差大约是 300
- 王五和赵六:用"米"量身高、"克"量体重,协方差大约是 30000
如果只看协方差,你会认为王五赵六的默契度是张三李四的 100 倍——但这是假象!
看到这个困境,先别慌。难在哪?
🧠 难在哪? 协方差有"单位":张三李四的 300 是"厘米 × 公斤",王五赵六的 30000 是"米 × 克"。同一对真实的情侣,用厘米量还是用米量,协方差的数字天差地别——量纲不同,根本没法比较。就像你说"我的身高是 1.7",但没说单位是米还是厘米,这个数字没有意义。
先动手试探。怎么把单位"除掉"?回顾 4.4 节学过的标准化:$X^* = (X-\mu_X)/\sigma_X$ 变成"期望 0、方差 1"的纯数字。如果我们对 X 和 Y 都做标准化,再看它们的协方差——单位就约掉了:
$$\frac{Cov(X,Y)}{\sigma_X \sigma_Y} \text{ 的单位} = \frac{\text{X单位 × Y单位}}{\text{X单位 × Y单位}} = 1 \text{(无单位,纯数字)}$$
🔍 回头看看我们做了什么:协方差的单位是"X单位 × Y单位",分母放上 $\sigma_X \sigma_Y$(也是"X单位 × Y单位")——分子分母的"单位"恰好一样,约分约掉了!就像分数约分一样,得到的是一个没有单位的纯数字,不管原来用厘米还是米、用公斤还是克,结果都一样。这个数字就是相关系数。
相关系数解决的正是这个问题:把 X 和 Y 各自用标准差"除"一遍,除掉单位,变成 -1 到 +1 之间的一个纯数字——就像用一把通用的"尺子"代替了原来带单位的那把。
② 正式陈述:
$$\boxed{\rho_{XY} = \frac{Cov(X, Y)}{\sqrt{Var(X)} \cdot \sqrt{Var(Y)}} = \frac{Cov(X, Y)}{\sigma_X \cdot \sigma_Y}}$$
③ 推导思路(从量纲问题出发 → 标准化思路):
🧠 思路1:量纲消去法(为什么除以标准差就能消除单位?)
协方差 $Cov(X,Y)$ 的单位 = "X的单位 × Y的单位"。标准差 $\sigma_X$ 的单位 = "X的单位",$\sigma_Y$ 的单位 = "Y的单位"。所以:
$$\frac{Cov(X,Y)}{\sigma_X \sigma_Y} \text{ 的单位} = \frac{\text{X单位 × Y单位}}{\text{X单位 × Y单位}} = 1 \text{(无单位,纯数字)}$$
大白话:就像分数约分——分子分母的单位恰好一样,约掉以后得到的就是一个"没有单位"的纯数字。不管原始数据用厘米还是米、用公斤还是克,约分后都一样。
🧠 思路2:标准化变换法(用 4.4 节学过的标准化来理解)
4.4 节学过一个技巧:把任意随机变量 $X$ 标准化为 $X^* = (X-\mu_X)/\sigma_X$,得到期望为 0、方差为 1 的变量。现在对 X 和 Y 都做标准化:
$$X^* = \frac{X - \mu_X}{\sigma_X}, \quad Y^* = \frac{Y - \mu_Y}{\sigma_Y}$$
那么这两个标准化后的变量的协方差恰好就是原来的相关系数:
$$\rho_{XY} = Cov(X^, Y^) = E\left[\frac{X-\mu_X}{\sigma_X} \cdot \frac{Y-\mu_Y}{\sigma_Y}\right] = \frac{E[(X-\mu_X)(Y-\mu_Y)]}{\sigma_X \sigma_Y} = \frac{Cov(X,Y)}{\sigma_X \sigma_Y}$$
大白话:相关系数就是把 X 和 Y 都"压"到同一把尺子上(标准化),让它们的期望都变成 0、波动都变成 1,然后再看协方差。这样算出来的"联动程度"不再受原始单位和波动大小的影响。
📝 推导复盘:相关系数 = 协方差变成"无单位纯数字"的结果。两条推导路径殊途同归——"量纲约分"告诉你为什么能消除单位,"标准化变换"告诉你这个操作在数学上等价于什么。结果是同一个公式,理解的深度来自这两条路。
⚠️ 易错边界:
- ρ 只衡量线性关系:这是相关系数最大的局限。$\rho=0$ 只能说明"没有直线型联动",不代表没有关系。经典反例 $Y=X^2$(对称分布时 $\rho=0$,但 Y 完全由 X 决定)。相关系数捕捉不到抛物线、正弦波等任何非线性关系。4.9 节会详细展开"不相关 ≠ 独立"。
- 分母是标准差乘积,不是方差乘积:$\rho = Cov/(\sigma_X \sigma_Y)$,分母是 $\sqrt{Var(X)} \cdot \sqrt{Var(Y)}$。如果忘记开根号用了 $Var(X) \cdot Var(Y)$,算出来的数字完全错误。
- ρ 的范围是 [-1, 1]:算完后检查——如果 ρ 不在 [-1, 1] 之间,一定是算错了。$|\rho|=1$ 意味着 Y 和 X 是完全的直线关系($Y = aX + b$ 以概率 1 成立)。
🪢 在整条链中的位置:
- 上游依赖:协方差计算公式(4.7节)→ 方差和标准差(4.4节)→ 标准化变换(4.4节)
- 本章内部:ρ 是协方差的"标准化版本";$\rho=0$(不相关)和"独立"的关系是 4.9 节的核心内容
- 下游应用:第3章1.9 二维正态分布的性质中使用 ρ;第6-7章回归分析中 $\rho^2$(决定系数 $R^2$,即相关系数的平方)衡量模型解释力;实际数据分析中 ρ 是最常用的相关性指标
相关系数的性质
性质1:取值范围在 -1 到 1 之间
$$\boxed{-1 \leq \rho_{XY} \leq 1}$$
这是相关系数最重要的性质!协方差可以取任何值,但相关系数被牢牢控制在 $[-1, 1]$ 区间内。
性质2:绝对值为1 = 完全的线性关系
$$\boxed{|\rho_{XY}| = 1 \quad \Leftrightarrow \quad \text{存在常数 } a, b \text{(} a \neq 0 \text{)使得 } P(Y = aX + b) = 1}$$
翻译:$|\rho|=1$ 意味着 Y 和 X 之间是一个严格的直线关系(以概率1成立——说白了,就是几乎一定如此,除了概率为 0 的极端情况)。比如 Y = 2X + 3,这时候 $\rho=1$(a 为正)或 $\rho=-1$(a 为负)。
性质3:正负判断
- $\rho > 0$:正相关(X 大时 Y 也大)
- $\rho < 0$:负相关(X 大时 Y 反而小)
- $\rho = 0$:不相关(没有线性关系)
生活理解 $\rho$ 的不同取值
| $\rho$ 的值 | 含义 | 生活中的例子 |
|---|---|---|
| $\rho = 1$ | 完美的正线性关系 | 摄氏温度和华氏温度——完全是一条直线 |
| $\rho = 0.9$ | 很强的正相关 | 身高和体重——大体上高的人更重 |
| $\rho = 0.3$ | 弱正相关 | 学习时间和考试成绩——有关系但不太强 |
| $\rho \approx 0$ | 无关 | 你的鞋码和你的考试成绩——毫无关系 |
| $\rho = -0.7$ | 较强负相关 | 车速和到达时间——越快越早到 |
| $\rho = -1$ | 完美的负线性关系 | X 和 Y = 100 − X——完全是一条下降的直线 |
✍️ 立刻练一道:设随机变量 X 和 Y 的相关系数为 0.5,且 Var(X) = 4,Var(Y) = 9。求 Cov(X, Y)。
点击看答案
由 $\rho = \dfrac{Cov}{\sigma_X \sigma_Y}$ 反推:
$$Cov = \rho \cdot \sqrt{Var(X)} \cdot \sqrt{Var(Y)} = 0.5 \times 2 \times 3 = 3$$
答案:Cov(X,Y) = 3。
题6(协方差计算)
已知 (X,Y) 的联合分布律:
| X\Y | 0 | 1 |
|---|---|---|
| 0 | 0.3 | 0.2 |
| 1 | 0.1 | 0.4 |
求 Cov(X,Y) 和 ρ_{XY}。
📌 对应模板:题型五(协方差和相关系数)
点击看答案
边缘分布:
P(X=0)=0.3+0.2=0.5,P(X=1)=0.1+0.4=0.5
P(Y=0)=0.3+0.1=0.4,P(Y=1)=0.2+0.4=0.6
E(X) = 0×0.5 + 1×0.5 = 0.5
E(Y) = 0×0.4 + 1×0.6 = 0.6
E(XY) = 0×0×0.3 + 0×1×0.2 + 1×0×0.1 + 1×1×0.4 = 0 + 0 + 0 + 0.4 = 0.4
Cov(X,Y) = E(XY) − E(X)E(Y) = 0.4 − 0.5×0.6 = 0.4 − 0.3 = 0.1
E(X²) = 0²×0.5 + 1²×0.5 = 0.5
Var(X) = 0.5 − 0.5² = 0.25
E(Y²) = 0²×0.4 + 1²×0.6 = 0.6
Var(Y) = 0.6 − 0.6² = 0.24
ρ_{XY} = Cov(X,Y) / √[Var(X)·Var(Y)]
= 0.1 / √(0.25×0.24)
= 0.1 / √0.06
= 0.1 / 0.2449
≈ 0.4082
答案:Cov(X,Y)=0.1,ρ_{XY}≈0.408
题10(相关系数+期望综合)
设随机变量 X 和 Y 的相关系数为 0.5,且 E(X)=E(Y)=0,E(X²)=E(Y²)=2。求 E[(X+Y)²]。
📌 对应模板:题型五(相关系数)+ 题型四(性质)
点击看答案
已知:E(X)=E(Y)=0,E(X²)=E(Y²)=2
Var(X) = E(X²) − [E(X)]² = 2 − 0 = 2
同理 Var(Y) = 2
ρ = 0.5 → Cov(X,Y) = ρ·√[Var(X)·Var(Y)] = 0.5×√(2×2) = 0.5×2 = 1
E[(X+Y)²] = E(X² + 2XY + Y²)
= E(X²) + 2E(XY) + E(Y²)
E(XY) = Cov(X,Y) + E(X)E(Y) = 1 + 0 = 1
所以 E[(X+Y)²] = 2 + 2×1 + 2 = 6
答案:6
4.9 独立与不相关的关系
📌 学完本节你能回答:"独立"和"不相关"到底什么关系?谁推出谁?反过来为什么不行?那个经典的反例 $Y=X^2$ 是怎么说明问题的?
先想一个问题:气温和它的"平方"相关吗?
"独立"和"不相关"听起来像近义词,但它们是两码事。这一节是全章最容易弄混的知识点,没有之一。先用一个生活场景把问题逼出来。
🎯 生活场景:你每天早上看两个数——气温和你的学号。气温和学号"独立":知道了气温,你也猜不出学号是多少,反过来也一样。气温和冰淇淋销量"相关":气温高的时候销量也高,有一条明显的直线趋势。但气温的平方和冰淇淋销量——气温从 20 度升到 30 度,销量涨了 50 杯;从 30 度升到 40 度,销量涨了 200 杯。升同样的温度,销量的涨幅越来越大——这是"曲线关系",不是直线。如果你只用相关系数这把"直线尺子"去量,可能量出个 0,然后错误地认为"没关系"。这就是本节要拆穿的迷思。
先动手验证一件事:如果 X 和 Y 独立,那么 Cov(X, Y) 一定是 0 吗?为什么?
——先别急着下结论,完整的论证放在下面③第1步,一步步拆给你看。那反过来呢?不相关就一定能推出独立吗?悬念同样留到后面揭晓。
② 正式陈述:
$$\boxed{\text{独立} \quad \Rightarrow \quad \text{不相关(} \rho = 0 \text{)}}$$
$$\boxed{\text{不相关(} \rho = 0 \text{)} \quad \nRightarrow \quad \text{独立}}$$
独立更强,不相关更弱。生活比喻记住:
- 独立 = 两个陌生人——你做什么完全不影响我做什么,知道 X 不会改变你对 Y 的判断
- 不相关(Cov=0) = 没有"你高我也高"的直线趋势——但不代表不认识(可能有曲线关系)
- 关键区别:独立 = "完全没关系"(信息量为零);不相关 = "没有直线关系"(但可能有曲线关系)
③ 完整推导:
🧠 第1步:证明"独立 ⇒ 不相关"
独立意味着 $E(XY) = E(X)E(Y)$(4.3节的性质5)。
代入协方差公式:
$$Cov(X,Y) = E(XY) - E(X)E(Y) = E(X)E(Y) - E(X)E(Y) = 0$$
大白话:如果 X 和 Y 独立,协方差公式里的两项 $E(XY)$ 和 $E(X)E(Y)$ 完全相等——一减就没了。协方差为 0,自然 $\rho=0$。独立一定不相关,这条路只用了协方差的一个公式,三步走完。
🧠 第2步:证明"不相关 ⇏ 独立"——构造反例
经典反例:设 $X \sim N(0, 1)$(标准正态分布),令 $Y = X^2$。
大白话:这个反例之所以成立,秘密在于 $E(X)=0$。因为正态分布左右完美对称,均值正好是 0。趁热打铁:$E(XY)=E(X \cdot X^2)=E(X^3)$——X³ 的图像左边是负的(负数立方=负数)、右边是正的(正数立方=正数),而且正负两边面积完全相等,在对称分布下积分恰好互相抵消,和为 0。于是 $Cov=0$ 成立。整个反例刻意利用了"对称分布 + 期望为 0"让协方差恰好归零。
计算验证:
$$Cov(X, X^2) = E(X^3) - E(X) \cdot E(X^2)$$
对于 $X \sim N(0,1)$:$E(X)=0$,$E(X^3)=0$(奇函数在对称区间积分为 0),$E(X^2)=1$(标准正态方差为 1)。
代入:$Cov(X, X^2) = 0 - 0 \times 1 = 0$,所以 $\rho=0$,X 和 $X^2$ 不相关。
但 X 和 Y 显然不独立! 因为 $Y = X^2$ 完全由 X 决定——知道了 X,你就 100% 知道 Y。
大白话总结这一步:协方差只能测量"你大我也大"的直线联动。X 和 X² 的关系是抛物线——在 0 的左边(X < 0),X 变小(-2 → -3)时 X² 反而变大(4 → 9),这和"你大我也大"的方向完全相反。抛物线左边下降、右边上升,从直线角度看"平均下来是平的"——协方差恰好为 0。协方差被这个 U 形曲线骗了。
🧠 第3步:二维正态分布——唯一的例外
当且仅当 (X,Y) 服从二维正态分布时,不相关和独立等价:
$$\boxed{\text{二维正态分布下:} \quad X, Y \text{ 独立} \quad \Leftrightarrow \quad \rho_{XY} = 0}$$
大白话:这是全章唯一一种"不相关 = 独立"的情况。因为二维正态分布的联合密度有一个特殊结构——当 $\rho=0$ 时,联合密度恰好等于两个边缘密度的乘积。而在一般的分布里,$\rho=0$ 只保证"联合密度在某种意义下和边缘密度的乘积偏差为零",不能保证完全相等。考试特别喜欢考这个点——它是常理(不相关推不出独立)的例外。
📝 推导复盘(用大白话把三段推导串一遍):
"独立 ⇒ 不相关"是单向高速公路——从独立出发,用协方差公式三步到位,堵不了。反过来"不相关 ⇒ 独立"是一条断头路——协方差为 0 只能保证没有直线联动,但 X 和 Y 完全可能通过 $Y=X^2$ 这样的曲线暗中勾连。协方差就像一把只能量直线的尺子——抛物线左边下降、右边上升,用直线尺一量:平均坡度为零,于是它报告"不相关"。但它没看见那条完整的抛物线。
唯一能让"不相关 ⇒ 独立"通行的桥,是二维正态分布——在它的特殊结构里,$\rho=0$ 恰好意味着联合密度 = 边缘密度的乘积。离开了二维正态,这条桥就断了。
四种情况一图打尽:
| 情况 | 散点图形状 | 相关? | 独立? | 大白话 |
|---|---|---|---|---|
| 完全独立且不相关 | 圆形/球形的随机散点 | 不相关 | 独立 | 两个陌生人,各走各的 |
| 线性关系 | 围绕一条直线分布 | 相关($\rho$ 接近 ±1) | 不独立 | 你高我也高,有直线默契 |
| 抛物线关系($Y=X^2$) | 围绕一条 U 形抛物线分布 | 不相关($\rho\approx 0$) | 不独立 | 有曲线默契,但直线尺子测不出 |
| 圆形但密度不均匀 | 散点呈圆形,但中心密、边缘稀 | 不相关 | 不独立 | 看起来"圆",但信息在密度变化里 |
关键结论:相关系数只捕捉"线性关系"!如果 X 和 Y 的关系是曲线的(比如 $Y=X^2$),即使它们有严格的函数关系,相关系数也可能为 0。
⚠️ 易错边界:
- 把"不相关"当成"独立" — 这是本章排名第一的坑。不相关只说明协方差为 0,不排除 $Y=X^2$、$Y=|X|$、$Y=\sin X$ 等任何非线性关系。每次看到"不相关"三个字,脑中自动弹出"不等于独立"五个字。
- 逻辑方向搞反 — 独立 ⇒ 不相关 ✓;不相关 ⇒ 独立 ✗(除非题目明确说了"二维正态分布")。选择题里常把这两个方向颠倒来迷惑人。
- 忘记正态分布的特殊性 — 题目如果没提"正态分布"四个字,默认"不相关推不出独立"。只有明确说"(X,Y)服从二维正态分布"时,不相关和独立才等价。
- 反例的条件别漏 — $Y=X^2$ 反例能成立的必要条件是 $E(X)=0$(对称分布且均值为 0)。如果 $E(X) \neq 0$,$Cov(X,X^2) = E(X^3) - E(X)E(X^2)$ 通常不为 0,反例就失效了。考试中构造反例时,优先选"均值为 0 的对称分布"(标准正态、均匀 U[-1,1]、离散型取 -1/0/1 各 1/3 等)。
- 不要混淆"不相关"和"正交" — 不相关的定义是 $Cov(X,Y)=0$,等价于 $E(XY)=E(X)E(Y)$。有些教材用"正交"指 $E(XY)=0$(要求均值为 0),两者差一个均值项。考研按"不相关 = Cov=0"答题。
🪢 在整条链中的位置:
- 上游依赖:协方差计算公式(4.7节)→ 相关系数定义(4.8节)→ 期望性质5——独立时 $E(XY)=E(X)E(Y)$(4.3节)
- 本章内部:本节是 4.7 和 4.8 的"终极应用"——协方差和相关系数为 0 到底意味着什么?本节给出了完整答案
- 下游应用:第3章1.9 二维正态分布的性质直接引用"ρ=0⇔独立";第6-7章回归分析中,$R^2=0$ 意味着线性模型没有解释力——但这不说明 X 和 Y 没有关系(和本节"不相关≠没关系"完全对应);实际数据分析的第一步永远是画散点图而不是只看相关系数——正是因为本节揭示的局限性
✍️ 立刻练一道:设 X 的分布律为 $P(X=-1)=P(X=0)=P(X=1)=1/3$,令 Y = X²。判断 X 和 Y 是否独立?是否相关?
点击看答案
(这正是 4.7 节立刻练一道的那组 X、Y——现在拿来判断。)
是否独立? Y 由 X 完全决定(知道了 X 就 100% 知道 Y=X²),显然不独立。也可以从联合分布律看:$P(X=-1,Y=1)=1/3$,而 $P(X=-1) \cdot P(Y=1) = \frac{1}{3} \times \frac{2}{3} = \frac{2}{9} \neq \frac{1}{3}$。
是否相关? 4.7 节已算过 $E(X)=0$,$E(XY)=E(X^3)=0$,所以 $Cov = 0 - 0 \times \frac{2}{3} = 0$,不相关。
答案:不独立,但不相关——这就是"不相关 ⇏ 独立"的经典反例:Y=X² 是抛物线关系(非线性),直线尺子量不出。
题7(独立与不相关判断)
设 X ~ U[−1, 1],Y = X²。判断 X 和 Y 是否独立?是否相关?
📌 对应模板:题型七(独立与不相关判断)
点击看答案
X ~ U[−1,1]:E(X) = 0(对称区间)
Y = X²,显然 X 和 Y 不独立(Y完全由X决定)
E(XY) = E(X·X²) = E(X³)
X³ 在 [−1, 1] 上是奇函数,均匀分布下:
E(X³) = ∫_{−1}^{1} x³·(1/2) dx = 0
所以 Cov(X,Y) = E(XY) − E(X)·E(Y) = 0 − 0·E(Y) = 0
ρ_{XY} = 0
结论:X 和 Y 不独立,但不相关(相关系数为0)。
这是"不相关⇏独立"的经典反例:
X 和 Y=X² 显然是函数关系(Y完全依赖X),
但通过计算发现相关系数为0——
因为相关系数只衡量"线性关系",而 X 和 X² 之间
是抛物线(非线性)关系,线性关系为0。
题13(综合·真题级)
设二维随机变量 (X,Y) 的联合密度为:
$$f(x,y) = \begin{cases} 2, & 0 < x < y < 1 \ 0, & \text{其他} \end{cases}$$
求:(1) E(X) 和 E(Y);(2) Cov(X,Y);(3) 判断 X 和 Y 是否独立。
📌 对应模板:题型二+题型五+题型七(连续型期望+协方差+独立性)
点击看答案
积分区域:0 < x < y < 1(三角形区域)
(1) 先求边缘密度:
f_X(x) = ∫_x^1 2 dy = 2(1−x),0 < x < 1
f_Y(y) = ∫_0^y 2 dx = 2y,0 < y < 1
E(X) = ∫₀¹ x·2(1−x) dx = 2∫₀¹ (x−x²) dx
= 2[x²/2 − x³/3]₀¹ = 2[1/2 − 1/3] = 2[1/6] = 1/3
E(Y) = ∫₀¹ y·2y dy = 2∫₀¹ y² dy = 2[y³/3]₀¹ = 2/3
(2) E(XY) = ∫₀¹∫_x^1 xy·2 dy dx
= 2∫₀¹ x[∫_x^1 y dy] dx
= 2∫₀¹ x[(1−x²)/2] dx
= ∫₀¹ (x − x³) dx
= [x²/2 − x⁴/4]₀¹
= 1/2 − 1/4 = 1/4
Cov(X,Y) = E(XY) − E(X)E(Y)
= 1/4 − (1/3)×(2/3)
= 1/4 − 2/9
= 9/36 − 8/36 = 1/36
(3) 判断独立:
如果独立,需 f(x,y) = f_X(x)·f_Y(y)
f_X(x)·f_Y(y) = 2(1−x)·2y = 4y(1−x)
但 f(x,y) = 2,两者不相等。
或者看定义域:x 的范围 (0, y) 依赖 y,不是矩形!
所以 X 和 Y 不独立。
答案:(1) E(X)=1/3, E(Y)=2/3;(2) Cov(X,Y)=1/36;(3) 不独立
4.10 矩和协方差矩阵(概念级,浏览即可)
📌 学完本节你能回答:什么是 k 阶原点矩?什么是 k 阶中心矩?期望和方差分别是几阶的?协方差矩阵长什么样?
这一节只需要花 3-5 分钟浏览一遍,知道"矩"和"协方差矩阵"这两个词指什么就行。真正的重点在前面 4.1-4.9 节(期望、方差、协方差、相关系数)。考研数学三要求:知道矩的定义、知道协方差矩阵的样子即可。
先想一个问题:只用"体重"一个数,能看出一个人的体型吗? 不能——身高 160 体重 70kg 和身高 190 体重 70kg 的人,一个偏胖一个偏瘦。一个数不够,就得再加"阶数":一阶看水平(期望),二阶看散开(方差),三阶看偏斜(偏度),四阶看尖峰(峰度)。阶数越高,描述得越细。这一节就是把"用数字描述分布"这件事系统化成"矩"的体系。
📏 生活场景:你想只用几个数字来描述一个人的身材——
- 体重 = "一阶特征"(最基础的信息——这个人在什么水平。相当于期望)
- 体型匀称度 = "二阶特征"(胖不胖、匀不匀——这个人离平均水平有多远。相当于方差)
- 有没有啤酒肚 = "三阶特征"(肚子是不是特别凸出——身体是"偏"向一边的。相当于偏度)
- 肩膀宽不宽 = "四阶特征"(更细节的身材信息。相当于峰度)
只用体重这一个数,你无法区分"身高 160、体重 70kg"和"身高 190、体重 70kg"的人——前者偏胖,后者偏瘦。第二阶信息(体型是否匀称 = 方差)才能告诉你这个人离"正常"有多远。第三阶信息(啤酒肚 = 偏度)告诉你这个人的肉是偏在上半身还是下半身。阶数越高,描述的细节越细——但在概率论的绝大多数应用中,一二阶(期望和方差)就够了。
② 正式定义:
k 阶矩的两大家族
原点矩(以 0 为参照点——看看数据本身有多大):
$$\boxed{m_k = E(X^k)}$$
- $k=1$:一阶原点矩 $m_1 = E(X)$ ——就是期望(数据的"重心"位置)
- $k=2$:二阶原点矩 $m_2 = E(X^2)$ ——算方差必须经过的一步
中心矩(以期望 $\mu = E(X)$ 为参照点——看看数据偏离中心有多远):
$$\boxed{\mu_k = E\left[(X - \mu)^k\right]}$$
- $k=1$:一阶中心矩 $\mu_1 = E(X - \mu) = 0$ ——恒等于零(正负偏离互相抵消)
- $k=2$:二阶中心矩 $\mu_2 = E[(X-\mu)^2]$ ——就是方差 $Var(X)$(偏离的"平均平方距离")
- $k=3$:三阶中心矩标准化后 = 偏度(数据向左歪还是向右歪——分布的不对称程度)
- $k=4$:四阶中心矩标准化后 = 峰度(数据在中心"堆"得有多高——分布的尖峭程度)
原点矩和中心矩的关系:$Var(X) = m_2 - m_1^2$,也就是"方差 = 二阶原点矩 − 一阶原点矩的平方"——正是本章 4.4 节的方差计算公式!这说明矩的体系是本章所有内容的统一框架:一阶原点矩 = 期望,二阶中心矩 = 方差,一切都有序地归入这个体系。
协方差矩阵
当你同时处理多个随机变量时,需要一张"总表"把每两个之间的协方差一次全记录下来。
对于二维随机向量 $(X, Y)$:
$$\Sigma = \begin{pmatrix} Var(X) & Cov(X, Y) \ Cov(Y, X) & Var(Y) \end{pmatrix}$$
- 对角线(左上到右下):放各自的方差($X$ 跟 $X$ 自己的协方差 = 方差;$Y$ 同理)
- 非对角线(右上、左下):放两两之间的协方差
- 对称:因为 $Cov(X,Y) = Cov(Y,X)$(性质 1),矩阵沿对角线镜像对称
对于 $n$ 维情况,就是一个 $n \times n$ 的对称矩阵,第 $(i,j)$ 个位置放 $Cov(X_i, X_j)$。这个矩阵在多维正态分布(第 3 章 1.9)中会再次出现。
📝 一句话总结:矩就是把"描述分布特征"这件事系统化了——一阶看位置,二阶看散开,三阶看偏斜,四阶看尖峰。协方差矩阵就是把所有"两两之间协方差"排成一张对称表。考研只需了解概念,不要求深入计算。
② 题型与练习(讲练合一)
题型一:离散型随机变量的期望和方差(⭐⭐⭐)
先抛一道题:给你一张分布律表,怎么又快又全地拿到 E(X) 和 Var(X)?
题目通常长这样:给一张分布律表格——每个可能取的值 x 和对应的概率 p 写成表格。还有一种变体:表格里参数不全,有一项概率用字母 a 表示。要求 E(X) 和 Var(X)。
看到这题,先别慌。难在哪?
🧠 难在哪? 分布律表就是 X 的"全部家当"——期望、方差都得从这张表里挤出来;要算的数不止一个(E(X) 和 Var(X)),而 Var(X) 又需要 E(X²);如果表格里有个 a,说明表不完整,得先补全。
按 4.1 / 4.4 节悟出的路子,一步步试探:
🧠 试探1:表是完整的吗? 所有概率加起来必须等于 1。如果有缺失的概率(比如写了个 a),先用 Σp = 1 把 a 求出来——这是第一步,漏了后面全错。
🧠 试探2:算期望 E(X) → E(X) = Σ x_i · p_i。把"每个可能值 × 它发生的概率",再加起来。
🧠 试探3:算 E(X²) → E(X²) = Σ (x_i)² · p_i。先把每个可能值平方,再乘概率,再求和。⚠️ E(X²) 不是 [E(X)]²,两者完全不同!
🧠 试探4:算方差 Var(X) → Var(X) = E(X²) − [E(X)]²。方差就是"平方的平均"减去"平均的平方"。
🔍 回头看看我们做了什么:整个流程其实只有两条主线——① 补全表格(有参数先解参数)→ ② 按 E(X) → E(X²) → Var(X) 的顺序逐个算。最容易被坑的就是第 3 步:E(X²) 是"先平方再平均",[E(X)]² 是"先平均再平方"——顺序反了结果全错。下面两道例题就是这两条主线的实战。
翻车现场:
- E(X²) 和 [E(X)]² 搞混——这是绝大多数人第一次做的经典错误。E(X²) 是先把每个 x 平方再乘概率求和;[E(X)]² 是先算期望再把结果平方。两个完全不同。
- 算 E(X²) 时光顾着平方,概率忘写了——把每个 x 的值平方了一下,列成一个新列表,然后...直接对列表取平均了!正确的做法是每个 "(x_i)²" 必须带上自己的权重 "× p_i",然后求和。简单说:x² 写对了,×pᵢ 丢了。
- 概率加起来不等于1没检查出来——如果题目给了参数,第一步一定是先把参数求出来再往下做。
例题1:基础题——给定分布律求期望和方差
题目:设随机变量 X 的分布律为:
| X | -2 | 0 | 2 |
|---|---|---|---|
| p | 0.3 | 0.5 | 0.2 |
求 E(X) 和 Var(X)。
点击看解答
第1步:检查表格完整性
0.3 + 0.5 + 0.2 = 1.0 ✓ 完整
第2步:算期望 E(X)
E(X) = (−2)×0.3 + 0×0.5 + 2×0.2
= −0.6 + 0 + 0.4
= −0.2
第3步:算 E(X²)
E(X²) = (−2)²×0.3 + 0²×0.5 + 2²×0.2
= 4×0.3 + 0×0.5 + 4×0.2
= 1.2 + 0 + 0.8
= 2.0
第4步:算方差
Var(X) = E(X²) − [E(X)]²
= 2.0 − (−0.2)²
= 2.0 − 0.04
= 1.96
答案:E(X) = −0.2, Var(X) = 1.96
例题2:进阶题——含参数,先求参数再求期望方差
题目:设随机变量 X 的分布律为:
| X | 0 | 1 | 2 | 3 |
|---|---|---|---|---|
| p | 0.1 | a | 0.3 | 0.2 |
求:(1) 常数 a;(2) E(X);(3) Var(X)。
点击看解答
第1步:求参数 a
所有概率相加必须等于1:
0.1 + a + 0.3 + 0.2 = 1
0.6 + a = 1
a = 0.4
完整的分布律:
| X | 0 | 1 | 2 | 3 |
| p | 0.1 | 0.4 | 0.3 | 0.2 |
第2步:算期望 E(X)
E(X) = 0×0.1 + 1×0.4 + 2×0.3 + 3×0.2
= 0 + 0.4 + 0.6 + 0.6
= 1.6
第3步:算 E(X²)
E(X²) = 0²×0.1 + 1²×0.4 + 2²×0.3 + 3²×0.2
= 0 + 0.4 + 1.2 + 1.8
= 3.4
第4步:算方差
Var(X) = E(X²) − [E(X)]²
= 3.4 − 1.6²
= 3.4 − 2.56
= 0.84
答案:(1) a = 0.4; (2) E(X) = 1.6; (3) Var(X) = 0.84
🛑 途中停顿
停下来,自己算一遍再往下翻。
已知 X 的分布律为:P(X=0)=0.3,P(X=1)=0.7。求 E(X) 和 Var(X)。
点击看答案
E(X) = 0×0.3 + 1×0.7 = 0.7
E(X²) = 0²×0.3 + 1²×0.7 = 0.7
Var(X) = 0.7 − 0.7² = 0.7 − 0.49 = 0.21
答案:E(X)=0.7,Var(X)=0.21
题型二:连续型随机变量的期望和方差(⭐⭐⭐)
先抛一道题:给你一个密度函数 f(x),怎么拿到 E(X) 和 Var(X)?
题目通常长这样:给概率密度函数 f(x)——一般是一个分段表达式。看到 f(x) 而不是表格,就是题型二。要求 E(X) 和 Var(X)。
看到这题,先别慌。难在哪?
🧠 难在哪? 连续型和离散型的差别只有一点:离散型是"求和",连续型是"积分"。但积分有两个新坑:① 积分范围不是整个数轴,只在 f(x) > 0 的区间做,区间外 f(x) = 0 乘什么都是 0;② 密度可能是分段函数,要分段积分再相加。
按 4.1 / 4.4 节悟出的路子,把离散型的流程换成积分即可:
🧠 试探1:确定 f(x) 的非零区间——积分只做这个区间。区间外的 f(x) = 0,贡献为 0。
🧠 试探2:算期望 E(X) → E(X) = ∫ x · f(x) dx,积分范围 = 非零区间。
🧠 试探3:算 E(X²) → E(X²) = ∫ x² · f(x) dx。
🧠 试探4:算方差 → Var(X) = E(X²) − [E(X)]²,公式和离散型完全一样!
🔍 回头看看我们做了什么:连续型的套路和离散型一模一样(E → E(X²) → Var),唯一的区别是把 Σ 换成 ∫、把 p_i 换成 f(x)dx。真正的难点全在积分本身——范围找对、分段别漏、密度先归一化,这三个坑踩完就稳了。下面两个例题分别演示"均匀分布验证公式"和"分段密度"。
常见子类型:
子类型一:均匀分布——验证公式
如果 X ~ U(a, b),可以直接套公式:
- E(X) = (a + b) / 2 —— 就是区间中点
- Var(X) = (b − a)² / 12
但如果题目要求"用定义证明",就得按模板一步步积分算。
子类型二:分段密度函数
f(x) 可能在 [a, b] 是某个表达式,在 [b, c] 是另一个表达式。积分时分段积分然后加起来。
翻车现场:
- 积分区间搞错——只在 f(x) > 0 的区间积分。不要在整个实数轴上积。
- 分段积分忘记加起来——如果是分段密度,必须每段分别积,然后加在一起。
- E(X²) 积分算错——x² 乘 f(x) 后,x 的次数变高了,积分容易出错。
- 忘记先把密度归一化——如果 f(x) 有未知参数,先用 ∫f(x)dx = 1 把参数求出来。
例题1:均匀分布——用积分验证公式
题目:设 X ~ U(0, θ)(θ > 0),概率密度为:
$$f(x)=\begin{cases} \frac{1}{\theta}, & 0 < x < \theta \ 0, & \text{其他} \end{cases}$$
求 E(X) 和 Var(X),并验证公式。
点击看解答
第1步:非零区间为 (0, θ)
第2步:算 E(X)
E(X) = ∫₀ᶿ x · (1/θ) dx
= (1/θ) · [x²/2]₀ᶿ
= (1/θ) · (θ²/2)
= θ/2
验证公式:E(X) = (a+b)/2 = (0+θ)/2 = θ/2 ✓
第3步:算 E(X²)
E(X²) = ∫₀ᶿ x² · (1/θ) dx
= (1/θ) · [x³/3]₀ᶿ
= (1/θ) · (θ³/3)
= θ²/3
第4步:算方差
Var(X) = E(X²) − [E(X)]²
= θ²/3 − (θ/2)²
= θ²/3 − θ²/4
= (4θ² − 3θ²) / 12
= θ²/12
验证公式:Var(X) = (b−a)²/12 = (θ−0)²/12 = θ²/12 ✓
答案:E(X) = θ/2, Var(X) = θ²/12
例题2:分段密度函数求期望方差
题目:设随机变量 X 的概率密度为:
$$f(x)=\begin{cases} x, & 0 \leq x < 1 \ 2-x, & 1 \leq x \leq 2 \ 0, & \text{其他} \end{cases}$$
求 E(X) 和 Var(X)。
点击看解答
这个密度函数是一个"三角形",形状像 ∧。
第1步:非零区间是 [0, 2],但密度表达式分成两段。
第2步:算 E(X)——分段积分
在 [0,1) 上:f(x) = x
在 [1,2] 上:f(x) = 2−x
E(X) = ∫₀¹ x·x dx + ∫₁² x·(2−x) dx
= ∫₀¹ x² dx + ∫₁² (2x − x²) dx
第一部分:∫₀¹ x² dx = [x³/3]₀¹ = 1/3
第二部分:∫₁² (2x − x²) dx = [x² − x³/3]₁²
= (4 − 8/3) − (1 − 1/3)
= (12/3 − 8/3) − (3/3 − 1/3)
= 4/3 − 2/3
= 2/3
E(X) = 1/3 + 2/3 = 1
第3步:算 E(X²)——同样分段积分
E(X²) = ∫₀¹ x²·x dx + ∫₁² x²·(2−x) dx
= ∫₀¹ x³ dx + ∫₁² (2x² − x³) dx
第一部分:∫₀¹ x³ dx = [x⁴/4]₀¹ = 1/4
第二部分:∫₁² (2x² − x³) dx = [2x³/3 − x⁴/4]₁²
= (16/3 − 4) − (2/3 − 1/4)
= 4/3 − 5/12
= 16/12 − 5/12 = 11/12
E(X²) = 1/4 + 11/12 = 3/12 + 11/12 = 14/12 = 7/6
第4步:算方差
Var(X) = E(X²) − [E(X)]²
= 7/6 − 1²
= 1/6
答案:E(X) = 1, Var(X) = 1/6
💡 验证:这个三角形对称于 x=1,所以期望就是 1,符合直觉。
🛑 途中停顿
停下来,自己算一遍再往下翻。
设 X 的概率密度 f(x)=2x(0<x<1),求 E(X)。
点击看答案
E(X) = ∫₀¹ x·2x dx = 2∫₀¹ x² dx = 2·[x³/3]₀¹ = 2/3
答案:E(X)=2/3
题型三:随机变量函数的期望(⭐⭐⭐)
先抛一道题:题目要的是 E(X²),但你手里只有 X 的分布
题目通常长这样:不直接让你求 X 的期望,而是求 g(X) 的期望——比如求 E(X²), E(2X+1), E(e^X), E(1/X) 等等。题目给的还是 X 的分布,但要求的是 X 的某个函数的期望。
看到这题,先别慌。难在哪?
🧠 难在哪? 你的第一反应可能是"想求 E(X²),就得先把 X² 这个新随机变量的分布求出来"——如果这么想,你就多绕了一大圈。4.2 节已经悟过:求 $g(X)$ 的期望,直接用 X 的分布算就行,把 X 的每个取值 $x_i$ 换成 $g(x_i)$,概率权重不动。
所以试探的路子只有三步,比想象中短:
🧠 试探1:确认 X 是离散型还是连续型——给了分布律表格 → 离散型;给了密度 f(x) → 连续型。
🧠 试探2:根据类型选公式——离散型:E[g(X)] = Σ g(x_i) · p_i;连续型:E[g(X)] = ∫ g(x) · f(x) dx。
🧠 试探3:代入计算——离散型直接代数求和,连续型做定积分。
🔍 回头看看我们做了什么:这道题考验的根本不是计算,而是敢不敢不绕路。为什么这个公式不用先求 Y 的分布? 按直觉,求 E(Y) = E[g(X)] 应该先把 Y 的分布律/密度求出来——但有个更直接的公式:直接把 g(X) 当作整体,用 X 的原分布去"加权平均"。就像你要算"全班同学身高的平方的平均",不需要先把每个人的"身高平方"列成一个新清单——你只需要拿到原来的身高清单,把每个身高平方一下,再求平均。结果完全一样,但省了一步。
翻车现场:
- 多此一举先求 Y 的分布——直接套 E[g(X)] 的公式,别绕路。除非题目明确要求"先求 Y 的分布,再求期望"。
- 离散型时只把 g(x_i) 列出来但忘记乘 p_i——每一步都要带概率。
- 连续型时积分范围弄错——积分范围就是 f(x) 的非零区间。
例题1:离散型——求 E(X²) 和 E(2X+1)
题目:已知随机变量 X 的分布律为:
| X | 1 | 2 | 3 |
|---|---|---|---|
| p | 0.2 | 0.5 | 0.3 |
求:E(X²) 和 E(2X+1)。
点击看解答
第1步:离散型,用公式 E[g(X)] = Σ g(x_i)·p_i
第2步:求 E(X²)
这里 g(x) = x²
E(X²) = 1²×0.2 + 2²×0.5 + 3²×0.3
= 1×0.2 + 4×0.5 + 9×0.3
= 0.2 + 2.0 + 2.7
= 4.9
第3步:求 E(2X+1)
这里 g(x) = 2x+1
E(2X+1) = (2×1+1)×0.2 + (2×2+1)×0.5 + (2×3+1)×0.3
= 3×0.2 + 5×0.5 + 7×0.3
= 0.6 + 2.5 + 2.1
= 5.2
💡 验证:如果先算 E(X) = 1×0.2 + 2×0.5 + 3×0.3 = 2.1
然后用线性性质:E(2X+1) = 2E(X)+1 = 2×2.1+1 = 5.2 ✓
答案:E(X²) = 4.9, E(2X+1) = 5.2
例题2:连续型——求 E(e^{−X}),以指数分布为例
题目:设 X 服从参数为 λ 的指数分布,概率密度为:
$$f(x)=\begin{cases} \lambda e^{-\lambda x}, & x > 0 \ 0, & x \leq 0 \end{cases}$$
求 $E(e^{-X})$。
点击看解答
第1步:连续型,非零区间为 (0, +∞)
g(x) = e^{−x}
第2步:套公式
E(e^{−X}) = ∫₀^{∞} e^{−x} · λ e^{−λx} dx
= λ · ∫₀^{∞} e^{−(λ+1)x} dx
第3步:计算积分
∫₀^{∞} e^{−(λ+1)x} dx = [−e^{−(λ+1)x} / (λ+1)]₀^{∞}
= 0 − (−1/(λ+1))
= 1/(λ+1)
所以 E(e^{−X}) = λ · 1/(λ+1) = λ/(λ+1)
答案:E(e^{−X}) = λ/(λ+1)
🛑 途中停顿
停下来想一想,不用动笔:已知 X 的分布,求 E(X²) 需要先求 X² 的分布吗?为什么?
点击看答案
不需要! 直接用 E[g(X)] 的公式,套 X 的原分布算就行。
就像你要算"全班身高的平方的平均值"——不需要先把每个人的"身高平方"列成新表格,拿到身高表把每个身高平方一下再算平均即可。
题型四:利用期望和方差的性质简化计算(⭐⭐⭐)
先抛一道题:已知 E、Var、Cov 一串数,求线性组合的期望方差
题目通常长这样:给出多个随机变量的期望、方差(有时还有协方差),要求计算这些变量的线性组合的期望方差——比如求 E(2X−3Y+5) 或 Var(aX+bY)。关键词:"设 E(X)=..., Var(X)=..., 求..."
看到这题,先别慌。难在哪?
🧠 难在哪? 期望好办——4.3 节的线性性质 E(aX+bY+c) = aE(X) + bE(Y) + c 永远成立,直接拆。方差才是重灾区:Var(X+Y) 能不能拆成 Var(X)+Var(Y),完全取决于 X、Y 独不独立。如果你没看清"独立"两个字就乱拆,结果全错。这一题考的其实是"先看条件、再选公式"的判断力。
先把两条主线摸清:
🧠 主线1:期望(用线性性质,永远成立,不需要任何条件):
① E(aX + b) = aE(X) + b
② E(X + Y) = E(X) + E(Y)
③ E(aX + bY + c) = aE(X) + bE(Y) + c
🧠 主线2:方差(需要小心条件):
① Var(aX + b) = a²Var(X) —— 系数要平方!加常数对方差没影响
② Var(X + Y) = Var(X) + Var(Y) + 2Cov(X,Y)
③ Var(X − Y) = Var(X) + Var(Y) − 2Cov(X,Y)
特殊情况(X 和 Y 独立时):
④ Var(aX + bY) = a²Var(X) + b²Var(Y) —— 协方差项消失
🔍 回头看看我们做了什么:两条主线的差别就在**"方差要先看独不独立"**。于是标准流程自然浮现:
🧠 试探1:整理已知条件——列出题目给的:E(X), E(Y), Var(X), Var(Y), Cov(X,Y) 等。注意看题目有没有说"X, Y 独立"。
🧠 试探2:算期望(用线性性质)——E(aX + bY + c) = aE(X) + bE(Y) + c,直接把系数乘上、常数加上就行。
🧠 试探3:算方差(两层判断,先看独不独立)——✅ 独立 → 用简化公式 Var(aX+bY) = a²Var(X) + b²Var(Y);❌ 不独立(或给了 Cov)→ 通用公式 Var(aX+bY) = a²Var(X) + b²Var(Y) + 2ab·Cov(X,Y),Var(aX−bY) = a²Var(X) + b²Var(Y) − 2ab·Cov(X,Y)。
🧠 试探4:代入计算——检查一下:方差不能为负数。
翻车现场:
- 方差系数忘记平方——Var(aX) = a²Var(X),不是 a·Var(X)。
- 独立条件没看清就乱用公式——题目没写"独立"就不能自动认为 Cov=0。
- Var(X−Y) 写减号——独立时 Var(X−Y) = Var(X) + Var(Y)(是加法不是减法!因为 (−1)² = 1)。
- 常数项 c 对期望有影响、对方差无影响——E(X+c) = E(X)+c,但 Var(X+c) = Var(X)。
例题1:已知协方差的情况
题目:已知 E(X) = 2, Var(X) = 1, E(Y) = 3, Var(Y) = 4, Cov(X, Y) = −1。求:E(2X − 3Y + 5) 和 Var(2X − 3Y + 5)。
点击看解答
第1步:整理已知
E(X) = 2, Var(X) = 1
E(Y) = 3, Var(Y) = 4
Cov(X, Y) = −1
第2步:算期望
E(2X − 3Y + 5) = 2E(X) − 3E(Y) + 5
= 2×2 − 3×3 + 5
= 4 − 9 + 5
= 0
第3步:算方差——因为有协方差,用含 Cov 的公式
Var(2X − 3Y) = 2²Var(X) + (−3)²Var(Y) + 2×2×(−3)×Cov(X,Y)
= 4×1 + 9×4 + 2×2×(−3)×(−1)
= 4 + 36 + 12
= 52
(加常数 +5 对方差无影响)Var(2X − 3Y + 5) = 52
答案:E(2X−3Y+5) = 0, Var(2X−3Y+5) = 52
例题2:独立情况
题目:设 X 和 Y 相互独立,已知 E(X) = 1, Var(X) = 2, E(Y) = −1, Var(Y) = 3。求:E(3X − 2Y) 和 Var(3X − 2Y)。
点击看解答
第1步:X, Y 独立 → 方差公式中没有协方差项
第2步:算期望
E(3X − 2Y) = 3E(X) − 2E(Y)
= 3×1 − 2×(−1)
= 3 + 2
= 5
第3步:算方差(独立时用简洁公式)
Var(3X − 2Y) = 3²Var(X) + (−2)²Var(Y)
= 9×2 + 4×3
= 18 + 12
= 30
💡 注意:Var(3X − 2Y) = 9Var(X) + 4Var(Y),是加号!
减法并不减方差——Var(X−Y) = Var(X) + Var(Y)(独立时)。
答案:E(3X−2Y) = 5, Var(3X−2Y) = 30
🛑 途中停顿
停下来,自己算一遍再往下翻。
已知 E(X)=3,Var(X)=2,求 Var(2X−1)。
点击看答案
Var(2X−1) = 2²·Var(X) = 4×2 = 8
注意两点:(1) 减 1(加常数)对方差无影响;(2) 乘 2 的系数要平方变成 4。
题型五:协方差和相关系数的计算(⭐⭐)
先抛一道题:给你一张二维联合分布表,怎么算出 Cov 和 ρ?
题目通常长这样:给出联合分布律(二维表格)或联合密度 f(x,y),要求计算 Cov(X,Y) 和相关系数 ρ。关键词:"协方差""相关系数""Cov""ρ""联合分布律""联合密度"。
看到这题,先别慌。难在哪?
🧠 难在哪? 一张二维表要"榨出"的信息比单变量表多得多:E(X)、E(Y)、Var(X)、Var(Y)、E(XY)、Cov、ρ 一共 7 个量。而它们之间有严格的顺序依赖——E(XY) 是最容易错的一环:它必须用联合分布算,绝不能用边缘分布。想清楚顺序,这一步路就不难走。
按 4.7 / 4.8 节悟出的路子,一步步试探:
🧠 试探1:分别求 E(X) 和 E(Y)——用边缘分布(把另一个变量"压缩"掉)。离散型:边缘分布就是"行加起来"或"列加起来";连续型:边缘密度就是对另一个变量积分。
🧠 试探2:求 E(XY)——⚠️ 必须用联合分布算!不能用边缘分布! 离散型:E(XY) = ΣΣ (x_i · y_j) · p_ij;连续型:E(XY) = ∫∫ xy · f(x,y) dx dy。
🧠 试探3:算协方差——Cov(X,Y) = E(XY) − E(X)E(Y)。
🧠 试探4:分别求 Var(X) 和 Var(Y)——Var(X) = E(X²) − [E(X)]²。
🧠 试探5:算相关系数——ρ = Cov(X,Y) / √[Var(X)·Var(Y)]。
🔍 回头看看我们做了什么:整条链就是**"先榨单变量量(E、Var)→ 再榨联合量(E(XY))→ Cov → ρ"**。最该警惕的是试探2——E(XY) 用边缘分布算是致命错误,因为边缘分布丢失了 X 和 Y "同时取值"的联动信息。下面这个离散型例题就是整条链的实战。
翻车现场:
- E(XY) 用边缘分布算——这是致命错误!E(XY) 必须用联合分布/联合密度算。
- 边缘分布求错了——离散型是行相加或列相加,注意别把行和列搞反。
- 相关系数公式分母搞错——ρ = Cov/(σ_X · σ_Y),分母是标准差不是方差!正确做法:先算 Var(X) 和 Var(Y),然后分别开根号得到 σ_X 和 σ_Y,再乘起来。
- 相关系数范围检查——算出的 ρ 如果不在 [−1, 1] 之间,一定算错了。
子类型一:离散型联合分布律
例题:已知二维随机变量 (X,Y) 的联合分布律为:
| X\Y | 0 | 1 |
|---|---|---|
| 0 | 0.1 | 0.3 |
| 1 | 0.2 | 0.4 |
求:Cov(X,Y) 和相关系数 ρ。
点击看解答
第1步:求边缘分布和 E(X), E(Y)
先求 X 的边缘分布(把每行概率加起来):
P(X=0) = 0.1 + 0.3 = 0.4
P(X=1) = 0.2 + 0.4 = 0.6
E(X) = 0×0.4 + 1×0.6 = 0.6
E(X²) = 0²×0.4 + 1²×0.6 = 0.6
Var(X) = E(X²) − [E(X)]² = 0.6 − 0.36 = 0.24
再求 Y 的边缘分布(把每列概率加起来):
P(Y=0) = 0.1 + 0.2 = 0.3
P(Y=1) = 0.3 + 0.4 = 0.7
E(Y) = 0×0.3 + 1×0.7 = 0.7
E(Y²) = 0²×0.3 + 1²×0.7 = 0.7
Var(Y) = E(Y²) − [E(Y)]² = 0.7 − 0.49 = 0.21
第2步:求 E(XY)——用联合分布律
E(XY) = (0×0)×0.1 + (0×1)×0.3 + (1×0)×0.2 + (1×1)×0.4
= 0 + 0 + 0 + 0.4
= 0.4
第3步:算协方差
Cov(X,Y) = E(XY) − E(X)E(Y)
= 0.4 − 0.6×0.7
= 0.4 − 0.42
= −0.02
第4步:算相关系数
ρ = Cov(X,Y) / √[Var(X)·Var(Y)]
= −0.02 / √(0.24 × 0.21)
= −0.02 / √(0.0504)
= −0.02 / 0.2245...
≈ −0.0891
答案:Cov(X,Y) = −0.02, ρ ≈ −0.09(很弱的负相关)
🛑 途中停顿
停下来,口头回答就行:算 E(XY) 时能用 X 或 Y 单独的边缘分布吗?必须用什么?
点击看答案
不能用边缘分布! E(XY) 必须用联合分布(或联合密度)算。
因为 E(XY) 涉及 X 和 Y 同时取值的概率——边缘分布丢失了这种"联动信息"。
题型六:利用常见分布的期望方差公式(⭐⭐⭐)
先抛一道题:题目"报菜名"报了个分布,你能不能秒答?
题目文字中直接出现:"设 X 服从二项分布 B(n,p)""X ~ P(λ)""X 服从均匀分布 U(a,b)""X ~ N(μ,σ²)"等等。看到这种"报菜名"式的分布描述,要什么?
看到这题,先别慌。难在哪?
🧠 难在哪? 这种题一点计算都不难——难的是"认得出"和"记得住"。如果你看到 B(10, 0.3) 还要从头用分布律去算期望方差,考场上就输在时间上了。这一题考的是 4.6 节那张"乘法口诀表"背得熟不熟。
试探的路子其实短到只有两步:
🧠 试探1:识别分布类型和参数——从题目中读出是什么分布,参数分别是什么。
🧠 试探2:直接套公式得出 E(X) 和 Var(X)——不要从头算!(如需函数的期望,回到题型三的方法。)
🔍 回头看看我们做了什么:这类题就是"报菜名 → 对照 4.6 节的表 → 出数字"。关键不是计算,是别把参数看错——下面这几个坑,全是历届考生用真金白银换来的教训。
翻车现场:
- 正态分布 N(μ, σ²) 第二个参数是方差 σ²,不是标准差 σ——N(3, 4) 意味着 Var(X)=4, σ=2。
- 二项分布 B(n, p) 参数顺序不能反——B(10, 0.3) 和 B(0.3, 10) 完全不同。
- 泊松分布 P(λ) 的 λ 既是期望又是方差——如果算出来期望不等于方差,要么算错了,要么不是泊松分布。
- 指数分布的参数和期望的关系——E(X) = 1/λ,期望和参数成反比。λ 越大,平均等待时间越短。
例题:二项分布套公式 + 反推 E(X²)
题目:设 X ~ B(10, 0.3),求 E(X), Var(X), E(X²)。
点击看解答
第1步:识别分布
X ~ B(10, 0.3) → 二项分布,n = 10, p = 0.3
第2步:套公式
E(X) = np = 10 × 0.3 = 3
Var(X) = np(1−p) = 10 × 0.3 × 0.7 = 2.1
第3步:反推 E(X²)
E(X²) = Var(X) + [E(X)]² = 2.1 + 9 = 11.1
答案:E(X) = 3, Var(X) = 2.1, E(X²) = 11.1
🛑 途中停顿
停下来,试着默写(不翻前面)。
二项分布 B(n,p) 的期望和方差各是多少?泊松分布 P(λ) 呢?正态分布 N(μ,σ²) 呢?
点击看答案
- 二项分布 B(n,p):E(X)=np,Var(X)=np(1−p)
- 泊松分布 P(λ):E(X)=λ,Var(X)=λ
- 正态分布 N(μ,σ²):E(X)=μ,Var(X)=σ²
都默写对了吗?正态分布的第二个参数是方差 σ²,不是标准差——这是最容易搞错的地方!
题型七:独立与不相关的判断(⭐⭐⭐)
先抛一道题:一张联合分布表,问"独立吗?相关吗?"
题目通常会问"X 和 Y 是否独立?是否相关?"或者选择题中比较"独立"和"不相关"这两个概念。
看到这题,先别慌。难在哪?
🧠 难在哪? 这一题同时考两个定义——独立(4.3节/第3章)和不相关(4.7节),而且两个判断方法完全不同:独立要逐一检查每一对概率,相关只要算一个数 Cov。更坑的是,这两个结论能拼出四种情况,你得先想清楚这四种分别长什么样,才不会跳进"把不相关当独立"的坑。
先动手把"独立"和"不相关"的关系摸清:
核心关系图:
独立 ──→ 不相关(Cov=0) ← 独立一定不相关
不相关 ──×→ 独立 ← 不相关不一定独立!
(只是没有"直线关系",但可能有其他关系)
唯一例外:二维正态分布中,独立 ⇔ 不相关(两者等价)
为什么独立一定不相关?
生活比喻(大白话版):
- 独立就像两个陌生人——你做什么完全不影响我做什么,彼此的信息量为零。
- **不相关(Cov=0)**就像两个人虽然认识,但没有"你高我也高、你矮我也矮"这种同步趋势——没有直线型的联动。
- 既然独立已经是"完全没关系",那肯定也没有"直线联动关系"。所以独立一定意味着 Cov=0。
- 但反过来不行——两个人可能没有直线联动(Cov=0),但可能私下认识(有非线性关系,比如 Y=X²)。
🧠 试探1:判断是否独立——离散型:检查每一对 (x_i, y_j),P(X=x_i, Y=y_j) = P(X=x_i) × P(Y=y_j) 是否成立;连续型:检查 f(x,y) = f_X(x)·f_Y(y) 是否成立。
🧠 试探2:判断是否相关——计算 Cov(X,Y) 是否为 0。
🧠 试探3:对照四种可能——① 独立 + Cov=0 → "独立且不相关";② 独立 + Cov≠0 → 不可能!独立必 Cov=0;③ 不独立 + Cov=0 → "不相关但不独立"(经典例子:Y=X²);④ 不独立 + Cov≠0 → "既相关又不独立"。
🔍 回头看看我们做了什么:判断的套路就是**"先用定义查独立,再用 Cov 查相关,最后对表"**。下面三个例题分别演示"独立""不独立且相关""不独立但不相关"三种真实情况——尤其例题3(Y=X²)就是 4.9 节的核心反例。
翻车现场:
- 把"不相关"当成"独立"——这是最大的坑。不相关只是 Cov=0,没有直线关系,但可能有曲线关系。
- 逻辑方向搞反——独立 ⇒ 不相关(正确),但不相关 ⇒ 独立(错误,除非是正态分布)。
- 独立判断漏检查某一对——离散型要检查所有 (x_i, y_j) 组合。
- 忘记正态分布的特殊性——只有二维正态分布中独立和不相关才等价。
例题1:判断离散型联合分布的独立性和相关性
题目:已知 (X,Y) 的联合分布律为:
| X\Y | −1 | 1 |
|---|---|---|
| −1 | 1/4 | 1/4 |
| 1 | 1/4 | 1/4 |
判断 X 和 Y 是否独立?是否相关?
点击看解答
第1步:求边缘分布
P(X=−1) = 1/4 + 1/4 = 1/2
P(X=1) = 1/4 + 1/4 = 1/2
P(Y=−1) = 1/4 + 1/4 = 1/2
P(Y=1) = 1/4 + 1/4 = 1/2
第2步:判断独立
检查 P(X=−1, Y=−1) = 1/4 = P(X=−1)×P(Y=−1) = 1/2×1/2 = 1/4 ✓
全部成立 → X 和 Y 独立
第3步:既然是独立的,必定不相关
答案:X 和 Y 独立,也不相关。
例题2:不独立且相关(Y=X,完全线性关系)
题目:已知 (X,Y) 的联合分布律为:
| X\Y | 0 | 1 |
|---|---|---|
| 0 | 1/3 | 0 |
| 1 | 0 | 2/3 |
判断 X 和 Y 是否独立?是否相关?
点击看解答
第1步:求边缘分布
P(X=0) = 1/3, P(X=1) = 2/3
P(Y=0) = 1/3, P(Y=1) = 2/3
第2步:判断独立
检查 P(X=0, Y=1) = 0
但 P(X=0)×P(Y=1) = 1/3×2/3 = 2/9 ≠ 0 ✗
→ 不独立!(Y 完全由 X 决定,实际 Y = X)
第3步:判断相关性
E(X) = 0×1/3 + 1×2/3 = 2/3
E(Y) = 0×1/3 + 1×2/3 = 2/3
E(XY) = 1×1×2/3 = 2/3
Cov(X,Y) = 2/3 − 2/3×2/3 = 2/9 ≠ 0
→ 相关!
答案:X 和 Y 不独立,且相关。(因为 Y=X,完全线性相关!)
例题3:不独立但不相关(这才是真正的"不相关≠独立"案例)
题目:设随机变量 X 的分布律为 P(X=−1)=1/3, P(X=0)=1/3, P(X=1)=1/3。令 Y = X²。判断 X 和 Y 是否独立?是否相关?
点击看解答
第1步:写出联合分布律
X 取 −1, 0, 1(各 1/3),Y = X² 取 0 或 1。
当 X=−1 时 Y=1;当 X=0 时 Y=0;当 X=1 时 Y=1。
联合分布律:
| X\Y | 0 | 1 |
|-----|-------|-------|
| −1 | 0 | 1/3 |
| 0 | 1/3 | 0 |
| 1 | 0 | 1/3 |
第2步:判断独立
边缘分布:P(X=−1)=1/3, P(X=0)=1/3, P(X=1)=1/3
P(Y=0)=1/3, P(Y=1)=2/3
检查 P(X=−1, Y=1) = 1/3 ≠ P(X=−1)·P(Y=1) = 1/3×2/3 = 2/9 ✗
→ 不独立!(Y 由 X 完全决定)
第3步:判断相关性
E(X) = (−1+0+1)/3 = 0
E(Y) = 0×1/3 + 1×2/3 = 2/3
E(XY) = (−1)·1·(1/3) + 0·0·(1/3) + 1·1·(1/3) = 0
Cov(X,Y) = E(XY) − E(X)E(Y) = 0 − 0×(2/3) = 0
→ 相关系数为 0,不相关!
答案:X 和 Y 不独立,但不相关。(Y = X² 是抛物线关系,非线性!)
💡 对比例题2和例题3:
例题2(Y=X):不独立 + 相关(有直线联动)
例题3(Y=X²):不独立 + 不相关(有抛物线联动但没有直线联动)
这就把"独立→不相关→独立"四种可能中的两种关键情况都覆盖了。
例题4(速例·连续型):联合密度判断独立和相关
点击展开——学完离散型后,看一个连续型的判断方法
题目:设 (X,Y) 的联合密度为 $f(x,y)=2$($0 < x < y < 1$),其他为 0。判断 X 和 Y 是否独立?是否相关?
第1步:求边缘密度(对另一个变量积分)
f_X(x) = ∫_x^1 2 dy = 2(1−x),0 < x < 1
f_Y(y) = ∫_0^y 2 dx = 2y,0 < y < 1
第2步:判断独立
f_X(x)·f_Y(y) = 2(1−x)·2y = 4y(1−x)
但 f(x,y) = 2,两者不相等。
或者看定义域:x 的范围 (0, y) 依赖 y,不是矩形!
→ 不独立
第3步:判断相关性
E(X) = ∫₀¹ x·2(1−x) dx = 1/3
E(Y) = ∫₀¹ y·2y dy = 2/3
E(XY) = ∫₀¹∫_x^1 xy·2 dy dx = 1/4
Cov(X,Y) = 1/4 − (1/3)×(2/3) = 1/4 − 2/9 = 1/36 ≠ 0
→ Cov ≠ 0,相关!
答案:不独立,且相关。(和例题2一样的情况,只是换成了连续型)
💡 连续型判断独立的两条路:
① 公式法:f_X(x)·f_Y(y) = f(x,y) 是否恒成立?
② 定义域法:如果定义域不是矩形(如"x < y"),一定不独立!
🛑 途中停顿
停下来判断对错:"不相关就是独立。"
点击看答案
这句话是错的。 不相关(Cov=0)只说明没有直线关系,不说明独立。
经典反例:X ~ N(0,1),令 Y = X²。算出来 Cov(X,Y)=0(不相关),但 Y 完全由 X 决定(显然不独立)。
记住口诀:独立 ⇒ 不相关 ✓;不相关 ⇒ 独立 ✗(唯一例外:二维正态分布)。
🧠 概念辨析自检(10道判断题)
覆盖全章核心概念(期望、方差、协方差、相关系数、独立与不相关)。先判断对错,再看答案。每题建议停留10秒想清楚"为什么"再往下翻。
判断1:$E(X+Y) = E(X) + E(Y)$ 永远成立,不需要任何条件。
点击看答案
✅ 正确。 期望的线性性质无条件成立——和的期望永远等于期望的和。这是期望比方差"好脾气"的原因之一。
判断2:$Var(X+Y) = Var(X) + Var(Y)$ 永远成立。
点击看答案
❌ 错误。 方差的和可以拆,需要 X 和 Y 独立(或不相关)。一般情况 $Var(X+Y) = Var(X) + Var(Y) + 2Cov(X,Y)$,多了协方差项。
判断3:期望 E(X) 一定是随机变量 X 能取到的值。
点击看答案
❌ 错误。 典型的反例:掷骰子的期望是 3.5,但骰子根本没有 3.5 这个面。期望是"中心位置"(加权平均),不一定是实际能取到的值。
判断4:$Cov(X,Y) = 0$ 意味着 X 和 Y 没有任何关系。
点击看答案
❌ 错误。 协方差为 0 只说明没有线性关系,但完全可能存在曲线关系。经典反例:$Y = X^2$,若 $E(X)=0$ 且分布对称,则 $Cov(X,X^2)=0$,但 Y 完全由 X 决定。
判断5:如果 X 和 Y 独立,则 $Cov(X,Y) = 0$ 一定成立。
点击看答案
✅ 正确。 独立 ⇒ $E(XY) = E(X)E(Y)$ ⇒ $Cov(X,Y) = E(XY) - E(X)E(Y) = 0$。这是"独立推出不相关"的数学证明。
判断6:相关系数 $\rho_{XY} = 0$ 等价于 X 和 Y 独立。
点击看答案
❌ 错误。 $\rho=0$(不相关)不能推出独立。唯一的例外是二维正态分布——只有在这种特殊情况下,"不相关"和"独立"才等价。
判断7:对于二维正态分布,$\rho = 0$ 是 X 和 Y 独立的充分必要条件。
点击看答案
✅ 正确。 这是全章唯一一种"独立 ⇔ 不相关"的情况,也是考试高频考点。题目如果没提"正态分布","不相关推不出独立"是默认答案。
判断8:$Var(aX + b) = a \cdot Var(X)$(即系数 a 不用平方)。
点击看答案
❌ 错误。 正确公式是 $Var(aX + b) = a^2 \cdot Var(X)$。系数必须平方——因为方差衡量"距离的平方",缩放 a 倍后距离变成 a 倍,平方后自然是 a² 倍。加常数 b 对方差无影响。
判断9:$Cov(X, X) = Var(X)$。
点击看答案
✅ 正确。 代入协方差公式:$Cov(X,X) = E(X \cdot X) - E(X)E(X) = E(X^2) - [E(X)]^2 = Var(X)$。自己跟自己的协方差就是自己的方差。
判断10:$E(XY) = E(X) \cdot E(Y)$ 永远成立。
点击看答案
❌ 错误。 乘积的期望能拆开,只有在 X 和 Y 独立时才成立(或者刚好 Cov=0 时也成立,但这不是"永远"成立)。注意和判断1对比——"和的期望"永远能拆,"乘积的期望"不能。
🧪 学完自测(4选择 + 2判断 + 4简答)
混搭全章知识点,检验你是否真的理解而不是死记。先自己答,再看答案。这些是学生最容易踩的坑。
选择题
选择1:关于"独立"和"不相关"的关系,下列说法正确的是:
A. 独立和不相关是等价的,可以互相推出
B. 不相关一定推出独立,但独立不一定推出不相关
C. 独立一定推出不相关,但不相关不一定推出独立
D. 独立和不相关没有任何关系
点击看答案
✅ C。 独立 ⇒ Cov=0(不相关)一定成立。但反之不然——反例:Y=X²,Cov=0 但显然不独立。唯一例外是二维正态分布(此时独立 ⇔ 不相关)。
选择2:关于 $Var(X+Y)$,下列说法正确的是:
A. $Var(X+Y) = Var(X) + Var(Y)$ 永远成立
B. $Var(X+Y) = Var(X) + Var(Y)$ 只在 X 和 Y 独立时成立
C. $Var(X+Y) = Var(X) + Var(Y) + Cov(X,Y)$
D. $Var(X+Y)$ 和 $E(X+Y)$ 一样,永远可以直接拆开
点击看答案
✅ B。 $Var(X+Y) = Var(X) + Var(Y)$ 需要独立(或不相关)条件。一般情况下多一项 $2Cov(X,Y)$。容易混淆的是:$E(X+Y)=E(X)+E(Y)$ 永远成立——期望是"好脾气",方差是"坏脾气"。
选择3:相关系数 $\rho = 0$ 意味着:
A. X 和 Y 没有任何关系
B. X 和 Y 一定独立
C. X 和 Y 之间不存在直线关系,但可能存在曲线关系
D. X 和 Y 的协方差一定大于 0
点击看答案
✅ C。 相关系数只衡量线性关系。$\rho=0$ 只说明没有直线联动,不排除 $Y=X^2$ 这样的曲线关系。A 和 B 都是经典错误。
选择4:关于 $E(X^2)$ 和 $[E(X)]^2$ 的关系,下列说法正确的是:
A. $E(X^2) = [E(X)]^2$ 永远成立
B. $E(X^2) \leq [E(X)]^2$ 永远成立
C. $E(X^2) \geq [E(X)]^2$,等号仅在 $Var(X)=0$ 时成立
D. 两者没有固定的大小关系
点击看答案
✅ C。 因为 $Var(X) = E(X^2) - [E(X)]^2 \geq 0$,所以 $E(X^2) \geq [E(X)]^2$。只有当 X 是常数(方差为 0)时等号才成立。
判断题
判断1:方差为 0 的随机变量一定是常数(以概率 1 等于某个常数)。
点击看答案
✅ 正确。 $Var(X)=0$ 意味着 $E[(X-EX)^2]=0$。由于 $(X-EX)^2 \geq 0$,期望为 0 只能推出 $P(X=EX)=1$——X 以概率 1 等于期望。
判断2:$E(XY) = E(X)E(Y)$ 是 X 和 Y 独立的充分必要条件。
点击看答案
❌ 错误。 $E(XY)=E(X)E(Y)$(即 Cov=0)只是独立的必要条件(独立必推出它),不是充分条件(它推不出独立)。反例:$X \sim N(0,1), Y=X^2$,$E(XY)=E(X^3)=0=E(X)E(Y)$,但显然不独立。
简答题
简答1:为什么 $E(X+Y) = E(X) + E(Y)$ 永远成立,但 $Var(X+Y) = Var(X) + Var(Y)$ 需要条件?用大白话解释。
点击看答案
期望是"平均"——一组数的总平均等于各部分平均之和,这和它们之间有没有关系无关。就像两个班合起来的总平均分 = 各班平均分按人数加权之和,不需要两个班成绩有任何关系。
方差是"波动的平方"——展开 $(X+Y-EX-EY)^2$ 时多了一个交叉项 $2(X-EX)(Y-EY)$,这项的期望就是 $2Cov(X,Y)$。X 和 Y 独立时这项才等于 0。就像两股波浪合在一起——如果它们同步涨落(相关),总波动比各自波动加起来更大。
简答2:写出 $Var(X) = E(X^2) - [E(X)]^2$ 的推导过程(从定义出发),并说明为什么这个公式比定义好用。
点击看答案
从定义出发:
$Var(X) = E[(X-EX)^2]$
展开平方:$= E[X^2 - 2X \cdot EX + (EX)^2]$
拆期望:$= E(X^2) - 2EX \cdot E(X) + (EX)^2$
(注意 $EX$ 是常数,可以提到期望外面)
$= E(X^2) - 2(EX)^2 + (EX)^2$
$= E(X^2) - (EX)^2$
好用在哪里:只需要算 $E(X)$ 和 $E(X^2)$ 两个值,避免先做减法再做平方再算期望的繁琐步骤。而且 $E(X^2)$ 用 4.2 节的函数期望公式直接能算。
简答3:举一个"不相关但不独立"的具体例子,并说明为什么这个例子成立。
点击看答案
例子:$X$ 取 −1, 0, 1 各 1/3,$Y = X^2$。
为什么成立:
- Y 由 X 完全决定 → 不独立(信息完全传递)
- $E(X)=0$(对称),$E(XY)=E(X^3)=0$(奇函数对称),所以 $Cov=0$ → 不相关
核心原因:相关系数只能测直线关系,$Y=X^2$ 是抛物线关系——从直线角度看是"平的"($\rho=0$),但实际上完全是函数关系。这说明了"不相关≠独立"的本质。
简答4:在什么特殊情况下,"不相关"和"独立"是等价的?这个特殊点在考试中为什么重要?
点击看答案
二维正态分布中,$\rho=0$(不相关)当且仅当 X 和 Y 独立。这是全章唯一一种"独立=不相关"的情况。
考试重要性:因为它是常理(不相关推不出独立)的唯一例外,选择题和判断题中如果遇到"独立⇔不相关",必须看题目是否说了"正态分布"。没说的话一般不成立,说了就成立。
③ 综合混搭练习
打乱题型,逼你自己判断用哪个方法。这四道题混合了本章的多个题型。
混搭1 🎲
设随机变量 X 的分布律为:
| X | 1 | 2 | 3 |
|---|---|---|---|
| p | 0.3 | 0.5 | 0.2 |
(1) 求 E(X) 和 Var(X)。
(2) 设 Y = 2X + 1,求 E(Y) 和 Var(Y)。
(3) 设 Z = X²,求 E(Z)。
📌 对应模板:题型一(离散型期望方差)+ 题型三(函数期望)+ 题型四(方差性质)
点击看答案
(1) 算期望和方差
E(X) = 1×0.3 + 2×0.5 + 3×0.2 = 0.3 + 1.0 + 0.6 = 1.9
E(X²) = 1²×0.3 + 2²×0.5 + 3²×0.2 = 0.3 + 2.0 + 1.8 = 4.1
Var(X) = E(X²) − [E(X)]² = 4.1 − 1.9² = 4.1 − 3.61 = 0.49
(2) Y = 2X + 1
E(Y) = 2E(X) + 1 = 2×1.9 + 1 = 4.8
Var(Y) = 2²·Var(X) = 4 × 0.49 = 1.96
(3) Z = X²
E(Z) = E(X²) = 4.1(直接来自第(1)步的计算)
答案:(1) E(X)=1.9, Var(X)=0.49; (2) E(Y)=4.8, Var(Y)=1.96; (3) E(Z)=4.1
混搭2 📊
设随机变量 X 的密度函数为:
$$f(x) = \begin{cases} \frac{3}{2}x^2, & -1 < x < 1 \ 0, & \text{其他} \end{cases}$$
(1) 验证这个 f(x) 确实是一个概率密度函数。
(2) 求 E(X) 和 Var(X)。
(3) 求 E(1/X),并说明这个期望是否存在。
📌 对应模板:题型二(连续型期望)+ 题型三(函数期望)+ 密度验证
点击看答案
(1) 验证为概率密度函数:
∫_{-1}^{1} (3/2)x² dx = (3/2)·[x³/3]_{-1}^{1} = (3/2)·(1/3 − (−1/3)) = (3/2)·(2/3) = 1 ✓
(2) 算期望和方差
E(X) = ∫_{-1}^{1} x·(3/2)x² dx = (3/2)∫_{-1}^{1} x³ dx
x³ 在 [−1, 1] 上是奇函数,对称区间积分为 0
E(X) = 0
E(X²) = ∫_{-1}^{1} x²·(3/2)x² dx = (3/2)∫_{-1}^{1} x⁴ dx
= (3/2)·[x⁵/5]_{-1}^{1} = (3/2)·(1/5 − (−1/5)) = (3/2)·(2/5) = 3/5
Var(X) = E(X²) − [E(X)]² = 3/5 − 0 = 0.6
(3) 求 E(1/X):
E(1/X) = ∫_{-1}^{1} (1/x)·(3/2)x² dx = (3/2)∫_{-1}^{1} x dx
= (3/2)·[x²/2]_{-1}^{1} = (3/2)·(1/2 − 1/2) = 0
但注意:积分区间包含 x=0 点,1/x 在 x=0 处无定义。
需要检查这个反常积分是否收敛。实际上被积函数 x 在 [−1, 1] 上
的积分是收敛的(原函数 x²/2 在 0 处连续),所以 E(1/X) = 0。
答案:(1) 验证通过;(2) E(X)=0, Var(X)=0.6;(3) E(1/X)=0
混搭3 🔗
已知随机变量 X 和 Y 的联合分布律为:
| X\Y | 0 | 2 |
|---|---|---|
| 0 | 0.2 | 0.3 |
| 1 | 0.1 | 0.4 |
(1) 求 E(X), E(Y), Var(X), Var(Y)。
(2) 求 Cov(X,Y) 和相关系数 ρ。
(3) X 和 Y 是否独立?是否相关?请说明理由。
📌 对应模板:题型五(协方差相关系数)+ 题型七(独立与不相关判断)
点击看答案
(1) 边缘分布
P(X=0) = 0.2 + 0.3 = 0.5, P(X=1) = 0.1 + 0.4 = 0.5
P(Y=0) = 0.2 + 0.1 = 0.3, P(Y=2) = 0.3 + 0.4 = 0.7
E(X) = 0×0.5 + 1×0.5 = 0.5
E(X²) = 0²×0.5 + 1²×0.5 = 0.5
Var(X) = 0.5 − 0.5² = 0.25
E(Y) = 0×0.3 + 2×0.7 = 1.4
E(Y²) = 0²×0.3 + 2²×0.7 = 0 + 2.8 = 2.8
Var(Y) = 2.8 − 1.4² = 2.8 − 1.96 = 0.84
(2) 协方差和相关系数
E(XY) = 0×0×0.2 + 0×2×0.3 + 1×0×0.1 + 1×2×0.4
= 0 + 0 + 0 + 0.8 = 0.8
Cov(X,Y) = E(XY) − E(X)E(Y) = 0.8 − 0.5×1.4 = 0.8 − 0.7 = 0.1
ρ = 0.1 / √(0.25×0.84) = 0.1 / √0.21 = 0.1/0.4583 ≈ 0.218
(3) 独立性判断
检查 P(X=0, Y=0)=0.2,P(X=0)×P(Y=0)=0.5×0.3=0.15
0.2 ≠ 0.15 → 不独立
因为 Cov=0.1≠0,所以 X 和 Y 相关。
答案:(1) E(X)=0.5, Var(X)=0.25, E(Y)=1.4, Var(Y)=0.84
(2) Cov=0.1, ρ≈0.218
(3) 不独立且相关(Cov≠0说明有线性关系)
混搭4 🧮
某公司有两个部门。A部门员工人数占比60%,平均工资8000元,标准差500元。B部门员工人数占比40%,平均工资10000元,标准差800元。
(1) 求全公司的平均工资。
(2a) Cov(A部门工资, B部门工资) 你猜是正还是负?为什么?(常识判断即可)
(2b) 若已知全公司工资的方差为 1,500,000(注意:方差单位是"元的平方"),能否利用方差分解公式反推出 Cov 的具体值?试试看。
💡 这里用到一个还没正式教的新公式——方差分解公式:$Var(X) = E[Var(X|Y)] + Var(E[X|Y])$。大白话就是一句话:总方差 = 组内方差的平均 + 组间方差。想象把全公司员工按部门分成两组:先看每个部门内部工资有多散(组内方差,按人数占比加权平均),再看两个部门的平均工资之间有多散(组间方差,即各部门均值与全公司均值 8800 的差距)。两部分加起来,就是全公司工资的总波动。这是本节前面"条件期望(补充)"讲过的结论,第7章回归会用到,这里先记住这句话就行。
(3) 如果从全公司随机抽取一名员工,工资为 X。已知 E(X) 和 Var(X) 已经算出,用切比雪夫不等式估计 P(|X − E(X)| ≥ 1000) 的上界。
📌 对应模板:题型四(期望方差性质)+ 题型五(协方差含义)+ 切比雪夫不等式
点击看答案
(1) E(X) = 0.6×8000 + 0.4×10000 = 4800 + 4000 = 8800
全公司平均工资为 8800 元。
(2a) 常识判断:如果两个部门的工资一起浮动(经济景气时一起涨,不景气时一起跌),
协方差为正;如果一个涨另一个跌,协方差为负。
通常两个部门的工资会受相同经济环境影响,大概率同涨同跌,
所以 Cov 大概率为正。
(2b) 利用方差分解公式:
Var(X) = E[Var(X|部门)] + Var[E(X|部门)]
= [0.6×500² + 0.4×800²] + [0.6×(8000-8800)² + 0.4×(10000-8800)²]
= [0.6×250000 + 0.4×640000] + [0.6×640000 + 0.4×1440000]
= [150000 + 256000] + [384000 + 576000]
= 406000 + 960000 = 1,366,000
方差分解公式算出的方差(1,366,000)和题目给的总方差(1,500,000)之差
来自于部门间的协方差项——这也印证了(2a)中 Cov 为正的判断。
(3) 切比雪夫不等式:
P(|X − 8800| ≥ 1000) ≤ Var(X) / 1000² = 1,500,000 / 1,000,000 = 1.5
但这个上界大于1,没有实际意义。切比雪夫不等式给出的上界通常很宽松,
实际概率可能远小于这个数。
答案:(1) 8800元;(2) 大概率正相关;(3) 上界 1.5(无效,说明需要更精确的分布信息)
条件期望(补充)——已知 X 的值,Y 的平均是多少?
这一小节补上第3章条件分布之后没来得及讲的一步:条件期望。第3章只教了"已知 X 时,Y 的条件分布 f(y|x)"(分布的形状),这一节再往前迈一步——算出这个条件的分布的"平均值"。后面的回马枪5和混搭题里都会用到,先花几分钟把它补上。
🎯 先抛问题:已知 X 的值,Y 的平均值是多少?
🧮 定义(其实就是对条件分布做一次普通期望式的加权平均):
离散型:$E(Y|X=x) = \sum_i y_i \cdot P(Y=y_i|X=x)$ —— 把每个取值乘上"已知 X=x 时的条件概率",再求和。
连续型:$E(Y|X=x) = \int_{-\infty}^{+\infty} y \cdot f_{Y|X}(y|x)\, dy$ —— 把 y 乘上条件密度,再积分。
🏠 生活比喻:已知一个人的身高 X,你对他体重的平均 Y 心里大概有数——高个子的人体重均值偏大,矮个子的人体重均值偏小。条件期望 $E(Y|X=x)$ 就是"把身高锁定在 x 这一档的人,体重的平均值"。它和普通期望 $E(Y)$(所有人的平均体重)不同:$E(Y)$ 是一个固定的数,而 $E(Y|X=x)$ 随 x 变化——x 不同,答案不同。
✍️ 具体数字例子(用第3章已学的条件分布来算):设 (X, Y) 的联合分布律为:P(X=0, Y=0)=0.2,P(X=0, Y=2)=0.3,P(X=1, Y=0)=0.1,P(X=1, Y=2)=0.4(就是本章前面题型练习里出现过的那张表)。第3章已学过:P(X=0) = 0.2+0.3 = 0.5,于是条件分布 P(Y=0|X=0) = 0.2/0.5 = 0.4,P(Y=2|X=0) = 0.3/0.5 = 0.6。按定义算:
$E(Y|X=0) = 0 \times 0.4 + 2 \times 0.6 = 1.2$ —— 即"X=0 的这一组,Y 平均为 1.2"。若 X 和 Y 独立,条件期望就等于普通期望 $E(Y)$(知道 X 不改变任何信息)。
💡 一句话总结:条件期望是条件分布的延伸——第3章学的是条件分布的形状,这里只是加一步"求平均"。考研数三偶有涉及,也是本章混搭4中方差分解公式($Var(X) = E[Var(X|Y)] + Var(E[X|Y])$)和第7章回归分析的预备知识。
🔄 回马枪1(第1章 × 第4章)全概率/贝叶斯 + 期望
某工厂有三条生产线:A线产量占50%,B线占30%,C线占20%。三条线的次品率分别为1%、3%、5%。
(1) 从全厂产品中随机抽一件,求它是次品的概率。
(2) 已知抽到的是次品,它来自C线的概率是多少?
(3) 设抽到次品记为1、正品记为0——即随机变量 X = 1(次品)或 0(正品)。利用(1)的结果,求 E(X) 和 Var(X)。
📌 回马枪指向:第1章全概率公式/贝叶斯公式 + 第4章0-1分布的期望方差
点击看答案
(1) 全概率公式:
P(次品) = 0.50×0.01 + 0.30×0.03 + 0.20×0.05
= 0.005 + 0.009 + 0.010 = 0.024
(2) 贝叶斯公式:
P(C线 | 次品) = [P(次品|C线) × P(C线)] / P(次品)
= (0.05 × 0.20) / 0.024
= 0.010 / 0.024 ≈ 0.4167
(3) X 是 0-1 分布,p = P(X=1) = 0.024:
E(X) = p = 0.024
Var(X) = p(1-p) = 0.024 × 0.976 = 0.023424
答案:(1) 0.024; (2) ≈0.417; (3) E(X)=0.024, Var(X)≈0.0234
🔄 回马枪2(第2章 × 第4章)正态分布 + 期望方差
设成年男性身高 X ~ N(170, 36)(单位:cm)。注意:N(170, 36) 中第二个参数 36 是方差 σ²,不是标准差。
(1) 求 E(X)、Var(X)、标准差 σ。
(2) 将身高标准化,求 Z = (X − 170)/6 的期望和方差。
(3) 若从该人群中随机抽 25 人,他们的平均身高记为 $\bar{X}$。已知 $\bar{X} \sim N(170, 36/25)$,求 $E(\bar{X})$ 和 $Var(\bar{X})$。
📌 回马枪指向:第2章正态分布参数含义 + 第4章标准化变换 + 期望方差性质
点击看答案
(1) X ~ N(170, 36):
E(X) = μ = 170 cm
Var(X) = σ² = 36
σ = √36 = 6 cm
(2) Z = (X − 170)/6:
这是标准化变换,Z ~ N(0, 1)
E(Z) = E[(X − 170)/6] = [E(X) − 170]/6 = 0
Var(Z) = Var[(X − 170)/6] = Var(X)/6² = 36/36 = 1
(3) 样本均值:
E(X̄) = E(X) = 170(期望的线性性质)
Var(X̄) = Var(X)/25 = 36/25 = 1.44
答案:(1) E=170, Var=36, σ=6;
(2) E(Z)=0, Var(Z)=1(标准正态);
(3) E(X̄)=170, Var(X̄)=1.44
🔄 回马枪3(第2章 × 第4章)泊松分布 + 期望方差推导
某银行柜台平均每小时来 4 位客户,设每小时到访人数 X ~ P(4)。
(1) 求 E(X) 和 Var(X)。(可直接用泊松公式,不要求从定义推导。)
(2) 设 Y = 2X + 3(某种计分方式),求 E(Y) 和 Var(Y)。
(3) 求 P(X = 0) 的值(精确到小数点后 4 位)。(提示:e⁻⁴ ≈ 0.0183)
📌 回马枪指向:第2章泊松分布公式 + 第4章方差性质 Var(aX+b)=a²Var(X)
点击看答案
(1) 泊松分布 X ~ P(4):
E(X) = λ = 4
Var(X) = λ = 4
(泊松分布是唯一期望=方差的常见分布!)
(2) Y = 2X + 3:
E(Y) = 2E(X) + 3 = 2×4 + 3 = 11
Var(Y) = 2² × Var(X) = 4 × 4 = 16
(注意:+3 对方差无影响——平移不改变波动)
(3) 泊松概率公式 P(X=k) = λᵏe⁻λ / k!:
P(X=0) = 4⁰ × e⁻⁴ / 0! = 1 × 0.0183 / 1 = 0.0183
答案:(1) E(X)=4, Var(X)=4;
(2) E(Y)=11, Var(Y)=16;
(3) P(X=0)=0.0183
🔄 回马枪4(第3章 × 第4章)联合分布 + 协方差 + 相关系数
已知 X 和 Y 的联合分布律:
| X\Y | -1 | 1 |
|---|---|---|
| -1 | 0.2 | 0.3 |
| 1 | 0.3 | 0.2 |
(1) 求 X 和 Y 各自的边缘分布,并分别求 E(X)、E(Y)、Var(X)、Var(Y)。
(2) 求 Cov(X, Y) 和相关系数 ρ。
(3) X 和 Y 是否独立?请用联合概率与边缘概率乘积比较来判断。
📌 回马枪指向:第3章联合分布与边缘分布 + 第4章协方差与相关系数 + 独立性判断
点击看答案
(1) 边缘分布:
P(X = −1) = 0.2 + 0.3 = 0.5
P(X = 1) = 0.3 + 0.2 = 0.5
P(Y = −1) = 0.2 + 0.3 = 0.5
P(Y = 1) = 0.3 + 0.2 = 0.5
E(X) = (−1)×0.5 + 1×0.5 = 0
E(Y) = (−1)×0.5 + 1×0.5 = 0
E(X²) = (−1)²×0.5 + 1²×0.5 = 1
Var(X) = 1 − 0² = 1
同理 Var(Y) = 1
(2) E(XY):
四个格子:XY = (−1)(−1)=1 (p=0.2), (−1)(1)=−1 (p=0.3),
(1)(−1)=−1 (p=0.3), (1)(1)=1 (p=0.2)
E(XY) = 1×0.2 + (−1)×0.3 + (−1)×0.3 + 1×0.2
= 0.2 − 0.3 − 0.3 + 0.2 = −0.2
Cov(X,Y) = E(XY) − E(X)E(Y) = −0.2 − 0×0 = −0.2
ρ = Cov/(σₓσᵧ) = −0.2 / (1×1) = −0.2
(3) 独立性判断:
检查 P(X=−1, Y=−1)=0.2 是否等于 P(X=−1)×P(Y=−1)=0.5×0.5=0.25
0.2 ≠ 0.25 → 不独立
(其实肉眼也看得出:表格不对称——同号概率 0.4,异号概率 0.6,
X 和 Y 倾向于取相反符号——这恰好对应 ρ=−0.2 的负相关。)
答案:(1) E(X)=E(Y)=0, Var(X)=Var(Y)=1;
(2) Cov=−0.2, ρ=−0.2;
(3) 不独立(联合概率≠边缘乘积)
🔄 回马枪5(第3章 × 第4章)边缘分布 + 条件期望
设 (X, Y) 的联合密度为:
$$f(x,y) = \begin{cases} 2, & 0 < x < y < 1 \ 0, & \text{其他} \end{cases}$$
(1) 求 X 的边缘密度 f_X(x)。(提示:对 y 积分时,y 的范围是从 x 到 1。)
(2) 利用(1)的结果,求 E(X)。
(3) 给定 X = 0.5 时,Y 的条件密度为 $f_{Y|X}(y|0.5) = \frac{1}{0.5} = 2 \quad (0.5 < y < 1)$。求条件期望 $E(Y | X = 0.5)$。
📌 回马枪指向:第3章边缘密度 + 条件密度 + 条件期望 + 第4章连续型期望计算
点击看答案
(1) X 的边缘密度:f_X(x) = ∫ f(x,y) dy
y 的范围:从 x 到 1(因为 0 < x < y < 1)
f_X(x) = ∫ₓ¹ 2 dy = 2(1 − x), 0 < x < 1
(2) E(X) = ∫₀¹ x × f_X(x) dx = ∫₀¹ x × 2(1 − x) dx
= 2 ∫₀¹ (x − x²) dx
= 2 [x²/2 − x³/3]₀¹ = 2 (1/2 − 1/3) = 2 × 1/6 = 1/3
(3) 条件期望:E(Y | X = 0.5) = ∫_{0.5}¹ y × f_{Y|X}(y|0.5) dy
= ∫_{0.5}¹ y × 2 dy
= 2 × [y²/2]_{0.5}¹
= 2 × (1/2 − 0.25/2)
= 1 − 0.25 = 0.75
直觉验证:给定 X=0.5,Y 均匀落在 (0.5, 1) 上,期望正好在中间 (0.5+1)/2=0.75。
答案:(1) f_X(x)=2(1−x), 0<x<1;
(2) E(X)=1/3;
(3) E(Y|X=0.5)=0.75
🎯 考试导航
题型考频速查
| 题型 | 考频 | 常见出题形式 | 备考建议 |
|---|---|---|---|
| 离散型期望方差 | 很高 | 选择/填空,每年至少1题 | 分布律表格+参数求解,熟练 $Var = E(X²) − [E(X)]²$ |
| 连续型期望方差 | 很高 | 选择/填空,常考均匀/指数分布 | 分段密度要分段积分,记住先验密度是否为1 |
| 函数期望 | 很高 | 选择或大题一小问 | 直接套公式,别绕路先求Y的分布 |
| 期望方差性质 | 很高 | 大题常客,线性组合问题 | 系数平方、独立条件、常数对方差无影响 |
| 协方差相关系数 | 中等 | 选择或大题,离散型为主 | E(XY)必须用联合分布算;相关系数分母是标准差乘积 |
| 常见分布公式 | 很高 | 送分题,直接套 | 正态分布第二个参数是σ²不是σ |
| 独立与不相关 | 较高 | 概念辨析选择 | 不相关≠独立,唯一例外:二维正态分布 |
常见分布公式速查
| 分布名称 | 参数 | E(X) | Var(X) | 助记技巧 |
|---|---|---|---|---|
| 0-1分布 | p | p | p(1−p) | 一次伯努利试验,期望就是p |
| 二项分布 B(n,p) | n, p | np | np(1−p) | 0-1分布的n倍 |
| 泊松分布 P(λ) | λ | λ | λ | 期望=方差,唯一"两者相等"的分布 |
| 均匀分布 U(a,b) | a, b | (a+b)/2 | (b−a)²/12 | 期望在正中间 |
| 指数分布 Exp(λ) | λ | 1/λ | 1/λ² | λ越大等待越短,方差是期望的平方 |
| 正态分布 N(μ,σ²) | μ, σ² | μ | σ² | 参数直接就是期望和方差 |
| 几何分布 | p | 1/p | (1−p)/p² | 直到第一次成功 |
| 超几何分布 | N,M,n | n·M/N | 含有限修正因子 | 不放回抽样 |
常用关系换算表
| 需要什么 | 公式 |
|---|---|
| 已知 E(X) 和 Var(X),求 E(X²) | $E(X²) = Var(X) + [E(X)]²$ |
| 已知 Cov, 求相关系数 | $\rho = Cov / (\sigma_X \sigma_Y)$ |
| 已知 ρ 和标准差,求 Cov | $Cov = \rho \cdot \sigma_X \cdot \sigma_Y$ |
| 独立时 Var(X+Y) | $Var(X+Y) = Var(X) + Var(Y)$ |
| 不独立时 Var(X+Y) | $Var(X+Y) = Var(X) + Var(Y) + 2Cov(X,Y)$ |
| Var(aX+bY) 一般公式 | $a²Var(X) + b²Var(Y) + 2ab·Cov(X,Y)$ |
| 协方差简便公式 | $Cov(X,Y) = E(XY) - E(X)E(Y)$ |
独立与不相关关系图示
独立 ⟹ 不相关(Cov=0)
不相关 ⟸̸ 独立 (反例:Y=X²,Cov=0但不独立)
相关 ⟹ 不独立 (Cov≠0 说明有线性关系,不可能独立)
正态分布例外:独立 ⟺ 不相关 ⟺ ρ=0
练习题-模板对照
题目已按"方法讲完立刻练"就近挪到各知识节里。下面的"现在位置"告诉你每题去哪找。
| 题号 | 难度 | 对应模板 | 核心考点 | 现在位置 |
|---|---|---|---|---|
| 1 | ⭐ | 题型一 | 离散型期望方差基本计算 | 4.4节 |
| 2 | ⭐ | 题型二+六 | 连续型期望 + 公式验证 | 4.4节 |
| 3 | ⭐ | 题型三 | 函数期望(两种方法) | 4.2节 |
| 4 | ⭐ | 题型四 | 方差性质(Var(aX+b)) | 4.5节 |
| 5 | ⭐ | 题型六 | 二项分布公式套用 | 4.6节 |
| 6 | ⭐⭐ | 题型五 | 联合分布→协方差→相关系数 | 4.8节 |
| 7 | ⭐⭐ | 题型七 | 不相关≠独立(经典反例) | 4.9节 |
| 8 | ⭐⭐ | 题型四 | 线性组合的期望方差 | 4.5节 |
| 9 | ⭐⭐ | 题型二+三 | 指数分布+函数期望 | 4.6节 |
| 10 | ⭐⭐⭐ | 综合 | 相关系数+期望综合 | 4.8节 |
| 11 | ⭐⭐⭐ | 题型四+六 | 正态线性组合 | 4.6节 |
| 12 | ⭐⭐⭐ | 第5章内容 | 概率上界估计 | 4.5节 |
| 13 | ⭐⭐⭐ | 综合 | 联合密度+边缘+协方差+独立 | 4.9节 |
| 14 | ⭐⭐⭐ | 题型六 | 正态反求参数 | 4.6节 |
| 15 | ⭐⭐⭐ | 题型四 | 样本均值的期望方差 | 4.5节 |
📋 自检清单
学完这章,你应该能回答下面这些问题。如果哪个答不上来,回到对应小节重新看。
- 期望是什么?用加权平均怎样理解它?
- 离散型期望公式和连续型期望公式分别是什么?
- 掷骰子的期望为什么是 3.5?能自己从头算一遍吗?
- 求 $E(X^2)$ 需要先求 $X^2$ 的分布吗?为什么不需要?
- 期望的线性性质 $E(aX + bY) = aE(X) + bE(Y)$ 需要 X 和 Y 独立吗?
- $E(XY) = E(X)E(Y)$ 什么时候成立?反过来成立吗?
- 方差的定义是什么?计算公式 $Var(X) = E(X^2) - [E(X)]^2$ 是怎么推导出来的?
- 方差 $Var(X)$ 和标准差 $\sigma_X$ 是什么关系?为什么需要标准差?
- 全班身高每人加 5cm,方差变不变?全班身高每人翻倍,方差怎么变?
- $Var(X+Y) = Var(X) + Var(Y)$ 什么时候成立?不成立时多了哪一项?
- 0-1分布、二项分布、泊松分布、均匀分布、指数分布、正态分布的期望和方差各是多少?能不看表默写出来吗?
- 协方差的定义和计算公式分别是什么?
- 协方差 > 0、< 0、= 0 分别代表什么含义?
- 相关系数的公式是什么?协方差为什么不能替代它?
- 相关系数的取值范围是多少?$|\rho|=1$ 意味着什么?
- "独立"和"不相关"到底什么关系?谁推出谁?反过来为什么不行?反例是什么?
- 二维正态分布下,独立和不相关的关系有什么特别的?
- 什么是 k 阶原点矩?什么是 k 阶中心矩?方差是几阶中心矩?
🔗 学完回顾:本章推导链
下面是本章所有核心概念之间的推导关系图。箭头方向是"从谁推出谁",箭头上标注的是推导用的关键工具。顺着箭头从左上往右下读,整章的骨架一目了然。
┌─────────────────────────────────────────────────────────────────────────────┐
│ 第4章 数字特征 推导链 │
└─────────────────────────────────────────────────────────────────────────────┘
┌─────────────────────┐
│ 期望定义 E(X) │ 离散:Σ xᵢ pᵢ 连续:∫ x f(x) dx
│ (加权平均 = 重心) │
└────────┬────────────┘
│
┌─────┴──────────────────────────────────────────┐
│ 线性性质(期望的"好脾气"——永远可拆,无需独立) │
▼ ▼
┌──────────────────┐ ┌──────────────────────┐
│ E(aX+b)=aE(X)+b │ │ E(X+Y)=E(X)+E(Y) │
│ 系数可提,常数直加 │ │ 和的期望=期望的和 │
└────────┬─────────┘ └──────────┬───────────┘
│ │
│ 独立时才有:E(XY)=E(X)E(Y) │
│ (乘法挑独立,加法不挑) │
│ │
┌────────┴───────────────────────────────────────────┘
│
▼
┌──────────────────────────────────────────────────────┐
│ 方差定义 Var(X) = E[(X−μ)²] │
│ (偏离平均的距离,平方后求期望——衡量"波动大小") │
└────────┬─────────────────────────────────────────────┘
│
│ 展开 (X−μ)² → 逐项求期望 → E(X)当常数提出
▼
┌──────────────────────────────────────────────────────┐
│ 计算公式 Var(X) = E(X²) − [E(X)]² │
│ "方差 = 平方的平均 − 平均的平方" │
└────────┬─────────────────────────────────────────────┘
│
│ (aX+b): X→aX (距离变a倍→平方变a²倍)
│ +b (平移→距离不变→方差不变)
▼
┌──────────────────────────────────────────────────────┐
│ 方差性质 │
│ Var(aX+b) = a²Var(X) 缩放平方变,平移完全不变 │
└────────┬─────────────────────────────────────────────┘
│
│ 展开 (X+Y) 的方差: (a+b)² = a²+b²+2ab
│ → 交叉项 E[(X−μₓ)(Y−μᵧ)] 诞生!
▼
┌──────────────────────────────────────────────────────┐
│ Var(X±Y) = Var(X)+Var(Y) ± 2Cov(X,Y) (通用式) │
│ 独立时 Cov=0 → Var(X±Y)=Var(X)+Var(Y) (减法也是加!) │
└────────┬─────────────────────────────────────────────┘
│
│ 协方差定义: Cov(X,Y)=E[(X−μₓ)(Y−μᵧ)]
│ 展开 → 计算公式
▼
┌──────────────────────────────────────────────────────┐
│ 协方差 Cov(X,Y) = E(XY) − E(X)E(Y) │
│ 推导套路 = 方差的"亲兄弟":展开→求期望→提常数→合并 │
│ Cov(X,X) = Var(X) ← 方差是协方差的特例 │
└────────┬─────────────────────────────────────────────┘
│
│ 协方差性质:对称、系数可提、加法可拆、常数归零
│
┌─────┴──────────────────────────────┐
│ │
▼ ▼
┌──────────────────────┐ ┌──────────────────────────────────┐
│ 相关系数 │ │ 协方差矩阵(n维推广) │
│ ρ = Cov(X,Y)/(σₓσᵧ) │ │ Σ = [Cov(Xᵢ,Xⱼ)] n×n 对称矩阵 │
│ 消除单位 → [−1, 1] │ │ 对角线=方差,非对角线=协方差 │
└────────┬─────────────┘ └──────────────┬───────────────────┘
│ │
│ −1 ≤ ρ ≤ 1 │ 矩:统一框架
│ |ρ|=1 ⇔ Y=aX+b │
│ ρ=0 ⇔ 不相关(非独立!) │ 一阶原点矩 m₁=E(X) = 期望
▼ │ 二阶中心矩 μ₂=Var(X)= 方差
┌──────────────────────────────────────┐ │ 三阶中心矩 → 偏度
│ 独立 ⇒ 不相关 (ρ=0) │ │ 四阶中心矩 → 峰度
│ 不相关 ⇏ 独立(反例:Y=X², X~N(0,1)) │ │
│ 唯二正态分布:独立⇔不相关 │ ◄────────────────────┘
└──────────────────────────────────────┘
┌─────────────────────────────────────────────────────────────────────────┐
│ 独立分支:常见分布的数字特征("乘法口诀",全书计算加速器) │
│ │
│ 二项 B(n,p): E=np, Var=np(1−p) ← 拆成n个独立0-1之和,期望加/方差加 │
│ 泊松 P(λ): E=λ, Var=λ ← 唯一期望=方差的分布 │
│ 均匀 U(a,b): E=(a+b)/2 ← 中心在正中间 │
│ Var=(b−a)²/12 ← 分母12 │
│ 指数 Exp(λ): E=1/λ, Var=1/λ² ← 分部积分推导 │
│ 正态 N(μ,σ²): E=μ, Var=σ² ← 参数直接就是期望方差! │
│ │
│ 记忆口诀:二项=0-1的n倍 | 泊松两值相等 | 均匀中分除12 | 指数积分两次 │
└─────────────────────────────────────────────────────────────────────────┘
顺着箭头读一遍就记住全章骨架:从期望定义出发 → 利用线性性质推导方差公式 → 方差展开时"多出来的交叉项"引出协方差 → 协方差除以标准差得到相关系数 → 独立/不相关的辨析是本章最深的坑。另一条支线:协方差推广到多个变量就是协方差矩阵,矩则把期望和方差统一到一个更大的框架里。
🔗 章末过渡
本章讲完了。你现在手里有了两把"尺子":期望(量平均水平)和方差(量波动大小),还有一对"关系探测器":协方差和相关系数。这些工具就是概率论后续全部计算的基石。
下一章(第5章)要讲大数定律与中心极限定理。你会发现本章背的公式在那里反复出现——切比雪夫不等式用期望和方差估计概率上界,辛钦大数定律用期望说明样本均值趋向总体均值,中心极限定理用期望和方差把一切标准化成正态分布。简单说:第4章是"造工具",第5章是"用工具回答更深刻的问题"——当我们重复做无数次实验,结果会趋向什么?
趁本章公式还热乎,翻到章首把"必背六种分布"的期望和方差再默写一遍。这六组数字在第5章会像乘法口诀一样反复用到。