第3章 多维随机变量
🔔 课前激活(花30秒想想再往下读)
你去医院体检,医生不会只看你的身高就说你健不健康——他要同时看身高、体重、血压、心率好几个指标。因为有些指标之间有"关联":高的人通常更重,血压高的人往往心率也快。如果只看一个数字,你永远发现不了这些"关系"。
再想想股票——你买了两只股票。你关心的是:如果A涨了,B也会跟着涨吗?还是一只涨另一只就跌?或者两者完全没关系?这其实就是"两个随机变量之间有什么关系"的问题。
带着这些问题往下读。读完这章,你不光能处理单个随机变量,还能分析两个变量之间的"关系"——这是概率论从入门到进阶的分水岭。
📌 学完这章你能回答:
- 知道一个人的身高,能猜出他的体重大概是多少吗?用什么工具来"猜"?
- 两个随机变量"独立"是什么意思?和"不相关"有什么区别?
- 串联电路中,系统寿命由什么决定?并联呢?(max还是min?)
- "联合分布"和"边缘分布",哪个包含的信息更多?为什么?
- 两个正态分布加起来,结果还是正态分布吗?方差怎么变?
本章考什么
考纲定位:多维随机变量是概率论从"一维"跨入"多维"的核心章节——从此开始,你不再是处理单个随机数,而是同时处理多个随机数以及它们之间的关系。这是考研大题的高频来源。
| 题型 | 考频 | 一句话说明 |
|---|---|---|
| 求联合分布中的未知参数 | ⭐⭐⭐ | 归一化条件,离散求和、连续二重积分 |
| 判断独立性 | ⭐⭐⭐ | 联合=边缘乘积,非矩形区域速判 |
| Z=X+Y的分布(卷积公式) | ⭐⭐⭐ | 考研大题,分清分布函数法和卷积法 |
| 求条件分布 | ⭐⭐ | 联合÷边缘,注意分母不为零 |
| 求边缘分布 | ⭐⭐ | 基础操作,注意积分上下限分段 |
| max/min的分布 | ⭐⭐ | max直接乘,min绕道补 |
| 二维均匀与二维正态 | ⭐⭐ | 性质概念题,正态独有ρ=0⇔独立 |
详细备考策略 + 每类题型的避坑要点见章末「🎯 考试导航」。
① 核心知识
1.1 二维随机变量
先想一个场景:只看身高,你能判断一个人健康吗?
去医院体检,医生从来不会只给你量一个身高就说结论。体检单上——身高、体重、血压、心率,一排放着。为什么?因为指标之间有"关系":高的人通常更重,血压高的人往往心率也快。如果你只记录一个数字,你永远发现不了这些关系。
再想股票:你买了两只股票 A 和 B。你最关心的问题恰恰是——如果 A 涨了,B 会跟着涨吗?还是一只涨另一只就跌?或者两者完全没关系?
难在哪?——一只股票是一个随机变量,用第 2 章的方法就能单独描述。但现在是两个随机变量一起出现,它们可能互相影响。把两个一维工具并排摆着,回答不了"它们之间有什么关系"。我们需要一个新工具,专门用来同时记录两个变量、并且能看出它们的"关系"。
这个新工具,就是本节的主角——二维随机变量。先记住一个直观的画面,再往下看。
生活比喻:以前你只记录全班同学的"数学成绩"——张三85分,李四92分,这是一维随机变量。现在你同时记录"数学成绩和英语成绩"——张三数学85、英语78,李四数学92、英语90。这时候你才能回答:"数学好的人英语是不是也好?"这就是二维随机变量要做的事。
再换一个比喻:天气预报。一维是"明天下不下雨"(是/否),二维是"明天温度和湿度"——温度30度但湿度很低(干热),和温度30度但湿度很高(闷热),体感完全不同。
正式定义:设 E 是一个随机试验,它的样本空间是 S。如果对于 S 中的每一个样本点 e,都有一对有序实数 (X(e), Y(e)) 与之对应,则称 (X, Y) 为二维随机变量(也叫二维随机向量)。
关键区别:(X,Y) 是一个整体,不是"两个一维随机变量的简单拼凑"。就像炒菜——番茄和鸡蛋单独吃各是各的味道,但"番茄炒蛋"是一个新菜,番茄的酸甜和鸡蛋的香滑互相影响,你不能说番茄炒蛋 = 番茄 + 鸡蛋。X 和 Y 往往有联系,这才是研究二维随机变量的意义。
与"两个独立的一维变量"的本质区别:
| 对比维度 | 两个独立的一维变量 | 一个二维随机变量 (X,Y) |
|---|---|---|
| 知道各自分布够吗? | 够,因为独立,联合=边缘相乘 | 不够,需要知道联合分布 |
| X和Y有联系吗? | 没有,互不影响 | 可能有(相关/不独立) |
| 能回答"X=某值时Y大概是多少"吗? | 不能 | 能(通过条件分布) |
| 研究重心 | 分别研究 X 和 Y | 研究 (X,Y) 这个整体 |
一句话:一维研究"一个事是什么样",二维研究"两个事在一起是什么样"——重点是"在一起"这三个字。
说完了二维随机变量的基本概念,接下来我们看怎么描述它——用什么工具来刻画"两个变量一起取值的概率"。
1.2 联合分布函数 F(x,y)
先想一个困境:两个变量一起,怎么"累计"?
第 2 章里,一维分布函数 $F_X(x) = P{X \leq x}$ 干的事是:给一个上限 x,它告诉你 X 不超过这个数的概率。一次只看一个变量。
现在麻烦来了——你有两个变量 X 和 Y。如果我想问"数学考了 85 分以内、同时英语考了 90 分以内"的学生占全班的比例,该怎么用一维工具回答?把两个一维分布函数摆在一起?不行——它们各自只会说"数学≤85 的概率"和"英语≤90 的概率",没人能回答"同时满足"这件事。
难在哪?——"同时"意味着两个条件叠在一起。一维的上限是一个数,二维的上限是一对数 (x, y)。你需要一个同时吃进两个上限的累计器:输入 X 的上限和 Y 的上限,输出"两个都不超过"的概率。
顺着这个思路,答案几乎是自己跳出来的——把一维的"一个上限"换成"两个上限":
$$F(x,y) = P{X \leq x,\ Y \leq y}$$
逗号就是"且":X ≤ x 且 Y ≤ y。这个二元函数,就是我们要认识的联合分布函数。先记住它,再看它长什么样。
生活比喻:想象你有一张地图,上面标记了全国所有城市的气温(X)和海拔(Y)。你想统计"气温不超过30度、且海拔不超过500米"的城市有多少。联合分布函数 F(x,y) 就是这样一个"累计概率计算器"——你输入 X 的上限和 Y 的上限,它告诉你"X 不超过这个数、同时 Y 不超过那个数"的概率是多少。
正式定义(必考定义):对于二维随机变量 (X,Y),称二元函数
$$F(x,y) = P{X \leq x,\ Y \leq y}, \quad -\infty < x < +\infty,\ -\infty < y < +\infty$$
为 (X,Y) 的联合分布函数。
- 逗号表示"且":X ≤ x 且 Y ≤ y
- x 和 y 是任意实数
- F(x,y) 的输出是概率,在 0 到 1 之间
如果把 (X,Y) 看作平面上随机落下的一个点,F(x,y) 就是这个点落在以 (x,y) 为右上顶点、向左下延伸到负无穷的无穷矩形内的概率。
① 生活场景
🗺️ 场景1:地图搜索餐厅——你在手机地图上,以"当前位置"为左下角,画一个矩形区域搜索餐厅。F(x,y) 就是"从地图最左下角开始,到你手指点到的右上角 (x,y) 为止"这个矩形里,包含的餐厅数量占全市餐厅总数的比例。每条性质对应一个生活常识:
- 矩形扩得越大,里面餐厅只会更多(单调不减)
- 如果矩形缩到不存在——比如右边界跑到最左边之外——里面的餐厅数为 0(F(-∞,·)=F(·,-∞)=0)
- 全市所有餐厅一定在地图上的某个有限区域内(F(+∞,+∞)=1)
- 刚好压在边界线上的餐厅,算"在里面"(右连续——踩线的人归"≤"这队)
🧾 场景2:报销单的双重条件——公司规定"发票金额不超过 x 元、且日期不晚于 y 号"才能报销。F(x,y) 就是同时满足两个条件的发票占比。如果你想单独统计"金额在 100 到 200 元之间、日期在 5 号到 15 号之间"的发票——不能直接查表,得用四个角的 F 值做加减法。
📐 场景3:剪窗花——你想从一张大红纸上剪出一个矩形窗花。你手里只有一把"从右下角剪到左下角"的大剪刀(F(x,y) 只能从右上角往左下延伸)。你怎么剪出中间那个矩形?先剪出整个右上大区域:F(x₂,y₂)——太大了;把左边多余竖条剪掉:-F(x₁,y₂);把下面多余横条剪掉:-F(x₂,y₁);左下角被剪了两次,补回去:+F(x₁,y₁)。这就是"四角加减法"。
大白话:F(x,y) 是一张"累计概率地图"。任何矩形区域的概率 = 右上角 - 左上角 - 右下角 + 左下角。记住"减两次加一次"的模式。
② 正式陈述
设二维随机变量 (X,Y) 的联合分布函数为 $F(x,y) = P{X \leq x,\ Y \leq y}$($x, y \in \mathbb{R}$)。F(x,y) 满足以下四条基本性质:
性质1:单调不减性
- 对任意固定的 y,若 $x_1 < x_2$,则 $F(x_1, y) \leq F(x_2, y)$
- 对任意固定的 x,若 $y_1 < y_2$,则 $F(x, y_1) \leq F(x, y_2)$
任一变量的上限提高,累计概率不会变小。
性质2:有界性与极限行为
- $0 \leq F(x,y) \leq 1$
- $F(+\infty, +\infty) = \lim\limits_{x\to+\infty, y\to+\infty} F(x,y) = 1$(覆盖整个平面)
- 对任意固定的 y:$F(-\infty, y) = \lim\limits_{x\to-\infty} F(x,y) = 0$
- 对任意固定的 x:$F(x, -\infty) = \lim\limits_{y\to-\infty} F(x,y) = 0$
- $F(-\infty, -\infty) = 0$
任一变量上限缩到负无穷 → 对应事件不可能发生 → 概率为 0。
性质3:右连续性
- F(x,y) 关于 x 右连续:$\lim\limits_{u \to x^+} F(u, y) = F(x, y)$
- F(x,y) 关于 y 右连续:$\lim\limits_{v \to y^+} F(x, v) = F(x, y)$
定义中的"≤"保证了边界上踩线的人算进去——这是分布函数的标准约定。
性质4:矩形概率公式(⭐ 二维特有,最重要)
对任意 $x_1 < x_2$,$y_1 < y_2$:
$$P{x_1 < X \leq x_2,\ y_1 < Y \leq y_2} = F(x_2,y_2) - F(x_1,y_2) - F(x_2,y_1) + F(x_1,y_1) \geq 0$$
💡 为什么是"二维特有"? 一维时落在区间 (a,b] 内 = F(b)-F(a),一次减法搞定。二维时矩形有四个角,需要"右上 - 左上 - 右下 + 左下"四次运算——本质是二维容斥原理。这四条性质共同保证了 F(x,y) 确实是一个合法的二维概率分布。
③ 完整推导
🧠 第1步:从定义出发——F(x,y) 到底在算什么
F(x,y) = P{X ≤ x, Y ≤ y} 的含义是:随机点 (X,Y) 落在以 (x,y) 为右上顶点、向左下无限延伸的矩形区域内的概率。
大白话:想象一张无限大的坐标纸,(X,Y) 是上面随机撒的一个点。F(x,y) 就是"这个点落在 (x,y) 左下方"的概率。x 和 y 越小,这个矩形越小,概率越小;x 和 y 越大,矩形越大,概率越大。
🧠 第2步:推导单调不减性
固定 y 不动,让 x 从 x₁ 增大到 x₂。此时矩形区域向右扩展了——新矩形完整包含了旧矩形。落在更大区域里的概率不可能比落在更小区域里的小,所以:
$$F(x_1, y) = P{X \leq x_1, Y \leq y} \leq P{X \leq x_2, Y \leq y} = F(x_2, y)$$
对 y 方向完全对称——固定 x,y 增大时矩形向上扩展,概率同样只增不减。
大白话:范围扩大了,包含的东西只会更多不会更少。就像搜索引擎放宽了搜索条件,搜出来的结果只会更多。
🧠 第3步:推导有界性与极限行为
- 0 ≤ F(x,y) ≤ 1:F(x,y) 是概率,概率天生就在 0 和 1 之间。
- F(-∞, y) = 0:当 x → -∞ 时,条件"X ≤ -∞"几乎是空的(没有任何实数比负无穷还小),概率趋近于 0。不管 y 取什么值都一样。
- F(x, -∞) = 0:完全对称的推导——Y ≤ -∞ 也是空的。
- F(-∞, -∞) = 0:两个条件都缩到负无穷,双重不可能,概率为 0。
- F(+∞, +∞) = 1:X 和 Y 都"不超过正无穷"——这覆盖了整个平面上的所有可能性,概率自然是 1(必然事件)。
大白话:概率的天花板是 1(整个平面),地板是 0(缩到不存在)。一头一尾,规定了 F(x,y) 的活动范围。
🧠 第4步:右连续性的推导逻辑
右连续性来自定义中的"≤"符号。对于固定的 y,当上限 x 从右侧逼近某值 a(即 x → a⁺)时,{X ≤ x} 的条件越来越松(x 比 a 稍大一点),但极限下回到 {X ≤ a}。因为"≤"保证了 a 本身一直算在里面,概率不会在边界处突然跳变。这就是右连续的含义——从右边逼近时,函数值连续。
大白话:踩线的人算"里面"——保证了从右边靠近边界时,结果不会突然跳。(从左边靠近可能会有跳跃——因为离散型随机变量取某个特定值可能有正概率,所以从左边逼近时"踩线的人突然进来了",产生跳跃。)
🧠 第5步(⭐ 核心):矩形概率公式的完整推导
这是全章最重要的推导之一。问题:随机点 (X,Y) 落在矩形 $(x_1, x_2] \times (y_1, y_2]$ 里的概率,怎么用 F 表示?
画图理解:F(x₂, y₂) 覆盖的是从 (-∞, -∞) 到 (x₂, y₂) 的整个大矩形。我们想要的是中间那一小块。
分步拆解:
- F(x₂, y₂):整个大区域(从最左下角到 (x₂, y₂))——包含了目标矩形和多余的边。
- 减去 F(x₁, y₂):把左边竖条(X ≤ x₁ 且 Y ≤ y₂)剪掉。
- 减去 F(x₂, y₁):把下面横条(X ≤ x₂ 且 Y ≤ y₁)剪掉。
- 加上 F(x₁, y₁):左下角的小块(X ≤ x₁ 且 Y ≤ y₁)被第 2 步和第 3 步各剪了一次——剪了两次!必须补回来。
最终结果:
$$P{x_1 < X \leq x_2,\ y_1 < Y \leq y_2} = F(x_2,y_2) - F(x_1,y_2) - F(x_2,y_1) + F(x_1,y_1) \geq 0$$
"≥ 0"是关键约束——概率不能是负数。如果某个 F 让这个式子算出负数,那它就不是合法的联合分布函数。
大白话:记住操作顺序——右上角、减左上角、减右下角、加左下角。口诀:"右上减左减右加左下"。本质上就是"大框里挖掉不想要的边框,被挖两次的角落补回去"。一维区间是两个端点(减一次),二维矩形是四个顶点(减两次加一次),三维立方体将是八个顶点(加减交替)。
✍️ 立刻练一道(刚学的"四角加减法",马上就用):设 F(x,y) 是某二维随机变量的联合分布函数,已知 $F(1,1)=0.6$,$F(0,1)=0.2$,$F(1,0)=0.3$,$F(0,0)=0.1$。求 $P{0 < X \leq 1,\ 0 < Y \leq 1}$。
点击看答案
按"右上 - 左上 - 右下 + 左下":
$$P{0 < X \leq 1,\ 0 < Y \leq 1} = F(1,1) - F(0,1) - F(1,0) + F(0,0) = 0.6 - 0.2 - 0.3 + 0.1 = 0.2$$
答案:0.2
④ 推导复盘
📝 用大白话把整个过程重新讲一遍:
四条性质的内在逻辑:
- 单调不减性是最自然的——累计概率嘛,上限放宽概率只增不减。
- 有界性规定了 F(x,y) 的"天花板"和"地板":天花板是 1(整个平面),地板是 0(退化到负无穷)。
- 右连续性是"≤"定义的直接后果——保证分布在跳跃点处行为一致。
- 矩形概率公式是四条里最实用的,也是从"定义"到"应用"的桥梁。
📝 减法公式的推导逻辑(最核心的部分):
你想算随机点 (X,Y) 落在矩形 $(x_1, x_2] \times (y_1, y_2]$ 里的概率。把 F(x₂,y₂) 覆盖的大区域拆成四块:
- 目标矩形:$(x_1, x_2] \times (y_1, y_2]$(想要的部分)
- 左边竖条:$(-\infty, x_1] \times (-\infty, y_2]$(多出来的,等于 F(x₁,y₂))
- 下面横条:$(-\infty, x_2] \times (-\infty, y_1]$(多出来的,等于 F(x₂,y₁))
- 左下角小块:$(-\infty, x_1] \times (-\infty, y_1]$(被减了两次,等于 F(x₁,y₁))
$$F(x_2,y_2) - F(x_1,y_2) - F(x_2,y_1) + F(x_1,y_1)$$
左条和横条都包含左下角,所以减去竖条再减横条时,左下角被减了两次——必须加回一次。这和一维的"区间概率 = 大减小区间"逻辑完全一致,只是维度升高导致顶点数从 2 变成 4。
📝 关键转折点:从一维到二维,"区间概率"从两个端点变成四个顶点。这是维度升高带来的复杂度——但原理不变(容斥),操作次数从 2 变成 4。今后学到三维,公式会有 $2^3=8$ 项(八个顶点交替加减)。掌握了这个模式,n 维也不怕。
📝 与后续内容的连接:F(x,y) 是整章的"地基"——边缘分布函数可以写成 $F_X(x) = F(x, +\infty)$、$F_Y(y) = F(+\infty, y)$;独立性用 F 判定就是 $F(x,y) = F_X(x) \cdot F_Y(y)$(下一节 1.7 的核心)。
⑤ 易错边界
⚠️ 错误1:把 F(x,y) 和 f(x,y) 搞混
- F(x,y) 是累计概率(定义中有 ≤),值在 0~1 之间。
- f(x,y) 是概率密度(连续型才有),本身可以大于 1!
- 两者的关系:f 是 F 的二阶混合偏导数(对 x 和 y 各求一次导),F 是 f 的二重积分。
大白话:F 是"累计存钱罐"里的总额(0~1之间),f 是"存钱速度"(可以很快,超过1)。一维时 F 求一次导得 f,二维要对 x 和 y 各求一次导(两次)才能从 F 回到 f。
⚠️ 错误2:矩形概率公式中不等式方向写反
公式里的矩形是 $(x_1, x_2] \times (y_1, y_2]$——左边界严格小于(<),右边界小于等于(≤)。这种写法保证:
- 边界点不会重复计算(左边界已在上一个矩形中算过)
- 所有点恰好被覆盖一次
如果题目给的是 $P{x_1 \leq X \leq x_2, y_1 \leq Y \leq y_2}$(两边都有等号),对于连续型差别不大(单点概率为 0),但离散型必须小心处理边界。
⚠️ 错误3:以为 F(x,y) = F_X(x) + F_Y(y)
这是最常见的误解!联合分布函数不是两个边缘分布函数的和(也不是乘积,除非独立)。两者的关系是:
- $F_X(x) = F(x, +\infty)$(把 Y 的上限推向无穷,压扁 Y)
- $F_Y(y) = F(+\infty, y)$(把 X 的上限推向无穷,压扁 X)
- 只有独立时才成立 $F(x,y) = F_X(x) \cdot F_Y(y)$
⚠️ 错误4:忘了矩形概率必须 ≥ 0
四条性质中,矩形概率非负(性质4)最容易被忽略。给定一个 F 让你判断它是不是合法的联合分布函数,只用前三条(单调、有界、右连续)不够——必须验证第四条:任意矩形内的概率都不能是负数。这是"看起来像 F"和"确实是 F"之间的唯一分界线。
⑥ 链条位置
从哪来:
- 根在 1.1 节 二维随机变量的定义——F(x,y) 是联合分布的最基础刻画工具。
- 本质是从一维分布函数 $F_X(x) = P{X \leq x}$ 自然推广而来的——从"一个上限"变成"两个上限",从"一条射线"变成"一个无穷矩形"。
到哪去:
- ↗ 1.3/1.4 节 离散/连续型:离散型用联合分布律 $p_{ij}$(F 的表格形式),连续型用联合密度 $f(x,y)$(F 的导数形式)。
- ↗ 1.5 节 边缘分布:$F_X(x) = F(x, +\infty)$,$F_Y(y) = F(+\infty, y)$——把不关心的变量的上限推向无穷大,就从联合分布函数得到了边缘分布函数。
- ↗ 1.7 节 独立性:独立 ⇔ $F(x,y) = F_X(x) \cdot F_Y(y)$——独立性判定最原始的形式就是联合分布函数 = 边缘分布函数的乘积。
- ↗ 1.8 节 分布函数法:求 Z = g(X,Y) 的分布,第一步永远是写 $F_Z(z) = P{g(X,Y) \leq z}$——分布函数思想贯穿全章。
在整条链中的位置:F(x,y) 是本章的"地基"。它定义了"联合分布"这个概念本身。所有后续工具——离散表格、连续密度、边缘、条件、独立性、卷积——都是在地基上盖的楼。学不会 F(x,y),后面每一节都没法真正理解。
接下来,我们要区分两种不同类型的二维随机变量——离散型和连续型。离散型只能取有限个或可列个值(像考试成绩),连续型可以在一个区间内连续取值(像身高体重)。两者的"语言"不同:离散型用表格(分布律),连续型用密度函数。
1.3 二维离散型随机变量与联合分布律
先想一个场景:两个变量都"一格一格"取值时,怎么记录?
上一节认识了联合分布函数 F(x,y)——它描述"两个变量都不超过某数"的累计概率。但有一种常见的变量,用"累计"来描述太绕了:它只能取几个离散的值。
比如一次考试,数学和英语都只记档次分(60、70、80、90、100)。全班 40 个人的"数学+英语"组合,一共也就 25 种可能。这时候你会怎么记录?最自然的办法就是画一张表——横行写数学档次,竖列写英语档次,格子里填"数学考 x 档、同时英语考 y 档"的人数占全班的比例。
难在哪?——表格格子那么多,光会画还不够。你得知道:这张表要满足什么规矩,才是一张"合法"的概率表? 一张不合法的表,算出来的答案全错。下面带着这个问题看。
生活比喻:你有一张全班成绩统计表——横行是数学成绩(60、70、80、90、100),竖列是英语成绩(60、70、80、90、100)。每个格子里填的是"数学考x分、同时英语考y分"的同学占全班的比例(概率)。这张表就是联合分布律。
再比如:你去餐厅点套餐——主食有米饭和面条两种,主菜有红烧肉、清蒸鱼、炒青菜三种。一共有 2×3=6 种组合。每种组合的概率不同,这就是一个二维离散分布。
正式定义:如果 (X,Y) 所有可能的取值是有限对或可列无限对,则称 (X,Y) 为二维离散型随机变量。
💡 "可列无限"是什么意思? 就是"虽然无限多,但可以一个一个编号(像自然数 1,2,3... 一样排成队)"。比如"第1次抛硬币到第n次才出现正面"——n 可以是 1,2,3,... 无限延伸,但每个 n 都能编号。和"不可列"的区别:实数轴上的所有点就不可列——你没法给每个实数一个编号,因为它们太"密"了。
设 (X,Y) 所有可能的取值为 $(x_i, y_j)$,$i, j = 1, 2, \dots$,则称
$$P{X = x_i,\ Y = y_j} = p_{ij}, \quad i,j = 1,2,\ldots$$
为 (X,Y) 的联合分布律(也叫联合概率分布)。
分布律通常用一张表格表示——表头是 Y 的取值,表侧是 X 的取值,格子里是 $p_{ij}$。
两条基本性质:
- 非负性:$p_{ij} \geq 0$——每个格子的概率不可能是负数。
- 归一性:$\displaystyle\sum_{i}\sum_{j} p_{ij} = 1$——所有格子的概率加起来必须是 1。
举例:假设 (X,Y) 的联合分布律如下(X取1,2;Y取1,2,3):
| X\Y | Y=1 | Y=2 | Y=3 |
|---|---|---|---|
| X=1 | 0.1 | 0.2 | 0.1 |
| X=2 | 0.15 | 0.25 | 0.2 |
验证:0.1+0.2+0.1+0.15+0.25+0.2 = 1.0 ✓。所有格子非负 ✓。
✍️ 立刻练一道(刚悟出的"归一性"规矩,马上就用):设 (X,Y) 的联合分布律如下(X取1,2;Y取1,2),表格里有一个未知常数 b:
| X\Y | Y=1 | Y=2 |
|---|---|---|
| X=1 | 0.15 | b |
| X=2 | 0.35 | 0.25 |
求 b 的值。
点击看答案
所有格子的概率加起来必须等于 1(归一性):
$$0.15 + b + 0.35 + 0.25 = 1 \quad \Rightarrow \quad b = 0.25$$
验证:所有格子和 = 0.15+0.25+0.35+0.25 = 1.0 ✓,且每个格子都在 0 到 1 之间 ✓。
答案:b = 0.25
🛑 提前试试:看完这张表,你有没有好奇——单看 X=1 的总概率是多少?单看 Y=2 的总概率呢?试试自己算一下(提示:把同一行的格子加起来,再把同一列的格子加起来),然后翻到 1.5 节看你算得对不对。
1.4 二维连续型随机变量与联合密度
先想一个困境:变量能"连续取值"时,表格还能用吗?
上一节的成绩档次表,靠的是"数学和英语都只有几档"。可如果你研究的是身高和体重——身高可以是 170.1cm、170.11cm、170.111cm……任何一个数字都可能是。把每个"可能的身高"当成一列?列不完,因为数字太多了。
难在哪?——任意一个具体点的概率都是 0(比如"身高恰好 170.11cm"的人,一个都没有)。离散型的"表格"彻底失灵了。但换个角度:虽然单点是 0,某些区域上"人多"、另一些区域"人少"——高而壮的偏多,矮而瘦的偏少。我们要找的就是一个能表达"哪里密集、哪里稀疏"的工具。
这个工具就是概率密度:它不直接回答"某点的概率",而是告诉你"某处有多浓"。把密度在一个区域上"积累"起来(积分),才能得到概率。下面带着"怎么描述一片区域上概率有多少"这个问题看。
与离散型不同,连续型随机变量可以取某个区间内的任意值(比如身高可以是170.1cm、170.11cm……)。这时不能用"每个点的概率"来描述了——因为任意一个具体点的概率都是0。我们需要换一种工具:概率密度。
生活比喻:你把一把沙子撒在桌面上——有的地方厚(沙子多),有的地方薄(沙子少)。沙子的厚度分布就是一个二维概率密度。厚的地方,随机抓一把沙子,抓到那里的概率大;薄的地方,概率小。但注意,密度本身不是概率!概率需要在一个区域上"积累"(积分)才能得到。
正式定义:如果存在一个非负可积函数 f(x,y),使得对于平面上任意区域 D,都有
$$P{(X,Y) \in D} = \iint_D f(x,y)\ dxdy$$
则称 (X,Y) 为二维连续型随机变量,f(x,y) 称为联合概率密度函数。
两条基本性质:
- 非负性:$f(x,y) \geq 0$
- 归一性:$\displaystyle\int_{-\infty}^{+\infty}\int_{-\infty}^{+\infty} f(x,y)\ dxdy = 1$
另外,在 f(x,y) 的连续点处,有
$$\frac{\partial^2 F(x,y)}{\partial x \partial y} = f(x,y)$$
也就是说,密度是分布函数的二阶混合偏导数——分布函数"求两次导"就回到密度。
💡 为什么是两次导数? 就像一维时分布函数求一次导等于密度($F'(x)=f(x)$),二维因为有两个变量,需要各求一次导(总共两次)。你可以理解成:先沿 x 方向求导剥一层皮,再沿 y 方向求导剥一层皮,两层皮剥完就回到原始的密度函数。
✍️ 立刻练一道(刚悟出的"归一性 = 全平面二重积分 = 1",马上就用):设 (X,Y) 的联合概率密度为:
$$f(x,y) = \begin{cases} k, & 0<x<1,; 0<y<1 \ 0, & \text{其他} \end{cases}$$
求常数 k 的值。
点击看答案
由归一化条件,全平面二重积分等于 1。f 只在正方形 $0<x<1,;0<y<1$ 内非零(等于常数 k),所以:
$$\iint f(x,y),dxdy = k \times (\text{正方形面积}) = k \times 1 = k = 1$$
答案:k = 1
📝 配套练习
题2 ⭐ | 连续型,求联合密度中的未知参数
对应模板:题型一(归一化条件)
设 (X,Y) 的联合概率密度为:
$$f(x,y) = \begin{cases} cxy, & 0<x<1,; 0<y<1 \ 0, & \text{其他} \end{cases}$$
求常数 c 的值。
点击看答案
归一化条件:$\iint f(x,y),dxdy = 1$
$$\int_0^1\int_0^1 cxy,dx,dy = c\int_0^1 y\left[\frac{x^2}{2}\right]_0^1 dy = \frac{c}{2}\int_0^1 y,dy = \frac{c}{2}\cdot\frac{1}{2} = \frac{c}{4} = 1$$
所以 $c=4$。
答案:$c=4$
了解了联合分布函数和联合密度之后,一个自然的问题来了:如果我只关心 X 本身(不管 Y 取什么值),该怎么算?这就是"边缘分布"。
1.5 边缘分布(⭐⭐ 核心定理 · 六段式)
先想一个困境:手里只有"两人合照",怎么单独洗出"单人照"?
你手上有全班的"数学+英语"联合成绩表(上一节那张表)。校长跑过来问:"数学成绩的分布是什么?"——他只关心数学,完全不关心英语。
难在哪?——你手里的表格,每个格子都是"数学考 x 且英语考 y"的联合概率。可现在你只想要"数学考 85 分"的总概率,而这个总概率分散在一整行里(数学85英语60、数学85英语70、数学85英语80……)。你没法从表格里直接指着一格说"这就是答案"。
怎么办?顺着直觉想——"数学考 85 分"包括了好多互不相容的情况,把这一行全部加起来,不就得到"数学 85 分"的总概率了吗?这个"把不要的变量消掉(求和),留下要看的变量"的操作,就是本节的主角——边缘分布。
这一节我们要解决一个关键问题:手里有两个人一起的"全家福照片"(联合分布),怎么单独把一个人的"单人照"(边缘分布)洗出来?方法分两种——离散型用"求和",连续型用"积分"。但两种方法的思路完全一样:把那个你不想看的人"压扁""消掉",剩下的就是你要看的人。
① 生活场景
🏫 场景1:成绩表——你是班主任,手里有全班的"数学+英语"联合成绩表。每行是数学分,每列是英语分,格子里是"数学考x分且英语考y分"的人数比例。现在校长只问:"数学成绩的分布是什么?"你不关心英语考多少——你只需要把每一行所有格子加起来,写在表格最右边。这就是数学的"边缘分布"。
📸 场景2:合影裁剪——你和一个朋友拍了一张合影(联合分布)。现在你只想洗一张你自己的单人照(边缘分布)。你怎么办?把朋友那半边照片裁掉(求和/积分掉另一个变量),剩下的就是你的单人照。但注意——裁掉之后,照片只剩你一个人,你再也看不出"你们俩当时的站位关系"(关联信息丢失了)。
🌫️ 场景3:压扁雾团——把联合密度想象成一团雾飘在平面上。你想知道"只看X轴方向,雾的浓度分布是怎样的"。你就从Y轴正上方使劲往下压,把所有雾都压到X轴上——Y方向的信息被"压扁"了,X轴上留下的厚度分布就是X的边缘密度。
大白话:边缘分布就是"把联合分布中另一个变量消掉(求和或积分),只看一个变量"的操作结果。
② 正式陈述
离散型:设二维离散型随机变量 $(X,Y)$ 的联合分布律为
$$p_{ij} = P{X = x_i,\ Y = y_j}, \quad i,j = 1,2,\ldots$$
则 X 的边缘分布律 为:
$$p_{i\cdot} = P{X = x_i} = \sum_{j} p_{ij}$$
Y 的边缘分布律 为:
$$p_{\cdot j} = P{Y = y_j} = \sum_{i} p_{ij}$$
其中小圆点 $\cdot$ 的位置表示"在这个维度上求和"——$p_{i\cdot}$ 行号固定,对所有列求和;$p_{\cdot j}$ 列号固定,对所有行求和。
连续型:设 $(X,Y)$ 的联合概率密度为 $f(x,y)$,则:
X 的边缘概率密度为:
$$f_X(x) = \int_{-\infty}^{+\infty} f(x,y)\ dy$$
Y 的边缘概率密度为:
$$f_Y(y) = \int_{-\infty}^{+\infty} f(x,y)\ dx$$
③ 完整推导
离散型推导(从联合分布律到边缘分布律)
🧠 第1步:从概率的基本事实出发
已知 $(X,Y)$ 所有可能的取值为 $(x_i, y_j)$,每个组合的概率为 $p_{ij}$。现在我想要"X 取某个固定值 $x_i$ 的概率"——不管 Y 取什么值都算。
在生活里:"数学考85分"这件事包含了好几种情况:数学85英语60、数学85英语70、数学85英语80……把所有这些情况的概率加在一起,才是"数学85分"的总概率。
大白话:X 取某个值的概率 = 在这个 X 值下,所有可能 Y 值对应的概率之和。
🧠 第2步:写出概率表达式
$$P{X = x_i} = P{X = x_i,\ Y = y_1} + P{X = x_i,\ Y = y_2} + \cdots$$
因为 $P{X = x_i}$ 就是事件 ${X = x_i}$ 的概率。而事件 ${X = x_i}$ 可以拆成互不相容的几个子事件:
- ${X = x_i, Y = y_1}$
- ${X = x_i, Y = y_2}$
- $\cdots$
这些子事件互不相容(Y 只能取一个值),所以它们的概率直接相加。
大白话:一个事件如果能拆成"要么这样、要么那样"的互斥子事件,总概率就是各子事件概率之和。这个拆法就是数学里"全概率公式"的思想。
🧠 第3步:用符号 $p_{ij}$ 表示
子事件 ${X = x_i, Y = y_j}$ 的概率就是 $p_{ij}$。所以:
$$P{X = x_i} = p_{i1} + p_{i2} + p_{i3} + \cdots = \sum_{j} p_{ij}$$
记作 $p_{i\cdot}$,下标的小圆点表示"对 j 求和"。
大白话:把表格第 i 行所有格子从左到右加起来,得到的就是 X 取第 i 个值的概率。为什么叫"边缘"?因为这些合计写在表格最右边、最下边的边缘空白处。
🧠 第4步:对称地得到 Y 的边缘分布
完全一样的思路,把表格第 j 列从上到下加起来:
$$P{Y = y_j} = \sum_{i} p_{ij} = p_{\cdot j}$$
大白话:行求和得 X 的边缘,列求和得 Y 的边缘。记住规则:想消掉哪个变量,就在哪个方向求和。
连续型推导(从联合密度到边缘密度)
🧠 第1步:理解"连续型不能逐点求和"
连续型随机变量取单个点的概率为 0,不能像离散型那样一格一格加。我们需要在"无穷小的宽度"上做积分。
大白话:离散型是一颗一颗红豆绿豆数着加,连续型是一锅粥——得用积分这个"超级精细的勺子"来舀。
🧠 第2步:固定 x,考虑 X 落在 $[x, x+dx]$ 这个无穷小区间里
$$P{x < X \leq x + dx} \approx f_X(x) \cdot dx$$
这个概率也可以从联合密度算出来:X 落在 $[x, x+dx]$ 之间时,Y 可以在整个实数范围 $(-\infty, +\infty)$ 内任意取值。所以:
$$P{x < X \leq x + dx} = \left[\int_{-\infty}^{+\infty} f(x,y)\ dy\right] \cdot dx$$
大白话:在 x 处取一根竖着的无穷细的"条条"(宽度 dx),把这条条上所有高度(y 从 -∞ 到 +∞)的密度加起来,就是 X 在这根条条上的概率。
🧠 第3步:对比两式,得到边缘密度
$$f_X(x) \cdot dx = \left[\int_{-\infty}^{+\infty} f(x,y)\ dy\right] \cdot dx$$
两边消去 $dx$,得到:
$$f_X(x) = \int_{-\infty}^{+\infty} f(x,y)\ dy$$
大白话:边缘密度 $f_X(x)$ 就是对联合密度沿 y 方向"压扁"(积分)。积分把 y 消掉了,结果只跟 x 有关。
🧠 第4步:Y 的边缘密度完全对称
$$f_Y(y) = \int_{-\infty}^{+\infty} f(x,y)\ dx$$
大白话:对谁积分,就是消掉谁。想消掉 Y → 对 y 积分得 $f_X(x)$;想消掉 X → 对 x 积分得 $f_Y(y)$。
实例演示
离散型:用前面的联合分布律表——
| X\Y | Y=1 | Y=2 | Y=3 | 行合计 = X的边缘 |
|---|---|---|---|---|
| X=1 | 0.1 | 0.2 | 0.1 | 0.4 |
| X=2 | 0.15 | 0.25 | 0.2 | 0.6 |
| 列合计 = Y的边缘 | 0.25 | 0.45 | 0.3 | 1.0 |
X 的边缘分布:P{X=1}=0.4,P{X=2}=0.6。
Y 的边缘分布:P{Y=1}=0.25,P{Y=2}=0.45,P{Y=3}=0.3。
连续型:设 $f(x,y) = 8xy$($0 < x < y < 1$):
$$f_X(x) = \int_x^1 8xy\ dy = 8x \cdot \frac{y^2}{2}\Big|_x^1 = 4x(1-x^2), \quad 0 < x < 1$$
$$f_Y(y) = \int_0^y 8xy\ dx = 8y \cdot \frac{x^2}{2}\Big|_0^y = 4y^3, \quad 0 < y < 1$$
✍️ 立刻练一道(刚悟出的"消掉谁就对谁求和",马上就用):设 (X,Y) 的联合分布律如下(X取1,2;Y取0,1),求 X 的边缘分布律。
| X\Y | Y=0 | Y=1 |
|---|---|---|
| X=1 | 0.2 | 0.3 |
| X=2 | 0.4 | 0.1 |
点击看答案
求 X 的边缘 = 对 Y 求和(逐行相加):
- $P(X=1) = 0.2 + 0.3 = 0.5$
- $P(X=2) = 0.4 + 0.1 = 0.5$
验证:$0.5 + 0.5 = 1$ ✓
答案:$P(X=1)=0.5$,$P(X=2)=0.5$
📝 配套练习
题1 ⭐ | 离散型联合分布,求未知参数和边缘分布(综合:题型一+二)
对应模板:题型一(联合分布律的基本操作)
已知二维离散型随机变量 (X,Y) 的联合分布律如下表:
| X\Y | 1 | 2 |
|---|---|---|
| 1 | 0.1 | 0.2 |
| 2 | a | 0.3 |
(1)求参数 a 的值;
(2)求 X 的边缘分布律(P(X=1)和P(X=2));
(3)求 Y 的边缘分布律(P(Y=1)和P(Y=2))。
点击看答案
(1)求 a
所有概率之和等于1:$0.1+0.2+a+0.3=1$,所以 $a=0.4$。
(2)X的边缘分布
$P(X=1)=0.1+0.2=0.3$,$P(X=2)=0.4+0.3=0.7$
(3)Y的边缘分布
$P(Y=1)=0.1+0.4=0.5$,$P(Y=2)=0.2+0.3=0.5$
答案:(1)$a=0.4$(2)$P(X=1)=0.3, P(X=2)=0.7$(3)$P(Y=1)=0.5, P(Y=2)=0.5$
题3 ⭐ | 连续型,求边缘密度(注意三角形区域)
对应模板:题型二(边缘密度计算)
设 (X,Y) 的联合密度为:
$$f(x,y) = \begin{cases} 2, & 0<x<y<1 \ 0, & \text{其他} \end{cases}$$
求 $f_X(x)$ 和 $f_Y(y)$。
点击看答案
区域是三角形 $0<x<y<1$——画图很重要!
求 $f_X(x)$:固定 x($0<x<1$),y 从 x 到 1:
$$f_X(x) = \int_x^1 2,dy = 2(1-x), \quad 0<x<1$$
求 $f_Y(y)$:固定 y($0<y<1$),x 从 0 到 y:
$$f_Y(y) = \int_0^y 2,dx = 2y, \quad 0<y<1$$
答案:
$$f_X(x)=\begin{cases}2(1-x),&0<x<1\0,&\text{其他}\end{cases},\quad f_Y(y)=\begin{cases}2y,&0<y<1\0,&\text{其他}\end{cases}$$
④ 推导复盘
📝 用大白话把整个过程重新讲一遍:
- 你手里有一张"两个人一起"的概率分布图(联合分布)。离散型是一张表格,连续型是一个曲面。
- 你现在只想看其中一个变量(比如 X)单独长什么样。
- 离散型的做法:把表格的一行从头到尾加起来,写到右边——加起来的结果就是 X 取这个值的概率。Y 的话,就一列一列加。
- 连续型的做法:想象把联合密度的"曲面"从 Y 方向压扁到 X 轴上。怎么"压扁"?对 y 做积分——积分是一种"无穷细的求和",等价于把 Y 方向上每一条无穷细的竖条加总。
- 得到的结果(边缘分布)是一个完全合法的概率分布——所有概率加起来(或积起来)等于 1,可以单独用来回答"X 取某值的概率是多少"这类问题。
📝 整个推导的关键转折点就一个:"X 取某值"这件事 = "X 取该值,且 Y 取任意值"。把后面这句拆成互斥子事件,概率直接相加/积分。这就是边缘化的本质。
⑤ 易错边界
⚠️ 错误1:把"对谁求和/积分"搞反了
- ❌ 求 X 的边缘,却在 X 方向求和 —— 错!消掉谁就对谁操作。
- ✅ 求 X 的边缘 = 对 Y 求和/积分(消掉 Y,留下 X)。
记忆口诀:想消掉谁,就对谁求和/积分。
⚠️ 错误2:连续型的积分上下限照抄 $(-\infty, +\infty)$
公式里写的是 $\int_{-\infty}^{+\infty}$,但实际操作时,$f(x,y)$ 只在某个有限区域内非零。你必须根据联合密度的实际定义区域来定上下限。
例:$f(x,y) = 8xy$($0 < x < y < 1$),求 $f_X(x)$ 时的 y 积分上下限是 $\int_x^1$,不是 $\int_{-\infty}^{+\infty}$。搞错上下限 → 全题报废。
⚠️ 错误3:忘了标注边缘密度的取值范围
连续型求完边缘密度后,必须在结果后面注明 x 或 y 的有效范围。比如 $f_X(x) = 4x(1-x^2),\ 0 < x < 1$。只写表达式不写范围 → 扣分。
⚠️ 错误4(最致命的理解误区):认为边缘分布能"还原"联合分布
这是整个多维随机变量章节最重要的一个认知——边缘分布一般不能反推联合分布。
为什么?因为边缘分布只告诉你 X 单独的分布、Y 单独的分布,但完全丢掉了 X 和 Y 之间的关联信息。相同的两个边缘分布可以搭配出无数种不同的联合分布——就像身高和体重都一样的两个人,他们的"高矮胖瘦组合"可以完全不同(一个高而瘦,另一个矮而壮但截然的组合)。
💡 直观例子:两个班的"数学+英语"联合分布表不同(一个班数学好的人英语也好,另一个班数学好的英语反而差——关联方向相反),但分别看数学的边缘分布完全一样、英语的边缘分布也完全一样。光看边缘分不出这两个班。就像两个人长相完全不同,但身高体重各自一样——只看身高体重分不出谁是谁,必须看"组合"(联合分布)。
唯一例外:当 X 和 Y 独立时,联合 = 两个边缘相乘。只有这个时候,你才能从边缘反推联合——因为独立意味着"两个人完全各过各的",没有关联信息需要保存。
⚠️ 错误5:边缘化了但不知道概率是否还是 1
离散型:行合计那一列的总和 = 所有格子总和 = 1。列合计那一行的总和 = 所有格子总和 = 1。验证这两个加起来都等于 1,边缘分布才合法。
连续型:$\int f_X(x)\ dx = \iint f(x,y)\ dxdy = 1$。求完 $f_X(x)$ 后对 x 积分,结果必须等于 1。
⑥ 链条位置
从哪来:
- 依赖 联合分布(1.3 节离散 / 1.4 节连续)——没有联合分布就没有边缘分布。
- 本质上是对联合分布做"降维"操作——从二维降到一维。
到哪去:
- ↗ 条件分布(1.6 节):条件分布的分母就是边缘分布。$f_{X|Y}(x|y) = f(x,y)/f_Y(y)$。边缘没算对,条件分布全错。
- ↗ 独立性判断(1.7 节):判断独立需要先算出两个边缘分布,再验证"联合 = 边缘乘积"。
- ↗ 卷积公式(1.8 节):卷积公式里要用到 $f_X(x)$ 和 $f_Y(y)$,这两个都是边缘密度。
- ↗ 第4章数字特征:求协方差 $Cov(X,Y) = E(XY) - E(X)E(Y)$ 时,$E(X)$ 和 $E(Y)$ 都是从各自的边缘分布算出来的。
在整条链中的位置:联合分布 → 边缘分布 → 条件分布 → 独立性 → 卷积/数字特征。边缘分布是"从联合走向一切"的第一个分叉口。学不会边缘分布,后面的条件分布、独立性判断、卷积公式全都卡住。
🛑 迷你自测:翻回 1.3 节那张联合分布律表(X=1,2; Y=1,2,3),30 秒内算出 X 的边缘分布和 Y 的边缘分布。算完再继续往下读。
1.6 条件分布(⭐⭐ 核心定理 · 六段式)
先想一个困境:知道了一个人,怎么重新"看"另一个人?
上一节的边缘分布,回答的是"不管 Y 是什么,X 单独长什么样"。现在问题升级:我知道了 Y 的具体值,X 的分布会变成什么样?
比如全校 1000 个学生,你有"数学+英语"的联合成绩表。现在你只关心"英语考了 90 分"的那一小撮人(可能就 50 个)——在这 50 个人的小圈子里,数学成绩的分布长什么样子?跟全校 1000 人的数学分布一样吗?大概率不一样——因为英语能考 90 的人,数学往往也不差。
难在哪?——你不能直接拿联合表里的格子用:那 50 个人只占表格的一小部分,把他们单独拿出来,他们的概率加起来不是 1。你需要一个操作:把这个"缩小后的圈子"重新缩放到概率总和为 1。
怎么缩放?想想第 1 章的条件概率 $P(A|B) = P(AB)/P(B)$——"已知 B 发生,A 的概率"= "A 和 B 同时发生"除以"B 发生"。这里一模一样:已知 Y=y,X 的分布 = "X 取某值且 Y=y" 除以 "Y=y" 的概率。这个"已知一部分信息后,重新计算的分布",就是本节的主角——条件分布。
这一节要解决的核心问题:手里有两个人一起的"全家福"(联合分布),你知道了其中一个人的具体值(比如Y=0.5),怎么把另一个人的分布重新算一遍?条件分布告诉你——把联合分布除以条件那个人的边缘概率,就得到了"缩小范围后"的新分布。
① 生活场景
🛒 场景1:记账本——你这个月总花销是 3000 块,你翻开账单想看"各项开销各占多少比例"。在"总花销=3000"这个条件之下,吃饭、交通、娱乐各自的分布是什么样的?条件分布就是帮你根据"已知总花销=3000"这个条件,重新分配各项开销的概率。
🏫 场景2:考试筛选——全校有 1000 个学生,你有"数学+英语"的联合成绩分布。现在你只关心"英语考了 90 分"的那一小撮人(可能就 50 个人),在这 50 个人的小圈子里,数学成绩的分布长什么样子?条件分布就是在这个缩小了的群体里重新算分布。
🧑⚕️ 场景3:体检数据——联合分布是身高+体重。已知一个人身高 180cm,他的体重最可能在什么范围?条件分布就是"身高=180cm"这条竖线上,体重取各种值的相对可能性。
大白话:条件分布 = 在"已知一个变量取某值"的限制下,重新计算另一个变量的分布。核心操作:从联合分布中"切一刀",然后把这个切面的面积缩放到 1,让它变成一个合法的概率分布。
② 正式陈述
离散型:设 $(X,Y)$ 的联合分布律为 $p_{ij} = P{X=x_i, Y=y_j}$,边缘分布为 $p_{i\cdot}$ 和 $p_{\cdot j}$。
给定 $Y=y_j$ 时,X 的条件分布律:
$$P{X = x_i \mid Y = y_j} = \frac{p_{ij}}{p_{\cdot j}}, \quad p_{\cdot j} > 0$$给定 $X=x_i$ 时,Y 的条件分布律:
$$P{Y = y_j \mid X = x_i} = \frac{p_{ij}}{p_{i\cdot}}, \quad p_{i\cdot} > 0$$
连续型:设 $(X,Y)$ 的联合密度为 $f(x,y)$,边缘密度为 $f_X(x)$ 和 $f_Y(y)$。
给定 $Y=y$ 时,X 的条件概率密度:
$$f_{X|Y}(x|y) = \frac{f(x,y)}{f_Y(y)}, \quad f_Y(y) > 0$$给定 $X=x$ 时,Y 的条件概率密度:
$$f_{Y|X}(y|x) = \frac{f(x,y)}{f_X(x)}, \quad f_X(x) > 0$$
③ 完整推导
离散型推导(从条件概率定义到条件分布)
🧠 第1步:回忆条件概率的基本定义
在初等概率论中,条件概率定义为:
$$P(A \mid B) = \frac{P(A \cap B)}{P(B)}, \quad P(B) > 0$$
这是所有条件分布推导的总源头——分子是"两件事同时发生"的概率,分母是"条件这件事本身"的概率。
大白话:条件概率的公式就是"交集除以条件"。比如"已知下雨,我迟到的概率" = "既下雨我又迟到的概率" ÷ "下雨的概率"。条件分布只是把这个思想从两个普通事件推广到两个随机变量。
🧠 第2步:把事件 B 换成 ${Y = y_j}$,事件 A 换成 ${X = x_i}$
$$P{X = x_i \mid Y = y_j} = \frac{P{X = x_i,\ Y = y_j}}{P{Y = y_j}}$$
分子 $P{X = x_i,\ Y = y_j}$ 就是联合分布律 $p_{ij}$(联合分布表的格子值)。
分母 $P{Y = y_j}$ 就是 Y 的边缘分布律 $p_{\cdot j}$(把第 j 列所有行加起来)。
大白话:把两个事件直接代入初等概率论的公式。分子是表格里"第i行第j列"那个格子;分母是第j列的列合计(Y的边缘分布)。
🧠 第3步:得到条件分布公式
$$P{X = x_i \mid Y = y_j} = \frac{p_{ij}}{p_{\cdot j}}$$
这就是条件分布律。给定 $Y = y_j$(固定第 j 列),把这一列的每个格子都除以这一列的合计 $p_{\cdot j}$——相当于把这一列"拉伸"到总和为 1。
大白话:给定"Y取某个值"的条件后,把联合分布表里对应那一列的所有格子重新缩放,让它们加起来等于 1。缩放的方法就是每个格子除以该列的合计。
🧠 第4步:验证条件分布是合法分布
$$\sum_i P{X = x_i \mid Y = y_j} = \sum_i \frac{p_{ij}}{p_{\cdot j}} = \frac{1}{p_{\cdot j}} \sum_i p_{ij} = \frac{p_{\cdot j}}{p_{\cdot j}} = 1$$
所有条件概率非负(因为 $p_{ij} \geq 0$,$p_{\cdot j} > 0$),加总之和为 1。满足概率分布的两条基本性质 ✓
大白话:把一列的所有格子除以该列合计后,新格子加起来一定等于 1。就像把一张饼按原比例缩小——原来所有格子的比例关系不变,但总和缩放到 1。
连续型推导(从离散型类比到密度之商)
🧠 第1步:连续型不能直接写 $P{Y=y}$ 做分母
因为连续型 $P{Y=y} = 0$(单个点的概率为 0),不能用离散型的"除以概率"来定义。但我们可以在 Y 的无穷小区间 $[y, y+dy]$ 上做近似,然后取极限。
大白话:离散型是"除以一个大于0的数字",连续型那个数字是 0,除以 0 没意义。所以我们退一步——不除以概率,而是除以密度。
🧠 第2步:在无穷小区间上应用条件概率定义
考虑 $P{x < X \leq x+dx \mid y < Y \leq y+dy}$:
$$P{x < X \leq x+dx \mid y < Y \leq y+dy} = \frac{P{x < X \leq x+dx,\ y < Y \leq y+dy}}{P{y < Y \leq y+dy}}$$
分子 $\approx f(x,y) \cdot dx \cdot dy$(联合密度 × 小矩形面积)
分母 $\approx f_Y(y) \cdot dy$(边缘密度 × 小区间宽度)
大白话:分子是落在小矩形 $[x, x+dx] \times [y, y+dy]$ 里的概率,分母是 Y 落在 $[y, y+dy]$ 里的概率(不管 X 取什么值)。
🧠 第3步:约去公共因子
$$\frac{f(x,y) \cdot dx \cdot dy}{f_Y(y) \cdot dy} = \frac{f(x,y)}{f_Y(y)} \cdot dx$$
这个结果应该等于条件密度 $f_{X|Y}(x|y)$ 乘以 $dx$(条件密度 × X 的小区间宽度)。所以:
$$f_{X|Y}(x|y) \cdot dx = \frac{f(x,y)}{f_Y(y)} \cdot dx$$
两边消去 $dx$:
$$f_{X|Y}(x|y) = \frac{f(x,y)}{f_Y(y)}$$
大白话:关键一步——$dy$ 在分子分母中约掉了!这说明虽然单点概率是 0,但密度的"比例关系"仍然有意义。条件密度 = 联合密度 ÷ 边缘密度,和离散型的"格子÷列合计"完全对应。
🧠 第4步:几何解释
联合密度 $f(x,y)$ 是一座山的表面。在 $Y=y$ 处垂直于 Y 轴切一刀,切出来的剖面曲线是 $f(x, y)$(把 y 当常数看)。这个剖面的"形状"就是条件密度的形状——但面积通常不是 1。除以 $f_Y(y)$(该处 Y 方向的总高度)等于把剖面缩放到面积刚好为 1。
大白话:切一刀出来的剖面形状是对的,但"大小"不对(面积不是1)。除以边缘密度就是做一次缩放——形状不变,面积变成 1,这才算合法概率分布。
实例演示
离散型:用联合分布律表(Y=2 条件下):
| X\Y | Y=1 | Y=2 | Y=3 |
|---|---|---|---|
| X=1 | 0.1 | 0.2 | 0.1 |
| X=2 | 0.15 | 0.25 | 0.2 |
$p_{\cdot 2} = 0.2 + 0.25 = 0.45$
$$P(X=1 \mid Y=2) = \frac{0.2}{0.45} \approx 0.444, \quad P(X=2 \mid Y=2) = \frac{0.25}{0.45} \approx 0.556$$
验证:$0.444 + 0.556 = 1$ ✓
连续型:$f(x,y) = 8xy$($0 < x < y < 1$),$f_Y(y) = 4y^3$($0 < y < 1$):
$$f_{X|Y}(x|y) = \frac{8xy}{4y^3} = \frac{2x}{y^2}, \quad 0 < x < y$$
给定 $Y=0.5$ 时:$f_{X|Y}(x|0.5) = \frac{2x}{0.25} = 8x$($0 < x < 0.5$)。验证:$\int_0^{0.5} 8x\ dx = 4x^2\big|_0^{0.5} = 1$ ✓
✍️ 立刻练一道(刚悟出的"格子 ÷ 列合计",马上就用):设 (X,Y) 的联合分布律如下(X取0,1;Y取0,1),求给定 $Y=1$ 时 X 的条件分布律。
| X\Y | Y=0 | Y=1 |
|---|---|---|
| X=0 | 0.1 | 0.2 |
| X=1 | 0.3 | 0.4 |
点击看答案
分母 = $P(Y=1) = 0.2 + 0.4 = 0.6$(Y 的边缘 = 第 2 列合计)。
$$P(X=0 \mid Y=1) = \frac{0.2}{0.6} = \frac{1}{3}, \quad P(X=1 \mid Y=1) = \frac{0.4}{0.6} = \frac{2}{3}$$
验证:$\frac{1}{3} + \frac{2}{3} = 1$ ✓
答案:$P(X=0|Y=1)=1/3$,$P(X=1|Y=1)=2/3$
📝 配套练习
题6 ⭐ | 条件分布(离散型)
对应模板:题型四(条件分布律)
已知 (X,Y) 的联合分布律为:
| X\Y | 1 | 2 |
|---|---|---|
| 1 | 0.2 | 0.1 |
| 2 | 0.3 | 0.4 |
求给定 Y=1 的条件下,X 的条件分布律。
点击看答案
$P(Y=1)=0.2+0.3=0.5$
$$P(X=1|Y=1)=\frac{0.2}{0.5}=0.4,\quad P(X=2|Y=1)=\frac{0.3}{0.5}=0.6$$
验证:$0.4+0.6=1$ ✓
答案:$P(X=1|Y=1)=0.4$,$P(X=2|Y=1)=0.6$
题7 ⭐⭐ | 条件密度(连续型)
对应模板:题型四(条件密度计算)
设 (X,Y) 的联合密度为 $f(x,y)=x+y$($0<x<1, 0<y<1$),求 $y=0.5$ 时 X 的条件密度 $f_{X|Y}(x|0.5)$。
点击看答案
第1步:求 $f_Y(y)$。
当 $0<y<1$:$f_Y(y)=\int_0^1 (x+y),dx = \frac{1}{2}+y$
第2步:$f_Y(0.5)=\frac{1}{2}+0.5=1$
第3步:$f_{X|Y}(x|0.5)=\frac{f(x,0.5)}{f_Y(0.5)} = \frac{x+0.5}{1} = x+0.5$($0<x<1$)
答案:
$$f_{X|Y}(x|0.5)=\begin{cases} x+0.5, & 0<x<1 \ 0, & \text{其他} \end{cases}$$
④ 推导复盘
📝 用大白话把整个过程重新讲一遍:
- 起点是初等概率论里最基础的条件概率公式:$P(A|B) = P(AB)/P(B)$。分子是"两件事都发生",分母是"条件那件事本身"。
- 离散型直接套用:分子 $p_{ij}$(联合表中的格子),分母 $p_{\cdot j}$(Y的边缘 = 第j列合计)。结果就是"给定Y取某值后,X取各种值的概率"。
- 连续型的难点在于 $P{Y=y}=0$,不能直接用"除以概率"。技巧是:在无穷小区间 $[y, y+dy]$ 上写条件概率,分子分母中的 $dy$ 约掉,极限下得到"密度相除"的形式。
- 几何理解:联合密度山上沿 Y=y 切一刀,剖面形状是对的,但面积不是 1。除以 $f_Y(y)$ 就是把剖面缩放到面积=1,变成合法的概率分布。
📝 整个推导的关键转折点:连续型中 $dy$ 约掉了——这解释了为什么单点概率为 0 的情况下,条件密度仍然有意义。密度的比值比单个概率的比值更稳定。
⑤ 易错边界
⚠️ 错误1(最致命):分母为零
$P{X = x_i \mid Y = y_j}$ 只有在 $P{Y = y_j} > 0$ 时才有定义。如果 $P{Y = y_j} = 0$,说明这个 $y_j$ 根本不可能出现——你不能以一个不可能发生的事件为前提去讨论别的变量。
连续型同理:要求 $f_Y(y) > 0$。在 $f_Y(y) = 0$ 的点上,条件密度没有定义。
🐱 大白话:你想调查"养猫的人每月花多少钱买猫粮",但你去的小区根本没人养猫(分母=0)——你连调查对象都找不到,怎么算比例?条件分布的分母就是"养猫的人数",这个人不能是 0。
⚠️ 错误2:搞反分子和分母
- ❌ 把"竖线前面那个变量的边缘分布"当分母——错了
- ✅ 竖线后面的条件变量(已知的那个)的边缘分布做分母
$$f_{X|Y}(x|y) = \frac{f(x,y)}{f_Y(y)}$$
竖线后面是 Y → 分母是 $f_Y(y)$(Y 的边缘)。记忆口诀:谁在竖线后面,谁就进分母。
⚠️ 错误3:连续型忘记标注 x 的取值范围
给定 $Y=y$ 后,x 的取值范围会受到 y 的约束。比如联合密度定义在 $0 < x < y < 1$,给定 $Y=0.5$ 后 x 的范围是 $(0, 0.5)$,不是 $(0, 1)$。
⚠️ 错误4:把条件密度里的 y 也当成变量
条件密度 $f_{X|Y}(x|y)$ 中,y 是已知常数(条件已经给定了),只有 x 是变量。验证"条件密度积分为 1"时,是对 x 积分,y 当常数带着走:
$$\int f_{X|Y}(x|y)\ dx = 1 \quad (\text{对 } x \text{ 积分,} y \text{ 固定})$$
⚠️ 错误5:混淆"条件分布"和"边缘分布"
- 边缘分布:不管另一个变量是什么,直接看分布 → 联合分布"压扁"
- 条件分布:已知另一个变量取某具体值,重新看分布 → 联合分布"切片后缩放"
边缘分布是一个全局视角(全校学生的身高分布);条件分布是一个局部视角(只选了体重>80kg的学生,再看他们的身高分布)。
⚠️ 错误6:连续型中 $P{Y=y}=0$ 不能直接做分母——但要区分"概率"和"密度"
虽然 $P{Y=y} = 0$(单点概率为零),但只要密度 $f_Y(y) > 0$,条件密度 $f(x,y)/f_Y(y)$ 仍然有定义。因为密度不等于概率——密度在某点可以大于 0,即使该点概率为 0。这就像一根针尖的面积是 0,但针尖所在的位置可以有一个确定的"密度读数"。
⑥ 链条位置
从哪来:
- 根在初等概率论的 条件概率公式 $P(A|B) = P(AB)/P(B)$。
- 直接依赖 联合分布(1.3/1.4 节)和 边缘分布(1.5 节)——条件分布 = 联合 ÷ 边缘。边缘没算对,条件分布全错。
到哪去:
- ↗ 独立性判断(1.7 节):当 X 和 Y 独立时,条件分布 = 边缘分布(条件不带来任何额外信息)。这是判断独立性的另一种等价方式。
- ↗ 全概率公式(第1章基础 + 本章扩展):$P(X=x_i) = \sum_j P(X=x_i|Y=y_j) \cdot P(Y=y_j)$。边缘分布可以写成"条件分布 × 条件概率"的加权平均。
- ↗ 贝叶斯公式(本章1.6延伸):$P(Y=y_j|X=x_i) = \frac{P(X=x_i|Y=y_j) \cdot P(Y=y_j)}{P(X=x_i)}$。条件分布翻转"竖线前后的变量"。
- ↗ 第4章数字特征:条件期望 $E(X|Y)$ 是条件分布的自然延伸——不只看条件分布的形状,还要算它的"平均值"(第4章"条件期望(补充)"小节会正式教)。
在整条链中的位置:联合分布 → 边缘分布 → 条件分布。条件分布是"联合/边缘"的商,也是连接联合分布和独立性、贝叶斯公式的关键枢纽。学会了条件分布,"已知部分信息后更新判断"的整个推理链条就打通了。
1.7 随机变量的独立性(⭐⭐⭐ 核心定理 · 六段式)
先想一个场景:朋友的硬币,会影响你的硬币吗?
你和朋友各抛一枚硬币。你抛出正面,朋友抛出什么?——你心里清楚,他的结果跟你半点关系都没有。你不会因为朋友抛了正面,就觉得自己更该出反面。这就是直觉里的"独立":知道一个结果,对判断另一个结果没有半点帮助。
反过来想一个不独立的例子:知道一个人月收入 2 万,你会猜他月消费大概几千到一万多;知道月收入 3000,你会猜消费一两千。收入的信息改变了你对消费的判断——这两个变量就不独立。
难在哪?——"独立不独立"这么直觉的东西,考试里要拿数字判定,光凭感觉不行。你得把"知道一个不影响另一个"翻译成能计算的公式。怎么翻译?两个角度,最后会汇聚到同一个结论:
- 角度一(条件):知道 Y 的值,X 的分布不该变 → 条件分布 = 边缘分布;
- 角度二(联合):X 和 Y 一起发生的概率,应该等于各自概率的乘积。
这就是本节的主角——独立性判定。
这一节要解决的核心问题:你手里有两个随机变量 X 和 Y,怎么判断它们是"各过各的、互不影响"还是"一个人变了另一个人也会跟着变"?数学上叫"独立性判定"——全章最基础也最容易在细节上翻车的概念。
① 生活场景
🪙 场景1:你和朋友各抛一枚硬币——你的结果是正面还是反面,跟你朋友的结果有半毛钱关系吗?没有。你的硬币不会"感应"到你朋友抛了正面就偏要出反面。这就是独立:知道朋友的结果,改变不了你对自己那枚硬币的判断。
💰 场景2:月收入和月消费——知道一个人月收入 2 万,你会猜他月消费大概几千到一万多;知道一个人月收入 3000,你会猜他月消费一两千。收入的信息"改变了"你对消费的判断——这就是不独立。
🎲 场景3:一颗骰子掷两次——第一次出几点和第二次出几点有关系吗?除非骰子被做了手脚,两次完全独立。第一次掷出 6,第二次掷出 6 的概率仍然是 1/6,不会"因为刚才出过 6 了所以这次不容易出 6"——那是赌徒谬误。
大白话:独立 = 知道一个变量的值,对猜另一个变量的值没有半点帮助。不独立 = 知道一个,另一个的"可能性分布"就变了。
② 正式陈述
设二维随机变量 (X,Y) 的联合分布函数为 $F(x,y)$,边缘分布函数分别为 $F_X(x)$ 和 $F_Y(y)$。
定义(分布函数形式):若对任意实数 x, y,都有
$$F(x,y) = F_X(x) \cdot F_Y(y)$$
则称 X 与 Y 相互独立。
离散型的等价判定:X 与 Y 独立 $\iff$ 对所有 i, j:
$$p_{ij} = p_{i\cdot} \times p_{\cdot j}$$
即联合分布律的每个格子 = 对应行合计 x 对应列合计。
连续型的等价判定:X 与 Y 独立 $\iff$ 在联合密度的连续点处(几乎处处):
$$f(x,y) = f_X(x) \cdot f_Y(y)$$
即联合密度 = 两个边缘密度的乘积。
💡 数学上更精确的说法是"对几乎所有 (x,y)"——意思是除了个别不影响积分的点(如一条宽度为零的线)之外,其他地方都要相等。这保证了密度函数在"概率意义上"的乘积关系成立。
从条件分布角度看独立:当 X 与 Y 独立时,条件分布退化为边缘分布:
$$f_{X|Y}(x|y) = \frac{f(x,y)}{f_Y(y)} = \frac{f_X(x) \cdot f_Y(y)}{f_Y(y)} = f_X(x)$$
条件没有带来任何额外信息——知道 Y=y 对 X 的判断毫无帮助。
③ 完整推导
🧠 第1步:从直觉到公式——"独立"到底在说什么
"独立"在生活中的意思是"互不影响"。翻译成概率语言:不管 Y 取什么值,X 取某个值的概率都不变。也就是条件概率 = 无条件概率:
$$P(X = x_i \mid Y = y_j) = P(X = x_i)$$
大白话:Y 取什么值,对 X 取 x_i 的概率没有任何影响——就像你朋友抛硬币的结果不影响你的硬币正面朝上的概率。
🧠 第2步:把条件概率展开,得到联合 = 边缘乘积
将条件概率公式 $P(X=x_i \mid Y=y_j) = \frac{P(X=x_i, Y=y_j)}{P(Y=y_j)}$ 代入第1步:
$$\frac{P(X=x_i, Y=y_j)}{P(Y=y_j)} = P(X=x_i)$$
两边同乘 $P(Y=y_j)$:
$$P(X=x_i, Y=y_j) = P(X=x_i) \cdot P(Y=y_j)$$
用符号表示:$p_{ij} = p_{i\cdot} \times p_{\cdot j}$
大白话:"两个人一起发生的概率"等于"第一个人发生的概率"乘以"第二个人发生的概率"。这是从条件概率定义一步推出来的,没有额外假设。
🧠 第3步:"所有"两个字不能省——独立性是"一票否决制"
关键来了——独立要求对每一对 (i,j) 都成立,不是"大多数成立就行"。
大白话:你检查 100 个格子,99 个满足"联合 = 边缘乘积",只有 1 个不满足——那就不独立!就像考试 100 道题,99 道对了 1 道错了,也不能说全对。独立性判定是"一票否决制"——找到一个反例就推翻。
🧠 第4步:连续型的平行推导
连续型不能逐点写条件概率(单点概率为 0),但密度的乘积关系可以平行推导:
$$f_{X|Y}(x|y) \stackrel{\text{独立}}{=} f_X(x)$$
而 $f_{X|Y}(x|y) = \frac{f(x,y)}{f_Y(y)}$,代入得:
$$\frac{f(x,y)}{f_Y(y)} = f_X(x) \quad \Rightarrow \quad f(x,y) = f_X(x) \cdot f_Y(y)$$
大白话:离散型是"格子 = 行合计 x 列合计";连续型是"联合密度 = X边缘密度 x Y边缘密度"。同一个思想换了件衣服——离散用求和,连续用积分,"联合 = 边缘乘积"这个核心等式不变。
🧠 第5步:速判法——看定义区域的形状
一个极其实用的技巧:如果联合密度 $f(x,y)$ 的非零区域不是矩形(不能写成 $a < x < b,\ c < y < d$ 的形式),则 X 和 Y 一定不独立。
为什么?独立性意味着 X 的取值范围和 Y 的取值无关。如果区域是三角形(如 $0 < x < y < 1$),知道 x=0.8 就意味着 y>0.8——x 的信息限制了 y 的范围,不独立。如果区域是圆形($x^2+y^2 \leq 1$),知道 x=0.9 就把 y 限制在很窄的范围——不独立。
大白话:不用算,先看区域形状!非矩形(三角形、圆形等)→ 直接判不独立。只有矩形区域才可能独立——然后再检查函数能不能拆成 g(x)·h(y)。
🧠 第6步:独立性的"可分离变量"判定法(连续型进阶技巧)
如果联合密度可以写成"只含 x 的函数" x "只含 y 的函数":
$$f(x,y) = g(x) \cdot h(y)$$
且定义区域是矩形($a<x<b,\ c<y<d$),则 X 和 Y 独立。此时 $f_X(x)$ 正比于 $g(x)$,$f_Y(y)$ 正比于 $h(y)$。
但注意:即使 f(x,y) 能写成 g(x)·h(y),如果定义区域不是矩形——仍然不独立!区域形状是第一关,函数形式是第二关。
大白话:两关都要过——第一关看形状(是不是矩形),第二关看函数(能不能拆成 x 的部分乘 y 的部分)。第一关不通过,直接淘汰。
✍️ 立刻练一道(刚悟出的"逐格检查"+"一票否决",马上就用):设 (X,Y) 的联合分布律如下(X取0,1;Y取0,1),判断 X 和 Y 是否独立。
| X\Y | Y=0 | Y=1 |
|---|---|---|
| X=0 | 0.25 | 0.25 |
| X=1 | 0.25 | 0.25 |
点击看答案
第1步:求边缘分布。
- $P(X=0)=0.5$,$P(X=1)=0.5$;$P(Y=0)=0.5$,$P(Y=1)=0.5$
第2步:逐格检查。看格子 (0,0):联合概率 = 0.25,边缘乘积 = 0.5×0.5 = 0.25,相等。再看格子 (0,1):0.25 = 0.5×0.5,也相等。(1,0)、(1,1) 同样相等。
第3步:全部格子都满足"联合 = 边缘乘积",独立。
答案:X 与 Y 独立。
📝 配套练习
题4 ⭐ | 离散型判断独立性(不独立的情况)
对应模板:题型三(随机变量的独立性判断)
已知 (X,Y) 的联合分布律为:
| X\Y | 1 | 2 |
|---|---|---|
| 1 | 0.2 | 0.1 |
| 2 | 0.3 | 0.4 |
判断 X 和 Y 是否独立。
点击看答案
第1步:求边缘分布。
$P(X=1)=0.3$,$P(X=2)=0.7$;$P(Y=1)=0.5$,$P(Y=2)=0.5$
第2步:逐一检查。检查 (1,1) 格:
$P(X=1,Y=1)=0.2$,$P(X=1)\times P(Y=1)=0.3\times0.5=0.15$
$0.2\neq0.15$,不相等!
所以 X 和 Y 不独立。
题5 ⭐⭐ | 连续型判断独立性(独立的情况)
对应模板:题型三(独立性判断)
设 (X,Y) 的联合密度为 $f(x,y)=4xy$($0<x<1, 0<y<1$),判断 X 与 Y 是否独立。
点击看答案
求 $f_X(x)$:$f_X(x)=\int_0^1 4xy,dy=2x$($0<x<1$)
求 $f_Y(y)$:$f_Y(y)=\int_0^1 4xy,dx=2y$($0<y<1$)
$f_X(x)·f_Y(y)=2x·2y=4xy=f(x,y)$ ✓
答案:X 与 Y 独立。
④ 推导复盘
📝 用大白话把整个过程重新讲一遍:
- "独立"的直觉是"互不影响"。翻译成概率语言:条件概率 = 无条件概率。
- 利用条件概率的定义 $P(A|B) = P(AB)/P(B)$,把直觉翻译成公式:$p_{ij} / p_{\cdot j} = p_{i\cdot}$,等价于 $p_{ij} = p_{i\cdot} \times p_{\cdot j}$。
- 这就是著名的"联合 = 边缘乘积"。离散型是格子乘积,连续型是密度乘积——同一个公式,两件衣服。
- "所有"是独立性判定中最容易被忽视的词——必须逐点验证,一票否决。
- 连续型超实用速判法:先看区域形状——非矩形直接判不独立。只有矩形才需要往下算。
- 独立时,条件分布退化为边缘分布——条件不带来任何新信息。这是从条件分布理解独立性的另一视角。
📝 整个推导的关键转折点:从"条件概率 = 无条件概率"到"联合 = 边缘乘积"——这是独立性的两种等价表述。前者是"直觉版"(知道 Y 不影响对 X 的判断),后者是"操作版"(用来做计算验证)。等价性来自条件概率定义本身。
⑤ 易错边界
⚠️ 错误1(最致命):只检查一个格子就说"独立"
独立性要求所有 (i,j) 对都满足联合 = 边缘乘积。检查一个格子不够——就像不能说"我去过一次北京没雾霾,所以北京从来没雾霾"。
- ✅ 正确:逐格检查,或利用"非矩形速判法"快速排除。
- ❌ 错误:只检查 (1,1) 格发现相等就说独立——其他格子可能不相等。
⚠️ 错误2(离散高频陷阱):边缘分布算错,独立性判断全错
边缘分布是独立性判定的基础。行合计或列合计算错 → 乘积算错 → 独立性结论全错。做独立性判定之前,先验证两个边缘分布加起来都等于 1——这是基本安全检查。
⚠️ 错误3(连续高频陷阱):看函数能分离就判独立,不管区域形状
$f(x,y) = 8xy$ 在 $0 < x < y < 1$ 上——函数可以写成 $8x \cdot y$(能分离),但区域是三角形!X 和 Y 不独立!因为 $0 < x < y$ 意味着 x 被 y 限制了。
判定独立性的正确顺序:①先看区域(非矩形 → 直接不独立)→ ②再看函数(矩形 + 可分离 → 独立)。两步缺一不可。
⚠️ 错误4:混淆"独立"和"不相关"
这是两个不同层级的概念——独立比不相关更强:
- 独立 ⇒ 不相关(独立一定没有线性关系)
- 不相关 ⇏ 独立(没有线性关系,但可能有曲线关系)
📌 先记住这个结论:协方差和相关系数要到第 4 章才正式定义,这里先把方向记住——独立 ⇒ 不相关,反过来不一定。第 4 章学了严格定义后,再回来看这个结论为什么成立。
例:X 对称分布在 [-1,1] 上,Y = X²。X 和 Y 不相关(协方差为 0,因为没有线性趋势),但显然不独立——知道 X=0.9,就能确定 Y=0.81。这种"曲线关系"协方差捕捉不到。
唯一例外:二维正态分布中,独立 ⇔ ρ=0(不相关)。这是考研高频考点。
⑥ 链条位置
从哪来:
- 根在初等概率论的 条件概率 $P(A|B) = P(AB)/P(B)$——独立性定义就是"条件概率 = 无条件概率"。
- 直接依赖 联合分布(1.3/1.4 节)和 边缘分布(1.5 节)——判定独立要先算边缘再对比联合。
- 与 条件分布(1.6 节)深度绑定——独立时条件分布退化回边缘分布,这是从条件分布角度理解独立的关键。
到哪去:
- ↗ 卷积公式(1.8 节):卷积公式的前提就是 X 和 Y 独立!不独立就不能用卷积,必须回到分布函数法。独立性判断是做 Z=X+Y 题的第一步。
- ↗ max/min 分布(1.8 节):$F_M(z) = [F(z)]^n$ 和 $F_N(z) = 1-[1-F(z)]^n$ 都依赖独立性假设。
- ↗ 第4章 数字特征:独立时协方差 Cov(X,Y)=0,方差可加 $Var(X+Y)=Var(X)+Var(Y)$。不独立时要加上协方差项。
- ↗ 第5章 大数定律:独立同分布(i.i.d.)是整个极限理论的基石——"独立"让样本之间互不干扰,"同分布"让它们有共同的规律。
- ↗ 第6章 数理统计:随机样本的定义就是"独立同分布"。如果样本之间不独立(如时间序列数据),整个统计推断框架都要换。
在整条链中的位置:联合分布 → 边缘分布 → 条件分布 → 独立性。独立性是本章的知识分水岭——之前的内容(边缘、条件)是"描述性"的(告诉你两个变量之间是什么关系),独立性开始是"判断性"的(给关系定性:有关还是无关)。判定了独立性,卷积公式和 max/min 公式才能决定走捷径还是绕路。
🛑 迷你自测:翻回 1.3 节那张联合分布律表(X=1,2; Y=1,2,3),检查一下——X 和 Y 独立吗?(提示:挑一个格子,算 P(X=1, Y=1) 是否等于 P(X=1) × P(Y=1)。)
1.8 两个随机变量函数的分布
Z = X+Y 的分布——卷积公式(⭐⭐⭐ 核心定理 · 六段式)
这一节要解决的核心问题:已知 X 和 Y 各自的分布,它们加在一起 Z = X+Y 的分布长什么样?这是全章考得最多的大题题型——两个随机因素叠加后的结果。
先想一个困境:两颗骰子加在一起,点数分布长什么样?
掷两颗公平的骰子,X = 第一颗的点数,Y = 第二颗的点数,独立。每颗骰子单独看,点数是均匀的(1 到 6 各 1/6)。问:总点数 Z = X+Y 的分布长什么样?
难在哪?——"总点数是 7"不是只有一种凑法。可以是 (1,6)、(2,5)、(3,4)、(4,3)、(5,2)、(6,1)——所有"和为 7"的组合都得算上,一个都不能漏。而且不同总点数的"凑法个数"不一样:总点数 7 有 6 种凑法,总点数 2 只有 (1,1) 一种。所以 Z 的分布绝不是均匀的。
试着算——每次组合的概率都是 $1/6 \times 1/6 = 1/36$(独立),那么:
$$P(Z=7) = P(X=1,Y=6) + P(X=2,Y=5) + \cdots + P(X=6,Y=1) = 6 \times \frac{1}{36} = \frac{1}{6}$$
🧠 这一步在想什么:"和为 z"每一对 (x, z-x) 都贡献一份概率,把它们全加起来。这个"把所有凑出 z 的组合全部累加"的运算,就是本节的主角——卷积。离散型是求和,连续型就是积分。下面先给出连续型的完整推导(为什么是那个积分),再回来看离散型实例。
① 生活场景
🚌 场景1:通勤时间——你每天上班,先走到公交站等车。等车时间 X 服从指数分布(有时运气好马上来,有时等很久),坐车时间 Y 服从均匀分布(20到40分钟之间,路况差不多)。你真正关心的是:从出门到公司的总时间 Z = X+Y 有多大的概率超过1小时? 两个独立随机因素叠加,总时间的分布不是简单的"两个分布拼在一起"——你需要一种叫"卷积"的运算。
🎲 场景2:两次抽奖——公司年会抽奖,上午抽一次(X元红包),下午再抽一次(Y元红包),两次独立。你关心今天总共拿到多少钱 Z = X+Y。Z=100 元的可能性来自哪些组合?可能是上午50+下午50,也可能是上午30+下午70,还可能是上午80+下午20……所有和为100的组合都要考虑。
📦 场景3:包裹总重量——你在两个不同的网店各买了一件东西,第一件重量 X、第二件重量 Y,快递按总重量 Z = X+Y 计费。X 和 Y 各自有分布,总重量 Z 超过首重的概率是多少?
大白话:两个独立随机变量相加——你要把所有"加起来等于 z"的可能路径的概率(或密度)全部累加起来。这就是卷积的直觉。
② 正式陈述
问题:已知二维随机变量 (X,Y) 的联合分布,求 Z = X+Y 的分布。
离散型:Z = X+Y 的分布律为:
$$P{Z = z_k} = \sum_{i} P{X = x_i,\ Y = z_k - x_i}$$
当 X 和 Y 独立时,简化为卷积形式:
$$P{Z = z_k} = \sum_{i} P{X = x_i} \cdot P{Y = z_k - x_i}$$
连续型:先用分布函数法求 $F_Z(z)$,再求导得 $f_Z(z)$:
$$F_Z(z) = P{X+Y \leq z} = \iint_{x+y \leq z} f(x,y)\ dxdy$$
$$f_Z(z) = F'_Z(z)$$
当 X 和 Y 独立时,得到卷积公式:
$$f_Z(z) = \int_{-\infty}^{+\infty} f_X(x) \cdot f_Y(z-x)\ dx$$
或对称形式:
$$f_Z(z) = \int_{-\infty}^{+\infty} f_X(z-y) \cdot f_Y(y)\ dy$$
③ 完整推导
🧠 第1步:用分布函数法——从"Z ≤ z"这个事件出发
要求 Z = X+Y 的分布,最直接的想法是:先算 Z 不超过某个值 z 的概率(也就是分布函数),然后求导得到密度函数。
$$F_Z(z) = P{Z \leq z} = P{X+Y \leq z}$$
大白话:求 Z 的分布,先不直接求它的密度——因为密度不好直接表达。曲线救国:先求"Z 不超过 z"的概率(分布函数),然后对它求导就是密度。这就像想知道车速的变化(加速度),先去记录位置的变化(位移),然后求两次导。
🧠 第2步:把概率写成二重积分
"X+Y ≤ z"这个条件在平面上对应什么区域?在 XY 平面上画一条直线 $x+y = z$(斜率为 -1 的直线,截距为 z)。"X+Y ≤ z"就是这条直线左下方的整个半平面。随机点 (X,Y) 落在半平面内的概率,就是在那个半平面上对联合密度做二重积分:
$$F_Z(z) = \iint_{x+y \leq z} f(x,y)\ dxdy$$
大白话:平面上画一条斜线 x+y=z,这条线的左下方就是"X+Y不超过z"的区域。在这个区域上对联合密度积分,得到的就是分布函数 F_Z(z)。想象联合密度是一座山——F_Z(z) 就是山在斜线左下方的体积。
🧠 第3步:把二重积分拆成迭积分
固定 x,让 y 从 -∞ 变到 z-x(因为 y 必须满足 y ≤ z-x)。这样把半平面上的二重积分拆成"先对 y、再对 x"的迭积分:
$$F_Z(z) = \int_{-\infty}^{+\infty} \left[ \int_{-\infty}^{z-x} f(x,y)\ dy \right] dx$$
大白话:把半平面切成无数条竖线——每条竖线固定一个 x,y 从最底下一直积到斜线所在的高度(z-x)。然后把所有竖线的结果沿 x 方向加总。这就像把一座山切成竖着的薄片,每片算面积,再把所有片的面积加起来。
🧠 第4步:对 z 求导,从分布函数得到密度函数
密度 = 分布函数的导数:$f_Z(z) = \frac{d}{dz} F_Z(z)$。对上面的迭积分求导,里面那层积分的上限是 z-x,用变上限积分求导公式:
$$f_Z(z) = \frac{d}{dz} \int_{-\infty}^{+\infty} \left[ \int_{-\infty}^{z-x} f(x,y)\ dy \right] dx = \int_{-\infty}^{+\infty} f(x, z-x)\ dx$$
大白话:变上限积分对上限变量求导——把上限代入被积函数即可。里面那层积分上限是 z-x,对 z 求导就是把 y 换成 z-x,得到 f(x, z-x)。外面那层对 x 的积分保持不变。
这已经是一个可以用的公式:$f_Z(z) = \int_{-\infty}^{+\infty} f(x, z-x)\ dx$。注意!这里用的是联合密度 f(x,y),不是边缘密度——意味着这个公式即使 X 和 Y 不独立也能用(只要你知道联合密度)。
🧠 第5步:X 和 Y 独立时,得到卷积公式
如果 X 和 Y 独立,联合密度等于边缘密度的乘积:$f(x, z-x) = f_X(x) \cdot f_Y(z-x)$。代入上面的公式:
$$f_Z(z) = \int_{-\infty}^{+\infty} f_X(x) \cdot f_Y(z-x)\ dx$$
这就是大名鼎鼎的卷积公式。
大白话:独立是"魔法开关"——一旦独立,联合密度就可以拆成 f_X(x) × f_Y(y)。把 y 换成 z-x,就得到了只依赖两个边缘密度的卷积公式。不独立的时候,你只能用第4步那个带联合密度的版本(也就是老老实实回到分布函数法做二重积分)。这就是为什么判断"X和Y是否独立"是做Z=X+Y题的第一步!
实例演示
离散型——两个骰子的点数之和:
掷两颗公平的骰子,X = 第一颗的点数,Y = 第二颗的点数,独立。求 Z = X+Y 的分布。
X 和 Y 的分布律都是:$P{X=k} = 1/6$(k = 1,2,...,6)。
Z=7 的组合:(1,6),(2,5),(3,4),(4,3),(5,2),(6,1),一共 6 种组合。
每种组合的概率 = 1/6 × 1/6 = 1/36。
$$P{Z=7} = 6 \times \frac{1}{36} = \frac{1}{6}$$
Z=2 只有一种组合 (1,1):$P = 1/36$。
Z=12 只有一种组合 (6,6):$P = 1/36$。
最终 Z 的分布呈"金字塔"形——中间(Z=7)概率最大,两头(Z=2,12)概率最小。
连续型——两个独立 U(0,1) 的和(见题型五例题,结果呈三角分布)。
✍️ 立刻练一道(刚悟出的"把所有和为 z 的组合都算上",马上就用):掷两颗公平的骰子,X、Y 分别为两骰子点数,独立。求 $P(Z=8)$,其中 Z = X+Y。
点击看答案
总点数为 8 的组合:(2,6)、(3,5)、(4,4)、(5,3)、(6,2),一共 5 种。
每种组合的概率 = 1/6 × 1/6 = 1/36,所以:
$$P(Z=8) = 5 \times \frac{1}{36} = \frac{5}{36}$$
答案:5/36
📝 配套练习
题8 ⭐⭐ | 卷积——两个 U(0,1) 的和(经典三角形分布)
对应模板:题型五(卷积公式)
设 X 和 Y 独立同服从 [0,1] 上的均匀分布,求 Z = X+Y 的密度函数。
点击看答案
用卷积公式。$f_X(x)=1$($0<x<1$),$f_Y(y)=1$($0<y<1$)。
$$f_Z(z)=\int_{-\infty}^{+\infty}f_X(x)f_Y(z-x),dx$$
被积函数非零:$0<x<1$ 且 $0<z-x<1$,即 $\max(0,z-1)<x<\min(1,z)$。
$0<z\leq1$:$f_Z(z)=\int_0^z 1,dx = z$
$1<z<2$:$f_Z(z)=\int_{z-1}^1 1,dx = 2-z$
答案:
$$f_Z(z)=\begin{cases} z, & 0<z\leq1 \ 2-z, & 1<z<2 \ 0, & \text{其他} \end{cases}$$
呈三角形分布。
题9 ⭐⭐⭐ | 正态分布可加性
对应模板:题型五(卷积公式+正态性质)
设 XN(0,1),YN(0,1),且 X 与 Y 独立。求 Z = X+Y 的分布。
点击看答案
方法一(快捷):独立正态的和仍是正态,均值相加、方差相加。
$Z\sim N(0+0, 1+1) = N(0,2)$
$$f_Z(z)=\frac{1}{\sqrt{4\pi}}e^{-\frac{z^2}{4}}$$
方法二(卷积验证):用卷积公式配平方积分,得到相同结果。
答案:$Z\sim N(0,2)$
④ 推导复盘
📝 用大白话把整个过程重新讲一遍:
- 你要算两个随机变量加起来(Z = X+Y)的分布。直接求密度不好办,于是先绕一步——求"Z 不超过某个值 z"的概率(分布函数法)。
- "X+Y 不超过 z"在平面上就是斜线 x+y=z 左下方的半平面。在这个半平面上对联合密度做二重积分,就得到了分布函数 F_Z(z)。
- 把这个二重积分拆成迭积分(先对 y 从 -∞ 积到 z-x,再对 x 从 -∞ 积到 +∞),然后对 z 求导——利用变上限积分求导法则,得到 $f_Z(z) = \int f(x, z-x)\ dx$。这个公式用联合密度,即使不独立也能用。
- 如果 X 和 Y 独立,联合密度 = 边缘密度乘积,代入得到卷积公式:$f_Z(z) = \int f_X(x) f_Y(z-x)\ dx$。
- 卷积的本质就是:把所有"和为 z"的 (x, z-x) 组合的密度全部加总起来。x 取不同值时,y = z-x 取对应值,每一对 (x, z-x) 贡献 $f_X(x) \cdot f_Y(z-x)$,积分就是把这些无穷多对的贡献全部累加。
📝 整个推导的关键转折点有两个:(1) 分布函数法——"先求概率再求导"这个迂回策略绕开了直接求密度的困难;(2) 独立条件的引入——把联合密度拆成边缘密度乘积,计算量从二重积分降为一重积分。
⑤ 易错边界
⚠️ 错误1(最致命):不独立就用卷积公式
卷积公式 $f_Z(z) = \int f_X(x) f_Y(z-x)\ dx$ 的前提是 X 和 Y 相互独立!如果题目没有明确说"独立"两个字,或者你判断出来它们不独立——必须回到分布函数法(二重积分)。
- ✅ 独立时:卷积公式,一重积分,快。
- ✅ 不独立时:分布函数法 $F_Z(z) = \iint_{x+y \leq z} f(x,y)\ dxdy$,二重积分,稳。
拿到 Z=X+Y 的题目,第一眼看什么?——题目有没有说"X和Y独立"!这个判断决定了你走哪条路。
⚠️ 错误2(极其高频):积分上下限照抄 $(-\infty, +\infty)$
卷积公式里积分号上写的是 $-\infty$ 到 $+\infty$,但实际操作时必须根据 $f_X$ 和 $f_Y$ 的实际非零区域来确定上下限。
具体做法:被积函数 $f_X(x) \cdot f_Y(z-x)$ 非零,当且仅当 x 在 f_X 的非零范围内、且 z-x 在 f_Y 的非零范围内。两个条件同时成立,x 的范围就是这两个条件的交集——这个交集取决于 z 的取值,所以必须对 z 分段讨论。
例:XU(0,1),YU(0,1) 独立。$f_X(x)$ 非零要求 $0<x<1$;$f_Y(z-x)$ 非零要求 $0<z-x<1$,即 $z-1<x<z$。x 的实际积分范围是 $(0,1) \cap (z-1, z)$ ——这就是为什么最终结果要根据 z 在 [0,1] 还是 [1,2] 分段。
⚠️ 错误3:X-Y 不是直接套卷积公式
题目让求 Z = X - Y 的分布。不能直接套卷积!正确的做法:令 W = -Y,先求出 W 的分布($f_W(w) = f_Y(-w)$),然后 Z = X + W,对 X 和 W 用卷积公式。
$$f_{X-Y}(z) = \int_{-\infty}^{+\infty} f_X(x) \cdot f_Y(x-z)\ dx$$
注意这个公式和 X+Y 的卷积公式的区别:$f_Y$ 的参数变成了 $x-z$ 而不是 $z-x$。
⚠️ 错误4:连续型忘了写 z 的取值范围
求完 $f_Z(z)$ 之后,必须在结果后面标注 z 的有效范围。卷积的结果通常是一个分段函数——不同 z 区间对应不同的积分上下限,因此表达式不同。漏了范围标注 → 扣分。
⚠️ 错误5:离散型忘了"和为 z"可能有多种组合
离散卷积时,$P(Z=k)$ 要加总所有满足 $x_i + y_j = k$ 的 (i,j) 组合。有时候一个 k 只对应一种组合,有时候对应多种——必须全部找齐。漏掉组合 → 概率算错。
⑥ 链条位置
从哪来:
- 直接依赖 联合分布(1.3/1.4 节)和 边缘分布(1.5 节)——卷积公式里 $f_X$ 和 $f_Y$ 都来自边缘分布。
- 依赖 独立性判断(1.7 节)——能不能用卷积公式,完全取决于 X 和 Y 是否独立。
- 推导过程中用到了 分布函数法——先求 $F_Z(z)$ 再求导得到 $f_Z(z)$,这是第2章"求随机变量函数的分布"中建立的通用策略。
到哪去:
- ↗ max/min 的分布(本节后续):Z = max(X,Y) 和 Z = min(X,Y) 也是"两个随机变量函数的分布",但它们的推导走的是另一条路——利用"max≤z 等价于所有变量≤z"的逻辑。
- ↗ 第4章 数字特征:$E(X+Y) = E(X) + E(Y)$(和的期望 = 期望的和,永远成立);$Var(X+Y) = Var(X) + Var(Y) + 2Cov(X,Y)$(独立时协方差为0,方差也可加)。
- ↗ 第5章 大数定律与中心极限定理:中心极限定理的核心就是——大量独立随机变量的和趋近正态分布。卷积是背后的数学基础:一次又一次地卷积,无论原始分布长什么样,卷积多了都变成正态的钟形。
- ↗ 第6章 数理统计:样本均值的分布本质上就是 n 个独立同分布变量的和(除以 n),理解卷积才能理解为什么"样本量越大,样本均值的方差越小"。
在整条链中的位置:联合分布 → 边缘分布 → 条件分布 → 独立性 → 卷积(Z=X+Y)→ max/min → 第4章数字特征 → 第5章极限定理。卷积是"从两个分布合成一个新分布"的操作——独立性能让这个操作从二重积分简化成一重积分(卷积公式),而不独立时你必须回到最原始的分布函数法。学会卷积,整个"随机变量函数分布"这一大类题的通用思路就打通了。
🛑 停一下:用你自己的话说——卷积公式在什么前提条件下才能用?(答案:X 和 Y 必须独立。)如果不独立,改用哪种方法?(答案:分布函数法,即二重积分。)眼睛扫一下题目,先判断能不能用卷积。
最大值 M = max(X,Y) 与最小值 N = min(X,Y) 的分布(⭐⭐ 核心方法 · 六段式·方法级)
这一节要解决的核心问题:n 个随机变量中"最强的那个"(max)和"最弱的那个"(min)各自服从什么分布?这是串联/并联系统寿命分析的理论基础。
先想一个困境:一串联灯,整串多久会灭?
一串圣诞树彩灯,只要有一个灯泡烧了,整串全灭。假如每个灯泡寿命独立,都服从某个分布——问:整串灯能撑多久?
难在哪?——整串灯的寿命取决于最先烧掉的那个灯泡(最脆弱的那个)。你没法直接说"整串寿命 = 某个灯泡的寿命",因为它随时可能被任何一个灯泡拖垮。换句话说:整串寿命 N = min(各灯泡寿命)。这个"最小值"的分布,不能简单套用单个灯泡的分布。
再想另一个方向:双电源机房,两路电源只要还有一路有电,服务器就不关机。系统能撑多久?——取决于最后断电的那一路(最坚挺的那个)。系统寿命 M = max(两路电源寿命)。
难在哪(升级版)?——"min ≤ z"这件事有个坑。你先试着想:整串灯"寿命不超过 z"等价于"每个灯泡都不超过 z"吗? 想清楚这个问题,max 和 min 的区别就明白了。下面带着这个问题看。
① 生活场景
💡 场景1:串联电路 = 圣诞树彩灯——一串彩灯只要有一个灯泡烧了整串全灭。这串灯的寿命取决于最先烧掉的那个(最脆弱的)。数学上:系统寿命 = min(各灯泡寿命)。
🔋 场景2:并联电路 = 双电源机房——两路电源只要还有一路有电服务器就不关机。系统能撑多久取决于最后断电的那一路(最坚挺的)。数学上:系统寿命 = max(两路电源寿命)。
🏆 场景3:体操比赛打分——5 位裁判打分,去掉最高最低取平均。最高分 M = max(5 个分数) 服从什么分布?最低分 N = min(5 个分数) 呢?
🚌 场景4:等多路公交——有 3 条线路都到公司,你上最先来的那辆。等车时间 N = min(三辆车的到达时间) 服从什么分布?
大白话:max 是"看最好的那个",min 是"看最差的那个"。两者的推导思路截然不同——max 可以直来直去(用 ≤ 直接写),min 必须绕弯(用 > 反着推)。
② 正式陈述
问题:设 n 个随机变量 $X_1, X_2, \ldots, X_n$ 相互独立,每个的分布函数为 $F_i(x)$(同分布时统一记为 $F(x)$)。求最大值 $M = \max(X_1, \ldots, X_n)$ 和最小值 $N = \min(X_1, \ldots, X_n)$ 的分布。
M = max 的分布:
分布函数:$F_M(z) = P{M \leq z} = P{X_1 \leq z,\ X_2 \leq z,\ \ldots,\ X_n \leq z}$
若 $X_1, \ldots, X_n$ 相互独立:
$$F_M(z) = F_1(z) \cdot F_2(z) \cdots F_n(z)$$
若还同分布(所有变量的分布函数都是 $F(z)$):
$$F_M(z) = [F(z)]^n$$
密度函数(当每个变量有密度 $f(x)$ 时):
$$f_M(z) = n[F(z)]^{n-1} \cdot f(z)$$
N = min 的分布:
分布函数:$F_N(z) = P{N \leq z} = 1 - P{N > z} = 1 - P{X_1 > z,\ X_2 > z,\ \ldots,\ X_n > z}$
若 $X_1, \ldots, X_n$ 相互独立:
$$F_N(z) = 1 - [1-F_1(z)] \cdot [1-F_2(z)] \cdots [1-F_n(z)]$$
若还同分布(所有变量的分布函数都是 $F(z)$):
$$F_N(z) = 1 - [1-F(z)]^n$$
密度函数:
$$f_N(z) = n[1-F(z)]^{n-1} \cdot f(z)$$
💡 max/min 公式对比速记:max 用 $F(z)$(≤ 的累计概率),min 用 $1-F(z)$(> 的生存概率)。max 是正门直入(直接乘积),min 是后门绕道(先乘生存概率再用 1 减)。记住一句话:max 乘正概率,min 乘反概率再反回来。
③ 完整推导
第一部分:M = max(X,Y) 的推导
🧠 第1步:从分布函数出发
求 M 的分布,先求分布函数 $F_M(z) = P{M \leq z}$,然后求导得密度。
大白话:一如既往——分布函数法。先求"M 不超过 z"的概率,再求导。
🧠 第2步:关键等价——"max ≤ z"意味着什么?
"max(X,Y) ≤ z"的意思是:X 和 Y 中最大的那个都不超过 z。等价于两个都不超过 z:
$$P{M \leq z} = P{\max(X,Y) \leq z} = P{X \leq z,\ Y \leq z}$$
大白话:全班"最高分不超过 90" = "每个人的分数都不超过 90"。如果有人考了 95,最高分就超过 90 了。这个等价关系是双向的——既充分又必要。
🧠 第3步:利用独立性,概率相乘
如果 X 和 Y 相互独立:
$$F_M(z) = P{X \leq z,\ Y \leq z} = P{X \leq z} \cdot P{Y \leq z} = F_X(z) \cdot F_Y(z)$$
如果 X 和 Y 还同分布(分布函数都是 F(z)),则:
$$F_M(z) = [F(z)]^2$$
推广到 n 个独立同分布的变量 $X_1, \ldots, X_n$:
$$F_M(z) = [F(z)]^n$$
大白话:独立时"两个人都 ≤ z 的概率" = "第一个人 ≤ z 的概率" x "第二个人 ≤ z 的概率"。n 个人都独立,就是 n 次方。
🧠 第4步:求导得密度
如果每个 X_i 还有密度 f(x),对分布函数求导:
$$f_M(z) = F'_M(z) = n[F(z)]^{n-1} \cdot f(z)$$
大白话:n 次方求导 = n x 原来的^(n-1) x 密度。链式法则直接套用。
第二部分:N = min(X,Y) 的推导
🧠 第1步:不能直接用"min ≤ z"!
如果直接写 $P{\min(X,Y) \leq z} = P{X \leq z,\ Y \leq z}$——这是错的!
为什么?"min ≤ z"意思是"只要有一个不超过 z 就行"——可能 X≤z 且 Y>z,或 X>z 且 Y≤z,或两者都≤z。而 $P{X \leq z,\ Y \leq z}$ 只覆盖了"两者都≤z"这一种情况,漏了另外两种情况!
大白话:全班"最低分不超过 60" = "至少有一个人不及格"——张三不及格算、李四不及格也算、两人都不及格也算。而"两个都不超过 60"只对应两人都不及格。两件事完全不同!这是 max/min 最容易被绕晕的地方。
🧠 第2步:绕道策略——先求"min > z",再反回来
虽然"min ≤ z"不好直接写,但"min > z"非常干净!
$P{N > z}$ = "最小值都大于 z" = "两个变量都大于 z":
$$P{N > z} = P{\min(X,Y) > z} = P{X > z,\ Y > z}$$
大白话:全班"最低分都超过 90" = "每个人的分数都超过 90"。这个方向是等价的!——因为如果每个人都 > 90,最低的一定 > 90;反过来如果最低的 > 90,那每个人都 > 90。
🧠 第3步:利用独立性,再绕回来
如果 X 和 Y 独立:
$$P{N > z} = P{X > z} \cdot P{Y > z} = [1 - F_X(z)] \cdot [1 - F_Y(z)]$$
然后用 1 减回去:
$$F_N(z) = P{N \leq z} = 1 - P{N > z} = 1 - [1 - F_X(z)] \cdot [1 - F_Y(z)]$$
推广到 n 个独立同分布变量:
$$F_N(z) = 1 - [1 - F(z)]^n$$
大白话:min 公式的灵魂操作——不是直接求"min ≤ z",而是先求"min > z"(等价于"所有人都 > z",好算),再用 1 减回来。
🧠 第4步:求导得密度
$$f_N(z) = F'_N(z) = n[1 - F(z)]^{n-1} \cdot f(z)$$
max 和 min 公式对比(放一起好记):
| max | min | |
|---|---|---|
| 核心等价 | $M \leq z \iff$ 所有人都 $\leq z$ | $N > z \iff$ 所有人都 $> z$ |
| 分布函数 | $[F(z)]^n$ | $1-[1-F(z)]^n$ |
| 密度 | $n[F(z)]^{n-1}f(z)$ | $n[1-F(z)]^{n-1}f(z)$ |
| 推导路径 | 直来直去(正门) | 绕道而行(后门) |
| 口诀 | max 乘正概率 | min 乘反(生存)概率再反回来 |
第三部分:典型应用——串联与并联
串联系统寿命 = 各元件寿命的最小值(最脆弱的决定一切)
并联系统寿命 = 各元件寿命的最大值(最坚挺的撑到最后)
重要结论:独立指数分布取 min,结果仍是指数分布,参数相加。$X_i \sim \text{Exp}(\lambda_i)$ 独立 → $\min(X_1,\ldots,X_n) \sim \text{Exp}(\lambda_1+\cdots+\lambda_n)$。但 max 不再是简单的指数分布。
✍️ 立刻练一道(刚悟出的"max 直接乘、min 绕道补",马上就用):设 X 与 Y 独立,X ~ (0:0.2, 1:0.8),Y ~ (0:0.5, 1:0.5)。求 $M = \max(X,Y)$ 和 $N = \min(X,Y)$ 的分布律。
点击看答案
求 M(max 直接乘):
$P(M \leq 0) = P(X\leq0,\ Y\leq0) = 0.2 \times 0.5 = 0.10$
$P(M=0) = 0.10$,$P(M=1) = 1 - 0.10 = 0.90$
求 N(min 绕道补):
$P(N > 0) = P(X>0,\ Y>0) = 0.8 \times 0.5 = 0.40$
$P(N=0) = 1 - 0.40 = 0.60$,$P(N=1) = 0.40$
答案:$M\sim(0:0.10, 1:0.90)$,$N\sim(0:0.60, 1:0.40)$
📝 配套练习
题10 ⭐ | max分布(两个独立同分布指数分布)
对应模板:题型六(最大值分布)
设 X 和 Y 独立同服从参数 $\lambda=1$ 的指数分布。已知 $f(t)=e^{-t}$($t>0$),$F(t)=1-e^{-t}$($t>0$)。求 $M=\max(X,Y)$ 的分布函数 $F_M(z)$ 和密度函数 $f_M(z)$。
点击看答案
$F_M(z) = P(\max(X,Y)\leq z) = P(X\leq z)P(Y\leq z) = [F(z)]^2$
当 $z>0$ 时:$F_M(z) = (1-e^{-z})^2$
当 $z\leq0$ 时:$F_M(z)=0$
求导得密度:$f_M(z) = 2(1-e^{-z})·e^{-z} = 2e^{-z}(1-e^{-z})$($z>0$)
答案:
$$F_M(z)=\begin{cases}(1-e^{-z})^2,&z>0\0,&z\leq0\end{cases},\quad f_M(z)=\begin{cases}2e^{-z}(1-e^{-z}),&z>0\0,&z\leq0\end{cases}$$
题11 ⭐⭐ | min分布(不同区间的均匀分布)
对应模板:题型六(最小值分布)
设 XU(0,1) 与 YU(0,2) 独立,求 $N=\min(X,Y)$ 的分布函数。
点击看答案
X 的分布函数:$F_X(x)=x$($0<x<1$)
Y 的分布函数:$F_Y(y)=y/2$($0<y<2$)
$F_N(z)=1-[1-F_X(z)][1-F_Y(z)]$,分段讨论:
$z\leq0$:$F_N(z)=0$
$0<z<1$:$F_N(z)=1-(1-z)(1-z/2)=\frac{3z}{2}-\frac{z^2}{2}$
$z\geq1$:$F_N(z)=1$
答案:
$$F_N(z)=\begin{cases}0,&z\leq0\\frac{3z}{2}-\frac{z^2}{2},&0<z<1\1,&z\geq1\end{cases}$$
题12 ⭐⭐⭐ | 串联/并联系统寿命(max/min应用)
对应模板:题型六(最大值与最小值的应用)
某系统由两个独立工作的电子元件组成。元件寿命 $X\sim\text{Exp}(\lambda_1)$,$Y\sim\text{Exp}(\lambda_2)$。
(1)串联时,系统寿命 $N=\min(X,Y)$ 服从什么分布?
(2)并联时,求 $M=\max(X,Y)$ 的密度函数。
点击看答案
(1)串联(min):
$$F_N(t)=1-[1-F_X(t)][1-F_Y(t)]=1-e^{-\lambda_1 t}·e^{-\lambda_2 t}=1-e^{-(\lambda_1+\lambda_2)t}$$
所以 $N\sim\text{Exp}(\lambda_1+\lambda_2)$,密度 $f_N(t)=(\lambda_1+\lambda_2)e^{-(\lambda_1+\lambda_2)t}$。
重要结论:独立指数分布取最小值,结果仍是指数分布,参数为原来参数之和。
(2)并联(max):
$$F_M(t)=(1-e^{-\lambda_1 t})(1-e^{-\lambda_2 t})=1-e^{-\lambda_1 t}-e^{-\lambda_2 t}+e^{-(\lambda_1+\lambda_2)t}$$
$$f_M(t)=\lambda_1 e^{-\lambda_1 t}+\lambda_2 e^{-\lambda_2 t}-(\lambda_1+\lambda_2)e^{-(\lambda_1+\lambda_2)t},\quad t>0$$
答案:(1)$N\sim\text{Exp}(\lambda_1+\lambda_2)$(2)$f_M(t)=\lambda_1 e^{-\lambda_1 t}+\lambda_2 e^{-\lambda_2 t}-(\lambda_1+\lambda_2)e^{-(\lambda_1+\lambda_2)t}$
④ 推导复盘
📝 用大白话把整个过程重新讲一遍:
max 的推导(直来直去):
- "最大值 ≤ z" ⇔ "所有人都 ≤ z"——等价关系,直接成立。
- 独立条件下乘法:$F_M(z) = F_X(z) \cdot F_Y(z)$。
- n 个独立同分布:$F_M(z) = [F(z)]^n$。
- 求导得密度。
min 的推导(绕道而行):
- "最小值 ≤ z" 不好直接写——情况太多(至少一个 ≤ z)。
- 改走反方向:"最小值 > z" ⇔ "所有人都 > z"——非常干净!
- 独立条件下:$P(N > z) = [1-F_X(z)] \cdot [1-F_Y(z)]$。
- 绕回来:$F_N(z) = 1 - P(N > z) = 1 - [1-F(z)]^n$。
📝 关键转折点(需反复体会):max 和 min 的推导之路完全相反——max 走正门(直接用 ≤),min 走后门(先求 > 再绕回来)。两个公式结构对偶:max 用 F(z)(≤ 的概率),min 用 1-F(z)(> 的概率,也叫生存函数)。记住一句话:max 乘正概率,min 乘反概率再反回来。
📝 这个"绕道策略"(先求反面再减回来)是概率论中极常见的手法——遇到"至少有一个"不好直接算时,先算"一个都没有"再用 1 减。第1章的基础方法论在这里无缝衔接。
⑤ 易错边界
⚠️ 错误1(最致命,最高频):把 max 和 min 公式记反
这是本章错误率最高的地方!很多人把 min 写成 $[F(z)]^n$——那是 max 的公式!
快速检验法:假设每个变量以 0.5 概率取 0、0.5 概率取 1。
- max 取 0 的概率 = 两个都取 0 = 0.25(max 趋向于取大值,所以取 0 的概率小)
- min 取 0 的概率 = 至少一个取 0 = 1 - 两个都取 1 = 1 - 0.25 = 0.75(min 趋向于取小值,所以取 0 的概率大)
- 0.25 ≠ 0.75——公式用反了结果完全不一样!用这个简单例子快速验证自己有没有记反。
⚠️ 错误2:min 直接写 $P{\min \leq z} = P{X \leq z, Y \leq z}$
这是推导层面的根本性错误。"min ≤ z"是"至少有一个 ≤ z",不是"两个都 ≤ z"。必须绕道!
✅ 正确做法:$F_N(z) = 1 - P{X > z, Y > z}$
⚠️ 错误3:不独立时直接套用乘积公式
$F_M(z) = [F(z)]^n$ 和 $F_N(z) = 1-[1-F(z)]^n$ 的前提都是变量相互独立!题目没明说独立 → 不能用简化公式,要从联合分布出发:$F_M(z) = P{X \leq z, Y \leq z} = F(z,z)$(用联合分布函数)。
⚠️ 错误4:n 个变量时忘了"同分布"是额外条件
$F_M(z) = [F(z)]^n$ 要求:①独立 + ②同分布。不同分布(如 XE(1), YE(2))即使独立也只能写 $F_X(z) \cdot F_Y(z)$,不能写 $[F(z)]^2$。
⑥ 链条位置
从哪来:
- 依赖 1.7 节独立性——max/min 的简化公式($[F(z)]^n$ 和 $1-[1-F(z)]^n$)要求变量相互独立。不独立时必须回到联合分布:$F_M(z) = P{X \leq z, Y \leq z} = F(z,z)$。
- 依赖 1.2 节联合分布函数——max 的分布函数 $F(z,z)$ 本质上就是联合分布函数在对角线上的取值。
- 推导策略继承自 第2章 的分布函数法——先求 $F(z)$ 再求导得 $f(z)$。
到哪去:
- ↗ 1.8 节卷积公式:max/min 和 Z=X+Y 是"两个随机变量函数分布"问题的两种思路——卷积走二重积分/迭积分路线,max/min 走逻辑等价路线("max ≤ z ⇔ 所有人都 ≤ z")。
- ↗ 第6章 次序统计量:$X_{(1)} = \min$ 是最小次序统计量,$X_{(n)} = \max$ 是最大次序统计量。本章的 max/min 公式是次序统计量理论的基础。
- ↗ 第6章 数理统计:样本极差 $R = X_{(n)} - X_{(1)}$、样本中位数等都建立在次序统计量之上。
在整条链中的位置:独立性 → max/min → 次序统计量(第6章)。max/min 是"从多个独立变量中提取极端值"的专门工具——串联系统用 min(最弱决定),并联系统用 max(最强撑住)。掌握"max 直入、min 绕道"的推导思路,以后遇到任何极端值问题都能找到入口。
商的分布 Z = X/Y(⭐ 方法级 · 了解)
这一节要解决的核心问题:两个随机变量相除 Z = X/Y 的分布是什么?这是"两个变量函数分布"的第三种常见形式(前两种是 Z=X+Y 和 max/min)。
先想一个困境:两个数相除,比值服从什么分布?
上一节的卷积,解决的是"两个随机变量相加 Z = X+Y"。可生活中"相除"的例子一点也不少:体检的 BMI = 体重÷身高²、投资的夏普比率 = 收益÷波动率、实验室的浓度 = 溶质质量÷溶液体积。分子分母都是随机变量——这个"比值" Z = X/Y 的分布,怎么求?
难在哪?——加法没有正负号的麻烦:X+Y ≤ z 在平面上永远圈出一块"斜线左下方"的区域。可除法要先看 Y 的正负:Y > 0 时 X/Y ≤ z 等价于 X ≤ zY(不等号不变);Y < 0 时不等式两边同乘一个负数,不等号要反过来,变成 X ≥ zY。同一个"比值不超过 z",在 Y 的上下两个半平面里圈出的区域不一样,必须分开处理。这就是 X/Y 比 X+Y 多出来的一层复杂度。
不过别慌——处理套路和卷积一模一样:分布函数法(先求 $F_Z(z)=P(X/Y\le z)$,再求导得密度),独立时把联合密度拆成两个边缘密度的乘积,只是被积函数里多一个 $|y|$ 因子。下面带着"Y 的正负这个坑"看完整推导。
① 生活场景
📏 场景1:BMI 的数学本质——体检时 BMI = 体重 / 身高²。体重 X 和身高 Y 各自有分布,BMI 这个比值又服从什么分布?知道它的分布才能判断一个人"偏胖"的概率有多大。
⚖️ 场景2:金融夏普比率——夏普比率 = (收益率 - 无风险利率) / 波动率。分子和分母都是随机变量,这个比值的分布决定了你的投资策略是否靠谱。
🧪 场景3:化学浓度——浓度 = 溶质质量 / 溶液体积。称量误差让分子分母都有随机性,浓度的分布受两者共同影响。
大白话:两个数相除在实际中太常见了——比率、浓度、效率指标都是。处理思路和卷积一样——把"两个变量的函数"转化为"一个新变量 + 一个老变量",然后对老变量积分消掉。
② 正式陈述
问题:已知二维随机变量 (X,Y) 的联合密度为 $f(x,y)$,求 $Z = X/Y$ 的密度函数。
方法一:分布函数法(通用,不要求独立)
先求分布函数,注意 Y 的正负影响不等号方向:
$$F_Z(z) = P\left{\frac{X}{Y} \leq z\right} = \int_0^{+\infty} \int_{-\infty}^{zy} f(x,y)\ dx\ dy + \int_{-\infty}^0 \int_{zy}^{+\infty} f(x,y)\ dx\ dy$$
对 z 求导得密度(通用公式):
$$f_Z(z) = \int_{-\infty}^{+\infty} |y| \cdot f(yz,\ y)\ dy$$
方法二:独立时的简化公式
当 X 和 Y 相互独立时,$f(x,y) = f_X(x) \cdot f_Y(y)$,代入得:
$$f_Z(z) = \int_{-\infty}^{+\infty} |y| \cdot f_X(yz) \cdot f_Y(y)\ dy$$
💡 与卷积公式的对比:
- 卷积(Z=X+Y):$\int f_X(x) \cdot f_Y(z-x)\ dx$——积分变量 x,$f_Y$ 参数 $z-x$
- 商(Z=X/Y):$\int |y| \cdot f_X(yz) \cdot f_Y(y)\ dy$——积分变量 y(分母),多 |y| 因子,$f_X$ 参数 $yz$
两个公式结构平行——都是"把联合密度拆成两个边缘密度的乘积,对其中一个变量积分消掉"。区别只在换元方式(加法 vs 乘法)和雅可比因子(1 vs |y|)。
③ 完整推导
🧠 第1步:分析问题——Z=X/Y 和 Z=X+Y 有什么不同?
对于 Z = X+Y,换元时写 y = z - x——加法天然容易处理。对于 Z = X/Y,变量关系是 X = Y·Z——乘法关系。
大白话:和的公式里 y = z-x(减法换元),商的公式里 x = y·z(乘法换元)。形式上不同,但处理思路完全一样——分布函数法 → 变量替换 → 积分消元。
🧠 第2步:分布函数法——通用方法,不要求独立
设 (X,Y) 的联合密度为 $f(x,y)$,先求分布函数:
$$F_Z(z) = P{Z \leq z} = P\left{\frac{X}{Y} \leq z\right}$$
这里有一个关键陷阱:除以 Y 时,不等式两边同乘 Y 的方向要看 Y 的正负!
- 当 Y > 0:$X/Y \leq z \iff X \leq zY$(乘正数,不等号不变)
- 当 Y < 0:$X/Y \leq z \iff X \geq zY$(乘负数,不等号方向反转!)
所以积分要分两块:
$$F_Z(z) = \int_0^{+\infty} \int_{-\infty}^{zy} f(x,y)\ dx\ dy + \int_{-\infty}^0 \int_{zy}^{+\infty} f(x,y)\ dx\ dy$$
大白话:Y>0 时积分区域是 X ≤ zY(斜线左下方);Y<0 时变成 X ≥ zY(斜线右上方)。这是 X/Y 比 X+Y 多一层复杂度的根本原因——加法没有正负号的问题!
🧠 第3步:对 z 求导得到密度
对 z 求导(变上限积分求导法则),得到:
$$f_Z(z) = \int_{-\infty}^{+\infty} |y| \cdot f(yz,\ y)\ dy$$
这里用的是联合密度 $f(x,y)$——不要求独立!只要你知道联合密度就能用这个公式。
大白话:和卷积推导完全一样——分布函数法 + 变上限求导。区别在于 (1) 积分区域因 Y 正负分段,(2) 多了一个 |y| 因子。
🧠 第4步:独立时的简化公式
当 X 和 Y 相互独立时,联合密度 $f(x,y) = f_X(x) \cdot f_Y(y)$。把 $x = yz$ 代入:
$$f_Z(z) = \int_{-\infty}^{+\infty} |y| \cdot f_X(yz) \cdot f_Y(y)\ dy$$
大白话:独立是"魔法开关"——联合密度拆成两个边缘密度的乘积,二重积分降为一重积分。和卷积公式的模式完全一致,只是多了一个 |y| 因子,被积函数是 $f_X(yz) \cdot f_Y(y)$ 而不是卷积的 $f_X(x) \cdot f_Y(z-x)$。
🧠 第5步:公式里的 |y| 是哪来的?——雅可比行列式直观解释
做变量替换 $(x, y) \to (z, y)$,其中 $z = x/y$(即 $x = yz$)。新旧坐标之间的"缩放因子"(雅可比行列式)是:
$$\left|\frac{\partial(x,y)}{\partial(z,y)}\right| = \left|\det\begin{pmatrix} y & z \ 0 & 1 \end{pmatrix}\right| = |y|$$
大白话:(x,y) 平面上的一个小矩形映射到 (z,y) 平面时,面积会缩放。缩放比例是 |y|——在 y 大的地方,"同样的 z 变化"对应"更大的 x 变化",所以概率密度要乘以 |y| 来补偿。这个 |y| 保证了"变量替换前后总概率不变(都等于 1)"。
🧠 第6步:四个公式比一比(帮你建立整体认知)
| 公式 | 独立时形式 | 被积函数特征 |
|---|---|---|
| Z = X+Y | $\int f_X(x) \cdot f_Y(z-x)\ dx$ | 积分变量 x,$f_Y$ 参数变为 $z-x$ |
| Z = X-Y | $\int f_X(x) \cdot f_Y(x-z)\ dx$ | 积分变量 x,$f_Y$ 参数变为 $x-z$ |
| Z = X·Y | $\int \frac{1}{ | x |
| Z = X/Y | $\int | y |
大白话:四个公式不必死记——全是分布函数法(二重积分 → 变量替换 → 求导)出来的。考试真要你推导时,老老实实走分布函数法流程。如果只考结论,记住 X/Y 公式的特征:积分变量是分母 y,被积函数里多一个 |y|,$f_X$ 参数是 yz。
④ 推导复盘
📝 用大白话把整个过程重新讲一遍:
- 老套路——分布函数法:$F_Z(z) = P(X/Y \leq z)$,在平面上找到满足条件的区域做二重积分。
- 和 Z=X+Y 的关键区别:除以 Y 时 Y 的正负影响不等号方向!所以必须分 Y>0 和 Y<0 两个半平面积分——这是 X/Y 比 X+Y 多一层复杂度的根本原因。
- 对 z 求导得到 $f_Z(z) = \int |y| f(yz, y) dy$——|y| 来自变量替换的雅可比行列式。
- 独立时联合密度拆成边缘密度乘积,得到商密度简化公式。
📝 关键转折点:X/Y 和 X+Y 本质上是同一个问题——"两个变量函数的分布"。同一套分布函数法流程,同一套变量替换 + 求导操作。区别只有两点:(1) 积分区域因正负号要分段;(2) 雅可比因子从 1 变成了 |y|。理解了这个统一框架,和、差、积、商四个公式全是一个套路。
📝 备考建议:Z=X/Y 的完整推导考研很少要求。更常见的是——题目给了联合密度 f(x,y),让你用分布函数法求 Z=X/Y 的分布。这时候不需要记任何特殊公式,直接走分布函数法流程。如果是两个独立标准正态相除,记住结论:Z ~ 柯西分布。
⑤ 易错边界
⚠️ 错误1(最致命):不等式乘 Y 时忘了分正负
$X/Y \leq z$ 乘 Y 时:Y>0 → $X \leq zY$(不等号不变);Y<0 → $X \geq zY$(不等号反转!)。忘了分情况 → 积分区域画错 → 全题报废。这是 X/Y 独有的陷阱,X+Y 没有这个问题。
⚠️ 错误2:公式里的 |y| 漏掉了
变量替换 (x,y) → (z,y) 产生的雅可比行列式是 |y|(带绝对值!),不是 y。漏掉绝对值 → 在 y<0 的区域符号搞反。为什么是绝对值?因为雅可比行列式取绝对值是为了保证概率的非负性——面积不能是负的。
⚠️ 错误3:忘了积分上下限分段
和卷积公式一样,$f_X(yz) \cdot f_Y(y)$ 非零要求 y 同时在 $f_Y$ 范围和 $yz$ 在 $f_X$ 范围里。这两个条件的交集取决于 z——必须对 z 分段讨论积分上下限。
⚠️ 错误4:独立性的前提
商密度简化公式 $\int |y| f_X(yz) f_Y(y) dy$ 的前提是 X 和 Y 相互独立。不独立时只能用分布函数法(带联合密度的版本)。
✍️ 立刻练一道(刚悟出的"商公式 = 分布函数法 + |y|因子",马上就用):设 X 与 Y 独立,X 在 $(0,1)$ 上均匀分布,Y 服从参数 $\lambda=1$ 的指数分布(密度 $f_Y(y)=e^{-y}$,$y>0$)。用分布函数法写出 $Z=X/Y$ 的密度函数 $f_Z(z)$ 的表达式(允许保留积分号)。
点击看答案
第1步:写出分布函数。Y 在 $y>0$ 上取正,所以只有 Y>0 这一段(不用分正负号):
$$F_Z(z) = P!\left(\frac{X}{Y}\le z\right) = \int_0^{+\infty} \int_0^{\min(1,;zy)} 1,dx \cdot e^{-y},dy = \int_0^{+\infty} \min(1,;zy),e^{-y},dy$$
($f_X(x)=1$($0<x<1$)、$f_Y(y)=e^{-y}$($y>0$);内层 $x$ 的范围是 $0<x<1$ 与 $0<x\le zy$ 的交集,即 $0<x<\min(1,zy)$。)
第2步:把 $\min(1,zy)$ 拆开积出闭式。$zy\le1 \iff y\le\frac1z$($z>0$ 时):
$$F_Z(z) = \int_0^{1/z} zy,e^{-y},dy + \int_{1/z}^{+\infty} e^{-y},dy = z\Big(1-\big(\tfrac1z+1\big)e^{-1/z}\Big) + e^{-1/z} = z,(1-e^{-1/z})$$
第3步:对 z 求导得密度。$\frac{d}{dz}e^{-1/z} = \frac{1}{z^2}e^{-1/z}$:
$$f_Z(z) = \frac{d}{dz}\Big[z(1-e^{-1/z})\Big] = (1-e^{-1/z}) - \frac1z e^{-1/z} = 1 - \Big(1+\frac1z\Big)e^{-1/z},\quad z>0$$
- 当 $z\le0$:$X>0$ 且 $Y>0$,比值 $X/Y>0$,事件 $X/Y\le z\le0$ 的概率为 0,所以 $f_Z(z)=0$。
验证($z>0$ 时是否为合法密度):分布函数 $F_Z(z)=z(1-e^{-1/z})$,当 $z\to+\infty$ 时 $e^{-1/z}\approx 1-\frac1z$,所以 $F_Z(+\infty)=1$ ✓;且 $F_Z(0^+)=0$,说明 $\int_0^{+\infty}f_Z(z),dz=1$ ✓;$f_Z(z)\ge0$ 显然成立 ✓。
答案:
$$f_Z(z)=\begin{cases} 1-\Big(1+\dfrac{1}{z}\Big)e^{-1/z}, & z>0 \[3mm] 0, & z\le0 \end{cases}$$
1.9 两个重要分布
二维均匀分布
先想一个场景:随机扔球,落点在哪?
你在一个矩形操场上随机扔一个球——任何位置被砸中的机会都一样,没有哪个位置"更受偏爱"。这类分布叫均匀分布。如果这个操场是二维的(一块地皮而不是一条线),落在任何位置都一样,那就是二维均匀分布。
难在哪?——二维均匀分布在非矩形区域上(三角形、圆形),就会引出很多反直觉的结论:比如"边缘分布还是不是均匀的?""X 和 Y 还独立吗?"这些问题,正是考试的判断题最爱挖的坑。下面带着"在非矩形区域上会出什么幺蛾子"这个问题看。
生活比喻:你在一个矩形操场上随机扔一个球——球落在操场任何一个位置的机会都一样。没有哪个位置"更受偏爱"。这就是均匀分布。
正式定义:设 D 是平面上一个有界区域,面积为 |D|。如果 (X,Y) 的联合概率密度为:
$$f(x,y) = \begin{cases} \dfrac{1}{|D|}, & (x,y) \in D \ 0, & \text{其他} \end{cases}$$
则称 (X,Y) 在 D 上服从二维均匀分布。
核心性质:
- 落在 D 内任一子区域 A 的概率 = A 的面积 / D 的面积
- 重要推论:二维均匀分布的两个分量 X 和 Y,一般不独立(除非 D 是矩形且边与坐标轴平行)。这是常考的判断题。
✍️ 立刻练一道(刚悟出的"概率 = 面积比",马上就用):设 (X,Y) 在正方形 $D={(x,y)\mid 0<x<1,;0<y<1}$ 上服从均匀分布,求 $P(X>0.5,;Y>0.5)$。
点击看答案
正方形面积 = 1。满足 $X>0.5,;Y>0.5$ 的是右上角四分之一小正方形,面积 = 0.5 × 0.5 = 0.25。
$$P(X>0.5,;Y>0.5) = \frac{0.25}{1} = 0.25$$
答案:0.25
📝 配套练习
题13 ⭐⭐ | 二维均匀分布求概率
对应模板:题型七(二维均匀分布)
设 (X,Y) 在区域 $D={(x,y)\mid 0<x<1,;0<y<1-x}$ 上服从均匀分布。求(1)联合密度;(2)$P(X<0.5)$。
点击看答案
(1) 三角形区域面积 = $1/2$,所以联合密度为:
$$f(x,y)=\begin{cases}2,&(x,y)\in D\0,&\text{其他}\end{cases}$$
(2) $P(X<0.5)=\int_0^{0.5}\int_0^{1-x}2,dy,dx=\int_0^{0.5}2(1-x),dx=0.75$
答案:(1)$f=2$(2)0.75
二维正态分布
先想一个场景:一把沙子从空中撒下,堆成什么样?
想象你抓一把沙子,从空中撒下去——沙子堆成一个小山包。这个山包的形状,主要由几个信息决定:山顶在哪、山有多陡、山是"正着"的还是"斜着"拉长的。
难在哪?——一维正态是一个钟形曲线(一个峰值、两侧对称),只要两个数就定死(均值决定峰的位置、方差决定峰的胖瘦)。二维正态是一座"钟形山包",多了一个维度就多了一份自由——山包可以被斜着拉长。这一斜,就引出了本章最有争议也最常考的一族性质(比如 $\rho=0$ 和"独立"的关系)。下面带着"这座斜山包有哪些独特性质"这个问题看。
生活比喻:想象你把一把沙子从空中撒下去——沙子堆成一个小山包。这个山包的形状完全由五个数字决定:
- 山顶在什么位置(两个数字告诉你山顶的坐标)——$\mu_1$(X 方向位置)和 $\mu_2$(Y 方向位置)
- 山有多"陡"(两个数字告诉你两个方向的坡度)——$\sigma_1^2$(X 方向坡度)和 $\sigma_2^2$(Y 方向坡度)
- 山是"正着"的还是"斜着"拉长的(一个数字告诉你倾斜方向)——$\rho$,也就是相关系数
$\rho>0$ 时山沿东北-西南方向拉长(X 大时 Y 也大),$\rho<0$ 时沿西北-东南方向拉长(X 大时 Y 小),$\rho=0$ 时山是圆形的(X 和 Y 各管各的,没有倾斜)。
这种"被五个数字完全决定形状的沙子山包",数学上就叫二维正态分布。
正式定义:(X,Y) 服从二维正态分布,记为 $(X,Y) \sim N(\mu_1, \mu_2, \sigma_1^2, \sigma_2^2, \rho)$,其中:
- $\mu_1$:X 的均值(山顶的 X 坐标)
- $\mu_2$:Y 的均值(山顶的 Y 坐标)
- $\sigma_1^2$:X 的方差(X 方向的坡度/分散程度)
- $\sigma_2^2$:Y 的方差(Y 方向的坡度/分散程度)
- $\rho$:X 和 Y 的相关系数($-1 \leq \rho \leq 1$,山包倾斜的方向和程度)
关键性质(⭐⭐⭐最重要的四条):
- 独立 ⇔ $\rho = 0$:这是二维正态分布独有的性质!对一般分布,"独立"可推"不相关",但反过来不行。唯独二维正态,两者完全等价。用沙子山包来理解:$\rho=0$ 意味着山是圆的,没有倾斜——说明 X 方向的信息完全不影响 Y 方向的样子,也就是独立。
- 边缘分布是一维正态:$X \sim N(\mu_1, \sigma_1^2)$,$Y \sim N(\mu_2, \sigma_2^2)$。从侧面看这个沙子山包,不管从 X 方向还是 Y 方向看,切出来的剖面曲线都是一维正态的钟形。
- 条件分布也是正态分布:因为联合正态的山包从任何方向竖着切一刀,切出来的剖面都是正态钟形曲线——就像不管你从哪个角度切这个沙子山,切面都是一样的钟形。
- 线性组合仍是正态:$aX + bY$ 服从正态分布。把 X 和 Y 按任意比例混合,结果还是正态。
⚠️ 易错提醒:两个边缘分布都是正态分布,不代表联合分布是二维正态分布!必须明确说"服从二维正态分布"才行。举个反例思路——你可以构造一个联合分布,它的两个边缘都是标准正态,但联合密度的形状不是"沙子山包",而是一个奇怪的形状(比如把圆形正态山包在四个象限重新排列)。考研特别喜欢考这个陷阱。
✍️ 立刻练一道(刚悟出的"二维正态四大性质 + ρ=0⇔独立",马上就用):设 $(X,Y)\sim N(1, 4;\ 0, 9;\ 0.5)$。(1)X 和 Y 独立吗?(2)$X$ 服从什么分布?$Y$ 服从什么分布?(3)$X+Y$ 服从什么分布?
点击看答案
(1) $\rho=0.5\neq0$,所以 X 和 Y 不独立(二维正态中独立 ⇔ $\rho=0$,$\rho\neq0$ 就一定不独立)。
(2) 二维正态的两个边缘都是一维正态:$X\sim N(\mu_1,\sigma_1^2)=N(1,4)$,$Y\sim N(\mu_2,\sigma_2^2)=N(0,9)$。
(3) 二维正态的线性组合仍是正态。均值直接相加:$E(X+Y)=E(X)+E(Y)=1+0=1$。方差要用第 4 章的公式——先记结论:和的方差 = 各自方差 + 交叉项(完整公式 $Var(X+Y)=Var(X)+Var(Y)+2\rho\sigma_1\sigma_2$ 第 4 章正式学),套进来算:
$$Var(X+Y)=4+9+2\times0.5\times\sqrt{4\times9}=13+6=19$$
所以 $X+Y\sim N(1,19)$。
答案:(1)不独立(2)$X\sim N(1,4)$,$Y\sim N(0,9)$(3)$X+Y\sim N(1,19)$
📝 配套练习
题14 ⭐⭐ | 二维正态分布的性质
对应模板:题型七(二维正态分布)
设 $(X,Y)\sim N(0,1;0,1;0)$,即 $\mu_1=\mu_2=0$,$\sigma_1^2=\sigma_2^2=1$,$\rho=0$。
(1)X 和 Y 是否独立?
(2)写出联合密度函数。
点击看答案
(1)独立。 二维正态中 $\rho=0\iff$独立。
(2) 代入公式得:
$$f(x,y)=\frac{1}{2\pi}e^{-\frac{x^2+y^2}{2}},\quad -\infty<x,y<+\infty$$
这也可以写成 $f_X(x)·f_Y(y)$ 的形式,其中 $f_X(x)=\frac{1}{\sqrt{2\pi}}e^{-x^2/2}$,再次验证了独立性。
答案:(1)独立(2)$f(x,y)=\frac{1}{2\pi}e^{-(x^2+y^2)/2}$
题15 ⭐⭐⭐ | 综合:圆域均匀分布的边缘、独立性、条件密度(综合:题型二+三+四+七)
对应模板:题型二+三+四(综合)
设 (X,Y) 在单位圆盘 $x^2+y^2\leq1$ 上服从均匀分布。
(1)求联合密度;
(2)求 $f_X(x)$ 和 $f_Y(y)$;
(3)判断 X 和 Y 是否独立;
(4)求 $f_{Y|X}(y|x)$。
点击看答案
(1) 圆面积 $=\pi$,联合密度 $f(x,y)=1/\pi$($x^2+y^2\leq1$)。
(2) 固定 x($-1<x<1$),y 范围 $-\sqrt{1-x^2}\leq y\leq\sqrt{1-x^2}$:
$$f_X(x)=\int_{-\sqrt{1-x^2}}^{\sqrt{1-x^2}}\frac{1}{\pi},dy=\frac{2}{\pi}\sqrt{1-x^2}$$
同理 $f_Y(y)=\frac{2}{\pi}\sqrt{1-y^2}$。
(3)不独立。 $f_X(x)·f_Y(y)=\frac{4}{\pi^2}\sqrt{(1-x^2)(1-y^2)}\neq\frac{1}{\pi}$。
直观解释:知道 X 接近 1 时 Y 只能接近 0,X 的信息"绑住"了 Y 的范围。
(4) 当 $-1<x<1$,$-\sqrt{1-x^2}<y<\sqrt{1-x^2}$:
$$f_{Y|X}(y|x)=\frac{1/\pi}{2\sqrt{1-x^2}/\pi}=\frac{1}{2\sqrt{1-x^2}}$$
给定 X=x 后,Y 在 $[-\sqrt{1-x^2},\sqrt{1-x^2}]$ 上均匀分布。
答案:(1)$f=1/\pi$(2)$f_X(x)=\frac{2}{\pi}\sqrt{1-x^2}$(3)不独立(4)$f_{Y|X}(y|x)=\frac{1}{2\sqrt{1-x^2}}$
附:本章知识脉络图
二维随机变量 (X,Y)
│
├── 离散型 ─── 联合分布律 pᵢⱼ(表格表示)
│ │
│ ├── 边缘分布:pᵢ· = Σⱼ pᵢⱼ,p·ⱼ = Σᵢ pᵢⱼ(行合计/列合计)
│ │
│ ├── 条件分布:P{X=xᵢ|Y=yⱼ} = pᵢⱼ / p·ⱼ(限定条件后的分布)
│ │
│ └── 独立性:pᵢⱼ = pᵢ· × p·ⱼ 对所有 i,j(联合=边缘乘积)
│
├── 连续型 ─── 联合密度 f(x,y)(概率浓度图)
│ │
│ ├── 边缘密度:f_X(x) = ∫ f(x,y) dy(压扁/投影)
│ │
│ ├── 条件密度:f_{X|Y}(x|y) = f(x,y) / f_Y(y)(剖面形状)
│ │
│ └── 独立性:f(x,y) = f_X(x)·f_Y(y)
│
├── 联合分布函数 F(x,y) = P{X≤x, Y≤y}
│ └── 四条性质:单调不减、有界、右连续、矩形概率非负
│
└── 两个变量的函数
├── Z = X+Y ─── 一般方法:F_Z(z) = ∬_{x+y≤z} f dxdy
│ └── 独立时:卷积公式 f_Z = ∫ f_X(x)·f_Y(z-x) dx
├── M = max ─── F_M(z) = [F(z)]ⁿ(都 ≤ z)
├── N = min ─── F_N(z) = 1-[1-F(z)]ⁿ(都 > z 的反面)
└── Z = X/Y ─── 了解卷积型公式
② 题型与练习(讲练合一)
题型一:求联合分布中的未知参数(⭐⭐⭐)
先看一道题:这个 a 到底是多少?
设二维离散型随机变量 (X,Y) 的联合分布律如下表,求常数 a 的值。
| X\Y | Y=1 | Y=2 | Y=3 |
|---|---|---|---|
| X=1 | 0.1 | 0.2 | a |
| X=2 | 0.2 | a | 0.1 |
看到这题,先别慌。难在哪?——表格里藏着两个 a,没法直接读出它们的值。
试着想:上一节 1.3 学过一个"规矩"——所有格子的概率加起来必须等于 1(归一性)。这张表是完整的联合分布律,所以把这个规矩写成等式,a 就"现形"了:
$$0.1 + 0.2 + a + 0.2 + a + 0.1 = 1 \quad \Rightarrow \quad 0.6 + 2a = 1 \quad \Rightarrow \quad a = 0.2$$
🧠 这一步在想什么:"联合分布律 → 归一性 → 一元方程"——未知参数躲在表格里,就用"总和=1"把它逼出来。算完还要验证:把 a=0.2 代回表格,所有格子和 = 0.1+0.2+0.2+0.2+0.2+0.1 = 1.0,且每个格子都在 0 到 1 之间 ✓
答案:$a = 0.2$
再看一道(连续型):这次 a 变成了 k
设 (X,Y) 的联合概率密度为:
$$f(x,y) = \begin{cases} kxy, & 0 < x < y < 1 \ 0, & \text{其他} \end{cases}$$
求常数 k 的值。
看到这题,先别慌。难在哪?——连续型没有"格子"可以加,表格的方法用不了了。但"归一性"的思想还在:全平面上对密度做二重积分 = 1。
试着想——关键一步是先看清"整个平面"到底是哪块区域。条件 $0 < x < y < 1$ 描述的是正方形 $[0,1]\times[0,1]$ 中被对角线 $y=x$ 切出来的上三角部分。区域画对了,再在正确区域上积分:
$$\int_0^1 \int_0^y kxy ,dx,dy = k\int_0^1 y\left[\frac{x^2}{2}\right]_0^y dy = \frac{k}{2}\int_0^1 y^3,dy = \frac{k}{2} \cdot \frac{1}{4} = \frac{k}{8}$$
令 $\frac{k}{8} = 1$,得 $k = 8$。验证:$k=8>0$,且 $f(x,y)=8xy \geq 0$ ✓
🧠 这一步在想什么:"连续型归一化 = 在定义区域上做二重积分 = 1"——和离散型的"格子相加=1"思想一模一样,只是把"加法"换成了"积分"。区域画错,积分上下限就全错,这题就报废。
答案:$k = 8$
🔍 回头看看:这两道题背后,其实是同一个招
| 离散型 | 连续型 | |
|---|---|---|
| 归一化=1 怎么落 | 所有格子相加 | 定义区域上二重积分 |
| 关键动作 | 列一元方程 | 先画区域再积分 |
📌 以后就这么办:看到"含未知参数的联合分布",就用"归一化=1"逼出参数。 ① 判断是表格还是密度公式;② 表格 → 全格子相加等于 1;密度 → 先画区域、再在定义区域上二重积分等于 1;③ 解方程得参数;④ 代回验证非负。
翻车现场:
- 积分区域画错(连续型):看到 $0<x<1, 0<y<1$ 就以为是正方形,但如果题目写的是 $0<x<y<1$,区域是三角形!一定要先在草稿纸上画出区域再写积分上下限。
- 忘了分段积分:如果密度函数在不同区域有不同的表达式,需要拆成多段分别积分再相加。
- 变量"没用完":连续型做完二重积分后,结果里不能还留着 x 或 y——它们应该被积分"消掉"。
🛑 途中停顿:停下来想一想——题目给的是表格(离散型)还是带 x,y 的公式(连续型)?这两种情况的"归一化=1"操作完全不同:离散型把所有格子加起来等于1,连续型在定义区域上做二重积分等于1。眼睛扫一遍题目,你能立刻判断出该用哪种方法吗?
这两类的配套练习(题1、题2)已经就近放在 1.4 节和 1.5 节的方法后面了,学完直接练。
题型二:求边缘分布(⭐⭐)
先看一道题:单看 X,分布是什么?
设 (X,Y) 的联合分布律如下表,求 X 和 Y 的边缘分布律。
| X\Y | Y=0 | Y=1 | Y=2 |
|---|---|---|---|
| X=1 | 0.1 | 0.2 | 0.1 |
| X=2 | 0.2 | 0.3 | 0.1 |
看到这题,先别慌。难在哪?——每个格子都是"X 和 Y 同时取某值"的概率,可这里只想要 X 单独的概率。比如 P(X=1):数学 1 分的人,英语可能 0、1、2 分——三种情况都得算。
试着想——上一节 1.5 刚悟过:求 X 的边缘,就把表格每一行所有格子加起来(消掉 Y,留下 X)。于是:
- $P(X=1) = 0.1 + 0.2 + 0.1 = 0.4$
- $P(X=2) = 0.2 + 0.3 + 0.1 = 0.6$
Y 的边缘反过来:把每一列从上到下加起来。
- $P(Y=0) = 0.1 + 0.2 = 0.3$
- $P(Y=1) = 0.2 + 0.3 = 0.5$
- $P(Y=2) = 0.1 + 0.1 = 0.2$
验证:X 边缘和 = 1.0 ✓,Y 边缘和 = 1.0 ✓
🧠 这一步在想什么:"行求和 → X 的边缘;列求和 → Y 的边缘"。离散型的边缘,本质就是把表格最右、最下的"合计"填出来。
答案:$P(X=1)=0.4, P(X=2)=0.6$;$P(Y=0)=0.3, P(Y=1)=0.5, P(Y=2)=0.2$
再看一道(连续型):这次要把积分上下限"切"对
设 (X,Y) 的联合密度为:
$$f(x,y) = \begin{cases} 8xy, & 0 < x < y < 1 \ 0, & \text{其他} \end{cases}$$
求 X 和 Y 的边缘密度。
看到这题,先别慌。难在哪?——上一节说过连续型边缘 = 对另一个变量积分。但这里区域是三角形 $0<x<y<1$,直接照抄 $(-\infty,+\infty)$ 当上下限,整题报废。必须先画图,把"固定 x 时 y 能跑多远"看清楚。
试着想——求 $f_X(x)$:固定 x,对 y 积分。在 $0<x<1$ 内,y 从 x 到 1:
$$f_X(x) = \int_x^1 8xy , dy = 8x \cdot \left[\frac{y^2}{2}\right]_x^1 = 4x(1-x^2), \quad 0<x<1$$
求 $f_Y(y)$:固定 y,对 x 积分。在 $0<y<1$ 内,x 从 0 到 y:
$$f_Y(y) = \int_0^y 8xy , dx = 8y \cdot \left[\frac{x^2}{2}\right]_0^y = 4y^3, \quad 0<y<1$$
🧠 这一步在想什么:上下限来自"联合密度真正的非零区域",不是公式里的 $(-\infty,+\infty)$。三角形区域里,x 和 y 互相"限制"对方——这就是为什么边缘密度往往是分段函数,而且算完必须标注取值范围。
答案:
$$f_X(x) = \begin{cases} 4x(1-x^2), & 0<x<1 \ 0, & \text{其他} \end{cases}, \quad f_Y(y) = \begin{cases} 4y^3, & 0<y<1 \ 0, & \text{其他} \end{cases}$$
🔍 回头看看:这两道题背后,其实是同一个招
| 离散型 | 连续型 | |
|---|---|---|
| 求 X 的边缘 | 每行格子相加 | 对 y 积分 |
| 求 Y 的边缘 | 每列格子相加 | 对 x 积分 |
| 关键 | 行/列相加 | 按非零区域切上下限 |
📌 以后就这么办:求边缘分布 = 把另一个变量消掉。 ① 离散型:求 X 就逐行求和,求 Y 就逐列求和;② 连续型:求 $f_X(x)$ 就对 y 积分、求 $f_Y(y)$ 就对 x 积分——上下限按联合密度的非零区域来;③ 算完务必标注取值范围,并验证边缘分布总和(积分)等于 1。
翻车现场:
- 积分上下限没有分段:联合密度定义在三角形区域 $0<x<y<1$ 时,固定不同的 x 对应不同的 y 积分范围。不同 x 对应不同上下限,所以边缘密度是分段函数。
- 把"边缘"理解反了:X 的边缘是对 Y 求和/积分(消掉 Y),不是对 X 求和。记住:要消掉谁,就对谁求和/积分。
🛑 途中停顿:考考自己——求 X 的边缘分布时,你是对 X 求和还是对 Y 求和?用大白话说:你想消掉谁,就对谁求和/积分。现在不看笔记,你能说出来吗:求 $f_X(x)$ 时,积分变量是谁?求 $f_Y(y)$ 时呢?
这道题的配套练习(题3)已经就近放在 1.5 节的方法后面了,学完直接练。
题型三:判断独立性(⭐⭐⭐)
先看一道题:这两个变量,是"各过各的"吗?
设 (X,Y) 的联合分布律如下表,判断 X 与 Y 是否独立。
| X\Y | Y=0 | Y=1 |
|---|---|---|
| X=0 | 0.3 | 0.2 |
| X=1 | 0.2 | 0.3 |
看到这题,先别慌。难在哪?——"独立"是上一节 1.7 悟出的"联合 = 边缘乘积"。可要判一个结论,总不能只靠感觉,得逐格验证。
试着想——先算边缘分布(每行/每列求和):
- $P(X=0)=0.5$,$P(X=1)=0.5$
- $P(Y=0)=0.5$,$P(Y=1)=0.5$
再逐格检查"格子 = 行合计 × 列合计"。挑格子 (0,0):联合概率 = 0.3,边缘乘积 = 0.5×0.5 = 0.25。0.3 ≠ 0.25,不相等!
🧠 这一步在想什么:独立性是"一票否决制"——找到一个反例就推翻。不用查完所有格子,一个不相等就足够下结论了。
答案:X 与 Y 不独立。
再看一道(连续型):换个"衣服",同一个招
设 (X,Y) 的联合密度为:
$$f(x,y) = \begin{cases} 4xy, & 0<x<1, 0<y<1 \ 0, & \text{其他} \end{cases}$$
判断 X 与 Y 是否独立。
看到这题,先别慌。难在哪?——离散型是"格子 = 边缘乘积",连续型没有格子,但思想一样:联合密度 = 边缘密度乘积。而且这题区域是矩形 $0<x<1,;0<y<1$——第一关(形状)过了,可以往下算。
试着想——求边缘密度:
- $f_X(x) = \int_0^1 4xy,dy = 2x$($0<x<1$)
- $f_Y(y) = \int_0^1 4xy,dx = 2y$($0<y<1$)
再算乘积:$f_X(x)·f_Y(y) = 2x·2y = 4xy = f(x,y)$ ✓ 处处相等。
🧠 这一步在想什么:"矩形区域 + 密度可分离 → 独立"。如果区域不是矩形(三角形、圆形),直接判不独立,连算都不用算——这是最省力的速判法。
答案:X 与 Y 独立。
🔍 回头看看:这两道题背后,其实是同一个招
| 离散型 | 连续型 | |
|---|---|---|
| 判什么 | 每个格子 = 行合计×列合计 | 联合密度 = 边缘密度乘积 |
| 一票否决 | 找到一个格子不满足 → 不独立 | 有一处不相等 → 不独立 |
| 速判 | 表格直接逐格 | 先看区域:非矩形 → 不独立 |
📌 以后就这么办:判断独立性 = 验证"联合 = 边缘乘积"是否处处成立。 ① 离散型:算出两个边缘,逐格检查 $p_{ij} = p_{i\cdot}\times p_{\cdot j}$,一个不满足就判不独立;② 连续型:先看定义区域是不是矩形——非矩形直接判不独立;矩形再算两个边缘密度,验证乘积是否等于联合密度;③ 全部成立才判独立。
翻车现场:
- 只检查一个格子就说"独立":独立性要求所有位置都满足乘积关系。
- 混淆"不相关"和"独立":独立一定不相关,但不相关不一定独立。只有二维正态分布中两者等价。
- 连续型忘了检查适用范围:边缘密度各自的非零区域和联合密度的非零区域不同时,即使表达式相等也不独立。
🛑 途中停顿:先别往下翻——题目给的是离散表格还是连续密度?离散型要逐个格子检查"联合=边缘乘积"。连续型有个速判法:先看定义区域形状!不是矩形(比如三角形、圆形)→ 直接判不独立,根本不用算。为什么?因为区域形状暴露了 X 和 Y 互相"绑住"对方。
这两道的配套练习(题4、题5)已经就近放在 1.7 节的方法后面了,学完直接练。
题型四:求条件分布(⭐⭐)
先看一道题:限定"英语 0 分",数学怎么变?
设 (X,Y) 的联合分布律如下表。求在 Y=0 条件下 X 的条件分布律。
| X\Y | Y=0 | Y=1 | Y=2 |
|---|---|---|---|
| X=1 | 0.1 | 0.2 | 0.1 |
| X=2 | 0.2 | 0.3 | 0.1 |
看到这题,先别慌。难在哪?——"在 Y=0 的条件下"这半句,意味着我们要看的不是全校,而是"英语恰好 0 分"那一小撮人。可这张表里 Y=0 那一列的概率加起来只有 0.3,不是 1——不能直接用。
试着想——上一节 1.6 悟过:条件分布 = 联合 ÷ 边缘,竖线后面是谁,分母就是谁的边缘。条件是 Y=0,分母 = $P(Y=0) = 0.1+0.2 = 0.3$。然后把这列每个格子除以 0.3:
$$P(X=1|Y=0) = \frac{0.1}{0.3} = \frac{1}{3}, \quad P(X=2|Y=0) = \frac{0.2}{0.3} = \frac{2}{3}$$
验证:$\frac{1}{3} + \frac{2}{3} = 1$ ✓
🧠 这一步在想什么:"固定条件列,格子 ÷ 该列合计"——把这一列重新缩放到总和为 1,它就成了一个合法的概率分布。
答案:$P(X=1|Y=0)=1/3$,$P(X=2|Y=0)=2/3$
再看一道(连续型):这次是"密度相除",别忘了范围
设 (X,Y) 的联合密度为:
$$f(x,y) = \begin{cases} 8xy, & 0<x<y<1 \ 0, & \text{其他} \end{cases}$$
求条件密度 $f_{X|Y}(x|y)$。
看到这题,先别慌。难在哪?——连续型没有"格子",但公式不变:条件密度 = 联合密度 ÷ 边缘密度。竖线后面是 Y,分母就是 $f_Y(y)$。
试着想——第1步:前面已算过 $f_Y(y) = 4y^3$($0<y<1$)。第2步:当 $0<y<1$ 时:
$$f_{X|Y}(x|y) = \frac{f(x,y)}{f_Y(y)} = \frac{8xy}{4y^3} = \frac{2x}{y^2}$$
第3步(最容易漏!):x 的取值范围。从 $0<x<y<1$ 得 $0<x<y$——给定 Y=y 后,x 的范围被 y 限制了,不是原来的 $0<x<1$。
🧠 这一步在想什么:"分子是联合密度、分母是竖线后面变量的边缘密度;算完必须标 x 的范围"。漏标范围,条件密度就不完整。
答案:
$$f_{X|Y}(x|y) = \begin{cases} \dfrac{2x}{y^2}, & 0<x<y \ 0, & \text{其他} \end{cases}, \quad 0<y<1$$
🔍 回头看看:这两道题背后,其实是同一个招
| 离散型 | 连续型 | |
|---|---|---|
| 条件分布 = | 格子 ÷ 列合计 | 联合密度 ÷ 边缘密度 |
| 分母 | 竖线后面变量的边缘概率 | 竖线后面变量的边缘密度 |
| 验证 | 条件概率加起来 = 1 | 对 x 积分 = 1(y 当常数) |
📌 以后就这么办:求条件分布 = "联合 ÷ 竖线后面的边缘"。 ① 离散型:找条件列 → 求该列合计做分母 → 每个格子除以它;② 连续型:先求竖线后面变量的边缘密度 → 联合密度 ÷ 它;③ 记得:离散型验证总和为 1;连续型必须标注 x 的取值范围(受 y 约束)。
翻车现场:
- 离散型搞反分子分母:谁在竖线前面,谁在分子上;谁在竖线后面,谁的分母就是它的边缘概率。
- 连续型忘记标 x 的取值限制:比如联合密度在 $0<x<y<1$ 上,给定 $Y=y_0$ 后,x 范围是 $(0,y_0)$,不是 $(0,1)$。
- 连续型把 y 也当变量:条件密度中 y 是已知常数,x 才是变量。验证积分等于1时,是对 x 积分,y 当常数。
🛑 途中停顿:问自己三个问题:①竖线前面的是分子还是分母?②分母是谁的边缘概率?③连续型算完条件密度后,最容易漏掉什么?——答案是 x 的取值范围!给定 Y=y 后 x 能跑的范围会受到 y 的约束,不是原来的全范围。
这两道的配套练习(题6、题7)已经就近放在 1.6 节的方法后面了,学完直接练。
题型五:Z = X+Y 的分布——卷积公式(⭐⭐⭐)
先看一道题:两个均匀加起来,会长成什么样?
设 X 和 Y 独立同服从 [0,1] 上的均匀分布,求 Z = X+Y 的密度函数。
看到这题,先别慌。难在哪?——X 和 Y 都在 [0,1] 上,但 Z 的取值范围变了:最小 0+0=0,最大 1+1=2。可 Z 落在中间(比如 Z=1)的密度是多少?不能直接套单个变量的密度。
试着想——在 1.8 节悟过两条路:分布函数法(万能)和卷积公式(独立时)。这题 X、Y 独立,两条路都能走。先用分布函数法看全貌。
联合密度:在正方形 $[0,1]\times[0,1]$ 上为 1。先写出:
$$F_Z(z) = P(X+Y \leq z) = \iint_{x+y \leq z} f(x,y),dxdy$$
🧠 这一步在想什么:"先求分布函数 F,再求导得密度"——直接求密度太难,绕道。关键拐点在画图:直线 $x+y=z$ 与正方形的交集形状取决于 z 的大小,所以要分段。
当 $0 \leq z < 1$ 时:直线切过正方形左下角,积分区域是一个等腰直角三角形(顶点在 (0,0)、(z,0)、(0,z)):
$$F_Z(z) = \int_0^z \int_0^{z-x} 1 ,dy,dx = \int_0^z (z-x),dx = \left[zx - \frac{x^2}{2}\right]_0^z = \frac{z^2}{2}$$
当 $1 \leq z < 2$ 时:积分区域是正方形减去右上角的小三角形。更简单的做法是算右上角空白的面积:
$$F_Z(z) = 1 - \int_{z-1}^1 \int_{z-x}^1 1 ,dy,dx = 1 - \int_{z-1}^1 (1-z+x),dx$$
计算后半部分:
$$\int_{z-1}^1 (1-z+x),dx = \left[(1-z)x + \frac{x^2}{2}\right]_{z-1}^1 = \frac{(2-z)^2}{2}$$
所以 $F_Z(z) = 1 - \frac{(2-z)^2}{2}$。
当 $z<0$:$F_Z(z)=0$;当 $z \geq 2$:$F_Z(z)=1$。
求导得密度:
$$f_Z(z) = \begin{cases} z, & 0 \leq z < 1 \ 2-z, & 1 \leq z < 2 \ 0, & \text{其他} \end{cases}$$
这就是三角分布——从0线性上升到1,再从1线性下降到2。
🧠 这一步在想什么:分布函数法的灵魂是"分段画图"——直线 x+y=z 扫过正方形,形状不同,积分区域就不同。每一段都要画对,漏一段就错一段。
再看一道(这次用卷积,更快)
设 X 和 Y 独立同服从参数为 $\lambda$ 的指数分布,求 Z = X+Y 的密度。
看到这题,先别慌。难在哪?——指数分布支持域是 $x>0$,卷积的积分上下限得跟着变,不能照抄 $(-\infty,+\infty)$。
试着想——这题 X、Y 独立,可以用卷积公式:$f_X(x)=\lambda e^{-\lambda x}$($x>0$),$f_Y(y)=\lambda e^{-\lambda y}$($y>0$)。被积函数非零要求 $x>0$ 且 $z-x>0$,所以 x 从 0 到 z。当 $z>0$ 时:
$$f_Z(z) = \int_0^z \lambda e^{-\lambda x} \cdot \lambda e^{-\lambda (z-x)} , dx = \lambda^2 e^{-\lambda z} \int_0^z 1,dx = \lambda^2 z e^{-\lambda z}$$
🧠 这一步在想什么:"独立 → 卷积一重积分;积分上下限由两个非零区域决定"。$e^{-\lambda x}\cdot e^{-\lambda(z-x)}$ 约成 $e^{-\lambda z}$(和 x 无关),积分立刻变简单。
答案:$f_Z(z) = \begin{cases} \lambda^2 z e^{-\lambda z}, & z>0 \ 0, & z\leq0 \end{cases}$
这是伽马分布 $Ga(2,\lambda)$。
🔍 回头看看:两条路,什么时候走哪条?
| 情况 | 推荐方法 | 原因 |
|---|---|---|
| X 和 Y 独立,且联合密度比较简单 | 卷积公式 | 一重积分,计算量小 |
| X 和 Y 不独立,或联合密度复杂 | 分布函数法 | 万能,什么情况都能用 |
| 不确定用哪个 | 分布函数法 | 稳,不会错 |
📌 以后就这么办:拿到 Z=X+Y,先问"X 和 Y 独立吗?" ① 独立 → 卷积公式 $f_Z(z)=\int f_X(x)f_Y(z-x),dx$(一重积分,快);② 不独立或没把握 → 分布函数法 $F_Z(z)=\iint_{x+y\leq z}f(x,y),dxdy$ 再求导(二重积分,稳);③ 无论哪条路,都要按 z 分段讨论积分上下限,算完标注 z 的取值范围。
翻车现场:
- 积分上下限写错:卷积积分范围是两个函数都非零的 x 的重叠区域。这个区域取决于 z,需要分段讨论。
- 忘了 $f_Y(z-x)$ 的非零条件:比如 $f_Y(y)$ 只在 (0,1) 上非零,则要求 $0<z-x<1$,即 $z-1<x<z$。
- 求完密度不写取值范围:$f_Z(z)$ 必须标明在什么 z 范围内有效。
经典结论速记:
- 两个 $U(0,1)$ 的和 → 三角分布
- 两个 $E(\lambda)$ 的和 → $Ga(2,\lambda)$
- 两个独立正态的和 → 正态(均值方差各自相加)
🛑 途中停顿:拿到题目先看一个关键信息——题目明说了"X 和 Y 独立"吗?独立 → 用卷积公式(一重积分,快);没明确说独立 → 老老实实用分布函数法(二重积分,稳)。你手头这道题该走哪条路?
这两道的配套练习(题8、题9)已经就近放在 1.8 节的方法后面了,学完直接练。
题型六:max与min的分布(⭐⭐)
先看一道题:两个变量的"最好"和"最差",分布是什么?
设 X 与 Y 独立,X ~ (0:0.3, 1:0.7),Y ~ (0:0.4, 1:0.6)。求 M = max(X,Y) 和 N = min(X,Y) 的分布律。
看到这题,先别慌。难在哪?——X 和 Y 都能取 0 或 1,但 max 和 min 把两个数的关系搅在一起:M=0 要"两个都取 0";N=0 只要"至少一个取 0"。"至少一个"比"两个都"难算。
试着想——max 可以直来直去:$M \leq 0$ 等价于"X 和 Y 都 ≤ 0",独立时概率相乘:
$$P(M\leq0) = P(X\leq0,Y\leq0) = 0.3\times0.4 = 0.12$$
但 min 必须绕道:"N ≤ 0"是"至少一个取 0",不好直接乘。反过来想——先求"N > 0",那才是干净的"两个都 > 0":
$$P(N>0) = P(X>0,Y>0) = 0.7\times0.6 = 0.42$$
再用 1 减回来:$P(N=0) = 1 - 0.42 = 0.58$。
🧠 这一步在想什么:"max 乘正概率(≤ z),min 乘反概率(> z)再反回来"。这就是上一节 1.8 悟出的"正门直入 / 后门绕道"。
答案:$M\sim(0:0.12, 1:0.88)$,$N\sim(0:0.58, 1:0.42)$
🔍 回头看看:max 和 min 到底差在哪?
| max | min | |
|---|---|---|
| 关键等价 | $M \leq z \iff$ 所有人都 $\leq z$ | $N > z \iff$ 所有人都 $> z$ |
| 独立同分布 | $F_M(z) = [F(z)]^n$ | $F_N(z) = 1-[1-F(z)]^n$ |
| 路径 | 直来直去(正门) | 绕道而行(后门) |
📌 以后就这么办:碰到 max/min,先分清走正门还是后门。 ① max:$F_M(z) = P(M\leq z) = P(\text{所有}\leq z)$,独立就概率相乘(同分布再写成 $[F(z)]^n$);② min:不许直接写 $P(N\leq z)=P(X\leq z,Y\leq z)$——那是错的!要先求 $P(N>z)=P(\text{所有}>z)$,再用 1 减(同分布写成 $1-[1-F(z)]^n$);③ 串联系统用 min、并联系统用 max。
翻车现场:
- min 的坑(高频错误!):直接写 $F_N(z) = P(X\leq z, Y\leq z)$——错的! $\min\leq z$ 是"只要有一个不超过 z",不是"两个都不超过 z"。必须用 $1-P(N>z)$ 绕一下。
- 把 max 和 min 的公式记反:max 的分布函数是各自分布函数的乘积;min 是 1 减各自生存函数的乘积。
🛑 途中停顿:最容易搞混的两个公式——max 和 min,你能默写出来吗?max≤z 等价于"所有都≤z"→ 分布函数直接相乘。min 不能直接乘!min≤z 必须绕道:先算"所有都>z",再用 1 减。串联用 min(最弱决定),并联用 max(最强撑住)。用你自己的话说一遍。
这三道的配套练习(题10、题11、题12)已经就近放在 1.8 节的方法后面了,学完直接练。
题型七:二维均匀分布与二维正态分布(⭐⭐)
7A. 二维均匀分布
先看一道题:圆上的均匀分布,边缘还是均匀吗?
设 (X,Y) 在单位圆 $x^2+y^2\leq1$ 上服从均匀分布。(1)写出联合密度;(2)求 X 的边缘密度;(3)求 $P(X>0, Y>0)$。
看到这题,先别慌。难在哪?——"均匀"意味着落在每个位置的密度一样,所以联合密度在圆内是个常数。但这个常数多大?得靠"全平面积分=1"逼出来。
试着想——(1) 圆的面积 = $\pi$,由归一化条件,圆内密度必须满足 密度 × 面积 = 1,所以 $f(x,y)=1/\pi$($x^2+y^2\leq1$)。
🧠 这一步在想什么:二维均匀分布的密度 = 1/区域面积。第(2)问就暴露一个陷阱:圆不是矩形,X 的边缘密度不是常数!固定 x(-1<x<1),y 的范围 $-\sqrt{1-x^2}\leq y\leq\sqrt{1-x^2}$:
$$f_X(x) = \int_{-\sqrt{1-x^2}}^{\sqrt{1-x^2}} \frac{1}{\pi},dy = \frac{2}{\pi}\sqrt{1-x^2}$$
带根号,根本不是常数。(3)$P(X>0,Y>0) = \frac{\text{四分之一圆面积}}{\text{圆面积}} = \frac{\pi/4}{\pi} = \frac{1}{4}$——均匀分布算概率,就是算面积比。
答案:(1)$f=1/\pi$(2)$f_X(x)=\frac{2}{\pi}\sqrt{1-x^2}$(3)1/4
📌 以后就这么办:看到二维均匀分布,三步走。 ① 确定区域 D 的形状(矩形、三角形、圆形等);② 计算 D 的面积 |D|,密度就是 $1/|D|$;③ 求边缘/条件/概率时,固定一个变量对另一个积分(连续)或算面积比,注意非矩形区域的边缘密度往往不是常数。
7B. 二维正态分布
先看一道题:ρ=0.5,这两个变量独立吗?
设 $(X,Y)\sim N(0,1;0,4;0.5)$。判断:(1)X 与 Y 独立?(2)X+Y 服从正态?(3)若 $\rho=0$ 则独立?(4)2X-Y 服从正态?
看到这题,先别慌。难在哪?——(X,Y) 服从二维正态,它身上的每个小结论都可能在"一般分布不成立、唯独二维正态成立"的边缘。第(3)问尤其阴:一般分布里 $\rho=0$ 只说明"不相关",不能说明"独立";但二维正态里 $\rho=0$ 就等价于独立——这是它的独有性质。
试着想——(1)$\rho=0.5\neq0$,不独立。(2)对,$X+Y\sim N(0,7)$(二维正态线性组合永远是正态)。(3)对,二维正态独有性质:$\rho=0\iff$独立。(4)对,线性组合仍是正态,$2X-Y\sim N(0,4)$。
🧠 这一步在想什么:二维正态的四大性质——独立⇔ρ=0、边缘正态、条件正态、线性组合仍正态——前三条在 1.9 节见过,第(4)条"线性组合仍是正态"是这节考得最多的大题基础。
答案:(1)错(2)对(3)对(4)对
📌 以后就这么办:看到二维正态,先对号四大性质。 ① 边缘:$X \sim N(\mu_1, \sigma_1^2)$,$Y \sim N(\mu_2, \sigma_2^2)$;② 独立 ⇔ $\rho=0$(二维正态独有!);③ 条件分布也是正态;④ 线性组合 $aX+bY$ 仍是正态。另外记住陷阱:两个边缘都是正态,不代表联合是二维正态。
翻车现场:
- 均匀分布——边缘密度是常数?错! 比如三角形区域上的二维均匀分布,边缘密度一般不是常数。别想当然。
- 正态分布——$\rho=0$ 只能说"不相关",不能说"独立"? 对一般分布是对的,但对二维正态,$\rho=0$ 意味着独立!
- 边缘正态 ≠ 联合正态:两个边缘分布都是正态,不代表联合分布是二维正态。
🛑 途中停顿:两个高频陷阱,看你能不能识破:①圆形/三角形区域上的二维均匀分布,边缘密度是常数吗?(不是!圆形边缘带 $\sqrt{1-x^2}$)②二维正态独有的那条性质是什么?提示:对一般分布不成立,唯独二维正态成立。(答案:$\rho=0 \iff$ 独立)
这三道的配套练习(题13、题14、题15)已经就近放在 1.9 节的方法后面了,学完直接练。
🧪 学完自测(4选择 + 2判断 + 4简答)
混搭全章知识点,检验你是不是真懂了。答案全部折叠,先自己做再看。
选择题1:下列哪个区域上的二维均匀分布,X 与 Y 一定独立?
A. 正方形 $0<x<1, 0<y<1$
B. 三角形 $0<x<1, 0<y<1-x$
C. 圆形 $x^2+y^2 \leq 1$
D. 以上都不独立
点击看答案
A。 只有矩形区域(且边与坐标轴平行)上的二维均匀分布,X 与 Y 才独立。三角形和圆形区域上 X 的取值会限制 Y 的范围,所以不独立。
选择题2:关于二维正态分布,下列说法错误的是:
A. 边缘分布都是一维正态分布
B. $\rho=0$ 时 X 与 Y 独立
C. 两个边缘都是正态,则联合分布一定是二维正态
D. X+Y 也服从正态分布
点击看答案
C。 这是考研高频陷阱。两个边缘都是正态,不代表联合是二维正态。必须明确说"服从二维正态分布"才行。A、B、D 都是二维正态的正确性质。
选择题3:$\min(X,Y) \leq z$ 的概率,正确做法是:
A. $P(X \leq z) \cdot P(Y \leq z)$
B. $1 - P(X > z) \cdot P(Y > z)$
C. $P(X \leq z) + P(Y \leq z)$
D. $[F(z)]^2$
点击看答案
B。 min 不能直接写乘积(那是 max 的做法)。必须绕道:先算"两个都 > z"的概率,再用 1 减。选项 A 和 D 是 max 的公式。
选择题4:已知联合分布律如下,X 与 Y 是否独立?
| X\Y | Y=0 | Y=1 |
|---|---|---|
| X=0 | 0.3 | 0.2 |
| X=1 | 0.2 | 0.3 |
A. 独立,因为所有概率加起来等于 1
B. 独立,因为每个格子都是边缘的乘积
C. 不独立,因为 P(X=0,Y=0) ≠ P(X=0)·P(Y=0)
D. 无法判断
点击看答案
C。 $P(X=0)=0.5$,$P(Y=0)=0.5$,乘积 $=0.25$,但实际 $P(X=0,Y=0)=0.3 \neq 0.25$。找到一个反例就够判不独立了。
判断题1:卷积公式 $f_Z(z)=\int f_X(x)\cdot f_Y(z-x),dx$ 只在 X 和 Y 独立时才能使用。
点击看答案
对。 卷积公式依赖"联合 = 边缘乘积",这正是独立条件。不独立时必须用分布函数法(二重积分)。
判断题2:二维均匀分布中,X 的边缘密度也是均匀分布。
点击看答案
错。 比如三角形区域上的二维均匀分布,边缘密度是线性函数(不是常数)。圆形区域的边缘密度含 $\sqrt{1-x^2}$。别想当然!
简答题1:用自己的话解释——为什么"边缘分布一般不能反推联合分布"?在你解释时,举一个具体的例子来说明。
点击看答案
要点:边缘分布只告诉你 X 单独是什么样的、Y 单独是什么样的,但丢掉了 X 和 Y 之间"怎么配合"的信息。比如两个班的数学和英语边缘分布完全相同,但一个班"数学好的人英语也好"(正相关),另一个班"数学好的英语反而差"(负相关)——它们的联合分布完全不同。所以光看边缘分不出这两个班。唯一的例外是 X 和 Y 独立时,联合 = 边缘乘积,可以从边缘反推联合。
简答题2:串联电路和并联电路中,系统寿命分别对应 max 还是 min?为什么?用大白话说出两者的公式推导思路。
点击看答案
串联 = min(最脆弱的元件决定系统寿命,一个坏就全坏)。推导:先算 $P(\min > z)$ = "所有元件都 > z" = $(1-F(z))^n$,然后 $F_N(z)=1-$ 这个结果。
并联 = max(最坚挺的元件撑到最后,全坏才坏)。推导:直接算 $P(\max \leq z)$ = "所有元件都 ≤ z" = $[F(z)]^n$。
关键区别:min 必须绕道(用 1 减),max 直接乘。
简答题3:二维正态分布的沙子山包比喻中,$\rho=0$ 时山是什么形状?这和"X 与 Y 独立"有什么关系?
点击看答案
$\rho=0$ 时山是圆形的——没有倾斜,X 方向和 Y 方向完全对称。这意味着知道 X 的取值无法推断 Y 更可能在哪边(正方向还是负方向),两个方向的信息互不影响——这正是"独立"的直观含义。这也是二维正态独有性质:$\rho=0$ 直接等价于独立,其他分布没有这个等价关系。
简答题4:求连续型条件密度 $f_{X|Y}(x|y)$ 时,最容易漏掉的两件事是什么?
点击看答案
最容易漏掉的两件事:
- 忘记标注 x 的取值范围——给定 $Y=y$ 后,x 能跑的范围会受到 y 的约束。比如联合密度在 $0<x<y<1$ 上,给定 $Y=0.5$ 后 x 范围是 $(0, 0.5)$,不是 $(0, 1)$。
- 忘记分母 $f_Y(y)$ 必须在 y 处大于 0——如果 $f_Y(y)=0$,说明这个 y 根本不可能出现,你没法在不可能发生的条件下讨论别的变量。
③ 综合混搭练习
打乱题型,逼你自己判断用哪个方法。以下四道题混合了本章的多个题型。
混搭1 🎲(题型一+二+三+四:离散型联合分布综合)
已知二维离散型随机变量 (X,Y) 的联合分布律如下表:
| X\Y | 0 | 1 |
|---|---|---|
| 0 | 0.1 | b |
| 1 | a | 0.3 |
且已知 $P(X=1)=0.5$。
(1)求参数 a 和 b 的值;
(2)求 X 和 Y 的边缘分布律;
(3)判断 X 和 Y 是否独立;
(4)求在 Y=1 条件下 X 的条件分布律。
点击看答案
(1)求 a 和 b
已知 $P(X=1)=a+0.3=0.5$,所以 $a=0.2$。
归一化:$0.1+b+0.2+0.3=1$,所以 $b=0.4$。
完整表格:
| X\Y | 0 | 1 |
|---|---|---|
| 0 | 0.1 | 0.4 |
| 1 | 0.2 | 0.3 |
(2)边缘分布
$P(X=0)=0.1+0.4=0.5$,$P(X=1)=0.5$
$P(Y=0)=0.1+0.2=0.3$,$P(Y=1)=0.4+0.3=0.7$
(3)判断独立性
检查 (X=0, Y=0):$P=0.1$,$P(X=0)P(Y=0)=0.5\times0.3=0.15$
$0.1\neq0.15$,所以不独立。
(4)条件分布
$P(Y=1)=0.7$
$P(X=0|Y=1)=0.4/0.7=4/7$
$P(X=1|Y=1)=0.3/0.7=3/7$
答案:(1)$a=0.2, b=0.4$(2)X: (0:0.5, 1:0.5), Y: (0:0.3, 1:0.7)(3)不独立(4)$X|Y=1$: (0:4/7, 1:3/7)
混搭2 🔄(题型一+二+四+七:三角形区域均匀分布)
设 (X,Y) 在由 $x=0$、$y=0$、$x+y=1$ 围成的三角形区域上服从均匀分布。
(1)写出联合密度函数 $f(x,y)$;
(2)求 X 的边缘密度 $f_X(x)$;
(3)求条件密度 $f_{Y|X}(y|x)$;
(4)求 $P(Y>0.5;|;X=0.25)$。
点击看答案
(1)联合密度
三角形顶点 (0,0), (1,0), (0,1),面积 = 1/2。
$$f(x,y)=\begin{cases}2,&0<x<1,;0<y<1-x\0,&\text{其他}\end{cases}$$
(2)X的边缘密度
固定 x($0<x<1$),y 从 0 到 $1-x$:
$$f_X(x)=\int_0^{1-x}2,dy=2(1-x),\quad 0<x<1$$
(3)条件密度
$$f_{Y|X}(y|x)=\frac{f(x,y)}{f_X(x)}=\frac{2}{2(1-x)}=\frac{1}{1-x},\quad 0<y<1-x$$
给定 X=x 后,Y 在 $(0,1-x)$ 上均匀分布。
(4)$P(Y>0.5|X=0.25)$
给定 X=0.25,Y 在 $(0,0.75)$ 上均匀分布,密度 $=1/0.75=4/3$。
$$P(Y>0.5|X=0.25)=\frac{0.75-0.5}{0.75}=\frac{0.25}{0.75}=\frac{1}{3}$$
答案:(1)$f=2$(2)$f_X(x)=2(1-x)$(3)$f_{Y|X}(y|x)=1/(1-x)$(4)1/3
混搭3 🧩(题型五+七:正态分布性质与卷积)
设 XN(1,4),YN(2,9),且 X 与 Y 相互独立。
(1)求 Z = X+Y 的分布;
(2)求 $P(Z>3)$(用标准正态分布函数 $\Phi$ 表示);
(3)如果 X 和 Y 不独立,相关系数 $\rho=0.5$,Z = X+Y 还服从正态分布吗?
点击看答案
(1)Z 的分布
独立正态的和仍是正态。$E(Z)=1+2=3$,$Var(Z)=4+9=13$。
所以 $Z\sim N(3,13)$。
(2)$P(Z>3)$
$$P(Z>3)=P\left(\frac{Z-3}{\sqrt{13}}>0\right)=1-\Phi(0)=1-0.5=0.5$$
因为对称性,正态分布大于其均值的概率正好是 0.5。
(3)不独立时
仍然服从正态分布!二维正态的线性组合永远是正态,不管 $\rho$ 是多少。
方差用到第 4 章的公式——先记结论:和的方差 = 各自方差 + 交叉项(完整公式第 4 章正式学),套进来算:$Var(Z)=4+9+2\times0.5\times\sqrt{4\times9}=13+6=19$。
$Z\sim N(3,19)$。
答案:(1)$Z\sim N(3,13)$(2)0.5(3)是,$Z\sim N(3,19)$
混搭4 🎯(题型五+六:指数分布综合)
设某设备有两个独立工作的核心部件,寿命(单位:千小时)分别为 $X\sim\text{Exp}(1)$,$Y\sim\text{Exp}(2)$(参数 $\lambda$ 越大,平均寿命越短)。
(1)求 $X$ 和 $Y$ 的平均寿命;
(2)若系统为串联(任一部件失效则系统失效),求系统寿命 $N=\min(X,Y)$ 的分布;
(3)若系统为并联(两部件都失效才失效),求系统寿命 $M=\max(X,Y)$ 的分布函数 $F_M(t)$;
(4)求串联系统的平均寿命。
点击看答案
(1)平均寿命
指数分布 $E(\lambda)$ 的均值 $=1/\lambda$。
$E(X)=1$(千小时),$E(Y)=1/2=0.5$(千小时)。
(2)串联(min)
$F_N(t)=1-[1-F_X(t)][1-F_Y(t)]=1-e^{-t}·e^{-2t}=1-e^{-3t}$($t>0$)
所以 $N\sim\text{Exp}(3)$,密度 $f_N(t)=3e^{-3t}$。
(3)并联(max)
$F_M(t)=F_X(t)·F_Y(t)=(1-e^{-t})(1-e^{-2t})$($t>0$)
展开:$F_M(t)=1-e^{-t}-e^{-2t}+e^{-3t}$。
(4)串联平均寿命
$E(N)=1/3\approx0.333$(千小时)≈ 333 小时。
单个元件平均寿命已经是 1 和 0.5,串联后降到 0.333——"短板效应"很明显。
答案:(1)1千小时, 0.5千小时(2)$N\sim\text{Exp}(3)$(3)$F_M(t)=1-e^{-t}-e^{-2t}+e^{-3t}$(4)0.333千小时
🔄 回马枪题(第1-2章回顾)
学新知识容易忘旧知识。下面4道题把第1-2章的内容拉到本章场景里交叉练习——旧知识不白学,新知识更牢固。
🔄 回马枪1 — 全概率+贝叶斯 × 联合分布(第1章)
某工厂有两条生产线:甲线产量占 70%,次品率 10%;乙线产量占 30%,次品率 5%。
(1)用全概率公式求随机抽一件产品是次品的概率。
(2)已知抽到一件次品,用贝叶斯公式求它来自甲线的概率。
(3)随机抽一件产品,定义 X = 1(甲线)/ 0(乙线),Y = 1(次品)/ 0(正品)。写出 (X,Y) 的联合分布律(四格表),并判断 X 和 Y 是否独立。
点击看答案
(1)全概率公式
记 A = "来自甲线",B = "次品"。
$$P(B) = P(B|A)P(A) + P(B|\bar{A})P(\bar{A}) = 0.10 \times 0.70 + 0.05 \times 0.30 = 0.07 + 0.015 = 0.085$$
(2)贝叶斯公式
$$P(A|B) = \frac{P(B|A)P(A)}{P(B)} = \frac{0.10 \times 0.70}{0.085} = \frac{0.07}{0.085} = \frac{14}{17} \approx 0.824$$
大白话:虽然甲线次品率更高(10% vs 5%),但"已知是次品→来自甲线"的概率高达82.4%——因为甲线产量大(70%),产出的次品绝对数量多。
(3)联合分布律
| X\Y | Y=0(正品) | Y=1(次品) |
|---|---|---|
| X=0(乙线) | 0.285 | 0.015 |
| X=1(甲线) | 0.630 | 0.070 |
验算:0.285+0.015+0.630+0.070 = 1.000 ✓
判断独立性:检查 (X=1, Y=1) 这个格子——
- 联合概率:$P(1,1) = 0.070$
- 边缘乘积:$P(X=1) \times P(Y=1) = 0.70 \times 0.085 = 0.0595$
$0.070 \neq 0.0595$,所以 X 和 Y 不独立。直观理解:甲线的次品率比乙线高,所以"来自哪条线"的信息会改变你对"是不是次品"的判断——两者有联系。
答案:(1)0.085(2)14/17 ≈ 0.824(3)不独立
🔄 回马枪2 — 一维分布函数性质(第2章)
关于分布函数 $F(x) = P{X \leq x}$,以下哪个选项一定正确?
A. $F(x)$ 在 $(-\infty, +\infty)$ 上处处连续
B. $F(x)$ 是严格单调递增的函数
C. $\lim\limits_{x \to -\infty} F(x) = 0$,$\lim\limits_{x \to +\infty} F(x) = 1$
D. $F(x)$ 的值可以大于 1
点击看答案
逐项分析:
- A ❌:离散型随机变量的分布函数是阶梯函数(有跳跃),只在跳跃点之间连续。比如 X 只取 0 和 1,$F(x)$ 在 x=0 和 x=1 处有跳跃——不连续。
- B ❌:分布函数是"单调不减",不是"严格单调递增"。在随机变量取不到值的区间(比如离散型两个取值之间的区间),$F(x)$ 是常数。常数的区间里不"严格递增"。
- C ✅:这是分布函数的基本性质——x 越来越小,概率趋于 0(几乎不可能比负无穷还小);x 越来越大,概率趋于 1(几乎肯定不超过正无穷)。
- D ❌:$F(x)$ 是概率,概率永远在 $[0, 1]$ 之间,不可能大于 1。
答案:C
🐱 大白话:分布函数就是一个"累计概率计数器"——从最左边(-∞)开始是 0,一路往右走,计数器只增不减,走到最右边(+∞)刚好到 1。中间可能有平台(概率不变),也可能有跳跃(概率突然增加)。这就是分布函数的"画像"。
🔄 回马枪3 — 正态标准化 × 多维场景(第2章)
设 $X \sim N(2, 4)$,$Y \sim N(1, 9)$,且 X 与 Y 相互独立。
(1)$Z = X + Y$ 服从什么分布?写出均值和方差。
(2)求 $P(Z > 5)$,用标准正态分布函数 $\Phi(\cdot)$ 表示。
(3)求 $P(X > Y)$,用 $\Phi(\cdot)$ 表示。(提示:考虑 $W = X - Y$,W 也是正态分布。)
点击看答案
(1)Z 的分布
独立正态的和仍是正态。
- $E(Z) = E(X) + E(Y) = 2 + 1 = 3$
- $Var(Z) = Var(X) + Var(Y) = 4 + 9 = 13$
所以 $Z \sim N(3, 13)$。
(2)$P(Z > 5)$
标准化:$\frac{Z - 3}{\sqrt{13}} \sim N(0, 1)$
$$P(Z > 5) = P!\left(\frac{Z - 3}{\sqrt{13}} > \frac{5 - 3}{\sqrt{13}}\right) = 1 - \Phi!\left(\frac{2}{\sqrt{13}}\right)$$
(3)$P(X > Y)$
$W = X - Y$ 也是正态分布(独立正态的线性组合仍是正态):
- $E(W) = 2 - 1 = 1$
- $Var(W) = Var(X) + (-1)^2 Var(Y) = 4 + 9 = 13$
所以 $W \sim N(1, 13)$。
$$P(X > Y) = P(W > 0) = P!\left(\frac{W - 1}{\sqrt{13}} > \frac{0 - 1}{\sqrt{13}}\right) = 1 - \Phi!\left(\frac{-1}{\sqrt{13}}\right) = \Phi!\left(\frac{1}{\sqrt{13}}\right)$$
最后一步用了 $\Phi(-z) = 1 - \Phi(z)$。
答案:(1)$Z \sim N(3, 13)$(2)$1 - \Phi(2/\sqrt{13})$(3)$\Phi(1/\sqrt{13})$
🔄 回马枪4 — 二项分布 × 多维组合(第2章)
设 $X \sim B(2,\ 0.6)$,$Y \sim B(3,\ 0.4)$,且 X 与 Y 相互独立。
(1)分别写出 X 和 Y 的边缘分布律(列出所有可能取值及概率)。
(2)求 $P(X = Y)$。
(3)求 $Z = X + Y$ 的分布律。
点击看答案
(1)边缘分布律
X ~ B(2, 0.6):$P(X=k) = C_2^k \cdot 0.6^k \cdot 0.4^{2-k}$
| X | 0 | 1 | 2 |
|---|---|---|---|
| P | $0.4^2=0.16$ | $2\times0.6\times0.4=0.48$ | $0.6^2=0.36$ |
Y ~ B(3, 0.4):$P(Y=k) = C_3^k \cdot 0.4^k \cdot 0.6^{3-k}$
| Y | 0 | 1 | 2 | 3 |
|---|---|---|---|---|
| P | $0.6^3=0.216$ | $3\times0.4\times0.36=0.432$ | $3\times0.16\times0.6=0.288$ | $0.4^3=0.064$ |
(2)$P(X = Y)$
由于 X 最大取 2、Y 最大取 3,X=Y 只可能是 0, 1, 2。利用独立性 $P(X=k, Y=k) = P(X=k) \cdot P(Y=k)$:
$$P(X=Y) = 0.16 \times 0.216 + 0.48 \times 0.432 + 0.36 \times 0.288$$
$$= 0.03456 + 0.20736 + 0.10368 = 0.3456$$
(3)$Z = X+Y$ 的分布律
Z 取值为 0~5。利用离散卷积:$P(Z=k) = \sum_i P(X=i) \cdot P(Y=k-i)$
| Z | 计算过程 | 结果 |
|---|---|---|
| 0 | $P(0,0)=0.16\times0.216$ | 0.03456 |
| 1 | $P(0,1)+P(1,0)=0.16\times0.432+0.48\times0.216$ | 0.17280 |
| 2 | $P(0,2)+P(1,1)+P(2,0)$ | 0.33120 |
| 3 | $P(0,3)+P(1,2)+P(2,1)$ | 0.30400 |
| 4 | $P(1,3)+P(2,2)=0.48\times0.064+0.36\times0.288$ | 0.13440 |
| 5 | $P(2,3)=0.36\times0.064$ | 0.02304 |
验算:0.03456+0.17280+0.33120+0.30400+0.13440+0.02304 = 1.00000 ✓
答案:(1)见上表(2)0.3456(3)见上表
🎯 考试导航
| 题型 | 考频 | 常见出题形式 | 备考建议 |
|---|---|---|---|
| 求联合分布中的未知参数 | ⭐⭐⭐ | 选择/填空,给表格或密度求常数 | 归一化条件是基本功。连续型先画图定区域再积分 |
| 判断独立性 | ⭐⭐⭐ | 概念题或计算题中的一小问 | 离散型逐个格子检查。连续型先看区域形状——非矩形大多不独立 |
| Z=X+Y的分布(卷积公式) | ⭐⭐⭐ | 大题,考研重点 | 分清用分布函数法还是卷积法。注意分段讨论和积分上下限 |
| 求条件分布 | ⭐⭐ | 大题中的一部分 | 连续型最容易漏标注x的取值范围。分母不能为0 |
| 求边缘分布 | ⭐⭐ | 计算题基础操作 | 连续型边缘密度一定是分段函数!算完一定要标范围并验证积分=1 |
| max/min的分布 | ⭐⭐ | 应用题(串联/并联系统) | min公式一定要绕道 $P(N>z)$。记清:max乘积,min补乘积 |
| 二维均匀与二维正态 | ⭐⭐ | 性质概念题 | 二维正态独有性质:独立⇔ρ=0。均匀的边缘一般不是均匀! |
解题公式速查
| 题型 | 核心公式 |
|---|---|
| 归一化(离散) | $\sum_i\sum_j p_{ij}=1$ |
| 归一化(连续) | $\iint f(x,y),dxdy=1$ |
| 边缘(离散) | $p_{i\cdot}=\sum_j p_{ij}$,$p_{\cdot j}=\sum_i p_{ij}$ |
| 边缘(连续) | $f_X(x)=\int f(x,y)dy$,$f_Y(y)=\int f(x,y)dx$ |
| 独立性 | $F(x,y)=F_X(x)F_Y(y)$ 或 $f(x,y)=f_X(x)f_Y(y)$ |
| 条件(离散) | $P(X=x_i |
| 条件(连续) | $f_{X |
| 卷积(独立时) | $f_Z(z)=\int f_X(x)f_Y(z-x)dx$ |
| max分布 | $F_M(z)=[F(z)]^n$(独立同分布) |
| min分布 | $F_N(z)=1-[1-F(z)]^n$(独立同分布) |
练习题型对照表
配套练习已就近放在对应知识块后面(方法讲完立刻练)。下表标注每道练习的当前位置。
| 题号 | 难度 | 所属题型 | 核心考点 | 现在的位置 |
|---|---|---|---|---|
| 1 | ⭐ | 题型一+二 | 离散联合律:归一化+边缘求和 | 1.5 节边缘分布后 |
| 2 | ⭐ | 题型一 | 连续归一化:二重积分求参数 | 1.4 节联合密度后 |
| 3 | ⭐ | 题型二 | 连续边缘密度:注意三角形区域 | 1.5 节边缘分布后 |
| 4 | ⭐ | 题型三 | 离散独立性:找到反例即不独立 | 1.7 节独立性后 |
| 5 | ⭐⭐ | 题型三 | 连续独立性:密度可分离变量 | 1.7 节独立性后 |
| 6 | ⭐ | 题型四 | 离散条件分布:联合÷边缘 | 1.6 节条件分布后 |
| 7 | ⭐⭐ | 题型四 | 连续条件密度:先求边缘再代入 | 1.6 节条件分布后 |
| 8 | ⭐⭐ | 题型五 | 卷积公式:U(0,1)和→三角分布 | 1.8 节卷积后 |
| 9 | ⭐⭐⭐ | 题型五 | 正态可加性:和仍是正态 | 1.8 节卷积后 |
| 10 | ⭐ | 题型六 | max分布:独立同分布指数 | 1.8 节 max/min 后 |
| 11 | ⭐⭐ | 题型六 | min分布:不同区间需分段 | 1.8 节 max/min 后 |
| 12 | ⭐⭐⭐ | 题型六 | 应用:串联min/并联max | 1.8 节 max/min 后 |
| 13 | ⭐⭐ | 题型七 | 二维均匀:三角形区域几何概率 | 1.9 节二维均匀后 |
| 14 | ⭐⭐ | 题型七 | 二维正态:ρ=0→独立 | 1.9 节二维正态后 |
| 15 | ⭐⭐⭐ | 题型七 | 综合:圆域均匀全部性质 | 1.9 节二维正态后 |
📋 自检清单
学完这章,你应该能回答下面这些问题。如果哪个答不上来,回到对应小节重新看。
- 一维随机变量和二维随机变量,研究的重点有什么本质不同?二维的"新"在哪里?
- 联合分布函数 F(x,y) = P{X≤x, Y≤y} 中,逗号在概率里是什么意思?
- 联合分布函数的四条性质中,哪一条是二维特有的(一维没有对应物)?
- 给你一张联合分布律表,能不能在 30 秒内算出 X 和 Y 各自的边缘分布?
- 边缘分布能唯一确定联合分布吗?什么情况下能?什么情况下不能?
- 条件分布和边缘分布有什么区别?条件分布的分母能为 0 吗?
- "独立"用联合分布和边缘分布的关系怎么表达?离散型怎么检查独立性?
- 独立和不相关(ρ=0)是什么关系?哪个更强?二维正态分布有什么特殊之处?
- 卷积公式是干什么用的?什么时候能用?什么时候不能用?
- max(X,Y) ≤ z 等价于什么事件?min(X,Y) > z 等价于什么事件?
- 串联系统的寿命对应 max 还是 min?并联系统呢?
- 二维均匀分布在圆形区域上,X 和 Y 独立吗?
- 两个边缘分布都是正态,联合分布一定是二维正态吗?如果不是,举一个反例思路。
💡 深度思考题
下面的问题不考计算,考的是你对"为什么"的理解。没有标准答案,但你得能用自己的话说清楚。
思考1:卷积公式和分布函数法都能求 Z=X+Y 的分布。什么时候优先选卷积?什么时候只能靠分布函数法?选错方法会有什么后果?——从"两个方法的根本区别"这个角度来回答。
思考2:为什么二维正态分布中 $\rho=0$ 等价于独立,但一般分布中 $\rho=0$ 不等于独立?想一个具体的"不相关但不独立"的例子(比如 Y = X^2,X 对称分布在 [-1, 1] 上),然后用大白话解释为什么它们不相关(没有线性趋势),但明明有很强的关系。
思考3:给你一个联合密度 f(x,y) 定义在三角形区域上,有人说"直接对 y 积分就能得到 f_X(x)"。这句话对不对?如果不对,最容易在哪个环节出错?用三角形区域为例,画出图来说明。
🔗 章末过渡
本章讲完了。你现在手里有了分析两个随机变量"关系"的全套工具:联合分布是全家福(两人一起看),边缘分布是单人照(只看一个人),条件分布是加了筛选条件后的样子,独立性告诉你两个人是不是各过各的,卷积和 max/min 告诉你它们的运算结果长什么样。
下一章(第4章)要给这些"关系"一个数字——就像给两个人的亲密程度打个分(0 到 1 之间)。这个分数就是"协方差和相关系数"。你会发现,本章学过的独立性判断、边缘分布、联合分布,在下一章全部会重新用到——比如协方差的定义就是从联合分布出发,而相关系数 $\rho$ 你已经在本章二维正态分布中见过面了。
🧭 学完回顾:本章推导链
闭上眼睛,沿着下面这条线走一遍——从"两个变量一起看"到"判断它们有没有关系"再到"把两个分布合成一个新分布"。卡在哪一步,就回到对应小节重新看。全走通了,这章才算真正学透了。
联合分布函数 F(x,y)=P{X≤x, Y≤y}
(刻画"两个变量一起"的累计概率)
│
┌─────────────────┼─────────────────┐
↓ ↓
四条基本性质 两种类型
│
·单调不减 ┌────────┴────────┐
·有界性: F(-∞,·)=0 ↓ ↓
F(+∞,+∞)=1 离散型(X,Y) 连续型(X,Y)
·右连续 联合分布律 pᵢⱼ 联合密度 f(x,y)
·★矩形概率非负 (二维表格) (三维曲面)
(二维容斥原理) 一格一格数 一片一片积分
│ │ │
└───────────────┬───────────┘ │
↓ │
联合分布 (F / pᵢⱼ / f) │
"全家福"——两个人一起看 │
│ │
┌─────────────┼─────────────┐ │
↓ ↓ │
边缘分布 条件分布 │
"把另一个人压扁消掉" "已知一个人,重算另一个" │
│
离散: pᵢ· = Σⱼ pᵢⱼ 离散: pᵢⱼ / p·ⱼ │
连续: f_X = ∫ f dy 连续: f(x,y) / f_Y(y) │
(求和/积分消掉不要的) (联合÷边缘 = 条件) │
│ │ │
└─────────────┬─────────────┘ │
↓ │
独立性判定 │
"两个人是不是各过各的?" │
│
判法1: 联合 = 边缘乘积 │
f(x,y) = f_X(x)·f_Y(y) ? │
│
判法2: 条件 = 边缘 │
知道Y改变不了X的分布吗? │
│
速判法: 区域非矩形 → 直接不独立! │
矩形 + 可分离变量 → 独立 │
│ │
┌─────────────────┼─────────────────┐ │
↓ ↓ ↓ │
Z = X+Y max / min Z = X/Y │
"两个因素叠加" "最好的/最差的" "两个因素相除" │
│
分布函数法(通用) max ≤ z ⇔ 都 ≤ z 分Y>0和Y<0 │
F=∬_{x+y≤z} f F_M = [F(z)]ⁿ 两段积分 │
│
X,Y独立 → 卷积 min > z ⇔ 都 > z 求导得密度 │
f_Z=∫f_X(x)× F_N = 1-[1-F]ⁿ 含|y|因子 │
f_Y(z-x) dx (绕道走后门) (雅可比行列式) │
│
└─────────────────┬─────────────────┘ │
↓ │
┌───────┴───────┐ │
↓ ↓ │
第4章: 数字特征 第5章: 极限定理 │
协方差/相关系数 中心极限定理 │
"给关系一个分数" "很多独立变量和→正态" │
走一遍推导链(跟着念一遍就记住):
- 起点:$F(x,y) = P{X \leq x, Y \leq y}$ —— 两个变量"都不超过某个数"的概率。
- 分岔:离散用表格($p_{ij}$),连续用曲面($f(x,y)$)。本质一样——描述"两个人一起取各种值的可能性"。
- 降维:想单独看 X?把 Y 消掉(求和/积分)。这就是边缘分布。注意——消掉 Y 的同时也丢了"X 和 Y 的关系"信息。
- 切片:已知 Y 取某个值,X 的分布怎么变?联合 ÷ 边缘 = 条件分布。竖线后面的人(已知条件)的分母进分母。
- 定关系:独立的本质 = 条件 = 边缘(知道 Y 不影响判断 X),等价于联合 = 边缘乘积。非矩形区域直接判不独立,不用算!
- 合成:知道 X 和 Y 的分布,怎么求 X+Y / max(X,Y) / X÷Y 的分布?分布函数法(先求 F 再求导)是通用核武器,独立时卷积公式是快捷方式。
- 去往:第 4 章把这些"关系"量化为数字(协方差/相关系数),第 5 章告诉你大量独立变量叠加的结果(中心极限定理)。