📖 概率论

第3章 多维随机变量

🔔 课前激活(花30秒想想再往下读)

你去医院体检,医生不会只看你的身高就说你健不健康——他要同时看身高、体重、血压、心率好几个指标。因为有些指标之间有"关联":高的人通常更重,血压高的人往往心率也快。如果只看一个数字,你永远发现不了这些"关系"。

再想想股票——你买了两只股票。你关心的是:如果A涨了,B也会跟着涨吗?还是一只涨另一只就跌?或者两者完全没关系?这其实就是"两个随机变量之间有什么关系"的问题。

带着这些问题往下读。读完这章,你不光能处理单个随机变量,还能分析两个变量之间的"关系"——这是概率论从入门到进阶的分水岭。

📌 学完这章你能回答:

  • 知道一个人的身高,能猜出他的体重大概是多少吗?用什么工具来"猜"?
  • 两个随机变量"独立"是什么意思?和"不相关"有什么区别?
  • 串联电路中,系统寿命由什么决定?并联呢?(max还是min?)
  • "联合分布"和"边缘分布",哪个包含的信息更多?为什么?
  • 两个正态分布加起来,结果还是正态分布吗?方差怎么变?

本章考什么

考纲定位:多维随机变量是概率论从"一维"跨入"多维"的核心章节——从此开始,你不再是处理单个随机数,而是同时处理多个随机数以及它们之间的关系。这是考研大题的高频来源。

题型 考频 一句话说明
求联合分布中的未知参数 ⭐⭐⭐ 归一化条件,离散求和、连续二重积分
判断独立性 ⭐⭐⭐ 联合=边缘乘积,非矩形区域速判
Z=X+Y的分布(卷积公式) ⭐⭐⭐ 考研大题,分清分布函数法和卷积法
求条件分布 ⭐⭐ 联合÷边缘,注意分母不为零
求边缘分布 ⭐⭐ 基础操作,注意积分上下限分段
max/min的分布 ⭐⭐ max直接乘,min绕道补
二维均匀与二维正态 ⭐⭐ 性质概念题,正态独有ρ=0⇔独立

详细备考策略 + 每类题型的避坑要点见章末「🎯 考试导航」。


① 核心知识

1.1 二维随机变量

先想一个场景:只看身高,你能判断一个人健康吗?

去医院体检,医生从来不会只给你量一个身高就说结论。体检单上——身高、体重、血压、心率,一排放着。为什么?因为指标之间有"关系":高的人通常更重,血压高的人往往心率也快。如果你只记录一个数字,你永远发现不了这些关系。

再想股票:你买了两只股票 A 和 B。你最关心的问题恰恰是——如果 A 涨了,B 会跟着涨吗?还是一只涨另一只就跌?或者两者完全没关系?

难在哪?——一只股票是一个随机变量,用第 2 章的方法就能单独描述。但现在是两个随机变量一起出现,它们可能互相影响。把两个一维工具并排摆着,回答不了"它们之间有什么关系"。我们需要一个新工具,专门用来同时记录两个变量、并且能看出它们的"关系"。

这个新工具,就是本节的主角——二维随机变量。先记住一个直观的画面,再往下看。

生活比喻:以前你只记录全班同学的"数学成绩"——张三85分,李四92分,这是一维随机变量。现在你同时记录"数学成绩和英语成绩"——张三数学85、英语78,李四数学92、英语90。这时候你才能回答:"数学好的人英语是不是也好?"这就是二维随机变量要做的事。

再换一个比喻:天气预报。一维是"明天下不下雨"(是/否),二维是"明天温度和湿度"——温度30度但湿度很低(干热),和温度30度但湿度很高(闷热),体感完全不同。

正式定义:设 E 是一个随机试验,它的样本空间是 S。如果对于 S 中的每一个样本点 e,都有一对有序实数 (X(e), Y(e)) 与之对应,则称 (X, Y) 为二维随机变量(也叫二维随机向量)。

关键区别:(X,Y) 是一个整体,不是"两个一维随机变量的简单拼凑"。就像炒菜——番茄和鸡蛋单独吃各是各的味道,但"番茄炒蛋"是一个新菜,番茄的酸甜和鸡蛋的香滑互相影响,你不能说番茄炒蛋 = 番茄 + 鸡蛋。X 和 Y 往往有联系,这才是研究二维随机变量的意义。

与"两个独立的一维变量"的本质区别:

对比维度 两个独立的一维变量 一个二维随机变量 (X,Y)
知道各自分布够吗? 够,因为独立,联合=边缘相乘 不够,需要知道联合分布
X和Y有联系吗? 没有,互不影响 可能有(相关/不独立)
能回答"X=某值时Y大概是多少"吗? 不能 能(通过条件分布)
研究重心 分别研究 X 和 Y 研究 (X,Y) 这个整体

一句话:一维研究"一个事是什么样",二维研究"两个事在一起是什么样"——重点是"在一起"这三个字。

说完了二维随机变量的基本概念,接下来我们看怎么描述它——用什么工具来刻画"两个变量一起取值的概率"。


1.2 联合分布函数 F(x,y)

先想一个困境:两个变量一起,怎么"累计"?

第 2 章里,一维分布函数 $F_X(x) = P{X \leq x}$ 干的事是:给一个上限 x,它告诉你 X 不超过这个数的概率。一次只看一个变量。

现在麻烦来了——你有两个变量 X 和 Y。如果我想问"数学考了 85 分以内、同时英语考了 90 分以内"的学生占全班的比例,该怎么用一维工具回答?把两个一维分布函数摆在一起?不行——它们各自只会说"数学≤85 的概率"和"英语≤90 的概率",没人能回答"同时满足"这件事。

难在哪?——"同时"意味着两个条件叠在一起。一维的上限是一个数,二维的上限是一对数 (x, y)。你需要一个同时吃进两个上限的累计器:输入 X 的上限和 Y 的上限,输出"两个都不超过"的概率。

顺着这个思路,答案几乎是自己跳出来的——把一维的"一个上限"换成"两个上限":

$$F(x,y) = P{X \leq x,\ Y \leq y}$$

逗号就是"且":X ≤ x 且 Y ≤ y。这个二元函数,就是我们要认识的联合分布函数。先记住它,再看它长什么样。

生活比喻:想象你有一张地图,上面标记了全国所有城市的气温(X)和海拔(Y)。你想统计"气温不超过30度、且海拔不超过500米"的城市有多少。联合分布函数 F(x,y) 就是这样一个"累计概率计算器"——你输入 X 的上限和 Y 的上限,它告诉你"X 不超过这个数、同时 Y 不超过那个数"的概率是多少。

正式定义(必考定义):对于二维随机变量 (X,Y),称二元函数
$$F(x,y) = P{X \leq x,\ Y \leq y}, \quad -\infty < x < +\infty,\ -\infty < y < +\infty$$
为 (X,Y) 的联合分布函数。

如果把 (X,Y) 看作平面上随机落下的一个点,F(x,y) 就是这个点落在以 (x,y) 为右上顶点、向左下延伸到负无穷的无穷矩形内的概率。

① 生活场景

🗺️ 场景1:地图搜索餐厅——你在手机地图上,以"当前位置"为左下角,画一个矩形区域搜索餐厅。F(x,y) 就是"从地图最左下角开始,到你手指点到的右上角 (x,y) 为止"这个矩形里,包含的餐厅数量占全市餐厅总数的比例。每条性质对应一个生活常识:

🧾 场景2:报销单的双重条件——公司规定"发票金额不超过 x 元、且日期不晚于 y 号"才能报销。F(x,y) 就是同时满足两个条件的发票占比。如果你想单独统计"金额在 100 到 200 元之间、日期在 5 号到 15 号之间"的发票——不能直接查表,得用四个角的 F 值做加减法。

📐 场景3:剪窗花——你想从一张大红纸上剪出一个矩形窗花。你手里只有一把"从右下角剪到左下角"的大剪刀(F(x,y) 只能从右上角往左下延伸)。你怎么剪出中间那个矩形?先剪出整个右上大区域:F(x₂,y₂)——太大了;把左边多余竖条剪掉:-F(x₁,y₂);把下面多余横条剪掉:-F(x₂,y₁);左下角被剪了两次,补回去:+F(x₁,y₁)。这就是"四角加减法"。

大白话:F(x,y) 是一张"累计概率地图"。任何矩形区域的概率 = 右上角 - 左上角 - 右下角 + 左下角。记住"减两次加一次"的模式。


② 正式陈述

设二维随机变量 (X,Y) 的联合分布函数为 $F(x,y) = P{X \leq x,\ Y \leq y}$($x, y \in \mathbb{R}$)。F(x,y) 满足以下四条基本性质:

性质1:单调不减性

任一变量的上限提高,累计概率不会变小。

性质2:有界性与极限行为

任一变量上限缩到负无穷 → 对应事件不可能发生 → 概率为 0。

性质3:右连续性

定义中的"≤"保证了边界上踩线的人算进去——这是分布函数的标准约定。

性质4:矩形概率公式(⭐ 二维特有,最重要)

对任意 $x_1 < x_2$,$y_1 < y_2$:
$$P{x_1 < X \leq x_2,\ y_1 < Y \leq y_2} = F(x_2,y_2) - F(x_1,y_2) - F(x_2,y_1) + F(x_1,y_1) \geq 0$$

💡 为什么是"二维特有"? 一维时落在区间 (a,b] 内 = F(b)-F(a),一次减法搞定。二维时矩形有四个角,需要"右上 - 左上 - 右下 + 左下"四次运算——本质是二维容斥原理。这四条性质共同保证了 F(x,y) 确实是一个合法的二维概率分布。


③ 完整推导

🧠 第1步:从定义出发——F(x,y) 到底在算什么

F(x,y) = P{X ≤ x, Y ≤ y} 的含义是:随机点 (X,Y) 落在以 (x,y) 为右上顶点、向左下无限延伸的矩形区域内的概率。

大白话:想象一张无限大的坐标纸,(X,Y) 是上面随机撒的一个点。F(x,y) 就是"这个点落在 (x,y) 左下方"的概率。x 和 y 越小,这个矩形越小,概率越小;x 和 y 越大,矩形越大,概率越大。

🧠 第2步:推导单调不减性

固定 y 不动,让 x 从 x₁ 增大到 x₂。此时矩形区域向右扩展了——新矩形完整包含了旧矩形。落在更大区域里的概率不可能比落在更小区域里的小,所以:

$$F(x_1, y) = P{X \leq x_1, Y \leq y} \leq P{X \leq x_2, Y \leq y} = F(x_2, y)$$

对 y 方向完全对称——固定 x,y 增大时矩形向上扩展,概率同样只增不减。

大白话:范围扩大了,包含的东西只会更多不会更少。就像搜索引擎放宽了搜索条件,搜出来的结果只会更多。

🧠 第3步:推导有界性与极限行为

大白话:概率的天花板是 1(整个平面),地板是 0(缩到不存在)。一头一尾,规定了 F(x,y) 的活动范围。

🧠 第4步:右连续性的推导逻辑

右连续性来自定义中的"≤"符号。对于固定的 y,当上限 x 从右侧逼近某值 a(即 x → a⁺)时,{X ≤ x} 的条件越来越松(x 比 a 稍大一点),但极限下回到 {X ≤ a}。因为"≤"保证了 a 本身一直算在里面,概率不会在边界处突然跳变。这就是右连续的含义——从右边逼近时,函数值连续。

大白话:踩线的人算"里面"——保证了从右边靠近边界时,结果不会突然跳。(从左边靠近可能会有跳跃——因为离散型随机变量取某个特定值可能有正概率,所以从左边逼近时"踩线的人突然进来了",产生跳跃。)

🧠 第5步(⭐ 核心):矩形概率公式的完整推导

这是全章最重要的推导之一。问题:随机点 (X,Y) 落在矩形 $(x_1, x_2] \times (y_1, y_2]$ 里的概率,怎么用 F 表示?

画图理解:F(x₂, y₂) 覆盖的是从 (-∞, -∞) 到 (x₂, y₂) 的整个大矩形。我们想要的是中间那一小块。

分步拆解:

  1. F(x₂, y₂):整个大区域(从最左下角到 (x₂, y₂))——包含了目标矩形和多余的边。
  2. 减去 F(x₁, y₂):把左边竖条(X ≤ x₁ 且 Y ≤ y₂)剪掉。
  3. 减去 F(x₂, y₁):把下面横条(X ≤ x₂ 且 Y ≤ y₁)剪掉。
  4. 加上 F(x₁, y₁):左下角的小块(X ≤ x₁ 且 Y ≤ y₁)被第 2 步和第 3 步各剪了一次——剪了两次!必须补回来。

最终结果:
$$P{x_1 < X \leq x_2,\ y_1 < Y \leq y_2} = F(x_2,y_2) - F(x_1,y_2) - F(x_2,y_1) + F(x_1,y_1) \geq 0$$

"≥ 0"是关键约束——概率不能是负数。如果某个 F 让这个式子算出负数,那它就不是合法的联合分布函数。

大白话:记住操作顺序——右上角、减左上角、减右下角、加左下角。口诀:"右上减左减右加左下"。本质上就是"大框里挖掉不想要的边框,被挖两次的角落补回去"。一维区间是两个端点(减一次),二维矩形是四个顶点(减两次加一次),三维立方体将是八个顶点(加减交替)。

✍️ 立刻练一道(刚学的"四角加减法",马上就用):设 F(x,y) 是某二维随机变量的联合分布函数,已知 $F(1,1)=0.6$,$F(0,1)=0.2$,$F(1,0)=0.3$,$F(0,0)=0.1$。求 $P{0 < X \leq 1,\ 0 < Y \leq 1}$。

点击看答案

按"右上 - 左上 - 右下 + 左下":
$$P{0 < X \leq 1,\ 0 < Y \leq 1} = F(1,1) - F(0,1) - F(1,0) + F(0,0) = 0.6 - 0.2 - 0.3 + 0.1 = 0.2$$

答案:0.2


④ 推导复盘

📝 用大白话把整个过程重新讲一遍:

四条性质的内在逻辑:

  1. 单调不减性是最自然的——累计概率嘛,上限放宽概率只增不减。
  2. 有界性规定了 F(x,y) 的"天花板"和"地板":天花板是 1(整个平面),地板是 0(退化到负无穷)。
  3. 右连续性是"≤"定义的直接后果——保证分布在跳跃点处行为一致。
  4. 矩形概率公式是四条里最实用的,也是从"定义"到"应用"的桥梁。

📝 减法公式的推导逻辑(最核心的部分):

你想算随机点 (X,Y) 落在矩形 $(x_1, x_2] \times (y_1, y_2]$ 里的概率。把 F(x₂,y₂) 覆盖的大区域拆成四块:

$$F(x_2,y_2) - F(x_1,y_2) - F(x_2,y_1) + F(x_1,y_1)$$

左条和横条都包含左下角,所以减去竖条再减横条时,左下角被减了两次——必须加回一次。这和一维的"区间概率 = 大减小区间"逻辑完全一致,只是维度升高导致顶点数从 2 变成 4。

📝 关键转折点:从一维到二维,"区间概率"从两个端点变成四个顶点。这是维度升高带来的复杂度——但原理不变(容斥),操作次数从 2 变成 4。今后学到三维,公式会有 $2^3=8$ 项(八个顶点交替加减)。掌握了这个模式,n 维也不怕。

📝 与后续内容的连接:F(x,y) 是整章的"地基"——边缘分布函数可以写成 $F_X(x) = F(x, +\infty)$、$F_Y(y) = F(+\infty, y)$;独立性用 F 判定就是 $F(x,y) = F_X(x) \cdot F_Y(y)$(下一节 1.7 的核心)。


⑤ 易错边界

⚠️ 错误1:把 F(x,y) 和 f(x,y) 搞混

大白话:F 是"累计存钱罐"里的总额(0~1之间),f 是"存钱速度"(可以很快,超过1)。一维时 F 求一次导得 f,二维要对 x 和 y 各求一次导(两次)才能从 F 回到 f。

⚠️ 错误2:矩形概率公式中不等式方向写反

公式里的矩形是 $(x_1, x_2] \times (y_1, y_2]$——左边界严格小于(<),右边界小于等于(≤)。这种写法保证:

如果题目给的是 $P{x_1 \leq X \leq x_2, y_1 \leq Y \leq y_2}$(两边都有等号),对于连续型差别不大(单点概率为 0),但离散型必须小心处理边界。

⚠️ 错误3:以为 F(x,y) = F_X(x) + F_Y(y)

这是最常见的误解!联合分布函数不是两个边缘分布函数的和(也不是乘积,除非独立)。两者的关系是:

⚠️ 错误4:忘了矩形概率必须 ≥ 0

四条性质中,矩形概率非负(性质4)最容易被忽略。给定一个 F 让你判断它是不是合法的联合分布函数,只用前三条(单调、有界、右连续)不够——必须验证第四条:任意矩形内的概率都不能是负数。这是"看起来像 F"和"确实是 F"之间的唯一分界线。


⑥ 链条位置

从哪来:

到哪去:

在整条链中的位置:F(x,y) 是本章的"地基"。它定义了"联合分布"这个概念本身。所有后续工具——离散表格、连续密度、边缘、条件、独立性、卷积——都是在地基上盖的楼。学不会 F(x,y),后面每一节都没法真正理解。


接下来,我们要区分两种不同类型的二维随机变量——离散型和连续型。离散型只能取有限个或可列个值(像考试成绩),连续型可以在一个区间内连续取值(像身高体重)。两者的"语言"不同:离散型用表格(分布律),连续型用密度函数。

1.3 二维离散型随机变量与联合分布律

先想一个场景:两个变量都"一格一格"取值时,怎么记录?

上一节认识了联合分布函数 F(x,y)——它描述"两个变量都不超过某数"的累计概率。但有一种常见的变量,用"累计"来描述太绕了:它只能取几个离散的值。

比如一次考试,数学和英语都只记档次分(60、70、80、90、100)。全班 40 个人的"数学+英语"组合,一共也就 25 种可能。这时候你会怎么记录?最自然的办法就是画一张表——横行写数学档次,竖列写英语档次,格子里填"数学考 x 档、同时英语考 y 档"的人数占全班的比例。

难在哪?——表格格子那么多,光会画还不够。你得知道:这张表要满足什么规矩,才是一张"合法"的概率表? 一张不合法的表,算出来的答案全错。下面带着这个问题看。

生活比喻:你有一张全班成绩统计表——横行是数学成绩(60、70、80、90、100),竖列是英语成绩(60、70、80、90、100)。每个格子里填的是"数学考x分、同时英语考y分"的同学占全班的比例(概率)。这张表就是联合分布律。

再比如:你去餐厅点套餐——主食有米饭和面条两种,主菜有红烧肉、清蒸鱼、炒青菜三种。一共有 2×3=6 种组合。每种组合的概率不同,这就是一个二维离散分布。

正式定义:如果 (X,Y) 所有可能的取值是有限对或可列无限对,则称 (X,Y) 为二维离散型随机变量。

💡 "可列无限"是什么意思? 就是"虽然无限多,但可以一个一个编号(像自然数 1,2,3... 一样排成队)"。比如"第1次抛硬币到第n次才出现正面"——n 可以是 1,2,3,... 无限延伸,但每个 n 都能编号。和"不可列"的区别:实数轴上的所有点就不可列——你没法给每个实数一个编号,因为它们太"密"了。

设 (X,Y) 所有可能的取值为 $(x_i, y_j)$,$i, j = 1, 2, \dots$,则称
$$P{X = x_i,\ Y = y_j} = p_{ij}, \quad i,j = 1,2,\ldots$$
为 (X,Y) 的联合分布律(也叫联合概率分布)。

分布律通常用一张表格表示——表头是 Y 的取值,表侧是 X 的取值,格子里是 $p_{ij}$。

两条基本性质:

  1. 非负性:$p_{ij} \geq 0$——每个格子的概率不可能是负数。
  2. 归一性:$\displaystyle\sum_{i}\sum_{j} p_{ij} = 1$——所有格子的概率加起来必须是 1。

举例:假设 (X,Y) 的联合分布律如下(X取1,2;Y取1,2,3):

X\Y Y=1 Y=2 Y=3
X=1 0.1 0.2 0.1
X=2 0.15 0.25 0.2

验证:0.1+0.2+0.1+0.15+0.25+0.2 = 1.0 ✓。所有格子非负 ✓。

✍️ 立刻练一道(刚悟出的"归一性"规矩,马上就用):设 (X,Y) 的联合分布律如下(X取1,2;Y取1,2),表格里有一个未知常数 b:

X\Y Y=1 Y=2
X=1 0.15 b
X=2 0.35 0.25

求 b 的值。

点击看答案

所有格子的概率加起来必须等于 1(归一性):
$$0.15 + b + 0.35 + 0.25 = 1 \quad \Rightarrow \quad b = 0.25$$

验证:所有格子和 = 0.15+0.25+0.35+0.25 = 1.0 ✓,且每个格子都在 0 到 1 之间 ✓。

答案:b = 0.25

🛑 提前试试:看完这张表,你有没有好奇——单看 X=1 的总概率是多少?单看 Y=2 的总概率呢?试试自己算一下(提示:把同一行的格子加起来,再把同一列的格子加起来),然后翻到 1.5 节看你算得对不对。


1.4 二维连续型随机变量与联合密度

先想一个困境:变量能"连续取值"时,表格还能用吗?

上一节的成绩档次表,靠的是"数学和英语都只有几档"。可如果你研究的是身高和体重——身高可以是 170.1cm、170.11cm、170.111cm……任何一个数字都可能是。把每个"可能的身高"当成一列?列不完,因为数字太多了。

难在哪?——任意一个具体点的概率都是 0(比如"身高恰好 170.11cm"的人,一个都没有)。离散型的"表格"彻底失灵了。但换个角度:虽然单点是 0,某些区域上"人多"、另一些区域"人少"——高而壮的偏多,矮而瘦的偏少。我们要找的就是一个能表达"哪里密集、哪里稀疏"的工具。

这个工具就是概率密度:它不直接回答"某点的概率",而是告诉你"某处有多浓"。把密度在一个区域上"积累"起来(积分),才能得到概率。下面带着"怎么描述一片区域上概率有多少"这个问题看。

与离散型不同,连续型随机变量可以取某个区间内的任意值(比如身高可以是170.1cm、170.11cm……)。这时不能用"每个点的概率"来描述了——因为任意一个具体点的概率都是0。我们需要换一种工具:概率密度。

生活比喻:你把一把沙子撒在桌面上——有的地方厚(沙子多),有的地方薄(沙子少)。沙子的厚度分布就是一个二维概率密度。厚的地方,随机抓一把沙子,抓到那里的概率大;薄的地方,概率小。但注意,密度本身不是概率!概率需要在一个区域上"积累"(积分)才能得到。

正式定义:如果存在一个非负可积函数 f(x,y),使得对于平面上任意区域 D,都有
$$P{(X,Y) \in D} = \iint_D f(x,y)\ dxdy$$
则称 (X,Y) 为二维连续型随机变量,f(x,y) 称为联合概率密度函数。

两条基本性质:

  1. 非负性:$f(x,y) \geq 0$
  2. 归一性:$\displaystyle\int_{-\infty}^{+\infty}\int_{-\infty}^{+\infty} f(x,y)\ dxdy = 1$

另外,在 f(x,y) 的连续点处,有
$$\frac{\partial^2 F(x,y)}{\partial x \partial y} = f(x,y)$$
也就是说,密度是分布函数的二阶混合偏导数——分布函数"求两次导"就回到密度。

💡 为什么是两次导数? 就像一维时分布函数求一次导等于密度($F'(x)=f(x)$),二维因为有两个变量,需要各求一次导(总共两次)。你可以理解成:先沿 x 方向求导剥一层皮,再沿 y 方向求导剥一层皮,两层皮剥完就回到原始的密度函数。

✍️ 立刻练一道(刚悟出的"归一性 = 全平面二重积分 = 1",马上就用):设 (X,Y) 的联合概率密度为:
$$f(x,y) = \begin{cases} k, & 0<x<1,; 0<y<1 \ 0, & \text{其他} \end{cases}$$
求常数 k 的值。

点击看答案

由归一化条件,全平面二重积分等于 1。f 只在正方形 $0<x<1,;0<y<1$ 内非零(等于常数 k),所以:

$$\iint f(x,y),dxdy = k \times (\text{正方形面积}) = k \times 1 = k = 1$$

答案:k = 1

📝 配套练习

题2 ⭐ | 连续型,求联合密度中的未知参数

对应模板:题型一(归一化条件)

设 (X,Y) 的联合概率密度为:
$$f(x,y) = \begin{cases} cxy, & 0<x<1,; 0<y<1 \ 0, & \text{其他} \end{cases}$$
求常数 c 的值。

点击看答案

归一化条件:$\iint f(x,y),dxdy = 1$

$$\int_0^1\int_0^1 cxy,dx,dy = c\int_0^1 y\left[\frac{x^2}{2}\right]_0^1 dy = \frac{c}{2}\int_0^1 y,dy = \frac{c}{2}\cdot\frac{1}{2} = \frac{c}{4} = 1$$

所以 $c=4$。

答案:$c=4$


了解了联合分布函数和联合密度之后,一个自然的问题来了:如果我只关心 X 本身(不管 Y 取什么值),该怎么算?这就是"边缘分布"。

1.5 边缘分布(⭐⭐ 核心定理 · 六段式)

先想一个困境:手里只有"两人合照",怎么单独洗出"单人照"?

你手上有全班的"数学+英语"联合成绩表(上一节那张表)。校长跑过来问:"数学成绩的分布是什么?"——他只关心数学,完全不关心英语。

难在哪?——你手里的表格,每个格子都是"数学考 x 且英语考 y"的联合概率。可现在你只想要"数学考 85 分"的总概率,而这个总概率分散在一整行里(数学85英语60、数学85英语70、数学85英语80……)。你没法从表格里直接指着一格说"这就是答案"。

怎么办?顺着直觉想——"数学考 85 分"包括了好多互不相容的情况,把这一行全部加起来,不就得到"数学 85 分"的总概率了吗?这个"把不要的变量消掉(求和),留下要看的变量"的操作,就是本节的主角——边缘分布。

这一节我们要解决一个关键问题:手里有两个人一起的"全家福照片"(联合分布),怎么单独把一个人的"单人照"(边缘分布)洗出来?方法分两种——离散型用"求和",连续型用"积分"。但两种方法的思路完全一样:把那个你不想看的人"压扁""消掉",剩下的就是你要看的人。


① 生活场景

🏫 场景1:成绩表——你是班主任,手里有全班的"数学+英语"联合成绩表。每行是数学分,每列是英语分,格子里是"数学考x分且英语考y分"的人数比例。现在校长只问:"数学成绩的分布是什么?"你不关心英语考多少——你只需要把每一行所有格子加起来,写在表格最右边。这就是数学的"边缘分布"。

📸 场景2:合影裁剪——你和一个朋友拍了一张合影(联合分布)。现在你只想洗一张你自己的单人照(边缘分布)。你怎么办?把朋友那半边照片裁掉(求和/积分掉另一个变量),剩下的就是你的单人照。但注意——裁掉之后,照片只剩你一个人,你再也看不出"你们俩当时的站位关系"(关联信息丢失了)。

🌫️ 场景3:压扁雾团——把联合密度想象成一团雾飘在平面上。你想知道"只看X轴方向,雾的浓度分布是怎样的"。你就从Y轴正上方使劲往下压,把所有雾都压到X轴上——Y方向的信息被"压扁"了,X轴上留下的厚度分布就是X的边缘密度。

大白话:边缘分布就是"把联合分布中另一个变量消掉(求和或积分),只看一个变量"的操作结果。


② 正式陈述

离散型:设二维离散型随机变量 $(X,Y)$ 的联合分布律为
$$p_{ij} = P{X = x_i,\ Y = y_j}, \quad i,j = 1,2,\ldots$$

则 X 的边缘分布律 为:
$$p_{i\cdot} = P{X = x_i} = \sum_{j} p_{ij}$$

Y 的边缘分布律 为:
$$p_{\cdot j} = P{Y = y_j} = \sum_{i} p_{ij}$$

其中小圆点 $\cdot$ 的位置表示"在这个维度上求和"——$p_{i\cdot}$ 行号固定,对所有列求和;$p_{\cdot j}$ 列号固定,对所有行求和。

连续型:设 $(X,Y)$ 的联合概率密度为 $f(x,y)$,则:

X 的边缘概率密度为:
$$f_X(x) = \int_{-\infty}^{+\infty} f(x,y)\ dy$$

Y 的边缘概率密度为:
$$f_Y(y) = \int_{-\infty}^{+\infty} f(x,y)\ dx$$


③ 完整推导

离散型推导(从联合分布律到边缘分布律)

🧠 第1步:从概率的基本事实出发

已知 $(X,Y)$ 所有可能的取值为 $(x_i, y_j)$,每个组合的概率为 $p_{ij}$。现在我想要"X 取某个固定值 $x_i$ 的概率"——不管 Y 取什么值都算。

在生活里:"数学考85分"这件事包含了好几种情况:数学85英语60、数学85英语70、数学85英语80……把所有这些情况的概率加在一起,才是"数学85分"的总概率。

大白话:X 取某个值的概率 = 在这个 X 值下,所有可能 Y 值对应的概率之和。

🧠 第2步:写出概率表达式

$$P{X = x_i} = P{X = x_i,\ Y = y_1} + P{X = x_i,\ Y = y_2} + \cdots$$

因为 $P{X = x_i}$ 就是事件 ${X = x_i}$ 的概率。而事件 ${X = x_i}$ 可以拆成互不相容的几个子事件:

这些子事件互不相容(Y 只能取一个值),所以它们的概率直接相加。

大白话:一个事件如果能拆成"要么这样、要么那样"的互斥子事件,总概率就是各子事件概率之和。这个拆法就是数学里"全概率公式"的思想。

🧠 第3步:用符号 $p_{ij}$ 表示

子事件 ${X = x_i, Y = y_j}$ 的概率就是 $p_{ij}$。所以:

$$P{X = x_i} = p_{i1} + p_{i2} + p_{i3} + \cdots = \sum_{j} p_{ij}$$

记作 $p_{i\cdot}$,下标的小圆点表示"对 j 求和"。

大白话:把表格第 i 行所有格子从左到右加起来,得到的就是 X 取第 i 个值的概率。为什么叫"边缘"?因为这些合计写在表格最右边、最下边的边缘空白处。

🧠 第4步:对称地得到 Y 的边缘分布

完全一样的思路,把表格第 j 列从上到下加起来:

$$P{Y = y_j} = \sum_{i} p_{ij} = p_{\cdot j}$$

大白话:行求和得 X 的边缘,列求和得 Y 的边缘。记住规则:想消掉哪个变量,就在哪个方向求和。

连续型推导(从联合密度到边缘密度)

🧠 第1步:理解"连续型不能逐点求和"

连续型随机变量取单个点的概率为 0,不能像离散型那样一格一格加。我们需要在"无穷小的宽度"上做积分。

大白话:离散型是一颗一颗红豆绿豆数着加,连续型是一锅粥——得用积分这个"超级精细的勺子"来舀。

🧠 第2步:固定 x,考虑 X 落在 $[x, x+dx]$ 这个无穷小区间里

$$P{x < X \leq x + dx} \approx f_X(x) \cdot dx$$

这个概率也可以从联合密度算出来:X 落在 $[x, x+dx]$ 之间时,Y 可以在整个实数范围 $(-\infty, +\infty)$ 内任意取值。所以:

$$P{x < X \leq x + dx} = \left[\int_{-\infty}^{+\infty} f(x,y)\ dy\right] \cdot dx$$

大白话:在 x 处取一根竖着的无穷细的"条条"(宽度 dx),把这条条上所有高度(y 从 -∞ 到 +∞)的密度加起来,就是 X 在这根条条上的概率。

🧠 第3步:对比两式,得到边缘密度

$$f_X(x) \cdot dx = \left[\int_{-\infty}^{+\infty} f(x,y)\ dy\right] \cdot dx$$

两边消去 $dx$,得到:

$$f_X(x) = \int_{-\infty}^{+\infty} f(x,y)\ dy$$

大白话:边缘密度 $f_X(x)$ 就是对联合密度沿 y 方向"压扁"(积分)。积分把 y 消掉了,结果只跟 x 有关。

🧠 第4步:Y 的边缘密度完全对称

$$f_Y(y) = \int_{-\infty}^{+\infty} f(x,y)\ dx$$

大白话:对谁积分,就是消掉谁。想消掉 Y → 对 y 积分得 $f_X(x)$;想消掉 X → 对 x 积分得 $f_Y(y)$。

实例演示

离散型:用前面的联合分布律表——

X\Y Y=1 Y=2 Y=3 行合计 = X的边缘
X=1 0.1 0.2 0.1 0.4
X=2 0.15 0.25 0.2 0.6
列合计 = Y的边缘 0.25 0.45 0.3 1.0

X 的边缘分布:P{X=1}=0.4,P{X=2}=0.6。
Y 的边缘分布:P{Y=1}=0.25,P{Y=2}=0.45,P{Y=3}=0.3。

连续型:设 $f(x,y) = 8xy$($0 < x < y < 1$):

$$f_X(x) = \int_x^1 8xy\ dy = 8x \cdot \frac{y^2}{2}\Big|_x^1 = 4x(1-x^2), \quad 0 < x < 1$$

$$f_Y(y) = \int_0^y 8xy\ dx = 8y \cdot \frac{x^2}{2}\Big|_0^y = 4y^3, \quad 0 < y < 1$$

✍️ 立刻练一道(刚悟出的"消掉谁就对谁求和",马上就用):设 (X,Y) 的联合分布律如下(X取1,2;Y取0,1),求 X 的边缘分布律。

X\Y Y=0 Y=1
X=1 0.2 0.3
X=2 0.4 0.1
点击看答案

求 X 的边缘 = 对 Y 求和(逐行相加):

  • $P(X=1) = 0.2 + 0.3 = 0.5$
  • $P(X=2) = 0.4 + 0.1 = 0.5$

验证:$0.5 + 0.5 = 1$ ✓

答案:$P(X=1)=0.5$,$P(X=2)=0.5$

📝 配套练习

题1 ⭐ | 离散型联合分布,求未知参数和边缘分布(综合:题型一+二)

对应模板:题型一(联合分布律的基本操作)

已知二维离散型随机变量 (X,Y) 的联合分布律如下表:

X\Y 1 2
1 0.1 0.2
2 a 0.3

(1)求参数 a 的值;
(2)求 X 的边缘分布律(P(X=1)和P(X=2));
(3)求 Y 的边缘分布律(P(Y=1)和P(Y=2))。

点击看答案

(1)求 a
所有概率之和等于1:$0.1+0.2+a+0.3=1$,所以 $a=0.4$。

(2)X的边缘分布
$P(X=1)=0.1+0.2=0.3$,$P(X=2)=0.4+0.3=0.7$

(3)Y的边缘分布
$P(Y=1)=0.1+0.4=0.5$,$P(Y=2)=0.2+0.3=0.5$

答案:(1)$a=0.4$(2)$P(X=1)=0.3, P(X=2)=0.7$(3)$P(Y=1)=0.5, P(Y=2)=0.5$


题3 ⭐ | 连续型,求边缘密度(注意三角形区域)

对应模板:题型二(边缘密度计算)

设 (X,Y) 的联合密度为:
$$f(x,y) = \begin{cases} 2, & 0<x<y<1 \ 0, & \text{其他} \end{cases}$$
求 $f_X(x)$ 和 $f_Y(y)$。

点击看答案

区域是三角形 $0<x<y<1$——画图很重要!

求 $f_X(x)$:固定 x($0<x<1$),y 从 x 到 1:
$$f_X(x) = \int_x^1 2,dy = 2(1-x), \quad 0<x<1$$

求 $f_Y(y)$:固定 y($0<y<1$),x 从 0 到 y:
$$f_Y(y) = \int_0^y 2,dx = 2y, \quad 0<y<1$$

答案:
$$f_X(x)=\begin{cases}2(1-x),&0<x<1\0,&\text{其他}\end{cases},\quad f_Y(y)=\begin{cases}2y,&0<y<1\0,&\text{其他}\end{cases}$$


④ 推导复盘

📝 用大白话把整个过程重新讲一遍:

  1. 你手里有一张"两个人一起"的概率分布图(联合分布)。离散型是一张表格,连续型是一个曲面。
  2. 你现在只想看其中一个变量(比如 X)单独长什么样。
  3. 离散型的做法:把表格的一行从头到尾加起来,写到右边——加起来的结果就是 X 取这个值的概率。Y 的话,就一列一列加。
  4. 连续型的做法:想象把联合密度的"曲面"从 Y 方向压扁到 X 轴上。怎么"压扁"?对 y 做积分——积分是一种"无穷细的求和",等价于把 Y 方向上每一条无穷细的竖条加总。
  5. 得到的结果(边缘分布)是一个完全合法的概率分布——所有概率加起来(或积起来)等于 1,可以单独用来回答"X 取某值的概率是多少"这类问题。

📝 整个推导的关键转折点就一个:"X 取某值"这件事 = "X 取该值,且 Y 取任意值"。把后面这句拆成互斥子事件,概率直接相加/积分。这就是边缘化的本质。


⑤ 易错边界

⚠️ 错误1:把"对谁求和/积分"搞反了

记忆口诀:想消掉谁,就对谁求和/积分。

⚠️ 错误2:连续型的积分上下限照抄 $(-\infty, +\infty)$

公式里写的是 $\int_{-\infty}^{+\infty}$,但实际操作时,$f(x,y)$ 只在某个有限区域内非零。你必须根据联合密度的实际定义区域来定上下限。

例:$f(x,y) = 8xy$($0 < x < y < 1$),求 $f_X(x)$ 时的 y 积分上下限是 $\int_x^1$,不是 $\int_{-\infty}^{+\infty}$。搞错上下限 → 全题报废。

⚠️ 错误3:忘了标注边缘密度的取值范围

连续型求完边缘密度后,必须在结果后面注明 x 或 y 的有效范围。比如 $f_X(x) = 4x(1-x^2),\ 0 < x < 1$。只写表达式不写范围 → 扣分。

⚠️ 错误4(最致命的理解误区):认为边缘分布能"还原"联合分布

这是整个多维随机变量章节最重要的一个认知——边缘分布一般不能反推联合分布。

为什么?因为边缘分布只告诉你 X 单独的分布、Y 单独的分布,但完全丢掉了 X 和 Y 之间的关联信息。相同的两个边缘分布可以搭配出无数种不同的联合分布——就像身高和体重都一样的两个人,他们的"高矮胖瘦组合"可以完全不同(一个高而瘦,另一个矮而壮但截然的组合)。

💡 直观例子:两个班的"数学+英语"联合分布表不同(一个班数学好的人英语也好,另一个班数学好的英语反而差——关联方向相反),但分别看数学的边缘分布完全一样、英语的边缘分布也完全一样。光看边缘分不出这两个班。就像两个人长相完全不同,但身高体重各自一样——只看身高体重分不出谁是谁,必须看"组合"(联合分布)。

唯一例外:当 X 和 Y 独立时,联合 = 两个边缘相乘。只有这个时候,你才能从边缘反推联合——因为独立意味着"两个人完全各过各的",没有关联信息需要保存。

⚠️ 错误5:边缘化了但不知道概率是否还是 1

离散型:行合计那一列的总和 = 所有格子总和 = 1。列合计那一行的总和 = 所有格子总和 = 1。验证这两个加起来都等于 1,边缘分布才合法。

连续型:$\int f_X(x)\ dx = \iint f(x,y)\ dxdy = 1$。求完 $f_X(x)$ 后对 x 积分,结果必须等于 1。


⑥ 链条位置

从哪来:

到哪去:

在整条链中的位置:联合分布 → 边缘分布 → 条件分布 → 独立性 → 卷积/数字特征。边缘分布是"从联合走向一切"的第一个分叉口。学不会边缘分布,后面的条件分布、独立性判断、卷积公式全都卡住。

🛑 迷你自测:翻回 1.3 节那张联合分布律表(X=1,2; Y=1,2,3),30 秒内算出 X 的边缘分布和 Y 的边缘分布。算完再继续往下读。


1.6 条件分布(⭐⭐ 核心定理 · 六段式)

先想一个困境:知道了一个人,怎么重新"看"另一个人?

上一节的边缘分布,回答的是"不管 Y 是什么,X 单独长什么样"。现在问题升级:我知道了 Y 的具体值,X 的分布会变成什么样?

比如全校 1000 个学生,你有"数学+英语"的联合成绩表。现在你只关心"英语考了 90 分"的那一小撮人(可能就 50 个)——在这 50 个人的小圈子里,数学成绩的分布长什么样子?跟全校 1000 人的数学分布一样吗?大概率不一样——因为英语能考 90 的人,数学往往也不差。

难在哪?——你不能直接拿联合表里的格子用:那 50 个人只占表格的一小部分,把他们单独拿出来,他们的概率加起来不是 1。你需要一个操作:把这个"缩小后的圈子"重新缩放到概率总和为 1。

怎么缩放?想想第 1 章的条件概率 $P(A|B) = P(AB)/P(B)$——"已知 B 发生,A 的概率"= "A 和 B 同时发生"除以"B 发生"。这里一模一样:已知 Y=y,X 的分布 = "X 取某值且 Y=y" 除以 "Y=y" 的概率。这个"已知一部分信息后,重新计算的分布",就是本节的主角——条件分布。

这一节要解决的核心问题:手里有两个人一起的"全家福"(联合分布),你知道了其中一个人的具体值(比如Y=0.5),怎么把另一个人的分布重新算一遍?条件分布告诉你——把联合分布除以条件那个人的边缘概率,就得到了"缩小范围后"的新分布。


① 生活场景

🛒 场景1:记账本——你这个月总花销是 3000 块,你翻开账单想看"各项开销各占多少比例"。在"总花销=3000"这个条件之下,吃饭、交通、娱乐各自的分布是什么样的?条件分布就是帮你根据"已知总花销=3000"这个条件,重新分配各项开销的概率。

🏫 场景2:考试筛选——全校有 1000 个学生,你有"数学+英语"的联合成绩分布。现在你只关心"英语考了 90 分"的那一小撮人(可能就 50 个人),在这 50 个人的小圈子里,数学成绩的分布长什么样子?条件分布就是在这个缩小了的群体里重新算分布。

🧑⚕️ 场景3:体检数据——联合分布是身高+体重。已知一个人身高 180cm,他的体重最可能在什么范围?条件分布就是"身高=180cm"这条竖线上,体重取各种值的相对可能性。

大白话:条件分布 = 在"已知一个变量取某值"的限制下,重新计算另一个变量的分布。核心操作:从联合分布中"切一刀",然后把这个切面的面积缩放到 1,让它变成一个合法的概率分布。


② 正式陈述

离散型:设 $(X,Y)$ 的联合分布律为 $p_{ij} = P{X=x_i, Y=y_j}$,边缘分布为 $p_{i\cdot}$ 和 $p_{\cdot j}$。

连续型:设 $(X,Y)$ 的联合密度为 $f(x,y)$,边缘密度为 $f_X(x)$ 和 $f_Y(y)$。


③ 完整推导

离散型推导(从条件概率定义到条件分布)

🧠 第1步:回忆条件概率的基本定义

在初等概率论中,条件概率定义为:
$$P(A \mid B) = \frac{P(A \cap B)}{P(B)}, \quad P(B) > 0$$

这是所有条件分布推导的总源头——分子是"两件事同时发生"的概率,分母是"条件这件事本身"的概率。

大白话:条件概率的公式就是"交集除以条件"。比如"已知下雨,我迟到的概率" = "既下雨我又迟到的概率" ÷ "下雨的概率"。条件分布只是把这个思想从两个普通事件推广到两个随机变量。

🧠 第2步:把事件 B 换成 ${Y = y_j}$,事件 A 换成 ${X = x_i}$

$$P{X = x_i \mid Y = y_j} = \frac{P{X = x_i,\ Y = y_j}}{P{Y = y_j}}$$

分子 $P{X = x_i,\ Y = y_j}$ 就是联合分布律 $p_{ij}$(联合分布表的格子值)。

分母 $P{Y = y_j}$ 就是 Y 的边缘分布律 $p_{\cdot j}$(把第 j 列所有行加起来)。

大白话:把两个事件直接代入初等概率论的公式。分子是表格里"第i行第j列"那个格子;分母是第j列的列合计(Y的边缘分布)。

🧠 第3步:得到条件分布公式

$$P{X = x_i \mid Y = y_j} = \frac{p_{ij}}{p_{\cdot j}}$$

这就是条件分布律。给定 $Y = y_j$(固定第 j 列),把这一列的每个格子都除以这一列的合计 $p_{\cdot j}$——相当于把这一列"拉伸"到总和为 1。

大白话:给定"Y取某个值"的条件后,把联合分布表里对应那一列的所有格子重新缩放,让它们加起来等于 1。缩放的方法就是每个格子除以该列的合计。

🧠 第4步:验证条件分布是合法分布

$$\sum_i P{X = x_i \mid Y = y_j} = \sum_i \frac{p_{ij}}{p_{\cdot j}} = \frac{1}{p_{\cdot j}} \sum_i p_{ij} = \frac{p_{\cdot j}}{p_{\cdot j}} = 1$$

所有条件概率非负(因为 $p_{ij} \geq 0$,$p_{\cdot j} > 0$),加总之和为 1。满足概率分布的两条基本性质 ✓

大白话:把一列的所有格子除以该列合计后,新格子加起来一定等于 1。就像把一张饼按原比例缩小——原来所有格子的比例关系不变,但总和缩放到 1。

连续型推导(从离散型类比到密度之商)

🧠 第1步:连续型不能直接写 $P{Y=y}$ 做分母

因为连续型 $P{Y=y} = 0$(单个点的概率为 0),不能用离散型的"除以概率"来定义。但我们可以在 Y 的无穷小区间 $[y, y+dy]$ 上做近似,然后取极限。

大白话:离散型是"除以一个大于0的数字",连续型那个数字是 0,除以 0 没意义。所以我们退一步——不除以概率,而是除以密度。

🧠 第2步:在无穷小区间上应用条件概率定义

考虑 $P{x < X \leq x+dx \mid y < Y \leq y+dy}$:

$$P{x < X \leq x+dx \mid y < Y \leq y+dy} = \frac{P{x < X \leq x+dx,\ y < Y \leq y+dy}}{P{y < Y \leq y+dy}}$$

分子 $\approx f(x,y) \cdot dx \cdot dy$(联合密度 × 小矩形面积)

分母 $\approx f_Y(y) \cdot dy$(边缘密度 × 小区间宽度)

大白话:分子是落在小矩形 $[x, x+dx] \times [y, y+dy]$ 里的概率,分母是 Y 落在 $[y, y+dy]$ 里的概率(不管 X 取什么值)。

🧠 第3步:约去公共因子

$$\frac{f(x,y) \cdot dx \cdot dy}{f_Y(y) \cdot dy} = \frac{f(x,y)}{f_Y(y)} \cdot dx$$

这个结果应该等于条件密度 $f_{X|Y}(x|y)$ 乘以 $dx$(条件密度 × X 的小区间宽度)。所以:

$$f_{X|Y}(x|y) \cdot dx = \frac{f(x,y)}{f_Y(y)} \cdot dx$$

两边消去 $dx$:

$$f_{X|Y}(x|y) = \frac{f(x,y)}{f_Y(y)}$$

大白话:关键一步——$dy$ 在分子分母中约掉了!这说明虽然单点概率是 0,但密度的"比例关系"仍然有意义。条件密度 = 联合密度 ÷ 边缘密度,和离散型的"格子÷列合计"完全对应。

🧠 第4步:几何解释

联合密度 $f(x,y)$ 是一座山的表面。在 $Y=y$ 处垂直于 Y 轴切一刀,切出来的剖面曲线是 $f(x, y)$(把 y 当常数看)。这个剖面的"形状"就是条件密度的形状——但面积通常不是 1。除以 $f_Y(y)$(该处 Y 方向的总高度)等于把剖面缩放到面积刚好为 1。

大白话:切一刀出来的剖面形状是对的,但"大小"不对(面积不是1)。除以边缘密度就是做一次缩放——形状不变,面积变成 1,这才算合法概率分布。

实例演示

离散型:用联合分布律表(Y=2 条件下):

X\Y Y=1 Y=2 Y=3
X=1 0.1 0.2 0.1
X=2 0.15 0.25 0.2

$p_{\cdot 2} = 0.2 + 0.25 = 0.45$

$$P(X=1 \mid Y=2) = \frac{0.2}{0.45} \approx 0.444, \quad P(X=2 \mid Y=2) = \frac{0.25}{0.45} \approx 0.556$$

验证:$0.444 + 0.556 = 1$ ✓

连续型:$f(x,y) = 8xy$($0 < x < y < 1$),$f_Y(y) = 4y^3$($0 < y < 1$):

$$f_{X|Y}(x|y) = \frac{8xy}{4y^3} = \frac{2x}{y^2}, \quad 0 < x < y$$

给定 $Y=0.5$ 时:$f_{X|Y}(x|0.5) = \frac{2x}{0.25} = 8x$($0 < x < 0.5$)。验证:$\int_0^{0.5} 8x\ dx = 4x^2\big|_0^{0.5} = 1$ ✓

✍️ 立刻练一道(刚悟出的"格子 ÷ 列合计",马上就用):设 (X,Y) 的联合分布律如下(X取0,1;Y取0,1),求给定 $Y=1$ 时 X 的条件分布律。

X\Y Y=0 Y=1
X=0 0.1 0.2
X=1 0.3 0.4
点击看答案

分母 = $P(Y=1) = 0.2 + 0.4 = 0.6$(Y 的边缘 = 第 2 列合计)。

$$P(X=0 \mid Y=1) = \frac{0.2}{0.6} = \frac{1}{3}, \quad P(X=1 \mid Y=1) = \frac{0.4}{0.6} = \frac{2}{3}$$

验证:$\frac{1}{3} + \frac{2}{3} = 1$ ✓

答案:$P(X=0|Y=1)=1/3$,$P(X=1|Y=1)=2/3$

📝 配套练习

题6 ⭐ | 条件分布(离散型)

对应模板:题型四(条件分布律)

已知 (X,Y) 的联合分布律为:

X\Y 1 2
1 0.2 0.1
2 0.3 0.4

求给定 Y=1 的条件下,X 的条件分布律。

点击看答案

$P(Y=1)=0.2+0.3=0.5$

$$P(X=1|Y=1)=\frac{0.2}{0.5}=0.4,\quad P(X=2|Y=1)=\frac{0.3}{0.5}=0.6$$

验证:$0.4+0.6=1$ ✓

答案:$P(X=1|Y=1)=0.4$,$P(X=2|Y=1)=0.6$


题7 ⭐⭐ | 条件密度(连续型)

对应模板:题型四(条件密度计算)

设 (X,Y) 的联合密度为 $f(x,y)=x+y$($0<x<1, 0<y<1$),求 $y=0.5$ 时 X 的条件密度 $f_{X|Y}(x|0.5)$。

点击看答案

第1步:求 $f_Y(y)$。
当 $0<y<1$:$f_Y(y)=\int_0^1 (x+y),dx = \frac{1}{2}+y$

第2步:$f_Y(0.5)=\frac{1}{2}+0.5=1$

第3步:$f_{X|Y}(x|0.5)=\frac{f(x,0.5)}{f_Y(0.5)} = \frac{x+0.5}{1} = x+0.5$($0<x<1$)

答案:
$$f_{X|Y}(x|0.5)=\begin{cases} x+0.5, & 0<x<1 \ 0, & \text{其他} \end{cases}$$


④ 推导复盘

📝 用大白话把整个过程重新讲一遍:

  1. 起点是初等概率论里最基础的条件概率公式:$P(A|B) = P(AB)/P(B)$。分子是"两件事都发生",分母是"条件那件事本身"。
  2. 离散型直接套用:分子 $p_{ij}$(联合表中的格子),分母 $p_{\cdot j}$(Y的边缘 = 第j列合计)。结果就是"给定Y取某值后,X取各种值的概率"。
  3. 连续型的难点在于 $P{Y=y}=0$,不能直接用"除以概率"。技巧是:在无穷小区间 $[y, y+dy]$ 上写条件概率,分子分母中的 $dy$ 约掉,极限下得到"密度相除"的形式。
  4. 几何理解:联合密度山上沿 Y=y 切一刀,剖面形状是对的,但面积不是 1。除以 $f_Y(y)$ 就是把剖面缩放到面积=1,变成合法的概率分布。

📝 整个推导的关键转折点:连续型中 $dy$ 约掉了——这解释了为什么单点概率为 0 的情况下,条件密度仍然有意义。密度的比值比单个概率的比值更稳定。


⑤ 易错边界

⚠️ 错误1(最致命):分母为零

$P{X = x_i \mid Y = y_j}$ 只有在 $P{Y = y_j} > 0$ 时才有定义。如果 $P{Y = y_j} = 0$,说明这个 $y_j$ 根本不可能出现——你不能以一个不可能发生的事件为前提去讨论别的变量。

连续型同理:要求 $f_Y(y) > 0$。在 $f_Y(y) = 0$ 的点上,条件密度没有定义。

🐱 大白话:你想调查"养猫的人每月花多少钱买猫粮",但你去的小区根本没人养猫(分母=0)——你连调查对象都找不到,怎么算比例?条件分布的分母就是"养猫的人数",这个人不能是 0。

⚠️ 错误2:搞反分子和分母

$$f_{X|Y}(x|y) = \frac{f(x,y)}{f_Y(y)}$$

竖线后面是 Y → 分母是 $f_Y(y)$(Y 的边缘)。记忆口诀:谁在竖线后面,谁就进分母。

⚠️ 错误3:连续型忘记标注 x 的取值范围

给定 $Y=y$ 后,x 的取值范围会受到 y 的约束。比如联合密度定义在 $0 < x < y < 1$,给定 $Y=0.5$ 后 x 的范围是 $(0, 0.5)$,不是 $(0, 1)$。

⚠️ 错误4:把条件密度里的 y 也当成变量

条件密度 $f_{X|Y}(x|y)$ 中,y 是已知常数(条件已经给定了),只有 x 是变量。验证"条件密度积分为 1"时,是对 x 积分,y 当常数带着走:

$$\int f_{X|Y}(x|y)\ dx = 1 \quad (\text{对 } x \text{ 积分,} y \text{ 固定})$$

⚠️ 错误5:混淆"条件分布"和"边缘分布"

边缘分布是一个全局视角(全校学生的身高分布);条件分布是一个局部视角(只选了体重>80kg的学生,再看他们的身高分布)。

⚠️ 错误6:连续型中 $P{Y=y}=0$ 不能直接做分母——但要区分"概率"和"密度"

虽然 $P{Y=y} = 0$(单点概率为零),但只要密度 $f_Y(y) > 0$,条件密度 $f(x,y)/f_Y(y)$ 仍然有定义。因为密度不等于概率——密度在某点可以大于 0,即使该点概率为 0。这就像一根针尖的面积是 0,但针尖所在的位置可以有一个确定的"密度读数"。


⑥ 链条位置

从哪来:

到哪去:

在整条链中的位置:联合分布 → 边缘分布 → 条件分布。条件分布是"联合/边缘"的商,也是连接联合分布和独立性、贝叶斯公式的关键枢纽。学会了条件分布,"已知部分信息后更新判断"的整个推理链条就打通了。


1.7 随机变量的独立性(⭐⭐⭐ 核心定理 · 六段式)

先想一个场景:朋友的硬币,会影响你的硬币吗?

你和朋友各抛一枚硬币。你抛出正面,朋友抛出什么?——你心里清楚,他的结果跟你半点关系都没有。你不会因为朋友抛了正面,就觉得自己更该出反面。这就是直觉里的"独立":知道一个结果,对判断另一个结果没有半点帮助。

反过来想一个不独立的例子:知道一个人月收入 2 万,你会猜他月消费大概几千到一万多;知道月收入 3000,你会猜消费一两千。收入的信息改变了你对消费的判断——这两个变量就不独立。

难在哪?——"独立不独立"这么直觉的东西,考试里要拿数字判定,光凭感觉不行。你得把"知道一个不影响另一个"翻译成能计算的公式。怎么翻译?两个角度,最后会汇聚到同一个结论:

这就是本节的主角——独立性判定。

这一节要解决的核心问题:你手里有两个随机变量 X 和 Y,怎么判断它们是"各过各的、互不影响"还是"一个人变了另一个人也会跟着变"?数学上叫"独立性判定"——全章最基础也最容易在细节上翻车的概念。


① 生活场景

🪙 场景1:你和朋友各抛一枚硬币——你的结果是正面还是反面,跟你朋友的结果有半毛钱关系吗?没有。你的硬币不会"感应"到你朋友抛了正面就偏要出反面。这就是独立:知道朋友的结果,改变不了你对自己那枚硬币的判断。

💰 场景2:月收入和月消费——知道一个人月收入 2 万,你会猜他月消费大概几千到一万多;知道一个人月收入 3000,你会猜他月消费一两千。收入的信息"改变了"你对消费的判断——这就是不独立。

🎲 场景3:一颗骰子掷两次——第一次出几点和第二次出几点有关系吗?除非骰子被做了手脚,两次完全独立。第一次掷出 6,第二次掷出 6 的概率仍然是 1/6,不会"因为刚才出过 6 了所以这次不容易出 6"——那是赌徒谬误。

大白话:独立 = 知道一个变量的值,对猜另一个变量的值没有半点帮助。不独立 = 知道一个,另一个的"可能性分布"就变了。


② 正式陈述

设二维随机变量 (X,Y) 的联合分布函数为 $F(x,y)$,边缘分布函数分别为 $F_X(x)$ 和 $F_Y(y)$。

定义(分布函数形式):若对任意实数 x, y,都有
$$F(x,y) = F_X(x) \cdot F_Y(y)$$
则称 X 与 Y 相互独立。

离散型的等价判定:X 与 Y 独立 $\iff$ 对所有 i, j:
$$p_{ij} = p_{i\cdot} \times p_{\cdot j}$$
即联合分布律的每个格子 = 对应行合计 x 对应列合计。

连续型的等价判定:X 与 Y 独立 $\iff$ 在联合密度的连续点处(几乎处处):
$$f(x,y) = f_X(x) \cdot f_Y(y)$$
即联合密度 = 两个边缘密度的乘积。

💡 数学上更精确的说法是"对几乎所有 (x,y)"——意思是除了个别不影响积分的点(如一条宽度为零的线)之外,其他地方都要相等。这保证了密度函数在"概率意义上"的乘积关系成立。

从条件分布角度看独立:当 X 与 Y 独立时,条件分布退化为边缘分布:
$$f_{X|Y}(x|y) = \frac{f(x,y)}{f_Y(y)} = \frac{f_X(x) \cdot f_Y(y)}{f_Y(y)} = f_X(x)$$
条件没有带来任何额外信息——知道 Y=y 对 X 的判断毫无帮助。


③ 完整推导

🧠 第1步:从直觉到公式——"独立"到底在说什么

"独立"在生活中的意思是"互不影响"。翻译成概率语言:不管 Y 取什么值,X 取某个值的概率都不变。也就是条件概率 = 无条件概率:
$$P(X = x_i \mid Y = y_j) = P(X = x_i)$$

大白话:Y 取什么值,对 X 取 x_i 的概率没有任何影响——就像你朋友抛硬币的结果不影响你的硬币正面朝上的概率。

🧠 第2步:把条件概率展开,得到联合 = 边缘乘积

将条件概率公式 $P(X=x_i \mid Y=y_j) = \frac{P(X=x_i, Y=y_j)}{P(Y=y_j)}$ 代入第1步:

$$\frac{P(X=x_i, Y=y_j)}{P(Y=y_j)} = P(X=x_i)$$

两边同乘 $P(Y=y_j)$:

$$P(X=x_i, Y=y_j) = P(X=x_i) \cdot P(Y=y_j)$$

用符号表示:$p_{ij} = p_{i\cdot} \times p_{\cdot j}$

大白话:"两个人一起发生的概率"等于"第一个人发生的概率"乘以"第二个人发生的概率"。这是从条件概率定义一步推出来的,没有额外假设。

🧠 第3步:"所有"两个字不能省——独立性是"一票否决制"

关键来了——独立要求对每一对 (i,j) 都成立,不是"大多数成立就行"。

大白话:你检查 100 个格子,99 个满足"联合 = 边缘乘积",只有 1 个不满足——那就不独立!就像考试 100 道题,99 道对了 1 道错了,也不能说全对。独立性判定是"一票否决制"——找到一个反例就推翻。

🧠 第4步:连续型的平行推导

连续型不能逐点写条件概率(单点概率为 0),但密度的乘积关系可以平行推导:

$$f_{X|Y}(x|y) \stackrel{\text{独立}}{=} f_X(x)$$

而 $f_{X|Y}(x|y) = \frac{f(x,y)}{f_Y(y)}$,代入得:

$$\frac{f(x,y)}{f_Y(y)} = f_X(x) \quad \Rightarrow \quad f(x,y) = f_X(x) \cdot f_Y(y)$$

大白话:离散型是"格子 = 行合计 x 列合计";连续型是"联合密度 = X边缘密度 x Y边缘密度"。同一个思想换了件衣服——离散用求和,连续用积分,"联合 = 边缘乘积"这个核心等式不变。

🧠 第5步:速判法——看定义区域的形状

一个极其实用的技巧:如果联合密度 $f(x,y)$ 的非零区域不是矩形(不能写成 $a < x < b,\ c < y < d$ 的形式),则 X 和 Y 一定不独立。

为什么?独立性意味着 X 的取值范围和 Y 的取值无关。如果区域是三角形(如 $0 < x < y < 1$),知道 x=0.8 就意味着 y>0.8——x 的信息限制了 y 的范围,不独立。如果区域是圆形($x^2+y^2 \leq 1$),知道 x=0.9 就把 y 限制在很窄的范围——不独立。

大白话:不用算,先看区域形状!非矩形(三角形、圆形等)→ 直接判不独立。只有矩形区域才可能独立——然后再检查函数能不能拆成 g(x)·h(y)。

🧠 第6步:独立性的"可分离变量"判定法(连续型进阶技巧)

如果联合密度可以写成"只含 x 的函数" x "只含 y 的函数":
$$f(x,y) = g(x) \cdot h(y)$$
且定义区域是矩形($a<x<b,\ c<y<d$),则 X 和 Y 独立。此时 $f_X(x)$ 正比于 $g(x)$,$f_Y(y)$ 正比于 $h(y)$。

但注意:即使 f(x,y) 能写成 g(x)·h(y),如果定义区域不是矩形——仍然不独立!区域形状是第一关,函数形式是第二关。

大白话:两关都要过——第一关看形状(是不是矩形),第二关看函数(能不能拆成 x 的部分乘 y 的部分)。第一关不通过,直接淘汰。

✍️ 立刻练一道(刚悟出的"逐格检查"+"一票否决",马上就用):设 (X,Y) 的联合分布律如下(X取0,1;Y取0,1),判断 X 和 Y 是否独立。

X\Y Y=0 Y=1
X=0 0.25 0.25
X=1 0.25 0.25
点击看答案

第1步:求边缘分布。

  • $P(X=0)=0.5$,$P(X=1)=0.5$;$P(Y=0)=0.5$,$P(Y=1)=0.5$

第2步:逐格检查。看格子 (0,0):联合概率 = 0.25,边缘乘积 = 0.5×0.5 = 0.25,相等。再看格子 (0,1):0.25 = 0.5×0.5,也相等。(1,0)、(1,1) 同样相等。

第3步:全部格子都满足"联合 = 边缘乘积",独立。

答案:X 与 Y 独立。

📝 配套练习

题4 ⭐ | 离散型判断独立性(不独立的情况)

对应模板:题型三(随机变量的独立性判断)

已知 (X,Y) 的联合分布律为:

X\Y 1 2
1 0.2 0.1
2 0.3 0.4

判断 X 和 Y 是否独立。

点击看答案

第1步:求边缘分布。
$P(X=1)=0.3$,$P(X=2)=0.7$;$P(Y=1)=0.5$,$P(Y=2)=0.5$

第2步:逐一检查。检查 (1,1) 格:
$P(X=1,Y=1)=0.2$,$P(X=1)\times P(Y=1)=0.3\times0.5=0.15$
$0.2\neq0.15$,不相等!

所以 X 和 Y 不独立。


题5 ⭐⭐ | 连续型判断独立性(独立的情况)

对应模板:题型三(独立性判断)

设 (X,Y) 的联合密度为 $f(x,y)=4xy$($0<x<1, 0<y<1$),判断 X 与 Y 是否独立。

点击看答案

求 $f_X(x)$:$f_X(x)=\int_0^1 4xy,dy=2x$($0<x<1$)
求 $f_Y(y)$:$f_Y(y)=\int_0^1 4xy,dx=2y$($0<y<1$)

$f_X(x)·f_Y(y)=2x·2y=4xy=f(x,y)$ ✓

答案:X 与 Y 独立。


④ 推导复盘

📝 用大白话把整个过程重新讲一遍:

  1. "独立"的直觉是"互不影响"。翻译成概率语言:条件概率 = 无条件概率。
  2. 利用条件概率的定义 $P(A|B) = P(AB)/P(B)$,把直觉翻译成公式:$p_{ij} / p_{\cdot j} = p_{i\cdot}$,等价于 $p_{ij} = p_{i\cdot} \times p_{\cdot j}$。
  3. 这就是著名的"联合 = 边缘乘积"。离散型是格子乘积,连续型是密度乘积——同一个公式,两件衣服。
  4. "所有"是独立性判定中最容易被忽视的词——必须逐点验证,一票否决。
  5. 连续型超实用速判法:先看区域形状——非矩形直接判不独立。只有矩形才需要往下算。
  6. 独立时,条件分布退化为边缘分布——条件不带来任何新信息。这是从条件分布理解独立性的另一视角。

📝 整个推导的关键转折点:从"条件概率 = 无条件概率"到"联合 = 边缘乘积"——这是独立性的两种等价表述。前者是"直觉版"(知道 Y 不影响对 X 的判断),后者是"操作版"(用来做计算验证)。等价性来自条件概率定义本身。


⑤ 易错边界

⚠️ 错误1(最致命):只检查一个格子就说"独立"

独立性要求所有 (i,j) 对都满足联合 = 边缘乘积。检查一个格子不够——就像不能说"我去过一次北京没雾霾,所以北京从来没雾霾"。

⚠️ 错误2(离散高频陷阱):边缘分布算错,独立性判断全错

边缘分布是独立性判定的基础。行合计或列合计算错 → 乘积算错 → 独立性结论全错。做独立性判定之前,先验证两个边缘分布加起来都等于 1——这是基本安全检查。

⚠️ 错误3(连续高频陷阱):看函数能分离就判独立,不管区域形状

$f(x,y) = 8xy$ 在 $0 < x < y < 1$ 上——函数可以写成 $8x \cdot y$(能分离),但区域是三角形!X 和 Y 不独立!因为 $0 < x < y$ 意味着 x 被 y 限制了。

判定独立性的正确顺序:①先看区域(非矩形 → 直接不独立)→ ②再看函数(矩形 + 可分离 → 独立)。两步缺一不可。

⚠️ 错误4:混淆"独立"和"不相关"

这是两个不同层级的概念——独立比不相关更强:

📌 先记住这个结论:协方差和相关系数要到第 4 章才正式定义,这里先把方向记住——独立 ⇒ 不相关,反过来不一定。第 4 章学了严格定义后,再回来看这个结论为什么成立。

例:X 对称分布在 [-1,1] 上,Y = X²。X 和 Y 不相关(协方差为 0,因为没有线性趋势),但显然不独立——知道 X=0.9,就能确定 Y=0.81。这种"曲线关系"协方差捕捉不到。

唯一例外:二维正态分布中,独立 ⇔ ρ=0(不相关)。这是考研高频考点。


⑥ 链条位置

从哪来:

到哪去:

在整条链中的位置:联合分布 → 边缘分布 → 条件分布 → 独立性。独立性是本章的知识分水岭——之前的内容(边缘、条件)是"描述性"的(告诉你两个变量之间是什么关系),独立性开始是"判断性"的(给关系定性:有关还是无关)。判定了独立性,卷积公式和 max/min 公式才能决定走捷径还是绕路。

🛑 迷你自测:翻回 1.3 节那张联合分布律表(X=1,2; Y=1,2,3),检查一下——X 和 Y 独立吗?(提示:挑一个格子,算 P(X=1, Y=1) 是否等于 P(X=1) × P(Y=1)。)


1.8 两个随机变量函数的分布

Z = X+Y 的分布——卷积公式(⭐⭐⭐ 核心定理 · 六段式)

这一节要解决的核心问题:已知 X 和 Y 各自的分布,它们加在一起 Z = X+Y 的分布长什么样?这是全章考得最多的大题题型——两个随机因素叠加后的结果。


先想一个困境:两颗骰子加在一起,点数分布长什么样?

掷两颗公平的骰子,X = 第一颗的点数,Y = 第二颗的点数,独立。每颗骰子单独看,点数是均匀的(1 到 6 各 1/6)。问:总点数 Z = X+Y 的分布长什么样?

难在哪?——"总点数是 7"不是只有一种凑法。可以是 (1,6)、(2,5)、(3,4)、(4,3)、(5,2)、(6,1)——所有"和为 7"的组合都得算上,一个都不能漏。而且不同总点数的"凑法个数"不一样:总点数 7 有 6 种凑法,总点数 2 只有 (1,1) 一种。所以 Z 的分布绝不是均匀的。

试着算——每次组合的概率都是 $1/6 \times 1/6 = 1/36$(独立),那么:
$$P(Z=7) = P(X=1,Y=6) + P(X=2,Y=5) + \cdots + P(X=6,Y=1) = 6 \times \frac{1}{36} = \frac{1}{6}$$

🧠 这一步在想什么:"和为 z"每一对 (x, z-x) 都贡献一份概率,把它们全加起来。这个"把所有凑出 z 的组合全部累加"的运算,就是本节的主角——卷积。离散型是求和,连续型就是积分。下面先给出连续型的完整推导(为什么是那个积分),再回来看离散型实例。


① 生活场景

🚌 场景1:通勤时间——你每天上班,先走到公交站等车。等车时间 X 服从指数分布(有时运气好马上来,有时等很久),坐车时间 Y 服从均匀分布(20到40分钟之间,路况差不多)。你真正关心的是:从出门到公司的总时间 Z = X+Y 有多大的概率超过1小时? 两个独立随机因素叠加,总时间的分布不是简单的"两个分布拼在一起"——你需要一种叫"卷积"的运算。

🎲 场景2:两次抽奖——公司年会抽奖,上午抽一次(X元红包),下午再抽一次(Y元红包),两次独立。你关心今天总共拿到多少钱 Z = X+Y。Z=100 元的可能性来自哪些组合?可能是上午50+下午50,也可能是上午30+下午70,还可能是上午80+下午20……所有和为100的组合都要考虑。

📦 场景3:包裹总重量——你在两个不同的网店各买了一件东西,第一件重量 X、第二件重量 Y,快递按总重量 Z = X+Y 计费。X 和 Y 各自有分布,总重量 Z 超过首重的概率是多少?

大白话:两个独立随机变量相加——你要把所有"加起来等于 z"的可能路径的概率(或密度)全部累加起来。这就是卷积的直觉。


② 正式陈述

问题:已知二维随机变量 (X,Y) 的联合分布,求 Z = X+Y 的分布。

离散型:Z = X+Y 的分布律为:
$$P{Z = z_k} = \sum_{i} P{X = x_i,\ Y = z_k - x_i}$$

当 X 和 Y 独立时,简化为卷积形式:
$$P{Z = z_k} = \sum_{i} P{X = x_i} \cdot P{Y = z_k - x_i}$$

连续型:先用分布函数法求 $F_Z(z)$,再求导得 $f_Z(z)$:
$$F_Z(z) = P{X+Y \leq z} = \iint_{x+y \leq z} f(x,y)\ dxdy$$
$$f_Z(z) = F'_Z(z)$$

当 X 和 Y 独立时,得到卷积公式:
$$f_Z(z) = \int_{-\infty}^{+\infty} f_X(x) \cdot f_Y(z-x)\ dx$$

或对称形式:
$$f_Z(z) = \int_{-\infty}^{+\infty} f_X(z-y) \cdot f_Y(y)\ dy$$


③ 完整推导

🧠 第1步:用分布函数法——从"Z ≤ z"这个事件出发

要求 Z = X+Y 的分布,最直接的想法是:先算 Z 不超过某个值 z 的概率(也就是分布函数),然后求导得到密度函数。

$$F_Z(z) = P{Z \leq z} = P{X+Y \leq z}$$

大白话:求 Z 的分布,先不直接求它的密度——因为密度不好直接表达。曲线救国:先求"Z 不超过 z"的概率(分布函数),然后对它求导就是密度。这就像想知道车速的变化(加速度),先去记录位置的变化(位移),然后求两次导。

🧠 第2步:把概率写成二重积分

"X+Y ≤ z"这个条件在平面上对应什么区域?在 XY 平面上画一条直线 $x+y = z$(斜率为 -1 的直线,截距为 z)。"X+Y ≤ z"就是这条直线左下方的整个半平面。随机点 (X,Y) 落在半平面内的概率,就是在那个半平面上对联合密度做二重积分:

$$F_Z(z) = \iint_{x+y \leq z} f(x,y)\ dxdy$$

大白话:平面上画一条斜线 x+y=z,这条线的左下方就是"X+Y不超过z"的区域。在这个区域上对联合密度积分,得到的就是分布函数 F_Z(z)。想象联合密度是一座山——F_Z(z) 就是山在斜线左下方的体积。

🧠 第3步:把二重积分拆成迭积分

固定 x,让 y 从 -∞ 变到 z-x(因为 y 必须满足 y ≤ z-x)。这样把半平面上的二重积分拆成"先对 y、再对 x"的迭积分:

$$F_Z(z) = \int_{-\infty}^{+\infty} \left[ \int_{-\infty}^{z-x} f(x,y)\ dy \right] dx$$

大白话:把半平面切成无数条竖线——每条竖线固定一个 x,y 从最底下一直积到斜线所在的高度(z-x)。然后把所有竖线的结果沿 x 方向加总。这就像把一座山切成竖着的薄片,每片算面积,再把所有片的面积加起来。

🧠 第4步:对 z 求导,从分布函数得到密度函数

密度 = 分布函数的导数:$f_Z(z) = \frac{d}{dz} F_Z(z)$。对上面的迭积分求导,里面那层积分的上限是 z-x,用变上限积分求导公式:

$$f_Z(z) = \frac{d}{dz} \int_{-\infty}^{+\infty} \left[ \int_{-\infty}^{z-x} f(x,y)\ dy \right] dx = \int_{-\infty}^{+\infty} f(x, z-x)\ dx$$

大白话:变上限积分对上限变量求导——把上限代入被积函数即可。里面那层积分上限是 z-x,对 z 求导就是把 y 换成 z-x,得到 f(x, z-x)。外面那层对 x 的积分保持不变。

这已经是一个可以用的公式:$f_Z(z) = \int_{-\infty}^{+\infty} f(x, z-x)\ dx$。注意!这里用的是联合密度 f(x,y),不是边缘密度——意味着这个公式即使 X 和 Y 不独立也能用(只要你知道联合密度)。

🧠 第5步:X 和 Y 独立时,得到卷积公式

如果 X 和 Y 独立,联合密度等于边缘密度的乘积:$f(x, z-x) = f_X(x) \cdot f_Y(z-x)$。代入上面的公式:

$$f_Z(z) = \int_{-\infty}^{+\infty} f_X(x) \cdot f_Y(z-x)\ dx$$

这就是大名鼎鼎的卷积公式。

大白话:独立是"魔法开关"——一旦独立,联合密度就可以拆成 f_X(x) × f_Y(y)。把 y 换成 z-x,就得到了只依赖两个边缘密度的卷积公式。不独立的时候,你只能用第4步那个带联合密度的版本(也就是老老实实回到分布函数法做二重积分)。这就是为什么判断"X和Y是否独立"是做Z=X+Y题的第一步!

实例演示

离散型——两个骰子的点数之和:

掷两颗公平的骰子,X = 第一颗的点数,Y = 第二颗的点数,独立。求 Z = X+Y 的分布。

X 和 Y 的分布律都是:$P{X=k} = 1/6$(k = 1,2,...,6)。

Z=7 的组合:(1,6),(2,5),(3,4),(4,3),(5,2),(6,1),一共 6 种组合。
每种组合的概率 = 1/6 × 1/6 = 1/36。
$$P{Z=7} = 6 \times \frac{1}{36} = \frac{1}{6}$$

Z=2 只有一种组合 (1,1):$P = 1/36$。
Z=12 只有一种组合 (6,6):$P = 1/36$。

最终 Z 的分布呈"金字塔"形——中间(Z=7)概率最大,两头(Z=2,12)概率最小。

连续型——两个独立 U(0,1) 的和(见题型五例题,结果呈三角分布)。

✍️ 立刻练一道(刚悟出的"把所有和为 z 的组合都算上",马上就用):掷两颗公平的骰子,X、Y 分别为两骰子点数,独立。求 $P(Z=8)$,其中 Z = X+Y。

点击看答案

总点数为 8 的组合:(2,6)、(3,5)、(4,4)、(5,3)、(6,2),一共 5 种。

每种组合的概率 = 1/6 × 1/6 = 1/36,所以:
$$P(Z=8) = 5 \times \frac{1}{36} = \frac{5}{36}$$

答案:5/36

📝 配套练习

题8 ⭐⭐ | 卷积——两个 U(0,1) 的和(经典三角形分布)

对应模板:题型五(卷积公式)

设 X 和 Y 独立同服从 [0,1] 上的均匀分布,求 Z = X+Y 的密度函数。

点击看答案

用卷积公式。$f_X(x)=1$($0<x<1$),$f_Y(y)=1$($0<y<1$)。

$$f_Z(z)=\int_{-\infty}^{+\infty}f_X(x)f_Y(z-x),dx$$

被积函数非零:$0<x<1$ 且 $0<z-x<1$,即 $\max(0,z-1)<x<\min(1,z)$。

$0<z\leq1$:$f_Z(z)=\int_0^z 1,dx = z$
$1<z<2$:$f_Z(z)=\int_{z-1}^1 1,dx = 2-z$

答案:
$$f_Z(z)=\begin{cases} z, & 0<z\leq1 \ 2-z, & 1<z<2 \ 0, & \text{其他} \end{cases}$$
呈三角形分布。


题9 ⭐⭐⭐ | 正态分布可加性

对应模板:题型五(卷积公式+正态性质)

设 XN(0,1),YN(0,1),且 X 与 Y 独立。求 Z = X+Y 的分布。

点击看答案

方法一(快捷):独立正态的和仍是正态,均值相加、方差相加。
$Z\sim N(0+0, 1+1) = N(0,2)$
$$f_Z(z)=\frac{1}{\sqrt{4\pi}}e^{-\frac{z^2}{4}}$$

方法二(卷积验证):用卷积公式配平方积分,得到相同结果。

答案:$Z\sim N(0,2)$


④ 推导复盘

📝 用大白话把整个过程重新讲一遍:

  1. 你要算两个随机变量加起来(Z = X+Y)的分布。直接求密度不好办,于是先绕一步——求"Z 不超过某个值 z"的概率(分布函数法)。
  2. "X+Y 不超过 z"在平面上就是斜线 x+y=z 左下方的半平面。在这个半平面上对联合密度做二重积分,就得到了分布函数 F_Z(z)。
  3. 把这个二重积分拆成迭积分(先对 y 从 -∞ 积到 z-x,再对 x 从 -∞ 积到 +∞),然后对 z 求导——利用变上限积分求导法则,得到 $f_Z(z) = \int f(x, z-x)\ dx$。这个公式用联合密度,即使不独立也能用。
  4. 如果 X 和 Y 独立,联合密度 = 边缘密度乘积,代入得到卷积公式:$f_Z(z) = \int f_X(x) f_Y(z-x)\ dx$。
  5. 卷积的本质就是:把所有"和为 z"的 (x, z-x) 组合的密度全部加总起来。x 取不同值时,y = z-x 取对应值,每一对 (x, z-x) 贡献 $f_X(x) \cdot f_Y(z-x)$,积分就是把这些无穷多对的贡献全部累加。

📝 整个推导的关键转折点有两个:(1) 分布函数法——"先求概率再求导"这个迂回策略绕开了直接求密度的困难;(2) 独立条件的引入——把联合密度拆成边缘密度乘积,计算量从二重积分降为一重积分。


⑤ 易错边界

⚠️ 错误1(最致命):不独立就用卷积公式

卷积公式 $f_Z(z) = \int f_X(x) f_Y(z-x)\ dx$ 的前提是 X 和 Y 相互独立!如果题目没有明确说"独立"两个字,或者你判断出来它们不独立——必须回到分布函数法(二重积分)。

拿到 Z=X+Y 的题目,第一眼看什么?——题目有没有说"X和Y独立"!这个判断决定了你走哪条路。

⚠️ 错误2(极其高频):积分上下限照抄 $(-\infty, +\infty)$

卷积公式里积分号上写的是 $-\infty$ 到 $+\infty$,但实际操作时必须根据 $f_X$ 和 $f_Y$ 的实际非零区域来确定上下限。

具体做法:被积函数 $f_X(x) \cdot f_Y(z-x)$ 非零,当且仅当 x 在 f_X 的非零范围内、且 z-x 在 f_Y 的非零范围内。两个条件同时成立,x 的范围就是这两个条件的交集——这个交集取决于 z 的取值,所以必须对 z 分段讨论。

例:XU(0,1),YU(0,1) 独立。$f_X(x)$ 非零要求 $0<x<1$;$f_Y(z-x)$ 非零要求 $0<z-x<1$,即 $z-1<x<z$。x 的实际积分范围是 $(0,1) \cap (z-1, z)$ ——这就是为什么最终结果要根据 z 在 [0,1] 还是 [1,2] 分段。

⚠️ 错误3:X-Y 不是直接套卷积公式

题目让求 Z = X - Y 的分布。不能直接套卷积!正确的做法:令 W = -Y,先求出 W 的分布($f_W(w) = f_Y(-w)$),然后 Z = X + W,对 X 和 W 用卷积公式。

$$f_{X-Y}(z) = \int_{-\infty}^{+\infty} f_X(x) \cdot f_Y(x-z)\ dx$$

注意这个公式和 X+Y 的卷积公式的区别:$f_Y$ 的参数变成了 $x-z$ 而不是 $z-x$。

⚠️ 错误4:连续型忘了写 z 的取值范围

求完 $f_Z(z)$ 之后,必须在结果后面标注 z 的有效范围。卷积的结果通常是一个分段函数——不同 z 区间对应不同的积分上下限,因此表达式不同。漏了范围标注 → 扣分。

⚠️ 错误5:离散型忘了"和为 z"可能有多种组合

离散卷积时,$P(Z=k)$ 要加总所有满足 $x_i + y_j = k$ 的 (i,j) 组合。有时候一个 k 只对应一种组合,有时候对应多种——必须全部找齐。漏掉组合 → 概率算错。


⑥ 链条位置

从哪来:

到哪去:

在整条链中的位置:联合分布 → 边缘分布 → 条件分布 → 独立性 → 卷积(Z=X+Y)→ max/min → 第4章数字特征 → 第5章极限定理。卷积是"从两个分布合成一个新分布"的操作——独立性能让这个操作从二重积分简化成一重积分(卷积公式),而不独立时你必须回到最原始的分布函数法。学会卷积,整个"随机变量函数分布"这一大类题的通用思路就打通了。

🛑 停一下:用你自己的话说——卷积公式在什么前提条件下才能用?(答案:X 和 Y 必须独立。)如果不独立,改用哪种方法?(答案:分布函数法,即二重积分。)眼睛扫一下题目,先判断能不能用卷积。

最大值 M = max(X,Y) 与最小值 N = min(X,Y) 的分布(⭐⭐ 核心方法 · 六段式·方法级)

这一节要解决的核心问题:n 个随机变量中"最强的那个"(max)和"最弱的那个"(min)各自服从什么分布?这是串联/并联系统寿命分析的理论基础。


先想一个困境:一串联灯,整串多久会灭?

一串圣诞树彩灯,只要有一个灯泡烧了,整串全灭。假如每个灯泡寿命独立,都服从某个分布——问:整串灯能撑多久?

难在哪?——整串灯的寿命取决于最先烧掉的那个灯泡(最脆弱的那个)。你没法直接说"整串寿命 = 某个灯泡的寿命",因为它随时可能被任何一个灯泡拖垮。换句话说:整串寿命 N = min(各灯泡寿命)。这个"最小值"的分布,不能简单套用单个灯泡的分布。

再想另一个方向:双电源机房,两路电源只要还有一路有电,服务器就不关机。系统能撑多久?——取决于最后断电的那一路(最坚挺的那个)。系统寿命 M = max(两路电源寿命)。

难在哪(升级版)?——"min ≤ z"这件事有个坑。你先试着想:整串灯"寿命不超过 z"等价于"每个灯泡都不超过 z"吗? 想清楚这个问题,max 和 min 的区别就明白了。下面带着这个问题看。


① 生活场景

💡 场景1:串联电路 = 圣诞树彩灯——一串彩灯只要有一个灯泡烧了整串全灭。这串灯的寿命取决于最先烧掉的那个(最脆弱的)。数学上:系统寿命 = min(各灯泡寿命)。

🔋 场景2:并联电路 = 双电源机房——两路电源只要还有一路有电服务器就不关机。系统能撑多久取决于最后断电的那一路(最坚挺的)。数学上:系统寿命 = max(两路电源寿命)。

🏆 场景3:体操比赛打分——5 位裁判打分,去掉最高最低取平均。最高分 M = max(5 个分数) 服从什么分布?最低分 N = min(5 个分数) 呢?

🚌 场景4:等多路公交——有 3 条线路都到公司,你上最先来的那辆。等车时间 N = min(三辆车的到达时间) 服从什么分布?

大白话:max 是"看最好的那个",min 是"看最差的那个"。两者的推导思路截然不同——max 可以直来直去(用 ≤ 直接写),min 必须绕弯(用 > 反着推)。


② 正式陈述

问题:设 n 个随机变量 $X_1, X_2, \ldots, X_n$ 相互独立,每个的分布函数为 $F_i(x)$(同分布时统一记为 $F(x)$)。求最大值 $M = \max(X_1, \ldots, X_n)$ 和最小值 $N = \min(X_1, \ldots, X_n)$ 的分布。

M = max 的分布:

分布函数:$F_M(z) = P{M \leq z} = P{X_1 \leq z,\ X_2 \leq z,\ \ldots,\ X_n \leq z}$

若 $X_1, \ldots, X_n$ 相互独立:
$$F_M(z) = F_1(z) \cdot F_2(z) \cdots F_n(z)$$

若还同分布(所有变量的分布函数都是 $F(z)$):
$$F_M(z) = [F(z)]^n$$

密度函数(当每个变量有密度 $f(x)$ 时):
$$f_M(z) = n[F(z)]^{n-1} \cdot f(z)$$

N = min 的分布:

分布函数:$F_N(z) = P{N \leq z} = 1 - P{N > z} = 1 - P{X_1 > z,\ X_2 > z,\ \ldots,\ X_n > z}$

若 $X_1, \ldots, X_n$ 相互独立:
$$F_N(z) = 1 - [1-F_1(z)] \cdot [1-F_2(z)] \cdots [1-F_n(z)]$$

若还同分布(所有变量的分布函数都是 $F(z)$):
$$F_N(z) = 1 - [1-F(z)]^n$$

密度函数:
$$f_N(z) = n[1-F(z)]^{n-1} \cdot f(z)$$

💡 max/min 公式对比速记:max 用 $F(z)$(≤ 的累计概率),min 用 $1-F(z)$(> 的生存概率)。max 是正门直入(直接乘积),min 是后门绕道(先乘生存概率再用 1 减)。记住一句话:max 乘正概率,min 乘反概率再反回来。


③ 完整推导
第一部分:M = max(X,Y) 的推导

🧠 第1步:从分布函数出发

求 M 的分布,先求分布函数 $F_M(z) = P{M \leq z}$,然后求导得密度。

大白话:一如既往——分布函数法。先求"M 不超过 z"的概率,再求导。

🧠 第2步:关键等价——"max ≤ z"意味着什么?

"max(X,Y) ≤ z"的意思是:X 和 Y 中最大的那个都不超过 z。等价于两个都不超过 z:

$$P{M \leq z} = P{\max(X,Y) \leq z} = P{X \leq z,\ Y \leq z}$$

大白话:全班"最高分不超过 90" = "每个人的分数都不超过 90"。如果有人考了 95,最高分就超过 90 了。这个等价关系是双向的——既充分又必要。

🧠 第3步:利用独立性,概率相乘

如果 X 和 Y 相互独立:

$$F_M(z) = P{X \leq z,\ Y \leq z} = P{X \leq z} \cdot P{Y \leq z} = F_X(z) \cdot F_Y(z)$$

如果 X 和 Y 还同分布(分布函数都是 F(z)),则:
$$F_M(z) = [F(z)]^2$$

推广到 n 个独立同分布的变量 $X_1, \ldots, X_n$:
$$F_M(z) = [F(z)]^n$$

大白话:独立时"两个人都 ≤ z 的概率" = "第一个人 ≤ z 的概率" x "第二个人 ≤ z 的概率"。n 个人都独立,就是 n 次方。

🧠 第4步:求导得密度

如果每个 X_i 还有密度 f(x),对分布函数求导:

$$f_M(z) = F'_M(z) = n[F(z)]^{n-1} \cdot f(z)$$

大白话:n 次方求导 = n x 原来的^(n-1) x 密度。链式法则直接套用。

第二部分:N = min(X,Y) 的推导

🧠 第1步:不能直接用"min ≤ z"!

如果直接写 $P{\min(X,Y) \leq z} = P{X \leq z,\ Y \leq z}$——这是错的!

为什么?"min ≤ z"意思是"只要有一个不超过 z 就行"——可能 X≤z 且 Y>z,或 X>z 且 Y≤z,或两者都≤z。而 $P{X \leq z,\ Y \leq z}$ 只覆盖了"两者都≤z"这一种情况,漏了另外两种情况!

大白话:全班"最低分不超过 60" = "至少有一个人不及格"——张三不及格算、李四不及格也算、两人都不及格也算。而"两个都不超过 60"只对应两人都不及格。两件事完全不同!这是 max/min 最容易被绕晕的地方。

🧠 第2步:绕道策略——先求"min > z",再反回来

虽然"min ≤ z"不好直接写,但"min > z"非常干净!

$P{N > z}$ = "最小值都大于 z" = "两个变量都大于 z":

$$P{N > z} = P{\min(X,Y) > z} = P{X > z,\ Y > z}$$

大白话:全班"最低分都超过 90" = "每个人的分数都超过 90"。这个方向是等价的!——因为如果每个人都 > 90,最低的一定 > 90;反过来如果最低的 > 90,那每个人都 > 90。

🧠 第3步:利用独立性,再绕回来

如果 X 和 Y 独立:

$$P{N > z} = P{X > z} \cdot P{Y > z} = [1 - F_X(z)] \cdot [1 - F_Y(z)]$$

然后用 1 减回去:
$$F_N(z) = P{N \leq z} = 1 - P{N > z} = 1 - [1 - F_X(z)] \cdot [1 - F_Y(z)]$$

推广到 n 个独立同分布变量:
$$F_N(z) = 1 - [1 - F(z)]^n$$

大白话:min 公式的灵魂操作——不是直接求"min ≤ z",而是先求"min > z"(等价于"所有人都 > z",好算),再用 1 减回来。

🧠 第4步:求导得密度

$$f_N(z) = F'_N(z) = n[1 - F(z)]^{n-1} \cdot f(z)$$

max 和 min 公式对比(放一起好记):

max min
核心等价 $M \leq z \iff$ 所有人都 $\leq z$ $N > z \iff$ 所有人都 $> z$
分布函数 $[F(z)]^n$ $1-[1-F(z)]^n$
密度 $n[F(z)]^{n-1}f(z)$ $n[1-F(z)]^{n-1}f(z)$
推导路径 直来直去(正门) 绕道而行(后门)
口诀 max 乘正概率 min 乘反(生存)概率再反回来
第三部分:典型应用——串联与并联

串联系统寿命 = 各元件寿命的最小值(最脆弱的决定一切)
并联系统寿命 = 各元件寿命的最大值(最坚挺的撑到最后)

重要结论:独立指数分布取 min,结果仍是指数分布,参数相加。$X_i \sim \text{Exp}(\lambda_i)$ 独立 → $\min(X_1,\ldots,X_n) \sim \text{Exp}(\lambda_1+\cdots+\lambda_n)$。但 max 不再是简单的指数分布。

✍️ 立刻练一道(刚悟出的"max 直接乘、min 绕道补",马上就用):设 X 与 Y 独立,X ~ (0:0.2, 1:0.8),Y ~ (0:0.5, 1:0.5)。求 $M = \max(X,Y)$ 和 $N = \min(X,Y)$ 的分布律。

点击看答案

求 M(max 直接乘):
$P(M \leq 0) = P(X\leq0,\ Y\leq0) = 0.2 \times 0.5 = 0.10$
$P(M=0) = 0.10$,$P(M=1) = 1 - 0.10 = 0.90$

求 N(min 绕道补):
$P(N > 0) = P(X>0,\ Y>0) = 0.8 \times 0.5 = 0.40$
$P(N=0) = 1 - 0.40 = 0.60$,$P(N=1) = 0.40$

答案:$M\sim(0:0.10, 1:0.90)$,$N\sim(0:0.60, 1:0.40)$

📝 配套练习

题10 ⭐ | max分布(两个独立同分布指数分布)

对应模板:题型六(最大值分布)

设 X 和 Y 独立同服从参数 $\lambda=1$ 的指数分布。已知 $f(t)=e^{-t}$($t>0$),$F(t)=1-e^{-t}$($t>0$)。求 $M=\max(X,Y)$ 的分布函数 $F_M(z)$ 和密度函数 $f_M(z)$。

点击看答案

$F_M(z) = P(\max(X,Y)\leq z) = P(X\leq z)P(Y\leq z) = [F(z)]^2$

当 $z>0$ 时:$F_M(z) = (1-e^{-z})^2$
当 $z\leq0$ 时:$F_M(z)=0$

求导得密度:$f_M(z) = 2(1-e^{-z})·e^{-z} = 2e^{-z}(1-e^{-z})$($z>0$)

答案:
$$F_M(z)=\begin{cases}(1-e^{-z})^2,&z>0\0,&z\leq0\end{cases},\quad f_M(z)=\begin{cases}2e^{-z}(1-e^{-z}),&z>0\0,&z\leq0\end{cases}$$


题11 ⭐⭐ | min分布(不同区间的均匀分布)

对应模板:题型六(最小值分布)

设 XU(0,1) 与 YU(0,2) 独立,求 $N=\min(X,Y)$ 的分布函数。

点击看答案

X 的分布函数:$F_X(x)=x$($0<x<1$)
Y 的分布函数:$F_Y(y)=y/2$($0<y<2$)

$F_N(z)=1-[1-F_X(z)][1-F_Y(z)]$,分段讨论:

$z\leq0$:$F_N(z)=0$
$0<z<1$:$F_N(z)=1-(1-z)(1-z/2)=\frac{3z}{2}-\frac{z^2}{2}$
$z\geq1$:$F_N(z)=1$

答案:
$$F_N(z)=\begin{cases}0,&z\leq0\\frac{3z}{2}-\frac{z^2}{2},&0<z<1\1,&z\geq1\end{cases}$$


题12 ⭐⭐⭐ | 串联/并联系统寿命(max/min应用)

对应模板:题型六(最大值与最小值的应用)

某系统由两个独立工作的电子元件组成。元件寿命 $X\sim\text{Exp}(\lambda_1)$,$Y\sim\text{Exp}(\lambda_2)$。
(1)串联时,系统寿命 $N=\min(X,Y)$ 服从什么分布?
(2)并联时,求 $M=\max(X,Y)$ 的密度函数。

点击看答案

(1)串联(min):
$$F_N(t)=1-[1-F_X(t)][1-F_Y(t)]=1-e^{-\lambda_1 t}·e^{-\lambda_2 t}=1-e^{-(\lambda_1+\lambda_2)t}$$
所以 $N\sim\text{Exp}(\lambda_1+\lambda_2)$,密度 $f_N(t)=(\lambda_1+\lambda_2)e^{-(\lambda_1+\lambda_2)t}$。
重要结论:独立指数分布取最小值,结果仍是指数分布,参数为原来参数之和。

(2)并联(max):
$$F_M(t)=(1-e^{-\lambda_1 t})(1-e^{-\lambda_2 t})=1-e^{-\lambda_1 t}-e^{-\lambda_2 t}+e^{-(\lambda_1+\lambda_2)t}$$
$$f_M(t)=\lambda_1 e^{-\lambda_1 t}+\lambda_2 e^{-\lambda_2 t}-(\lambda_1+\lambda_2)e^{-(\lambda_1+\lambda_2)t},\quad t>0$$

答案:(1)$N\sim\text{Exp}(\lambda_1+\lambda_2)$(2)$f_M(t)=\lambda_1 e^{-\lambda_1 t}+\lambda_2 e^{-\lambda_2 t}-(\lambda_1+\lambda_2)e^{-(\lambda_1+\lambda_2)t}$


④ 推导复盘

📝 用大白话把整个过程重新讲一遍:

max 的推导(直来直去):

  1. "最大值 ≤ z" ⇔ "所有人都 ≤ z"——等价关系,直接成立。
  2. 独立条件下乘法:$F_M(z) = F_X(z) \cdot F_Y(z)$。
  3. n 个独立同分布:$F_M(z) = [F(z)]^n$。
  4. 求导得密度。

min 的推导(绕道而行):

  1. "最小值 ≤ z" 不好直接写——情况太多(至少一个 ≤ z)。
  2. 改走反方向:"最小值 > z" ⇔ "所有人都 > z"——非常干净!
  3. 独立条件下:$P(N > z) = [1-F_X(z)] \cdot [1-F_Y(z)]$。
  4. 绕回来:$F_N(z) = 1 - P(N > z) = 1 - [1-F(z)]^n$。

📝 关键转折点(需反复体会):max 和 min 的推导之路完全相反——max 走正门(直接用 ≤),min 走后门(先求 > 再绕回来)。两个公式结构对偶:max 用 F(z)(≤ 的概率),min 用 1-F(z)(> 的概率,也叫生存函数)。记住一句话:max 乘正概率,min 乘反概率再反回来。

📝 这个"绕道策略"(先求反面再减回来)是概率论中极常见的手法——遇到"至少有一个"不好直接算时,先算"一个都没有"再用 1 减。第1章的基础方法论在这里无缝衔接。


⑤ 易错边界

⚠️ 错误1(最致命,最高频):把 max 和 min 公式记反

这是本章错误率最高的地方!很多人把 min 写成 $[F(z)]^n$——那是 max 的公式!

快速检验法:假设每个变量以 0.5 概率取 0、0.5 概率取 1。

⚠️ 错误2:min 直接写 $P{\min \leq z} = P{X \leq z, Y \leq z}$

这是推导层面的根本性错误。"min ≤ z"是"至少有一个 ≤ z",不是"两个都 ≤ z"。必须绕道!

✅ 正确做法:$F_N(z) = 1 - P{X > z, Y > z}$

⚠️ 错误3:不独立时直接套用乘积公式

$F_M(z) = [F(z)]^n$ 和 $F_N(z) = 1-[1-F(z)]^n$ 的前提都是变量相互独立!题目没明说独立 → 不能用简化公式,要从联合分布出发:$F_M(z) = P{X \leq z, Y \leq z} = F(z,z)$(用联合分布函数)。

⚠️ 错误4:n 个变量时忘了"同分布"是额外条件

$F_M(z) = [F(z)]^n$ 要求:①独立 + ②同分布。不同分布(如 XE(1), YE(2))即使独立也只能写 $F_X(z) \cdot F_Y(z)$,不能写 $[F(z)]^2$。


⑥ 链条位置

从哪来:

到哪去:

在整条链中的位置:独立性 → max/min → 次序统计量(第6章)。max/min 是"从多个独立变量中提取极端值"的专门工具——串联系统用 min(最弱决定),并联系统用 max(最强撑住)。掌握"max 直入、min 绕道"的推导思路,以后遇到任何极端值问题都能找到入口。

商的分布 Z = X/Y(⭐ 方法级 · 了解)

这一节要解决的核心问题:两个随机变量相除 Z = X/Y 的分布是什么?这是"两个变量函数分布"的第三种常见形式(前两种是 Z=X+Y 和 max/min)。


先想一个困境:两个数相除,比值服从什么分布?

上一节的卷积,解决的是"两个随机变量相加 Z = X+Y"。可生活中"相除"的例子一点也不少:体检的 BMI = 体重÷身高²、投资的夏普比率 = 收益÷波动率、实验室的浓度 = 溶质质量÷溶液体积。分子分母都是随机变量——这个"比值" Z = X/Y 的分布,怎么求?

难在哪?——加法没有正负号的麻烦:X+Y ≤ z 在平面上永远圈出一块"斜线左下方"的区域。可除法要先看 Y 的正负:Y > 0 时 X/Y ≤ z 等价于 X ≤ zY(不等号不变);Y < 0 时不等式两边同乘一个负数,不等号要反过来,变成 X ≥ zY。同一个"比值不超过 z",在 Y 的上下两个半平面里圈出的区域不一样,必须分开处理。这就是 X/Y 比 X+Y 多出来的一层复杂度。

不过别慌——处理套路和卷积一模一样:分布函数法(先求 $F_Z(z)=P(X/Y\le z)$,再求导得密度),独立时把联合密度拆成两个边缘密度的乘积,只是被积函数里多一个 $|y|$ 因子。下面带着"Y 的正负这个坑"看完整推导。


① 生活场景

📏 场景1:BMI 的数学本质——体检时 BMI = 体重 / 身高²。体重 X 和身高 Y 各自有分布,BMI 这个比值又服从什么分布?知道它的分布才能判断一个人"偏胖"的概率有多大。

⚖️ 场景2:金融夏普比率——夏普比率 = (收益率 - 无风险利率) / 波动率。分子和分母都是随机变量,这个比值的分布决定了你的投资策略是否靠谱。

🧪 场景3:化学浓度——浓度 = 溶质质量 / 溶液体积。称量误差让分子分母都有随机性,浓度的分布受两者共同影响。

大白话:两个数相除在实际中太常见了——比率、浓度、效率指标都是。处理思路和卷积一样——把"两个变量的函数"转化为"一个新变量 + 一个老变量",然后对老变量积分消掉。


② 正式陈述

问题:已知二维随机变量 (X,Y) 的联合密度为 $f(x,y)$,求 $Z = X/Y$ 的密度函数。

方法一:分布函数法(通用,不要求独立)

先求分布函数,注意 Y 的正负影响不等号方向:
$$F_Z(z) = P\left{\frac{X}{Y} \leq z\right} = \int_0^{+\infty} \int_{-\infty}^{zy} f(x,y)\ dx\ dy + \int_{-\infty}^0 \int_{zy}^{+\infty} f(x,y)\ dx\ dy$$

对 z 求导得密度(通用公式):
$$f_Z(z) = \int_{-\infty}^{+\infty} |y| \cdot f(yz,\ y)\ dy$$

方法二:独立时的简化公式

当 X 和 Y 相互独立时,$f(x,y) = f_X(x) \cdot f_Y(y)$,代入得:
$$f_Z(z) = \int_{-\infty}^{+\infty} |y| \cdot f_X(yz) \cdot f_Y(y)\ dy$$

💡 与卷积公式的对比:

  • 卷积(Z=X+Y):$\int f_X(x) \cdot f_Y(z-x)\ dx$——积分变量 x,$f_Y$ 参数 $z-x$
  • 商(Z=X/Y):$\int |y| \cdot f_X(yz) \cdot f_Y(y)\ dy$——积分变量 y(分母),多 |y| 因子,$f_X$ 参数 $yz$

两个公式结构平行——都是"把联合密度拆成两个边缘密度的乘积,对其中一个变量积分消掉"。区别只在换元方式(加法 vs 乘法)和雅可比因子(1 vs |y|)。


③ 完整推导

🧠 第1步:分析问题——Z=X/Y 和 Z=X+Y 有什么不同?

对于 Z = X+Y,换元时写 y = z - x——加法天然容易处理。对于 Z = X/Y,变量关系是 X = Y·Z——乘法关系。

大白话:和的公式里 y = z-x(减法换元),商的公式里 x = y·z(乘法换元)。形式上不同,但处理思路完全一样——分布函数法 → 变量替换 → 积分消元。

🧠 第2步:分布函数法——通用方法,不要求独立

设 (X,Y) 的联合密度为 $f(x,y)$,先求分布函数:

$$F_Z(z) = P{Z \leq z} = P\left{\frac{X}{Y} \leq z\right}$$

这里有一个关键陷阱:除以 Y 时,不等式两边同乘 Y 的方向要看 Y 的正负!

所以积分要分两块:
$$F_Z(z) = \int_0^{+\infty} \int_{-\infty}^{zy} f(x,y)\ dx\ dy + \int_{-\infty}^0 \int_{zy}^{+\infty} f(x,y)\ dx\ dy$$

大白话:Y>0 时积分区域是 X ≤ zY(斜线左下方);Y<0 时变成 X ≥ zY(斜线右上方)。这是 X/Y 比 X+Y 多一层复杂度的根本原因——加法没有正负号的问题!

🧠 第3步:对 z 求导得到密度

对 z 求导(变上限积分求导法则),得到:
$$f_Z(z) = \int_{-\infty}^{+\infty} |y| \cdot f(yz,\ y)\ dy$$

这里用的是联合密度 $f(x,y)$——不要求独立!只要你知道联合密度就能用这个公式。

大白话:和卷积推导完全一样——分布函数法 + 变上限求导。区别在于 (1) 积分区域因 Y 正负分段,(2) 多了一个 |y| 因子。

🧠 第4步:独立时的简化公式

当 X 和 Y 相互独立时,联合密度 $f(x,y) = f_X(x) \cdot f_Y(y)$。把 $x = yz$ 代入:

$$f_Z(z) = \int_{-\infty}^{+\infty} |y| \cdot f_X(yz) \cdot f_Y(y)\ dy$$

大白话:独立是"魔法开关"——联合密度拆成两个边缘密度的乘积,二重积分降为一重积分。和卷积公式的模式完全一致,只是多了一个 |y| 因子,被积函数是 $f_X(yz) \cdot f_Y(y)$ 而不是卷积的 $f_X(x) \cdot f_Y(z-x)$。

🧠 第5步:公式里的 |y| 是哪来的?——雅可比行列式直观解释

做变量替换 $(x, y) \to (z, y)$,其中 $z = x/y$(即 $x = yz$)。新旧坐标之间的"缩放因子"(雅可比行列式)是:

$$\left|\frac{\partial(x,y)}{\partial(z,y)}\right| = \left|\det\begin{pmatrix} y & z \ 0 & 1 \end{pmatrix}\right| = |y|$$

大白话:(x,y) 平面上的一个小矩形映射到 (z,y) 平面时,面积会缩放。缩放比例是 |y|——在 y 大的地方,"同样的 z 变化"对应"更大的 x 变化",所以概率密度要乘以 |y| 来补偿。这个 |y| 保证了"变量替换前后总概率不变(都等于 1)"。

🧠 第6步:四个公式比一比(帮你建立整体认知)

公式 独立时形式 被积函数特征
Z = X+Y $\int f_X(x) \cdot f_Y(z-x)\ dx$ 积分变量 x,$f_Y$ 参数变为 $z-x$
Z = X-Y $\int f_X(x) \cdot f_Y(x-z)\ dx$ 积分变量 x,$f_Y$ 参数变为 $x-z$
Z = X·Y $\int \frac{1}{ x
Z = X/Y $\int y

大白话:四个公式不必死记——全是分布函数法(二重积分 → 变量替换 → 求导)出来的。考试真要你推导时,老老实实走分布函数法流程。如果只考结论,记住 X/Y 公式的特征:积分变量是分母 y,被积函数里多一个 |y|,$f_X$ 参数是 yz。


④ 推导复盘

📝 用大白话把整个过程重新讲一遍:

  1. 老套路——分布函数法:$F_Z(z) = P(X/Y \leq z)$,在平面上找到满足条件的区域做二重积分。
  2. 和 Z=X+Y 的关键区别:除以 Y 时 Y 的正负影响不等号方向!所以必须分 Y>0 和 Y<0 两个半平面积分——这是 X/Y 比 X+Y 多一层复杂度的根本原因。
  3. 对 z 求导得到 $f_Z(z) = \int |y| f(yz, y) dy$——|y| 来自变量替换的雅可比行列式。
  4. 独立时联合密度拆成边缘密度乘积,得到商密度简化公式。

📝 关键转折点:X/Y 和 X+Y 本质上是同一个问题——"两个变量函数的分布"。同一套分布函数法流程,同一套变量替换 + 求导操作。区别只有两点:(1) 积分区域因正负号要分段;(2) 雅可比因子从 1 变成了 |y|。理解了这个统一框架,和、差、积、商四个公式全是一个套路。

📝 备考建议:Z=X/Y 的完整推导考研很少要求。更常见的是——题目给了联合密度 f(x,y),让你用分布函数法求 Z=X/Y 的分布。这时候不需要记任何特殊公式,直接走分布函数法流程。如果是两个独立标准正态相除,记住结论:Z ~ 柯西分布。


⑤ 易错边界

⚠️ 错误1(最致命):不等式乘 Y 时忘了分正负

$X/Y \leq z$ 乘 Y 时:Y>0 → $X \leq zY$(不等号不变);Y<0 → $X \geq zY$(不等号反转!)。忘了分情况 → 积分区域画错 → 全题报废。这是 X/Y 独有的陷阱,X+Y 没有这个问题。

⚠️ 错误2:公式里的 |y| 漏掉了

变量替换 (x,y) → (z,y) 产生的雅可比行列式是 |y|(带绝对值!),不是 y。漏掉绝对值 → 在 y<0 的区域符号搞反。为什么是绝对值?因为雅可比行列式取绝对值是为了保证概率的非负性——面积不能是负的。

⚠️ 错误3:忘了积分上下限分段

和卷积公式一样,$f_X(yz) \cdot f_Y(y)$ 非零要求 y 同时在 $f_Y$ 范围和 $yz$ 在 $f_X$ 范围里。这两个条件的交集取决于 z——必须对 z 分段讨论积分上下限。

⚠️ 错误4:独立性的前提

商密度简化公式 $\int |y| f_X(yz) f_Y(y) dy$ 的前提是 X 和 Y 相互独立。不独立时只能用分布函数法(带联合密度的版本)。


✍️ 立刻练一道(刚悟出的"商公式 = 分布函数法 + |y|因子",马上就用):设 X 与 Y 独立,X 在 $(0,1)$ 上均匀分布,Y 服从参数 $\lambda=1$ 的指数分布(密度 $f_Y(y)=e^{-y}$,$y>0$)。用分布函数法写出 $Z=X/Y$ 的密度函数 $f_Z(z)$ 的表达式(允许保留积分号)。

点击看答案

第1步:写出分布函数。Y 在 $y>0$ 上取正,所以只有 Y>0 这一段(不用分正负号):
$$F_Z(z) = P!\left(\frac{X}{Y}\le z\right) = \int_0^{+\infty} \int_0^{\min(1,;zy)} 1,dx \cdot e^{-y},dy = \int_0^{+\infty} \min(1,;zy),e^{-y},dy$$
($f_X(x)=1$($0<x<1$)、$f_Y(y)=e^{-y}$($y>0$);内层 $x$ 的范围是 $0<x<1$ 与 $0<x\le zy$ 的交集,即 $0<x<\min(1,zy)$。)

第2步:把 $\min(1,zy)$ 拆开积出闭式。$zy\le1 \iff y\le\frac1z$($z>0$ 时):
$$F_Z(z) = \int_0^{1/z} zy,e^{-y},dy + \int_{1/z}^{+\infty} e^{-y},dy = z\Big(1-\big(\tfrac1z+1\big)e^{-1/z}\Big) + e^{-1/z} = z,(1-e^{-1/z})$$

第3步:对 z 求导得密度。$\frac{d}{dz}e^{-1/z} = \frac{1}{z^2}e^{-1/z}$:
$$f_Z(z) = \frac{d}{dz}\Big[z(1-e^{-1/z})\Big] = (1-e^{-1/z}) - \frac1z e^{-1/z} = 1 - \Big(1+\frac1z\Big)e^{-1/z},\quad z>0$$

  • 当 $z\le0$:$X>0$ 且 $Y>0$,比值 $X/Y>0$,事件 $X/Y\le z\le0$ 的概率为 0,所以 $f_Z(z)=0$。

验证($z>0$ 时是否为合法密度):分布函数 $F_Z(z)=z(1-e^{-1/z})$,当 $z\to+\infty$ 时 $e^{-1/z}\approx 1-\frac1z$,所以 $F_Z(+\infty)=1$ ✓;且 $F_Z(0^+)=0$,说明 $\int_0^{+\infty}f_Z(z),dz=1$ ✓;$f_Z(z)\ge0$ 显然成立 ✓。

答案:
$$f_Z(z)=\begin{cases} 1-\Big(1+\dfrac{1}{z}\Big)e^{-1/z}, & z>0 \[3mm] 0, & z\le0 \end{cases}$$


1.9 两个重要分布

二维均匀分布

先想一个场景:随机扔球,落点在哪?

你在一个矩形操场上随机扔一个球——任何位置被砸中的机会都一样,没有哪个位置"更受偏爱"。这类分布叫均匀分布。如果这个操场是二维的(一块地皮而不是一条线),落在任何位置都一样,那就是二维均匀分布。

难在哪?——二维均匀分布在非矩形区域上(三角形、圆形),就会引出很多反直觉的结论:比如"边缘分布还是不是均匀的?""X 和 Y 还独立吗?"这些问题,正是考试的判断题最爱挖的坑。下面带着"在非矩形区域上会出什么幺蛾子"这个问题看。

生活比喻:你在一个矩形操场上随机扔一个球——球落在操场任何一个位置的机会都一样。没有哪个位置"更受偏爱"。这就是均匀分布。

正式定义:设 D 是平面上一个有界区域,面积为 |D|。如果 (X,Y) 的联合概率密度为:
$$f(x,y) = \begin{cases} \dfrac{1}{|D|}, & (x,y) \in D \ 0, & \text{其他} \end{cases}$$
则称 (X,Y) 在 D 上服从二维均匀分布。

核心性质:

✍️ 立刻练一道(刚悟出的"概率 = 面积比",马上就用):设 (X,Y) 在正方形 $D={(x,y)\mid 0<x<1,;0<y<1}$ 上服从均匀分布,求 $P(X>0.5,;Y>0.5)$。

点击看答案

正方形面积 = 1。满足 $X>0.5,;Y>0.5$ 的是右上角四分之一小正方形,面积 = 0.5 × 0.5 = 0.25。

$$P(X>0.5,;Y>0.5) = \frac{0.25}{1} = 0.25$$

答案:0.25

📝 配套练习

题13 ⭐⭐ | 二维均匀分布求概率

对应模板:题型七(二维均匀分布)

设 (X,Y) 在区域 $D={(x,y)\mid 0<x<1,;0<y<1-x}$ 上服从均匀分布。求(1)联合密度;(2)$P(X<0.5)$。

点击看答案

(1) 三角形区域面积 = $1/2$,所以联合密度为:
$$f(x,y)=\begin{cases}2,&(x,y)\in D\0,&\text{其他}\end{cases}$$

(2) $P(X<0.5)=\int_0^{0.5}\int_0^{1-x}2,dy,dx=\int_0^{0.5}2(1-x),dx=0.75$

答案:(1)$f=2$(2)0.75


二维正态分布

先想一个场景:一把沙子从空中撒下,堆成什么样?

想象你抓一把沙子,从空中撒下去——沙子堆成一个小山包。这个山包的形状,主要由几个信息决定:山顶在哪、山有多陡、山是"正着"的还是"斜着"拉长的。

难在哪?——一维正态是一个钟形曲线(一个峰值、两侧对称),只要两个数就定死(均值决定峰的位置、方差决定峰的胖瘦)。二维正态是一座"钟形山包",多了一个维度就多了一份自由——山包可以被斜着拉长。这一斜,就引出了本章最有争议也最常考的一族性质(比如 $\rho=0$ 和"独立"的关系)。下面带着"这座斜山包有哪些独特性质"这个问题看。

生活比喻:想象你把一把沙子从空中撒下去——沙子堆成一个小山包。这个山包的形状完全由五个数字决定:

$\rho>0$ 时山沿东北-西南方向拉长(X 大时 Y 也大),$\rho<0$ 时沿西北-东南方向拉长(X 大时 Y 小),$\rho=0$ 时山是圆形的(X 和 Y 各管各的,没有倾斜)。

这种"被五个数字完全决定形状的沙子山包",数学上就叫二维正态分布。

正式定义:(X,Y) 服从二维正态分布,记为 $(X,Y) \sim N(\mu_1, \mu_2, \sigma_1^2, \sigma_2^2, \rho)$,其中:

关键性质(⭐⭐⭐最重要的四条):

  1. 独立 ⇔ $\rho = 0$:这是二维正态分布独有的性质!对一般分布,"独立"可推"不相关",但反过来不行。唯独二维正态,两者完全等价。用沙子山包来理解:$\rho=0$ 意味着山是圆的,没有倾斜——说明 X 方向的信息完全不影响 Y 方向的样子,也就是独立。
  2. 边缘分布是一维正态:$X \sim N(\mu_1, \sigma_1^2)$,$Y \sim N(\mu_2, \sigma_2^2)$。从侧面看这个沙子山包,不管从 X 方向还是 Y 方向看,切出来的剖面曲线都是一维正态的钟形。
  3. 条件分布也是正态分布:因为联合正态的山包从任何方向竖着切一刀,切出来的剖面都是正态钟形曲线——就像不管你从哪个角度切这个沙子山,切面都是一样的钟形。
  4. 线性组合仍是正态:$aX + bY$ 服从正态分布。把 X 和 Y 按任意比例混合,结果还是正态。

⚠️ 易错提醒:两个边缘分布都是正态分布,不代表联合分布是二维正态分布!必须明确说"服从二维正态分布"才行。举个反例思路——你可以构造一个联合分布,它的两个边缘都是标准正态,但联合密度的形状不是"沙子山包",而是一个奇怪的形状(比如把圆形正态山包在四个象限重新排列)。考研特别喜欢考这个陷阱。

✍️ 立刻练一道(刚悟出的"二维正态四大性质 + ρ=0⇔独立",马上就用):设 $(X,Y)\sim N(1, 4;\ 0, 9;\ 0.5)$。(1)X 和 Y 独立吗?(2)$X$ 服从什么分布?$Y$ 服从什么分布?(3)$X+Y$ 服从什么分布?

点击看答案

(1) $\rho=0.5\neq0$,所以 X 和 Y 不独立(二维正态中独立 ⇔ $\rho=0$,$\rho\neq0$ 就一定不独立)。

(2) 二维正态的两个边缘都是一维正态:$X\sim N(\mu_1,\sigma_1^2)=N(1,4)$,$Y\sim N(\mu_2,\sigma_2^2)=N(0,9)$。

(3) 二维正态的线性组合仍是正态。均值直接相加:$E(X+Y)=E(X)+E(Y)=1+0=1$。方差要用第 4 章的公式——先记结论:和的方差 = 各自方差 + 交叉项(完整公式 $Var(X+Y)=Var(X)+Var(Y)+2\rho\sigma_1\sigma_2$ 第 4 章正式学),套进来算:
$$Var(X+Y)=4+9+2\times0.5\times\sqrt{4\times9}=13+6=19$$
所以 $X+Y\sim N(1,19)$。

答案:(1)不独立(2)$X\sim N(1,4)$,$Y\sim N(0,9)$(3)$X+Y\sim N(1,19)$

📝 配套练习

题14 ⭐⭐ | 二维正态分布的性质

对应模板:题型七(二维正态分布)

设 $(X,Y)\sim N(0,1;0,1;0)$,即 $\mu_1=\mu_2=0$,$\sigma_1^2=\sigma_2^2=1$,$\rho=0$。
(1)X 和 Y 是否独立?
(2)写出联合密度函数。

点击看答案

(1)独立。 二维正态中 $\rho=0\iff$独立。

(2) 代入公式得:
$$f(x,y)=\frac{1}{2\pi}e^{-\frac{x^2+y^2}{2}},\quad -\infty<x,y<+\infty$$

这也可以写成 $f_X(x)·f_Y(y)$ 的形式,其中 $f_X(x)=\frac{1}{\sqrt{2\pi}}e^{-x^2/2}$,再次验证了独立性。

答案:(1)独立(2)$f(x,y)=\frac{1}{2\pi}e^{-(x^2+y^2)/2}$


题15 ⭐⭐⭐ | 综合:圆域均匀分布的边缘、独立性、条件密度(综合:题型二+三+四+七)

对应模板:题型二+三+四(综合)

设 (X,Y) 在单位圆盘 $x^2+y^2\leq1$ 上服从均匀分布。
(1)求联合密度;
(2)求 $f_X(x)$ 和 $f_Y(y)$;
(3)判断 X 和 Y 是否独立;
(4)求 $f_{Y|X}(y|x)$。

点击看答案

(1) 圆面积 $=\pi$,联合密度 $f(x,y)=1/\pi$($x^2+y^2\leq1$)。

(2) 固定 x($-1<x<1$),y 范围 $-\sqrt{1-x^2}\leq y\leq\sqrt{1-x^2}$:
$$f_X(x)=\int_{-\sqrt{1-x^2}}^{\sqrt{1-x^2}}\frac{1}{\pi},dy=\frac{2}{\pi}\sqrt{1-x^2}$$
同理 $f_Y(y)=\frac{2}{\pi}\sqrt{1-y^2}$。

(3)不独立。 $f_X(x)·f_Y(y)=\frac{4}{\pi^2}\sqrt{(1-x^2)(1-y^2)}\neq\frac{1}{\pi}$。
直观解释:知道 X 接近 1 时 Y 只能接近 0,X 的信息"绑住"了 Y 的范围。

(4) 当 $-1<x<1$,$-\sqrt{1-x^2}<y<\sqrt{1-x^2}$:
$$f_{Y|X}(y|x)=\frac{1/\pi}{2\sqrt{1-x^2}/\pi}=\frac{1}{2\sqrt{1-x^2}}$$
给定 X=x 后,Y 在 $[-\sqrt{1-x^2},\sqrt{1-x^2}]$ 上均匀分布。

答案:(1)$f=1/\pi$(2)$f_X(x)=\frac{2}{\pi}\sqrt{1-x^2}$(3)不独立(4)$f_{Y|X}(y|x)=\frac{1}{2\sqrt{1-x^2}}$


附:本章知识脉络图

二维随机变量 (X,Y)
    │
    ├── 离散型 ─── 联合分布律 pᵢⱼ(表格表示)
    │       │
    │       ├── 边缘分布:pᵢ· = Σⱼ pᵢⱼ,p·ⱼ = Σᵢ pᵢⱼ(行合计/列合计)
    │       │
    │       ├── 条件分布:P{X=xᵢ|Y=yⱼ} = pᵢⱼ / p·ⱼ(限定条件后的分布)
    │       │
    │       └── 独立性:pᵢⱼ = pᵢ· × p·ⱼ 对所有 i,j(联合=边缘乘积)
    │
    ├── 连续型 ─── 联合密度 f(x,y)(概率浓度图)
    │       │
    │       ├── 边缘密度:f_X(x) = ∫ f(x,y) dy(压扁/投影)
    │       │
    │       ├── 条件密度:f_{X|Y}(x|y) = f(x,y) / f_Y(y)(剖面形状)
    │       │
    │       └── 独立性:f(x,y) = f_X(x)·f_Y(y)
    │
    ├── 联合分布函数 F(x,y) = P{X≤x, Y≤y}
    │       └── 四条性质:单调不减、有界、右连续、矩形概率非负
    │
    └── 两个变量的函数
            ├── Z = X+Y ─── 一般方法:F_Z(z) = ∬_{x+y≤z} f dxdy
            │       └── 独立时:卷积公式 f_Z = ∫ f_X(x)·f_Y(z-x) dx
            ├── M = max ─── F_M(z) = [F(z)]ⁿ(都 ≤ z)
            ├── N = min ─── F_N(z) = 1-[1-F(z)]ⁿ(都 > z 的反面)
            └── Z = X/Y ─── 了解卷积型公式

② 题型与练习(讲练合一)

题型一:求联合分布中的未知参数(⭐⭐⭐)

先看一道题:这个 a 到底是多少?

设二维离散型随机变量 (X,Y) 的联合分布律如下表,求常数 a 的值。

X\Y Y=1 Y=2 Y=3
X=1 0.1 0.2 a
X=2 0.2 a 0.1

看到这题,先别慌。难在哪?——表格里藏着两个 a,没法直接读出它们的值。

试着想:上一节 1.3 学过一个"规矩"——所有格子的概率加起来必须等于 1(归一性)。这张表是完整的联合分布律,所以把这个规矩写成等式,a 就"现形"了:

$$0.1 + 0.2 + a + 0.2 + a + 0.1 = 1 \quad \Rightarrow \quad 0.6 + 2a = 1 \quad \Rightarrow \quad a = 0.2$$

🧠 这一步在想什么:"联合分布律 → 归一性 → 一元方程"——未知参数躲在表格里,就用"总和=1"把它逼出来。算完还要验证:把 a=0.2 代回表格,所有格子和 = 0.1+0.2+0.2+0.2+0.2+0.1 = 1.0,且每个格子都在 0 到 1 之间 ✓

答案:$a = 0.2$

再看一道(连续型):这次 a 变成了 k

设 (X,Y) 的联合概率密度为:
$$f(x,y) = \begin{cases} kxy, & 0 < x < y < 1 \ 0, & \text{其他} \end{cases}$$
求常数 k 的值。

看到这题,先别慌。难在哪?——连续型没有"格子"可以加,表格的方法用不了了。但"归一性"的思想还在:全平面上对密度做二重积分 = 1。

试着想——关键一步是先看清"整个平面"到底是哪块区域。条件 $0 < x < y < 1$ 描述的是正方形 $[0,1]\times[0,1]$ 中被对角线 $y=x$ 切出来的上三角部分。区域画对了,再在正确区域上积分:

$$\int_0^1 \int_0^y kxy ,dx,dy = k\int_0^1 y\left[\frac{x^2}{2}\right]_0^y dy = \frac{k}{2}\int_0^1 y^3,dy = \frac{k}{2} \cdot \frac{1}{4} = \frac{k}{8}$$

令 $\frac{k}{8} = 1$,得 $k = 8$。验证:$k=8>0$,且 $f(x,y)=8xy \geq 0$ ✓

🧠 这一步在想什么:"连续型归一化 = 在定义区域上做二重积分 = 1"——和离散型的"格子相加=1"思想一模一样,只是把"加法"换成了"积分"。区域画错,积分上下限就全错,这题就报废。

答案:$k = 8$

🔍 回头看看:这两道题背后,其实是同一个招

离散型 连续型
归一化=1 怎么落 所有格子相加 定义区域上二重积分
关键动作 列一元方程 先画区域再积分

📌 以后就这么办:看到"含未知参数的联合分布",就用"归一化=1"逼出参数。 ① 判断是表格还是密度公式;② 表格 → 全格子相加等于 1;密度 → 先画区域、再在定义区域上二重积分等于 1;③ 解方程得参数;④ 代回验证非负。

翻车现场:

  1. 积分区域画错(连续型):看到 $0<x<1, 0<y<1$ 就以为是正方形,但如果题目写的是 $0<x<y<1$,区域是三角形!一定要先在草稿纸上画出区域再写积分上下限。
  2. 忘了分段积分:如果密度函数在不同区域有不同的表达式,需要拆成多段分别积分再相加。
  3. 变量"没用完":连续型做完二重积分后,结果里不能还留着 x 或 y——它们应该被积分"消掉"。

🛑 途中停顿:停下来想一想——题目给的是表格(离散型)还是带 x,y 的公式(连续型)?这两种情况的"归一化=1"操作完全不同:离散型把所有格子加起来等于1,连续型在定义区域上做二重积分等于1。眼睛扫一遍题目,你能立刻判断出该用哪种方法吗?
这两类的配套练习(题1、题2)已经就近放在 1.4 节和 1.5 节的方法后面了,学完直接练。


题型二:求边缘分布(⭐⭐)

先看一道题:单看 X,分布是什么?

设 (X,Y) 的联合分布律如下表,求 X 和 Y 的边缘分布律。

X\Y Y=0 Y=1 Y=2
X=1 0.1 0.2 0.1
X=2 0.2 0.3 0.1

看到这题,先别慌。难在哪?——每个格子都是"X 和 Y 同时取某值"的概率,可这里只想要 X 单独的概率。比如 P(X=1):数学 1 分的人,英语可能 0、1、2 分——三种情况都得算。

试着想——上一节 1.5 刚悟过:求 X 的边缘,就把表格每一行所有格子加起来(消掉 Y,留下 X)。于是:

Y 的边缘反过来:把每一列从上到下加起来。

验证:X 边缘和 = 1.0 ✓,Y 边缘和 = 1.0 ✓

🧠 这一步在想什么:"行求和 → X 的边缘;列求和 → Y 的边缘"。离散型的边缘,本质就是把表格最右、最下的"合计"填出来。

答案:$P(X=1)=0.4, P(X=2)=0.6$;$P(Y=0)=0.3, P(Y=1)=0.5, P(Y=2)=0.2$

再看一道(连续型):这次要把积分上下限"切"对

设 (X,Y) 的联合密度为:
$$f(x,y) = \begin{cases} 8xy, & 0 < x < y < 1 \ 0, & \text{其他} \end{cases}$$
求 X 和 Y 的边缘密度。

看到这题,先别慌。难在哪?——上一节说过连续型边缘 = 对另一个变量积分。但这里区域是三角形 $0<x<y<1$,直接照抄 $(-\infty,+\infty)$ 当上下限,整题报废。必须先画图,把"固定 x 时 y 能跑多远"看清楚。

试着想——求 $f_X(x)$:固定 x,对 y 积分。在 $0<x<1$ 内,y 从 x 到 1:
$$f_X(x) = \int_x^1 8xy , dy = 8x \cdot \left[\frac{y^2}{2}\right]_x^1 = 4x(1-x^2), \quad 0<x<1$$

求 $f_Y(y)$:固定 y,对 x 积分。在 $0<y<1$ 内,x 从 0 到 y:
$$f_Y(y) = \int_0^y 8xy , dx = 8y \cdot \left[\frac{x^2}{2}\right]_0^y = 4y^3, \quad 0<y<1$$

🧠 这一步在想什么:上下限来自"联合密度真正的非零区域",不是公式里的 $(-\infty,+\infty)$。三角形区域里,x 和 y 互相"限制"对方——这就是为什么边缘密度往往是分段函数,而且算完必须标注取值范围。

答案:
$$f_X(x) = \begin{cases} 4x(1-x^2), & 0<x<1 \ 0, & \text{其他} \end{cases}, \quad f_Y(y) = \begin{cases} 4y^3, & 0<y<1 \ 0, & \text{其他} \end{cases}$$

🔍 回头看看:这两道题背后,其实是同一个招

离散型 连续型
求 X 的边缘 每行格子相加 对 y 积分
求 Y 的边缘 每列格子相加 对 x 积分
关键 行/列相加 按非零区域切上下限

📌 以后就这么办:求边缘分布 = 把另一个变量消掉。 ① 离散型:求 X 就逐行求和,求 Y 就逐列求和;② 连续型:求 $f_X(x)$ 就对 y 积分、求 $f_Y(y)$ 就对 x 积分——上下限按联合密度的非零区域来;③ 算完务必标注取值范围,并验证边缘分布总和(积分)等于 1。

翻车现场:

  1. 积分上下限没有分段:联合密度定义在三角形区域 $0<x<y<1$ 时,固定不同的 x 对应不同的 y 积分范围。不同 x 对应不同上下限,所以边缘密度是分段函数。
  2. 把"边缘"理解反了:X 的边缘是对 Y 求和/积分(消掉 Y),不是对 X 求和。记住:要消掉谁,就对谁求和/积分。

🛑 途中停顿:考考自己——求 X 的边缘分布时,你是对 X 求和还是对 Y 求和?用大白话说:你想消掉谁,就对谁求和/积分。现在不看笔记,你能说出来吗:求 $f_X(x)$ 时,积分变量是谁?求 $f_Y(y)$ 时呢?
这道题的配套练习(题3)已经就近放在 1.5 节的方法后面了,学完直接练。


题型三:判断独立性(⭐⭐⭐)

先看一道题:这两个变量,是"各过各的"吗?

设 (X,Y) 的联合分布律如下表,判断 X 与 Y 是否独立。

X\Y Y=0 Y=1
X=0 0.3 0.2
X=1 0.2 0.3

看到这题,先别慌。难在哪?——"独立"是上一节 1.7 悟出的"联合 = 边缘乘积"。可要判一个结论,总不能只靠感觉,得逐格验证。

试着想——先算边缘分布(每行/每列求和):

再逐格检查"格子 = 行合计 × 列合计"。挑格子 (0,0):联合概率 = 0.3,边缘乘积 = 0.5×0.5 = 0.25。0.3 ≠ 0.25,不相等!

🧠 这一步在想什么:独立性是"一票否决制"——找到一个反例就推翻。不用查完所有格子,一个不相等就足够下结论了。

答案:X 与 Y 不独立。

再看一道(连续型):换个"衣服",同一个招

设 (X,Y) 的联合密度为:
$$f(x,y) = \begin{cases} 4xy, & 0<x<1, 0<y<1 \ 0, & \text{其他} \end{cases}$$
判断 X 与 Y 是否独立。

看到这题,先别慌。难在哪?——离散型是"格子 = 边缘乘积",连续型没有格子,但思想一样:联合密度 = 边缘密度乘积。而且这题区域是矩形 $0<x<1,;0<y<1$——第一关(形状)过了,可以往下算。

试着想——求边缘密度:

再算乘积:$f_X(x)·f_Y(y) = 2x·2y = 4xy = f(x,y)$ ✓ 处处相等。

🧠 这一步在想什么:"矩形区域 + 密度可分离 → 独立"。如果区域不是矩形(三角形、圆形),直接判不独立,连算都不用算——这是最省力的速判法。

答案:X 与 Y 独立。

🔍 回头看看:这两道题背后,其实是同一个招

离散型 连续型
判什么 每个格子 = 行合计×列合计 联合密度 = 边缘密度乘积
一票否决 找到一个格子不满足 → 不独立 有一处不相等 → 不独立
速判 表格直接逐格 先看区域:非矩形 → 不独立

📌 以后就这么办:判断独立性 = 验证"联合 = 边缘乘积"是否处处成立。 ① 离散型:算出两个边缘,逐格检查 $p_{ij} = p_{i\cdot}\times p_{\cdot j}$,一个不满足就判不独立;② 连续型:先看定义区域是不是矩形——非矩形直接判不独立;矩形再算两个边缘密度,验证乘积是否等于联合密度;③ 全部成立才判独立。

翻车现场:

  1. 只检查一个格子就说"独立":独立性要求所有位置都满足乘积关系。
  2. 混淆"不相关"和"独立":独立一定不相关,但不相关不一定独立。只有二维正态分布中两者等价。
  3. 连续型忘了检查适用范围:边缘密度各自的非零区域和联合密度的非零区域不同时,即使表达式相等也不独立。

🛑 途中停顿:先别往下翻——题目给的是离散表格还是连续密度?离散型要逐个格子检查"联合=边缘乘积"。连续型有个速判法:先看定义区域形状!不是矩形(比如三角形、圆形)→ 直接判不独立,根本不用算。为什么?因为区域形状暴露了 X 和 Y 互相"绑住"对方。
这两道的配套练习(题4、题5)已经就近放在 1.7 节的方法后面了,学完直接练。


题型四:求条件分布(⭐⭐)

先看一道题:限定"英语 0 分",数学怎么变?

设 (X,Y) 的联合分布律如下表。求在 Y=0 条件下 X 的条件分布律。

X\Y Y=0 Y=1 Y=2
X=1 0.1 0.2 0.1
X=2 0.2 0.3 0.1

看到这题,先别慌。难在哪?——"在 Y=0 的条件下"这半句,意味着我们要看的不是全校,而是"英语恰好 0 分"那一小撮人。可这张表里 Y=0 那一列的概率加起来只有 0.3,不是 1——不能直接用。

试着想——上一节 1.6 悟过:条件分布 = 联合 ÷ 边缘,竖线后面是谁,分母就是谁的边缘。条件是 Y=0,分母 = $P(Y=0) = 0.1+0.2 = 0.3$。然后把这列每个格子除以 0.3:

$$P(X=1|Y=0) = \frac{0.1}{0.3} = \frac{1}{3}, \quad P(X=2|Y=0) = \frac{0.2}{0.3} = \frac{2}{3}$$

验证:$\frac{1}{3} + \frac{2}{3} = 1$ ✓

🧠 这一步在想什么:"固定条件列,格子 ÷ 该列合计"——把这一列重新缩放到总和为 1,它就成了一个合法的概率分布。

答案:$P(X=1|Y=0)=1/3$,$P(X=2|Y=0)=2/3$

再看一道(连续型):这次是"密度相除",别忘了范围

设 (X,Y) 的联合密度为:
$$f(x,y) = \begin{cases} 8xy, & 0<x<y<1 \ 0, & \text{其他} \end{cases}$$
求条件密度 $f_{X|Y}(x|y)$。

看到这题,先别慌。难在哪?——连续型没有"格子",但公式不变:条件密度 = 联合密度 ÷ 边缘密度。竖线后面是 Y,分母就是 $f_Y(y)$。

试着想——第1步:前面已算过 $f_Y(y) = 4y^3$($0<y<1$)。第2步:当 $0<y<1$ 时:
$$f_{X|Y}(x|y) = \frac{f(x,y)}{f_Y(y)} = \frac{8xy}{4y^3} = \frac{2x}{y^2}$$

第3步(最容易漏!):x 的取值范围。从 $0<x<y<1$ 得 $0<x<y$——给定 Y=y 后,x 的范围被 y 限制了,不是原来的 $0<x<1$。

🧠 这一步在想什么:"分子是联合密度、分母是竖线后面变量的边缘密度;算完必须标 x 的范围"。漏标范围,条件密度就不完整。

答案:
$$f_{X|Y}(x|y) = \begin{cases} \dfrac{2x}{y^2}, & 0<x<y \ 0, & \text{其他} \end{cases}, \quad 0<y<1$$

🔍 回头看看:这两道题背后,其实是同一个招

离散型 连续型
条件分布 = 格子 ÷ 列合计 联合密度 ÷ 边缘密度
分母 竖线后面变量的边缘概率 竖线后面变量的边缘密度
验证 条件概率加起来 = 1 对 x 积分 = 1(y 当常数)

📌 以后就这么办:求条件分布 = "联合 ÷ 竖线后面的边缘"。 ① 离散型:找条件列 → 求该列合计做分母 → 每个格子除以它;② 连续型:先求竖线后面变量的边缘密度 → 联合密度 ÷ 它;③ 记得:离散型验证总和为 1;连续型必须标注 x 的取值范围(受 y 约束)。

翻车现场:

  1. 离散型搞反分子分母:谁在竖线前面,谁在分子上;谁在竖线后面,谁的分母就是它的边缘概率。
  2. 连续型忘记标 x 的取值限制:比如联合密度在 $0<x<y<1$ 上,给定 $Y=y_0$ 后,x 范围是 $(0,y_0)$,不是 $(0,1)$。
  3. 连续型把 y 也当变量:条件密度中 y 是已知常数,x 才是变量。验证积分等于1时,是对 x 积分,y 当常数。

🛑 途中停顿:问自己三个问题:①竖线前面的是分子还是分母?②分母是谁的边缘概率?③连续型算完条件密度后,最容易漏掉什么?——答案是 x 的取值范围!给定 Y=y 后 x 能跑的范围会受到 y 的约束,不是原来的全范围。
这两道的配套练习(题6、题7)已经就近放在 1.6 节的方法后面了,学完直接练。


题型五:Z = X+Y 的分布——卷积公式(⭐⭐⭐)

先看一道题:两个均匀加起来,会长成什么样?

设 X 和 Y 独立同服从 [0,1] 上的均匀分布,求 Z = X+Y 的密度函数。

看到这题,先别慌。难在哪?——X 和 Y 都在 [0,1] 上,但 Z 的取值范围变了:最小 0+0=0,最大 1+1=2。可 Z 落在中间(比如 Z=1)的密度是多少?不能直接套单个变量的密度。

试着想——在 1.8 节悟过两条路:分布函数法(万能)和卷积公式(独立时)。这题 X、Y 独立,两条路都能走。先用分布函数法看全貌。

联合密度:在正方形 $[0,1]\times[0,1]$ 上为 1。先写出:
$$F_Z(z) = P(X+Y \leq z) = \iint_{x+y \leq z} f(x,y),dxdy$$

🧠 这一步在想什么:"先求分布函数 F,再求导得密度"——直接求密度太难,绕道。关键拐点在画图:直线 $x+y=z$ 与正方形的交集形状取决于 z 的大小,所以要分段。

当 $0 \leq z < 1$ 时:直线切过正方形左下角,积分区域是一个等腰直角三角形(顶点在 (0,0)、(z,0)、(0,z)):
$$F_Z(z) = \int_0^z \int_0^{z-x} 1 ,dy,dx = \int_0^z (z-x),dx = \left[zx - \frac{x^2}{2}\right]_0^z = \frac{z^2}{2}$$

当 $1 \leq z < 2$ 时:积分区域是正方形减去右上角的小三角形。更简单的做法是算右上角空白的面积:
$$F_Z(z) = 1 - \int_{z-1}^1 \int_{z-x}^1 1 ,dy,dx = 1 - \int_{z-1}^1 (1-z+x),dx$$
计算后半部分:
$$\int_{z-1}^1 (1-z+x),dx = \left[(1-z)x + \frac{x^2}{2}\right]_{z-1}^1 = \frac{(2-z)^2}{2}$$
所以 $F_Z(z) = 1 - \frac{(2-z)^2}{2}$。

当 $z<0$:$F_Z(z)=0$;当 $z \geq 2$:$F_Z(z)=1$。

求导得密度:
$$f_Z(z) = \begin{cases} z, & 0 \leq z < 1 \ 2-z, & 1 \leq z < 2 \ 0, & \text{其他} \end{cases}$$

这就是三角分布——从0线性上升到1,再从1线性下降到2。

🧠 这一步在想什么:分布函数法的灵魂是"分段画图"——直线 x+y=z 扫过正方形,形状不同,积分区域就不同。每一段都要画对,漏一段就错一段。

再看一道(这次用卷积,更快)

设 X 和 Y 独立同服从参数为 $\lambda$ 的指数分布,求 Z = X+Y 的密度。

看到这题,先别慌。难在哪?——指数分布支持域是 $x>0$,卷积的积分上下限得跟着变,不能照抄 $(-\infty,+\infty)$。

试着想——这题 X、Y 独立,可以用卷积公式:$f_X(x)=\lambda e^{-\lambda x}$($x>0$),$f_Y(y)=\lambda e^{-\lambda y}$($y>0$)。被积函数非零要求 $x>0$ 且 $z-x>0$,所以 x 从 0 到 z。当 $z>0$ 时:
$$f_Z(z) = \int_0^z \lambda e^{-\lambda x} \cdot \lambda e^{-\lambda (z-x)} , dx = \lambda^2 e^{-\lambda z} \int_0^z 1,dx = \lambda^2 z e^{-\lambda z}$$

🧠 这一步在想什么:"独立 → 卷积一重积分;积分上下限由两个非零区域决定"。$e^{-\lambda x}\cdot e^{-\lambda(z-x)}$ 约成 $e^{-\lambda z}$(和 x 无关),积分立刻变简单。

答案:$f_Z(z) = \begin{cases} \lambda^2 z e^{-\lambda z}, & z>0 \ 0, & z\leq0 \end{cases}$
这是伽马分布 $Ga(2,\lambda)$。

🔍 回头看看:两条路,什么时候走哪条?

情况 推荐方法 原因
X 和 Y 独立,且联合密度比较简单 卷积公式 一重积分,计算量小
X 和 Y 不独立,或联合密度复杂 分布函数法 万能,什么情况都能用
不确定用哪个 分布函数法 稳,不会错

📌 以后就这么办:拿到 Z=X+Y,先问"X 和 Y 独立吗?" ① 独立 → 卷积公式 $f_Z(z)=\int f_X(x)f_Y(z-x),dx$(一重积分,快);② 不独立或没把握 → 分布函数法 $F_Z(z)=\iint_{x+y\leq z}f(x,y),dxdy$ 再求导(二重积分,稳);③ 无论哪条路,都要按 z 分段讨论积分上下限,算完标注 z 的取值范围。

翻车现场:

  1. 积分上下限写错:卷积积分范围是两个函数都非零的 x 的重叠区域。这个区域取决于 z,需要分段讨论。
  2. 忘了 $f_Y(z-x)$ 的非零条件:比如 $f_Y(y)$ 只在 (0,1) 上非零,则要求 $0<z-x<1$,即 $z-1<x<z$。
  3. 求完密度不写取值范围:$f_Z(z)$ 必须标明在什么 z 范围内有效。

经典结论速记:

🛑 途中停顿:拿到题目先看一个关键信息——题目明说了"X 和 Y 独立"吗?独立 → 用卷积公式(一重积分,快);没明确说独立 → 老老实实用分布函数法(二重积分,稳)。你手头这道题该走哪条路?
这两道的配套练习(题8、题9)已经就近放在 1.8 节的方法后面了,学完直接练。


题型六:max与min的分布(⭐⭐)

先看一道题:两个变量的"最好"和"最差",分布是什么?

设 X 与 Y 独立,X ~ (0:0.3, 1:0.7),Y ~ (0:0.4, 1:0.6)。求 M = max(X,Y) 和 N = min(X,Y) 的分布律。

看到这题,先别慌。难在哪?——X 和 Y 都能取 0 或 1,但 max 和 min 把两个数的关系搅在一起:M=0 要"两个都取 0";N=0 只要"至少一个取 0"。"至少一个"比"两个都"难算。

试着想——max 可以直来直去:$M \leq 0$ 等价于"X 和 Y 都 ≤ 0",独立时概率相乘:
$$P(M\leq0) = P(X\leq0,Y\leq0) = 0.3\times0.4 = 0.12$$

但 min 必须绕道:"N ≤ 0"是"至少一个取 0",不好直接乘。反过来想——先求"N > 0",那才是干净的"两个都 > 0":
$$P(N>0) = P(X>0,Y>0) = 0.7\times0.6 = 0.42$$

再用 1 减回来:$P(N=0) = 1 - 0.42 = 0.58$。

🧠 这一步在想什么:"max 乘正概率(≤ z),min 乘反概率(> z)再反回来"。这就是上一节 1.8 悟出的"正门直入 / 后门绕道"。

答案:$M\sim(0:0.12, 1:0.88)$,$N\sim(0:0.58, 1:0.42)$

🔍 回头看看:max 和 min 到底差在哪?

max min
关键等价 $M \leq z \iff$ 所有人都 $\leq z$ $N > z \iff$ 所有人都 $> z$
独立同分布 $F_M(z) = [F(z)]^n$ $F_N(z) = 1-[1-F(z)]^n$
路径 直来直去(正门) 绕道而行(后门)

📌 以后就这么办:碰到 max/min,先分清走正门还是后门。 ① max:$F_M(z) = P(M\leq z) = P(\text{所有}\leq z)$,独立就概率相乘(同分布再写成 $[F(z)]^n$);② min:不许直接写 $P(N\leq z)=P(X\leq z,Y\leq z)$——那是错的!要先求 $P(N>z)=P(\text{所有}>z)$,再用 1 减(同分布写成 $1-[1-F(z)]^n$);③ 串联系统用 min、并联系统用 max。

翻车现场:

  1. min 的坑(高频错误!):直接写 $F_N(z) = P(X\leq z, Y\leq z)$——错的! $\min\leq z$ 是"只要有一个不超过 z",不是"两个都不超过 z"。必须用 $1-P(N>z)$ 绕一下。
  2. 把 max 和 min 的公式记反:max 的分布函数是各自分布函数的乘积;min 是 1 减各自生存函数的乘积。

🛑 途中停顿:最容易搞混的两个公式——max 和 min,你能默写出来吗?max≤z 等价于"所有都≤z"→ 分布函数直接相乘。min 不能直接乘!min≤z 必须绕道:先算"所有都>z",再用 1 减。串联用 min(最弱决定),并联用 max(最强撑住)。用你自己的话说一遍。
这三道的配套练习(题10、题11、题12)已经就近放在 1.8 节的方法后面了,学完直接练。


题型七:二维均匀分布与二维正态分布(⭐⭐)

7A. 二维均匀分布

先看一道题:圆上的均匀分布,边缘还是均匀吗?

设 (X,Y) 在单位圆 $x^2+y^2\leq1$ 上服从均匀分布。(1)写出联合密度;(2)求 X 的边缘密度;(3)求 $P(X>0, Y>0)$。

看到这题,先别慌。难在哪?——"均匀"意味着落在每个位置的密度一样,所以联合密度在圆内是个常数。但这个常数多大?得靠"全平面积分=1"逼出来。

试着想——(1) 圆的面积 = $\pi$,由归一化条件,圆内密度必须满足 密度 × 面积 = 1,所以 $f(x,y)=1/\pi$($x^2+y^2\leq1$)。

🧠 这一步在想什么:二维均匀分布的密度 = 1/区域面积。第(2)问就暴露一个陷阱:圆不是矩形,X 的边缘密度不是常数!固定 x(-1<x<1),y 的范围 $-\sqrt{1-x^2}\leq y\leq\sqrt{1-x^2}$:
$$f_X(x) = \int_{-\sqrt{1-x^2}}^{\sqrt{1-x^2}} \frac{1}{\pi},dy = \frac{2}{\pi}\sqrt{1-x^2}$$

带根号,根本不是常数。(3)$P(X>0,Y>0) = \frac{\text{四分之一圆面积}}{\text{圆面积}} = \frac{\pi/4}{\pi} = \frac{1}{4}$——均匀分布算概率,就是算面积比。

答案:(1)$f=1/\pi$(2)$f_X(x)=\frac{2}{\pi}\sqrt{1-x^2}$(3)1/4

📌 以后就这么办:看到二维均匀分布,三步走。 ① 确定区域 D 的形状(矩形、三角形、圆形等);② 计算 D 的面积 |D|,密度就是 $1/|D|$;③ 求边缘/条件/概率时,固定一个变量对另一个积分(连续)或算面积比,注意非矩形区域的边缘密度往往不是常数。

7B. 二维正态分布

先看一道题:ρ=0.5,这两个变量独立吗?

设 $(X,Y)\sim N(0,1;0,4;0.5)$。判断:(1)X 与 Y 独立?(2)X+Y 服从正态?(3)若 $\rho=0$ 则独立?(4)2X-Y 服从正态?

看到这题,先别慌。难在哪?——(X,Y) 服从二维正态,它身上的每个小结论都可能在"一般分布不成立、唯独二维正态成立"的边缘。第(3)问尤其阴:一般分布里 $\rho=0$ 只说明"不相关",不能说明"独立";但二维正态里 $\rho=0$ 就等价于独立——这是它的独有性质。

试着想——(1)$\rho=0.5\neq0$,不独立。(2)对,$X+Y\sim N(0,7)$(二维正态线性组合永远是正态)。(3)对,二维正态独有性质:$\rho=0\iff$独立。(4)对,线性组合仍是正态,$2X-Y\sim N(0,4)$。

🧠 这一步在想什么:二维正态的四大性质——独立⇔ρ=0、边缘正态、条件正态、线性组合仍正态——前三条在 1.9 节见过,第(4)条"线性组合仍是正态"是这节考得最多的大题基础。

答案:(1)错(2)对(3)对(4)对

📌 以后就这么办:看到二维正态,先对号四大性质。 ① 边缘:$X \sim N(\mu_1, \sigma_1^2)$,$Y \sim N(\mu_2, \sigma_2^2)$;② 独立 ⇔ $\rho=0$(二维正态独有!);③ 条件分布也是正态;④ 线性组合 $aX+bY$ 仍是正态。另外记住陷阱:两个边缘都是正态,不代表联合是二维正态。

翻车现场:

  1. 均匀分布——边缘密度是常数?错! 比如三角形区域上的二维均匀分布,边缘密度一般不是常数。别想当然。
  2. 正态分布——$\rho=0$ 只能说"不相关",不能说"独立"? 对一般分布是对的,但对二维正态,$\rho=0$ 意味着独立!
  3. 边缘正态 ≠ 联合正态:两个边缘分布都是正态,不代表联合分布是二维正态。

🛑 途中停顿:两个高频陷阱,看你能不能识破:①圆形/三角形区域上的二维均匀分布,边缘密度是常数吗?(不是!圆形边缘带 $\sqrt{1-x^2}$)②二维正态独有的那条性质是什么?提示:对一般分布不成立,唯独二维正态成立。(答案:$\rho=0 \iff$ 独立)
这三道的配套练习(题13、题14、题15)已经就近放在 1.9 节的方法后面了,学完直接练。


🧪 学完自测(4选择 + 2判断 + 4简答)

混搭全章知识点,检验你是不是真懂了。答案全部折叠,先自己做再看。


选择题1:下列哪个区域上的二维均匀分布,X 与 Y 一定独立?

A. 正方形 $0<x<1, 0<y<1$
B. 三角形 $0<x<1, 0<y<1-x$
C. 圆形 $x^2+y^2 \leq 1$
D. 以上都不独立

点击看答案

A。 只有矩形区域(且边与坐标轴平行)上的二维均匀分布,X 与 Y 才独立。三角形和圆形区域上 X 的取值会限制 Y 的范围,所以不独立。


选择题2:关于二维正态分布,下列说法错误的是:

A. 边缘分布都是一维正态分布
B. $\rho=0$ 时 X 与 Y 独立
C. 两个边缘都是正态,则联合分布一定是二维正态
D. X+Y 也服从正态分布

点击看答案

C。 这是考研高频陷阱。两个边缘都是正态,不代表联合是二维正态。必须明确说"服从二维正态分布"才行。A、B、D 都是二维正态的正确性质。


选择题3:$\min(X,Y) \leq z$ 的概率,正确做法是:

A. $P(X \leq z) \cdot P(Y \leq z)$
B. $1 - P(X > z) \cdot P(Y > z)$
C. $P(X \leq z) + P(Y \leq z)$
D. $[F(z)]^2$

点击看答案

B。 min 不能直接写乘积(那是 max 的做法)。必须绕道:先算"两个都 > z"的概率,再用 1 减。选项 A 和 D 是 max 的公式。


选择题4:已知联合分布律如下,X 与 Y 是否独立?

X\Y Y=0 Y=1
X=0 0.3 0.2
X=1 0.2 0.3

A. 独立,因为所有概率加起来等于 1
B. 独立,因为每个格子都是边缘的乘积
C. 不独立,因为 P(X=0,Y=0) ≠ P(X=0)·P(Y=0)
D. 无法判断

点击看答案

C。 $P(X=0)=0.5$,$P(Y=0)=0.5$,乘积 $=0.25$,但实际 $P(X=0,Y=0)=0.3 \neq 0.25$。找到一个反例就够判不独立了。


判断题1:卷积公式 $f_Z(z)=\int f_X(x)\cdot f_Y(z-x),dx$ 只在 X 和 Y 独立时才能使用。

点击看答案

对。 卷积公式依赖"联合 = 边缘乘积",这正是独立条件。不独立时必须用分布函数法(二重积分)。


判断题2:二维均匀分布中,X 的边缘密度也是均匀分布。

点击看答案

错。 比如三角形区域上的二维均匀分布,边缘密度是线性函数(不是常数)。圆形区域的边缘密度含 $\sqrt{1-x^2}$。别想当然!


简答题1:用自己的话解释——为什么"边缘分布一般不能反推联合分布"?在你解释时,举一个具体的例子来说明。

点击看答案

要点:边缘分布只告诉你 X 单独是什么样的、Y 单独是什么样的,但丢掉了 X 和 Y 之间"怎么配合"的信息。比如两个班的数学和英语边缘分布完全相同,但一个班"数学好的人英语也好"(正相关),另一个班"数学好的英语反而差"(负相关)——它们的联合分布完全不同。所以光看边缘分不出这两个班。唯一的例外是 X 和 Y 独立时,联合 = 边缘乘积,可以从边缘反推联合。


简答题2:串联电路和并联电路中,系统寿命分别对应 max 还是 min?为什么?用大白话说出两者的公式推导思路。

点击看答案

串联 = min(最脆弱的元件决定系统寿命,一个坏就全坏)。推导:先算 $P(\min > z)$ = "所有元件都 > z" = $(1-F(z))^n$,然后 $F_N(z)=1-$ 这个结果。

并联 = max(最坚挺的元件撑到最后,全坏才坏)。推导:直接算 $P(\max \leq z)$ = "所有元件都 ≤ z" = $[F(z)]^n$。

关键区别:min 必须绕道(用 1 减),max 直接乘。


简答题3:二维正态分布的沙子山包比喻中,$\rho=0$ 时山是什么形状?这和"X 与 Y 独立"有什么关系?

点击看答案

$\rho=0$ 时山是圆形的——没有倾斜,X 方向和 Y 方向完全对称。这意味着知道 X 的取值无法推断 Y 更可能在哪边(正方向还是负方向),两个方向的信息互不影响——这正是"独立"的直观含义。这也是二维正态独有性质:$\rho=0$ 直接等价于独立,其他分布没有这个等价关系。


简答题4:求连续型条件密度 $f_{X|Y}(x|y)$ 时,最容易漏掉的两件事是什么?

点击看答案

最容易漏掉的两件事:

  1. 忘记标注 x 的取值范围——给定 $Y=y$ 后,x 能跑的范围会受到 y 的约束。比如联合密度在 $0<x<y<1$ 上,给定 $Y=0.5$ 后 x 范围是 $(0, 0.5)$,不是 $(0, 1)$。
  2. 忘记分母 $f_Y(y)$ 必须在 y 处大于 0——如果 $f_Y(y)=0$,说明这个 y 根本不可能出现,你没法在不可能发生的条件下讨论别的变量。

③ 综合混搭练习

打乱题型,逼你自己判断用哪个方法。以下四道题混合了本章的多个题型。


混搭1 🎲(题型一+二+三+四:离散型联合分布综合)

已知二维离散型随机变量 (X,Y) 的联合分布律如下表:

X\Y 0 1
0 0.1 b
1 a 0.3

且已知 $P(X=1)=0.5$。

(1)求参数 a 和 b 的值;
(2)求 X 和 Y 的边缘分布律;
(3)判断 X 和 Y 是否独立;
(4)求在 Y=1 条件下 X 的条件分布律。

点击看答案

(1)求 a 和 b

已知 $P(X=1)=a+0.3=0.5$,所以 $a=0.2$。

归一化:$0.1+b+0.2+0.3=1$,所以 $b=0.4$。

完整表格:

X\Y 0 1
0 0.1 0.4
1 0.2 0.3

(2)边缘分布

$P(X=0)=0.1+0.4=0.5$,$P(X=1)=0.5$
$P(Y=0)=0.1+0.2=0.3$,$P(Y=1)=0.4+0.3=0.7$

(3)判断独立性

检查 (X=0, Y=0):$P=0.1$,$P(X=0)P(Y=0)=0.5\times0.3=0.15$
$0.1\neq0.15$,所以不独立。

(4)条件分布

$P(Y=1)=0.7$
$P(X=0|Y=1)=0.4/0.7=4/7$
$P(X=1|Y=1)=0.3/0.7=3/7$

答案:(1)$a=0.2, b=0.4$(2)X: (0:0.5, 1:0.5), Y: (0:0.3, 1:0.7)(3)不独立(4)$X|Y=1$: (0:4/7, 1:3/7)


混搭2 🔄(题型一+二+四+七:三角形区域均匀分布)

设 (X,Y) 在由 $x=0$、$y=0$、$x+y=1$ 围成的三角形区域上服从均匀分布。

(1)写出联合密度函数 $f(x,y)$;
(2)求 X 的边缘密度 $f_X(x)$;
(3)求条件密度 $f_{Y|X}(y|x)$;
(4)求 $P(Y>0.5;|;X=0.25)$。

点击看答案

(1)联合密度

三角形顶点 (0,0), (1,0), (0,1),面积 = 1/2。
$$f(x,y)=\begin{cases}2,&0<x<1,;0<y<1-x\0,&\text{其他}\end{cases}$$

(2)X的边缘密度

固定 x($0<x<1$),y 从 0 到 $1-x$:
$$f_X(x)=\int_0^{1-x}2,dy=2(1-x),\quad 0<x<1$$

(3)条件密度

$$f_{Y|X}(y|x)=\frac{f(x,y)}{f_X(x)}=\frac{2}{2(1-x)}=\frac{1}{1-x},\quad 0<y<1-x$$

给定 X=x 后,Y 在 $(0,1-x)$ 上均匀分布。

(4)$P(Y>0.5|X=0.25)$

给定 X=0.25,Y 在 $(0,0.75)$ 上均匀分布,密度 $=1/0.75=4/3$。
$$P(Y>0.5|X=0.25)=\frac{0.75-0.5}{0.75}=\frac{0.25}{0.75}=\frac{1}{3}$$

答案:(1)$f=2$(2)$f_X(x)=2(1-x)$(3)$f_{Y|X}(y|x)=1/(1-x)$(4)1/3


混搭3 🧩(题型五+七:正态分布性质与卷积)

设 XN(1,4),YN(2,9),且 X 与 Y 相互独立。

(1)求 Z = X+Y 的分布;
(2)求 $P(Z>3)$(用标准正态分布函数 $\Phi$ 表示);
(3)如果 X 和 Y 不独立,相关系数 $\rho=0.5$,Z = X+Y 还服从正态分布吗?

点击看答案

(1)Z 的分布

独立正态的和仍是正态。$E(Z)=1+2=3$,$Var(Z)=4+9=13$。
所以 $Z\sim N(3,13)$。

(2)$P(Z>3)$

$$P(Z>3)=P\left(\frac{Z-3}{\sqrt{13}}>0\right)=1-\Phi(0)=1-0.5=0.5$$

因为对称性,正态分布大于其均值的概率正好是 0.5。

(3)不独立时

仍然服从正态分布!二维正态的线性组合永远是正态,不管 $\rho$ 是多少。
方差用到第 4 章的公式——先记结论:和的方差 = 各自方差 + 交叉项(完整公式第 4 章正式学),套进来算:$Var(Z)=4+9+2\times0.5\times\sqrt{4\times9}=13+6=19$。
$Z\sim N(3,19)$。

答案:(1)$Z\sim N(3,13)$(2)0.5(3)是,$Z\sim N(3,19)$


混搭4 🎯(题型五+六:指数分布综合)

设某设备有两个独立工作的核心部件,寿命(单位:千小时)分别为 $X\sim\text{Exp}(1)$,$Y\sim\text{Exp}(2)$(参数 $\lambda$ 越大,平均寿命越短)。

(1)求 $X$ 和 $Y$ 的平均寿命;
(2)若系统为串联(任一部件失效则系统失效),求系统寿命 $N=\min(X,Y)$ 的分布;
(3)若系统为并联(两部件都失效才失效),求系统寿命 $M=\max(X,Y)$ 的分布函数 $F_M(t)$;
(4)求串联系统的平均寿命。

点击看答案

(1)平均寿命

指数分布 $E(\lambda)$ 的均值 $=1/\lambda$。
$E(X)=1$(千小时),$E(Y)=1/2=0.5$(千小时)。

(2)串联(min)

$F_N(t)=1-[1-F_X(t)][1-F_Y(t)]=1-e^{-t}·e^{-2t}=1-e^{-3t}$($t>0$)
所以 $N\sim\text{Exp}(3)$,密度 $f_N(t)=3e^{-3t}$。

(3)并联(max)

$F_M(t)=F_X(t)·F_Y(t)=(1-e^{-t})(1-e^{-2t})$($t>0$)
展开:$F_M(t)=1-e^{-t}-e^{-2t}+e^{-3t}$。

(4)串联平均寿命

$E(N)=1/3\approx0.333$(千小时)≈ 333 小时。
单个元件平均寿命已经是 1 和 0.5,串联后降到 0.333——"短板效应"很明显。

答案:(1)1千小时, 0.5千小时(2)$N\sim\text{Exp}(3)$(3)$F_M(t)=1-e^{-t}-e^{-2t}+e^{-3t}$(4)0.333千小时


🔄 回马枪题(第1-2章回顾)

学新知识容易忘旧知识。下面4道题把第1-2章的内容拉到本章场景里交叉练习——旧知识不白学,新知识更牢固。


🔄 回马枪1 — 全概率+贝叶斯 × 联合分布(第1章)

某工厂有两条生产线:甲线产量占 70%,次品率 10%;乙线产量占 30%,次品率 5%。

(1)用全概率公式求随机抽一件产品是次品的概率。
(2)已知抽到一件次品,用贝叶斯公式求它来自甲线的概率。
(3)随机抽一件产品,定义 X = 1(甲线)/ 0(乙线),Y = 1(次品)/ 0(正品)。写出 (X,Y) 的联合分布律(四格表),并判断 X 和 Y 是否独立。

点击看答案

(1)全概率公式

记 A = "来自甲线",B = "次品"。
$$P(B) = P(B|A)P(A) + P(B|\bar{A})P(\bar{A}) = 0.10 \times 0.70 + 0.05 \times 0.30 = 0.07 + 0.015 = 0.085$$

(2)贝叶斯公式

$$P(A|B) = \frac{P(B|A)P(A)}{P(B)} = \frac{0.10 \times 0.70}{0.085} = \frac{0.07}{0.085} = \frac{14}{17} \approx 0.824$$

大白话:虽然甲线次品率更高(10% vs 5%),但"已知是次品→来自甲线"的概率高达82.4%——因为甲线产量大(70%),产出的次品绝对数量多。

(3)联合分布律

X\Y Y=0(正品) Y=1(次品)
X=0(乙线) 0.285 0.015
X=1(甲线) 0.630 0.070

验算:0.285+0.015+0.630+0.070 = 1.000 ✓

判断独立性:检查 (X=1, Y=1) 这个格子——

  • 联合概率:$P(1,1) = 0.070$
  • 边缘乘积:$P(X=1) \times P(Y=1) = 0.70 \times 0.085 = 0.0595$

$0.070 \neq 0.0595$,所以 X 和 Y 不独立。直观理解:甲线的次品率比乙线高,所以"来自哪条线"的信息会改变你对"是不是次品"的判断——两者有联系。

答案:(1)0.085(2)14/17 ≈ 0.824(3)不独立


🔄 回马枪2 — 一维分布函数性质(第2章)

关于分布函数 $F(x) = P{X \leq x}$,以下哪个选项一定正确?

A. $F(x)$ 在 $(-\infty, +\infty)$ 上处处连续
B. $F(x)$ 是严格单调递增的函数
C. $\lim\limits_{x \to -\infty} F(x) = 0$,$\lim\limits_{x \to +\infty} F(x) = 1$
D. $F(x)$ 的值可以大于 1

点击看答案

逐项分析:

  • A ❌:离散型随机变量的分布函数是阶梯函数(有跳跃),只在跳跃点之间连续。比如 X 只取 0 和 1,$F(x)$ 在 x=0 和 x=1 处有跳跃——不连续。
  • B ❌:分布函数是"单调不减",不是"严格单调递增"。在随机变量取不到值的区间(比如离散型两个取值之间的区间),$F(x)$ 是常数。常数的区间里不"严格递增"。
  • C ✅:这是分布函数的基本性质——x 越来越小,概率趋于 0(几乎不可能比负无穷还小);x 越来越大,概率趋于 1(几乎肯定不超过正无穷)。
  • D ❌:$F(x)$ 是概率,概率永远在 $[0, 1]$ 之间,不可能大于 1。

答案:C

🐱 大白话:分布函数就是一个"累计概率计数器"——从最左边(-∞)开始是 0,一路往右走,计数器只增不减,走到最右边(+∞)刚好到 1。中间可能有平台(概率不变),也可能有跳跃(概率突然增加)。这就是分布函数的"画像"。


🔄 回马枪3 — 正态标准化 × 多维场景(第2章)

设 $X \sim N(2, 4)$,$Y \sim N(1, 9)$,且 X 与 Y 相互独立。

(1)$Z = X + Y$ 服从什么分布?写出均值和方差。
(2)求 $P(Z > 5)$,用标准正态分布函数 $\Phi(\cdot)$ 表示。
(3)求 $P(X > Y)$,用 $\Phi(\cdot)$ 表示。(提示:考虑 $W = X - Y$,W 也是正态分布。)

点击看答案

(1)Z 的分布

独立正态的和仍是正态。

  • $E(Z) = E(X) + E(Y) = 2 + 1 = 3$
  • $Var(Z) = Var(X) + Var(Y) = 4 + 9 = 13$

所以 $Z \sim N(3, 13)$。

(2)$P(Z > 5)$

标准化:$\frac{Z - 3}{\sqrt{13}} \sim N(0, 1)$

$$P(Z > 5) = P!\left(\frac{Z - 3}{\sqrt{13}} > \frac{5 - 3}{\sqrt{13}}\right) = 1 - \Phi!\left(\frac{2}{\sqrt{13}}\right)$$

(3)$P(X > Y)$

$W = X - Y$ 也是正态分布(独立正态的线性组合仍是正态):

  • $E(W) = 2 - 1 = 1$
  • $Var(W) = Var(X) + (-1)^2 Var(Y) = 4 + 9 = 13$

所以 $W \sim N(1, 13)$。

$$P(X > Y) = P(W > 0) = P!\left(\frac{W - 1}{\sqrt{13}} > \frac{0 - 1}{\sqrt{13}}\right) = 1 - \Phi!\left(\frac{-1}{\sqrt{13}}\right) = \Phi!\left(\frac{1}{\sqrt{13}}\right)$$

最后一步用了 $\Phi(-z) = 1 - \Phi(z)$。

答案:(1)$Z \sim N(3, 13)$(2)$1 - \Phi(2/\sqrt{13})$(3)$\Phi(1/\sqrt{13})$


🔄 回马枪4 — 二项分布 × 多维组合(第2章)

设 $X \sim B(2,\ 0.6)$,$Y \sim B(3,\ 0.4)$,且 X 与 Y 相互独立。

(1)分别写出 X 和 Y 的边缘分布律(列出所有可能取值及概率)。
(2)求 $P(X = Y)$。
(3)求 $Z = X + Y$ 的分布律。

点击看答案

(1)边缘分布律

X ~ B(2, 0.6):$P(X=k) = C_2^k \cdot 0.6^k \cdot 0.4^{2-k}$

X 0 1 2
P $0.4^2=0.16$ $2\times0.6\times0.4=0.48$ $0.6^2=0.36$

Y ~ B(3, 0.4):$P(Y=k) = C_3^k \cdot 0.4^k \cdot 0.6^{3-k}$

Y 0 1 2 3
P $0.6^3=0.216$ $3\times0.4\times0.36=0.432$ $3\times0.16\times0.6=0.288$ $0.4^3=0.064$

(2)$P(X = Y)$

由于 X 最大取 2、Y 最大取 3,X=Y 只可能是 0, 1, 2。利用独立性 $P(X=k, Y=k) = P(X=k) \cdot P(Y=k)$:

$$P(X=Y) = 0.16 \times 0.216 + 0.48 \times 0.432 + 0.36 \times 0.288$$
$$= 0.03456 + 0.20736 + 0.10368 = 0.3456$$

(3)$Z = X+Y$ 的分布律

Z 取值为 0~5。利用离散卷积:$P(Z=k) = \sum_i P(X=i) \cdot P(Y=k-i)$

Z 计算过程 结果
0 $P(0,0)=0.16\times0.216$ 0.03456
1 $P(0,1)+P(1,0)=0.16\times0.432+0.48\times0.216$ 0.17280
2 $P(0,2)+P(1,1)+P(2,0)$ 0.33120
3 $P(0,3)+P(1,2)+P(2,1)$ 0.30400
4 $P(1,3)+P(2,2)=0.48\times0.064+0.36\times0.288$ 0.13440
5 $P(2,3)=0.36\times0.064$ 0.02304

验算:0.03456+0.17280+0.33120+0.30400+0.13440+0.02304 = 1.00000 ✓

答案:(1)见上表(2)0.3456(3)见上表


🎯 考试导航

题型 考频 常见出题形式 备考建议
求联合分布中的未知参数 ⭐⭐⭐ 选择/填空,给表格或密度求常数 归一化条件是基本功。连续型先画图定区域再积分
判断独立性 ⭐⭐⭐ 概念题或计算题中的一小问 离散型逐个格子检查。连续型先看区域形状——非矩形大多不独立
Z=X+Y的分布(卷积公式) ⭐⭐⭐ 大题,考研重点 分清用分布函数法还是卷积法。注意分段讨论和积分上下限
求条件分布 ⭐⭐ 大题中的一部分 连续型最容易漏标注x的取值范围。分母不能为0
求边缘分布 ⭐⭐ 计算题基础操作 连续型边缘密度一定是分段函数!算完一定要标范围并验证积分=1
max/min的分布 ⭐⭐ 应用题(串联/并联系统) min公式一定要绕道 $P(N>z)$。记清:max乘积,min补乘积
二维均匀与二维正态 ⭐⭐ 性质概念题 二维正态独有性质:独立⇔ρ=0。均匀的边缘一般不是均匀!

解题公式速查

题型 核心公式
归一化(离散) $\sum_i\sum_j p_{ij}=1$
归一化(连续) $\iint f(x,y),dxdy=1$
边缘(离散) $p_{i\cdot}=\sum_j p_{ij}$,$p_{\cdot j}=\sum_i p_{ij}$
边缘(连续) $f_X(x)=\int f(x,y)dy$,$f_Y(y)=\int f(x,y)dx$
独立性 $F(x,y)=F_X(x)F_Y(y)$ 或 $f(x,y)=f_X(x)f_Y(y)$
条件(离散) $P(X=x_i
条件(连续) $f_{X
卷积(独立时) $f_Z(z)=\int f_X(x)f_Y(z-x)dx$
max分布 $F_M(z)=[F(z)]^n$(独立同分布)
min分布 $F_N(z)=1-[1-F(z)]^n$(独立同分布)

练习题型对照表

配套练习已就近放在对应知识块后面(方法讲完立刻练)。下表标注每道练习的当前位置。

题号 难度 所属题型 核心考点 现在的位置
1 ⭐ 题型一+二 离散联合律:归一化+边缘求和 1.5 节边缘分布后
2 ⭐ 题型一 连续归一化:二重积分求参数 1.4 节联合密度后
3 ⭐ 题型二 连续边缘密度:注意三角形区域 1.5 节边缘分布后
4 ⭐ 题型三 离散独立性:找到反例即不独立 1.7 节独立性后
5 ⭐⭐ 题型三 连续独立性:密度可分离变量 1.7 节独立性后
6 ⭐ 题型四 离散条件分布:联合÷边缘 1.6 节条件分布后
7 ⭐⭐ 题型四 连续条件密度:先求边缘再代入 1.6 节条件分布后
8 ⭐⭐ 题型五 卷积公式:U(0,1)和→三角分布 1.8 节卷积后
9 ⭐⭐⭐ 题型五 正态可加性:和仍是正态 1.8 节卷积后
10 ⭐ 题型六 max分布:独立同分布指数 1.8 节 max/min 后
11 ⭐⭐ 题型六 min分布:不同区间需分段 1.8 节 max/min 后
12 ⭐⭐⭐ 题型六 应用:串联min/并联max 1.8 节 max/min 后
13 ⭐⭐ 题型七 二维均匀:三角形区域几何概率 1.9 节二维均匀后
14 ⭐⭐ 题型七 二维正态:ρ=0→独立 1.9 节二维正态后
15 ⭐⭐⭐ 题型七 综合:圆域均匀全部性质 1.9 节二维正态后

📋 自检清单

学完这章,你应该能回答下面这些问题。如果哪个答不上来,回到对应小节重新看。


💡 深度思考题

下面的问题不考计算,考的是你对"为什么"的理解。没有标准答案,但你得能用自己的话说清楚。

思考1:卷积公式和分布函数法都能求 Z=X+Y 的分布。什么时候优先选卷积?什么时候只能靠分布函数法?选错方法会有什么后果?——从"两个方法的根本区别"这个角度来回答。

思考2:为什么二维正态分布中 $\rho=0$ 等价于独立,但一般分布中 $\rho=0$ 不等于独立?想一个具体的"不相关但不独立"的例子(比如 Y = X^2,X 对称分布在 [-1, 1] 上),然后用大白话解释为什么它们不相关(没有线性趋势),但明明有很强的关系。

思考3:给你一个联合密度 f(x,y) 定义在三角形区域上,有人说"直接对 y 积分就能得到 f_X(x)"。这句话对不对?如果不对,最容易在哪个环节出错?用三角形区域为例,画出图来说明。


🔗 章末过渡

本章讲完了。你现在手里有了分析两个随机变量"关系"的全套工具:联合分布是全家福(两人一起看),边缘分布是单人照(只看一个人),条件分布是加了筛选条件后的样子,独立性告诉你两个人是不是各过各的,卷积和 max/min 告诉你它们的运算结果长什么样。

下一章(第4章)要给这些"关系"一个数字——就像给两个人的亲密程度打个分(0 到 1 之间)。这个分数就是"协方差和相关系数"。你会发现,本章学过的独立性判断、边缘分布、联合分布,在下一章全部会重新用到——比如协方差的定义就是从联合分布出发,而相关系数 $\rho$ 你已经在本章二维正态分布中见过面了。


🧭 学完回顾:本章推导链

闭上眼睛,沿着下面这条线走一遍——从"两个变量一起看"到"判断它们有没有关系"再到"把两个分布合成一个新分布"。卡在哪一步,就回到对应小节重新看。全走通了,这章才算真正学透了。

                          联合分布函数 F(x,y)=P{X≤x, Y≤y}
                           (刻画"两个变量一起"的累计概率)
                                        │
                      ┌─────────────────┼─────────────────┐
                      ↓                                    ↓
                四条基本性质                            两种类型
                                                         │
                ·单调不减                       ┌────────┴────────┐
                ·有界性: F(-∞,·)=0              ↓                  ↓
                  F(+∞,+∞)=1              离散型(X,Y)        连续型(X,Y)
                ·右连续                     联合分布律 pᵢⱼ      联合密度 f(x,y)
                ·★矩形概率非负               (二维表格)         (三维曲面)
                  (二维容斥原理)              一格一格数          一片一片积分
                      │                           │                  │
                      └───────────────┬───────────┘                  │
                                      ↓                              │
                             联合分布 (F / pᵢⱼ / f)                 │
                             "全家福"——两个人一起看                   │
                                      │                              │
                        ┌─────────────┼─────────────┐                │
                        ↓                           ↓                │
                   边缘分布                     条件分布              │
              "把另一个人压扁消掉"         "已知一个人,重算另一个"      │
                                                                      │
              离散: pᵢ· = Σⱼ pᵢⱼ         离散: pᵢⱼ / p·ⱼ            │
              连续: f_X = ∫ f dy         连续: f(x,y) / f_Y(y)       │
              (求和/积分消掉不要的)        (联合÷边缘 = 条件)          │
                        │                           │                │
                        └─────────────┬─────────────┘                │
                                      ↓                              │
                              独立性判定                              │
                         "两个人是不是各过各的?"                       │
                                                                      │
                    判法1: 联合 = 边缘乘积                             │
                    f(x,y) = f_X(x)·f_Y(y) ?                          │
                                                                      │
                    判法2: 条件 = 边缘                                 │
                    知道Y改变不了X的分布吗?                             │
                                                                      │
                    速判法: 区域非矩形 → 直接不独立!                    │
                    矩形 + 可分离变量 → 独立                           │
                                      │                              │
                    ┌─────────────────┼─────────────────┐            │
                    ↓                 ↓                  ↓            │
               Z = X+Y            max / min           Z = X/Y         │
            "两个因素叠加"    "最好的/最差的"    "两个因素相除"        │
                                                                      │
          分布函数法(通用)    max ≤ z ⇔ 都 ≤ z    分Y>0和Y<0         │
          F=∬_{x+y≤z} f      F_M = [F(z)]ⁿ      两段积分             │
                                                                      │
          X,Y独立 → 卷积     min > z ⇔ 都 > z    求导得密度           │
          f_Z=∫f_X(x)×       F_N = 1-[1-F]ⁿ      含|y|因子           │
              f_Y(z-x) dx    (绕道走后门)         (雅可比行列式)       │
                                                                      │
                    └─────────────────┬─────────────────┘            │
                                      ↓                              │
                              ┌───────┴───────┐                      │
                              ↓               ↓                      │
                         第4章: 数字特征   第5章: 极限定理             │
                        协方差/相关系数   中心极限定理                │
                       "给关系一个分数"  "很多独立变量和→正态"         │

走一遍推导链(跟着念一遍就记住):

  1. 起点:$F(x,y) = P{X \leq x, Y \leq y}$ —— 两个变量"都不超过某个数"的概率。
  2. 分岔:离散用表格($p_{ij}$),连续用曲面($f(x,y)$)。本质一样——描述"两个人一起取各种值的可能性"。
  3. 降维:想单独看 X?把 Y 消掉(求和/积分)。这就是边缘分布。注意——消掉 Y 的同时也丢了"X 和 Y 的关系"信息。
  4. 切片:已知 Y 取某个值,X 的分布怎么变?联合 ÷ 边缘 = 条件分布。竖线后面的人(已知条件)的分母进分母。
  5. 定关系:独立的本质 = 条件 = 边缘(知道 Y 不影响判断 X),等价于联合 = 边缘乘积。非矩形区域直接判不独立,不用算!
  6. 合成:知道 X 和 Y 的分布,怎么求 X+Y / max(X,Y) / X÷Y 的分布?分布函数法(先求 F 再求导)是通用核武器,独立时卷积公式是快捷方式。
  7. 去往:第 4 章把这些"关系"量化为数字(协方差/相关系数),第 5 章告诉你大量独立变量叠加的结果(中心极限定理)。
← 上一章下一章 →