📖 概率论

第2章 一维随机变量及其分布

🔔 课前激活(花30秒想想再往下读)

你在公交车站等车,这路车平均10分钟来一班,但你永远不知道上一班刚走还是下一班快到——等车时间可能是0分钟,也可能是10分钟,甚至更长。你有没有想过,虽然每次等多久不确定,但"等超过8分钟"的概率其实是有规律可算的?

再比如你投10次篮,每次命中率30%。"命中3次"和"命中7次",哪个更有可能?如果换一种规则——"一直投到第一个球进为止",概率又完全不同了。

带着这些问题往下读。这一章会把"不确定的事"变成"能算的数学"——让随机变量帮你说话。

📌 学完这章你能回答:

  • 离散型和连续型随机变量到底有什么区别?为什么连续型在任何单个数值上的概率都是0?
  • 分布函数 F(x) 到底是什么?怎么用它算区间概率?
  • 正态分布为什么必须"标准化"才能查表?标准化是怎么做的?
  • 已知一个变量的分布,如果对它做平方、加减乘除、取绝对值——新变量的分布怎么求?
  • 什么情况下可以用泊松分布代替二项分布来简化计算?

本章考什么

考纲要求:一维随机变量是概率论的核心工具——把随机现象"翻译"成数字,后续多维随机变量、数字特征、统计推断都建立在本章基础上。这一章新东西确实不少,但别怕——分块学,一个一个拿下。

题型 考频 说明
求分布律/密度中的未知参数 ⭐⭐⭐ 每年至少1道,选择题或计算题第一问
求分布函数 ⭐⭐⭐ 最基本也最常用的操作,常作为大题第一步
利用常见分布求概率 ⭐⭐⭐ 大题常客,二项/正态尤重
正态分布标准化与查表计算 ⭐⭐⭐ 最高频操作之一,多练几遍就熟了
随机变量函数的分布 ⭐⭐⭐ 大题重点,分布函数法是万能工具
泊松近似二项 ⭐⭐ 中等频率,条件判断是关键

① 核心知识

⚠️ 关于 E(X) 和 Var(X):你在本章会反复看到"期望 E(X)"和"方差 Var(X)"这两个词。它们分别表示随机变量的"平均水平"和"波动程度"——就像描述一个班级时,平均分告诉大家"整体水平",分数差距告诉大家"整齐不整齐"。期望和方差的正式定义在第4章详细讲解,本章你只需要把它们当作"平均值"和"波动大小"来理解。(有些教材用 D(X) 表示方差,和 Var(X) 是同一个东西——本书统一用 Var(X)。)

1.1 随机变量——把随机结果"翻译"成数字

先想一个场景:掷骰子的结果,怎么"算"?

你掷一颗骰子,结果可能是"1点、2点、……、6点"——这是随机结果,每次掷之前都不确定。现在问你:掷出偶数点的概率是多少?

这题不难,你会数:2点、4点、6点三种情况,概率 3/6 = 1/2。但注意——你刚才做的一件事是:把"2点""4点""6点"这几个用文字描述的结果,当成了 2、4、6 这几个数字来数。

难在哪?——"正面/反面""红色/蓝色"这些随机结果,本身不是数字。不是数字,就没法加减乘除,就没法算概率。 比如抛硬币,"正面"加"正面"是什么?没意义。

动手试探:那能不能给每个结果"贴一个数字"?比如抛硬币——"正面记1分,反面记0分"。这样一来,一次抛掷的结果就变成了一个数:要么是1,要么是0。一个数,就能算概率了。

🧠 这一步在想什么:我们做的事特别像"翻译"——把说不清楚的结果(正面/反面/红色/蓝色),翻译成能计算的数字(0/1/2/3)。翻译规则可以自己定(比如把正面记成1),只要每个结果对应一个唯一的数就行。

🔍 回头看看:刚才那个"翻译规则"就是本节的主角——随机变量。它不是一个具体的数(因为随机,每次结果都变),而是一条把随机结果变成数字的规则。

生活比喻:你去菜市场买菜,在门口随机拦住一个人,问他"今天花了多少钱"——这个人花的钱数,就是一个随机变量。为什么叫"变量"?因为不同的人花的钱不一样;为什么叫"随机"?因为你拦到谁不确定,所以这个数具体是多少也不确定。

再比如抛一枚硬币:"正面记1分,反面记0分"——抛一次之后你得到的分数,也是一个随机变量。

正式定义(核心):设随机试验的样本空间为 S。如果对每个样本点 e ∈ S,都有一个实数 X(e) 与它对应,则称 X(e) 为随机变量,简记为 X。

这个定义用一句话说就是:随机变量是把"随机试验的结果"翻译成"数字"的规则。它是一座桥——把"说不清楚的结果(正面/反面/红色/蓝色)"变成"能算的数字(0/1/2/3)"。

✍️ 立刻练一道:同时抛两枚硬币,用 X 表示"正面朝上的枚数"。(1) X 可能取哪些值?(2) X = 2 对应哪个随机结果?

点击看答案

(1) X 可能取 0、1、2——两枚都反面是 0,一正一反是 1,两枚都正面是 2。
(2) X = 2 对应"两枚都是正面"这个随机结果。


1.2 离散型 vs 连续型——两种不同的随机变量

先想一个场景:同样是"随机",为什么骰子和身高完全不一样?

抛一颗骰子,结果是 1、2、3、4、5、6——随机,但取值是明明白白能列出来的。可如果你在称一个人的身高,结果可能是 170.2cm、170.23cm、170.237cm……它也是随机(每个人不同),但你永远列不完所有可能的取值。

难在哪?——同样是随机变量,一个是"能数清的几个点",一个是"填满一条线的数"。这决定了后面的概率怎么算,必须分清楚。

动手试探:区分它们其实只需要问一句话——"X 的取值能一个一个列出来吗?"

🔍 回头看看:这个"能不能列出来"的差异,就是随机变量的第一次分类。后面你会看到,离散型和连续型连"描述概率的工具"都不一样——一个用分布律(一行一行列),一个用概率密度(一条曲线来刻画)。

生活比喻:想象你在数两个完全不同的东西——

正式定义:

对比维度 离散型 连续型
取值特点 孤立的点,能列出来 填满一个区间,列不完
描述工具 分布律(概率分布列) 概率密度函数
在单个点上的概率 可以大于0 一定等于0
为什么单点概率是0 — 因为一个点的"长度"是0,概率是"面积"

连续型随机变量 P(X = a) = 0 对任何 a 都成立——这意味着 P(X ≤ a) = P(X < a),等式两边就差一个点,概率上没区别。

✍️ 立刻练一道:判断下面每个随机变量是离散型还是连续型:(1) 某公交站一天内进站的公交车数;(2) 某趟公交的准点到站误差(秒);(3) 一批零件里次品的个数;(4) 一台机器的连续运转时间(小时)。

点击看答案

(1) 离散型——车辆数是 0、1、2、3……能一个一个列出来。
(2) 连续型——误差可以精确到任意小数,填满一个区间。
(3) 离散型——次品个数是整数,能列出来。
(4) 连续型——运转时间是连续变化的量。


1.3 离散型随机变量的分布律

先想一个场景:怎么"完整地"描述一个随机变量?

回到抛硬币的例子:X 是"正面记1、反面记0"。如果有人问"X 到底是什么样的随机变量",你光说"取值是0或1"够吗?不够——还得说清楚"取0和取1各有多大概率"。因为同样是取值 0/1,一个公平硬币和一个不公平硬币是完全不同的两个随机变量。

难在哪?——"每个取值各有多少概率",这是描述随机变量的全部信息,得有个标准的记法,否则没法计算、没法比较、没法列成表。

动手试探:那就把所有可能的取值和它们各自的概率,一一对应地列出来——比如"X=0 的概率是 0.5,X=1 的概率是 0.5"。列完你就发现:每一种取值配一个概率,这就是一个完整的"分配方案"。

班级里有40个学生,你随机抽一个人,问他"你一周打几次游戏"。

🔍 回头看看:把"每种取值"和"对应的概率"列成一张表——这张表就是本节的主角,分布律。它告诉你"概率"是怎么"分配"到每个取值上的。

正式定义(核心):设 X 是离散型随机变量,其所有可能取值为 x₁, x₂, ..., xₖ, ...。称
$$P(X = x_k) = p_k, \quad k = 1, 2, ...$$
为 X 的分布律(或概率分布列)。

分布律的两种表示:

  1. 表格形式:

    X x₁ x₂ ... xₖ ...
    P p₁ p₂ ... pₖ ...
  2. 公式形式:$P(X = k) = ...$(比如二项分布公式)

分布律的两条性质——为什么是必要条件?
① 🏫 生活场景:分蛋糕

一盘蛋糕切成若干块,分给全家人。每块大小可以不同(有的人吃得多、有的人吃得少),但有两条铁律:第一,每块不能是负数(没人"倒贴"蛋糕);第二,所有块加起来等于整个蛋糕(不能凭空多出来、也不能少掉一块)。

分布律就是把"总概率 1"这块蛋糕切成若干块,分给每个可能的取值。p_k 就是第 k 块的大小。同样两条铁律:每块 ≥ 0,加起来 = 1。

② 正式陈述

设离散型随机变量 X 的分布律为 $P(X = x_k) = p_k, ; k = 1, 2, ...$,则 {p_k} 必须满足:

编号 性质名称 数学表达 通俗版
(i) 非负性 $p_k \geq 0$ 对所有 k 成立 每个取值的概率不能是负数——概率为负没有意义
(ii) 归一性 $\sum_k p_k = 1$ 所有可能取值的概率加起来必须等于 1——因为 X 必定取某个值

这两条是"概率"这个概念本身的硬性要求——任何分布律都必须满足。考试中看到"已知分布律含未知参数,求参数",99% 是在考归一性:列方程 $\sum p_k = 1$。

③ 📝 大白话复盘 + 分布律和分布函数的关系

为什么这两条是必要条件? 因为概率论的公理就是这样规定的:任何事件的概率 ≥ 0(非负性),必然事件的概率 = 1(规范性)。分布律中的每个 p_k 是事件 {X = x_k} 的概率,所以 p_k ≥ 0;而所有 {X = x_k} 的并集就是整个样本空间(X 必定取某个 x_k),所以概率之和 = 1。

分布律和分布函数的关系:

如果把分布函数 F(x) 想象成"累计存水量",分布律就是"每个桶里单独装了多少水":

离散型分布函数就是"分段常数、右连续、每次跳跃高度 = p_k"的阶梯函数。这两条性质保证了阶梯从 0 开始、一路向上、最终到达 1——中间不往回走、不跳过头。

✍️ 立刻练一道:抛两枚硬币,X 表示正面朝上的枚数(0、1、2 三种取值)。(1) 写出 X 的分布律;(2) 检查它是否满足分布律的两条性质;(3) 求 P(X ≤ 1)。

点击看答案

(1) 两枚硬币有 4 种等可能结果:正正、正反、反正、反反。所以分布律为:

X 0 1 2
P 1/4 1/2 1/4

(2) 两条性质:每个概率 ≥ 0 ✓;1/4 + 1/2 + 1/4 = 1 ✓。
(3) P(X ≤ 1) = P(X=0) + P(X=1) = 1/4 + 1/2 = 3/4。

分布律里的"未知参数"怎么求?——先动手算一道

看到这题,先别慌:设 X 的分布律为 P(X = k) = a·k,k = 1, 2, 3, 4。求 a。

难在哪?——分布律里掺了个未知的 a,X 到底怎么分布,a 定了才算数。手里能用的"硬条件"只有一个:分布律的两条性质。哪条能挤出 a?——归一性:所有概率加起来必须等于 1。

动手试探:把归一性写出来:∑_{k=1}^4 P(X=k) = a·1 + a·2 + a·3 + a·4 = a·(1+2+3+4) = 10a = 1。解出来 a = 0.1。

🧠 这一步在想什么:为什么要用归一性而不是非负性?——归一性是带等号的方程,能给 a 一个确定的数;非负性只是个不等式,挤不出具体值。考试中"已知分布律含未知参数,求参数"99% 是在考归一性。

🔍 回头看看:流程是"确定类型 → 列归一性方程 → 解方程 → 代回验算"。离散型用 ∑p_k = 1,连续型用 ∫f dx = 1,一个套路两处用。

📌 以后就这么办:①判断离散还是连续;②离散列 ∑p_k = 1,连续列 ∫f(x)dx = 1;③解出参数;④代回检查总和是否为 1。

✍️ 立刻练一道:设随机变量 X 的分布律为:

X 1 2 3 4
P 2a 3a 4a a

求常数 a。

点击看答案

由分布律的归一性:所有概率之和 = 1,即 2a + 3a + 4a + a = 1,10a = 1,a = 0.1。
验证:0.2 + 0.3 + 0.4 + 0.1 = 1 ✓。

1.4 连续型随机变量的概率密度

先想一个场景:称体重,"刚好 62.0000 公斤"的概率是多少?

连续型随机变量(身高、体重、寿命)有个绕不开的问题:它的取值填满一个区间,任何单个数值都只占"一根没有宽度的线"。你问"某人体重刚好 62 公斤的概率",答案是 0——不是因为他不可能 62 公斤,而是因为"刚好一个点"在连续世界里占不到任何"面积"。

难在哪?——如果每个单点的概率都是 0,那**该用什么来描述概率呢?**分布律(逐个列出概率)在连续型这里彻底失灵了:每个点都是 0,列出来毫无信息。

动手试探:换个问法——不问"刚好 62 公斤",而问"体重在 61.5 到 62.5 公斤之间的概率"。这个就有答案了。所以连续型的概率不是"算点",而是算区间。那怎么描述"每一处的密集程度"?——回忆一下描述"密集程度"的现成工具:密度。

生活比喻:设想一根不均匀的金属棒,长1米。不同位置的密度不一样——有的地方铁多(密度大),有的地方铁少(密度小)。

🔍 回头看看:连续型随机变量用的就是同一招——概率密度。在单点上概率为0(点没有"宽度"),在区间上概率 = 密度函数在这个区间上的积分(相当于面积)。

正式定义(核心):对于随机变量 X,如果存在非负可积函数 f(x),使得对任意实数 a < b,有
$$P(a < X \leq b) = \int_a^b f(x),dx$$
则称 X 为连续型随机变量,f(x) 称为 X 的概率密度函数(简称概率密度或密度)。

如果你第一次看到积分符号 ∫ 感到紧张——完全正常!把它想象成一个压蒜器:把一条弯弯曲曲的曲线(大蒜)压扁,压出来的"面积"就是积分结果。你不需要成为积分高手才能学这章。把 ∫_a^b f(x) dx 理解为"曲线 f(x) 下面、从 a 到 b 之间的面积"就足够了。本章实际用到的积分基本只有两种:∫ x dx = x²/2 和 ∫ x² dx = x³/3。考试中复杂的积分要么很简单,要么题目直接给结果。先理解"积分 = 连续求和 = 面积"这个概念,计算的事慢慢来。

概率密度的两条性质(必考):

  1. 非负性:$f(x) \geq 0$(密度不能为负,否则概率就算出负数了)
  2. 归一性:$\int_{-\infty}^{+\infty} f(x),dx = 1$(整条曲线下的总面积 = 1)

类比记忆:离散型的分布律是所有 p_k 加起来 = 1;连续型的密度是整条曲线下的面积 = 1。两者说的都是"总概率等于1"。

密度里的"未知参数"怎么求?——先动手算一道

看到这题,先别慌:设 X 的概率密度为 $f(x) = \begin{cases} kx, & 0 < x < 2 \ 0, & \text{其他} \end{cases}$,求常数 k。

难在哪?——和离散型一模一样的困境:密度里掺了个未知的 k。手里能用的"硬条件"还是那两个——非负性(不等式)和归一性(等式)。能挤出 k 的只有归一性。

动手试探:∫_{−∞}^{+∞} f(x) dx = 1。注意密度只在 (0, 2) 上非零,所以积分只在 0 到 2 上算:∫_0^2 kx dx = k·[x²/2]_0^2 = k·2 = 1,解出 k = 1/2。

🧠 这一步在想什么:连续型列归一性方程时,最容易错的是积分区间——密度只在某个区间非零,积分限就该是那个区间,别写成 −∞ 到 +∞ 照搬公式(那会出错)。这也是为什么有的题目特意把密度写成"分段"的样子——每一段都要积到。

🔍 回头看看:和离散型求参数的流程完全平行——判断类型 → 列归一性 → 解方程 → 验算。离散 ∑p_k = 1,连续 ∫f dx = 1,一套思路。

📌 以后就这么办:①判断离散还是连续;②连续型列 ∫f(x)dx = 1(积分区间取密度的非零区间);③解出参数;④代回验证总面积 = 1。

✍️ 立刻练一道:设随机变量 X 的概率密度为 $f(x) = \begin{cases} k(1-x), & 0 < x < 1 \ 0, & \text{其他} \end{cases}$,求常数 k。

点击看答案

由密度的归一性:∫_0^1 k(1−x) dx = 1。
k · ∫_0^1 (1−x) dx = k · [x − x²/2]_0^1 = k · (1 − 1/2) = k · (1/2) = 1,所以 k = 2。

概率密度能大于1吗?

可以! 概率密度 f(x) 可以大于1,只要积分(面积)=1 就行。

比如一个高为2、宽为0.5的长方形——高度(密度)是2,但宽度只有0.5,面积 = 2 × 0.5 = 1,完全合法。这个"在某个区间内密度处处相等"的分布,后面1.7节会正式介绍——叫均匀分布。

而概率 p_k 不能大于1——这是离散和连续的一个重要区别。简单区分:概率密度是"密度",不是概率本身,就像金属棒的密度大不等于铁的总量多——看总面积。

✍️ 立刻练一道:设 X 的密度为 $f(x) = \begin{cases} x/2, & 0 < x < 2 \ 0, & \text{其他} \end{cases}$。(1) 验证它是合法的密度(非负 + 总面积为1);(2) 求 P(1 < X < 2);(3) 求 P(X = 1.5)。

点击看答案

(1) 在 (0, 2) 上 x/2 > 0 ✓;$\int_{-\infty}^{+\infty} f(x),dx = \int_0^2 \frac{x}{2},dx = \left[\frac{x^2}{4}\right]_0^2 = \frac{4}{4} - 0 = 1$ ✓。
(2) $P(1 < X < 2) = \int_1^2 \frac{x}{2},dx = \left[\frac{x^2}{4}\right]_1^2 = 1 - \frac{1}{4} = \frac{3}{4}$。
(3) P(X = 1.5) = 0——连续型在单个点上的概率永远是 0。


1.5 分布函数——最重要的概念

说完了离散型的分布律和连续型的概率密度,接下来看它们的"统一框架"——分布函数。

先想一个场景:离散和连续,能不能用同一种方式算概率?

到现在为止,离散型用"把每个取值的概率列出来"(分布律),连续型用"算密度曲线下的面积"(积分)。两套语言,各说各话。可有时候题目给你的是混合的情况,或者你只想知道"X 不超过某个数 x 的总概率"——有没有一个统一的入口,不管离散还是连续,都能用它说话?

动手试探:注意两套语言里其实有个共同的影子——"X 不超过 x 的概率"。离散型是"把所有 ≤ x 的 p_k 加起来",连续型是"从 −∞ 积到 x 的面积"。这两个计算不一样,但问的问题完全一样:X 落在 (−∞, x] 里的概率有多少。

🧠 这一步在想什么:既然两套语言都在反复算同一个东西,那不如把它正式命名、当作一把统一尺子。给任意实数 x,都对应一个确定的数 P(X ≤ x)——x 是变量,这个"不超过 x 的概率"就随 x 变化,它本身就是一个函数。

🔍 回头看看:这个"把 X ≤ x 的概率写成关于 x 的函数"的定义,就是本节主角——分布函数。它是离散和连续的统一框架:离散累加、连续积分,问的都是同一个 F(x)。

生活比喻:你在超市排队结账,每个人结账时间不同。你问:"结账时间不超过5分钟的概率是多少?"——这其实就是分布函数在 x=5 处的值。

分布函数 = "累计概率"。它告诉你:随机变量 X 取值"不超过某个数 x"的总概率是多少。就像一个水库,水从上游(−∞)往下游(+∞)流。到了位置 x 时,拦住的概率有多少——这就是 F(x)。

正式定义(核心,最重要公式之一):设 X 是随机变量(离散或连续都行),对任意实数 x,称
$$F(x) = P(X \leq x), \quad x \in (-\infty, +\infty)$$
为 X 的分布函数。

注意那个等号:F(x) = P(X ≤ x),不是 P(X < x)。这里带等号,对应分布函数的"右连续"性质。**"右连续"**简单说就是:从右边靠近时函数值不变——比如你站在一个台阶上,从右边往左走到台阶边缘,脚还在台阶上。后面四条性质那里会详细讲。

三种情况下的计算:

🧪 马上试一个:假如 X 取值 1, 2, 3,对应概率 0.3, 0.5, 0.2。那 F(2.5) 是多少?

答案是 0.3 + 0.5 = 0.8——因为 ≤2.5 的取值只有 1 和 2,把它们的概率加起来就行。F(1.8) = 0.3(只有 1),F(0.5) = 0(没有 ≤0.5 的取值)。简单吧?

求离散型的分布函数——先动手算一道

看到这题,先别慌:已知 X 的分布律

X 0 1 2
P 0.2 0.5 0.3
求分布函数 F(x)。

难在哪?——F(x) 不是算一个点,而是要写出"对任意 x 都成立"的完整分段表达式。x 是任意实数,落在哪个区间,算法就不一样。

动手试探:先问"F(x) = P(X ≤ x)"。取一个具体的 x,比如 x = 0.5:≤0.5 的取值只有 0,所以 F(0.5) = 0.2。再取 x = 1.7:≤1.7 的取值是 0 和 1,F(1.7) = 0.2 + 0.5 = 0.7。看出来了吗——x 落在哪一段,就把前面所有取值的概率累加起来。

🧠 这一步在想什么:关键是把数轴按 X 的取值切成区间,x 每跨过一个取值,累积的概率就跳高一段。区间从左到右依次:x < 0、0 ≤ x < 1、1 ≤ x < 2、x ≥ 2。

🔍 回头看看:我们其实走了一套固定的流程——①把取值从小到大排好;②从 −∞ 往右一段段累加;③等号放在区间左边(为什么?——分布函数右连续,0.2 这个概率在 x 到 0 时就已经算进去,属于"0 右边"这一段,所以写 0 ≤ x < 1)。这就是"求离散型分布函数"的标准流程。

📌 以后就这么办:已知分布律 → 求分布函数 F(x):①取值从小到大排好;②按区间从 −∞ 往右逐段累加概率;③分段区间写成"左闭右开"(等号在左边);④最右一段 F(x) = 1。

完整结果:
$$F(x) = \begin{cases} 0, & x < 0 \ 0.2, & 0 \leq x < 1 \ 0.7, & 1 \leq x < 2 \ 1, & x \geq 2 \end{cases}$$

✍️ 立刻练一道:已知 X 的分布律:

X −1 0 2
P 0.3 0.5 0.2
求 X 的分布函数 F(x)。
点击看答案

取值从小到大:x₁=−1(p=0.3),x₂=0(p=0.5),x₃=2(p=0.2)。分区间累加:

  • x < −1:F(x) = 0
  • −1 ≤ x < 0:F(x) = 0.3
  • 0 ≤ x < 2:F(x) = 0.3 + 0.5 = 0.8
  • x ≥ 2:F(x) = 0.3 + 0.5 + 0.2 = 1

所以:
$$F(x) = \begin{cases} 0, & x < -1 \ 0.3, & -1 \leq x < 0 \ 0.8, & 0 \leq x < 2 \ 1, & x \geq 2 \end{cases}$$

求连续型的分布函数——同样是分段积分

再看一个:已知 X 的密度为 $f(x) = \begin{cases} 2x, & 0 < x < 1 \ 0, & \text{其他} \end{cases}$,求 F(x)。

难在哪?——F(x) = ∫_{−∞}^x f(t) dt,但 f(t) 只在 (0,1) 上非零。x 落在 0 左边、0 到 1 之间、1 右边,积分结果是三种完全不同的样子。

动手试探:分三段看——

🧠 这一步在想什么:积分变量必须换个字母(用 t,别用 x)——因为 x 已经占了"分布函数的自变量"这个位置。分段积分的关键是"x 落在哪个区间,就只积到 x 为止"。

🔍 回头看看:和离散型完全一个套路——只是把"累加概率"换成"积分密度",同样是"按区间分段"。

📌 以后就这么办:已知密度 → 求分布函数 F(x):①写公式 F(x) = ∫_{−∞}^x f(t) dt(积分变量用 t);②找出密度的非零区间,按 x 落在"左边 / 内部 / 右边"分三段算;③最左段 0,最右段 1;④写完验证 F(−∞)=0、F(+∞)=1、单调不减。

✍️ 立刻练一道:设 X 的概率密度为 $f(x) = \begin{cases} 3x^2, & 0 < x < 1 \ 0, & \text{其他} \end{cases}$,求 X 的分布函数 F(x)。

点击看答案

F(x) = ∫_{−∞}^x f(t) dt,分三段:

  • x < 0:F(x) = 0
  • 0 ≤ x < 1:F(x) = ∫_0^x 3t² dt = t³|_0^x = x³
  • x ≥ 1:F(x) = ∫_0^1 3t² dt + ∫_1^x 0 dt = 1 + 0 = 1

所以:
$$F(x) = \begin{cases} 0, & x < 0 \ x^3, & 0 \leq x < 1 \ 1, & x \geq 1 \end{cases}$$

验证:F(0) = 0,F(1) = 1,在 (0,1) 内 x³ 单调递增,连续 ✓。

分布函数的四条性质(定理级)

你已经知道分布函数 F(x) = P(X ≤ x) 是"累积概率"。现在问一个更深的问题:什么样的函数才有资格当分布函数?不是随便写个函数就行的——它必须满足四条性质。这四条性质不是数学家拍脑袋想出来的,而是从概率的基本道理推导出来的。

① 🏫 生活场景:累积成绩排名

想象你们班 40 个人,语文考试分数从低到高排好。你定义"排名占比":分数 ≤ 某个分数 x 的学生人数,占总人数的比例。

这个"排名占比曲线"就是分布函数的生活原型。它有四条"铁律":

  1. 单调不减:分数越高,排名占比不可能变小
  2. 从 0 开始:低到离谱的分数(-∞),没人能达到,占比是 0
  3. 到 1 结束:高到离谱的分数(+∞),所有人都"≤"它,占比是 1
  4. 等号归自己:如果分数刚好等于某人的分数,这个人在"≤"里面(这就是右连续——后面细讲)
② 正式陈述

设 F(x) = P(X ≤ x) 是随机变量 X 的分布函数,则 F(x) 必须满足以下四条性质(缺一不可):

编号 性质名称 数学表达 通俗版
(i) 单调不减 若 x₁ < x₂,则 F(x₁) ≤ F(x₂) 越往右走,累积概率只升不降
(ii) 有界性 0 ≤ F(x) ≤ 1 对所有 x 成立 概率只能在 0 到 1 之间
(iii) 极限归一 $\lim\limits_{x \to -\infty} F(x) = 0$,$\lim\limits_{x \to +\infty} F(x) = 1$ 最左边概率 0(啥都没发生),最右边概率 1(肯定发生)
(iv) 右连续 $F(x+0) = F(x)$ 对每个 x 成立 从右边走过来,值不变——每个台阶的值归右边那段

四条性质不是并列关系——(ii) 有界性和 (iii) 极限归一其实说的是"值域锁定在 [0,1] 并且两端填满",但分开列更方便判断。考试中判断一个函数是不是分布函数,四条全部要检查。

③ 🧠 完整推导:从概率的定义出发逐条证明

第 1 步:单调不减

已知 x₁ < x₂,要证 F(x₁) ≤ F(x₂)。

概率的基石是"事件越大,概率越大"——大事件包含小事件,概率自然不小于小事件。

把事件写成集合:${X \leq x_2} = {X \leq x_1} \cup {x_1 < X \leq x_2}$

等号右边的两个集合没有重叠(X 不可能同时 ≤ x₁ 又 > x₁),所以概率直接相加:
$$F(x_2) = P(X \leq x_2) = P(X \leq x_1) + P(x_1 < X \leq x_2) = F(x_1) + \underbrace{P(x_1 < X \leq x_2)}_{\geq 0}$$

第二项 P(x₁ < X ≤ x₂) 是非负的(概率不可能为负),所以 F(x₂) ≥ F(x₁)。得证。

🧠 这一步在想什么:把 {X ≤ x₂} 拆成"≤ x₁ 的部分"和"x₁ 到 x₂ 之间的部分"两段。因为中间那段概率 ≥ 0,所以累积量只会更多不会更少——单调不减就这么来的。

更有用的是中间结论:$P(x_1 < X \leq x_2) = F(x_2) - F(x_1)$——这就是后面求区间概率的核心公式!

第 2 步:F(−∞) = 0

要证:当 x → −∞ 时,F(x) → 0。

${X \leq x}$ 当 x → −∞ 时,这个事件越来越"窄"(X 要越来越小)。取极限时,事件退化为空集 $\emptyset$(没有实数能比 −∞ 还小),而 $P(\emptyset) = 0$。

🧠 这一步在想什么:概率公理说空事件概率为 0。x 往负无穷跑,条件越来越苛刻,最后没有任何数能满足 X ≤ −∞——事件消失了,概率归零。

第 3 步:F(+∞) = 1

要证:当 x → +∞ 时,F(x) → 1。

${X \leq x}$ 当 x → +∞ 时,这个事件越来越"宽"(几乎所有数都被包进去了)。取极限时,事件退化为必然事件 S(任何实数都 ≤ +∞),而 $P(S) = 1$。

🧠 这一步在想什么:概率公理说必然事件概率为 1。x 往正无穷跑,条件越来越松,最后所有实数都满足 X ≤ +∞——事件覆盖了整个样本空间,概率当然是 1。

第 4 步:右连续

要证:在任意点 x₀ 处,F(x₀+0) = F(x₀),其中 F(x₀+0) 表示从右边趋近 x₀ 时的极限值。

这个性质的证明比前三条更精细,我们需要概率的连续性(单调序列的极限性质):

考虑一列从右边递减趋近 x₀ 的数:$x_1 > x_2 > \cdots > x_0$,且 $x_n \to x_0$。

事件 ${X \leq x_n}$ 是一个递减的事件序列(条件越来越严格——xₙ 越来越小,所以 ≤ xₙ 的 X 越来越少)。这些事件的交集正好是 ${X \leq x_0}$(因为 X ≤ 所有 > x₀ 的数,等价于 X ≤ x₀)。

由概率的下连续性(递减事件列的极限 = 交集的概率):
$$\lim_{n \to \infty} P(X \leq x_n) = P\left(\bigcap_{n=1}^{\infty} {X \leq x_n}\right) = P(X \leq x_0)$$
即 $\lim_{x \to x_0^+} F(x) = F(x_0)$——右连续得证。

🧠 这一步在想什么:从右边无限逼近 x₀,事件范围(X ≤ 比 x₀ 略大的数)越来越收窄到 X ≤ x₀。概率公理保证事件序列"连续收缩"时,极限概率等于极限事件的概率——不会凭空出现一个跳跃。

🎯 为什么定义时取 ≤ 而不是 <? 这是刻意设计。如果定义 F(x) = P(X < x),那么离散型在取值点 x_k 处——F(x_k) = P(X < x_k) 不包含该点的概率 p_k,而从右边逼近的极限却是 P(X ≤ x_k) = F(x_k) + p_k,两者差了一个 p_k。也就是说,用 < 定义会导致分布函数在取值点处不是右连续的。用 ≤ 定义让分布函数自动右连续,这是概率论里统一采用 ≤ 的原因。

④ 📝 推导复盘——用大白话把四条性质重新讲一遍

上面推导用到的核心逻辑只有两个:

  1. 概率的加法(互斥事件的概率可加——第一条的证明)
  2. 概率的极限(事件序列收缩→概率也收缩——第四条的证明)

用大白话把这四条串起来:

一句话总结:分布函数就是从 −∞ 出发、一路不回头地爬升、最终到达 1 的右连续阶梯(离散型)或斜坡(连续型)。

⑤ ⚠️ 易错边界——这些坑踩了会丢分

陷阱一:"单调不减"不等于"严格递增"
F(x) 可以有平台(常数段)。比如连续型 X 不可能取 [a, b] 之间的值(密度在这个区间全为 0),那 F(x) 在 [a, b] 上就是平的——累积概率不变,因为根本没有新增概率。离散型在每个取值之间也是平的。只要不下降就行——平着走完全合法。

陷阱二:"右连续"是最容易被漏检的性质

陷阱三:F(−∞) = 0 和 F(+∞) = 1 不是自动满足的
随便写一个递增函数不一定两端极限对。比如 F(x) = 0.5 + 0.3x(x ∈ [0, 1])——这个函数单调递增且值域在 [0.5, 0.8] 之间,两端到不了 0 和 1,不是分布函数。判断时必须检查两端极限。

陷阱四:"有界性"和"极限归一"不能互相替代
有界性只说了 0 ≤ F(x) ≤ 1,没保证能取到两端。极限归一才要求"确实能到达"0 和 1。两者都要检查。

陷阱五:连续型分布函数连续,但不一定光滑(可导)
连续型的分布函数是连续的(没有跳跃),但不一定光滑——可能有"尖角"。比如均匀分布 U(0, 1) 的分布函数在 x=0 和 x=1 处就有折角——连续但不可导。不要看见连续就以为是光滑曲线。

⑥ 🔗 在整条链中的位置

从哪里来:

到哪里去:

判断"是不是分布函数"——用四条性质当检验清单

先想一个场景:怎么戳穿一个"假分布函数"?

考试常见题:给你一个函数 F(x),问它能不能当分布函数。四个选项四个函数,只有一个合法。

难在哪?——不能凭感觉"像不像"。得有一套人人都一样的检验清单。而清单就摆在前面:四条性质——单调不减、0 ≤ F ≤ 1、F(−∞)=0 且 F(+∞)=1、右连续。四条全过才合法,缺一条就出局。

动手试探:拿它检验一个例子——$F(x) = \begin{cases} 0, & x < 0 \ x^2, & 0 \leq x < 1 \ 1, & x \geq 1 \end{cases}$。逐条查:①单调不减——在 [0,1) 上 x² 递增 ✓;②0 ≤ F ≤ 1 ✓;③F(−∞) = 0、F(+∞) = 1 ✓;④右连续——x=0 处 F(0+0)=0=F(0) ✓,x=1 处 F(1+0)=1=F(1) ✓。四条全过 → 合法。

🧠 这一步在想什么:最容易漏的是右连续和两端极限。反例:F(x) = 0.5 + 0.3x(x∈[0,1])单调递增、值域也合法,但 F(−∞) ≠ 0、F(+∞) ≠ 1,直接出局。分段函数则要重点查每个分段点。

🔍 回头看看:这一套"逐条打勾"的流程,就是把四条性质变成一张可以照着执行的检查表。

📌 以后就这么办:判断 F(x) 是否合法——①单调不减(重点查分段点);②0 ≤ F(x) ≤ 1;③F(−∞)=0、F(+∞)=1;④右连续(F(x₀+0) = F(x₀),分段点必查)。

✍️ 立刻练一道:判断以下函数是否为分布函数:$F(x) = \begin{cases} 0, & x < 0 \ \frac{x}{2}, & 0 \leq x < 2 \ 1, & x \geq 2 \end{cases}$。

点击看答案

第1步(单调不减):[0,2) 上 x/2 单调递增 ✓;分段点 x=0:左极限 0、函数值 0 ✓;分段点 x=2:左极限 1、函数值 1 ✓。
第2步(有界性):0 ≤ F(x) ≤ 1 ✓。
第3步(极限):F(−∞) = 0 ✓,F(+∞) = 1 ✓。
第4步(右连续):x=0 处 F(0+0) = 0 = F(0) ✓;x=2 处 F(2+0) = 1 = F(2) ✓;其他点连续 ✓。

四条性质全部满足 → 是合法的分布函数 ✓(这正是均匀分布 U(0,2) 的分布函数)。

分布函数与分布律、概率密度的转换

离散型和连续型各自有"正向"和"反向"的转换关系:

方向 离散型 连续型
从分布律/密度 → 分布函数 $F(x) = \sum_{x_k \leq x} p_k$ $F(x) = \int_{-\infty}^x f(t),dt$
从分布函数 → 分布律/密度 $p_k = F(x_k) - F(x_k - 0)$(跳跃高度) $f(x) = F'(x)$(求导)

离散型:分布律是"每个桶里有多少水",分布函数是"把前面所有桶的水加起来"——前者是增量,后者是累计量。

连续型:概率密度是"每一瞬间水流的速度",分布函数是"从源头到这个位置一共积了多少水"——前者是导数(变化率),后者是积分(累积量)。

连续型中最重要的关系:在 f(x) 的连续点处,$F'(x) = f(x)$。一求导就行了。

用分布函数求区间概率——先动手算一道

看到这题,先别慌:某连续型随机变量 X 的分布函数 F(x) 已知(不用管它具体长什么样),要求 P(2 < X ≤ 5)。

难在哪?——我们手里现在只有 F(x) = P(X ≤ x),但题目问的是"X 落在 (2, 5] 这个区间"的概率。F(x) 只给"从 −∞ 到某个点"的累计,怎么从累计里"抠出"一段区间?

动手试探:想想 F(5) 和 F(2) 各是什么——F(5) = P(X ≤ 5),F(2) = P(X ≤ 2)。两者的差呢?
$$F(5) - F(2) = P(X \leq 5) - P(X \leq 2) = P(2 < X \leq 5)$$
恰好就是我们要的!

🧠 这一步在想什么:把"到 5 为止的累计"减去"到 2 为止的累计",中间那段 (2, 5] 就"露"出来了。像剥洋葱——从外面剥掉 2 以前的部分,剩下的就是 (2, 5]。

🔍 回头看看:这其实在 1.5 的"四条性质"推导里已经埋过伏笔——那里证明单调不减时得到过一个副产品:$P(x_1 < X \leq x_2) = F(x_2) - F(x_1)$。现在它终于派上大用场了。

📌 核心公式(必考):$P(a < X \leq b) = F(b) - F(a)$

💧 回到水库比喻:F(b) 是把水从源头拦到 b 的总量,F(a) 是拦到 a 的总量。两者一减,就是从 a 到 b 之间新增的水量——也就是 X 落在 (a, b] 里的概率。

注意不等号方向:公式用的是 a < X ≤ b(左边开、右边闭)。如果是连续型,开闭无所谓,因为端点概率为0。如果是离散型,要注意端点是否包含。

常见变形:

✍️ 立刻练一道(真题改编):设连续型随机变量 X 的分布函数为 $F(x) = \begin{cases} 0, & x < 0 \ Ax^2, & 0 \leq x < 1 \ 1, & x \geq 1 \end{cases}$。(1) 求常数 A;(2) 求概率密度 f(x);(3) 求 P(0.3 < X < 0.7)。

点击看答案

(1) 连续型分布函数处处连续,在 x = 1 处应有 F(1) = lim_{x→1⁻} F(x):即 A·1² = 1,所以 A = 1。
(2) 密度在 F 可导处求导:0 < x < 1 时 f(x) = (x²)' = 2x,其余 f(x) = 0。即 $f(x) = \begin{cases} 2x, & 0 < x < 1 \ 0, & \text{其他} \end{cases}$。
(3) P(0.3 < X < 0.7) = F(0.7) − F(0.3) = 0.7² − 0.3² = 0.49 − 0.09 = 0.40。

1.6 常见离散型分布

概率论中有一批"经典分布",它们来自现实中的典型场景。考试中看到这些分布的名字,直接套用已知的公式来计算。下面逐一介绍。

🧭 这一节怎么学:这5个离散分布(0-1、二项、泊松、几何、超几何)乍一看全是公式,很容易背混。所以我们的学法不是"先背公式",而是——每个分布都从一个真实场景出发,先自己算出这个概率该怎么算,再发现"原来这就是某个分布"。这样公式是"长出来"的,不是"背下来"的。记不住分布没关系,能认场景就行:看到"投 n 次篮"想二项,看到"稀有事件、次数多、概率小"想泊松,看到"不放回抽"想超几何,看到"投到进为止"想几何。

0-1分布(两点分布)——最简单的分布

先想一个场景:抛一枚硬币,怎么把"正面/反面"变成能算的数字?

生活比喻:抛一枚硬币——正面是1,反面是0。结果就两种可能。生活中的"成/败""是/否""通过/不通过"都是0-1分布。

难在哪?——结果只有两种(正面/反面),但这两种结果本身不是数字。"正面"加"正面"没意义,不算出数字就没法算概率。

动手试探:自己定个规则——"正面记1分,反面记0分"。抛一次之后,你得到的就从一个"说不清的结果"变成一个确定的数:要么是1,要么是0。那"正面的概率"怎么算?给正面一个概率 p(比如硬币不公平,正面概率0.7),反面就是 1−p = 0.3。只要 p 在 0 到 1 之间,这就是一个合法的概率分配。

🧠 这一步在想什么:这个分布只踩 0 和 1 两个点,所以叫"两点"。它是整个概率论最简单的分布——一次试验、两种结果、一个参数 p 就描述完了。

🔍 回头看看:这个"成功记1、失败记0"的规则,就是本节主角——0-1分布(也叫两点分布、伯努利分布)。别小看它,下面二项分布就是它的"n 次重复版"。

正式定义(必考):随机变量 X 只取 0 和 1 两个值,且
$$P(X=1) = p, \quad P(X=0) = 1-p \quad (0 < p < 1)$$
则称 X 服从参数为 p 的0-1分布(也叫两点分布、伯努利分布),记作 $X \sim B(1, p)$。

项目 内容
参数 $p$:成功的概率
期望 $E(X) = p$
方差 $Var(X) = p(1-p)$
适用场景 一次试验,两种结果(成功/失败)

💡 E(X)=期望=平均值(第4章正式定义),Var(X)=方差=波动大小。现在先当"平均水平"和"整齐程度"理解就行。

0-1分布是二项分布 n=1 时的特殊情况。

二项分布 B(n, p)——多次独立重复试验

先想一个场景:投 n 次篮,"恰好进 k 次"的概率怎么算?

生活比喻:投篮——你每次投进的概率是 p(比如30%),投 n 次(比如10次),"投进 k 次"的概率是多少?

难在哪?——"恰好进 k 次"有太多可能的具体情况:可能是第1、3、5次进,也可能是第2、4、7次进……每一种"哪几次进"都是一条不同的路线。光数清楚有多少条路线就够呛,还要算概率。

动手试探:先算一条具体路线的概率——比如"前 k 次进、后 n−k 次不进":第1次进的概率 p、第2次进的概率 p……第 k+1 次不进的概率 1−p……全部乘起来是 $p^k (1-p)^{n-k}$。再数路线:从 n 次里挑出"进的是哪 k 次",一共 $C_n^k$ 种选法。每条路线概率都一样,所以总概率 = 路线数 × 每条路线概率 = $C_n^k p^k (1-p)^{n-k}$。

🧠 这一步在想什么:公式其实是三块拼图——$C_n^k$(路线数)、$p^k$(k 次全进)、$(1-p)^{n-k}$(剩下的全不进)。这就是"n 次独立重复试验,成功恰好 k 次"的完整故事。

🔍 回头看看:这个"投 n 次、每次成功概率 p、恰好成功 k 次"的分布,就是本节主角——二项分布。它来自一个特别具体的场景(投篮、抽检、看病……),所以记公式不如记场景:看到"n 次独立试验、问恰好 k 次成功",就是二项。

正式定义(核心):如果随机变量 X 的分布律为
$$P(X = k) = C_n^k , p^k (1-p)^{n-k}, \quad k = 0, 1, 2, ..., n$$
其中 $0 < p < 1$,则称 X 服从参数为 n, p 的二项分布,记作 $X \sim B(n, p)$。

项目 内容
参数 $n$:试验次数;$p$:每次成功的概率
分布律 $P(X=k) = C_n^k p^k (1-p)^{n-k}$
期望 $E(X) = np$
方差 $Var(X) = np(1-p)$
适用场景 n 次独立重复试验中成功的次数

可加性:若 $X \sim B(n_1, p)$,$Y \sim B(n_2, p)$ 且 X, Y 独立,则 $X+Y \sim B(n_1+n_2, p)$(两个二项分布相加还是二项分布,前提是 p 相同)。

常用特例:0-1分布 = B(1, p)。所以抛一次硬币就是 B(1, p)。

🛑 停一下:在继续往下之前,先试一个——你投4次篮,每次命中率0.5。恰好投进2次的概率是多少?(用二项分布公式,答案在下面)

点击看答案

P(X=2) = C_4^2 × 0.5² × 0.5² = 6 × 0.25 × 0.25 = 0.375。投4次恰好进2次,概率37.5%——比很多人直觉猜的要低,因为可能性分散在0~4次的各种情况。

二项分布的期望和方差——从伯努利"拆"出来的推导

二项分布 B(n, p) 的期望 E(X) = np,方差 Var(X) = np(1-p)。考试直接套这两个公式。先记住结论:投 n 次、每次成功率 p,平均成功 np 次;波动大小是 np(1-p)。为什么恰好是这两个数?完整推导要用到期望和方差的运算公式(第 4 章会系统教),到第 4 章学完再回来补推导——现在会用结论做题就行。

① 🏫 生活场景:投 n 次篮,平均进几个?

你每次投篮命中率 30%。投 10 次,平均能进几个?直觉告诉你:10 × 30% = 3 个。这个直觉完全正确——因为"平均"是可以累加的:第一次平均进 0.3 个,第二次也平均进 0.3 个……投 10 次,平均总共进 10 × 0.3 = 3 个。

但"波动程度"就不能简单累加了——10 次投篮的波动,不是每次波动的 10 倍,而是每次波动的 10 倍再打个折扣。为什么?因为各次投篮的结果互相独立——这次运气好(进了)可能正好被下次运气差(没进)抵消一部分。

② 正式陈述

定理:设 $X \sim B(n, p)$(n 次独立伯努利试验,每次成功概率为 p),则:
$$E(X) = np, \quad Var(X) = np(1-p)$$

核心策略——拆成 n 个独立的 0-1 变量:定义
$$X_i = \begin{cases} 1, & \text{第 i 次试验成功} \ 0, & \text{第 i 次试验失败} \end{cases}, \quad i = 1, 2, ..., n$$
每个 $X_i \sim B(1, p)$(0-1 分布),且 $X_1, X_2, ..., X_n$ 相互独立。那么:
$$X = X_1 + X_2 + \cdots + X_n$$
二项分布就是 n 个独立 0-1 变量的和——这是整个推导的基石。

③ 📌 完整推导——第 4 章再补

二项分布最深的结构是:n 次独立伯努利试验的和。期望和方差为什么是 np 和 np(1-p)?靠两个工具:

📌 这两个工具(期望的线性性质、独立变量的方差可加性)都是第 4 章的核心内容。第 4 章学完,再回来推导一次就全懂了。现在先记住结论:E(X) = np,Var(X) = np(1-p)。

④ 📝 结论怎么记——大白话

一句话:二项分布 B(n, p) 就是 n 个独立 0-1 变量加起来。

这个"拆解法"是概率论中最重要的技术之一——第 4 章学完期望方差的运算工具后,会回来系统推导一遍。考试直接套结论。

⑤ ⚠️ 易错边界

陷阱一:方差可加的前提是独立!
$Var(X_1 + X_2) = Var(X_1) + Var(X_2)$ 只在 $X_1, X_2$ 独立时成立。如果不独立,还要补一个交叉项(协方差,第 4 章学)。二项分布中各次试验独立,所以可以直接加。但如果题目给的是"不放回抽样"(超几何分布),每次就不独立了——方差公式里多了一个修正因子 $\frac{N-n}{N-1}$(有限总体修正)。

陷阱二:0-1 变量的期望 p、方差 p(1-p)——分布表里已给结论
二项分布由 n 个独立的 0-1 变量组成,每个 0-1 变量的期望是 p、方差是 p(1-p)(见 0-1 分布表)。为什么是这个数?推导要用期望和方差的运算公式,第 4 章学完再回头算一次就懂了。做题直接用结论。

⑥ 🔗 在整条链中的位置

从哪里来:

到哪里去:

✍️ 立刻练一道(二项分布综合):某射击运动员每次命中率为 0.7,独立射击 4 次。设 X 为命中次数。(1) 求 X 的分布律;(2) 求至少命中 2 次的概率。

点击看答案

X ~ B(4, 0.7),即 n=4, p=0.7。

(1) 分布律 P(X=k) = C_4^k (0.7)^k (0.3)^{4−k},k = 0,1,2,3,4:

  • k=0: (0.3)^4 = 0.0081
  • k=1: 4×0.7×0.027 = 0.0756
  • k=2: 6×0.49×0.09 = 0.2646
  • k=3: 4×0.343×0.3 = 0.4116
  • k=4: 0.2401

验证:0.0081+0.0756+0.2646+0.4116+0.2401 = 1.0000 ✓

(2) P(X ≥ 2) = 1 − P(X=0) − P(X=1) = 1 − 0.0081 − 0.0756 = 0.9163。

泊松分布 P(λ)——稀有事件发生的次数

先想一个场景:平均每小时来 λ 人,"某一刻恰好来了 k 个"的概率怎么算?

生活比喻:一个客服中心,平均每小时接10个电话。具体到某一天某个小时,可能正好8个、12个、或15个——泊松分布就是描述这种"稀有事件在固定时段内发生的次数"。

难在哪?——"平均每小时来 λ 人"只给了你平均,具体某一段极短时间里来几个完全随机。更要命的是,这个概率的公式 $\frac{\lambda^k}{k!} e^{-\lambda}$ 看起来特别吓人——λ 的 k 次方、阶乘 k!、自然对数的负次方 e^{−λ},到底从哪冒出来的?

动手试探:别背公式,我们把它"造"出来。把 1 小时切成 n 段极短的小段,短到"一段里几乎不可能同时来两个人"(一段要么来0个、要么来1个)。那"1 小时来了 k 个人"就约等于"n 段里有 k 段各来了 1 个人"——这正是二项分布!每段来人的概率 = λ/n(n 段加起来平均 λ 人),所以:
$$P(\text{来了 } k \text{ 个人}) \approx C_n^k \left(\frac{\lambda}{n}\right)^k \left(1-\frac{\lambda}{n}\right)^{n-k}$$
把段切得越来越细(n → ∞),这个式子会稳定下来,趋近于 $\frac{\lambda^k}{k!} e^{-\lambda}$。泊松公式不是天外来客——它就是"二项分布把时间切到无限细"的极限。

🧠 这一步在想什么:三个"吓人"成分各有来历——λ^k 来自"k 段各来一个人"的概率 (λ/n)ᵏ 与组合数分子里的 nᵏ 约掉;分母的 k! 来自组合数"选哪 k 段";e^{−λ} 是 $(1-\lambda/n)^n$ 在 n 无穷大时的老朋友(自然对数的定义式)。没有一个是拍脑袋出来的。

🔍 回头看看:这个"稀有事件在固定时段内发生 k 次"的分布,就是本节主角——泊松分布。适用场景:事件独立、随机、平均发生率稳定(客服电话、交通事故、网页点击、布匹疵点……)。它和二项分布是"亲戚"——二项是"切好的固定 n 次试验",泊松是"把时间/空间切到无限细"。

正式定义(核心):如果随机变量 X 的分布律为
$$P(X = k) = \frac{\lambda^k}{k!} e^{-\lambda}, \quad k = 0, 1, 2, ...$$
其中 $\lambda > 0$,则称 X 服从参数为 λ 的泊松分布,记作 $X \sim P(\lambda)$。

项目 内容
参数 $\lambda$:单位时间/单位面积内事件发生的平均次数
分布律 $P(X=k) = \frac{\lambda^k}{k!} e^{-\lambda}$
期望 $E(X) = \lambda$
方差 $Var(X) = \lambda$(期望和方差相等!)
适用场景 电话呼叫次数、交通事故数、网页点击量、布匹疵点数

期望 = 方差 = λ,这是泊松分布最独特的特征。如果一个数据集的均值和方差差不多大,就适合用泊松分布拟合。

可加性:若 $X \sim P(\lambda_1)$,$Y \sim P(\lambda_2)$ 且 X, Y 独立,则 $X+Y \sim P(\lambda_1 + \lambda_2)$。

✍️ 立刻练一道(泊松分布综合):设某路口在固定时段内通过的汽车数 X 服从泊松分布。已知 P(X=1) = P(X=2)。(1) 求参数 λ;(2) 求 E(X) 和 Var(X);(3) 求 P(X ≥ 1)。(已知 e^{−2} ≈ 0.1353)

点击看答案

(1) X ~ P(λ),P(X=k) = (λ^k / k!) e^{−λ}。已知 P(X=1) = P(X=2):
λ/1! · e^{−λ} = λ²/2! · e^{−λ},两边消去 e^{−λ}:λ = λ²/2,即 2λ = λ²,λ(λ−2) = 0。
λ = 0(舍去,泊松参数必须 > 0)或 λ = 2。所以 λ = 2。

(2) 泊松分布 E(X) = Var(X) = λ,所以 E(X) = 2,Var(X) = 2。

(3) P(X ≥ 1) = 1 − P(X=0) = 1 − e^{−2} ≈ 1 − 0.1353 = 0.8647。

几何分布——首次成功所需次数

先想一个场景:一直投到第一个球进为止,"恰好第 k 次才进"的概率怎么算?

生活比喻:你一直投篮,投到第一次投进就停。问"恰好投了 k 次才进"的概率——这就是几何分布。你关心的是第一次成功之前要失败多少次。

难在哪?——"恰好第 k 次才进"要求两件事同时发生:前 k−1 次全没进,第 k 次才进。这两段必须分开想,再乘起来。

动手试探:前 k−1 次全没进——每次不进的概率是 1−p,k−1 次独立,所以是 $(1-p)^{k-1}$;第 k 次进了——概率是 p。两段一乘:
$$P(X = k) = (1-p)^{k-1} p$$
比如命中率 30%:"恰好第 3 次才进"= 0.7² × 0.3 = 0.147。

🧠 这一步在想什么:公式就一段故事——"前面一直输 $(1-p)^{k-1}$,最后一局赢 p"。没有组合数,因为"第 k 次才进"的路线只有一条(前 k−1 次必须全输),不需要挑。

🔍 回头看看:这个"首次成功所需次数"的分布,就是本节主角——几何分布。它和二项的区别就在"规则":二项是"投够 n 次、数进几个",几何是"投到进为止、数投了几次"。别记公式,记场景。

正式定义(必考):如果随机变量 X 表示"在独立重复试验中首次成功所需的试验次数",每次成功的概率为 p,则
$$P(X = k) = (1-p)^{k-1} p, \quad k = 1, 2, 3, ...$$
称 X 服从参数为 p 的几何分布。

项目 内容
参数 $p$:每次成功的概率
分布律 $P(X=k) = (1-p)^{k-1} p$
期望 $E(X) = 1/p$
方差 $Var(X) = (1-p)/p^2$
适用场景 首次成功所需的试验次数
几何分布的无记忆性——"已经等了那么久,不会让你更接近成功"

几何分布是唯一具有无记忆性的离散型分布。这个性质既有深刻的数学含义,也有日常生活中常见的误解。

① 🏫 生活场景:等公交 vs 投篮

错误直觉:你等了 20 分钟公交还没来,觉得"下一分钟到的概率应该比刚开始等的时候大"——因为车"快了"。但公交是按时程表发的,上一班刚走、下一班要 10 分钟才来——你等了 20 分钟只能说明上一班刚走你就到了,还要再等 10 分钟。已经等的时间不会让下一班"提前"到。

投篮也是:你已经连续投丢 10 次。很多人觉得"该进了吧?"——这就是赌徒谬误。每次投篮的命中率还是 30%,不受前面 10 次影响。但几何分布的无记忆性更强——不仅是每次命中率不变(独立性),而是整个"还要等多少次才进"的概率分布都和新的一样。

等公交和投篮的区别:公交是均匀分布(有上限),投篮是几何分布(无限尾巴)。几何分布的无记忆性说:不管你已经失败了多少次,未来还要等多久这件事,统计规律和从头开始等完全一样。

② 正式陈述

定理(几何分布的无记忆性):设随机变量 X 服从参数为 p 的几何分布(即 X 表示独立重复试验中首次成功所需的试验次数),则对任意非负整数 m, n,有:
$$P(X > m+n \mid X > m) = P(X > n)$$

其中 m 是"已经失败的次数"(已知条件),n 是"还要失败的次数"(你关心的问题)。

用大白话说:已知已经失败了 m 次之后,"还要再失败超过 n 次"的概率,和一个刚上场的人"要失败超过 n 次"的概率完全一样。已经失败的 m 次被"遗忘"了——条件概率里 m 消失了。

等价形式(直接用概率写,方便代公式计算):
$$P(X > m+n \mid X > m) = (1-p)^n$$

符号 含义 通俗理解
$m$ 已经失败的次数 已知条件——"已经投丢了 m 次"
$n$ 关心还要失败多少次 问题——"还要再丢超过 n 次吗?"
$p$ 单次成功的概率 每次投篮命中率
$(1-p)^n$ 接下来 n 次全失败的概率 和新手完全一样——"忘了"之前的 m 次

两种写法说的同一件事:条件概率 = 无条件概率,m 被消掉了。无记忆性比独立性更强——独立性只管"下一次",无记忆性管"整个未来的分布"。

③ 🧠 推导过程

第 1 步:先算 P(X > n)——"前 n 次全失败"的概率

大白话:几何分布 X 表示"第几次才第一次成功"。X > n 意思就是前 n 次全失败。

每次失败概率 = 1-p,n 次独立(每次互不影响),所以:
$$P(X > n) = (1-p)^n$$

第 2 步:算条件概率 P(X > m+n | X > m)

大白话:已知已经失败了 m 次,问"总共要失败超过 m+n 次"(也就是"还要再失败超过 n 次")的概率是多少。

由条件概率公式:
$$P(X > m+n \mid X > m) = \frac{P(X > m+n ;\text{且}; X > m)}{P(X > m)} = \frac{P(X > m+n)}{P(X > m)}$$

分子中 ${X > m+n}$ 已经包含了 ${X > m}$(因为 m+n > m),所以交集就是 ${X > m+n}$。

代入:
$$P(X > m+n \mid X > m) = \frac{(1-p)^{m+n}}{(1-p)^m} = (1-p)^n$$

第 3 步:和 P(X > n) 比较

大白话:条件概率的结果 $(1-p)^n$ 正好等于 $P(X > n)$——也就是"从一开始还要失败超过 n 次"的概率。

$$P(X > m+n \mid X > m) = (1-p)^n = P(X > n)$$

结论:已知已经失败了 m 次之后,接下来"还要再失败超过 n 次"的概率,和一个刚上场的人"要失败超过 n 次"的概率一模一样。已经失败的 m 次被"遗忘"了——条件概率里 m 被消掉了。

🧠 核心观察:推导中分子分母的 $(1-p)^m$ 约掉了——这就是"无记忆"的代数学根源。指数函数 $a^{m+n} / a^m = a^n$ 的"指数相减"性质产生了"记忆消除"。连续型的指数分布也是靠 $e^{-\lambda(s+t)} / e^{-\lambda s} = e^{-\lambda t}$ 实现无记忆的——两者在代数结构上完全一致。

④ 📝 大白话复盘

几何分布的无记忆性可以总结为一句话:"已经等了多久"不影响"还要等多久"的分布。

更精确地说:$P(X > m+n \mid X > m) = P(X > n)$。其中 m 是你已经失败的次数(已知条件),n 是你关心的问题("还要失败超过几次")。等式说——条件概率的结果和 m 无关。

生活记忆法:一个投篮命中率 30% 的人,已经连续投丢 10 次。下一次投进的概率还是 30%(独立性),并且"还要投多少次才进"的整个概率分布,和一个刚上场、命中率 30% 的新人一模一样(无记忆性)。独立性管"下一次",无记忆性管"整个未来"——无记忆性更强。

⑤ ⚠️ 易错边界

陷阱:独立性和无记忆性不是一回事!

无记忆性强于独立。一个分布可以各次试验独立但"剩余等待时间的分布"随已等时间改变——比如等公交(均匀分布):等了 8 分钟之后,剩下的最多还有 2 分钟——未来等待时间的分布确实变了。而几何分布和指数分布的剩余等待时间分布始终不变——这就是为什么它们是"无记忆"的。

唯一性:几何分布是唯一具有无记忆性的离散型分布。如果一个离散型非负随机变量满足 $P(X > m+n \mid X > m) = P(X > n)$ 对所有 m, n 成立,则 X 一定服从几何分布。这是考试中识别几何分布的补充手段。

⑥ 🔗 在整条链中的位置

从哪里来:

到哪里去:

超几何分布——不放回抽样的计数

先想一个场景:抽奖箱"摸一张不放回",和二项分布哪里不一样?

你有一个抽奖箱,里面有100张券,其中3张有奖。你不放回地一次摸出10张——问恰好摸到1张奖券的概率。

难在哪?——如果"摸一张放回去再摸"(二项分布),每次摸中奖的概率都稳定是 3/100。但现在是不放回:你摸走一张后,箱子里剩下的券变少了,中奖比例也跟着变。每次摸的条件都不一样,二项分布的公式直接套不上。

动手试探:那该怎么算?"恰好摸到 1 张奖券"可以拆成两步——从 3 张奖券里选 1 张(有 C_3^1 种选法),再从 97 张无奖券里选 9 张(C_97^9 种),总共从 100 张里选 10 张(C_100^{10} 种)。所以概率 = C_3^1 × C_97^9 / C_100^{10}。

🧠 这一步在想什么:分子分母都在"选"——都在算"从 N 件里选 n 件的组合数"。分子是两个独立的选择拼起来的:从"好的"M 件里选 k 件,从"坏的"N−M 件里选 n−k 件。

🔍 回头看看:这个"分子两个组合数相乘、分母一个总组合数"的结构,就是本节主角——超几何分布。

正式定义(必考):从含有 M 件次品的 N 件产品中,不放回地随机抽取 n 件。设 X 为抽到的次品数,则:
$$P(X = k) = \frac{C_M^k \cdot C_{N-M}^{n-k}}{C_N^n}, \quad k = 0, 1, 2, ..., \min(M, n)$$
称 X 服从参数为 N, M, n 的超几何分布。

期望:$$E(X) = n \cdot \frac{M}{N}$$
方差:$$Var(X) = n \cdot \frac{M}{N} \cdot \frac{N-M}{N} \cdot \frac{N-n}{N-1}$$

超几何分布与二项分布的关系(高频考点):

对比项 超几何分布 二项分布
抽样方式 不放回 放回
每次概率 会变化 不变
适用场景 总体有限、抽样比例高 总体无限、或抽样比例很低

关键结论:当 N 很大(总体很大)、n 相对 N 很小(抽样比例 < 10%)时,超几何分布可以用二项分布 B(n, M/N) 来近似。因为此时"不放回"的影响微乎其微——就像从大海里取一瓢水,取不取走对剩下的几乎没影响。

✍️ 立刻练一道(超几何分布):一批零件共30个,其中8个有瑕疵。质检员不放回地随机抽取6个检查。设X为抽到的瑕疵品个数。求:(1) 恰好抽到2个瑕疵品的概率;(2) 至少抽到1个瑕疵品的概率。

点击看答案

N=30, M=8, n=6。

(1) P(X=2) = C_8^2 × C_22^4 / C_30^6 = 28 × 7315 / 593775 = 204820 / 593775 ≈ 0.3449。

(2) P(X ≥ 1) = 1 − P(X=0) = 1 − C_8^0 × C_22^6 / C_30^6 = 1 − 74613/593775 ≈ 1 − 0.1257 = 0.8743。

✍️ 立刻练一道(超几何→二项近似):一批产品共200件,其中20件不合格。不放回地抽取10件。用二项分布近似计算恰好有1件不合格的概率,并与精确的超几何公式比较。

点击看答案

抽样比例 n/N = 10/200 = 0.05 < 0.1,可以用二项近似。
近似:X ~ B(10, 20/200) = B(10, 0.1),P(X=1) ≈ C_10^1 × 0.1¹ × 0.9⁹ = 10 × 0.1 × 0.3874 ≈ 0.3874。
精确(超几何)直接算很麻烦,但近似值 0.3874 与精确值非常接近(误差通常不到2%)。当抽样比例小于10%时,二项近似足够精确,计算量大幅减少。

二项分布与泊松分布的关系——泊松近似(定理级)

二项分布 $C_n^k p^k (1-p)^{n-k}$ 在 n 很大、p 很小时计算量爆炸——10000 的阶乘谁也受不了。但大自然给了一条捷径:当 n 趋向无穷大、p 趋向 0、但两者的乘积 np 保持为一个常数 λ 时,二项分布会收敛到泊松分布。这就是"稀有事件在大基数中发生的次数"的数学基础。

① 🏫 生活场景:商场的"稀有买家"

一个商场有 10000 个顾客,每个人买东西的概率只有 0.1%(0.001)。你问"恰好有 k 个人买东西的概率是多少"——用二项公式要算 $C_{10000}^k (0.001)^k (0.999)^{10000-k}$,组合数和 0.999 的 10000 次方让人头皮发麻。

但换个思路:每个人买不买是独立的、概率极小、总人数极大。这不就是在"茫茫人海中数稀有事件发生了几次"吗?直觉上,这个数量应该只依赖于"平均有多少人买东西"——也就是 $10000 \times 0.001 = 10$ 人。至于到底是 10000 人每人概率 0.001,还是 20000 人每人概率 0.0005,只要乘积(平均人数)一样,分布应该差不多。

泊松定理把这个直觉变成了严谨的数学。

② 正式陈述

泊松定理:设 $np_n \to \lambda > 0$(当 $n \to \infty$ 时),即 n 很大、p 很小、但 np 稳定在 λ 附近。则对任意固定的 k = 0, 1, 2, ...,有:
$$\lim_{n \to \infty} C_n^k , p_n^k (1-p_n)^{n-k} = \frac{\lambda^k}{k!} e^{-\lambda}$$

近似公式(考试直接套):当 n ≥ 20 且 p ≤ 0.05 时,取 λ = np,有:
$$C_n^k p^k (1-p)^{n-k} \approx \frac{\lambda^k}{k!} e^{-\lambda}, \quad k = 0, 1, 2, ...$$

一句话:二项分布 B(n, p) 的极限(n→∞, p→0, np→λ)就是泊松分布 P(λ)。泊松是二项的"稀有事件极限版"。

③ 🧠 核心推导:从二项到泊松的关键步骤

以下是证明的骨架——不要求你背每行代数,但要看懂每一步在做什么、为什么能过去。

第 1 步:写出二项概率,代换 p = λ/n

大白话:把 p 写成 λ/n,这样当 n → ∞ 时 p → 0,np = λ 保持不变。

$$P(X = k) = C_n^k , p^k (1-p)^{n-k}$$

令 $p = \lambda / n$(所以 $np = \lambda$),代入:
$$P(X = k) = \frac{n!}{k!(n-k)!} \cdot \left(\frac{\lambda}{n}\right)^k \cdot \left(1 - \frac{\lambda}{n}\right)^{n-k}$$

第 2 步:把组合数"撑开"成 n 个因子的乘积

大白话:$C_n^k$ 写开就是 $\frac{n(n-1)(n-2)...(n-k+1)}{k!}$,和后面的 $(\lambda/n)^k$ 配合——n 的因子会和分母的 n^k 对上。

$$\frac{n!}{k!(n-k)!} \cdot \frac{\lambda^k}{n^k} = \frac{\lambda^k}{k!} \cdot \frac{n(n-1)(n-2)\cdots(n-k+1)}{n^k}$$

$$= \frac{\lambda^k}{k!} \cdot \frac{n}{n} \cdot \frac{n-1}{n} \cdot \frac{n-2}{n} \cdots \frac{n-k+1}{n}$$

$$= \frac{\lambda^k}{k!} \cdot 1 \cdot \left(1 - \frac{1}{n}\right) \cdot \left(1 - \frac{2}{n}\right) \cdots \left(1 - \frac{k-1}{n}\right)$$

🧠 这一步在想什么:把组合数拆成 k 个因子,每个都是 $\frac{n - 某数}{n}$ 的形式。当 n 非常大时,每个因子都接近 1——这为下一步取极限铺路。

第 3 步:处理 $(1 - \lambda/n)^{n-k}$——这坨是关键

大白话:$(1 - \lambda/n)^n$ 在 n → ∞ 时的极限是 $e^{-\lambda}$(这是自然对数 e 的定义式之一),剩下的几次方无关紧要。

把指数拆开:
$$\left(1 - \frac{\lambda}{n}\right)^{n-k} = \left(1 - \frac{\lambda}{n}\right)^n \cdot \left(1 - \frac{\lambda}{n}\right)^{-k}$$

当 n → ∞ 时:

🧠 这一步在想什么:最关键的转化——自然对数 e 的定义就是 $\lim_{n \to \infty} (1 + x/n)^n = e^x$。这里 x = -λ,所以极限是 e^{-λ}。这是整条推导中"把离散变连续"的桥梁——自然对数 e 登场了。

第 4 步:合体——取极限 n → ∞

大白话:把第 2 步的前半截和第 3 步的后半截乘起来,n → ∞ 时各自收敛。

$$P(X = k) = \frac{\lambda^k}{k!} \cdot \left(1 - \frac{1}{n}\right)\left(1 - \frac{2}{n}\right)\cdots\left(1 - \frac{k-1}{n}\right) \cdot \left(1 - \frac{\lambda}{n}\right)^n \cdot \left(1 - \frac{\lambda}{n}\right)^{-k}$$

取 n → ∞:

全部乘起来:
$$\lim_{n \to \infty} P(X = k) = \frac{\lambda^k}{k!} \cdot 1 \cdot e^{-\lambda} \cdot 1 = \frac{\lambda^k}{k!} e^{-\lambda}$$

🧠 这一步在想什么:前半截(组合数变换)趋于 1,后半截(指数上那坨)趋于 e^{-λ},乘起来就是泊松分布。推导全程只用了两个"老的"数学极限——组合数展开和 e 的定义——不需要新魔术。

第 5 步:泊松分布的期望和方差都是 λ

大白话:既然二项分布的极限是泊松,那二项的期望 np = λ 和方差 np(1-p) → λ(因为 p → 0 时 1-p → 1)的极限自然也是 λ。

从二项取极限:
$$E(X) = np = \lambda \quad \text{(始终等于 λ,不随 n 变化)}$$
$$Var(X) = np(1-p) = \lambda\left(1 - \frac{\lambda}{n}\right) \to \lambda \quad (n \to \infty)$$

怎么算出来的?从泊松分布律出发做一次级数求和即可——具体求和技巧第 4 章讲期望时教,这里先记住结论:E(X) = λ。

🧠 这一步在想什么:泊松分布的期望 = 方差 = λ 是它的"身份证"——看到期望方差相等的分布,第一反应就应该是泊松。而且 λ 既是期望也是方差,做题时可以互相验证。

④ 📝 推导复盘——大白话串一遍

整条推导只有三招:

  1. 换元:把 p 写成 λ/n,让 n → ∞、p → 0 同时发生,np 始终 = λ 不变。
  2. 拆解组合数:$C_n^k / n^k$ 展开成 k 个 $(1 - 某数/n)$ 的乘积 → 取极限 → 全变成 1。
  3. e 的定义:$(1 - \lambda/n)^n \to e^{-\lambda}$——这是自然对数最经典的定义式,也是"离散变连续"的关键桥梁。

三招一合:$C_n^k p^k (1-p)^{n-k} \to \frac{\lambda^k}{k!} e^{-\lambda}$。

用大白话说:当试验次数多到离谱、成功概率小到可怜、但平均成功次数 λ = np 还正常时,二项分布就"退化"成了泊松分布——不用算 n 和 p 各是多少,只需要知道 λ 一个数就够了。

⑤ ⚠️ 易错边界

坑一:近似条件不是绝对的(n ≥ 20, p ≤ 0.05 只是经验法则)
n 不够大或 p 不够小时,泊松近似误差会变大。比如 n = 10, p = 0.3(p 不小),或者 n = 5, p = 0.01(n 不够大),都不适合用泊松近似。考试中如果题目没有明确说"用泊松近似",先检查条件。

坑二:λ = np 不是 n/p 或 p/n
λ 是"平均成功次数"= 试验次数 × 每次成功概率。比如 1000 人每人发病概率 0.005 → λ = 5。最容易算错的是把 λ 写成 n/p = 200000——完全不是一个量级。

坑三:泊松近似是"近似",不是"等于"
$C_n^k p^k (1-p)^{n-k} \approx \frac{\lambda^k}{k!} e^{-\lambda}$,不是恒等式。考试中写"≈"而不是"="。但在 n ≥ 100 且 p ≤ 0.01 时,近似误差通常不到 1%。

坑四:泊松的期望和方差都是 λ——但这是结论不是定义
期望 = 方差 = λ 是从推导中得出来的性质,不是泊松分布的"定义"。如果题目说"X 的期望 = 方差 = 3",不能直接断定 X ~ P(3)——需要额外确认 X 的分布律确实是 $\frac{3^k}{k!} e^{-3}$ 的形式。

⑥ 🔗 在整条链中的位置

从哪里来:

到哪里去:

✍️ 立刻练一道(泊松近似二项):某保险公司有 10000 个投保人,每人一年内发生事故的概率为 0.0005,且各人相互独立。设 X 为一年内发生事故的人数。用泊松分布近似计算:(1) 恰好有 4 人发生事故的概率;(2) 至少有 2 人发生事故的概率。(已知 e^{−5} ≈ 0.0067)

点击看答案

n = 10000(很大 ≥ 20),p = 0.0005(很小 ≤ 0.05)→ 可用泊松近似。λ = np = 10000 × 0.0005 = 5,X ~ P(5)。

(1) P(X = 4) ≈ (5^4 / 4!) × e^{−5} = (625/24) × 0.0067 ≈ 26.0417 × 0.0067 ≈ 0.1745。

(2) P(X ≥ 2) ≈ 1 − P(X=0) − P(X=1) = 1 − 0.0067 − 5 × 0.0067 = 1 − 0.0067 − 0.0335 = 0.9598。

1.7 常见连续型分布

🧭 中场小结:到目前为止,你手上已经有了5个离散型分布的公式——0-1、二项、泊松、几何、超几何。它们有个共同点:都是用来算**"有几个"**的——成功几次、来几个电话、抽到几个次品。

接下来要讲的3个连续型分布用来算**"有多长/多重/多高"——等多长时间、身高多少厘米、误差多大。它们的"概率"不是某个点的概率(单点永远是0),而是一段区间里的面积**。准备好了吗?

说完了离散型,接下来看连续型分布。连续型分布用概率密度 f(x) 来描述,概率通过积分(面积)来计算。

均匀分布 U(a, b)——区间内等可能

先想一个场景:每个时刻"一样可能",密度曲线该长什么样?

生活比喻:你在公交车站等车,车每10分钟来一班。你不知道上一班刚走还是下一班马上到——在0到10分钟之间,每个时刻"等到车"的可能性完全一样。

难在哪?——X 是连续型,单点概率永远是 0,没法"给每个点列一个概率"。但"每个时刻一样可能"这句话,数学上其实是在说:密度在 (0, 10) 上是一根水平的直线。

动手试探:那这根水平线有多高?用归一性来定——密度曲线下的总面积必须等于 1。这根线从 0 到 10 宽 10、高是常数 h,面积 = 10 × h = 1,所以 h = 1/10。推广到一般区间 (a, b):宽 b−a,高必须是 1/(b−a)。密度公式不是背的——是"面积必须等于1"推出来的。

🧠 这一步在想什么:"等可能"翻译成数学就是"密度是常数";常数多大,由"总面积=1"决定。所以均匀分布的密度必然长成 $\frac{1}{b-a}$。

🔍 回头看看:这个"区间内密度处处相等"的分布,就是本节主角——均匀分布。它的好处是概率特别直观:$P(c<X<d) = (d-c)/(b-a)$,一个"长度比"就够。

正式定义(高频):如果随机变量 X 的概率密度为
$$f(x) = \begin{cases} \frac{1}{b-a}, & a < x < b \ 0, & \text{其他} \end{cases}$$
则称 X 在区间 (a, b) 上服从均匀分布,记作 $X \sim U(a, b)$。

项目 内容
参数 $a, b$:区间的左右端点
密度函数 $f(x) = \frac{1}{b-a}$(区间内是常数!)
分布函数 $F(x) = \frac{x-a}{b-a}, \quad a < x < b$
期望 $E(X) = \frac{a+b}{2}$(中点)
方差 $Var(X) = \frac{(b-a)^2}{12}$
适用场景 四舍五入误差、等车时间、在区间内"等可能"的随机量

分布函数完整形式:$F(x) = \begin{cases} 0, & x \leq a \ \frac{x-a}{b-a}, & a < x < b \ 1, & x \geq b \end{cases}$

几何概率解释:$P(c < X < d) = \frac{d-c}{b-a}$(子区间长度 ÷ 总长度)。均匀分布中,概率 = 长度比!

均匀分布的期望和方差——为什么恰好是中点和"宽度平方除以12"?
① 🏫 生活场景:等公交——平均等多久?波动多大?

公交车每 10 分钟来一班,你在一个完全随机的时间点到站。等车时间 X 在 [0, 10] 上均匀分布。

除以 12 这个数字是怎么来的?下面推导会告诉你——不是魔法,是积分出来的。

② 正式陈述

设 $X \sim U(a, b)$,即密度 $f(x) = \frac{1}{b-a}, ; a < x < b$,则:
$$E(X) = \frac{a+b}{2}, \quad Var(X) = \frac{(b-a)^2}{12}$$

项目 公式 通俗理解
期望 $\frac{a+b}{2}$ 区间中点——"最平均的那个数"
方差 $\frac{(b-a)^2}{12}$ 区间宽度的平方除以 12——区间越宽,波动越大
③ 📌 完整推导——第 4 章再补

先记住结论:E(X) = (a+b)/2(区间中点),Var(X) = (b-a)²/12(宽度平方 ÷ 12)。为什么恰好是这两个数?推导思路:

📌 这套计算(连续型随机变量的期望、方差公式,以及 E(X²) 的积分求法)都是第 4 章的核心内容。第 4 章学完再回来推导一次:期望积分出中点,方差积分出宽度平方 ÷ 12。现在先用结论。

④ 📝 直觉验证——结论对不对

💡 一句话记:均匀分布的期望是中点、方差是宽度²/12。12 这个数不是魔法——是第 4 章积分推导时自然冒出来的。

⑤ ⚠️ 易错边界

坑一:区间是 (a, b) 还是 [a, b]?
均匀分布的密度定义通常写开区间 (a, b),但因为连续型单点概率为 0,写成开区间或闭区间没有实质区别。分布函数在端点的定义要注意:F(x) = 0 当 x ≤ a,F(x) = 1 当 x ≥ b。

坑二:方差是 (b-a)²/12,不是 (b-a)/12 或 (b-a)²/6
系数是 1/12,容易记成 1/6 或漏掉平方。验证记忆:U(0, 1) 的方差 = 1/12 ≈ 0.083,如果算出来是 1/6 ≈ 0.167 就错了。

坑三:均匀分布"等可能"指的是区间内每个子区间概率相等,不是每个点概率相等
连续型单点概率永远是 0。"等可能"的意思是:落在 [c, d] 里的概率只和区间长度 d−c 成正比,和区间位置无关。公式:$P(c < X < d) = (d-c)/(b-a)$。

坑四:E(X) = (a+b)/2 是区间中点,和"均匀"直接相关
如果分布不是均匀的(密度不是常数),期望不一定在中点。不要看到 [a, b] 区间就自动写上 (a+b)/2——除非明确说是均匀分布。

⑥ 🔗 在整条链中的位置

从哪里来:

到哪里去:

✍️ 立刻练一道(均匀分布综合):设 X ~ U(1, 5)。(1) 写出概率密度 f(x) 和分布函数 F(x);(2) 求 P(2 < X < 4);(3) 求 P(X > 3)。

点击看答案

(1) a=1, b=5。密度:f(x) = 1/(5−1) = 1/4(1 < x < 5),其余 0。分布函数:
$$F(x) = \begin{cases} 0, & x < 1 \ (x-1)/4, & 1 \leq x < 5 \ 1, & x \geq 5 \end{cases}$$

(2) P(2 < X < 4) = F(4) − F(2) = 3/4 − 1/4 = 1/2;或用长度比:P = (4−2)/(5−1) = 2/4 = 1/2。
(3) P(X > 3) = 1 − F(3) = 1 − (3−1)/4 = 1 − 2/4 = 1/2。

指数分布 Exp(λ)——寿命与等待时间

先想一个场景:灯泡不记得自己亮了多久,密度曲线该长什么样?

生活比喻:一个灯泡的寿命。它今天亮不亮,不影响明天还能亮多久——灯泡不记得自己已经亮了多久! 一台设备用了1000小时,它"还能再用多久"的分布,和一台新设备"能用多久"的分布完全一样。

难在哪?——"无记忆"是非常苛刻的要求:剩余寿命的分布不能随"已经用掉的时间"变化。数学上能同时满足"连续、非负、无记忆"的形状,只有唯一一个——这直接把密度曲线"逼"成了一种固定形状。

动手试探:回想几何分布的无记忆性靠的是"指数相减":$(1-p)^{m+n}/(1-p)^m = (1-p)^n$,已经输掉的 m 次被约掉。连续版要一模一样,就要求"活过 s 小时的概率"是一个指数函数 $a^s$(因为 $a^{s+t}/a^s = a^t$,s 自动消失)。把失效率记为 λ,就有 $P(X > s) = e^{-\lambda s}$;密度是"尾巴概率"的导数:$f(x) = -\frac{d}{dx}e^{-\lambda x} = \lambda e^{-\lambda x}$。指数密度不是凭空出现的——它是"无记忆"唯一逼出来的形状。

🧠 这一步在想什么:整个公式只有一个参数 λ(失效率)——λ 越大越容易坏、平均寿命 1/λ 越短。密度从 x=0 的 λ 一路指数衰减到 0:越往后越可能已经坏掉,但每一刻的失效率都不变,这正是无记忆的几何外观。

🔍 回头看看:这个"寿命/等待时间"的分布,就是本节主角——指数分布。它是几何分布的连续版:几何管"投几次才进",指数管"等多长时间才坏",靠的都是同一个指数函数把"过去"消掉。

正式定义(高频):如果随机变量 X 的概率密度为
$$f(x) = \begin{cases} \lambda e^{-\lambda x}, & x > 0 \ 0, & x \leq 0 \end{cases}$$
其中 λ > 0,则称 X 服从参数为 λ 的指数分布,记作 $X \sim Exp(\lambda)$。

项目 内容
参数 $\lambda$:失效率(越大越容易坏,寿命越短)
密度函数 $f(x) = \lambda e^{-\lambda x}, , x > 0$
分布函数 $F(x) = 1 - e^{-\lambda x}, , x > 0$
期望 $E(X) = 1/\lambda$(平均寿命)
方差 $Var(X) = 1/\lambda^2$
适用场景 电子元件寿命、等待时间、服务时间

分布函数推导:$F(x) = \int_0^x \lambda e^{-\lambda t},dt = 1 - e^{-\lambda x}$

注意 $P(X > x) = e^{-\lambda x}$——指数分布的"尾巴"概率非常简洁,经常用到。

指数分布的无记忆性——连续版本的"忘记过去"

指数分布是唯一具有无记忆性的连续型分布——和几何分布(离散型中唯一无记忆)形成完美的对应。两者的代数结构完全一样,只是"次数"换成了"时间"。

① 🏫 生活场景:灯泡不记得自己亮了多久

一个灯泡已经亮了 1000 小时。你问:"它还能再亮 500 小时的概率是多少?"

如果你的直觉是"已经亮了 1000 小时,快坏了,再亮 500 小时不太可能"——那是你假设灯泡会"老化"。但指数分布假设灯泡不老化——它的"失效率"始终不变。一个亮了 1000 小时的灯泡,和全新的灯泡,"还能再亮 500 小时以上"的概率完全一样。

这听起来反直觉——现实中的灯泡会老化。但有些电子元件(在稳定工作期内)确实接近无记忆;有些自然现象(如放射性衰变)也遵循这个规律。

几何 = "投多少次才进"不记得之前投丢过几次;指数 = "等多长时间才坏"不记得已经工作多久。一个管次数,一个管时间,数学上完全对应。

② 正式陈述

定理(指数分布的无记忆性):设随机变量 X 服从参数为 λ 的指数分布(即 X ~ Exp(λ)),则对任意正实数 s, t > 0,有:
$$P(X > s+t \mid X > s) = P(X > t)$$

其中 s 是"已经工作的时间"(已知条件),t 是"还要再工作的时间"(你关心的问题)。

用大白话说:已知元件已经工作了 s 小时还没坏,"还能再工作超过 t 小时"的概率,和一个全新元件"能工作超过 t 小时"的概率完全一样。元件不记得自己已经工作过 s 小时——过去的 s 小时被"忘"了。

等价形式(用指数分布的尾巴公式 $P(X > t) = e^{-\lambda t}$ 代入):
$$P(X > s+t \mid X > s) = e^{-\lambda t}$$

符号 含义 通俗理解
$s$ 已经工作的时间 已知条件——"已经亮了 s 小时还没坏"
$t$ 关心还要工作多久 问题——"还能再亮 t 小时吗?"
$\lambda$ 失效率 越大越容易坏,平均寿命 $1/\lambda$
$e^{-\lambda t}$ 全新元件活过 t 的概率 条件概率的结果——和新的一样

两种写法说的同一件事:条件概率 = 无条件概率,s 被消掉了。指数分布是唯一具有无记忆性的连续型分布(正如几何分布是唯一具有无记忆性的离散型分布)。

③ 🧠 推导过程

第 1 步:先算 P(X > t)——"寿命超过 t"的概率

大白话:指数分布最方便的就是"尾巴概率"——比 t 活得长的概率,公式特别简洁。

X ~ Exp(λ),密度 $f(x) = \lambda e^{-\lambda x}, x > 0$,分布函数 $F(x) = 1 - e^{-\lambda x}$。所以:
$$P(X > t) = 1 - F(t) = e^{-\lambda t}$$

这就是指数分布"尾巴"的标准公式——简洁到惊人。

第 2 步:算条件概率 P(X > s+t | X > s)

大白话:已知活了 s 小时(还没坏),问"再活超过 t 小时"的概率。

由条件概率公式:
$$P(X > s+t \mid X > s) = \frac{P(X > s+t ;\text{且}; X > s)}{P(X > s)} = \frac{P(X > s+t)}{P(X > s)}$$

分子中 ${X > s+t}$ 自动包含 ${X > s}$(因为 s+t > s),所以交集就是 ${X > s+t}$。

代入尾巴公式:
$$P(X > s+t \mid X > s) = \frac{e^{-\lambda(s+t)}}{e^{-\lambda s}} = e^{-\lambda t}$$

第 3 步:和 P(X > t) 比较

大白话:$e^{-\lambda t}$ 正好等于 $P(X > t)$——也就是"全新元件寿命超过 t"的概率。

$$P(X > s+t \mid X > s) = e^{-\lambda t} = P(X > t)$$

结论:已经活了 s 小时之后,还能再活超过 t 小时的概率,等于一个全新的元件能活超过 t 小时的概率。s 消失了——过去的 s 小时被"忘"得一干二净。

🧠 核心观察:$e^{-\lambda(s+t)} / e^{-\lambda s} = e^{-\lambda t}$,指数函数的"幂相减 = 指数相减"性质产生了无记忆效应。这和几何分布 $(1-p)^{m+n} / (1-p)^m = (1-p)^n$ 的代数结构完全一样——离散对应 $(1-p)$,连续对应 $e^{-\lambda}$。它们都是"乘法变加法"的指数函数的特例。

④ 📝 大白话复盘 + 几何分布 vs 指数分布对应表

指数分布的无记忆性:元件不记得自己已经工作了多久——剩余寿命的分布始终和新的一样。

对比维度 几何分布(离散) 指数分布(连续)
随机变量 首次成功所需次数 寿命/等待时间
参数 p(单次成功概率) λ(失效率)
核心概率 $P(X > n) = (1-p)^n$ $P(X > t) = e^{-\lambda t}$
无记忆公式 $P(X > m+n \mid X > m) = P(X > n)$ $P(X > s+t \mid X > s) = P(X > t)$
消掉什么 $(1-p)^m$ 被约掉 $e^{-\lambda s}$ 被约掉
"失忆"机制 指数函数 $a^{m+n}/a^m = a^n$ 指数函数 $e^{-\lambda(s+t)}/e^{-\lambda s} = e^{-\lambda t}$

这张表记下来,几何和指数的无记忆性就永远不会搞混——离散是 $(1-p)^n$,连续是 $e^{-\lambda t}$,代数结构一模一样。

⑤ ⚠️ 易错边界

坑一:无记忆性 ≠ "永远不会坏"
无记忆性说的是剩余寿命的分布不变,不是说元件真的永生。λ 越大(失效率越高),不管是新元件还是旧元件,剩余寿命都短——只是"旧"不影响剩余寿命而已。

坑二:现实中指数分布只是近似
真正的灯泡、轴承会老化——用久了坏的概率增加,不是无记忆的。指数分布适用于"稳定工作期"或某些无老化现象(如放射性衰变)。考试不考这个现实差异,但要理解这是数学模型,不是绝对真理。

坑三:条件概率方向别反
$P(X > s+t \mid X > s)$ 和 $P(X > s \mid X > s+t)$ 完全不同!前者是"已知活了 s,问还能活超过 t",后者是"已知活了 s+t,问是否活过了 s"——后者当然是 1(s+t > s 必然成立)。无记忆性是前者,别把条件和结论搞反。

坑四:指数分布是唯一无记忆的连续分布
和几何分布一样,指数分布也具有唯一性——如果连续型非负随机变量满足无记忆性,则它一定是指数分布。考试中如果看到"无记忆性"三个字但没有说是什么分布,离散型选几何、连续型选指数。

⑥ 🔗 在整条链中的位置

从哪里来:

到哪里去:

✍️ 立刻练一道(指数分布综合):设某电子元件的寿命 X(单位:千小时)服从参数 λ = 2 的指数分布。(1) 写出密度函数 f(x) 和分布函数 F(x);(2) 求寿命超过 500 小时的概率;(3) 已知该元件已经工作了 500 小时,求还能再工作 500 小时以上的概率(无记忆性验证)。(已知 e^{−1} ≈ 0.3679)

点击看答案

(1) 密度:f(x) = 2e^{−2x}(x > 0),x ≤ 0 时为 0。分布函数:F(x) = 1 − e^{−2x}(x > 0),x ≤ 0 时为 0。

(2) 注意单位:500 小时 = 0.5 千小时。P(X > 0.5) = e^{−2×0.5} = e^{−1} ≈ 0.3679。

(3) P(X > 1.0 | X > 0.5) = P(X > 1.0)/P(X > 0.5) = e^{−2}/e^{−1} = e^{−1} ≈ 0.3679。这和 P(X > 0.5) 相等——验证了无记忆性:元件"不记得"自己已经工作过 500 小时。

正态分布 N(μ, σ²)——最重要的分布

先想一个场景:身高大多在平均值附近、越极端越少,密度曲线该长什么样?

生活比喻:人的身高——大多数人身高在平均值附近(比如男生平均175cm),特别高(2米以上)和特别矮(1米5以下)的人都很少。画出来就像一个钟形——中间高、两边低、左右对称。这几乎是自然界最常见的分布。

难在哪?——"钟形"只是大概的样子,数学上得给出精确公式。中间高、两边低、左右对称——什么样的函数天然长这样?最简单的候选是 $e^{-x^2}$:x 离 0 越远,x² 越大,$e^{-x^2}$ 越小——天然就是"中间最高、两边衰减、左右对称"。

动手试探:给这个形状加两个"旋钮"——①把中心从 0 挪到 μ:$e^{-\frac{(x-\mu)^2}{2\sigma^2}}$;②控制胖瘦:σ 越小越瘦高、σ 越大越矮胖。最后还有一条铁律"总面积必须=1",归一性会逼出前面那个系数 $\frac{1}{\sqrt{2\pi},\sigma}$。于是:
$$f(x) = \frac{1}{\sqrt{2\pi},\sigma} e^{-\frac{(x-\mu)^2}{2\sigma^2}}$$

🧠 这一步在想什么:整个公式的灵魂是指数上那个 $(x-\mu)^2$——它同时造成三个性质:中间最高(x=μ 时指数最大)、左右对称(± 都一样)、越远越接近 0。μ 定中心、σ 定胖瘦、系数管总面积。归一性里的 $\sqrt{2\pi}$ 是积分算出来的常数,不用纠结它从哪来。

🔍 回头看看:这个"钟形"的分布,就是本节主角——正态分布。它是概率论最重要的分布:身高、血压、成绩、测量误差、零件尺寸……几乎所有"大量独立小因素叠加"的量都会近似它。这也是为什么下面要专门学它的"标准化"。

正式定义(核心中的核心):如果随机变量 X 的概率密度为
$$f(x) = \frac{1}{\sqrt{2\pi},\sigma} e^{-\frac{(x-\mu)^2}{2\sigma^2}}, \quad -\infty < x < +\infty$$
其中 μ 为实数,σ > 0,则称 X 服从参数为 μ, σ² 的正态分布(也叫高斯分布),记作 $X \sim N(\mu, \sigma^2)$。

项目 内容
参数 $\mu$:均值(分布的中心位置);$\sigma^2$:方差(分布的宽度)
密度函数 $f(x) = \frac{1}{\sqrt{2\pi},\sigma} e^{-\frac{(x-\mu)^2}{2\sigma^2}}$
分布函数 $F(x) = \frac{1}{\sqrt{2\pi},\sigma} \int_{-\infty}^x e^{-\frac{(t-\mu)^2}{2\sigma^2}},dt$(没有初等表达式!)
期望 $E(X) = \mu$
方差 $Var(X) = \sigma^2$
适用场景 几乎所有自然和社会现象:身高、体重、成绩、误差、质量……
正态密度曲线的形状

正态密度曲线的五个特征(高频):

  1. 对称性:关于 x = μ 对称(左边和右边完全一样)
  2. 单峰性:在 x = μ 处取到最大值 $\frac{1}{\sqrt{2\pi},\sigma}$
  3. 拐点:在 x = μ ± σ 处曲线改变弯曲方向
  4. 渐近线:x → ±∞ 时 f(x) → 0(尾巴拖得很远但一直在降)
  5. 面积:曲线下的总面积 = 1

正态分布的密度函数没有初等积分表达式!也就是说,F(x) 不能写成普通的加减乘除形式,必须用数值表查。这就是为什么我们需要"标准化"。

标准化——把任意正态变成标准正态(定理级)

正态分布的分布函数 $\int_{-\infty}^x \frac{1}{\sqrt{2\pi}\sigma} e^{-\frac{(t-\mu)^2}{2\sigma^2}},dt$ 没有初等表达式——没法写成我们学过的加减乘除、指数对数的简单组合。但标准正态 N(0, 1) 有现成的数值表可以查。标准化做的事情就是把任意正态"翻译"成标准正态——让查表成为可能。

① 🏫 生活场景:不同班级的成绩怎么公平比较?

A 班语文考试,全班平均分 70,分数差距(标准差)10 分。B 班数学考试,全班平均分 80,分数差距 20 分。

小明在 A 班考了 85 分,小红在 B 班考了 90 分。乍一看小红高——90 > 85。但这不公平:两个班的"尺子"不一样!A 班整体分数低(均值 70),B 班整体分数高(均值 80),而且 A 班分数更集中(标准差 10),B 班更散(标准差 20)。

怎么公平比较?统一用一把"标准尺子"——不直接比原始分,而是比"你比你们班平均分高了几个标准差":

结论:小明在 A 班的相对排名远高于小红在 B 班的排名——虽然小红原始分更高。

这个"离平均差几个标准差"的操作,就是标准化。正态分布的标准化完全一样——把任何一个"班级"(均值 μ、标准差 σ)的成绩,换算成"统一标准尺"(均值 0、标准差 1)上的数字。

② 正式陈述

定理(正态分布的标准化):若 $X \sim N(\mu, \sigma^2)$(即 X 服从均值 μ、方差 σ² 的正态分布),令
$$Z = \frac{X - \mu}{\sigma}$$
则 $Z \sim N(0, 1)$,即 Z 服从标准正态分布。

标准正态分布涉及两个符号,不搞懂后面寸步难行:

🚗 怎么记:小 φ 是"速度"(密度 = 变化率),大 Φ 是"里程"(分布函数 = 累积量)。查表查的是大 Φ——也就是"从最左边一直积到 z,总共有多少概率"。

标准正态表怎么查? 表里列出了不同 z 值对应的 Φ(z) 数值。比如:

 z    | 0.00   0.01   0.02   ...  0.09
------+--------------------------------
 0.0  | 0.5000 0.5040 0.5080 ... 0.5359
 0.1  | 0.5398 0.5438 0.5478 ... 0.5753
 ...
 1.0  | 0.8413 0.8438 0.8461 ... 0.8643
 1.9  | 0.9713 0.9719 0.9726 ... 0.9767
 2.0  | 0.9772 0.9778 0.9783 ... 0.9817

比如查 Φ(1.0):左边竖列找"1.0"那一行,顶上横排找"0.00"那一列,交叉位置 0.8413 就是答案。查 Φ(1.96):行找"1.9",列找"0.06",交叉处 0.9750。考试时会给一小段表,够你用。

特殊值速记(常用考点):

③ 🧠 完整推导:为什么 $Z = \frac{X-\mu}{\sigma}$ 恰好变成标准正态?

第 1 步:平移——减去均值 μ,把中心移到 0

定义 Y = X − μ。我们想知道 Y 的分布。

X 的密度是:$f_X(x) = \frac{1}{\sqrt{2\pi},\sigma} e^{-\frac{(x-\mu)^2}{2\sigma^2}}$

用分布函数法求 Y 的密度:
$$F_Y(y) = P(Y \leq y) = P(X - \mu \leq y) = P(X \leq y + \mu) = F_X(y + \mu)$$

对 y 求导(链式法则):
$$f_Y(y) = f_X(y + \mu) \cdot 1 = \frac{1}{\sqrt{2\pi},\sigma} e^{-\frac{(y + \mu - \mu)^2}{2\sigma^2}} = \frac{1}{\sqrt{2\pi},\sigma} e^{-\frac{y^2}{2\sigma^2}}$$

🧠 这一步在想什么:把整条曲线往左挪 μ 的距离。公式里原本的 $(x-\mu)^2$ 变成了 $(y+\mu-\mu)^2 = y^2$——中心从 μ 移到了 0。但注意:宽度没变,指数上分母还是 $2\sigma^2$,前面的系数还是 $\frac{1}{\sqrt{2\pi}\sigma}$。现在均值是 0 了,但方差还是 σ²——"钟"挪到原点,胖瘦没变。

第 2 步:缩放——除以标准差 σ,把宽度缩到 1

定义 $Z = \frac{Y}{\sigma} = \frac{X-\mu}{\sigma}$。继续用分布函数法。

$$F_Z(z) = P(Z \leq z) = P\left(\frac{Y}{\sigma} \leq z\right) = P(Y \leq \sigma z) = F_Y(\sigma z)$$

对 z 求导:
$$f_Z(z) = f_Y(\sigma z) \cdot \sigma = \frac{1}{\sqrt{2\pi},\sigma} e^{-\frac{(\sigma z)^2}{2\sigma^2}} \cdot \sigma = \frac{1}{\sqrt{2\pi}} e^{-\frac{z^2}{2}} = \phi(z)$$

🧠 这一步在想什么:除以 σ 是把曲线横向压缩——"胖"的钟变瘦。来追踪三个关键位置的 σ 都去了哪里:

  • 指数上的 $\sigma^2$ 来自密度公式,$(\sigma z)^2$ 除以 $2\sigma^2$,$\sigma^2$ 约掉——指数干干净净变成 $-\frac{z^2}{2}$
  • 系数中的 $\frac{1}{\sigma}$(密度公式自带)和链式法则求导乘出来的 $\sigma$ 正好消掉——前面剩 $\frac{1}{\sqrt{2\pi}}$

最终得到的就是 $\frac{1}{\sqrt{2\pi}} e^{-z^2/2}$——标准正态密度!

第 3 步:双重确认——用期望和方差验证

确保 Z 的均值真的是 0,方差真的是 1。

$$E(Z) = E\left(\frac{X - \mu}{\sigma}\right) = \frac{1}{\sigma}E(X - \mu) = \frac{1}{\sigma}(E(X) - \mu) = \frac{1}{\sigma}(\mu - \mu) = 0$$

$$Var(Z) = Var\left(\frac{X - \mu}{\sigma}\right) = \frac{1}{\sigma^2}Var(X - \mu) = \frac{1}{\sigma^2}Var(X) = \frac{1}{\sigma^2} \cdot \sigma^2 = 1$$

🧠 这一步在想什么:期望和方差的双重确认——均值确实是 0,方差确实是 1。这和密度函数的结果互相印证:密度是 $\frac{1}{\sqrt{2\pi}} e^{-z^2/2}$ 的正是 N(0, 1)。注意方差运算中:常数(μ)加减不改变方差,但除以 σ 会让方差除以 σ²——刚好消成 1。

综合结论:$f_Z(z) = \phi(z)$ 且 $E(Z) = 0, Var(Z) = 1$——Z 完全符合标准正态分布 N(0, 1) 的定义。得证。

④ 📝 推导复盘——用大白话重新讲一遍

标准化就是把任意一个正态分布"调理"成标准尺寸,分两步操作:

第一步"搬家":减去均值 μ。就像把一个钟形曲线从"位置 μ"平移到"位置 0"——钟的形状完全不变,中心从 μ 挪到了 0。密度公式里原本的 $(x-\mu)^2$ 变成了 $y^2$。

第二步"缩水":除以标准差 σ。就像把钟形曲线在横轴上挤一下——"胖"的变瘦,"瘦"的更瘦,统统统一到宽度 1。密度公式里的 σ 们自己跟自己干了一架:指数上的 σ² 被约掉,系数里的 σ 和链式法则乘出来的 σ 互相抵消——最终剩下的就是干干净净的 $\frac{1}{\sqrt{2\pi}} e^{-z^2/2}$。

两步合起来,用大白话说:"不管什么正态分布,先把它挪到零点的位置,再把它挤到单位宽度——这样全世界所有的正态就都变成一个标准形状了,一张表就能查所有。"

标准化过后,任意正态分布的概率计算变成三步:

  1. 写出 $Z = \frac{X-\mu}{\sigma}$(标准化变换)
  2. 把原始不等式转化为 Z 的不等式(比如 $P(X < a) = P(Z < \frac{a-\mu}{\sigma})$)
  3. 查标准正态表(或用 Φ 符号表示结果)
⑤ ⚠️ 易错边界——这些坑踩了会丢分

坑一:标准化用 σ(标准差),不是 σ²(方差)!
题目如果给的是"方差 σ² = 4",那 σ = 2。标准化时 $Z = \frac{X-\mu}{2}$,不是除 4。这是最高频的失误——做题前先用笔圈出"方差 = σ²",算出 σ 再代入公式。

坑二:标准化改变数值,但不改变分布的形状类型
标准化的结果是另一个正态分布——形状依然是钟形。它只是换了横轴上的刻度(平移+缩放),钟还是那个钟,不是变成了别的分布。

坑三:查表前必须标准化
正态分布表只有 N(0, 1) 的版本——不存在"查 N(5, 4) 的表"。任何 N(μ, σ²) 的问题,第一步必须先做 Z 变换。如果题目没有给查表需要的数值,就让你用 Φ 符号表达结果(不要求算出具体数字)。

坑四:Φ(−z) = 1 − Φ(z) 常忘用——这个公式是建立在对称性上的
标准正态表通常只给 z ≥ 0 的值(因为曲线关于 0 对称,负半边的值可以通过对称性转化)。比如要查 Φ(−1.5),表里找不到 −1.5——你得算 1 − Φ(1.5) = 1 − 0.9332 = 0.0668。

坑五:aX + b 的方差是 a²σ²,不是 aσ²
若 X ~ N(μ, σ²),则 Y = aX + b ~ N(aμ + b, a²σ²)。方差乘以 a²——因为方差衡量的是"平方后的平均偏离程度",乘 a 倍后偏离也乘 a 倍,平方一下就是 a²。标准化中除以 σ,方差就除以 σ²——刚好消成 1。

坑六:标准化是线性变换的特例
把 $Z = \frac{X-\mu}{\sigma}$ 写成 $Z = \frac{1}{\sigma}X + (-\frac{\mu}{\sigma})$,这就是 $a = \frac{1}{\sigma}, b = -\frac{\mu}{\sigma}$ 的线性变换。按公式:$Z \sim N(a\mu + b, a^2\sigma^2) = N(\frac{\mu}{\sigma} - \frac{\mu}{\sigma}, \frac{\sigma^2}{\sigma^2}) = N(0, 1)$。和推导结果一致——标准化是线性变换性质的一个具体应用。

⑥ 🔗 在整条链中的位置

从哪里来:

到哪里去:

正态分布的重要性质

性质一:线性变换仍为正态(必考)
若 $X \sim N(\mu, \sigma^2)$,则 $Y = aX + b \sim N(a\mu + b, a^2\sigma^2)$。
特别地,$a = 1/\sigma, b = -\mu/\sigma$ 时,$Y = (X-\mu)/\sigma \sim N(0, 1)$——这就是标准化!

注意:方差变成了 $a^2\sigma^2$(乘以 a 的平方!),不是 $a\sigma^2$。

性质二:独立正态之和仍为正态(可加性)
若 $X \sim N(\mu_1, \sigma_1^2)$,$Y \sim N(\mu_2, \sigma_2^2)$ 且 X, Y 独立,则:
$$X + Y \sim N(\mu_1 + \mu_2, \sigma_1^2 + \sigma_2^2)$$

性质三:对称性
$P(X \leq \mu - c) = P(X \geq \mu + c)$(左右尾巴对称)

性质四:3σ 原则
$P(|X - \mu| \leq 3\sigma) \approx 0.9973$——几乎(99.73%)的数据都在均值±3个标准差范围内。超出3σ 的范围,基本可以认为不可能发生。

正态分布的计算——先动手算一道,再悟出套路

看到这题,先别慌:设 X ~ N(3, 4),求 P(2 < X ≤ 5)。(已知 Φ(1) = 0.8413,Φ(0.5) = 0.6915)

难在哪?——正态分布 F(x) 没有初等表达式,直接积分算不出。但标准正态 N(0, 1) 有表可查。所以思路是:先把 X 的区间换算成 Z 的区间,再用表。

动手试探:σ² = 4 所以 σ = 2,标准化 Z = (X−3)/2 ~ N(0,1)。区间也跟着换:2 < X ≤ 5 ⟺ (2−3)/2 < Z ≤ (5−3)/2 ⟺ −0.5 < Z ≤ 1。于是:
$$P(2 < X \leq 5) = P(-0.5 < Z \leq 1) = \Phi(1) - \Phi(-0.5)$$
查表 Φ(1) = 0.8413。但表里没有 −0.5?——用对称性 Φ(−0.5) = 1 − Φ(0.5) = 1 − 0.6915 = 0.3085。
$$= 0.8413 - 0.3085 = 0.5328$$

🧠 这一步在想什么:整个流程其实是"标准化 → 区间跟着换 → 化为 Φ 表达式 → 查表",中间唯一的小机关是负的 z 用 Φ(−z) = 1 − Φ(z) 转成正的。

🔍 回头看看:我们已经把"任意正态求区间概率"变成了一条固定流水线——这比死记公式有用得多。

📌 以后就这么办:①标准化 Z = (X−μ)/σ(注意除以 σ,不是 σ²);②把原始区间换算成 Z 的区间;③写成 Φ(z) 表达式;④查表(负的用对称性 Φ(−z) = 1 − Φ(z))。

✍️ 立刻练一道(正态标准化计算):设 X ~ N(10, 4)。(1) 求 P(X > 13);(2) 求 P(|X − 10| < 3)。已知 Φ(1.5) = 0.9332,Φ(1) = 0.8413。

点击看答案

μ = 10, σ² = 4,σ = 2,Z = (X − 10)/2 ~ N(0, 1)。

(1) P(X > 13) = P(Z > (13−10)/2) = P(Z > 1.5) = 1 − Φ(1.5) = 1 − 0.9332 = 0.0668。

(2) P(|X − 10| < 3) = P(−1.5 < Z < 1.5) = Φ(1.5) − Φ(−1.5) = Φ(1.5) − [1 − Φ(1.5)] = 2Φ(1.5) − 1 = 2 × 0.9332 − 1 = 0.8664。

✍️ 立刻练一道(正态分布应用·真题改编):某高校男生身高 X(单位:cm)服从正态分布 N(172, 36)。(1) 求身高在 166cm 到 178cm 之间的概率;(2) 若该校按身高从高到低排,身高最高的 2.5% 的男生需要多高以上?(已知 Φ(1) = 0.8413,Φ(2) = 0.9772,z_{0.025} = 1.96)

点击看答案

μ = 172, σ² = 36,σ = 6,Z = (X − 172)/6 ~ N(0, 1)。

(1) P(166 < X < 178) = P(−1 < Z < 1) = Φ(1) − Φ(−1) = Φ(1) − [1 − Φ(1)] = 2Φ(1) − 1 = 2 × 0.8413 − 1 = 0.6826。即约 68.26% 的男生身高在 166cm 到 178cm 之间。

(2) "身高前 2.5%",即 P(X > c) = 0.025,标准化得 P(Z > (c−172)/6) = 0.025,所以 (c−172)/6 = z_{0.025} = 1.96。c = 172 + 1.96 × 6 = 183.76,即约 183.8cm 以上。

反求 μ 和 σ——已知两个累积概率,倒推两个参数(先动手算一道)

看到这题,先别慌:设 X ~ N(μ, σ²),已知 P(X ≤ 60) = 0.8413,P(X ≤ 50) = 0.3085。求 μ 和 σ。(已知 Φ(1) = 0.8413,Φ(−0.5) = 0.3085)

难在哪?——前面都是"知道 μ、σ 求概率",这题反过来:只知道两个概率,要倒推 μ、σ 两个未知数。两个未知数需要两个方程,正好题目给了两个条件——这就是联立方程的路子。

动手试探:把两个条件各自标准化:
$$P(X \leq 60) = \Phi\left(\frac{60-\mu}{\sigma}\right) = 0.8413 \quad \Rightarrow \quad \frac{60-\mu}{\sigma} = 1$$
$$P(X \leq 50) = \Phi\left(\frac{50-\mu}{\sigma}\right) = 0.3085 \quad \Rightarrow \quad \frac{50-\mu}{\sigma} = -0.5$$

🧠 这一步在想什么:0.8413 和 0.3085 一看就是要查表反查——Φ(z)=0.8413 时 z=1,Φ(z)=0.3085 时 z=−0.5(负值用对称性 Φ(−0.5)=1−Φ(0.5)=0.3085)。于是两个条件变成两个整方程:(60−μ)/σ=1 和 (50−μ)/σ=−0.5。

🔍 回头看看:解联立方程——两式相减消掉 μ:(60−μ)−(50−μ) = σ−(−0.5σ),即 10 = 1.5σ,σ = 20/3;代回得 μ = 60−20/3 = 160/3。亲手验算一下:标准化 (60−160/3)/(20/3) = (20/3)/(20/3) = 1 ✓,(50−160/3)/(20/3) = (−10/3)/(20/3) = −0.5 ✓。两个条件都对上了,答案可靠。

📌 以后就这么办:已知两个累积概率反求 μ、σ——①把每个条件都标准化成 Φ((a−μ)/σ) = 已知数;②查表(或反查)把 Φ 换成 z 值,得到两个整方程;③联立解出 μ、σ;④代回验算两个标准化分数是否对上。

✍️ 立刻练一道(反求参数):设 X ~ N(μ, σ²),已知 P(X ≤ 70) = 0.9772,P(X ≤ 80) = 0.9938。求 μ 和 σ。(已知 Φ(2) = 0.9772,Φ(2.5) = 0.9938)

点击看答案

P(X ≤ 70) = Φ((70−μ)/σ) = 0.9772 → (70−μ)/σ = 2,即 70 − μ = 2σ。
P(X ≤ 80) = Φ((80−μ)/σ) = 0.9938 → (80−μ)/σ = 2.5,即 80 − μ = 2.5σ。
两式相减:(80−μ)−(70−μ) = 2.5σ − 2σ,即 10 = 0.5σ,σ = 20。
代入 70 − μ = 40,μ = 30。
验算:(70−30)/20 = 2 ✓,(80−30)/20 = 2.5 ✓。所以 μ = 30,σ = 20。

1.8 随机变量函数的分布

说完常见分布之后,我们来看一个更一般的问题:已知一个随机变量 X 的分布,如果对 X 做运算(比如 Y = X²、Y = 2X + 3、Y = |X|),那么新变量 Y 的分布是什么?

生活比喻:你已知一个班级每个学生的身高 X(厘米)。现在定义 Y = X − 100(身高减100)。问:Y 这个新变量的分布是什么?Y 的分布规律可以从 X 的分布规律推导出来——这就是"求随机变量函数的分布"。

正式定义(高频考点):已知随机变量 X 的分布,$Y = g(X)$ 是 X 的函数,求 Y 的分布。

离散型——三步法

先动手算一道:Y = X²,X 的分布律已知,怎么求 Y 的分布?

看到这题,先别慌:已知 X 的分布律

X −1 0 1 2
P 0.2 0.1 0.3 0.4
求 Y = X² 的分布律。

难在哪?——X 有 4 个取值,Y 是新变量,它的分布律没法直接抄。但有一个直觉:X 取某个值的概率是固定的,Y 只是 X 的"结果"——X=−1 发生,Y=1 就发生,概率还是 0.2。

动手试探:把每个 X 取值代进 Y = X²,逐个记下对应概率——

但这时发现问题了:Y=1 出现了两次(X=−1 和 X=1 都对应 Y=1)。Y 的分布律里 Y=1 只能出现一次,怎么办?——把两条路都算进"Y=1"的概率:0.2 + 0.3 = 0.5。

🧠 这一步在想什么:每出现一个 Y 的取值,就把所有"通往它的 X 取值的概率"加起来。这就是"合并相同值"——最容易漏的一步。

🔍 回头看看:其实就三步——①把每个 X 代入 y = g(x) 算出 Y 的取值;②每个对应的概率原样抄过来;③相同 Y 值的概率合并。检查一下:0.1 + 0.5 + 0.4 = 1 ✓。

📌 以后就这么办(离散型三步法):①把 X 的每个取值 x_k 代入 y = g(x_k),算出 Y 的所有取值;②Y = g(x_k) 的概率 = P(X = x_k);③若不同 x 得到相同 y,把概率加起来合并。

✍️ 立刻练一道(离散型函数分布):已知 X 的分布律:

X −1 0 1 2
P 0.2 0.1 0.4 0.3
求 Y = (X − 1)² 的分布律。
点击看答案

把每个 X 取值代入 Y = (X−1)²:

  • X=−1 → Y = (−2)² = 4,概率 0.2
  • X=0 → Y = (−1)² = 1,概率 0.1
  • X=1 → Y = 0² = 0,概率 0.4
  • X=2 → Y = 1² = 1,概率 0.3

合并相同 Y 值:Y=1 有 0.1 + 0.3 = 0.4。验证 0.4 + 0.4 + 0.2 = 1 ✓。

Y 0 1 4
P 0.4 0.4 0.2

连续型——分布函数法(万能方法)

先想一个场景:Y = −ln X,X 的密度已知,怎么求 Y 的密度?

看到这题,先别慌:设 X ~ U(0, 1)(均匀分布,密度在 (0,1) 内是常数 1),求 Y = −ln X 的概率密度。

难在哪?——Y 是连续型,它没有分布律可以"逐条列"。而上一节离散型的"三步法"在连续型这里用不了:X 有不可数个取值,没法一个一个代入。

动手试探:不能直接求密度,那就换个思路——先求 Y 的分布函数 F_Y(y),再求导。为什么?因为"分布函数"我们已经会算:F_Y(y) = P(Y ≤ y) = P(−ln X ≤ y)。把它解成关于 X 的不等式:−ln X ≤ y ⟺ ln X ≥ −y ⟺ X ≥ e^{−y}。所以
$$F_Y(y) = P(X \geq e^{-y}) = 1 - F_X(e^{-y})$$
X ~ U(0,1) 的分布函数是 F_X(x) = x(0 < x < 1),e^{−y} 落在 (0,1) 里(当 y > 0),所以 F_Y(y) = 1 − e^{−y}。最后求导:f_Y(y) = (1 − e^{−y})' = e^{−y}(y > 0)。

🧠 这一步在想什么:绕了个弯,但每一步都有"老工具"撑着——①"Y 的事件"翻译成"X 的事件"(解不等式);②用 X 的分布函数算这个概率;③求导把分布函数变回密度。全程没碰"新公式"。

🔍 回头看看:我们其实走出了一条完整流水线——这比背公式有用得多,因为它任何函数都适用(单调、非单调、分段都行)。

📌 以后就这么办(分布函数法四步走):

第1步:定义 F_Y(y) = P(Y ≤ y) = P(g(X) ≤ y)
第2步:解不等式 g(X) ≤ y,把"关于 Y 的事件"变成"关于 X 的范围"
第3步:用 X 的分布函数/密度算出这个概率(积分或 F_X 表达式)
第4步:对 y 求导,得 f_Y(y) = F_Y'(y)

分布函数法的思想:不直接求密度,而是先求"累积量"(分布函数),再求导回到密度。就像不知道一个曲线的方程,但知道它每段的斜率变化规律——那就从斜率反推曲线。

例1:线性函数 Y = aX + b(单调函数)
已知 $X \sim N(\mu, \sigma^2)$,求 $Y = aX + b$ 的分布。

用分布函数法:

结论:$Y \sim N(a\mu + b, a^2\sigma^2)$。正态的线性函数还是正态!

例2:平方函数 Y = X²(非单调函数)
已知 X 的密度为 $f_X(x)$,求 $Y = X²$ 的密度。

用分布函数法:

非单调函数的关键:不等式 g(X) ≤ y 解出来可能是多个区间,要分别积分!分布函数法的优势在这里——它自动处理了分段。

✍️ 立刻练一道(分布函数法·连续型):设 X ~ U(0, 2)(密度 f(x) = 1/2,0 < x < 2)。求 Y = X³ 的概率密度。

点击看答案

X 的密度 f_X(x) = 1/2(0 < x < 2),分布函数 F_X(x) = x/2(0 < x < 2)。Y = X³ 在 (0,2) 上严格递增,值域 0 < y < 8。

第1步:F_Y(y) = P(Y ≤ y) = P(X³ ≤ y)。
第2步:y ≤ 0 时 F_Y(y) = 0;0 < y < 8 时 X³ ≤ y ⟺ X ≤ y^{1/3}。
第3步:F_Y(y) = P(X ≤ y^{1/3}) = F_X(y^{1/3}) = y^{1/3}/2。
第4步:求导,0 < y < 8 时 f_Y(y) = (1/2)·(1/3)y^{−2/3} = (1/6)y^{−2/3};其余为 0。

验证:∫_0^8 (1/6)y^{−2/3} dy = (1/6)·[3y^{1/3}]_0^8 = (1/6)·6 = 1 ✓。

✍️ 立刻练一道(分布函数法·非单调):设 X ~ N(0, 1)。(1) 求 Y = |X| 的概率密度;(2) 利用结果求 P(|X| < 1)。(已知 Φ(1) = 0.8413)

点击看答案

X ~ N(0,1),F_X(x) = Φ(x)。

(1) Y = |X| ≥ 0。y ≤ 0 时 F_Y(y) = 0。y > 0 时:
F_Y(y) = P(|X| ≤ y) = P(−y ≤ X ≤ y) = Φ(y) − Φ(−y) = Φ(y) − [1 − Φ(y)] = 2Φ(y) − 1。
求导:f_Y(y) = 2φ(y) = 2·(1/√(2π))e^{−y²/2} = √(2/π)·e^{−y²/2}(y > 0),y ≤ 0 时为 0。

(2) P(|X| < 1) = F_Y(1) = 2Φ(1) − 1 = 2 × 0.8413 − 1 = 0.6826。

✍️ 立刻练一道(分布函数法·分段函数):设随机变量 X 的概率密度为 $f_X(x) = \begin{cases} x/2, & 0 < x < 2 \ 0, & \text{其他} \end{cases}$,求 Y = X² 的概率密度。

点击看答案

X 的范围是 (0, 2),Y = X² 的范围是 (0, 4)。用分布函数法:

y ≤ 0 时 F_Y(y) = 0。0 < y < 4 时:X² ≤ y ⟺ −√y ≤ X ≤ √y,但 X > 0,所以实际是 0 < X ≤ √y。
F_Y(y) = P(0 < X ≤ √y) = ∫_0^{√y} (x/2) dx = [x²/4]_0^{√y} = y/4。
y ≥ 4 时:X ≤ 2 ⟹ X² ≤ 4 ≤ y,F_Y(y) = 1。

求导:0 < y < 4 时 f_Y(y) = (y/4)' = 1/4,其余为 0。

即 f_Y(y) = 1/4(0 < y < 4),其余为 0——Y 服从 [0, 4] 上的均匀分布 U(0, 4)!

公式法——单调函数的快捷方式

先想一个场景:同样是 Y = 2X + 3,能不能"抄近道"?

上一节我们用分布函数法求过"正态的线性函数",费了四步。但你可能已经感觉到:如果 g 是单调函数(一直增或一直减),好像有个更省事的规律。

动手试探:回顾例1的结论——对 Y = aX + b,求导后结果是 $f_Y(y) = \frac{1}{|a|} f_X(\frac{y-b}{a})$。把这个式子端详一下:它很像——"把 X 的密度搬到 y 的位置,再乘一个修正系数"。y = g(x) 的反函数是 x = h(y),密度在 h(y) 处取值,系数是 |h'(y)|。

🔍 回头看看:其实这正是分布函数法第4步"求导"的必然结果——链式法则把反函数的导数 |h'(y)| 自然带了出来。也就是说,单调函数下,四步法可以压缩成一条公式。

📌 以后就这么办(公式法):当 y = g(x) 在 X 的取值范围内严格单调且可导、导数不为零时,令 x = h(y) 为反函数,则
$$f_Y(y) = f_X[h(y)] \cdot |h'(y)|$$

其中 $x = h(y)$ 是 $y = g(x)$ 的反函数(把运算倒过来——比如 y = 2x + 3 的反操作是 x = (y − 3)/2,y = e^x 的反操作是 x = ln y),$|h'(y)|$ 是反函数的导数的绝对值。

什么时候用公式法:$Y = aX + b$、$Y = e^X$、$Y = \ln X$ 这类单调函数——直接用公式法更快。

什么时候必须用分布函数法:$Y = X²$(非单调)、$Y = |X|$(非单调)、分段函数——这些不能用公式法,必须走分布函数法。

考试建议:公式法可以节省时间,但分布函数法是万能方法,建议先熟练掌握分布函数法,再学公式法作为加速工具。

✍️ 立刻练一道(公式法·单调函数):设 X ~ N(0, 1),求 Y = 2X + 3 的概率密度。

点击看答案

y = g(x) = 2x+3 单调,反函数 x = h(y) = (y−3)/2,h'(y) = 1/2。
f_Y(y) = f_X((y−3)/2) · |1/2| = φ((y−3)/2)/2 = (1/2)·(1/√(2π))·e^{−((y−3)/2)²/2} = (1/(2√(2π)))·e^{−(y−3)²/8}。
因为正态的线性变换仍为正态,所以 Y ~ N(3, 4),密度 f_Y(y) = (1/(2√(2π)))·e^{−(y−3)²/8}。

✍️ 立刻练一道(公式法·一般密度):设随机变量 X 的概率密度为 $f(x) = \begin{cases} 3x^2, & 0 < x < 1 \ 0, & \text{其他} \end{cases}$,求 Y = 2X − 1 的概率密度。

点击看答案

y = g(x) = 2x−1 严格单调,反函数 x = h(y) = (y+1)/2,h'(y) = 1/2。X 的取值范围 0 < x < 1 ⟹ −1 < y < 1。
f_Y(y) = f_X((y+1)/2) · |1/2| = 3·((y+1)/2)² · (1/2) = (3/8)(y+1)²(当 −1 < y < 1),其他情况为 0。


② 题型速查与练习索引

这一章的所有方法都在前面的知识区里跟着例题一步步发现了,配套练习也已经就近放在每个知识点后面(每题一个"✍️ 立刻练一道")。这里不再重复讲方法,只做两件事:告诉你每个题型在哪儿、给你一张"看到什么题→想到什么招"的总速查表。做题时想不起来,就回到对应小节的"📌 以后就这么办"。

题型速查表(看到什么题 → 回哪里)

题型 考频 在知识区的哪里 核心招法(一句话)
题型一 求分布律/密度中的未知参数 ⭐⭐⭐ 1.3 节"分布律里的未知参数怎么求"、1.4 节"密度里的未知参数怎么求" 归一性列方程:离散 ∑pₖ = 1,连续 ∫f = 1
题型二 求分布函数 ⭐⭐⭐ 1.5 节"求离散型的分布函数"、"求连续型的分布函数" 离散分段累加、连续分段积分;等号在左边(右连续)
题型二·子类型③ 分布函数 → 分布律/密度 ⭐⭐ 1.5 节"分布函数与分布律、概率密度的转换" 离散看跳跃高度,连续直接求导 f = F'
题型二·子类型④ 判断分布函数合法性 ⭐⭐⭐ 1.5 节"判断是不是分布函数" 四条性质逐条打勾:单调不减/0≤F≤1/两端极限/右连续
题型三 利用常见分布求概率 ⭐⭐⭐ 1.6 各离散分布、1.7 各连续分布(每个分布后紧跟练习) 认场景选分布,套该分布公式
题型四 正态标准化与查表 ⭐⭐⭐ 1.7 正态分布"正态分布的计算" 标准化 Z=(X−μ)/σ,区间跟着换,查 Φ,负的用 Φ(−z)=1−Φ(z)
题型五 随机变量函数的分布 ⭐⭐⭐ 1.8 离散三步法 / 连续分布函数法 / 公式法 离散三步法(合并相同值);连续分布函数法四步走;单调用公式法
题型六 泊松近似二项 ⭐⭐ 1.6"二项分布与泊松分布的关系"(泊松近似) 条件 n≥20、p≤0.05,λ=np,套泊松公式

各题型配套练习的所在位置

题 练习内容 对应题型 所在位置
练习1 离散型·求未知参数(分布律含 a) 题型一 1.3 节"立刻练一道"(2a/3a/4a/a)
练习2 连续型·求未知参数(密度 k(1−x)) 题型一 1.4 节"立刻练一道"(k=2)
练习3 离散型·求分布函数 题型二① 1.5 节"求离散型的分布函数"后(X=−1,0,2)
练习4 连续型·求分布函数 题型二② 1.5 节"求连续型的分布函数"后(密度 3x²)
练习5 二项分布·分布律+至少 题型三① 1.6 二项分布后(命中率0.7)
练习6 超几何分布·不放回抽样 题型三③ 1.6 超几何分布后(30个8个瑕疵)
练习7 超几何→二项近似 题型三③ 1.6 超几何分布后(200件20件)
练习8 均匀分布·密度+分布函数+概率 题型三 1.7 均匀分布后(U(1,5))
练习9 正态分布·标准化计算 题型四 1.7 正态分布后(N(10,4))
练习10 指数分布·密度+尾巴+无记忆性 题型三④ 1.7 指数分布后(Exp(2))
练习11 离散型·函数分布(三步法) 题型五① 1.8 离散三步法后(Y=(X−1)²)
练习12 泊松分布·求λ+期望方差+概率 题型三② 1.6 泊松分布后(P(X=1)=P(X=2))
练习13 已知分布函数求密度和概率 题型一+题型二 1.5 节"用分布函数求区间概率"后(Ax²)
练习14 正态分布应用·百分位 题型四 1.7 正态分布后(身高 N(172,36))
练习15 分布函数法·Y=X³ 题型五② 1.8 分布函数法后(U(0,2))
练习16 泊松近似二项 题型六 1.6 泊松近似后(保险公司10000人)
练习17 正态+函数分布·Y= X
练习18 分布函数法·非单调分段 题型五② 1.8 分布函数法后(f_X(x)=x/2)

混搭练习、综合自测在下面章节:🧪 学完自测(4选择+2判断+4简答)紧接本节之后;③ 综合混搭练习在章节后部,专门用来"打乱题型、逼你判断用哪个方法"。


🧪 学完自测(4选择 + 2判断 + 4简答)

混搭全章知识点,检验你真正掌握了多少。答案用折叠,先自己做再看。


选择题1:设随机变量 X 的概率密度为 f(x),则下列等式一定正确的是( )

A. f(x) 的取值范围是 [0, 1]
B. P(X = a) = f(a) 对任何 a 成立
C. $\int_{-\infty}^{+\infty} f(x),dx = 1$
D. 若 f(1) = 2,则 P(X = 1) = 2

点击看答案

C。A错:密度可以大于1。B错:连续型单点概率为0。D错:密度值不等于概率值。C是密度的归一性——总面积为1,这是密度的基本要求。


选择题2:已知 X ~ N(3, 4),则 P(X < 1) 等于( )

A. Φ(1)
B. Φ(−1)
C. 1 − Φ(1)
D. Φ(−0.5)

点击看答案

B。标准化:Z = (X−3)/2 ~ N(0,1)。P(X < 1) = P(Z < (1−3)/2) = P(Z < −1) = Φ(−1)。σ²=4 所以 σ=2,注意别用错。


选择题3:下列哪种情况不能用泊松分布近似二项分布?

A. n = 1000, p = 0.003
B. n = 50, p = 0.04
C. n = 100, p = 0.5
D. n = 200, p = 0.01

点击看答案

C。泊松近似的条件是 n 很大(≥20)且 p 很小(≤0.05)。C中 p=0.5 不小,不能用泊松近似——此时二项分布是对称的,应直接计算或正态近似。


选择题4:设 X 的密度为 $f_X(x)$,Y = −2X + 1,则 Y 的密度为( )

A. $f_X((y-1)/(-2))$
B. $\frac{1}{2} f_X(\frac{y-1}{-2})$
C. $\frac{1}{|-2|} f_X(\frac{1-y}{2})$
D. $-2 f_X(y)$

点击看答案

C。公式法:反函数 x = h(y) = (1−y)/2,h'(y) = −1/2,|h'(y)| = 1/2。所以 $f_Y(y) = f_X((1-y)/2) \cdot 1/2$。注意 a = −2 时公式中的 |a| = 2。


判断题1:分布函数 F(x) 一定是右连续的,但不一定是连续函数。

点击看解析

正确。离散型分布函数是阶梯函数(右连续但不连续),连续型分布函数处处连续(自然也右连续)。不管是离散还是连续,分布函数都满足右连续——"台阶踩右边"。


判断题2:若 X ~ N(0, 1),则 P(X > 0) = 0.5。

点击看解析

正确。标准正态关于0对称,0正好是中心点,左右各一半。Φ(0) = 0.5,所以 P(X > 0) = 1 − 0.5 = 0.5。


简答题1:用自己的话说说"分布函数法四步走"是什么?为什么Y = X²时不能用公式法而必须用分布函数法?

点击看答案

四步走:①定义F_Y(y)=P(Y≤y);②把Y的不等式转化为X的不等式;③用X的分布计算概率;④对y求导得到密度。

Y=X²不能用公式法的原因是:y=x²不是单调函数——x取正值和负值都得到同样的y值。公式法要求g(x)严格单调(一直增或一直减),X²在正负半轴增减性不同,必须用分布函数法分段处理。


简答题2:连续型随机变量在单点上的概率为0,那"概率密度"的意义是什么?密度能大于1吗?为什么?

点击看答案

概率密度就像金属棒的密度——在单个点上,"铁的质量"是0(点没有体积),但密度本身可以很大。密度的意义是:在很小的区间上,概率约等于密度×区间长度。密度能大于1——比如一个高2、宽0.5的长方形,密度是2(>1),但面积(=概率)只有1。概率密度的限制是"总面积为1",不是"数值不超过1"。


简答题3:正态分布为什么要"标准化"?标准化的两步是什么?标准化后φ(z)和Φ(z)分别代表什么?查表查的是哪个?

点击看答案

因为正态分布的分布函数没有初等表达式(不能写成普通的加减乘除),只有标准正态N(0,1)有现成的数值表。标准化的两步:①减均值X−μ(把中心移到0),②除以标准差(X−μ)/σ(把宽度缩放到1)。φ(z)(小写phi)是标准正态的概率密度,Φ(z)(大写Phi)是标准正态的分布函数。查表查的是大Φ——即"从−∞到z累计的概率"。


简答题4:有一个完全不懂概率论的朋友问你:"二项分布和超几何分布到底什么区别?什么时候用哪个?"请用大白话解释。

点击看答案

二项分布是"摸一个放回去再摸"——每次摸的时候条件完全一样,成功的概率不变。超几何分布是"摸一个不放回去接着摸"——每摸一次,剩下的东西里"好的"和"坏的"比例都在变。

什么时候用二项?总体非常大(比如全国人口),你抽几个人对剩下几乎没影响——放不放回差不多。什么时候用超几何?总体不大(比如一箱20个零件),抽的比例较高——不放回的影响就不能忽略了。经验判断:抽样比例小于10%时,二项近似就够了。


③ 综合混搭练习

打乱题型,逼你自己判断用哪个方法。这四道题混合了本章的多个题型。


混搭1 🎲(正态分布 + 二项分布)

某工厂生产一批零件,其直径 X(单位:mm)服从正态分布 N(50, 0.25)。零件的合格标准为 49.5mm < X < 50.5mm。

(1) 求随机抽取一个零件为合格品的概率。(已知 Φ(1) = 0.8413)

(2) 现从这批零件中独立抽取 5 个,设 Y 为其中合格品的个数,求 Y 的分布律,并求 P(Y ≥ 4)。

(3) 如果改为抽取 10 个,求 P(Y = 0)(即全部不合格的概率)。

📌 对应模板:题型四(正态标准化)+ 题型三·子类型①(二项分布)

点击看答案
(1) X ~ N(50, 0.25),μ=50,σ²=0.25 ⇒ σ=0.5

P(49.5 < X < 50.5) = P((49.5−50)/0.5 < Z < (50.5−50)/0.5)
                    = P(−1 < Z < 1)
                    = Φ(1) − Φ(−1)
                    = Φ(1) − [1 − Φ(1)]
                    = 2Φ(1) − 1
                    = 2 × 0.8413 − 1
                    = 0.6826

合格率 p = 0.6826

(2) Y ~ B(5, p),其中 p = 0.6826

P(Y ≥ 4) = P(Y=4) + P(Y=5)

P(Y=4) = C_5^4 × p^4 × (1−p)^1
       = 5 × 0.6826⁴ × 0.3174
       = 5 × 0.2172 × 0.3174
       ≈ 0.3446

P(Y=5) = p^5 = 0.6826⁵ ≈ 0.1483

P(Y ≥ 4) = 0.3446 + 0.1483 = 0.4929

(3) 抽取10个,Y ~ B(10, 0.6826)
P(Y=0) = (1−p)¹⁰ = 0.3174¹⁰ ≈ 0.00001(极低,几乎不可能)

答案:(1) 0.6826  (2) 约 0.4929  (3) 约 0.00001

混搭2 🔄(参数求解 + 分布函数 + 函数分布)

设连续型随机变量 X 的概率密度为:
$$f(x) = \begin{cases} k(2-x), & 0 < x < 2 \ 0, & \text{其他} \end{cases}$$

(1) 求常数 k。

(2) 求 X 的分布函数 F(x)。

(3) 求 P(0.5 < X < 1.5)。

(4) 求 Y = 3X + 1 的概率密度。

📌 对应模板:题型一(求未知参数)+ 题型二·子类型②(密度→分布函数)+ 题型五·子类型③(公式法)

点击看答案
(1) 归一性:∫_0^2 k(2-x) dx = 1
    k · ∫_0^2 (2-x) dx = 1
    k · [2x − x²/2]_0^2 = 1
    k · (4 − 2) = 1
    k · 2 = 1
    k = 1/2

(2) F(x) = ∫_{-∞}^x f(t) dt

    当 x < 0:F(x) = 0
    当 0 ≤ x < 2:
        F(x) = ∫_0^x (1/2)(2−t) dt
             = (1/2)[2t − t²/2]_0^x
             = (1/2)(2x − x²/2)
             = x − x²/4
    当 x ≥ 2:F(x) = 1

    F(x) = ⎧ 0,          x < 0
           ⎨ x − x²/4,   0 ≤ x < 2
           ⎩ 1,          x ≥ 2

(3) P(0.5 < X < 1.5) = F(1.5) − F(0.5)
    = (1.5 − 1.5²/4) − (0.5 − 0.5²/4)
    = (1.5 − 2.25/4) − (0.5 − 0.25/4)
    = (1.5 − 0.5625) − (0.5 − 0.0625)
    = 0.9375 − 0.4375
    = 0.5

(4) Y = 3X+1,g(x)=3x+1 严格单调,可用公式法。
    反函数 x = h(y) = (y−1)/3,h'(y) = 1/3
    X 的取值范围 0 < x < 2 ⇒ 1 < y < 7

    f_Y(y) = f_X((y−1)/3) · |1/3|
           = (1/2)[2 − (y−1)/3] · (1/3)     (当 1 < y < 7)
           = (7−y)/18,  1 < y < 7

    其他情况 f_Y(y) = 0

答案:(1) k = 1/2  (2) 见上  (3) 0.5  (4) f_Y(y) = (7−y)/18, 1<y<7

混搭3 🧩(离散型分布律 + 分布函数 + 函数分布)

设随机变量 X 的分布律为:

X 0 1 2
P 0.2 0.5 0.3

(1) 求 X 的分布函数 F(x),并求 P(X ≤ 1)。

(2) 求 Y = |X − 1| 的分布律。

(3) 求 P(Y > 0)。

(4) 求 Y 的分布函数 F_Y(y)。

📌 对应模板:题型二·子类型①(离散型→分布函数)+ 题型五·子类型①(离散型三步法)

点击看答案
(1) 取值从小到大:x₁=0(p=0.2), x₂=1(p=0.5), x₃=2(p=0.3)

    F(x) = ⎧ 0,   x < 0
           ⎪ 0.2, 0 ≤ x < 1
           ⎨ 0.7, 1 ≤ x < 2
           ⎩ 1,   x ≥ 2

    P(X ≤ 1) = F(1) = 0.7

(2) Y = |X−1|
    X=0 → Y=1,概率 0.2
    X=1 → Y=0,概率 0.5
    X=2 → Y=1,概率 0.3

    合并 Y=1:0.2 + 0.3 = 0.5

    Y 的分布律:
    | Y | 0 | 1 |
    |---|-----|-----|
    | P | 0.5 | 0.5 |

(3) P(Y > 0) = P(Y=1) = 0.5

(4) Y 的分布函数:
    F_Y(y) = ⎧ 0,   y < 0
             ⎪ 0.5, 0 ≤ y < 1
             ⎩ 1,   y ≥ 1

答案:(1) F(x) 见上,P(X≤1)=0.7  (2) 见上  (3) 0.5  (4) F_Y(y) 见上

混搭4 🎯(泊松分布 + 二项分布 + 泊松近似)

某快递站平均每天收到 3 个包裹需要二次派送(即第一次派送失败),假设需要二次派送的包裹数 X 服从泊松分布。

(1) 求某天恰好有 2 个包裹需要二次派送的概率。(已知 e^{−3} ≈ 0.0498)

(2) 求某天至少有 1 个包裹需要二次派送的概率。

(3) 该快递站一共有 2000 个客户,每个客户在某天需要二次派送的概率为 0.001。用泊松近似计算某天需要二次派送的客户数不超过 3 的概率。(已知 e^{−2} ≈ 0.1353)

📌 对应模板:题型三·子类型②(泊松分布)+ 题型六(泊松近似二项)

点击看答案
(1) X ~ P(3),λ=3
    P(X=2) = (3² / 2!) × e^{−3}
           = (9/2) × 0.0498
           = 4.5 × 0.0498
           = 0.2241

(2) P(X ≥ 1) = 1 − P(X=0)
              = 1 − e^{−3}
              = 1 − 0.0498
              = 0.9502

(3) 二项分布:n=2000(很大),p=0.001(很小)→ 可用泊松近似
    λ = np = 2000 × 0.001 = 2

    P(Y ≤ 3) = ∑_{k=0}^3 (2^k / k!) e^{−2}

    k=0: (1/1) × 0.1353 = 0.1353
    k=1: (2/1) × 0.1353 = 0.2706
    k=2: (4/2) × 0.1353 = 0.2706
    k=3: (8/6) × 0.1353 ≈ 0.1804

    P(Y ≤ 3) = 0.1353 + 0.2706 + 0.2706 + 0.1804 = 0.8569

答案:(1) 约 0.2241  (2) 约 0.9502  (3) 约 0.8569

混搭5 🔙(回顾·第1章 — 条件概率 + 二项分布)

📌 这道题故意把第1章的条件概率和第2章的二项分布绑在一起——考试中这种"跨章节组合"非常常见。

某工厂有A、B两条生产线。A线产量占70%,次品率2%;B线产量占30%,次品率5%。现从当天产品中随机抽取1件。

(1) 求抽到次品的概率。(回顾·全概率公式)

(2) 已知抽到的是次品,求它来自A线的概率。(回顾·贝叶斯公式)

(3) 现从当天产品中独立抽取10件(产品数量巨大,可视为放回抽样),设Y为其中次品的个数。求Y的分布律和P(Y ≥ 1)。(第2章·二项分布)

📌 对应模板:第1章·全概率+贝叶斯 + 题型三·子类型①(二项分布)

点击看答案
(1) 全概率公式:
    设A₁=来自A线,A₂=来自B线,B=抽到次品
    P(B) = P(A₁)P(B|A₁) + P(A₂)P(B|A₂)
         = 0.7 × 0.02 + 0.3 × 0.05
         = 0.014 + 0.015 = 0.029

(2) 贝叶斯公式:
    P(A₁|B) = P(A₁)P(B|A₁) / P(B)
            = 0.7 × 0.02 / 0.029
            = 0.014 / 0.029 ≈ 0.4828

(3) Y ~ B(10, 0.029),即 n=10, p=0.029
    分布律:P(Y=k) = C_{10}^k × 0.029^k × 0.971^{10−k}

    P(Y ≥ 1) = 1 − P(Y=0)
             = 1 − 0.971¹⁰
             ≈ 1 − 0.745
             ≈ 0.255

答案:(1) 0.029  (2) 约 0.483  (3) Y~B(10,0.029),P(Y≥1)≈0.255

混搭6 🔄 回马枪·第1章回顾(条件概率 + 独立性 + 指数分布)

📌 这道题把第1章的条件概率/独立性判定和第2章的指数分布搅在一起——先算出概率,再判断事件关系。

某电子元件的寿命 X(单位:千小时)服从参数 λ = 0.5 的指数分布,即 X ~ Exp(0.5)。定义两个事件:

(1) 求 P(A)、P(B) 和 P(AB)。(第2章·指数分布尾巴概率:P(X > t) = e^{−λt})

(2) 判断 A 与 B 是否独立。(第1章·独立性:P(AB) = P(A)·P(B)?)

(3) 求 P(B | A)。(第1章·条件概率公式)

(4) (3) 的结果和你算出的 P(B) 是什么关系?这个关系"巧合"吗?用本章学到的知识解释。(提示:想想指数分布最独特的性质)

📌 对应模板:第1章·条件概率+独立性 + 题型三·子类型④(指数分布)

点击看答案
(1) 指数分布 P(X > t) = e^{−λt},λ = 0.5。

    P(A) = P(X > 1) = e^{−0.5×1} = e^{−0.5} ≈ 0.6065
    P(B) = P(X > 2) = e^{−0.5×2} = e^{−1} ≈ 0.3679

    注意 AB = {X > 1 且 X > 2} = {X > 2} = B(因为 >2 自动满足 >1),
    所以 P(AB) = P(B) ≈ 0.3679。

(2) P(A)·P(B) = 0.6065 × 0.3679 ≈ 0.2231
    而 P(AB) = 0.3679

    0.3679 ≠ 0.2231 → A 与 B 不独立。

    通俗理解:如果 A 和 B 独立,"寿命超过 2000 小时"应该和"已经超过 1000 小时"无关。
    但实际上 P(AB) 比 P(A)P(B) 大得多——超过 1000 小时后,再超过 2000 小时的概率
    比"从零开始超过 2000 小时"大多了。因为已经熬过 1000 小时了,再熬 1000 小时就行。

(3) P(B | A) = P(AB) / P(A) = e^{−1} / e^{−0.5} = e^{−0.5} ≈ 0.6065

(4) P(B | A) = e^{−0.5} = 0.6065,而 P(B) = e^{−1} = 0.3679。两者不相等——这说明
    事件 A 和 B 不独立(条件概率 ≠ 无条件概率)。

    但有趣的是:P(B | A) = e^{−0.5} = P(X > 1)!
    也就是说:已知元件活了 1000 小时,"还能再活 1000 小时以上"的概率,
    等于"一个新元件活 1000 小时以上"的概率。

    这就是指数分布的**无记忆性**:
    P(X > s+t | X > s) = P(X > t),这里 s=1, t=1。
    已知活了 1 千小时,再活 1 千小时以上的概率 = 从头活 1 千小时以上的概率。
    元件"忘记"自己已经工作过 1000 小时。

答案:(1) P(A)≈0.6065, P(B)≈0.3679, P(AB)≈0.3679  (2) 不独立  (3) ≈0.6065  (4) 无记忆性

混搭7 🔄 回马枪·第1章回顾(全概率公式 + 贝叶斯公式 + 泊松分布)

📌 全概率和贝叶斯的一层壳 + 泊松分布做内核——先拆场景算概率,再用贝叶斯倒推原因。

某城市天气预报的准确率如下:预报下雨且实际下雨的概率为 0.8;预报不下雨但实际下雨的概率为 0.1。该城市下雨的日期占 30%。

已知下雨天,某路段平均发生 2 起交通事故(泊松分布);非下雨天,平均发生 0.5 起交通事故。设某天该路段的交通事故数 X 服从对应参数的泊松分布。

(1) 某天预报下雨,这天实际下雨的概率是多少?(第1章·贝叶斯公式)

(2) 随机选一天,该路段恰好发生 1 起交通事故的概率是多少?(第1章·全概率公式 + 第2章·泊松分布)

(3) 已知某天该路段恰好发生了 1 起交通事故,这天是下雨天的概率是多少?(第1章·贝叶斯公式 + 第2章·泊松分布)
(已知 e^{−2} ≈ 0.1353, e^{−0.5} ≈ 0.6065)

📌 对应模板:第1章·全概率+贝叶斯 + 题型三·子类型②(泊松分布)

点击看答案
设事件 R = 实际下雨,F = 预报下雨。
已知:P(R) = 0.3,P(F|R) = 0.8,P(F|R̅) = 0.1(因为预报不下雨但下雨=0.1 → 预报下雨但不下雨=0.1)

(1) 贝叶斯公式求 P(R|F):

    先求 P(F) = P(R)P(F|R) + P(R̅)P(F|R̅)
              = 0.3 × 0.8 + 0.7 × 0.1
              = 0.24 + 0.07 = 0.31

    P(R|F) = P(R)P(F|R) / P(F) = 0.24 / 0.31 ≈ 0.7742

(2) 全概率公式 + 泊松分布。

    下雨天 X ~ P(2):P(X=1 | R) = (2¹/1!) × e^{−2} = 2 × 0.1353 = 0.2706
    非下雨天 X ~ P(0.5):P(X=1 | R̅) = (0.5¹/1!) × e^{−0.5} = 0.5 × 0.6065 = 0.3033

    P(X=1) = P(R)P(X=1|R) + P(R̅)P(X=1|R̅)
           = 0.3 × 0.2706 + 0.7 × 0.3033
           = 0.0812 + 0.2123
           = 0.2935

(3) 贝叶斯公式:

    P(R | X=1) = P(R)P(X=1|R) / P(X=1)
               = 0.0812 / 0.2935
               ≈ 0.2767

    即使事故数是 1(不算多),下雨天的后验概率(0.2767)比先验概率(0.3)
    还略低——因为非下雨天发生 1 起事故的概率(0.3033)其实比下雨天(0.2706)
    还略高(非下雨天的 λ=0.5 时,P(X=1) 恰好比 λ=2 时更大)。

答案:(1) ≈0.7742  (2) ≈0.2935  (3) ≈0.2767

💡 思考题(开放题,没有标准答案)

下面的问题不要求算出精确数字,而是让你练习"拿到一个现实场景,自己判断用什么分布建模"的能力——这比会套公式重要得多。

场景:你开了一家小超市,想研究"每天有多少顾客买东西"和"每个顾客花了多少钱"这两个问题。

点击看思路(不是标准答案)

问题A参考:选泊松分布。顾客来店是独立的、随机的(上一个顾客不影响下一个),且一天内平均人数比较稳定——符合泊松的适用条件。排除二项:没有固定的"试验次数"(你不是预设了200个人然后看谁买东西)。排除超几何:不存在"从有限总体不放回抽取"的结构。

问题B参考:偏态分布(右偏)——大多数顾客花几十到几百块,极少数花很多。不可能是正态(正态对称,但消费金额明显不对称——中位数低于均值)。可以考虑对数正态分布或指数分布,但第2章讲的三个连续分布(均匀/指数/正态)都不完美匹配——这说明现实问题往往需要比课本更灵活的分布。

问题C参考:会有偏差,因为"拦8个人"可能不是完全随机的——你可能更愿意拦看起来有空的人,或者避开匆忙的人。这就是"抽样偏差"问题,第3章讲多维随机变量时会进一步讨论。


🎯 考试导航

常见分布汇总表(考前10分钟看这一页)

离散型分布

分布 参数 分布律 P(X=k) 期望 E(X) 方差 Var(X) 取值范围
0-1 分布 B(1,p) p P(X=1)=p, P(X=0)=1−p p p(1−p) k=0,1
二项分布 B(n,p) n, p $C_n^k p^k (1-p)^{n-k}$ np np(1−p) k=0,1,...,n
泊松分布 P(λ) λ $\frac{\lambda^k}{k!}e^{-\lambda}$ λ λ k=0,1,2,...
几何分布 p $(1-p)^{k-1}p$ 1/p (1−p)/p² k=1,2,3,...
超几何分布 N,M,n $\frac{C_M^k C_{N-M}^{n-k}}{C_N^n}$ $n\frac{M}{N}$ $n\frac{M}{N}\frac{N-M}{N}\frac{N-n}{N-1}$ k≤min(M,n)

连续型分布

分布 参数 密度 f(x) 分布函数 F(x) 期望 方差
均匀分布 U(a,b) a, b $\frac{1}{b-a}, a<x<b$ $\frac{x-a}{b-a}, a<x<b$ $\frac{a+b}{2}$ $\frac{(b-a)^2}{12}$
指数分布 Exp(λ) λ $\lambda e^{-\lambda x}, x>0$ $1-e^{-\lambda x}, x>0$ $\frac{1}{\lambda}$ $\frac{1}{\lambda^2}$
正态分布 N(μ,σ²) μ, σ² $\frac{1}{\sqrt{2\pi}\sigma}e^{-\frac{(x-\mu)^2}{2\sigma^2}}$ 无初等形式 μ σ²

核心公式速记

公式 说明
$F(x) = P(X \leq x)$ 分布函数定义
$\sum p_k = 1$ 分布律归一性
$\int_{-\infty}^{+\infty} f(x)dx = 1$ 密度归一性
$P(a < X \leq b) = F(b) - F(a)$ 区间概率公式
$Z = \frac{X-\mu}{\sigma} \sim N(0,1)$ 正态标准化
$\Phi(-z) = 1 - \Phi(z)$ 标准正态对称性
$f_Y(y) = F_Y'(y)$ 分布函数法求密度
$\lambda = np$(泊松近似) 二项→泊松参数转换

各分布的"标志性特征"

分布 一眼认出的特征
二项 B(n,p) 有组合数 C_n^k
泊松 P(λ) 有 λ^k/k! 和 e^{−λ},E(X)=Var(X)=λ
均匀 U(a,b) 密度是常数
指数 Exp(λ) 有 e^{−λx},无记忆性
正态 N(μ,σ²) 有 e^{−(x−μ)²/(2σ²)},对称钟形

题型速查表

题型 考频 常见出题形式 备考建议
求分布律/密度中的未知参数 ⭐⭐⭐ 选择题或大题第一问 记住归一性,区分离散(∑=1)和连续(∫=1)
求分布函数 ⭐⭐⭐ 大题第一问或选择题 离散分段累加,连续分段积分;注意右连续
利用常见分布求概率 ⭐⭐⭐ 大题或选择题 熟记各分布公式,注意参数含义
正态分布标准化 ⭐⭐⭐ 大题或选择题 先标准化再查表,牢记对称性公式
随机变量函数的分布 ⭐⭐⭐ 大题重点 分布函数法是万能方法,非单调函数必须用它
泊松近似二项 ⭐⭐ 选择题或大题一小问 确认条件(n≥20, p≤0.05),λ=np

题目索引

全部练习已就近放在对应知识点后(每个"✍️ 立刻练一道"),完整对应关系见本章 ② 题型速查与练习索引 的"各题型配套练习的所在位置"。这里按难度汇总。

练习 难度 分布/类型 对应题型 所在位置
练习1 ⭐ 离散型·求参数 题型一 1.3 节
练习2 ⭐ 连续型·求参数 题型一 1.4 节
练习3 ⭐ 离散型·求分布函数 题型二① 1.5 节
练习4 ⭐ 连续型·求分布函数 题型二② 1.5 节
练习5 ⭐ 二项分布 题型三① 1.6 节
练习6 ⭐ 超几何分布 题型三③ 1.6 节
练习7 ⭐⭐ 超几何→二项近似 题型三③ 1.6 节
练习8 ⭐⭐ 均匀分布 题型三 1.7 节
练习9 ⭐⭐ 正态分布 题型四 1.7 节
练习10 ⭐⭐ 指数分布 题型三④ 1.7 节
练习11 ⭐⭐ 离散型函数分布 题型五① 1.8 节
练习12 ⭐⭐ 泊松分布 题型三② 1.6 节
练习13 ⭐⭐⭐ 连续型综合 题型一+题型二 1.5 节
练习14 ⭐⭐⭐ 正态分布应用 题型四 1.7 节
练习15 ⭐⭐⭐ 分布函数法 题型五② 1.8 节
练习16 ⭐⭐⭐ 泊松近似二项 题型六 1.6 节
练习17 ⭐⭐⭐ 正态+函数分布 题型四+题型五② 1.8 节
练习18 ⭐⭐⭐ 分布函数法(非单调) 题型五② 1.8 节

📋 自检清单

学完这章,你应该能不打磕巴地回答以下问题。如果有回答不出来的,回到对应小节重新学习。


🧬 学完回顾:本章推导链

学完本章所有知识点后,花两分钟看着这张图,把每个箭头上的"为什么"在心里过一遍。箭头上的文字是推导的关键操作。

                            随机变量 X
                    把"随机结果"翻译成"数字"
                                │
                                ▼
                  分布函数 F(x) = P(X ≤ x)
              四条性质:单调不减 | 有界[0,1] | F(−∞)=0, F(+∞)=1 | 右连续
                                │
                    ┌───────────┴───────────┐
                    ▼                       ▼
              【离散型】                  【连续型】
           分布律 P(X=xₖ)=pₖ          密度 f(x),∫f=1
            ∑pₖ=1                    概率=曲线下面积
                    │                       │
         ┌─────────┼─────────┐       ┌──────┼──────┐
         ▼         ▼         ▼       ▼      ▼      ▼
      0-1分布   几何分布   超几何   均匀分布  指数分布  正态分布
      B(1,p)   P(X=k)=   不放回   U(a,b)  Exp(λ)  N(μ,σ²)
        │       (1-p)ᵏ⁻¹p  抽样    密度=   密度=   密度=
        │         │                常数    λe⁻λˣ  钟形曲线
        ▼         ▼
     二项分布   无记忆性                       │
     B(n,p)    P(X>m+n|X>m)                    ▼
     n次独立     =P(X>n)               标准化 Z=(X−μ)/σ
     伯努利之和                            ─────────
        │                                    │
        │ n→∞, p→0, np=λ                     ▼
        ▼                              标准正态 N(0,1)
     泊松分布                              查表 Φ(z)
     P(λ)                      Φ(−z)=1−Φ(z)(对称性)
     期望=方差=λ
                    分布函数法(万能工具)
              已知 X 的分布 → 求 Y = g(X) 的分布
                              │
             ┌────────────────┼────────────────┐
             ▼                ▼                ▼
        离散型三步法      连续型分布函数法    公式法(单调时)
       ①代入 Y=g(xₖ)     ①F_Y(y)=P(g(X)≤y)   f_Y(y)=f_X(h(y))·|h'(y)|
       ②概率不变          ②转化为X的事件      反函数x=h(y)
       ③相同值合并概率    ③用X的分布算概率    链式法则求导
                          ④对y求导得f_Y(y)

核心脉络一句话:随机变量把不确定的事变成能算的数 → 分布函数统一了离散和连续两套语言 → 8个常见分布各自对应一类现实场景 → 标准化让所有正态都变成一张表的形状 → 分布函数法让你能从已知分布推导任意新分布。

🔗 章末过渡

本章讲完了。你现在手里有了这些东西:

  • 8个常见分布的公式(5个离散 + 3个连续),从二项到正态,覆盖了考试中90%的概率计算场景
  • 分布函数这把"万能钥匙"——不管是离散还是连续,F(x) = P(X ≤ x) 都是统一的入口
  • 分布函数法这个"终极武器"——已知X的分布,任意Y = g(X)的分布都能推导出来
  • 标准化这个"翻译官"——把任意正态变成标准正态,让查表成为可能

下一章(第3章)要讲二维随机变量——把"一个人的身高"扩展到"两个人的身高一起看",把"一个变量的分布"扩展到"两个变量的联合分布"。你会发现第2章的很多思路可以直接平移过去:边缘分布就是"只看其中一个变量不管另一个"(和分布律/密度一个思路),二维分布函数 F(x,y) 和一维 F(x) 的逻辑完全一样,只是从一条线变成了一个平面。

别急着翻篇——先确保自检清单全部打勾,再把混搭练习里那道完全没思路的题重做一遍。第3章等着你。

← 上一章下一章 →