复旦大学经济学院 ECON130001
古典概型 $P(A)=\dfrac{\sharp A}{\sharp\Omega}$(有限 + 等可能,难点在计数); 几何概型 $P(A)=\dfrac{m(A)}{m(\Omega)}$(同一个式子,计数换成测度)。
贝特朗悖论:不说清「对什么等可能」,同一道题能给出 $\frac13$、$\frac14$、$\frac12$ 三个答案。 等可能是模型假设,要为它负责。
到现在为止,概率都是一次性算出来的:给定 $\Omega$,数一数,完事。 可现实里信息是陆续到来的——三门问题里,主持人一开门,那扇门的概率就变了。 已经知道了一部分事实,剩下的概率该怎么改?
条件概率是「概率更新」的数学工具,贝叶斯定理是 AI 做推理与学习的核心算法之一。 从这一讲起,概率不再是一个静态的数,而是随信息变化的量。
彩票从 1–30 中选 6 个数字。你买了一注 $\{1,7,15,21,26,30\}$。
知道一个号码之后,中奖概率涨到 5 倍。
概率本身没变,变的是我们站在哪个样本空间上看它。 第 (2) 问里,$\Omega$ 已经从「全部 $C_{30}^6$ 注」缩成了「含 15 的那些注」。
在事件 $B$ 发生的情况下事件 $A$ 发生的概率,称为 $A$ 在给定 $B$ 下的 条件概率,记为 $P(A\mid B)$。
相对地,$P(A)$ 称为无条件概率。本课程只考虑 $P(B)>0$ 的情形。
概率论在数理统计中的一个主要用途,就是当观察到某事件发生时,更新概率。 统计推断的整个过程——从数据反推模型——本质上都是在算条件概率。
$P(A\mid B)$ 读作「在 $B$ 已发生的条件下 $A$ 的概率」。 竖线不是除号,也没有先后顺序的含义—— $B$ 可以是后发生的事(比如已知结果反推原因)。
在古典概型下 $P(A)=\dfrac{\sharp A}{\sharp\Omega}$,$P(B)=\dfrac{\sharp B}{\sharp\Omega}$。
已知 $B$ 发生,样本空间就缩成了 $B$。此时 $A$ 也发生, 意味着结果落在 $A\cap B$ 里: $$P(A\mid B)=\frac{\sharp(A\cap B)}{\sharp B} =\frac{\sharp(A\cap B)/\sharp\Omega}{\sharp B/\sharp\Omega}=\frac{P(AB)}{P(B)}$$
于是有条件概率公式 $$\boxed{\;P(A\mid B)=\frac{P(AB)}{P(B)}\;}$$
无条件概率的分母是 $\Omega$,条件概率的分母是 $B$。 「除以 $P(B)$」这个动作,就是「把 $B$ 当成新的全集重新归一化」。
回到彩票题,用公式重算第 (2) 问:
$$P(\text{中奖}\mid 15\text{ 中})=\frac{1/C_{30}^6}{C_{29}^5/C_{30}^6}=\frac{1}{C_{29}^5}$$与刚才「直接在缩小的空间里数」结果一致。
同时掷两个骰子,已知两数之和是奇数,求和小于 8 的概率。
$B$=和为奇数,$P(B)=\frac12$; $A\cap B$=和为 $3,5,7$,共 $2+4+6=12$ 种,$P(AB)=\frac{12}{36}=\frac13$。 $$P(A\mid B)=\frac{1/3}{1/2}=\frac23$$
反复掷两个骰子,观察点数之和。求和为 7 先于和为 8 出现的概率。
大部分回合既不是 7 也不是 8,它们什么也没决定,可以整体忽略。 只需看「第一次出现 7 或 8 时,它是 7 吗」。
记 $A$=和为 7,$B$=和为 7 或 8。和为 7 有 6 种,和为 8 有 5 种: $$P(A\mid B)=\frac{P(A\cap B)}{P(B)}=\frac{6/36}{11/36}=\frac{6}{11}$$
题面是一个无穷次的试验,条件概率把它化成了一次。 「只在相关的那部分样本空间里比较」——这是条件概率最常用的一种解题姿势。
把条件概率公式移项即得 $$P(AB)=P(A\mid B)P(B)=P(B\mid A)P(A)$$
推广到 $n$ 个事件(链式法则): $$P(A_1A_2\cdots A_n)=P(A_1)P(A_2\mid A_1)P(A_3\mid A_1A_2)\cdots$$
盒中有 $r$ 个红球、$b$ 个蓝球,依次不放回取两个球。 求第一个红、第二个蓝的概率。
$$P(AB)=P(A)P(B\mid A)=\frac{r}{r+b}\cdot\frac{b}{r+b-1}$$
有些试验里条件概率比无条件概率容易算(比如「已经拿走一个红球之后」)。 这时就反过来,用条件概率去拼出无条件概率。
每次购买时,有 $1/3$ 的概率买与上次相同的品牌,$2/3$ 换品牌。 第一次等可能地选 A 或 B。求前两次买 A、后两次买 B 的概率。
用链式法则逐步展开: $$P(A_1A_2B_3B_4)=P(A_1)P(A_2\mid A_1)P(B_3\mid A_1A_2)P(B_4\mid A_1A_2B_3)$$ $$=\frac12\cdot\frac13\cdot\frac23\cdot\frac13=\frac{1}{27}$$
一张蓝牌、四张红牌(记为 A、B、C、D)。随机取两张。
(1) 已知 A 被选中,求两张都是红牌的概率;
(2) 已知至少一张是红牌,求两张都是红牌的概率。
$$\text{(1)}\ \frac{C_3^1/C_5^2}{C_4^1/C_5^2}=\frac34=0.75 \qquad \text{(2)}\ \frac{C_4^2/C_5^2}{1}=\frac{6}{10}=0.6$$
右边这两问值得对照着看:「A 被选中」比「至少一张红牌」是更强的信息 (后者其实必然发生,$P=1$),所以给出的条件概率更高。本讲末尾会专门辨析这件事。
两盒球:第一盒 60 红 40 蓝,第二盒 10 红 20 蓝。 先随机取一盒,再从中随机取一球。求取到红球的概率。
$$P(B)=P(B\mid A_1)P(A_1)+P(B\mid A_2)P(A_2) =\frac{60}{100}\cdot\frac12+\frac{10}{30}\cdot\frac12=\frac{7}{15}$$
若 $A_1,A_2,\dots$ 构成完备事件组且都有正概率,则对任一事件 $B$ $$P(B)=\sum_i P(B\mid A_i)P(A_i)$$
盒里有 3 枚两面都是正的硬币、4 枚两面都是反的、2 枚正常硬币。 随机取一枚抛一次,求得到正面的概率。
按取到哪种硬币分三类: $$P(A)=1\cdot\frac39+0\cdot\frac49+\frac12\cdot\frac29=\frac49$$
规则同前,但第一次买 A 的概率为 $1/4$、买 B 为 $3/4$。求第二次买 B 的概率。
按第一次买了什么分两类: $$P(B_2)=P(B_2\mid A_1)P(A_1)+P(B_2\mid B_1)P(B_1)$$ $$=\frac23\cdot\frac14+\frac13\cdot\frac34=\frac{5}{12}$$
三步:① 找一个完备事件组(「按什么分类」)② 算每一类的权重 $P(A_i)$ ③ 算每一类里的条件概率 $P(B\mid A_i)$,然后加权平均。 难点永远在第 ①步——分对了类,后面是机械的。
一个游戏,第一轮得分 $X$ 等可能地取 $1$ 至 $50$。之后反复玩, 直到出现分数 $Y\ge X$ 为止。求 $Y=50$ 的概率。
记 $B_i=\{X=i\}$,它们构成完备事件组,$P(B_i)=\frac1{50}$。
已知 $X=i$,后续只在 $\{i,i+1,\dots,50\}$ 这 $51-i$ 个分数里等可能地首次命中,故 $$P(Y=50\mid B_i)=\frac{1}{51-i}$$
$$P(Y=50)=\sum_{i=1}^{50}\frac{1}{50}\cdot\frac{1}{51-i}\approx0.090$$注意 $P(Y=50\mid B_i)$ 这一步:它又是一个条件概率技巧 ——把「反复试到成功」压缩成「只看相关的那些结果」,和第 9 页的 7 先于 8 是同一招。
固定 $B$,把 $P(\cdot\mid B)$ 看成一个函数,它满足第 1 讲的三条公理, 因此第 1 讲的全部性质原样成立:
$$P(\overline{A}\mid B)=1-P(A\mid B)$$ $$P(A\cup C\mid B)=P(A\mid B)+P(C\mid B)-P(A\cap C\mid B)$$不必为条件概率另立一套性质。但注意:竖线右边必须始终是同一个 $B$。 $P(A\mid B)+P(A\mid\overline{B})$ 一般不等于 1——那是两个不同的样本空间上的数。
三者是同一个式子的三种用法。接下来把它们合起来,就得到本讲的主角。
某病发病率万分之一。检测方法:真患病者 90% 检出阳性, 未患病者 10% 误报。某人检测为阳性,求其实际患病的概率。
检测之前,此人患病的概率是 $0.0001$——这是先验概率。
现在有了「检测阳性」这条新信息,要把它更新成 $P(\text{患病}\mid\text{阳性})$ ——这是后验概率。
注意方向:题目给的是 $P(\text{阳性}\mid\text{患病})=0.9$, 要求的是 $P(\text{患病}\mid\text{阳性})$。两者不是一回事。
若 $A_1,A_2,\dots$ 构成完备事件组且都有正概率,则对任一 $P(B)>0$ 的事件 $B$ $$P(A_m\mid B)=\frac{P(A_m)P(B\mid A_m)}{\sum_i P(A_i)P(B\mid A_i)}$$
$$\underbrace{P(A_m\mid B)}_{\text{后验}}=\frac{\overbrace{P(B\mid A_m)}^{\text{似然}}\times\overbrace{P(A_m)}^{\text{先验}}}{\underbrace{P(B)}_{\text{归一化}}}$$ 新证据不能单独说话,它必须乘上「这件事本来有多常见」。
记 $B_1$=患病、$B_2$=未患病、$A$=检测阳性: $$P(B_1\mid A)=\frac{P(A\mid B_1)P(B_1)}{P(A\mid B_1)P(B_1)+P(A\mid B_2)P(B_2)}$$ $$=\frac{0.9\times0.0001}{0.9\times0.0001+0.1\times0.9999} =\frac{0.00009}{0.10008}\approx0.0009$$
关键在分母里的第二项。设想 100 万人: 真患病的只有 100 人,其中 90 人测出阳性; 而健康的 999 900 人里,有 99 990 人被误报。
阳性的人共约 10 万,真患病的只有 90 个。误报的绝对数量压倒了真报 ——不是因为检测不准,是因为健康的人实在太多了。
三个滑块:违约率(先验)、查全率、误报率。 右边一万个方块是「自然频率」的图形版。
把违约率从 2% 拖到 20%,其余不动。 看后验从 15% 跳到 82%——模型一个字没改,结论天翻地覆。
交互演示:拖动先验与两类错误率,观察后验概率
风险判断从 1% 更新到 10.8%,涨了十倍。
10.8% 意味着被标记的人里,近九成其实不会违约。 直接据此拒贷会错杀大量好客户。「风险上升十倍」与「这个人会违约」是两回事。
三台机器 $M_1,M_2,M_3$ 分别生产 20%、30%、50% 的产品, 次品率分别为 1%、2%、3%。随机抽到一件次品,求它是 $M_2$ 生产的概率。
先验 $P(B_2)=0.30$,后验 $P(B_2\mid A)=0.26$——反而降了。
因为 $M_3$ 既产量最大又次品率最高,「是次品」这条证据把嫌疑更多地推给了 $M_3$。 后验不一定比先验大——证据往哪边推,取决于似然的相对大小。
若事件 $A$ 发生的可能性不受 $B$ 发生与否的影响,即 $$P(A\mid B)=P(A)$$ 则称 $A$ 对 $B$ 独立。
互斥是集合关系($A\cap B=\varnothing$,一个发生另一个必不发生,极强的关联); 独立是概率关系($P(AB)=P(A)P(B)$,一个发生与否不改变另一个)。 两个正概率事件若互斥,则一定不独立。
掷一枚骰子,$A$=掷得偶数,$B$=掷得 $\{1,2,3,4\}$。$A$ 与 $B$ 独立吗?
$P(A)=\frac12$,$P(B)=\frac23$,$AB=\{2,4\}$: $$P(AB)=\frac13=\frac12\times\frac23=P(A)P(B)$$ 独立。——虽然两个事件明显有重叠,看上去毫不「无关」。
抛硬币两次。$A$=第一次正面,$B$=第二次正面,$C$=两次结果相同。 考察三者的独立性。
三个事件两两独立(各自验证 $P=\frac14=\frac12\times\frac12$), 但 $P(ABC)=\frac14\ne\frac18=P(A)P(B)P(C)$。
两两独立不等于相互独立。
左例说明:独立是一个算出来的性质,不是看出来的直觉。 右例说明:多个事件的独立性,必须每一个子集都验证乘法式,不能只两两验。
机器次品率 $p$,各件是否次品相互独立。
第二问用了对立事件——「至少一个」还是先看反面,第 1 讲的习惯。
$n$ 次重复试验相互独立、每次事件 $A$ 的概率均为 $p$, 称为 $n$ 重贝努里试验。$A$ 恰好发生 $k$ 次的概率 $$p_n(k)=C_n^k p^k(1-p)^{n-k}$$
$C_n^k$ 又称二项式系数,因为 $(a+b)^n=\sum_{k=0}^n C_n^k a^{n-k}b^k$。
再看一道:一直抽到发现第 5 件次品为止,恰好抽了 $n$ 件的概率是 $C_{n-1}^4p^5(1-p)^{n-5}$——前 $n-1$ 件里恰好 4 件次品,第 $n$ 件必须是次品。
$p_n(k)$ 这个式子请记住。第 4 讲它会有个名字:二项分布。
某家庭有 5 个孩子,每个孩子蓝眼睛的概率 $1/4$,相互独立。 问「至少有三个孩子是蓝眼睛」的概率,在以下两种已知条件下分别是多少?
最小的已确定,只需剩下 4 个里再出现 $\ge2$ 个: $$\sum_{k=2}^{4}C_4^k\Big(\tfrac14\Big)^k\Big(\tfrac34\Big)^{4-k}=\frac{67}{256}\approx0.262$$
因为「最小的那个是蓝眼睛」是强得多的信息。 (a) 只排除了「五个都不是」这 1 种情形; (b) 排除了「最小的不是」的全部情形——占了样本空间的 $3/4$。 样本空间收缩得越厉害,条件概率变得越多。
| 名称 | 公式 | 什么时候用 |
|---|---|---|
| 条件概率 | $P(A\mid B)=\dfrac{P(AB)}{P(B)}$ | 已知一部分事实,重算概率 |
| 乘法法则 | $P(AB)=P(A\mid B)P(B)$ | 条件概率好算,联合概率难算 |
| 全概率公式 | $P(B)=\sum_i P(B\mid A_i)P(A_i)$ | 由「原因」算「结果」 |
| 贝叶斯定理 | $P(A_m\mid B)=\dfrac{P(A_m)P(B\mid A_m)}{\sum_i P(A_i)P(B\mid A_i)}$ | 由「结果」反推「原因」 |
| 独立性 | $P(A\mid B)=P(A)\iff P(AB)=P(A)P(B)$ | 判断信息是否起作用 |
| 贝努里定理 | $p_n(k)=C_n^kp^k(1-p)^{n-k}$ | $n$ 次独立重复,恰好成功 $k$ 次 |
结论:知道什么时候可以借独立性简化模型、什么时候必须正视事件间的关联, 是概率论应用里最核心的一项判断力。
把 100 笔住房抵押贷款打包成一个结构化产品。单笔违约概率 $p=5\%$。 产品的优先级份额只在违约笔数超过 30 时才会受损。这份额有多安全?
用贝努里定理: $$P(\text{至少 30 笔违约})=\sum_{k=30}^{100}C_{100}^k(0.05)^k(0.95)^{100-k}$$ $$\approx8.6\times10^{-16}$$
比连续中两次头奖还罕见。这份额看起来几乎无风险。
房价是共同因素:一个区域的房价一起跌,违约就会一起发生。 极端情形(完全相关)下,要么几乎没人违约,要么大家一起违约: $$P(\text{至少 30 笔违约})\approx p=5\%$$
同一批贷款,两个假设下的风险差了约 14 个数量级。
2007–2008 年,大量结构化产品正是在「违约相关性很低」这一假设下拿到最高评级的。 房价同步下跌后假设失效——错的不是乘法法则,是它的前提。
想知道 $P(\text{垃圾}\mid\text{内容})$,直接算很难;但反过来统计 「垃圾邮件里出现某些词的频率」很容易。于是 $$\underbrace{P(\text{垃圾}\mid\text{内容})}_{\text{后验}} =\frac{\overbrace{P(\text{内容}\mid\text{垃圾})}^{\text{似然}}\times\overbrace{P(\text{垃圾})}^{\text{先验}}}{P(\text{内容})}$$
「内容」含很多词,$P(\text{「免费」且「发票」}\mid\text{垃圾})$ 依然难算。 于是假设给定类别后各词相互独立: $$P(\text{「免费」且「发票」}\mid\text{垃圾}) =P(\text{「免费」}\mid\text{垃圾})\times P(\text{「发票」}\mid\text{垃圾})$$ 复杂的联合概率被拆成一串乘积。
分别算出「是垃圾」与「是正常」的后验,哪个大归哪类——分类器就成了。 它用的全部工具本讲都讲过:这一讲讲完,你已经能推导一个真实在用的 AI 算法。
阳性结果下真患病的概率是 0.09%,不是 90%。 直觉之所以错一千倍,是因为它把 $P(\text{阳性}\mid\text{患病})$ 当成了 $P(\text{患病}\mid\text{阳性})$ ——方向反了。
贝叶斯定理做的事,就是把方向掰回来:证据再强,也要先乘上「这件事本来有多常见」。 哈佛医学院的受访者不是不会算术,是漏掉了基础比率这一项。
注意本讲最后那个式子:$p_n(k)=C_n^kp^k(1-p)^{n-k}$。 它把「恰好成功 $k$ 次」的概率写成了$k$ 的一个函数 ——$k$ 取遍 $0,1,\dots,n$,就得到一整张概率表。
与其每次都问「某个事件的概率是多少」,不如一次性描述一个数量的全部可能取值及其概率。 下一讲:把这个「数量」正式定义为随机变量。