条件概率与事件独立性

第 3 讲 · 概率论与数理统计

复旦大学经济学院 ECON130001

上一讲我们做了什么

给了基本事件概率两种来源

古典概型 $P(A)=\dfrac{\sharp A}{\sharp\Omega}$(有限 + 等可能,难点在计数); 几何概型 $P(A)=\dfrac{m(A)}{m(\Omega)}$(同一个式子,计数换成测度)。

也看清了代价

贝特朗悖论:不说清「对什么等可能」,同一道题能给出 $\frac13$、$\frac14$、$\frac12$ 三个答案。 等可能是模型假设,要为它负责。

★ 留下的问题

到现在为止,概率都是一次性算出来的:给定 $\Omega$,数一数,完事。 可现实里信息是陆续到来的——三门问题里,主持人一开门,那扇门的概率就变了。 已经知道了一部分事实,剩下的概率该怎么改?

为什么需要这一讲

场景 一种病,人群中每一万人有一个。检测方法「可靠性 90%」: 真患病的人 90% 会测出阳性,没病的人有 10% 会误报。 你去做了检测,结果是阳性。
冲突 你多半会想:「90% 准,那我大概有九成可能真的病了。」
这不是外行的想法。1978 年 Casscells 等人在《新英格兰医学杂志》上, 拿一道结构完全相同的题去问哈佛医学院的教师、住院医师和学生: 发病率千分之一、误报率 5%,测出阳性后患病概率是多少? 多数人答 95%。正确答案约 2%。
悬念 我们这道题的正确答案是 0.09%——不到千分之一。 直觉的答案和它差了一千倍
同样几个数字,为什么算出来天差地别?问题出在哪一步?
来源 Casscells W., Schoenberger A., Graboys T. B. (1978). Interpretation by Physicians of Clinical Laboratory Results. New England Journal of Medicine, 299(18), 999–1001. 题设为发病率 $1/1000$、假阳性率 5%,多数受访者答 95%,正确答案约 2%。 pubmed.ncbi.nlm.nih.gov/692627|访问日期 2026-08-01。
本页正文所用的「发病率万分之一、检出率 90%、误报率 10%」是本课程教材的题设, 与该研究的数字不同,结论方向一致。

本讲学习目标

  1. 会用条件概率把「已知一部分事实」翻译成样本空间的收缩
  2. 掌握三个连环工具:乘法法则 → 全概率公式 → 贝叶斯定理,并知道各自该在什么时候用
  3. 说清独立互斥的区别,并知道错误的独立性假设能造成多大的灾难
这一讲的位置

条件概率是「概率更新」的数学工具,贝叶斯定理是 AI 做推理与学习的核心算法之一。 从这一讲起,概率不再是一个静态的数,而是随信息变化的量

先看一个数怎么被信息改变

彩票从 1–30 中选 6 个数字。你买了一注 $\{1,7,15,21,26,30\}$。

  1. 中奖的概率是多少?
  2. 如果你已经知道 15 是中奖号码之一,中奖概率变成多少?
$$\text{(1)}\quad \frac{1}{C_{30}^6}=\frac{1}{593775}\approx1.7\times10^{-6}$$ $$\text{(2)}\quad \frac{1}{C_{29}^5}=\frac{1}{118755}\approx8.4\times10^{-6}$$

知道一个号码之后,中奖概率涨到 5 倍

发生了什么

概率本身没变,变的是我们站在哪个样本空间上看它。 第 (2) 问里,$\Omega$ 已经从「全部 $C_{30}^6$ 注」缩成了「含 15 的那些注」。

条件概率的定义

定义

在事件 $B$ 发生的情况下事件 $A$ 发生的概率,称为 $A$ 在给定 $B$ 下的 条件概率,记为 $P(A\mid B)$。

相对地,$P(A)$ 称为无条件概率。本课程只考虑 $P(B)>0$ 的情形。

为什么它重要

概率论在数理统计中的一个主要用途,就是当观察到某事件发生时,更新概率。 统计推断的整个过程——从数据反推模型——本质上都是在算条件概率。

读法上的一个提醒

$P(A\mid B)$ 读作「在 $B$ 已发生的条件下 $A$ 的概率」。 竖线不是除号,也没有先后顺序的含义—— $B$ 可以是后发生的事(比如已知结果反推原因)。

公式是怎么来的:样本空间的收缩

从古典概型推出条件概率公式

在古典概型下 $P(A)=\dfrac{\sharp A}{\sharp\Omega}$,$P(B)=\dfrac{\sharp B}{\sharp\Omega}$。

已知 $B$ 发生,样本空间就缩成了 $B$。此时 $A$ 也发生, 意味着结果落在 $A\cap B$ 里: $$P(A\mid B)=\frac{\sharp(A\cap B)}{\sharp B} =\frac{\sharp(A\cap B)/\sharp\Omega}{\sharp B/\sharp\Omega}=\frac{P(AB)}{P(B)}$$

于是有条件概率公式 $$\boxed{\;P(A\mid B)=\frac{P(AB)}{P(B)}\;}$$

分母换了,这是全部的秘密

无条件概率的分母是 $\Omega$,条件概率的分母是 $B$。 「除以 $P(B)$」这个动作,就是「把 $B$ 当成新的全集重新归一化」。

用一下:两道骰子题

回到彩票题,用公式重算第 (2) 问:

$$P(\text{中奖}\mid 15\text{ 中})=\frac{1/C_{30}^6}{C_{29}^5/C_{30}^6}=\frac{1}{C_{29}^5}$$

与刚才「直接在缩小的空间里数」结果一致。

同时掷两个骰子,已知两数之和是奇数,求和小于 8 的概率。

$B$=和为奇数,$P(B)=\frac12$; $A\cap B$=和为 $3,5,7$,共 $2+4+6=12$ 种,$P(AB)=\frac{12}{36}=\frac13$。 $$P(A\mid B)=\frac{1/3}{1/2}=\frac23$$

一道需要转个弯的题

反复掷两个骰子,观察点数之和。求和为 7 先于和为 8 出现的概率。

解:把无穷次试验压成一次

大部分回合既不是 7 也不是 8,它们什么也没决定,可以整体忽略。 只需看「第一次出现 7 或 8 时,它是 7 吗」。

记 $A$=和为 7,$B$=和为 7 或 8。和为 7 有 6 种,和为 8 有 5 种: $$P(A\mid B)=\frac{P(A\cap B)}{P(B)}=\frac{6/36}{11/36}=\frac{6}{11}$$

这道题的价值

题面是一个无穷次的试验,条件概率把它化成了一次。 「只在相关的那部分样本空间里比较」——这是条件概率最常用的一种解题姿势。

反过来用:乘法法则

概率的乘法法则

把条件概率公式移项即得 $$P(AB)=P(A\mid B)P(B)=P(B\mid A)P(A)$$

推广到 $n$ 个事件(链式法则): $$P(A_1A_2\cdots A_n)=P(A_1)P(A_2\mid A_1)P(A_3\mid A_1A_2)\cdots$$

盒中有 $r$ 个红球、$b$ 个蓝球,依次不放回取两个球。 求第一个红、第二个蓝的概率。

$$P(AB)=P(A)P(B\mid A)=\frac{r}{r+b}\cdot\frac{b}{r+b-1}$$

用它的时机

有些试验里条件概率比无条件概率容易算(比如「已经拿走一个红球之后」)。 这时就反过来,用条件概率去拼出无条件概率。

乘法法则的两道例题

例:换牙膏

每次购买时,有 $1/3$ 的概率买与上次相同的品牌,$2/3$ 换品牌。 第一次等可能地选 A 或 B。求前两次买 A、后两次买 B 的概率。

用链式法则逐步展开: $$P(A_1A_2B_3B_4)=P(A_1)P(A_2\mid A_1)P(B_3\mid A_1A_2)P(B_4\mid A_1A_2B_3)$$ $$=\frac12\cdot\frac13\cdot\frac23\cdot\frac13=\frac{1}{27}$$

例:抽牌

一张蓝牌、四张红牌(记为 A、B、C、D)。随机取两张。

(1) 已知 A 被选中,求两张都是红牌的概率;
(2) 已知至少一张是红牌,求两张都是红牌的概率。

$$\text{(1)}\ \frac{C_3^1/C_5^2}{C_4^1/C_5^2}=\frac34=0.75 \qquad \text{(2)}\ \frac{C_4^2/C_5^2}{1}=\frac{6}{10}=0.6$$

右边这两问值得对照着看:「A 被选中」比「至少一张红牌」是更强的信息 (后者其实必然发生,$P=1$),所以给出的条件概率更高。本讲末尾会专门辨析这件事。

全概率公式:把复杂事件拆开算

两盒球:第一盒 60 红 40 蓝,第二盒 10 红 20 蓝。 先随机取一盒,再从中随机取一球。求取到红球的概率。

$$P(B)=P(B\mid A_1)P(A_1)+P(B\mid A_2)P(A_2) =\frac{60}{100}\cdot\frac12+\frac{10}{30}\cdot\frac12=\frac{7}{15}$$

全概率定理

若 $A_1,A_2,\dots$ 构成完备事件组且都有正概率,则对任一事件 $B$ $$P(B)=\sum_i P(B\mid A_i)P(A_i)$$

证明思路 由完备事件组,$B=\bigcup_i (B\cap A_i)$ 且各项两两互斥;用可列可加性拆开, 再对每一项用乘法法则 $P(BA_i)=P(B\mid A_i)P(A_i)$。 这正是第 1 讲命题 5「按一个事件分情形」的概率版本。完整证明见教师笔记。

全概率公式的两道例题

例:硬币

盒里有 3 枚两面都是正的硬币、4 枚两面都是反的、2 枚正常硬币。 随机取一枚抛一次,求得到正面的概率。

按取到哪种硬币分三类: $$P(A)=1\cdot\frac39+0\cdot\frac49+\frac12\cdot\frac29=\frac49$$

例:换牙膏(续)

规则同前,但第一次买 A 的概率为 $1/4$、买 B 为 $3/4$。求第二次买 B 的概率。

按第一次买了什么分两类: $$P(B_2)=P(B_2\mid A_1)P(A_1)+P(B_2\mid B_1)P(B_1)$$ $$=\frac23\cdot\frac14+\frac13\cdot\frac34=\frac{5}{12}$$

全概率公式的使用套路

三步:① 找一个完备事件组(「按什么分类」)② 算每一类的权重 $P(A_i)$ ③ 算每一类里的条件概率 $P(B\mid A_i)$,然后加权平均。 难点永远在第 ①步——分对了类,后面是机械的。

一道需要用「可列个」分类的题

一个游戏,第一轮得分 $X$ 等可能地取 $1$ 至 $50$。之后反复玩, 直到出现分数 $Y\ge X$ 为止。求 $Y=50$ 的概率。

解:按第一轮的得分分类

记 $B_i=\{X=i\}$,它们构成完备事件组,$P(B_i)=\frac1{50}$。

已知 $X=i$,后续只在 $\{i,i+1,\dots,50\}$ 这 $51-i$ 个分数里等可能地首次命中,故 $$P(Y=50\mid B_i)=\frac{1}{51-i}$$

$$P(Y=50)=\sum_{i=1}^{50}\frac{1}{50}\cdot\frac{1}{51-i}\approx0.090$$

注意 $P(Y=50\mid B_i)$ 这一步:它又是一个条件概率技巧 ——把「反复试到成功」压缩成「只看相关的那些结果」,和第 9 页的 7 先于 8 是同一招。

条件概率也是概率

运算性质

固定 $B$,把 $P(\cdot\mid B)$ 看成一个函数,它满足第 1 讲的三条公理, 因此第 1 讲的全部性质原样成立:

$$P(\overline{A}\mid B)=1-P(A\mid B)$$ $$P(A\cup C\mid B)=P(A\mid B)+P(C\mid B)-P(A\cap C\mid B)$$
证明思路 逐条验证三条公理:非负性显然;$P(\Omega\mid B)=P(\Omega B)/P(B)=1$; 可列可加性由 $(\bigcup_j A_j)\cap B=\bigcup_j(A_j\cap B)$ 与原可列可加性得到。 完整证明见教师笔记。
这条结论省掉了大量重复劳动

不必为条件概率另立一套性质。但注意:竖线右边必须始终是同一个 $B$。 $P(A\mid B)+P(A\mid\overline{B})$ 一般等于 1——那是两个不同的样本空间上的数。

小结:三个工具的关系

  • 条件概率 $P(A\mid B)=\dfrac{P(AB)}{P(B)}$——把已知的事实变成样本空间的收缩
  • 乘法法则 $P(AB)=P(A\mid B)P(B)$——同一个式子反过来用,由条件概率拼出联合概率
  • 全概率公式 $P(B)=\sum_i P(B\mid A_i)P(A_i)$——分类、加权、求和

三者是同一个式子的三种用法。接下来把它们合起来,就得到本讲的主角。

回到开场那道题

某病发病率万分之一。检测方法:真患病者 90% 检出阳性, 未患病者 10% 误报。某人检测为阳性,求其实际患病的概率。

现在能说清楚在求什么了

检测之前,此人患病的概率是 $0.0001$——这是先验概率

现在有了「检测阳性」这条新信息,要把它更新成 $P(\text{患病}\mid\text{阳性})$ ——这是后验概率

注意方向:题目给的是 $P(\text{阳性}\mid\text{患病})=0.9$, 要求的是 $P(\text{患病}\mid\text{阳性})$。两者不是一回事。

贝叶斯定理

定理

若 $A_1,A_2,\dots$ 构成完备事件组且都有正概率,则对任一 $P(B)>0$ 的事件 $B$ $$P(A_m\mid B)=\frac{P(A_m)P(B\mid A_m)}{\sum_i P(A_i)P(B\mid A_i)}$$

证明思路 分子用乘法法则 $P(A_mB)=P(A_m)P(B\mid A_m)$,分母用全概率公式展开 $P(B)$, 两者相除即条件概率的定义。贝叶斯定理不是新东西,是前面三个工具的组合。 完整证明见教师笔记。
怎么读这个式子

$$\underbrace{P(A_m\mid B)}_{\text{后验}}=\frac{\overbrace{P(B\mid A_m)}^{\text{似然}}\times\overbrace{P(A_m)}^{\text{先验}}}{\underbrace{P(B)}_{\text{归一化}}}$$ 新证据不能单独说话,它必须乘上「这件事本来有多常见」。

算出来:0.09%

记 $B_1$=患病、$B_2$=未患病、$A$=检测阳性: $$P(B_1\mid A)=\frac{P(A\mid B_1)P(B_1)}{P(A\mid B_1)P(B_1)+P(A\mid B_2)P(B_2)}$$ $$=\frac{0.9\times0.0001}{0.9\times0.0001+0.1\times0.9999} =\frac{0.00009}{0.10008}\approx0.0009$$

为什么直觉会错一千倍

关键在分母里的第二项。设想 100 万人: 真患病的只有 100 人,其中 90 人测出阳性; 而健康的 999 900 人里,有 99 990 人被误报。

阳性的人共约 10 万,真患病的只有 90 个。误报的绝对数量压倒了真报 ——不是因为检测不准,是因为健康的人实在太多了

交互:信贷违约的贝叶斯更新

怎么用

三个滑块:违约率(先验)、查全率、误报率。 右边一万个方块是「自然频率」的图形版。

当堂要做的实验

违约率从 2% 拖到 20%,其余不动。 看后验从 15% 跳到 82%——模型一个字没改,结论天翻地覆。

应用:AI 信用风险评估

场景
  • 先验:历史数据显示任一申请人未来违约的概率 $P(\text{违约})=0.01$
  • 证据:模型发现该申请人「近 3 个月有信用卡逾期记录」
  • 违约客户中有此特征的比例 $P(\text{逾期}\mid\text{违约})=0.6$
  • 未违约客户中有此特征的比例 $P(\text{逾期}\mid\text{不违约})=0.05$
后验 $$P(\text{违约}\mid\text{逾期})=\frac{0.6\times0.01}{0.6\times0.01+0.05\times0.99} =\frac{0.006}{0.0555}\approx10.8\%$$

风险判断从 1% 更新到 10.8%,涨了十倍。

但也要读出另一面

10.8% 意味着被标记的人里,近九成其实不会违约。 直接据此拒贷会错杀大量好客户。「风险上升十倍」与「这个人会违约」是两回事。

再练一道:次品是哪台机器做的

三台机器 $M_1,M_2,M_3$ 分别生产 20%、30%、50% 的产品, 次品率分别为 1%、2%、3%。随机抽到一件次品,求它是 $M_2$ 生产的概率。

$$P(B_2\mid A)=\frac{0.02\times0.30}{0.01\times0.20+0.02\times0.30+0.03\times0.50} =\frac{0.006}{0.023}\approx0.26$$

先验 $P(B_2)=0.30$,后验 $P(B_2\mid A)=0.26$——反而降了

为什么会降

因为 $M_3$ 既产量最大又次品率最高,「是次品」这条证据把嫌疑更多地推给了 $M_3$。 后验不一定比先验大——证据往哪边推,取决于似然的相对大小。

独立性:什么时候信息不起作用

定义

若事件 $A$ 发生的可能性不受 $B$ 发生与否的影响,即 $$P(A\mid B)=P(A)$$ 则称 $A$ 对 $B$ 独立

等价刻画与性质
  • $A,B$ 独立 $\iff P(AB)=P(A)P(B)$(对称,故「独立」不分主客)
  • 若 $A,B$ 独立,则 $A$ 与 $\overline{B}$、$\overline{A}$ 与 $B$、$\overline{A}$ 与 $\overline{B}$ 都独立
  • 若 $A_1,\dots,A_n$ 相互独立,则 $P\!\left(\bigcap_i A_i\right)=\prod_i P(A_i)$, $P\!\left(\bigcup_i A_i\right)=1-\prod_i P(\overline{A_i})$
★ 独立 $\ne$ 互斥

互斥是集合关系($A\cap B=\varnothing$,一个发生另一个必不发生,极强的关联); 独立是概率关系($P(AB)=P(A)P(B)$,一个发生与否不改变另一个)。 两个正概率事件若互斥,则一定独立。

两个例子:独立不是看着像就行

掷一枚骰子,$A$=掷得偶数,$B$=掷得 $\{1,2,3,4\}$。$A$ 与 $B$ 独立吗?

$P(A)=\frac12$,$P(B)=\frac23$,$AB=\{2,4\}$: $$P(AB)=\frac13=\frac12\times\frac23=P(A)P(B)$$ 独立。——虽然两个事件明显有重叠,看上去毫不「无关」。

抛硬币两次。$A$=第一次正面,$B$=第二次正面,$C$=两次结果相同。 考察三者的独立性。

三个事件两两独立(各自验证 $P=\frac14=\frac12\times\frac12$), 但 $P(ABC)=\frac14\ne\frac18=P(A)P(B)P(C)$。

两两独立不等于相互独立。

左例说明:独立是一个算出来的性质,不是看出来的直觉。 右例说明:多个事件的独立性,必须每一个子集都验证乘法式,不能只两两验。

独立性最有用的地方:重复试验

三道同源例题

机器次品率 $p$,各件是否次品相互独立。

  • 抽 6 件,恰有 2 件次品:$C_6^2p^2(1-p)^4$
  • 抽 6 件,至少 1 件次品:$1-(1-p)^6$
  • 抽 $n$ 件,恰有 $k$ 件次品:$C_n^kp^k(1-p)^{n-k}$

第二问用了对立事件——「至少一个」还是先看反面,第 1 讲的习惯。

贝努里定理

$n$ 次重复试验相互独立、每次事件 $A$ 的概率均为 $p$, 称为 $n$ 重贝努里试验。$A$ 恰好发生 $k$ 次的概率 $$p_n(k)=C_n^k p^k(1-p)^{n-k}$$

$C_n^k$ 又称二项式系数,因为 $(a+b)^n=\sum_{k=0}^n C_n^k a^{n-k}b^k$。

再看一道:一直抽到发现第 5 件次品为止,恰好抽了 $n$ 件的概率是 $C_{n-1}^4p^5(1-p)^{n-5}$——前 $n-1$ 件里恰好 4 件次品,第 $n$ 件必须是次品。

$p_n(k)$ 这个式子请记住。第 4 讲它会有个名字:二项分布

辨析:两条听起来差不多的信息

设定

某家庭有 5 个孩子,每个孩子蓝眼睛的概率 $1/4$,相互独立。 问「至少有三个孩子是蓝眼睛」的概率,在以下两种已知条件下分别是多少?

(a) 已知至少一个是蓝眼睛 $$P(B_{\ge3}\mid B_{\ge1})=\frac{P(B_{\ge3})}{1-(3/4)^5} =\frac{106/1024}{781/1024}=\frac{106}{781}\approx0.136$$
(b) 已知最小的那个是蓝眼睛

最小的已确定,只需剩下 4 个里再出现 $\ge2$ 个: $$\sum_{k=2}^{4}C_4^k\Big(\tfrac14\Big)^k\Big(\tfrac34\Big)^{4-k}=\frac{67}{256}\approx0.262$$

为什么差了近一倍

因为「最小的那个是蓝眼睛」是强得多的信息。 (a) 只排除了「五个都不是」这 1 种情形; (b) 排除了「最小的不是」的全部情形——占了样本空间的 $3/4$。 样本空间收缩得越厉害,条件概率变得越多。

公式小结

名称公式什么时候用
条件概率$P(A\mid B)=\dfrac{P(AB)}{P(B)}$已知一部分事实,重算概率
乘法法则$P(AB)=P(A\mid B)P(B)$条件概率好算,联合概率难算
全概率公式$P(B)=\sum_i P(B\mid A_i)P(A_i)$由「原因」算「结果」
贝叶斯定理$P(A_m\mid B)=\dfrac{P(A_m)P(B\mid A_m)}{\sum_i P(A_i)P(B\mid A_i)}$由「结果」反推「原因」
独立性$P(A\mid B)=P(A)\iff P(AB)=P(A)P(B)$判断信息是否起作用
贝努里定理$p_n(k)=C_n^kp^k(1-p)^{n-k}$$n$ 次独立重复,恰好成功 $k$ 次

独立性假设:一把双刃剑

用错了的代价
  • 现实中大量事件是相互关联
  • 错误地假设独立、然后套用 $P(A_1\cdots A_n)=\prod P(A_i)$, 结论可能与事实差若干个数量级
  • 下一页就是一个真实的例子
「天真」假设的威力
  • 朴素贝叶斯分类器做文本分类时, 「天真地」假设一封邮件里每个词的出现相互独立
  • 即 $P(\text{「免费」且「发票」}\mid\text{垃圾}) =P(\text{「免费」}\mid\text{垃圾})\times P(\text{「发票」}\mid\text{垃圾})$
  • 这个假设明显不符合语言事实,但实践中效果好得惊人,且算得飞快

结论:知道什么时候可以借独立性简化模型、什么时候必须正视事件间的关联, 是概率论应用里最核心的一项判断力。

案例:当「独立」这个假设塌掉

场景

把 100 笔住房抵押贷款打包成一个结构化产品。单笔违约概率 $p=5\%$。 产品的优先级份额只在违约笔数超过 30 时才会受损。这份额有多安全?

假设各笔违约相互独立

用贝努里定理: $$P(\text{至少 30 笔违约})=\sum_{k=30}^{100}C_{100}^k(0.05)^k(0.95)^{100-k}$$ $$\approx8.6\times10^{-16}$$

比连续中两次头奖还罕见。这份额看起来几乎无风险。

但如果它们高度相关

房价是共同因素:一个区域的房价一起跌,违约就会一起发生。 极端情形(完全相关)下,要么几乎没人违约,要么大家一起违约: $$P(\text{至少 30 笔违约})\approx p=5\%$$

同一批贷款,两个假设下的风险差了约 14 个数量级。

2007–2008 年,大量结构化产品正是在「违约相关性很低」这一假设下拿到最高评级的。 房价同步下跌后假设失效——错的不是乘法法则,是它的前提。

来源与说明 上述两个概率为本课程的教学化演算:$n=100$、$p=0.05$ 的二项分布尾概率, 与完全相关情形下的对照,均可用本讲公式直接验证,不代表任何具体产品的真实参数。 2007–2008 年结构化产品评级失效与违约相关性假设的关系,属金融危机研究的公认结论, 此处仅作定性引用。

把本讲拼成一个真的 AI 算法

第一步:用贝叶斯定理反推

想知道 $P(\text{垃圾}\mid\text{内容})$,直接算很难;但反过来统计 「垃圾邮件里出现某些词的频率」很容易。于是 $$\underbrace{P(\text{垃圾}\mid\text{内容})}_{\text{后验}} =\frac{\overbrace{P(\text{内容}\mid\text{垃圾})}^{\text{似然}}\times\overbrace{P(\text{垃圾})}^{\text{先验}}}{P(\text{内容})}$$

第二步:那个「朴素」的独立性假设

「内容」含很多词,$P(\text{「免费」且「发票」}\mid\text{垃圾})$ 依然难算。 于是假设给定类别后各词相互独立: $$P(\text{「免费」且「发票」}\mid\text{垃圾}) =P(\text{「免费」}\mid\text{垃圾})\times P(\text{「发票」}\mid\text{垃圾})$$ 复杂的联合概率被拆成一串乘积。

第三步:决策

分别算出「是垃圾」与「是正常」的后验,哪个大归哪类——分类器就成了。 它用的全部工具本讲都讲过:这一讲讲完,你已经能推导一个真实在用的 AI 算法。

本讲总结

① 回到开场那个问题

阳性结果下真患病的概率是 0.09%,不是 90%。 直觉之所以错一千倍,是因为它把 $P(\text{阳性}\mid\text{患病})$ 当成了 $P(\text{患病}\mid\text{阳性})$ ——方向反了。

贝叶斯定理做的事,就是把方向掰回来:证据再强,也要先乘上「这件事本来有多常见」。 哈佛医学院的受访者不是不会算术,是漏掉了基础比率这一项。

② 核心结论
  • 条件概率就是样本空间的收缩:$P(A\mid B)=P(AB)/P(B)$
  • 由因算果用全概率公式,由果推因用贝叶斯定理
  • 独立 $\iff P(AB)=P(A)P(B)$;$n$ 重贝努里试验 $p_n(k)=C_n^kp^k(1-p)^{n-k}$

本讲总结(续)

③ 易错提醒
  • $P(A\mid B)\ne P(B\mid A)$。本讲一切错误的源头
  • 独立 $\ne$ 互斥。互斥是集合关系(强关联),独立是概率关系(无影响)
  • 两两独立 $\ne$ 相互独立。必须每个子集都验证
  • $P(A\mid B)+P(A\mid\overline B)$ 一般不等于 1——两个不同的样本空间
④ 下一讲

注意本讲最后那个式子:$p_n(k)=C_n^kp^k(1-p)^{n-k}$。 它把「恰好成功 $k$ 次」的概率写成了$k$ 的一个函数 ——$k$ 取遍 $0,1,\dots,n$,就得到一整张概率表。

与其每次都问「某个事件的概率是多少」,不如一次性描述一个数量的全部可能取值及其概率下一讲:把这个「数量」正式定义为随机变量。