复旦大学经济学院 ECON130001
条件概率 $P(A\mid B)=\dfrac{P(AB)}{P(B)}$ 是样本空间的收缩; 由因算果用全概率公式,由果推因用贝叶斯定理。
独立 $\iff P(AB)=P(A)P(B)$,它让 $n$ 重贝努里试验可算; 但假设错了,风险能低估十几个数量级。
上一讲最后那个式子 $p_n(k)=C_n^kp^k(1-p)^{n-k}$, 把「恰好成功 $k$ 次」的概率写成了 $k$ 的一个函数。
与其每次都问「某个事件的概率是多少」, 不如一次性描述一个数量的全部可能取值及其概率。这个「数量」该怎么定义?
抛 3 次硬币,$A=\{\text{恰好 2 次正面}\}=\{\text{正正反},\ \text{正反正},\ \text{反正正}\}$。
基金经理不关心导致股价波动的每一条新闻(具体事件), 只关心最终的涨跌幅——一个数值。
垃圾邮件过滤器最终要输出一个是垃圾邮件的得分——也是一个数值。
造一座桥,把样本空间里的每个结果(如「正正反」)映射到一个我们关心的数字(如 $2$)。 这座桥就是随机变量。
定义在样本空间上的实值函数,称为随机变量。
常用大写字母 $X,Y,Z$ 或希腊字母 $\eta,\zeta,\xi$ 表示。
$X$ 不是一个数,是一条规则:给定 $\omega\in\Omega$,返回一个实数 $X(\omega)$。 「随机」体现在 $\omega$ 是随机抽到的,$X$ 这条规则本身完全确定。
例:抛硬币 3 次,$X$=正面次数,则 $X(\text{正正反})=2$,$X(\text{反反反})=0$。
$\{X=2\}$ 就是事件 $\{\text{正正反},\text{正反正},\text{反正正}\}$ 的简写。 随机变量把事件的书写从「列举结果」变成了「写不等式」。
随机变量 $X$ 的分布,指对所有实数集 $C$,事件 $\{X\in C\}$ 的概率 $P(X\in C)$ 的全体。
只能取有限个或可列无穷个值。
例:抛硬币的正面次数、一天的索赔件数。
在一个区间上可以取所有值。
例:股票收益率、等车时间。第 5 讲
「跑赢年数」$X$ 只能取 $0,1,\dots,10$,是离散型。 我们要的正是它的整张分布表,而不是某一个 $P(X=10)$。
对离散型随机变量 $X$ 及其所有可能取值 $x$,定义 $$f(x)=P(X=x)$$ 称 $f$ 为 $X$ 的概率函数(也叫分布律)。
记 $p_k=f(x_k)$,则
反过来也成立:任何满足这两条的 $\{p_k\}$ 都定义了一个合法的分布。 这是后面「确定常数 $c$」那类题的依据。
| $X$ | $x_1$ | $x_2$ | $\cdots$ | $x_k$ |
|---|---|---|---|---|
| $p$ | $p_1$ | $p_2$ | $\cdots$ | $p_k$ |
函数式、图、表——三种写法内容完全相同,按场合选。
彩票选一个三位数,开奖从 $0$–$999$ 随机抽。中奖号码 $X$ 的概率函数: $$f(x)=\frac{1}{1000},\quad x=0,1,\dots,999$$ 若 $X$ 的 $n$ 个取值概率都是 $1/n$,称 $X$ 服从离散型均匀分布。
某人买彩票中奖率 $p$,没中就继续买下一期,直到中奖为止。 求购买次数 $\xi$ 的概率函数。
前 $k-1$ 次都没中、第 $k$ 次中: $$p_k=P(\xi=k)=p(1-p)^{k-1},\quad k=1,2,\dots$$ 这个式子马上会有名字
(1) $f(x)=cx,\ x=1,\dots,5$: $$c(1+2+3+4+5)=1\ \Rightarrow\ c=\tfrac{1}{15}$$
(2) $f(x)=c/2^x,\ x=0,1,2,\dots$: $$c\sum_{x=0}^{\infty}\tfrac{1}{2^x}=2c=1\ \Rightarrow\ c=\tfrac12$$
(2) 用到了等比级数求和。离散型的取值可以有可列无穷个, 这时归一化就是一个级数收敛的条件。
$X$ 服从参数为 $p$ 的伯努利分布,若 $X$ 只取 $0,1$,且 $$P(X=1)=p,\qquad P(X=0)=1-p$$
接下来的三个分布,全部由伯努利试验搭成:
AI 分类模型的输出就是一个伯努利随机变量的参数 $p$ ——它根据输入特征尽可能准地估出这个 $p$。
上一讲的贝叶斯分类器、本讲的伯努利分布,说的是同一件事的两面: 前者算 $p$,后者描述 $p$ 定下来之后的随机性。
机器有 10% 概率生产次品,各件独立。重复生产直到出现次品为止, 令 $X$ 为结束时生产的产品数量。$X$ 服从什么分布?
$X$ 服从参数为 $p$ 的几何分布,若 $$f(x)=\begin{cases}(1-p)^{x-1}p,& x=1,2,\dots\\[2pt] 0,&\text{其他}\end{cases}$$
含义:前 $x-1$ 次都失败(每次概率 $1-p$,独立相乘),第 $x$ 次成功。
几何:固定目标(第一次成功),数次数——$X$ 无上限。
二项:固定次数 $n$,数成功——$X$ 最多是 $n$。
两者哪个是随机的正好对调。
注意 $P(X>k)=(1-p)^k$ 这个式子有多好用——「至今尚未成功」的概率, 正面算只需一步。这是上一讲「先看对立事件」习惯的又一次兑现。
若 $X$ 服从几何分布,则对任意 $s,t\in\mathbb{N}$ $$P(X>s+t\mid X>t)=P(X>s)$$
「已经等了 $t$ 次还没成功」这个信息,对将来毫无价值。 再等 $s$ 次仍不成功的概率,和从头开始等 $s$ 次一模一样。
对照上一讲:这正是「独立」在时间维度上的表现——过去不携带关于未来的信息。
用在求职模型上,这个性质其实反直觉且多半不成立: 现实中失业越久越难找到工作(技能折旧、雇主筛选)。 模型的假设失效在哪里,比模型本身更值得想。
机器次品率 $p=10\%$,检查 $n$ 个产品。令 $X_i=1$ 表示第 $i$ 个是次品, 则 $X_1,\dots,X_n$ 独立同分布,都服从参数 $p$ 的伯努利分布。
令 $X=X_1+\cdots+X_n$ 为次品总数,$X$ 服从什么分布?
这正是上一讲的贝努里定理 $p_n(k)$——现在它有了名字和身份:一个随机变量的分布。
所以伯努利是二项的特例。「$n$ 个独立同分布伯努利变量之和」是二项分布最本质的刻画 ——第 8 讲中心极限定理会从这里出发。
切换四个分布,拖参数看形状。二项分布下还可勾选「叠加泊松逼近」。
交互演示:四个离散分布参数联动,含泊松逼近二项
假设基金经理毫无选股能力,每年跑赢基准的概率 $p=0.5$,各年独立。 10 年中跑赢的年数 $X\sim B(10,0.5)$。
确实罕见。
设有 5000 位经理,纯靠运气:
「连赢 10 年」在几千人的行业里几乎必然会落到某个人头上, 并不能据此推出他有能力——除非把「一共有多少次机会」也算进去。这叫多重比较,第 12 讲细讲。
右边这个推理——「若假设为真,观测到的结果极不可能,于是怀疑假设」 ——就是假设检验的全部逻辑。第 12 讲会给它一套严格的语言。 但请注意它与上一页的教训并不矛盾:前提是你只测了这一个模型。
对任意 $p,q$ 与正整数 $n$ $$(p+q)^n=\sum_{k=0}^{n}C_n^k p^k q^{n-k}$$
二项分布的归一化条件是二项式定理的直接推论。 「二项分布」这个名字正是由此而来。
二项分布的取值最多到 $n$。但有些量事先不知道上限:
我们需要一种新的离散分布,来描述 大量重复试验中「稀有事件」发生的次数 ——试验次数 $n$ 极大、单次概率 $p$ 极小,但平均次数 $np$ 是个正常的数。
顾客平均每小时 4.5 名。把一小时切成 3600 秒,假设每秒最多来一位顾客, 每秒来人的概率 $p=4.5/3600=0.00125$。于是一小时的顾客数 $X\sim B(3600,0.00125)$。
$C_{3600}^x$ 根本算不动;而且它无法描述顾客数超过 3600 的情况。
观察相邻两项之比:
$\dfrac{f(x+1)}{f(x)}=\dfrac{(n-x)p}{(x+1)(1-p)}\approx\dfrac{np}{x+1}$
——$n$ 与 $p$ 只以乘积 $np$ 出现。
$f(1)=\lambda f(0)$,$f(2)=\frac{\lambda^2}{2}f(0)$,$f(3)=\frac{\lambda^3}{6}f(0)$,…… 一般地 $f(x)=\frac{\lambda^x}{x!}f(0)$。
由归一化与 $\sum_{x\ge0}\lambda^x/x!=e^{\lambda}$ 得 $f(0)=e^{-\lambda}$,于是 $f(x)=\dfrac{e^{-\lambda}\lambda^x}{x!}$。
$X$ 服从参数为 $\lambda$ 的泊松分布,若 $$f(x)=\begin{cases}\dfrac{e^{-\lambda}\lambda^x}{x!},& x=0,1,2,\dots\\[4pt] 0,&\text{其他}\end{cases}$$
令 $\lambda_n=np_n$。若 $n\to\infty$ 且 $\lambda_n\to\lambda$,则 $B(n,p_n)$ 趋近于参数 $\lambda$ 的泊松分布。
实用判据:$n\ge20$ 且 $p\le0.05$ 时,用 $\lambda=np$ 的泊松分布近似二项分布, 误差已经很小。回到上一页的交互器,勾上「叠加泊松逼近」,把 $n$ 拖大、$p$ 拖小,两条线会重合。
大样本中某事件发生率 0.01,随机抽 200 人,求至少 4 人的概率。
精确(二项 $B(200,0.01)$): $$P(X\ge4)=1-\sum_{k=0}^{3}C_{200}^k(0.01)^k(0.99)^{200-k}=0.1420$$
近似(泊松 $\lambda=np=2$):$P(X\ge4)\approx0.1429$。 差 0.0009——完全够用,而计算量小得多。
一页书平均 $\lambda$ 处印错,错印数服从泊松分布。 求某页没有错印的概率。
$$P(X=0)=\frac{\lambda^0e^{-\lambda}}{0!}=e^{-\lambda}$$
若 $\lambda=0.5$,则 $e^{-0.5}\approx0.607$—— 平均每页半个错,仍有六成的页面是干净的。
一本书 $n$ 页,每页平均 $\lambda$ 个错误。求至少有 $m$ 页错误多于 $k$ 个的概率。
第一层(页内,泊松):某一页错误多于 $k$ 个的概率 $$p=\sum_{i=k+1}^{\infty}\frac{\lambda^ie^{-\lambda}}{i!}$$
第二层(页间,二项):整本书里「错误多于 $k$ 个」的页数 $X\sim B(n,p)$, $$P(X\ge m)=\sum_{x=m}^{n}C_n^xp^x(1-p)^{n-x}$$
198 座的飞机卖 200 张票,平均 1% 的乘客不出现。所有到场乘客都有座,需至少 2 人不出现: $X\sim B(200,0.01)\approx\text{Poisson}(2)$, $P(X\ge2)=1-3e^{-2}\approx0.5940$——只超售 2 张就有四成概率坐不下。
两个场景是同一个模式:用泊松分布刻画「正常水平」,再用尾概率定义「异常」。 这就是所有异常检测系统的骨架。
到这里,离散型随机变量已经能用概率函数 $f(x)=P(X=x)$ 完整描述了。
但这套写法对连续型行不通。 「等车时间恰好是 3.000000… 分钟」的概率是 0——每一点的概率都是 0, $f(x)=P(X=x)$ 全等于 0,什么信息都没带。
需要一个对两类都管用的描述方式。
对随机变量 $X$ 和任意实数 $x$,定义 $$F(x)=P(X\le x)$$ 称 $F$ 为 $X$ 的(累积)分布函数。
它问的不是「恰好等于 $x$ 的概率」,而是「不超过 $x$ 的概率」。 后者对连续型也是个有意义的正数。
$X$ 服从 0-1 分布,$P(X=0)=p$、$P(X=1)=1-p$。其分布函数为 $$F(x)=\begin{cases}0,& x<0\\ p,& 0\le x<1\\ 1,& x\ge1\end{cases}$$ ——一个阶梯函数,在每个取值点向上跳一格,跳的高度就是该点的概率。
它来自定义里那个 $\le$。若把定义改成 $F(x)=P(X<x)$,得到的就是左连续函数。 约定不同,公式全变——所以下一页那组公式必须和这个约定配套记。
对随机变量 $X$:
离散型:$F$ 在取值点跳跃,跳高就是 $P(X=x)$。
连续型:$F$ 处处连续,于是 $P(X=x)=0$——
每一点的概率都是 0,但落在区间里的概率不是 0。
这解释了上一页那个困惑:连续型不是「没有概率」, 是概率不集中在点上,而是摊在区间上。
对离散型随机变量 $X$ 及其概率函数 $p_k$, $$F(x)=\sum_{k:\,x_k\le x}p_k$$
$X$ 取 $-2,0,1,4$,概率分别 $0.4,0.1,0.3,0.2$。画 $F(x)$。
阶梯:在 $-2$ 跳到 $0.4$,在 $0$ 跳到 $0.5$,在 $1$ 跳到 $0.8$,在 $4$ 跳到 $1$。 四级台阶,高度和为 1。
反复抛硬币直到出现正面,$X$=抛的次数。画 $F(x)$。
$X$ 服从 $p=1/2$ 的几何分布,$P(X=k)=(1/2)^k$。 $$F(k)=1-(1/2)^{k}$$ 无穷多级台阶,越来越矮,永远够不到 1 但趋于 1。
在区间 $[4,10]$ 上任意抛一个质点,$X$ 为质点与原点的距离。 若落在任一子区间的概率与该区间长度成正比,求 $X$ 的分布函数。
没有台阶了——一条连续上升的折线。 任何一点的概率都是 0,但 $P(5<X\le7)=\frac{7-4}{6}-\frac{5-4}{6}=\frac13$。
连赢 10 年的概率确实只有 $1/1024$。但在 5000 位经理里, 至少出现一个这样的人的概率是 99.2%,赢 8 年以上的期望人数是 273 人。
只盯住一个事件的概率会看错;掌握「跑赢年数」的整张分布,才能把账算全。 这就是从「事件」升级到「随机变量」的意义。
本讲最后一页的 $F(x)=\frac{x-4}{6}$ 是一条光滑上升的曲线, 没有台阶——所以 $P(X=x)=0$,概率函数彻底失效了。
但那条曲线的斜率还在:斜率大的地方,概率就密集。 下一讲:用「密度」代替「概率」,把 $F$ 的导数请出来。