复旦大学经济学院 ECON130001
$X:\Omega\to\mathbb{R}$ 是一个函数;离散型用概率函数 $f(x)=P(X=x)$ 描述, 四个基本分布:伯努利 → 几何 → 二项 → 泊松。
分布函数 $F(x)=P(X\le x)$,离散型是阶梯,且 $P(X=x)=F(x)-F(x^-)$ 就是该点的跳跃高度。
上一讲最后那个例子 $F(x)=\frac{x-4}{6}$ 是一条光滑上升的曲线,没有台阶 ——于是 $P(X=x)=0$,概率函数彻底失效。
但曲线的斜率还在:斜率大的地方概率就密集。这个「斜率」该怎么用?
在 $[4,10]$ 上任意抛一个质点,$X$ 为它与原点的距离,落在任一子区间的概率与区间长度成正比。 $$F(x)=\begin{cases}0,& x<4\\[2pt]\dfrac{x-4}{6},& 4\le x<10\\[4pt]1,& x\ge10\end{cases}$$
对连续变量,任何单点的概率都是 0: $P(\text{收益率}=1\%)=0$。
所以概率函数 $f(x)=P(X=x)$ 恒为 0,没有任何信息。 需要一个全新的工具。
对连续型随机变量 $X$,若其分布函数可以写成 $$F(x)=\int_{-\infty}^{x}f(t)\,\mathrm{d}t$$ 则称 $f$ 为 $X$ 的概率密度函数,记作 $X\sim f(x)$。
$f(x)$ 本身不是 $X$ 取 $x$ 的概率——它甚至可以大于 1。 有意义的是它在一段区间上的积分。
类比:密度 $\mathrm{kg/m^3}$ 不是质量,乘上体积才是质量。 概率是「密度 × 长度」,摊在区间上而不是堆在点上。
回到上一讲的问题:$F$ 的斜率就是 $f$。 斜率大的地方,同样宽的区间里装的概率就多。
因为 $P(X=x)=0$,区间端点开闭无关紧要: $P(a<X<b)=P(a\le X\le b)=\int_a^b f$。 离散型里完全不成立——那里少算一个端点就少一块概率。
若 $\xi$ 的密度为 $\varphi(x)=\lambda$($a\le x\le b$),其余为 0, 则称 $\xi$ 服从 $[a,b]$ 上的均匀分布。求 $F(x)$。
由归一化 $\lambda(b-a)=1$,得 $\lambda=\dfrac{1}{b-a}$。积分得 $$F(x)=\begin{cases}0,& x<a\\[2pt]\dfrac{x-a}{b-a},& a\le x<b\\[4pt]1,& x\ge b\end{cases}$$
这正是上一讲那道 $[4,10]$ 质点题的一般形式。
注意 $\lambda=\frac{1}{b-a}$:区间越短,密度越高。 $[0,0.1]$ 上的均匀分布密度是 $10$——密度大于 1 完全正常。
当我们对一个量一无所知,只能确定它的范围时, 均匀分布是「最公平」的假设——不偏袒任何取值。
可以说,均匀分布是许多复杂 AI 模型训练的起点。 区间宽度 $a$ 怎么定?要用到方差——第 7 讲。
$\varphi(x)=kx+1$($0\le x\le2$),其余为 0。求 $k$、$F(x)$ 及 $P(1.5<\xi<2.5)$。
归一化:$\int_0^2(kx+1)\mathrm{d}x=2k+2=1\Rightarrow k=-\tfrac12$。 $$F(x)=-\tfrac14x^2+x,\quad 0\le x\le2$$ $$P(1.5<\xi<2.5)=F(2)-F(1.5)=1-0.9375=0.0625$$
注意:$\xi$ 最大只到 2,所以 $F(2.5)=F(2)=1$。 积分上限要落在支撑集内。
$f(x)=cxe^{-x^2/2}$($x>0$),其余为 0。求 $c$。
换元 $u=x^2/2$: $$\int_0^{\infty}cxe^{-x^2/2}\mathrm{d}x=c\int_0^{\infty}e^{-u}\mathrm{d}u=c=1$$ 故 $c=1$。
这个分布叫瑞利分布, 是二维正态的模长——第 6 讲会见到。
$F(x)=e^{x-3}$($x\le3$),$F(x)=1$($x>3$)。求密度函数。
对 $F$ 求导: $$f(x)=\begin{cases}e^{x-3},& x\le3\\ 0,& x>3\end{cases}$$ 「先求 $F$ 再求导」是连续型的标准动作,本讲后半还会用到。
$F(x)=0$($x<0$)、$a+b\cos x$($0\le x<\pi/4$)、$1$($x\ge\pi/4$)。求 $a+b$。
连续型的分布函数是连续函数(没有跳跃),所以在 $x=0$ 处 $$\lim_{x\to0^-}F(x)=0=a+b\cos0=a+b$$ 故 $a+b=0$。
这道题考的不是计算,是「连续型 $\Rightarrow$ $F$ 连续」这条性质。
$\varphi(x)=A\cos x$($|x|\le\pi/2$),其余为 0。 求 (1) $A$;(2) 分布函数;(3) $P(0<\xi<\pi/4)$。
(1) $\int_{-\pi/2}^{\pi/2}A\cos x\,\mathrm{d}x=2A=1\Rightarrow A=\tfrac12$。
(2) 对 $|x|\le\pi/2$: $\displaystyle F(x)=\int_{-\pi/2}^{x}\tfrac12\cos t\,\mathrm{d}t=\frac{1+\sin x}{2}$,于是 $$F(x)=\begin{cases}0,& x<-\tfrac{\pi}{2}\\[2pt]\dfrac{1+\sin x}{2},& |x|\le\tfrac{\pi}{2}\\[4pt]1,& x>\tfrac{\pi}{2}\end{cases}$$
(3) $F(\tfrac{\pi}{4})-F(0)=\dfrac{1+\frac{\sqrt2}{2}}{2}-\dfrac12=\dfrac{\sqrt2}{4}\approx0.354$。
核查一下 $F$:$F(-\pi/2)=0$、$F(\pi/2)=1$、处处不减且连续。凡是求出 $F$,都该这样验一遍。
$X$ 服从 $[0,5]$ 上的均匀分布,定义 $$Y=\begin{cases}0,& X\le1\\ 5,& X\ge3\\ X,&\text{其他}\end{cases}$$ 画出 $Y$ 的分布函数。
$P(Y=0)=P(X\le1)=\tfrac15$,$P(Y=5)=P(X\ge3)=\tfrac25$—— 这两点上有跳跃;而在 $(1,3)$ 上 $Y=X$,$F$ 连续上升。
所以 $F_Y$ 是「两级台阶 + 中间一段斜坡」。
它既不离散也不连续。分布函数的价值就在这里——它对任何随机变量都有定义。
接下来三个具体分布:均匀(已讲)、指数、正态。
$X$ 服从参数为 $\lambda$ 的指数分布,若 $$f(x)=\begin{cases}\lambda e^{-\lambda x},& x>0\\ 0,&\text{其他}\end{cases}$$
特别地,$P(X>t)=e^{-\lambda t}$——「活过 $t$」的概率,本讲后面反复要用。
$\lambda$ 叫速率:$\lambda$ 越大,密度衰减越快,事件来得越急。 它就是上一讲泊松分布里那个 $\lambda$——下面会证明这不是巧合。
电子元件寿命服从参数 $\lambda$ 的指数分布。求 (1) 寿命大于 $t$ 的概率;(2) 已工作了 $s$ 小时后,再活过 $t$ 小时的概率。
(1) $\displaystyle P(X>t)=\int_t^{\infty}\lambda e^{-\lambda x}\mathrm{d}x=e^{-\lambda t}$
(2) 用条件概率: $$P(X>t+s\mid X>s)=\frac{P(X>t+s)}{P(X>s)}=\frac{e^{-\lambda(t+s)}}{e^{-\lambda s}}=e^{-\lambda t}=P(X>t)$$
已经用了 $s$ 小时这件事,对元件的剩余寿命毫无影响——它「不会变老」。
这是上一讲几何分布无记忆性的连续版本。 而且可以证明:指数分布是唯一具有这个性质的连续分布。
$n$ 个灯泡同时点亮,寿命相互独立且都服从参数 $\lambda$ 的指数分布。求 (1) 到第一个灯泡失效的时间 $Y_1$ 的分布; (2) 从第一个失效到第二个失效的时间 $Y_2$ 的分布。
$Y_1>t$ 意味着所有 $n$ 个都还没坏。由独立性 $$P(Y_1>t)=\prod_{i=1}^{n}P(X_i>t)=\left(e^{-\lambda t}\right)^n=e^{-n\lambda t}$$ 所以 $Y_1$ 服从参数 $n\lambda$ 的指数分布——$n$ 个一起等,来得快 $n$ 倍。
第一个坏掉后还剩 $n-1$ 个,而由无记忆性, 这 $n-1$ 个「和新的一样」。于是同理,$Y_2$ 服从参数 $(n-1)\lambda$ 的指数分布。
没有无记忆性,第 (2) 问根本没法这么简单地做。
两者描述的是同一个随机过程(泊松过程)的两个问法:
例:公交车到站平均每小时 $\lambda$ 辆。「一小时来几辆」服从泊松,「我要等多久」服从指数。
设速率为 $\lambda$,$T$ 是到下一次事件的等待时间。关键的一步翻译: $$\{T>t\}\iff\{\text{在长度 }t\text{ 的区间内事件发生了 }\mathbf{0}\text{ 次}\}$$ 由泊松分布 $P(\text{时长 }t\text{ 内发生 }k\text{ 次})=\dfrac{e^{-\lambda t}(\lambda t)^k}{k!}$,取 $k=0$: $$P(T>t)=e^{-\lambda t}\ \Longrightarrow\ F(t)=1-e^{-\lambda t}$$ 正是参数 $\lambda$ 的指数分布。
无记忆性意味着失业时长不影响再就业难度。现实中往往相反: 技能折旧、雇主对长期失业者的筛选,都会让 $\lambda$ 随时间下降。 模型给出的是一个基准,偏离基准的地方才是研究对象。
第 3 条是它真正的统治力来源:正态分布不是因为世界本来正态, 而是因为「大量微小独立因素之和」必然趋近正态。
但请记住开场那个故事——「近似」和「精确」之间的差距,全在尾巴上。
$X$ 服从参数为 $\mu,\sigma^2$ 的正态分布,若密度函数为 $$f(x)=\frac{1}{\sqrt{2\pi}\,\sigma}\exp\left[-\frac12\left(\frac{x-\mu}{\sigma}\right)^2\right]$$ 记作 $X\sim N(\mu,\sigma^2)$。
指数里是 $-\frac12\left(\frac{x-\mu}{\sigma}\right)^2$: $\mu$ 决定中心位置,$\sigma$ 决定胖瘦。 前面的 $\frac{1}{\sqrt{2\pi}\sigma}$ 只是为了让总面积等于 1。
最后一条就是开场故事的伏笔: $e^{-x^2/2}$ 的衰减比任何指数都快, 所以正态分布认为极端事件「几乎不可能」。 真实收益率的尾巴要厚得多。
若 $X\sim N(\mu,\sigma^2)$ 且 $Y=aX+b$($a\ne0$),则 $$Y\sim N(a\mu+b,\ a^2\sigma^2)$$ 特别地,取 $a=\frac1\sigma$、$b=-\frac{\mu}{\sigma}$: $$Z=\frac{X-\mu}{\sigma}\sim N(0,1)$$
$N(0,1)$ 称为标准正态分布,其密度与分布函数记为 $$\phi_0(x)=\frac{1}{\sqrt{2\pi}}e^{-x^2/2},\qquad \Phi_0(x)=\int_{-\infty}^{x}\phi_0(u)\,\mathrm{d}u$$
$\Phi_0$ 没有初等函数表达式,只能查表或数值计算。 但有了标准化,全世界只需要一张表——任何 $N(\mu,\sigma^2)$ 的问题 都先化成 $Z$ 再查。
表上通常只印 $x\ge0$ 的值。要查 $\Phi_0(-2)$, 就用 $\Phi_0(-2)=1-\Phi_0(2)$。
它来自密度关于 0 对称这个几何事实——不用背,画个图就出来了。
$X\sim N(5,4)$(即 $\mu=5$、$\sigma=2$),求 $P(1<X<8)$。
① 标准化 令 $Z=\dfrac{X-5}{2}\sim N(0,1)$: $$P(1<X<8)=P\!\left(\frac{1-5}{2}<Z<\frac{8-5}{2}\right)=P(-2<Z<1.5)$$
② 拆成分布函数之差 $$=\Phi_0(1.5)-\Phi_0(-2)$$
③ 用对称性处理负值再查表 $$=\Phi_0(1.5)-[1-\Phi_0(2)]=0.93319-(1-0.97725)=0.91044$$
$$p_k=P(|X-\mu|\le k\sigma)=P(|Z|\le k)$$ 右边只与 $k$ 有关,和 $\mu,\sigma$ 无关。
| $k$ | $p_k$ |
|---|---|
| 1 | 0.6826 |
| 2 | 0.9544 |
| 3 | 0.9974 |
| 4 | 0.99994 |
| 5 | $1-6\times10^{-7}$ |
| 10 | $1-2\times10^{-23}$ |
$10\sigma$ 之外只有 $2\times10^{-23}$。每天观测一次,平均要等 $10^{20}$ 年 ——比宇宙年龄还长十亿倍。
若日收益率真的服从正态分布,那么一个 $10\sigma$ 的单日损失, 平均要 $\dfrac{1}{2\times10^{-23}}\approx5\times10^{22}$ 个交易日才出现一次 ——约合 $2\times10^{20}$ 年。
1987 年 10 月 19 日、1998 年 8–9 月、2008 年秋、2020 年 3 月…… 「几十亿年一次」和「十年一次」的差距,不在计算,在假设。
正态分布的尾部按 $e^{-x^2/2}$ 衰减,快得不像话。 真实收益率的尾部是幂律式的,厚得多。
这不是说正态分布没用——它是最好的第一近似, 也是第 8–12 讲全部推断工具的基础。 但用它做极端风险的判断时,必须知道自己在假设什么。
某股票日收益率 $R\sim N(0.0005,\ 0.02^2)$,持有 100 万元。 问:未来一天,有 95% 的把握损失不超过多少?
等价于求临界值 $r$ 使 $P(R<r)=0.05$。
① 标准化 $P\!\left(Z<\dfrac{r-0.0005}{0.02}\right)=0.05$
② 查表 下 5% 分位点 $\dfrac{r-0.0005}{0.02}\approx-1.645$
③ 解出 $r\approx-0.0324$,即 $-3.24\%$
$$\text{VaR}=100\text{ 万}\times3.24\%=32\,400\ \text{元}$$
读法:「平均每 20 个交易日,会有 1 天亏得比 32 400 元多」。 注意它没有回答「那一天会亏多少」——而那正是开场故事里出事的地方。
拖 $\mu$、$\sigma$ 与置信水平,看红色尾部面积与 VaR 数字同步变化。
交互演示:拖动参数与置信水平,观察尾部面积与 VaR
核心假设:无法解释的误差项 $\epsilon\sim N(0,\sigma^2)$。
基于正态假设,才能对系数 $\beta_1$ 做 $t$ 检验, 判断「面积」是否真有统计意义上的影响。第 12 讲
也正是基于它,才能为预测的房价给出一个置信区间, 而不只是一个孤零零的数。第 11 讲
没有这个假设,模型只能给出一个点预测,无法回答「这个预测有多可信」。 正态分布是连接机器学习与统计推断的桥梁——它把「预测」变成了「可以被质疑和检验的预测」。
我们常常关心的不是 $X$ 本身,而是它的某个函数。 例:$X$ 是汽车时速,我们想知道跑完一百公里的用时 $Y=100/X$。
核心动作:把关于 $Y$ 的事件翻译成关于 $X$ 的事件, 再用已知的 $F_X$。
注意 $Y=100/X$ 是减函数,所以不等号翻了向。 这是本节最容易错的地方——每次都要先判断单调方向。
离散型随机变量 $X$ 有概率函数 $f$,令 $Y=r(X)$,则 $Y$ 的概率函数为 $$g(y)=P[r(X)=y]=\sum_{x:\,r(x)=y}f(x)$$
$X$ 在 $1$–$9$ 上均匀分布,$Y=|X-5|$。
$Y$ 取 $0,1,2,3,4$。$Y=0$ 只来自 $X=5$; $Y=k$($k\ge1$)来自 $X=5\pm k$ 两个值: $$g(y)=\begin{cases}\tfrac19,& y=0\\[2pt]\tfrac29,& y=1,2,3,4\end{cases}$$
$X$ 等概率取 $-3,\dots,3$(七个值),$Y=X^2-X$。
逐个代:$X=0,1\to Y=0$;$X=-1,2\to Y=2$; $X=-2,3\to Y=6$;$X=-3\to Y=12$。 $$g(y):\ \tfrac27,\tfrac27,\tfrac27,\tfrac17\quad(y=0,2,6,12)$$
连续型随机变量 $X$ 有密度 $f$,令 $Y=r(X)$,则 $$G(y)=P[r(X)\le y]=\int_{x:\,r(x)\le y}f(x)\,\mathrm{d}x$$ 若 $Y$ 也是连续型,其密度为 $g(y)=\dfrac{\mathrm{d}G(y)}{\mathrm{d}y}$。
$Z$ 是队列的服务速率,有连续分布函数 $F$。平均等候时间 $Y=1/Z$,求 $G$。
$$G(y)=P(Y\le y)=P\!\left(\frac1Z\le y\right)=P\!\left(Z\ge\frac1y\right) =P\!\left(Z>\frac1y\right)=1-F\!\left(\frac1y\right)$$
倒数第二步用到 $P(Z=1/y)=0$——连续型才能这样把 $\ge$ 换成 $>$。
「先求分布函数、再求导」是连续型的唯一通法。 直接对密度做代换是错的——密度不是概率,不能像换元那样搬。
$X\sim U[-1,1]$,密度 $f(x)=\frac12$。求 $Y=X^2$ 的密度。
对 $0<y<1$: $$G(y)=P(X^2\le y)=P(-\sqrt y\le X\le\sqrt y)=\int_{-\sqrt y}^{\sqrt y}\tfrac12\,\mathrm{d}x=\sqrt y$$ 求导: $$g(y)=\frac{1}{2\sqrt y},\quad 0<y<1$$
注意 $g$ 在 $y\to0^+$ 时趋于无穷, 但它仍是合法密度(积分为 1)——再次说明密度不是概率。
$X$ 有密度 $f$,$Y=aX+b$($a\ne0$),则 $$g(y)=\frac{1}{|a|}f\!\left(\frac{y-b}{a}\right)$$
那个 $\frac{1}{|a|}$ 就是雅可比因子: 变量被拉伸 $a$ 倍,密度必须压扁 $a$ 倍,总面积才守恒。
把它用在正态分布上,正好给出前面那条 $Y=aX+b\sim N(a\mu+b,a^2\sigma^2)$。
正态分布的尾部按 $e^{-x^2/2}$ 衰减,快到 $10\sigma$ 之外的概率只有 $2\times10^{-23}$ ——按这个模型,那种损失「$10^{20}$ 年才出现一次」。
可它在几十年里出现了好几次。数学没有错,参数也没估错, 错的是「收益率服从正态分布」这个看不见的前提。 与第 3 讲那个结构化产品的教训完全一样:出事的从来不是公式,是公式的假设。
到现在为止,我们一次只研究一个随机变量。 可现实里要紧的往往是几个量之间的关系: 两只股票的收益会不会一起跌?身高与体重怎么联动?
而这正是开场那个故事真正的病根—— LTCM 的模型不是不知道单个资产的分布,是低估了它们「一起动」的程度。
下一讲:多维随机变量及其分布。