复旦大学经济学院 ECON130001
期望 $EX$、方差 $D(X)=E(X^2)-(EX)^2$、协方差 $\mathrm{Cov}(X,Y)=E(XY)-E(X)E(Y)$、 相关系数 $\rho=\mathrm{Cov}/(\sigma_X\sigma_Y)$。
$E(X+Y)=E(X)+E(Y)$ 不需要独立; $D(X+Y)=D(X)+D(Y)$ 需要不相关,否则要加 $2\mathrm{Cov}$。
$E$ 与 $D$ 描述的还是一个随机变量。 如果把很多个独立同分布的随机变量平均起来,会怎样?
绪论里布丰投针的频率会稳定到概率上、第 6 讲两个均匀分布相加变梯形再加会变钟形 ——这两件事其实是同一件事。
问题一:凭什么相信反复抛硬币,经验频率会趋向理论概率 0.5? → 大数定律
问题二:为什么从身高、测量误差到金融收益率,处处都是正态分布? → 中心极限定理
抛 10 次硬币,恰好 5 次正面的概率是多少?正面比率落在 $0.4$ 到 $0.6$ 之间呢?抛 100 次呢?
「恰好一半」的概率下降了(0.2461 → 0.0796), 而「比率接近一半」的概率上升了(0.6563 → 0.9648)。
大数定律说的是后者,不是前者。这正是开场那些赌客弄反的地方。
大数定律要做的,就是把这个直观变成定理。
而为了证它,我们需要一个工具:只知道期望和方差,就能估计「偏离多远」的概率 ——即使完全不知道分布长什么样。
设 $X$ 有期望 $EX$ 与方差 $DX$,则对任意 $\varepsilon>0$ $$P(|X-EX|\ge\varepsilon)\le\frac{DX}{\varepsilon^2} \qquad\Longleftrightarrow\qquad P(|X-EX|<\varepsilon)\ge1-\frac{DX}{\varepsilon^2}$$
价值:不需要知道分布,只要有期望和方差就能给出保证。这在实际中极为难得。
代价:非常松。证明里放缩了两次,所以给出的只是个粗糙上界 ——本讲后半会看到它有多松。
10000 盏灯,每盏开的概率 0.7,彼此独立。求同时开着的灯数在 6800 至 7200 之间的概率。
$X\sim B(10000,0.7)$,$EX=7000$、$DX=10000\times0.7\times0.3=2100$: $$P(|X-7000|<200)\ge1-\frac{2100}{200^2}\approx0.95$$
已知 $EX=10$、$P(X\le7)=0.2$、$P(X\ge13)=0.3$。证明 $DX\ge\frac92$。
取 $\varepsilon=3$。左边 $P(|X-10|\ge3)\ge0.2+0.3=0.5$, 而不等式给出 $P(|X-10|\ge3)\le\frac{DX}{9}$,故 $$\frac{DX}{9}\ge0.5\ \Longrightarrow\ DX\ge\frac92$$
同一个不等式,两个方向都能用:知道方差估概率,或者知道概率反推方差的下界。 第二种用法在考试里出现得不少。
设 $X_1,\dots,X_n$ 来自期望 $\mu$、方差 $\sigma^2$ 的总体,$\overline{X}_n=\frac1n\sum X_i$,则 $$E(\overline{X}_n)=\frac1n\sum_{i=1}^{n}E(X_i)=\mu,\qquad D(\overline{X}_n)=\frac{1}{n^2}\sum_{i=1}^{n}D(X_i)=\frac{\sigma^2}{n}$$
注意 $D$ 里那个 $\frac{1}{n^2}$——由第 7 讲 $D(aX)=a^2D(X)$,且各项独立才能相加。
期望不变,方差缩小 $n$ 倍。标准差缩小 $\sqrt n$ 倍 ——想把精度提高一倍,样本量要变成四倍。
代入切比雪夫: $$P(|\overline{X}_n-\mu|\ge\varepsilon)\le\frac{\sigma^2}{n\varepsilon^2}\xrightarrow{\ n\to\infty\ }0$$ 右边趋于 0——大数定律已经证完了。
某总体期望未知,但已知标准差不超过 2。要保证样本均值与期望的距离小于 1 的概率至少 0.99, 样本量至少多大?
由 $D(\overline{X}_n)=\frac{\sigma^2}{n}\le\frac4n$ 与切比雪夫: $$P(|\overline{X}_n-\mu|<1)\ge1-\frac{D(\overline{X}_n)}{1^2}\ge1-\frac{4}{n}$$ 要求 $1-\frac4n\ge0.99$,即 $\frac4n\le0.01$: $$n\ge400$$
注意分母是 $n$ 不是 $n^2$——$D(\overline{X}_n)=\sigma^2/n$。 这一步写错是最常见的失误。
另外:400 是切比雪夫给出的保守答案。本讲后半用中心极限定理重算, 需要的样本量会小得多。
若存在常数 $a$,使得对任意 $\varepsilon>0$ $$\lim_{n\to\infty}P\big(|X_n-a|<\varepsilon\big)=1$$ 则称随机变量序列 $\{X_n\}$ 依概率收敛于 $a$。
依概率收敛说的是:「偏离超过 $\varepsilon$」这件事的概率趋于 0。
它没有说:某一次的结果会被「修正」; 也没有说:黑色多了红色就会补上。轮盘没有记忆。
频率之所以趋于 $1/2$,不是因为后面的结果去抵消前面的, 而是因为后面的次数越来越多,把前面那 26 次稀释掉了。
$X_1,X_2,\dots$ 相互独立,方差一致有界(存在 $l$ 使所有 $DX_i<l$),则 $$\lim_{n\to\infty}P\left\{\left|\frac1n\sum_{i=1}^{n}X_i-\frac1n\sum_{i=1}^{n}EX_i\right|<\varepsilon\right\}=1$$ 不要求同分布,只要求独立 + 方差有界。
$n$ 次独立试验中事件 $A$ 发生 $X$ 次,则频率依概率收敛于概率: $$\lim_{n\to\infty}P\left\{\left|\frac{X}{n}-p\right|<\varepsilon\right\}=1$$ 这就是绪论那个承诺:布丰投针的频率为什么会稳定到 $\pi$ 相关的那个数上。
$X_1,X_2,\dots$ 独立同分布,$EX_i=a$,则 $$\lim_{n\to\infty}P\left\{\left|\frac1n\sum_{i=1}^{n}X_i-a\right|<\varepsilon\right\}=1$$ 只要期望存在,不要求方差存在——比切比雪夫定理的条件弱。
10 个部分独立同分布,各长期望 2 mm、标准差 0.01 mm。 总长 $(20\pm0.1)$ mm 为合格,求合格概率。
$Y=\sum_{i=1}^{10}X_i$,$EY=20$、$DY=10\times0.0001=0.001$: $$P(|Y-20|<0.1)\ge1-\frac{0.001}{0.01}=0.9$$
每个加数舍入到最近整数,误差独立且服从 $U(-0.5,0.5)$。
(1) 1500 个数相加,误差总和绝对值超过 15 的概率?
$EY=0$,$DY=1500\times\frac1{12}=125$: $$P(|Y|\ge15)\le\frac{125}{225}=55.6\%$$
(2) 最多几个数相加,能让 $P(|Y|<10)\ge0.9$?
需 $1-\frac{DY}{100}\ge0.9$ 即 $DY\le10$,故 $\frac{n}{12}\le10$,$n\le120$。
右题那个 55.6% 记住它——本讲后半用中心极限定理重算,答案是 18%。 差了三倍。切比雪夫有多松,一会儿就知道了。
一份保费 500 元、保额 10 万元的意外险。对单个投保人, 公司要么净赚 500,要么巨亏 99 500——这是极度不确定的赌局。
结论:只要定价合理,大数定律就保证了公司整体经营的稳定。 它把个体的巨大不确定性,转化成了总体的确定性。
但请注意前提:各保单要相互独立。 一场地震让整个区域同时出险时,这个前提就塌了——第 3 讲结构化产品那一课的保险版本。
这是数据驱动方法的理论支点。没有大数定律,「大数据」就没有意义。
绪论的布丰投针、第 2 讲 AlphaGo 的蒙特卡洛树搜索, 用的都是这一条。
大数定律告诉我们:样本均值会趋近期望。
但它只给了一个粗糙的上界——切比雪夫算出 55.6%,实际只有 18%。 我们无法比较精确地估计「偏离到底有多大」。
中心极限定理给出的不是上界,是分布本身。
设 $X_1,X_2,\dots$ 相互独立,$E(X_i)=\mu_i$、$D(X_i)=\sigma_i^2$。 记 $Z_n=X_1+\cdots+X_n$,将其标准化: $$\frac{Z_n-E(Z_n)}{\sqrt{D(Z_n)}}=\frac{\sum_i X_i-\sum_i\mu_i}{\sqrt{\sum_i\sigma_i^2}}$$ 若每个 $X_i$ 对总和的影响都不大,则 $$\lim_{n\to\infty}P\left\{\frac{Z_n-E(Z_n)}{\sqrt{D(Z_n)}}\le x\right\}=\Phi_0(x)$$
不管 $X_i$ 服从什么分布——只要独立、方差有限、没有哪一项特别大 ——它们的和标准化后总是趋于标准正态。
这就是第 5 讲那个问题的答案:正态分布无处不在,不是因为世界本来正态, 而是因为「大量微小独立因素之和」必然趋近正态。
1500 个数相加,误差独立且 $\sim U(-0.5,0.5)$,$EY=0$、$DY=125$。求 $P(|Y|\ge15)$。
55.6% 对 18%——切比雪夫松了三倍。
第 (2) 问同样:切比雪夫给 $n\le120$,CLT 给 $n\le441$ (由 $2\Phi_0(10/\sqrt{DY})-1\ge0.9$ 得 $DY\le36.7$,$n\le12\times36.7$)。 能多算三倍多的数。
代价:切比雪夫是严格成立的不等式,CLT 是近似。 要精度就用 CLT,要保证就用切比雪夫。
$X_1,X_2,\dots$ 独立同分布,$EX_i=\mu$、$DX_i=\sigma^2$,则 $$\lim_{n\to\infty}P\left\{\frac{\overline{X}_n-\mu}{\sigma/\sqrt n}\le x\right\}=\Phi_0(x)$$ 即 $n$ 充分大时 $$\frac{\overline{X}_n-\mu}{\sigma/\sqrt n}\ \dot\sim\ N(0,1), \qquad \overline{X}_n\ \dot\sim\ N\!\left(\mu,\ \frac{\sigma^2}{n}\right)$$
分母那个 $\sigma/\sqrt n$ 正是 slide 11 算出的 $\sqrt{D(\overline{X}_n)}$, 它有个专门的名字:标准误(standard error)。
这个式子是第 9–12 讲全部内容的出发点。 从下一讲起,我们做的每一件事都从它开始。
寿命方差 $\sigma^2=400$,用 $\overline X$ 估计 $\mu$。 为使 $P(|\overline X-\mu|<1)\ge0.95$,$n$ 至少多大?
$$2\Phi_0\!\left(\frac{\sqrt n}{\sigma}\right)-1\ge0.95 \ \Longrightarrow\ \frac{\sqrt n}{20}\ge1.96$$ $$n\ge(1.96\times20)^2\approx1537$$
1.96 这个数要记住——95% 的双侧分位点, 第 10 讲的置信区间天天用。
80% 的木柱长度不小于 3 m。随机选 100 根,求至少 30 根短于 3 m 的概率。
$X_i=1$ 表示短于 3 m,$EX_i=0.2$、$DX_i=0.16$。 $Y=\sum X_i$,$EY=20$、$DY=16$: $$P(Y\ge30)\approx1-\Phi_0\!\left(\frac{30-20}{4}\right)=1-\Phi_0(2.5)=0.0062$$
二项分布的精确值是 0.0112—— 近似值偏小了近一半。尾部是 CLT 近似最差的地方。
若 $X\sim B(n,p)$,则 $n\to\infty$ 时 $$P(a<X<b)\approx\Phi_0\!\left(\frac{b-np}{\sqrt{np(1-p)}}\right) -\Phi_0\!\left(\frac{a-np}{\sqrt{np(1-p)}}\right)$$
| 近似 | 适用条件 | 出处 |
|---|---|---|
| 泊松 $\lambda=np$ | $n$ 大、$p$ 小、$np$ 适中 | 第 4 讲 |
| 正态 $N(np,np(1-p))$ | $n$ 大、$p$ 不太靠近 0 或 1 | 本讲 |
经验判据:$np>5$ 且 $n(1-p)>5$ 时用正态近似。$p$ 极小就用泊松。
每个学生有 0、1、2 名家长参会,概率分别 0.05、0.8、0.15。全校 400 名学生,相互独立。 求 (1) 参会家长数超过 450 的概率;(2) 恰有 1 名家长参会的学生数不多于 340 的概率。
$EX_i=1.1$,$EX_i^2=1.4$,$DX_i=1.4-1.21=0.19$。 $X=\sum_{i=1}^{400}X_i$,$EX=440$、$DX=76$: $$P(X>450)=1-\Phi_0\!\left(\frac{450-440}{\sqrt{76}}\right)$$ $$=1-\Phi_0(1.147)=0.1257$$
$Y$=恰 1 名家长的学生数 $\sim B(400,0.8)$,$EY=320$、$DY=64$: $$P(Y\le340)=\Phi_0\!\left(\frac{340-320}{8}\right)$$ $$=\Phi_0(2.5)=0.9938$$
同一道题的两问用了两个定理:(1) 的 $X_i$ 取三个值不是伯努利, 只能用一般的 Liapunov;(2) 的 $Y$ 是标准二项,用拉普拉斯更直接。先看清随机变量是什么。
100 个元件,每个寿命期望 1000 小时、标准差 100,分布未知。 求设备总寿命超过 98000 小时的概率。
不需要知道分布!$S\sim N(100000,\ 1000^2)$: $$P(S>98000)=P(Z>-2)\approx0.9772$$
限重 800 kg。成年男性体重期望 70 kg、标准差 10 kg,10 人同乘,求超重概率。
$S\sim N(700,\ 1000)$,标准差 $\approx31.6$: $$P(S>800)=P(Z>3.16)\approx0.0008$$
但要留个心眼:$n=10$ 不算大, 而且这里问的是尾部概率——正是 CLT 近似最不准的地方(对照木柱那题)。 工程上会留更大余量。
测试新版网页 B 的转化率是否优于旧版 A。
调查机构凭 1000 个样本,怎么得出「比例为 $55\%\pm3\%$」?
没有中心极限定理,绝大多数统计推断都失去理论基础。
这两件事分别是第 12 讲假设检验与第 10 讲区间估计的内容。 本讲讲完,后半学期的地基就打好了。
赌客们没有算错,他们把定理用反了方向。
大数定律说的是「比率趋于 1/2」,不是「次数会被补平」。 看 slide 6 那组数:抛得越多,「恰好一半」的概率下降, 「比率接近一半」的概率上升——这是两件相反的事。
频率之所以收敛,是因为后来的次数把前面那 26 次稀释了, 而不是因为后来的结果去抵消它。轮盘没有记忆。
本讲那个式子里 $\mu$ 与 $\sigma$ 是已知的——我们从模型推数据。 可现实完全相反:手里只有数据,$\mu$ 和 $\sigma$ 恰恰是要求的东西。 从下一讲起方向反过来:由数据推模型,这就是绪论说的统计学。
下一讲:样本及抽样分布。