复旦大学经济学院 ECON130001
大数定律:$\overline X_n$ 依概率收敛于 $\mu$——绪论说的「频率会稳定到概率」; 中心极限定理:$\frac{\overline X_n-\mu}{\sigma/\sqrt n}\dot\sim N(0,1)$,不管原分布是什么。
$E(\overline X_n)=\mu$,$D(\overline X_n)=\dfrac{\sigma^2}{n}$——期望不变,标准差按 $\sqrt n$ 缩小。
上面这些式子里,$\mu$ 与 $\sigma$ 都是已知的——我们从模型推数据。
可现实完全相反:手里只有数据,$\mu$ 和 $\sigma$ 恰恰是要求的东西。 从今天起方向反过来:由数据推模型。
概率:给定条件,对未知作预测——Play God。
统计:给定数据,归纳出规律——Be Human。
数理统计三块内容:样本分布(本讲)→ 参数估计(第 10 讲)→ 假设检验(第 11 讲)。
注意第一块里那个问法:「样本均值本身服从什么分布」。 $\overline X$ 是随机变量的函数,所以它也是随机变量,也有自己的分布 ——这就是「抽样分布」,本讲的主角。
总体:研究对象的全体;组成它的每个基本单位称个体。
样本:从总体中抽出的若干个体;样本中个体的个数称样本容量。
瓦尔德那批数据里的飞机,不是从「所有出击的飞机」里随机抽的 ——它们是被「能飞回来」这个条件筛过的。样本与总体不同分布,后面所有结论全部失效。
本讲之后所有的公式,都默认了这五个字。用之前先问一句:我的数据是怎么来的?
样本 $(X_1,\dots,X_n)$ 的函数 $f(X_1,\dots,X_n)$ 称为统计量, 其中 $f$ 不含未知参数。
最常见的统计量是样本均值 $$\overline X=\frac1n\sum_{i=1}^{n}X_i$$
$\dfrac{\overline X-\mu}{\sigma/\sqrt n}$ 不是统计量——它含着未知的 $\mu,\sigma$, 算不出来。
统计量必须是拿到数据就能算出数值的东西。 本讲后半那些 $\chi^2$、$t$、$F$ 之所以重要,正是因为它们把未知参数消掉了。
94 88 95 96 85 81 63 92 77 99 97 69 76 76 85 66 75 86 91 83 96 71 81 60 94 71 67 89 63 64
第一步永远是排序,从 60 到 99。排完之后,分布形态才看得见。
| 组限 | 组中值 | 频数 | 频率 | 累积 |
|---|---|---|---|---|
| 60–70 | 65 | 7 | 23% | 23% |
| 70–80 | 75 | 6 | 20% | 43% |
| 80–90 | 85 | 8 | 27% | 70% |
| 90–100 | 95 | 9 | 30% | 100% |
因为密度不是概率,面积才是概率——第 5 讲讲了三遍的那件事。 组距变了而不除,图形的高度就会随组距任意变化,没法与 $f$ 对上。
整个统计学的图形,都是在用数据去逼近理论对象: 直方图 → $f$,累积频率 → $F$,样本均值 → $\mu$,样本方差 → $\sigma^2$。
把样本观测值排序为 $x_1^*\le x_2^*\le\cdots\le x_n^*$,令 $$F_n(x)=\begin{cases} 0,& x<x_1^*\\ k/n,& x_k^*\le x<x_{k+1}^*\\ 1,& x\ge x_n^*\end{cases}$$ 称 $F_n$ 为样本分布函数(也叫经验分布函数)。
注意 63 那里一步跳了 2/30——因为有两个 63。它是阶梯函数, 形状与第 4 讲离散型的 $F$ 一模一样。
$F_n(x)$ 就是「样本中不超过 $x$ 的比例」。 由伯努利大数律(第 8 讲),对每个固定的 $x$, $F_n(x)$ 依概率收敛于真实的 $F(x)$——这就是「用数据逼近理论」的第一个严格保证。
$S=\sqrt{S^2}$ 称为样本标准差。化简计算公式: $$S^2=\frac{1}{n-1}\left(\sum_{i=1}^{n}X_i^2-n\overline X^2\right)$$
因为 $\overline X$ 是从同一批数据里算出来的。 $n$ 个离差 $X_i-\overline X$ 之间有一个约束:它们的和恒等于 0。 知道了其中 $n-1$ 个,最后一个就定了——真正自由的只有 $n-1$ 个。
这个数就叫自由度。除以 $n-1$ 而不是 $n$,$S^2$ 的期望才恰好等于 $\sigma^2$ (第 10 讲称之为无偏性)。
令 $y_i=x_i-a$,则 $\overline x=\overline y+a$、$s_x^2=s_y^2$;
令 $z_i=(x_i-a)/c$,则 $\overline x=c\overline z+a$、$s_x^2=c^2s_z^2$。
与第 7 讲 $E(aX+c)=aE(X)+c$、$D(aX+c)=a^2D(X)$ 完全平行——手算时用它简化数字。
总体服从正态分布。只有在这个前提下,样本均值、样本方差及它们的函数 才有干净的分布可算。
$X_i\sim N(\mu_i,\sigma_i^2)$ 相互独立,则 $$a_1X_1+\cdots+a_kX_k\sim N\Big(\sum a_i\mu_i,\ \sum a_i^2\sigma_i^2\Big)$$
取 $a_i=\frac1n$、$\mu_i=\mu$、$\sigma_i^2=\sigma^2$: $$\overline X\sim N\!\left(\mu,\ \frac{\sigma^2}{n}\right), \qquad \frac{(\overline X-\mu)\sqrt n}{\sigma}\sim N(0,1)$$
注意与第 8 讲的区别:那里是 $n$ 很大时的近似, 这里总体正态,对任何 $n$ 都精确成立。
$X\sim\Gamma(\alpha,\beta)$ 若 $$f(x)=\frac{\beta^\alpha}{\Gamma(\alpha)}x^{\alpha-1}e^{-\beta x},\quad x>0$$
$\alpha=1,\beta=\lambda$ 时就是指数分布——第 5 讲那个的推广。
$$E(X)=\frac{\alpha}{\beta},\qquad D(X)=\frac{\alpha}{\beta^2}$$ (用上面最后那条积分公式直接算出。)
$X_i\sim\Gamma(\alpha_i,\beta)$ 独立($\beta$ 相同),则 $\sum X_i\sim\Gamma\big(\sum\alpha_i,\ \beta\big)$。
若 $X\sim N(0,1)$,则 $X^2\sim\Gamma(\tfrac12,\tfrac12)$。
$X_1,\dots,X_k$ 独立且都 $\sim N(0,1)$,由 $\Gamma$ 分布的可加性 $$X_1^2+\cdots+X_k^2\sim\Gamma\!\left(\frac k2,\ \frac12\right)$$ 称为自由度为 $k$ 的卡方分布,记 $\chi^2(k)$。
由 $\Gamma$ 分布的期望方差立得:$E=k$,$D=2k$。
配方只有一句:$k$ 个独立标准正态,各自平方再相加。 所以它非负、右偏;$k$ 越大越对称(中心极限定理)。
$(X_1,\dots,X_n)$ 取自 $N(\mu,\sigma^2)$,则
对多元正态,不相关 $\iff$ 独立(第 7 讲)。而 $$\mathrm{Cov}(\overline X,\ X_i-\overline X) =\mathrm{Cov}(\overline X,X_i)-D(\overline X)$$ $=\frac{\sigma^2}{n}-\frac{\sigma^2}{n}=0$。 $\overline X$ 与每个残差都不相关,故与 $S^2$ 独立。
平方和分解恒等式: $$\underbrace{\sum\Big(\tfrac{X_i-\mu}{\sigma}\Big)^2}_{\sim\chi^2(n)} =\underbrace{\tfrac{(n-1)S^2}{\sigma^2}}_{B} +\underbrace{\Big(\tfrac{\overline X-\mu}{\sigma/\sqrt n}\Big)^2}_{\sim\chi^2(1)}$$ $B$ 与右项独立,自由度可加:$n=\mathrm{df}(B)+1$,故 $\mathrm{df}(B)=n-1$。
「少一个自由度」这件事,在这里第二次出现—— slide 15 从「离差之和为 0」看出来,这里从平方和分解算出来。是同一件事。
四个标签页各是一个统计量。每页顶部写着配方, 点「再抽」若干组,直方图就会向理论密度靠拢。
$t$ 与 $F$ 那两页等讲到再回来。
交互演示:反复抽样,看 χ²/t/F 的直方图向理论密度收敛
$\dfrac{\overline X-\mu}{\sigma/\sqrt n}\sim N(0,1)$ 很漂亮, 但 $\sigma$ 我们不知道——它不是统计量,算不出来。
自然的想法:用样本标准差 $S$ 顶替 $\sigma$。可这样一来分母也随机了,还是正态吗?
若 $X\sim N(0,1)$、$Y\sim\chi^2(n)$ 且相互独立,则 $$T=\frac{X}{\sqrt{Y/n}}\sim t(n)$$ 其密度为 $$f(x)=\frac{\Gamma\!\left(\frac{n+1}{2}\right)}{\sqrt{n\pi}\,\Gamma\!\left(\frac n2\right)} \left(1+\frac{x^2}{n}\right)^{-\frac{n+1}{2}}$$
密度式子不必记,记配方:正态除以「$\chi^2$ 除以自由度」的平方根。 分母也在抖,偶尔特别小,就把商顶得很大——这就是 $t$ 比正态尾厚的原因。
$(X_1,\dots,X_n)$ 取自 $N(\mu,\sigma^2)$,则 $$T=\frac{\overline X-\mu}{S/\sqrt n}\sim t(n-1)$$
$\sigma$ 已知 → 用 $\dfrac{\overline X-\mu}{\sigma/\sqrt n}\sim N(0,1)$
$\sigma$ 未知 → 用 $\dfrac{\overline X-\mu}{S/\sqrt n}\sim t(n-1)$
自由度 $n\to\infty$ 时 $t$ 趋于标准正态——大样本时两者没差别, 小样本时必须用 $t$。
$(X_1,\dots,X_{n_1})$ 与 $(Y_1,\dots,Y_{n_2})$ 取自两个独立正态总体 $N(\mu_1,\sigma^2)$、$N(\mu_2,\sigma^2)$(方差相同),则 $$T=\frac{(\overline X-\overline Y)-(\mu_1-\mu_2)} {\sqrt{\dfrac{(n_1-1)S_1^2+(n_2-1)S_2^2}{n_1+n_2-2}}\ \sqrt{\dfrac{1}{n_1}+\dfrac{1}{n_2}}} \sim t(n_1+n_2-2)$$
推荐算法两个版本,两组用户的「人均点击数」分别来自 $N(\mu_1,\sigma^2)$、$N(\mu_2,\sigma^2)$。 要判断两版本优劣,就要先构造这个包含两组信息的统计量、并知道它的分布 ——第 11 讲拿它做检验。
若 $X\sim\chi^2(n_1)$、$Y\sim\chi^2(n_2)$ 相互独立,则 $$F=\frac{X/n_1}{Y/n_2}\sim F(n_1,n_2)$$ 两个 $\chi^2$ 各除以自己的自由度,再相比。
性质:若 $F\sim F(n_1,n_2)$,则 $\dfrac1F\sim F(n_2,n_1)$——倒过来自由度也换个位置, 查表时常用。
两独立正态总体 $N(\mu_1,\sigma_1^2)$、$N(\mu_2,\sigma_2^2)$ 的样本,则 $$F=\frac{S_1^2/\sigma_1^2}{S_2^2/\sigma_2^2}\sim F(n_1-1,\ n_2-1)$$
由上一节 $\frac{(n_i-1)S_i^2}{\sigma_i^2}\sim\chi^2(n_i-1)$ 直接代入定义即得。
风险用收益率方差衡量。要判断哪支风险更高(比较 $\sigma_1^2$ 与 $\sigma_2^2$), 就构造这个比值统计量。第 11 讲的 $F$ 检验用的就是它。
切到 $t$:红色虚线是标准正态。
$F$ 页:两个自由度相等时,分布集中在 1 附近—— 因为那时两个方差在估同一个东西。
交互演示:t 分布与正态的对比,F 分布的形状
总体 $N(52,\ 6.3^2)$,抽容量 36 的样本。求 $\overline X$ 落在 $50.8$ 到 $53.8$ 之间的概率。
$\overline X\sim N(52,\ 1.05^2)$($6.3/\sqrt{36}=1.05$): $$P=\Phi_0(1.71)-\Phi_0(-1.14)$$ $$=\Phi_0(1.71)+\Phi_0(1.14)-1=0.8293$$
两个独立样本都取自 $N(20,3)$,容量分别 10、15。 求两样本均值之差的绝对值大于 0.3 的概率。
$\overline X-\overline Y\sim N\!\left(0,\ \tfrac{3}{10}+\tfrac{3}{15}\right)=N(0,\ 0.5)$: $$P(|\overline X-\overline Y|>0.3)=2-2\Phi_0\!\left(\tfrac{0.3}{\sqrt{0.5}}\right)$$ $$=2-2\Phi_0(0.42)=0.6744$$
右题的关键是方差相加:$D(\overline X-\overline Y)=D(\overline X)+D(\overline Y)$ ——两样本独立,且 $D(-\overline Y)=D(\overline Y)$。减法的方差也是相加。
$X_1,\dots,X_6$ 取自 $N(0,1)$。 (1) $Y=(X_1+X_2+X_3)^2+(X_4+X_5+X_6)^2$,求 $C$ 使 $CY\sim\chi^2$; (2) $Y=\dfrac{C(X_1+X_2)}{(X_3^2+X_4^2+X_5^2)^{1/2}}$,求 $C$ 使 $Y\sim t$。
$X_1+X_2+X_3\sim N(0,3)$,要变成标准正态需除以 $\sqrt3$。 两个平方和才是 $\chi^2(2)$,故 $$C=\frac13$$
$t=\dfrac{N(0,1)}{\sqrt{\chi^2(k)/k}}$。
$N(\mu,\sigma^2)$ 抽 16 个,$\mu,\sigma^2$ 未知。求 $P(S^2/\sigma^2\le2.041)$。
$\dfrac{15S^2}{\sigma^2}\sim\chi^2(15)$,两边同乘 15: $P(\chi^2(15)\le30.6)=0.99$。
瓦尔德看出的不是别人算错了,而是样本不是从总体里随机抽的 ——它被「能飞回来」这个条件筛过了。
本讲之后的每一个公式,都默认了「简单随机样本」这五个字: 独立、且与总体同分布。这五个字一旦不成立, $\overline X$ 估的就不是你想要的 $\mu$,后面全部推断随之作废。
拿到任何数据,第一个问题永远是:它是怎么来的?
| 统计量 | 分布 | 什么时候用 |
|---|---|---|
| $\dfrac{\overline X-\mu}{\sigma/\sqrt n}$ | $N(0,1)$ | $\sigma$ 已知 |
| $\dfrac{\overline X-\mu}{S/\sqrt n}$ | $t(n-1)$ | $\sigma$ 未知 |
| $\dfrac{(n-1)S^2}{\sigma^2}$ | $\chi^2(n-1)$ | 推断方差 |
| $\dfrac{S_1^2/\sigma_1^2}{S_2^2/\sigma_2^2}$ | $F(n_1-1,n_2-1)$ | 比较两个方差 |
这张表是第 10–11 讲的操作手册,必须默写。$\sigma$ 未知就必须用 $t$。
本讲造出了一堆统计量,但还没真正「估计」过任何东西—— 只说了 $\overline X$ 逼近 $\mu$,没说凭什么、也没说估得多准。 下一讲:参数估计——怎么构造估计量、怎么判断它好不好, 以及怎么给出一个区间,而不只是一个数。