样本及抽样分布

第 9 讲 · 概率论与数理统计

复旦大学经济学院 ECON130001

上一讲我们做了什么

证明了两件一直欠着的事

大数定律:$\overline X_n$ 依概率收敛于 $\mu$——绪论说的「频率会稳定到概率」; 中心极限定理:$\frac{\overline X_n-\mu}{\sigma/\sqrt n}\dot\sim N(0,1)$,不管原分布是什么

最要紧的一个式子

$E(\overline X_n)=\mu$,$D(\overline X_n)=\dfrac{\sigma^2}{n}$——期望不变,标准差按 $\sqrt n$ 缩小。

★ 留下的问题

上面这些式子里,$\mu$ 与 $\sigma$ 都是已知的——我们从模型推数据。

可现实完全相反:手里只有数据,$\mu$ 和 $\sigma$ 恰恰是要求的东西。 从今天起方向反过来:由数据推模型。

为什么需要这一讲

场景 二战期间,盟军要给轰炸机加装甲。装甲很重,只能加在少数部位。 于是统计返航飞机的中弹分布——机翼与机身弹孔密集,引擎与驾驶舱几乎没有。
冲突 结论似乎是明摆着的:哪里弹孔多,就加固哪里。 数据是真的,统计也没算错。
在哥伦比亚大学「统计研究组」工作的亚伯拉罕·瓦尔德说: 反了——该加固的恰恰是弹孔最少的地方。
悬念 因为这些数据只来自飞回来的飞机。 引擎中弹的那些,根本没能回来被统计。
手里的样本,不等于你想研究的总体。 那么——样本到底能告诉我们关于总体的什么?靠什么保证?
来源 Abraham Wald 与哥伦比亚大学 Statistical Research Group(SRG)于 1943 年就 返航战机的弹着分布提出,装甲应加在受损较少的部位, 因为受损严重仍能返航说明该处可承受打击。相关工作后以 A Method of Estimating Plane Vulnerability Based on Damage of Survivors 为题整理发表,被视为运筹学与「幸存者偏差」的奠基文献之一。 en.wikipedia.org/wiki/Survivorship_bias|访问日期 2026-08-02。 本页只引述定性结论,不涉及具体弹孔计数——流传的具体数字多为后世演绎。

本讲学习目标

  1. 说清总体、样本、统计量三者的关系,以及「简单随机样本」这个假设有多要紧
  2. 会用直方图与样本分布函数把数据画成图,把它们与理论上的 $f$、$F$ 对上
  3. 掌握三个新分布 $\chi^2$、$t$、$F$,知道它们是怎么从正态样本里出来的
概率与统计的分工(绪论那张图)

概率:给定条件,对未知作预测——Play God
统计:给定数据,归纳出规律——Be Human

数理统计三块内容:样本分布(本讲)→ 参数估计(第 10 讲)→ 假设检验(第 11 讲)

一个贯穿三讲的例子

以某科技公司股票的日收益率为考察对象
样本分布(本讲)
  • 画日收益率的频数直方图,看分布形态
  • 假设收益率 $\sim N(\mu,\sigma^2)$, 问样本均值 $\overline X$ 本身服从什么分布
后两讲
  • 参数估计:用数据估出真实的回报率 $\mu$ 与风险 $\sigma^2$
  • 假设检验:检验 $\mu$ 是否显著大于 0(真的赚钱吗); 再检验「服从正态」这个假设本身是否合理

注意第一块里那个问法:「样本均值本身服从什么分布」。 $\overline X$ 是随机变量的函数,所以它也是随机变量,也有自己的分布 ——这就是「抽样分布」,本讲的主角。

总体与样本

定义

总体:研究对象的全体;组成它的每个基本单位称个体
样本:从总体中抽出的若干个体;样本中个体的个数称样本容量

本课程只研究「简单随机样本」
  • 总体是一个随机变量 $X$
  • 简单随机样本是 $n$ 个相互独立、且与总体同分布的随机变量 $X_1,\dots,X_n$
  • 「样本」也可以指某次具体抽样得到的数值 $x_1,\dots,x_n$
★ 「独立同分布」这五个字就是开场故事的要害

瓦尔德那批数据里的飞机,不是从「所有出击的飞机」里随机抽的 ——它们是被「能飞回来」这个条件筛过的。样本与总体不同分布,后面所有结论全部失效。

本讲之后所有的公式,都默认了这五个字。用之前先问一句:我的数据是怎么来的?

统计量

定义

样本 $(X_1,\dots,X_n)$ 的函数 $f(X_1,\dots,X_n)$ 称为统计量, 其中 $f$ 不含未知参数

最常见的统计量是样本均值 $$\overline X=\frac1n\sum_{i=1}^{n}X_i$$

「不含未知参数」这条不是形式要求

$\dfrac{\overline X-\mu}{\sigma/\sqrt n}$ 不是统计量——它含着未知的 $\mu,\sigma$, 算不出来

统计量必须是拿到数据就能算出数值的东西。 本讲后半那些 $\chi^2$、$t$、$F$ 之所以重要,正是因为它们把未知参数消掉了

先把数据画出来:分组统计表

30 个学生的成绩

94 88 95 96 85 81 63 92 77 99 97 69 76 76 85 66 75 86 91 83 96 71 81 60 94 71 67 89 63 64

第一步永远是排序,从 60 到 99。排完之后,分布形态才看得见。

分组统计
组限组中值频数频率累积
60–7065723%23%
70–8075620%43%
80–9085827%70%
90–10095930%100%
分组直方图
频率直方图

直方图:数据版的密度函数

两种直方图,对应两个理论对象
  • 频率直方图:每个长方形的高度 $=$ 频率 $\div$ 组距。 近似的是密度函数 $f(x)$——所以要除以组距, 这样长方形的面积才等于频率。
  • 累积频率直方图近似的是分布函数 $F(x)$
★ 为什么高度要除以组距

因为密度不是概率,面积才是概率——第 5 讲讲了三遍的那件事。 组距变了而不除,图形的高度就会随组距任意变化,没法与 $f$ 对上。

整个统计学的图形,都是在用数据去逼近理论对象: 直方图 → $f$,累积频率 → $F$,样本均值 → $\mu$,样本方差 → $\sigma^2$。

样本分布函数

定义

把样本观测值排序为 $x_1^*\le x_2^*\le\cdots\le x_n^*$,令 $$F_n(x)=\begin{cases} 0,& x<x_1^*\\ k/n,& x_k^*\le x<x_{k+1}^*\\ 1,& x\ge x_n^*\end{cases}$$ 称 $F_n$ 为样本分布函数(也叫经验分布函数)。

成绩数据的 $F_{30}$ $$F_{30}(x)=\begin{cases}0,& x<60\\ 1/30,& 60\le x<63\\ 3/30,& 63\le x<64\\ 4/30,& 64\le x<66\\ \cdots\\ 1,& x\ge99\end{cases}$$

注意 63 那里一步跳了 2/30——因为有两个 63。它是阶梯函数, 形状与第 4 讲离散型的 $F$ 一模一样。

$F_n(x)$ 就是「样本中不超过 $x$ 的比例」。 由伯努利大数律(第 8 讲),对每个固定的 $x$, $F_n(x)$ 依概率收敛于真实的 $F(x)$——这就是「用数据逼近理论」的第一个严格保证。

样本均值与样本方差

定义 $$\overline X=\frac1n\sum_{i=1}^{n}X_i,\qquad S^2=\frac{1}{n-1}\sum_{i=1}^{n}(X_i-\overline X)^2$$

$S=\sqrt{S^2}$ 称为样本标准差。化简计算公式: $$S^2=\frac{1}{n-1}\left(\sum_{i=1}^{n}X_i^2-n\overline X^2\right)$$

★ 为什么分母是 $n-1$ 而不是 $n$

因为 $\overline X$ 是从同一批数据里算出来的。 $n$ 个离差 $X_i-\overline X$ 之间有一个约束:它们的和恒等于 0。 知道了其中 $n-1$ 个,最后一个就定了——真正自由的只有 $n-1$ 个

这个数就叫自由度。除以 $n-1$ 而不是 $n$,$S^2$ 的期望才恰好等于 $\sigma^2$ (第 10 讲称之为无偏性)。

两条平移缩放性质

令 $y_i=x_i-a$,则 $\overline x=\overline y+a$、$s_x^2=s_y^2$;
令 $z_i=(x_i-a)/c$,则 $\overline x=c\overline z+a$、$s_x^2=c^2s_z^2$。

与第 7 讲 $E(aX+c)=aE(X)+c$、$D(aX+c)=a^2D(X)$ 完全平行——手算时用它简化数字。

小结:从数据到统计量

  • 总体是随机变量,样本是 $n$ 个独立同分布的随机变量——这五个字是一切的前提
  • 统计量不能含未知参数,否则算不出数值
  • 统计量本身也是随机变量,也有自己的分布——这就是「抽样分布」
  • 直方图逼近 $f$,样本分布函数逼近 $F$,$\overline X$ 逼近 $\mu$,$S^2$ 逼近 $\sigma^2$
  • $S^2$ 的分母是 $n-1$,因为离差之和恒为 0,自由度少一个

正态总体下的抽样分布

★ 从这里起,全部结论都加一个前提

总体服从正态分布。只有在这个前提下,样本均值、样本方差及它们的函数 才有干净的分布可算。

回顾第 6 讲:正态的线性组合仍是正态

$X_i\sim N(\mu_i,\sigma_i^2)$ 相互独立,则 $$a_1X_1+\cdots+a_kX_k\sim N\Big(\sum a_i\mu_i,\ \sum a_i^2\sigma_i^2\Big)$$

立刻得到样本均值的分布

取 $a_i=\frac1n$、$\mu_i=\mu$、$\sigma_i^2=\sigma^2$: $$\overline X\sim N\!\left(\mu,\ \frac{\sigma^2}{n}\right), \qquad \frac{(\overline X-\mu)\sqrt n}{\sigma}\sim N(0,1)$$

注意与第 8 讲的区别:那里是 $n$ 很大时的近似, 这里总体正态,对任何 $n$ 都精确成立

工具准备:$\Gamma$ 函数与 $\Gamma$ 分布

$\Gamma$ 函数 $$\Gamma(\alpha)=\int_0^{\infty}x^{\alpha-1}e^{-x}\,\mathrm{d}x$$
  • $\Gamma(n)=(n-1)!$(正整数 $n$)——它是阶乘的连续推广
  • $\Gamma(\tfrac12)=\sqrt\pi$
  • $\Gamma(n+\tfrac12)=(n-\tfrac12)(n-\tfrac32)\cdots(\tfrac12)\Gamma(\tfrac12)$
  • $\displaystyle\int_0^{\infty}x^{\alpha-1}e^{-\beta x}\mathrm{d}x=\frac{\Gamma(\alpha)}{\beta^\alpha}$
$\Gamma$ 分布

$X\sim\Gamma(\alpha,\beta)$ 若 $$f(x)=\frac{\beta^\alpha}{\Gamma(\alpha)}x^{\alpha-1}e^{-\beta x},\quad x>0$$

$\alpha=1,\beta=\lambda$ 时就是指数分布——第 5 讲那个的推广。

$$E(X)=\frac{\alpha}{\beta},\qquad D(X)=\frac{\alpha}{\beta^2}$$ (用上面最后那条积分公式直接算出。)

可加性

$X_i\sim\Gamma(\alpha_i,\beta)$ 独立($\beta$ 相同),则 $\sum X_i\sim\Gamma\big(\sum\alpha_i,\ \beta\big)$。

$\chi^2$ 分布:正态平方和

第一步:一个标准正态的平方

若 $X\sim N(0,1)$,则 $X^2\sim\Gamma(\tfrac12,\tfrac12)$。

证明思路 令 $Y=X^2$。$F_Y(y)=P(-\sqrt y\le X\le\sqrt y)=2\Phi_0(\sqrt y)-1$,求导: $$f_Y(y)=\frac{\phi_0(\sqrt y)}{\sqrt y} =\frac{1}{\sqrt{2\pi}}y^{-1/2}e^{-y/2} =\frac{(1/2)^{1/2}}{\Gamma(1/2)}y^{1/2-1}e^{-y/2}$$ 末式正是 $\Gamma(\frac12,\frac12)$ 的密度(用了 $\Gamma(\frac12)=\sqrt\pi$)。 这就是第 5 讲「先求 $G$ 再求导」那一招。完整证明见教师笔记。
第二步:$k$ 个相加

$X_1,\dots,X_k$ 独立且都 $\sim N(0,1)$,由 $\Gamma$ 分布的可加性 $$X_1^2+\cdots+X_k^2\sim\Gamma\!\left(\frac k2,\ \frac12\right)$$ 称为自由度为 $k$ 的卡方分布,记 $\chi^2(k)$。

由 $\Gamma$ 分布的期望方差立得:$E=k$,$D=2k$。

配方只有一句:$k$ 个独立标准正态,各自平方再相加。 所以它非负、右偏;$k$ 越大越对称(中心极限定理)。

样本方差的分布

核心定理

$(X_1,\dots,X_n)$ 取自 $N(\mu,\sigma^2)$,则

  1. $\displaystyle\frac{1}{\sigma^2}\sum_{i=1}^{n}(X_i-\overline X)^2 =\frac{(n-1)S^2}{\sigma^2}\sim\chi^2(n-1)$
  2. $\overline X$ 与 $S^2$ 相互独立
为什么独立

对多元正态,不相关 $\iff$ 独立(第 7 讲)。而 $$\mathrm{Cov}(\overline X,\ X_i-\overline X) =\mathrm{Cov}(\overline X,X_i)-D(\overline X)$$ $=\frac{\sigma^2}{n}-\frac{\sigma^2}{n}=0$。 $\overline X$ 与每个残差都不相关,故与 $S^2$ 独立。

为什么自由度是 $n-1$

平方和分解恒等式: $$\underbrace{\sum\Big(\tfrac{X_i-\mu}{\sigma}\Big)^2}_{\sim\chi^2(n)} =\underbrace{\tfrac{(n-1)S^2}{\sigma^2}}_{B} +\underbrace{\Big(\tfrac{\overline X-\mu}{\sigma/\sqrt n}\Big)^2}_{\sim\chi^2(1)}$$ $B$ 与右项独立,自由度可加:$n=\mathrm{df}(B)+1$,故 $\mathrm{df}(B)=n-1$。

「少一个自由度」这件事,在这里第二次出现—— slide 15 从「离差之和为 0」看出来,这里从平方和分解算出来。是同一件事。

交互:三个分布是怎么造出来的

怎么用

四个标签页各是一个统计量。每页顶部写着配方, 点「再抽」若干组,直方图就会向理论密度靠拢。

现在先看前两页
  1. 样本均值:把 $n$ 拖大,钟形越来越窄——$\sqrt n$ 律
  2. $\chi^2$:非负、右偏;期望恰好等于自由度;$n$ 拖大会变对称

$t$ 与 $F$ 那两页等讲到再回来。

$t$ 分布:当 $\sigma$ 未知时

问题出在哪

$\dfrac{\overline X-\mu}{\sigma/\sqrt n}\sim N(0,1)$ 很漂亮, 但 $\sigma$ 我们不知道——它不是统计量,算不出来。

自然的想法:用样本标准差 $S$ 顶替 $\sigma$。可这样一来分母也随机了,还是正态吗?

$t$ 分布的定义

若 $X\sim N(0,1)$、$Y\sim\chi^2(n)$ 且相互独立,则 $$T=\frac{X}{\sqrt{Y/n}}\sim t(n)$$ 其密度为 $$f(x)=\frac{\Gamma\!\left(\frac{n+1}{2}\right)}{\sqrt{n\pi}\,\Gamma\!\left(\frac n2\right)} \left(1+\frac{x^2}{n}\right)^{-\frac{n+1}{2}}$$

密度式子不必记,记配方:正态除以「$\chi^2$ 除以自由度」的平方根。 分母也在抖,偶尔特别小,就把商顶得很大——这就是 $t$ 比正态尾厚的原因。

$t$ 分布:形状与最重要的一条结论

t 分布与正态分布
自由度越大越接近正态
$t$ 统计量(第 10–11 讲天天用)

$(X_1,\dots,X_n)$ 取自 $N(\mu,\sigma^2)$,则 $$T=\frac{\overline X-\mu}{S/\sqrt n}\sim t(n-1)$$

证明思路 分子分母同除 $\sigma$: $T=\dfrac{(\overline X-\mu)/(\sigma/\sqrt n)}{\sqrt{\frac{(n-1)S^2}{\sigma^2}\big/(n-1)}}$。 分子 $\sim N(0,1)$,根号内 $\sim\chi^2(n-1)/(n-1)$,两者独立(上一页第 2 条) ——正好符合 $t$ 的定义。完整证明见教师笔记。
★ 对照着记

$\sigma$ 已知 → 用 $\dfrac{\overline X-\mu}{\sigma/\sqrt n}\sim N(0,1)$
$\sigma$ 未知 → 用 $\dfrac{\overline X-\mu}{S/\sqrt n}\sim t(n-1)$

自由度 $n\to\infty$ 时 $t$ 趋于标准正态——大样本时两者没差别, 小样本时必须用 $t$。

两个样本的 $t$ 统计量

定理

$(X_1,\dots,X_{n_1})$ 与 $(Y_1,\dots,Y_{n_2})$ 取自两个独立正态总体 $N(\mu_1,\sigma^2)$、$N(\mu_2,\sigma^2)$(方差相同),则 $$T=\frac{(\overline X-\overline Y)-(\mu_1-\mu_2)} {\sqrt{\dfrac{(n_1-1)S_1^2+(n_2-1)S_2^2}{n_1+n_2-2}}\ \sqrt{\dfrac{1}{n_1}+\dfrac{1}{n_2}}} \sim t(n_1+n_2-2)$$

式子长,但结构很简单
  • 分子:两个均值之差,减去它们真实的差(标准化的老套路
  • 第一个根号里是合并方差——两组数据一起估同一个 $\sigma^2$, 按自由度加权平均
  • 第二个根号是 $\overline X-\overline Y$ 的标准差因子($\frac{\sigma^2}{n_1}+\frac{\sigma^2}{n_2}$ 提出 $\sigma^2$ 后剩的)
  • 自由度 $n_1+n_2-2$:两组各损失一个
用在哪:算法 A/B 测试

推荐算法两个版本,两组用户的「人均点击数」分别来自 $N(\mu_1,\sigma^2)$、$N(\mu_2,\sigma^2)$。 要判断两版本优劣,就要先构造这个包含两组信息的统计量、并知道它的分布 ——第 11 讲拿它做检验。

$F$ 分布:比较两个方差

定义

若 $X\sim\chi^2(n_1)$、$Y\sim\chi^2(n_2)$ 相互独立,则 $$F=\frac{X/n_1}{Y/n_2}\sim F(n_1,n_2)$$ 两个 $\chi^2$ 各除以自己的自由度,再相比。

性质:若 $F\sim F(n_1,n_2)$,则 $\dfrac1F\sim F(n_2,n_1)$——倒过来自由度也换个位置, 查表时常用。

两样本方差比的分布

两独立正态总体 $N(\mu_1,\sigma_1^2)$、$N(\mu_2,\sigma_2^2)$ 的样本,则 $$F=\frac{S_1^2/\sigma_1^2}{S_2^2/\sigma_2^2}\sim F(n_1-1,\ n_2-1)$$

由上一节 $\frac{(n_i-1)S_i^2}{\sigma_i^2}\sim\chi^2(n_i-1)$ 直接代入定义即得。

用在哪:比较两支股票的风险

风险用收益率方差衡量。要判断哪支风险更高(比较 $\sigma_1^2$ 与 $\sigma_2^2$), 就构造这个比值统计量。第 11 讲的 $F$ 检验用的就是它。

交互:回到工具,看 $t$ 与 $F$

这次看后两页

切到 $t$:红色虚线是标准正态。

当堂要做的两个实验
  1. $t$ 页把 $n$ 拖到 2–3:尾巴明显比正态厚,中间更矮
  2. 再拖到 40:两条线几乎重合——大样本时用 $z$ 还是 $t$ 无所谓

$F$ 页:两个自由度相等时,分布集中在 1 附近—— 因为那时两个方差在估同一个东西。

例题(一):样本均值的概率

总体 $N(52,\ 6.3^2)$,抽容量 36 的样本。求 $\overline X$ 落在 $50.8$ 到 $53.8$ 之间的概率。

$\overline X\sim N(52,\ 1.05^2)$($6.3/\sqrt{36}=1.05$): $$P=\Phi_0(1.71)-\Phi_0(-1.14)$$ $$=\Phi_0(1.71)+\Phi_0(1.14)-1=0.8293$$

两个独立样本都取自 $N(20,3)$,容量分别 10、15。 求两样本均值之差的绝对值大于 0.3 的概率。

$\overline X-\overline Y\sim N\!\left(0,\ \tfrac{3}{10}+\tfrac{3}{15}\right)=N(0,\ 0.5)$: $$P(|\overline X-\overline Y|>0.3)=2-2\Phi_0\!\left(\tfrac{0.3}{\sqrt{0.5}}\right)$$ $$=2-2\Phi_0(0.42)=0.6744$$

右题的关键是方差相加:$D(\overline X-\overline Y)=D(\overline X)+D(\overline Y)$ ——两样本独立,且 $D(-\overline Y)=D(\overline Y)$。减法的方差也是相加。

例题(二):凑出标准形式

$X_1,\dots,X_6$ 取自 $N(0,1)$。 (1) $Y=(X_1+X_2+X_3)^2+(X_4+X_5+X_6)^2$,求 $C$ 使 $CY\sim\chi^2$; (2) $Y=\dfrac{C(X_1+X_2)}{(X_3^2+X_4^2+X_5^2)^{1/2}}$,求 $C$ 使 $Y\sim t$。

解 (1)

$X_1+X_2+X_3\sim N(0,3)$,要变成标准正态需除以 $\sqrt3$。 两个平方和才是 $\chi^2(2)$,故 $$C=\frac13$$

解 (2):照 $t$ 的配方凑

$t=\dfrac{N(0,1)}{\sqrt{\chi^2(k)/k}}$。

  • 分子:$X_1+X_2\sim N(0,2)$,要除以 $\sqrt2$
  • 分母:$X_3^2+X_4^2+X_5^2\sim\chi^2(3)$,要除以 3 再开根
$$Y=\frac{(X_1+X_2)/\sqrt2}{\sqrt{(X_3^2+X_4^2+X_5^2)/3}} \ \Longrightarrow\ C=\sqrt{\frac32}$$

$N(\mu,\sigma^2)$ 抽 16 个,$\mu,\sigma^2$ 未知。求 $P(S^2/\sigma^2\le2.041)$。

$\dfrac{15S^2}{\sigma^2}\sim\chi^2(15)$,两边同乘 15: $P(\chi^2(15)\le30.6)=0.99$。

本讲总结

① 回到那些飞回来的飞机

瓦尔德看出的不是别人算错了,而是样本不是从总体里随机抽的 ——它被「能飞回来」这个条件筛过了。

本讲之后的每一个公式,都默认了「简单随机样本」这五个字: 独立、且与总体同分布。这五个字一旦不成立, $\overline X$ 估的就不是你想要的 $\mu$,后面全部推断随之作废。

拿到任何数据,第一个问题永远是:它是怎么来的?

本讲总结(续)

② 核心结论(正态总体)
统计量分布什么时候用
$\dfrac{\overline X-\mu}{\sigma/\sqrt n}$$N(0,1)$$\sigma$ 已知
$\dfrac{\overline X-\mu}{S/\sqrt n}$$t(n-1)$$\sigma$ 未知
$\dfrac{(n-1)S^2}{\sigma^2}$$\chi^2(n-1)$推断方差
$\dfrac{S_1^2/\sigma_1^2}{S_2^2/\sigma_2^2}$$F(n_1-1,n_2-1)$比较两个方差

这张表是第 10–11 讲的操作手册,必须默写。$\sigma$ 未知就必须用 $t$。

③ 易错提醒
  • $S^2$ 的分母是 $n-1$,对应的 $\chi^2$ 自由度也是 $n-1$
  • 本讲全部结论都要求总体正态;CLT 才是「不管什么分布」
  • 两样本之的方差是相加

④ 下一讲

本讲造出了一堆统计量,但还没真正「估计」过任何东西—— 只说了 $\overline X$ 逼近 $\mu$,没说凭什么、也没说估得多准。 下一讲:参数估计——怎么构造估计量、怎么判断它好不好, 以及怎么给出一个区间,而不只是一个数。