复旦大学经济学院 ECON130001
区间估计已经在悄悄做判断了:基金回报率的区间整个在 0 以上,我们说它赚钱; 跨过 0,就说不出口。
可这个「说得出口」的界限,凭什么划在那里? 如果判断错了,错的概率是多少?估计只回答「是多少」, 不回答「是不是」。
参数估计:对未知参数给出估计值或估计范围。
假设检验:事先对参数有一个预判,拿到样本后检验这个预判是否站得住。
「事先」两个字是要害——先有假设,后看数据。反过来做,整套理论就失效了(slide 24)。
这是一个主观选定的标准,记为 $\alpha$,称为显著性水平(或检验水平), 一般取 $5\%$ 或 $1\%$。
它像数学里的反证法:先假定 $H_0$ 成立,推出一个结论(这样的样本很罕见), 再用观测到的事实去顶它。
但它不是严格的反证法:数学反证法推出的是矛盾, 这里推出的只是不太可能。不太可能的事也会发生—— 所以这套程序注定会出错,只是出错的概率被我们事先控制住了。
$H_0$ 为真,却把它否定了。
发生概率就是显著性水平 $\alpha$——这是我们主动选定的。
$H_0$ 为假,却没能否定它。
发生概率记为 $\beta$。它不由我们直接选定, 取决于真值离 $H_0$ 有多远、样本有多大。
| $H_0$ 实际为真 | $H_0$ 实际为假 | |
|---|---|---|
| 拒绝 $H_0$ | 第一类错误(概率 $\alpha$) | 判断正确 |
| 不拒绝 $H_0$ | 判断正确 | 第二类错误(概率 $\beta$) |
样本容量固定时,把 $\alpha$ 调小,$\beta$ 必然变大——门槛越高越不容易冤枉, 也就越容易放过。标准做法是先固定 $\alpha$ 再降低 $\beta$; 而唯一能同时压小两者的,是加大样本量。
「不予批准」不等于「证明了这个药无效」——它只意味着手头的证据还不够。 很多药第一次试验没过,是因为样本量太小;加大试验后就过了。
同样,「不拒绝 $H_0$」绝不意味着「证明了 $H_0$ 正确」—— 所以标准说法是「不拒绝原假设」,而不是「接受原假设」。 费希尔的原话是:原假设永远不会被证明或确立,只可能被推翻。
句子里那两个字——「真的」——问的正是: 我们观测到的差异,是本质上的提升,还是随机波动造成的巧合?
新版 App 的日均使用时长比旧版多了 3 分钟。这 3 分钟是真的吗? 只看这个数字永远回答不了——因为哪怕两版完全一样, 两组用户的均值也不可能恰好相等。
假设检验提供的,是一套区分「随机巧合」与「本质不同」的规则 ——并且明确告诉你,这套规则会以多大的概率出错。
样本来自 $N(\mu,\sigma^2)$,$\sigma^2$ 已知。计算统计量 $$U=\frac{\overline X-\mu_0}{\sigma/\sqrt n}$$ 若 $|u|>u_{\alpha/2}$ 则拒绝 $H_0$(临界值由 $P(|U|>u_{\alpha/2})=\alpha$ 定)。
$U$ 就是第 9 讲那个枢轴量,只是把 $\mu$ 换成假设值 $\mu_0$。
$\sigma^2=1.21$,抽 6 块,均值 31.13。$\alpha=5\%$ 下检验平均强度是否为 32.50。
$$u=\frac{31.13-32.50}{\sqrt{1.21/6}}=-3.05$$ $|u|=3.05>1.96$,拒绝 $H_0$——不能认为平均强度是 32.50。
$N(\mu,40^2)$,抽 9 根,均值 780。$\alpha=0.05$ 下能否认为强度是 800?
$$u=\frac{780-800}{40/\sqrt9}=-1.5$$ $|u|=1.5<1.96$,不能拒绝 $H_0$。
注意措辞:结论是「不能拒绝」, 不是「已经证明断裂强度就是 800」。
第一类错误: $$P(\text{拒绝}H_0\mid H_0\text{为真})=P(|U|>u_{\alpha/2})=\alpha$$ 就是 $\alpha$ 本身——这正是我们选 $\alpha$ 的含义。
第二类错误(真值是某个 $\mu\neq\mu_0$): $$\beta=P(|U|<u_{\alpha/2}\mid\mu) =\Phi_0(\lambda+u_{\alpha/2})-\Phi_0(\lambda-u_{\alpha/2}), \quad \lambda=\frac{\mu_0-\mu}{\sigma/\sqrt n}$$
$1-\beta$ 称为功效。
$\sigma^2$ 未知时用 $S$ 顶替,统计量变成 $$T=\frac{\overline X-\mu_0}{S/\sqrt n}$$ 若 $|t|>t_{\alpha/2}(n-1)$ 则拒绝 $H_0$。 与 $z$ 检验只差两处:$\sigma\to S$,$u\to t$。
抽 20 个,均值 3160、样本标准差 300;历史资料 3140。 $\alpha=1\%$ 下有无显著差异($t_{0.005}(19)=2.861$)?
$$t=\frac{3160-3140}{300/\sqrt{20}}=0.298$$ $|t|<2.861$,不能拒绝 $H_0$——没有显著差异。
16 只元件平均寿命 241.5、样本标准差 98.73,国标 280。 $\alpha=5\%$ 下能否认为达标($t_{0.025}(15)=2.131$)?
$$t=\frac{241.5-280}{98.73/\sqrt{16}}=-1.560$$ $|t|<2.131$,不能拒绝 $H_0$。
右题差了 38.5(近 14%)却「不能拒绝」——样本标准差高达 98.73,差距淹没在噪声里。 「没有显著差异」不等于「没有差异」,它往往只是在说:数据还不足以分辨。
某日内交易策略:不能稳定盈利的策略,日均收益率 $\mu$ 应为 0。 模拟 25 天,$\bar x=0.12\%$、$s=0.5\%$,日收益率正态,$\alpha=0.05$。
因为 $H_0$ 是受保护的一方:要说服人「这个策略能赚钱」, 举证责任在声称赚钱的人身上——就像新药要证明自己有效。
把想证明的放进 $H_1$,把「什么也没发生」放进 $H_0$——这是列假设时唯一的规矩。
左边设定 $H_0$、真实世界的参数与检验参数,右边画出两条抽样分布 ——$H_0$ 假定的那条,和真实的那条。两条曲线重叠的部分,就是错误发生的地方。
交互演示:两条抽样分布的重叠部分,就是两类错误发生的地方
$$\chi^2=\frac{(n-1)S^2}{\sigma_0^2}$$ 若 $\chi^2>\chi^2_b$ 或 $\chi^2<\chi^2_a$ 则拒绝 $H_0$,其中 $P(\chi^2>\chi^2_b)=P(\chi^2<\chi^2_a)=\alpha/2$,自由度 $n-1$。
$\chi^2$ 不对称,两个临界值要分别查表,不是一对相反数。
改进工艺后抽 5 炉,样本方差 $0.228^2$。$\alpha=5\%$ 下能否认为方差仍为 $0.108^2$? ($\chi^2_{0.975}(4)=0.484$,$\chi^2_{0.025}(4)=11.1$)
$$\chi^2=\frac{4\times0.228^2}{0.108^2}=17.83$$ $17.83>11.1$,拒绝 $H_0$——方差变了。
以往 $\sigma^2=5000$。新批次取 26 个,$s^2=9200$。$\alpha=2\%$ 下波动性有无显著变化? ($\chi^2_{0.99}(25)=11.524$,$\chi^2_{0.01}(25)=44.314$)
$$\chi^2=\frac{25\times9200}{5000}=46$$ $46>44.314$,拒绝 $H_0$——波动性有显著变化。
统计量不变,$$\chi^2=\frac{(n-1)S^2}{\sigma_0^2}$$ 但只看右尾:$\chi^2>\chi^2_\alpha(n-1)$ 就拒绝。
把 $\alpha$ 全押在一侧,同样的显著性水平下更容易拒绝。
每袋标准重量 500 g,标准差不超过 10 g。抽 9 袋,均值 499 g, 样本标准差 16.03 g。$\alpha=5\%$($t_{0.025}(8)=2.306$,$\chi^2_{0.05}(8)=15.5$)。
先检验均值($\sigma$ 未知,用 $t$): $$t=\frac{499-500}{16.03/\sqrt9}=-0.187$$ $|t|<2.306$,均值这一项正常。
再检验方差(单侧,$H_0:\sigma^2\le100$): $$\chi^2=\frac{8\times16.03^2}{10^2}=20.56$$ $20.56>15.5$,拒绝——波动超标,包装机工作不正常。
一台机器要两项都合格。均值达标而方差超标, 意味着平均没错,但每一袋都可能差很多——这比平均偏一点严重得多。
$$F=\frac{S_1^2}{S_2^2}$$ 若 $F>F_b$ 或 $F<F_a$ 则拒绝,其中 $P(F<F_a)=P(F>F_b)=\alpha/2$, 自由度 $(n_1-1,\ n_2-1)$。
$H_0$ 为真时它退化成第 9 讲那个统计量,应该在 1 附近;单侧版本只看右尾。
甲、乙各 5 个地块,样本方差 2653 与 11784,$\alpha=5\%$ ($F_{0.025}(4,4)=9.60$、$F_{0.975}(4,4)=0.10$)。
$$F=\frac{2653}{11784}=0.23$$ $0.10<0.23<9.60$,不能拒绝——可以认为方差相等。
甲 5 个方差 7.505,乙 4 个方差 2.593,$\alpha=10\%$ ($F_{0.05}(4,3)=9.12$、$F_{0.05}(3,4)=6.59$)。
$F=\dfrac{7.505}{2.593}=2.894$。左临界值要用倒数性质: $$F_{0.95}(4,3)=\frac{1}{F_{0.05}(3,4)}=\frac{1}{6.59}=0.15$$ $0.15<2.894<9.12$,不能拒绝。
$F$ 表通常只印右尾,左临界值要用 $F_{1-\alpha}(m,n)=1/F_\alpha(n,m)$ ——取倒数,两个自由度换位置。
投资者在「新兴市场股票基金 A」与「发达国家债券基金 B」之间配置, 想知道两者的风险(收益率方差)是否有显著差异。 数据:$n_A=16$、$s_A^2=3.5$;$n_B=21$、$s_B^2=1.2$。$\alpha=0.05$ ($F_{0.025}(15,20)=2.57$,$F_{0.975}(15,20)=0.363$)。
有充分证据表明两类资产的风险水平存在显著差异, 构建组合时不能把它们当作同风险资产对待。
12 月出生抽 6 个,方差 505667;6 月出生抽 10 个,方差 93956。 $\alpha=5\%$ 下检验冬季的方差是否比夏季小 ($F_{0.05}(5,9)=3.48$)。
$H_0:\sigma_1^2\le\sigma_2^2$(冬季不比夏季大): $$F=\frac{505667}{93956}=5.382>3.48$$ 拒绝 $H_0$——冬季新生儿体重方差不比夏季小。
问题问的是「冬季是否比夏季小」,但 $H_0$ 写的是相反的那一边。
规矩还是那条:想证明的放 $H_1$。这里想证明「冬季方差更大」, 所以 $H_1:\sigma_1^2>\sigma_2^2$,$H_0$ 只能是 $\sigma_1^2\le\sigma_2^2$。 列反了拒绝域会跑到左尾,$F=5.382$ 落不进去,结论完全相反。
本题做双侧的右临界值是 4.48,单侧的门槛 3.48 更低 ——方向说得越明确越容易显著。所以方向必须在看数据之前定: 先看数据再挑方向,等于白拿一半的 $\alpha$。
若 $|t|>t_{\alpha/2}(n_1+n_2-2)$ 则拒绝 $H_0$。
这就是第 9 讲那个两样本 $t$ 统计量,令 $\mu_1-\mu_2=0$ 之后的样子。
公式里的合并方差 $S_p^2$ 假定了两个总体方差相等。 所以标准流程是两步:
顺序不能反。方差都不同的两组数据,比较均值本来就没多大意义。
新版信息流推荐算法(B)是否比旧算法(A)更能增加用户停留时长? 随机把 20 名用户分两组各 10 人,记录日均使用时长(分钟)。
A 组:$\bar x_A=30.2$,$s_A^2=5.2$;B 组:$\bar x_B=33.5$,$s_B^2=4.5$。 $\alpha=0.05$($F_{0.05}(9,9)=3.179$,$t_{0.05}(18)=1.734$)。
结论:有充分证据认为 B 显著优于 A,可以全量上线。 但注意「随机分成两组」这五个字——这是整个结论的前提。 若 B 组是自愿报名的用户,那批人本来就更活跃,检验再规范也没用 (第 9 讲那些飞回来的飞机)。
$X\sim N(\mu,\sigma^2)$,抽 36 位考生,平均 66.5 分,标准差 15 分。 $\alpha=0.05$ 下能否认为全体考生平均成绩为 70 分?
单个总体期望、$\sigma$ 未知,用 $t$: $$t=\frac{66.5-70}{15/\sqrt{36}}=\frac{-3.5}{2.5}=-1.4$$ 临界值 $t_{0.025}(35)\approx2.03$,$|t|<2.03$,不能拒绝 $H_0$。
正常条件下 $N(1.405,\ 0.048^2)$。某日抽 5 根,纤度为 1.32, 1.55, 1.36, 1.40, 1.44。$\alpha=0.1$ 下总体标准差是否正常?
$H_0:\sigma^2=0.048^2$。算得 $\bar x=1.414$、$S^2=0.00778$: $$\chi^2=\frac{4\times0.00778}{0.048^2}=13.5$$ 临界值 $\chi^2_{0.05}(4)=9.49$、$\chi^2_{0.95}(4)=0.711$。 $13.5>9.49$,拒绝 $H_0$——标准差不正常。
两道题合起来是一个提醒:题目问「均值」就用 $t$(或 $z$),问「方差/标准差」就用 $\chi^2$。 右题给了 $\mu=1.405$ 却用不上——检验方差时均值是不是已知都不影响统计量, 因为 $S^2$ 里已经用样本均值扣掉了它(代价是自由度少一个)。
A(9 个):540 533 520 545 531 541 529 534 525
B(10 个):565 577 580 575 556 542 560 532 570 561
$\alpha=0.1$ 下标准差有无显著差异($F_{0.05}(9,8)=3.39$)?
$S_1^2=63.86$、$S_2^2=236.84$,$F=0.2696$;左临界值 $F_{0.95}(8,9)=1/3.39=0.295$。$0.2696<0.295$,拒绝。
旧:75.5 77.3 76.2 78.1 74.3 72.4 77.4 78.4 76.7 76
新:77.3 79.1 79.1 81 80.2 79.1 82.1 80 77.3 79.1
$\alpha=0.01$ 下新旧工艺的期望有无显著差异?
① 查方差:$s_1^2=3.325$、$s_2^2=2.225$, $F=1.49$ 落在 $(1/6.54,\ 6.54)$ 内,方差可视为相等。
② 比均值:$\bar x=76.23$、$\bar y=79.43$、$S_p=1.666$, $T=\dfrac{76.23-79.43}{1.666\sqrt{0.2}}=-4.296$。 $|T|>t_{0.005}(18)=2.878$,拒绝。
总体密度 $f(x;\theta)$,$\theta\in\Theta$,检验 $H_0:\theta\in\Theta_0$。令 $$L(\hat\Theta)=\sup_{\theta\in\Theta}L,\qquad L(\hat\Theta_0)=\sup_{\theta\in\Theta_0}L$$ 称 $\lambda=\dfrac{L(\hat\Theta)}{L(\hat\Theta_0)}$ 为广义似然比, 否定域为 $W_0=\{\lambda>\lambda_0\}$,$\lambda_0$ 由 $\sup_{\theta\in\Theta_0}P(W_0\mid\theta)=\alpha$ 定出。
读法很直白:不受 $H_0$ 约束时能达到的最大似然, 比受约束时高出太多,就说明这个约束不合理。
可算出 $\lambda=e^{\frac{n}{2\sigma^2}(\bar x-\mu_0)^2}$,故 $$W_0=\{|\bar x-\mu_0|>C\}$$ 由 $P(|\overline X-\mu_0|>C\mid\mu_0)=\alpha$ 解得 $C=\dfrac{u_{\alpha/2}}{\sqrt n}\sigma$ ——正是 slide 9 那个 $z$ 检验。
$\bar x\le\mu_0$ 时 $\lambda\equiv1$(约束根本没起作用),故只需看 $\bar x>\mu_0$, 此时 $\lambda$ 与双侧同形,但否定域变成 $$W_0=\{\bar x-\mu_0>C\}$$ 由 $\sup_{\mu\le\mu_0}P(\cdot)=P(\cdot\mid\mu_0)=\alpha$ 解得 $C=\dfrac{u_{2\alpha}}{\sqrt n}\sigma$。
本节标 * 号,不作考试要求。放在这里只为说明一件事: 前面那四个检验不是各自拍脑袋想出来的,它们都是同一个原理的特例 ——而这个原理,正是上一讲的最大似然。
交互演示:原假设全为真,却总能做出「显著」——试很多次、边看边停
$\alpha=5\%$ 保证的是一次事先定好的检验犯第一类错误的概率是 5%—— 这两个条件缺一不可。这也是第 4 讲那位「连胜十年」的基金经理的另一面。
费希尔没有去争「她能不能尝出来」。他改而问了一个能回答的问题: 如果她完全靠猜,出现眼下这个结果的概率有多大? 答案是 $1/70\approx1.4\%$——罕见到不像是猜的。
但即便八杯全对,费希尔也没有说「证明了她有这个本事」。 他的原话是:原假设永远不会被证明或确立,只可能被推翻。
假设检验不是一台判定真假的机器。 它做的是:把一个含糊的争论,换成一个有明确规则、 并且事先说好了会以多大概率出错的判断程序。
| 要检验什么 | 条件 | 统计量 | 分布 |
|---|---|---|---|
| 单个总体的 $\mu$ | $\sigma^2$ 已知 | $\dfrac{\overline X-\mu_0}{\sigma/\sqrt n}$ | $N(0,1)$ |
| $\sigma^2$ 未知 | $\dfrac{\overline X-\mu_0}{S/\sqrt n}$ | $t(n-1)$ | |
| 单个总体的 $\sigma^2$ | $\mu$ 未知 | $\dfrac{(n-1)S^2}{\sigma_0^2}$ | $\chi^2(n-1)$ |
| 两总体方差之比 | $\mu_1,\mu_2$ 未知 | $\dfrac{S_1^2}{S_2^2}$ | $F(n_1-1,n_2-1)$ |
| 两总体均值之差 | 方差未知但相等 | $\dfrac{\overline X-\overline Y}{S_p\sqrt{1/n_1+1/n_2}}$ | $t(n_1+n_2-2)$ |
从分赌本到八杯茶,十二讲已全部讲完。下一讲是复习课: 把这两半接成一张图,看清两个方向在哪一点上对接。