复旦大学经济学院 ECON130001
| $\dfrac{\overline X-\mu}{\sigma/\sqrt n}\sim N(0,1)$ | $\sigma$ 已知 |
| $\dfrac{\overline X-\mu}{S/\sqrt n}\sim t(n-1)$ | $\sigma$ 未知 |
| $\dfrac{(n-1)S^2}{\sigma^2}\sim\chi^2(n-1)$ | 推断方差 |
| $\dfrac{S_1^2/\sigma_1^2}{S_2^2/\sigma_2^2}\sim F(n_1-1,n_2-1)$ | 比较两个方差 |
上一讲只说了 $\overline X$ 「逼近」$\mu$、$S^2$「逼近」$\sigma^2$。 可凭什么是它们?换一个式子行不行?
更要紧的是:估出来的那个数,离真值到底有多远? 只报一个数字,等于什么都没说。
实际工作中,我们往往知道总体分布的大致类型(正态、指数、二项……), 但不知道其中的参数。参数估计就是用样本把它算出来: $$\hat\theta(X_1,X_2,\cdots,X_n)$$ 称为 $\theta$ 的估计量。
注意它是统计量——不含未知参数,拿到数据就能算。
消费函数 $C=a+bY$。边际消费倾向 $b$ 就是要估的参数—— 它决定了财政刺激的乘数有多大。
一个图像识别模型内部有上亿个参数。所谓「训练模型」, 本质就是用大量数据去估计这些参数——用的正是本讲后半的最大似然思想。
一致性(样本够多时收敛到真值)→ 无偏性(平均而言不偏)→ 有效性(波动更小)
若 $n\to\infty$ 时 $\hat\theta$ 依概率收敛于 $\theta$,即对任意 $\varepsilon>0$ $$\lim_{n\to\infty}P(|\hat\theta-\theta|<\varepsilon)=1$$ 则称 $\hat\theta$ 是 $\theta$ 的一致估计。
注意最后两条:分母除 $n-1$ 还是 $n$,都一致。 一致性是个「大样本」的要求,$n$ 很大时差一个分母无所谓。
一致性是底线,不是优点。一个估计量连样本无限多都收敛不到真值, 那它根本不能用。真正用来分高下的是后面两把尺子。
若 $E\hat\theta=\theta$,则称 $\hat\theta$ 是 $\theta$ 的无偏估计。
「无偏」说的是把整个抽样过程重复无穷多次,估计值的平均正中真值 ——不是说某一次估得准。
——上一讲那个 $n-1$ 的分母,就是为了这一条。
$X_1$ 无偏,却连一致都不是:样本再多,它也只看第一个数,永远不收敛。 无偏与一致,是两件互不蕴含的事。
反过来 $\frac1n\sum(X_i-\overline X)^2$ 有偏、却一致。 这说明一把尺子不够用。
从同一总体中抽取两个独立样本 $(X_{11},\cdots,X_{1n_1})$ 与 $(X_{21},\cdots,X_{2n_2})$,则 $$\overline X=\frac{1}{n_1+n_2}\left(n_1\overline{X_1}+n_2\overline{X_2}\right)$$ $$S^2=\frac{(n_1-1)S_1^2+(n_2-1)S_2^2}{n_1+n_2-2}$$ 分别是总体期望与方差的无偏估计量。
均值按样本量加权,方差按自由度 $n_i-1$ 加权。 分母 $n_1+n_2-2$:两组各损失一个自由度,因为各自的均值都是从数据里算出来的。
第二个式子就是上一讲两样本 $t$ 统计量里的合并方差 $S_p^2$ ——它在本讲区间估计、下一讲假设检验里还会出现三次。
设总体服从参数为 $\lambda$ 的指数分布,令 $\theta=1/\lambda$。证明 $\overline X$ 与 $n\cdot\min(X_1,\cdots,X_n)$ 都是 $\theta$ 的无偏估计。
$E(\overline X)=E(X)=1/\lambda=\theta$。完事。
令 $Z=\min(X_1,\cdots,X_n)$。最小值大于 $z$,当且仅当每一个都大于 $z$: $$P(Z>z)=\prod_{i=1}^{n}P(X_i>z)=e^{-n\lambda z}$$ 故 $F_Z(z)=1-[1-F_X(z)]^n=1-e^{-n\lambda z}$ ——$Z$ 服从参数 $n\lambda$ 的指数分布。
于是 $E(Z)=\dfrac{1}{n\lambda}$,$E(nZ)=\dfrac1\lambda=\theta$。
两个都无偏,那该用哪一个?无偏性到这里就分不出高下了 ——第三把尺子登场。
$\hat\theta$ 与 $\hat\theta'$ 都是 $\theta$ 的无偏估计。样本容量给定时, 若 $D(\hat\theta)<D(\hat\theta')$,则称 $\hat\theta$ 比 $\hat\theta'$ 有效。
若在 $\theta$ 的一切无偏估计中 $\hat\theta$ 的方差最小, 则称 $\hat\theta$ 为 $\theta$ 的有效估计量。
差了 $n$ 倍。$n=100$ 时,$\overline X$ 的方差只有它的百分之一。 答案很清楚:用 $\overline X$。
为什么差这么多?因为 $n\min$ 只用了一个数据点(最小的那个), 其余 $n-1$ 个全扔了。用上全部信息的估计量,方差才会随 $n$ 变小。
——这正是开场故事里高斯的那句话:一次观测都不能扔。
比较总体期望的两个无偏估计 $\overline X=\frac1n\sum X_i$ 与 $X'=\sum a_iX_i\big/\sum a_i$($a_i>0$)的有效性。
两者都无偏($X'$ 的权重之和为 1)。方差: $$D(\overline X)=\frac{\sigma^2}{n},\qquad D(X')=\frac{\sum a_i^2}{\left(\sum a_i\right)^2}\sigma^2$$
用 $a^2+b^2\ge2ab$: $$\left(\sum_{i=1}^na_i\right)^2=\sum_i a_i^2+\sum_{i\neq j}a_ia_j \le\sum_i a_i^2+\sum_{i\neq j}\frac{a_i^2+a_j^2}{2}=n\sum_i a_i^2$$ 故 $\dfrac{\sum a_i^2}{(\sum a_i)^2}\ge\dfrac1n$,即 $D(\overline X)\le D(X')$。
在所有线性无偏估计里,等权重的算术平均方差最小; 只有当 $a_1=\cdots=a_n$ 时取等号。
换句话说:数据同质时,别自作聪明加权。 (若各观测精度不同,最优权重与方差成反比——那是计量经济学的加权最小二乘。)
| 标准 | 说的是什么 | 一句话 |
|---|---|---|
| 一致性 | $n\to\infty$ 时收敛到真值 | 底线,不是优点 |
| 无偏性 | $E\hat\theta=\theta$ | 重复无穷多次,平均正中靶心 |
| 有效性 | 无偏估计中方差最小 | 枪法更稳,弹着点更集中 |
既然样本是从总体里抽出来的,样本的特征就该和总体的特征相似。 「矩」是刻画分布特征的量——一阶矩是期望,二阶矩与方差有关。
让模型的理论矩,等于从样本里算出来的矩。有几个未知参数,就列几个方程。
由「数理统计之父」卡尔·皮尔逊在 19 世纪末提出,是最早的一般化参数估计方法。 今天有了更强的最大似然法,但矩估计因为思想直白、计算简便, 仍是理解参数估计的起点。
总体 $X$ 的 $k$ 阶原点矩:$\mu_k=E(X^k)$。
样本的 $k$ 阶样本矩:$A_k=\dfrac1n\sum_{i=1}^{n}X_i^k$。
由大数定律,$n\to\infty$ 时 $A_k$ 依概率收敛于 $\mu_k$ ——整个方法的合法性就来自这一句。
几个未知参数,就用几阶矩。
$\mu_1=1/\lambda\ \Rightarrow\ \lambda=1/\mu_1$,代入样本矩: $$\hat\lambda=\frac{1}{\overline X}$$ 一个参数,一阶矩就够。
$\mu_1=\dfrac{a+b}{2}$,$\mu_2=\dfrac{(b-a)^2}{12}+\dfrac{(a+b)^2}{4}$, 解得 $a,b=\mu_1\mp\sqrt{3(\mu_2-\mu_1^2)}$,故 $$\hat a,\hat b=\overline X\mp\sqrt{\frac3n\sum_{i=1}^n(X_i-\overline X)^2}$$ 两个参数,用到二阶矩。
右边那个解不必硬记:注意 $\mu_2-\mu_1^2$ 就是方差 $\frac{(b-a)^2}{12}$, 所以 $b-a=\sqrt{12(\mu_2-\mu_1^2)}$,再把区间中点 $\mu_1$ 往两边各推一半。
$\mu_1=np$,$\mu_2=np(1-p)+n^2p^2$
注意 $\mu_1^2+\mu_1-\mu_2=np^2$,故 $$p=\frac{\mu_1^2+\mu_1-\mu_2}{\mu_1},\qquad n=\frac{\mu_1^2}{\mu_1^2+\mu_1-\mu_2}$$ 代入样本矩(记 $B^2=\frac1n\sum(X_i-\overline X)^2$): $$\hat p=\frac{\overline X-B^2}{\overline X},\qquad \hat n=\frac{\overline X^2}{\overline X-B^2}$$
$\mu_1=\mu$,$\mu_2=\sigma^2+\mu^2$,解得 $\mu=\mu_1$、$\sigma^2=\mu_2-\mu_1^2$: $$\hat\mu=\overline X,\qquad \hat{\sigma^2}=\frac1n\sum_{i=1}^n(X_i-\overline X)^2$$
对任何分布,期望与方差的矩估计都是这两个式子。 因为一阶矩就是期望、二阶中心矩就是方差,与分布类型无关。
盯住 $\hat{\sigma^2}$ 的分母:是 $n$,不是 $n-1$。 也就是说——矩估计给出的方差估计是有偏的。
某路公交车每隔 $\theta$ 分钟发一班($\theta$ 未知)。乘客在任意时刻到站, 等待时间 $X\sim U(0,\theta)$。随机调查 $n$ 位乘客,得样本 $X_1,\cdots,X_n$,估计 $\theta$。
平均等待时间应该是发车间隔的一半,所以间隔就是平均等待时间的两倍。 结果与常识严丝合缝——矩估计的朴素之处正在于此。
先记住这道题。slide 23 我们会用最大似然法重做一遍, 得到一个完全不同的答案。哪个对?——那时再说。
优点
代价
总体分布为 $f(x;\theta)$,现有观测值 $x_1,\cdots,x_n$。问: $\theta$ 取什么值时,我手上这批数据最有可能出现? 就认为那个 $\theta$ 最合理。
$$L(x_1,\cdots,x_n;\theta)=\prod_{i=1}^{n}f(x_i;\theta)$$ 其中 $f$ 是概率函数(离散)或密度函数(连续)。
式子长得和联合密度一模一样,但看的方向反了: 联合密度里 $\theta$ 固定、$x$ 是变量;似然函数里 $x$ 是已经拿到的数据、固定不动, $\theta$ 才是变量。
所以 $L$ 的图像横轴是参数,不是数据。它不积分成 1,也不是概率。
若 $L(x_1,\cdots,x_n;\theta)$ 在 $\hat\theta$ 处达到最大值, 则称 $\hat\theta$ 是 $\theta$ 的最大似然估计(MLE)。
连乘变成连加,求导容易得多。$\ln$ 单调递增,所以 $\ln L$ 与 $L$ 在同一点取最大。
标准套路:$\dfrac{\partial\ln L}{\partial\theta}=0$,解出 $\hat\theta$。 多个参数就解偏导方程组。
只有当 $L$ 光滑、最大值在内部取到时,求导才有效。 如果 $L$ 在边界上单调、最大值取在端点(比如均匀分布), 令导数为零会得不到解,甚至得到错误答案——slide 23、27 各有一例。
上面一张图是数据与当前参数下的密度,下面一张是对数似然函数。 拖动参数滑块,两张图同时变。
「均匀 $\theta$」那一页留到 slide 24 再看。
交互演示:拖动参数,看数据与密度的贴合程度和对数似然曲线同步变化
与矩估计完全一样。
注意二项那一列:$\sum\ln C_n^{x_i}$ 这一项不含 $p$,求导直接消失。 凡是与参数无关的因子,取对数后都不影响求导——写似然时可以直接扔掉。
参数必须满足 $a<\min x_i$ 且 $b>\max x_i$ ——否则某个 $x_i$ 落在区间外,$f(x_i)=0$,整个 $L=0$。 在此条件下 $\ln L=-n\ln(b-a)$,它没有驻点:对 $a$ 求导恒正、对 $b$ 求导恒负。 要 $\ln L$ 最大就要 $b-a$ 最小,而它受上面那个约束限制: $$\hat a=\min x_i,\qquad \hat b=\max x_i$$
$U(0,\theta)$ 的 MLE 是 $\hat\theta=\max x_i$: 「已经见过有人等了 19 分钟,那间隔至少 19 分钟」。 而矩估计给的是 $2\overline X$。两个答案完全不同。
而且 $\max x_i$ 永远小于真正的 $\theta$——它系统性偏低,是有偏估计。 可以证明 $E(\max X_i)=\dfrac{n}{n+1}\theta$,所以 $\dfrac{n+1}{n}\max x_i$ 才无偏。
交互演示:重复 2000 次抽样,对比 MLE 与矩估计的偏差和标准差
所以「哪个对」这个问题本身就问错了。看你要什么: 要平均无误差,用矩估计;要单次估得稳,用 MLE(或它的无偏修正版 $\frac{n+1}{n}\max x_i$,两样都占)。
分别求偏导: $$\frac{\partial\ln L}{\partial\mu}=\frac{1}{\sigma^2}\Big(\sum_{i=1}^n x_i-n\mu\Big)=0,\qquad \frac{\partial\ln L}{\partial\sigma^2}=-\frac{n}{2\sigma^2} +\frac{1}{2(\sigma^2)^2}\sum_{i=1}^n(x_i-\mu)^2=0$$ $$\hat\mu=\overline X,\qquad \hat{\sigma^2}=\frac1n\sum_{i=1}^n(X_i-\overline X)^2$$
盯住第一个偏导:让它为零,等价于让 $\sum(x_i-\mu)^2$ 最小。 也就是说——在正态误差下,最大似然估计就是「残差平方和最小」。
这正是高斯给欧洲天文学界的答案:「最贴近全部数据」= 残差平方和最小。 对最简单的情形(反复测同一个量),它给出的就是算术平均。 von Zach 按高斯的预报,在 1801 年 12 月 7 日重新找到了谷神星。
把这个想法推广到 $C=a+bY$ 这样的关系上,就是最小二乘法——计量经济学的第一课。
$Y=1$ 表示购买。用逻辑回归描述: $$P(Y=1\mid x)=\frac{1}{1+e^{-\theta x}}$$ $\theta$ 就是要用数据估计的未知参数。
收集到 3 个样本:(年龄 20, 不买)、(年龄 35, 买)、(年龄 50, 买)。似然函数就是 「观测到这三个结果」的概率: $$L(\theta)=\Big(1-\frac{1}{1+e^{-20\theta}}\Big) \cdot\frac{1}{1+e^{-35\theta}}\cdot\frac{1}{1+e^{-50\theta}}$$ 找 $\hat\theta$ 使 $L$ 最大——这个过程就叫「训练模型」。 实践中对 $\ln L$ 求最大,并用梯度下降数值求解。
深度学习里那个「交叉熵损失函数」,就是负对数似然。 最小化损失 = 最大化似然。本页这个式子和一个上亿参数的模型,用的是同一个原理。
$f(x,\theta)=(\theta+1)x^\theta$,$0<x<1$,$\theta>-1$ 未知。 求 $\theta$ 的矩估计与最大似然估计。
矩估计: $\mu_1=EX=\displaystyle\int_0^1(\theta+1)x^{\theta+1}\mathrm dx=\frac{\theta+1}{\theta+2}$, 反解 $\theta=\dfrac{2\mu_1-1}{1-\mu_1}$: $$\hat\theta=\frac{2\overline X-1}{1-\overline X}$$
MLE: $\ln L=n\ln(\theta+1)+\theta\sum\ln x_i$,令 $\dfrac{\mathrm d\ln L}{\mathrm d\theta}=0$: $$\hat\theta=-\frac{n}{\sum_{i=1}^n\ln x_i}-1$$
$f(x,\theta)=2e^{-2(x-\theta)}$,$x>\theta$,$\theta>0$ 未知。求 $\theta$ 的 MLE。
$$\ln L=n\ln2-2\sum_{i=1}^n x_i+2n\theta$$ 它是 $\theta$ 的单调递增函数,令导数为零无解。 但约束是 $\theta\le\min x_i$(否则某个 $x_i$ 落在支撑外,$L=0$),故 $$\hat\theta=\min x_i$$
又一次:最大值在端点。 凡是参数出现在分布支撑的边界上($x>\theta$、$0<x<\theta$ 这类), 就要先画出 $\ln L$ 随 $\theta$ 变化的样子,别急着求导。
| 矩估计 | 最大似然估计 | |
|---|---|---|
| 思想 | 模型的矩 = 样本的矩 | 让手上这批数据最可能出现 |
| 做法 | 列方程组,反解,代入 $A_k$ | 写 $\ln L$,求导置零(或看端点) |
| 要求 | 只要矩存在,不必知道分布形式 | 必须知道 $f(x;\theta)$ 的具体形式 |
| 性质 | 一定一致,不一定无偏 | 一般一致,常常有偏,但更有效 |
说「这只基金的月均回报率是 1.5%」,听起来很确定。 可这个 1.5% 是从 16 个月的数据里算出来的——换 16 个月,它会变成别的数。 只报一个数,等于把估计的不确定性藏了起来。
找两个统计量 $\underline\theta(X_1,\cdots,X_n)$、$\overline\theta(X_1,\cdots,X_n)$,使 $$P(\underline\theta<\theta<\overline\theta)=1-\alpha$$ 则称 $(\underline\theta,\overline\theta)$ 为置信区间, $1-\alpha$ 为置信度。常取 $\alpha=5\%$ 或 $1\%$。
$\theta$ 是固定的常数,不是随机变量; 随机的是区间的两个端点——它们由样本算出。
所以「95% 置信区间」的正确读法是:按这个方法反复抽样、反复造区间, 其中约 95% 的区间会套住真值。不是「$\theta$ 有 95% 的概率落在这个区间里」。
整个下半场只做一件事:把第 9 讲那四个统计量当枢轴量,逐个反解。
| $\dfrac{\overline X-\mu}{\sigma/\sqrt n}\sim N(0,1)$ | → $\mu$ 的区间($\sigma$ 已知) |
| $\dfrac{\overline X-\mu}{S/\sqrt n}\sim t(n-1)$ | → $\mu$ 的区间($\sigma$ 未知) |
| $\dfrac{(n-1)S^2}{\sigma^2}\sim\chi^2(n-1)$ | → $\sigma^2$ 的区间 |
| $\dfrac{S_1^2/\sigma_1^2}{S_2^2/\sigma_2^2}\sim F(n_1-1,n_2-1)$ | → $\sigma_1^2/\sigma_2^2$ 的区间 |
枢轴量不是统计量——它含着未知参数 $\theta$(所以算不出数值), 但它的分布不含未知参数(所以能查表)。这两点缺一不可。
由 $\dfrac{\overline X-\mu}{\sigma/\sqrt n}\sim N(0,1)$,找临界值 $u_{\alpha/2}$ 使 $$P\left(\left|\frac{\overline X-\mu}{\sigma/\sqrt n}\right|<u_{\alpha/2}\right)=1-\alpha$$ 变形(把 $\mu$ 解到中间)得 $$P\left(\overline X-\frac{\sigma}{\sqrt n}u_{\alpha/2}<\mu <\overline X+\frac{\sigma}{\sqrt n}u_{\alpha/2}\right)=1-\alpha$$
其中 $u_{\alpha/2}$ 由 $\Phi_0(u_{\alpha/2})=1-\alpha/2$ 查表: $\alpha=5\%$ 时 $u_{\alpha/2}=1.96$;$\alpha=1\%$ 时 $u_{\alpha/2}=2.58$。
随机抽 10 个灯泡,平均寿命 1200 小时。总体正态、方差为 8。求 $\alpha=5\%$ 的置信区间。
$$\left(1200\mp1.96\cdot\frac{\sqrt8}{\sqrt{10}}\right)=(1198.25,\ 1201.75)$$
区间的半宽 $\frac{\sigma}{\sqrt n}u_{\alpha/2}$ 说明了三件事: $\sigma$ 越大越宽、$n$ 越大越窄(按 $\sqrt n$)、要求的把握越大越宽。 想把区间缩一半,样本量要翻两番。
由中心极限定理,$\overline X$ 近似正态,故 $$\left(\overline X-\frac{\sigma}{\sqrt n}u_{\alpha/2},\ \overline X+\frac{\sigma}{\sqrt n}u_{\alpha/2}\right)$$ 仍可用。$\sigma$ 未知时用 $S$ 顶替即可——$n$ 大时这点差别可以忽略。
注意这里不要求总体正态,靠的是第 8 讲的中心极限定理。
月回报率 $\sim N(\mu,\sigma^2)$,已知波动率 $\sigma=2\%$。抽 $n=16$ 个月,样本均值 $\bar x=1.5\%$。 求 $\mu$ 的 95% 置信区间。
$z_{0.025}=1.96$,半宽 $=1.96\times\frac{2}{\sqrt{16}}=0.98$: $$(1.5-0.98,\ 1.5+0.98)=(0.52\%,\ 2.48\%)$$
整个区间都在 0 以上——这才是分析师真正关心的结论: 有较强把握认为这只基金确实在赚钱。
如果区间是 $(-0.3\%,\ 3.3\%)$ 呢?点估计还是 1.5%, 但「赚钱」这个结论就站不住了。这就是为什么必须报区间。
正态总体、$\sigma^2$ 未知,用 $t$ 作枢轴量: $$\left(\overline X\mp\frac{S}{\sqrt n}t_{\alpha/2}(n-1)\right)$$ 与上一个公式只差两处:$\sigma\to S$,$u\to t$。
$n=10$,$\bar x=1200$,$S^2=8$,$t_{0.025}(9)=2.262$: $$\left(1200\mp2.262\cdot\frac{\sqrt8}{\sqrt{10}}\right)=(1198,\ 1202)$$ 比 $\sigma$ 已知时宽了——因为多估了一个 $\sigma$,代价就是区间变宽。
抽 4 天:10, 5, 2, 7。求 $\alpha=1\%$ 的置信区间,$t_{0.005}(3)=5.841$。
$\bar x=6$,$S^2=\frac{16+1+16+1}{3}=11.33$: $$\left(6\mp5.841\cdot\frac{\sqrt{11.33}}{\sqrt4}\right)=(-3.8,\ 15.8)$$
区间宽到几乎没有信息。4 个数据、要求 99% 的把握, 换来的就是这样一个结论。数据太少时,诚实的报告本来就该这么宽。
反复抽样、反复造区间。每个区间都不一样,真值那条竖线一动不动。
第 3 条是关键:置信度管的是「漏掉的比例」,样本量管的是「区间的宽度」。 两件事互不干涉。
交互演示:反复造区间,数一数有多少条没套住真值
方差未知时用 $S_1^2,S_2^2$ 顶替。根号里是相加——第 9 讲说过,差的方差也是相加。
其中 $S_p^2=\dfrac{(n_1-1)S_1^2+(n_2-1)S_2^2}{n_1+n_2-2}$ ——就是 slide 8 那个合并方差。
用在哪:A/B 测试。两版推荐算法,两组用户的人均点击数。 如果 $\mu_1-\mu_2$ 的置信区间整个在 0 以上,就有把握说版本一更好; 如果区间跨过 0,「更好」这个结论就下不了——哪怕两组的样本均值确实差了一截。
正态总体,用 $\dfrac{(n-1)S^2}{\sigma^2}\sim\chi^2(n-1)$ 作枢轴量: $$P\left(a<\frac{(n-1)S^2}{\sigma^2}<b\right)=1-\alpha$$ 把 $\sigma^2$ 解到中间要取倒数,不等号方向翻转,故 $$\left(\frac{(n-1)S^2}{b},\ \frac{(n-1)S^2}{a}\right)$$ 取 $a=\chi^2_{1-\alpha/2}(n-1)$、$b=\chi^2_{\alpha/2}(n-1)$, 其中 $\chi^2_\alpha$ 由 $P(\chi^2\ge\chi^2_\alpha)=\alpha$ 查表。
与前面两个不同:$\chi^2$ 不对称,所以两端的临界值不是一对相反数, 要分别查两次表。学生最常见的错误是只查一个然后加负号。
抽 30 袋,样本标准差 10 克,总体正态。求 $\alpha=5\%$ 时 $\sigma^2$ 的置信区间。
$(n-1)S^2=29\times100=2900$,查表 $\chi^2_{0.025}(29)=45.72$、$\chi^2_{0.975}(29)=16.05$: $$\left(\frac{2900}{45.72},\ \frac{2900}{16.05}\right)=(63.4,\ 180.7)$$
取 9 发炮弹试验,样本标准差 $S=11$ m/s,总体正态。 求 $\alpha=5\%$ 时标准差 $\sigma$ 的置信区间。 已知 $\chi^2_{0.025}(8)=17.5$、$\chi^2_{0.975}(8)=2.18$。
$(n-1)S^2=8\times121=968$: $$\sigma^2\in\left(\frac{968}{17.5},\ \frac{968}{2.18}\right)=(55.31,\ 444.04)$$ 再对两个端点开平方: $$\sigma\in(7.44,\ 21.07)$$
右题最后一步是唯一的技术点:要 $\sigma$ 的区间,就把 $\sigma^2$ 区间的两个端点各开平方。 这一步合法,是因为开平方是严格单调的变换,不改变「落在区间内」这件事。
区间从 7.44 跨到 21.07,宽得惊人——9 个数据估方差,就是这个精度。 估方差比估均值要费数据得多。
期望未知的情形。由第 9 讲 $$\frac{S_1^2/S_2^2}{\sigma_1^2/\sigma_2^2}\sim F(n_1-1,n_2-1)$$ 得 $$P\left(F_{1-\alpha/2}<\frac{S_1^2/S_2^2}{\sigma_1^2/\sigma_2^2}<F_{\alpha/2}\right)=1-\alpha$$ 故 $\dfrac{\sigma_1^2}{\sigma_2^2}$ 的置信区间为 $$\left(\frac{S_1^2}{S_2^2}\cdot\frac{1}{F_{\alpha/2}(n_1-1,n_2-1)},\ \frac{S_1^2}{S_2^2}\cdot\frac{1}{F_{1-\alpha/2}(n_1-1,n_2-1)}\right)$$
比较两支股票的风险时,看这个区间是否包含 1: 包含 1,就说不出谁的波动更大;整个在 1 以上,才有把握说第一支风险更高。
查表提示:多数表只给 $F_{\alpha/2}$,$F_{1-\alpha/2}(n_1,n_2)=1\big/F_{\alpha/2}(n_2,n_1)$ ——第 9 讲那条「倒过来自由度换位」的性质,就是为这里准备的。
从一批钉子中抽 16 枚,样本均值 2.125,样本标准差 0.017,长度服从正态分布,$\alpha=0.1$。 求:(1) 已知 $\sigma=0.01$ 时 $\mu$ 的置信区间;(2) $\sigma$ 未知时 $\mu$ 的置信区间; (3) $\sigma$ 未知时 $\sigma^2$ 的置信区间。
已知 $u_{0.05}=1.65$,$t_{0.05}(15)=1.753$,$\chi^2_{0.05}(15)=25$,$\chi^2_{0.95}(15)=7.26$
(1) $\left(\overline X\mp u_{\alpha/2}\frac{\sigma}{\sqrt n}\right)$ $=2.125\mp1.65\times\frac{0.01}{4}$ $$=(2.121,\ 2.129)$$
(2) $\left(\overline X\mp t_{\alpha/2}\frac{S}{\sqrt n}\right)$ $=2.125\mp1.753\times\frac{0.017}{4}$ $$=(2.117,\ 2.130)$$
(3) $\left(\frac{(n-1)S^2}{\chi^2_{\alpha/2}},\frac{(n-1)S^2}{\chi^2_{1-\alpha/2}}\right)$ $=\left(\frac{0.004335}{25},\frac{0.004335}{7.26}\right)$ $$=(0.00017,\ 0.000597)$$
对比 (1) 与 (2):同一批数据,$\sigma$ 未知时区间明显更宽 (半宽从 0.0041 变成 0.0074)。多估一个参数,精度就要付出代价—— $n=16$ 时 $t$ 比 $u$ 大了 6%,而 $S$ 又比 $\sigma$ 大了 70%。
$E(X)=p$,$D(X)=p(1-p)$。大样本下 $\overline X$ 近似 $N\big(p,\ p(1-p)/n\big)$,故 $$P\left(\frac{|\overline X-p|}{\sqrt{p(1-p)/n}}<u_{\alpha/2}\right)\approx1-\alpha$$ 难点在于 $p$ 同时出现在分子和分母。两边平方整理成 $ap^2+bp+c<0$,其中 $$a=n+u_{\alpha/2}^2,\quad b=-(2n\overline X+u_{\alpha/2}^2),\quad c=n\overline X^2$$ 解二次不等式得区间 $\left(\dfrac{-b-\sqrt{b^2-4ac}}{2a},\ \dfrac{-b+\sqrt{b^2-4ac}}{2a}\right)$。
若统计量 $\underline\theta$ 满足 $P(\theta>\underline\theta)\ge1-\alpha$, 则 $(\underline\theta,+\infty)$ 是 $\theta$ 的单侧置信区间(给出置信下限)。
若 $\overline\theta$ 满足 $P(\theta<\overline\theta)\ge1-\alpha$, 则 $(-\infty,\overline\theta)$ 给出置信上限。
什么时候用单侧?只关心一个方向的时候。 买设备只关心寿命的下限,控制污染只关心排放的上限。
把 $\alpha$ 全押在一边,同样的置信度下这一侧的界限比双侧更紧 ——查表时用 $u_\alpha$ 而不是 $u_{\alpha/2}$。
高斯没有去挑「最可靠的三次观测」。他把二十多次全用上, 问了一个不同的问题:参数取什么值时,我看到的这批数据最有可能出现?
在正态误差下,这个问题的答案是残差平方和最小; 对反复测量同一个量的情形,答案就是算术平均。 von Zach 按这个答案,把丢了十个月的谷神星找了回来。
「最好的估计」不是一个可以靠直觉认定的东西——它需要一个准则。 本讲给了三把尺子和两种造法。
区间估计已经在悄悄回答判断题了:基金的回报率区间整个在 0 以上, 我们就说它赚钱;跨过 0,就说不出口。
可这个界限到底划在哪?下一讲:假设检验——把这句话变成一套 有明确规则、也有明确犯错概率的判断程序,并看清它会以哪两种方式出错。