复旦大学经济学院 ECON130001
十三讲讲完了。可如果现在问一句:「这门课到底在讲什么?」 ——把随机事件、随机变量、期望方差、大数定律、抽样分布、估计、检验一路列下来, 那只是目录,不是答案。
它们之间是怎么接上的?这是最后一次课要回答的事。
三种题型对应三种准备:选择题考概念边界(「不相关能否推出独立」这类), 计算题考流程熟练度,证明题考的是定义会不会用—— 绝大多数证明题的第一步就是把定义写出来。
由模型推数据(绪论 – 第 8 讲)
给定分布与参数,算出事件的概率、随机变量的期望方差、 以及样本量趋于无穷时的极限行为。
终点是大数定律与中心极限定理 ——它们回答了「样本能有多接近总体」。
由数据推模型(第 9 – 11 讲)
手上只有样本,参数才是要求的东西。
起点是抽样分布 ——它把上半场那些定理,变成了四个可以查表的统计量。
就在这一个式子上: $$\overline X\sim N\!\left(\mu,\ \frac{\sigma^2}{n}\right)$$ 上半场用它预测样本会落在哪;下半场把它反过来,从样本反推 $\mu$ 在哪。
$\chi^2$、$t$、$F$ 都是它的衍生品:$\sigma$ 不知道就用 $S$ 顶替($\to t$), 要推断 $\sigma^2$ 本身就看残差平方和($\to\chi^2$), 要比较两个方差就相除($\to F$)。
求 $Y=g(X)$ 的分布,八成的错都出在定义域上。
做法固定:先写 $F_Y(y)=P(g(X)\le y)$, 把 $g(X)\le y$ 解成关于 $X$ 的区间, 再与 $X$ 本身的取值范围取交集,最后求导。
$g$ 不单调时(比如 $Y=X^2$)要分段讨论, 并注意 $y<0$ 时 $F_Y(y)=0$。
密度不是概率:$f(x)$ 可以大于 1, $P(X=x)=0$ 对连续型恒成立。面积才是概率。
$P(M\le z)=P(X\le z)P(Y\le z)$(都不超过)
$P(N>z)=P(X>z)P(Y>z)$(都超过)
第 10 讲那道「$n\min(X_i)$ 是无偏估计」的题,用的就是第二条。
离散 $EX=\sum_k x_kf(x_k)$;连续 $EX=\int_{-\infty}^{\infty}xf(x)\mathrm dx$。 存在性要求级数或积分绝对收敛(第 7 讲那个圣彼得堡悖论)。
函数的期望不必先求分布:$E[r(X)]=\sum r(x)f(x)$ 或 $\int r(x)f(x)\mathrm dx$。
条件期望:$E[Y\mid x]=\sum_y y\,g_2(y\mid x)$ 或 $\int y\,g_2(y\mid x)\mathrm dy$。
不相关($\mathrm{Cov}=0$)是独立的必要非充分条件。 独立一定不相关,不相关不一定独立——二元正态是唯一的例外, 它那里不相关就等价于独立。
| 分布 | $f$ | $EX$ | $DX$ |
|---|---|---|---|
| 几何 | $(1-p)^{x-1}p$ | $1/p$ | $(1-p)/p^2$ |
| 二项 | $C_n^kp^k(1-p)^{n-k}$ | $np$ | $np(1-p)$ |
| 泊松 | $\dfrac{\lambda^k}{k!}e^{-\lambda}$ | $\lambda$ | $\lambda$ |
可加性:$p$ 相同的独立二项之和仍是二项($n$ 累加); 独立泊松之和仍是泊松($\lambda$ 累加)。
| 分布 | $EX$ | $DX$ |
|---|---|---|
| 均匀 $U(a,b)$ | $\dfrac{a+b}{2}$ | $\dfrac{(b-a)^2}{12}$ |
| 指数 $\lambda$ | $1/\lambda$ | $1/\lambda^2$ |
| $\Gamma(\alpha,\beta)$ | $\alpha/\beta$ | $\alpha/\beta^2$ |
| 正态 $N(\mu,\sigma^2)$ | $\mu$ | $\sigma^2$ |
可加性:$k$ 个独立指数之和是 $\Gamma(k,\lambda)$; $\beta$ 相同的独立 $\Gamma$ 之和仍是 $\Gamma$($\alpha$ 累加)。 $\Gamma(\alpha)=(\alpha-1)\Gamma(\alpha-1)$。
另有二元正态分布:它是「不相关 $\iff$ 独立」的唯一常见例外。
第 3 条给出 $\overline X\sim N(\mu,\sigma^2/n)$——上半场的终点。
第 5 条把正态平方成 $\chi^2$,$k$ 个一加就是 $\chi^2(k)$——下半场的起点。
这两条之间那一步,就是整门课的接缝。 后面的 $t$(正态除以 $\chi^2$ 的根)与 $F$(两个 $\chi^2$ 相比),都由它长出来。
只需要期望与方差,不需要知道分布——这是它的全部价值, 代价是界很松。
不管原分布是什么,标准化之后都趋于标准正态。
「如何证明大数定律?」——标准答案是用切比雪夫不等式: 对 $\overline X_n$ 用一次,$D(\overline X_n)=\sigma^2/n\to0$,右边的界就压到 0。
这是本课最典型的证明题:把定义写出来,套一个已知不等式。
两者的分工:大数定律说 $\overline X_n$ 会收敛到 $\mu$; 中心极限定理说它以多快的速度、按什么形状收敛。
三条线:区间估计与检验用同一批枢轴量; 单侧把 $\alpha$ 全押一边;比均值前先用 $F$ 查方差。
十三讲排成两列,左边「由模型推数据」,右边「由数据推模型」, 中间那根弯箭头就是方向反转。 点任意一格,看这一讲的要点,以及它从哪里来、往哪里去。
回答三四个问题(估计还是检验?期望还是方差?$\sigma$ 已知吗?), 它给出该用的那个式子,以及查表时的注意事项。
这就是开场那位同学缺的东西—— 一张按「你要解决什么问题」排列的表,而不是按讲次排列的表。
交互演示:十三讲的知识地图,以及「该用哪个统计量」决策树
公式一个不漏,却不知道用哪一个——问题不在记性, 在于那张表是按我们讲的顺序排的。
换个排法:先问「你要估计,还是要判断」,再问「关于期望,还是关于方差」, 再问「$\sigma$ 知不知道」。三个问题就能定位到唯一的那个式子。 十三讲的内容没有变少,只是换了一个能用的次序。
从 1654 年帕斯卡与费马为「分赌本」通信,到 1935 年费希尔用八杯茶 定义什么叫「有证据」——中间三百年,人类学会的是同一件事:
在没法确定的地方,仍然可以说出有分量的话; 并且能讲清楚,这句话有多大把握、会以多大概率出错。
这不只是考试内容。之后无论做研究、做投资、做产品, 面对数据时最该问的永远是那三句: 这批数据是怎么来的?这个结论的不确定性有多大?我一共试了多少次?
本课程的自然延伸是计量经济学:把第 10 讲的最大似然与最小二乘, 从「估一个 $\mu$」推广到「估一条 $C=a+bY$」。
祝考试顺利。