复旦大学经济学院 ECON130001
联合 $f(x,y)$ 看全貌、边缘 $f_1=\sum_y f$ 看单个、条件 $g_2(y\mid x)=f/f_1$ 看联动; 独立 $\iff f=f_1f_2$。
离散沿斜线求和、连续用卷积;二项、泊松、正态都可加, 正态是方差相加——但要求独立。
不独立时方差怎么算?「一起动」的程度,能不能压缩成一个数?
而且——整张联合分布表信息量很大,但汇报时没人要看一张表, 大家要的是「平均多少」「波动多大」这样的一两个数。
一个复杂的分布如何变成可比较的决策指标? 投资者 A 的收益服从 $f_A$、B 服从 $f_B$,谁更好? AI 模型 A 的误差服从 $g_A$、B 服从 $g_B$,哪个更优? 本讲用几个数概括整个分布。
某航班过去四天分别延误 $0,10,20,30$ 分钟,平均延误多久?——$15$ 分钟。
换个问法:过去四天里两天延误 10 分钟、一天 20 分钟、一天没延误呢? $$\frac{10+10+20+0}{4}=10\times\tfrac12+20\times\tfrac14+0\times\tfrac14=10$$ 右边这个写法就是期望——把「平均」重写成「取值 × 概率再求和」。
离散型:若级数 $\sum_k x_kf(x_k)$ 绝对收敛,则 $$EX=\sum_{k=1}^{\infty}x_kf(x_k)$$
连续型:若积分 $\int_{-\infty}^{\infty}xf(x)\mathrm{d}x$ 绝对收敛,则 $$EX=\int_{-\infty}^{\infty}xf(x)\,\mathrm{d}x$$
开场那个赌局的期望就是不收敛的——所以严格地说, 它的期望不存在,而不是「等于无穷大」。
期望不存在的分布是真实存在的(柯西分布就是一例)。 见到期望先问一句:它收敛吗?
$X$ 服从 0-1 分布,$P(X=1)=p$。
$$E(X)=0\times(1-p)+1\times p=p$$伯努利分布的期望就是 $p$ 本身—— 「平均成功次数」等于「成功概率」。这条后面反复要用。
$X$ 有密度 $f(x)=2x$($0<x<1$)。
$$E(X)=\int_0^1 x\cdot 2x\,\mathrm{d}x=\frac{2}{3}$$直觉核对:密度在 $x$ 大处更高,所以期望应该大于区间中点 $0.5$。 $\frac23$ 符合。算完顺手做一次这种核对。
盒中红球比例 $p$,有放回取 $n$ 个,其中 $X$ 个红球。求 $EX$。
关键一步:$k\,C_n^k=k\cdot\dfrac{n!}{k!(n-k)!}=n\cdot\dfrac{(n-1)!}{(k-1)!(n-k)!}=n\,C_{n-1}^{k-1}$,于是
$$EX=np\sum_{k=1}^{n}C_{n-1}^{k-1}p^{k-1}(1-p)^{(n-1)-(k-1)}=np\cdot 1=np$$末尾那个和式是 $B(n-1,p)$ 的全部概率,等于 1。
能算,但不好玩。等讲完期望的性质,这题会缩成一行——见 slide 20。
$$EX=\sum_{k=1}^{\infty}k(1-p)^{k-1}p$$ 两边乘 $(1-p)$ 并把指标平移: $$(1-p)EX=\sum_{k=1}^{\infty}k(1-p)^{k}p=\sum_{k=1}^{\infty}(k-1)(1-p)^{k-1}p$$ 上下两式相减,$k-(k-1)=1$: $$pEX=\sum_{k=1}^{\infty}(1-p)^{k-1}p=1 \ \Longrightarrow\ EX=\frac1p$$
结果很好记:成功率 $p$,平均要试 $1/p$ 次。$p=0.1$ 就平均试 10 次。
错位相减这一招在第 10 讲还会再用一次。
$x=0$ 那项为 0,从 1 开始;提出一个 $\lambda$ 后剩下的又是全部概率。
分部积分。速率 $\lambda$ 的倒数就是平均等待时间——每小时来 4 辆车,平均等 15 分钟。
由密度关于 $\mu$ 对称直接看出,不必算积分。
| 分布 | $EX$ | 怎么记 |
|---|---|---|
| 伯努利 $(p)$ | $p$ | 平均成功次数 = 成功概率 |
| 二项 $B(n,p)$ | $np$ | 做 $n$ 次,每次期望 $p$ |
| 几何 $(p)$ | $1/p$ | 成功率的倒数 |
| 泊松 $(\lambda)$ | $\lambda$ | $\lambda$ 本来就定义成「平均次数」 |
| 指数 $(\lambda)$ | $1/\lambda$ | 速率的倒数 |
| 正态 $N(\mu,\sigma^2)$ | $\mu$ | 对称中心 |
这张表要背下来,第 8 讲起每一讲都在用。
令 $Y=r(X)$,则 $$E[r(X)]=\sum_{\text{所有 }x}r(x)f(x)\qquad\text{或}\qquad E[r(X)]=\int_{-\infty}^{\infty}r(x)f(x)\,\mathrm{d}x$$
第 5 讲求 $Y=r(X)$ 的分布要「先求 $G$ 再求导」,很麻烦。 但如果只要期望,用 $X$ 的密度直接积就行,不必求 $Y$ 的分布。
$f(x)=2x$($0<x<1$),求 $E(X^{1/2})$。
$$\int_0^1 x^{1/2}\cdot2x\,\mathrm{d}x=\frac45$$$f(x)=3x^2$($0<x<1$),求 $E(1/X)$。
$$\int_0^1 \frac1x\cdot3x^2\,\mathrm{d}x=\frac32$$$f(x,y)=1$($0\le x,y\le1$),求 $E(X^2+Y^2)$。
$$\int_0^1\!\!\int_0^1(x^2+y^2)\,\mathrm{d}x\,\mathrm{d}y=\frac13+\frac13=\frac23$$$f(x,y)=12y^2$($0\le y\le x\le1$),求 $E(XY)$。
$$\int_0^1\!\!\int_0^x xy\cdot12y^2\,\mathrm{d}y\,\mathrm{d}x =\int_0^1 3x^5\,\mathrm{d}x=\frac12$$积分限又是上一讲那套:$y$ 从 0 到 $x$。
一般地 $E[r(X,Y)]=\displaystyle\iint r(x,y)f(x,y)\,\mathrm{d}x\,\mathrm{d}y$ ——同样不必先求 $r(X,Y)$ 的分布。
$E(X+Y)=E(X)+E(Y)$ 永远成立,哪怕 $X,Y$ 强烈相关。
$E(XY)=E(X)E(Y)$ 只在独立时成立——不独立时两边的差,
正是本讲后半的主角协方差。
$X\sim B(n,p)$ 可写成 $n$ 个独立伯努利之和 $X=\sum_{i=1}^n X_i$, 每个 $E(X_i)=p$。由可加性 $$EX=\sum_{i=1}^{n}E(X_i)=np$$
一行。对比 slide 8 那半页组合恒等式。
$n$ 封信随机装进 $n$ 个信封,$X$ 为装对的封数。求 $EX$。
令 $X_i=1$ 表示第 $i$ 封装对,则 $P(X_i=1)=\frac1n$,$E(X_i)=\frac1n$: $$EX=\sum_{i=1}^{n}E(X_i)=n\cdot\frac1n=1$$
无论 $n$ 多大,平均都恰好装对 1 封。 而这些 $X_i$ 并不独立——可加性不需要独立,这里就用上了。
$X_1,X_2,X_3$ 独立,$E(X_i)=0$、$E(X_i^2)=1$。求 $E[X_1^2(X_2-4X_3)^2]$。
$X_1^2$ 与 $(X_2-4X_3)^2$ 独立,故可乘: $$=E(X_1^2)\cdot E[(X_2-4X_3)^2]$$ $$=1\cdot E(X_2^2-8X_2X_3+16X_3^2)=1-0+16=17$$ 中间项 $E(X_2X_3)=E(X_2)E(X_3)=0$。
第一次滤去 $X_1$ 比例杂质,第二次滤去 $X_2$。 $X_1,X_2$ 独立同分布,$f(x)=4x^3$($0<x<1$)。 求两次后剩余比例 $Y$ 的期望。
$Y=(1-X_1)(1-X_2)$,由独立性 $$E(Y)=\big[1-E(X_1)\big]^2=\Big(1-\tfrac45\Big)^2=0.04$$ ($E(X_1)=\int_0^1 x\cdot4x^3=\frac45$。)
两级过滤把杂质降到 4%——比单级的 20% 好得多。
组合总收益率 $R_p=\sum_i w_iR_i$($w_i$ 是各资产权重)。
组合的预期收益就是各资产预期收益的加权平均 ——不需要知道资产之间怎么联动。
收益可以这样简单相加,风险不行。 这是现代投资组合理论的出发点,但只解决了一半问题: 「我能期望赚多少」。另一半——「我要冒多大风险」——要等到方差与协方差。
给定 $X=x$ 时 $Y$ 的条件期望,就是条件分布的期望: $$E[Y\mid x]=\sum_{\text{所有 }y}y\,g_2(y\mid x) \qquad\text{或}\qquad E[Y\mid x]=\int_{-\infty}^{\infty}y\,g_2(y\mid x)\,\mathrm{d}y$$
$E[Y\mid x]$ 不是一个数,是一条曲线——每给一个 $x$,就有一个对应的平均值。 上一讲的「猜你喜欢」要的正是它:给定用户对甲片打 5 分,他对乙片的平均打分。
已知房屋面积 $X$,如何最优地预测价格 $Y$?
在所有可能的预测值中,使均方误差 $E\big[(Y-\text{预测值})^2\mid X=x\big]$ 最小的那个, 恰好就是条件期望 $E[Y\mid X=x]$。
$E[Y\mid X=x]$ 是 $x$ 的函数,称为回归函数。 线性回归假设它是直线 $\beta_0+\beta_1x$,多项式回归假设它是多项式, 神经网络用更复杂的非线性函数去逼近它。
分歧只在「用什么函数族去逼近」,目标完全相同。
期望回答了「中心在哪」。但——
学生甲成绩稳定在 90 分,学生乙在 85–95 之间波动。两人的期望都是 90, 可谁的成绩更让人放心?
还需要一个数来描述「散得有多开」。
称 $X-EX$ 为离差。离差平方的期望称为方差: $$D(X)=E\big[(X-EX)^2\big]$$ 离散型 $\sum_x(x-EX)^2f(x)$,连续型 $\int(x-EX)^2f(x)\mathrm{d}x$。 其平方根 $\sqrt{D(X)}$ 称为标准差。
直接取 $E(X-EX)$ 恒等于 0(正负抵消),没有信息。 平方消掉符号;而且平方比取绝对值好——它可导,能求最优, 上一页那个「均方误差最小」正是靠这一点。
代价是量纲变了(元 → 元²),所以又定义标准差把量纲开回来。
股价 $A\sim U[25,35]$,$B\sim U[15,45]$。求各自的期望与方差。
$E(A)=E(B)=30$——期望完全相同。
$$D(A)=\int_{25}^{35}(a-30)^2\cdot\tfrac1{10}\,\mathrm{d}a=\frac{25}{3}\approx8.33$$ $$D(B)=\int_{15}^{45}(b-30)^2\cdot\tfrac1{30}\,\mathrm{d}b=75$$标准差分别是 $2.89$ 与 $8.66$,相差三倍。
一般地,$U[a,b]$ 的方差是 $\dfrac{(b-a)^2}{12}$—— 区间宽度翻三倍,方差翻九倍。期望看不出的差别,方差一眼看出。
$E(X+Y)=E(X)+E(Y)$ 不需要独立; $D(X+Y)=D(X)+D(Y)$ 需要独立。
而且 $D$ 里的系数是 $a^2$ 不是 $a$——所以标准差才是 $|a|$ 倍。
$$(1-p)EX^2=\sum_{k\ge1}(k-1)^2(1-p)^{k-1}p$$ 相减,$k^2-(k-1)^2=2k-1$: $$pEX^2=E(2X-1)=\frac2p-1$$ $$D(X)=EX^2-(EX)^2=\frac{2-p}{p^2}-\frac1{p^2}=\frac{1-p}{p^2}$$
硬算用 $E[X(X-1)]$ 的技巧: $$E(X^2)=E[X(X-1)]+EX=n(n-1)p^2+np$$ $$D(X)=n^2p^2-np^2+np-n^2p^2=np(1-p)$$
或者一行:$X=\sum X_i$ 独立, 每个 $D(X_i)=p(1-p)$,由可加性 $$D(X)=np(1-p)$$
注意右边这次用到了独立——而 slide 21 求期望时没用到。 同一个分解,方差比期望多一个前提。
期望与方差都等于 $\lambda$——第 4 讲说过的那个「最好认的特征」,现在证出来了。
标准差 $=1/\lambda=$ 期望。指数分布的标准差等于它的期望,也是个好认的特征。
记号里那个 $\sigma^2$ 本来就是方差——第 5 讲写记号时埋的,现在兑现。
模型训练就是最小化某个「损失」的期望。回归任务最常用的是均方误差: $$\min_{\text{模型参数}}\ E\big[(Y_{\text{真实}}-Y_{\text{预测}})^2\big]$$
换个损失函数就换了目标:用绝对误差 $E|Y-\hat Y|$,最优预测变成条件中位数而非均值。 损失函数的选择,等于在选你要预测分布的哪个特征。
| 分布 | $EX$ | $D(X)$ |
|---|---|---|
| 伯努利 $(p)$ | $p$ | $p(1-p)$ |
| 二项 $B(n,p)$ | $np$ | $np(1-p)$ |
| 几何 $(p)$ | $1/p$ | $(1-p)/p^2$ |
| 泊松 $(\lambda)$ | $\lambda$ | $\lambda$ |
| 均匀 $U[a,b]$ | $(a+b)/2$ | $(b-a)^2/12$ |
| 指数 $(\lambda)$ | $1/\lambda$ | $1/\lambda^2$ |
| 正态 $N(\mu,\sigma^2)$ | $\mu$ | $\sigma^2$ |
这张表期末一定要能默写。第 8 讲起全部推断都从它出发。
两个不独立的随机变量,依赖到什么程度? 数学成绩与语文成绩不独立,但也不相等——怎么描述?
展开后得到常用的计算式: $$\mathrm{Cov}(X,Y)=E(XY)-E(X)E(Y)$$
当时说:$E(XY)=E(X)E(Y)$ 只在独立时成立。 不独立时两边的差,就是协方差。
符号的含义:$X$ 比平均大的时候 $Y$ 也偏大 → 两个离差同号 → 乘积为正 → $\mathrm{Cov}>0$。
$f(x,y)=2xy+0.5$($0\le x,y\le1$)。求 $\mathrm{Cov}(X,Y)$。
$$E(X)=E(Y)=\int_0^1\!\!\int_0^1 x(2xy+0.5)\,\mathrm{d}y\,\mathrm{d}x=\frac{7}{12}$$ $$E(XY)=\int_0^1\!\!\int_0^1 xy(2xy+0.5)\,\mathrm{d}y\,\mathrm{d}x=\frac{25}{72}$$ $$\mathrm{Cov}=\frac{25}{72}-\Big(\frac{7}{12}\Big)^2=\frac{1}{144}$$
正的,但很小——两者略微正相关。
第一条说方差是协方差的特例(自己和自己的协方差); 第四条是上一讲那个问题的答案——不独立时方差不再简单相加, 差的正好是 $2\mathrm{Cov}$。独立时 $\mathrm{Cov}=0$,退回旧公式。
收益是线性相加的:$E[R_p]=w_AE[R_A]+w_BE[R_B]$,与相关性无关。
风险不是——最后那一项带着协方差。
若 $\mathrm{Cov}<0$,总风险小于各部分风险之和: 同样的期望收益,更低的波动。这就是「不要把鸡蛋放在一个篮子里」的数学原理, 也是金融学里常说的唯一的免费午餐。
高维特征之间的关系用协方差矩阵 $\Sigma$ 描述。 主成分分析通过分析 $\Sigma$,找到一组协方差为 0 的新坐标轴, 实现降维与特征解耦。「让协方差为零」是两个领域共同的目标。
两个资产的期望与波动可调,主角是那根相关系数滑块。
交互演示:拖动相关系数,观察风险—收益曲线如何弯折
$\mathrm{Cov}(2X,Y)=2\mathrm{Cov}(X,Y)$——换个单位,数就变了。 用元还是用万元,算出来差一万倍,没法横向比较。
可以证明 $|\rho|\le1$。特别地:
$\beta$ 衡量个股相对整个市场的风险: $$\beta_i=\frac{\mathrm{Cov}(R_i,R_m)}{D(R_m)}=\rho_{i,m}\frac{\sigma_i}{\sigma_m}$$
$\rho_{i,m}$ 越高、$\beta$ 越大,股票「进攻性」越强;反之「防御性」强。 $\beta$ 是构建投资策略的关键指标,而它本质上就是一个标准化的协方差。
建模前算所有输入特征的相关系数矩阵是标准操作。
若两个特征的 $|\rho|$ 接近 1,说明信息高度重复。 为防止过拟合、提高效率,通常从中移除一个。
两个领域用的是同一个数:金融用它度量「跟大盘走多紧」,AI 用它度量「这两列数据是不是在说同一件事」。
$X$ 等可能取 $-1,0,1$,令 $Y=X^2$。
显然不独立——知道 $X$ 就完全知道 $Y$。
但算协方差:$E(X)=0$, $$\mathrm{Cov}(X,Y)=E(X^3)-E(X)E(X^2)=0-0=0$$ 不相关。
$\rho$ 只度量线性关系。$Y=X^2$ 是一个完美的非线性关系, 而它的线性成分恰好为零(抛物线关于 $y$ 轴对称,正负抵消)。
$\rho=0$ 只说明「没有线性关系」,不说明「没有关系」。
若 $Y=aX+b$,则 $\mathrm{Cov}=aD(X)$、$D(Y)=a^2D(X)$, $$\rho=\frac{aD(X)}{|a|D(X)}=\mathrm{sgn}(a)$$ 完全线性时 $\rho=\pm1$,符号由斜率决定。
$X,Y$ 服从二元正态分布,若联合密度为 $$f(x,y)=\frac{1}{2\pi\sigma_1\sigma_2\sqrt{1-\rho^2}} \exp\left\{-\frac{1}{2(1-\rho^2)}\left[ \Big(\tfrac{x-\mu_1}{\sigma_1}\Big)^2 -2\rho\Big(\tfrac{x-\mu_1}{\sigma_1}\Big)\Big(\tfrac{y-\mu_2}{\sigma_2}\Big) +\Big(\tfrac{y-\mu_2}{\sigma_2}\Big)^2\right]\right\}$$
上一页刚说「不相关不一定独立」,这里却说「等价」——因为这里多了一个前提: 联合分布是二元正态。
在正态的世界里,$\rho$ 装下了两个变量之间的全部关系;出了这个世界就不行。 这也解释了为什么金融模型偏爱正态——它让「相关性」这一个数就够用了。
记 $\boldsymbol{X},\boldsymbol{\mu}$ 为 $n$ 维列向量,$\boldsymbol{C}$ 为协方差矩阵 ($c_{ij}=\mathrm{Cov}(X_i,X_j)$),则 $$f(x_1,\dots,x_n)=(2\pi)^{-n/2}|\boldsymbol{C}|^{-1/2} \exp\left\{-\tfrac12(\boldsymbol{X}-\boldsymbol{\mu})^{T}\boldsymbol{C}^{-1}(\boldsymbol{X}-\boldsymbol{\mu})\right\}$$
注意第一条的「且相互独立」不能去掉: 各分量都正态,不足以保证整体是多维正态。 第四条是二维那条性质的推广,同样只在正态世界成立。
若 $g$ 是凹函数,则 $$E[g(X)]\le g(E[X])$$ 等号成立当且仅当 $g$ 是线性函数(或 $X$ 退化为常数)。
它正是开场那个悖论的解答方向。 丹尼尔·伯努利 1738 年的想法是:人关心的不是钱 $X$,是效用 $g(X)$, 而 $g$ 是凹的(钱越多,多一块钱的价值越小)。 于是即便 $E[X]=\infty$,$E[g(X)]$ 仍可以是有限的。
把 $X,Y$ 换成离差 $X-EX$、$Y-EY$,立刻得到 $$\mathrm{Cov}(X,Y)^2\le D(X)D(Y)$$ 这就是 $|\rho|\le1$。
它的期望不是无穷大,而是不存在——级数不绝对收敛,定义里那四个字就是为它准备的。
更深一层:即便期望存在,一个数也不足以指导决策。 丹尼尔·伯努利 1738 年的答案是:人最大化的不是钱的期望,是效用的期望, 而效用函数是凹的——由琴生不等式,$E[g(X)]\le g(E[X])$,无穷的期望换成有限的效用。
这就是期望效用理论的起点,也是整个现代经济学的基石之一。
本讲算出 $E$ 与 $D$,但它们描述的还是一个随机变量。 如果把很多个独立同分布的随机变量平均起来会怎样?
绪论里布丰投针的频率会稳定到概率上、第 6 讲两个均匀分布相加变成梯形再加会变钟形 ——这两件事其实是同一件事,下一讲给它们名字:大数定律与中心极限定理。