复旦大学经济学院 ECON130001
连续型用 $f$ 描述,$F(x)=\int_{-\infty}^x f$;三个分布:均匀、指数、正态。 标准化 $Z=\frac{X-\mu}{\sigma}$ 让全世界只需一张表。
离散型求和,连续型先求 $G$ 再求导,别漏雅可比因子。
到现在为止,我们一次只研究一个随机变量。 可现实里要紧的往往是几个量之间的关系。
而这正是上一讲那个故事真正的病根——LTCM 的模型不是不知道单个资产的分布, 是低估了它们「一起动」的程度。「一起动」该怎么描述?
现实中变量总是关联的:收入与受教育年限、个股收益与大盘、用户年龄与点击率。 本讲是从「一个变量」跨到「一群变量」的桥。
设 $X,Y$ 是两个随机变量,它们的联合分布指: 对所有实数对的集合 $C$,概率 $P[(X,Y)\in C]$ 的全体。
掷一个骰子、抛一枚硬币。$X$=点数,$Y$=硬币是否正面(正 1 反 0)。
$(X,Y)$ 的取值集是 $\{(1,1),\dots,(6,1),(1,0),\dots,(6,0)\}$ 共 12 个, 每个概率 $\frac{1}{12}$。
注意不是把 $X$ 和 $Y$ 分开描述—— 是把 $(X,Y)$ 当作一个整体,看它落在平面上各处的概率。 这个视角的转换是本讲的全部难点。
若 $X,Y$ 都是离散型,其联合概率函数为 $$f(x,y)=P(\{X=x\}\cap\{Y=y\})$$ 满足 $\displaystyle\sum_{\text{所有}(x,y)}f(x,y)=1$。
一维时 $f(x)=P(X=x)$,画出来是一排柱子; 二维时 $f(x,y)$ 画出来是一张表(或平面上一片带高度的点)。
归一化条件从「一排加起来是 1」变成「整张表加起来是 1」。
随机抽一户,求 (1) 至少两辆车且至少两台电视的概率; (2) 恰有一辆车的概率。
(1) 把 $x\ge2$ 且 $y\ge2$ 的六格加起来: $$P(X\ge2,Y\ge2)=0.5$$
(2) 把 $x=1$ 那整行加起来: $$P(X=1)=0.2$$
留意第 (2) 问:它只问 $X$,却要把 $Y$ 的所有取值加掉。 这个动作就是「边缘分布」,二十分钟后会正式命名。
把「汽车数 × 电视机数」换成「对甲片的评分 × 对乙片的评分」, 每位用户的一对评分 $(x,y)$ 就是表里的一个数据点。 所有点的分布就是联合概率函数 $f(x,y)$ ——这是推荐算法的原始矿藏。若 $f(5,5)$ 很高,说明喜欢一部的人多半也喜欢另一部。
点任意一行看边缘;按住 Shift 点则选列。 条件分布那半边先不看,讲到再回来。
交互演示:点行/列查看边缘分布与条件分布
若存在非负函数 $f$,使得对 $xy$ 平面上的每个集合 $C$ 都有 $$P\{(X,Y)\in C\}=\iint_C f(x,y)\,\mathrm{d}x\,\mathrm{d}y$$ 则称 $X,Y$ 服从连续型联合分布,$f$ 为联合概率密度函数。
与一维完全同构:非负 + 总积分为 1。只是积分从一重变成了二重。
一维时「概率 = 密度 × 长度」,二维时「概率 = 密度 × 面积」 ——概率是曲面下方的体积。密度依然不是概率。
$f(x,y)=cx^2y$($x^2\le y\le1$),其余为 0。求 $c$。
区域是抛物线 $y=x^2$ 与直线 $y=1$ 围成的,$x$ 从 $-1$ 到 $1$。 先对 $y$ 积,$y$ 从 $x^2$ 到 $1$;再对 $x$ 积: $$\int_{-1}^{1}\!\!\int_{x^2}^{1}cx^2y\,\mathrm{d}y\,\mathrm{d}x=\frac{4}{21}c=1$$ 故 $c=\dfrac{21}{4}$。
二重积分题的全部难点在画图定限。不画图直接写积分限,十有八九错。 这一条从本讲一直用到期末。
$f(x,y)=\frac{21}{4}x^2y$($x^2\le y\le1$)。求 $P(X\ge Y)$。
$X\ge Y$ 即 $y\le x$。与原区域 $x^2\le y$ 求交: 需 $x^2\le y\le x$,这要求 $0\le x\le1$。 $$\iint_{S_0}f=\int_0^1\!\!\int_{x^2}^{x}\frac{21}{4}x^2y\,\mathrm{d}y\,\mathrm{d}x=\frac{3}{20}$$
关键是把两个约束求交: 题目给的区域 $\cap$ 事件给的区域。 漏掉任一个,积分限就错。
$X$ 的分布函数由 $F_1(x)=\lim\limits_{y\to+\infty}F(x,y)$ 得到, $Y$ 的由 $F_2(y)=\lim\limits_{x\to+\infty}F(x,y)$ 得到。
四项,两加两减。这是第 1 讲容斥原理在二维的样子 ——减两次多减了一块,要加回来。
若 $X,Y$ 连续型且有联合密度 $f$,则 $$F(x,y)=\int_{-\infty}^{y}\!\!\int_{-\infty}^{x}f(r,s)\,\mathrm{d}r\,\mathrm{d}s$$ 反过来求二阶混合偏导: $$f(x,y)=\frac{\partial^2F(x,y)}{\partial x\,\partial y}=\frac{\partial^2F(x,y)}{\partial y\,\partial x}$$
$X,Y$ 只在 $[0,2]$ 取值,$F(x,y)=\frac{1}{16}xy(x+y)$。求 $F_1(x)$ 与 $f(x,y)$。
$F_1$:令 $y=2$($Y$ 最大只到 2,故 $y\to\infty$ 的极限就是 $F(x,2)$): $$F_1(x)=\tfrac18x(x+2),\quad 0\le x\le2$$
$f$:$F=\frac{1}{16}(x^2y+xy^2)$, $\partial_x F=\frac{1}{16}(2xy+y^2)$,再对 $y$ 求导: $$f(x,y)=\tfrac18(x+y),\quad 0\le x,y\le2$$
二元随机变量 $\{X,Y\}$ 中,$X$ 或 $Y$ 自己的分布称为边缘分布。
记 $X$ 的边缘分布函数为 $F_1(x)$、边缘概率(密度)函数为 $f_1(x)$; $Y$ 的记为 $F_2(y)$、$f_2(y)$。
把联合概率写成一张表,每行加起来写在右边缘、 每列加起来写在下边缘——「边缘分布」就是这么来的。
$X$ 的边缘概率函数 $$f_1(x)=\sum_{\text{所有 }y}f(x,y)$$ $Y$ 的边缘概率函数 $$f_2(y)=\sum_{\text{所有 }x}f(x,y)$$
把另一个变量「加掉」。 这正是 slide 7 第 (2) 问做过的事——现在它有名字了。
边缘分布让我们抛开变量间的关系,单独审视每个变量自身的特性 ——比如一部电影的「大众口碑」。 $$f_1(x)=\sum_{y=1}^{5}f(x,y)\quad(\text{对 }Y\text{ 的所有评分求和})$$
注意「非个性化」这四个字。边缘分布对所有人给出同一个答案 ——这正是开场那个悬念的一半:它有用,但不够。
边缘分布函数则由极限得到: $F_1(x)=\lim\limits_{y\to\infty}F(x,y)$,$F_2(y)=\lim\limits_{x\to\infty}F(x,y)$。
$f(x,y)=\frac{21}{4}x^2y$($x^2\le y\le1$)。求两个边缘密度。
$$f_1(x)=\int_{x^2}^{1}\tfrac{21}{4}x^2y\,\mathrm{d}y=\tfrac{21}{8}x^2(1-x^4),\quad -1\le x\le1$$ $$f_2(y)=\int_{-\sqrt y}^{\sqrt y}\tfrac{21}{4}x^2y\,\mathrm{d}x=\tfrac{7}{2}y^{5/2},\quad 0\le y\le1$$
两次积分的限完全不同:算 $f_1$ 时 $y$ 从 $x^2$ 到 1; 算 $f_2$ 时 $x$ 从 $-\sqrt y$ 到 $\sqrt y$。又是画图定限。
掷两枚硬币,每枚各掷十次。考虑两种情形:
求 $X,Y$ 的联合分布。
两种情形下 $X$ 与 $Y$ 的边缘分布都是 $B(10,0.5)$。但 $$\text{(1)}\ \ p_{ij}=C_{10}^iC_{10}^j\,0.5^{20};\qquad \text{(2)}\ \ p_{ij}=C_{10}^i\,0.5^{10}\ (i=j),\ \ 0\ (i\ne j)$$
把两个边缘都拿到手,还差的那一块,就是「它们怎么一起动」。 (2) 里知道 $X$ 就完全知道 $Y$,(1) 里知道 $X$ 对 $Y$ 毫无帮助——而边缘一模一样。
三个联合分布轮流切换,盯住右边那两条边缘柱子。
切换时联合分布的表格面目全非(对角线 → 满格 → 反对角线), 而边缘分布纹丝不动。
三种情形分别是:互不影响、知道一个就知道另一个、一个大另一个必定小。
交互演示:三个联合分布,边缘完全相同
既然边缘分布不足以决定联合分布,那自然要问:什么时候它足够?
换句话说:什么时候「两个变量各自的分布」就是全部信息, 再没有额外的「一起动」需要交代?
对任意实数集 $A,B$,若事件 $\{X\in A\}$ 与 $\{Y\in B\}$ 独立,即 $$P(\{X\in A\}\cap\{Y\in B\})=P(X\in A)\,P(Y\in B)$$ 则称随机变量 $X,Y$ 相互独立。
回答上一页的问题:独立时,边缘分布就是全部信息 ——联合分布是两个边缘的乘积,没有额外内容。不独立时才需要联合分布。
识别变量间的独立性,可以帮系统避免逻辑不相关的「无效推荐」。
系统发现,用户对科幻片 $X$ 的评分与对儿童动画 $Y$ 的评分相互独立: $$f(x,y)=f_1(x)f_2(y)$$
找相关性用于推荐,找独立性用于划分边界。两者同等重要 ——这正是「协同过滤」与「多维度画像」两条技术路线的分工。
$X,Y$ 相互独立,都服从 $g(x)=2x$($0\le x\le1$)。求 $P(X+Y\le1)$。
独立 $\Rightarrow$ 联合是乘积: $$f(x,y)=4xy,\quad 0\le x,y\le1$$ $$P(X+Y\le1)=\int_0^1\!\!\int_0^{1-x}4xy\,\mathrm{d}y\,\mathrm{d}x=\frac16$$
$f(x,y)=ke^{-(x+2y)}$($x,y\ge0$)。$X,Y$ 是否独立?
归一化给出 $k=2$。两个边缘: $$f_1(x)=e^{-x}\ (x\ge0),\qquad f_2(y)=2e^{-2y}\ (y\ge0)$$ $f_1f_2=2e^{-x-2y}=f$,独立。
这也是最好认的一种形态:密度能拆成「只含 $x$ 的因子 × 只含 $y$ 的因子」, 且定义域是矩形,就独立。
$f(x,y)=kx^2y^2$($x^2+y^2\le1$)。$X,Y$ 是否独立?
密度看起来完全可分离($kx^2\cdot y^2$),但不独立。
一个反例就够:$f(0.9,0.9)=0$(因为 $0.81+0.81>1$,在区域外), 而 $f_1(0.9)\ne0$、$f_2(0.9)\ne0$,故 $f\ne f_1f_2$。
$f(x,y)=\frac{15}{4}x^2$($0\le y\le1-x^2$)。求边缘并判断独立性。
$$f_1(x)=\tfrac{15}{4}x^2(1-x^2),\qquad f_2(y)=\tfrac52(1-y)^{3/2}$$ 乘积不等于 $f$,不独立——同样是定义域不是矩形。
定义域不是矩形($x$ 的范围依赖 $y$),就一定不独立 ——因为知道了 $X$ 就限制了 $Y$ 的取值范围,这本身就是信息。 可分离只是必要条件,不是充分条件。
$f(x,y)=\frac{1}{30}(x+y)$,$x=0,1,2$,$y=0,1,2,3$。求边缘并判断独立性。
$$f_1(x)=\sum_{y=0}^{3}\tfrac{x+y}{30}=\tfrac{1}{15}(2x+3)$$ $$f_2(y)=\sum_{x=0}^{2}\tfrac{x+y}{30}=\tfrac{1}{10}(1+y)$$ $f_1f_2\ne f$,不独立。
$f(x,y)=\frac32y^2$($0\le x\le2$,$0\le y\le1$)。
$$f_1(x)=\int_0^1\tfrac32y^2\mathrm{d}y=\tfrac12,\qquad f_2(y)=\int_0^2\tfrac32y^2\mathrm{d}x=3y^2$$ $f_1f_2=\frac32y^2=f$,独立。
进一步:事件 $\{X<1\}$ 与 $\{Y\ge\frac12\}$ 也独立 ——随机变量独立 $\Rightarrow$ 由它们生成的任意事件独立。
由这张表能算出 $X$ 的边缘概率,也就是总的失窃率。 但——给定某个品牌,它的失窃率是多少?
取出那一列,再除以列和。
设 $X,Y$ 的联合概率函数为 $f$。对每个使 $f_2(y)>0$ 的 $y$,定义 $$g_1(x\mid y)=\frac{f(x,y)}{f_2(y)}$$ 称为给定 $Y=y$ 时 $X$ 的条件概率函数。对称地,对 $f_1(x)>0$ 的 $x$ $$g_2(y\mid x)=\frac{f(x,y)}{f_1(x)}$$
$$\sum_x g_1(x\mid y)=\frac{\sum_x f(x,y)}{f_2(y)}=\frac{f_2(y)}{f_2(y)}=1$$ 除以 $f_2(y)$ 这个动作,就是让那一列重新加到 1。 这是第 3 讲「样本空间收缩」在二维表上的样子。
点一行,右下会画出 $g_2(y\mid x)$ 并显示它加起来等于 1。
切到「两枚硬币(独立)」,点任意一行——条件分布都长一样,
而且等于边缘分布。
再切到「同一枚硬币」,条件分布退化成一根柱子。
独立的含义就是:条件分布不随条件而变。
交互演示:点行/列查看条件分布的归一化
条件分布是实现「千人千面」个性化推荐的引擎:用已知信息预测未知偏好。 $$g_2(y\mid x)=\frac{f(x,y)}{f_1(x)}$$
边缘分布 $f_1$ 给出「大众口碑」,对谁都一样; 条件分布 $g_2(y\mid x)$ 才是因人而异的那部分。 这正是「协同过滤」的核心,也是 Cinematch 与冠军算法的分野。
加工分两步,第一步用时 $Y$,总用时 $X$,联合密度 $f(x,y)=e^{-x}$($0\le y\le x<\infty$)。 已知 $Y$ 之后,想更新关于 $X$ 的分布。
不能直接套条件概率公式——因为 $P(Y=y)=0$,分母是 0。
对每个使 $f_2(y)>0$ 的 $y$,直接定义 $$g_1(x\mid y)=\frac{f(x,y)}{f_2(y)}$$ 对 $f_2(y)=0$ 的点可任意定义,只要 $g_1$ 仍是一个密度函数。
形式与离散型一模一样,但地位不同: 离散型那个是推出来的,连续型这个是定义的 ——因为原来的定义在这里失效了。
$f(x,y)=e^{-x}$($0\le y\le x$)。求 $g_1(x\mid y)$。
先求边缘: $$f_2(y)=\int_y^{\infty}e^{-x}\mathrm{d}x=e^{-y}$$ $$g_1(x\mid y)=\frac{e^{-x}}{e^{-y}}=e^{y-x},\quad x\ge y$$
认得出来吗?这是平移到 $y$ 的指数分布 ——已经用了 $y$ 分钟,剩余时间仍服从原来的指数分布。 第 5 讲的无记忆性,在这里又出现了。
机器次品率 $P$ 未知,设 $P\sim U[0,1]$。抽查 $n$ 件,次品数为 $X$。求 $(X,P)$ 的联合分布。
给定 $P=p$ 时 $X\sim B(n,p)$: $$g_1(x\mid p)=C_n^xp^x(1-p)^{n-x}$$ 由乘法法则 $f(x,p)=g_1(x\mid p)f_2(p)$,而 $f_2(p)=1$: $$f(x,p)=C_n^xp^x(1-p)^{n-x}$$
这是贝叶斯统计的雏形:把未知参数也当成随机变量。
$(X,Y)$ 在 $S=\{(x-1)^2+(y+2)^2\le9\}$ 上均匀分布。 求 $g_2(y\mid x)$ 与 $P(Y>0\mid X=2)$。
$f=\frac{1}{9\pi}$。竖着切一刀,$f_1(x)=\frac{2}{9\pi}\sqrt{9-(x-1)^2}$,故 $$g_2(y\mid x)=\frac{1}{2}\big[9-(x-1)^2\big]^{-1/2}$$ 是均匀分布——竖切得到的线段上处处等可能。
$$P(Y>0\mid X=2)=\frac{2-\sqrt2}{4}\approx0.146$$
$f(x,y)=c(x+y^2)$($0\le x,y\le1$)。求 $g_1(x\mid y)$ 与 $P(X<\frac12\mid Y=\frac12)$。
$f_2(y)=c(\frac12+y^2)$,于是 $c$ 约掉了: $$g_1(x\mid y)=\frac{x+y^2}{\frac12+y^2}$$ $$P(X<\tfrac12\mid Y=\tfrac12)=\int_0^{1/2}\frac{x+\frac14}{\frac34}\mathrm{d}x=\frac13$$
右题里 $c$ 自动约掉——求条件分布常常不必先定归一化常数。省一步。
$f(x,y)=\frac{3}{16}(4-2x-y)$($x,y>0$,$2x+y<4$)。 求 $g_2(y\mid x)$ 与 $P(Y\ge2\mid X=0.5)$。
$$f_1(x)=\int_0^{4-2x}\!\!f\,\mathrm{d}y=\tfrac38(x-2)^2$$ $$g_2(y\mid x)=\frac{4-2x-y}{2(x-2)^2}$$ $$P(Y\ge2\mid X=0.5)=\int_2^{3}g_2(y\mid0.5)\,\mathrm{d}y=\frac19$$
总产量 $Y\sim\text{Poisson}(\lambda)$,每件独立地以概率 $p$ 为次品。求次品数 $X$ 的分布。
给定 $Y=y$ 时 $X\sim B(y,p)$。由乘法法则再对 $y$ 求和: $$P(X=x)=\sum_{y=x}^{\infty}C_y^xp^x(1-p)^{y-x}\frac{\lambda^y}{y!}e^{-\lambda} =\frac{(\lambda p)^x}{x!}e^{-\lambda p}$$
结果仍是泊松分布,参数变成 $\lambda p$。 漂亮得像变魔术,但每一步都是本讲的工具。
三个工具齐了:联合看全貌、边缘看单个、条件看联动。
但还有一类问题没解决:两个资产的收益 $X$ 与 $Y$, 我关心的往往不是它们各自,而是组合的总收益 $X+Y$。 它的分布怎么求?
$X_1$ 等可能取 $1,2,3,4$,$X_2$ 等可能取 $1,2,3$,相互独立。求 $Y=X_1+X_2$ 的分布。
$Y$ 取 $2,\dots,7$,联合有 $4\times3=12$ 种等可能组合:
| $y$ | 2 | 3 | 4 | 5 | 6 | 7 |
|---|---|---|---|---|---|---|
| $P$ | 1/12 | 2/12 | 3/12 | 3/12 | 2/12 | 1/12 |
比如 $Y=4$ 有 $(1,3),(2,2),(3,1)$ 三种。
一般地 $\displaystyle P(Y=y)=\sum_{x}f(x,\,y-x)$ ——沿着一条斜线把联合分布加起来。$X_1-X_2$、$2X_1-3X_2$ 同理,只是斜线的方向变了。
若 $X_1,\dots,X_k$ 相互独立,$X_i\sim B(n_i,p)$($p$ 必须相同),则 $$X_1+\cdots+X_k\sim B(n_1+\cdots+n_k,\ p)$$
为什么显然:$B(n,p)$ 就是 $n$ 次独立伯努利试验的成功数。 把 $n_1$ 次和 $n_2$ 次拼起来,就是 $n_1+n_2$ 次。
若 $X_1,\dots,X_k$ 相互独立,$X_i\sim\text{Poisson}(\lambda_i)$,则 $$X_1+\cdots+X_k\sim\text{Poisson}(\lambda_1+\cdots+\lambda_k)$$
直观:两个独立的泊松过程叠加,还是泊松过程,速率相加。 「这条路每小时来 10 辆车,那条路来 6 辆,合起来 16 辆。」
$p$ 相同这个条件不能省。$B(3,0.5)+B(3,0.9)$ 不是二项分布 ——它连「每次成功率相同」这个前提都不满足。
队列前两位顾客一起走。$X_1,X_2$ 独立且都服从 $f(x)=2e^{-2x}$($x>0$)。 求总等待时间 $Y=X_1+X_2$ 的分布。
老办法:先求 $G$ 再求导(第 5 讲) $$G(y)=P(X_1+X_2\le y)=\int_0^y\!\!\int_0^{y-x_2}\!\!4e^{-2x_1-2x_2}\mathrm{d}x_1\mathrm{d}x_2 =1-e^{-2y}-2ye^{-2y}$$ $$g(y)=G'(y)=4ye^{-2y}$$
$Z=X+Y$ 的密度为 $$f_Z(z)=\int_{-\infty}^{\infty}f(z-y,\ y)\,\mathrm{d}y$$ 若 $X,Y$ 独立,则 $$f_Z(z)=\int_{-\infty}^{\infty}f_1(z-y)f_2(y)\,\mathrm{d}y$$
这就是上一页「沿斜线求和」的连续版——把求和换成积分。
若 $X_1,\dots,X_k$ 相互独立,$X_i\sim N(\mu_i,\sigma_i^2)$,则 $$X_1+\cdots+X_k\sim N(\mu_1+\cdots+\mu_k,\ \sigma_1^2+\cdots+\sigma_k^2)$$
$$\sigma_{X+Y}=\sqrt{\sigma_X^2+\sigma_Y^2}\ <\ \sigma_X+\sigma_Y$$ 这就是「分散化降低风险」的数学来源——两个独立资产的组合, 波动率小于各自波动率之和。
但请回到开场:上面这条要求独立。 资产之间一旦高度相关,方差就不再简单相加,分散化的效果会大打折扣 ——第 7 讲会给出带协方差的一般公式。
投资者同时持股票与债券。年末股票价值 $X\sim U[1000,4000]$, 债券价值 $Y\sim U[800,1200]$,两者独立。求组合价值 $Z=X+Y$ 的分布。
两个均匀分布相加,结果不再是均匀分布,而是一个梯形 ——中间平、两头斜。再加几个,就会越来越像钟形。
这是第 8 讲中心极限定理最早的一丝征兆。
$(X,Y)$ 在矩形 $G=\{0\le x\le2,\ 0\le y\le1\}$ 上均匀分布。 求以 $X,Y$ 为边长的矩形面积 $S=XY$ 的密度。
$P(XY\le s)$ 对应双曲线 $xy=s$ 下方的区域,积分后求导得 $$f(s)=\begin{cases}\dfrac12(\ln2-\ln s),& 0<s\le2\\[4pt] 0,&\text{其他}\end{cases}$$
注意 $f(s)\to\infty$ 当 $s\to0^+$——又一次:密度可以趋于无穷, 但积分仍等于 1。第 5 讲说过三遍的那件事。
设 $X,Y$ 独立,分布函数分别为 $F_X,F_Y$,则 $$F_{\max}(z)=F_X(z)F_Y(z)$$ $$F_{\min}(z)=1-\big[1-F_X(z)\big]\big[1-F_Y(z)\big]$$
因为「最大值不超过 $z$」等价于「每一个都不超过 $z$」, 「最小值超过 $z$」等价于「每一个都超过 $z$」 ——都是把 max/min 翻译成「所有」,再用独立性拆开。
第 5 讲那道 $n$ 个灯泡的题($Y_1$ 服从 $\text{Exp}(n\lambda)$), 用的正是 $F_{\min}$ 这条。
Netflix 的 100 万美元,买的是联合分布里那块边缘分布装不下的信息。
把每部电影的评分分布、每个用户的打分习惯都估准,也只是两个边缘分布 ——而「这个人会不会喜欢这部片子」藏在条件分布 $g_2(y\mid x)$ 里。 边缘对所有人给同一个答案,条件才因人而异。
本讲说「正态之和的方差相加」,但那有个前提:独立。 不独立时该怎么算?「一起动」的程度,能不能压缩成一个数?
而且——整张联合分布表信息量很大,但汇报时没人要看一张表, 大家要的是「平均多少」「波动多大」这样的一两个数。
下一讲:随机变量的数字特征——期望、方差,以及描述「一起动」的协方差。