ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

随机变量的数字特征:期望、方差、协方差与相关系数全解析

随机变量的数字特征:期望、方差、协方差与相关系数全解析 “随机变量的数字特征”这个系列写到这里已经是第十五篇了。前面十几篇我们一直在跟分布函数、密度函数打交道把随机变量的“全貌”翻来覆去地看。但实际做数据分析、做工程、做量化甚至平时考试算题你不可能每次都把一条完整的分布曲线摆在桌上——更多时候你只需要几个“数字”就能把一堆随机现象说得八九不离十。这几个数字就是随机变量的数字特征。这篇博文不是从零开始讲定义而是把数字特征这条线串起来把期望、方差、协方差、相关系数、矩这几块放在一起结合我做过的实际计算案例讲清楚它们分别回答什么问题、怎么算、怎么用以及最容易在哪里翻车。适合正在学概率论的在校生也适合那些学完概率论但一直没搞明白“这东西到底干嘛用”的从业者。1. 数字特征到底在描述什么1.1 为什么不能只靠分布函数你可能会说既然分布函数 $F(x)$ 已经完整刻画了一个随机变量那还要期望和方差干什么这就像你描述一个人可以拿出他全年的体检报告、每一顿饭的记录、每天的心情曲线——信息确实完整但你要在饭桌上快速跟别人介绍这个人你大概率只会说身高、体重、性格最多加个收入水平。数字特征干的就是这件事把无限维的信息压缩成有限几个数牺牲细节换取可操作性和可对比性。在实际工程里完整分布往往是拿不到的。你手头可能只有几百个采样点这时候你没法精确估计 $F(x)$但你可以用样本均值去估计期望用样本方差去估计方差——这两个数已经足够支撑你做很多决策了。比如你评估两条物流线路的配送时效你不需要画出两条完整的时间分布曲线你只需要知道A线平均 28 小时波动 5 小时B线平均 32 小时波动 2 小时。这个对比已经能说明很多问题。1.2 四个核心指标各管哪摊事数字特征家族里最常用的四个指标各有分工先把这个地图铺开数学期望 $E(X)$回答“平均来看是多少”。它是随机变量取值的加权平均权重就是概率。相当于把无数次试验的结果取平均趋近的那个值。方差 $D(X)$回答“波动有多大”。它度量的是取值偏离期望的平方的平均水平。方差越大说明结果越分散越不确定。协方差 $Cov(X,Y)$回答“两个变量是否一起变动”。正的值说明一个大了另一个通常也大负的值说明两者呈反向变动接近零说线性相关性弱。相关系数 $\rho_{XY}$协方差的“标准化版本”把协方差的量纲去掉落到 $[-1,1]$ 区间里方便跨场景比较。后面还有三阶中心矩偏度、四阶中心矩峰度这些更高阶的指标用来描述分布形状的对称性和尖峭程度金融里算收益率分布的时候会用到。1.3 参数 vs. 统计量一个容易混淆的起点在往下走之前必须把这个区分说清楚——否则后面算题会一直犯迷糊。参数是随机变量本身的数字特征它是对真实概率分布而言的是个固定的值比如某个总体真正的均值 $\mu$。统计量是由样本算出来的比如 $\bar{X}$它本身也是一个随机变量每次抽样都会变。我们做推断统计时候核心思路就是用统计量去估计参数。这个系列前面章节里反复出现的“用样本均值估计总体期望”“用样本方差估计总体方差”本质上就是在做这件事。理解不了这一层后面大数定律、中心极限定理的应用就都悬空。2. 数学期望的深入拆解2.1 离散型和连续型的统一视角离散型随机变量的期望定义是 $$E(X)\sum_i x_i p_i$$连续型的定义是 $$E(X)\int_{-\infty}^{\infty} x f(x), dx$$这两个公式看着不同但底层逻辑一致把每个取值 $x$ 和它出现的“权重”概率或概率密度微元相乘再累加。离散型是求和连续型是积分仅此而已。我在实际带人做计算的时候发现新手最容易卡的坑是离散型里忘记把 $p_i$ 全部加起来等于 1 这个条件作为自检连续型里积分上下限取错。尤其当密度函数是分段定义的比如$$f(x)\begin{cases} 2x, 0 \le x \le 1 \ 0, \text{其他} \end{cases}$$这时候计算 $E(X)$你需要老老实实写 $$E(X)\int_0^1 x \cdot 2x , dx \int_0^1 2x^2 , dx \frac{2}{3}$$如果积分区间随手写成 $(-\infty, \infty)$分段函数没写清楚分母就容易出问题。2.2 随机变量函数的期望两个算法怎么选这块是高频考点也是实用工具。设 $Yg(X)$求 $E(Y)$ 有两条路先求出 $Y$ 的分布再按期望定义算。步骤多但通用。直接用公式$E[g(X)]\sum_i g(x_i)p_i$离散型或 $E[g(X)]\int g(x)f(x), dx$连续型。不需要先求 $Y$ 的分布。实际考试和工程计算里第二条路快得多。我印象很深的一道题设 $X$ 在 $[0,2]$ 上均匀分布求 $E(X^2)$。如果走第一条路你得先设 $YX^2$然后求 $Y$ 的分布函数 $$F_Y(y)P(Y \le y)P(X^2 \le y)P(X \le \sqrt{y})\frac{\sqrt{y}}{2}, \quad 0 \le y \le 4$$然后求导得密度 $f_Y(y)\frac{1}{4\sqrt{y}}$再算 $\int_0^4 y \cdot \frac{1}{4\sqrt{y}}, dy$——不是不能算但绕了一大圈。走第二条路 $$E(X^2)\int_0^2 x^2 \cdot \frac{1}{2}, dx \frac{1}{2} \cdot \frac{x^3}{3}\bigg|_0^2 \frac{4}{3}$$三行出结果。注意均匀分布的密度函数是 $\frac{1}{2}$因为区间长度是 2。这个细节很多人会漏。2.3 期望的运算性质线性是黄金法则期望有两条核心运算性质$E(C)C$常数期望等于本身$E(aXbY)aE(X)bE(Y)$线性可加性这里最关键的一点线性可加性对任意两个随机变量都成立不管它们是否独立。这是个超级好用的性质但我也见过很多人误以为“只有独立才能拆”——不是的。独立性不是期望线性拆分的前提但它是方差拆分的前提两者千万别搞混。举个例子说明线性性质的价值。设 $X_1, X_2, \dots, X_n$ 是独立同分布的随机变量每个的期望都是 $\mu$那么 $$E(\bar{X})E\left(\frac{1}{n}\sum_{i1}^n X_i\right)\frac{1}{n}\sum_{i1}^n E(X_i)\frac{1}{n}\cdot n\mu\mu$$这一步证明过程里没有用到任何独立性条件。样本均值无论何时都是总体期望的无偏估计这句话的前提就在这里。3. 方差与标准差的实操细节3.1 方差的等价公式和它的妙用方差定义为 $$D(X)E{[X-E(X)]^2}$$但实际计算中更常用的是这个等价公式 $$D(X)E(X^2)-[E(X)]^2$$这两个公式为什么等价展开定义式 $$E{[X-E(X)]^2}E[X^2-2X E(X)E(X)^2]$$由于期望的线性性质可以拆开 $$E(X^2)-2E(X)E(X)[E(X)]^2E(X^2)-[E(X)]^2$$中间的 $-2E(X)E(X)$ 这一步是因为 $E(X)$ 本身是一个常数所以 $E[2X E(X)]2E(X)E(X)$。用这个等价公式很多计算会简化不少。比如算 $D(2X3)$你先算 $E(2X3)2E(X)3$再算 $E[(2X3)^2]$然后套公式。步骤清晰不容易错。3.2 方差的性质中最容易漏的条件方差的性质有以下几条$D(C)0$$D(XC)D(X)$$D(CX)C^2 D(X)$$D(X\pm Y)D(X)D(Y)\pm 2Cov(X,Y)$若 $X$ 与 $Y$ 独立则 $D(X\pm Y)D(X)D(Y)$第四条是一个通式第五条是前者的特例。很多人只背了第五条“独立时方差可加”碰到 $X$ 和 $Y$ 不独立就傻眼。比如 $YX$那 $D(XY)D(2X)4D(X)$而 $D(X)D(Y)2D(X)$差了整整一倍。原因就在于 $Cov(X,X)D(X)$ 这一项。我在实操中踩过一个类似的坑。当时做的是一个传感器融合的小项目两个传感器测同一个物理量一个精度高一个精度低我把两个读数直接做了平均。直觉告诉我精度应该提升但我忘了两个传感器的噪声是相关的因为受同一环境温度干扰结果算出来融合后的方差并没有按预想下降那么多。后来意识到要用带协方差项的公式。3.3 标准差的意义把量纲带回来方差的单位是原变量单位的平方。如果你在衡量一批零件长度的波动长度单位是毫米方差单位是平方毫米——这在物理意义上是别扭的。所以工程里更多用标准差 $\sigma\sqrt{D(X)}$它跟原变量同量纲可以直接跟均值放在一起描述。比如零件标称长度 50mm标准差 0.02mm这就是一个很直观的描述绝大多数零件长度落在 $50 \pm 3\times0.02$ 也就是 $49.94$ 到 $50.06$ mm 之间如果分布近似正态。这个“三倍标准差”的直觉是做质量控制的基本功。4. 协方差与相关系数两个变量关系的度量4.1 协方差的定义和计算套路协方差的定义式 $$Cov(X,Y)E{[X-E(X)][Y-E(Y)]}$$同样常用的是等价公式 $$Cov(X,Y)E(XY)-E(X)E(Y)$$展开验证一下前面那个期望式子里把乘积展开得到 $E(XY) - E(X)E(Y) - E(X)E(Y) E(X)E(Y)$化简就是 $E(XY)-E(X)E(Y)$。这个公式用起来特别顺手。比如 $X$ 和 $Y$ 的联合分布律已经给出了但比较繁琐的时候你先分别求 $E(X)$、$E(Y)$、$E(XY)$然后一减就完事。需要注意$E(XY)$ 的计算要看联合分布离散型$E(XY)\sum_i\sum_j x_i y_j p_{ij}$连续型$E(XY)\int\int xy f(x,y), dxdy$如果 $X$ 和 $Y$ 独立那么 $E(XY)E(X)E(Y)$此时协方差为零。但反过来不成立——协方差为零推不出独立。这是个经典陷阱后面常见问题里我再细说。4.2 相关系数协方差的标准化版本相关系数定义为 $$\rho_{XY}\frac{Cov(X,Y)}{\sqrt{D(X)}\sqrt{D(Y)}}$$它的核心性质是有界性$|\rho_{XY}| \le 1$。这个性质的直观解释是相关系数衡量的是线性相关程度当 $\rho1$ 时 $Y$ 与 $X$ 完全正线性相关当 $\rho-1$ 时完全负线性相关当 $\rho0$ 时称 $X$ 与 $Y$ 不相关。为什么叫“线性相关”因为相关系数本质上是在衡量“用一条直线去拟合 $X$ 和 $Y$ 的关系时拟合效果有多好”。$\rho^2$ 就是这条直线能解释的方差比例。比如 $\rho0.6$说明 $Y$ 的方差里有 $36%$ 可以用 $X$ 的线性变化来解释剩下的 $64%$ 是别的原因。这里必须补一句容易误解的地方相关系数小只说明线性关系弱不代表两个变量没关系。假设 $YX^2$$X$ 在 $[-1,1]$ 上对称分布算出来相关系数很有可能是 0。但 $Y$ 明明是由 $X$ 完全决定的——这是非线性关系不是无关系。4.3 协方差矩阵多维随机变量的标配当随机变量从一维走向多维单个方差和相关系数就不够用了。协方差矩阵把所有分量两两之间的协方差都装进去$$\Sigma \begin{bmatrix} D(X_1) Cov(X_1,X_2) \cdots Cov(X_1,X_n) \ Cov(X_2,X_1) D(X_2) \cdots Cov(X_2,X_n) \ \vdots \vdots \ddots \vdots \ Cov(X_n,X_1) Cov(X_n,X_2) \cdots D(X_n) \end{bmatrix}$$对角线是各分量的方差非对角线是两两协方差。它是对称矩阵而且半正定。在多维正态分布里协方差矩阵完全刻画了变量之间的线性依赖结构。做 PCA 降维的时候第一步就是把协方差矩阵的特征值分解算出来特征值大小代表每个主成分方向上的方差大小特征向量就是那些方向。5. 实际计算案例从题目到工程全走一遍5.1 一道典型计算题的全过程题目设 $(X,Y)$ 的联合密度函数为$$f(x,y)\begin{cases} xy, 0 \le x \le 1, 0 \le y \le 1 \ 0, \text{其他} \end{cases}$$求 $E(X)$、$D(X)$、$Cov(X,Y)$、$\rho_{XY}$。第一步求边缘密度。对 $y$ 积分 $$f_X(x)\int_0^1 (xy), dy x\frac{1}{2}, \quad 0 \le x \le 1$$同理 $f_Y(y)y\frac{1}{2}$。第二步求 $E(X)$ $$E(X)\int_0^1 x\left(x\frac{1}{2}\right) dx \int_0^1 \left(x^2\frac{x}{2}\right) dx \frac{1}{3}\frac{1}{4}\frac{7}{12}$$第三步求 $E(X^2)$ $$E(X^2)\int_0^1 x^2\left(x\frac{1}{2}\right) dx \int_0^1 \left(x^3\frac{x^2}{2}\right) dx \frac{1}{4}\frac{1}{6}\frac{5}{12}$$第四步求方差 $$D(X)E(X^2)-[E(X)]^2\frac{5}{12}-\left(\frac{7}{12}\right)^2\frac{5}{12}-\frac{49}{144}\frac{60-49}{144}\frac{11}{144}$$第五步求 $E(XY)$ $$E(XY)\int_0^1\int_0^1 xy(xy), dxdy \int_0^1\int_0^1 (x^2 y x y^2), dxdy$$先对 $x$ 积分 $$\int_0^1 x^2 y, dx \frac{y}{3}, \quad \int_0^1 x y^2, dx \frac{y^2}{2}$$再对 $y$ 积分 $$E(XY)\int_0^1 \left(\frac{y}{3}\frac{y^2}{2}\right) dy \frac{1}{6}\frac{1}{6}\frac{1}{3}$$第六步求协方差 $$Cov(X,Y)\frac{1}{3}-\frac{7}{12}\times\frac{7}{12}\frac{1}{3}-\frac{49}{144}\frac{48-49}{144}-\frac{1}{144}$$第七步由对称性 $D(Y)D(X)$所以 $$\rho_{XY}\frac{-1/144}{\sqrt{11/144}\times\sqrt{11/144}}-\frac{1}{11}$$整个计算过程走完你会发现没有一步是“需要灵感”的全是固定流程边缘密度 → 一阶矩 → 二阶矩 → 协方差 → 相关系数。这也是为什么我说数字特征是概率论里“最像操作工”的板块——只要你流程熟练不太可能出错。5.2 工程场景用数字特征评估两个投资组合把视角切换到实际应用。假设你手头有两个投资组合 A 和 B年化收益率分别用随机变量 $R_A$、$R_B$ 表示。你已经从历史数据算出来$E(R_A)8%$$D(R_A)0.04$$E(R_B)12%$$D(R_B)0.09$$Cov(R_A,R_B)0.02$单独看A 收益低但稳B 收益高但波动大。如果做 $50%/50%$ 的组合组合收益率 $R_P0.5R_A0.5R_B$则$$E(R_P)0.5\times8%0.5\times12%10%$$$$D(R_P)0.5^2\times0.040.5^2\times0.092\times0.5\times0.5\times0.020.010.02250.010.0425$$组合的标准差约 20.6%比单独持有 B 的 30% 低了不少。这就是“分散化”的数学本质组合方差不仅取决于单项资产的方差还取决于资产之间的协方差。如果两者协方差为负分散效果会更好——这条逻辑是做资产配置的理论基石。5.3 用样本估计总体统计量的无偏性问题在这个系列前面的内容里我们反复出现过一个式子 $$S^2\frac{1}{n-1}\sum_{i1}^n (X_i-\bar{X})^2$$为什么分母是 $n-1$ 而不是 $n$用数字特征的框架来解释。先假设分母用 $n$记 $S_n^2$ $$S_n^2\frac{1}{n}\sum_{i1}^n (X_i-\bar{X})^2$$可以证明这里不展开全部计算 $$E(S_n^2)\frac{n-1}{n}D(X)$$所以 $S_n^2$ 会系统性低估总体方差。把分母换成 $n-1$就能恰好补齐这个偏差 $$E(S^2)D(X)$$这就是“无偏性”的含义。我当时第一次学到这个的时候觉得概率论真是有点“反直觉的艺术”——一个看起来只是分母差 1 的调整背后藏着期望运算的完整推导。6. 常见问题与避坑指南6.1 四个高频翻车点翻车点一期望线性拆分误加“独立”条件。有人写 $E(XY)E(X)E(Y)$ 时总想加个“当 $X$、$Y$ 独立才成立”——这个加对了。但有人把 $E(XY)E(X)E(Y)$ 也加上独立条件这就错了。前者需要独立后者永远成立。翻车点二方差拆分漏了协方差项。$D(X-Y)D(X)-D(Y)$ 是错误公式正确写法是 $D(X-Y)D(X)D(Y)-2Cov(X,Y)$。当 $X$ 与 $Y$ 独立时$D(X-Y)D(X)D(Y)$注意中间是加号不是减号。翻车点三协方差为零直接推断独立。前面已经举了 $YX^2$ 的例子。协方差为零只说明“不线性相关”非线性关系可能很强。翻车点四连续型期望的积分区间出错。密度函数的分段定义边界没看清积分上限写错。每次算之前先验证 $\int f(x), dx1$这是最廉价的自检手段。6.2 快速自检表检查项方法预期结果密度函数是否正确全域积分是否等于1等于1方差是否非负用 $E(X^2)-[E(X)]^2$ 计算大于等于0相关系数是否超界$\rho$ 值落在 $[-1,1]$边缘密度是否归一对每个边缘密度积分等于1协方差矩阵是否对称检查 $Cov(X,Y)Cov(Y,X)$相等6.3 经验心得先画框架再动手最后分享一点我从算题和做项目中总结的习惯。拿到一道求数字特征的题不要上来就代公式。先花三十秒在草稿纸上列出四行分布类型是什么离散型还是连续型需要哪些中间量$E(X)$、$E(X^2)$、$E(XY)$是单变量还是多变量是否需要协方差最终要什么期望方差相关系数把这四行写清楚再动手计算。看似多花了三十秒实际上避免了很多“算到一半发现漏了边缘密度”的返工。做工程数据分析也一样先明确你要用哪个数字特征来回答业务问题——是要平均表现期望、稳定性方差、还是两个指标的关系相关系数——然后再决定计算路径。这套方法在我自己处理数据的时候反复救过我。有一次我拿到一批用户行为数据直接去算两个指标的相关系数结果接近 0差点下结论“两者无关”。后来加了散点图一看呈现出明显的 U 形关系——相关系数完全捕捉不到这个。所以我现在每次算完相关系数只要条件允许一定会画一张散点图瞟一眼。数字特征给你的是压缩后的信息压缩就会丢细节这个代价你心里得一直有数。
返回列表