Create your own
Lesson illustration

离散分布的期望、方差与协方差计算

你好。上一课我们从离散联合分布出发,计算了边缘概率、条件概率,并用贝叶斯公式理解“评测通过”这类证据如何改变对真实质量的判断。

这一课继续使用离散分布,但问题换成:一个随机量的典型水平是什么、它会围绕典型水平波动多大,以及两个随机量是否倾向于一起变化。对应的三个核心量是期望、方差与协方差。它们会反复出现在后训练工作中:平均奖励、奖励方差、每条轨迹的 token 成本波动、不同评测指标的共同变化,以及策略梯度估计的高方差问题等。

完成本课后,你应能从离散概率表或离散联合概率表中,计算:

并能说清它们各自描述什么、又不能说明什么。


期望:按概率加权的长期平均

是一个离散随机变量。它不是某一次任务的固定观测值,而是一次随机试验可能产生的数值结果。例如,从一个固定任务池随机抽取任务,并让 Agent 完成它;定义:

假设根据历史轨迹,我们得到下列分布:

:工具调用次数
00.10
10.30
20.40
30.20

先检查它是否是有效分布:

期望是每个可能取值按其发生概率加权后的总和:

在这个例子中:

因此,随机抽取一个任务时,Agent 的平均工具调用次数是

这里最重要的直觉是:期望不是“一次运行最可能出现的结果”,也不一定是可能实际观察到的值。 在这里, 次调用并不会出现在某一条单独轨迹中;它描述的是大量同类任务和相同策略下的长期平均。

如果每一次工具调用平均消耗 元,那么单条轨迹成本 。期望成本是:

这说明期望可以把“随机次数”转化为长期资源预算。在实际 Agent 评测中,平均 token 数、平均调用数、平均延迟,本质上都在估计某类随机变量的期望。

Expected Value and Variance of Discrete Random Variables

观看 jbstatistics 的《Expected Value and Variance of Discrete Random Variables》。它将期望、函数的期望和方差连成一条计算主线,适合先建立公式背后的“概率加权”直觉。

先看 期望定义,注意每个可能结果为何要乘以其概率。接着看 函数期望,理解平方、成本等变换也仍然按原分布加权。最后观看 方差例题,重点区分 \mathbb{E}[X^2] 与 ((\mathbb{E}[X])^2)。

更一般地,如果我们关心 的某个函数 ,只需把“结果值”替换成变换后的值:

例如,若一次轨迹的成本随调用数非线性增长,令:

那么 就是“调用次数平方”的平均,而不是平均调用次数的平方。两者看起来相近,含义却不同,下一节的方差正是依赖这个区别。


方差:结果会离平均水平多远

仅有期望还不够。考虑两个 Agent:

  • Agent A 的平均工具调用次数为 ,绝大多数任务都接近这个数;
  • Agent B 的平均调用次数也是 ,但有些任务零调用,有些任务会反复调用很多次。

两者平均成本相同,但 B 的预算风险、尾部延迟和用户体验显然更不稳定。我们需要用方差描述这种波动。

令:

方差定义为随机变量偏离均值的平方距离的期望

对离散分布展开:

平方有两个作用:

  1. 正负偏离不会相互抵消;
  2. 离均值很远的结果会得到更大的惩罚。

回到工具调用次数的例子,已经知道:

逐项计算:

00.102.890.289
10.300.490.147
20.400.30.090.036
30.201.31.690.338

将最后一列相加:

因此,该策略的工具调用次数方差为:

该图用离散概率表展示期望的加权求和,以及通过先计算 \(\mathbb{E}[X^2]\)、再减去均值平方来得到方差的快捷公式。

更常用的计算式

直接计算 很直观,但手算和编程时常用下面的等价形式:

先算:

再代入:

两种算法必然给出同一结果。第二种形式之所以容易出错,是因为下面两项绝不相同:

前者是“先平方每个可能结果,再取平均”;后者是“先取平均,再平方”。

4.2 Mean or Expected Value and Standard Deviation

阅读 OpenStax《Statistics》的 4.2 节。这份材料用概率表逐列计算期望和离散分布的方差,有助于把公式稳定地落实到表格运算。

在 “4.2 Mean or Expected Value and Standard Deviation” 中,先读期望的定义和 Example 4.3。从 期望值示例 开始,留意每一行的 xP(x) 如何汇总成长期平均。随后继续阅读方差定义与 Example 4.4,尤其关注 方差计算说明:先围绕均值求偏差、平方、乘以概率,最后求和。

方差的单位与标准差

方差的单位是原单位的平方。若 的单位是“工具调用次数”,则:

的单位是“调用次数的平方”。因此,实际解释波动时,人们也常使用标准差

本例中:

标准差重新回到了“调用次数”的单位。它可粗略理解为:一次任务的调用次数通常会在均值 附近波动约 次;但这不是一个严格的上下界,更不能据此断言所有任务都落在某个固定范围内。

还要区分两个场景:

  • 若题目给出了完整的理论分布 ,本课公式给出的是该分布的真实期望和真实方差。
  • 若你只有有限条 rollout 记录,则这些公式中的概率需要用频率近似,得到的是对真实量的估计。如何从有限样本可靠地估计和比较指标,是后续评测模块会系统处理的问题。

协方差:两个随机量如何共同偏离各自均值

方差衡量一个变量自身的波动。现在考虑两个变量:

其中 表示通过, 表示未通过。

我们关心的不只是它们各自的平均值,还关心:调用数偏高的任务,成功率是否也倾向于偏高?还是调用数偏高往往意味着任务更难、反而更容易失败?

协方差衡量的就是两个变量相对各自均值的偏离,是否倾向于同号或异号:

其中:

对于离散联合分布:

其符号来自每个联合结果的“偏离乘积”:

  • 都高于均值,两个偏离为正,乘积为正;
  • 都低于均值,两个偏离为负,乘积仍为正;
  • 若一个高于均值、另一个低于均值,乘积为负。

因此,协方差的正负描述的是“共同波动的方向”。


从联合概率表计算协方差

考虑一个简化的轨迹统计。令 表示是否发生额外工具调用, 表示任务是否最终通过验证。

未通过 通过
无额外调用0.100.400.50
有额外调用0.400.100.50
0.500.501.00

由边缘分布得到:

使用定义直接计算:

负协方差说明:在这个分布中,“有额外调用”与“成功”更常出现反向偏离。具体来说,最常见的两个组合是:

  • 没有额外调用且通过;
  • 有额外调用但未通过。

在实际 Agent 系统中,一种合理解释可能是:任务越难,越容易触发补救性工具调用,也越可能最终失败。但请注意,这只是解释假设,不是协方差本身能够证明的因果关系。额外调用没有被证明“导致”失败;两者可能共同受任务难度、工具可靠性或提示词质量影响。

快捷公式

协方差有一个尤其常用的等价式:

对上面的联合表:

因此:

在多变量统计、奖励分析和损失项分析中,这个形式通常比逐项计算偏差更方便。

18 The Correlation Coefficient - STAT ONLINE

阅读 Penn State STAT 414 的 Lesson 18 中 18.1 与 18.3 节。它给出了离散联合分布下协方差的正式定义、快捷计算式,以及“独立”和“零协方差”之间不能混淆的关系。

在 Section 18.1 “Covariance of X and Y” 中,阅读 Definition 18.1、Example 18.1,并跟随快捷式 \operatorname{Cov}(X,Y)=\mathbb{E}[XY]-\mu_X\mu_Y 的说明。可从 协方差后的讨论 附近定位快捷公式与第二个例题。随后到 Section 18.3 “Understanding Rho”,阅读 独立性的结果,再看该节关于零相关但仍依赖的反例;重点记住:零协方差不等于独立。


独立、零协方差与一个关键反例

如果 独立,则联合分布可以拆开:

在这种情况下:

所以:

也就是说:

但反方向通常不成立。协方差为零,并不表示两个变量独立。

考虑一个离散反例。令:

并且三个值等概率出现:

定义:

显然,一旦知道 ,就完全知道 ,所以它们绝不是独立的。可是:

因此:

原因在于协方差主要捕捉线性方向上的共同变化。这个例子中 是明确的非线性依赖:当 为正或负时, 都较大;正负方向带来的协方差贡献恰好抵消。

这条警告对于后训练分析很重要。例如,某种格式特征与奖励模型分数的线性协方差接近零,不代表奖励模型没有利用该特征;它仍可能存在阈值式、分段式或其他非线性偏好。

最后,一个很有用的恒等式是:

因为把协方差定义中的 换成 ,就得到:

因此,方差可以看作“变量与它自身的协方差”。


一套稳定的计算流程

当你面对离散分布或联合分布表时,可按以下顺序计算:

  1. 检查概率表。
    单变量分布中所有概率之和应为 ;联合分布表所有内部单元格之和也应为

  2. 先计算边缘分布。
    协方差需要 ,因此必须先对联合表按行或按列求和。

  3. 计算期望。
    对单变量用:

  4. 计算方差。
    通常优先使用:

    若需要解释每个取值为何贡献波动,则回到偏差平方定义。

  5. 计算协方差。
    先求:

    再使用:

  6. 解释时保持边界。
    期望是长期平均;方差是波动强度;协方差的符号说明线性共同波动方向。它们都不能单独证明因果关系;协方差为零也不能证明独立性。


小结

本课建立了离散随机变量的三个核心统计量:

  • 期望描述概率加权的长期平均:
  • 方差描述围绕均值的平方波动:
  • 协方差描述两个变量相对各自均值的共同偏离:

在后训练场景中,平均 reward、平均 token 成本、回报波动、成功率与调用次数的共同变化,都可以先用这套语言描述。后续学习策略梯度、PPO 的优势函数和奖励归一化时,期望与方差将从“概率表上的计算”变成直接决定训练稳定性的工具。

下一课将转向 softmax 与 log-sum-exp,重点是如何在实际大模型训练中稳定地计算概率与对数概率,避免指数运算导致上溢或下溢。

Can't find a good explanation? Sign up and we'll make it for you

Sign up