你好。上一课我们从离散联合分布出发,计算了边缘概率、条件概率,并用贝叶斯公式理解“评测通过”这类证据如何改变对真实质量的判断。
这一课继续使用离散分布,但问题换成:一个随机量的典型水平是什么、它会围绕典型水平波动多大,以及两个随机量是否倾向于一起变化。对应的三个核心量是期望、方差与协方差。它们会反复出现在后训练工作中:平均奖励、奖励方差、每条轨迹的 token 成本波动、不同评测指标的共同变化,以及策略梯度估计的高方差问题等。
完成本课后,你应能从离散概率表或离散联合概率表中,计算:
并能说清它们各自描述什么、又不能说明什么。
期望:按概率加权的长期平均
设 是一个离散随机变量。它不是某一次任务的固定观测值,而是一次随机试验可能产生的数值结果。例如,从一个固定任务池随机抽取任务,并让 Agent 完成它;定义:
假设根据历史轨迹,我们得到下列分布:
| :工具调用次数 | |
|---|---|
| 0 | 0.10 |
| 1 | 0.30 |
| 2 | 0.40 |
| 3 | 0.20 |
先检查它是否是有效分布:
期望是每个可能取值按其发生概率加权后的总和:
在这个例子中:
因此,随机抽取一个任务时,Agent 的平均工具调用次数是 。
这里最重要的直觉是:期望不是“一次运行最可能出现的结果”,也不一定是可能实际观察到的值。 在这里, 次调用并不会出现在某一条单独轨迹中;它描述的是大量同类任务和相同策略下的长期平均。
如果每一次工具调用平均消耗 元,那么单条轨迹成本 。期望成本是:
这说明期望可以把“随机次数”转化为长期资源预算。在实际 Agent 评测中,平均 token 数、平均调用数、平均延迟,本质上都在估计某类随机变量的期望。
Expected Value and Variance of Discrete Random Variables
观看 jbstatistics 的《Expected Value and Variance of Discrete Random Variables》。它将期望、函数的期望和方差连成一条计算主线,适合先建立公式背后的“概率加权”直觉。
先看 期望定义,注意每个可能结果为何要乘以其概率。接着看 函数期望,理解平方、成本等变换也仍然按原分布加权。最后观看 方差例题,重点区分 \mathbb{E}[X^2] 与 ((\mathbb{E}[X])^2)。
更一般地,如果我们关心 的某个函数 ,只需把“结果值”替换成变换后的值:
例如,若一次轨迹的成本随调用数非线性增长,令:
那么 就是“调用次数平方”的平均,而不是平均调用次数的平方。两者看起来相近,含义却不同,下一节的方差正是依赖这个区别。
方差:结果会离平均水平多远
仅有期望还不够。考虑两个 Agent:
- Agent A 的平均工具调用次数为 ,绝大多数任务都接近这个数;
- Agent B 的平均调用次数也是 ,但有些任务零调用,有些任务会反复调用很多次。
两者平均成本相同,但 B 的预算风险、尾部延迟和用户体验显然更不稳定。我们需要用方差描述这种波动。
令:
方差定义为随机变量偏离均值的平方距离的期望:
对离散分布展开:
平方有两个作用:
- 正负偏离不会相互抵消;
- 离均值很远的结果会得到更大的惩罚。
回到工具调用次数的例子,已经知道:
逐项计算:
| 0 | 0.10 | 2.89 | 0.289 | |
| 1 | 0.30 | 0.49 | 0.147 | |
| 2 | 0.40 | 0.3 | 0.09 | 0.036 |
| 3 | 0.20 | 1.3 | 1.69 | 0.338 |
将最后一列相加:
因此,该策略的工具调用次数方差为:

更常用的计算式
直接计算 很直观,但手算和编程时常用下面的等价形式:
先算:
再代入:
两种算法必然给出同一结果。第二种形式之所以容易出错,是因为下面两项绝不相同:
前者是“先平方每个可能结果,再取平均”;后者是“先取平均,再平方”。
4.2 Mean or Expected Value and Standard Deviation
阅读 OpenStax《Statistics》的 4.2 节。这份材料用概率表逐列计算期望和离散分布的方差,有助于把公式稳定地落实到表格运算。
在 “4.2 Mean or Expected Value and Standard Deviation” 中,先读期望的定义和 Example 4.3。从 期望值示例 开始,留意每一行的 xP(x) 如何汇总成长期平均。随后继续阅读方差定义与 Example 4.4,尤其关注 方差计算说明:先围绕均值求偏差、平方、乘以概率,最后求和。
方差的单位与标准差
方差的单位是原单位的平方。若 的单位是“工具调用次数”,则:
的单位是“调用次数的平方”。因此,实际解释波动时,人们也常使用标准差:
本例中:
标准差重新回到了“调用次数”的单位。它可粗略理解为:一次任务的调用次数通常会在均值 附近波动约 次;但这不是一个严格的上下界,更不能据此断言所有任务都落在某个固定范围内。
还要区分两个场景:
- 若题目给出了完整的理论分布 ,本课公式给出的是该分布的真实期望和真实方差。
- 若你只有有限条 rollout 记录,则这些公式中的概率需要用频率近似,得到的是对真实量的估计。如何从有限样本可靠地估计和比较指标,是后续评测模块会系统处理的问题。
协方差:两个随机量如何共同偏离各自均值
方差衡量一个变量自身的波动。现在考虑两个变量:
其中 表示通过, 表示未通过。
我们关心的不只是它们各自的平均值,还关心:调用数偏高的任务,成功率是否也倾向于偏高?还是调用数偏高往往意味着任务更难、反而更容易失败?
协方差衡量的就是两个变量相对各自均值的偏离,是否倾向于同号或异号:
其中:
对于离散联合分布:
其符号来自每个联合结果的“偏离乘积”:
- 若 与 都高于均值,两个偏离为正,乘积为正;
- 若 与 都低于均值,两个偏离为负,乘积仍为正;
- 若一个高于均值、另一个低于均值,乘积为负。
因此,协方差的正负描述的是“共同波动的方向”。
从联合概率表计算协方差
考虑一个简化的轨迹统计。令 表示是否发生额外工具调用, 表示任务是否最终通过验证。
| 未通过 | 通过 | ||
|---|---|---|---|
| 无额外调用 | 0.10 | 0.40 | 0.50 |
| 有额外调用 | 0.40 | 0.10 | 0.50 |
| 0.50 | 0.50 | 1.00 |
由边缘分布得到:
使用定义直接计算:
负协方差说明:在这个分布中,“有额外调用”与“成功”更常出现反向偏离。具体来说,最常见的两个组合是:
- 没有额外调用且通过;
- 有额外调用但未通过。
在实际 Agent 系统中,一种合理解释可能是:任务越难,越容易触发补救性工具调用,也越可能最终失败。但请注意,这只是解释假设,不是协方差本身能够证明的因果关系。额外调用没有被证明“导致”失败;两者可能共同受任务难度、工具可靠性或提示词质量影响。
快捷公式
协方差有一个尤其常用的等价式:
对上面的联合表:
因此:
在多变量统计、奖励分析和损失项分析中,这个形式通常比逐项计算偏差更方便。
18 The Correlation Coefficient - STAT ONLINE
阅读 Penn State STAT 414 的 Lesson 18 中 18.1 与 18.3 节。它给出了离散联合分布下协方差的正式定义、快捷计算式,以及“独立”和“零协方差”之间不能混淆的关系。
在 Section 18.1 “Covariance of X and Y” 中,阅读 Definition 18.1、Example 18.1,并跟随快捷式 \operatorname{Cov}(X,Y)=\mathbb{E}[XY]-\mu_X\mu_Y 的说明。可从 协方差后的讨论 附近定位快捷公式与第二个例题。随后到 Section 18.3 “Understanding Rho”,阅读 独立性的结果,再看该节关于零相关但仍依赖的反例;重点记住:零协方差不等于独立。
独立、零协方差与一个关键反例
如果 和 独立,则联合分布可以拆开:
在这种情况下:
所以:
也就是说:
但反方向通常不成立。协方差为零,并不表示两个变量独立。
考虑一个离散反例。令:
并且三个值等概率出现:
定义:
显然,一旦知道 ,就完全知道 ,所以它们绝不是独立的。可是:
因此:
原因在于协方差主要捕捉线性方向上的共同变化。这个例子中 是明确的非线性依赖:当 为正或负时, 都较大;正负方向带来的协方差贡献恰好抵消。
这条警告对于后训练分析很重要。例如,某种格式特征与奖励模型分数的线性协方差接近零,不代表奖励模型没有利用该特征;它仍可能存在阈值式、分段式或其他非线性偏好。
最后,一个很有用的恒等式是:
因为把协方差定义中的 换成 ,就得到:
因此,方差可以看作“变量与它自身的协方差”。
一套稳定的计算流程
当你面对离散分布或联合分布表时,可按以下顺序计算:
-
检查概率表。
单变量分布中所有概率之和应为 ;联合分布表所有内部单元格之和也应为 。 -
先计算边缘分布。
协方差需要 与 ,因此必须先对联合表按行或按列求和。 -
计算期望。
对单变量用: -
计算方差。
通常优先使用:若需要解释每个取值为何贡献波动,则回到偏差平方定义。
-
计算协方差。
先求:再使用:
-
解释时保持边界。
期望是长期平均;方差是波动强度;协方差的符号说明线性共同波动方向。它们都不能单独证明因果关系;协方差为零也不能证明独立性。
小结
本课建立了离散随机变量的三个核心统计量:
- 期望描述概率加权的长期平均:
- 方差描述围绕均值的平方波动:
- 协方差描述两个变量相对各自均值的共同偏离:
在后训练场景中,平均 reward、平均 token 成本、回报波动、成功率与调用次数的共同变化,都可以先用这套语言描述。后续学习策略梯度、PPO 的优势函数和奖励归一化时,期望与方差将从“概率表上的计算”变成直接决定训练稳定性的工具。
下一课将转向 softmax 与 log-sum-exp,重点是如何在实际大模型训练中稳定地计算概率与对数概率,避免指数运算导致上溢或下溢。
Can't find a good explanation? Sign up and we'll make it for you
Sign up