日期: 2026 年 9 月 22 日
笔记作者: Zhongzhu Zhou
阅读论文: Long-Horizon Language Model Reinforcement Learning via Progressive Point Matching
论文作者: Preston Fu、Kevin Frans、Oleh Rybkin、Sergey Levine、Aviral Kumar
版本: arXiv:2609.07303v1,2026 年 9 月 7 日
本笔记覆盖正文与附录 A–D,共 38 页。
资源: 作者介绍 · 官方代码入口
1. 先说这篇论文值得读在哪里
一道题需要十个关键步骤。模型完成了前九个,最后算错;另一个回答从一开始就没有抓住问题。只检查最终答案时,两者都是零分。长程强化学习的一个浪费,正在于昂贵的失败轨迹里可能已经有不少有价值的进展,却没有被训练信号区分出来。
PPM,即 Progressive Point Matching,试图利用参考解答,把这种进展变成奖励。它先把参考解答拆成若干“推理点”,再检查模型生成到每个位置时已经到达哪些点。奖励来自新增加的进度,而不是每一段文字表面上有多合理。模型仍然自己生成回答,参考解答主要进入评分过程。
这还不够。如果参考解答绕了远路,而模型找到一条更短的正确解法,简单计算“匹配了几个参考步骤”会惩罚这条好路线。于是论文引入 shortcutting:到达一个后续节点后,已经不必显式重做的前置步骤也获得信用。在理想定义里,最终目标一旦达成,全部参考点都得到补分。

我认为它最有价值的地方,是把三个经常混在一起的问题拆开了:失败时有没有信号、信号能否分配到较短的片段、奖励是否强迫模型沿着参考路线走。中间奖励、分段记分和捷径补分分别回答这三个问题。
但阅读时也要把三层结论分开。第一层是理想推理图上的最优策略等价性;第二层是独立性等假设下的梯度信噪比分析;第三层才是真实模型、有限数据和评审模型共同构成的实验系统。第一层成立,不能自动推出第三层一定收敛到最优,更不能推出所有 agent 任务都会获得同样收益。
实验最有说服力的部分,是可控任务里随着推理跨度增加而扩大的优势,以及接近零成功率的数学题上重新获得训练信号。另一方面,PPM 在部分 AIME 指标上输给 GRPO,较短训练预算与较长训练预算也没有形成单调关系。这些结果应当一起保留。
本文所有模型实验数字均来自论文。原绘示意图、玩具模型曲线和手算例子都会说明来源;没有把它们当作新增训练实验。
2. 前置知识:为什么“最后对不对”越来越难学
2.1 从语言模型概率到策略梯度
固定一个问题后,模型依次生成 token。整段回答的概率是条件概率的乘积:
设最终答案奖励为 。期望奖励对参数求导,先使用对数导数恒等式,再把整段概率展开,可得:
这里最值得注意的不是公式长短,而是同一个 乘在整段 token 的梯度上。回答里有关键推导、有无效探索,也可能有蒙对的结尾;结果奖励本身并不知道各段分别起了什么作用。最终失败的轨迹即使包含正确引理,也可能和完全没有进展的轨迹一样没有正信号。
GRPO 一类方法利用同一问题下多个回答的相对好坏来构造优势。如果一组回答全部为零分,减去组均值后仍然全是零。增加采样数可以提高碰到成功的概率,但长任务可能让这个代价很快变大。
若单次成功概率为 ,采样 条独立轨迹,至少出现一次成功的概率是:
做一个纯说明性的计算:假设 20 个必要步骤彼此独立,每步成功概率都是 0.7,则整题成功率约为 。一次采样 16 条,至少成功一次的概率也只有约 1.27%。这不是论文中 Qwen 的实测成功率,而是在说明:一旦可靠信号依赖“所有必要步骤都成功”,提高 rollout 数未必是便宜的解决办法。
2.2 正确的一步,不一定是有用的一步
传统过程奖励通常检查某一步是否逻辑正确。PPM 关心的是是否到达参考解中的有用状态。例如,重复一个恒真的等式可能没有错误,但不推进问题;通过另一种方法得到关键中间量,可能没有模仿参考文字,却确实推进了问题。
这里也有反方向的风险。附录 D 的 PPM 评分提示要求检查中间结果是否出现,而不要求生成该结果的推导一定可靠。这样能避免把“前面有错、后面仍得到了有用结论”的轨迹全部判死刑,但也可能给无依据的正确断言记分。因而“进度评分”和“证明有效性检查”不能被视为同一件事。
2.3 记住四个不同的尺度
| 尺度 | 这里表示什么 | 不应混同为什么 |
|---|---|---|
| token 长度 | 模型实际生成的文本长度 | 不等于推理难度 |
| 分段数 | 在哪些前缀位置进行评分 | 不等于推理点数 |
| 参考点数 | 参考解被拆出的要点数量 | 会随拆分粒度改变 |
| 理论跨度 | 附录模型里的必要子问题数 | 不等于 4K、8K 等预算 |
后文用 表示参考点数量,用 表示理论跨度,避免把两个概念混在一起。一个 4K 回答可以分成四段,但实际包含的关键推理点既可能超过四个,也可能一个都没有。
3. 方法核心:把推理看成到达一组中间状态
3.1 推理点为什么可以压缩历史
假设两个不同的推导都证明了同一个引理,后续解题往往只需要使用引理,不需要重新阅读它的全部证明。论文据此把“已经得到哪些结论”看成推理状态。生成新的一段文字,相当于向这个集合增加新的点,或者暂时没有增加。
这个状态天然单调:先前建立的引理不会因为后面多写了几句话就消失。它很适合组织部分奖励,却并不是对真实自回归模型的精确描述。真实模型继续生成时看到的是整个前缀;错误陈述、矛盾符号、很长的干扰内容,都可能降低后续成功率。两段文字包含同样的有效引理,不意味着它们诱导出相同的续写分布。
设参考点集合包含 个点,其中最后一个是目标 。理想进度定义为:
这个“属于”不仅包括显式达到的点,也包括按捷径规则补上的点。为了让不同问题的最高分同为一,可以除以 。对单个问题而言,这样的正比例缩放不改变最优策略;跨问题合并梯度时,各题奖励尺度和参考点拆分方式仍会影响训练权重。
3.2 捷径补分解决了什么偏差
考虑一个自拟例子:参考解按 前进,但另一个解法通过 直接到达 。若只计算原文中显式出现的参考点,第二种成功解法可能只有一分,而尚未完成的 路线有两分。训练目标就被悄悄改成了“尽量像参考解”,而不是“把题解对”。
Shortcutting 的作用,是后续成果已经使前面的步骤不再必要时,把相应信用补回来。它是一条奖励记账规则,不代表模型真的生成过那些省略的推导。在理想图中,目标一旦达成,全部参考点都获得信用,因此正确的短路不会被参考解的长度惩罚。

3.3 为什么用相邻前缀的差
把轨迹分为 段,第 段结束时的归一化进度记为 :
例如进度依次为 ,四段奖励就是 。第三段重复已经拿到的结论,没有新增奖励;第四段到达目标,获得剩余信用。这样同一个结果反复出现,不会反复计分。

评审模型看到的是截至当前的完整前缀,而不是孤立的一小段。这让它知道变量此前如何定义,某个结论为什么相关。代价是重复读取前文。另一个现实问题是:理想集合的分数保证单调,独立调用的语言模型评分却可能前后不一致,出现后一个前缀得分反而下降的情况。理论定义和实际评分误差必须分开讨论。
4. “无偏”到底保证了什么
4.1 先把望远镜求和写出来
把每一段的新进度相加,中间项会相互抵消:
接下来才是命题 4.1 的关键条件:假设存在一个可行策略,能够以概率一到达目标;目标点属于参考集合;成功通过捷径规则获得全部信用。每条轨迹的总分不超过一,而期望总分等于一,当且仅当几乎必然得到满分。由于满分包含目标点,这恰好对应几乎必然成功的策略集合。因此两个目标的最优策略集合一致。
这个证明很简洁,但它没有证明任意策略在两种奖励下的排序都一致,也没有证明两种目标的梯度相同,更没有证明有限步神经网络训练一定收敛。失败轨迹在 PPM 下可以获得正分,本来就意味着非最优策略的相对价值发生了改变。
4.2 去掉可达性条件,会发生什么
再看一个自拟的十点问题。策略 A 有 60% 概率成功,失败时毫无进展;策略 B 永远不成功,但每次都到达九个非目标点。两者的期望分数为:
如果可行策略只有这两个,结果奖励选 A,进度奖励选 B。这不是对原命题的反例,因为“存在必胜策略”的假设已经不成立。若再加入一个总能成功的 C,它在两种奖励下都是一分,才恢复相同的最优解。
这个边界与真实训练很有关:预算太短、模型能力不足或可选择策略受限,都可能让完成任务暂时不可行。此时最大化部分进展仍可能很有用,却不能把“有用”改写成“与最终成功目标完全等价”。论文说的 unbiased,更适合理解为特定条件下的最优策略一致,而不是任意 PPM 梯度都是最终奖励梯度的无偏估计。
4.3 和势函数奖励塑形的联系
使用未归一化计数,令 ,再定义 。在非终止状态 时:
形式上,它类似折扣因子为一的势函数塑形。但论文脚注明确保留了失败终止状态的势值,才能给失败轨迹部分信用。终点势值会进入总回报,因此不能忽略终止条件,直接套用更一般的策略不变性结论。
若加入折扣,求和也不再只剩最后一个分数:
把第二个求和的下标错开,就能得到右侧。对于 ,早出现的进展有额外权重。以后若加入 token 成本、时延惩罚或提早结束奖励,应当重新分析目标,而不能认为原命题已经覆盖这些变化。
5. 理论主线:不是只增加奖励,而是减少无关噪声
5.1 附录建立了怎样的简化模型
附录 A 假设每个推理点都有一个独立的局部成功事件 。若点 需要前置集合 中的事件全部成功,它是否被到达就写成:
参数梯度是高维向量。作者把它沿固定方向投影成标量 ,并假设:
不同点的 相互独立,这些矩常数不随任务跨度变化。这些条件不能省略:实际语言模型共享参数和上下文,不同步骤的难度也不同。理论是在隔离一种信用分配机制,而不是完整模拟 transformer 的训练动力学。
三个估计量分别对应最终结果奖励、整条轨迹的进度奖励、局部进度奖励:
第二个式子尤其直观:所有点的进度总和乘在所有步骤的梯度总和上。某一步产生了价值,会给许多无关步骤也附上相同的权重。第三个式子则只把局部到达事件与对应的梯度项相乘。在理想假设下,少了这类无关交叉项,就可能显著降低方差。
5.2 稀疏结果奖励为什么出现指数问题
信噪比定义为均值的绝对值除以标准差:
完整成功需要 个事件都发生。对每个 ,独立性给出 ,所以均值为 。再展开平方:有 个对角项,每个贡献 ;有 个非对角项,每个贡献 。减去均值平方,得到:
若独立采样 次后取平均,方差缩小为原来的 ,信噪比提高 。因此在这个模型里,要抵消跨度增加带来的指数退化,需要相应增加约 量级的样本。它解释了为什么长任务的完整成功信号可能非常昂贵,但不是对任意真实 RL 工作负载的通用时间预测。
5.3 局部奖励的收益取决于进展之间的相关性
令 表示一条轨迹到达的点数。附录对局部估计量计算出:
在均值与标准差里约掉共同因子:
最后的不等式来自柯西不等式 。公式告诉我们,平均进展多少固然重要,进展是否高度相关、是否集中在少数幸运轨迹里同样重要。
若各个子任务独立, 服从二项分布,均值为 、方差为 ,所以局部信噪比是 。若子任务是严格串行链,后面的点只有前面全部成功才可达;固定 时, 与相关二阶矩都保持有界,局部信噪比则是 。两者都优于稀疏结果信号的指数衰减,但不应把独立任务的收益照搬到串行任务。

整轨迹 PPM 在命题 A.3 的正则条件下为 。更一般的图会弱一些:大量叶子依赖一个低概率瓶颈时,进度会成批出现,局部信号也可能下降;附录的一般最坏情形达到 ,加入额外矩条件后可得到 下界。这些条件说明,“密集奖励”不是一个脱离任务结构的万能标签。
此外,v1 在命题 A.7 后的文字称某个蒲公英图上两种 PPM 估计量具有相同的 信噪比,后面的命题 A.10 却给出二者比值随规模增长的下界。同一套假设下不能同时直接采用这两句话,值得请作者澄清。本文图 4 使用明确的矩公式和独立任务设定,没有把这段有待澄清的文字当成画图依据。
6. 算法与训练配方:一定要连着附录读
6.1 算法 1:理想 PPM 的完整步骤
下面用伪代码说明信息流,具体奖励到 token 优势的映射保留为显式选项。这样可以避免把论文中抽象的优势函数误写成唯一确定的公式。
Algorithm 1. Ideal progressive point matching
Input: current policy, reference solutions, segment rule
1. Build reasoning points and dependency/obsoletion rules.
2. Sample responses on-policy without reference hints.
3. Split each response into K segments.
4. Set S = empty; m[0] = 0.
5. For each segment k:
a. Judge the cumulative prefix through segment k.
b. Update reached points and apply shortcut closure.
c. Set m[k] = credited points / reference point count.
d. Set r[k] = m[k] - m[k-1].
6. Map segment rewards to token advantages as specified.
7. Update on generated tokens only; do not train on prompt tokens.
8. Evaluate using final success, then repeat.
第 5 步表达的是理想集合语义。实际论文用语言模型抽取推理点、生成依赖关系、评估前缀,因此每一步都可能有误差。正文算法里的优势映射函数是抽象的,不能仅根据这个框架就推断所有实验使用完全相同的目标。
6.2 默认参数与两个重要例外
附录给出的默认训练是同步 on-policy:采样一步、训练一步。表 3 列出温度 1.0、裁剪阈值 0.20/0.28、学习率 、150 步、每题 16 条轨迹、每批 8 个问题,总 batch 为 128。论文报告使用 v5e-32 TPU pods,每次实验约 12–24 小时;这些是作者的实验条件。
真正影响理解的是下面四个选择。
- 默认会加入最终结果奖励。 对分段方法,每段进度奖励加上最终结果奖励后,再计算 GRPO 优势。这帮助模型学会在预算内正确输出答案,与纯粹的进度望远镜求和并非同一个目标。
- 只减组均值,不除标准差。 这保留奖励差异的绝对大小,避免极小的分数差被放大成单位尺度。
- 对被长度上限截断的轨迹屏蔽损失。 目的是减轻长度压力,但也意味着一部分已经生成的昂贵数据不参与更新。
- 按固定训练预算切四段。 回答提前结束时可能出现空段,空段进度奖励为零;不是把每条实际回答均匀切成四等份。
两个例外尤其不能漏掉:Polaris 的 RL 学习率是 ;POPE-hard 的 PPM 使用每批 16 个问题、系数 0.002 的 k3 KL 惩罚,而且只使用 PPM 奖励,不再把最终结果奖励加进去。因此,“所有实验都没有 KL”或者“所有实验都混合结果奖励”都不准确。
若用 表示某个实验中混合后的分段奖励,简单求和会得到:
它说明分段数本身会影响最终成功在原始奖励和中的相对权重。实际训练后面还有组中心化、token 加权和屏蔽,不能仅凭这个等式反推完整目标;但它足以提醒我们,四段并不是与优化无关的展示参数。
6.3 算法 2:一批数据应该怎样记账
Algorithm 2. Experimental reward accounting
1. Generate responses; retain actual termination/truncation status.
2. Score full prefixes at the configured chunk boundaries.
3. Difference adjacent scores to obtain progress increments.
4. Add final reward only if this experiment specifies it.
5. Apply the stated group-centering and advantage mapping.
6. Apply truncation and probability-mismatch masks.
7. Record retained samples, generated tokens and judge usage.
8. Compare methods using final-answer evaluation metrics.
这份伪代码是对论文配方的解释性整理,并不声称论文给出了每个分组细节或规定了完全相同的处理顺序。尤其要区分“当前片段的即时信用”和“从当前片段往后的 reward-to-go”:二者不能随意替换。附录的局部估计量说明了特定假设下的好处,不等于证明任何局部优势启发式都优化同一个完整任务目标。
7. 可控实验:先看跨度,再看复杂评分
7.1 两个极端结构
Multi-Countdown 要求连续解 个独立算术题,全部正确才算完整成功。作者用 Qwen3-1.7B,每轮 512 token。Matrix Manipulation 则要求按顺序操作矩阵,前一步错会影响后续状态,使用关闭 thinking 的 Qwen3-4B-Instruct-2507,同样每轮 512 token。这两个环境分别接近独立子任务和严格串行依赖。
论文图 4 在 Multi-Countdown 上标出的训练 token 加速比,随 分别为 1.8、3.5、8.7、19.7 倍。它比较的是达到指定训练成功率所需的 token,不是推理速度,更不是加上评审模型调用后整个系统的墙钟加速。Matrix Manipulation 同样改善,但随跨度变化的方式不同,这与理论中任务相关性的重要性相呼应。
这一步实验刻意使用容易核对的中间状态,是一个好的设计:先验证信用分配本身,再引入开放文本的评分误差。否则很难区分“任务越来越长导致奖励稀疏”和“文本越来越长导致 judge 更不可靠”。
7.2 GSM-Infinite 的结果要横着读
GSM-Infinite 从关系图生成数学问题。作者固定复杂度为 ,每档 5,000 题,其中 40% 的边与问题相关,其余为干扰;使用 Qwen3-1.7B、关闭 thinking、4K 训练预算。参考图被转为文字推理点,再用 Gemini 判断各前缀的进度。

| 方法 | |||
|---|---|---|---|
| 基座模型 | 13.4% | 5.6% | 5.6% |
| 最终结果奖励 | 68.4% | 8.4% | 9.1% |
| Verifree | 82.8% | 12.6% | 9.8% |
| OPSD | 28.3% | 10.2% | 7.8% |
| 过程奖励 | 32.9% | 7.5% | 8.0% |
| 整轨迹 PPM | 75.8% | 33.4% | 8.9% |
| 分段 PPM | 65.2% | 41.5% | 19.1% |
在最难的 ,分段 PPM 比结果奖励高 10 个百分点,成功率约为其 2.10 倍;相比整轨迹 PPM 的 8.9%,也不只是小幅改善。但在 ,Verifree 最好,分段 PPM 甚至低于结果奖励。合理结论是:这组实验里,随着跨度加大,局部信用的价值越来越突出,而不是每个任务都应该无条件换成 PPM。
过程奖励基线也不是只替换一个评分词。它同时改变了评分目标、取消捷径,并对孤立段评分,而 PPM 评分完整前缀后取差。因此过程基线较差,支持的是两套配方的差异,不能精确归因于其中某一项。若想知道哪个因素真正起作用,需要进一步做因素拆分实验。
8. 消融实验揭示了配方的敏感性
论文表 4 固定 GSM-Infinite 的 、400M 训练 token。完整 PPM 达到 19.1%;去掉最终结果奖励变成 6.3%;恢复标准差归一化变成 7.1%;按实际回答长度切段为 14.8%;去掉长度过滤为 17.1%。相同表中的纯结果奖励是 9.1%。

最值得停下来想的是第一项。理论说理想进度奖励与结果奖励可以有相同的最优策略,实验却显示,在这一有限预算场景里,把结果奖励加回来非常重要。这两句话不矛盾:理想全局最优与现实训练速度并不是同一个问题,实际 judge 也不是精确的状态函数。与此同时,POPE-hard 又明确只用 PPM 获得改善,说明奖励混合的价值取决于完整成功是否已经能够出现。
标准差归一化的结果提供了另一个线索。若一组回答的进度分几乎一样,除以极小标准差会把很小的差异变成很大的相对优势。这个差异可能是真信号,也可能是 judge 噪声。只减均值则保留其绝对大小。这是对结果的合理解释,但论文没有通过控制 judge 噪声来单独证明该机制,应该保留为解释而非事实定论。
切段方式也会引入长度激励。预算 4,096 token、四段时,固定边界每隔 1,024 token 出现;一条 2,400-token 的回答有两个完整段、一个不完整段和一个空段。若按实际回答长度四等分,每段则为 600 token。后者让同一组里“第几段”对应不同的绝对计算量,给 token 分配优势时可能产生额外长度压力。
屏蔽截断轨迹同样有双面性:它减少在上限前赶快猜答案的压力,却可能把最困难、最长、也最昂贵的一批轨迹排除掉。比较训练效率时,除了生成了多少 token,还应记录有多少真正进入梯度更新、它们来自哪些难度的题。否则“同样训练 token”并不等于“同样有效训练数据”。
9. 真实数学:外推有收益,但不要把胜负抹平
9.1 Polaris:并不是每列都赢
这组实验用 Qwen3-4B,在 8K 预算训练、16K 预算评估。数据准备从 3,903 道题开始,过滤难以可靠验证的题后剩 3,509,再生成可用参考解、推理点和图,最终保留 2,287。它是经过质量与可验证性筛选的数据,不能被描述成对整个原始题库不加选择的结果。

| 评估项 | 基座 | GRPO | PPM |
|---|---|---|---|
| Polaris test pass@1 | 41.6% | 44.1% | 45.9% |
| Polaris test pass@8 | 74.5% | 80.6% | 80.7% |
| AIME25 pass@1 | 51.0% | 56.0% | 53.5% |
| AIME25 pass@8 | 74.0% | 72.7% | 74.8% |
| HMMT25 pass@1 | 34.6% | 35.4% | 37.9% |
| HMMT25 pass@8 | 56.9% | 55.6% | 59.8% |
PPM 在 Polaris test 的 pass@1 比 GRPO 高 1.8 个百分点,但 pass@8 只高 0.1 个百分点,没有误差区间时不宜把后一项写成明显胜利。AIME25 的 pass@1 则比 GRPO 低 2.5 个百分点。完整表格里,Verifree 的 Polaris test pass@1 为 46.1%,过程奖励的 pass@8 为 83.2%,也分别超过 PPM。PPM 在 HMMT25 的表现更强。
SFT 的行为很不同:训练集 pass@8 达 60.9%,Polaris test pass@8 为 65.1%,AIME25 pass@1 只有 9.8%。但这个基线使用 non-thinking 模式直接学习参考解,不能由此断言所有监督预热或高质量教师轨迹训练都会失败。论文比较的是特定配方,结论应保留这个粒度。
9.2 POPE-hard:从几乎没有信号到可以训练
这组数据更贴近论文动机。作者从 2,515 题中筛出在 8K、16 次无提示采样下零观测成功的 601 题,再保留其中在十段参考前缀帮助下能观察到成功的 382 题,即 0p10p。论文所谓 POPE-hard 都指这个最后子集。它同时满足“直接很难”和“可以被参考信息帮助”,这个选择条件很重要。
4K 训练、16K 测试时,GRPO 与基座一样,pass@1 为 0.4%、pass@8 为 2.3%;POPE 达到 1.2% 和 6.3%;PPM 达到 3.5% 和 14.8%。后一个指标比 POPE 高 8.5 个百分点,约为其 2.35 倍。相对增幅明显,但绝对成功率仍低,大部分尝试依然失败。

8K 训练的 PPM 在 16K 测试时,pass@1 为 3.9%,pass@8 为 12.5%。作者推测,中等训练预算让模型试图在有限长度内赶快完成,造成提早猜答案和输出长度下降;更短预算下几乎没有完成机会,反而能集中学习有用的中间进展。这是实验支持的解释方向,还不是被唯一识别的因果机制。
捷径消融同样需要逐列阅读:4K 训练时,去掉捷径让 test pass@8 从 14.8% 降到 9.3%;8K 时从 12.5% 降到 11.7%,但 pass@1 反而是无捷径的 4.1% 高于完整 PPM 的 3.9%。强制按参考点原顺序出现更差。整体上,允许灵活路线有价值,但不是每个指标都给出无条件一致的排序。
9.3 pass@k 为什么不能从平均 pass@1 直接换算
单个问题若每次独立成功概率为 ,至少一次成功的概率是 。实际评估为每题采样 次,观察到 次成功,论文使用:
分母是从全部样本挑 个的方式数,分子是全部挑到失败样本的方式数,两者相除再用一减去,就得到至少含一个成功的估计。最后应对每个问题的结果取平均。由于不同问题的 不同,而且函数非线性,不能把全数据平均 pass@1 塞进去,直接推导平均 pass@8。
因此,4K 与 8K 的排名变化可能来自覆盖了更多问题,也可能来自采样多样性变化,或者两者都有。仅靠两个汇总数无法区分。还要记住:pass@8 假设有办法识别这八个答案里哪个成功,它本身不等于系统能向用户稳定交付一个正确答案。
10. 评审模型与成本:多出来的信号从哪里来
10.1 分数合理,不代表已经校准
论文用 gemini-2.5-flash-lite 进行进度与过程评分,用 Gemini 3 Flash 系列生成推理点和图。作者逐渐增加给定参考前缀的长度,检查后续成功和 PPM 分数是否同步提高。正文报告 PPM 提示的 Kendall 排序相关为 0.856,普通 rubric 提示为 0.768;附录探针包含八个问题、五档参考前缀、每档八次续写,并比较多个评审模型。
这说明评分对受控的帮助信息有合理响应,但排序相关不等于成功概率校准。给更多正确参考内容,会同时提高评审分和续写成功率;这不保证模型自己产生的错误、矛盾前缀上也存在同样关系。对剩余步骤难度差异很大的问题,“多到达一个点”也不应必然意味着成功概率线性增加。因此线性趋势适合作为实用校准目标,而不是一般性定理。
附录表 5 和表 6 分别描述推理点与推理图评估,但 v1 展示的数值完全相同,值得确认是有意结果还是表格重复。推理点实验也只使用 32 个留出问题。即使召回率高,也没有直接回答错误点、无关依赖、替代正确解法被漏记等问题。
10.2 四次完整前缀评分不是免费操作
设一条回答有 token,问题、评分说明与 rubric 等重复开销为 。均匀取 个完整前缀评分,judge 输入 token 约为:
四段时就是 ,尚未包括 judge 输出、重试和缓存效果。举一个成本记账例子:、 时,输入总计 14,240 token。它们主要是 prefill,与策略逐 token 解码、反向传播的成本当然不同,不能把 token 数直接当成相同的美元或时间。
作者指出推理点和图只需预先生成一次,评分主要是 prefill,这有利于摊销。但判断总体效率,仍应写出完整账本:
如果结果奖励训练增加一倍 rollout 就能获得相似收益,和引入外部 judge 谁更便宜,需要真实预算比较。缓存参考信息、共享前缀、批量评审和更小的 judge 都可能改善 PPM,但不能在没有测量时把可能性写成已经实现的收益。
10.3 推理点拆得细不细,本身会改变激励
把每个细小步骤都设成点,信号密集,但容易接近逐步模仿参考;只保留最终答案,则退化成结果奖励。合理的点应当足够有意义,可以支撑后续推理,同时又允许多种到达方式。
即使统一除以点数,也无法消除拆分带来的偏好。同一个参考解,如果把十个简单代数变形分别记点、关键洞见只记一点,和把准备工作合成一点、关键洞见单列一点,会形成不同的奖励地形。下一步值得比较同一道题的多种参考分解,而不只是比较 judge 模型大小。
11. 设计选择、替代方案与预算区间
| 设计 | 为什么这样做 | 替代方案与失效边界 |
|---|---|---|
| 匹配推理点 | 容许措辞与路线变化 | 若目标就是模仿专家行为,直接蒸馏可能更简单 |
| 捷径补分 | 不惩罚更短的正确解法 | 依赖关系过宽会给无依据结论额外信用 |
| 完整前缀评分 | 保留变量定义和上下文 | 步骤可独立验证时,局部评分更便宜 |
| 固定预算四段 | 平衡局部信用与评分调用数 | 太粗失去定位,太细增加成本和噪声 |
| 只减组均值 | 保留奖励差异绝对尺度 | 标准化有尺度优势,也会放大小差异 |
| 屏蔽截断轨迹 | 减少赶在上限前完成的压力 | 最困难的有用轨迹也可能被一起丢弃 |
作者把训练长度概括为三个区间:非常短时,任务基本不可能完成,只能学习部分进展;中间长度可能诱发急于完成和猜答案;足够长时,完整成功更可行,目标才能真正落在任务完成上。这是一个值得研究的假说,不是一张已经测出统一分界线的相图。

一批题的难度不一致时,同一个 token 上限可能同时把不同题放在三个区间里。我的后续实验会先按可观测成功率与部分进度分层,再比较不同长度策略。这样才能区分“短预算减轻了长度压力”“相同资源下做了更多更新”和“过滤后留下了另一批轨迹”三种解释。
这里也可以用一个操作性问题帮助选方法:当前失败主要是没有任何有用探索,还是已经走到了不少中间状态却无法完成?前者可能更需要参考前缀引导或数据设计;后者更适合尝试 PPM 的奖励端监督。二者并非互斥,但在实验里应分别报告,避免把更强的参考信息供给误当成单一奖励公式的贡献。
12. 局限:这篇论文尚未证明什么
规模与任务类型有限。 实验主要围绕 1.7B、4B 模型、合成任务和筛选数学题。论文用持续数小时乃至数天的任务作为动机,并不意味着已经完成多日软件 agent、不可逆工具操作或复杂外部环境的验证。
仍依赖参考解。 学习者自己不会解的题,需要另一方提供有用解答与进度标记。生成和筛选过程可能排除最难或最模糊的题。这是利用特权信息的一种有价值方式,不是从完全未知、没有任何进度来源的问题中无条件自学。
状态抽象与真实上下文存在差别。 理想状态累积正确点,实际文本却会增加矛盾和干扰。一个引理虽然还在上下文里,模型未必还能有效调用它;外部 agent 状态甚至会真正被后续操作破坏。
统计证据分辨率有限。 主表没有为所有差值提供重复种子和不确定区间。80.7% 对 80.6% 不能支持强烈的优越性判断。对于低成功率数据,采样次数、逐题分布和样本筛选尤其影响解释。
预算外推不等于分布泛化。 在更长测试预算下解决更多题,是一个清楚的能力维度;是否能泛化到未见题型,是另一个维度。POPE-hard 的 382 题还特别筛选了“可被参考前缀帮助”的样本,结论应保留这个条件。
效果依赖具体配方。 GSM-Infinite 中结果奖励非常关键,POPE-hard 却不混合它;长度过滤、切段和归一化也各有影响。理解论文需要同时记住目标函数和这些训练条件。
13. 批判性分析:下一步最需要补上的证据
13.1 理想图与图生成提示之间有一道缝
最重要的文本差异出现在捷径定义。正文第 4 节说,达到目标会使所有参考点得到信用;附录 D 的图生成提示却要求,不要让最终答案直接使具体推导、构造、分类讨论或不可能性论证全部失去必要性。同时,它给出的例子又允许从结论沿局部规则向前传递补分。这意味着,生成的某个图究竟能否让任意正确替代解获得满分,不能仅凭提示词假定。
这不等于断言实验有错。它意味着定理中的前提需要通过独立的行为测量来确认。一个简单而有信息量的测试,是给同一道题准备多种已验证的正确解法,包括明显更短、完全绕开参考引理的解法,检查终止进度是否都达到满分。最终是否成功,应由独立的结果标准判断,不能用“与参考重合很多”代替。
同时还要加入只猜答案、无依据断言中间结果的负例。捷径太保守,会重新奖励模仿;捷径太宽松,又会给无根据的陈述满分。PPM 最独特也最值得研究的部分,正是这两种错误之间怎样取舍。
13.2 把方差改善与目标变化区分开
PPM 给不同失败轨迹不同价值,这本身就改变了暂时性的优化偏好。模型收益可能来自更低方差、更好的探索方向、参考解隐含的课程,以及更合适的训练长度。附录的信噪比模型隔离了其中一部分机制,不能自动解释全部神经网络实验收益。
更有判别力的实验应在相同 judge 调用、相同奖励尺度下,比较即时片段信用、reward-to-go、整轨迹 PPM,以及另一种保留终止条件的塑形方案。最终都用真实任务成功率评估。这样才有机会区分“拿到了更多部分信息”和“选择了某种优势估计器”各自贡献多少。
13.3 在模型可能钻空子的地方测 judge
参考前缀插值是很好的起点,但有效参考本身比模型最糟糕的输出整洁得多。更接近训练风险的样本包括:同一前缀里出现相互矛盾的值、反复搬运已得引理、错误推导碰巧得到正确中间数、不同符号下的正确证明,以及先对后错的改写。
只测“正确点有没有被找到”不够,还要测“错误信用被发放了多少”。优化过程可能不断放大最能骗过评分器的情况。对单调进度也要问清楚:如果后文否定了前面的结论,旧点是否仍然有效?数学知识可以保留后回溯,但 agent 写坏文件、消耗资源之后,外部状态真的会倒退。在扩展到 agent 前,需要区分“历史上做过”与“当前仍然成立”。
13.4 用完整预算来比较替代方案
训练团队实际面对的是:相同资源应该多采样、买更好参考解、训练一个 critic,还是多做 PPM 评分?只有策略生成 token 的横轴,无法把这些选择放在同一张成本曲线上。
我会要求报告参考生成的一次性成本、复用次数、judge 输入输出 token、缓存设定、保留的训练轨迹比例,以及真实时延。PPM 仍可能明显获胜;完整记账只是让工程结论有一个可比较的基础,而不是把样本效率自动等同于总成本优势。
13.5 算法 3:一项更有针对性的后续研究
Algorithm 3. Proposed follow-up study; not performed here
1. Freeze separate training, development and unseen test sets.
2. Build multiple valid reference decompositions per problem.
3. Measure goal closure and false-credit rates on held-out traces.
4. Compare reward assignments under the same total cost budget.
5. Sweep training length, chunk count and judge model separately.
6. Evaluate several test budgets with final pass@1 and pass@k.
7. Report repeated seeds and prompt-level uncertainty intervals.
8. Group failures by dependency structure and reference mismatch.
这项研究试图回答的是:模型逐渐偏离参考路线之后,简洁的进度度量是否仍能可靠地指导探索?相较于再增加一个总分,它更能检验 PPM 的核心承诺。
14. 结论
PPM 提供了一种清楚的思路:用参考解构造中间里程碑,把失败轨迹中的有效进展变成 on-policy 训练信号,再通过分段信用与捷径补分减少粗糙奖励的副作用。可控跨度实验和近零成功率数学实验,说明这条路线值得继续研究。
我会保留的主要判断是:它让“还没做完”变得有信息,而不必要求模型逐字照着参考解走。但理想最优性依赖条件,实际 judge 和图只是近似;真实 benchmark 的胜负并不一致,外部评分成本也不能忽略。最终成功率、替代正确路线的待遇、以及完整资源成本,仍应是评价它的三个核心坐标。
参考资料与图表来源
- Fu、Frans、Rybkin、Levine、Kumar,PPM 论文 v1,2026。本文实验数字、算法框架、命题与附录细节均以该版本为依据。
- 作者介绍与官方资源入口。代码链接用于后续查找资源。
- Qu 等,POPE。用于后续理解参考前缀引导;本文涉及 POPE 的比较数字来自 PPM 表 7。
- Cheng 等,IsoCompute Playbook。用于后续研究采样预算分配。
图 1–3、9 为原绘解释图;图 4 为明确假设下的玩具模型矩计算;图 5–8 依次重绘 PPM 表 1、4、2、7 的部分数值。文中的百分点差和比值是对原表的算术计算,不代表另行训练或复现得到的结果。