图:智能体在多轮任务中识别并恢复关键错误
图:智能体在多轮任务中识别并恢复关键错误

发布日期:2026-10-06 | 分类:AI / AI研究 | 来源:arXiv 2609.40285、NVIDIA Research


一句话

On-Policy Distillation(OPD)失败的根本原因不是「学生不会」,而是「学生从不采样到关键纠错轨迹」。NVIDIA 这篇论文给出了一个工程上极其实用的解法。

问题:多轮 Agent 的「致命第一错」

在 ALFWorld、WebShop、Search-based QA 三类任务上对 Qwen3 系列(8B–235B)做实验,作者发现一个反直觉的现象:

超过一半的失败轨迹里,只有一个关键错误决策(pivotal mistake),通常出现在前几轮。一旦这个错误发生,后续状态被「污染」,模型在错误的轨迹上反复采样,再也回不来。

这解释了为什么传统的「在正确答案上做监督学习」总是事倍功半——学生从来没走到正确答案那条路径上,监督信号对它来说是「看不见的」。

解法:预防 + 恢复双蒸馏

PivotOPD 的核心是两类监督信号的组合:

  1. 预防蒸馏(Preventive):在关键错误步,用「老师模型」的正确答案做反向 KL 监督,让学生在那个状态学会不犯错。
  2. 恢复蒸馏(Recovery):从「关键错误后」的状态出发,让老师在接下来的 K 步给出纠错轨迹,用正向 KL 把这些「学生本来采不到的行为」蒸馏进来。

关键洞察是两种 KL 方向的差异化使用:

  • 关键错误步用 reverse KL(保守、贴近学生原本分布)
  • 恢复轨迹用 forward KL(强制学生学到它原本不会采样的高奖励行为)

数据:真的有效

在 Qwen3-1.7B 学生模型上的结果:

  • ALFWorld 任务成功率:73.7%
  • 关键错误恢复率:基础模型 8.3% → 标准 OPD 20.3% → 仅预防 45.8% → PivotOPD 72.7%
  • 恢复所需轮次:基线 13.4 轮 → PivotOPD 9.7 轮(最优 6.2 轮)
  • 72 个标注的关键错误里,PivotOPD 改善了 60 个,没有一个变得更差

我的看法

这是一篇「工程直觉压过论文花活」的工作。它没有发明新架构,没有刷榜单,只是把「学生采样不到 → 老师也补不上」这个 Agent 训练的老大难问题拆得很干净。

对做 Agent 产品的团队来说,这是 2026 年最值得抄作业的一篇训练方法论文——不需要 100k H100,复现门槛极低,回报立竿见影。

回到那个被反复引用的论点:智能体瓶颈从来不是「不会想」,而是「不敢拍板」。PivotOPD 给了「拍板后还能翻盘」的能力,这是 Agent 从 Demo 走向生产的关键拼图。


本文为逍遥云初 AI 科技前沿快讯 · 2026-10-06 · 第①篇