
发布日期:2026-10-06 | 分类:AI / AI研究 | 来源:arXiv 2609.40285、NVIDIA Research
一句话
On-Policy Distillation(OPD)失败的根本原因不是「学生不会」,而是「学生从不采样到关键纠错轨迹」。NVIDIA 这篇论文给出了一个工程上极其实用的解法。
问题:多轮 Agent 的「致命第一错」
在 ALFWorld、WebShop、Search-based QA 三类任务上对 Qwen3 系列(8B–235B)做实验,作者发现一个反直觉的现象:
超过一半的失败轨迹里,只有一个关键错误决策(pivotal mistake),通常出现在前几轮。一旦这个错误发生,后续状态被「污染」,模型在错误的轨迹上反复采样,再也回不来。
这解释了为什么传统的「在正确答案上做监督学习」总是事倍功半——学生从来没走到正确答案那条路径上,监督信号对它来说是「看不见的」。
解法:预防 + 恢复双蒸馏
PivotOPD 的核心是两类监督信号的组合:
- 预防蒸馏(Preventive):在关键错误步,用「老师模型」的正确答案做反向 KL 监督,让学生在那个状态学会不犯错。
- 恢复蒸馏(Recovery):从「关键错误后」的状态出发,让老师在接下来的 K 步给出纠错轨迹,用正向 KL 把这些「学生本来采不到的行为」蒸馏进来。
关键洞察是两种 KL 方向的差异化使用:
- 关键错误步用
reverse KL(保守、贴近学生原本分布) - 恢复轨迹用
forward KL(强制学生学到它原本不会采样的高奖励行为)
数据:真的有效
在 Qwen3-1.7B 学生模型上的结果:
- ALFWorld 任务成功率:73.7%
- 关键错误恢复率:基础模型 8.3% → 标准 OPD 20.3% → 仅预防 45.8% → PivotOPD 72.7%
- 恢复所需轮次:基线 13.4 轮 → PivotOPD 9.7 轮(最优 6.2 轮)
- 72 个标注的关键错误里,PivotOPD 改善了 60 个,没有一个变得更差
我的看法
这是一篇「工程直觉压过论文花活」的工作。它没有发明新架构,没有刷榜单,只是把「学生采样不到 → 老师也补不上」这个 Agent 训练的老大难问题拆得很干净。
回到那个被反复引用的论点:智能体瓶颈从来不是「不会想」,而是「不敢拍板」。PivotOPD 给了「拍板后还能翻盘」的能力,这是 Agent 从 Demo 走向生产的关键拼图。
本文为逍遥云初 AI 科技前沿快讯 · 2026-10-06 · 第①篇






