📄 论文信息
STRIDE: Learnable Stepwise Language Feedback for LLM Reasoning 作者:Junjie Zhang, Guozheng Ma, Shunyu Liu, Zetian Hu, Yongcheng Jing, Ting-En Lin, Yongbin Li, Dacheng Tao 机构:南洋理工大学 Generative AI Lab + 阿里巴巴通义实验室 提交日期:2026 年 5 月 13 日 arXiv: https://arxiv.org/abs/2605.18851
🎯 核心问题:为什么 LLM 推理训练需要「语言反馈」?
当前 LLM 推理能力的提升主要依赖强化学习(RLVR),通过可验证的奖励信号训练模型。但这种方法存在一个根本缺陷:它只告诉模型「最终答案对不对」,却不告诉它「哪一步出了错、为什么错」。这就是所谓的信用分配(Credit Assignment)难题。
为了解决这个问题,研究者们提出了过程奖励模型(PRM),给每个推理步骤打一个标量分数。但 STRIDE 论文指出了一个被忽视的深层问题——标量奖励存在「信息瓶颈」:将高维度的推理过程压缩成一个数值,必然导致信息丢失。两个逻辑上完全不同的错误可能得到相同的分数,模型根本无法区分「错在哪里」和「为什么错」。
现有的语言反馈方法(如 critique-based RL)虽然提供了更丰富的文本反馈,但依赖冻结的外部评判器,无法随着策略的进化而持续改进。TANGO 虽然实现了生成式验证器的联合训练,却最终把语言输出又转回了标量奖励——重新引入了信息瓶颈。
📊 关键数据与实验结果
STRIDE 在多个推理基准测试上显著超越了 SOTA 基线。最引人注目的发现是:在零通过率问题(zero-pass-rate problems)上,标量方法完全无法产生学习信号(advantage 为零),而 STRIDE 通过语言反馈仍能驱动模型学习。Phase III(引导轨迹重定向)仅占总训练时间的 1/13,却带来了决定性的能力突破——让模型从「完全不会」进步到「可以解决」。
论文通过 Rate-Distortion 理论分析证明,标量奖励在信息带宽上存在根本性限制。实验中,两个语义上完全不同的推理错误在标量空间中坍缩为同一个值,而语言反馈恢复了缺失的语义维度。
🏗️ 技术架构:三阶段交错训练
- Phase I — 基础策略优化(占比 9/13):使用 GRPO + 结果奖励训练生成器,建立基础推理能力
- Phase II — 生成式验证器优化(占比 3/13):用 RLVR 训练验证器,使其能将终端奖励分解为逐步语言验证
- Phase III — 引导轨迹重定向(占比 1/13):验证器定位首个失败点(FPF),生成器从验证过的前缀步骤重新探索推理路径
- 多点重定向策略:不从头重来,而是从多个验证锚点出发,大幅压缩搜索空间
- 仅依赖结果奖励:学习信号严格绑定最终正确性,屏蔽不可靠的逐步标量信号带来的有害梯度噪声
🔑 关键洞察
💭 引发思考
STRIDE 提出了一个根本性的问题:我们是否一直在用错误的方式训练 LLM 推理?标量奖励就像给学生只打分不批改——分数告诉你考了多少,但不告诉你哪里错了、怎么改。语言反馈则是真正的「批改」,它保留了推理过程中的语义信息,让模型能够理解错误的本质。
更深层的启示是:LLM 推理能力的突破可能不在于更大的模型或更多的数据,而在于更聪明的训练信号。STRIDE 的轨迹重定向机制本质上是在做「有指导的探索」——不是盲目采样,而是从已知的失败点出发,用语言反馈引导模型走向正确的方向。这与人类学习的方式惊人地相似:我们从错误中学习,不是通过重复犯同样的错,而是通过理解错误的原因并尝试不同的路径。
📎 相关阅读
- TANGO (Zha et al., 2025) — 生成式验证器联合训练的前身工作
- DeepSeek-R1 (Guo et al., 2025) — RLVR 在推理模型中的里程碑式应用
- STaR / Quiet-STaR (Zelikman et al.) — 自教式推理的经典框架
- Let's Verify Step by Step (Lightman et al., 2023) — 过程奖励模型的奠基之作
逍遥云初 | 2026.05.21






