📄 论文信息

STRIDE: Learnable Stepwise Language Feedback for LLM Reasoning 作者:Junjie Zhang, Guozheng Ma, Shunyu Liu, Zetian Hu, Yongcheng Jing, Ting-En Lin, Yongbin Li, Dacheng Tao 机构:南洋理工大学 Generative AI Lab + 阿里巴巴通义实验室 提交日期:2026 年 5 月 13 日 arXiv: https://arxiv.org/abs/2605.18851

🎯 核心问题:为什么 LLM 推理训练需要「语言反馈」?

当前 LLM 推理能力的提升主要依赖强化学习(RLVR),通过可验证的奖励信号训练模型。但这种方法存在一个根本缺陷:它只告诉模型「最终答案对不对」,却不告诉它「哪一步出了错、为什么错」。这就是所谓的信用分配(Credit Assignment)难题。

为了解决这个问题,研究者们提出了过程奖励模型(PRM),给每个推理步骤打一个标量分数。但 STRIDE 论文指出了一个被忽视的深层问题——标量奖励存在「信息瓶颈」:将高维度的推理过程压缩成一个数值,必然导致信息丢失。两个逻辑上完全不同的错误可能得到相同的分数,模型根本无法区分「错在哪里」和「为什么错」。

现有的语言反馈方法(如 critique-based RL)虽然提供了更丰富的文本反馈,但依赖冻结的外部评判器,无法随着策略的进化而持续改进。TANGO 虽然实现了生成式验证器的联合训练,却最终把语言输出又转回了标量奖励——重新引入了信息瓶颈。

📊 关键数据与实验结果

STRIDE 在多个推理基准测试上显著超越了 SOTA 基线。最引人注目的发现是:在零通过率问题(zero-pass-rate problems)上,标量方法完全无法产生学习信号(advantage 为零),而 STRIDE 通过语言反馈仍能驱动模型学习。Phase III(引导轨迹重定向)仅占总训练时间的 1/13,却带来了决定性的能力突破——让模型从「完全不会」进步到「可以解决」。

论文通过 Rate-Distortion 理论分析证明,标量奖励在信息带宽上存在根本性限制。实验中,两个语义上完全不同的推理错误在标量空间中坍缩为同一个值,而语言反馈恢复了缺失的语义维度。

🏗️ 技术架构:三阶段交错训练

  • Phase I — 基础策略优化(占比 9/13):使用 GRPO + 结果奖励训练生成器,建立基础推理能力
  • Phase II — 生成式验证器优化(占比 3/13):用 RLVR 训练验证器,使其能将终端奖励分解为逐步语言验证
  • Phase III — 引导轨迹重定向(占比 1/13):验证器定位首个失败点(FPF),生成器从验证过的前缀步骤重新探索推理路径
  • 多点重定向策略:不从头重来,而是从多个验证锚点出发,大幅压缩搜索空间
  • 仅依赖结果奖励:学习信号严格绑定最终正确性,屏蔽不可靠的逐步标量信号带来的有害梯度噪声

🔑 关键洞察

信息瓶颈是标量奖励的结构性缺陷。论文用 Rate-Distortion 理论正式证明:将高维推理过程压缩为标量,信息带宽存在理论上界。这意味着无论 PRM 怎么优化打分精度,在信息论层面上它都无法提供足够的语义带宽来区分和纠正不同类型的推理错误。语言反馈突破了这个瓶颈。
验证器可以和生成器一起「长大」。STRIDE 的核心创新是让验证器和生成器通过 RL 联合训练,只用结果奖励就能学会逐步的语言验证。随着生成器变强,验证器也在进化,形成正向循环。这解决了冻结外部评判器无法持续改进的问题。
失败样本不是废品,是学习金矿。传统方法把失败的推理路径当负样本丢弃。STRIDE 的轨迹重定向机制从失败中学习——定位首个错误点,从正确的前缀重新出发。这让模型在零通过率问题上也能产生学习信号,突破了标量方法的天花板。
Phase III 的「四两拨千斤」效应。仅占总训练 1/13 时间的 Phase III,却带来了最关键的能力跃迁。它不改变模型的基础推理能力,而是在推理卡住时提供「拐杖」——用语言反馈引导模型在中间步骤做出不同决策。这暗示:训练时的少量引导信号可能比大量无差别采样更高效。

💭 引发思考

STRIDE 提出了一个根本性的问题:我们是否一直在用错误的方式训练 LLM 推理?标量奖励就像给学生只打分不批改——分数告诉你考了多少,但不告诉你哪里错了、怎么改。语言反馈则是真正的「批改」,它保留了推理过程中的语义信息,让模型能够理解错误的本质。

更深层的启示是:LLM 推理能力的突破可能不在于更大的模型或更多的数据,而在于更聪明的训练信号。STRIDE 的轨迹重定向机制本质上是在做「有指导的探索」——不是盲目采样,而是从已知的失败点出发,用语言反馈引导模型走向正确的方向。这与人类学习的方式惊人地相似:我们从错误中学习,不是通过重复犯同样的错,而是通过理解错误的原因并尝试不同的路径。

📎 相关阅读

  • TANGO (Zha et al., 2025) — 生成式验证器联合训练的前身工作
  • DeepSeek-R1 (Guo et al., 2025) — RLVR 在推理模型中的里程碑式应用
  • STaR / Quiet-STaR (Zelikman et al.) — 自教式推理的经典框架
  • Let's Verify Step by Step (Lightman et al., 2023) — 过程奖励模型的奠基之作

逍遥云初 | 2026.05.21