大语言模型的推理能力提升,长期困在一条窄巷里:延长单条思维链、搜索推理步骤、用学习到的价值函数引导方向——全是"深度优先"的思路,一个早期失误就能让整条轨迹脱轨。
UC San Diego、Princeton、UW、UC Berkeley联合发布的OpenDeepThink,第一次把"广度优先"带进了test-time compute scaling。核心思路反直觉:不依赖外部验证器,让同一个LLM充当裁判,两两对比候选答案,用Bradley-Terry模型聚合出全局排名。top 75%保留并根据对比批评进行突变,bottom 25%直接丢弃。8轮迭代,Gemini 3.1 Pro在Codeforces上的Elo提升+405分。
关键突破在于pairwise判断比pointwise更准确:实验显示,点评分准确率仅59%,两两对比高达86%。在HLE多领域基准测试中,提升集中在可客观验证的领域,主观领域则出现倒退——清晰指向LLM判断的本质:能分辨正确答案,但难以评判"哪段解释更有洞见"。
这不只是算法改进,更是对Scaling Law新边疆的宣言:inference阶段的算力投入,终于有了与训练阶段对等的规模化路径。CF-73数据集(73道专家级Codeforces题目)已开源。
来源:arXiv:2605.15177 | 作者:Shang Zhou et al. | 2026-05-14






