大模型到底能不能「举一反三」?这个问题困扰了AI研究者很久。新加坡国立大学等机构近日发表在arXiv上的论文(arXiv:2604.15306),用最短路径规划任务对LLM的系统性泛化能力来了一次「终局审判」。结论并不乐观。
实验设计:一个干净的可控环境
研究团队构建了一个基于最短路径规划的合成环境——这是一个典型的可组合序列化优化问题(SOP)。模型需要在给定的地图上,找出从起点到终点的最短路径。实验设置了两个正交的泛化轴:
- 空间迁移(spatial transfer):在全新、未见过的地图上测试——考验模型能否将学会的路径规划规则迁移到新环境
- 长度扩展(length scaling):在同一张地图上增加步数——考验模型能否处理更长推理链的问题
这个设计的聪明之处在于:它把「训练数据」「训练范式」「推理时策略」这三个因素干净地隔离开,可以独立测试每一个对泛化的影响。
核心发现:空间迁移强,长度扩展必败
- 空间迁移表现优异:模型能在未见过的地图上正确规划路径,说明它确实学到了可迁移的结构性规则
- 长度扩展稳定失效:当路径变长时,模型表现急剧下降,且失败模式呈现「递归不稳定」特征——步数越多,错误累积越严重
这意味着当前的大模型在处理需要「多步推理」的复杂问题时存在结构性缺陷——它可能学会了每个单独步骤的规律,但无法将它们正确串联成长序列。
三个因素的独立影响
- 训练数据决定能力上限:把训练预算花在更多样的问题上,比堆同类解法更有效;选择覆盖更广原语的问题,比增加原语组合更重要
- 强化学习稳定但不提升:RL能稳定训练,但无法突破SFT设定的性能天花板,且两者错误模式高度相似
- 推理时Scaling无法拯救长度失败:更强的推理策略只能改善空间迁移表现,无法修复长度扩展的根本性失败
观点:递归不稳定才是大模型的阿喀琉斯之踵
这项研究最值得深思的不是「大模型不能泛化」这个结论,而是精准定位了泛化失败的根源:递归不稳定。
在需要多步规划的任务中(自动驾驶、医疗诊断、复杂对话系统),每一步的输出都会成为下一步的输入。一旦某一步出错,后续所有步骤都会在错误基础上叠加错误。模型越大、推理链越长,这个问题越严重。
这也解释了为什么当前火热的Agent系统经常在长程任务中「迷失」——不是单个工具调用失败,而是整个推理链条的累积误差击穿了系统。在推动Agent「规划更长任务」之前,先解决递归不稳定的根本问题。
论文:arXiv:2604.15306,NUS / CFM / Google Research,2026年4月16日。






