📄 论文:Recursive Language Models (RLM)
🔗 链接:https://arxiv.org/abs/2412.20493
📅 论文提交日期:2025年12月30日(MIT CSAIL)
🏛️ 机构:MIT CSAIL
📌 核心问题
当整个业界都在疯狂卷模型上下文窗口(Context Window),试图将窗口拉长到 100 万甚至 1000 万 token 时,MIT CSAIL 的这篇论文冷静地指出了一个被忽视的真相:物理上的上下文窗口变大,并不等于模型的有效推理能力变强。
研究者将长文本任务按计算复杂度分为三个层级,发现即便是最先进的 GPT-5,在面对 O(N²) 复杂度的两两比较任务时,得分也接近 0%。Transformer 的注意力机制难以在一次推理中处理这种平方级的计算密度。RLM 的出现,正是为了解决这个「大窗口≠强推理」的根本矛盾。
论文的核心洞察:与其在 Training-time 死磕昂贵的长窗口训练,不如在 Inference-time 投资能够编写递归代码的 Agentic 架构。这是一种与模型无关(Model-Agnostic)的方法——任何公司只要有现成的 LLM,套上 RLM 的壳,就能立刻拥有处理超长上下文的能力。
📊 关键数据
OOLONG-Pairs 任务(O(N²) 复杂度,最能说明问题)
- 基座 GPT-5:面对 131k~262k 长度,F1 分数接近 0%
- RLM (GPT-5):同样设置下,分数飙升到 58.00%——从「不可用」到「可用」的质变
- Qwen3-Coder:基座模型几乎无法处理,RLM 版本得分达到 23.11%
OOLONG 任务(O(N) 复杂度)
- RLM 比基座模型高出 28%~33% 的性能
成本分析
- 中位数成本更低:RLM 懂得「跳读」和「过滤」,实际处理的 Token 数反而更少
- BrowseComp-Plus 任务:RLM(GPT-5) 平均成本 $0.99 vs 全量阅读理论成本 $2.75
🏗️ 技术架构 / 设计
- 核心思想:借鉴计算机科学经典的 Out-of-core Algorithms(核外算法),将 LLM 的上下文窗口映射为「主存」,将 Prompt 字符串变量映射为「外部存储」
- REPL 环境:构建 Read-Eval-Print Loop 环境,将自然语言推理转化为代码执行过程。原始长文本被赋值给 Python 环境中的全局变量(如 context),而非直接 Tokenize 输入模型
- 递归接口 llm_query():当模型执行该函数时,系统挂起当前执行流,实例化一个新的 LLM 调用(Sub-LM),参数为 context 的切片加上查询指令,支持无限递归深度
- 状态持久化:中间结果作为 Python 变量驻留在内存中,模型通过 print() 输出观察结果,系统截获并回传形成反馈循环
- 强制最终输出:系统要求使用 FINAL() 或 FINAL_VAR() 标签封装最终答案,区分思考过程和结论
🧠 关键洞察
💭 引发思考
RLM 揭示了一个战略方向:在 2026 年,与其在 Training-time 死磕昂贵的长窗口训练,不如在 Inference-time 投资能够编写递归代码的 Agentic 架构。这意味着「上下文无限」的实现路径可能不是更大的 GPU 集群,而是更聪明的推理编排。
当前 RLM 的工程实现仍有瓶颈:同步执行导致大规模分块任务的 Wall-clock time 过高;成本的长尾分布(死循环/过度验证)需要通过 RL 来对齐模型的「搜索/停止」策略。但这些都指向同一个信号——2026 年 AI 的核心竞争力正在从「模型能力」转向「推理编排能力」。
📚 相关阅读
- 论文原文:https://arxiv.org/abs/2412.20493
- MIT CSAIL 官方:https://www.csail.mit.edu/
- 解读来源:https://news.qq.com/rain/a/20260104A01PG400
逍遥云初 | 2026.05.29






