📄 论文信息

论文:Think Deep, Not Just Long: Measuring LLM Reasoning Effort via Deep-Thinking Tokens

作者:Liqian Peng, Tian Tan, Chao Zhao, Blake JianHang Chen, Ziqian Lin, Alec Go, Yu Meng

机构:University of Virginia

提交日期:2026 年 2 月 13 日(Work in Progress)

arXiv:https://arxiv.org/abs/2602.13517


🎯 核心问题

大语言模型(LLM)通过生成长链式思维(Chain-of-Thought, CoT)来展现推理能力,业界普遍将 token 数量等同于推理质量——认为「想得越多,答得越准」。但越来越多的证据表明,这条假设站不住脚。

更长的推理链并不一定带来更高的准确率。相反,研究表明存在一个倒 U 型关系:推理超过一定长度后,性能反而开始下降。这种现象被称为「overthinking」——模型在冗长的推理过程中放大了错误的启发式推理,或陷入无关细节的循环。用 token 数量来衡量推理质量,不仅鼓励了冗余表达,还浪费了大量计算资源在「无信息量」的 token 上。

这篇论文提出了一个全新的视角:不要看模型「说了多少」,而要看模型「想了多深」。


📊 关键数据

评估覆盖 4 个高难度推理基准 × 3 个模型家族 × 8 个模型变体:

  • 基准:AIME 2024、AIME 2025、HMMT 2025(竞赛数学)、GPQA-Diamond(研究生级科学推理)
  • 模型:GPT-OSS-20B/120B(low/medium/high)、DeepSeek-R1-70B、Qwen3-30B-Thinking

核心对比结果(GPT-OSS-120B-medium 跨 4 个基准平均):

  • Token 数量 vs 准确率:Pearson 相关系数 r = -0.544(负相关!越长越差)
  • Deep-Thinking Ratio vs 准确率:Pearson 相关系数 r = +0.828(强正相关)
  • DTR 的相关性在所有 8 个模型变体和 4 个基准上均一致优于 length-based 和 confidence-based 基线

Think@n 策略效果:

  • 性能匹配或超越标准 self-consistency(多数投票)
  • 推理成本降低约 50%(通过早期拒绝低 DTR 前缀实现)

🏗️ 技术架构 / 设计

核心概念:Deep-Thinking Token

  • 定义:在深层 Transformer 层中,预测分布才最终收敛的 token。即模型「想了很久才决定」的 token
  • 直觉:简单 token(如 and、is、the)在浅层就稳定了;难 token(如运算结果、答案符号)在深层才收敛
  • 方法:将中间层隐状态通过 unembedding 矩阵投影到词表空间,计算每层与最终层的 JSD 散度

Deep-Thinking Ratio (DTR) 计算流程

  • Step 1:对每个生成位置 t,计算中间层 l 与最终层 L 之间的 JSD 散度 D_{t,l}
  • Step 2:找到「稳定深度」c_t —— JSD 首次低于阈值 g 的层
  • Step 3:若 c_t 位于深层区域(≥ ρ×L,ρ=0.85),则标记为 deep-thinking token
  • Step 4:DTR = 深层 token 数 / 总 token 数

Think@n 推理策略

  • 生成 n 个候选回答,按 DTR 从高到低排序
  • 优先选择高 DTR 的候选进行多数投票
  • 关键优化:基于短前缀的 DTR 估计,提前拒绝低质量候选,节省约 50% 推理成本

热力图发现

  • 功能词(and、is、boxed)在浅层就收敛——模型不需要「思考」这些词
  • 运算结果和答案 token(如 13、(D))直到深层才收敛——模型在这些位置真正「思考」
  • 答案 token 随着上下文增加,会逐渐在更早的层出现——模型在「学习」自己的推理

💡 关键洞察

推理质量 ≠ 推理长度。Token 数量与准确率呈负相关(r=-0.544),而 DTR 与准确率呈强正相关(r=0.828)。这意味着当前以「更长 CoT」为核心的推理增强范式可能走偏了方向——我们应该追求「深思」而非「长考」。
模型内部存在「思考深度」的层级分化。简单 token 在浅层就稳定,复杂 token 需要深层计算。这种分化是自动涌现的,不需要额外训练。这为理解 Transformer 的推理机制提供了新的可解释性视角。
Think@n 证明了「质量优于数量」在推理场景中的可行性。通过 DTR 前缀过滤,用一半的计算成本就能达到甚至超越传统 self-consistency 的效果。这对大规模推理部署有直接的工程价值。
Overthinking 不仅浪费算力,还会伤害性能。论文发现更长的推理链反而导致准确率下降,这与 DeepSeek-R1 等模型观察到的现象一致。DTR 提供了一种在推理过程中实时检测 overthinking 的机制。

🤔 引发思考

这篇论文的核心洞察对当前 AI 推理的发展方向提出了根本性的质疑。2024-2025 年,从 OpenAI o1/o3 到 DeepSeek-R1 再到 Claude 的 extended thinking,行业一直在「让模型想得更久」这条路上狂奔。但 DTR 的发现表明,更久 ≠ 更好——模型需要的不是更多的 token 预算,而是更高效的内部计算。

从工程角度看,DTR 有巨大的应用潜力:它可以作为推理阶段的「质量信号」,用于动态分配计算资源(给难题更多算力、给简单题更少算力),或者作为 reward model 的补充信号用于强化学习训练。更重要的是,它提供了一种无需外部标注、纯靠模型内部状态就能评估推理质量的方法——这在 RLHF/DPO 等对齐方法中可能有重要应用。

不过需要注意,DTR 的计算需要访问中间层隐状态,这意味着它目前只能用于自建推理环境,无法直接应用于黑盒 API(如 GPT-4、Claude 等闭源模型)。如何将类似的思想迁移到黑盒场景,是一个值得探索的方向。


📚 相关阅读

  • DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning — https://arxiv.org/abs/2501.12948
  • When Does LLM Think More is Not Always Better — 关于 CoT 长度与性能倒 U 型关系的研究
  • Logic-RL: Unleashing LLM Reasoning with Rule-Based Reinforcement Learning — 微软基于规则 RL 释放 LLM 推理能力
  • Reasoning Beyond Limits: Advances and Open Problems for LLMs — LLM 推理综合综述

逍遥云初 | 2026.05.25