📄 论文信息
论文:Think Deep, Not Just Long: Measuring LLM Reasoning Effort via Deep-Thinking Tokens
作者:Liqian Peng, Tian Tan, Chao Zhao, Blake JianHang Chen, Ziqian Lin, Alec Go, Yu Meng
机构:University of Virginia
提交日期:2026 年 2 月 13 日(Work in Progress)
arXiv:https://arxiv.org/abs/2602.13517
🎯 核心问题
大语言模型(LLM)通过生成长链式思维(Chain-of-Thought, CoT)来展现推理能力,业界普遍将 token 数量等同于推理质量——认为「想得越多,答得越准」。但越来越多的证据表明,这条假设站不住脚。
更长的推理链并不一定带来更高的准确率。相反,研究表明存在一个倒 U 型关系:推理超过一定长度后,性能反而开始下降。这种现象被称为「overthinking」——模型在冗长的推理过程中放大了错误的启发式推理,或陷入无关细节的循环。用 token 数量来衡量推理质量,不仅鼓励了冗余表达,还浪费了大量计算资源在「无信息量」的 token 上。
这篇论文提出了一个全新的视角:不要看模型「说了多少」,而要看模型「想了多深」。
📊 关键数据
评估覆盖 4 个高难度推理基准 × 3 个模型家族 × 8 个模型变体:
- 基准:AIME 2024、AIME 2025、HMMT 2025(竞赛数学)、GPQA-Diamond(研究生级科学推理)
- 模型:GPT-OSS-20B/120B(low/medium/high)、DeepSeek-R1-70B、Qwen3-30B-Thinking
核心对比结果(GPT-OSS-120B-medium 跨 4 个基准平均):
- Token 数量 vs 准确率:Pearson 相关系数 r = -0.544(负相关!越长越差)
- Deep-Thinking Ratio vs 准确率:Pearson 相关系数 r = +0.828(强正相关)
- DTR 的相关性在所有 8 个模型变体和 4 个基准上均一致优于 length-based 和 confidence-based 基线
Think@n 策略效果:
- 性能匹配或超越标准 self-consistency(多数投票)
- 推理成本降低约 50%(通过早期拒绝低 DTR 前缀实现)
🏗️ 技术架构 / 设计
核心概念:Deep-Thinking Token
- 定义:在深层 Transformer 层中,预测分布才最终收敛的 token。即模型「想了很久才决定」的 token
- 直觉:简单 token(如 and、is、the)在浅层就稳定了;难 token(如运算结果、答案符号)在深层才收敛
- 方法:将中间层隐状态通过 unembedding 矩阵投影到词表空间,计算每层与最终层的 JSD 散度
Deep-Thinking Ratio (DTR) 计算流程
- Step 1:对每个生成位置 t,计算中间层 l 与最终层 L 之间的 JSD 散度 D_{t,l}
- Step 2:找到「稳定深度」c_t —— JSD 首次低于阈值 g 的层
- Step 3:若 c_t 位于深层区域(≥ ρ×L,ρ=0.85),则标记为 deep-thinking token
- Step 4:DTR = 深层 token 数 / 总 token 数
Think@n 推理策略
- 生成 n 个候选回答,按 DTR 从高到低排序
- 优先选择高 DTR 的候选进行多数投票
- 关键优化:基于短前缀的 DTR 估计,提前拒绝低质量候选,节省约 50% 推理成本
热力图发现
- 功能词(and、is、boxed)在浅层就收敛——模型不需要「思考」这些词
- 运算结果和答案 token(如 13、(D))直到深层才收敛——模型在这些位置真正「思考」
- 答案 token 随着上下文增加,会逐渐在更早的层出现——模型在「学习」自己的推理
💡 关键洞察
🤔 引发思考
这篇论文的核心洞察对当前 AI 推理的发展方向提出了根本性的质疑。2024-2025 年,从 OpenAI o1/o3 到 DeepSeek-R1 再到 Claude 的 extended thinking,行业一直在「让模型想得更久」这条路上狂奔。但 DTR 的发现表明,更久 ≠ 更好——模型需要的不是更多的 token 预算,而是更高效的内部计算。
从工程角度看,DTR 有巨大的应用潜力:它可以作为推理阶段的「质量信号」,用于动态分配计算资源(给难题更多算力、给简单题更少算力),或者作为 reward model 的补充信号用于强化学习训练。更重要的是,它提供了一种无需外部标注、纯靠模型内部状态就能评估推理质量的方法——这在 RLHF/DPO 等对齐方法中可能有重要应用。
不过需要注意,DTR 的计算需要访问中间层隐状态,这意味着它目前只能用于自建推理环境,无法直接应用于黑盒 API(如 GPT-4、Claude 等闭源模型)。如何将类似的思想迁移到黑盒场景,是一个值得探索的方向。
📚 相关阅读
- DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning — https://arxiv.org/abs/2501.12948
- When Does LLM Think More is Not Always Better — 关于 CoT 长度与性能倒 U 型关系的研究
- Logic-RL: Unleashing LLM Reasoning with Rule-Based Reinforcement Learning — 微软基于规则 RL 释放 LLM 推理能力
- Reasoning Beyond Limits: Advances and Open Problems for LLMs — LLM 推理综合综述
逍遥云初 | 2026.05.25






