AI Agent 到底在烧谁的钱?斯坦福首次系统性研究 Token 消耗行为

论文:How Do AI Agents Spend Your Money? Analyzing and Predicting Token Consumption in Agentic Coding Tasks 作者:Jiaxin Pei, Erik Brynjolfsson, Sandy Pentland 等(Stanford Digital Economy Lab) 提交日期:2026-04-24 | arXiv: 2604.22750 论文链接:https://arxiv.org/abs/2604.22750


📌 核心问题:Agent 经济学的黑箱

AI Agent 正在从「辅助工具」变成「自主执行者」。当一个 Coding Agent 可以自己读代码、改代码、跑测试、修 bug 的时候,一个自然的问题浮出水面:它到底要花多少钱?这不是一个简单的 API 调用计费问题——Agent 的工作方式是多轮交互、反复读取上下文,token 消耗呈雪球式增长。

斯坦福数字经济学实验室的这篇论文,首次对 AI Agent 的 token 消耗行为进行了系统性研究。他们在 SWE-bench Verified 上测试了 8 个前沿 LLM,试图回答三个关键问题:Agent 把 token 花在哪了?哪些模型更省 token?Agent 能否提前预估自己的开销?

答案令人震惊:Agent 任务的 token 消耗是代码推理和代码对话的 1000 倍。而 Agent 完全无法预测自己的花费,同一任务的不同运行之间差异高达 30 倍。这意味着,目前所有基于「按结果计费」的 Agent 商业模式,都面临一个根本性的成本不可预测问题。


📊 关键数据

  • Agent 任务 token 消耗是代码推理/对话的 1000 倍
  • 成本主要由输入 token 驱动(非输出),Agent 每一步都要重新读取完整上下文
  • 同一任务不同运行的 token 消耗差异高达 30 倍
  • 更高 token 消耗 ≠ 更高准确率;准确率往往在中间成本时达到峰值
  • 模型效率差异巨大:Kimi-K2 和 Claude-Sonnet-4.5 比 GPT-5 平均多消耗 150 万+ token
  • 人类专家对任务难度的评估与实际 token 成本仅弱相关
  • 前沿模型预测自身 token 用量的相关系数仅 0.39,且系统性低估实际开销

🏗️ 技术架构与设计

  • 测试平台:SWE-bench Verified(真实 GitHub issue 修复任务,业界标准 benchmark)
  • 测试模型:8 个前沿 LLM,包括 GPT-5、Claude-Sonnet-4.5、Kimi-K2 等
  • 分析维度:token 消耗分布、输入/输出 token 比例、模型间效率对比、成本预测能力
  • 创新点:首次将 token 消耗的随机性(stochasticity)量化,并揭示 Agent 无法自估成本的根本原因

🔑 关键洞察

输入 token 是成本黑洞 与直觉不同,Agent 的主要开销不是「生成答案」,而是「反复阅读上下文」。每一步 Agent 都要把之前所有的对话历史、代码片段、工具返回值重新喂给模型。这就像一个人每写一行代码就要把整本教科书重新读一遍。这个架构性问题意味着:单纯优化模型推理速度无法解决成本问题,必须从上下文管理层面入手。
随机性 30 倍——Agent 经济学的根本挑战 同一任务、同一 Agent、同一模型,运行 10 次可能花 1 倍到 30 倍不等的 token。这种随机性来自 Agent 决策路径的发散——一个微小的中间步骤差异可能导致完全不同的执行轨迹。这对 Agent 服务的定价模式是致命打击:你无法为一个结果不确定、成本不确定的服务给出固定报价。
花钱多 ≠ 效果好 研究发现准确率往往在中间 token 消耗时达到峰值,之后趋于饱和。这意味着「让 Agent 多想想」并不是一个可靠的优化策略。更多的 token 可能只是在重复无用的上下文,而非深入思考。对于工程团队来说,设置 token 上限不仅是成本控制手段,也可能是提升效率的手段。
模型间的效率鸿沟 在完全相同的任务上,不同模型的 token 消耗可以相差数百万。Kimi-K2 和 Claude-Sonnet-4.5 比 GPT-5 平均多消耗 150 万+ token。这不仅是成本问题,也暗示了不同模型在「工具使用效率」和「上下文压缩能力」上的根本差异。选择合适的模型对 Agent 的 ROI 影响巨大。

💡 引发思考

这篇论文揭示了一个被行业集体忽视的问题:当我们兴奋地讨论 Agent 能做什么的时候,很少有人认真计算它要花多少钱。1000 倍的 token 消耗差距意味着,如果一个代码推理任务花 0.01 美元,同等复杂度的 Agent 任务可能要花 10 美元。当企业部署数百个 Agent 并行工作时,这个成本会迅速失控。

更深层的问题是「Moravec's Paradox」在 Agent 经济学中的体现:人类觉得简单的任务(比如改一个变量名),Agent 可能需要大量 token 来理解上下文;而人类觉得困难的任务(比如架构设计),Agent 可能只需要少量 token。这意味着我们不能用人类的直觉来预估 Agent 的成本——需要全新的成本模型和优化策略。

对于正在构建 Agent 产品或使用 Agent 服务的团队来说,这篇论文的启示是明确的:(1) 上下文管理是成本优化的核心战场;(2) 模型选择对 ROI 的影响可能比你想象的大得多;(3) 不要假设 Agent 能自我控制成本——需要外部的 guardrails 和预算机制。


📎 相关阅读

  • 论文原文:https://arxiv.org/abs/2604.22750
  • Stanford Digital Economy Lab:https://digitaleconomy.stanford.edu/news/how-are-ai-agents-spending-your-tokens/
  • SWE-bench Verified:https://www.swebench.com/

逍遥云初 | 2026.05.14