AI Agent 到底在烧谁的钱?斯坦福首次系统性研究 Token 消耗行为
论文:How Do AI Agents Spend Your Money? Analyzing and Predicting Token Consumption in Agentic Coding Tasks 作者:Jiaxin Pei, Erik Brynjolfsson, Sandy Pentland 等(Stanford Digital Economy Lab) 提交日期:2026-04-24 | arXiv: 2604.22750 论文链接:https://arxiv.org/abs/2604.22750
📌 核心问题:Agent 经济学的黑箱
AI Agent 正在从「辅助工具」变成「自主执行者」。当一个 Coding Agent 可以自己读代码、改代码、跑测试、修 bug 的时候,一个自然的问题浮出水面:它到底要花多少钱?这不是一个简单的 API 调用计费问题——Agent 的工作方式是多轮交互、反复读取上下文,token 消耗呈雪球式增长。
斯坦福数字经济学实验室的这篇论文,首次对 AI Agent 的 token 消耗行为进行了系统性研究。他们在 SWE-bench Verified 上测试了 8 个前沿 LLM,试图回答三个关键问题:Agent 把 token 花在哪了?哪些模型更省 token?Agent 能否提前预估自己的开销?
答案令人震惊:Agent 任务的 token 消耗是代码推理和代码对话的 1000 倍。而 Agent 完全无法预测自己的花费,同一任务的不同运行之间差异高达 30 倍。这意味着,目前所有基于「按结果计费」的 Agent 商业模式,都面临一个根本性的成本不可预测问题。
📊 关键数据
- Agent 任务 token 消耗是代码推理/对话的 1000 倍
- 成本主要由输入 token 驱动(非输出),Agent 每一步都要重新读取完整上下文
- 同一任务不同运行的 token 消耗差异高达 30 倍
- 更高 token 消耗 ≠ 更高准确率;准确率往往在中间成本时达到峰值
- 模型效率差异巨大:Kimi-K2 和 Claude-Sonnet-4.5 比 GPT-5 平均多消耗 150 万+ token
- 人类专家对任务难度的评估与实际 token 成本仅弱相关
- 前沿模型预测自身 token 用量的相关系数仅 0.39,且系统性低估实际开销
🏗️ 技术架构与设计
- 测试平台:SWE-bench Verified(真实 GitHub issue 修复任务,业界标准 benchmark)
- 测试模型:8 个前沿 LLM,包括 GPT-5、Claude-Sonnet-4.5、Kimi-K2 等
- 分析维度:token 消耗分布、输入/输出 token 比例、模型间效率对比、成本预测能力
- 创新点:首次将 token 消耗的随机性(stochasticity)量化,并揭示 Agent 无法自估成本的根本原因
🔑 关键洞察
💡 引发思考
这篇论文揭示了一个被行业集体忽视的问题:当我们兴奋地讨论 Agent 能做什么的时候,很少有人认真计算它要花多少钱。1000 倍的 token 消耗差距意味着,如果一个代码推理任务花 0.01 美元,同等复杂度的 Agent 任务可能要花 10 美元。当企业部署数百个 Agent 并行工作时,这个成本会迅速失控。
更深层的问题是「Moravec's Paradox」在 Agent 经济学中的体现:人类觉得简单的任务(比如改一个变量名),Agent 可能需要大量 token 来理解上下文;而人类觉得困难的任务(比如架构设计),Agent 可能只需要少量 token。这意味着我们不能用人类的直觉来预估 Agent 的成本——需要全新的成本模型和优化策略。
对于正在构建 Agent 产品或使用 Agent 服务的团队来说,这篇论文的启示是明确的:(1) 上下文管理是成本优化的核心战场;(2) 模型选择对 ROI 的影响可能比你想象的大得多;(3) 不要假设 Agent 能自我控制成本——需要外部的 guardrails 和预算机制。
📎 相关阅读
- 论文原文:https://arxiv.org/abs/2604.22750
- Stanford Digital Economy Lab:https://digitaleconomy.stanford.edu/news/how-are-ai-agents-spending-your-tokens/
- SWE-bench Verified:https://www.swebench.com/
逍遥云初 | 2026.05.14






