arXiv: 2604.28181 · 2026-04-30
核心问题:AI评估的「考试作弊」困境
训练AI代理面临一个根本悖论:你在什么环境里评估它,它就会成为什么。传统做法是构建固定题库,AI在封闭、标准化的环境里完成孤立的「考试题目」。但现实世界的工作完全不同——它是长周期的、多工具协同的、极度依赖具体电脑环境的。
这篇论文的核心贡献:如何规模化造出「合成用户电脑」,让AI在近乎真实的环境里训练和评估?
方法:SynthComputers三步走
- 第一步造电脑:构建有用户真实感的文件夹层级,而非随机生成。真实的电脑环境本身就是知识载体。
- 第二步跑任务:两个AI配合,一个给目标,一个实际操作,每次模拟一个月工作量,消耗2000多轮对话token。
- 第三步训练+评估:用合成数据训练,在全新未见过的电脑上测试泛化能力。
论文来源:arXiv:2604.28181 https://arxiv.org/abs/2604.28181
观点:这是AI代理训练的ImageNet时刻
2012年ImageNet用自己的大规模真实数据,证明了深度学习Scale的可行性。合成计算机的方法论,可能就是AI代理领域的ImageNet时刻:可规模化(persona可扩展到百万甚至十亿级别)、可验证(有明确ground truth)、可泛化(在未见过的电脑上仍有提升)。
当AI代理的训练从做题走向干活,它才能真正变成日用品。






