📌 核心问题:为什么最强模型在抽象推理上近乎交白卷?
2026 年 4 月底,ARC Prize Foundation 发布了对 GPT-5.5 和 Claude Opus 4.7 在 ARC-AGI-3 基准上的详细分析。结果令人震惊:GPT-5.5 得分仅 0.43%,Opus 4.7 更低至 0.18%——而人类首次接触就能 100% 解答。
这不是一个简单的「模型不行」的故事。ARC-AGI-3 的真正价值在于,它首次让我们看到了模型失败的「思维过程」——不是答错了什么,而是为什么答错。对于正在构建 Agent 系统的工程师来说,这些失败模式直指当前 AI 的核心短板。
🔬 ARC-AGI-3:测试什么?
ARC-AGI-3 是一个包含 135 个全新环境的测试集。每个环境都是手工设计的,测试 AI 的抽象推理和适应能力。测试者不会得到任何操作说明,必须:
- 探索不熟悉的界面
- 从稀疏反馈中推断规则(构建世界模型)
- 形成并测试假设
- 从错误假设中恢复
- 将一个关卡学到的知识迁移到下一个(持续学习)
这些环境刻意排除了模型训练数据中的文化知识,纯粹测试抽象推理能力。可以说,这是对 Agent 真实能力的「最小公分母」测试。
🔑 三种关键失败模式
失败模式 1:看到局部效果,建不出世界模型
最常见的失败。模型能观察到「当我按下 ACTION3,这个物体旋转了」,但无法转化为全局规则:「ACTION3 旋转物体,旋转控制哪一面获得新值,所以应先调整物体方向匹配目标。」
Opus 在 cd82 关卡中,第 4 步就知道 ACTION3 旋转容器,第 6 步看到 ACTION5 倒 paint——但始终没能组合出「先旋转桶,再蘸 paint 复现目标」的策略。看到了所有零件,拼不出完整拼图。
失败模式 2:训练数据的抽象层级劫持
模型反复将不熟悉机制映射到已知游戏:俄罗斯方块、Frogger、Sokoban、Breakout……训练数据中的类比劫持了动作选择。
GPT-5.5 在 ls20 关卡中把需要组合钥匙的谜题当 Breakout 玩;在 cd82 锚定了 Flood-It 机制。局部视觉相似性 → 完整游戏理论 → 浪费大量动作测试错误 affordance。
失败模式 3:赢了关卡,没学会游戏
最反直觉的发现:模型赢了一关,这个「奖励」也无法转化为下一关的成功。Opus 在 ka59 中 37 步通关 Level 1,但它对机制的理解(传送角色)是错的。Level 1 能赢是因为关卡容错性高 + 错误理论碰巧有效。
到了 Level 2 要求真正机制(形状匹配+推动)时,Opus 固化为「点击目标就能填充」,再也恢复不了。早期关卡通过是理解的噪声信号,不是可靠证据。
🧠 Opus vs GPT-5.5:两种截然不同的失败
- Opus 4.7:擅长短期机制发现,但容易将观察压缩成「自信但错误」的理论,然后固执执行
- GPT-5.5:假设生成更宽泛,更容易想到正确方向,但无法将假设压缩为可执行计划
一句话总结:Opus 压缩错了,GPT-5.5 压缩不了。
Agent 工程启示:不能简单选「用 Opus 还是 GPT-5.5」,而是根据任务特性选择。快速锁定策略 → Opus;多可能性探索 → GPT-5.5。两者都需要外部机制弥补缺陷。
🚀 引发思考:Agent 工程师该怎么看?
三种失败模式完美对应现实 Agent 的常见翻车:
- 「建不出世界模型」→ Agent 在陌生网站/API 上乱点,能观察变化但搞不懂逻辑
- 「训练数据劫持」→ Agent 把新工具当旧工具用,产生错误假设
- 「赢了没学会」→ Agent 偶然成功后错误理论固化,后续反复失败
Harness Engineering 的核心——给 Agent 套缰绳、提供反馈循环、渐进式披露——正是在弥补这些短板。纯靠模型能力提升,路还很长。工程化 Harness 才是当前更务实的路径。
📎 相关阅读
- ARC Prize 官方分析:arcprize.org/blog/arc-agi-3-gpt-5-5-opus-4-7-analysis
- GPT-5.5 发布:openai.com/index/introducing-gpt-5-5
- Claude Opus 4.7 发布:anthropic.com/news/claude-opus-4-7
逍遥云初 | 2026.05.02






