📌 核心问题:为什么最强模型在抽象推理上近乎交白卷?

2026 年 4 月底,ARC Prize Foundation 发布了对 GPT-5.5 和 Claude Opus 4.7 在 ARC-AGI-3 基准上的详细分析。结果令人震惊:GPT-5.5 得分仅 0.43%,Opus 4.7 更低至 0.18%——而人类首次接触就能 100% 解答。

这不是一个简单的「模型不行」的故事。ARC-AGI-3 的真正价值在于,它首次让我们看到了模型失败的「思维过程」——不是答错了什么,而是为什么答错。对于正在构建 Agent 系统的工程师来说,这些失败模式直指当前 AI 的核心短板。

🔬 ARC-AGI-3:测试什么?

ARC-AGI-3 是一个包含 135 个全新环境的测试集。每个环境都是手工设计的,测试 AI 的抽象推理和适应能力。测试者不会得到任何操作说明,必须:

  • 探索不熟悉的界面
  • 从稀疏反馈中推断规则(构建世界模型)
  • 形成并测试假设
  • 从错误假设中恢复
  • 将一个关卡学到的知识迁移到下一个(持续学习)

这些环境刻意排除了模型训练数据中的文化知识,纯粹测试抽象推理能力。可以说,这是对 Agent 真实能力的「最小公分母」测试。

🔑 三种关键失败模式

失败模式 1:看到局部效果,建不出世界模型

最常见的失败。模型能观察到「当我按下 ACTION3,这个物体旋转了」,但无法转化为全局规则:「ACTION3 旋转物体,旋转控制哪一面获得新值,所以应先调整物体方向匹配目标。」

Opus 在 cd82 关卡中,第 4 步就知道 ACTION3 旋转容器,第 6 步看到 ACTION5 倒 paint——但始终没能组合出「先旋转桶,再蘸 paint 复现目标」的策略。看到了所有零件,拼不出完整拼图。

失败模式 2:训练数据的抽象层级劫持

模型反复将不熟悉机制映射到已知游戏:俄罗斯方块、Frogger、Sokoban、Breakout……训练数据中的类比劫持了动作选择。

GPT-5.5 在 ls20 关卡中把需要组合钥匙的谜题当 Breakout 玩;在 cd82 锚定了 Flood-It 机制。局部视觉相似性 → 完整游戏理论 → 浪费大量动作测试错误 affordance。

失败模式 3:赢了关卡,没学会游戏

最反直觉的发现:模型赢了一关,这个「奖励」也无法转化为下一关的成功。Opus 在 ka59 中 37 步通关 Level 1,但它对机制的理解(传送角色)是错的。Level 1 能赢是因为关卡容错性高 + 错误理论碰巧有效。

到了 Level 2 要求真正机制(形状匹配+推动)时,Opus 固化为「点击目标就能填充」,再也恢复不了。早期关卡通过是理解的噪声信号,不是可靠证据。

🧠 Opus vs GPT-5.5:两种截然不同的失败

  • Opus 4.7:擅长短期机制发现,但容易将观察压缩成「自信但错误」的理论,然后固执执行
  • GPT-5.5:假设生成更宽泛,更容易想到正确方向,但无法将假设压缩为可执行计划

一句话总结:Opus 压缩错了,GPT-5.5 压缩不了。

Agent 工程启示:不能简单选「用 Opus 还是 GPT-5.5」,而是根据任务特性选择。快速锁定策略 → Opus;多可能性探索 → GPT-5.5。两者都需要外部机制弥补缺陷。

🚀 引发思考:Agent 工程师该怎么看?

三种失败模式完美对应现实 Agent 的常见翻车:

  • 「建不出世界模型」→ Agent 在陌生网站/API 上乱点,能观察变化但搞不懂逻辑
  • 「训练数据劫持」→ Agent 把新工具当旧工具用,产生错误假设
  • 「赢了没学会」→ Agent 偶然成功后错误理论固化,后续反复失败

Harness Engineering 的核心——给 Agent 套缰绳、提供反馈循环、渐进式披露——正是在弥补这些短板。纯靠模型能力提升,路还很长。工程化 Harness 才是当前更务实的路径。

📎 相关阅读

  • ARC Prize 官方分析:arcprize.org/blog/arc-agi-3-gpt-5-5-opus-4-7-analysis
  • GPT-5.5 发布:openai.com/index/introducing-gpt-5-5
  • Claude Opus 4.7 发布:anthropic.com/news/claude-opus-4-7

逍遥云初 | 2026.05.02