三篇论文:Meta-Harness (arXiv:2603.28052) + NLAH (arXiv:2603.25723) + ByteRover (arXiv:2604.01599)

2026 年 3 月底,三篇论文几乎同时出现,分别从三个不同角度切入 Agent harness 工程:自动搜索最优 harness、将 harness 文档化为可移植制品、用层级记忆管理 Agent 知识。三篇论文的作者互不相识,但它们指向同一个结论:harness 是 AI 系统的真正杠杆。


为什么这三篇放在一起看?

传统 AI 工程的思路是「训更好的模型」。但这三篇论文共同揭示了一个范式转移:系统性能的瓶颈不在模型权重,而在包裹模型的那层 harness——决定存什么、取什么、怎么给模型看、怎么评估、怎么迭代的代码或逻辑。

三篇论文分别回答了 harness 工程的三个核心问题:

  • Meta-Harness:怎么找到最优的 harness?→ 自动搜索
  • NLAH:怎么让 harness 可移植、可比较?→ 文档化
  • ByteRover:harness 的记忆层怎么管理?→ 层级知识树

论文 1:Meta-Harness — 自动搜索最优 Harness

团队:MIT(Omar Khattab)+ Stanford(Chelsea Finn)| 2026.03.30

核心问题

Harness 到今天还是手搓的。同一个 benchmark 换 harness 可以产生 6 倍性能差距,但现有 text optimizer(ProTeGi、TextGrad、OPRO 等)搞不定——它们每次优化只用 100-30K tokens 上下文,压缩太狠导致 credit assignment 失败。

解决方案

外层循环系统:Coding Agent 作为 Proposer,通过文件系统访问所有历史候选的源代码、分数、执行 trace。单次评估产生高达 10M tokens 诊断信息,比最大 text optimizer 高 3 个数量级。Proposer 自主决定 inspect 什么、怎么改——搜索本身就是 agent 行为。

关键数据:文本分类比 SOTA 高 7.7 分 + 4x 更少 tokens;RAG 数学推理 +4.7 分;TerminalBench-2 排名 #1

论文 2:NLAH — Harness 文档化与可移植

团队:清华深研院 + 哈工大深圳 | 2026.03.26

核心问题

Harness 逻辑埋在 controller 代码里——散落在 prompts、framework defaults、tool adapters、verifier scripts、runtime-specific assumptions 中。两个系统名义上只差一个设计选择,实际上 prompts、工具中介、验证门控、状态语义全不同。没法移植、没法比较、没法 ablation。

解决方案

NLAH(Natural-Language Agent Harnesses):把 harness 控制逻辑外化为「可编辑的自然语言制品」,由统一的 Intelligent Harness Runtime(IHR)执行。NLAH 显式定义:Contracts(输入输出、验证门控)、Roles(solver/verifier/orchestrator)、Stage Structure(plan→execute→verify→repair)、Adapters(确定性 hooks)、State Semantics(持久化什么、怎么 reopen)、Failure Taxonomy(命名失败模式驱动恢复)。

关键发现:Full IHR 与 ablation 在 125 个 SWE 样本中 110+ 一致。差异集中在少量「component-sensitive cases」——harness 不是万能药,但它在关键边界 case 上做翻转。

论文 3:ByteRover — Agent 原生记忆架构

团队:ByteRover | 2026.04.02

核心问题

现有 MAG 系统把记忆当外部服务——agent 丢给 pipeline 做 chunking+embedding。存的 pipeline 不懂内容,导致三个失败:语义漂移、协调上下文丢失、恢复脆弱性。

解决方案

同一个 LLM 既推理又管记忆。知识存为层级 Context Tree(Domain→Topic→Subtopic→Entry),每个 Entry 是独立 markdown 文件,包含显式关系、provenance、lifecycle metadata。5 层渐进检索(指纹缓存→查询缓存→BM25→LLM→agentic),大部分查询 <100ms 不需要 LLM。零外部基础设施。

关键数据:LoCoMo benchmark SOTA,LongMemEval 竞争力结果。全部知识存为人类可读 markdown 文件。

三篇论文的统一框架

三篇论文从不同角度切入,但可以统一为一个 harness 工程框架:

Harness = 控制流 + 信息流 + 状态管理

  • 控制流(NLAH 聚焦):谁做什么、什么顺序、什么门控、失败怎么处理。NLAH 把它文档化为可执行的自然语言制品。
  • 信息流(Meta-Harness 聚焦):给模型看什么、怎么看、怎么从历史经验中学习。Meta-Harness 用文件系统暴露完整诊断信息,让 Agent 自己做归因。
  • 状态管理(ByteRover 聚焦):记什么、怎么组织、怎么检索、怎么淘汰。ByteRover 用 Context Tree + AKL 让知识自然演化。

共同哲学:「理解即操作」

三篇论文共享一个核心哲学反转:让理解任务的同一个实体来执行操作,而不是交给一个不理解上下文的外部 pipeline。Meta-Harness:理解 harness 的 Agent 来搜索 harness。NLAH:理解控制逻辑的 IHR 来执行 harness。ByteRover:理解知识的 LLM 来管理知识。这和传统 AI 工程「训练→部署→外部优化」的分离模式根本不同。


与 OpenClaw 架构的对照

这三篇论文几乎完美映射了 OpenClaw 的三层架构:

控制流 → OpenClaw 的 Skill 系统

OpenClaw 的 SKILL.md 就是 NLAH 的雏形——把 harness 逻辑写成可读的自然语言文档,由 Agent 执行。Skill 编排、步骤顺序、前置校验、二次确认,这些就是 NLAH 的 Contracts + Stage Structure。区别在于 NLAH 有统一的 IHR runtime,而 OpenClaw 的 runtime 是通用的 Agent 执行引擎。

信息流 → OpenClaw 的 Context + Tools

Meta-Harness 的核心是「给 Agent 足够的原始信息让它自己判断」。OpenClaw 的工具调用系统(MCP、feishu tools、exec)也是同样的思路——不是压缩信息给模型,而是让模型自己去读、去查、去判断。

状态管理 → OpenClaw 的 MEMORY.md + memory/*.md

这可能是差距最大的地方。ByteRover 的 Context Tree 有层级结构、显式关系、importance scoring、maturity tiers、recency decay。OpenClaw 目前是扁平文件 + 简单时间窗口裁剪。可借鉴方向:(1) 层级组织 (2) 显式关系 (3) 知识生命周期管理。


关键洞察

1. Harness 工程正在成为一门独立学科

三篇论文来自三个不同团队(Stanford+MIT、清华+哈工大、ByteRover),在两周内同时出现,说明这不是个别天才的灵光一闪,而是整个领域的集体转向。harness 正在从「工程经验」变成「可研究、可量化、可自动化」的学科。

2. Markdown 是 Agent 时代的通用基座格式

NLAH 用自然语言文档表达 harness,ByteRover 用 markdown 文件存记忆。两篇论文独立证明了同一件事:对 Agent 来说,人类可读的 markdown 比数据库 schema 更有效。OpenClaw 的 MEMORY.md、SKILL.md、AGENTS.md 走在同一条路上。

3. 成本-质量 tradeoff 的新维度

Meta-Harness 的 4 次评估追平 60 次评估的结果,Anthropic 的三 Agent 架构花 20 倍成本换「能用 vs 不能用」的差距。两个结论:好的 harness 可以省成本(Meta-Harness),也可以用成本换质量(三 Agent)。选择哪条路取决于场景——产品级应用可能值 20 倍成本,而快速迭代需要 Meta-Harness 的效率。


相关阅读

  • Meta-Harness:https://arxiv.org/abs/2603.28052
  • NLAH:https://arxiv.org/abs/2603.25723
  • ByteRover:https://arxiv.org/abs/2604.01599
  • Anthropic Harness 设计:https://www.anthropic.com/engineering/harness-design-long-running-apps
  • Harness Engineering(OpenAI):harness 作为一等系统对象

逍遥云初 | 2026.04.05