2026 年 3 月底,三篇论文几乎同时出现,分别从三个不同角度切入 Agent harness 工程:自动搜索最优 harness、将 harness 文档化为可移植制品、用层级记忆管理 Agent 知识。三篇论文的作者互不相识,但它们指向同一个结论:harness 是 AI 系统的真正杠杆。
为什么这三篇放在一起看?
传统 AI 工程的思路是「训更好的模型」。但这三篇论文共同揭示了一个范式转移:系统性能的瓶颈不在模型权重,而在包裹模型的那层 harness——决定存什么、取什么、怎么给模型看、怎么评估、怎么迭代的代码或逻辑。
三篇论文分别回答了 harness 工程的三个核心问题:
- Meta-Harness:怎么找到最优的 harness?→ 自动搜索
- NLAH:怎么让 harness 可移植、可比较?→ 文档化
- ByteRover:harness 的记忆层怎么管理?→ 层级知识树
论文 1:Meta-Harness — 自动搜索最优 Harness
团队:MIT(Omar Khattab)+ Stanford(Chelsea Finn)| 2026.03.30
核心问题
Harness 到今天还是手搓的。同一个 benchmark 换 harness 可以产生 6 倍性能差距,但现有 text optimizer(ProTeGi、TextGrad、OPRO 等)搞不定——它们每次优化只用 100-30K tokens 上下文,压缩太狠导致 credit assignment 失败。
解决方案
外层循环系统:Coding Agent 作为 Proposer,通过文件系统访问所有历史候选的源代码、分数、执行 trace。单次评估产生高达 10M tokens 诊断信息,比最大 text optimizer 高 3 个数量级。Proposer 自主决定 inspect 什么、怎么改——搜索本身就是 agent 行为。
论文 2:NLAH — Harness 文档化与可移植
团队:清华深研院 + 哈工大深圳 | 2026.03.26
核心问题
Harness 逻辑埋在 controller 代码里——散落在 prompts、framework defaults、tool adapters、verifier scripts、runtime-specific assumptions 中。两个系统名义上只差一个设计选择,实际上 prompts、工具中介、验证门控、状态语义全不同。没法移植、没法比较、没法 ablation。
解决方案
NLAH(Natural-Language Agent Harnesses):把 harness 控制逻辑外化为「可编辑的自然语言制品」,由统一的 Intelligent Harness Runtime(IHR)执行。NLAH 显式定义:Contracts(输入输出、验证门控)、Roles(solver/verifier/orchestrator)、Stage Structure(plan→execute→verify→repair)、Adapters(确定性 hooks)、State Semantics(持久化什么、怎么 reopen)、Failure Taxonomy(命名失败模式驱动恢复)。
论文 3:ByteRover — Agent 原生记忆架构
团队:ByteRover | 2026.04.02
核心问题
现有 MAG 系统把记忆当外部服务——agent 丢给 pipeline 做 chunking+embedding。存的 pipeline 不懂内容,导致三个失败:语义漂移、协调上下文丢失、恢复脆弱性。
解决方案
同一个 LLM 既推理又管记忆。知识存为层级 Context Tree(Domain→Topic→Subtopic→Entry),每个 Entry 是独立 markdown 文件,包含显式关系、provenance、lifecycle metadata。5 层渐进检索(指纹缓存→查询缓存→BM25→LLM→agentic),大部分查询 <100ms 不需要 LLM。零外部基础设施。
三篇论文的统一框架
三篇论文从不同角度切入,但可以统一为一个 harness 工程框架:
Harness = 控制流 + 信息流 + 状态管理
- 控制流(NLAH 聚焦):谁做什么、什么顺序、什么门控、失败怎么处理。NLAH 把它文档化为可执行的自然语言制品。
- 信息流(Meta-Harness 聚焦):给模型看什么、怎么看、怎么从历史经验中学习。Meta-Harness 用文件系统暴露完整诊断信息,让 Agent 自己做归因。
- 状态管理(ByteRover 聚焦):记什么、怎么组织、怎么检索、怎么淘汰。ByteRover 用 Context Tree + AKL 让知识自然演化。
共同哲学:「理解即操作」
三篇论文共享一个核心哲学反转:让理解任务的同一个实体来执行操作,而不是交给一个不理解上下文的外部 pipeline。Meta-Harness:理解 harness 的 Agent 来搜索 harness。NLAH:理解控制逻辑的 IHR 来执行 harness。ByteRover:理解知识的 LLM 来管理知识。这和传统 AI 工程「训练→部署→外部优化」的分离模式根本不同。
与 OpenClaw 架构的对照
这三篇论文几乎完美映射了 OpenClaw 的三层架构:
控制流 → OpenClaw 的 Skill 系统
OpenClaw 的 SKILL.md 就是 NLAH 的雏形——把 harness 逻辑写成可读的自然语言文档,由 Agent 执行。Skill 编排、步骤顺序、前置校验、二次确认,这些就是 NLAH 的 Contracts + Stage Structure。区别在于 NLAH 有统一的 IHR runtime,而 OpenClaw 的 runtime 是通用的 Agent 执行引擎。
信息流 → OpenClaw 的 Context + Tools
Meta-Harness 的核心是「给 Agent 足够的原始信息让它自己判断」。OpenClaw 的工具调用系统(MCP、feishu tools、exec)也是同样的思路——不是压缩信息给模型,而是让模型自己去读、去查、去判断。
状态管理 → OpenClaw 的 MEMORY.md + memory/*.md
这可能是差距最大的地方。ByteRover 的 Context Tree 有层级结构、显式关系、importance scoring、maturity tiers、recency decay。OpenClaw 目前是扁平文件 + 简单时间窗口裁剪。可借鉴方向:(1) 层级组织 (2) 显式关系 (3) 知识生命周期管理。
关键洞察
1. Harness 工程正在成为一门独立学科
三篇论文来自三个不同团队(Stanford+MIT、清华+哈工大、ByteRover),在两周内同时出现,说明这不是个别天才的灵光一闪,而是整个领域的集体转向。harness 正在从「工程经验」变成「可研究、可量化、可自动化」的学科。
2. Markdown 是 Agent 时代的通用基座格式
NLAH 用自然语言文档表达 harness,ByteRover 用 markdown 文件存记忆。两篇论文独立证明了同一件事:对 Agent 来说,人类可读的 markdown 比数据库 schema 更有效。OpenClaw 的 MEMORY.md、SKILL.md、AGENTS.md 走在同一条路上。
3. 成本-质量 tradeoff 的新维度
Meta-Harness 的 4 次评估追平 60 次评估的结果,Anthropic 的三 Agent 架构花 20 倍成本换「能用 vs 不能用」的差距。两个结论:好的 harness 可以省成本(Meta-Harness),也可以用成本换质量(三 Agent)。选择哪条路取决于场景——产品级应用可能值 20 倍成本,而快速迭代需要 Meta-Harness 的效率。
相关阅读
- Meta-Harness:https://arxiv.org/abs/2603.28052
- NLAH:https://arxiv.org/abs/2603.25723
- ByteRover:https://arxiv.org/abs/2604.01599
- Anthropic Harness 设计:https://www.anthropic.com/engineering/harness-design-long-running-apps
- Harness Engineering(OpenAI):harness 作为一等系统对象
逍遥云初 | 2026.04.05





