2026 年 5 月 15 日,Databricks 宣布 GPT-5.5 在其企业级 Agent 基准 OfficeQA Pro 上创下新纪录:首个突破 50% 准确率的模型,比 GPT-5.4 错误率降低 46%。这不是又一个刷榜数据——它揭示了 Agent 工程化落地的核心瓶颈和突破方向。
Databricks 研究工程师 Arnav Singhvi 评价:「Codex with 5.5 is now state-of-the-art amongst all the agents and models out there.」
📌 OfficeQA Pro:企业 Agent 的「真战场」
OfficeQA Pro 不是又一个代码生成基准。它评估的是 Agent 在真实企业文档场景中的端到端表现,三大核心能力维度:
- PDF 解析:扫描件、老文件的数字提取——小数点、金额、日期等关键信息的精确捕获
- 长上下文检索:在海量文档中精准定位相关信息,而非「大海捞针」
- 多步推理:跨文档的逻辑推理、数据关联、结论推导
这些任务在生产环境中频繁导致 Agent 系统崩溃。OfficeQA Pro 的价值在于:它测的不是「模型能不能回答问题」,而是「Agent 能不能在真实企业文档中闭环完成任务」。
🔥 关键数据
核心指标
- 准确率 50%:OfficeQA Pro 历史上首个突破 50% 的模型
- 错误率降低 46%:相比 GPT-5.4,几乎砍掉一半错误
- SOTA:在所有评测模型和 Agent 组合中排名第一
最大提升领域:解析重型工作流
Databricks 观察到 GPT-5.5 最大的提升出现在「解析重型」场景——扫描件和老文件的数字提取。Singhvi 描述:「Earlier models like 5.4 were unable to parse all the digits correctly, but it seems like 5.5 has a step-function lift in parsing older documents and scanned PDFs.」
这是一个典型的「一步错、步步错」问题:解析阶段漏掉一个数字,后续整个推理链条全部偏离。GPT-5.5 在源头就解决了这个问题。
多步编排的可靠性提升
另一个关键改进是多步任务编排的可靠性。Singhvi 指出:「One thing that we saw with 5.4 is sometimes it would go on these unnecessary search detours, and that would cause very inefficient trajectories.」
GPT-5.4 会在执行过程中「跑偏」——去做不必要的搜索、探索无关的上下文,导致效率低下甚至任务失败。GPT-5.5 能精准检索上下文,走完完整流程,无需额外人工监督。
🧠 技术架构:AgentBricks + Agent Supervisor API
Databricks 通过 AI Unity Gateway 将 GPT-5.5 提供给企业客户,核心架构由两部分组成:
- AgentBricks:Agent 构建框架,支持企业自定义 Agent 工作流
- Agent Supervisor API:Agent 编排层,GPT-5.5 作为 supervisor 协调多个专业 Agent 的解析、检索和执行
在这个架构中,GPT-5.5 不是直接处理所有任务,而是作为「监督者」角色——编排专业 Agent 完成子任务,确保整体流程的可靠性。Singhvi 预测:「We're going to see a lot of customers using AgentBricks and Agent Supervisor API for custom agent workflows. Having GPT-5.5 supervise these workflows is really exciting.」
🔑 关键洞察
洞察一:模型能力的天花板在「多步编排的可靠性」,不在「单次推理」
这是 Harness Engineering 的核心观点在真实企业场景中的验证。GPT-5.5 的突破不只是「推理更准了」,而是「在多步编排中更可靠了」。从 5.4 到 5.5 的 46% 错误率降低,主要来自两个方面:
- 源头准确性:解析阶段不再漏关键数据
- 流程可靠性:不再「跑偏」去做不必要的搜索
这两个改进都不是「单次推理能力」的提升,而是「系统级行为」的改善。模型在 harness 中的表现,远比模型本身的能力更重要。
洞察二:企业 Agent 的真正瓶颈是「文档解析」,不是「推理能力」
OfficeQA Pro 揭示了一个被忽视的事实:企业 Agent 最频繁失败的地方不是「想不明白」,而是「看不清楚」。扫描件、老文件、非结构化文档——这些是企业数据的主体,也是 Agent 最容易出错的地方。
GPT-5.5 的「step-function lift in parsing」表明,模型在文档理解层面的进步可能比推理层面的进步更有价值。这对企业 Agent 部署的启示:与其追求更强的推理模型,不如先解决文档解析的准确性。
洞察三:Agent Supervisor 模式正在成为企业 Agent 的标准架构
Databricks 的 AgentBricks + Agent Supervisor API 架构代表了一种趋势:企业 Agent 不再是「一个模型干所有事」,而是「一个 supervisor 编排多个专业 agent」。这与 Harness Engineering 的核心主张高度一致——系统设计比模型能力更重要。
GPT-5.5 在这个架构中的角色是「supervisor」而非「worker」,这暗示了模型能力的正确使用方式:让最强的模型负责编排和监督,而非直接执行所有子任务。
🚀 引发思考
对 Agent 部署的启示
如果你的企业 Agent 还在用「单模型 + 简单 prompt」的架构,是时候考虑引入 supervisor 模式了。Databricks 的实践表明,即使是最强的模型(GPT-5.5),在 supervisor 架构下的表现也显著优于直接执行模式。
对模型评测的启示
OfficeQA Pro 这类「企业真实任务」基准正在取代传统 benchmark。未来 12 个月,我们很可能看到:企业选型不再看 HumanEval/SWE-Bench,而是看「在我的真实文档场景中,Agent 的闭环完成率是多少」。
与 Harness Engineering 的呼应
这篇文章的核心论点——「模型是引擎,Harness 是整车调校」——在 Databricks 的实践中得到了完美验证。GPT-5.5 在 OfficeQA Pro 上的 SOTA 表现,离不开 AgentBricks + Agent Supervisor API 这套 harness 的支撑。没有好的 harness,再强的模型也无法在企业场景中发挥真正实力。
📎 相关阅读
- OpenAI 官方案例:https://openai.com/index/databricks/
- Databricks AgentBricks 文档:https://docs.databricks.com/
- OfficeQA Pro 基准:Databricks 企业级 Agent 评测基准,覆盖扫描 PDF 解析 + 长上下文检索 + 多步推理
逍遥云初 | 2026.05.18






