Coding Agent 双雄更新:OpenAI Codex 全面扩张 × Anthropic Claude Opus 4.7 发布

📌 核心问题:Coding Agent 正在吞噬整个软件开发流程

2026 年 4 月第三周,两家 AI 巨头同时发布了重磅更新——OpenAI 将 Codex 从"代码编辑器"升级为"全能操作系统",Anthropic 则发布了 Claude Opus 4.7 强化 Agent 自主执行能力。这不是巧合,而是行业趋势的集中爆发:Coding Agent 正在从"写代码的工具"进化为"管理整个软件开发生命周期的自主系统"。

两个更新的共同信号:Agent 不再是被动的代码补全工具,而是能主动规划、跨应用协作、长时间自主运行的"数字同事"。


🔥 OpenAI Codex:从代码编辑器到全能操作系统

更新概览

2026 年 4 月 16 日,OpenAI 发布了 Codex 桌面应用的重大更新。这次更新的核心定位是:Codex for (almost) everything——不再局限于代码,而是覆盖软件开发的全生命周期。

六大核心能力

1. 后台计算机使用(Background Computer Use)

  • Codex 可以通过"看屏幕、点击、打字"来操作 Mac 上的所有应用
  • 多个 Agent 可以并行运行,不干扰用户在其他应用中的工作
  • 适用于前端迭代、应用测试、以及没有 API 的软件操作
  • 关键意义:Agent 从"代码世界的居民"变成了"桌面世界的居民"

2. 原生 Web 能力

  • 内置浏览器,用户可以直接在网页上给 Agent 发指令
  • 当前支持 localhost Web 应用,计划扩展到完全控制浏览器
  • 关键意义:Agent 的操作边界从本地扩展到了整个互联网

3. 图像生成(GPT-Image-1.5)

  • 结合截图和代码,在同一工作流中创建产品概念、前端设计、Mockup 和游戏素材
  • 关键意义:Coding Agent 开始具备多模态输出能力

4. 90+ 新插件生态

  • 覆盖 Atlassian Rovo、CircleCI、GitLab Issues、Microsoft Suite、Neon by Databricks 等
  • 结合 Skills、应用集成和 MCP Server
  • 关键意义:Agent 的工具链从"开发者工具"扩展到"企业协作工具"

5. 开发者工作流深度支持

  • GitHub PR 评审评论处理
  • 多终端 Tab
  • SSH 连接远程 devbox(alpha)
  • 侧边栏文件预览:PDF、电子表格、幻灯片、文档
  • Summary Pane:追踪 Agent 计划、来源和产物
  • 关键意义:Agent 从"写代码"扩展到"管理代码"

6. 记忆与长期任务

  • Memory 预览:记住个人偏好、纠正和积累的信息
  • 自动化:可复用对话线程,保留上下文
  • 定时任务:Agent 可以自己安排未来工作,跨天/跨周自动执行
  • 主动建议:基于项目上下文、插件和记忆,主动推荐下一步工作
  • 关键意义:Agent 从"一次性工具"变成"持续工作的同事"

定价与可用性

  • 当前面向 ChatGPT 登录的桌面应用用户推出
  • 企业版、教育版及 EU/UK 用户即将跟进
  • Computer Use 初始仅支持 macOS

🧠 Anthropic Claude Opus 4.7:Agent 自主执行的质变

更新概览

2026 年 4 月 16 日,Anthropic 发布 Claude Opus 4.7。这是 Opus 4.6 的直接升级,延续了约两个月的发布节奏。定价不变:输入 $5/M token,输出 $25/M token。

核心升级

1. 编程能力大幅跃升

  • 在 93 任务的编程基准测试中,分辨率比 Opus 4.6 提升 13%
  • 包含 4 个 Opus 4.6 和 Sonnet 4.6 都无法解决的任务
  • CursorBench 从 58% 跃升至 70%
  • 关键数据:Hex 评测中"低努力的 Opus 4.7 ≈ 中等努力的 Opus 4.6"

2. Agent 自主执行能力

  • 能连续工作数小时,遇到困难不放弃,而是持续推进
  • 在 Devin 的长时自主任务中表现突出,解锁了之前无法可靠运行的深度调查工作
  • Notion Agent 评测:+14% 准确率,工具错误减少 2/3,首次通过隐含需求测试
  • 关键意义:Agent 从"需要监督的助手"变成"可以委托的同事"

3. 视觉理解增强

  • 支持更高分辨率的图像理解
  • 能阅读化学结构、解读复杂技术图表
  • 在生命科学专利工作流中表现突出

4. 推理与判断力

  • 在推理过程中能发现自己的逻辑错误并自我纠正
  • 更有"主见"——不会简单地同意用户,而是提出自己的观点
  • Harvey 法律 AI 评测:90.9% 准确率,能正确区分"转让条款"和"控制权变更条款"

5. 安全保障(Project Glasswing)

  • 作为 Mythos Preview 网络安全能力的"试验田"
  • 内置自动检测和阻止高风险网络安全请求的机制
  • 正规安全研究人员可通过"网络验证计划"使用

生态反馈

  • GitHub Copilot:已集成 Opus 4.7
  • Amazon Bedrock:已上线
  • Google Vertex AI / Microsoft Foundry:已可用
  • Replit:同质量下成本更低,日志分析和 Bug 定位更高效
  • Notion:工具调用准确率和规划能力大幅提升

🔑 关键洞察

洞察一:Coding Agent 正在变成"软件开发操作系统"

OpenAI 的 Codex 更新清晰地展示了这个趋势:从代码编辑 → PR 评审 → 终端管理 → 浏览器控制 → 图像生成 → 记忆系统 → 长期任务调度。这不是"代码补全工具的升级",而是"软件开发操作系统的构建"。

Agent 的边界正在从"写代码"扩展到"管理整个软件开发生命周期"。2026 年的 Coding Agent,本质上是一个能理解上下文、跨应用协作、自主规划和执行的"数字开发团队成员"。

洞察二:Anthropic 和 OpenAI 在 Agent 赛道上走了不同的路

  • OpenAI:走"平台化"路线——把 Codex 打造成一个操作系统,通过插件生态和计算机使用能力,让 Agent 能操作一切
  • Anthropic:走"深度化"路线——把 Claude 打造成一个更聪明、更可靠、更能自主执行的 Agent,强调推理质量和长时运行的稳定性

两条路都有道理,最终可能殊途同归。但对于开发者来说,选择取决于场景:需要跨应用协作选 OpenAI Codex,需要深度推理和长时自主执行选 Claude Opus 4.7。

洞察三:Agent 的"记忆"和"主动性"是下一个竞争焦点

OpenAI Codex 的 Memory 功能和主动建议能力,标志着 Agent 从"被动响应"到"主动参与"的转变。当 Agent 能记住你的偏好、理解你的项目上下文、主动推荐下一步工作时,它就不再是工具,而是真正的"同事"。

这个方向值得持续关注——谁先做好 Agent 的记忆和主动性,谁就掌握了下一代开发者工具的入口。


📎 相关阅读

  • [Codex for (almost) everything](https://openai.com/index/codex-for-almost-everything/) - OpenAI 官方博客
  • [Introducing Claude Opus 4.7](https://www.anthropic.com/news/claude-opus-4-7) - Anthropic 官方博客
  • [Codex can now operate between apps](https://www.helpnetsecurity.com/2026/04/17/openai-codex-desktop-update-macos/) - HelpNetSecurity
  • [Claude Opus 4.7 - What Changed for Coding Agents](https://www.verdent.ai/guides/what-is-claude-opus-4-7) - Verdent AI
  • [Anthropic, OpenAI, or Cursor model for your agent skills?](https://tessl.io/blog/anthropic-openai-or-cursor-model-for-your-agent-skills-7-learnings-from-running-880-evals-including-opus-47/) - Tessl
  • [Claude Opus 4.7 in Amazon Bedrock](https://aws.amazon.com/blogs/aws/introducing-anthropics-claude-opus-4-7-model-in-amazon-bedrock/) - AWS Blog

逍遥云初 | 2026.04.24