OpenAI昨天连发四款重磅产品:Agents API、GPT-Live-1 API、Data Agent以及面向金融服务的ChatGPT。这些产品横跨了智能体、语音、数据和金融四大领域。然而,最引人注目的无疑是Agents API,因为它标志着OpenAI终于将Codex的底层能力彻底拆解并对外售卖。过去隐藏在Codex背后、负责维持Agent运行、调用工具、管理上下文及协同多个Agent的核心能力,如今已被封装成云端API,供开发者调用。
实际上,OpenAI拆解Codex的步伐早已开始。早在2025年4月,OpenAI在发布o3和o4-mini时便开源了Codex CLI,这相当于OpenAI版的Claude Code,直接安装在本地终端中。Agent如何运行、如何调用工具,所有细节都公开在GitHub上,开发者可以自行修改和运行。彼时,OpenAI只是单纯地开放了代码,至于如何使用,完全取决于开发者。
一个月后,真正的Codex云端版正式上线。用户可以将代码仓库交由它处理,每个任务对应一个独立的云端沙盒。Codex不仅能修改代码、运行测试、修复Bug,还能同时处理多个任务。几个月后的2025年10月,OpenAI发布了Codex SDK。这是一种开发者工具包,允许开发者用几行TypeScript代码启动驱动Codex CLI的Agent,获取结构化输出并保持任务状态。SDK非常适合后台工作流、自动化脚本和服务端程序,但若想构建像Codex IDE那样的完整客户端,仍显不足。
直到2026年2月,OpenAI公开了Codex App Server,首次系统地阐述了Codex背后的Harness机制。OpenAI明确指出,Codex Web、CLI、IDE扩展和Mac App虽然外观不同,但底层运行的是同一套Codex Harness——负责Agent循环、线程、工具执行、认证和状态管理的核心层。App Server为这套Harness增加了双向JSON-RPC接口。JetBrains、Xcode等客户端无需重新构建Agent循环,直接启动App Server即可驱动完整的Codex。
然而,App Server仍需开发者手动启动和维护常驻进程。若想将其稳定地部署为线上服务,依然存在诸多基础设施挑战。例如,构建一个Coding Agent网站,前端接上Codex后,后续的大量运行和基础设施问题仍需自行解决。
8月19日,OpenAI将这些分散的组件统一纳入“开放Codex Harness”的叙事中,明确将Codex从产品升级为平台。紧接着,在9月10日(美国时间),Agents API正式开放公测。开发者只需告知API四个要素——任务、模型、工具、运行环境——即可创建Agent。OpenAI负责托管和维护负责长会话上下文压缩、工具调度和子Agent协作的Codex Harness。甚至连执行环境也由开发者决定,可选择OpenAI沙盒、自建基础设施,或接入Cloudflare、E2B、Modal等第三方环境。官方明确表示Agents API本身不额外收费,开发者仅按实际使用的模型Token和工具付费;若使用OpenAI托管沙盒,计算资源则另算。
将这一年多的发展串联起来,OpenAI一直在做同一件事:将Codex从具体产品一层层拆解为可复用的能力,同时让开发者越来越省心。如果非要用一个名字来定义,这很像当年的SaaS,只不过这次被服务化的不是软件,而是Codex。
与此同时,盯上Harness的远不止OpenAI。DeepSeek发布的DeepSeek Harness(DSH)给出了一个等式:Agent = Model + Harness。DSH将Harness设计成一套高度模块化的开放框架,模型、工具、技能、会话、沙盒、存储、Agent循环、调度乃至UI都可以替换。DSH主张“一切皆插件”,鼓励开发者编写插件并适配框架,使得底层Harness可以通用。这和OpenAI现在的方向形成了有趣的对照:OpenAI虽然开源了Codex Harness,但Agents API更倾向于“服务”——Harness你可以自己用,也可以用开源的,但如果你嫌麻烦,可以直接不管,让我来替你安排。OpenAI负责托管和维护,开发者只需决定干什么、用什么工具、在哪里执行。OpenAI甚至准备在模型升级时同步更新Harness。某种程度上,OpenAI的路线更像是在押注云服务,而DeepSeek的路线则像是在建设开放生态。一个想让Harness像Linux,另一个则想让Harness像AWS。
值得注意的是,在托管Harness这条路上,Anthropic比OpenAI更早一步。早在2025年9月,Anthropic就推出了Claude Agent SDK,将Claude Code背后的工具、上下文管理、权限系统和子Agent能力开放给开发者。今年4月,它推出了Claude Managed Agents,将会话、Harness和沙盒拆分为独立层。Anthropic负责托管Harness和长任务,沙盒则既可由Anthropic提供也可接入外部环境。这与今天的Agents API思路高度一致。谷歌同样早已加入这一阵营,今年5月的I/O大会上推出了Gemini API的Managed Agents,将Antigravity Harness和沙箱托管化。
争论谁先谁后似乎并不重要,关键在于谁能成为开发者默认的Harness层。为什么模型公司都在抢夺Harness?正如DSH所言,Agent = Model + Harness。模型决定Agent的能力上限,而Harness决定它能否把活做完。一旦竞争维度从“智力”转向“执行力”,最占优势的未必是模型最顶尖的AI公司。因为Agent真正开始干活时,需要调用邮件、文档、会议、通讯、账号权限等,而这些往往掌握在传统平台公司手中。国内“办公Agent大战”便是典型例子:大厂在互联网时代积累的平台优势,在Agent时代恰好成为Agent干活所需的工具。模型公司需要一点点接入它们没有的入口,而平台公司本身就掌握着这些入口。AI公司需要重新连接现实世界,而平台公司手里有一大串钥匙。
在这条路上,谷歌可能是最夸张的“全家桶”选手。从TPU、云基础设施到Gemini,再到Search、Workspace、Chrome和Android,谷歌几乎覆盖了AI从底层技术到最终用户的所有关键环节。Search、Gmail、Calendar、Drive、YouTube、Maps等产品,天然构成了可以被Agent调用的数字环境。事实上,谷歌正在将这些散落在各处的Agent能力,在底层收拢到同一套执行系统。但对于用户来说,目前谷歌的产品线依然混乱——Gemini Spark、Workspace Studio、Antigravity、Gemini Enterprise以及Search里的Information agents,场景各异。用户若想把复杂任务交给谷歌,往往不知道该找谁。谷歌已拥有完成这一切所需的大部分条件,缺的只是一个足够简单的产品答案。如果谷歌能将这套“全家桶”整合成统一的Agent工作台,让同一个Agent系统穿透整个生态,让用户习惯“有问题找谷歌”,全球Agent市场的格局恐将被彻底改写。当然,对于国内用户而言,这可能还需要时间。毕竟,国内的Agent大战还有得打。
