撰文:硅谷 Alan Walker

一周之内三家公司做了同一件事,这才是重点2026 年 8 月 20 日California Ave 的酒吧,第二杯还没喝完,群里已经在传「OpenAI 全面开源 Codex Harness」——但真正值得看的不是这一条消息,是它前面六天里发生的另外两件事。01 先把话说准:开源的到底是什么8 月 19 日,OpenAI 开发者博客发了一篇《Codex as a platform: build on the open agent harness》。中文圈翻成了"全面开源"。这个说法有两处不准,得先修掉,不然后面全是错的。
第一,不是新开源。Codex CLI 从 2025 年 4 月发布起就是开源的,用 Rust 写的,MIT / Apache2.0 许可。8 月 19 日这篇不是一次代码发布,是一次定位发布——把已经开源的一堆东西,重新包装成"平台"这个叙事。新东西是 app-server 协议、官方 SDK,和一整套"怎么把 Codex 装进你自己产品里"的说明书。
第二,也是最关键的——不是"全面"。OpenAI 在文章里写得清清楚楚:开源的是 harness 和集成层,模型访问与托管服务 仍然是分开的。先解释一下 harness 是什么模型只会做一件事:给它一段文字,它吐一段文字。它不会读文件、不会跑命令、不会等你点"同意"、不会记住上一轮干了啥。harness 就是包在模型外面、让它能干活的那一整套东西:怎么找上下文、怎么调工具、怎么控制沙箱权限、什么时候停下来要你批准、怎么把上一轮的结果接到下一轮。
模型是发动机,harness 是变速箱、方向盘、刹车和仪表盘。OpenAI 送出去的是车壳和底盘,发动机还锁在自己车间里。02 时间线:三家公司,七天把日历摊开,这件事的性质就完全变了。2026 年 8 月,harness 层的一周8 月 13 日 - DeepSeek 发布 DeepSeek Harness v0.1,MIT 许可,GitHub 开放下载,公开对标 Claude Code。同日发布 V4-Pro,原生支持 OpenAI Responses API,并且直接集成 Codex。8 月 18 日 - Block(Square 和 Cash App 的母公司)开源 Berd——一个本地桌面应用,用一个界面同时管 Goose、Claude Code 和 Codex。8 月 18 日 - Anthropic 的 Claude Code CLI 发布 v2.1.229 性能修复,把 p99 CPU 占用从 24% 压到 10%(改了 Bun 垃圾回收的调度方式)。8 月 19 日 - OpenAI 发布《Codex as a platform》。看出来了吗?harness 这一层,在这七天里被三家公司同时按到了"免费"这个价格上。DeepSeek 用 MIT 许可送,Block 直接送了个统一壳子,OpenAI 第六天出来说"我们的也是开源的,而且是标准"。
这一段是全文的地基你没法卖一样马上就要免费的东西。你只能决定,要不要当那个把它送出去的人。DeepSeek 在 8 月 13 日把时钟按下去了。OpenAI 在 8 月 19 日回答的,不是"我要不要开源",而是"这件事的署名权归谁"。时间差只有六天,这不是巧合。
一句话解读把这理解成 OpenAI 主动出招,会误判它的处境。更准确的说法是:它抢在别人之前,把一个已经保不住的东西送了出去,并且要求署名。03 那句最容易被跳过的话整篇公告里最重要的一句,藏在中段,语气平淡到几乎让人跳过去:"开源的这一层是 harness 和集成界面;模型访问 与 托管服务 保持独立。"这一句话把整件事的结构说完了。而且它有一个现成的、所有人都见过的模板——举个例子 · 安卓
安卓是开源的。任何人都可以拿 AOSP 源码去改、去发行、去做自己的手机系统。但 Google 移动服务(GMS)——应用商店、地图、推送、账号体系——不开源。结果是什么?十几年过去,能 fork 安卓的公司有几十家,能在没有 GMS 的情况下把手机卖到全球的,几乎没有。Google 送掉了操作系统,留下了操作系统之上那层让它值钱的东西。
Codex harness 就是 AOSP。模型访问加托管服务,就是 GMS。
这个结构的精妙之处在于:送掉的那一层,本来就快没有定价权了;留下的那一层,定价权在变强。04 为什么 harness 突然这么重要要理解 OpenAI 为什么肯送,得先理解 harness 到底能带来多大差别。公告里给了一个数,我认为是全文最硬的一个数据点。同一个模型,换一套 harness
模型 - GPT-5.6 Sol,一字未改测试 - ARC-AGI-3改动 - 只改了两个 harness 设置:保留推理链(retained reasoning)+ 上下文压缩(context compaction)结果 - 得分从 13.3% 升到 38.3%,同时输出 token 减少到原来的 六分之一
把这个数分析一下:模型没动,只动了外面那层壳,能力接近翻了三倍,成本降到六分之一。一句话解读这意味着在今天这个阶段,harness 对"你实际能拿到多少智能"的影响,可能比换一代模型还大。那么一个反直觉的推论就出来了:如果外面这层壳的杠杆有这么大,而全世界大部分人的壳都做得很烂,那就等于你的模型一直在被别人的烂壳测量、被低估。把自己的壳开源,是最省钱的一种自证——让所有人在评估你的模型时,用的是你自己调好的那套。
再看两个技术细节,能佐证这不是营销文案:网络成了瓶颈。OpenAI 工程师在 AI Engineer World's Fair 上讲过,当 GPT-5.3 Codex Spark 在 Cerebras 硬件上跑到每秒 1000 个 token 时,卡住的不再是推理速度,是 网络往返。于是他们把 harness 从 HTTP 请求改成了 WebSocket 长连接。推论:推理已经快到让"管道"成为限制。这条路继续走下去,harness 的重要性只会更高。
工具太多会撑爆上下文。harness 里用了"延迟工具"和"工具搜索"两个设计,目的是别把几百个工具定义一股脑塞进上下文。MCP 生态铺开之后,这是一个真实的、马上会撞上的工程问题。05 是冲着 Anthropic 上市来的吗
先说时间:Anthropic 6 月保密递交招股书,市场预期 9 月或 10 月 上市,传的目标估值 2 万亿美元。OpenAI 8 月 19 日 发这篇。正好落在路演窗口里。但要判断它有没有杀伤力,得先看杀伤路径是什么。Anthropic 的估值故事里,有一条很关键的支柱:Claude Code 是稀缺资产。它长得快、赚钱、而且是 闭源 的——外面买不到。第三方追踪的数字是 Claude Code 占 Anthropic 总 ARR 约 22%。OpenAI 这篇文章要传达的,正好是这条支柱的反面:
攻击点agent 的那个执行循环,不是稀缺资产。它是基础设施,而且我们免费送,还带 SDK 和示例应用。如果市场信了这一句,Claude Code 就从"稀缺资产"变成"做得比较好的一个实现"。倍数会跟着这个判断走。但我要把这个判断的边界说清楚,不然就是危言耸听:它打的是 叙事,不是报表。harness 免费,不代表模型免费。Claude Code 的收入来自 token 消耗和席位订阅,不来自卖 harness——Anthropic 从来没卖过 harness。所以短期内这一击落不到损益表上。
它只够到 22%。另外 78% 是 API 和企业业务,跟 harness 是不是开源基本无关。路演窗口里,叙事就是钱。承销商定价靠的是可比公司和故事强度。在这个特定的六周里,"编程 agent 是不是稀缺资产"这个问题的答案,值真金白银。一句话解读时间点太巧了,说完全没有考虑对手的上市窗口,不太可信。但把它读成"OpenAI 为了打击 Anthropic 才开源",会看错因果——DeepSeek 已经在六天前把这层送出去了,OpenAI 不跟就是白丢署名权。对上市窗口的伤害,更像是一个顺手的副产品,而不是主要动机。06 做 harness 的创业公司,生意没了
这是所有影响里最直接、最没有悬念的一条。一家创业公司如果原来的定位是"我们做一个更好的 agent 运行时/执行循环/CLI 工具",那么从 8 月 19 日起,它的融资材料需要重写。理由很简单:agent 执行循环 → 免费(MIT / Apache 2.0,Rust 写的,生产级)客户端协议 → 免费(app-server,有完整文档)编程接口 → 免费(官方 Codex SDK)可参考的完整实现 → 免费(Relay 示例应用,带 MCP 工具和人工审批)
另一家的同类品 → 免费(DeepSeek Harness,MIT,6 天前)OpenAI 甚至没有用"竞争"这个动作。它在文章里直接对创业者说:别去 复刻 一个换了 logo 的 Codex app,去做那些我们不做的东西——你自己的界面、你自己的上下文、你自己的工具、你自己的审批流程。
举个例子这套打法有个老名字,叫「把互补品做成白菜价」。Google 免费送安卓,是为了让手机变便宜,好让更多人用搜索。Meta 免费送 React 和 PyTorch,是为了让前端和 AI 人才用它的标准长大。你送掉的东西越不值钱,你留下的东西就越值钱——前提是这两样必须一起用。那还剩什么能做?三块,而且都不在运行时这一层:垂直的上下文和工具。报税、安全事件响应、供应链调度——OpenAI 自己点名说这些归你。Thrive Holdings 和 Crete 做的报税 agent 处理了 7000 份报税表、把准备时间砍掉约三分之一,这是个真实的样本。
评测与可观测。agent 跑错了怎么发现、怎么归因、怎么回归测试。这一层还没有标准答案。跨模型的编排层。Block 的 Berd 就是这个方向——一个界面管三家的 agent。但要注意,Block 自己把它开源了,说明这一层也很难直接卖钱。07 对 DeepSeek、Kimi 是帮忙还是下套
这是全文我认为最值得想清楚的一节,因为直觉给的答案是错的。表面上:这是天大的好事harness 开源了,理论上任何开源模型都可以塞进去跑。DeepSeek 也确实立刻这么做了——V4-Pro 原生支持 OpenAI 的 Responses API,并且直接集成 Codex。国产开源模型的开发者体验,一夜之间接上了世界上打磨得最好的那套壳。往下一层:接口的定义权归谁
问题在于,DeepSeek 为了接进这套壳,做了一件事——它让自己的 API 去 兼容 OpenAI 的 schema。而 Responses API 的规范,现在由一个多厂商机构治理,成员包括 Nvidia、Ollama、LM Studio。这一段是重点
把自己的 API 交给一个标准组织去治理,看上去是放权。实际效果是相反的:标准组织会让一个原本属于某一家的设计,变成所有人的默认。标准委员会几乎从不推翻发起者的架构,它们的工作是把它固化下来、发给全行业。举个例子这就像所有电器厂商都同意用同一种插座。听起来很公平——直到你意识到插座的形状是其中一家画的。之后每一个新做电器的人,都得先量一遍那个孔位。做电器的可以随便竞争、随便降价,但"什么叫能插上"这件事,永远由画孔位的人定义。
后果:模型从"平台"降级成"零件"顺着这条路走下去,会发生一件对开源模型很不利的事:用户的工作流、记忆、插件、技能、审批规则、上下文管理策略——全都活在 harness 里,不在模型里。模型变成了那个可以 随时被拔下来换掉 的部分。好消息是:换模型变容易了,DeepSeek 和 Kimi 可以靠价格和权重抢份额。坏消息是:换模型变容易了。你抢来的份额,明天同样可以被下一家用同样的方式抢走。把它说完整开源 harness,把模型之间的竞争,从平台战争降级成了零件比价。而在零件比价里,价格一定往下走,利润归那个定义了插孔的人。
所以对 DeepSeek、Kimi 这类开源模型来说,这一步短期是实打实的助力—— 分发成本骤降,开发者能立刻用上。长期是一个结构性的陷阱——你越好用,就越证明"模型是可替换零件"这个命题,而这个命题成立之后,最难赚钱的恰恰是做零件的。一句话解读
OpenAI 没有拦着开源模型进场。它做的是把场地铺好、把规则写好,然后欢迎所有人进来打——在它画的球场上。08 商业模式:送中间,收两头把整条价值链摊平,OpenAI 的取舍一目了然。最底层 - 模型权重、推理算力、托管服务、企业管控 → 收钱,且不开源
中间层 - agent 执行循环、客户端协议、SDK、CLI → 免费送出上层 - 界面、垂直上下文、工具、审批流 → 交给开发者做最上层 - ChatGPT 约 10 亿月活、插件生态、结算与广告 → 收钱,且不开源注意最后一行。翻 OpenAI 开发者文档的侧边栏,能看到 Commerce(结算)和 Ads(广告)两套完整 API——商品目录、转化追踪、广告主账户、竞价、效果衡量,一应俱全。
这才是终局的形状:免费送掉中间那层没有定价权的管道,把流量入口和结算入口这两头攥死。
举个例子你可以把 harness 想成高速公路,OpenAI 免费修、免费让所有人跑。但加油站是它的(模型和算力),路尽头那座城是它的(10 亿月活的 ChatGPT),城里收租和收广告费的也是它(结算和广告 API)。路修得越好、跑的车越多,两头越赚钱。修路这件事本身赚不赚钱,根本不重要。顺带回答"是不是为了资本市场":是,而且很有效。"我们有一个很好用的编程 app"和"我们是 agent 时代的平台层",在募资材料里是两个完全不同量级的故事。前者的对标是一家软件公司,后者的对标是安卓和 Windows。09 数字与摩擦
几个能 量化 的东西,正反都列出来。往上的· 用户规模:Codex 从 2026 年 3 月的 200 万周活,到 8 月约 1000 万月活。OpenAI 整体约 10 亿月活。· 已经接进来的:GitHub 和 JetBrains 把 Codex 作为 agent provider 接入了自己的 IDE(7 月 7 日);Cisco 用 Codex SDK 做了 Cloud Control 里的 App Builder;Thrive Holdings 与 Crete 的报税系统跑了 7000 份报税表。
· 内部自证:OpenAI 的 harness 团队从 2025 年 8 月到 2026 年 1 月,用 agent 写出了 100 万行生产代码、1500 个合并 PR,期间没有一行源码是人手写的;团队到七个人时,稳定在每人每天3.5 个 PR。10 Anthropic 手里还有什么牌
这一节必须写,否则前面九节就是选择性叙事。Anthropic 在这件事上真实的暴露面是:Claude Code 的 harness 是闭源的。如果行业在一套开放 harness 加一套开放协议上标准化了,Claude 的处境就会变成"一个可以插进去的模型",而 Claude Code 那套完整体验的差异化,会越来越难讲清楚。这是真的风险,不该回避。
但棋盘上还有另外一半:值得注意的事实OpenAI 这篇公告里,MCP 出现了七次以上——"应用自有的 MCP 服务"、"MCP 工具"、Relay 示例应用的工具层,全部建立在 MCP 之上。MCP 是 Anthropic 提出并开源的协议。再翻一层:OpenAI 的开发者文档里,有一个页面叫 "Submit a Claude Code plugin"。所以真实的格局,比"OpenAI 围剿 Anthropic"复杂得多:
Anthropic 拿下了 工具协议层。MCP 已经是事实标准,连对手的旗舰产品都建在上面。OpenAI 正在拿下 执行循环层 和 API schema 层。harness 加 Responses API。两家都在对方的地基上盖房子。这不是一方吃掉另一方,是两个标准体系在互相咬合。一句话解读这一层的竞争,赢面不在"谁的产品更好",在"谁定义的东西被更多人当成默认"。到今天为止,工具怎么接是 Anthropic 说了算,agent 怎么跑是 OpenAI 说了算。两家各拿了半张牌桌。11 写在最后
回到最开始那个问题:到底是几个意思?我的答案是,主要是三个意思,重要性递减:第一,抢署名权。DeepSeek 8 月 13 日已经把 harness 用 MIT 送了出去,Block 8 月 18 日送了个统一壳子。这一层的价格已经是零,OpenAI 唯一能争的,是"这套标准是谁定的"。它在第六天出手,争到了。第二,把智能的度量权收回来。同一个模型,换两个 harness 设置,得分从13.3% 到38.3%,token 降到六分之一。当外壳的 杠杆 有这么大,你就不能容忍全世界用别人做的烂壳来评估你的模型。开源自己的壳,是最 省钱 的自证方式。第三,把中间那截不赚钱的管道送掉,把两头攥紧。底下是模型和算力,上头是 10 亿月活加结算和广告。中间那截,本来就没有定价权。
至于"打击 Anthropic 上市"——时间点太巧,不信它完全没考虑过。但把它当成主要动机,会看错这件事的因果方向:OpenAI 不是在选择进攻,它是在被推着做一件不做就吃亏的事,然后顺手把动作做得很漂亮。真正需要盯的,是九月十月两件事撞在一起:Anthropic 的 招股书,和第一批真正建在 Codex app-server 上的第三方产品。前者会把叙事换成审计过的数字,后者会告诉你这套标准到底有没有人真的用。
核实说明一、已核实(一手来源)· OpenAI 开发者博客《Codex as a platform: build on the open agent harness》,2026 年 8 月 19 日,作者 Nicolas Bonamy、Derrick Choi。文中关于 harness 定义、三种集成方式(codex exec / Codex SDK / app-server)、Relay 示例应用、以及"开源层为 harness 与集成界面,模型访问与托管服务保持独立"的表述,均直接来自该文。
· ARC-AGI-3 数据:保留推理与上下文压缩使 GPT-5.6 Sol 得分从 13.3% 升至 38.3%,同时输出 token 减少至六分之一——来自该文引用的 OpenAI 官方页面。· 已公开的采用方:GitHub 与 JetBrains(2026 年 7 月 7 日)、Cisco App Builder、Thrive Holdings 与 Crete 的报税系统(7000 份报税表、准备时间约减三分之一),均在该文中列出并附官方链接。
· OpenAI 开发者文档确实包含 Commerce 与 Ads 两套 API,以及名为「Submit a Claude Code plugin」的页面(见开发者站导航结构)。· DeepSeek Harness v0.1 于 2026 年 8 月 13 日发布,MIT 许可、GitHub 开放,公开对标 Claude Code;同日 DeepSeek-V4-Pro 发布,原生支持 OpenAI Responses API 并集成 Codex(VentureBeat,8 月 13 日)。
· Codex CLI 于 2025 年 4 月首发;2026 年 3 月超过 200 万周活(Wikipedia 引 Reuters 等)。二、单一来源 / 需二次核对· harness 用 Rust 编写、MIT / Apache2.0 双许可,Responses API schema 由含 Nvidia、Ollama、LM Studio 的多厂商机构治理,以及 WebSocket 改造与「延迟工具/工具搜索」设计——来自 OpenAI 工程师 Dominik Kundel 在 AI Engineer World's Fair 的演讲报道(BigGo Finance 转述),未核对演讲原始录像。
· Codex「约 1000 万月活」与 OpenAI「约 10 亿月活」来自 The Deep View 的独家报道,非 OpenAI 官方披露。· harness 团队 100 万行代码、1500 个 PR、零人工手写代码、每人每天3.5 个 PR——来自 OpenAI《Harness engineering》博客及第三方转述(SaaSCity),数字口径未独立复核。
· Block 于 2026 年 8 月 18 日开源 Berd、Anthropic Claude Code CLI v2.1.229 的 p99 CPU 优化数据,均来自 explainx.ai 的行业汇总,未见双方官方公告原文。· Claude Code 占 Anthropic 总 ARR 约 22%,来自第三方追踪机构 TickerTrends 的估算,非 Anthropic 官方披露。Anthropic 从未单独公开 Claude Code 的 ARR。· Anthropic 2 万亿美元 IPO 目标估值为媒体转述的市场预期,非公司公开表态。
三、作者推断(非事实)· 「OpenAI 是被 DeepSeek 8 月 13 日的动作推着走、争的是署名权而非主动进攻」——这是基于时间线的推断,OpenAI 从未如此表述,也不排除其内部早有此规划。· 安卓 / GMS 的类比、「插座孔位」的类比、以及「开源 harness 把模型从平台降级为零件」的结论,均为作者判断。· 「打击 Anthropic 上市窗口更像顺手的副产品而非主要动机」为推断,无任何内部信息支持。
· 对 harness 创业公司剩余空间的三点判断(垂直上下文、评测可观测、跨模型编排),为作者判断。· 「工具协议归 Anthropic、执行循环归 OpenAI,两家各拿半张牌桌」为作者对当前格局的概括,随时可能被新事件推翻。四、重要提示· 本文由 Claude(Anthropic 制造)协助撰写,核心议题涉及 OpenAI 与 Anthropic 的直接竞争,存在最直接的利益冲突。第十节已尽量写出 Anthropic 真实的暴露面,但读者仍应假定本文存在无法完全消除的偏向。· 「全面开源」是媒体表述,不是 OpenAI 的表述。OpenAI 明确说明模型访问与托管服务不在开源范围内。
· 本文不构成投资建议。—— Kea


