阅读地图:如何理解第一本书与这本比较书

如果把这两个目录都看成在写 AI coding agent,那么最容易误读的地方,是把它们当成两份重复文档。它们并不重复,分工其实很清楚。

第一本书更像单体解剖。它以 Claude Code 为样本,讨论一套可控 agent 为什么必须具备控制面、query loop、工具权限、上下文治理、恢复路径、多代理验证和团队制度这些器官。它要回答的问题是:一套能在真实工程环境里持续工作的 harness,内部骨架应该是什么样。

这本比较书更像比较解剖。它把 Claude Code 和 Codex 放在一起,比较两者如何承认模型不可靠,以及如何把秩序安放在不同层级。它要回答的问题是:同样是做 harness,哪些设计更接近共识,哪些体现了不同工程路线的取舍。

现在还可以再多补一层用途:当你把前面这些判断带去看第三方 harness 时,也更容易识别一种常见误区。很多系统表面上也有 memory、skills、compact 和多代理,但上下文治理的主轴仍然是先把大量文本塞进 prompt,超了再截断和补救。这种路线看上去像“信息更全”,实际往往更费 token,也更容易把工作语义冲淡。

换句话说,可以把两者理解成同一研究计划的前后两步:

  • 第一步,在第一本书里先抽出 Harness Engineering 的一般原则。
  • 第二步,在这本比较书里再看这些原则如何在两套系统里分别落地。

先看第一本书:Claude Code 给出的九个结构判断

第一本书的主线可压成九条:harness 先约束模型别把工程环境弄坏;prompt 是控制平面的一部分;query loop 才是 agent 的心跳;工具是受审批、调度、中断语义约束的执行接口;上下文越多不等于越好,memory / CLAUDE.md / compact 本质是预算治理;错误属于主路径,恢复要第一等设计;多代理的价值在职责分区与独立验证;团队落地必须把规则沉淀成可复用制度;最终这些抽成一套稳定的 Harness Engineering 原则清单。

只读第一本书会得到一个强印象:Claude Code 的系统气质偏运行时治理——它先关心会话如何连续运行、工具如何别闯祸、恢复如何别把系统拖进死循环、验证如何别沦为形式。

再看这本比较书:同一个问题,Claude Code 和 Codex 从哪里起笔

这本比较书在这个基础上,把比较轴明确拆成了几层。

控制面

Claude Code 更像动态 prompt 装配线。它把很多秩序压进运行前后的 prompt 拼装、会话状态和上下文治理里。

Codex 更像显式控制层。它把 instruction fragments、审批策略、工具 schema、thread、rollout、hook 等结构尽量模块化、类型化、可组合化。

连续性

Claude Code 把连续性压进主循环,强调 query loop 的心跳纪律。

Codex 把连续性拆进 thread、rollout 和 state bridge,强调状态如何被结构化持有和恢复。

工具与权限

Claude Code 偏运行时约束,重点在调用时如何审批、如何中断、如何避免危险动作直接落地。

Codex 偏策略语言和工具契约,重点在 schema、approval policy、sandbox 和 exec policy 这些显式器官。

本地治理

Claude Code 倾向把地方经验收编成现场记忆,例如 CLAUDE.md、memory、skills 和工作流约束。

Codex 倾向把地方制度挂到结构化注入和事件系统上,例如 instructions、skills、hooks 和明确的工具边界。

多代理与验证

Claude Code 强调多代理是运行时职责分区,验证必须独立于实现阶段。

Codex 则更强调通过显式委派、持久状态和工具化协作,把验证从“礼仪动作”变成可跟踪的系统能力。

合起来以后,真正清楚的是什么

把第一本书和这本比较书放在一起看,能得到三个更完整的结论。

第一,比较的重点主要落在 harness

这两套文档反复指向同一个事实:AI coding system 的核心挑战,首先是如何让模型在终端、文件系统、权限和团队制度中不失控;模型能力的提升要放在这个前提里理解。

第二,Claude Code 和 Codex 的差别,主要是秩序安放的位置不同

Claude Code 更像从运行时事故经验里塑出来的系统,优先解决连续性、恢复和现场治理。

Codex 更像从显式结构设计里塑出来的系统,优先解决控制层命名、策略表达、边界清晰和可组合性。

第三,后来者不该照抄产品,而该识别自己的主要不确定性

如果你的问题是长会话容易失控、恢复路径很脆、验证总被跳过,那么更该先学第一本书强调的运行时纪律。

如果你的问题是规则来源太散、权限边界不清、工具契约不稳定、团队很难复制同一套行为,那么更该先学这本比较书里总结出的 Codex 式显式控制层。

如果你看到某套系统主要靠堆叠 bootstrap 文本、身份设定、技能目录和工作区说明来维持连续性,那也不必急着被“上下文很多”这件事打动。很多时候,这更像一种尚未把上下文真正治理起来的过渡状态,离成熟的第三条路线还有一段距离。

推荐阅读顺序

如果你是第一次进入这套材料,推荐按下面的顺序读。

  1. 先读序言,先确认这套比较关注的是秩序放在哪一层,不只是罗列功能表。
  2. 再读第 1 章 为什么要把 Claude Code 和 Codex 放在一起看,建立问题意识。
  3. 然后顺着第 2 到第 6 章读完控制面、连续性、工具治理、本地制度和多代理验证这五条比较轴。
  4. 如果只想快速看总结,直接读第 7 章 殊途同归,还是各表一枝。
  5. 如果你的目标是自己动手搭系统,最后读第 8 章 如果你要自己做:该向谁学,先学什么。这一章现在也补了一张三路对照图,用来说明为什么有些 harness 明明“上下文很满”,却依然又贵又乱。

一句话总结

第一本书解释的是:为什么一个可控的 agent 必须采用这种结构。

这本比较书解释的是:当两套系统都认真做 harness 时,它们为什么会长得不一样。

results matching ""

    No results matching ""