Agent X-Ray
RuntimeNotesAbout
Notes/产品经理/Agent 基础知识/S06-实践

阶段 6 实践 — 四种 Harness 同构能力对照

5 分钟 · 更新于 2026-09-01

阶段 6 实践 — 四种 Harness 同构能力对照

本实践的产出最小产出:Pi、DeepSeek Harness、Codex 与 Claude Code 的四方同构能力对照图 完整产出:四方九格对照表 + 对照图 + 一次 Claude Code 运行实验 + 一次"内置/扩展/独立服务"三方案比较 + 一份选型模板

预计投入:8~12 小时(含精读)。本阶段读的量大,但产出的对照表会在阶段 7~14 反复被用到。


实践 1 · 九格对照表(先做这个,再画图)

用讲义的九个部件建表,四列填四个 Harness:

部件PiDeepSeek HarnessCodexClaude Code我的判断
① 指令装配谁的方案更适合我们?为什么?
② 模型适配
③ 工具管线
④ 上下文与压缩
⑤ 会话与状态
⑥ 执行环境
⑦ 权限与审批
⑧ 扩展点
⑨ 可观测性

填表规则

  1. 每格不超过两句话。写不下说明还没抓住要点。
  2. 必须写"取舍",不只写"做法"。例:不写"Claude Code 有多层压缩",写"Claude Code 用分层压缩保护长会话和缓存成本,代价是恢复合同、断路器和可观测性更复杂"。
  3. 最后一列是本表的价值所在。前四列是读书笔记,最后一列才是产品判断。
  4. Claude Code 每格要标证据等级:[源码][实测][推断],不要把快照细节当稳定公开契约。

精读路径(按部件找章节,不要顺读)

部件PidshCodexClaude Code
① 指令装配第 8 章第 3、9 章第 6 章第 5、6 章
② 模型适配第 4 章第 6 章第 5 章第 4 章
③ 工具管线第 5 章第 7 章第 8 章第 8、9 章
④ 上下文与压缩第 8、9 章第 9 章第 7 章第 4、7 章
⑤ 会话与状态第 10 章第 8 章第 12 章第 3、12 章;完整会话存储见教程范围说明
⑥ 执行环境第 5 章第 10 章第 9、10 章第 10 章
⑦ 权限与审批(刻意不做)第 10 章第 11 章第 9、10、11 章
⑧ 扩展点第 11 章第 2、12 章第 13 章第 11、14 章
⑨ 可观测性第 7 章第 8 章第 3 章第 4、9、11 章

起手先读:Claude Code 第 15 章,它已经给出了四方对照框架。

验收标准

  • 36 格填满,每格 ≤ 2 句
  • Claude Code 9 格全部标出证据等级
  • "我的判断"一列 9 条全部有结论且有理由
  • 至少 2 处结论是"某家方案更适合我们"或"四家都不抄,理由是…"——如果九条全选同一家,说明没有考虑自己的用户群、威胁模型和成本

实践 2 · 同构能力对照图(⭐ 必做)

做法:用 diagram 技能画一张图,要求:

  • 横轴:九个部件
  • 纵轴:四个 Harness
  • 三种视觉强度表示:内核内置 / 扩展实现 / 刻意不做
  • 在"刻意不做"的格子上标注理由(Pi 的三个"不做"是最好的素材)

加分项:在图上加第四行——"我们要做的产品",把九格填上目标状态。这一行画完,阶段 14 综合项目 A 的架构图就有底稿了。

验收

  • 图能一眼看出三者的取舍差异
  • "刻意不做"的格子有理由,不是留白
  • 能对着图讲清"为什么同一个能力,四家的答案完全不同"

存放Excalidraw/ 或本目录,建议命名 三种Harness同构能力对照.excalidraw.md


实践 3 · Claude Code 运行证据小实验

不要只依赖源码拆解,选一个可公开观察的机制做最小实验。推荐从以下三项选一:

实验观察点
长会话压缩压缩前后目标、约束、待办是否保留;原始记录能否回溯
Fresh vs Fork 委派Prompt 重复量、主上下文占用、结果质量与成本
Hook 工具治理Hook 是否能阻止/改写调用;失败是否污染日志或上下文

记录格式至少包含:版本、配置、输入、事件顺序、实际结果、结论及证据等级。无法实测的内部机制明确写 [推断],不要补成事实。

验收

  • 至少一项实验有可重复步骤和原始观察记录
  • 结论区分公开行为与内部实现推断

实践 4 · 一个能力,三种实现方案的比较

任务:挑一个具体能力,比较"内核内置 / 扩展实现 / 独立服务"三种方案。

推荐候选(挑一个和你实际工作相关的):

候选能力为什么值得比较
长期记忆三种方案在生产里都有真实案例
审批与权限Pi 不做、dsh 留接缝、Codex 内置,三档齐全
知识检索(RAG)本仓的 GBrain 就是"独立服务"方案的实例

比较维度

维度内核内置扩展实现独立服务
首次交付成本
长期维护成本
谁能改 / 改要发版吗
跨产品复用
故障隔离(它挂了会怎样)
可观测性
版本兼容负担
数据边界与合规

结论要求:给出推荐方案 + 触发切换的条件。例如:"先做扩展,当出现第二个消费方单实例数据量超过 X 时,拆成独立服务。"

本仓的现成案例 GBrain 就是"独立服务"路线的活样本:跨源索引、多客户端可见、独立部署与升级。它的三个已知陷阱(embedding key 只在 systemd EnvironmentFile 里、源路径禁止重叠、新源要 rescope 才对 MCP 客户端可见)恰好都是独立服务方案特有的运维成本——把它们写进"长期维护成本"那一格,比任何理论分析都有说服力。


实践 5 · 《Agent Harness 产品架构选型模板》

把前三个实践的结论固化成一份可复用的模板,供以后每次做 Agent 方案时套用。

模板骨架

text
一、用户与风险
   1. 目标用户是谁?技术水平?
   2. 出错时谁承担后果?
   3. 由此确定:harness 该兜住多少

二、形态选择
   4. 本地 / 云端 / 嵌入式 / 混合?依据是什么?
   5. 未来 12 个月会有几个前端?(决定要不要协议先行)

三、九个部件的目标状态
   6~14. 每个部件:内置 / 扩展 / 外部服务 / 不做 + 理由

四、成本与风险
   15. 跨平台成本(注意 Windows 沙箱系数)
   16. 扩展点带来的长期兼容承诺
   17. 提示词如何版本化与灰度

五、验收
   18. 哪些指标达标才算这个 harness 可用

验收

  • 拿这份模板套一遍 Pi 桌面端的现状,能填满且能发现至少 2 个缺口
  • 模板里每一条都能追溯到本阶段学到的某条判断

自测

维度阶段 6 的问法
解释讲清"为什么 Pi 不做权限弹窗不算缺陷"
画图四方同构能力对照图完成
比较九格表最后一列 9 条判断都有理由
实践一项 Claude Code 运行实验 + 三方案比较有结论和切换条件
评测能定义"这个 harness 可用"的验收指标
产品化选型模板能套用到真实项目
迁移拿一个没读过的开源 Agent 项目,能在 30 分钟内填出它的九格

通过标志 迁移这一项是硬门槛。随便找一个 GitHub 上的 agent 项目,30 分钟内能说出它的九格状态和最主要的取舍。做不到,说明还停留在"记住了三份教程的结论",而不是掌握了框架。


  • 阶段 6 讲义
  • Claude Code 第 15 章:四种 Harness 哲学对照
  • Claude Code Harness 深度教程
  • 阶段 14 讲义:综合项目评审标准
  • 学习路线

本章目录
实践 1 · 九格对照表(先做这个,再画图)实践 2 · 同构能力对照图(⭐ 必做)实践 3 · Claude Code 运行证据小实验实践 4 · 一个能力,三种实现方案的比较实践 5 · 《Agent Harness 产品架构选型模板》自测Related Documents
苏ICP备2025204887号-2