本实践的产出 ⭐ 最小产出:Pi、DeepSeek Harness、Codex 与 Claude Code 的四方同构能力对照图 完整产出:四方九格对照表 + 对照图 + 一次 Claude Code 运行实验 + 一次"内置/扩展/独立服务"三方案比较 + 一份选型模板
预计投入:8~12 小时(含精读)。本阶段读的量大,但产出的对照表会在阶段 7~14 反复被用到。
用讲义的九个部件建表,四列填四个 Harness:
| 部件 | Pi | DeepSeek Harness | Codex | Claude Code | 我的判断 |
|---|---|---|---|---|---|
| ① 指令装配 | 谁的方案更适合我们?为什么? | ||||
| ② 模型适配 | |||||
| ③ 工具管线 | |||||
| ④ 上下文与压缩 | |||||
| ⑤ 会话与状态 | |||||
| ⑥ 执行环境 | |||||
| ⑦ 权限与审批 | |||||
| ⑧ 扩展点 | |||||
| ⑨ 可观测性 |
| 部件 | Pi | dsh | Codex | Claude Code |
|---|---|---|---|---|
| ① 指令装配 | 第 8 章 | 第 3、9 章 | 第 6 章 | 第 5、6 章 |
| ② 模型适配 | 第 4 章 | 第 6 章 | 第 5 章 | 第 4 章 |
| ③ 工具管线 | 第 5 章 | 第 7 章 | 第 8 章 | 第 8、9 章 |
| ④ 上下文与压缩 | 第 8、9 章 | 第 9 章 | 第 7 章 | 第 4、7 章 |
| ⑤ 会话与状态 | 第 10 章 | 第 8 章 | 第 12 章 | 第 3、12 章;完整会话存储见教程范围说明 |
| ⑥ 执行环境 | 第 5 章 | 第 10 章 | 第 9、10 章 | 第 10 章 |
| ⑦ 权限与审批 | (刻意不做) | 第 10 章 | 第 11 章 | 第 9、10、11 章 |
| ⑧ 扩展点 | 第 11 章 | 第 2、12 章 | 第 13 章 | 第 11、14 章 |
| ⑨ 可观测性 | 第 7 章 | 第 8 章 | 第 3 章 | 第 4、9、11 章 |
起手先读:Claude Code 第 15 章,它已经给出了四方对照框架。
验收标准:
做法:用 diagram 技能画一张图,要求:
加分项:在图上加第四行——"我们要做的产品",把九格填上目标状态。这一行画完,阶段 14 综合项目 A 的架构图就有底稿了。
验收:
存放:Excalidraw/ 或本目录,建议命名 三种Harness同构能力对照.excalidraw.md。
不要只依赖源码拆解,选一个可公开观察的机制做最小实验。推荐从以下三项选一:
| 实验 | 观察点 |
|---|---|
| 长会话压缩 | 压缩前后目标、约束、待办是否保留;原始记录能否回溯 |
| Fresh vs Fork 委派 | Prompt 重复量、主上下文占用、结果质量与成本 |
| Hook 工具治理 | Hook 是否能阻止/改写调用;失败是否污染日志或上下文 |
记录格式至少包含:版本、配置、输入、事件顺序、实际结果、结论及证据等级。无法实测的内部机制明确写 [推断],不要补成事实。
验收:
任务:挑一个具体能力,比较"内核内置 / 扩展实现 / 独立服务"三种方案。
推荐候选(挑一个和你实际工作相关的):
| 候选能力 | 为什么值得比较 |
|---|---|
| 长期记忆 | 三种方案在生产里都有真实案例 |
| 审批与权限 | Pi 不做、dsh 留接缝、Codex 内置,三档齐全 |
| 知识检索(RAG) | 本仓的 GBrain 就是"独立服务"方案的实例 |
比较维度:
| 维度 | 内核内置 | 扩展实现 | 独立服务 |
|---|---|---|---|
| 首次交付成本 | |||
| 长期维护成本 | |||
| 谁能改 / 改要发版吗 | |||
| 跨产品复用 | |||
| 故障隔离(它挂了会怎样) | |||
| 可观测性 | |||
| 版本兼容负担 | |||
| 数据边界与合规 |
结论要求:给出推荐方案 + 触发切换的条件。例如:"先做扩展,当出现第二个消费方或单实例数据量超过 X 时,拆成独立服务。"
本仓的现成案例 GBrain 就是"独立服务"路线的活样本:跨源索引、多客户端可见、独立部署与升级。它的三个已知陷阱(embedding key 只在 systemd EnvironmentFile 里、源路径禁止重叠、新源要 rescope 才对 MCP 客户端可见)恰好都是独立服务方案特有的运维成本——把它们写进"长期维护成本"那一格,比任何理论分析都有说服力。
把前三个实践的结论固化成一份可复用的模板,供以后每次做 Agent 方案时套用。
模板骨架:
验收:
| 维度 | 阶段 6 的问法 |
|---|---|
| 解释 | 讲清"为什么 Pi 不做权限弹窗不算缺陷" |
| 画图 | 四方同构能力对照图完成 |
| 比较 | 九格表最后一列 9 条判断都有理由 |
| 实践 | 一项 Claude Code 运行实验 + 三方案比较有结论和切换条件 |
| 评测 | 能定义"这个 harness 可用"的验收指标 |
| 产品化 | 选型模板能套用到真实项目 |
| 迁移 | 拿一个没读过的开源 Agent 项目,能在 30 分钟内填出它的九格 |
通过标志 迁移这一项是硬门槛。随便找一个 GitHub 上的 agent 项目,30 分钟内能说出它的九格状态和最主要的取舍。做不到,说明还停留在"记住了三份教程的结论",而不是掌握了框架。