Agent X-Ray
RuntimeNotesAbout
Notes/产品经理/Agent 基础知识/README

AI 与 Agent 基础知识学习路线

21 分钟 · 更新于 2026-09-01

AI 与 Agent 基础知识学习路线

路线定位 这不是一套面向算法工程师的纯理论课程,也不是一份“学会调用几个框架 API”的开发教程,而是一套面向 Agent Harness 产品经理 的系统学习路线:补齐 LLM 与 Agent 底层认知,深入 Harness、工具、上下文、记忆、评测、安全和运行时机制,最终能够独立完成 Agent 产品定义、技术方案判断、原型验证和产品化落地。

针对陈琨的定制原则 结合 个人经历,当前优势是手边有大量一线实践素材和真实场景(国际机票 Agent、Pi / DeepSeek Harness / Codex / Claude Code 四份 Harness 拆解、MCP 工具面等)——但这些拆解多是借助 AI 完成的,产出不等于掌握,概念根基仍需系统补齐。后续学习重点应当是:

  1. 系统补基础:把零散经验还原为完整知识树,避免只熟悉具体产品而缺少通用理论。
  2. 建立可迁移判断力:能解释不同模型、框架、Runtime 与 Harness 的取舍,而不是只会复述某个项目实现。
  3. 加强评测与治理:从“把 Agent 做出来”升级到“证明它可靠、可控、可运营”。
  4. 产品化表达:将技术机制翻译为用户价值、产品边界、交互方案、指标体系和商业化判断。
  5. 形成公开作品:每一阶段都沉淀可展示的文章、图谱、Demo 或产品方案,服务 Agent Harness 产品方向求职与长期发展。

〇、目录导航

本路线的学习材料按阶段分目录存放。每个阶段一份讲义(知识骨架 + 常见误区 + 外部一手资料)和一份实践(可执行步骤 + 验收标准 + 自测)。

两份跨阶段材料先看这两个

  • 术语表 — Agent 与 Harness 核心词汇:九组易混词的边界与判别问句,每阶段结束回来修订一次
  • 资料索引 — 外部权威资料清单:按阶段归类的一手来源,含 MCP / A2A / OTel 的当前状态与可信度分级
阶段讲义实践
0 · 能力盘点与统一词汇从模型到 Agent 产品的四层分工能力盘点与分层图
1 · LLM 基础产品经理需要理解的 LLM 原理三个可复现的模型行为实验
2 · 模型 API 与结构化交互消息契约、结构化输出与调用经济学国际机票需求抽取 Schema
3 · RAG 与上下文工程检索链路与上下文工程四动作召回对比与错误上下文注入
4 · Agent 基础与 Agent LoopAgent Loop 解剖手写一个最小 Agent Loop
5 · Tool Use、MCP 与 Skills工具契约、MCP 与 Skills15 个 MCP 工具的粒度重审
6 · Harness 内核架构Harness 内核的九个部件四种 Harness 同构能力对照
7 · Runtime 与生命周期持久执行、会话生命周期与打包分发桌面 Harness 生命周期设计
8 · Memory 与长期知识四层记忆与写入门槛记忆冲突与知识边界地图
9 · Planning 与 Multi-Agent规划、委派与多 Agent 编排单 Agent 与 Planner-Executor 对比
10 · Evaluation 与可观测性如何证明一个 Agent 可靠30 条最小评测集
11 · 安全、权限与人机治理Agent 安全的四层防线风险分级、授权矩阵与注入演练
12 · Agent 产品设计与体验Agent 产品设计与交互模式Agent 状态图与指标体系
13 · 产品化、组织落地与商业化从 Demo 到平台成熟度模型与路线机会分析
14 · 综合项目与作品集两个综合项目的评审标准作品集交付模板

讲义与实践的分工 讲义不重复外部文章能讲的内容,只做三件事:给出这一层的知识骨架、指出最容易混用的边界、把本仓已有的四份 Harness 拆解与外部一手资料挂到对应位置。实践把路线图里一行的「最小实践」展开成可执行的步骤、记录模板与验收标准,并尽量绑定真实素材(国际机票 Agent、Pi 桌面端、本仓知识基建、vfticket CLI)。


一、最终能力目标

完成本路线后,应能回答并实践以下问题:

1. 模型认知

  • LLM 为什么能生成内容,又为什么会幻觉?
  • Token、Embedding、Attention、Transformer、预训练、对齐和推理分别解决什么问题?
  • Temperature、上下文窗口、Prompt Caching、结构化输出如何影响效果、成本与延迟?
  • 应该如何在能力、价格、速度、稳定性和生态之间选择模型?

2. Agent 机制

  • Workflow、Chatbot、Copilot、Agent 和 Multi-Agent 的边界是什么?
  • Agent Loop 如何在模型推理、工具调用、环境反馈与停止条件之间循环?
  • Agent 的状态、任务、会话、事件和长期执行应该如何组织?
  • 什么情况下应该增加规划、反思、子 Agent,什么情况下只会徒增复杂度?

3. Harness 产品能力

  • Framework、Runtime、Harness、Agent Application 分别负责什么?
  • 一个生产级 Harness 为什么需要指令、工具、文件系统、沙箱、会话、压缩、权限、扩展和可观测性?
  • 如何比较 Pi、Claude Code、Codex、DeepSeek Harness、LangGraph 等不同形态?
  • 如何把开源 Agent 内核包装成普通用户可安装、可配置、可更新、可恢复的产品?

4. 产品化与治理

  • 如何定义 Agent 的能力边界、自主等级、确认点和失败回退?
  • 如何设计对话、卡片、工具过程、流式状态和 Human-in-the-loop 交互?
  • 如何建立离线评测、线上指标、轨迹分析、安全防线与成本模型?
  • 如何判断一个 Agent 产品是真需求、功能演示,还是具备长期商业价值的工作系统?

二、推荐学习方法

每个模块都采用同一套五步循环:

  1. 建立概念:用自己的话解释“是什么、为什么、何时使用”。
  2. 观察机制:阅读原理、源码、事件日志或工具轨迹,理解真实运行过程。
  3. 比较取舍:至少比较两种实现,不把单一产品设计误认为行业标准。
  4. 最小实践:完成一个可运行、可观察、可失败的最小实验。
  5. 产品翻译:输出一页产品说明,写清用户价值、适用边界、风险与指标。

学习深度标准 对数学公式以“能解释机制和产品影响”为主,不要求推导模型训练算法;对代码以“能阅读、修改最小样例、与研发讨论方案”为主,不以成为全职算法或基础设施工程师为目标。

用好已有拆解产出 各阶段“已有资料”引用的 Pi / DeepSeek Harness / Codex / Claude Code 教程等,多是此前借助 AI 完成的拆解——当初产出不等于已经掌握。以学习者身份重读它们,并用「阶段性自测」校准每个阶段该投入的深度:自测用来校准深度,不用来决定跳过。

Claude Code 拆解的证据边界 Claude Code Harness 深度教程基于 2026-03-31 的外部版 Sourcemap 快照,并用本机 2.1.241 运行痕迹交叉验证。迁移结论时要区分源码事实、运行实测与合理推断;快照中的精确数量、Feature Gate 和被 DCE 删除模块,不应写成 Claude Code 永久公开契约或行业标准。

每个模块的固定输出

  • 一篇 1000~3000 字学习笔记
  • 一张机制图或架构图
  • 一份关键概念与常见误区清单
  • 一个最小实验或产品案例
  • 一段面向非技术人员的 3 分钟口头解释

产出量控制 五项全做 × 14 个阶段在 16~24 周内并不现实。每个阶段标注了一项「⭐ 最小产出」作为底线——时间不足时只做这一项,其余按余力补齐,不要因为凑产出而拖慢主线。


三、循序渐进的完整学习路径

阶段 0:能力盘点与统一词汇

目标:先建立地图,解决“熟悉很多产品,但概念边界可能混用”的问题。

⭐ 最小产出:一张“模型 → Agent → Harness → Agent 产品”分层图

本阶段材料:讲义 · 实践

必学内容

  • AI、Machine Learning、Deep Learning、Foundation Model、Generative AI、LLM
  • Chatbot、Copilot、Workflow、Agent、Multi-Agent
  • Framework、SDK、Runtime、Harness、Application
  • Prompt Engineering、Context Engineering、Harness Engineering
  • RAG、Knowledge Base、Memory、Skills、MCP、Tool Use

必须回答

  • “模型”和“Agent”之间增加了哪些软件层?
  • Harness 与普通 Agent Framework 的本质区别是什么?
  • Agent 产品经理与传统 AI 产品经理、平台产品经理有什么能力差异?

阶段输出

  • 《Agent Harness 产品经理能力模型》
  • 一张“模型 → Agent → Harness → Agent 产品”分层图
  • 建立个人术语表,持续修正概念边界

推荐起点

  • Harness Engineering 研究报告
  • Agent Harness 的解剖学
  • 工程问题与科学问题的区别

阶段 1:AI、机器学习与 LLM 基础

目标:建立足以支撑产品决策的模型底层认知,不再把模型视为黑盒 API。

⭐ 最小产出:《产品经理真正需要理解的 LLM 原理》

本阶段材料:讲义 · 实践

必学内容(P0 深度)

  1. 文本表示:Tokenization、Token、Embedding、向量相似度
  2. Transformer 直觉:Attention、位置编码、上下文依赖——机制级理解即可
  3. 推理基础:概率分布、Temperature、Top-p、采样、确定性与随机性
  4. 能力与限制:幻觉、知识截止、上下文衰退、长文本问题、推理不稳定
  5. 模型类型:通用模型、Reasoning Model、多模态模型、小模型、开源模型
  6. 模型生命周期总览:预训练 → 对齐 → 蒸馏/量化各解决什么问题、对能力和成本有什么产品影响

延伸内容(P2,了解即可)

与「学习优先级」对齐:以下内容达到“能与算法同学对话”即可,不作为本阶段验收标准。

  • 机器学习基本范式:监督学习、无监督学习、自监督学习、强化学习
  • 神经网络细节:参数、层、激活、损失函数、梯度下降
  • 后训练算法细节:Instruction Tuning、SFT、RLHF、DPO 的算法差异

产品经理需要掌握的判断

  • 为什么同一个 Prompt 多次执行可能得到不同结果?
  • 为什么模型“知道”不等于能够稳定完成任务?
  • 为什么更长的上下文不必然带来更好效果?
  • 为什么 Agent 问题不能全部通过升级模型解决?
  • 什么场景需要大模型,什么场景应使用规则、搜索或传统模型?

最小实践

  • 对同一任务调整 Temperature,记录输出稳定性差异
  • 比较普通模型与 Reasoning Model 的任务表现、成本和延迟
  • 用 Embedding 完成一次最小语义检索
  • 画出“一次 LLM 请求从文本到生成结果”的流程图

阶段输出

  • 《产品经理真正需要理解的 LLM 原理》
  • 《模型选型五维矩阵:效果、延迟、价格、上下文与生态》

阶段 2:模型 API、Prompt 与结构化交互

目标:理解 LLM 应用最基础的输入输出契约,为 Agent Tool Use 打地基。

⭐ 最小产出:为国际机票需求抽取任务设计一套结构化输出 Schema

本阶段材料:讲义 · 实践

必学内容

  • System、Developer、User、Assistant 消息及优先级
  • Chat Completions、Responses API 等常见调用形态
  • Streaming、Thinking、Stop Reason、Usage、错误与重试
  • Structured Output、JSON Schema、Function Calling
  • Prompt 基本结构:目标、上下文、约束、示例、输出格式、验收标准
  • Few-shot、Chain-of-thought 的能力与风险
  • Prompt Caching、批处理、并发、Token 成本与延迟
  • 模型网关、Provider 适配、Fallback 与路由

最小实践

  • 用同一个业务任务比较自由文本输出与 JSON Schema 输出
  • 记录一次流式请求的完整事件序列
  • 设计“主模型失败 → 备用模型”的 Fallback 策略
  • 为国际机票需求抽取任务设计一套结构化输出 Schema

已有资料

  • Pi:模型调用
  • Claude Opus 5 提示词指南
  • Prompt Caching 实践
  • Prompt Caching 原理解释
  • Claude Code:缓存经济学与稳定前缀

阶段 3:RAG、知识库与上下文工程

目标:理解“把正确的信息放进模型上下文”比单纯优化 Prompt 更重要。

⭐ 最小产出:构造一次错误召回实验,观察错误上下文如何诱发错误答案

本阶段材料:讲义 · 实践

与阶段 8(Memory)的分工 本阶段解决单次请求内的上下文供给(检索、组装、压缩);跨会话的连续性(会话历史、长期记忆)在 阶段 8 展开。两者同属“往窗口里放什么”这一个问题,学习时注意衔接、避免重复展开。

必学内容

  • RAG 基本链路:采集、清洗、切分、Embedding、索引、召回、重排、生成
  • Semantic Search、Keyword Search、Hybrid Search
  • Chunk、Metadata、Query Rewrite、Rerank、引用与溯源
  • Context Engineering 四类动作:Write、Select、Compress、Isolate
  • Context Rot、Lost in the Middle、上下文污染与冲突
  • Prompt Caching、上下文复用与成本控制
  • Knowledge Base、LLM Wiki、Knowledge Graph 与搜索系统的差异
  • “检索命中”与“事实正确”的区别

最小实践

  • 用同一组文档比较关键词检索与向量检索
  • 构造一次错误召回,观察错误上下文如何诱发错误答案
  • 为知识问答设计“回答 + 引用 + 置信度 + 未知声明”格式
  • 分析当前 OKF Wiki、GBrain 与 Vault 原文的职责边界

已有资料

  • Pi:上下文工程
  • Claude 5 上下文工程新规则
  • Karpathy LLM Wiki 方法论
  • LLM Wiki 方法论与团队实践
  • Claude Code:系统提示词装配
  • Claude Code:动态附件通道
  • Claude Code:上下文压缩案例

阶段 4:Agent 基础与 Agent Loop

目标:理解 Agent 不是“更会聊天的模型”,而是模型在环境中的循环决策系统。

⭐ 最小产出:不使用 Agent Framework,手写一个最小 Agent Loop 并记录完整轨迹

本阶段材料:讲义 · 实践

必学内容

  • Agent 的最小构成:Model、Instructions、Tools、State、Environment、Loop
  • Agent Loop:输入 → 推理 → 工具调用 → 环境反馈 → 再推理 → 停止
  • Turn、Step、Tool Call、Observation、Stop Reason
  • ReAct、Plan-and-Execute、Reflection 等常见模式
  • 确定性 Workflow 与开放式 Agent 的适用边界
  • 状态机、事件驱动与对话历史
  • 自主等级、最大步数、超时、预算与停止条件
  • 错误恢复:重试、改参、换工具、换模型、转人工

必须回答

  • 哪些任务根本不应该使用 Agent?
  • 为什么 Tool Calling 不等于 Agent?
  • Agent 为什么会死循环、偏航或过早结束?
  • 如何区分模型失败、工具失败、上下文失败与 Harness 失败?

最小实践

  • 不使用 Agent Framework,手写一个最小 Agent Loop
  • 记录每一步模型消息、工具参数、工具结果和停止原因
  • 注入工具报错,观察 Agent 是否能恢复
  • 为 Loop 增加最大步数、Token 预算和人工确认点

已有资料

  • Pi:Agent Loop
  • DeepSeek Harness:Agent Loop
  • Pi:事件驱动
  • Claude Code:生产级 Agent Loop

阶段 5:Tool Use、MCP 与 Skills

目标:掌握 Agent 如何获得“手脚”和领域能力,以及工具面为什么决定产品上限。

⭐ 最小产出:国际机票 Agent 15 个 MCP 工具的粒度与命名重审报告

本阶段材料:讲义 · 实践

必学内容

  • Function Calling 与 Tool Use 的调用契约
  • Tool Schema:名称、描述、参数、返回值、错误语义
  • 工具粒度、命名空间、分页、过滤与 Token 效率
  • 并行调用、串行依赖、幂等性、超时、重试与副作用
  • MCP 的 Host、Client、Server、Tools、Resources、Prompts
  • MCP 与普通 API、Plugin、Skill 的差异
  • Skills 的渐进式披露、触发描述、指令与资源组织
  • Code Execution、Computer Use、Browser Use 的能力和风险
  • Tool Search 与动态工具加载

产品经理需要掌握的判断

  • 一个业务 API 应该直接暴露为工具,还是组合成更高层业务动作?
  • 查询工具与写入工具应如何设计不同的确认和授权机制?
  • 工具返回多少信息既足够决策,又不会污染上下文?
  • MCP 是接口标准,不等于 Agent 产品价值;真正壁垒在哪里?

最小实践

  • 为国际机票 Agent 重新审视 15 个 MCP 工具的粒度与命名
  • 设计一个只读工具和一个有副作用工具的完整契约
  • 构造参数错误、权限错误、业务失败三类错误返回
  • 创建一个最小 Skill,并验证正确触发与错误触发

已有资料

  • Pi:工具系统
  • DeepSeek Harness:工具系统
  • DeepSeek Harness:技能与扩展点
  • Claude Code 如何使用 Skills
  • Tool Search
  • Claude Code:工具系统与延迟加载
  • Claude Code:工具执行链
  • Claude Code:Skills、Plugins、MCP 与 Commands

阶段 6:Harness 内核架构

目标:从会用 Agent 上升到能定义和比较 Agent Harness 的内核架构。

⭐ 最小产出:Pi、DeepSeek Harness、Codex 与 Claude Code 的四方同构能力对照图

本阶段材料:讲义 · 实践

必学内容

  • Framework、Runtime、Harness、Agent Application 四层分工
  • 指令装配、模型适配、工具管线、消息转换、状态与事件
  • 文件系统、Shell、进程、网络、浏览器与沙箱
  • Extension、Plugin、Middleware、Hook、Dependency Injection
  • 本地 Harness、云端 Managed Agent 与嵌入式 Agent 的差异

深度对比对象

  1. Pi:极简内核、减法哲学、扩展补能力
  2. DeepSeek Harness:一切皆插件、Seam 与配置 Patch
  3. Codex:工程完备,以协议、跨平台沙箱和可验证性兜住风险
  4. Claude Code:上下文经济学,以缓存前缀、动态注入和渐进披露组织架构

最小实践

  • 绘制四种 Harness 的同构能力对照图
  • 选择一个能力,比较“内核内置、扩展实现、独立服务”三种方案

已有资料

  • Pi-Agent 深度教程
  • DeepSeek Harness 深度教程
  • Harness Engineering 研究报告
  • Claude Code Harness 深度教程
  • 四种 Harness 哲学对照
  • Middleware 与 Agent Harness

阶段 7:Runtime、生命周期与打包分发

目标:理解 Harness 如何作为可安装、可恢复、可升级的产品长期运行——这是内核架构之外,产品化 Harness 的另一半。

⭐ 最小产出:桌面 Harness 的启动、自检、升级、失败回滚完整生命周期设计

本阶段材料:讲义 · 实践

必学内容

  • Session 持久化、恢复、分叉、重放与事件溯源
  • 生命周期管理:启动、运行、取消、中断、恢复、关闭
  • 长时间任务:Checkpoint、队列、异步任务、断点续跑
  • 配置分层、能力发现、版本兼容、运行时更新与回滚

深度对比对象

  1. LangGraph / Temporal 类 Runtime:持久执行和显式工作流
  2. Pi Agent 桌面端:从开源内核到普通用户产品的 Packaging Layer

最小实践

  • 为桌面 Harness 设计启动、自检、升级、失败回滚完整生命周期
  • 写一份《Agent Harness 产品架构选型模板》

已有资料

  • Pi:会话管理
  • DeepSeek Harness:会话与事件溯源
  • 动态 Harness 工作流
  • Claude Code:压缩与恢复合同

阶段 8:Memory、Session 与长期知识

目标:区分“模型上下文、会话历史、长期记忆和知识库”,理解跨会话连续性的真实实现。

⭐ 最小产出:Vault、Wiki、GBrain、Session Log 和模型上下文的关系图

本阶段材料:讲义 · 实践

与阶段 3 的分工 阶段 3 解决单次请求内的上下文供给,本阶段解决跨会话的连续性——同一个问题的两半。进入本阶段前先重读阶段 3 的笔记。

必学内容

  • Working Memory、Short-term Memory、Long-term Memory
  • Semantic、Episodic、Procedural Memory
  • 消息历史、Session State、Scratchpad、任务状态
  • 自动摘要、Compaction、Truncation、Checkpoint
  • 用户画像、偏好记忆、事实记忆与操作记忆
  • 记忆写入门槛、冲突处理、时效性、遗忘与用户控制
  • 记忆检索、知识检索与源文档查询的差异
  • 多 Agent 共享记忆与上下文隔离
  • 隐私、敏感数据、跨用户污染和可删除性

最小实践

  • 比较原始消息、摘要消息和结构化状态三种会话恢复方式
  • 设计一套“何时写入长期记忆”的决策规则
  • 构造一条过期记忆,设计更新、冲突与删除流程
  • 画出 Vault、Wiki、GBrain、Session Log 和模型上下文的关系图

已有资料

  • Pi:消息系统
  • Pi:上下文压缩
  • Your Harness, Your Memory
  • AI Agent 的持续学习
  • Claude Code:持久指令与上下文装配

阶段 9:Planning、Subagent、Workflow 与 Multi-Agent

目标:理解复杂任务如何拆解、委派和收敛,避免为了“多 Agent”而多 Agent。

⭐ 最小产出:同一任务下单 Agent 与 Planner + Executor 的对比实验记录

本阶段材料:讲义 · 实践

必学内容

  • Planning、Task Decomposition、Todo、Task Graph
  • Supervisor、Router、Handoff、Subagent、Peer-to-peer
  • Workflow、DAG、状态机、事件驱动编排
  • 上下文隔离与 Context Firewall
  • 并行执行、结果聚合、冲突处理与同步屏障
  • 角色分工、共享状态、独立状态与最小权限
  • 长程任务中的 Validator、Reviewer、Summarizer
  • Ralph Loop 等重复执行模式
  • Multi-Agent 的成本、延迟、错误放大和不可观测性

判断原则

  • 单 Agent 加好工具能解决的问题,不要先上 Multi-Agent。
  • 子 Agent 的核心价值通常是上下文隔离与专业化,不只是“模拟团队角色”。
  • 编排结构越复杂,越需要确定性状态、终止条件和评测证据。

最小实践

  • 用同一任务比较单 Agent 与 Planner + Executor
  • 设计一个主 Agent + 研究 Subagent + 审核 Subagent 的任务
  • 注入子任务失败,验证重试、降级和最终汇总
  • 复盘个人知识库网站的多 Agent 自动化开发链路

已有资料

  • DeepSeek Harness:委派与编排
  • Claude Code:Todos 到 Tasks
  • 远程控制自动化开发
  • Claude Code:Fork 与 Fresh 两种委派
  • Claude Code:专业化 Agent 与对抗式验证

阶段 10:Evaluation、Observability 与可靠性

目标:从“感觉效果不错”升级为“能够量化证明 Agent 是否可靠”。

⭐ 最小产出:国际机票 Agent 的 30 条最小评测集

本阶段材料:讲义 · 实践

必学内容

  • Eval 目标:能力评估、回归测试、方案比较、上线门槛
  • 测试集:真实任务、合成任务、边界任务、对抗任务
  • 指标层级:最终结果、过程轨迹、工具选择、参数正确性、成本与延迟
  • Exact Match、Rubric、LLM-as-a-Judge、Human Review
  • pass@k、成功率、任务完成率、恢复率与人工接管率
  • Offline Eval、Online Eval、A/B Test、灰度发布
  • Trace、Span、Event、Tool Log、Token Usage、成本归因
  • 非确定性系统测试:固定环境、重复采样、统计分布
  • 故障分类:模型、Prompt、上下文、工具、权限、网络、业务系统、Harness
  • 自愈、重试、Fallback、Circuit Breaker、降级与人工兜底

最小实践

  • 为国际机票 Agent 建立 30 条最小评测集
  • 同时评估最终答案和工具调用轨迹
  • 比较两个模型或两个 Prompt 版本,输出统计结果
  • 定义 Agent 上线前的准入门槛与回归流程

已有资料

  • Pi:测试模式
  • Agent 评测就绪清单
  • Deep Agents 评测方法
  • 生产 Agent 自愈
  • Claude Code:验证 Agent 的证据合同

阶段 11:安全、权限与人机治理

目标:理解 Agent 的风险来自“模型可以行动”,而不只是“模型可能答错”。

⭐ 最小产出:Agent 工具的风险分级和授权矩阵

本阶段材料:讲义 · 实践

必学内容

  • Prompt Injection、Indirect Prompt Injection、Data Exfiltration
  • Tool Poisoning、恶意内容、跨边界指令与不可信输入
  • Authentication、Authorization、用户身份与代理身份
  • Least Privilege、Capability、Allowlist、Denylist
  • Sandbox、Filesystem Boundary、Network Boundary、Secret Management
  • Read / Write / Execute / Publish 不同风险等级
  • Human-in-the-loop 与 Human-on-the-loop
  • Dry-run、二次确认、审批、撤销、审计日志
  • Fail-open 与 Fail-closed
  • 模型行为规范、政策、内容安全和企业治理

产品经理需要定义

  • 哪些动作 Agent 可以自主执行?
  • 哪些动作必须说明影响并获得确认?
  • 哪些动作必须永久禁止或只能在沙箱执行?
  • 用户如何知道 Agent 做了什么、为什么做、是否成功?

最小实践

  • 为 Agent 工具建立风险分级和授权矩阵
  • 对一个网页浏览 Agent 进行 Prompt Injection 攻击测试
  • 设计“预览 → 确认 → 执行 → 回执 → 撤销”交互
  • 对比 Pi、DeepSeek Harness、Codex 与 Claude Code 的安全边界

已有资料

  • DeepSeek Harness:沙箱与权限
  • 抵抗 Prompt Injection
  • Agent 授权的两种模式
  • 可信 Agent 实践
  • Claude Code:权限与沙箱边界
  • Claude Code:Hooks 治理层

阶段 12:Agent 产品设计与用户体验

目标:把技术能力翻译为普通用户能够理解、信任并持续使用的产品。

⭐ 最小产出:Agent 完整状态图(等待、思考、调用工具、需确认、成功、部分成功、失败)

本阶段材料:讲义 · 实践

必学内容

  • 场景选择:高价值、高频、可验证、可获得工具闭环
  • Jobs to be Done、用户控制感、信任与认知负担
  • Agent 能力边界和自主等级设计
  • Chat、Canvas、Workbench、Copilot、Background Agent 等交互形态
  • 流式输出、思考状态、工具状态、任务进度与结果卡片
  • Clarification、Confirmation、Interrupt、Resume、Cancel、Undo
  • 失败表达、局部结果、降级方案和转人工
  • 新手引导、快捷任务、模板、历史任务与可复用 Workflow
  • 用户反馈、纠错、偏好与记忆管理
  • 价值指标:任务成功率、完成时间、人工节省、复用率、留存、付费
  • 成本模型:模型 Token、工具调用、基础设施、人工审核与失败成本

重点复盘项目

  1. 国际机票 AI 订票 Agent
  2. Pi Agent 桌面端
  3. DeepSeek Harness 双运行时集成
  4. 团队技能体系与知识基础设施
  5. B2B 国际机票工作台的 vibe coding 交付模式

最小实践

  • 绘制完整状态:等待、思考、调用工具、需确认、成功、部分成功、失败
  • 设计一个无对话框的 Agent Workbench 形态
  • 建立 Agent 产品北极星指标与护栏指标

订票 Agent 的完整产品定义(用户任务、能力边界、自主等级)不在此处重复做,统一收敛到 阶段 14 综合项目 B;本阶段只做上述方法论片段练习。

已有资料

  • AI 指数时代的产品管理
  • 81,000 人希望 AI 做什么
  • AI Agent 自主性测量
  • AI 使用中的去赋能模式

阶段 13:Agent 产品化、组织落地与商业化

目标:从单个功能走向可部署、可运营、可扩展的 Agent 平台或 Harness 产品。

⭐ 最小产出:“通用 Harness”与“行业 Agent”两条产品路线的机会差异分析

本阶段材料:讲义 · 实践

必学内容

  • Prototype、MVP、Production 三阶段差异
  • Build vs Buy、开源 vs 闭源、本地 vs 云端
  • Tenant、Identity、Billing、Quota、Rate Limit
  • 配置管理、版本管理、模型升级、兼容与回滚
  • Extension / Skill / MCP 生态和开发者体验
  • 团队推广、模板化 Workflow、权限治理和知识资产
  • AI Native 组织中的人机分工与流程再设计
  • 商业模式:订阅、用量、Seat、结果付费、平台抽成、企业私有化
  • 护城河:数据、Workflow、工具闭环、分发、信任、迁移成本、生态

最小实践

  • 设计 Harness 的 Extension / Skill / MCP 开发者生态
  • 输出企业引入 Agent Harness 的成熟度模型
  • 分析“通用 Harness”与“行业 Agent”两条产品路线的机会差异

Pi Agent 桌面端的完整产品战略与商业模式画布不在此处重复做,统一收敛到 阶段 14 综合项目 A。

已有资料

  • 运营 AI Native 工程组织
  • AI Native Company
  • AI Native 软件工程课程

阶段 14:综合项目与个人作品集

目标:将知识转化为能够证明 Agent Harness 产品能力的完整作品。

⭐ 最小产出:综合项目 A、B 二选一完整交付(另一个作为后续迭代)

本阶段材料:讲义 · 实践

两个综合项目分别整合阶段 12、13 留待收敛的产品定义与商业化交付,是全路线产出的最终归宿。

综合项目 A:Agent Harness 产品蓝图

建议以 Pi Agent 桌面端下一代版本 为对象,完成:

  • 市场与用户问题定义
  • 产品定位和差异化
  • Framework / Runtime / Harness / Application 架构图
  • 模型、工具、Skills、MCP、Memory、Subagent 能力地图
  • 安全与授权矩阵
  • Eval 与 Observability 方案
  • 安装、启动、更新、恢复和迁移生命周期
  • Extension 生态与商业模式
  • 高保真原型或可运行 Demo

综合项目 B:行业 Agent 产品方案

建议以 国际机票 AI 订票 Agent 2.0 为对象,完成:

  • 用户旅程与高价值任务选择
  • 确定性流程与开放式 Agent 的边界
  • 业务 MCP 工具重构
  • Booking Context 与长期记忆方案
  • 报价、下单等高风险动作的确认机制
  • 离线评测集、线上指标与失败分类
  • 对话、卡片、后台任务与人工接管交互
  • 商业化与增长路径

建议形成的公开作品

  1. 《Agent Harness 产品经理知识地图》
  2. 《从 Model 到 Harness:Agent 软件栈完整拆解》
  3. 《四种 Agent Harness 哲学:减法、全插件化、工程完备与上下文经济学》
  4. 《如何评测一个会使用工具的 Agent》
  5. 《Agent 的安全不是弹一个确认框:权限与治理体系》
  6. 《国际机票 Agent 2.0 产品蓝图》
  7. 一个可公开演示的 Agent Harness Demo

四、建议节奏

推荐周期 建议按 16~24 周推进,每周投入 6~10 小时。熟悉度高的模块用「阶段性自测」判断能否快速通过,但不建议完全跳过——已有实践多为借助 AI 完成,概念、评测和产品表达仍需补齐。

周期阶段核心成果
第 1~2 周阶段 0~1统一词汇、补齐 LLM 基础
第 3~4 周阶段 2~3模型 API、Prompt、RAG 与上下文
第 5~6 周阶段 4~5Agent Loop、Tool Use、MCP、Skills
第 7~9 周阶段 6~8Harness 内核、Runtime、Session、Memory
第 10~11 周阶段 9Planning、Subagent、Multi-Agent
第 12~14 周阶段 10~11Eval、Observability、安全与治理
第 15~17 周阶段 12~13Agent 产品、组织落地与商业化
第 18~24 周阶段 14综合项目与公开作品集

五、学习优先级

P0:必须真正掌握

  • LLM 基本机制与能力边界
  • Agent Loop、状态、工具和停止条件
  • Tool Use、MCP、Skills 的产品与技术差异
  • Harness 与 Runtime 架构
  • Context、Memory、Session、Knowledge Base 的边界
  • Eval、Observability、安全和授权
  • Agent 用户体验与产品指标

P1:需要形成方法论

  • Planning、Subagent 与 Multi-Agent 取舍
  • 长时间运行、恢复、自愈和后台任务
  • 模型路由、缓存、成本与性能优化
  • Agent 平台化、生态与商业化

P2:了解并能与专业人员沟通

  • 模型训练、对齐和后训练算法细节
  • 向量数据库与推理基础设施实现细节
  • GPU、量化、推理引擎和模型部署
  • 高级强化学习与形式化验证

六、阶段性自测

每完成一个阶段,用以下标准自测:

  1. 解释:能否不用术语堆砌,向传统产品经理讲明白?
  2. 画图:能否画出信息流、状态流和失败分支?
  3. 比较:能否列出至少两种方案的收益、代价和适用条件?
  4. 实践:能否完成最小实验,并观察到真实运行证据?
  5. 评测:能否定义什么叫成功,以及如何重复验证?
  6. 产品化:能否转化为用户价值、交互、边界、指标和商业判断?
  7. 迁移:换一个模型、框架或业务场景后,结论是否仍然成立?

真正完成的标志 不是“看完了多少文章”,而是能够把一个陌生 Agent 产品拆成模型层、工具层、上下文层、Runtime、Harness、交互层和治理层,并基于证据提出可落地的改进方案。


  • 陈琨-Agent Harness 产品方向简历
  • Harness Engineering 研究报告
  • Pi-Agent 深度教程
  • DeepSeek Harness 深度教程
  • Codex Harness 深度教程
  • Claude Code Harness 深度教程
  • AI 技术博客索引
  • AI Native 软件工程课程

本章目录
〇、目录导航一、最终能力目标二、推荐学习方法三、循序渐进的完整学习路径四、建议节奏五、学习优先级六、阶段性自测Related Documents
苏ICP备2025204887号-2