本实践的产出 ⭐ 最小产出:Agent 完整状态图(等待、思考、调用工具、需确认、成功、部分成功、失败) 完整产出:状态图 + 无对话框 Workbench 设计 + 指标体系 + 五个项目复盘
预计投入:6~8 小时。订票 Agent 的完整产品定义不在这里做,留给阶段 14 综合项目 B;本实践只做方法论片段。
| 状态 | 界面文案 | 可用操作 | 能否取消 | 中间产物在哪 |
|---|---|---|---|---|
| 理解中 | ||||
| 需要澄清 | ||||
| 规划中 | ||||
| 计划预览 | ||||
| 执行中 | ||||
| 需要你确认 | ||||
| 已暂停 | ||||
| 被中断 | ||||
| 成功 | ||||
| 部分成功 | ||||
| 失败(可重试) | ||||
| 失败(需人工) |
对"失败(可重试)"和"失败(需人工)",各写一份完整文案,包含:发生了什么 / 做到哪一步 / 为什么 / 现在能做什么。用用户语言,不出现错误码、模型名、内部服务名。
验收标准:
存放:Excalidraw/ 或本目录。
任务:为国际机票 B2B 场景设计一个不以对话为主的 Agent 形态。
B2B 用户(销售、客服、代理)对自己要什么很确定。让他们打字描述需求,比点几个下拉框慢——对话在这里是效率倒退(讲义第三节)。这个练习的目的是打破"Agent = 聊天"的思维定式。
| 区域 | 内容 | 设计要点 |
|---|---|---|
| 任务发起区 | 结构化输入(航线、日期、乘客、约束) | 常用组合可保存为模板 |
| 计划/过程区 | Agent 的计划与当前动作 | 可解释的理由;可中断 |
| 结果区 | 结构化结果 + 可操作项 | 每项结果可直接触发下一步动作 |
| 确认区 | 需要人决策的事项队列 | 批量确认;每项有完整预览 |
| 历史/审计区 | 做过什么、谁确认的、能否撤销 | 时间线形态 |
验收:
一个,且必须是结果量:
自检:这个指标涨了,用户一定获益了吗?如果能想出一个"指标涨但用户更糟"的情形,换一个。
| 指标 | 阈值 | 依据 | 超阈值时怎么办 |
|---|---|---|---|
| 危险动作越权次数 | 0 | 硬红线 | 立即回滚 |
| 人工接管率 | |||
| 撤销率 | |||
| 单次任务成本 | |||
| 用户主动关闭 Agent 的比例 | |||
| 澄清轮数中位数 |
按讲义第七节的五项,做一次真实核算:
| 成本项 | 单次任务估算 | 数据来源 |
|---|---|---|
| 模型 token(含失败重试与被丢弃的中间步骤) | 阶段 4 的轨迹记录 | |
| 工具调用 | ||
| 基础设施 | ||
| 人工审核(确认/接管/纠错的人力) | ||
| 失败成本(赔付/返工/信任损失) |
关键计算:单次任务总成本 vs 人工做同一件事的成本。如果前者不显著低于后者,商业模型不成立——这个结论要敢于写出来。
验收:
用本阶段的框架,逐个复盘手上的五个项目:
| 项目 | 场景四筛子过了几个 | 工具闭环有缺口吗 | 交互形态对吗 | 失败表达合格吗 | 有指标吗 |
|---|---|---|---|---|---|
| 国际机票 AI 订票 Agent | |||||
| Pi Agent 桌面端 | |||||
| DeepSeek Harness 双运行时集成 | |||||
| 团队技能体系与知识基础设施 | |||||
| B2B 工作台的 vibe coding 交付模式 |
复盘的诚实度决定它的价值 写"效果良好"没有意义。有价值的复盘长这样:"工具闭环缺了支付,导致用户仍要切出去操作,这是它没被日常使用的主要原因;如果重做,第一件事是打通支付或者干脆把场景收窄到'比价'而不是'订票'。"
这种复盘能力本身就是产品经理的核心能力展示。
| 维度 | 阶段 12 的问法 |
|---|---|
| 解释 | 讲清"为什么对专业用户来说对话可能是效率倒退" |
| 画图 | 12 状态图 + Workbench 原型 |
| 比较 | Chat / Workbench / 后台任务三种形态,各给一个适用场景与理由 |
| 实践 | 状态图 + 原型 + 指标体系 + 五项目复盘 |
| 评测 | 北极星指标过了"涨了用户一定获益吗"的自检 |
| 产品化 | 成本模型能支撑一次"要不要做"的决策 |
| 迁移 | 把状态图用到一个后台批量任务上,哪些状态会变?(提示:确认会变成批量确认,中断会变成暂停队列) |
通过标志 拿状态图给一个没参与过项目的同事看,他能指出**"如果我在这一步关掉页面会怎样"**的答案。答不出来,说明中间产物那一列没写清楚。