Agent X-Ray
RuntimeNotesAbout
Notes/产品经理/Agent 基础知识/S12-实践

阶段 12 实践 — Agent 状态图与指标体系

4 分钟 · 更新于 2026-09-01

阶段 12 实践 — Agent 状态图与指标体系

本实践的产出最小产出:Agent 完整状态图(等待、思考、调用工具、需确认、成功、部分成功、失败) 完整产出:状态图 + 无对话框 Workbench 设计 + 指标体系 + 五个项目复盘

预计投入:6~8 小时。订票 Agent 的完整产品定义不在这里做,留给阶段 14 综合项目 B;本实践只做方法论片段。


实践 1 · 完整状态图(⭐ 必做)

要画进去的状态

text
等待输入 → 理解中 → 需要澄清 ⇄ 等待用户补充
              ↓
           规划中 → 计划预览 ⇄ 用户修改计划
              ↓
           执行中(当前动作:___)
              ↓         ↘
        需要你确认 ⇄ 已暂停   被用户中断
              ↓
    ┌─────────┼──────────┬─────────────┐
   成功    部分成功    失败(可重试)   失败(需人工)

每个状态填四格

状态界面文案可用操作能否取消中间产物在哪
理解中
需要澄清
规划中
计划预览
执行中
需要你确认
已暂停
被中断
成功
部分成功
失败(可重试)
失败(需人工)

三条硬要求

  • "执行中"要能显示当前动作("正在查询 8-30 上海→东京航班…"),不是转圈
  • "部分成功"必须有独立设计:做成了什么可以先用、没做成什么、下一步能做什么
  • 每个状态的中间产物去向都要写——被中断时已占的座、已生成的草稿,不会自动消失

加分项:失败表达四段

对"失败(可重试)"和"失败(需人工)",各写一份完整文案,包含:发生了什么 / 做到哪一步 / 为什么 / 现在能做什么。用用户语言,不出现错误码、模型名、内部服务名。

验收标准

  • 12 个状态 × 4 格填满
  • 状态图能直接交给设计师做界面
  • 两份失败文案通过"给不懂技术的人看,他知道下一步该干什么"的测试

存放Excalidraw/ 或本目录。


实践 2 · 无对话框的 Agent Workbench

任务:为国际机票 B2B 场景设计一个不以对话为主的 Agent 形态。

为什么做这个练习

B2B 用户(销售、客服、代理)对自己要什么很确定。让他们打字描述需求,比点几个下拉框慢——对话在这里是效率倒退(讲义第三节)。这个练习的目的是打破"Agent = 聊天"的思维定式。

要设计的五个区域

区域内容设计要点
任务发起区结构化输入(航线、日期、乘客、约束)常用组合可保存为模板
计划/过程区Agent 的计划与当前动作可解释的理由;可中断
结果区结构化结果 + 可操作项每项结果可直接触发下一步动作
确认区需要人决策的事项队列批量确认;每项有完整预览
历史/审计区做过什么、谁确认的、能否撤销时间线形态

必须回答的三个问题

  1. 自然语言输入放在哪? —— 它应该是补充("其他要求…"),不是主入口。
  2. 一个用户一天处理 50 个任务,怎么设计? —— 提示:任务队列 + 批量确认 + 模板。
  3. 哪些环节仍然必须是对话? —— 通常是"需求本身说不清"的探索型场景。

验收

  • 五个区域有低保真原型(可用 frontend-design 技能出 HTML 原型,放 页面原型/ai-output/
  • 能说清"同一个能力,Chat 形态和 Workbench 形态的效率差在哪"

实践 3 · 指标体系

北极星指标

一个,且必须是结果量:

text
候选:完成的订票任务数 / 节省的人工工时 / 端到端完成时间的缩短
我选:______,理由:______

自检:这个指标涨了,用户一定获益了吗?如果能想出一个"指标涨但用户更糟"的情形,换一个。

护栏指标

指标阈值依据超阈值时怎么办
危险动作越权次数0硬红线立即回滚
人工接管率
撤销率
单次任务成本
用户主动关闭 Agent 的比例
澄清轮数中位数

成本模型

按讲义第七节的五项,做一次真实核算:

成本项单次任务估算数据来源
模型 token(含失败重试与被丢弃的中间步骤)阶段 4 的轨迹记录
工具调用
基础设施
人工审核(确认/接管/纠错的人力)
失败成本(赔付/返工/信任损失)

关键计算:单次任务总成本 vs 人工做同一件事的成本。如果前者不显著低于后者,商业模型不成立——这个结论要敢于写出来。

验收

  • 北极星指标过了自检
  • 护栏指标每项有阈值和依据
  • 成本模型五项齐全,且做了与人工的对比

实践 4 · 五个项目的复盘

用本阶段的框架,逐个复盘手上的五个项目:

项目场景四筛子过了几个工具闭环有缺口吗交互形态对吗失败表达合格吗有指标吗
国际机票 AI 订票 Agent
Pi Agent 桌面端
DeepSeek Harness 双运行时集成
团队技能体系与知识基础设施
B2B 工作台的 vibe coding 交付模式

每个项目回答两个问题

  1. 如果现在重做,第一件要改的是什么?
  2. 这个项目最能展示什么能力? (为阶段 14 的作品集做素材筛选)

复盘的诚实度决定它的价值 写"效果良好"没有意义。有价值的复盘长这样:"工具闭环缺了支付,导致用户仍要切出去操作,这是它没被日常使用的主要原因;如果重做,第一件事是打通支付或者干脆把场景收窄到'比价'而不是'订票'。"

这种复盘能力本身就是产品经理的核心能力展示。


自测

维度阶段 12 的问法
解释讲清"为什么对专业用户来说对话可能是效率倒退"
画图12 状态图 + Workbench 原型
比较Chat / Workbench / 后台任务三种形态,各给一个适用场景与理由
实践状态图 + 原型 + 指标体系 + 五项目复盘
评测北极星指标过了"涨了用户一定获益吗"的自检
产品化成本模型能支撑一次"要不要做"的决策
迁移把状态图用到一个后台批量任务上,哪些状态会变?(提示:确认会变成批量确认,中断会变成暂停队列)

通过标志 拿状态图给一个没参与过项目的同事看,他能指出**"如果我在这一步关掉页面会怎样"**的答案。答不出来,说明中间产物那一列没写清楚。


  • 阶段 12 讲义
  • 阶段 7 实践:生命周期
  • 阶段 14 实践:作品集交付模板
  • 学习路线

本章目录
实践 1 · 完整状态图(⭐ 必做)实践 2 · 无对话框的 Agent Workbench实践 3 · 指标体系实践 4 · 五个项目的复盘自测Related Documents
苏ICP备2025204887号-2