Agent X-Ray
RuntimeNotesAbout
Notes/产品经理/Agent 基础知识/S14-实践

阶段 14 实践 — 作品集交付模板

5 分钟 · 更新于 2026-09-01

阶段 14 实践 — 作品集交付模板

本实践的产出最小产出:综合项目 A、B 二选一完整交付 完整产出:综合项目 + 2~3 篇公开作品 + 素材归档

预计投入:6~8 周(路线图第 18~24 周)。本文件是交付模板与检查清单,不是又一份要读的材料。


一、开工前:素材盘点

前十三个阶段应当已经产出了这些东西。开工第一件事是确认它们都在、都能找到

阶段应有产出在哪状态
0分层图、能力模型、术语表☐ 有 ☐ 缺
1LLM 原理笔记、模型选型五维矩阵、三个实验数据
2需求抽取 Schema、流式事件记录、Fallback 表
3检索对照数据、错误注入实验、知识边界图
4最小 Agent Loop 代码、轨迹 JSON、工具错误信息规范
5工具重审报告、两份契约、Skill
6九格对照表、同构能力对照图、选型模板
7生命周期设计、会话恢复对照、长任务设计
8写入门槛规则、记忆生命周期 SOP
9单 Agent vs Planner 对比数据、三角色设计、链路复盘
1030 条评测集、跑批报告、A/B 统计、准入门槛
11授权矩阵、注入演练报告、五段式交互
1212 状态图、Workbench 原型、指标体系、五项目复盘
13路线分析、成熟度模型、商业模型试算

加粗的三项是作品集的核心资产 阶段 10 的评测数据、阶段 11 的注入演练、阶段 5 的工具重审——这三样别人很难速成。如果它们缺失或质量不够,优先回去补,比往综合项目里再加章节更值。


二、综合项目交付模板

通用骨架(A、B 都用这个)

text
一、问题
   1.1 目标用户与他们现在的做法(要有具体的人和具体的耗时)
   1.2 我们要解决的那一件事
   1.3 为什么现在做 / 为什么值得做

二、边界与承诺
   2.1 会做什么(用户语言)
   2.2 不会做什么
   2.3 做之前会问你什么
   2.4 自主等级(按动作,不按产品)

三、方案
   3.1 架构(四层图 + 九部件的目标状态)
   3.2 关键取舍(每条:选了什么 / 放弃了什么 / 什么条件下会改)
   3.3 能力地图

四、证据                              ← 本方案与"PPT 方案"的分水岭
   4.1 评测集与结果(三层,含统计口径)
   4.2 安全演练结果(三轮对照)
   4.3 成本实测

五、风险
   5.1 风险清单(技术 / 业务 / 组织)
   5.2 缓解措施
   5.3 遗留风险与后续验证计划     ← 不要装作没有

六、落地
   6.1 里程碑与排期
   6.2 依赖与前置条件
   6.3 成本与商业模型
   6.4 第一个可验证的里程碑

七、复盘(如果是既有项目的 2.0)
   7.1 1.0 做对了什么
   7.2 1.0 做错了什么             ← 加分项在这里
   7.3 这次怎么改

交付物清单

类型A 项目B 项目
主文档产品蓝图(本模板)产品方案(本模板)
四层架构 + 能力地图 + 生命周期用户旅程 + 12 状态图 + 工具面分域
授权矩阵 + 选型对照授权矩阵 + 评测集 + 工具契约
数据评测/成本实测评测跑批 + 注入演练
可交互Demo 或高保真原型Workbench 原型

存放:正式版进 ai-output/formal/产品文档/;过程稿放 ai-output/temporary/drafts/;图放 Excalidraw/;原型放 页面原型/


三、公开作品写作模板

《如何评测一个会使用工具的 Agent》(建议第一篇)

text
一、为什么"试了几次感觉不错"不够
    —— 用阶段 1 实验 1 的温度数据开场:同样输入,输出并不一样

二、评什么:三层
    最终结果 / 轨迹 / 状态变化
    重点讲第三层:为什么"数据库最终状态"是最硬的判据

三、怎么建评测集
    四类配比 + 固定环境(时间、工具桩)
    为什么不能用线上接口

四、真实数据
    30 条用例的跑批结果
    "结果对但轨迹不对"的比例 —— 这是本文最有价值的一个数字

五、准入门槛怎么定
    两条硬红线为什么不能是百分比

六、常见误用
    pass@k 的口径问题
    LLM 判官的位置/长度偏好

素材来源:阶段 10 全部产出 + 阶段 1 实验 1。

《Agent 的安全不是弹一个确认框》(建议第二篇)

text
一、一个演示:三轮注入实验
    无防护 / 只加提示词防护 / 加能力层防护
    数据摆在最前面

二、为什么提示词层防护不可靠
    间接注入的载体是工具返回,不是用户输入
    "AI 防火墙"为什么挡不住成熟攻击

三、四层防线
    能力边界 / 策略判定 / 人机确认 / 审计可撤销

四、确认框的两个失效模式
    确认疲劳;只优化漏拦不优化误报

五、授权矩阵怎么做
    四级分类 + 确认预算检查

六、一句话结论
    "让模型不被骗"做不到;"被骗也做不成坏事"做得到

素材来源:阶段 11 全部产出。

《Pi 与 DeepSeek Harness:减法哲学和全插件化的产品取舍》(建议第三篇)

必须避免的写法:复述三份教程的结论。

应有的写法:以"谁承担风险"为主线,用九格对照表作骨架,每一节的落点都是产品判断而不是技术描述。


四、发布前检查

text
□ 每篇文章里,至少有一个数字是自己实验测出来的
□ 每篇文章里,至少有一处"我原来以为 X,实测发现 Y"
□ 没有一段是只有结论没有依据的
□ 所有引用的外部事实都有链接和日期
□ 所有涉及公司业务的内容已脱敏(航线/价格/客户/内部系统名)
□ 找一个同行读一遍,能提出三个尖锐问题
□ 文章里的"我们"指代清楚(是团队做的还是我做的)

脱敏检查要认真做 工具名、内部服务名、真实价格、客户名、内网地址、凭据——公开前逐项过。一次泄露的代价,远大于这篇文章带来的收益。


五、术语表回填与收尾

作品集完成后,做最后一件事:回到 术语表

  • 十四个阶段新学到的概念,都加进去了吗?
  • 阶段 0 打的 #待澄清 标记,清掉了几条?还剩哪些?
  • 每条定义是不是已经换成自己的话了?
  • 至少 30 个词条有本业务的例子了吗?

整条路线的收尾自检 剩下的 #待澄清 就是你下一轮学习的起点。清空它不是目标——诚实地知道自己还有哪些概念说不清,才是这条路线真正要建立的能力。


六、最终验收(对应路线图「六、阶段性自测」)

维度阶段 14 的问法
解释把综合项目讲给一个非技术的人听,10 分钟,他能复述核心价值
画图架构图、状态图、授权矩阵齐全,且能互相印证
比较关键取舍每条都写清"放弃了什么、什么条件下会改"
实践有可运行/可点击的东西
评测有真实数据,有统计口径,有"不能确定"的诚实结论
产品化方案能进真实立项讨论
迁移随便找一个没研究过的 Agent 产品,2 小时内写出 1500 字拆解与改进建议

走完这条路线的标志 不是"看完了多少文章",是最后一行那个迁移测试。做得到,说明这套框架已经是你的了;做不到,说明还停留在记住了很多结论的阶段。


  • 阶段 14 讲义:评审标准
  • 学习路线
  • 术语表
  • 外部权威资料清单

本章目录
一、开工前:素材盘点二、综合项目交付模板三、公开作品写作模板四、发布前检查五、术语表回填与收尾六、最终验收(对应路线图「六、阶段性自测」)Related Documents
苏ICP备2025204887号-2