Agent X-Ray
RuntimeNotesAbout
Notes/产品经理/Agent 基础知识/S13-实践

阶段 13 实践 — 成熟度模型与路线机会分析

5 分钟 · 更新于 2026-09-01

阶段 13 实践 — 成熟度模型与路线机会分析

本实践的产出最小产出:「通用 Harness」与「行业 Agent」两条产品路线的机会差异分析 完整产出:路线分析 + 企业成熟度模型 + 扩展生态设计 + 一次商业模型试算

预计投入:5~7 小时。Pi 桌面端的完整产品战略不在这里做,留给阶段 14 综合项目 A。


实践 1 · 两条路线的机会差异分析(⭐ 必做)

分析框架

对「通用 Harness」和「行业 Agent」两条路线,各回答十个问题:

#问题通用 Harness行业 Agent
1目标客户是谁,他们现在怎么解决这个问题
2我们能提供的具体价值(可量化)
3竞争对手是谁
4大厂免费版会不会覆盖这个价值
5护城河在哪(对照讲义第六节九项)
6需要的核心能力(对应本路线哪几个阶段)
7我们已具备什么 / 还缺什么
8定价模式
9最大风险
1012 个月内可验证的里程碑

三条填表要求

  • 第 4 问必须诚实回答。通用 Harness 这条路上,"大厂明天就免费送一个更好的"是常态风险,不能回避。
  • 第 5 问要对照九项护城河逐个打勾,不能只写"我们做得更好"。
  • 第 7 问要与阶段 0 的能力模型对照——缺的能力如果落在你 0~1 分的项上,这条路线的执行风险很高。

结论部分

text
主线选择:______
理由(三条以内):
放弃/暂缓另一条的理由:
两条路线共用的资产(如果有):
12 个月的验证计划:

这个选择会决定作品集的形态 阶段 14 的两个综合项目分别对应这两条路线。主线定了,综合项目就该优先做对应的那个,另一个作为后续迭代。两个都做一半,是最差的选择。

验收标准

  • 20 格填满
  • 有明确的主线结论 + 三条以内的理由
  • 12 个月里程碑是可验证的("完成 X 个客户的付费验证",不是"打磨产品")

实践 2 · 企业 Agent 成熟度模型

任务:把讲义第七节的 L0~L4 五级模型,落成可评估的检查表

每级要写清三件事

级别进入标志(客观可判)典型障碍突破动作
L0 探索
L1 试点
L2 生产
L3 规模化
L4 再设计

"进入标志"必须客观可判。反例:"团队开始重视 AI"。正例:"至少一个场景有回归评测集、准入门槛和授权矩阵,且最近一次发版走了这套流程"。

自评:我们现在在哪一级

对手上的三个场景各评一次:

场景当前级别卡在什么地方下一步最小动作
国际机票 AI 订票 Agent
团队技能体系与知识基础设施
Pi Agent 桌面端

"卡在什么地方"往往是组织问题不是技术问题 最常见的答案是"没人能回答 Agent 做错了算谁的"。如果是这样,下一步最小动作应当是做出授权矩阵 + 审计日志 + 撤销入口(阶段 11 的产出),而不是继续优化效果。

验收

  • 五级的进入标志都是客观可判的
  • 三个场景的自评有结论,且"下一步最小动作"是一周内能启动的事

实践 3 · 扩展生态设计

任务:为一个 Harness 产品设计 Extension / Skill / MCP 三层扩展面。

谁来写能做什么不能做什么兼容承诺
MCP Server第三方提供工具与资源改变 Agent 的核心行为
Skill用户/团队提供领域知识与流程调用未授权的工具
Extension / Plugin高级用户改变运行时行为绕过权限层

开发者体验四问(讲义第四节)

问题我的答案
开发者为什么来写这个扩展?
从零到第一个能跑的东西要多久?
怎么调试?出错时能看到什么?
我们承诺多久的向后兼容?

用本仓的 Skill 体系做验证

本仓的 35+ 个 Skill 是"内部生态"的现成样本。回答:

  • 这些 Skill 里,哪几个是真的被反复使用的?哪几个写完就没再用过?
  • 用得多的那几个,有什么共同点?(提示:触发描述准确、解决高频痛点、输出可直接用)
  • 从这个样本能推出什么"扩展生态设计原则"?

内部生态的数据比任何理论都可信 你手上有一个跑了很久的真实扩展生态。统计它的使用分布(哪些常用、哪些废弃),是设计外部生态最有价值的输入——它会告诉你开发者真正需要什么,以及大部分扩展会被废弃这个事实。


实践 4 · 商业模型试算

任务:对国际机票 Agent(或 Pi 桌面端)做一次完整试算。

成本侧(承接阶段 12 实践 3)

单次任务月度(按预估量)
模型 token(含重试与被丢弃的中间步骤)
工具调用
基础设施
人工审核
失败成本
合计

收入侧:三种定价各试算一次

模式计费方式月收入估算客户能接受吗主要风险
按席位与"减少人力"的价值主张冲突
按任务客户预算不可预测
按结果"什么算达成"的定义争议

三个必须回答的问题

  1. 单次任务成本 vs 人工做同一件事的成本,差距是多少倍?不到 2 倍,商业逻辑很脆弱。
  2. 按结果定价的话,"结果"怎么客观计量? 这个度量需要阶段 10 的评测能力支撑——现在具备吗?
  3. 自主等级降一级,人工审核成本上升多少? 这决定了自主度是不是定价参数。

验收

  • 成本五项齐全,有依据(token 数来自阶段 4 的真实轨迹)
  • 三种定价都算过,有推荐结论
  • 三个问题有明确回答,包括"目前还不具备"这种诚实答案

实践 5 · 护城河季度自检

写一份可以每季度重复做的自检清单:

text
问题:如果竞争对手明天拿到我们全部的提示词和架构文档,多久能追上?

逐项检查(对照讲义第六节九项):
  □ 独家数据:我们有什么别人拿不到的?
  □ 工具闭环:我们能做哪些写操作是别人做不了的?
  □ 评测集与失败案例库:积累了多少条?别人从零建要多久?
  □ 工作流嵌入:用户的流程为我们改造了多少?
  □ 信任与合规:有什么资质/审计记录是别人短期拿不到的?
  □ 分发渠道:谁在用户面前?

结论:护城河主要在 ______,最脆弱的是 ______。
本季度要加固的一项:______

验收:填完一次,且"最脆弱的是"这一行有诚实的答案。


自测

维度阶段 13 的问法
解释讲清"为什么按席位定价与 Agent 的价值主张冲突"
画图成熟度模型五级图 + 扩展面三层图
比较两条路线的十问对照,有明确主线结论
实践成熟度自评 + 商业模型试算
评测按结果定价所需的度量能力,现在具备吗(诚实回答)
产品化路线分析能支撑一次真实的立项讨论
迁移把成熟度模型用到"团队知识基础设施"这个非 Agent 场景,还成立吗?

通过标志 能对"我们要不要做一个通用 Agent 平台"这个问题,给出一个带风险条件的结论("在 X 成立的情况下值得做,否则应当聚焦 Y"),而不是"看起来机会很大"。


  • 阶段 13 讲义
  • 阶段 12 实践:指标体系
  • 阶段 14 讲义:综合项目
  • 学习路线

本章目录
实践 1 · 两条路线的机会差异分析(⭐ 必做)实践 2 · 企业 Agent 成熟度模型实践 3 · 扩展生态设计实践 4 · 商业模型试算实践 5 · 护城河季度自检自测Related Documents
苏ICP备2025204887号-2