本实践的产出 ⭐ 最小产出:「通用 Harness」与「行业 Agent」两条产品路线的机会差异分析 完整产出:路线分析 + 企业成熟度模型 + 扩展生态设计 + 一次商业模型试算
预计投入:5~7 小时。Pi 桌面端的完整产品战略不在这里做,留给阶段 14 综合项目 A。
对「通用 Harness」和「行业 Agent」两条路线,各回答十个问题:
| # | 问题 | 通用 Harness | 行业 Agent |
|---|---|---|---|
| 1 | 目标客户是谁,他们现在怎么解决这个问题 | ||
| 2 | 我们能提供的具体价值(可量化) | ||
| 3 | 竞争对手是谁 | ||
| 4 | 大厂免费版会不会覆盖这个价值 | ||
| 5 | 护城河在哪(对照讲义第六节九项) | ||
| 6 | 需要的核心能力(对应本路线哪几个阶段) | ||
| 7 | 我们已具备什么 / 还缺什么 | ||
| 8 | 定价模式 | ||
| 9 | 最大风险 | ||
| 10 | 12 个月内可验证的里程碑 |
这个选择会决定作品集的形态 阶段 14 的两个综合项目分别对应这两条路线。主线定了,综合项目就该优先做对应的那个,另一个作为后续迭代。两个都做一半,是最差的选择。
验收标准:
任务:把讲义第七节的 L0~L4 五级模型,落成可评估的检查表。
| 级别 | 进入标志(客观可判) | 典型障碍 | 突破动作 |
|---|---|---|---|
| L0 探索 | |||
| L1 试点 | |||
| L2 生产 | |||
| L3 规模化 | |||
| L4 再设计 |
"进入标志"必须客观可判。反例:"团队开始重视 AI"。正例:"至少一个场景有回归评测集、准入门槛和授权矩阵,且最近一次发版走了这套流程"。
对手上的三个场景各评一次:
| 场景 | 当前级别 | 卡在什么地方 | 下一步最小动作 |
|---|---|---|---|
| 国际机票 AI 订票 Agent | |||
| 团队技能体系与知识基础设施 | |||
| Pi Agent 桌面端 |
"卡在什么地方"往往是组织问题不是技术问题 最常见的答案是"没人能回答 Agent 做错了算谁的"。如果是这样,下一步最小动作应当是做出授权矩阵 + 审计日志 + 撤销入口(阶段 11 的产出),而不是继续优化效果。
验收:
任务:为一个 Harness 产品设计 Extension / Skill / MCP 三层扩展面。
| 层 | 谁来写 | 能做什么 | 不能做什么 | 兼容承诺 |
|---|---|---|---|---|
| MCP Server | 第三方 | 提供工具与资源 | 改变 Agent 的核心行为 | |
| Skill | 用户/团队 | 提供领域知识与流程 | 调用未授权的工具 | |
| Extension / Plugin | 高级用户 | 改变运行时行为 | 绕过权限层 |
| 问题 | 我的答案 |
|---|---|
| 开发者为什么来写这个扩展? | |
| 从零到第一个能跑的东西要多久? | |
| 怎么调试?出错时能看到什么? | |
| 我们承诺多久的向后兼容? |
本仓的 35+ 个 Skill 是"内部生态"的现成样本。回答:
内部生态的数据比任何理论都可信 你手上有一个跑了很久的真实扩展生态。统计它的使用分布(哪些常用、哪些废弃),是设计外部生态最有价值的输入——它会告诉你开发者真正需要什么,以及大部分扩展会被废弃这个事实。
任务:对国际机票 Agent(或 Pi 桌面端)做一次完整试算。
| 项 | 单次任务 | 月度(按预估量) |
|---|---|---|
| 模型 token(含重试与被丢弃的中间步骤) | ||
| 工具调用 | ||
| 基础设施 | ||
| 人工审核 | ||
| 失败成本 | ||
| 合计 |
| 模式 | 计费方式 | 月收入估算 | 客户能接受吗 | 主要风险 |
|---|---|---|---|---|
| 按席位 | 与"减少人力"的价值主张冲突 | |||
| 按任务 | 客户预算不可预测 | |||
| 按结果 | "什么算达成"的定义争议 |
验收:
写一份可以每季度重复做的自检清单:
验收:填完一次,且"最脆弱的是"这一行有诚实的答案。
| 维度 | 阶段 13 的问法 |
|---|---|
| 解释 | 讲清"为什么按席位定价与 Agent 的价值主张冲突" |
| 画图 | 成熟度模型五级图 + 扩展面三层图 |
| 比较 | 两条路线的十问对照,有明确主线结论 |
| 实践 | 成熟度自评 + 商业模型试算 |
| 评测 | 按结果定价所需的度量能力,现在具备吗(诚实回答) |
| 产品化 | 路线分析能支撑一次真实的立项讨论 |
| 迁移 | 把成熟度模型用到"团队知识基础设施"这个非 Agent 场景,还成立吗? |
通过标志 能对"我们要不要做一个通用 Agent 平台"这个问题,给出一个带风险条件的结论("在 X 成立的情况下值得做,否则应当聚焦 Y"),而不是"看起来机会很大"。