Agent X-Ray
RuntimeNotesAbout
Notes/产品经理/Agent 基础知识/S01-实践

阶段 1 实践 — 三个可复现的模型行为实验

4 分钟 · 更新于 2026-09-01

阶段 1 实践 — 三个可复现的模型行为实验

本实践的产出最小产出:《产品经理真正需要理解的 LLM 原理》学习笔记 完整产出:三个实验记录 + 《模型选型五维矩阵》

预计投入:4~6 小时。实验都很小,重点是亲眼看到现象,不是做出漂亮的结论。

环境 本仓根目录有共享 .venv。脚本写到 ai-output/temporary/scripts/,数据写到 ai-output/temporary/data/。模型访问走本机已配置的网关(见 AI基础设施/CLIProxyAPI模型反代/AI基础设施/variflight_AI GATEWAY/,或 codex-cliproxy-gateway 记忆条目)。

注意 AI基础设施/ 目录有自己的 CLAUDE.md禁止在提交进仓库的文档里写明文密钥——实验脚本里的凭据一律走环境变量。


实验 1 · 同一任务下的输出稳定性(对应"温度"实践)

问题:同样的输入跑 20 次,输出会有多不一样?

做法

  1. 选一个有确定答案的业务任务。推荐:"从这段客服对话里抽出出发地、目的地、出发日期、乘客数",用 5 段真实风格的中文对话。
  2. 对每段对话,在 temperature ∈ {0, 0.3, 0.7, 1.0} 各跑 5 次,记录:
    • 抽取结果是否完全一致
    • 出现了几种不同的结果
    • 有没有"格式对但值错"的情况
  3. 汇总成表:温度 × 一致率。

记录模板

温度完全一致次数 / 总次数不同结果种数典型分歧
0
0.3
0.7
1.0

要看到的现象

  • 温度 0 也会出现不一致(哪怕只有一两次)——这是本实验的核心,写进笔记
  • 分歧集中在哪类字段?通常是日期隐含信息("下周三"、"我们仨")

验收:能用一句话解释"为什么生产上必须假设非确定性"。


实验 2 · 位置偏见(对应"上下文"实践)

问题:同一条关键信息放在上下文的不同位置,模型还能找到吗?

做法

  1. 准备 20 段长度相近的干扰文本(可用本仓 产品文档/ 里任意 PRD 的段落)。
  2. 准备 1 条唯一正确答案所在的关键段落,例如"XX 航线婴儿票的手续费规则是 …"。
  3. 把关键段落分别插到第 1、5、10、15、20 位,各跑 5 次,问同一个问题。
  4. 记录每个位置的正确率。

要看到的现象

  • 第 1 位和第 20 位正确率明显高于中间位置
  • 中间位置的错误形态:不是"说不知道",而是自信地用干扰段落里的内容作答

验收

  • 能画出一条位置-正确率曲线(哪怕只有 5 个点)
  • 能推出一条产品规则,例如"检索结果注入上下文时,把最相关的一条放最后、把系统指令放最前"

这个实验的价值 它把讲义里引用的论文结论变成自己观察到的事实。阶段 3 设计检索结果注入顺序时,你会直接用到这条曲线。


实验 3 · 最小语义检索(对应"Embedding"实践)

问题:向量检索什么时候会给出"很像但完全不对"的结果?

做法

  1. 取 30~50 条本仓真实内容做语料(推荐 wiki/concepts/ 下的概念文章片段,或 产品文档/ 的小节)。
  2. 用任一 embedding 模型建索引,写 15 行左右的脚本即可。
  3. 构造三类查询各 5 条:
    • 正常查询:措辞不同、意思相同
    • 方向反转:把"上海→东京"换成"东京→上海"
    • 否定/限定翻转:把"可退改"换成"不可退改"、把"国际"换成"国内"
  4. 记录 Top-5 命中里有多少是语义相近但业务上错误的。

要看到的现象

  • 方向反转和否定翻转的查询,Top-1 经常仍是原文档
  • 相似度分数看不出它错了——分数高低不区分"对"和"像"

验收

  • 能列出至少 3 类"向量检索必然失手"的业务查询形态
  • 能说明为什么阶段 3 要引入混合检索与重排

实验 4(可选)· 推理模型对照

如果时间允许,选 2~3 个任务对照普通模型与 Reasoning Model:

任务类型普通模型推理模型延迟差成本差
退改费用按规则计算可验证
多程行程可行性判断可验证
给用户写一段改签说明主观

要看到的现象:可验证任务上差距明显、主观任务上几乎无差别,但延迟和成本在两类任务上同样地贵。


产出 1 · 学习笔记(⭐ 必做)

《产品经理真正需要理解的 LLM 原理》,1000~3000 字,结构建议:

  1. 一句话说清模型是什么(无状态函数)
  2. 三个实验各一段:现象 → 机制 → 产品规则
  3. 五个必须能解释的限制(幻觉 / 知识截止 / 上下文衰退 / 长文本≠记忆 / 能力不稳定),每条配一个国际机票业务的例子
  4. 一段"哪些 Agent 问题升级模型解决不了"的清单

验收:把这篇给不懂技术的同事看,对方能答出"为什么不能保证每次输出一样"。


产出 2 · 模型选型五维矩阵

一张表 + 一段说明。表的列固定为:效果 / 延迟 / 价格 / 上下文 / 生态。行是你实际可能选的模型

要求:

  • 价格一列写的是每完成一次任务的成本估算,不是每百万 token 单价
  • 生态一列必须包含:结构化输出支持、工具调用稳定性、Prompt Caching 支持、限流策略、降级路径
  • 表头标注数据获取日期(模型参数变化快,无日期的对照表三个月后就是错的)
  • 附一段"什么信号触发主备切换"的规则

自测

维度阶段 1 的问法
解释不用"神经网络""参数"这些词,讲清模型为什么会幻觉
画图画出"一次 LLM 请求从文本到生成结果"的流程图(tokenize → 前向 → 分布 → 采样 → 解码)
比较通用模型 vs 推理模型 vs 小模型,各给一个本业务的适用场景
实践三个实验都跑完,有数据
评测能说明"为什么单次成功不能算通过"
产品化五维矩阵能用于一次真实选型讨论
迁移换一家模型厂商,三个实验的结论是否依然成立?位置偏见通常成立,具体数值不成立

  • 阶段 1 讲义
  • 阶段 3 讲义
  • 学习路线

本章目录
实验 1 · 同一任务下的输出稳定性(对应"温度"实践)实验 2 · 位置偏见(对应"上下文"实践)实验 3 · 最小语义检索(对应"Embedding"实践)实验 4(可选)· 推理模型对照产出 1 · 学习笔记(⭐ 必做)产出 2 · 模型选型五维矩阵自测Related Documents
苏ICP备2025204887号-2