本实践的产出 ⭐ 最小产出:《产品经理真正需要理解的 LLM 原理》学习笔记 完整产出:三个实验记录 + 《模型选型五维矩阵》
预计投入:4~6 小时。实验都很小,重点是亲眼看到现象,不是做出漂亮的结论。
环境 本仓根目录有共享 .venv。脚本写到 ai-output/temporary/scripts/,数据写到 ai-output/temporary/data/。模型访问走本机已配置的网关(见 AI基础设施/CLIProxyAPI模型反代/ 与 AI基础设施/variflight_AI GATEWAY/,或 codex-cliproxy-gateway 记忆条目)。
注意 AI基础设施/ 目录有自己的 CLAUDE.md,禁止在提交进仓库的文档里写明文密钥——实验脚本里的凭据一律走环境变量。
问题:同样的输入跑 20 次,输出会有多不一样?
做法:
记录模板:
| 温度 | 完全一致次数 / 总次数 | 不同结果种数 | 典型分歧 |
|---|---|---|---|
| 0 | |||
| 0.3 | |||
| 0.7 | |||
| 1.0 |
要看到的现象:
验收:能用一句话解释"为什么生产上必须假设非确定性"。
问题:同一条关键信息放在上下文的不同位置,模型还能找到吗?
做法:
要看到的现象:
验收:
这个实验的价值 它把讲义里引用的论文结论变成自己观察到的事实。阶段 3 设计检索结果注入顺序时,你会直接用到这条曲线。
问题:向量检索什么时候会给出"很像但完全不对"的结果?
做法:
要看到的现象:
验收:
如果时间允许,选 2~3 个任务对照普通模型与 Reasoning Model:
| 任务 | 类型 | 普通模型 | 推理模型 | 延迟差 | 成本差 |
|---|---|---|---|---|---|
| 退改费用按规则计算 | 可验证 | ||||
| 多程行程可行性判断 | 可验证 | ||||
| 给用户写一段改签说明 | 主观 |
要看到的现象:可验证任务上差距明显、主观任务上几乎无差别,但延迟和成本在两类任务上同样地贵。
《产品经理真正需要理解的 LLM 原理》,1000~3000 字,结构建议:
验收:把这篇给不懂技术的同事看,对方能答出"为什么不能保证每次输出一样"。
一张表 + 一段说明。表的列固定为:效果 / 延迟 / 价格 / 上下文 / 生态。行是你实际可能选的模型。
要求:
| 维度 | 阶段 1 的问法 |
|---|---|
| 解释 | 不用"神经网络""参数"这些词,讲清模型为什么会幻觉 |
| 画图 | 画出"一次 LLM 请求从文本到生成结果"的流程图(tokenize → 前向 → 分布 → 采样 → 解码) |
| 比较 | 通用模型 vs 推理模型 vs 小模型,各给一个本业务的适用场景 |
| 实践 | 三个实验都跑完,有数据 |
| 评测 | 能说明"为什么单次成功不能算通过" |
| 产品化 | 五维矩阵能用于一次真实选型讨论 |
| 迁移 | 换一家模型厂商,三个实验的结论是否依然成立?位置偏见通常成立,具体数值不成立 |