Agent X-Ray
RuntimeNotesAbout
Notes/产品经理/Agent 基础知识/S01-讲义

阶段 1 讲义 — 产品经理真正需要理解的 LLM 原理

7 分钟 · 更新于 2026-09-01

阶段 1 讲义 — 产品经理真正需要理解的 LLM 原理

本阶段的深度标准 目标是能解释机制和产品影响,不是能推导训练算法。判别标准:当研发说"这个做不到"时,你能判断这是模型的固有限制当前调用方式的限制,还是没做上下文工程——这三者的应对完全不同。

一句话前提 模型是一个无状态函数:给一段 token 序列,输出下一个 token 的概率分布。你在产品里看到的"记忆""思考""坚持""犹豫",全部是这个函数被外层软件反复调用的结果。阶段 1 全部内容都是这句话的展开。


一、文本表示:Token、Embedding、相似度

Token 是模型看世界的最小单位

模型不认字,只认 token。一段文本先被 tokenizer 切成 token 序列,再映射成整数 ID。

产品影响有三条,都很实际:

  1. 中文比英文贵。同样信息量,中文的 token 数通常明显高于英文(具体倍率随 tokenizer 而异,需要实测而不是背数字)。这直接影响长文档场景的成本估算。
  2. 计价、限流、上下文窗口全部以 token 计,不是字数。做成本模型时用字数换算会系统性偏低。
  3. 切分边界会影响行为。少见的专有名词、航班号、订单号会被切成多个碎片 token,模型对它们的处理稳定性低于常见词——这是"为什么 Agent 老是把 PNR 抄错一位"的机制层解释之一。

Embedding 是"意思"的坐标

Embedding 把一段文本映射成一个高维向量,语义相近的文本向量距离近。它是检索的基础(阶段 3),不是生成的基础。

产品经理最需要建立的一条直觉:Embedding 度量的是"像不像",不是"对不对"。"东京到上海的航班取消政策"和"上海到东京的航班取消政策"在向量空间里几乎重合,但业务上是两件事。所有基于纯向量检索的问答系统,都在这个位置漏水。

Attention 与 Transformer:只要理解一件事

不需要会推导。需要理解的是:生成第 n 个 token 时,模型会回看前面所有 token 并给它们分配注意力权重。

由此推出三条产品结论:

  • 位置有偏见。研究反复验证:开头和结尾的信息被利用得更好,中间显著更差(Lost in the Middle, arXiv:2307.03172;后续工作把它归因为模型固有的 U 型注意力偏置,arXiv:2406.16008)。关键指令放开头或结尾,不要埋在中间。
  • 计算量随长度增长。这是长上下文既贵又慢的机制原因。
  • 前缀可缓存。同一段前缀重复出现时,其 KV 计算结果可以复用——这就是 Prompt Caching 的原理(阶段 2 展开)。

二、推理:为什么同一个 Prompt 会给不同答案

模型每一步输出的是整个词表上的概率分布,然后按采样策略挑一个。

参数作用产品含义
Temperature拉平(高)或锐化(低)概率分布低温更稳定但更套路;低温 ≠ 确定性
Top-p / Top-k只在累计概率 p / 前 k 个候选里采样截断长尾,减少胡说,但也减少多样性
Seed固定随机源即便固定,服务端批处理、硬件浮点差异仍可能导致输出不同

产品经理最该记住的一条 不存在"把温度设成 0 就变成确定性系统"这回事。 生产上应当假设:同一输入、同一参数,两次运行可能走不同路径。这是阶段 10(评测)必须用统计方法而不是单次断言的根本原因。

Reasoning Model(推理模型)什么时候值得用

判别三问(综合业界共识与实测经验):

  1. 正确性可被验证吗(数学、代码、逻辑、可对账的业务规则)?可验证时推理模型收益大;主观任务(文案、摘要、共情回复)收益小。
  2. 准确性是否比速度更重要?用户在等回复时,几十秒的思考时间通常不可接受;后台批处理则完全可以。
  3. 一次错误的代价是否大于额外成本?错一次要人工返工两小时的场景,多花的推理成本可以忽略。

对应到国际机票业务:运价规则解析、退改费用计算、对账差异归因 属于第一类;给用户的推荐话术、行程摘要 属于第二类。


三、能力与限制:五个必须能解释的现象

1. 幻觉(Hallucination)

模型的目标是"生成看起来最合理的下一个 token",不是"说真话"。当它没有相关知识时,流畅的错误答案和正确答案在生成机制上没有区别

产品对策不是"让模型别乱说",而是:给它可核验的上下文(阶段 3)、要求它给出引用、允许它说"不知道"、对高风险输出做外部校验。

2. 知识截止(Knowledge Cutoff)

训练数据有截止时间。凡是会变的事实——价格、政策、航班、库存、代码——都不能依赖模型的内部知识。 这条直接推出本仓的硬规则:代码事实一律走 vfticket codescope ask,不靠记忆。

3. 上下文衰退与 Context Rot

不是"塞满就好"。上下文越长,中间信息越容易被忽略,无关内容还会稀释注意力。Chroma 的上下文腐化研究给出过一个很好记的现象描述:把关键文档放在 20 篇里的第 5~15 位,准确率会显著下降;放在最前或最后则保持得住。

4. 长文本 ≠ 长期记忆

100 万上下文窗口解决的是"一次能塞多少",不解决"跨会话记住什么"。后者是阶段 8 的题目。把两者混为一谈,会导致产品方案里出现"我们上大窗口模型就有记忆了"这种错误判断。

5. 能力不稳定

模型"知道"一件事,不等于每次都能稳定用出来。同一个知识点,换个问法、换个上下文位置、多一个干扰工具,成功率可能明显变化。这就是为什么必须有评测(阶段 10)而不是"试了几次挺好"。


四、模型类型与生命周期

类型地图

类型特征典型用法
通用模型均衡,延迟可控Agent 主力
Reasoning Model先思考后回答,慢且贵规划、复杂推理、评测判官
多模态模型图/音/视频输入票面识别、原型截图理解
小模型便宜、快、可本地分类、路由、抽取、护栏
开源模型可私有化、可微调数据不出域、成本敏感的高频任务

一条常被忽略的架构手法 用小模型做路由和护栏,用大模型做主干。国际机票场景里"这句话是查价、改签还是投诉"这种分类,用小模型做又快又便宜,还能显著降低主模型的上下文负担。

生命周期:预训练 → 对齐 → 蒸馏/量化

阶段解决什么产品影响
预训练获得语言与世界知识决定知识截止与基础能力上限
对齐(指令微调 / 偏好优化)让模型听指令、符合规范决定"它会不会照你说的做"以及拒答边界
蒸馏 / 量化用更小的模型逼近大模型决定同一家族里"便宜档"能力衰减在哪些维度

深度要求:能与算法同学对话即可(路线图 P2)。不需要区分 SFT / RLHF / DPO 的算法细节,需要知道"这三步分别决定了什么产品属性"。


五、模型选型五维矩阵

阶段 1 的第二个产出物。五个维度不是并列的,有依赖顺序

1200

评估时最常见的两个错误:

  • 只比单价不比总量。便宜模型如果要多轮重试、输出更啰嗦、更常调错工具,全链路成本可能更高。正确口径是每完成一次任务的成本
  • 忘了降级路径。选型必须成对:主模型 + 备用模型,并且明确"什么信号触发切换"(超时、限流、结构化输出校验失败、连续工具调用错误)。

六、常见误区清单

误区纠正
"温度 0 = 确定性"只是更锐化的采样,仍非确定性
"上下文越长越好"长上下文带来位置偏见、成本与延迟;先做筛选再谈长度
"模型答错就是模型不行"先分清:能力不足 / 上下文缺失 / 指令歧义 / 工具契约错
"Embedding 检索命中就是答案对"相似 ≠ 正确,方向词、否定词、时间限定最常翻车
"推理模型总是更好"主观任务上收益小,延迟成本却是实打实的
"小模型没用"路由、分类、护栏、抽取上性价比极高
"私有化部署更省钱"只有在高频稳定负载下才成立,低频场景 GPU 闲置成本更高

七、外部一手资料(阶段 1 精读,约 5 小时)

资料出处读它拿什么
Lost in the Middle: How Language Models Use Long ContextsarXiv 2023-07位置偏见的原始证据,只读摘要 + 图 1 即可
Calibrating Positional Attention Bias Improves Long Context UtilizationarXiv 2024-06把"中间丢失"归因到 U 型注意力偏置,理解机制而非现象
Effective context engineering for AI agentsAnthropic,2025-09-29阶段 3 的主教材,阶段 1 先读前半理解"上下文是有限且会衰减的资源"
各家模型官方文档的能力与限制章节官方唯一可信的窗口大小 / 价格 / 特性对照来源,二手对比表会过期

数字类信息不要抄二手表 模型的窗口、价格、限流每几个月就变。本讲义刻意不写具体数字。做选型时以官方文档为准,并在自己的选型矩阵里记上"数据获取日期"。

本仓已有资料:

  • Claude Opus 5 提示词指南(阶段 2 主用,此处先看"模型特性"部分)
  • Fable 实地指南(不同定位模型的能力画像差异)

  • 阶段 1 实践:三个可复现的模型行为实验
  • 阶段 2 讲义
  • 术语表
  • 学习路线

本章目录
一、文本表示:Token、Embedding、相似度二、推理:为什么同一个 Prompt 会给不同答案三、能力与限制:五个必须能解释的现象四、模型类型与生命周期五、模型选型五维矩阵六、常见误区清单七、外部一手资料(阶段 1 精读,约 5 小时)Related Documents
苏ICP备2025204887号-2