本阶段的深度标准 目标是能解释机制和产品影响,不是能推导训练算法。判别标准:当研发说"这个做不到"时,你能判断这是模型的固有限制、当前调用方式的限制,还是没做上下文工程——这三者的应对完全不同。
一句话前提 模型是一个无状态函数:给一段 token 序列,输出下一个 token 的概率分布。你在产品里看到的"记忆""思考""坚持""犹豫",全部是这个函数被外层软件反复调用的结果。阶段 1 全部内容都是这句话的展开。
模型不认字,只认 token。一段文本先被 tokenizer 切成 token 序列,再映射成整数 ID。
产品影响有三条,都很实际:
Embedding 把一段文本映射成一个高维向量,语义相近的文本向量距离近。它是检索的基础(阶段 3),不是生成的基础。
产品经理最需要建立的一条直觉:Embedding 度量的是"像不像",不是"对不对"。"东京到上海的航班取消政策"和"上海到东京的航班取消政策"在向量空间里几乎重合,但业务上是两件事。所有基于纯向量检索的问答系统,都在这个位置漏水。
不需要会推导。需要理解的是:生成第 n 个 token 时,模型会回看前面所有 token 并给它们分配注意力权重。
由此推出三条产品结论:
模型每一步输出的是整个词表上的概率分布,然后按采样策略挑一个。
| 参数 | 作用 | 产品含义 |
|---|---|---|
| Temperature | 拉平(高)或锐化(低)概率分布 | 低温更稳定但更套路;低温 ≠ 确定性 |
| Top-p / Top-k | 只在累计概率 p / 前 k 个候选里采样 | 截断长尾,减少胡说,但也减少多样性 |
| Seed | 固定随机源 | 即便固定,服务端批处理、硬件浮点差异仍可能导致输出不同 |
产品经理最该记住的一条 不存在"把温度设成 0 就变成确定性系统"这回事。 生产上应当假设:同一输入、同一参数,两次运行可能走不同路径。这是阶段 10(评测)必须用统计方法而不是单次断言的根本原因。
判别三问(综合业界共识与实测经验):
对应到国际机票业务:运价规则解析、退改费用计算、对账差异归因 属于第一类;给用户的推荐话术、行程摘要 属于第二类。
模型的目标是"生成看起来最合理的下一个 token",不是"说真话"。当它没有相关知识时,流畅的错误答案和正确答案在生成机制上没有区别。
产品对策不是"让模型别乱说",而是:给它可核验的上下文(阶段 3)、要求它给出引用、允许它说"不知道"、对高风险输出做外部校验。
训练数据有截止时间。凡是会变的事实——价格、政策、航班、库存、代码——都不能依赖模型的内部知识。 这条直接推出本仓的硬规则:代码事实一律走 vfticket codescope ask,不靠记忆。
不是"塞满就好"。上下文越长,中间信息越容易被忽略,无关内容还会稀释注意力。Chroma 的上下文腐化研究给出过一个很好记的现象描述:把关键文档放在 20 篇里的第 5~15 位,准确率会显著下降;放在最前或最后则保持得住。
100 万上下文窗口解决的是"一次能塞多少",不解决"跨会话记住什么"。后者是阶段 8 的题目。把两者混为一谈,会导致产品方案里出现"我们上大窗口模型就有记忆了"这种错误判断。
模型"知道"一件事,不等于每次都能稳定用出来。同一个知识点,换个问法、换个上下文位置、多一个干扰工具,成功率可能明显变化。这就是为什么必须有评测(阶段 10)而不是"试了几次挺好"。
| 类型 | 特征 | 典型用法 |
|---|---|---|
| 通用模型 | 均衡,延迟可控 | Agent 主力 |
| Reasoning Model | 先思考后回答,慢且贵 | 规划、复杂推理、评测判官 |
| 多模态模型 | 图/音/视频输入 | 票面识别、原型截图理解 |
| 小模型 | 便宜、快、可本地 | 分类、路由、抽取、护栏 |
| 开源模型 | 可私有化、可微调 | 数据不出域、成本敏感的高频任务 |
一条常被忽略的架构手法 用小模型做路由和护栏,用大模型做主干。国际机票场景里"这句话是查价、改签还是投诉"这种分类,用小模型做又快又便宜,还能显著降低主模型的上下文负担。
| 阶段 | 解决什么 | 产品影响 |
|---|---|---|
| 预训练 | 获得语言与世界知识 | 决定知识截止与基础能力上限 |
| 对齐(指令微调 / 偏好优化) | 让模型听指令、符合规范 | 决定"它会不会照你说的做"以及拒答边界 |
| 蒸馏 / 量化 | 用更小的模型逼近大模型 | 决定同一家族里"便宜档"能力衰减在哪些维度 |
深度要求:能与算法同学对话即可(路线图 P2)。不需要区分 SFT / RLHF / DPO 的算法细节,需要知道"这三步分别决定了什么产品属性"。
阶段 1 的第二个产出物。五个维度不是并列的,有依赖顺序:

评估时最常见的两个错误:
| 误区 | 纠正 |
|---|---|
| "温度 0 = 确定性" | 只是更锐化的采样,仍非确定性 |
| "上下文越长越好" | 长上下文带来位置偏见、成本与延迟;先做筛选再谈长度 |
| "模型答错就是模型不行" | 先分清:能力不足 / 上下文缺失 / 指令歧义 / 工具契约错 |
| "Embedding 检索命中就是答案对" | 相似 ≠ 正确,方向词、否定词、时间限定最常翻车 |
| "推理模型总是更好" | 主观任务上收益小,延迟成本却是实打实的 |
| "小模型没用" | 路由、分类、护栏、抽取上性价比极高 |
| "私有化部署更省钱" | 只有在高频稳定负载下才成立,低频场景 GPU 闲置成本更高 |
| 资料 | 出处 | 读它拿什么 |
|---|---|---|
| Lost in the Middle: How Language Models Use Long Contexts | arXiv 2023-07 | 位置偏见的原始证据,只读摘要 + 图 1 即可 |
| Calibrating Positional Attention Bias Improves Long Context Utilization | arXiv 2024-06 | 把"中间丢失"归因到 U 型注意力偏置,理解机制而非现象 |
| Effective context engineering for AI agents | Anthropic,2025-09-29 | 阶段 3 的主教材,阶段 1 先读前半理解"上下文是有限且会衰减的资源" |
| 各家模型官方文档的能力与限制章节 | 官方 | 唯一可信的窗口大小 / 价格 / 特性对照来源,二手对比表会过期 |
数字类信息不要抄二手表 模型的窗口、价格、限流每几个月就变。本讲义刻意不写具体数字。做选型时以官方文档为准,并在自己的选型矩阵里记上"数据获取日期"。
本仓已有资料: