Agent X-Ray
RuntimeNotesAbout
Notes/产品经理/Agent 基础知识/索引

外部权威资料清单

9 分钟 · 更新于 2026-09-01

外部权威资料清单

这份清单的定位 学习路线的每个阶段都列了"已有资料"(本仓已收录的中译与拆解)。本清单补的是外部一手来源:官方工程博客、官方文档、原始论文、标准与安全框架。

检索时间:2026-08-25,通过 Perplexity Search API 分两轮批量检索——首轮 9 次调用 44 条 query 建立索引,补检索 3 轮关闭已知缺口,另用免费检索核实存疑 URL。

性质声明:本清单基于检索返回的正文片段建立,不是全文精读。它回答的是"这篇存不存在、日期是多少、核心主张是什么、值不值得读",不替代读原文。

三条使用规则

  1. 优先读一手。官方工程博客 > 官方文档 > 论文摘要 > 二手解读。本清单不收录内容营销性质的"2026 最佳实践"类文章。
  2. 数字类信息去官方核对。模型窗口、价格、限流、规范版本每几个月就变。清单里给的是入口,不是结论。
  3. 注意日期。每条都标了发布/更新时间。Agent 领域一年前的"最佳实践"可能已经过时(例如 MCP 的会话模型在 2026-07 被整个推翻)。

一、按阶段的精读清单

阶段 0 · 分层与统一词汇

资料出处 · 时间读它拿什么
Building Effective AI AgentsAnthropic Engineering · 2024-12-19Workflow / Agent 的边界定义,后续所有讨论的公共前提
A Practical Guide to Building AgentsOpenAI · PDFinstructions / guardrails / tools 三件套,与上一篇形成对照
Building Effective AI Agents(资源库版)Anthropic · 2026-08 更新单 Agent / 多 Agent / Workflow 的选型讨论
Effective harnesses for long-running agentsAnthropic Engineering · 2025-11-26Harness 这一层具体做什么,最实的一篇

阶段 1 · LLM 基础

资料出处 · 时间读它拿什么
Lost in the Middle: How Language Models Use Long ContextsarXiv · 2023-07位置偏见的原始证据。读摘要 + 图 1 即可
Calibrating Positional Attention Bias Improves Long Context UtilizationarXiv · 2024-06把"中间丢失"归因到 U 型注意力偏置
各模型厂商官方文档的能力与限制章节官方窗口/价格/特性的唯一可信来源。不要用二手对照表

阶段 2 · 模型 API 与结构化交互

资料出处 · 时间读它拿什么
Structured model outputsOpenAI API 文档 · 2026-08 更新结构化输出 vs 函数调用的官方判别与边界情况
Agents SDK 指南OpenAI API 文档Agent / handoff / guardrail / session 的官方定义
Prompt caching(Anthropic)Anthropic 官方文档cache_control 显式断点、5m/1h TTL、写入 1.25×/2× 与读取 0.1× 的计费、混用 TTL 时长档必须排在短档之前的顺序约束、逐模型最小可缓存长度
Prompt caching(OpenAI)OpenAI API 文档 · 2026-08 更新默认自动缓存 + 显式断点、prompt_cache_options.ttl / prompt_cache_retention、按模型的最小前缀与保留期对照表

缓存参数是逐模型列表且持续变动 上面两篇给的是机制与量级。做成本模型时逐条去官方页核对当前在用模型的数字,并在自己的表里记数据获取日期。

阶段 3 · RAG 与上下文工程

资料出处 · 时间读它拿什么
Effective context engineering for AI agentsAnthropic Engineering · 2025-09-29本阶段主教材:上下文是有限资源、compaction、子 Agent 隔离
Building agents with the Claude Agent SDKAnthropic Engineering · 2025-09-29自动压缩与子 Agent 隔离在真实 SDK 里的形态

阶段 4 · Agent 基础与 Agent Loop

资料出处 · 时间读它拿什么
ReAct: Synergizing Reasoning and ActingarXiv · 2022-10交替结构的原始表述
Reflexion: Language Agents with Verbal Reinforcement LearningarXiv · 2023-03反思生效的前提条件
Building agents 学习路径OpenAI Developers从最小 loop 到编排的完整实践路径
Agents 概览OpenAI Developers官方对 Agent 三要素的表述

阶段 5 · Tool Use、MCP 与 Skills

资料出处 · 时间读它拿什么
Writing effective tools for AI agentsAnthropic Engineering · 2025-09-11本阶段主教材:评测驱动的工具设计
Equipping agents for the real world with Agent SkillsAnthropic Engineering · 2025-10-16Skill 的设计原则与创作指南
The Complete Guide to Building Skills for ClaudeAnthropic 资源库三级渐进式披露的完整说明
OWASP Agentic Skills Top 10(AST01–AST10)OWASP技能包生态的十类风险;与 ASI 系列是两份独立清单,别混编号
MCP 2026-07-28 规范发布公告MCP 官方博客 · 2026-07-28当前规范版本,发布以来最大一次修订
The New MCP RoadmapMCP 官方博客 · 2026-08-23渐进式发现与 Agent 授权的方向
MCP 规范主页官方规范原文,涉及改造决策时以此为准

阶段 6 · Harness 内核架构

资料出处 · 时间读它拿什么
Agent SDK overviewClaude Code 文档"何时用 SDK、何时自己写 loop"的官方判别
Effective harnesses for long-running agentsAnthropic · 2025-11-26长任务对 Harness 的要求

阶段 7 · Runtime 与生命周期

资料出处 · 时间读它拿什么
LangGraph PersistenceLangChain 文档Checkpointer(线程内)vs Store(跨线程) 的两层切分
LangGraph CheckpointersLangChain 文档三档持久化时机(退出时/异步/同步)与线程模型

阶段 8 · Memory 与长期知识

资料出处 · 时间读它拿什么
LangGraph PersistenceLangChain 文档会话状态与长期记忆的工程分层(与阶段 7 同一篇,视角不同)
记忆类产品的架构文档(Letta / Mem0 / Zep-Graphiti / Cognee 等)各官方三种切分思路:OS 隐喻(core/archival/recall)、抽取式、时序知识图谱
OWASP Top 10 for Agentic Applications(2026)OWASP · 2025-12记忆与上下文投毒(ASI06)的风险描述

阶段 9 · Planning 与 Multi-Agent

资料出处 · 时间读它拿什么
Building agents with the Claude Agent SDKAnthropic · 2025-09-29子 Agent 的两个价值:并行化与上下文隔离
Orchestration and handoffsOpenAI Agents SDK 文档Handoff 作为一等概念的设计
Building Governed AI Agents(cookbook)OpenAI Cookbook · 2026-02-23分诊 Agent 与 handoff 路由的具体实现

阶段 10 · Evaluation 与可观测性

资料出处 · 时间读它拿什么
Evaluate agent workflows(trace grading)OpenAI 文档 · 2026-08 更新用 trace 打分回答"选对工具了吗、该 handoff 时 handoff 了吗"
Evaluating AI Agents at the Run, Trace, and Thread LevelLangChain · 2026-06-23三层评测:最终结果 / 轨迹 / 状态变化
Trajectory evaluationsLangChain 文档轨迹评测器的具体用法
Application-specific evaluation approachesLangChain 文档按应用类型选评测方法
τ-bench: A Benchmark for Tool-Agent-User InteractionarXiv · 2024-06"比对最终数据库状态" 这一评测思路
Testing Agent Skills Systematically with EvalsOpenAI 博客 · 2026-01-22把评测做成轻量端到端测试的工程做法

阶段 11 · 安全、权限与治理

资料出处 · 时间读它拿什么
OWASP Top 10 for Agentic Applications(2026)OWASP · 2025-12 发布ASI01~ASI10 完整清单,每条附真实事件;威胁建模的检查表
发布公告(含十条逐条说明)OWASP · 2025-12-09十条各自对应哪次真实事故,最快建立直觉的一篇
Designing AI agents to resist prompt injectionOpenAI为什么只靠过滤输入不够;约束「被注入后能做什么」
Understanding prompt injectionsOpenAI Safety基础解释,适合拿给非技术同事看
Design Patterns for Securing LLM Agents against Prompt InjectionsarXiv · 2025-06本阶段最实用的论文:可套用的防御设计模式
Defeating Prompt Injections by Design(CaMeL)arXiv · 2025-03数据流与控制流分离的原理
AgentDojoarXiv · 2024-06注入攻防的动态评测环境,把手工演练升级成可重复基准
Autonomy Levels for Agentic AI云安全联盟 · 2026-01-28六级自主等级的定义与命名(对标 SAE J3016)
Agentic AI Autonomy Levels and Control Framework(v2 PDF)云安全联盟 · 2026-03(2026-07 更新)每一级的决策/执行/人参与/风险规格表
Safety in building agentsOpenAI API 文档护栏在平台层的形态
Guardrails and human reviewOpenAI Agents SDK护栏与人工复核在 SDK 层的形态

阶段 12~14 · 产品、商业化与作品集

资料出处 · 时间读它拿什么
A Practical Guide to Building AgentsOpenAI护栏与人工复核的产品化表达;从试点到规模化的路径
Autonomy Levels for Agentic AI云安全联盟 · 2026-01-28自主等级的产品化定义与两条实操建议(L1 起步、L5 不建议)
2026 年 Agent UX 模式整理行业分析 · C 级截至 2026-08 没有一手来源;当检查清单用,不要当权威分类引用
2026 年 Agent 定价模式对照行业分析 · D 级只借鉴模式,不引用数字——见下节可信度分级

二、协议与标准的当前状态(2026-08-25)

这一节是有时效的,每季度应当复核一次

MCP(Model Context Protocol)

  • 当前规范版本:2026-07-28,官方称为发布以来最大的一次修订
  • 核心变化:协议核心无状态化(移除协议级会话与 Mcp-Session-Id、移除 initialize/initialized 握手)、新增 server/discover、列表结果可缓存且顺序确定、方法名与工具名走 Mcp-Method / Mcp-Name HTTP 头(网关可据此做路由与鉴权)、服务端→客户端请求改用多轮往返(MRTR)而非常开双向流、Tasks 与 MCP Apps 升级为一等公民、授权要求收紧
  • 部分特性的弃用状态在二手报道中说法不一,涉及改造决策请以规范原文为准
  • 入口:规范主页 · 官方博客

A2A(Agent2Agent)

  • 2025-04 由 Google 发布,2026-03 发布 v1.0
  • 2026-04 官方公布一周年成果:150+ 组织支持,主流云平台集成
  • 2026-08-17 转入 Linux Foundation 旗下的 Agentic AI Foundation,与 MCP 同处一个中立治理机构
  • 与 MCP 的分工:MCP 接工具,A2A 接 Agent
  • 产品判断:协议正在变成公共基础设施——基础设施不给任何人护城河

OpenTelemetry GenAI 语义约定

  • 截至 2026 年年中,GenAI 与 MCP 相关的语义约定仍处 Development / experimental 状态,字段名还会变
  • 产品含义:现在可以按 OTel 思路埋点,但预留一层字段映射,不要把字段名硬编码进太多下游依赖

OWASP 的两份 Agentic 清单(别混编号)

Top 10 for Agentic Applications(ASI01–ASI10),2025-12 发布、面向 2026:

编号名称官方举的真实案例
ASI01目标劫持 Agent Goal HijackEchoLeak
ASI02工具滥用 Tool MisuseAmazon Q
ASI03身份与权限滥用 Identity & Privilege Abuse
ASI04智能体供应链漏洞 Agentic Supply Chain VulnerabilitiesGitHub MCP exploit
ASI05意外代码执行 Unexpected Code ExecutionAutoGPT RCE
ASI06记忆与上下文投毒 Memory & Context PoisoningGemini Memory Attack
ASI07不安全的 Agent 间通信 Insecure Inter-Agent Communication
ASI08级联失败 Cascading Failures
ASI09人机信任利用 Human-Agent Trust Exploitation
ASI10失控 Agent Rogue AgentsReplit meltdown

Agentic Skills Top 10(AST01–AST10)另一份独立清单,专门覆盖技能包生态(如 AST09「无治理」)。两份的编号前缀不同,引用时别写混。

CSA 自主等级(六级,对标 SAE J3016)

级别名称决策者执行者人的参与
L0无自主 No Autonomy每个动作
L1辅助 AssistedAI逐动作审批
L2受监督 SupervisedAI审批计划/批次
L3有条件 ConditionalAI(边界内)AI越界才上报
L4高度自主 High AutonomyAIAI监控与异常处理
L5完全自主 Full AutonomyAI(含自设目标)AI仅战略层监督

官方两条建议:L1 是新上手组织的推荐起点L5 列出只为分类完整,不建议用于当前企业部署

这套「自主等级」与本路线的「动作风险分级」是两个正交的轴 前者分人参与到什么程度,后者分这件事做错了有多严重。组合方式见阶段 11 讲义第四节。


三、可信度分级:怎么看待"2026 最佳实践"类文章

检索 Agent 主题时,搜索结果里有大量 SEO 内容。本清单刻意排除了它们,但你自己检索时会遇到。分级标准:

级别类型怎么用
A · 一手厂商工程博客、官方文档、规范原文、原始论文可直接引用,注明日期
B · 半一手基金会公告、权威媒体报道、有署名的实践复盘可引用事件与时间线,结论要交叉验证
C · 二手解读技术社区文章、对照评测只用来发现线索,结论回到 A 级核对
D · 内容营销"2026 年最佳 X 工具对比""完整指南"不引用。尤其是价格、市场规模、采纳率这类数字

D 级最常出现在三类话题上 定价模式、工具选型对比、市场采纳率。 这三类话题的搜索结果里,绝大部分是带商业目的的内容。判别方法:样本量说了吗?谁做的调研?口径是什么?说不清就当 D 级。

模式可以借鉴,数字必须自己算。


四、维护约定

  • 每季度复核一次第二节(协议与标准状态),改动写在下面的变更记录里
  • 新增资料时,标注 出处 · 时间 · 读它拿什么 三项,缺一项不收
  • 只收 A 级和 B 级;C 级线索直接去找它引用的一手来源
  • 本仓已收录中译的文章,链接到本仓文件而不是外链(见各阶段讲义的"已有资料"节)

变更记录

日期变更
2026-08-25建立。9 次批量检索(44 条 query),覆盖 Anthropic / OpenAI / LangChain 官方文档、MCP 规范、arXiv 奠基论文、OWASP 与 CSA 安全框架
2026-08-25补检索 3 轮,关闭首版四处缺口:① ASI07–ASI10 补齐并附真实事件;② CSA 六级自主等级拿到级名与规格;③ 两家 Prompt Caching 官方文档替换掉此前的二手描述;④ 核实并修正两条此前由我推断而非检索所得的 URL。新增 Agentic Skills Top 10、防御设计模式论文、AgentDojo 三个来源。同时把阶段 12 的 Agent UX 模式表明确降级标注为 C 级

首版遗留的已知薄弱处(供下次复核时优先处理)

  • 阶段 12 的 Agent UX 模式表:截至 2026-08 确实没有一手来源,已标 C 级。若日后有厂商或标准组织发布正式模式规范,优先替换。
  • 阶段 13 的定价模式分类:来源全为 D 级内容营销,已按"只描述模式、不引用任何数字"处理。
  • 阶段 8 的记忆产品对照:Letta 的 core/archival/recall 三分法目前引自二手,未核对官方文档。
  • 本清单全部条目均基于检索摘要片段(400~2500 字符)建立,不是全文精读。它是指路级索引,条目里的"读它拿什么"是导读,不能替代读原文。

  • AI 与 Agent 基础知识学习路线
  • 术语表
  • AI 技术博客索引(本仓已收录的中译文章)
  • Anthropic 官方最佳实践汇总

本章目录
一、按阶段的精读清单二、协议与标准的当前状态(2026-08-25)三、可信度分级:怎么看待"2026 最佳实践"类文章四、维护约定Related Documents
苏ICP备2025204887号-2