要点速览
- WikiSkill 把智能体工作区拆为三层:不可变的原始执行轨迹(Raw 层)、跨迭代持久积累的知识库(Wiki 层)、可执行的技能(Skills 层);技能更新受验证门控约束、可被回滚,而 Wiki 永不回滚、持续复利式积累。
- 每轮进化循环由四个组件构成:推理智能体执行 rollout → Wiki 维护者把轨迹提炼为模式页并维护进化日志 → 技能提议者以 ReAct 方式查阅 Wiki 与轨迹后提出原子化技能修改 → 门控与回滚机制按验证集表现决定接受或回退。
- 在五个基准、五个模型上,WikiSkill 一致优于 EvoSkill、SkillOpt、Trace2Skill 等现有技能进化方法;且模型越大收益越大(Qwen 系列平均提升 +12.3 / +17.5 / +23.9 个点),带技能的 Qwen-3.5-9B(47.4%)可胜过无技能的 Qwen-3.6-27B(39.4%)。
- 进化出的技能可跨模型、跨模型家族迁移,他模型进化的技能有时优于自进化技能——说明「发现技能」与「执行技能」是两种不同的能力。
- 消融实验确认持久化 Wiki 是收益关键:给技能提议者开放 Wiki 访问使平均成绩从 48.7% 升至 63.7%;反之,让推理智能体在训练 rollout 阶段读 Wiki 反而会损害最终技能质量。
原文链接
- 英文原文归档:英文原文
- arXiv:https://arxiv.org/abs/2608.27454
Liyan Tang、Cyrus Rashtchian、Chun-Sung Ferng、Andrew Tomkins、Da-Cheng Juan、Tu Vu(Google Research / Virginia Tech)
「智能体技能 (agent skills)」将专门知识与工作流打包为可复用的资源,从而扩展 AI 智能体的能力。近期工作已能从智能体经验中自动发现这类技能,使智能体得以在交互中渐进式地适应环境。然而,指导技能开发的洞见通常散落在优化历史之中,难以在迭代之间被系统性地复用。我们提出 WikiSkill,一个让智能体技能与「持久化知识库 (persistent knowledge base)」(wiki)协同进化的框架。从高层看,WikiSkill 将原始执行经验、积累的知识与可执行技能三者分离,并持续把经验固化进 wiki,供后续的技能更新在其上构建。在多样的基准与模型上,WikiSkill 一致优于最先进的「技能进化 (skill evolution)」方法,并在多数「模型-基准」组合中优于无技能基线。我们发现技能进化与模型规模扩展互为补充:更大的模型通常从进化出的技能中获益更多,而配备技能的小模型可以胜过大得多的无技能模型。我们还发现,进化出的技能能有效地跨模型、跨模型家族迁移,他模型进化出的技能有时优于自进化技能。最后,消融研究确认:wiki 中的持久化知识积累对有效的技能进化至关重要。这些结果表明,系统性地积累并提炼智能体经验,有助于打造可复用、可迁移的技能。
(图 1 图注)图 1:WikiSkill 一致优于无技能基线与现有技能进化方法,且其优势在更强的模型上愈发明显。图中报告了各模型分别使用无技能,以及 EvoSkill、SkillOpt、WikiSkill 进化出的技能时,在各评测基准上的平均准确率(详见表 1)。
通用 AI 智能体在跨领域完成复杂任务方面的能力与日俱增 (Patwardhan et al., 2026; Jackson et al., 2025; Merrill et al., 2026; Phan et al., 2026)。然而,可靠地完成现实任务往往需要领域专门知识(例如程序性知识与工作流)。「智能体技能」(Zhang et al., 2025; Li et al., 2026; Chen et al., 2026a; Liu et al., 2026) 提供了一种轻量、开放的格式,无需更新模型参数即可承载这类专门知识。技能的核心是把指令、脚本及其他资源打包成一个可复用的、基于文件系统的模块(即一个组织化的目录)(Zhang et al., 2025; Li et al., 2026; Anthropic, 2026; Xia et al., 2026b)。这种设计使专门知识在兼容技能机制的各类智能体之间保持一致、可审计、可复用。它还支持「渐进式披露 (progressive disclosure)」(Jiang et al., 2026):智能体在任一时刻只加载相关内容,从而节省上下文空间。更广义地说,技能提供了一种独立于模型参数的知识积累机制。
然而,开发有效的技能仍然困难。大多数智能体技能靠人工编写,这要求作者预判智能体将会需要哪些程序性知识与工作流 (Li et al., 2026; Liang et al., 2026; Xu and Yan, 2026)。这一挑战催生了近期的迭代式技能开发工作:在训练任务上执行智能体、分析成功与失败的轨迹,并基于由此获得的经验精炼技能 (Yuksekgonul et al., 2025; Agrawal et al., 2026; Alzubi et al., 2026; Ni et al., 2026; Ouyang et al., 2026; Yang et al., 2026)。
一个关键的设计问题是:在技能进化的全过程中,如何保存并组织智能体学到的东西。已有工作以不同方式回答这一问题:EvoSkill (Alzubi et al., 2026) 维护先前提案及其评估结果的累积历史;Trace2Skill (Ni et al., 2026) 从执行轨迹中提取并整合经验教训,融入技能更新;SkillOpt (Yang et al., 2026) 利用「被拒编辑」反馈与逐 epoch 的元指导。但这些方法都没有把「已学到的东西」维护为一个独立的、持续演化的知识表示。受 Karpathy (2026) 关于 LLM Wiki 的观点启发——他主张把经验编译为持久的、可复利的知识——我们提出问题:能否将智能体经验同样编译为持久化知识,以支撑长期的技能进化? 我们提出 WikiSkill,在原始经验与可执行程序(即技能)之间加入一个结构化的知识层。这一层使技能开发得以在跨迭代不断被验证、不断被整合的知识之上构建,而不是依赖散落在各种技能进化产物中的零散知识。
WikiSkill 把智能体工作区组织为三层:存放不可变执行轨迹的「原始层 (Raw Layer)」、维护结构化知识的「Wiki 层 (Wiki Layer)」、容纳持续演化的程序性知识的「技能层 (Skill Layer)」(见图 2)。每次迭代包含四个组件:使用当前技能执行 rollout 的「推理智能体 (Inference Agent)」、把轨迹固化进 wiki 的「Wiki 维护者 (Wiki Maintainer)」、利用 wiki 与轨迹提出技能更新的「技能提议者 (Skill Proposer)」,以及只保留能改善验证集表现的更新的「门控与回滚 (gating and rollback)」机制。技能更新可以被回滚,但 wiki 是持久的,未来的更新可以在积累的知识上继续构建。从高层看,这些组件构成一个持续循环:经验被固化为持久化知识,而持久化知识支撑技能进化。
我们在五个基准上评估 WikiSkill,涵盖数学推理(LiveMathematicianBench (He et al., 2026))、网络搜索(SealQA (Pham et al., 2026))、电子表格操作(SpreadSheetBench (Ma et al., 2024))、长上下文文档问答(OfficeQA (Singhvi et al., 2025))与交互式具身任务(ALFWorld (Shridhar et al., 2021)),使用来自 Qwen (Qwen Team, 2026a; Qwen Team, 2026b)、Gemma (Gemma Team, 2026) 与 Gemini (Google DeepMind, 2026) 家族的五个模型。我们发现 WikiSkill 优于现有技能进化方法,并在多数设置中优于无技能基线。有趣的是,技能进化与模型规模扩展互为补充。在 Qwen 家族内部,WikiSkill 对 4B、9B、27B 模型的平均性能分别提升 12.3%、17.5% 与 23.9%,增益随模型规模递增。与此同时,进化出的技能可以弥补相当大的模型规模差距:带 WikiSkill 的 Qwen-3.5-9B 胜过无技能的 Qwen-3.6-27B(47.4% vs. 39.4%)。我们进一步发现,进化出的技能能有效跨模型家族迁移,并可能优于自进化技能。例如在 ALFWorld 上,Qwen-3.5-9B 使用由 Qwen-3.6-27B 进化出的技能达到 70.2%,而使用自身进化的技能只有 63.4%。这些结果表明,技能的发现与技能的执行是两种不同的能力。最后,我们的分析表明持久化 wiki 对上述增益至关重要,支持了「跨迭代积累并提炼知识能改善技能进化」这一假设。
综上,我们的主要贡献是:
总而言之,我们希望这项工作能激发更多关于「智能体如何从经验中积累、组织与复用知识」的基础研究。
我们形式化 LLM 智能体的迭代式技能进化任务。设 为任务数据集,其中 表示一个任务实例, 表示其真值答案。我们把 划分为三个互不相交的子集:训练任务 、验证任务 与测试任务 。
智能体 是一个基于 LLM 的系统,配备工具集 (例如 bash shell、搜索 API 或文件读取器)与活跃技能集 。技能是一个模块化的、基于文件系统的目录,将领域程序性知识打包为指令、脚本及其他资源 (Zhang et al., 2025; Li et al., 2026; Chen et al., 2026a; Liu et al., 2026)。具体而言,每个技能包含一个 SKILL.md 文件,其 frontmatter 元数据(唯一的 name 与简洁的 description)之后是完整的程序性指令与适用条件。技能集 初始为空集(),并针对每个数据集通过进化过程逐步构建。
执行任务 时,智能体接收任务上下文 与可用技能 。智能体使用工具与技能同环境进行多步交互,生成一条「执行轨迹 (execution trajectory)」。轨迹 由观察 与动作 构成(动作可包含对 中工具的调用)。最后一个动作 给出预测答案 。预测的正确性由领域特定的评分函数 评估。对任一任务子集 ,将智能体 在其全部任务实例上 rollout,得到对应的执行轨迹集 。该子集上的表现 是全部任务实例 的平均得分。
在 WikiSkill 中,第 次迭代的系统状态由二元组 表示,其中 为活跃的程序性技能集, 为持久化知识库(Wiki)。候选技能更新受验证门控约束、得分退化时会被回滚,而知识库 则跨迭代持久存在并复利式积累。从 出发,WikiSkill 在迭代 中协同演化联合状态 ,利用训练 rollout 、模式固化以及基于 的验证门控,最大化在未见任务 上的最终测试表现 。
(图 2 图注)图 2:WikiSkill 框架总览。智能体工作区被组织为三层:不可变的执行轨迹(Raw 层)、跨迭代复利积累的持久化知识库(Wiki 层)、活跃的程序性指令(Skills 层)。在每轮进化循环中,推理智能体执行 rollout(注入活跃技能,但禁止访问 Wiki),Wiki 维护者把轨迹固化进 Wiki,技能提议者(采用 ReAct 机制)提出更新建议,而 Wiki 在所有迭代之间始终保留。
我们提出 WikiSkill,一个让智能体技能与持久化知识库(wiki)协同进化的框架。它建立在三层知识架构之上(3.1 节),执行一个编排好的进化循环:智能体执行 rollout,Wiki 维护者固化轨迹并更新 wiki,技能提议者提出技能更新,门控机制筛选变更(3.2 节)。
WikiSkill 工作区由三个不同的层组成,如图 2 所示,说明如下。
该层存放每次迭代从训练样本收集到的原始执行轨迹 。这些轨迹完整记录了智能体的逐步交互,包括推理、工具调用、工具调用输出与最终答案。在我们的设置中,Wiki 维护者与技能提议者两个智能体可以访问这些原始轨迹以分析智能体行为。为保留原始历史,该层是不可变的。
该层把原始轨迹编译为结构化的、复利积累的知识,并在整个技能进化过程中持续维护。它包含一个模式目录(patterns/),由若干独立的 markdown 文件构成,每个文件记录一种具体的失败模式或成功策略,并附上可执行的应对办法。至关重要的是,该层通过进化日志(logs.md,由 Wiki 维护者更新)与技能影响追踪器(skill-impact.md,由外层编排框架在验证门控后以程序方式更新)提供跨优化迭代的长期历史感知。这些记录使 Wiki 维护者与技能提议者能够:(1) 查看完整的技能接受历史,避免再次提出已被拒绝的干预;(2) 追踪先前迭代提出了什么、这些提案是否成功;(3) 识别哪些错误在迭代之间反复出现。wiki 在迭代之间不会重置,而是在整个进化过程中持续积累并编译知识。
该层包含活跃的进化技能集 ,编码推理智能体可读取的程序性知识。WikiSkill 中每个技能目录包含两个文件:SKILL.md,承载技能的完整内容;PURPOSE.md,把该技能回溯映射到促成其创建或修改的 Wiki 模式。技能层与 Wiki 层交互的详细示例见图 3,并在 5.3 节的案例研究中说明。
WikiSkill 循环由四个组件构成。在每次迭代中,推理智能体(3.2.1 节)使用 skills/ 中的活跃技能执行任务,在 raw/ 中产出不可变的执行轨迹。在训练 rollout 期间,推理智能体被禁止访问 Wiki 层——我们的消融研究(5.1 节)表明,允许其在训练期间访问 wiki 会对技能开发产生负面影响。接着,Wiki 维护者(3.2.2 节)结合现有 wiki/ 层分析这些原始轨迹,诊断失败、提炼成功策略,更新持久的模式目录与进化日志。随后,技能提议者(3.2.3 节)审阅更新后的 wiki 并读取最新一轮的执行轨迹,在 skills/ 中生成或修改候选技能。最后,门控与回滚机制(3.2.4 节)在验证子集上评估候选技能,接受成功的修改,或在变更导致性能退化时回滚技能集。完整的进化算法见附录 A 的算法 1。
在第 次迭代,推理智能体 以活跃技能集 为条件,使用环境工具 执行多轮轨迹:
在 WikiSkill 中,活跃技能 的完整内容被直接注入推理智能体的系统提示词。沿用先前工作 (Yang et al., 2026; Ni et al., 2026) 的做法,这种全量注入设定确保程序性指令在任务执行期间即时可用,从而在本研究中排除了技能触发或检索失败这一混杂变量。
在第 次迭代,获得训练子集 上的 rollout 轨迹 后,我们抽取成功与失败执行轨迹的一个子集 (抽样预算与分层标准见附录 C),以规避上下文窗口限制。Wiki 维护者智能体 把这些观察固化进持久 wiki ,产出中间 wiki 状态 :
Wiki 维护者接收完整的 wiki 上下文 与抽样轨迹 。它对失败任务执行「根因分析 (root cause analysis)」,并从通过的任务中提炼成功策略。每次迭代中,Wiki 维护者可以在 wiki/patterns/ 下创建新模式页,也可以用新证据或更精炼的解法更新既有模式页。对模式页的更新采用增量的、基于补丁的编辑(如追加、替换或插入文本片段)。每当模式被修改,Wiki 维护者会同步修订 index.md 目录以反映当前状态,并把本轮迭代发现的摘要追加进进化日志 logs.md。每轮迭代创建或更新的模式数量没有硬性上限;Wiki 维护者根据轨迹与当前 wiki 状态自行决定哪些更新是必要的。
提议者 是一个负责技能发现与精炼的 LLM 智能体。在第 次迭代,提议者以多轮 ReAct 风格 (Yao et al., 2023) 运行。为避免分析冗长执行历史时耗尽上下文窗口,提议者并不会收到一组固定的预抽样轨迹;它初始拿到的是 wiki 索引 、历史技能影响追踪器(skill-impact.md),以及全部训练任务结果的简要汇总(通过/失败状态、预测与真值答案)。作为一个自主智能体,它主动推理并使用环境工具(read_file),按需选择并检视特定的模式页与原始执行轨迹 ,在诊断根因之后合成提案 :
在每次迭代中,技能提议者产出一个原子化的提案 ,只针对单个技能:要么创建一个新技能,要么对目标既有技能施加增量的、基于补丁的编辑。
提案 生成后被应用到工作区,得到候选技能集 。系统在验证子集 上评估 ,得到验证轨迹 与得分 。接受决策由下式给出:
若被接受,候选技能被保留为新的活跃技能集 ,性能阈值 更新为 。在进化循环开始前, 初始化为以空技能集 在 上评估得到的基线验证分数 。若验证分数在进化过程中的任一时刻达到最大值(),进化循环提前终止。若被拒绝,系统丢弃候选技能修改,将技能集回退到最近一次成功的配置 。值得注意的是,无论接受与否,wiki 都不会被回滚;积累的模式与日志在所有迭代之间持续保留,确保长期知识不丢失。每次验证评估之后,外层编排框架都会以程序方式向 wiki/skill-impact.md 追加一条记录,即 ,内容包括提案元数据、目标技能名、修改的 unified diff、验证分数 ,以及最终接受结果 。至此完成第 次迭代的 wiki 状态迁移 ,为技能提议者在后续迭代中提供一份客观的、有真值依据的历史干预审计记录,以避免重复失败的修改。
我们在跨越多样领域的五个基准上进行评估:数学推理(LiveMathematicianBench,简称 LiveMath (He et al., 2026))、网络搜索(SealQA (Pham et al., 2026))、电子表格操作(SpreadsheetBench,简称 SpreadSheet (Ma et al., 2024))、长上下文文档问答(OfficeQA (Singhvi et al., 2025))与交互式具身任务(ALFWorld (Shridhar et al., 2021))。数据集细节与统计信息见附录 B。
我们将 WikiSkill 与三个有代表性的技能进化基线进行比较:Trace2Skill (Ni et al., 2026)、EvoSkill (Alzubi et al., 2026) 与 SkillOpt (Yang et al., 2026)。它们共享同一个总体循环:rollout 智能体、分析执行轨迹、提出技能修改、以验证集门控变更。我们还评估各模型不带技能的表现作为无技能基线。对这些框架的详细描述以及优化器 API 调用复杂度分析见附录 D。我们把比较聚焦于专门的技能进化框架,而非通用的自动提示词优化器(如 GEPA (Agrawal et al., 2026))——先前工作已表明专门的技能进化流水线一致优于通用提示词优化方法 (Yang et al., 2026)。
我们同时使用闭源与开放权重模型来评估 WikiSkill 与各基线。闭源模型使用 Gemini-3.5-Flash (Google DeepMind, 2026)。开放权重模型评估 Qwen-3.5-4B/9B-Instruct (Qwen Team, 2026a)、Qwen-3.6-27B (Qwen Team, 2026b) 与 Gemma-4-31B-It (Gemma Team, 2026),均通过 vLLM 框架 (Kwon et al., 2023) 部署。
| 模型 | 方法 | LiveMath | SealQA | SpreadSheet | OfficeQA | ALFWorld | 平均 |
|---|---|---|---|---|---|---|---|
| Qwen-3.5-4B | No skill | 29.1 | 32.5 | 14.6 | 30.2 | 24.4 | 26.2 |
| Qwen-3.5-4B | Trace2Skill | 31.5 | 37.6 | 17.5 | 31.0 | 42.8 | 32.1 |
| Qwen-3.5-4B | EvoSkill | 41.7 | 37.3 | 18.6 | 29.5 | 41.5 | 33.7 |
| Qwen-3.5-4B | SkillOpt | 48.7 | 33.3 | 14.0 | 34.5 | 45.3 | 35.2 |
| Qwen-3.5-4B | WikiSkill | 49.7 | 39.4 | 21.1 | 28.5 | 53.7 | 38.5 |
| Qwen-3.5-9B | No skill | 28.2 | 26.3 | 24.3 | 35.9 | 34.7 | 29.9 |
| Qwen-3.5-9B | Trace2Skill | 33.1 | 36.9 | 26.5 | 38.4 | 48.8 | 36.7 |
| Qwen-3.5-9B | EvoSkill | 58.1 | 34.5 | 35.4 | 34.9 | 48.5 | 42.3 |
| Qwen-3.5-9B | SkillOpt | 48.7 | 29.4 | 29.0 | 38.0 | 55.7 | 40.2 |
| Qwen-3.5-9B | WikiSkill | 56.3 | 43.1 | 33.6 | 40.5 | 63.4 | 47.4 |
| Qwen-3.6-27B | No skill | 33.9 | 27.5 | 40.8 | 42.1 | 52.8 | 39.4 |
| Qwen-3.6-27B | Trace2Skill | 36.3 | 37.3 | 53.3 | 54.3 | 55.5 | 47.3 |
| Qwen-3.6-27B | EvoSkill | 57.3 | 32.9 | 59.5 | 52.5 | 64.2 | 53.3 |
| Qwen-3.6-27B | SkillOpt | 51.9 | 34.5 | 53.2 | 54.8 | 59.2 | 50.7 |
| Qwen-3.6-27B | WikiSkill | 61.9 | 41.6 | 81.7 | 53.7 | 77.6 | 63.3 |
| Gemma-4-31B | No skill | 33.9 | 30.6 | 48.3 | 43.3 | 50.4 | 41.3 |
| Gemma-4-31B | Trace2Skill | 32.3 | 37.7 | 58.5 | 43.2 | 57.2 | 45.8 |
| Gemma-4-31B | EvoSkill | 29.8 | 38.4 | 56.4 | 39.9 | 52.6 | 43.4 |
| Gemma-4-31B | SkillOpt | 40.1 | 36.1 | 63.1 | 44.4 | 61.9 | 49.1 |
| Gemma-4-31B | WikiSkill | 56.7 | 41.2 | 68.0 | 44.2 | 64.4 | 54.9 |
| Gemini-3.5-Flash | No skill | 33.0 | 29.4 | 50.5 | 48.6 | 85.9 | 49.5 |
| Gemini-3.5-Flash | Trace2Skill | 41.9 | 44.3 | 56.0 | 50.0 | 85.9 | 55.6 |
| Gemini-3.5-Flash | EvoSkill | 44.6 | 43.6 | 55.4 | 51.2 | 85.9 | 56.1 |
| Gemini-3.5-Flash | SkillOpt | 49.7 | 28.2 | 66.1 | 49.8 | 85.9 | 55.9 |
| Gemini-3.5-Flash | WikiSkill | 72.6 | 44.7 | 76.6 | 60.7 | 85.9 | 68.1 |
表 1:各推理模型与测试集上的方法比较。每个模型区块评估该推理模型不带技能(No skill)以及带不同技能进化方法所开发技能的表现。为保证公平比较,所有技能进化方法均从空技能集出发,进化出的技能在推理时注入推理智能体的提示词。所有分数为完整进化过程三次独立运行的平均测试表现。本文方法(WikiSkill)以加粗标出(原文以高亮标注 WikiSkill 行、以加粗标注各数据集最优结果,多个加粗表示在 1,000 次配对 bootstrap 检验下与最优无显著差异();该格式细节未在本表中保留)。
我们跨模型、跨任务评估 WikiSkill,并研究进化出的技能能否跨模型迁移。表 1 展示了跨模型、跨任务的主要技能进化结果,包括技能进化收益随模型规模的变化;表 2 展示了跨模型技能迁移结果。下面详细分析。
为考虑波动性,每种方法的完整进化过程都独立重复三次,所有报告分数为三个进化技能集的平均测试表现。性能差异的统计显著性用 的配对 bootstrap 检验评估(附录 C)。注意,对 Gemini-3.5-Flash 在 ALFWorld 上的结果:所有进化方法的表现与无技能基线相同(85.9%),原因是 Gemini-3.5-Flash 在技能进化开始前就已在验证子集()上达到 100% 分数。这也解释了为什么在跨模型迁移评估(表 2)中,Gemini-3.5-Flash 作为 ALFWorld 的技能来源被标记为「」。
如表 1 所示,WikiSkill 在全部五个模型上取得最高的平均表现。相对每个模型上最强的对比技能进化方法,WikiSkill 将 Qwen-3.5-4B、Qwen-3.5-9B、Qwen-3.6-27B、Gemma-4-31B 与 Gemini-3.5-Flash 的平均表现分别提升 3.3、5.1、10.0、5.8 与 12.0 个点。这些提升在各设置中是一致的:WikiSkill 在多数「模型-数据集」组合上优于无技能基线,并且在五个数据集的平均表现上对所有模型都追平或超过最强对比方法。提升覆盖多样领域,且幅度可以很大。例如,WikiSkill 把 Gemini-3.5-Flash 在 LiveMath 上从 33.0% 提升到 72.6%、在 SpreadSheet 上从 50.5% 提升到 76.6%,把 Qwen-3.6-27B 在 ALFWorld 上从 52.8% 提升到 77.6%。相比之下,现有技能进化方法的表现不够稳定:EvoSkill 在 LiveMath 上大幅提升 Qwen-9B(28.2% 58.1%),却在同一基准上拖累 Gemma-4-31B(33.9% 29.8%);SkillOpt 则在 SealQA 上拖累 Gemini-3.5-Flash(29.4% 28.2%)。这些结果表明 WikiSkill 在各设置中带来既更强又更可靠的提升。
在 Qwen 家族内部,WikiSkill 带来的平均提升随模型规模递增:Qwen-3.5-4B 为 +12.3 个点,Qwen-3.5-9B 为 +17.5 个点,Qwen-3.6-27B 为 +23.9 个点。这一趋势在 SpreadSheet 上尤为突出:WikiSkill 对三个模型分别提升 +6.5、+9.3 与 +40.9 个点,说明技能进化的收益可以随模型规模大幅增长。与此同时,进化技能又能弥补相当大的模型规模差距:带 WikiSkill 的 Qwen-3.5-9B 平均准确率达到 47.4%,胜过无技能的 Qwen-3.6-27B(39.4%);带 WikiSkill 的 Qwen-3.5-4B 也达到 38.5%。结果表明,模型能力与进化出的程序性知识是互补的性能来源:更强的模型能开发并执行更有效的技能、从技能进化中获得更大价值,而有效的技能可以让小模型胜过大得多的无技能模型。
结果显示,某些数据集比其他数据集更适合技能进化。对 Qwen-3.6-27B,WikiSkill 在 OfficeQA 上提升 11.6 个点、在 SealQA 上提升 14.1 个点,而在 ALFWorld、LiveMath 与 SpreadSheet 上分别提升 24.8、28.0 与 40.9 个点。类似差异也出现在其他模型上。LiveMath 一贯从技能进化中受益,五个模型上的提升在 20.6 到 39.6 个点之间;ALFWorld 在 WikiSkill 实际进化出技能的四个模型上(因提前终止而排除 Gemini-3.5-Flash)提升 14.0 到 29.3 个点。相比之下,OfficeQA 因其长上下文文档检索需求而构成独特挑战:较大的模型能有效利用进化出的搜索工作流在冗长文档中导航(Qwen-3.6-27B +11.6 个点、Gemini-3.5-Flash +12.1 个点),而 Qwen-3.5-4B 难以在长上下文中执行这类多步搜索工作流,退回到默认的通读行为,反而导致轻微退化。
| 模型 | 技能来源 | LiveMath | SealQA | SpreadSheet | OfficeQA | ALFWorld |
|---|---|---|---|---|---|---|
| Qwen-3.5-4B | None | 29.1 | 32.5 | 14.6 | 30.2 | 24.4 |
| Qwen-3.5-4B | Qwen-3.5-4B(自进化) | 49.7 | 39.4 | 21.1 | 28.5 | 53.7 |
| Qwen-3.5-4B | Qwen-3.6-27B | 59.7 | 38.8 | 33.0 | 25.4 | 57.0 |
| Qwen-3.5-4B | Gemini-3.5-Flash | 62.6 | 37.3 | 23.0 | 32.2 | - |
| Qwen-3.5-9B | None | 28.2 | 26.3 | 24.3 | 35.9 | 34.7 |
| Qwen-3.5-9B | Qwen-3.5-4B | 61.0 | 40.4 | 25.0 | 40.3 | 69.2 |
| Qwen-3.5-9B | Qwen-3.5-9B(自进化) | 56.3 | 43.1 | 33.6 | 40.5 | 63.4 |
| Qwen-3.5-9B | Qwen-3.6-27B | 59.1 | 40.4 | 50.5 | 39.9 | 70.2 |
| Qwen-3.5-9B | Gemini-3.5-Flash | 53.0 | 39.6 | 48.8 | 40.5 | - |
| Qwen-3.6-27B | None | 33.9 | 27.5 | 40.8 | 42.1 | 52.8 |
| Qwen-3.6-27B | Qwen-3.5-4B | 62.6 | 41.6 | 40.6 | 52.9 | 72.1 |
| Qwen-3.6-27B | Qwen-3.6-27B(自进化) | 61.9 | 41.6 | 81.7 | 53.7 | 77.6 |
| Qwen-3.6-27B | Gemini-3.5-Flash | 65.1 | 51.0 | 76.0 | 52.5 | - |
| Gemma-4-31B | None | 33.9 | 30.6 | 48.3 | 43.3 | 50.4 |
| Gemma-4-31B | Qwen-3.5-4B | 73.1 | 38.8 | 37.1 | 42.1 | 66.9 |
| Gemma-4-31B | Qwen-3.6-27B | 73.7 | 37.7 | 72.0 | 44.2 | 66.9 |
| Gemma-4-31B | Gemma-4-31B(自进化) | 56.7 | 41.2 | 68.0 | 44.2 | 64.4 |
| Gemma-4-31B | Gemini-3.5-Flash | 61.8 | 37.7 | 68.8 | 43.4 | - |
| Gemini-3.5-Flash | None | 33.0 | 29.4 | 50.5 | 48.6 | 85.9 |
| Gemini-3.5-Flash | Qwen-3.5-4B | 67.5 | 40.0 | 18.1 | 48.5 | 87.3 |
| Gemini-3.5-Flash | Qwen-3.6-27B | 73.9 | 43.5 | 63.4 | 47.7 | 86.8 |
| Gemini-3.5-Flash | Gemini-3.5-Flash(自进化) | 72.6 | 44.7 | 76.6 | 60.7 | - |
表 2:跨模型技能迁移结果。我们评估各推理模型使用无技能(None)以及以 Qwen-3.5-4B、Qwen-3.6-27B、Gemini-3.5-Flash 为来源模型、由 WikiSkill 进化出的技能。技能在推理时注入推理智能体的系统提示词。加粗行为自进化技能(推理模型与技能来源相同,原文以高亮标注)。「」表示来源模型在技能进化前即达到 100% 验证表现,因此未进化出技能。
表 2 评估了以不同来源模型开发的 WikiSkill 技能在各推理模型之间的迁移效果。迁移技能经常同时胜过无技能基线与自进化技能。例如,Qwen-3.6-27B 的技能把 Qwen-3.5-9B 在 SpreadSheet 上提升到 50.5%,而其无技能为 24.3%、自进化技能为 33.6%;又把 Gemma-4-31B 在 LiveMath 上提升到 73.7%,对比分别为 33.9% 与 56.7%。值得注意的是,从小模型向大模型的迁移也同样有效:Qwen-3.5-4B 的技能把 Gemma-4-31B 在 LiveMath 上提升到 73.1%、在 ALFWorld 上提升到 66.9%。结果表明,更强的来源模型并不必然产出更好的技能,而由一个模型的经验开发出的程序性知识可以跨模型规模与模型家族迁移。
表 2 的结果表明,WikiSkill 既能产出可跨模型迁移的通用程序性知识,也可能产出引发负迁移的模型特定策略。LiveMath 技能的跨模型迁移效果特别好:Qwen-3.5-4B 与 Qwen-3.6-27B 的技能分别把 Gemini-3.5-Flash 从 33.0% 提升到 67.5% 与 73.9%。相反,SpreadSheet 上存在强烈的「来源-目标」交互效应:Qwen-3.5-4B 的技能把 Gemini-3.5-Flash 从 50.5% 拉低到 18.1%,而 Qwen-3.6-27B 的技能却把它提升到 63.4%。我们的错误分析找出了这种负迁移背后的两个因素。第一,Qwen-3.5-4B 的技能编码了低层变通做法(如单行 Python 命令与字符串转换规则),这帮助小模型规避执行失败,却限制了 Gemini-3.5-Flash 这类更强模型使用完整的端到端脚本。第二,碎片化的诊断流程引入了冗余工具调用,可能在任务完成前就耗尽 Gemini-3.5-Flash 的交互预算。
我们再来看不同推理模型如何使用同一来源模型开发的技能。在 Qwen 家族内部,更强的模型能从同样的程序性知识中获得更大价值。例如,Qwen-3.6-27B 的 SpreadSheet 技能分别把 Qwen-3.5-4B、Qwen-3.5-9B 与 Qwen-3.6-27B 相对各自无技能基线提升 18.4%、26.2% 与 40.9%。OfficeQA 则提供了一个「技能对他人比对自己更有用」的案例:Qwen-3.5-4B 的技能把自身表现从 30.2% 降到 28.5%,却把 Qwen-3.6-27B 从 42.1% 提升到 52.9%。轨迹分析表明,在长上下文场景中,小模型容易被冗长的文档上下文干扰,无法遵循细致的多步搜索指令,退回到默认的通读文档行为;而更强的模型能在长上下文中更可靠地执行技能所指定的结构化导航流程。综合来看,这些结果区分了自进化通常混为一谈的两种能力:从经验中发现有用的程序性知识,与在推理时有效执行这些知识。
为理解持久化知识在技能进化中的贡献点,我们对进化过程中两个可使用 wiki 的组件分别消融其 wiki 访问权限(表 3)。具体地,我们用 Gemini-3.5-Flash 独立地改变训练 rollout 阶段推理智能体、以及技能开发阶段技能提议者的 wiki 访问权限,得到四种配置。当技能提议者没有 wiki 访问权限时,我们同时移除 Wiki 维护者,即消除跨迭代的持久化知识积累。WikiSkill 的默认配置是:技能提议者可访问 wiki,推理智能体不可访问。
| 推理智能体访问 Wiki | 技能提议者访问 Wiki | LiveMath | SealQA | SpreadSheet | OfficeQA | 平均 |
|---|---|---|---|---|---|---|
| (No skill 基线) | 33.0 | 29.4 | 50.5 | 48.6 | 40.4 | |
| 是 | 否 | 43.8 | 42.0 | 44.4 | 51.0 | 45.3 |
| 否 | 否 | 51.3 | 38.4 | 49.9 | 55.2 | 48.7 |
| 是 | 是 | 64.8 | 42.8 | 80.2 | 55.6 | 60.9 |
| 否 | 是(默认配置) | 72.6 | 44.7 | 76.6 | 60.7 | 63.7 |
表 3:使用 Gemini-3.5-Flash 对 WikiSkill 的消融研究。我们在四种配置下评估各基准表现,配置区别在于技能进化期间推理智能体与技能提议者是否拥有 wiki 访问权限。当技能提议者没有 wiki 访问权限时,同时移除 Wiki 维护者,消除跨迭代的持久化知识积累。末行为 WikiSkill 默认配置。(注:原表以勾/叉标记访问权限,该标记在归档 HTML 中丢失,此处「是/否」按正文描述推断复原。)
如表 3 所示,在推理智能体不可访问 wiki 的前提下,给技能提议者开放持久 wiki 访问将平均基准表现从 48.7% 提升到 63.7%(+15.0%),其中 LiveMath(51.3% 到 72.6%)与 SpreadsheetBench(49.9% 到 76.6%)的提升尤为可观。缺少跨迭代积累的持久化知识时,技能提议者难以解决错综复杂的失败模式。
在技能提议者可访问持久 wiki 的前提下,再让推理智能体在训练 rollout 期间访问 wiki,会把平均基准表现从 63.7% 降到 60.9%,其中 LiveMath 从 72.6% 大幅跌至 64.8%。我们推测:当推理智能体在训练 rollout 期间同时能读技能与 wiki 时,部分任务求解知识可能直接取自 wiki 而非技能,这会让所得轨迹对技能开发的参考价值下降。
为更好地理解 WikiSkill 如何跨模型、跨数据集地演化知识与技能,我们分析进化过程中积累的 wiki 模式与产出的技能(表 4),以及成功技能更新在各迭代中被接受的时点(附录表 5)。
表 4 汇总了各模型与基准上技能与 wiki 模式的创建与编辑情况及其平均长度。跨模型来看,Qwen 系列模型产出更长的程序性技能(118.9-128.6 行),而 Gemma-4-31B 与 Gemini-3.5-Flash 产出更紧凑的技能(分别为 45.1 与 81.2 行)。wiki 模式的积累在模型间也有差异:平均创建 6.3-8.9 个模式、编辑 7.0-18.4 次。跨基准来看,SpreadSheet 产出最长的技能(142.5 行)与最多的 wiki 模式(9.8 个),而 LiveMath 产出最短的技能(84.6 行)与最少的 wiki 模式(4.4 个)。总体而言,技能结构与 wiki 积累在模型与数据集之间均存在差异。
(图 3 图注)图 3:ALFWorld 上 Wiki 引导技能进化的案例研究(Qwen-3.6-27B)。持久的 Wiki 层编译了跨迭代模式、历史提案 diff 及其接受决策的审计记录,以及按时间排列的历史。在第 0 轮技能提案被拒的信息指引下,提议者在第 1 轮合成了被接受的技能更新,并在之后依据新的模式证据继续精炼。图中文件内容为便于呈现已作简化。
附录表 5 把被接受的技能更新按早期(第 0-1 轮)、中期(第 2-4 轮)与晚期(第 5-7 轮)分组。跨模型来看,初始阶段占被接受更新的 39%-52%,中期与晚期仍占相当比例。跨基准的规律类似:39%-58% 的被接受更新发生在初始阶段。持续精炼在 SealQA 上尤为明显:33% 的被接受更新发生在中期、28% 发生在晚期。结合 5.1 节的消融结果,这些数据表明持久化知识积累支撑了跨迭代的持续技能精炼。Wiki 层保存了反复出现的错误、被拒绝的提案与进化历史,为技能提议者的后续更新提供积累的上下文。下面我们通过一个案例研究说明这些积累知识如何指导技能进化。
为说明 Wiki 层与技能层在进化中的交互,我们追踪 Qwen-3.6-27B 在 ALFWorld 上的一个具体例子,如图 3 所示(为呈现方便已简化)。
在第 0 轮,Wiki 维护者识别出一种基本的循环行为(take-examine-move-loop.md),技能提议者据此提出 goal-directed-action 技能,但它未能改善验证集表现而被拒绝。关键在于,skill-impact.md 保存了该提案的 diff 与被拒结果,使后续技能更新得以将这次失败尝试纳入考虑。
依据这份审计记录,技能提议者在第 1 轮创建了 break-repetition-loop 技能,附带一条具体行动规则(绝不把物品放回其原始位置),该提案被接受。随着新的循环变体在 rollout 中出现(multi-operation-loop.md),Wiki 维护者在持久 wiki 中积累新证据。在这些积累的 wiki 模式与新存储轨迹(图中未展示)的指引下,技能提议者在第 4 轮以一条新规则(每种操作对每个物品只做一次)进一步精炼了该技能。这个例子展示了先前迭代的持久化知识如何指导后续的技能精炼。
| 类别 | 技能:创建(提出/接受) | 技能:编辑(提出/接受) | 技能平均长度 | Wiki 模式:创建 | Wiki 模式:编辑 | Wiki 模式平均长度 |
|---|---|---|---|---|---|---|
| 按模型(全数据集平均) | ||||||
| Qwen-3.5-4B | 3.1 / 1.6 | 4.9 / 1.3 | 126.2 | 8.8 | 18.4 | 48.2 |
| Qwen-3.5-9B | 4.6 / 1.4 | 3.4 / 0.7 | 128.6 | 7.3 | 10.9 | 26.6 |
| Qwen-3.6-27B | 4.4 / 1.5 | 3.6 / 0.8 | 118.9 | 6.5 | 17.9 | 47.7 |
| Gemma-4-31B | 4.8 / 1.3 | 3.2 / 0.8 | 45.1 | 6.3 | 13.7 | 23.7 |
| Gemini-3.5-Flash | 2.3 / 1.2 | 5.7 / 1.1 | 81.2 | 8.9 | 7.0 | 18.1 |
| 按基准(全模型平均) | ||||||
| LiveMath | 1.9 / 1.1 | 6.1 / 1.9 | 84.6 | 4.4 | 12.1 | 31.7 |
| SealQA | 4.9 / 0.9 | 3.1 / 0.4 | 98.5 | 9.4 | 15.9 | 26.9 |
| SpreadSheet | 4.5 / 1.4 | 3.5 / 1.1 | 142.5 | 9.8 | 11.3 | 38.5 |
| OfficeQA | 4.7 / 1.8 | 3.3 / 0.3 | 102.9 | 8.3 | 14.9 | 31.4 |
| ALFWorld | 3.9 / 1.6 | 4.1 / 0.8 | 93.5 | 5.8 | 14.3 | 40.6 |
表 4:进化出的技能与 wiki 模式在各推理模型(上半)与基准(下半)上的统计。技能一栏报告提出/接受的创建与编辑数量及以 markdown 行数计的平均长度;wiki 模式一栏报告创建与编辑数量及平均长度。所有 wiki 模式的创建与编辑均被保留。
智能体技能编码可复用的程序性知识,使 LLM 智能体能够把过去的经验用于未来的任务 (Zhang et al., 2025; Li et al., 2026; Anthropic, 2026; Xia et al., 2026b; Zhou et al., 2026; Wang et al., 2026; Xu and Yan, 2026)。近期的框架让智能体通过从过往执行轨迹中发现并精炼程序性知识来自我改进 (Yuksekgonul et al., 2025; Agrawal et al., 2026; Ouyang et al., 2026; Xia et al., 2026a; Lu et al., 2026)。EvoSkill (Alzubi et al., 2026)、Trace2Skill (Ni et al., 2026) 与 SkillOpt (Yang et al., 2026) 等方法使用专门的智能体流水线来分析任务 rollout 并更新模块化的技能文档 (Zhang et al., 2026b)。然而,这些方法都没有把已学到的东西维护为一个独立的、持续演化的知识表示。WikiSkill 引入了一个持久的 Wiki 层,跨迭代把经验固化为结构化知识,使后续技能更新能系统性地建立在积累的知识之上。
除了构建高质量的技能之外,技能增强的智能体还必须在执行期间有效地选择并利用相关技能 (Chen et al., 2026a; Liu et al., 2026)。随着可复用技能数量的增长,近期工作探索了技能检索,即为每个任务从技能库中选出相关技能 (Zheng et al., 2026; Su et al., 2026; Cho et al., 2026; Shi et al., 2026; Ye et al., 2026)。WikiSkill 则聚焦于技能质量本身,与技能检索相互独立。另一条研究路线优化更广义的智能体运行框架(agent harness),包括提示词、上下文、工具、记忆与工作流 (Lou et al., 2026; Lee et al., 2026; Zhang et al., 2026a; Chen et al., 2026b; Lin et al., 2026)。这些方法通过分析执行轨迹与环境反馈来搜索更好的智能体配置,从而改进整个智能体系统。这一方向与 WikiSkill 互补:WikiSkill 专注于在保持更广义的智能体运行框架不变的前提下,进化可复用的程序性技能。
我们提出了 WikiSkill:一个让智能体技能与持久的、复利式积累的知识库(wiki)协同进化的框架。通过把智能体工作区组织为三个不同的层,WikiSkill 使技能开发得以在跨迭代不断被验证、不断被整合的知识之上构建。一个编排好的循环把经验固化进 wiki、依据积累的知识提出技能精炼、并按验证表现对变更进行门控。实验上,WikiSkill 在五个基准与五个推理模型上一致优于现有技能进化方法,并在多数「模型-数据集」组合中优于无技能基线。在整体增益之外,技能进化与模型规模扩展互为补充:更大的模型通常从进化技能中获益更多,而配备技能的小模型可以胜过大得多的无技能模型。同时,进化出的技能能有效跨模型、跨模型家族迁移,并可能优于自进化技能。最后,消融实验确认持久化知识积累对有效的技能进化至关重要。
WikiSkill 存在若干局限,也由此指向未来工作。第一,为隔离技能质量、避免技能检索引入的混杂效应,本研究沿用先前工作的做法,把活跃技能直接注入智能体提示词。这一设定没有评估技能检索或触发,而随着可用技能数量增长,这一点会变得重要。第二,我们的验证门控要求每个被接受的提案都必须提升验证分数,这排除了那些暂时保持性能不变、但可能在后续迭代中带来增益的中性提案。我们沿用先前技能进化框架 (Yang et al., 2026; Alzubi et al., 2026) 的严格标准以保证公平比较;探索更灵活的接受标准是未来工作的重要方向。第三,Wiki 层跨迭代持续积累模式页、进化日志与提案 diff,但 WikiSkill 目前缺少自动修剪 wiki 的机制。随着长期进化运行中知识不断积累,此类修剪可能变得必要。最后,尽管我们的基准套件包含长上下文文档推理(OfficeQA)与多步工具交互,但它没有覆盖跨数百个环境动作或数小时的超长时程任务。开发能够在单次长执行 rollout 之内精炼程序性知识的在线技能适应方法,仍是未来工作的重要方向。
本文使用大语言模型与编码智能体辅助并润色写作,以及生成部分表格与图表。
参考文献从略,见英文原文归档。
WikiSkill 的完整技能进化流程(算法 1)如下:
被接受的技能更新提案在各迭代阶段的分布见附录表 5(列于附录 B 之后)。
五个基准的要点:LiveMathematicianBench(LiveMath)(He et al., 2026) 由近几个月的数学竞赛选择题组成,考察复杂数学推理、量词与极值条件。SealQA (Pham et al., 2026) 是事实型问答基准,考察智能体构造有效搜索查询并从网络搜索结果中提取答案的能力。SpreadsheetBench(SpreadSheet)(Ma et al., 2024) 考察在库约束(如公式求值限制)下编写正确代码并执行复杂表格变换的能力。OfficeQA (Singhvi et al., 2025) 在大规模历史财政部公报(Treasury bulletins)语料上考察长上下文问答,任务需要跨长上下文与多页财务表格综合证据;沿用 Yang et al. (2026) 的设定,提示词中提供预解析的 oracle 参考页作为初始文档证据,同时保留本地文本处理工具(glob、grep、read)以便检索、交叉核对与检视磁盘上的完整公报文件。ALFWorld (Shridhar et al., 2021) 是交互式文本具身环境,智能体通过向模拟器输出文本动作完成多步家务任务,考察顺序决策、空间推理与从模拟器反馈中恢复错误的能力。
| 类别 | 早期(第 0-1 轮) | 中期(第 2-4 轮) | 晚期(第 5-7 轮) |
|---|---|---|---|
| 按模型 | |||
| Qwen-3.5-4B | 39% | 39% | 21% |
| Qwen-3.5-9B | 52% | 30% | 19% |
| Qwen-3.6-27B | 43% | 40% | 17% |
| Gemma-4-31B | 52% | 37% | 11% |
| Gemini-3.5-Flash | 50% | 46% | 4% |
| 按基准 | |||
| LiveMath | 44% | 42% | 14% |
| SealQA | 39% | 33% | 28% |
| SpreadSheet | 41% | 48% | 11% |
| OfficeQA | 58% | 26% | 16% |
| ALFWorld | 55% | 34% | 10% |
表 5:被接受的技能更新在进化迭代中的分布,按模型(上半)与基准(下半)分组。百分比表示各阶段被接受更新所占的比例。
| 基准 | 交互方式 | 训练 | 验证 | 测试 | 环境工具 |
|---|---|---|---|---|---|
| LiveMath | 单步 | 35 | 18 | 124 | 无(直接推理) |
| SealQA | 多步 | 16 | 10 | 85 | web_search、read_file |
| SpreadSheet | 多步 | 80 | 40 | 280 | bash |
| OfficeQA | 多步 | 50 | 24 | 172 | glob、grep、read |
| ALFWorld | 多步 | 39 | 18 | 134 | 环境许可动作(Admissible Actions) |
表 6:各基准的样本统计、数据划分、交互方式与可用环境工具。
所有任务划分与工具集严格对齐先前工作 (Yang et al., 2026; Alzubi et al., 2026)。工具设定:LiveMath 为无外部工具的单步推理,模型直接给出最终答案;SealQA 配备网络搜索(Google Search API)与文件读取,用于多步事实检索(全部实验使用 2026 年 7 月版 SealQA);SpreadSheet 提供 bash shell 工具执行 Python 代码与表格操作;OfficeQA 提供本地文本搜索工具用于多步公报导航;ALFWorld 提供交互式模拟器动作空间用于多步具身决策。
小验证集下的评估稳健性。 沿用先前工作的既有设定 (Yang et al., 2026; Alzubi et al., 2026),各基准的验证子集相对较小,可能给门控决策引入评估噪声。为此,所有报告分数为整条进化流水线三次独立运行的平均测试表现,并配以配对 bootstrap 显著性检验(详见附录 C)。
定义一次进化迭代为在完整训练子集 上 rollout 一遍( 个训练任务实例),以大小为 ()的 minibatch 处理。各框架每轮迭代的优化器 API 调用复杂度 如下:
| 框架 | 每轮迭代公式 | 复杂度 |
|---|---|---|
| Trace2Skill | ||
| EvoSkill | ||
| SkillOpt | ||
| WikiSkill |
表 7:各自我改进智能体框架每轮进化迭代的优化器 API 调用复杂度比较。 为训练任务数, 为批大小, 为 WikiSkill 技能提议者的交互式 ReAct 推理轮数, 为 SkillOpt 每步的反思与合并调用数, 为 Trace2Skill 归约树的分支因子。WikiSkill 在所有数据集上使用 ;在该全批(full-batch)模式下,WikiSkill 每轮的优化器调用数与训练集规模无关,仅需 次调用。
要点:
原文附录 E 给出了三类提示词的完整原文(此处摘编其结构要点,完整文本见英文原文归档):