Agent X-Ray
RuntimeNotesAbout
Notes/AI 前沿/大厂技术博客档案/第19章

LLM 知识库

2 分钟 · 更新于 2026-09-01 · 原文

来源Andrej Karpathy 于 2026-04-08 在 X (Twitter) 分享。

LLM 知识库

最近我发现一件非常有用的事:用 LLM 为各种研究兴趣主题构建个人知识库。这样一来,我近期的大量 token 消耗已经不再是操作代码,而是操作知识(以 Markdown 和图片形式存储)。最新的 LLM 在这方面表现相当出色。

数据摄入

我将源文档(文章、论文、代码仓库、数据集、图片等)索引到 raw/ 目录中,然后用 LLM 增量式地「编译」一个 wiki——本质上就是一个按目录结构组织的 .md 文件集合。这个 wiki 包含 raw/ 中所有数据的摘要、反向链接 (Backlinks),并将数据归类为概念,为每个概念撰写文章并互相链接。将网页文章转换为 .md 文件时,我喜欢用 Obsidian Web Clipper 扩展,同时用快捷键把所有相关图片下载到本地,方便 LLM 直接引用。

IDE

我用 Obsidian 作为「IDE 前端」,在里面查看原始数据、编译后的 wiki 以及衍生的可视化内容。需要强调的是,wiki 的所有数据都由 LLM 编写和维护,我极少直接编辑。我还尝试过一些 Obsidian 插件来用其他方式渲染和查看数据(比如用 Marp 做幻灯片)。

问答

真正有趣的地方在于,当你的 wiki 足够大时(例如我在某个近期研究方向上已有约 100 篇文章、约 40 万字),你可以向 LLM Agent 提出各种复杂问题,它会自行检索并研究答案。我原以为需要用到复杂的 RAG (检索增强生成) 技术,但 LLM 在自动维护索引文件和文档简要摘要方面表现很好,在这个约数十万字的小规模下,它能轻松读取所有重要的相关数据。

输出

我不喜欢在终端文本中获取答案,而是让 LLM 为我渲染 Markdown 文件、幻灯片(Marp 格式)或 matplotlib 图表,然后在 Obsidian 中查看。根据查询需求,还可以有许多其他可视化输出格式。我经常会把这些输出「归档」回 wiki,以增强后续查询的效果。这样,我自己的探索和查询总是在知识库中「累积增值」。

健康检查

我对 wiki 运行过一些 LLM「健康检查」,例如发现不一致的数据、用网络搜索补充缺失数据、发现有趣的关联以作为新文章候选等,从而增量式地清理 wiki 并提升整体数据完整性。LLM 在建议进一步值得探究的问题方面表现很好。

额外工具

我发现自己在不断开发额外的工具来处理数据。例如我用 vibe coding 的方式写了一个简单的 wiki 搜索引擎,我既可以直接在 Web UI 中使用,更常见的做法是通过 CLI 把它交给 LLM 作为工具来处理更大规模的查询。

进一步探索

随着仓库增长,自然会想到合成数据生成 + 微调 (Finetuning),让 LLM 在权重中「知道」这些数据,而不仅仅依赖上下文窗口。

总结

从多个来源收集原始数据,用 LLM 编译成 .md wiki,再由 LLM 通过各种 CLI 工具进行问答并增量增强 wiki,所有内容都在 Obsidian 中查看。你几乎不需要手动编写或编辑 wiki,这是 LLM 的领域。我认为这里有空间做出一个了不起的新产品,而不是一堆临时拼凑的脚本。


  • Anthropic AI & Agent 最佳实践
  • Lessons from Building Claude Code

本章目录
数据摄入IDE问答输出健康检查额外工具进一步探索总结Related Documents
苏ICP备2025204887号-2