LLM 时代的知识工程:从文档管理到可操作的知识系统
当大语言模型成为知识的主要消费者之一,知识工程的对象、方法和评价标准都在变化。本文给出一个面向人机共读的知识系统框架。
目录
传统知识管理的核心问题是”存起来找不到”,而 LLM 时代的核心问题变成了”找到了用不好”。这篇文章讨论这个转变,以及它对个人和企业知识系统设计的含义。
从”图书馆”到”工作台”
图书馆式知识系统的假设是:用户知道自己要找什么,找到之后自己会读完。这个假设涉及到两个过程,(1)用户向系统发起搜索请求,得到系统返回的结果;(2)用户对返回的搜索结果进行判断,逐个打开最可能相关的项进行阅读,提取出需要的知识。
这一过程在两种情况下失效:
- 使用者的先验不足——新手不知道该检索什么;
- 使用者不是人——LLM 没有”自己去读完”的耐心概念,它只接受被裁剪好的上下文。
因此知识系统的基本单元需要重新设计。与其问”这篇文档放在哪个文件夹”,不如问:
- 这条知识解决什么问题?(问题锚点)
- 它在什么条件下成立?(适用边界)
- 它和哪些概念相互依赖?(关系网络)
这三个问题的解决需要我们以新的视角去审视现有的知识系统。
一个三层框架
我把面向人机共读的知识系统分成三层:
原始材料层保存来源:论文、报告、网站、会议记录、现场观察、数据库等。
概念层把材料抽象成稳定的概念和关系。
知识层将原始材料提取并按照概念层的设计组织成网络结构。
决策层面向具体问题,以概念和知识作为依据形成行动建议。
LLM 在知识层读写,形成决策建议,人在决策层判断——这是我认为比较合理的人机分工。
一个微小的实证
我在自己维护的三类内容上做了对比:传统文件夹笔记、带主题聚合的数字花园、以及为 LLM 裁剪过的结构化摘要。让同一个模型回答 20 个需要跨文档综合的问题,结果如下(示例数据):
结构化摘要明显胜出并不意外:它本质上是为模型”预制了上下文”。真正值得注意的数字是数字花园也显著优于文件夹——只要存在显式的主题聚合,机器的可用性就大幅提升。
对个人网站的含义
这也是本站采用 Topics 作为一等公民的原因。Topic 不是标签,而是知识系统里的”概念锚点”:文章、笔记、阅读记录和项目都挂接到主题上,主题页自动聚合出一个小型知识视图。
局限与下一步
这个框架目前有三个未解决的问题: