这一节只讲胶囊系统的主流程和核心分层。先看一份资料进入系统以后要经过哪些动作,再看为什么系统需要入口、证据、索引、理解、演化和内化这几层。每一层具体怎么做,放到后面单独展开。
2.1 先看一份资料怎样进入系统
前面已经讲过,普通收藏夹最大的问题不是不能保存资料,而是资料保存以后就停在那里了。它没有被理解,没有和已有材料发生关系,也没有变成以后写作、学习、做方案时可以重新调用的知识资产。
先来看看胶囊系统的整个流程:假如一份资料进入了胶囊系统,它会被如何处理?
+------------
| 接收资料 链接、网页、PDF、音频、图片、文字
+------------
|
v
+------------
| 入口去重 用 URL、文件指纹、消息 ID 拦截明显重复
+------------
|
v
+------------
| 抽取内容 抓取网页、解析 PDF、转写音频、识别图片
+------------
|
v
+------------
| 生成证据 转成 Markdown、转写稿、OCR 文本
+------------
|
v
+------------
| 写入索引 记录来源、状态、证据页和目标主题
+------------
|
v
+------------
| 理解关系 Hermes 提取观点,判断主题和资料关系
+------------
|
v
+------------
| 演化主题 去掉重复表达,扩展和校正主题页
+------------
|
v
+------------
| 形成内化结构 当前判断、主题索引、输出任务
+------------
这张图先只表达流程顺序,不急着讨论每一步应该放到哪个模块处理。流程和模块不是一回事。流程表达的是动作顺序,分层模块表达的是职责边界。
入口去重应该尽量早做。能用原始链接、文件指纹、消息 ID 判断出来的重复,就不要等到后面再处理。这样可以避免同一条资料反复抓取、反复转换,也能减少后面 Hermes 的理解成本。
但胶囊系统真正要处理的,不是严格意义上的文件重复。互联网资料里更常见的是改写、转载、洗稿和重复讲同一件事。两个资料的正文未必完全一样,但进入主题页以后可能没有任何新增价值。这样的重复不能靠指纹解决,必须等 Hermes 理解正文以后,在主题演化阶段处理。
入口去重只负责拦掉低成本、确定性的重复;真正决定 Wiki 是否重复的,是后面的演化层判断:这份资料有没有新观点、新例子、新边界,还是只是换一种说法重复已有内容。
如果这条流程成立,一份资料就不再是孤立的收藏记录。它会先经过入口去重和内容抽取,再被处理成可以核对的证据,随后进入索引、理解、主题演化和内化线索整理。
这里最重要的变化,是资料不再停留在“保存”这个动作上。它进入系统以后,还会继续被整理、比较、融合和校正,并逐渐变成用户愿意反复打开的知识结构。
2.2 证据先标准化,再谈理解
这里要先讨论“证据”这个概念。胶囊系统里的证据,不一定必须是原始文件。证据指的是可核对的信息。
音频的证据可以是转写成文字,PDF 的证据也可以是抽取出来的正文,网页的证据可以是清理后的 Markdown。只要信息足够完整,后面能回到来源核对,它就可以承担证据层的职责。这和法律意义上的证据不完全一样,法律上的「证据」是不能加工和修改的。
胶囊系统中真正会被 Hermes 读取、比较和融合的,大部分时候仍然是文本。所以,主证据应该放在飞书知识库或飞书云文档里,而不是默认保存在本地。本地最多保存临时转换文件、处理日志,以及那些不适合放进飞书的原始附件(视频、PDF 等)。
所以,证据层应该尽量简单。
+------------
| 主证据 飞书知识库/云文档里的 Markdown 文本
+------------
|
v
+------------
| 原始载体 音频、PDF、图片等,不适合放飞书时才留在本地
+------------
主证据一般是标准化后的文本。它可以放在飞书知识库或飞书云文档里,作为后续理解和主题演化的依据。
而原始载体是否长期保留,要看它有没有核对价值。
比如一段正式访谈,语气、停顿和原声本身可能有价值,原始音频就应该保留。普通语音输入如果已经完整转写成文字,原始音频未必需要长期保存。PDF 也是一样。如果页码、图表、版式本身有证据价值,就保留原件;如果只是文字资料,Markdown 证据可能已经够用。
按这个规则处理,飞书会成为证据层的主要承载位置,用户也能直接在飞书里查看和校对这些证据文本。系统不会变成一个无限膨胀的本地附件仓库,也不会失去回头核对的能力。
2.3 再按模块拆开胶囊系统
有了信息流以后,再看模块就比较清楚了。胶囊系统不是一条简单流水线,而是几个部分在配合工作。
+------------
| 交互层 接收资料,也接收用户的问题和指令
+------------
|
v
+------------
| 证据层 保存可核对的信息,优先转成文本
+------------
|
v
+------------
| 索引层 管理入库资料,连接证据层和演化层
+------------
|
v
+------------
| 理解层 Hermes 阅读资料,判断观点和关系
+------------
|
v
+------------
| 演化层 扩展主题边界,校正已有判断
+------------
|
v
+------------
| 内化层 当前判断、主题索引、输出任务
+------------
到了这里,9.2 要讲的核心思路已经够了。胶囊系统接收资料,但不只是保存资料;它会像维护 Wiki 一样,让主题页随着新资料不断延伸和校正,并把这种变化整理成用户可以反复理解和使用的知识结构。
下一节再把这几层逐一拆开,看每一层具体承担什么任务,以及第一版用飞书和 Hermes 应该怎样实现。
2.4 ■ 学点英语
| 中文 | English | 音标 | 说明 |
|---|---|---|---|
| 胶囊系统 | Capsule System | /ˈkæpsuːl ˈsɪstəm/ | 把知识压缩成可检索、可演化、可复用单元的系统 |
| 知识胶囊 | Knowledge Capsule | /ˈnɑːlɪdʒ ˈkæpsuːl/ | 围绕一个主题沉淀出的知识单元 |
| 知识单元 | Knowledge Unit | /ˈnɑːlɪdʒ ˈjuːnɪt/ | 可以被检索、更新和复用的最小知识块 |
| 主题聚合 | Topic Aggregation | /ˈtɑːpɪk ˌæɡrɪˈɡeɪʃən/ | 把同一主题下的材料集中到一起 |