💡阅读指南

这一节只讲胶囊系统的主流程和核心分层。先看一份资料进入系统以后要经过哪些动作,再看为什么系统需要入口、证据、索引、理解、演化和内化这几层。每一层具体怎么做,放到后面单独展开。

2.1 先看一份资料怎样进入系统

前面已经讲过,普通收藏夹最大的问题不是不能保存资料,而是资料保存以后就停在那里了。它没有被理解,没有和已有材料发生关系,也没有变成以后写作、学习、做方案时可以重新调用的知识资产。

先来看看胶囊系统的整个流程:假如一份资料进入了胶囊系统,它会被如何处理?

Text
+------------
|  接收资料      链接、网页、PDF、音频、图片、文字
+------------
       |
       v
+------------
|  入口去重      用 URL、文件指纹、消息 ID 拦截明显重复
+------------
       |
       v
+------------
|  抽取内容      抓取网页、解析 PDF、转写音频、识别图片
+------------
       |
       v
+------------
|  生成证据      转成 Markdown、转写稿、OCR 文本
+------------
       |
       v
+------------
|  写入索引      记录来源、状态、证据页和目标主题
+------------
       |
       v
+------------
|  理解关系      Hermes 提取观点,判断主题和资料关系
+------------
       |
       v
+------------
|  演化主题      去掉重复表达,扩展和校正主题页
+------------
       |
       v
+------------
|  形成内化结构  当前判断、主题索引、输出任务
+------------

这张图先只表达流程顺序,不急着讨论每一步应该放到哪个模块处理。流程和模块不是一回事。流程表达的是动作顺序,分层模块表达的是职责边界。

入口去重应该尽量早做。能用原始链接、文件指纹、消息 ID 判断出来的重复,就不要等到后面再处理。这样可以避免同一条资料反复抓取、反复转换,也能减少后面 Hermes 的理解成本。

但胶囊系统真正要处理的,不是严格意义上的文件重复。互联网资料里更常见的是改写、转载、洗稿和重复讲同一件事。两个资料的正文未必完全一样,但进入主题页以后可能没有任何新增价值。这样的重复不能靠指纹解决,必须等 Hermes 理解正文以后,在主题演化阶段处理。

入口去重只负责拦掉低成本、确定性的重复;真正决定 Wiki 是否重复的,是后面的演化层判断:这份资料有没有新观点、新例子、新边界,还是只是换一种说法重复已有内容。

如果这条流程成立,一份资料就不再是孤立的收藏记录。它会先经过入口去重和内容抽取,再被处理成可以核对的证据,随后进入索引、理解、主题演化和内化线索整理。

这里最重要的变化,是资料不再停留在“保存”这个动作上。它进入系统以后,还会继续被整理、比较、融合和校正,并逐渐变成用户愿意反复打开的知识结构。

2.2 证据先标准化,再谈理解

这里要先讨论“证据”这个概念。胶囊系统里的证据,不一定必须是原始文件。证据指的是可核对的信息。

音频的证据可以是转写成文字,PDF 的证据也可以是抽取出来的正文,网页的证据可以是清理后的 Markdown。只要信息足够完整,后面能回到来源核对,它就可以承担证据层的职责。这和法律意义上的证据不完全一样,法律上的「证据」是不能加工和修改的。

胶囊系统中真正会被 Hermes 读取、比较和融合的,大部分时候仍然是文本。所以,主证据应该放在飞书知识库或飞书云文档里,而不是默认保存在本地。本地最多保存临时转换文件、处理日志,以及那些不适合放进飞书的原始附件(视频、PDF 等)。

所以,证据层应该尽量简单。

Text
+------------
|  主证据        飞书知识库/云文档里的 Markdown 文本
+------------
       |
       v
+------------
|  原始载体      音频、PDF、图片等,不适合放飞书时才留在本地
+------------

主证据一般是标准化后的文本。它可以放在飞书知识库或飞书云文档里,作为后续理解和主题演化的依据。

而原始载体是否长期保留,要看它有没有核对价值。

比如一段正式访谈,语气、停顿和原声本身可能有价值,原始音频就应该保留。普通语音输入如果已经完整转写成文字,原始音频未必需要长期保存。PDF 也是一样。如果页码、图表、版式本身有证据价值,就保留原件;如果只是文字资料,Markdown 证据可能已经够用。

按这个规则处理,飞书会成为证据层的主要承载位置,用户也能直接在飞书里查看和校对这些证据文本。系统不会变成一个无限膨胀的本地附件仓库,也不会失去回头核对的能力。

2.3 再按模块拆开胶囊系统

有了信息流以后,再看模块就比较清楚了。胶囊系统不是一条简单流水线,而是几个部分在配合工作。

Text
+------------
|  交互层        接收资料,也接收用户的问题和指令
+------------
       |
       v
+------------
|  证据层        保存可核对的信息,优先转成文本
+------------
       |
       v
+------------
|  索引层        管理入库资料,连接证据层和演化层
+------------
       |
       v
+------------
|  理解层        Hermes 阅读资料,判断观点和关系
+------------
       |
       v
+------------
|  演化层        扩展主题边界,校正已有判断
+------------
       |
       v
+------------
|  内化层        当前判断、主题索引、输出任务
+------------

到了这里,9.2 要讲的核心思路已经够了。胶囊系统接收资料,但不只是保存资料;它会像维护 Wiki 一样,让主题页随着新资料不断延伸和校正,并把这种变化整理成用户可以反复理解和使用的知识结构。

下一节再把这几层逐一拆开,看每一层具体承担什么任务,以及第一版用飞书和 Hermes 应该怎样实现。

2.4 ■ 学点英语

中文 English 音标 说明
胶囊系统 Capsule System /ˈkæpsuːl ˈsɪstəm/ 把知识压缩成可检索、可演化、可复用单元的系统
知识胶囊 Knowledge Capsule /ˈnɑːlɪdʒ ˈkæpsuːl/ 围绕一个主题沉淀出的知识单元
知识单元 Knowledge Unit /ˈnɑːlɪdʒ ˈjuːnɪt/ 可以被检索、更新和复用的最小知识块
主题聚合 Topic Aggregation /ˈtɑːpɪk ˌæɡrɪˈɡeɪʃən/ 把同一主题下的材料集中到一起