这一节先梳理第一版到底接收哪些资料形态,再逐一决定它们怎样形成证据。前面的需求里,我们讨论的非常含糊,这里有必要对资料范围进行收敛。 收敛对于 Vibe-Coding 非常重要。如果不收敛,很容易造成过度开发。人类的思维总是倾向于发散。所以,我必须要认真的对大量的需求做鉴定和收缩。一个不裁剪,不分阶段的项目,肯定是一个失败的项目。
3.1 收敛依据
需求裁剪最困难的地方,往往不是不知道有哪些方案,而是不知道哪些应该要,哪些可以不要。同一个需求,有人认为必须保留,也有人觉得完全没有必要。这里没有一套适用于所有项目的答案。所以,在收敛具体需求之前,必须先对当前项目做一个完整的定位。
胶囊系统首先是一个个人知识库。它主要满足个人的学习和记录需求,帮助我们把日常接触到的资料整理成以后可以继续使用的知识。它和企业里用于生产、研发或业务协作的知识库并不一样。后者可能直接参与产品开发、客户交付和重要决策,一条证据缺失或失真,都可能带来实际的业务后果。
理解清楚这个定位,非常重要。
我认为,这两类知识库最大的区别,在于个人知识库应该更加轻量。对于证据来源是否完整、原始资料是否长期保存,没有那么严苛。它可以允许一定程度的容错。企业生产知识库则不能如此随意。它通常需要更严格的来源追溯、原件保存、权限控制和审计记录,有时还必须满足组织内部的合规要求。
当然,企业知识库是一个极其庞大的话题,那肯定不是我们这个综合教材能够表达的。他需要涉及到 Agentic RAG、Graph 知识图谱等。企业知识库的目的也同个人知识库不同。
这就是整个项目的底色:我们做的是一个服务个人学习和记录的知识库,而不是一套用于生产环境的证据管理系统。后面无论是放弃 PDF 里的图片,还是不保留原始音频和视频,都是在这个底色上做出的需求裁剪。以后遇到“这个到底要不要”的问题,也可以先回到这里,看看当前选择是不是仍然符合这个项目的定位。
所以,搞清楚项目的底色,对于裁剪需求非常重要,希望同学们可以借鉴我的思路。下面我们根据这个底色,来对需求做裁剪和收敛。
3.2 资料接收范围
前面的需求简报直接把 URL、网页、PDF、音频、图片和文字都列进了接收范围,但这还不够。不同资料形态携带信息的方式不一样,系统不能用同一套规则处理它们。
第一版先接受六类资料。前五类是单一形态,最后一类是文字、图片和视频混在一起的复合资料。
| 资料形态 | 常见来源 | 第一版处理方向 |
|---|---|---|
| 纯文本 | 用户输入、.txt、消息正文 |
直接作为文字证据 |
| PDF 文档 | 电子书、论文、报告、扫描文档 | 提取文字证据,不处理 PDF 中的图片 |
| 纯图片 | 截图、照片、图表、扫描页 | 识别图片中的信息,形成文字证据 |
| 纯音频 | 录音、播客、语音消息 | 转写为文字证据 |
| 纯视频 | 课程、演讲、视频文件 | 形成文字证据 |
| 复合资料 | 微信公众号文章、HTML 页面 | 保留 URL,并把有价值的内容清洗成文字证据 |
这里的“复合资料”是对这类混合内容的工作称呼。第一版只处理网页,因为微信公众号文章和普通 HTML 页面都可能同时包含正文、图片、视频、广告和其他页面资源。
Word、Excel、PowerPoint 等其他格式,第一版暂不接受处理。
3.3 两层证据
这里还要区分两层证据: 1. 原始证据,指视频、PDF、网页 URL。这类原始证据,如果有 URL,则只保存 URL。如果没有 URL,比如用户发了一段音频,则音频提取文字后,直接丢弃(不是删除,只是不记录,不保存)。 2. 清理、提取后的证据,我们称为”衍生证据“。
比如,一份 PDF,他是原始证据,但是将其提取成纯文本、去掉图片后的文本属于“衍生证据”。
在胶囊系统中,我们会保存原始证据的 URL 和 “衍生证据”。衍生证据通常是文本。
但对于复合材料,会有一些不同,这个我们后面讨论。
3.4 纯文本证据的处理规则
纯文本没有复杂的载体问题。用户提交的文字可以直接作为证据,系统只需要保留原意,必要时整理段落和格式,不能在接收阶段把它改写成摘要。
后续的主题判断、去重和融合都应该建立在这份文字证据上。知识页可以重新组织内容,但不能反过来覆盖这份处理后的证据。
3.5 PDF 统一转换成文字
PDF 一律转换成文字。文字型 PDF 直接提取正文,扫描型 PDF 通过 OCR 识别文字,再清理页眉、页脚、页码和其他版面噪音。系统不保留原 PDF,也不处理 PDF 里嵌入的图片。
如果 PDF 来自一个 URL,这个 URL 作为原始证据保存,抽取出的文字作为衍生证据保存,两者保持关联。如果用户直接提交 PDF 文件,没有 URL,那么系统只留下抽取后的文字,不保存原始文件。
这个选择会放弃 PDF 中的版式、图表和其他视觉信息,PDF 在胶囊系统里只是一种文字来源,不承担原文件归档的职责。
3.6 独立图片的证据成立条件
纯图片和复合资料里的图片不是同一种判断对象。复合资料里的图片可以借助正文、标题、图注和页面位置理解;纯图片没有这些上下文,只能把图片本身当作一个独立对象来判断。
因此,纯图片只有在自身已经构成完整、可独立理解的知识证据时,其中的信息才值得转换成文字进入知识系统。判断的重点不是“它有没有可能和某个主题有关”,而是“它自己能不能形成一个独立的文字知识片段”。图片里的文字、标题、图例、坐标、标注或结构,必须足以让人判断它在表达什么。表格、流程图、公式、地图、带明确标注的数据图,以及能够说明操作状态的截图,通常符合这个条件。
反过来,单独提交的风景图、头像、装饰图、广告图或普通照片,如果独立存在,通常不被认定为知识。它们只有夹在有意义的正文、图注或其他证据中时,才可能因为上下文而获得价值。脱离上下文以后,图片本身不能完整表达知识,就不应进入知识内容。比如,这张图片:

这里值得讨论的是,一张风景图是否属于”知识“。以摄影风景为例,我认为不属于。一张风景图如果独立存在,没有依附于其他上下文,那么它应该属于摄影、壁纸类多媒体,这本身不应该进入到以文字为主的知识库。当然,你可以为自己的摄影作品配上文字上下文,这样可以算作摄影知识的一部分。比如,你可以输入一张图片,然后再附带一段 Prompt:这张作品拍摄于 2026 明年 8.11 日,参数是什么。
每个人对于知识的界定会有差异,也会造成需求文档的不一致。所以,我常说,Agent 时代每个人的作品都是独一无二的。但不管怎么样,需求文档最重要的就是”讲清楚”,这一点是共同的。
判断完成以后,图片中有价值的信息会被识别并清洗成文字,图片文件本身不保留;如果图片来自 URL,则另外保存 URL 作为原始证据。
3.7 音频与视频的证据转换规则
纯音频的主要信息通常在声音内容里,纯视频的讲解内容通常可以通过字幕或转写稿进入文字证据。因此,第一版对这两类资料只要求形成可阅读、可检索的文字证据。
它们不作为知识页中的独立媒体对象保存,原始音频和视频文件也不进入证据层。如果资料来自 URL,系统只把 URL 作为原始证据保存。
流转规则:
音频、视频 -> 转写并清洗 -> 文字证据
如果音频或视频来自链接,则有两层证据:URL 形式的原始证据和转写后的文字证据。直接提交的媒体文件没有原始证据,只有处理后的文字证据。这个时代的信息太泛滥了,如果只是个人的兴趣、爱好,非工作知识,保不保存原始多媒体没有多大意义。
可能你想的很多,但是最后发现,保留一大堆视频、音频毫无用处。我个人的原则是能要文字的,绝不要其他格式的媒体。
3.8 复合资料的内容保留规则
这是最麻烦的一类。微信公众号文章和普通 HTML 页面往往同时包含正文、图片、视频、广告和跟踪资源。第一版把网页 URL 保存为原始证据,再抽取并清洗页面内容,形成文字证据。
复合资料的处理边界是:正文进入文字证据;图片结合正文和图注判断,有价值的信息转换成文字,但不保留图片文件;视频、音频和其他媒体也不单独保存。广告、装饰资源和其他无关内容直接排除。这样,网页最终只留下两样东西:作为原始证据的 URL,以及作为处理后证据的清洗文本。
复合资料中的图片判断标准
复合资料里的图片可以结合正文、标题、图注和页面位置判断。图片即使不能独立表达完整事实,只要它是正文不可替代的补充,忽略后会使证据不完整,就应当把其中的信息转换成文字;广告、装饰资源和与正文无关的图片则不进入知识内容。
但这其实是最难的一类判断。
以下图片均来自于我的微信公众号“林间有风”

这种图片里的信息应该转成文字证据吗?我个人认为不需要,因为它本身没有增加新的信息,只是在佐证观点或者加深印象。
再比如,这种:

同样是这个问题,没有增加新的信息,原则上我认为不需要再把它转换成文字。
那什么样的信息应该转成文字证据呢?这种:

这种:

它属于知识本身的一部分,不是为了渲染、加强或增强说服力,所以应当识别出来,转换成文字证据。
如果上下文不足以确认图片的作用,只能把它标记为待确认,不能擅自把无法识别的内容编成文字。无论判断结果如何,图片文件本身都不进入证据层;网页的原始证据仍然是它的 URL。
你看,其实想想就知道有点难,这100%需要用到视觉模型,且需要模型有不错的推理能力。