前面我们讲过怎么把抖音视频保存下来。但很多时候,真正有用的是视频里讲过的话。这一节就顺着这个需求往下走:把一段视频变成可以搜索、可以引用、可以放进知识库的文字。
3.1 视频保存下来,还不算真正拿到内容
刷到一条不错的视频,我们通常是被里面的观点、讲解或者案例打动。看第一遍的时候觉得有用,随手收藏。过几天真想回头找那句话,就只能拖进度条,凭印象猜它大概在前半段还是后半段。
这就是视频作为知识材料最麻烦的地方。它适合看,不适合查;适合播放,不适合整理。想把其中一段放进笔记,最后往往还是要手工转述。
文字就轻很多。它可以搜索,可以复制,可以重新分段,也可以合并进已有资料里。所以这一节的重点,是把视频里的声音变成能用的文字。
3.2 先想清楚要不要保留视频
真正动手之前,Hermes 应该先问一句:这次要不要把视频文件也保存下来?
如果只是想提取文字,其实不必每次都保存完整视频。很多抖音视频背后是音视频分离的流,Hermes 可以只取音频,直接拿去识别。这样更快,也少占空间。最后只需要得到一份转写和一份笔记,就已经足够。
如果后面还要剪辑、归档,或者需要留一份原始素材,再保存完整视频。这样会多一个 mp4 文件,流程也稍微重一点。这个选择没有高低,只是任务目标不同:只要文字,就走轻一点的路线;要保留素材,就走完整路线。
这个细节看起来小,其实很重要。Agent 最容易犯的错,就是用户只想要文字,它却把整套下载、合并、转码都跑了一遍。任务开始前多问一句,后面就少做很多无用功。
3.3 抖音没有现成字幕,只能听
有些网站会提供字幕轨道,像 YouTube 这种,Hermes 直接把字幕抓下来就行。抖音网页端通常不是这样。页面里的 <video> 元素不一定带字幕轨道,页面数据里也未必有逐句文案。
既然没有现成字幕,就只能把音频交给语音识别模型,让模型把声音听写成文字。这类技术通常叫 ASR,也就是自动语音识别。手机输入法里的语音输入、会议录音转文字,本质上做的也是这件事。
这一节用 Whisper 来完成听写。可以把 Whisper 理解成一个听写模型:给它一段音频,它会输出文字和对应时间点。它的好处是可以在本地运行,不需要把音频上传到外部服务。普通短视频和口播内容,用它先转出一份初稿,已经够用了。
但初稿只是初稿。Whisper 能把声音听成文字,却不一定听懂语境。它可能把“Token”听成别的词,也可能把“剪辑”“分镜”这类行业词识别错。中文输出里偶尔还会混入繁体字。单看每个错误都不大,放进笔记里就会很别扭。
这时才需要 LLM。它不重新听音频,而是读 Whisper 转出来的文字,结合上下文做语义纠错。字典替换只能处理固定错误,比如繁体转简体、少数常见错字;同音词、专有名词、行业术语,这些都必须能看懂上下文才能修改准确。
所以这条流程要多一个步骤。先用语音识别把声音听写成文字,再用 LLM 逐段纠错。等句子基本干净了,再进入下一步结构化。如果一开始就急着把转写整理成文章,最后很容易得到一篇看似完整、但关键术语到处出错的笔记。
3.4 章节信息不是字幕,但很有用
抖音通常不给逐句字幕,但有些视频会带章节摘要或章节列表。比如一个讲「五步走通知识蒸馏」的视频,可能附有这样一段章节信息:
00:00 引言
00:54 导出视频字幕
01:11 设计开工指南
02:16 分批蒸馏
03:26 三层汇总
04:14 设计检索规则
04:30 结语
这些数据不够细,不能直接当正文,但很有用——它告诉 Hermes 这段视频大概分成哪几部分,每一部分从什么时候开始。
这对整理笔记很有帮助。没有章节信息时,Hermes 只能根据转写内容自己判断哪里该分段;如果有章节标题和时间点,就可以先搭出一个骨架,再把纠错后的转写填进去。这样生成的笔记更像一篇有结构的文章,而不是一长串被硬切开的字幕。
这也是配套 Skill 里要提取章节数据的原因。它的目的很朴素:让后面的 Markdown 笔记更稳。
3.5 最后得到什么
默认情况下,只需要两份文件就足够了。一份是带时间戳的转写,保留原视频的时间线,方便以后回查;另一份是整理后的 Markdown 笔记,去掉时间戳,按章节和话题重新组织。
这两份文件的职责不同。转写负责“可追溯”,笔记负责“可阅读”。要核对原话,就看转写;要复习内容,就看笔记。如果一开始选择保存视频,那就再多一份 mp4,用来剪辑、归档或人工复核。
本节对应的 Skill 已放在资料包中:
profile/douyin-skills/douyin-extract.md
这个 Skill 会先询问是否保存视频。默认只取音频,生成转写和 Markdown 笔记;如果需要保存素材,再额外输出视频文件。正文理解思路,具体执行看 Skill。
可以直接这样让 Hermes 实践:
请参考 profile/douyin-skills/douyin-extract.md,
帮我处理这个抖音视频。默认不保存视频文件,
生成一份带时间戳的转写,
再生成一份适合放进知识库的 Markdown 笔记:
https://v.douyin.com/xxxxxxx/
如果跑通了,桌面上看到的就不再只是一个视频文件,而是一份可以回查的转写,以及一份可以真正读下去的笔记。
3.6 ■ 学点英语
| 中文 | English | 音标 | 说明 |
|---|---|---|---|
| 字幕提取 | Subtitle Extraction | /ˈsʌbtaɪtl ɪkˈstrækʃən/ | 从视频中获取字幕文本的过程 |
| 语音识别 | Speech Recognition | /spiːtʃ ˌrekəɡˈnɪʃən/ | 把语音内容转换成文字的技术 |
| 转写文本 | Transcript | /ˈtrænskrɪpt/ | 由语音识别得到的文字内容 |
| 时间戳 | Timestamp | /ˈtaɪmstæmp/ | 标记字幕或事件发生时间的位置 |