前面我们在 logamee-auto-video 的流程里提到了 TTS,但只是带过。这一节专门讲声音克隆——什么是声音克隆,为什么可以本地部署,以及有哪些好用的开源方案。重点是想让读者理解:声音克隆不是什么高不可攀的技术,普通显卡就能跑,而且免费。
5.1 什么是声音克隆
声音克隆的本质,是让 AI 学习一个人的声音特征,然后用这个声音说出任何文字。
你给它一段 10 秒的录音,它能学会你的音色、语速、停顿习惯。听起来很科幻,但这个技术在 2024 年就已经成熟了。
5.2 为什么可以本地部署
通常我们会认为,AI 模型的参数非常大,本地普通电脑根本跑不起来。那么 TTS 这种模型也会很大吗?
恰恰相反。声音克隆模型的参数量通常在几亿到十几亿之间,远小于大语言模型(动辄万亿级参数)。这意味着什么?意味着普通显卡就能跑,甚至 CPU 也能勉强运行。
当然专业的 TTS 商业服务也有,比如 ElevenLabs、微软 Azure 的声音克隆 API。但这些都是按字符收费的,一支 10 分钟的视频,可能要花掉几十块。对于经常做视频的人来说,这笔开销不小。
好消息是,开源社区已经有非常成熟的方案。你完全可以本地部署,零成本使用。
5.3 推荐的开源项目
IndexTTS2(B 站开源)
这是目前国内最火的声音克隆项目,B 站语音团队开源。教材资料里的示例视频使用的就是这个 TTS。
它的核心能力:
- 零样本克隆:只需要一段 3-10 秒的参考音频,就能克隆音色
- 情感控制:可以指定"开心地说""平静地说""激动地说",声音会跟着情绪变化
- 时长控制:能精确控制生成音频的时长,适合做视频配音
- 中英混合:中文发音准确,支持拼音输入处理多音字
硬件要求不高,6GB 显存就能跑。如果你用的是 16GB 显存的显卡,生成速度很快,10 秒的音频只需 10 秒生成。
项目地址:https://github.com/index-tts/index-tts
社区已经做好了一键安装包,下载解压就能用,不需要自己配环境。本教材里的示例视频使用的就是这个 TTS。
CosyVoice2(阿里开源)
阿里通义实验室开源的项目,和 IndexTTS2 定位类似。
它的特点:
- 支持多语言(中文、英文、日文、韩文)
- 零样本声音克隆
- 细粒度情感控制
- 流式输出,可以边生成边播放
硬件要求和 IndexTTS2 差不多,8GB 显存推荐配置。
项目地址:https://github.com/FunAudioLLM/CosyVoice
Fish Speech
这是一个比较轻量的方案,适合显存不够的用户。
它的特点:
- 参数量更小,4GB 显存就能跑
- 推理速度快
- 支持多语言
- 音质不错,但情感控制不如前两个
项目地址:https://github.com/fishaudio/fish-speech
5.4 怎么用?
讲到这里,其实这个问题,没有讨论的必要了。同学们应该养成一种万事丢给 Agent 的好习惯。
直接要求你的 Agent 全盘操作这些 TTS(从下载、安装到使用,全部丢给你的 Hermes)。你只管把需求告诉它。
5.5 声音克隆的局限
虽然技术已经成熟,但还是有一些限制:
- 参考音频质量:如果录音有噪音、回声,克隆效果会打折扣
- 极端情感:像大哭、大笑这种极端情感,AI 还做不到特别自然
- 方言支持:普通话没问题,但方言支持有限
- 实时性:生成一段 10 秒的音频可能需要几秒到十几秒,不适合实时对话场景
对于做视频来说,这些限制基本可以忽略。你只需要准备一段清晰的参考音频,就能得到不错的效果。
5.6 ■ 学点英语
| 中文 | English | 音标 | 说明 |
|---|---|---|---|
| 声音克隆 | Voice Cloning | /vɔɪs ˈkloʊnɪŋ/ | 用样本音频生成相似说话声音的技术 |
| 音频样本 | Audio Sample | /ˈɔːdioʊ ˈsæmpəl/ | 用于训练、克隆或识别声音的录音片段 |
| 文本转语音 | Text-to-Speech | /tekst to spiːtʃ/ | 把文字转换成语音音频的技术 |
| 本地部署 | Local Deployment | /ˈloʊkl dɪˈplɔɪmənt/ | 把模型或服务运行在本机环境中 |