💡阅读指南

前面我们在 logamee-auto-video 的流程里提到了 TTS,但只是带过。这一节专门讲声音克隆——什么是声音克隆,为什么可以本地部署,以及有哪些好用的开源方案。重点是想让读者理解:声音克隆不是什么高不可攀的技术,普通显卡就能跑,而且免费。

5.1 什么是声音克隆

声音克隆的本质,是让 AI 学习一个人的声音特征,然后用这个声音说出任何文字。

你给它一段 10 秒的录音,它能学会你的音色、语速、停顿习惯。听起来很科幻,但这个技术在 2024 年就已经成熟了。

5.2 为什么可以本地部署

通常我们会认为,AI 模型的参数非常大,本地普通电脑根本跑不起来。那么 TTS 这种模型也会很大吗?

恰恰相反。声音克隆模型的参数量通常在几亿到十几亿之间,远小于大语言模型(动辄万亿级参数)。这意味着什么?意味着普通显卡就能跑,甚至 CPU 也能勉强运行。

当然专业的 TTS 商业服务也有,比如 ElevenLabs、微软 Azure 的声音克隆 API。但这些都是按字符收费的,一支 10 分钟的视频,可能要花掉几十块。对于经常做视频的人来说,这笔开销不小。

好消息是,开源社区已经有非常成熟的方案。你完全可以本地部署,零成本使用。

5.3 推荐的开源项目

IndexTTS2(B 站开源)

这是目前国内最火的声音克隆项目,B 站语音团队开源。教材资料里的示例视频使用的就是这个 TTS。

它的核心能力:

  • 零样本克隆:只需要一段 3-10 秒的参考音频,就能克隆音色
  • 情感控制:可以指定"开心地说""平静地说""激动地说",声音会跟着情绪变化
  • 时长控制:能精确控制生成音频的时长,适合做视频配音
  • 中英混合:中文发音准确,支持拼音输入处理多音字

硬件要求不高,6GB 显存就能跑。如果你用的是 16GB 显存的显卡,生成速度很快,10 秒的音频只需 10 秒生成。

项目地址:https://github.com/index-tts/index-tts

社区已经做好了一键安装包,下载解压就能用,不需要自己配环境。本教材里的示例视频使用的就是这个 TTS。

CosyVoice2(阿里开源)

阿里通义实验室开源的项目,和 IndexTTS2 定位类似。

它的特点:

  • 支持多语言(中文、英文、日文、韩文)
  • 零样本声音克隆
  • 细粒度情感控制
  • 流式输出,可以边生成边播放

硬件要求和 IndexTTS2 差不多,8GB 显存推荐配置。

项目地址:https://github.com/FunAudioLLM/CosyVoice

Fish Speech

这是一个比较轻量的方案,适合显存不够的用户。

它的特点:

  • 参数量更小,4GB 显存就能跑
  • 推理速度快
  • 支持多语言
  • 音质不错,但情感控制不如前两个

项目地址:https://github.com/fishaudio/fish-speech

5.4 怎么用?

讲到这里,其实这个问题,没有讨论的必要了。同学们应该养成一种万事丢给 Agent 的好习惯。

直接要求你的 Agent 全盘操作这些 TTS(从下载、安装到使用,全部丢给你的 Hermes)。你只管把需求告诉它。

5.5 声音克隆的局限

虽然技术已经成熟,但还是有一些限制:

  • 参考音频质量:如果录音有噪音、回声,克隆效果会打折扣
  • 极端情感:像大哭、大笑这种极端情感,AI 还做不到特别自然
  • 方言支持:普通话没问题,但方言支持有限
  • 实时性:生成一段 10 秒的音频可能需要几秒到十几秒,不适合实时对话场景

对于做视频来说,这些限制基本可以忽略。你只需要准备一段清晰的参考音频,就能得到不错的效果。

5.6 ■ 学点英语

中文 English 音标 说明
声音克隆 Voice Cloning /vɔɪs ˈkloʊnɪŋ/ 用样本音频生成相似说话声音的技术
音频样本 Audio Sample /ˈɔːdioʊ ˈsæmpəl/ 用于训练、克隆或识别声音的录音片段
文本转语音 Text-to-Speech /tekst to spiːtʃ/ 把文字转换成语音音频的技术
本地部署 Local Deployment /ˈloʊkl dɪˈplɔɪmənt/ 把模型或服务运行在本机环境中