💡阅读指南

自动化 PPT 视频并不能简单理解为:把文字丢给 AI,让它随便配几张图、加一段声音、然后产出一段视频。 这当然也算是自动化视频。但效果很差。 我们想做的是:把一篇有结构的文章,丢给 Hermes,让它在真正理解内容的情况下,为我们自动生成 PPT、搭配动画、自动合成语音、校对字幕,最后烧录成视频。

3.1 PPT视频制作的主要成本

首先说明一下,PPT视频和普通视频的区别。PPT 视频通常更接近于传统的 PPT,主要用来讲解知识、商业计划、产品介绍,你就可以把它当做是一个有语音的 PPT。

而普通的视频更接近于 AIGC 产出的视频,里面有人物、有场景、有镜头语言。以现在 AI 的能力,能把 PPT 视频自动化就很不错了。不要奢望能自动化 AIGC 视频。

一篇文章要变成视频,大致会经过这样一条链路:

Text
原稿 → 分页 → 画面(动效) → 口播 → 字幕 → 录制 → 导出

单看每一步,都不算难。但经过这么长的链路,还要保持较高的质量,就是一件很难的事儿。

而我认为视频制作最麻烦的有两件: 1. 文章里改一段文字,通常改完就结束了;视频里改一句话,可能会一路影响声音、字幕、画面和时间。 2. 如何让AI 真的理解内容,而不是堆砌文字。

alt text alt text

上面两张图,就是典型的 AI 没有理解内容,它只是简单地把内容做了分类。然后用比较结构化的方式展示了出来。看起来整齐,但这不是 PPT,这就是 PDF 文档。看这个东西和看文档没区别,它适合自己看,不适合给别人"讲"。

3.2 直接生成视频的问题

Hermes 已经有不少相关能力。它能写 HTML,能调用 TTS,能处理字幕,也能用浏览器录屏。所以,只是让它把文章做成视频,并不困难。

随便准备一篇文章,然后给 Hermes 输入一条指令:

请把这篇文章做成一支知识讲解视频。首先根据内容生成 PPT,并配上语音旁白和字幕,最后导出mp4 视频。

Hermes 会生成页面,也会合成音频,也能导出一个视频文件。但它多半只是“生成”,谈不上“制作”。

生成出来的幻灯片,往往只是把文章切成几页。标题放上去,下面列几条要点。声音按页面念一遍,字幕跟在底部。视频可以播放,但还是这个问题,这是念文章,不是 PPT 视频。

普通生成指令肯定做不出好的 PPT 视频。它不会先证明自己读懂了原稿,也不会先写清楚每一页要让观众明白什么,更不会判断哪些内容该上屏、哪些内容只适合留在声音里。

少了这些中间环节,AI 很容易把视频做成一份自动翻页的文档。

3.3 通用 AI 视频工具的边界

当然市面上也有很多自动化 PPT 视频的 Skill。

但我尝试后发现,效果很一般。当然这未必是 Skill 的问题,还是我之前的观点:每个人都应该有自己的定制Skill。其他人做的一定不好用。如果你下载本章我提供的示例 Skill 后,发现它也不好用,这说明你进步了,理解了我说这句话的意思。

大多数的自动化 PPT 视频的 Skill 都是基于前面我们谈到的最简单的流程:

Text
输入文字 → 自动分镜 → 匹配素材 → 合成视频

然后在这些流程中,嵌入了一些主题、风格、布局、字幕等小细节。但没有解决那个根本问题:AI 依然是在堆砌文字,而不是根据文字设计画面。

这样的 Skill 适合新闻摘要、社交媒体短片。画面和文案大致相关,节奏够快,观感不差,就能覆盖很多场景。

而知识类视频不一样。知识类视频里的画面不是装饰,它本身就承担解释工作。

讲因果关系,画面要让观众看见原因怎样推到结果。讲对比,画面要让差异落在同一套坐标里。讲层级,底层和上层的位置关系要稳定下来。

所以本章后面要做的,不是再写一个“输入文字、自动生成视频”的通用工具。

真正的问题是:怎么让 Hermes 先读懂内容,再根据内容去设计画面。这个问题如果不解决,后面再加主题、字幕、语音、动画,效果也只是在一份文档外面包了一层视频壳。

下一节,我们就看这个 Skill 到底怎么设计。

3.4 ■ 学点英语

中文 English 音标 说明
视频自动化 Video Automation /ˈvɪdioʊ ˌɔːtəˈmeɪʃən/ 把脚本、画面和导出流程交给程序完成
时间轴 Timeline /ˈtaɪmlaɪn/ 按时间排列画面、声音和动画的结构
生产流水线 Production Pipeline /prəˈdʌkʃən ˈpaɪplaɪn/ 把素材、处理和导出串起来的生产流程
批量生成 Batch Generation /bætʃ ˌdʒenəˈreɪʃən/ 一次性生成多份内容或多个版本