视频怎么加 AI 配音
三种方法给视频加配音:现场录音、上传音频、AI 文字转语音,附脚本、麦克风、对齐与压音技巧。

给视频加配音,实际上有三条路:一边播画面一边现场录音、上传你在别处录好的旁白、或者用一段脚本生成 AI 文字转语音。本文把这三种方法在浏览器里全部讲一遍——无需安装——而且不停在"点一下麦克风按钮"这种大多数工具页说到就打住的层面。真正让配音听起来专业的,是那些手艺活儿:写一段会呼吸的脚本、把麦克风摆到不爆音、让旁白对准剪辑点、再把背景音乐压下去让每个字都清清楚楚。如果你要发到 YouTube、TikTok、Shorts 或 Reels,正是这些手艺,把听起来像"AI 糊弄"的配音,和让观众愿意留下来听的配音区分开来。
核心要点
- 先判断音频任务:提取、清理、分轨、配音和响度统一是不同问题。
- 用能解决问题的最低破坏流程,并在批量前先测一条难素材。
- 去掉音乐或提取音频不等于获得他人画面的使用权。
- 整理好源音频,方便文字稿、字幕、配音和导出都可追溯。
给视频加配音的三种方法
在动手之前,先决定这三种方法里哪一种适合你的视频。它们在时间、可控性、以及你自己声音的参与度上各有取舍。

| 方法 | 适合 | 需要什么 | 主要取舍 |
|---|---|---|---|
| 对着画面现场录 | 反应类、解说类、靠个人风格的频道 | 一支麦克风和安静的房间 | 重录很花时间 |
| 上传录好的音频 | 播客主、手里有录音棚音质的人 | 一段成品 MP3/WAV/M4A | 录和剪要分两步 |
| AI 文字转语音 | 无脸解说、影视解说、教程、多语言 | 一份精炼的脚本 | 不调就很机械 |
大多数创作者都是混着用——无脸解说用 AI 声、个人开场现场录一条。下面的流程对三种都适用,因为剪辑、对齐和混音都发生在音频已经存在之后。
方法一:对着画面现场录配音
一边看素材一边录,是拿到"能对着画面反应"的旁白的最快方式。反应类、解说类、以及任何以你声音为卖点的频道,默认都用这种。

分步操作:
- 打开工程,把播放头拖到旁白该开始的地方。
- 先设好麦克风电平(见下方设置框)——录 10 秒试听,确认没有爆表。
- 播放素材,跟着画面把台词说出来。看着画面能让你的语速保持诚实。
- 说错一句就继续往下,把时间点记下来——重录一小段比整条重来快得多。
- 剪掉开头结尾的空白,再把音频片段轻推一下,让开头那个字落在你正在描述的那一帧上。
能修好八成烂音的麦克风设置:
- 麦克风离嘴 15–25 厘米,略微偏轴,让爆破音("p" 和 "b")不至于砰砰响。
- 在你能找到的最小、软装最多的房间里录——塞满衣服的衣柜好过空旷回声大的办公室。
- 把输入电平调到正常说话峰值在 −12 到 −6 dB 之间,绝不碰到 0。
- 关掉风扇、空调和通知。房间底噪事后几乎不可能干净地去掉。
如果现场录出来还是有嘶声、嗡声或底噪忽高忽低,混音前先过一遍降噪——我们那篇如何给视频清理音频讲了处理顺序,免得你处理过头把声音搞得像泡在水里。
方法二:上传录好的配音
如果你已经在别处录过旁白——播客、手机备忘录、专门的 USB 麦克风录制——直接把成品音频拿进工程就行。这样录和剪是干净的两步,比对着粗剪现场说更好控制。
- 把旁白导出成 MP3、WAV 或 M4A。
- 把视频和音频文件上传到同一个浏览器工程里。Recapo 支持 MP4、MOV 和其他常见格式,单个任务最大 6GB,所以长录音和 4K 素材都放得下。
- 把语音轨放到视频下方它自己的一层上。
- 在自然的断句处把旁白切开,方便你把每一段滑动到对准画面——完整对齐步骤在下一节。
- 位置锁定后,从语音轨生成字幕,静音也能读到内容。
最后这步比听起来重要——信息流里有相当一部分播放是静音状态,屏幕文字是保住信息不丢的关键。用自动字幕转写配音、烧录出干净且同步的字幕;如果你刚接触字幕,如何给视频加字幕讲了样式和时间轴。
方法三:生成 AI 文字转语音配音
AI 文字转语音是无脸频道、影视解说和教程的主力——这些场景你没法或不想自己录。你粘贴脚本、选一个声音,就能得到一条干净的旁白轨——不用麦克风、不用重录、没有房间噪音。代价是原始 TTS 不调就很机械,而这恰好是下一节要解决的。
基本流程:
- 把脚本写进或粘贴到配音生成器。句子短一点——TTS 照标点直读,长句一口气念完会喘不过气。
- 选一个符合你频道调性的声音。定下来之前,用同一段话试听两三个;同一份脚本,换个声音可能温暖、也可能冷冰冰。
- 生成整条,从头听到尾,抓出任何念错的字。
- 在脚本层面改掉念错的词(见下文),只重新生成那一句,再放进时间轴。
- 用同一份脚本生成字幕,让文字和音频步调一致。
如果你是围绕脚本来做的——把文章、解说稿或摘要变成有旁白的视频——走文字转语音视频这条路能让脚本和声音待在一起,Recapo 还能在你生成声音之前,从源视频里帮你起草摘要和脚本。想搭一套完整的无脸流程,如何做无脸视频展示了配音、字幕和画面怎么拼成一个能发布的频道格式。
让 AI 配音像人的三个参数
这是工具页会跳过的部分。拿到自然的 AI 配音,归根结底是控制三样东西:语速、停顿、发音。把这三样调好,九成的"机器人嗓"问题就消失了。
1. 语速(说话速率)。 默认 TTS 念旁白往往偏快。解说和教程需要观众消化信息,就调慢一格;高能量的影视解说可以保持轻快。先自己掐着表把脚本读一遍——如果你自己都没法在那个速度下舒服地念完,AI 也不该。
2. 停顿(断句)。 TTS 靠标点停顿,所以标点就是你的节奏工具。想要一个真正的停顿时用句号,别用逗号。把一个长句拆成两个短句就多一次换气。单独一个换行或省略号,能在包袱或转场前买到一个更长的停顿。
3. 发音(多音/歧义词)。 中文和英文都有一堆会被 AI 猜错的字:中文里的"重"(chóng/zhòng)、"行"(xíng/háng)、"长"(cháng/zhǎng)、"当"(dāng/dàng)、数字和品牌名也会翻车。两个办法:
| 问题词类型 | 例子 | 解法 |
|---|---|---|
| 多音字 | "重"(重复 / 重量) | 换个说法,或改成不歧义的词 |
| 缩写/字母 | "SQL"、"GIF" | 按你想要的读法写出来 |
| 数字/日期 | "1990 年代"、"150 万" | 写成"一九九零年代""一百五十万" |
| 品牌名 | 任何不常见的拼写 | 按发音拼出来并试听 |
只重新生成改过的那一句,别整条重来——更快,也能保住其余部分的节奏不变。
怎么让旁白对准剪辑点
无论你用哪种方法,对齐都是让旁白显得"有意为之"而非"贴上去的"关键。目标是:观众听到某个词时,正好看到那个词描述的东西。

- 锚定开场句。 把语音片段滑到让开场那个字落在开场镜头上,不是落在它前面。
- 照字幕来剪。 如果你生成了字幕,把它们当视觉标记——每一块字幕都精确显示一句话从哪开始,你就能把素材剪到踩上这些点。
- 对短语,别对秒数。 当你说"然后它就坏了",切到坏掉那东西的画面应该落在"坏了"上。移动画面,别移音频,来对齐它们。
- 转场处留一拍静音。 新段落前空四分之一秒,听感上就像一个自然的分段。
- 闭着眼睛全速看一遍,再静音看一遍。 如果两种方式都成立——只听声音、只看画面——你的对齐就稳了。
短视频尤其如此——节奏没有漂移的余地。如果你顺手要把横屏素材改成竖屏,竖屏改尺寸这一步放在对齐之后做,免得旁白的时间轴又跟着移位。
压音乐、调电平,让每个字都清楚
配音跟满音量的音乐抢,是旁白听起来发糊最常见的原因。"压音(ducking)"就是在人声说话时自动把音乐调低,说话的空隙里再抬回来。
要瞄准的电平目标:
- 人声在最上面,是最响的元素——把它当作你的基准。
- 背景音乐:旁白播放时压到人声下方大约 15–20 dB。它应该被感觉到,而不是被听到。
- 在句子之间的静音空隙里,让音乐抬回来,别让它像突然消失了。
- 音效:短促有力,绝不在说话下面持续拖着。
一个简单的混音顺序:
- 先单独把人声电平调对。
- 加音乐,往下压到你能听清旁白每一个辅音为止。
- 最后用手机扬声器听一遍,别用耳机——你的观众大多在用手机,发糊的中频在那儿暴露得最明显。
如果你选的音乐带人声、或某一段老是跟旁白打架,往往直接抽掉更省事——见如何去掉视频里的音乐,再换一段更干净的器乐垫底重新搭。
按使用场景配音
同样的工具服务于差别很大的格式。以下是最常见三类的做法。
- 解说和影视解说视频。 脚本优先。先把整段旁白写好,生成 AI 声音,再把画面剪来对——你是拿画面去对声音,而不是反过来。从源视频起草的摘要和脚本,给你一份可以删改的初稿,而不是一张白纸。
- 口播和个人配音。 现场录,让你的个人风格传出去,然后清理音频、加字幕。别把声音处理得太过、弄成假的。
- 教程和 how-to。 语速就是一切——观众会暂停、会回放,所以略慢、断句清楚的 AI 声,胜过又快又高能的读法。把每一步的旁白都对准屏幕上的确切动作。
无论哪种格式,都把配音、字幕和改尺寸当作一遍来做,让时间轴在导出前就锁在一起。
常见问题
怎么免费在线给视频加配音? 用浏览器版编辑器,什么都不用装。上传视频,然后要么当场录旁白、要么放进一段录好的文件、要么用脚本生成 AI 声音——都在同一个工程里。Recapo 的价格详情在定价页上;流程本身完全在你的浏览器里跑。
我能直接对着视频录配音吗? 可以。拖到起始点,设好麦克风电平,播放素材,跟着画面把台词说出来。边说边看画面,能让你的语速对上剪辑点。之后剪掉开头结尾,让开头那个字落在正确的镜头上。
我的 AI 配音为什么听起来很机械? 几乎总是三件事之一:念得太快、忽略了你要的停顿、或把某个歧义词念错了。语速调慢一格,想要真正停顿的地方用句号而非逗号,在脚本层面修好多音字、缩写和数字,然后只重新生成那一句。
怎么不让音乐盖住旁白? 压音乐——旁白播放时把它压到人声下方大约 15–20 dB,空隙里再抬回来。先把人声电平定好,再把音乐抬到刚好还能听清每一个辅音。器乐比带人声的曲子压得干净得多。
已经有配音了,还需要加字幕吗? 需要。信息流里有相当一部分播放是静音的,字幕能给静音观众保住信息,也给所有人加深印象。用同一份脚本或语音轨生成字幕,让文字和音频完全同步。
开始给你的视频加配音
无论你是现场录、上传成品、还是用脚本生成 AI 声,整个过程都在你的浏览器里跑——旁白、字幕、对齐和导出在一处,单个任务最大 6GB。挑一个适合你视频的方法,调好语速、停顿和发音,压下音乐,发出去。免费注册 Recapo 账号,今天就给你的下一个视频加上配音。

