Recapo
Recap & Faceless

Hoe voeg je een AI-voiceover toe aan elke video

Leer hoe je een voice-over aan een video toevoegt op drie manieren — live opnemen, audio uploaden of AI tekst-naar-spraak gebruiken — plus scripting, microfoonopstelling, synchronisatie en ducking.

Hoe voeg je een AI-voiceover toe aan elke video

Om een voice-over aan een video toe te voegen heb je drie praktische routes: je stem live opnemen terwijl het beeldmateriaal wordt afgespeeld, een vertelling uploaden die je elders hebt opgenomen, of een AI-tekst-naar-spraak track genereren op basis van een geschreven script. Deze gids behandelt alle drie in een browser — geen installatie nodig — en gaat verder dan de instructies "klik op de microfoonknop" waar de meeste toolpagina's stoppen. Wat een voice-over echt professioneel laat klinken, is het vakmanschap: een script schrijven dat ademt, een microfoon zo instellen dat die niet clipt, de voice-over synchroniseren met je cuts en muziek vermijden zodat elk woord duidelijk blijft. Als je publiceert op YouTube, TikTok, Shorts of Reels, onderscheidt dat een voice-over die als "AI-slop" klinkt van de vraag waar kijkers voor blijven.

Belangrijkste Punten

  1. Diagnoseer eerst de audioklus: extractie, schoonmaken, stem-scheiding, voice-over en luidheid zijn verschillende taken.
  2. Gebruik het minst destructieve proces dat het probleem oplost, en test één harde clip voordat je batcht.
  3. Het verwijderen van muziek of het extraheren van audio maakt geen rechten op andermans beelden vrij.
  4. Houd bronaudio georganiseerd zodat transcripties, onderschriften, voice-overs en exporten traceerbaar blijven.

De drie manieren om een voice-over aan een video toe te voegen

Voordat je op een knop drukt, bepaal welke van de drie methoden bij je video past. Ze wisselen verschillend af qua tijd, controle en hoeveel je eigen stem erbij betrokken is.

Methode Het beste voor Wat je nodig hebt Belangrijkste afweging

Neem live opnames over beeldenReacties, commentaar, persoonlijkheidsgedreven kanalenEen microfoon en een stille kamerHerkansingen kosten echt tijd
Upload een vooraf opgenomen bestandPodcasthosts, iedereen met studio-audioEen voltooide MP3/WAV/M4AJe bewerkt twee dingen apart
AI tekst-naar-spraakGezichtsloze uitleg, samenvattingen, tutorials, meertalige uitlegEen strak scriptKlinkt robotachtig als je hem niet afstemt

De meeste makers mixen methodes — een AI-stem voor een gezichtsloze samenvatting, een live take voor een persoonlijke intro. De onderstaande workflow geldt voor alle drie, omdat bewerken, synchroniseren en mixen allemaal plaatsvinden nadat de audio is bestaan.

Methode 1: Neem een live voice-over op over je video

Opnemen terwijl je de beelden bekijkt is de snelste manier om een voice-over te krijgen die reageert op wat er op het scherm is. Het is de standaard voor commentaar, reacties en elk kanaal waar jouw stem het product is.

Stap voor stap:

  1. Open je project en scrub naar waar de vertelling zou moeten beginnen.
  2. Stel eerst je microfoonniveau in (zie het setup-vakje hieronder) — doe een test van 10 seconden en controleer of je niet piekt.
  3. Speel de beelden af en spreek je tekst terwijl de video rolt. Het kijken van de film houdt je tempo eerlijk.
  4. Als je een regel mist, ga dan door en markeer de tijdstempel — het is sneller om één fragment opnieuw op te nemen dan de hele take opnieuw te beginnen.
  5. Knip de stilte bij kop en staart bij, en duw dan de audioclip zodat je eerste woord op het shot valt dat je beschrijft.

Microfoonopstelling die 80% van het slechte geluid oplost:

  1. Zet de microfoon 15–25 centimeter van je mond, iets uit de as zodat plosiven ("p" en "b" geluiden) niet bonken.
  2. Neem op in de kleinste zacht gemeubileerde kamer die je hebt — een kast met kleren is beter dan een groot echoënd kantoor.
  3. Richt je inputniveau zo dat normale spraak piekt rond −12 tot −6 dB, zonder 0 te raken.
  4. Zet ventilatoren, airco en meldingen uit. Kamergezoem is bijna onmogelijk om achteraf schoon te verwijderen.

Als je live take nog steeds sis, gezoem of een inconsistente vloer heeft, doe het dan eerst door een cleanup-pass voordat je mixt — onze gids over hoe je audio schoonmaakt voor een video) behandelt de volgorde van bewerkingen zodat je niet overbewerkt en je stem niet onder water laat klinken.

Methode 2: Upload een vooraf opgenomen voice-over

Als je al ergens hebt verteld — een podcast, een telefoonmemo, een speciale USB-microfoonsessie — neem je gewoon de uiteindelijke audio mee in je project. Dit houdt opnemen en bewerken als twee schone stappen, wat makkelijker te controleren is dan live praten over een ruwe montage.

  1. Exporteer je vertelling als MP3, WAV of M4A.
  2. Upload de video en het audiobestand naar hetzelfde browserproject. Recapo accepteert MP4, MOV en andere gangbare formaten, met tot 6GB per taak, dus lange opnamesessies en 4K-beelden passen allebei.
  3. Zet de voicetrack op een eigen laag onder de video.
  4. Splits de vertelling op natuurlijke zinsonderbrekingen zodat je elk stuk kunt schuiven om bij het beeld te passen — volledige synchronisatiestappen staan in het volgende deel.
  5. Zodra de plaatsing is vergrendeld, genereer je ondertitels van de voicetrack zodat de woorden leesbaar zijn met geluid uit.

Die laatste stap is belangrijker dan het klinkt — een groot deel van de feedweergaven vindt gedempt plaats, dus tekst op het scherm is hoe je de boodschap intact houdt. Gebruik auto-captions om de voice-over te transcriberen en schone, gesynchroniseerde ondertitels in te branden; als ondertitels nieuw voor je zijn, hoe voeg je ondertitels toe aan een video loopt door stijl en timing.

Methode 3: Genereer een AI-tekst-naar-spraak voice-over

AI tekst-naar-spraak is het werkpaard voor gezichtsloze kanalen, samenvattingen en tutorials waar je niet kunt of wilt opnemen. Je plakt een script, kiest een stem en krijgt een schone verteltrack — geen microfoon, geen heropnames, geen geluid in de kamer. Rauw TTS klinkt robotachtig tenzij je het afstemt, wat precies is wat het volgende deel behandelt.

De basisstroom:

  1. Schrijf of plak je script in de voiceover maker. Houd zinnen kort — TTS leest interpunctie letterlijk, en lange run-ons komen er ademloos uit.
  2. Kies een stem die past bij de toon van je kanaal. Doe twee of drie audities op dezelfde alinea voordat je je committeert; Hetzelfde script kan warm of klinisch aanvoelen, afhankelijk van de stem.
  3. Genereer het nummer en luister van begin tot eind naar elk woord dat verkeerd valt.
  4. Herstel de verkeerde woorden op het scriptniveau (zie hieronder), regenereer alleen die regel opnieuw en zet die in je tijdlijn.
  5. Voeg ondertitels toe van hetzelfde script zodat tekst en audio in lijn blijven.

Als je rond een script bouwt — een artikel, een samenvatting of een samenvatting omzet in een ingesproken video — laat de tekst-naar-spraak video) route script en stem samenwerken, en Recapo kan ook helpen bij het opstellen van samenvattingen en scripts van een bronvideo voordat je ooit een stem genereert. Voor een volledige faceless setup laat hoe maak je gezichtsloze video's zien hoe voice-over, ondertiteling en visuals samenkomen in een publiceerbaar kanaalformaat.

De drie parameters die AI-stem menselijk laten klinken

Dit is de landingspagina's van het onderdeel tool. Een natuurlijke AI-voice-over krijgen komt neer op het beheersen van drie dingen: tempo, pauzes en uitspraak. Los deze op en 90% van het "robotstem"-probleem verdwijnt.

1. Tempo (spreeksnelheid). Standaard TTS leest vaak iets snel voor de vertelling. Vertraag het een tandje voor uitlegers en tutorials waarbij kijkers informatie moeten absorberen; Houd het sneller voor energieke samenvattingen. Lees eerst je eigen script hardop met een timer — als je het niet comfortabel kunt zeggen op die snelheid, zou de AI dat ook niet moeten doen.

2. Pauzes (zinsonderbrekingen). TTS pauzeert bij interpunctie, dus interpunctie is jouw timingtool. Gebruik punten, geen komma's, waar je een echte beat wilt. Breek één lange zin op in twee korte zinnen om een ademhaling toe te voegen. Een speciale regelafbreking of een ellips zorgt voor een langere pauze voor een punchline of een scènewissel.

3. Uitspraak (dubbelzinnige woorden). Engels zit vol homografen die de AI verkeerd kan raden — "read," "lead," "live," "bass," "record," "present," "tear," "wind." Merknamen, acroniemen en cijfers zijn ook een probleem. Twee oplossingen:

Probleemwoordtype Voorbeeld Fix

Homograaf"lezen" (verleden vs heden)Herformuleer de zin, of spel het fonetisch ("rood")
Acroniem"SQL", "GIF"Schrijf het zoals je wilt, het staat erop: "vervolg", "jif"
Nummer/datum"Jaren 90", "$1,5 miljoen"Schrijf "negentien negentig", "één komma vijf miljoen"
MerknaamOngebruikelijke spellingSpel het fonetisch uit en doe auditie

Regenereer alleen de gecorrigeerde lijn in plaats van het hele circuit — dat is sneller en houdt de rest van je timing intact.

Hoe synchroniseer je de vertelling met je cuts

Welke methode je ook hebt gebruikt, synchronisatie zorgt ervoor dat de vertelling doelbewust aanvoelt in plaats van erop geplakt. Het doel: de kijker hoort het woord precies op het moment dat hij het ding ziet dat het beschrijft.

  1. Anker de eerste regel. Schuif de spraakclip zodat het openingswoord op je openingsshot valt, niet ervoor.
  2. Knip het bijschrift. Als je bijschriften hebt gegenereerd, gebruik ze dan als visuele markeringen — elk ondertitelblok laat precies zien waar een zin begint, zodat je beelden kunt bijsnijden om die beats te bereiken.
  3. Match cuts naar zinnen, niet seconden. Als je zegt "and then it breaks," zou de overgang naar het gebroken ding op "breaks" moeten landen. Verplaats het beeld, niet het geluid, om ze op één lijn te zetten.
  4. Laat een stilte achter bij de scènewisselingen. Een kwart seconde voordat een nieuw gedeelte voor het oor als een alinea wordt doorgebroken.
  5. Bekijk het één keer op volle snelheid met gesloten ogen, en dan één keer op demp. Als het beide kanten op werkt — alleen audio en alleen visueel — is je synchronisatie goed.

Vooral voor korte vormen is strakke synchronisatie niet onderhandelbaar — er is geen ruimte om te driften. Als je horizontale beelden herkadert voor een verticale feed, doe dan de verticale resize na het synchroniseren zodat je vertellingtiming niet verschuift.

Muziek ontwijken en niveaus mixen zodat elk woord duidelijk is

Een voice-over die concurreert met volwaardige muziek is de meest voorkomende reden waarom de voice-over onduidelijk wordt. "Ducken" betekent automatisch de muziek verlagen telkens wanneer de stem spreekt, en deze dan weer omhoog brengen in de gaten.

Doelniveaus om op te richten:

  1. Stem staat bovenaan als het luidste element — behandel het als je referentie.
  2. Achtergrondmuziek: laat het ongeveer 15–20 dB onder de stem vallen terwijl de vertelling speelt. Het moet gevoeld worden, niet gehoord.
  3. In de stille gaten tussen de regels laat muziek weer opstijgen zodat het niet voelt alsof het eruit is gevallen.
  4. Geluidseffecten: kort en krachtig, nooit aanhoudend onder spraak.

Een eenvoudige mengvolgorde:

  1. Zorg eerst dat het stemniveau klopt, op zichzelf.
  2. Voeg muziek toe en trek die naar beneden totdat je elke medeklinker van de vertelling kunt horen.
  3. Doe een laatste luister via telefoonspeakers, niet via koptelefoons — het grootste deel van je publiek zit op een telefoon, waar een modderig middentoneel het slechtst opvalt.

Als de muziek die je hebt gekozen zang heeft of een gedeelte dat je vertelling steeds tegenhoudt, is het vaak makkelijker om het te verwijderen — zie hoe je muziek uit video verwijdert en opnieuw opbouwt met een schoner instrumentaal bed.

Voice-over per gebruiksgeval

Dezelfde tools dienen heel verschillende formaten. Hier lees je hoe je de drie meest voorkomende kunt benaderen.

  1. Uitleg en samenvattingsvideo's. Eerst het script. Schrijf de hele vertelling, genereer een AI-stem, en knip dan beelden om erbij te komen — je bewerkt beeld naar stem, niet andersom. Een samenvatting of script opgesteld van een bronvideo geeft je een concept om in te knippen in plaats van een blanco pagina.
  2. Praatkop en persoonlijke voice-over. Neem live op zodat je persoonlijkheid doorkomt, maak dan de audio schoon en voeg ondertitels toe. Verwerk de stem niet te veel tot iets kunstmatigs.
  3. Tutorials en how-to. Tempo is alles — kijkers pauzeren en spoelen terug, dus een iets tragere AI-stem met duidelijke pauzes overtreft een snelle, energieke leeservaring. Synchroniseer elke stap met de exacte actie op het scherm.

Welk formaat je ook gebruikt, bouw de voice-over, onderschriften en herkaderen in één keer zodat de timing in elkaar valt voordat je exporteert.

FAQ

Hoe voeg ik gratis een voice-over toe aan een video online? Gebruik een browsergebaseerde editor zodat er niets te installeren valt. Upload je video, neem dan ter plekke de voice-over op, plaats een vooraf opgenomen bestand, of genereer een AI-stem op basis van een script — allemaal in hetzelfde project. Prijsinformatie voor Recapo staat op de prijspagina; De workflow zelf draait volledig in je browser.

Kan ik een voice-over direct over mijn video opnemen? Ja. Scrub naar je startpunt, stel je microfoonniveau in, speel het beeldmateriaal af en spreek je teksten terwijl het rolt. Terwijl je naar de foto kijkt terwijl je praat, blijft je tempo afgestemd op de knipsels. Trim daarna het hoofd en de staart zodat het eerste woord op de juiste foto valt.

Waarom klinkt mijn AI-voice-over robotachtig? Bijna altijd één van drie dingen: het is te snel lezen, het negeren van de pauzes die je nodig hebt, of het is het verkeerd uitspreken van een dubbelzinnig woord. Vertraag het tempo een stapje, gebruik punten in plaats van komma's waar je een echte beat wilt, en zet homografen, acroniemen en getallen vast op het scriptniveau, en genereer dan alleen die regel opnieuw.

Hoe voorkom ik dat muziek de vertelling overstemt? Duck de muziek — verlaag hem ongeveer 15–20 dB onder de stem wanneer de vertelling speelt, en laat hem weer stijgen in de openingen. Stel eerst het stemniveau in, zet dan de muziek alleen hoger totdat je nog steeds elke medeklinker kunt horen. Instrumentale tracks duiken veel zuiverder dan die met zang.

Moet ik ondertitels toevoegen als ik al een voice-over heb? Ja. Een groot deel van de feedweergaven vindt gedempt plaats, dus bijschriften houden je bericht intact voor stille kijkers en versterken het voor iedereen anders. Genereer ze vanuit hetzelfde script of stemtrack zodat tekst en audio perfect synchroon blijven.

Begin met het toevoegen van je voice-over

Of je nu live opneemt, een voltooide opname uploadt of een AI-stem genereert vanuit een script, het hele proces draait in je browser — vertelling, ondertiteling, synchronisatie en export op één plek, op bestanden tot 6GB. Kies de methode die bij je video past, stel het tempo, pauzes en uitspraak af, duik de muziek en zet hem af. Maak je gratis Recapo-account aan, en voeg vandaag nog een voice-over toe aan je volgende video.

Referenties en officiële bronnen

  1. FFmpeg-documentatie
  2. YouTube Help: Copyright op YouTube
  3. YouTube aanbevolen upload-coderingsinstellingen


Aanbevolen artikelen

Alles bekijken