Sådan tilføjer du en AI-voiceover til enhver video
Lær at tilføje en voiceover til en video på tre måder — optag live, upload lyd eller brug AI tekst-til-tale — plus scripting, mikrofonopsætning, synkronisering og ducking.

For at tilføje en voiceover til en video har du tre praktiske metoder: optag din stemme live, mens optagelserne afspilles, upload en fortælling du har optaget et andet sted, eller generer et AI-tekst-til-tale-spor ud fra et skrevet manuskript. Denne guide dækker alle tre i en browser — ingen installation nødvendig — og går ud over de "klik på mikrofonknappen"-instruktioner, som de fleste værktøjssider stopper ved. Det, der faktisk får en voiceover til at lyde professionel, er håndværket: at skrive et manuskript, der ånder, sætte en mikrofon, så den ikke klipper, synkronisere fortællingen til dine klip og undvige musikken, så hvert ord forbliver klart. Hvis du skriver på YouTube, TikTok, Shorts eller Reels, adskiller det en voiceover, der læses som "AI-slurk", fra en seer, der bliver for.
Vigtige pointer
- Diagnosticer lydopgaven først: udtrækkelse, oprydning, stammeadskillelse, voiceover og lydstyrke er forskellige opgaver.
- Brug den mindst destruktive proces, der løser problemet, og test et hårdt klip før batching.
- At fjerne musik eller udtrække lyd frigiver ikke rettigheder til andres optagelser.
- Hold kildelyd organiseret, så transskriptioner, billedtekster, voiceovers og eksport forbliver sporbare.
De tre måder at tilføje en voiceover til en video på
Før du trykker på en knap, skal du beslutte, hvilken af de tre metoder der passer til din video. De skiftes forskelligt om tid, kontrol og hvor meget din egen stemme er involveret.
| Metode Bedst til Hvad du har brug for Hovedafvejning |
| Optag live over optagelser | Reaktioner, kommentarer, personlighedsdrevne kanaler | En mikrofon og et stille rum | Omprøvninger koster reel tid |
| Upload en forudindspillet fil | Podcastværter, alle med studielyd | En færdig MP3/WAV/M4A | Du redigerer to ting separat |
| AI tekst-til-tale | Ansigtsløse forklaringer, opsummeringer, tutorials, flersproget | Et stramt manuskript | Det lyder robotagtigt, hvis du ikke tuner den |
De fleste skabere blander metoder — en AI-stemme til en ansigtsløs opsummering, en liveoptagelse til en personlig introduktion. Arbejdsgangen nedenfor gælder for alle tre, fordi redigering, synkronisering og mix alle sker efter lydens tilstedeværelse.
Metode 1: Optag en live voiceover over din video
At optage, mens du ser optagelserne, er den hurtigste måde at få en fortælling, der reagerer på det, der vises på skærmen. Det er standarden for kommentarer, reaktioner og enhver kanal, hvor din stemme er produktet.
Trin for trin:
- Åbn dit projekt og skrub hen til, hvor fortællingen skal starte.
- Indstil dit mikrofonniveau først (se setup-boksen nedenfor) — lav en 10-sekunders test og tjek, at du ikke topper.
- Afspil optagelserne og sig dine replikker, mens videoen ruller. At se filmen holder dit tempo ærligt.
- Hvis du fumler en replik, så fortsæt og marker tidsstemplet — det er hurtigere at genindspille et klip end at genstarte hele optagelsen.
- Klip dødluften ved hoved og hale, og skub så lydklippet, så dit første ord rammer det billede, du beskriver.
Mikrofonopsætning, der retter 80% af dårlig lyd:
- Få mikrofonen 6–10 tommer fra munden, lidt uden for aksen, så plosiver ("p" og "b"-lyde) ikke dunker.
- Optag i det mindste blødt møblerede rum, du har — et klædeskab med tøj slår et stort ekkoagtigt kontor.
- Sigt dit inputniveau, så normal tale topper omkring −12 til −6 dB, uden nogensinde at røre 0.
- Sluk for blæsere, aircondition og notifikationer. Rumbrummen er næsten umulig at fjerne rent bagefter.
Hvis dit live-take stadig har sus, brummen eller en inkonsekvent gulv, så kør det igennem en cleanup-gennemgang, før du mixer — vores guide til hvordan man renser lyd til en video] dækker rækkefølgen af operationer, så du ikke overbehandler og får din stemme til at lyde under vand.
Metode 2: Upload en forudindspillet voiceover
Hvis du allerede har fortalt et sted — en podcast, en telefonnota, en dedikeret USB-mikrofonsession — tager du bare den færdige lyd med ind i dit projekt. Dette holder optagelse og redigering som to rene trin, hvilket er nemmere at styre end at tale live over et råklip.
- Eksporter din fortælling som MP3, WAV eller M4A.
- Upload videoen og lydfilen til det samme browserprojekt. Recapo accepterer MP4, MOV og andre almindelige formater med op til 6GB pr. opgave, så lange optagesessioner og 4K-optagelser passer begge ind.
- Læg stemmesporet på sit eget lag under videoen.
- Del fortællingen op i naturlige sætningsskift, så du kan skubbe hvert stykke til billedet — fulde synkroniseringstrin findes i næste afsnit.
- Når placeringen er låst, generer du undertekster fra stemmesporet, så ordene kan læses med lyd slået fra.
Det sidste trin betyder mere, end det lyder — en stor del af feedvisningerne sker med lydløshed, så tekst på skærmen er måden, du holder beskeden intakt på. Brug auto-captions til at transskribere voiceoveren og brænde rene, synkroniserede undertekster ind; hvis undertekster er nye for dig, hvordan tilføjer du undertekster til en video gennemgår styling og timing.
Metode 3: Generer en AI tekst-til-tale voiceover
AI tekst-til-tale er arbejdshesten for ansigtsløse kanaler, opsummeringer og tutorials, hvor du ikke kan eller vil optage. Du indsætter et manuskript, vælger en stemme og får et rent fortællespor — ingen mikrofon, ingen genoptagelser, ingen rumstøj. Rå TTS lyder robotagtigt, medmindre du tuner det, hvilket er præcis, hvad næste afsnit dækker.
Den grundlæggende flow:
- Skriv eller indsæt dit script i voiceover maker. Hold sætninger korte — TTS læser tegnsætning bogstaveligt, og lange run-ons kommer ud åndeløse.
- Vælg en stemme, der matcher din kanals tone. Audition to eller tre på samme afsnit, før du forpligter dig; Det samme manuskript kan føles varmt eller klinisk afhængigt af stemmen.
- Generer nummeret og lyt fra ende til anden efter et ord, der rammer forkert.
- Ret de forkerte ord på manuskriptniveau (se nedenfor), regenerer kun den linje, og læg den ind i din tidslinje.
- Tilføj undertekster fra samme skrift, så tekst og lyd forbliver i takt.
Hvis du bygger op omkring et manuskript — ved at omdanne en artikel, et resumé eller et resumé til en fortællet video — lader tekst-til-tale-video](/da/tools/text-to-speech-video/)-ruten manuskript og stemme leve sammen, og Recapo kan også hjælpe med at udarbejde resuméer og manuskripter fra en kildevideo, før du overhovedet genererer en stemme. For et fuldt faceless setup viser how to make faceless videosz, hvordan voiceover, billedtekster og visuelle elementer samles i et publicerbart kanalformat.
De tre parametre, der får AI-stemmer til at lyde menneskelig
Dette er delværktøjets landingssider, spring over. At få en naturlig AI-voiceover handler om at styre tre ting: tempo, pauser og udtale. Løser du disse, forsvinder 90% af problemet med "robotstemmen".
1. Tempo (talehastighed). Standard TTS læses ofte en smule hurtigt til oplæsning. Sænk tempoet et hak for forklaringer og tutorials, hvor seerne skal absorbere information; Hold det hurtigere for energiske opsummeringer. Læs dit eget script højt med en timer først — hvis du ikke kan sige det komfortabelt i den hastighed, bør AI'en heller ikke gøre det.
2. Pauser (sætningsskift). TTS pauser på tegnsætning, så tegnsætning er dit timingværktøj. Brug punktum, ikke kommaer, hvor du vil have et rigtigt beat. Del en lang sætning op i to korte for at give et åndedrag. Et dedikeret linjeskift eller en ellipse giver en længere pause før en punchline eller sceneskift.
3. Udtale (tvetydige ord). Engelsk er fuld af homografer, som AI'en kan gætte forkert — "read," "lead," "live," "bas," "record," "present," "tear," "wind." Mærkenavne, forkortelser og numre udløser det også. To rettelser:
| Problemordtype Eksempel Løsning |
| Homograf | "Læse" (fortid vs. nutid) | Omformuler sætningen, eller stav den fonetisk ("rød") |
| Akronym | "SQL", "GIF" | Skriv det, som du vil, det siger: "sequel", "jif" |
| Nummer/dato | "1990'erne", "$1,5M" | Skriv "nitten halvfemsere", "et komma fem millioner" |
| Mærkenavn | enhver usædvanlig stavemåde | Stav det fonetisk og prøv det til audition |
Regenerer kun den korrigerede linje i stedet for hele banen — det er hurtigere og holder resten af din timing intakt.
Sådan synkroniserer du fortælling med dine klip
Uanset hvilken metode du brugte, er det synkronisering, der får fortællingen til at føles bevidst i stedet for påklistret. Målet: seeren hører ordet lige idet de ser det, det beskriver.
- Forankr den første linje. Skub stemmeklippet, så åbningsordet lander på dit åbningsbillede, ikke før det.
- Klip på billedteksten. Hvis du har genereret billedtekster, brug dem som visuelle markører — hver undertekstblok viser dig præcis, hvor en sætning starter, så du kan trimme optagelserne for at ramme de beats.
- Match klipper til sætninger, ikke sekunder. Når du siger "og så bryder det," skal klippet til det ødelagte sted lande på "breaks." Flyt det visuelle, ikke lyden, for at justere dem.
- Efterlad et øjebliks stilhed ved sceneskift. Et kvart sekunds mellemrum, før en ny sektion læses som et afsnit, der brydes for øret.
- Se det én gang i fuld fart med lukkede øjne, og så én gang på lydløs. Hvis det virker begge veje — kun lyd og kun visuelt — er din synkronisering solid.
Især for kortform er tæt synkronisering ikke til forhandling — der er ikke plads til at drifte. Hvis du omrammer horisontalt materiale til et vertikalt feed, så lav vertical resize efter synkronisering, så din oplæsningstiming ikke ændrer sig.
Undviger musik og mixer niveauer, så hvert ord er klart
En voiceover, der konkurrerer med fuld volumen, er den mest almindelige grund til, at fortællingen bliver mudret. "Ducking" betyder automatisk at sænke musikken, når stemmen taler, og så hæve den igen i hullerne.
Målniveauer at sigte efter:
- Stemmen sidder øverst som det højeste element — betragt den som din reference.
- Baggrundsmusik: sænk den cirka 15–20 dB under stemmen, mens fortællingen spiller. Det skal mærkes, ikke høres.
- I de stille pauser mellem linjerne, lad musikken stige op igen, så det ikke føles som om, den er faldet ud.
- Lydeffekter: korte og slagkraftige, aldrig opretholdt under tale.
En simpel blandingsrækkefølge:
- Få stemmeniveauet rigtigt først, af sig selv.
- Tilføj musik og træk den ned, indtil du kan høre hver eneste konsonant i fortællingen.
- Lav et sidste lyt på telefonens højttalere, ikke hovedtelefoner — størstedelen af dit publikum er på en telefon, hvor et mudret mellemtoneområde er værst.
Hvis musikken, du valgte, har vokaler eller en sektion, der hele tiden kæmper imod din fortælling, er det ofte nemmere at fjerne den — se hvordan man fjerner musik fra video og genopbygger med et renere instrumentalunderlag.
Voiceover efter brugstilfælde
De samme værktøjer bruger meget forskellige formater. Her er, hvordan du griber de tre mest almindelige an.
- Forklarings- og opsummeringsvideoer. Manuskript først. Skriv hele fortællingen, generer en AI-stemme, og klip så visuelle elementer for at matche — du redigerer billede til stemme, ikke omvendt. Et resumé eller manuskript udarbejdet fra en kildevideo giver dig et udkast at trimme i stedet for en tom side.
- Talende hoved og personlig voiceover. Optag live, så din personlighed bærer igennem, og ryd derefter op i lyden og tilføj undertekster. Overbearbejde ikke stemmen til noget kunstigt.
- Tutorials og how-tos. Tempoet er alt — seerne pauser og spoler tilbage, så en lidt langsommere AI-stemme med klare pauser slår en hurtig, energisk læsning. Synkroniser hver trins fortælling med den præcise handling på skærmen.
Uanset hvilket format du er i, så byg voiceover, billedtekster og omramming som én gennemgang, så timingen passer sammen, før du eksporterer.
FAQ
Hvordan tilføjer jeg en voiceover til en video gratis online? Brug en browserbaseret editor, så der ikke er noget at installere. Upload din video, og optag så enten fortællingen på stedet, indsæt en forudindspillet fil, eller generer en AI-stemme ud fra et manuskript – alt sammen i det samme projekt. Prisoplysninger for Recapo findes på prissiden; Selve arbejdsgangen kører udelukkende i din browser.
Kan jeg optage en voiceover direkte over min video? Ja. Scrub til dit startpunkt, indstil dit mikrofonniveau, afspil optagelserne, og sig dine replikker, mens det ruller. At se filmen, mens du taler, holder dit tempo i takt med klippene. Trim hovedet og halen bagefter, så det første ord lander på det rigtige billede.
Hvorfor lyder min AI-voiceover robotagtig? Næsten altid én af tre ting: det er at læse for hurtigt, det ignorerer de pauser, du har brug for, eller det er at udtale et tvetydig ord forkert. Sænk tempoet et hak, brug punktum i stedet for kommaer, hvor du vil have et rigtigt beat, og fastsæt homografer, forkortelser og tal på script-niveau, og genskab så kun den linje.
Hvordan undgår jeg at overdøve fortællingen? Bøj musikken — sænk den cirka 15–20 dB under stemmen, når fortællingen spiller, og lad den stige op igen i hullerne. Indstil stemmeniveauet først, og skru så kun op for musikken, indtil du stadig kan høre alle konsonanter. Instrumentale numre dukker langt mere renligt end dem med vokal.
Skal jeg tilføje undertekster, hvis jeg allerede har en voiceover? Ja. En stor del af feedvisningerne sker mutet, så billedtekster holder din besked intakt for stille seere og forstærker den for alle andre. Generer dem fra samme script eller stemmespor, så tekst og lyd forbliver helt synkroniserede.
Begynd at tilføje din voiceover
Uanset om du optager live, uploader et færdigt take eller genererer en AI-stemme ud fra et manuskript, kører hele processen i din browser — oplæsning, undertekster, synkronisering og eksport ét sted på filer op til 6 GB. Vælg den metode, der passer til din video, juster tempo, pauser og udtale, undlad musikken, og send den afsted. Opret din gratis Recapo-konto og tilføj en voiceover til din næste video i dag.
Referencer og officielle kilder
- FFmpeg-dokumentation
- YouTube Hjælp: Copyright på YouTube
- YouTube anbefalede upload-kodningsindstillinger
