Slik lager du talking head-videoer med AI (rimelig arbeidsflyt)
Tre måter å lage talking-head-stil videoer med AI — kostnadssammenligning, manusmaler, bildetekster og publiseringsspesifikasjoner for TikTok, Shorts og Reels.

talking head video — Denne guiden forklarer temaet med praktiske trinn, eksempler og en arbeidsflyt du kan bruke med en gang.
En video med snakkende hode krever ikke at noen er på kamera. AI-voiceover pluss stock-visuelle effekter og undertekster gir deg en publiserbar video fra én enkelt laptop — hovedkostnaden som gjenstår er tiden din. Denne guiden går først gjennom tallene på tre tilnærminger — programleder på kamera, AI-voiceover og AI-avatar — og går deretter gjennom en femtrinns arbeidsflyt, med en manusmal og publiseringsspesifikasjoner du kan kopiere som de er.
Tre tilnærminger: Regn tallene først

| TilnærmingForhåndsinvesteringPer-video produksjonHovedulempe | |||
| Programleder foran kamera | Lyssetting, mikrofon, øving foran kamera | Innspilling pluss opptak; Tidskostnaden er uforutsigbar | Høy terskel for å gå på kamera; Fridagene trekker ned produksjonen |
| AI-voiceover + visuelle elementer | Nesten null | Manus → voiceover → sette sammen visuelle elementer; Kort rørledning | Visuelle elementer og bildetekster bærer alt; Et svakt tema faller flatt |
| AI-avatar | Egendefinert ansikts- og stemmeoppsett | Rask å generere, men leppesynkronisering og bevegelser krever gjentatte justeringer | Stiv levering; Seerne ser det med et blikk |
Hvem hver av dem passer:
- Programleder foran kamera: Folk som bygger et personlig merke eller tillitsdrevet innhold (anmeldelser, førstehåndserfaring). Ingenting kan erstatte tillit ansikt til kamera.
- AI-voiceover + visuelle elementer: Folk som ikke vil vise ansiktet sitt og vil teste temaer i stort volum. Den dekker veiledninger, oppsummeringer og innhold i forklaringsstil — og det er hovedfokuset i denne guiden.
- AI-avatar: kontoer som trenger en fast «vert»-persona og poster veldig ofte. Produksjonsprosessen er lang; Ikke anbefalt når du starter.
Den femtrinns AI-arbeidsflyten for snakkende hode
1. Skriv manuset. Struktur: én hook → tre punkter → én oppfordring til handling. Budsjettlengden er ~140–160 ord per minutt, så en 60-sekunders video varer omtrent 140–160 ord; Hvis du er over, kutt et poeng — ikke hast med tempoet. Malen får sin egen seksjon nedenfor.
- Generer voiceoveren. Slipp manuset inn i en Tekst-til-tale-verktøy. Nøkkelen her er ikke å velge stemme – det er korrekturlesing: legg til tegnsetting som matcher talerytmen; forskriv alt motoren har en tendens til å misforstå (homografer som «read» og «live», navn, tall) til en form den ikke kan få feil av; Lytt gjennom hele sporet før du eksporterer. Når AI-voiceovers går galt, er det nesten alltid fordi ingen korrekturleste manuset.

- Sett sammen det visuelle. For en video uten kamera kan visuelle elementer deles inn i tre typer: b-roll, tekstkort (nøkkelpunkter på skjermen) og skjermopptak (for opplæring). Bruk en Ansiktsløst videoverktøy For å matche visuelle elementer med manusseksjoner — én visuell idé per seksjon, og aldri la et eneste bilde ligge på skjermen i 20 sekunder.
- Legg til bildetekster. Mange blar med lyden av; En snakkende hode-video uten teksting kunne like gjerne ikke eksistert. Kjør voiceoveren gjennom en Verktøy for automatisk teksting, sjekk deretter linje for linje — egennavn og tall er der feilene samler seg. Tre stylingregler: skriv stort nok til å leses, ikke mer enn to linjer på skjermen, og hold deg unna plattformens UI-soner (nederst og høyre kant). Hvis du heller vil generere bildeteksten først og style den separat, bruk Videotekstgenerator.
- Omslag og tittel. Velg en ramme fra den ferdige videoen med ekte informasjon i, eksporter den som omslag, og legg til en stor tekstlinje. Ikke la tittelen gjenta omslagsteksten: omslaget vekker nysgjerrigheten, tittelen formidler informasjonen.
En manusmal du kan kopiere
Skjelettet: 1 krok → 3 punkter (hver leder med konklusjonen, og utvides deretter i 2–3 setninger) → 1 oppfordring til handling.
Et gjennomarbeidet eksempel (~60 sekunder, verktøy-tutorial-stil):
Du trenger ikke å lære deg et komplett redigeringssystem for å lage én video med snakkende hode. (krok) Først, manuset: skriv det ord for ord, legg tempoet til omtrent 140 ord i minuttet, og bryt opp enhver setning du snubler over høyt. Så voiceoveren: skriv om ord AI-en kan lese feil, merk pausene selv — ikke la det rase gjennom et helt avsnitt i ett åndedrag. Til slutt, undertekster: mange ser på uten lydløshet, så ingen undertekster betyr at videoen like gjerne ikke eksisterer. Tre trinn, og du har noe du kan publisere. Hvilket trinn sitter du fast på? Fortell meg i kommentarfeltet. (oppfordring til handling)
Bytt inn et nytt tema, og dette skjelettet skalerer til batch-skriving — men de tre punktene må være innhold du selv har filtrert. Malen kontrollerer strukturen, ikke kvaliteten.
TikTok / Shorts / Reels publiseringsspesifikasjoner i et overblikk
Spesifikasjonene nedenfor er plattformenes publiserte regler; Varighetene er praktiske forslag:
| Plattform Bildeforhold Varighet Omslag | |||
| TikTok | 9:16 (1080×1920) | 45–90 sekunder er et solid utgangspunkt for snakkende hode | Velg en ramme; Støttet forsidetekst |
| YouTube Shorts | 9:16 (1080×1920) | Opptil 3 minutter distribueres som Shorts — overlat til den offisielle siden | Valgt fra videorammer; Ingen separat bildeoplasting |
| Instagram Reels | 9:16 (1080×1920) | Kortere vinner; fortsett å snakke-hode under ~90 sekunder | Velg en ramme, eller last opp et vertikalt omslagsbilde |
En eksport 9:16 kan sendes ut til alle tre plattformer — det er ikke behov for separate versjoner. Det eneste som er verdt å håndtere per plattform er omslaget og hvordan du skriver tittelen.
YouTubes policy for uautentisk innhold: AI-snakkende hode kan ikke hoppe over dette
Siden juli 2025 har YouTubes inntektspolitikk erstattet «repeterende innhold» med «uautentisk innhold» — rettet direkte mot masseprodusert, malbasert innhold uten menneskelig kreativ innsats; Følg den offisielle siden for det med liten skrift. Hva det betyr for AI-snakkende hode-videoer: AI-skrevet manus, AI-voiceover, AI-sammensatt visuell effekt, publisert nøyaktig som generert — ren volumproduksjon som dette vil sannsynligvis ikke bestå en vurdering av inntektsgenerering.
Bunnlinjen er å holde det menneskelige kreative laget i egne hender: du velger temaene, du gir synsvinkelen, du tar redigeringsbeslutningene — AI håndterer bare gjennomføringen. Ikke gamble på dette: å miste inntekter etter at kanalen har tatt av, koster langt mer enn å gjøre det riktig fra starten av. Denne artikkelen gir heller ingen løfter om trafikk eller inntekter — retningslinjer og algoritmer endres; Det menneskelige kreative laget er det ene du faktisk kontrollerer.
Er daglig publisering bærekraftig?
Flaskehalsen i AI-produksjon av snakkende hoder er manus og korrekturlesing, ikke rendering. Den bærekraftige tilnærmingen er batching: skriv en uke med manus på én fast dag, lag voiceovers og visuelle elementer i én batch, og spre korrekturlesing av bildetekster utover uken. Det er mye mer stabilt enn å lage hver video fra bunnen av hver dag, og det er lettere å holde kvalitetslinjen. I stedet for å jage en daglig opplasting, sett en rytme du kan fortsette å kjøre i åtte uker på rad.
Hvis du vil gå dypere inn i fortellerstil-videoer, er hele arbeidsflyten i gang Hvordan lage en filmoppsummeringsvideo; for hvordan hele verktøykjeden henger sammen, se AI-videoredigering forklart.
FAQ
Vil ikke AI-voiceoveren høres falsk ut?
Den robotaktige følelsen kommer stort sett fra dårlig formulering og feiltolkede ord. Skriv manuset slik folk faktisk snakker, marker pauser for hånd, og forhåndsskriv alt motoren gjør feil – det fjerner de fleste åpenbare tegn. Publikum for informasjonsinnhold fra snakkehoveder bryr seg om selve informasjonen; Deres toleranse for stemmen er høyere enn man skulle tro.
Kan ansiktsløse, snakkende hoder-videoer tjene penger på?
Ja, men de må bestå plattformens originalitetsvurdering. Ta YouTube: policyen oppdatert i juli 2025 retter seg mot masseprodusert uautentisk innhold, ikke «innhold som brukte AI». Hvis et menneske velger temaene, leverer synspunktet og tar redigeringsbeslutningene, er du fortsatt innenfor reglene. Se plattformens offisielle sider for nøyaktige vilkår — denne artikkelen gir ingen inntektsløfter.
Hvor mange ord bør et 60-sekunders manus være?
Med ~140–160 ord per minutt, omtrent 140–160 ord. Bedre å lande poenget på 130 ord enn å presse inn 200 og skynde seg — når leveringen først går raskere, klarer verken tekstene eller publikum å holde følge.
Må jeg lage tre separate versjoner for de tre plattformene?
Nei. En 9:16 vertikal eksport fungerer på alle tre; Det som krever håndtering per plattform er omslaget (reglene for rammevalg varierer) og hvordan du skriver tittelen. Publiser den samme videoen overalt først, se hvilken plattform som plukker den opp, og tilpass deretter til den.
Hva er filgrensene for å lage talking head-videoer med Recapo?
Last opp direkte fra nettleseren — vanlige formater som MP4 og MOV støttes, med opptil 6 GB kildemateriale per oppgave. Voiceover, bildetekster, vertikal størrelse og eksport av omslag skjer alle i ett arbeidsområde, så du flytter ikke filer mellom apper.
Hvert steg i denne arbeidsflyten — voiceover, bildetekster, visuell sammensetning og eksport av omslag — kjører fra ende til annen i Recopos nettleser-arbeidsområde, uten installasjoner. Opprett en konto, ta manuset til din neste talking-head-video, og kjør de fem stegene én gang.
Referanser og offisielle kilder
- YouTube-hjelp: Oppgi endret eller syntetisk innhold
- Retningslinjer for inntektsinnspilling av YouTube-kanaler
- YouTube anbefalte opplastingskodingsinnstillinger


