Cómo añadir una voz en off con IA a cualquier vídeo
Aprende a añadir una voz en off a un vídeo de tres maneras — grabar en directo, subir audio o usar texto a voz con IA — además de scripting, configuración del micrófono, sincronización y ducking.

Para añadir una voz en off a un vídeo tienes tres rutas prácticas: grabar tu voz en directo mientras se reproduce el material, subir una narración que hayas grabado en otro sitio o generar una pista de texto a voz con IA a partir de un guion escrito. Esta guía cubre los tres dentro de un navegador — no es necesario instalar — y va más allá de las instrucciones de "pulsa el botón del micrófono" en las que se detienen la mayoría de las páginas de herramientas. Lo que realmente hace que una voz en off suene profesional es el oficio: escribir un guion que respire, ajustar un micrófono para que no sature, sincronizar la narración con tus cortes y esquivar la música para que cada palabra quede clara. Si publicas en YouTube, TikTok, Shorts o Reels, ese trabajo separa una voz en off que suena como "basura de IA" de una que los espectadores se quedan.
Puntos clave
- Diagnostica primero el trabajo de audio: extracción, limpieza, separación de vástago, voz en off y volumen son tareas diferentes.
- Utiliza el proceso menos destructivo que resuelva el problema y prueba un clip duro antes de agruparlo.
- Eliminar música o extraer audio no garantiza derechos sobre las grabaciones de otra persona.
- Mantén el audio fuente organizado para que las transcripciones, leyendas, voces en off y exportaciones sean rastreables.
Las tres formas de añadir una voz en off a un vídeo
Antes de pulsar un botón, decide cuál de los tres métodos encaja con tu vídeo. Se basan de manera diferente en cuanto al tiempo, el control y cuánto interviene tu propia voz.
| Método Mejor para Lo que necesitas Principal compensación |
| Grabar en directo sobre imágenes | Reacciones, comentarios, canales impulsados por la personalidad | Un micrófono y una habitación silenciosa | Las repeticiones cuestan tiempo real |
| Sube un archivo pregrabado | Presentadores de podcasts, cualquiera con audio de estudio | Un MP3/WAV/M4A terminado | Editas dos cosas por separado |
| Texto a voz con IA | Explicaciones sin rostro, resúmenes, tutoriales, multilingüe | Un guion ajustado | Suena robótico si no lo afinas |
La mayoría de los creadores mezclan métodos: una voz de IA para un resumen sin rostro, una versión en directo para una introducción personal. El flujo de trabajo que aparece a continuación se aplica a los tres, porque la edición, sincronización y mezcla ocurren después de que el audio ya existe.
Método 1: Graba una voz en directo sobre tu vídeo
Grabar mientras ves el metraje es la forma más rápida de conseguir una narración que reaccione a lo que hay en pantalla. Es el valor predeterminado para comentarios, reacciones y cualquier canal donde tu voz sea el producto.
Paso a paso:
- Abre tu proyecto y refrega hasta donde debería empezar la narración.
- Configura primero el nivel del micrófono (mira la caja de configuración más abajo) — haz una prueba de 10 segundos y comprueba que no estás alcanzando pico.
- Reproduce el metraje y repite tus líneas mientras avanza el vídeo. Ver la película mantiene tu ritmo honesto.
- Si te equivocas en una línea, sigue y marca la marca de tiempo: es más rápido volver a grabar un clip que reiniciar toda la toma.
- Recorta el aire muerto en la cabeza y la cola, luego mueve el clip de audio para que tu primera palabra llegue al plano que describes.
Configuración de micrófono que arregla el 80% del audio malo:
- Coloca el micrófono a 6–10 pulgadas de la boca, ligeramente fuera del eje para que las oclusivas (sonidos "p" y "b") no retumben.
- Graba en la habitación más pequeña y con muebles blandos que tengas — un armario con ropa es mejor que una gran oficina con eco.
- Apunta tu nivel de entrada para que el habla normal alcance su pico entre −12 y −6 dB, sin llegar nunca a 0.
- Apaga los ventiladores, el aire acondicionado y las notificaciones. El zumbido de la habitación es casi imposible de eliminar limpiamente después de que se haya hecho.
Si tu toma en directo sigue teniendo silbido, zumbido o un suelo irregular, pásala por una pasada de limpieza antes de mezclar — nuestra guía sobre cómo limpiar audio para un video](/es/blog/how-to-clean-up-audio-for-video/) cubre el orden de operaciones para que no sobreproceses y hagas que tu voz suene bajo el agua.
Método 2: Subir una voz en off pregrabada
Si ya has narrado en algún sitio — un podcast, un memorando por teléfono, una sesión de micrófono USB dedicada — simplemente llevas el audio final a tu proyecto. Esto mantiene la grabación y edición como dos pasos limpios, lo cual es más fácil de controlar que hablar en directo sobre un corte preliminar.
- Exporta tu narración como MP3, WAV o M4A.
- Sube el vídeo y el archivo de audio al mismo proyecto del navegador. Recapo acepta MP4, MOV y otros formatos comunes, con hasta 6GB por tarea, por lo que tanto las sesiones largas de grabación como el metraje 4K son compatibles.
- Coloca la pista de voz en una capa propia debajo del vídeo.
- Divide la narración en los saltos naturales de frase para que puedas deslizar cada fragmento y que coincida con la imagen — los pasos completos de sincronización están en la siguiente sección.
- Una vez que la colocación esté bloqueada, genera subtítulos a partir de la pista de voz para que las palabras sean legibles y el sonido fuera de servicio.
Ese último paso importa más de lo que parece: una gran parte de las visualizaciones del feed se sienten silenciadas, así que el texto en pantalla es la forma de mantener el mensaje intacto. Usa auto-captions para transcribir la voz en off y grabar subtítulos limpios y sincronizados; si los subtítulos son nuevos para ti, cómo añadir subtítulos a un video explica el estilo y el tiempo.
Método 3: Generar una voz en off de texto a voz con IA
El texto a voz con IA es el principal campo de batalla para los canales sin rostro, resúmenes y tutoriales donde no puedes o no quieres grabar. Pegas un guion, eliges una voz y obtienes una pista de narración limpia — sin micrófono, sin repeticiones, sin ruido de ambiente. El TTS en bruto suena robótico a menos que lo afines, que es exactamente lo que cubre la siguiente sección.
El flujo básico:
- Escribe o pega tu script en el voiceover maker. Mantén las frases cortas — TTS lee la puntuación literalmente, y los largos tramos salen sin aliento.
- Elige una voz que coincida con el tono de tu canal. Haz dos o tres audiciones en el mismo párrafo antes de comprometerte; El mismo guion puede resultar cálido o clínico dependiendo de la voz.
- Genera la pista y escucha de principio a fin para ver si hay alguna palabra que salga mal.
- Correge las palabras equivocadas a nivel de guion (ver más abajo), regenera solo esa línea y colócala en tu línea de tiempo.
- Añade subtítulos del mismo guion para que el texto y el audio estén sincronizados.
Si estás construyendo alrededor de un guion — convirtiendo un artículo, un resumen o un resumen en vídeo narrado — la ruta texto a voz video permite que guion y voz convivan, y Recapo también puede ayudar a redactar resúmenes y guiones a partir de un vídeo fuente antes de que generes una voz. Para una configuración totalmente sin rostro, cómo hacer vídeos sin rostro muestra cómo la voz en off, los subtítulos y los visuales se combinan en un formato de canal publicable.
Los tres parámetros que hacen que la voz de la IA suene humana
Esta es la herramienta de parte que las páginas de aterrizaje saltarán. Conseguir una voz en off natural con IA se reduce a controlar tres cosas: el ritmo, las pausas y la pronunciación. Si arreglas esto, desaparece el 90% del problema de la "voz robótica".
1. Ritmo (ritmo de habla). El TTS por defecto suele ser un poco rápido para la narración. Reduce el ritmo un poco para explicaciones y tutoriales donde los espectadores necesitan absorber información; Mantenlo más ágil para resúmenes de alta energía. Lee tu propio guion en voz alta con un temporizador primero; si no puedes decirlo cómodamente a esa velocidad, la IA tampoco debería.
2. Pausas (pausas de frase). TTS pausa la puntuación, así que la puntuación es tu herramienta de tiempo. Usa puntos, no comas, donde quieres un ritmo real. Divide una frase larga en dos cortas para añadir un suspiro. Un salto de línea dedicado o una elipsis compra una pausa más larga antes de un remate o un cambio de escena.
3. Pronunciación (palabras ambiguas). El inglés está lleno de homógrafos que la IA puede adivinar mal — "read", "lead", "live", "bass", "record", "present", "tear", "wind". Los nombres de marcas, acrónimos y números también lo confunden. Dos soluciones:
| Tipo de palabra problemática Ejemplo Arreglar |
| Homògrafo | "leído" (pasado vs presente) | Reformula la frase, o escríbela fonéticamente ("rojo") |
| Acrónimo | "SQL", "GIF" | Escríbelo como quieras que se diga: "secuela", "jif" |
| Número/fecha | "Años 90", "1,5 millones de dólares" | Escribe "años noventa", "uno coma cinco millones" |
| Nombre de la marca | cualquier ortografía inusual | Deletrearlo fonéticamente y audicionarlo |
Regenera solo la línea corregida en lugar de toda la pista: es más rápido y mantiene el resto del tiempo intacto.
Cómo sincronizar la narración con tus cortes
Sea cual sea el método que hayas usado, la sincronización es lo que hace que la narración parezca intencionada en lugar de pegada encima. El objetivo: el espectador escucha la palabra justo cuando ve lo que describe.
- Ancla la primera línea. Desliza el clip de voz para que la palabra inicial caiga en tu primer disparo, no antes.
- Corta el pie de foto. Si has generado subtítulos, úsalos como marcadores visuales: cada bloque de subtítulos te muestra exactamente dónde empieza una frase, así que puedes recortar el metraje para alcanzar esos puntos.
- Coincide con frases, no segundos. Cuando dices "y luego se rompe", el corte a lo roto debería quedar en "rompe". Mueve el visual, no el audio, para alinearlos.
- Deja un momento de silencio cuando cambias de escena. Un cuarto de segundo antes de que una nueva sección se lea como un salto de párrafo para el oído.
- Mírala una vez a toda velocidad con los ojos cerrados, y luego una vez silenciada. Si funciona en ambos sentidos — solo audio y solo visual — tu sincronización es sólida.
Especialmente para la versión corta, la sincronización ajustada es innegociable — no hay margen para derrapar. Si estás reencuadrando metraje horizontal para un feed vertical mientras estás en ello, haz el [redimensionamiento vertical] ](/es/blog/how-to-make-a-video-vertical/) después de sincronizar para que el tiempo de la narración no cambie.
Esquivando la música y mezclando los niveles para que cada palabra quede clara
Una voz en off que compite con música a todo volumen es la razón más común por la que la narración se vuelve confusa. "Agacharse" significa bajar automáticamente la música cada vez que la voz habla, y luego volver a subirla en los huecos.
Niveles objetivo a los que aspirar:
- La voz es el elemento más fuerte — trátala como tu referencia.
- Música de fondo: baja aproximadamente 15–20 dB bajo la voz mientras suena la narración. Debe sentirse, no escucharse.
- En los silenciosos espacios entre líneas, deja que la música vuelva a subir para que no parezca que se ha apagado.
- Efectos de sonido: breves y contundentes, nunca sostenidos bajo habla.
Un orden de mezcla sencillo:
- Primero acierta el nivel de voz, por sí solo.
- Añade música y baja hasta que puedas oír cada consonante de la narración.
- Haz una última escucha con altavoces del móvil, no con auriculares — la mayoría de tu audiencia está en un teléfono, donde un rango medio embarrado se nota peor.
Si la música que elegiste tiene voces o una sección que sigue luchando contra tu narración, a menudo es más fácil eliminarla — mira cómo eliminar música de video y reconstruir con un fondo instrumental más limpio.
Voz en off por caso de uso
Las mismas herramientas sirven a formatos muy diferentes. Así es como abordar los tres más comunes.
- Vídeos explicativos y de resumen. Guion primero. Escribe toda la narración, genera una voz con IA y luego corta los visuales para que coincidan — tú editas la imagen a voz, no al revés. Un resumen o guion redactado a partir de un vídeo fuente te da un borrador para recortar en lugar de una página en blanco.
- Voz en off de voz y personal. Graba en directo para que tu personalidad se transmita, luego limpia el audio y añade subtítulos. No sobreproceses la voz hasta convertirla en algo artificial.
- Tutoriales y tutoriales. El ritmo lo es todo: los espectadores pausan y retroceden, así que una voz de IA un poco más lenta con pausas claras supera a una lectura rápida y enérgica. Sincroniza la narración de cada paso con la acción exacta en pantalla.
Sea cual sea el formato en el que estés, construye la voz en off, los subtítulos y el reencuadre como una sola pasada para que el tiempo encaje antes de exportar.
Preguntas frecuentes
¿Cómo puedo añadir una voz en off a un vídeo gratis en línea? Usa un editor basado en navegador para que no haya nada que instalar. Sube tu vídeo y graba la narración en el momento, deja un archivo pregrabado o genera una voz de IA a partir de un guion — todo en el mismo proyecto. Los detalles de precios para Recapo están disponibles en la página de precios; El flujo de trabajo en sí se ejecuta íntegramente en tu navegador.
¿Puedo grabar una voz en off directamente sobre mi vídeo? Sí. Limpia hasta el punto de inicio, ajusta el nivel del micrófono, pon el vídeo y repite tus líneas mientras avanza. Ver la película mientras hablas mantiene tu ritmo acorde con los cortes. Recorta la cabeza y la cola después para que la primera palabra caiga en el tiro correcto.
¿Por qué mi voz en off de IA suena robótica? Casi siempre es una de tres cosas: es leer demasiado rápido, ignorar las pausas que necesitas, o pronunciar mal una palabra ambigua. Reduce el ritmo un poco, usa puntos en lugar de comas donde quieres un ritmo real, y corrige homógrafos, acrónimos y números a nivel de guion, y luego regenera solo esa línea.
¿Cómo evito que la música ahogue la narración? Baja la música — bájala aproximadamente 15–20 dB bajo la voz cuando suene la narración, y deja que suba de nuevo en los huecos. Configura primero el nivel de la voz y luego sube la música solo hasta que puedas oír todas las consonantes. Las pistas instrumentales se agachan mucho más limpiamente que las que tienen voces.
¿Debería añadir pies de foto si ya tengo una voz en off? Sí. Una gran parte de las visualizaciones del feed ocurren en silencio, así que los pies de foto mantienen tu mensaje intacto para los espectadores silenciosos y lo refuerzan para el resto. Generarlos a partir del mismo script o pista de voz para que el texto y el audio estén perfectamente sincronizados.
Empieza a añadir tu voz en off
Ya sea que grabes en directo, subas una toma terminada o generes una voz de IA a partir de un guion, todo el proceso se ejecuta en tu navegador: narración, subtítulos, sincronización y exportación en un solo lugar, en archivos de hasta 6GB. Elige el método que se adapte a tu vídeo, ajusta el ritmo, las pausas y la pronunciación, evita la música y lanzalo. Crea tu cuenta Recapo gratuita y añade una voz en off a tu próximo vídeo hoy mismo.
Referencias y fuentes oficiales
- FFmpeg documentation
- Ayuda en YouTube: Derechos de autor en YouTube
- Configuración de codificación recomendada por YouTube
