Recapo

Cómo añadir subtítulos a un vídeo (y clips) de un podcast

Cómo subtitular un vídeo de podcast: transcribe el episodio una vez, corrige y estiliza los subtítulos del podcast, y luego reutiliza la transcripción para subtitular los clips verticales.

Cómo añadir subtítulos a un vídeo (y clips) de un podcast

Para subtitular un vídeo de podcast, transcribes el episodio completo una vez, revisas y cronometras el texto, luego grabas los subtítulos en el vídeo o exportas un archivo SRT/VTT sidecar — y, si trabajas con inteligencia, reutilizas esa misma transcripción para cortar clips verticales subtitulados para YouTube Shorts, TikTok y Instagram Reels. El error que cometen la mayoría de los creadores es tratar los subtítulos como una tarea puntual que repiten en cada plataforma. Debería ser el primer paso de una cadena repetible por episodio.

Esta guía lo plantea así: transcribe una vez, subtitula una vez y deja que una sola pasada limpia alimente tu vídeo completo, tus archivos de subtítulos del sidecar y cada corto que cortes del episodio. Cubriremos la diferencia entre subtítulos grabados y archivos sidecar, el flujo de trabajo paso a paso, los problemas de precisión específicos del podcast que los tutoriales genéricos evitan, y cómo convertir esa única transcripción en un lote de clips subtitulados.

Puntos clave

  1. Subtitula el episodio una vez, luego reutiliza la transcripción para el vídeo completo, los archivos de sidecar y cada clip — no subtitules por plataforma.
  2. Los pies de foto grabados son para clips sociales; Los archivos SRT/VTT sidecar son para la subida de formato largo donde la plataforma los renderiza.
  3. El audio del podcast rompe el subtítulo automático de formas predecibles — nombres, jerga, números y diálogo cruzado — así que ahorra tiempo para corregir, no solo tiempo de procesamiento.
  4. Recapo encaja en la transcripción → la leyenda → reencuadrar → cadena de exportación en una sola pestaña del navegador; Úsalo como capa de flujo de trabajo, no como un botón mágico.

Por qué los subtítulos de los vídeos de podcast son innegociables

Los subtítulos en un vídeo de podcast no son una cortesía, sino que soportan la carga. Tres fuerzas las hacen obligatorias.

Primero, la visualización mute-first. Algunas visualizaciones del feed ocurren con el sonido apagado, y la documentación de YouTube y Meta empuja constantemente a los creadores hacia los subtítulos precisamente por esta razón. Un clip de podcast es casi puro hablar, así que con el audio silenciado, un clip sin subtítulos es una persona moviendo la boca. Los pies de foto son lo que permite que el scroll se detiene.

Segundo, accesibilidad y alcance. Los subtítulos hacen que tu programa sea útil para espectadores sordos o con discapacidad auditiva, así como para el grupo mucho más grande que ve desde una oficina tranquila, un gimnasio ruidoso o un idioma que no sea el primero. Eso es público que simplemente no consigues de otra manera.

Tercero, descubribilidad. Tanto el texto en pantalla como un archivo de subtítulos subido ofrecen a las plataformas algo que leer — los archivos sidecar alimentan la transcripción que los sistemas de búsqueda y recomendaciones indexan. Nada de esto funciona si los pies de foto son incorrectos, así que la precisión, que se explica más abajo, es todo el juego.

La conclusión: los subtítulos de los podcasts no son agradables de añadir al final. Son el entregable, y la transcripción que los produce es un recurso que reutilizas toda la semana.

Subtítulos grabados vs. sidecar SRT/VTT

Antes de poner pie de foto cualquier cosa, decide qué tipo de subtítulos necesita el destino. Hay dos, y no son intercambiables.

Los subtítulos grabados (codificados) se renderizan de forma permanente en los píxeles de vídeo. Cada espectador los ve, estilizados exactamente como los diseñaste, en cualquier jugador. Esto es lo que buscas para los clips sociales verticales, donde no puedes confiar en la interfaz de subtítulos de la plataforma y donde el estilo forma parte del gancho.

Los subtítulos de sidecar son un archivo separado — normalmente SRT o VTT — que viaja junto al vídeo. La plataforma los renderiza, el espectador puede desactivarlos y los motores de búsqueda pueden leerlos. Esto es lo que quieres para el episodio completo en YouTube o en un podcast, donde quieres texto seleccionable, indexable y estilo nativo.

Pies de foto grabados Sidecar SRT/VTT

Donde viveIntegrado en los píxeles de vídeoArchivo de .srt / .vtt separado
Mejor paraClips verticales (Shorts/Reels/TikTok)Episodio completo en YouTube / presentador de podcast
Control del espectadorSiempre activado, no se puede cambiarActivar o desactivar, a veces traducir
EstiloControl total (tuyo)Nativo de plataforma, limitado
Texto buscableNo (es una imagen)Sí (legible por máquina)
Edición tras la exportaciónSe requiere volver a renderizarEdita el archivo de texto en cualquier momento

La mayoría de los podcasters acaban necesitando ambos: archivos sidecar para la subida de formato largo, y subtítulos grabados para los clips. La buena noticia es que una única transcripción precisa produce cualquiera de los dos — por eso mismo la cadena que se muestra a continuación comienza con la transcripción, no con el estilo.

El flujo de trabajo por episodio para subtitular un vídeo de podcast

Aquí está la secuencia que escala. Funciona limpiamente en un espacio de trabajo basado en navegador como Recapo — sin instalación, transcripción-leyenda-reestructuración-exportación en un solo lugar — pero los pasos se aplican a cualquier conjunto de herramientas.

  1. Transcribe primero el episodio completo. Antes de tocar el estilo, subtitula automáticamente toda la grabación para obtener una transcripción cronometrada y editable. Sube el episodio (los formatos comunes como MP4 y MOV funcionan) y deja que la herramienta genere una sincronización a nivel de palabra que puedas leer y corregir. Leer un episodio de 60 minutos lleva un par de minutos; Fregarla tarda una hora.
  2. Revisa el audio en comparación con el sonido. Este es el paso que la gente se salta y lamenta. Corregir las palabras que el auto-subtitulado falla de forma fiable en los podcasts — ver la siguiente sección — y limpiar el relleno donde un pie de foto solo diría "eh, eh, ya sabes."
  3. Añade etiquetas de altavoz si es una conversación. Para entrevistas y programas copresentados, marca quién habla. En el vídeo completo esto se lee como HOST: / GUEST:; En los clips puedes poner etiquetas o usar color, pero la transcripción subyacente debería saber quién dijo qué.
  4. Decide entre burn-in y sidecar por destino. Para el episodio completo, exporta un archivo sidecar para que la plataforma muestre los subtítulos seleccionables. Para los clips, planea grabarlos dentro.
  5. Estiliza los pies de foto en pantalla. Para cualquier cosa quemada, establece la fuente, tamaño, contraste y colocación en la zona segura (que se tratará más adelante). Mantenlo legible antes de hacerlo bonito.
  6. Exporta una vez por destino. Exporta el vídeo completo subtitulado y/o el archivo sidecar, luego pasa a los clips — no estás retranscribiendo, solo reutilizando la transcripción que ya has corregido.

El sentido de ordenarlo así: la parte cara y humana (la corrección) ocurre una vez, al principio, y todo lo que sigue hereda una transcripción en la que ya confías.

El audio del podcast rompe los subtítulos automáticos de formas predecibles

Los tutoriales genéricos de "añadir subtítulos" asumen una narración limpia y con un solo altavoz. El audio del podcast es lo contrario, y activa el subtítulo automático de varias formas recurrentes. Conocerlos convierte la corrección de una búsqueda del tesoro en una lista de comprobación.

Problema Por qué los podcasts lo desencadenan La solución

Nombres equivocadosLos nombres de invitados, marcas y títulos de los desfiles no forman parte del vocabulario general de un modeloBuscar y reemplazar cada nombre propio una vez; Crea un glosario por programa
Jerga y siglasLos programas de nicho están llenos de términos que los modelos no entiendenArregla la primera instancia y luego reemplaza todo
Números y estadísticas"$40K", "2019", "tres a uno" se distorsionanCompara cada número con el audio — estos se citan y capturan capturas de pantalla
DiafoníaDos personas hablando a la vez confunde los límites de palabrasResolver manualmente los solapamientos; Elige al orador que lleva el punto
Relleno y falsos comienzos"Así que, eh, sí" se llena de lecturaRecorta el relleno en el pie de foto aunque lo mantengas en el audio
Homónfonos"their/there", "to/two" activan audio poco claroLee los pies de foto como texto, no solo en contra de audio

Una regla práctica: revisa primero números, nombres y el remate de cada momento digno de un clip — esas son las líneas que se citan y capturan de pantalla. Si el audio de tu fuente es desagradable (habitaciones con eco, micrófonos baratos, invitados remotos), espera más correcciones y considera limpiar el audio antes de transcribir, ya que un sonido más limpio produce subtítulos más limpios. Para la versión sistemática, véase cómo mejorar la precisión de los subtítulos automáticos.

Desde un episodio hasta un lote de clips subtitulados

Aquí es donde el gasoducto da sus frutos. La transcripción que ya has corregido es el material bruto para tus clips cortos: no subtitulas el episodio y luego empiezas de nuevo para los clips, los reutilizas.

  1. Encuentra los momentos dignos de un clip en la transcripción. Hojea el texto corregido para encontrar pensamientos independientes: una opinión polémica, una explicación clara, un número sorprendente, una historia con un giro. Leer también es mejor que fregar aquí.
  2. Corta el episodio largo en candidatos cortos. Introduce la grabación en una herramienta de IA que convierte los vídeos largos en shorts para mostrar segmentos de alta señal, luego trata sus selecciones como candidatas: conserva las buenas, recorta los límites a mano para que cada clip empiece con la primera palabra interesante.
  3. Reencuadra a vertical. Convierte cada clip a 9:16 para Cortos, Reels y TikTok. Para un programa grabado, recorta al altavoz activo; Para solo audio, te apoyarás más en los subtítulos como parte visual.
  4. Graba los subtítulos para los clips. Pasa cada corte vertical por un generador de subtítulos de vídeo ](/es/tools/video-caption-generator/) y adapta los subtítulos para que los vean en silencio. Como el momento proviene de tu transcripción revisada, los pies de foto heredan la misma precisión: no hay que corregir nombres ni números.
  5. Añade una portada y exporta. Elige un marco o tarjeta de título, exporta un MP4 con subtítulos y un archivo alimenta las tres plataformas verticales.

Ese es el bucle: transcribe una vez, corrige una vez y luego pone un episodio completo subtitulado y cinco o siete clips subtitulados de la misma pasada. Para profundizar en la selección de clips de esto, consulta cómo convertir un podcast en clips.

Pies de foto de estilo para clips verticales silenciados primero

Los subtítulos grabados viven o mueren por legibilidad, no por decoración. Algunas reglas cubren la mayor parte.

  1. Manténlos en la zona segura. Coloca los pies de foto en el tercio medio del fotograma de 9:16, sin las bandas superior e inferior donde están los botones de plataforma, nombres de usuario y barras de progreso. El texto debajo de la interfaz "para ti" es texto que nadie lee.
  2. Talla para un teléfono a la distancia de un brazo. Grande, audaz, de alto contraste. Un trazo oscuro o un cuadro de fondo sutil mantiene el texto blanco legible sobre imágenes brillantes o una onda con mucho volumen.
  3. Una o dos líneas a la vez. No pongas una frase entera en pantalla. Muestra una frase, sincronízala con el habla y déjala moverse — la animación palabra por palabra o frase por frase mantiene la mirada en el seguimiento.
  4. Usa color o etiquetas para los altavoces. En un clip para dos personas, un color por altavoz (o una pequeña etiqueta con el nombre) indica a los espectadores quién está hablando sin saturar el encuadre.
  5. Correge el remate. Una palabra equivocada en la frase que haga que el clip funcione lo matará. Revisa los clips de héroes antes de grabar los subtítulos — después de la grabación, corregir un error tipográfico significa volver a renderizar.

El objetivo son los subtítulos que el espectador pueda leer en medio segundo con el sonido apagado. Las fuentes ingeniosas son opcionales; La legibilidad no lo es.

SRT vs. VTT: qué archivo sidecar para la subida de formato largo

Durante el episodio completo, exportarás un archivo sidecar en lugar de grabar subtítulos — y tendrás que usar dos formatos comunes. SRT (SubRip) es la opción sencilla y casi universal: marcas de tiempo y texto, aceptadas casi en todas partes. VTT (WebVTT) es el formato nativo web que añade metadatos de estilo y posicionamiento sobre la misma estructura central.

La versión corta: SRT para compatibilidad general, VTT cuando la plataforma o reproductor lo desea específicamente. La mayoría de los presentadores de vídeo y podcast aceptan SRT para una subida sencilla; algunos reproductores web y herramientas de subtitulado prefieren o requieren VTT. En cualquier caso, ambos provienen de la misma transcripción corregida, así que nunca estás rehaciendo el trabajo — estás exportando el mismo texto en un envoltorio diferente. Para el desglose completo de ambos formatos y cuándo cada uno importa, véase SRT vs. VTT. Mantén tu transcripción maestra limpia y cronometrada, y trata SRT o VTT como un objetivo de exportación, no algo que se edite a mano línea por línea.

Una prueba rápida para cualquier herramienta de subtítulos de pódcast

El espacio de herramientas para podcasts está saturado, y todas las herramientas prometen subtítulos precisos. No confíes en la lista de características — haz una prueba. Toma un episodio real tuyo, con la calidad real de su micrófono, nombres de invitados y crosstalk, y mide cuatro cosas:

  1. Precisión de transcripción en tu contenido. ¿Cuántos nombres, términos y números tienes que corregir cada diez minutos? Este es el número que decide si la herramienta ahorra tiempo o simplemente mueve el trabajo.
  2. Fricción de edición. ¿Se puede arreglar una palabra, reemplazar un nombre recurrente y ajustar el tiempo sin problemas con la interfaz?
  3. Flexibilidad de exportación. ¿Puedes conseguir tanto los subtítulos grabados para los clips como un archivo sidecar para la subida en formato largo, de la misma transcripción?
  4. Tiempo para un clip con subtítulos. De subir a un clip terminado con subtítulos de 9:16, ¿cuántos minutos y cuántos pasos manuales?

Haz esa misma prueba de quince minutos con cualquier cosa que estés considerando; Te dice más que cualquier tabla comparativa. Recapo es un ajuste basado en navegador para esta cadena exacta — transcribir, subtitular, reencuadrar y exportar en un solo lugar — pero deja que decida la prueba, no la presentación.

Preguntas frecuentes

¿Cómo puedo añadir subtítulos a un vídeo de podcast gratis para que los pruebe? Empieza transcribiendo el episodio en una transcripción cronometrada y luego revísalo — esa única transcripción corregida es la que produce tanto los subtítulos grabados para los clips como un sidecar SRT/VTT para la subida completa. Las herramientas basadas en navegador permiten hacer todo el proceso de transcripción y subtítulos sin instalar software; Consulta la página de precios para ver qué incluye cada plan.

¿Debería grabar subtítulos o subir un archivo SRT? Ambos, para destinos diferentes. Graba los subtítulos en los clips sociales verticales, donde controlas el estilo y no puedes depender de la interfaz de subtítulos de la plataforma. Sube un sidecar SRT (o VTT) para el episodio completo a YouTube o a un presentador de podcast, donde quieras texto seleccionable, buscable y alternable.

¿Cómo arreglo los malos subtítulos automáticos en un podcast? Revisa la transcripción con el audio, priorizando nombres, jerga, números y cualquier línea que planees recortar. Corrige un nombre o término recurrente una vez y reemplázalo todo, crea un glosario por programa y limpia el audio original antes de transcribirlo: un sonido más limpio produce pies de foto más limpios.

¿Puedo reutilizar los mismos subtítulos para mi episodio y mis clips? Sí — ese es el sentido de subtitular una vez. Revisa primero la transcripción completa, exporta un archivo sidecar para la subida de formato largo y luego reutiliza el mismo texto temporizado para grabar los subtítulos en cada clip vertical. Los clips heredan la precisión que ya arreglaste, así que no tienes que corregir nombres y números por clip.

¿Cuál es la diferencia entre SRT y VTT en los subtítulos de podcast? Ambos son archivos de subtítulos sidecar con marcas de tiempo y texto. SRT es el formato más sencillo y casi universal que la mayoría de los anfitriones aceptan; VTT es nativo de la web y soporta estilismo y posicionamiento adicionales. Usa SRT para una compatibilidad amplia y VTT cuando una plataforma o reproductor específico lo solicita — ambos exportan desde la misma transcripción.

Pon un pie de foto en tu próximo episodio una vez, úsalo en todas partes

El flujo de trabajo es sencillo una vez que dejas de repetirte: transcribe el episodio una vez, corrige la transcripción una vez, y luego deja que esa única pasada produzca tu vídeo completo subtitulado, tu SRT/VTT sidecar y un lote de clips verticales subtitulados. Todo lo que viene más adelante — reencuadrar, grabar en los subtítulos, exportar — hereda una transcripción en la que ya confías. Crea una cuenta Recapo gratuita, sube tu último episodio y convierte una grabación en un episodio totalmente subtitulado más una semana de clips — no es necesario instalarlo.

Referencias y fuentes oficiales

  1. Ayuda en YouTube: Añadir subtítulos y leyendas
  2. Documentación web MDN: WebVTT API
  3. Recapo.ai: Resumen del producto y límites actuales de subida
  4. Recapo.ai: Editor de vídeo IA
  5. FFmpeg: Documentación oficial


Artículos recomendados

Ver todo