Vídeo a subtítulos

Convierte el habla de un vídeo o archivo de audio en un archivo de subtítulos con tiempos. Coloca un clip, ejecuta el reconocedor y luego descarga la transcripción como SRT, VTT o texto sin formato, con los códigos de tiempo ya incluidos.

Añade tu vídeo o audio

MP4 · MOV · MKV · MP3 · WAV · M4A

Arrastra un archivo aquí o haz clic para buscarlo

Un archivo a la vez, hasta 30 MB. Para una grabación larga, extrae primero el audio con Vídeo a MP3; se sube mucho más rápido y cubre más minutos.

MP4MOVMKVMP3WAVM4A

Subtítulos

Añade un archivo para empezar

Tu transcripción aparecerá aquí

Cómo generar subtítulos a partir de un vídeo

Añade tu archivo

Arrastra un vídeo o un archivo de audio. El límite es de 30 MB, así que en una grabación larga merece la pena extraer primero la pista de audio: el mismo minuto de voz ocupa una fracción del tamaño.

Ejecutar el reconocedor

Elige el idioma hablado si lo conoces, y activa las etiquetas de hablantes si habla más de una persona. Luego inicia la ejecución y deja la pestaña abierta; la página muestra cuánto has esperado.

Comprueba y luego descarga

Lee la transcripción y corrige lo que el reconocedor haya oído mal. Luego guárdala como SRT para un reproductor o un editor, VTT para la web, o TXT cuando solo quieras las palabras.

Por qué usar Vídeo a subtítulos de Aihangsoft

Con tiempos, no solo transcrito

Cada línea vuelve con un código de tiempo de inicio y fin, así que el resultado entra directamente en una pista de subtítulos. No hay que alinear manualmente el texto con el audio.

Tres formatos, una ejecución

La misma transcripción se exporta como SRT, VTT o texto sin formato, así que no tienes que ejecutarla de nuevo para obtener otro formato. Elige el que pida la plataforma.

Nada que instalar

Sin app, sin plugin y sin cuenta para probarlo. Funciona tanto en el teléfono que llevas en el bolsillo como en un escritorio, lo que importa porque ahí suele estar la grabación.

Para qué lo usa la gente

Subtítulos para vídeo social

La mayoría de los vídeos cortos se ven sin sonido, y las plataformas esperan un archivo de subtítulos en lugar de texto escrito a mano. Genera aquí el SRT y súbelo junto con el clip.

Caso de uso: Reels, Shorts, TikTok, YouTube

Transcripciones de reuniones y entrevistas

Convierte una llamada grabada, una clase o una entrevista en texto buscable en lugar de escuchar todo de nuevo. Activa las etiquetas de hablantes y podrás ver quién dijo qué.

Caso de uso: reuniones, clases, periodismo

Texto de una grabación que es tuya

La exportación TXT elimina los códigos de tiempo y deja prosa simple, que es lo que quieres para notas del programa, un borrador de blog, un conjunto de notas de estudio o cualquier cosa que pienses buscar después.

Caso de uso: notas, notas del programa, borradores

Etiquetas de hablantes para una conversación

En una entrevista de dos personas, el reconocedor puede etiquetar cada línea con el hablante, para que la transcripción se lea como una conversación y no como un bloque largo de texto.

Caso de uso: entrevistas, mesas redondas, podcasts

Cómo funciona y adónde va tu archivo

Motor
El modelo de reconocimiento de voz se ejecuta en Volcengine AI MediaKit, no en el navegador.
Ubicación de los datos
Nube: tu archivo se sube a Volcengine AI MediaKit para procesarlo. El archivo de resultado se elimina automáticamente a los 30 minutos.
Más
Esta es una de las seis herramientas Cloud AI. Las otras 45 funcionan por completo en el navegador. Cómo funcionan las herramientas de archivos en el navegador.

Preguntas frecuentes sobre Vídeo a subtítulos

Sí, y no necesitas cuenta para probarlo. Cada conexión obtiene una ejecución gratuita al día de hasta 2 minutos de contenido. Una cuenta gratuita obtiene 5 créditos al día, que cubren aproximadamente un minuto de habla, y los suscriptores Pro obtienen 1500 créditos al mes con un límite de 30 minutos por ejecución. Una ejecución cuesta 5 créditos por minuto de contenido, redondeando hacia arriba, así que un clip de 2 minutos cuesta 10 créditos y uno de 10 minutos cuesta 50. Iniciar sesión eleva tanto la cuota diaria como el límite de duración. Los créditos se cobran una vez que el archivo se ha procesado realmente, lo que significa que un clip que resulta no tener habla reconocible igualmente cuesta los créditos de su duración, y también uno que solo contiene música. Una ejecución que falla antes del procesamiento, o que el servicio rechaza, no cuesta nada, y una consulta repetida de un trabajo terminado nunca se cobra dos veces.
La precisión depende de la grabación y no de la herramienta. El habla clara grabada cerca de un micrófono, con una persona hablando a la vez, se transcribe muy bien, incluidos nombres y términos técnicos. La precisión baja cuando varias personas hablan a la vez, cuando hay música fuerte o tráfico detrás de la voz, cuando el micrófono está lejos y con acentos regionales marcados. El reconocedor actualmente solo admite chino simplificado e inglés, así que el habla en otros idiomas no es utilizable. Los números, las marcas y los nombres propios son los errores más comunes, por eso el resultado es editable antes de descargarlo. Trata la salida como un primer borrador rápido que te ahorra la mayor parte de la escritura, no como un archivo que publicas sin leerlo.
Puedes subir audio como MP3, WAV, M4A, AAC, FLAC u OGG, o vídeo como MP4, MOV, MKV, WebM, M4V o MPEG. El límite de subida es de 30 MB. El límite de duración depende de tu plan: los invitados pueden transcribir hasta 2 minutos en una ejecución, las cuentas gratuitas hasta 10 minutos y Pro hasta 30 minutos. Como el vídeo pesa mucho más que el audio a la misma duración, un vídeo de 30 MB puede ser más corto de lo que permite el límite de duración. Para grabaciones largas, extrae primero el audio con nuestra herramienta Vídeo a MP3, que también funciona en el navegador, y luego sube el archivo de audio mucho más pequeño. Si un archivo es demasiado largo de una pieza, divídelo y ejecuta cada parte por separado.
Sí, esta herramienta funciona de forma diferente a nuestras herramientas del navegador. Tu archivo se sube a nuestro servidor y se reenvía a Volcengine AI MediaKit, donde se ejecuta el reconocimiento de voz, y el texto reconocido se devuelve a tu navegador. El archivo subido no se almacena como archivo multimedia en nuestro servidor y no se genera ningún enlace de descarga para él. Esto significa que la herramienta no puede funcionar sin conexión ni sin una conexión. Si tu grabación contiene algo confidencial, recuerda que sí sale de tu dispositivo. Para trabajos que nunca deban subirse, usa nuestras herramientas del navegador, que se ejecutan por completo en tu propio navegador, por ejemplo el Convertidor de subtítulos, o un programa de transcripción local.
Sí. Cuando termina la ejecución obtienes una vista previa de toda la transcripción con sus códigos de tiempo, y puedes corregir nombres, números y redacción directamente en ese cuadro antes de guardar. Los botones de descarga siempre exportan lo que haya en el cuadro en ese momento, así que los archivos SRT, VTT y TXT coinciden con tus cambios. Si solo necesitas el texto, descarga la versión TXT o cópialo directamente de la vista previa. Si necesitas que los subtítulos se incrusten en la imagen para que siempre sean visibles, descarga aquí el SRT y luego usa nuestra herramienta Añadir subtítulos, que se ejecuta en tu navegador y también puede cambiar el estilo de la fuente, el color y la posición antes de exportar el vídeo.
SRT es el formato de subtítulos más aceptado. Casi todos los reproductores de vídeo, editores y plataformas sociales lo leen, por eso es el predeterminado para subir subtítulos. VTT es el formato que usan el vídeo web y el elemento de vídeo HTML, y admite algunas funciones de estilo adicionales, así que es la elección correcta para un reproductor en un sitio web o para una plataforma que pide un archivo WebVTT. TXT son solo las palabras habladas en orden de lectura con los códigos de tiempo eliminados, que es lo que quieres cuando el texto va a un documento, una entrada de blog, un conjunto de notas o un índice de búsqueda en lugar de volver a un vídeo. Los tres se generan a partir de la misma transcripción, así que el texto es idéntico y solo cambia el empaquetado.

Obtén subtítulos de tu vídeo

Texto con tiempos que puedes descargar como SRT, VTT o TXT. No necesitas cuenta para probarlo.

Sube un archivo