Traductor de vídeo IA

Uso comercial OK 380+ modelos Sin marca de agua No es necesario inscribirse
Modelo:
+ GPT-5, Claude, Gemini
Repost your YouTube in Spanish, Hindi, French — with your face actually saying the words. Upload a video, pick a target language + voice, and we transcribe, translate, re-voice, and mix the new audio back into the original clip. Toggle lip-sync to also re-render the mouth.

Arrastre y suelte su vídeo aquí, o haga clic para navegar

MP4, MOV, WebM hasta 100MB · clips de menos de 5 minutos de trabajo más rápido

· ·
~1,500 tokens por minuto de vídeo (ruta de audio) · ~3,000/min con sincronización de labios.
Extraer audio de vídeo...
Vídeo traducido listo
Show transcript + translation
Original (transcrito)

                    
Traducido

                    
Descargar MP4

Donde el traductor de vídeo paga

Volver a publicar YouTube a nivel mundial

Una carga en inglés → español, hindi, francés, portugués, indonesio vuelve a subir con la voz del orador en cada idioma. 4× el público para una producción.

Localización de los cursos

Los educadores en línea doblan un curso de 50 videos en 10 idiomas durante la noche. La opción de sincronización de labios hace que los segmentos de cabeza parlante se sientan nativos, no subtitulados.

Localizar anuncios

Ejecute el mismo testimonio de producto a través de 10 cuentas de anuncios específicas para cada país. El mismo actor, la misma toma, audio nativo por mercado, sin una repetición.

Cómo funciona el traductor de vídeo

Medida 1

Extraer audio

El servidor ffmpeg saca una pista de MP3 limpia de su carga. Rápido — se ejecuta en el API VPS.

Medida 2

Transcribir

Whisper convierte el audio en texto con detección automática del lenguaje. Soporte de 99 idiomas fuera de la caja.

Medida 3

Translate + re-voice

MadLAD se traduce al idioma de destino; Kokoro lo dice en la voz que elegiste entre 174 opciones.

Medida 4

Mix back + (optional) lip-sync

ffmpeg reemplaza el audio original con la nueva pista. Si la sincronización de labios está activada, Sync Lipsync v2 vuelve a renderizar la boca para que coincida.

Consejos para el vídeo más limpio traducido

  • Escenas multi-parlantes confunden la transcripción y la sincronización de labios pasan ambos.
  • Borrar audio a -6 dB. La música de fondo o el ruido reducen la precisión de la transcripción.
  • Los clips de menos de 5 minutos renderizan en 2-5 minutos (camino de audio) o 5-15 minutos (con sincronización de labios).
  • Español, francés, alemán, portugués, italiano tienen las opciones de voz más naturales de Kokoro. Hindi, árabe, japonés, coreano, chino también trabajan.
Opciones avanzadas
Resultado
Los tokens se están agotando. Obtener más tokens
¿Quieres mejores resultados? Modelos premium (GPT-5, Claude, Gemini) ofrecen una mayor calidad. Ver los planes

❤️ Love this tool? Share it!

Regístrate para obtener un enlace de referencia y ganar 25.000 tokens por amigo.

¿Quieres más? Regístrate gratis por 30K tokens/día + 10K bonus
Regístrate gratis

Procesando su solicitud...

Vuelve a publicar tu YouTube en español, hindi, francés — con la voz del orador en el idioma de destino. Susurra transcripciones, MadLAD traduce, Kokoro re-voces, ffmpeg mezcla de nuevo. Opcional Sincronización Lipsync v2 vuelve a renderizar la boca.

Cómo usar Traductor de vídeo IA

1
Introduzca su entrada

Escriba texto, cargue un archivo o describa lo que desee. No necesita cuenta.

2
Haga clic en generar

Nuestra IA procesa su solicitud en segundos utilizando los mejores modelos de código abierto.

3
Descargar & compartir

Descarga, copia o comparte tu resultado. Gratis para uso personal y comercial.

Utilice esta herramienta a través de API

Automatice esta herramienta a partir de su propio código. Endpoint REST compatible con OpenAI, Auth Token de Portador, no requiere SDK adicional. Los costos de token coinciden con la interfaz web.

curl -X POST https://api.free.ai/v1/video/generate/ \
  -H "Authorization: Bearer sk-free-..." \
  -H "Content-Type: application/json" \
  -d '{"prompt": "A cat playing piano", "duration": 4}'

Traductor de vídeo IA — FAQ

Sube cualquier vídeo (un clip de YouTube, una conferencia de curso, un testimonio de producto) y lo traducimos al idioma de destino con la voz del altavoz re-sintetizado en ese idioma. Opcionalmente, lip-sync vuelve a renderizar la boca para que realmente coincida con el nuevo audio. El tono: volver a publicar su YouTube en español, hindi, francés — con su cara realmente diciendo las palabras.

Cinco pasos ejecutan el lado del cliente en secuencia: (1) ffmpeg extrae un MP3 limpio del vídeo, (2) Whisper lo transcribe (autodetecta 99 idiomas), (3) MadLAD traduce el texto, (4) Kokoro habla la traducción en la voz que eligió, (5) ffmpeg mezcla el nuevo audio en el vídeo original, reemplazando la pista original. Con la sincronización de labios, un sexto paso conduce el resultado a través de Sync Lipsync v2 para volver a renderizar la boca.

Video Dubbing siempre ejecuta la tubería completa de sincronización de labios — es la opción premium de preservación de identidad. Video Translator hace que la sincronización de labios opt-in: saltarlo para una ejecución 3× más rápida, ~50% más barato que es perfecto para el contenido de voz sobre estilo donde la sincronización bucal perfecta no es crítica (podcasts, grabaciones de pantalla, videos de cocina, cualquier cosa donde el altavoz no está en primer plano todo el tiempo).

La ruta de solo audio se ejecuta casi por completo en modelos auto-anfitriones (ffmpeg + Whisper + MadLAD + Kokoro), por lo que cabe dentro de su token diario para clips cortos. Lip-sync utiliza el modelo premium Sync Lipsync v2 y requiere tokens comprados. Estimación: ~1,500 tokens por minuto de vídeo para la ruta de audio, ~3,000/min con lip-sync.

Los desplegables exponen 20 idiomas de alta demanda (español, francés, alemán, italiano, portugués, holandés, polaco, ruso, turco, árabe, hebreo, hindi, chino, japonés, coreano, vietnamita, indonesio, tailandés, sueco, inglés). MadLAD técnicamente soporta 450+; ping nosotros si usted necesita otros.

Sí — el selector de voz tira de las 174 voces de Kokoro en 37 idiomas. Cada voz está etiquetada con una muestra para que pueda audicionar antes de comprometerse. Coincide el género de voz con el altavoz para obtener el resultado más natural.

No — Kokoro elige entre 174 voces de stock, no un clon del altavoz original. Para la clonación de voz que conserva la identidad, ejecute nuestra herramienta /voice/clone/ primero para capturar la voz del altavoz, luego utilice un flujo de trabajo personalizado. Clonación de voz + traducción automática en una sola tubería está en la hoja de ruta.

Los clips de hasta 100MB procesan bien. Menos de 5 minutos se renderizan en 2-5 minutos para la ruta de audio, 5-15 minutos con sincronización de labios. Para videos más largos, se dividen en escenas, se traducen cada uno y se recombinan en /video/editor/.

MP4, MOV, WebM, MKV hasta 100MB. Un solo altavoz orientado hacia adelante da la transcripción más limpia y (si lo habilita) la mejor sincronización de labios. La música de fondo o varios altavoces reducen la precisión de la transcripción.

No por Traductor de vídeo IA — reemplaza el audio, no las imágenes. Para grabar subtítulos traducidos en el vídeo, ejecute nuestra herramienta /video/caption/ en el resultado. Para exportar un archivo de subtítulos SRT/VTT, utilice /transcribir/ en el vídeo original.

No. Las cargas se eliminan a los pocos minutos del renderizado. La salida se encuentra en nuestra CDN durante 24 horas (7 días para los usuarios pagados) en el enlace share, luego se elimina.

No como un único punto final — encadenar los existentes en vivo: POST /v1/video/to-audio/ → /v1/stt/ → /v1/translate/ → /v1/tts/ → /v1/video/add-audio/, luego opcionalmente /v1/video/lip-sync/. Recetas completas de rizos para cada uno en /api/. La frontend orquesta esta cadena exacta.

Regístrate gratis por 30.000 tokens

Crear cuenta gratuita

No se requiere tarjeta de crédito

¿Cómo calificaría a esta herramienta?

Love this tool? Share it!