Speech to Text

Uso comercial OK 380+ modelos Sin marca de agua No es necesario inscribirse
Modelo:
+ GPT-5, Claude, Gemini
Cargue un archivo de audio o vídeo —o pegue una URL— y obtenga una transcripción limpia con marcas de tiempo. Diarización del altavoz, exportación de subtítulos SRT/VTT, más de 100 idiomas con autodetección. Escalas de costos exactamente con longitud de clip. Powered by Whisper large-v3 and Parakeet (auto-hosted), además de Wizper premium y ElevenLabs STT.

Arrastre y suelte audio/vídeo, o haga clic para navegar

MP3, WAV, MP4, WebM, M4A — hasta 500MB

- - -
Whisper large-v3 — 99 idiomas, la mejor precisión de su clase.
Estimación de token para este clip
-
YouTube, Instagram, TikTok, Spotify y más de 1.300 plataformas
El costo de transcripción de URL se basa en la duración real del clip — cotizamos después de la descarga. Espere ~500 tokens/minuto en Whisper.
Grabación: 0:00

Transcripción en tiempo real con el micrófono

Transcripción

Transcribir tu audio...

Esto puede tomar un momento para archivos más largos.

Lo que las personas transcriben con Free.ai

Entrevistas + podcasts

Diarización etiqueta cada altavoz. Exportar SRT directamente a su editor de vídeo, o texto plano para una redacción de artículo.

Títulos automáticos + subtítulos

Sube una carga de YouTube o TikTok, elige SRT o WebVTT y graba los subtítulos con /video/subtitle/. Flujo de trabajo de subtítulos único.

Notas para las reuniones

Upload a Zoom/Teams recording - get transcript + speaker labels. Pair with /write/summarize/ for bullet-point minutes.

Conferencias + lecciones

Transcribe una conferencia de 90 minutos, luego usa /study/flashcards/ o /write/summarize/ para convertirlo en material de estudio.

Audio en idioma extranjero

Whisper auto-detecta 99 idiomas. Transcribir en el original, a continuación, enviar el texto a través de /translate/ para saltar idiomas.

Legal + médico

Marcas de tiempo, etiquetas de altavoz, exportación de JSON con el tiempo de inicio/final de cada palabra — reporter de corte preciso o preparación de notas clínicas.

Cómo se compara la transcripción Free.ai

Lo que consigues Free.ai Otter.ai Descript Rev.com
Uso diario gratuito5K+ tokens/day300 minutes/mo1 hr/month-
MotorWhisper large-v3, ParakeetProprietaryProprietaryHuman + AI
Idiomas99English-focused2230+
Diarización del altavoz
Exportación SRT / VTTPaidPaid
API públicaLimitedLimited
Transmisión en vivo STT (gratuito) Paid--
Se requiere inscripciónNoYesYesYes
Las cifras de los competidores reflejan los niveles libres enumerados públicamente a partir de 2026. Compruebe cada proveedor para los planes actuales.
Opciones avanzadas
Resultado
Los picos se están agotando. Obtener más tokens
¿Quieres mejores resultados? Modelos premium (GPT-5, Claude, Gemini) ofrecen una mayor calidad. Ver los planes

❤️ Love this tool? Share it!

Regístrate para obtener un enlace de referencia y ganar 30.000 fichas por amigo.

¿Quieres más? Regístrate gratis por 30K tokens/día + 10K bonus
Regístrate gratis

Procesando su solicitud...

Best free speech to text tool. Upload MP3, WAV, MP4 or record live. Auto-detect language. Speaker diarization. No sign up required.

Cómo usar Speech to Text

1
Introduzca su entrada

Escriba texto, cargue un archivo o describa lo que desee. No necesita cuenta.

2
Haga clic en generar

Nuestra IA procesa su solicitud en segundos utilizando los mejores modelos de código abierto.

3
Descargar & compartir

Descarga, copia o comparte tu resultado. Gratis para uso personal y comercial.

Utilice esta herramienta a través de API

Automatice esta herramienta desde su propio código. Endpoint REST compatible con OpenAI, Autentica de torre de portadora, no se requiere SDK adicional. Los costos de la conexión coinciden con la interfaz web.

curl -X POST https://api.free.ai/v1/stt/ \
  -H "Authorization: Bearer sk-free-..." \
  -H "Content-Type: application/json" \
  -d '{"file": "@audio.mp3", "language": "auto"}'

Speech to Text - FAQ

Free.ai ofrece un discurso Whisper con excelente precisión, 99 idiomas, exportación de subtítulos, detección de altavoces y captura de micrófonos en vivo, completamente gratis.

Cargar un archivo de audio o vídeo (MP3, WAV, MP4, M4A), haga clic en Transcribir y obtenga un discurso preciso para el texto en segundos.

Sí. Pegue cualquier URL de YouTube en la pestaña URL y Speech To Text de voz a texto extrae el audio y lo convierte. Funciona con Instagram, TikTok, Spotify y 1.300+ plataformas.

Sí. Autodetectar o seleccionar entre 99 idiomas. Nuestro Voz a texto maneja bien los acentos, el ruido de fondo y el audio en lenguaje mixto.

Sí. Seleccione varios archivos de audio a la vez, cada uno se envía a través de un texto con seguimiento de progreso y los resultados se pueden descargar por separado o combinados.

Sí. El discurso a la API de texto en /api/ es compatible con OpenAI. Sube audio programáticamente y recibe JSON con la transcripción, el idioma y las marcas de tiempo.

Sí. Toggle Speaker Detection antes de subir y la salida de voz a texto está etiquetada por altavoz (Slacker 1, Speaker 2...). Agrega 50% al costo token.

El Voz a texto acepta archivos de hasta 500MB por carga. Para contenido de varias horas, divida primero el audio en trozos.

Muy precisa para el audio claro — típicamente 95%+ precisión de palabra en inglés con nuestro motor Whisper gran v3. La calidad depende de la claridad de audio, el acento y el ruido de fondo.

Sí. La transcripción es completamente editable en su lugar. Corrija errores, reformate y copie/descarga como TXT, SRT o VTT.

Sí. El audio se procesa en nuestras propias GPUs y se elimina después de que el discurso se completa. Nada se almacena a largo plazo, se comparte o se utiliza para el entrenamiento.

Sí. Sube un archivo de audio o vídeo en /chat/ y pídele a la IA que lo transcriba — combina el discurso con el texto con preguntas de seguimiento y resumen en un flujo de trabajo.

Inscríbete gratis — 30.000 fichas/día

Crear cuenta gratuita

No se requiere tarjeta de crédito

¿Cómo calificaría a esta herramienta?

Love this tool? Share it!