faster-whisper large-v3-turbo

Free.ai (self-hosted) · stt · ~500 tokens per minute

Suelta un archivo de audio o vídeo, o pega una URL debajo

~500 tokens per minute

faster-whisper large-v3-turbo es a Modelo de discurso a texto construido por OpenAI / SYSTRAN. Más fuerte en Accurate transcription. Auto-alojado en Free.ai GPUs — funciona gratis contra su piscina diaria de tokens (500 tokens por minuto). Liberado bajo MIT - uso comercial permitido en Free.ai.

Uso a través de API

API REST compatible con OpenAI. Genera una llave y llama a este modelo en segundos.

curl -X POST https://api.free.ai/v1/stt/ \
  -H "Authorization: Bearer sk-free-..." \
  -H "Content-Type: application/json" \
  -d '{"model":"whisper","audio_url":"https://..."}'
Documentación API Obtener clave API

Preguntas frecuentes

faster-whisper large-v3-turbo transcribe audio hablado en texto. Sube un archivo MP3, WAV, M4A o vídeo y faster-whisper large-v3-turbo devuelve la transcripción completa más subtítulos opcionales SRT/VTT con marcas de tiempo.

faster-whisper large-v3-turbo handles dozens of languages - Whisper-family models cover 90+, others vary. Pick "auto-detect" or specify the language for highest accuracy.

La tasa de error de palabra es del 5-10% en audio inglés limpio, del 10-20% en audio ruidoso o acentuado. Las grandes variantes de la misma arquitectura hacen significativamente mejor en casos duros - elija más grande cuando el audio es rudo.

Sí - cada segmento incluye marcas de tiempo de inicio/final. Exportar como SRT o VTT y el mapa de tiempos directamente en su vídeo.

faster-whisper large-v3-turbo se ejecuta en nuestras propias GPUs contra su piscina gratuita diaria primero; $5 → 200.000 fichas pagadas después de eso. Alrededor de ~500 fichas por minuto.

MP3, WAV, M4A, FLAC, OGG, más vídeo (MP4, MOV, WebM) - extraemos el audio. Máximo 500 MB por carga. Archivos más largos? Dividir con /audio/cut/ o utilizar /v1/stt/batch/.

Diarización de altavoz es un pase separado - cambiar "diarizar" en /transcribir/. faster-whisper large-v3-turbo maneja la transcripción; etiquetas de diarización cada segmento con altavoz 1 / altavoz 2 / etc.

Sí - /batch/ acepta una carpeta de archivos de audio. Cada transcripción aterriza en /account/?tab=historia con el nombre de archivo original. Para la preservación de la carpeta-árbol utilice la API.

Sí - POST su audio a /v1/stt/transcrib/ con model="faster-whisper large-v3-turbo". Devuelve JSON con texto + segmentos + marcas de tiempo de nivel de palabra. /api/ tiene la referencia completa.

Los modelos auto-anfitriones mantienen audio en nuestras GPUs; pase premium con un DPA. El audio se elimina después de la ventana de intercambio (24h anon, 7d first-in). No entrenamos en sus entradas.

Sí - Free.ai concede el uso comercial de transcripciones. Necesita derechos sobre el audio que subió (su propia grabación, material licenciado o contenido con consentimiento).

El factor en tiempo real es aproximadamente 0,05-0.2× - un podcast de 60 minutos se transcribe en 3-12 minutos. Los modelos premium a menudo terminan más rápido. Utilice el botón de cola para cerrar la pestaña.

¿Ama a Free.ai? ¡Dile a tus amigos!

Calificar esta página