Fal Speech-to-Text

Free.ai · stt · ~500 tokens por minute

Solte un ficheiro de son ou vídeo, ou apegue un URL en baixo

~500 tokens por minute
Corre libremente nas nosas GPU. Actualizar para Fal Speech-to-Text →

Fal Speech-to-Text é a modelo de voz a texto. Enrutado a través de modelos externos - ~500 tokens por minuto (50% de markup sobre o custo ascendente).

Usar a API

API REST compatíbel con OpenAI. Xere unha chave e chame a este modelo en segundos.

curl -X POST https://api.free.ai/v1/stt/ \
  -H "Authorization: Bearer sk-free-..." \
  -H "Content-Type: application/json" \
  -d '{"model":"premium/speech-to-text","audio_url":"https://..."}'
Documentación da API Obter a chave da API

Preguntas frecuentes

Fal Speech-to-Text transcríbe o son falado en texto. Envíe un ficheiro MP3, WAV, M4A ou vídeo e Fal Speech-to-Text devolve a transcrición completa máis os subtítulos SRT/ VTT opcionais con marcas de tempo.

Fal Speech-to-Text handles dozens of languages - Whisper-family models cover 90+, others vary. Pick "auto-detect" or specify the language for highest accuracy.

A taxa de erros de palabras é do 5- 10% no son inglés puro, do 10- 20% no son ruidoso ou acentuado. As variantes grandes da mesma arquitectura funcionan significativamente mellor nos casos duros - escolla máis grandes cando o son é áspero.

Si, cada segmento inclúe marcas de tempo de inicio/ fin. Exportar como SRT ou VTT e os tempos mapearanse directamente no vídeo.

Fal Speech-to-Text is a premium transcription engine. About ~500-1,500 tokens per minute of audio, shown live before you generate. Self-hosted transcription runs free on your 30,000-token daily pool; premium models are pay-as-you-go, with top-ups from $1.

MP3, WAV, M4A, FLAC, OGG, e vídeo (MP4, MOV, WebM) - extraemos o son. Máximo 500 MB por envío. Ficheiros máis longos? Dividir con / audio/ cut / ou usar / v1/ stt/ batch /.

A diarización do falante é unha pasada separada - conmute « diarize » en / transcribe /. Fal Speech-to-Text xestiona a transcrición; a diarización etiqueta cada segmento co falante 1 / falante 2 / etc.

Si - / batch / acepta un cartafol de ficheiros de son. Cada transcrición atópase en / account /? tab=history co nome do ficheiro orixinal. Para preservar a árbore de cartafoles use a API.

Si - POST o audio a / v1/ stt/ transcribe / con model=" Fal Speech-to-Text ". Devolve JSON con texto + segmentos + marcas de tempo a nivel de palabra. / api / ten a referencia completa.

Os modelos auto- hospedados manteñen o son nas nosas GPU; os premium pasan a través cun DPA. O son é borrado despois da fiestra de compartición (24h anon, 7d de acceso). Non adestramos coas túas entradas.

Si - Free.ai concede o uso comercial das transcricións. Precisa dos dereitos do son que enviou (a súa propia gravación, material licenciado ou contido con permiso).

Real-time factor is roughly 0.05-0.2× - a 60-minute podcast transcribes in 3-12 minutes. Premium models often finish faster. Use the queue button to close the tab.

Amas a Free.ai?

Cualificar esta páxina