Fal Speech-to-Text

Free.ai · stt · ~500 Token pro minute

Eng Audio- oder Videodatei zéien oder eng URL hei ënnendrënner setzen

~500 Token pro minute
D'Géigend ass frësch a frësch. Aktualiséieren fir Fal Speech-to-Text →

Fal Speech-to-Text is a Sprooch-zu-Text-Modell. Routed through external models - ~500 tokens pro Minutt (50% markup over upstream cost).

D'API

OpenAI-kompatibel REST API. Generéiert e Schlëssel an rufft dat Modell an e puer Sekonnen un.

curl -X POST https://api.free.ai/v1/stt/ \
  -H "Authorization: Bearer sk-free-..." \
  -H "Content-Type: application/json" \
  -d '{"model":"premium/speech-to-text","audio_url":"https://..."}'
Dokumentatioun API Schlëssel

Häufig gestallte Froen

Fal Speech-to-Text transkribéiert gesot Audio an Text. Luet eng MP3, WAV, M4A oder Videodatei erop an Fal Speech-to-Text gëtt déi voll Transkriptioun plus optional SRT/VTT Ënnertitelen mat Zäitstempelen zréck.

Fal Speech-to-Text handles dozens of languages - Whisper-family models cover 90+, others vary. Pick "auto-detect" or specify the language for highest accuracy.

D'Wäertfehlerrate ass 5-10% bei engem gudden engleschen Audio, 10-20% bei engem lauten oder akzentuéierten Audio. Grouss Varianten vun der selwechter Architektur sinn op schwéiere Fäll bedeitend besser - wielt méi grouss wann den Audio rau ass.

Ja - all Segment enthält Start-/Ennzäitstempelen. Exportéiert als SRT oder VTT an d'Zäit gëtt direkt op Äre Video gesat.

Fal Speech-to-Text ass eng Premium-Transkriptiounsmaschinn. Ëm ~500-1500 Token pro Minutt Audio, live gewisen ier Dir generéiert. Selbst-gehost Transkriptioun leeft gratis op Ärem 30.000-Token-daglecher Pool; Premium Modeller sinn pay-as-you-go, mat Top-ups vun $1.

MP3, WAV, M4A, FLAC, OGG, plus Video (MP4, MOV, WebM) - mir extrahéieren den Audio. Max 500 MB pro Upload. Länger Dateien? Split mat /audio/cut/ oder benotzt /v1/stt/batch/.

Speaker diarization is a separate pass - toggle "diarize" on /transcribe/. Fal Speech-to-Text handles the transcription; diarization labels each segment with Speaker 1 / Speaker 2 / etc.

Ja - /batch/ akzeptéiert en Ordner mat Audiodateien. All Transkriptioun fält an /account/?tab=history mat dem originelle Dateinamen. Fir d'Erhale vum Ordnerbaum benotzt d'API.

Yes - POST your audio to /v1/stt/transcribe/ with model="Fal Speech-to-Text". Returns JSON with text + segments + word-level timestamps. /api/ has the full reference.

Self-hosted models keep audio on our GPUs; premium pass through with a DPA. Audio is deleted after the share-window (24h anon, 7d logged in). We do not train on your inputs.

Ja - Free.ai erlaabt kommerziell Benotzung vun Transkripten. Dir braucht d'Recht op den Audio deen Dir erofgelueden hutt (Äert eege Recording, lizenzéiert Material oder Inhalt mat Zoustëmmung).

Echtzäitfaktor ass ongeféier 0.05-0.2× - e 60-Minuten-Podcast gëtt an 3-12 Minutten transkritéiert. Premium Modeller sinn dacks méi séier fäerdeg. Benotzt d'Këscht-Knäppchen fir d'Tab ze schließen.

Liewe Free.ai? Erzielt Är Frënn!

Dës Säit bewäerten