Distil-Whisper large-v3

Free.ai (self-hosted) · stt · ~500 Token pro minute

Eng Audio- oder Videodatei zéien oder eng URL hei ënnendrënner setzen

~500 Token pro minute

Distil-Whisper large-v3 is a Sprooch-zu-Text-Modell built by HuggingFace. Strongest at Real-time transcription, large-volume batch STT.. Self-hosted on Free.ai GPUs — runs free against your daily token pool (500 tokens pro Minutt). D'Lizenz ass ënner der MIT publizéiert ginn, déi op Free.ai autoriséiert ass.

D'API

OpenAI-kompatibel REST API. Generéiert e Schlëssel an rufft dat Modell an e puer Sekonnen un.

curl -X POST https://api.free.ai/v1/stt/ \
  -H "Authorization: Bearer sk-free-..." \
  -H "Content-Type: application/json" \
  -d '{"model":"distil-whisper-large-v3","audio_url":"https://..."}'
Dokumentatioun API Schlëssel

Häufig gestallte Froen

Distil-Whisper large-v3 transkribéiert gesot Audio an Text. Luet eng MP3, WAV, M4A oder Videodatei erop an Distil-Whisper large-v3 gëtt déi voll Transkriptioun plus optional SRT/VTT Ënnertitelen mat Zäitstempelen zréck.

Distil-Whisper large-v3 handles dozens of languages - Whisper-family models cover 90+, others vary. Pick "auto-detect" or specify the language for highest accuracy.

D'Wäertfehlerrate ass 5-10% bei engem gudden engleschen Audio, 10-20% bei engem lauten oder akzentuéierten Audio. Grouss Varianten vun der selwechter Architektur sinn op schwéiere Fäll bedeitend besser - wielt méi grouss wann den Audio rau ass.

Ja - all Segment enthält Start-/Ennzäitstempelen. Exportéiert als SRT oder VTT an d'Zäit gëtt direkt op Äre Video gesat.

Distil-Whisper large-v3 runs on our own GPUs against your daily free pool first; $5 → 200,000 paid tokens after that. About ~500 tokens per minute.

MP3, WAV, M4A, FLAC, OGG, plus Video (MP4, MOV, WebM) - mir extrahéieren den Audio. Max 500 MB pro Upload. Länger Dateien? Split mat /audio/cut/ oder benotzt /v1/stt/batch/.

Speaker diarization is a separate pass - toggle "diarize" on /transcribe/. Distil-Whisper large-v3 handles the transcription; diarization labels each segment with Speaker 1 / Speaker 2 / etc.

Ja - /batch/ akzeptéiert en Ordner mat Audiodateien. All Transkriptioun fält an /account/?tab=history mat dem originelle Dateinamen. Fir d'Erhale vum Ordnerbaum benotzt d'API.

Yes - POST your audio to /v1/stt/transcribe/ with model="Distil-Whisper large-v3". Returns JSON with text + segments + word-level timestamps. /api/ has the full reference.

Self-hosted models keep audio on our GPUs; premium pass through with a DPA. Audio is deleted after the share-window (24h anon, 7d logged in). We do not train on your inputs.

Ja - Free.ai erlaabt kommerziell Benotzung vun Transkripten. Dir braucht d'Recht op den Audio deen Dir erofgelueden hutt (Äert eege Recording, lizenzéiert Material oder Inhalt mat Zoustëmmung).

Echtzäitfaktor ass ongeféier 0.05-0.2× - e 60-Minuten-Podcast gëtt an 3-12 Minutten transkritéiert. Premium Modeller sinn dacks méi séier fäerdeg. Benotzt d'Këscht-Knäppchen fir d'Tab ze schließen.

Liewe Free.ai? Erzielt Är Frënn!

Dës Säit bewäerten