Distil-Whisper large-v3

Free.ai (self-hosted) · stt · ~500 tokens per minute

Slip en lyd- eller videofil, eller indsæt en URL nedenfor

~500 tokens per minute

Distil-Whisper large-v3 er a tale- til- tekst- model bygget af HuggingFace. Stærkeste på Real-time transcription, large-volume batch STT.. Self-hostet på Free.ai GPU'er kører gratis mod din daglige token pool (500 tokens pr. minut). Udgivelse under MIT - kommerciel brug tilladt på Free.ai.

Brug via API

OpenAI-kompatibel REST API. Generer en nøgle og ring til denne model på få sekunder.

curl -X POST https://api.free.ai/v1/stt/ \
  -H "Authorization: Bearer sk-free-..." \
  -H "Content-Type: application/json" \
  -d '{"model":"distil-whisper-large-v3","audio_url":"https://..."}'
API- dokumentation Hent API- nøgle

Ofte stillede spørgsmål

Distil-Whisper large-v3 transskriberer talt lyd til tekst. Upload en MP3, WAV, M4A, eller videofil og Distil-Whisper large-v3 returnerer den fulde udskrift plus valgfri SRT / VTT undertekster med tidsstempler.

Distil-Whisper large-v3 handles dozens of languages - Whisper-family models cover 90+, others vary. Pick "auto-detect" or specify the language for highest accuracy.

Word-fejl rate er 5-10% på ren engelsk lyd, 10-20% på støjende eller accentet lyd. Store varianter af samme arkitektur gør meningsfuldt bedre på hårde kasser - vælge større, når lyden er ru.

Ja - hvert segment omfatter start/send tidsstempler. Eksportér som SRT eller VTT og gange kortet direkte på din video.

Distil-Whisper large-v3 kører på vores egne GPU'er mod din daglige gratis pool først; $ 5 → 200.000 betalte tokens efter det. Om ~ 500 tokens per minut.

MP3, WAV, M4A, FLAC, OGG, plus video (MP4, MOV, WebM) - vi udtrækker lyden. Max 500 MB per upload. Længere filer? Split med /audio/cut/ eller brug /v1/stt/batch/.

Højttalerdiarisering er en separat pass - skifte "diarize" på /transcribe /. Distil-Whisper large-v3 håndterer transskription; diarisering etiketter hvert segment med højttaler 1 / højttaler 2 / etc.

Ja - /batch/ accepterer en mappe med lydfiler. Hver udskrift lander i /account/?tab=historie med det oprindelige filnavn. For mappe- træ bevaring bruge API.

Ja - POST din lyd til /v1/stt/transcribe/ with model="Distil-Whisper large-v3". Returnerer JSON med tekst + segmenter + ord- niveau tidsstempler. /api / har den fulde reference.

Selvværd modeller holde lyd på vores GPU'er; luksus passere igennem med en DPA. Lyd slettes efter aktie-vinduet (24h anon, 7d sign-in). Vi træner ikke på dine indgange.

Ja - Free.ai giver kommerciel brug af udskrifter. Du har brug for rettigheder til den lyd, du uploadede (din egen optagelse, licenseret materiale eller indhold med samtykke).

Real-time faktor er omkring 0.05-0.2× - en 60-minutters podcast transcribes på 3-12 minutter. Premium modeller ofte afslutte hurtigere. Brug køknappen til at lukke fanen.

Love Free.ai? Tell your friends!

Bedøm denne side