Distil-Whisper large-v3

Free.ai (self-hosted) · stt · ~500 žetonai minute

Numeskite garso ar vaizdo failą arba įklijuokite URL žemiau

~500 žetonai minute

Distil-Whisper large-v3 yra a kalbos modelis sukurtas HuggingFace. Stipriausi ties Real-time transcription, large-volume batch STT.. Savarankiškas Free.ai GPU – bėga nemokamai nuo savo kasdienių žetonų baseinas ({tpm__markes} per minutę). Išleistas pagal MIT - leidžiamas komercinis naudojimas Free.ai.

Naudoti per API

Suderinama su OpenAI REST API. Generuokite raktą ir paskambinkite šiam modeliui per kelias sekundes.

curl -X POST https://api.free.ai/v1/stt/ \
  -H "Authorization: Bearer sk-free-..." \
  -H "Content-Type: application/json" \
  -d '{"model":"distil-whisper-large-v3","audio_url":"https://..."}'
API dokumentacija Gauti API raktą

Dažnai užduodami klausimai

Distil-Whisper large-v3 transcribes spoken audio into text. Upload an MP3, WAV, M4A, or video file and Distil-Whisper large-v3 returns the full transcript plus optional SRT/VTT subtitles with timestamps.

Distil-Whisper large-v3 handles dozens of languages - Whisper-family models cover 90+, others vary. Pick "auto-detect" or specify the language for highest accuracy.

Žodžių klaidų lygis yra 5-10% švaraus anglų garso, 10-20% garsiai ar akcentuotas garso. Dideli variantai tos pačios architektūros daro prasmingai geriau kietais atvejais - pasirinkti didesnis, kai garso yra grubus.

Taip - kiekvienas segmentas apima pradžios/galutinės žymes. Eksportuoti kaip SRT ar VTT ir laiko žemėlapį tiesiai į savo vaizdo įrašą.

Distil-Whisper large-v3 veikia mūsų pačių GPU prieš savo kasdien nemokamą baseinas pirmą; $5 → 200,000 mokama žetonų po to. Apie ~500 žetonų per minutę.

MP3, WAV, M4A, FLAC, OGG, plius video (MP4, MOV, WebM) - mes ištraukiame garso. Maks. 500 MB vienam įkelimui. Ilgesni failai? Split with /audio/cut/ or use /v1/stt/partch/.

Garsiakalbio diarizacija yra atskiras leidimas - įjungti "dializuoti" /trantracter/. Distil-Whisper large-v3 tvarko transkripciją; Diarizavimo etiketes kiekviename segmente su Garsiakalbiu 1 / Garsiakalbiu 2 / ir tt

Taip - /partch/ priima aplanką garso failų. Kiekvienas stenogramos failas / paskyra /?tab=istorija su originalu failo pavadinimu. Aplanko- eilės išsaugojimui naudoti API.

Taip - Padėkite garso įrašą /v1/stt/tractor/ su modeliu="Distil-Whisper large-v3". Grįžta JSON su tekstu + segmentai + žodžio lygio žymos. /api/ turi visą nuorodą.

Savarankiškai priimti modeliai išlaikyti garso mūsų GPU; premija perduoti per su DPA. Audio yra ištrinta po akcijų akcijų-window (24h anon, 7d prisijungė). Mes ne mokyti jūsų įėjimai.

Taip - Free.ai suteikia komercinį transkriptų naudojimą. Jums reikia teisių į įkeltą garsą (savo įrašymo, licencijuotos medžiagos ar turinio su sutikimu).

Realaus laiko faktorius yra maždaug 0,05-0,2× - 60 minučių podcast transliuoja per 3-12 minučių. Premium modeliai dažnai baigiasi greičiau. Naudokite eilės mygtuką uždaryti kortelę.

Like this tool? Share it!

Įvertinti šį puslapį