Distil-Whisper large-v3

Free.ai (self-hosted) · stt · ~500 tokens per minute

Ispusti audio ili video datoteku, ili zalijepi URL ispod

~500 tokens per minute

Distil-Whisper large-v3 je a model govor-u-tekst izgrađen od HuggingFace. Najjača na Real-time transcription, large-volume batch STT.. Free.ai GPU-a — radi besplatno protiv vašeg dnevnog token poola (500 tokens u minuti). Objavljeno pod licencom MIT - komercijalna upotreba dozvoljena pod licencom Free.ai.

Korištenje putem API

OpenAI-kompatibilni REST API. Generiraj ključ i pozovi ovaj model u sekundi.

curl -X POST https://api.free.ai/v1/stt/ \
  -H "Authorization: Bearer sk-free-..." \
  -H "Content-Type: application/json" \
  -d '{"model":"distil-whisper-large-v3","audio_url":"https://..."}'
API dokumentacija Pribavi API ključ

Često postavljana pitanja

Distil-Whisper large-v3 transkripira govorenu audio u tekst. Učitaj MP3, WAV, M4A, ili video datoteku i Distil-Whisper large-v3 vraća potpuni transkript plus opcionalne SRT/VTT titlove sa vremenskim oznakama.

Distil-Whisper large-v3 handles dozens of languages - Whisper-family models cover 90+, others vary. Pick "auto-detect" or specify the language for highest accuracy.

Stopa grešaka u riječima je 5-10% na čistom engleskom audio, 10-20% na bučnom ili naglašenom audio. Velike varijante iste arhitekture rade značajno bolje na teškim slučajevima - odaberite veće kada je audio grub.

Da - svaki segment uključuje početne/zadnje vremenske pečate. Izvozi kao SRT ili VTT i vremenski markeri će se direktno prikazati na video.

Distil-Whisper large-v3 radi na našim vlastitim GPU-ima protiv vašeg dnevnog besplatnog bazena prvo; $5 → 200.000 plaćenih žetona nakon toga. Oko ~500 žetona po minuti.

MP3, WAV, M4A, FLAC, OGG, plus video (MP4, MOV, WebM) - izvlačimo audio. Maksimalno 500 MB po uploadu. Dulje datoteke? Podijelite sa /audio/cut/ ili koristite /v1/stt/batch/.

Diarizacija govornika je zasebni prolaz - prebacite "diarize" na /transcribe/. Distil-Whisper large-v3 se bavi transkripcijom; diarizacija označava svaki segment sa Speaker 1 / Speaker 2 / itd.

Da - /batch/ prihvaća direktorij audio datoteka. Svaki transkript završava u /account/?tab=history sa originalnim imenom datoteke. Za očuvanje stabla direktorija koristite API.

Da - POST audio u /v1/stt/transcribe/ sa modelom "Distil-Whisper large-v3". Vraća JSON sa tekstom + segmentima + vremenskim oznakama na nivou riječi. /api/ ima punu referencu.

Modeli koji se sami hostaju zadržavaju zvuk na našim GPU-ovima; premium prolazi kroz DPA. Zvuk se briše nakon prozora za dijeljenje (24h anonimno, 7d prijavljeno). Mi ne treniramo na vašim ulazima.

Da - Free.ai dozvoljava komercijalnu upotrebu transkripta. Trebate prava na audio koji ste učitali (vaša vlastita snimka, licencirani materijal, ili sadržaj sa pristankom).

Faktor realnog vremena je otprilike 0.05-0.2× - 60-minutni podcast se transkribira za 3-12 minuta. Premium modeli često završavaju brže. Koristite dugme reda za zatvaranje kartice.

Volim Free.ai?

Ocijeni ovu stranicu