Distil-Whisper large-v3

Free.ai (self-hosted) · stt · ~500 znaki na minute

Przesuń plik audio lub wideo, lub wklej URL poniżej

~500 znaki na minute

Distil-Whisper large-v3 jest a model mowy do tekstu zbudowany przez HuggingFace. Najsilniejsza w Real-time transcription, large-volume batch STT.. Samodzielnie umieszczony na Free.ai GPU – biegnie wolny od codziennego zbiornika tokenów (500 žetonów za minutę). Wydawane pod MIT - użytkowanie handlowe dozwolone na Free.ai.

Użyj przez API

Kompatybilny z OpenAI REST API. Generuj klucz i zadzwoń po tym modelu w sekundach.

curl -X POST https://api.free.ai/v1/stt/ \
  -H "Authorization: Bearer sk-free-..." \
  -H "Content-Type: application/json" \
  -d '{"model":"distil-whisper-large-v3","audio_url":"https://..."}'
Dokumentacja API Pobierz klucz API

Często zadawane pytania

Distil-Whisper large-v3 transcribe audio w tekst. Wyślij MP3, WAV, M4A, lub plik wideo i Distil-Whisper large-v3 zwraca pełną transkrypcję plus opcjonalne napisy SRT/VTT z czasem.

Distil-Whisper large-v3 handles dozens of languages - Whisper-family models cover 90+, others vary. Pick "auto-detect" or specify the language for highest accuracy.

Wskaźnik błędów jest 5-10% na czystym angielskim audio, 10-20% na głośnym lub akcentowanym audio. Duże warianty tej samej architektury robią znacząco lepiej w trudnych przypadkach - wybierz większe, gdy dźwięk jest surowy.

Tak - każdy segment zawiera czasowe ślady startu i końca. Eksportować jako SRT lub VTT oraz mapę czasów bezpośrednio do swojego wideo.

Distil-Whisper large-v3 biegnie na własne GPUs przeciwko codziennie darmowy basen pierwszy; $5 → 200 000 zapłaconych żetonów po tym. Około ~500 tokena na minutę.

MP3, WAV, M4A, FLAC, OGG, plus video (MP4, MOV, WebM) - wyciągamy dźwięk. Max 500 MB na wysłanie. Długiej pliki? Rozdzielić z /audio/cut/ lub użyć /v1/stt/batch /.

Dializacja głośnika jest oddzielnym przepustką - włączanie "diarize" na /transcribek /. Distil-Whisper large-v3 obsługuje transkrypcję; etykiety diaryzacyjne każdego segmentu z głośnika 1 / głośnika 2 / itd.

Tak - /batch/ akceptuje folder plików audio. Każdy transkrypt wpada w /account /?tab=historya z oryginalnym nazwą pliku. Dla zachowania folderów- drewna używaj API.

Tak - POST audio do /v1/stt/transcribe/ z modelem="Distil-Whisper large-v3". Zwraca JSON z tekstem + segmenty + czasowe szczebla rzędu słowa. /api/ ma pełne odniesienie.

Samodomowe modele trzymają audio na naszych GPU; premium przejść z DPA. Audio jest usuwane po okienku share-okien (24h anon, 7d podpisywanie). Nie trenujemy na wejściu.

Tak - Free.ai przyznaje komercyjne wykorzystanie transkryptów. Potrzebujesz praw do zajętego audio (własny materiał, licencjonowany lub zawartość z zgodą).

W rzeczywistości współczynnik wynosi około 0,05-0,2× - 60 minutowy transkrypt podcast w ciągu 3-12 minut. Modele premium często zakończą się szybciej. Użyj przycisku kolejki, aby zamknąć zakładkę.

Love Free.ai? Tell your friends!

Oceń tę stronę