Distil-Whisper large-v3

Free.ai (self-hosted) · stt · ~500 Μάρκες ανά minute

Ρίξτε ένα αρχείο ήχου ή βίντεο, ή επικολλήστε ένα URL παρακάτω

~500 Μάρκες ανά minute

Distil-Whisper large-v3 είναι a μοντέλο ομιλίας προς κείμενο κατασκευής από HuggingFace. Πιο δυνατό στο Real-time transcription, large-volume batch STT.. Αυτό-φιλοξενούνται σε Free.ai GPUs ~ τρέχει δωρεάν ενάντια σας καθημερινή πισίνα μάρκα (500 μάρκες ανά λεπτό). Κυκλοφόρησε στο πλαίσιο MIT - εμπορική χρήση επιτρέπεται στο Free.ai.

Χρήση μέσω API

OpenAI-συμβατικό REST API. Δημιουργήστε ένα κλειδί και καλέστε αυτό το μοντέλο σε δευτερόλεπτα.

curl -X POST https://api.free.ai/v1/stt/ \
  -H "Authorization: Bearer sk-free-..." \
  -H "Content-Type: application/json" \
  -d '{"model":"distil-whisper-large-v3","audio_url":"https://..."}'
Τεκμηρίωση API Πάρτε το κλειδί API

Συχνές Ερωτήσεις

Distil-Whisper large-v3 transcribes spoken audio into text. Upload an MP3, WAV, M4A, or video file and Distil-Whisper large-v3 returns the full transcript plus optional SRT/VTT subtitles with timestamps.

Distil-Whisper large-v3 handles dozens of languages - Whisper-family models cover 90+, others vary. Pick "auto-detect" or specify the language for highest accuracy.

Word-error rate είναι 5-10% σε καθαρό αγγλικό ήχο, 10-20% σε θόρυβο ή τονισμένο ήχου. Μεγάλες παραλλαγές της ίδιας αρχιτεκτονικής κάνουν σημαντικά καλύτερα σε δύσκολες περιπτώσεις - επιλέξτε μεγαλύτερη όταν ο ήχος είναι τραχύς.

Ναι - κάθε τμήμα περιλαμβάνει σφραγίδες έναρξης/ λήξης χρόνου. Εξαγωγή ως SRT ή VTT και οι χρόνοι χάρτη κατ 'ευθείαν στο βίντεο σας.

Distil-Whisper large-v3 τρέχει με τη δική μας GPUs ενάντια καθημερινά δωρεάν πισίνα σας πρώτα; $ 5 → 200.000 πληρωμένα μάρκα μετά από αυτό. Περίπου ~500 μάρκες ανά λεπτό.

MP3, WAV, M4A, FLAC, OGG, συν βίντεο (MP4, MOV, WebM) - εξάγουμε τον ήχο. Max 500 MB ανά αποστολή. Μακρότερα αρχεία; Χωρίστε με /audio/cut/ ή χρήση /v1/stt/batch/.

Η διαποίηση ομιλητών είναι ένα ξεχωριστό πέρασμα - εναλλαγή "διακρίνει" στο /trancegraph/. Distil-Whisper large-v3 χειρίζεται τη μεταγραφή; διακρίνει ετικέτες κάθε τμήμα με τον Ηχείο 1 / Ηχείο 2 / κ.λπ.

Ναι - / batch/ δέχεται ένα φάκελο αρχείων ήχου. Κάθε αντίγραφο προσγειώνεται στο /account/?tab=ιστορία με το αρχικό όνομα αρχείου. Για τη διατήρηση του φακέλου-δέντρου χρησιμοποιήστε το API.

Ναι - ΠΩΜΑ σας ήχου /v1/stt/trancegraph/ with model="Distil-Whisper large-v3". Επιστρέφει JSON με κείμενο + τμήματα + χρονοσφραγίσεις λέξεων-level. /api/ έχει την πλήρη αναφορά.

Τα αυτοξεχωρισμένα μοντέλα διατηρούν τον ήχο στις GPU μας. premium περνάνε με DPA. Το Audio διαγράφεται μετά το παράθυρο μετοχών (24h anon, 7d υπογεγραμμένο-in).

Ναι - Free.ai χορηγεί εμπορική χρήση των μεταγραφών. Χρειάζεστε δικαιώματα στον ήχο που ανεβάσατε (το δικό σας υλικό εγγραφής, άδεια, ή περιεχόμενο με συγκατάθεση).

Ο συντελεστής πραγματικού χρόνου είναι περίπου 0.05-0.2× - ένα 60 λεπτά podcast traffers σε 3-12 λεπτά. Premium μοντέλα συχνά τελειώνουν γρηγορότερα.

Love Free.ai? Tell your friends!

Βαθμολογήστε αυτή τη σελίδα