Fal Speech-to-Text

Free.ai · stt · ~500 Μάρκες ανά minute

Ρίξτε ένα αρχείο ήχου ή βίντεο, ή επικολλήστε ένα URL παρακάτω

~500 Μάρκες ανά minute
Είναι ελεύθεροι με τις GPU μας. Αναβάθμιση για Fal Speech-to-Text →

Fal Speech-to-Text είναι a μοντέλο ομιλίας προς κείμενο. Διαδρομή μέσω εξωτερικών μοντέλων - ~500 μάρκες ανά λεπτό (50% βαθμολογία πάνω από το κόστος προηγούμενου).

Χρήση μέσω API

OpenAI-συμβατικό REST API. Δημιουργήστε ένα κλειδί και καλέστε αυτό το μοντέλο σε δευτερόλεπτα.

curl -X POST https://api.free.ai/v1/stt/ \
  -H "Authorization: Bearer sk-free-..." \
  -H "Content-Type: application/json" \
  -d '{"model":"premium/speech-to-text","audio_url":"https://..."}'
Τεκμηρίωση API Πάρτε το κλειδί API

Συχνές Ερωτήσεις

Fal Speech-to-Text transcribes spoken audio into text. Upload an MP3, WAV, M4A, or video file and Fal Speech-to-Text returns the full transcript plus optional SRT/VTT subtitles with timestamps.

Fal Speech-to-Text handles dozens of languages - Whisper-family models cover 90+, others vary. Pick "auto-detect" or specify the language for highest accuracy.

Word-error rate είναι 5-10% σε καθαρό αγγλικό ήχο, 10-20% σε θόρυβο ή τονισμένο ήχου. Μεγάλες παραλλαγές της ίδιας αρχιτεκτονικής κάνουν σημαντικά καλύτερα σε δύσκολες περιπτώσεις - επιλέξτε μεγαλύτερη όταν ο ήχος είναι τραχύς.

Ναι - κάθε τμήμα περιλαμβάνει σφραγίδες έναρξης/ λήξης χρόνου. Εξαγωγή ως SRT ή VTT και οι χρόνοι χάρτη κατ 'ευθείαν στο βίντεο σας.

Fal Speech-to-Text is a premium transcription engine. About ~500-1,500 tokens per minute of audio, shown live before you generate. Self-hosted transcription runs free on your 30,000-token daily pool; premium models are pay-as-you-go, with top-ups from $1.

MP3, WAV, M4A, FLAC, OGG, συν βίντεο (MP4, MOV, WebM) - εξάγουμε τον ήχο. Max 500 MB ανά αποστολή. Μακρότερα αρχεία; Χωρίστε με /audio/cut/ ή χρήση /v1/stt/batch/.

Η διαποίηση ομιλητών είναι ένα ξεχωριστό πέρασμα - εναλλαγή "διακρίνει" στο /trancegraph/. Fal Speech-to-Text χειρίζεται τη μεταγραφή; διακρίνει ετικέτες κάθε τμήμα με τον Ηχείο 1 / Ηχείο 2 / κ.λπ.

Ναι - / batch/ δέχεται ένα φάκελο αρχείων ήχου. Κάθε αντίγραφο προσγειώνεται στο /account/?tab=ιστορία με το αρχικό όνομα αρχείου. Για τη διατήρηση του φακέλου-δέντρου χρησιμοποιήστε το API.

Ναι - ΠΩΜΑ σας ήχου /v1/stt/trancegraph/ with model="Fal Speech-to-Text". Επιστρέφει JSON με κείμενο + τμήματα + χρονοσφραγίσεις λέξεων-level. /api/ έχει την πλήρη αναφορά.

Τα αυτοξεχωρισμένα μοντέλα διατηρούν τον ήχο στις GPU μας. premium περνάνε με DPA. Το Audio διαγράφεται μετά το παράθυρο μετοχών (24h anon, 7d υπογεγραμμένο-in).

Ναι - Free.ai χορηγεί εμπορική χρήση των μεταγραφών. Χρειάζεστε δικαιώματα στον ήχο που ανεβάσατε (το δικό σας υλικό εγγραφής, άδεια, ή περιεχόμενο με συγκατάθεση).

Ο συντελεστής πραγματικού χρόνου είναι περίπου 0.05-0.2× - ένα 60 λεπτά podcast traffers σε 3-12 λεπτά. Premium μοντέλα συχνά τελειώνουν γρηγορότερα.

Love Free.ai? Tell your friends!

Βαθμολογήστε αυτή τη σελίδα