Fal Speech-to-Text
Free.ai
·
stt
·
~500 žetona po minute
Fal Speech-to-Text je a model govora u tekst. Putovanje kroz vanjske modele - ~500 žetoni po minuti (50% označavanje iznad troškova iznad streama).
Koristi preko API
OpenAI kompatibilan REST API. Generiraj ključ i nazovi ovaj model u sekundama.
curl -X POST https://api.free.ai/v1/stt/ \
-H "Authorization: Bearer sk-free-..." \
-H "Content-Type: application/json" \
-d '{"model":"premium/speech-to-text","audio_url":"https://..."}'
API dokumentacija
Dobavi API ključ
Česta pitanja
Fal Speech-to-Text transcribes spoken audio into text. Upload an MP3, WAV, M4A, or video file and Fal Speech-to-Text returns the full transcript plus optional SRT/VTT subtitles with timestamps.
Fal Speech-to-Text handles dozens of languages - Whisper-family models cover 90+, others vary. Pick "auto-detect" or specify the language for highest accuracy.
Brzina riječi-grebotina je 5-10% na čist engleski audio, 10-20% na bučno ili naglasak audio. Velika varijante iste arhitekture učiniti smisao bolje na tvrde slučajeve - odaberi veći kada je zvuk grub.
Da - svaki segment uključuje početna/krajnja vremenska mjesta. Izvezi kao SRT ili VTT i vremensku mapu ravno na vaš video.
Fal Speech-to-Text je premium transkripcija motor. O ~500-1,500 žetoni po minuti zvuka, prikazan uživo prije nego što generirati. Samo-hosted transkripcija radi besplatno na 30.000-taken dnevni bazen; premium modeli su pay-as-yo-go, s top-upovima od $1.
MP3, WAV, M4A, FLAC, OGG, plus video (MP4, MOV, WebM) - izvlačimo zvuk. Max 500 MB po slanju. Duži datoteke? Split s /audio/cut/ ili koristiti /v1/stt/batch /.
Dijarizacija zvučnika je odvojena prolaznica - uključite "dijarise" na /transkripciju /. Fal Speech-to-Text upravlja transkripcijom; dijarizacijski oznake svaki segment sa zvučnikom 1 / Zvučnik 2 / itd.
Da - /batch / prihvaća mapu audio datoteka. Svaki transkripti sleti u /account /?tab=history s originalnim imenom datoteke. Za očuvanje mape-tree koristite API.
Da - POST svoj audio na /v1/stt/transcribec/ s modelom="Fal Speech-to-Text". Povratak JSON s tekstom + segmenti + vremenski znakovi na razini riječi. /api/ ima punu referencu.
Samodomoćni modeli čuvaju zvuk na našim GPU-ovima; premium prolazi s DPA. Audio se briše nakon dio-prozora (24h, 7d potpisanih). Ne treniramo na vašim ulazima.
Da - Free.ai dodjeljuje komercijalnu upotrebu transkripta. Potrebna su vam prava na audio koji ste upisali (vlastiti snimak, licencirani materijal ili sadržaj s pristankom).
Faktor u realnom vremenu je približno 0,05-0,2× - 60-minutni podcast transkripti za 3-12 minuta. Premium modeli često završe brže. Koristite gumb reda za zatvaranje kartice.