Fal Speech-to-Text
Free.ai
·
stt
·
~500 Token minute
Fal Speech-to-Text bụ a ngwe-ka-okwu móòdù. N'ime ụzọ n'ime n'ime model - ~500 tokens nkeji (50% markup n'elu upstream ọnụego).
Jiri site na API
OpenAI-na-akpaghị aka REST API. Kewapụta kii nakwa kpọọ móòdù a n'ime sekọnd.
curl -X POST https://api.free.ai/v1/stt/ \
-H "Authorization: Bearer sk-free-..." \
-H "Content-Type: application/json" \
-d '{"model":"premium/speech-to-text","audio_url":"https://..."}'
Dọkumenti
Wepụta kii
Ajụjụ ndị a jụrụkarị
Fal Speech-to-Text na-atụgharị ụda akọwapụtara n'ime ngwe. Bipụta faịlụ MP3, WAV, M4A, mọọbụ faịlụ vidio na Fal Speech-to-Text na-eziga ntụgharị zuru ezu nakwa SRT/VTT n'aka ekpe na oge.
Fal Speech-to-Text na-ejikwa asụsụ ndị dị iche iche - Whisper-family models cover 90+, Parakeet covers ~25, ndị ọzọ na-agbanwe. Họrọ "auto-detect" mọọbụ kọwaa asụsụ maka nghọta dị elu.
Ọnụọgụgụ okwu-ezighị ezi bụ 5-10% na ụda English dị ọcha, 10-20% na ụda na-anụ ọkụ ma ọ bụ ụda na-akụda. Ụdị dị ukwuu nke ụda ahụ na-eme ka ọ dị mma n'ihe ndị dị njọ - họrọ nnukwu mgbe ụda ahụ dị njọ.
Ee - segmenti ọbụla na-agụnye oge mbido/nkewapụta. Ekpughe ya dịka SRT mọọbụ VTT na oge map n'ụzọ ziri ezi na vidyo gị.
Fal Speech-to-Text bụ n'ime n'ime n'ime n'ime n'ime n'ime n'ime n'ime n'ime n'ime n'ime n'ime n'ime n'ime n'ime n'ime n'ime n'ime n'ime n'ime n'ime n'ime n'ime n'ime n'ime n'ime n'ime n'ime n'ime n'ime n'ime n'ime n'ime n'ime n'ime n'ime n'ime n'ime n'ime n'ime n'ime n'ime n'ime n'ime n'ime n'ime n'ime n'ime n'ime n'ime n'ime n'ime n'ime n'ime n'ime n'ime n'ime n'ime n'ime n'ime n'ime n'ime n'ime n'ime n'ime n'ime n'ime n'ime n'ime n'ime n'ime n'ime n'ime n'ime n'ime n'ime n'ime n'ime n'ime n'ime n'ime n'ime n'ime n'ime n'ime n'ime n'ime n'ime n'ime n'ime n'ime n'ime n'ime n'ime n'ime n'ime n'ime n'ime n'ime n'ime n'ime n'ime n'ime n'ime n'ime n'ime n'ime n'ime n'ime n'ime n'ime n'ime n'ime n'ime n'ime n'ime n'ime n'ime n'ime n'ime n'ime n'ime n'ime n'ime n'ime n'ime n'ime n'ime n'ime n'ime n'ime n'ime n'ime n'ime n'ime n'ime n'ime n'ime n'ime n'ime n'ime n'ime n'ime n'ime n'ime n'ime n'ime n'ime n'ime n'ime n'ime n'ime n'ime n'ime n'ime n'ime n'ime n'ime n'ime n'ime n'ime n'ime n'ime n'ime n'ime n'ime n'ime n'ime n'ime n
MP3, WAV, M4A, FLAC, OGG, nakwa vidiyo (MP4, MOV, WebM) - anyị na-ewepụ ụda. Max 500 MB kwa ibudata. Files dị ogologo? Split na /audio/cut/ ma ọ bụ jiri /v1/stt/batch/.
Nhazi nke onyeọsụsụ bụ nbanye dị iche iche - gbanwee "diarize" na /transcribe/. Fal Speech-to-Text na-ejikwa ntụgharị; nhazi nke onyeọsụsụ na-egosipụta segmenti ọbụla na Onyeọsụsụ 1 / Onyeọsụsụ 2 / wdg.
Ee — /batch/ na-anabata nsomebefaịlụ nke faịlụ ụda. Nhazi nke ọbụla na-abanye na /account/?tab=history na aha faịlụ mbụ. Maka nchekwa nke nsomebefaịlụ-tree jiri API.
Yabụ - POST ụda gị na /v1/stt/transcribe/ na model="Fal Speech-to-Text". Na-eziga JSON na ngwe + segments + oge-ihe dị na okwu. /api/ nwere ndesịta zuru ezu.
Models na-echekwa onwe ha na-echekwa ụda na GPUs anyị; ọbụna na-aga site na DPA. Ọdịdị a na-ehichapụ mgbe windo n'otu (24h anon, 7d banye-na). Anyị anaghị arụ ọrụ na init gị.
Ee — Free.ai na-enye ikike iji n'ọrụ n'ọrụ nke transcripts. Ichọrọ ikike n'ihe oyiyi ịgbapụtala (n'ihe oyiyi gị, ihenhọrọ nke ikike, mọọbụ ihenhọrọ nke ikike).
Real-time factor bụ ihe dị ka 0.05–0.2× — 60-minuite podcast transcribes na 3–12 minit. Premium models mgbe ụfọdụ na-agwụ n'ụzọ n'ụzọ. Jiri bọtịnụ n'okporo ụzọ mechie táàbụ̀ ahụ.