Fal Speech-to-Text

Free.ai · stt · ~500 Ama-token ngalinye minute

Thola ifayela lomsindo noma levidiyo, noma chofoza i-URL ngezansi

~500 Ama-token ngalinye minute
Isebenza ngokukhululekile kuma-GPU ethu. Ukulungiswa kwe- Fal Speech-to-Text →

Fal Speech-to-Text yi an imodeli yokukhuluma-ku-tekisi. Ihamba ngezindlela ezingaphandle - ~500 tokens imizuzu (50% markup ngaphezulu kwezindleko eziphezulu).

Sebenzisa nge-API

I-REST API ehambisana ne-OpenAI. Dala isithonjana bese ubiza le modeli emaminithini.

curl -X POST https://api.free.ai/v1/stt/ \
  -H "Authorization: Bearer sk-free-..." \
  -H "Content-Type: application/json" \
  -d '{"model":"premium/speech-to-text","audio_url":"https://..."}'
Ulwazi-mbhalo lwe-API Thola isithonjana se-API

Imibuzo ebuzwa kaningi

Fal Speech-to-Text iguqula umsindo okhuluma ube sihloko. Layisha i-MP3, WAV, M4A, noma ihele levidiyo futhi Fal Speech-to-Text ibuyisela ukuguqulelwa okugcwele kanye ne-SRT/VTT ekhethiwe engezansi nesikhathi sosuku.

Fal Speech-to-Text handles dozens of languages - Whisper-family models cover 90+, others vary. Pick "auto-detect" or specify the language for highest accuracy.

Izinga lephutha legama lingu-5-10% ku-English audio ecacile, 10-20% ku-noise or accented audio. Ama-variants amakhulu we-architecture afanayo asebenza kahle kakhulu ezimoni ezinzima - khetha okukhulu uma umsindo unzima.

Yebo - yonke inhlamvu ifaka iqala/siphele isikhathi sokufaka. Rhweba ngaphandle njenge-SRT noma i-VTT futhi amahora amaphiwe ngokuqondile kwividiyo yakho.

Fal Speech-to-Text yinjini yokudlulisa ephakeme. Ngo ~500-1,500 amathokheni ngemininingwane yomsindo, ebonisa ngempela ngaphambi kokuba ukhiqize. Ukudlulisa okuhlelwe ngokwezifiso kusebenza ngokukhululekile ku-30,000-token yakho ye-pool yansuku zonke; amamodeli ephakeme akhokhelwa-njengoku-go, nge-top-ups kusuka ku-$ 1.

MP3, WAV, M4A, FLAC, OGG, kanye nevidiyo (MP4, MOV, WebM) - sikhipha umsindo. Max 500 MB ngayinye ukuthunyelwa. Amafayela ade kakhulu? Yahlula nge /audio/cut/ noma sebenzisa /v1/stt/batch/.

Umsindo womuntu okhulumayo uhlukaniswe - shintsha "ukukhuluma" ku /ukubhala/. Fal Speech-to-Text uphatha ukubhala; umsindo womuntu okhulumayo uphawula nganoma yisiphi isiqephu nomsindo 1 / umsindo 2 / njll.

Yebo - /batch/ ithatha isibaya sefayela lomsindo. Isingeniso ngasinye siwela ku /account/?tab=history ngegama lefayela elisemthethweni. Ukugcina isibaya-isihlahla sebenzisa i-API.

Yebo - ITHOLA umsindo wakho ku /v1/stt/transcribe/ ngemodeli "Fal Speech-to-Text". Ibuyisela i-JSON ngesihloko + amasekhondi + amahora egama-level. /api/ inesimo esigcwele.

Amamodeli ahlala ahlala agcina umsindo ku-GPU yethu; ipremiyamu idlula nge-DPA. Umsindo ususwa ngemuva kohlelo lokusibelana (24h anon, 7d ukungena). Asiqeqeshi ngemingeniso yakho.

Yebo - Free.ai inikeza ukusetshenziswa komphakathi kwe-transcripts. Udinga izimfanelo zesandi esilayishiwe (ukurekhoda kwakho, izinto ezilayisense, noma okuqukethwe ngesivumelwano).

Isikhathi sangempela somphumela yi 0.05-0.2× - ipodcast yemizuzu engu-60 ibhala imizuzwana engu-3-12. Amamodeli aphezulu avame ukuqedela ngokushesha. Sebenzisa inkinobho yokulinganisa ukuvala i-tab.

Uthando Free.ai? Uthi abangane bakho!

Linganisa lelikhasi