Fal Speech-to-Text

Free.ai · stt · ~500 ٽوڪنز minute

آڊيو يا وڊيو فائل ڇڏ، يا URL کي ھيٺ چپ ڪريو

~500 ٽوڪنز minute
اسان جي GPUs تي مفت هلندو. ان لاءِ اپگريڊ ڪريو Fal Speech-to-Text →

Fal Speech-to-Text ۽ a ڳالھائڻ-لکڻ لاءِ ماڊل. ٻاهرين ماڊل ذريعي روٽ - ~500 ٽوڪنز في منٽ (50% مارڪ اپ مٿي قيمت تي).

API ذريعي استعمال ڪريو

OpenAI-compatible REST API. هڪ ڪُل پيدا ڪريو ۽ ھن ماڊل کي سيڪنڊن ۾ سڏيو.

curl -X POST https://api.free.ai/v1/stt/ \
  -H "Authorization: Bearer sk-free-..." \
  -H "Content-Type: application/json" \
  -d '{"model":"premium/speech-to-text","audio_url":"https://..."}'
API دستاویز API ڪوڊ حاصل ڪريو

گھڻا پڇيل سوال

Fal Speech-to-Text ڳالهائيندڙ آڊيو کي متن ۾ تبديل ڪندو آھي. MP3، WAV، M4A يا وڊيو فائل اپ لوڊ ڪريو ۽ Fal Speech-to-Text مڪمل ترنسڪريٽ ۽ اختياري SRT/VTT عنوانن سان گڏ وقت جي نشانين سان موٽائيندو آھي.

Fal Speech-to-Text handles dozens of languages - Whisper-family models cover 90+, others vary. Pick "auto-detect" or specify the language for highest accuracy.

لفظ-خطر جي شرح 5-10% صاف انگريزي آڊيو تي، 10-20% شور يا ڌڪ آڊيو تي آهي. وڏيون تبديليون هڪ ئي آرڪائيوگراف جي سخت ڪيسن تي بهتر ڪم ڪن ٿيون - وڏي چونڊيو جڏهن آڊيو سخت آهي.

ھائو - هر حصي ۾ شروعات/آخر وقت جو نشان شامل آھي. SRT يا VTT طور برآمد ڪريو ۽ وقت جو نقشو سڌو پنھنجي وڊيو تي.

Fal Speech-to-Text هڪ پريميئم ترڪيب انجن آهي. هر منٽ ۾ آڊيو جي حوالي سان ~ 500-1,500 ٽوڪنز، توهان جي پيدا ڪرڻ کان اڳ جي زندگي ڏيکاريو. پاڻ-هسٽل ٿيل ترڪيب توهان جي 30,000-ٽوڪنز روزاني پول تي مفت هلندو آهي؛ پريميئم ماڊل توهان جي وڃڻ وانگر ادا ڪيا ويندا آهن، $ 1 کان مٿي.

MP3, WAV, M4A, FLAC, OGG, plus video (MP4, MOV, WebM) - اسان آڊيو کي ڪڍي ڇڏيو. Max 500 MB per upload. ڊگھي فائلون؟ /audio/cut/ سان ورهايو يا /v1/stt/batch/ استعمال ڪريو.

اسپيڪر ڊيائريزيشن هڪ الڳ پاس آهي - "diarize" کي /transcribe/ تي تبديل ڪريو. Fal Speech-to-Text ڊائريزيشن کي سنڀاليندو آھي؛ ڊيائريزيشن هر حصي کي اسپيڪر 1 / اسپيڪر 2 / وغيره سان ليڪ ڪري ٿو.

ھائو - /batch/ آڊيو فائل جو هڪ فولڊر قبول ڪري ٿو. هر ترنسڪريٽ /account/?tab=history ۾ اصل فائل نالي سان لھندي آھي. فولڊر-وڻ جي سنڀال لاءِ API استعمال ڪريو.

ھائو - پنھنجي آڊيو کي /v1/stt/transcribe/ ڏانهن POST ڪريو model="Fal Speech-to-Text" سان. JSON کي متن + حصن + لفظ-پائيدار timestamps سان موٽائي ٿو. /api/ ۾ پورو حوالو آھي.

پاڻ کي ميزبان ماڊل اسان جي GPUs تي آڊيو رکي ٿو؛ پريميئم DPA سان گذري ٿو. آڊيو حصيداري-وينديءَ کان پوءِ ختم ڪيو ويندو آهي (24h انون، 7d لاگ ان). اسان توھان جي انپٽ تي تربيت نه ڪندا آھيون.

ھائو - Free.ai ترنسڪريٽ جو تجارتي استعمال ڪري ٿو. اوھان کي اوھان جي اپ لوڊ ڪيل آڊيو جا حق گھرجن (پنھنجو پاڻ رڪارڊ، لائسنس ٿيل مواد يا رضامندي سان مواد).

ريئل ٽائيم فڪٽر تقريبن 0.05-0.2× آهي - 60 منٽن جو پوڊ ڪاسٽ 3-12 منٽن ۾ نقل ڪري ٿو. پرائمري ماڊل اڪثر جلدي ختم ٿيندا آهن. ٽيب بند ڪرڻ لاءِ انتظار بٽڻ استعمال ڪريو.

Free.ai پيار؟ پنھنجي دوستن کي چئو!

ھن صفحي کي تصنيف ڪريو