Distil-Whisper large-v3

Free.ai (self-hosted) · stt · ~500 ຕົວ​ເລກ​ຕໍ່ minute

ຖອດ​ໄຟລ໌​ສຽງ ຫຼື ວີດີໂອ ຫຼື ປ້າຍ URL ລົງ​ຂ້າງລຸ່ມ

~500 ຕົວ​ເລກ​ຕໍ່ minute

Distil-Whisper large-v3 ແມ່ນ a ແບບ​ຟອມ​ການ​ເວົ້າ​ເປັນ​ຂໍ້​ຄວາມ ສ້າງໂດຍ HuggingFace. ແຮງທີ່ສຸດທີ່ Real-time transcription, large-volume batch STT.. ເປັນເຈົ້າພາບຕົນເອງໃນ Free.ai GPUs - ແລ່ນຟຣີຕໍ່ຕ້ານສະໂມສອນໂຕກອນຂອງທ່ານທຸກໆມື້ (500 tokens ​ຕໍ່​ນາທີ). ອອກອາກາດພາຍໃຕ້ MIT - ການໃຊ້ທຸລະກິດອະນຸຍາດຢູ່ໃນ Free.ai.

ប្រើ​ຜ່ານ API

OpenAI- REST API ເຂົ້າກັນໄດ້. ສ້າງກູໂກແລະໂທແບບນີ້ໃນສອງວິນາທີ.

curl -X POST https://api.free.ai/v1/stt/ \
  -H "Authorization: Bearer sk-free-..." \
  -H "Content-Type: application/json" \
  -d '{"model":"distil-whisper-large-v3","audio_url":"https://..."}'
ເອກະສານ API ເອົາ​ກຸນ​ແຈ API

ຄໍາຖາມທີ່ຖາມເລື້ອຍໆ

Distil-Whisper large-v3 ແປສຽງເວົ້າເປັນຂໍ້ຄວາມ. ສົ່ງ MP3, WAV, M4A, ຫຼື ໄຟລ໌ວິດີໂອແລະ Distil-Whisper large-v3 ຄືນໄປບ່ອນການແປເຕັມ plus ທາງເລືອກ SRT / VTT ບົດຄວາມທີ່ມີ timestamps.

Distil-Whisper large-v3 handles dozens of languages - Whisper-family models cover 90+, others vary. Pick "auto-detect" or specify the language for highest accuracy.

ອັດຕາຄວາມຜິດພາດຂອງຄໍາແມ່ນ 5-10% ສໍາລັບສຽງພາສາອັງກິດທີ່ສະອາດ, 10-20% ສໍາລັບສຽງທີ່ສຽງຫຼືສຽງທີ່ອ່ອນແອ. ຕົວເລືອກທີ່ໃຫຍ່ກວ່າຂອງສະຖາປັດຕະຍະກໍາດຽວກັນເຮັດໄດ້ດີກວ່າໃນກໍລະນີທີ່ຫຍຸ້ງຍາກ - ເລືອກໃຫຍ່ກວ່າເມື່ອສຽງແມ່ນຫຍາບຄາຍ.

ຍອມຮັບ - ທຸກໆສ່ວນປະກອບມີເວລາເລີ່ມຕົ້ນ/ຈົບ. ສົ່ງອອກເປັນ SRT ຫຼື VTT ແລະເວລາວາງແຜນກົງໄປກົງມາໃສ່ວິດີໂອຂອງທ່ານ.

Distil-Whisper large-v3 ແລ່ນໃນ GPUs ຂອງພວກເຮົາເອງຕໍ່ຕ້ານ pool ຂອງທ່ານຟຣີທຸກໆມື້ກ່ອນ; $5 → 200,000 ຈ່າຍ tokens ຫຼັງຈາກນັ້ນ. ປະມານ ~500 tokens ຕໍ່ນາທີ.

MP3, WAV, M4A, FLAC, OGG, ນອກນັ້ນຍັງມີວິດີໂອ (MP4, MOV, WebM) - ພວກເຮົາດຶງສຽງ. ສູງສຸດ 500 MB ຕໍ່ການອັບໂຫລດ. ເອກະສານຍາວກວ່າ? ແບ່ງອອກດ້ວຍ /audio/cut/ ຫຼືໃຊ້ /v1/stt/batch/.

ການ​ດັດ​ແປງ​ຜູ້​ເວົ້າ​ແມ່ນ​ການ​ຜ່ານ​ທີ່​ແຕກ​ຕ່າງ​ກັນ - ປ່ຽນ "diarize" ໃນ / transcribe /. Distil-Whisper large-v3 ຈັດການ​ການ​ດັດ​ແປງ; ການ​ດັດ​ແປງ​ແມ່ນ​ມີ​ຊື່​ສ່ວນ​ຕ່າງໆ​ຂອງ​ຜູ້​ເວົ້າ 1 / ຜູ້​ເວົ້າ2/ ອື່ນໆ

ຍອມຮັບ - / batch / ຮັບເອົາ​ໂຟນເດີ​ຂອງ​ໄຟລ໌​ສຽງ. ລາຍການ​ບັນທຶກ​ແຕ່ລະອັນ​ຈະ​ຕົກ​ຢູ່​ໃນ / account /? tab=history ທີ່ມີ​ຊື່​ໄຟລ໌​ຕົ້ນຕໍ. ສຳ​ລັບ​ການ​ຮັກສາ​ຕົ້ນ​ຂອງ​ໂຟນເດີ​ໃຊ້ API.

ຍິນດີ - POST ສຽງຂອງທ່ານໄປ /v1/stt/transcribe/ ກັບ model="Distil-Whisper large-v3". ສົ່ງຄືນ JSON ທີ່ມີຂໍ້ຄວາມ + segments + ເວລາລະດັບຄໍາ. /api/ ມີຄໍາແນະນໍາເຕັມ.

ແບບທີ່ຈັດການເອງຮັກສາສຽງໃນ GPUs ຂອງພວກເຮົາ; ຄ່າໃຊ້ຈ່າຍຜ່ານຜ່ານກັບ DPA. ສຽງຖືກລຶບຫຼັງຈາກແບ່ງປັນ-window (24h anon, 7d ເຂົ້າສູ່ລະບົບ). ພວກເຮົາບໍ່ຝຶກອົບຮົມກ່ຽວກັບຂໍ້ມູນເຂົ້າຂອງທ່ານ.

ຍິນດີ - Free.ai ອະນຸຍາດໃຫ້ໃຊ້ການໃຊ້ທຸລະກິດຂອງ transcripts. ທ່ານຕ້ອງການສິດທິຂອງສຽງທີ່ທ່ານໄດ້ອັບໂຫລດ (ການບັນທຶກຂອງທ່ານເອງ, ໃບອະນຸຍາດວັດຖຸ, ຫຼືເນື້ອໃນທີ່ມີການອະນຸຍາດ).

ປັດໃຈເວລາຈິງແມ່ນປະມານ 0.05-0.2 × - ເພງເພງ 60 ນາທີ transcribes ໃນ 3-12 ນາທີ. ແບບ Premium ມັກຈະສໍາເລັດໄວຂຶ້ນ. ໃຊ້ປຸ່ມລໍຖ້າເພື່ອປິດແທັບ.

ຮັກ Free.ai? ເວົ້າກັບເພື່ອນຂອງທ່ານ!

ຈັດ​ອັນ​ດັບ​ໜ້າ​ນີ້