Free ຕາກາລອກ Transcription

ແປສຽງແລະວິດີໂອ ຕາກາລອກ ໄປເປັນຂໍ້ຄວາມກັບ AI. ໄວ, ຖືກຕ້ອງແລະຟຣີ.

ວິທີການ​ເຮັດວຽກ

  1. ໄປ​ທີ່ កម្មវិធី​ແປ​ສຽງ Free.ai
  2. ສົ່ງ​ໄຟລ໌​ສຽງ ຫຼື ວີດີໂອ ຕາກາລອກ ຂອງທ່ານ
  3. AI ຂອງພວກເຮົາກວດພົບ ຕາກາລອກ ໂດຍອັດຕະໂນມັດແລະແປມັນ
  4. ດາວໂຫລດ​ບົດ​ບັນທຶກ​ຂອງທ່ານ​ເປັນ​ບົດ​ຄວາມ ຫຼື ບົດ​ລາຍ​ຊື່​ຜູ້​ອ່ານ SRT

ຕາກາລອກ ຄຸນສົມບັດ​ການ​ແປ​ເປັນ​ພາສາ​ອັງກິດ

  • ✓ພັດທະນາໂດຍ faster-whisper (ມີໃບອະນຸຍາດ MIT)
  • ✓ການກວດພົບພາສາ ຕາກາລອກ ໂດຍ​ອັດຕະໂນມັດ
  • ✓ສະຫນັບສະຫນູນ MP3, WAV, MP4, M4A, FLAC, ແລະອື່ນໆ
  • ✓ສົ່ງອອກ​ຊື່​ບົດ​ຄວາມ​ພາຍ​ໃຕ້​ຊື່​ສຽງ (SRT)
  • ✓ບໍ່ມີ​ຂໍ້​ຈຳກັດ​ຂະ​ໜາດ​ໄຟລ໌​ໃນ​ແຜນ​ທີ່​ຈ່າຍ
  • ✓ຄວາມເປັນສ່ວນຕົວ ແລະ ຄວາມປອດໄພ -- ໄຟລ໌ຈະຖືກລຶບຫຼັງຈາກ​ທີ່​ໄດ້​ປະມວນຜົນ

ລາຍລະອຽດ​ພາສາ

ພາສາຕາກາລອກ
ລະຫັດ ISOtl
ແບບ​ແບບ AIfaster-whisper
ລາຄາ​ຟຣີ

ຄໍາຖາມ​ທີ່​ຖາມ​ເລື້ອຍໆ

ຕາກາລອກ ແມ່ນພາສາຊັບພະຍາກອນກາງ ສຳ ລັບ Whisper - ໃຫຍ່-v3-turbo ຕົກຢູ່ໃນອັດຕາຄວາມຜິດພາດຂອງ ຄຳ ເວົ້າ 15-25%. ເນື້ອໃນຂອງ transcript ແມ່ນເຊື່ອຖືໄດ້; ຄາດຫວັງຄວາມຜິດພາດຂອງຕົວລະຄອນທີ່ມີຊື່, ບາງຄັ້ງກໍ່ປ່ຽນລະຫັດແລະສຽງສັ້ນໆ. ວາງແຜນຜ່ານຄົນ ສຳ ລັບຜົນໄດ້ຮັບທີ່ມີຄຸນນະພາບ.​ (ລະດັບ C, 15-25% word error rate ຕາມມາດຕະຖານ - ພວກເຮົາ​ພິມ​ເຜີຍ​ແຜ່​ລະດັບ​ WER ທີ່​ຈິງ​ໃຈ​ກວ່າ​ການ​ໂຄສະນາ​ຂາຍ​ສິນຄ້າ​)

ໂອ້ - ຕາກາລອກ transcription ແຕ້ມຈາກ pool token ຂອງທ່ານຟຣີທຸກໆມື້ກ່ອນ. ສຽງຄ່າໃຊ້ຈ່າຍປະມານ 50 tokens ຕໍ່ນາທີ, ດັ່ງນັ້ນ pool ມື້ທີ່ບໍ່ລະບຸຊື່ປົກຄຸມບາງຊົ່ວໂມງຂອງສຽງໃນແຕ່ລະມື້. ລົງທະບຽນໃນບັນຊີໄດ້ຮັບໃຫຍ່ກວ່າ 30,000-token pool ທຸກໆມື້. ຜ່ານນັ້ນ, transcription ແມ່ນຈ່າຍ-ເປັນ-ທ່ານ-ໄປ, ກັບ token top-ups ຈາກ $1.

ຕົວອັກສອນ ຕາກາລອກ ຈະຖືກສົ່ງຄືນເປັນ UTF-8 ມາດຕະຖານ​ພ້ອມ​ກັບ​ການ​ອັກສອນ​ປົກກະຕິ​ຂອງ​ພາສາ.

MP3, WAV, M4A, FLAC, OGG, OPUS, ແລະ WEBM ແມ່ນໄດ້ຮັບການຍອມຮັບໂດຍກົງ. ສໍາລັບວິດີໂອ (MP4, MOV, MKV) ພວກເຮົາດຶງດູດສຽງດົນຕີ track ຂ້າງເຊີບເວີກ່ອນທີ່ຈະສົ່ງມັນໄປ Whisper - ທ່ານບໍ່ຈໍາເປັນຕ້ອງປ່ຽນແປງສິ່ງໃດແດ່ເອງ. pipeline ດຽວກັນບໍ່ວ່າຈະເປັນພາສາຕົ້ນຕໍ, ລວມທັງ ຕາກາລອກ.

ບໍ່ມີຊື່ອັບໂຫລດກອບໃນປະມານ 500 MB ຕໍ່ໄຟລ໌. ເຂົ້າສູ່ລະບົບບັນຊີໄປເຖິງ2GB. ໄລຍະເວລາແມ່ນບໍ່ຈໍາກັດຫຍຸ້ງຍາກ - ໄຟລ໌ຍາວແມ່ນ chunked ໂດຍອັດຕະໂນມັດ (30 ວິນາທີກັບ overlap window) ແລະ stitch ຄືນໄປບ່ອນໃນ transcript ດຽວກັບ timestamps ຕໍ່ໄປ. ຫຼາຍຊົ່ວໂມງ ຕາກາລອກ ການບັນທຶກ (podcasts, lectures ເຕັມ, ກອງປະຊຸມ) ເຮັດວຽກດີ.

ຍິນດີຕ້ອນຮັບ - speaker diarization ແມ່ນປິດໂດຍ default ສໍາລັບ transcript ທຸກໆ ຕາກາລອກ. ຜົນໄດ້ຮັບແມ່ນ segmented ເປັນ Speaker 1 / Speaker2/ Speaker3ກັບ timestamps, ດັ່ງນັ້ນການສໍາພາດ, ກອງປະຊຸມປຶກສາຫາລື, ແລະ multi-party ປະຊຸມມາກັບຄືນມາມີស្លាກ. Diarization ແລ່ນໃນແບບທີ່ແຍກຕ່າງຫາກແລະເຮັດວຽກຄືກັນໃນທົ່ວພາສາທັງຫມົດທີ່ພວກເຮົາສະຫນັບສະຫນູນ.

ຍິນດີ - ປ້າຍ URL ເຂົ້າໄປໃນ / transcribe / youtube / ສໍາລັບ YouTube ຫຼື / transcribe / podcast / ສໍາລັບ podcast feeds (Apple, Spotify, RSS). ພວກເຮົາດາວໂຫລດສຽງ, ແລ່ນມັນຜ່ານ Whisper ກັບພາສາ=tl, ແລະກັບຄືນໄປບ່ອນ transcript ກັບ timestamps ແລະເຄື່ອງຫມາຍຜູ້ເວົ້າ. ເນື້ອໃນ ຕາກາລອກ ປົກກະຕິ: WhatsApp ສຽງບັນທຶກ, YouTube vlogs, ແລະວິດີໂອສັ້ນ-ຮູບຮ່າງແມ່ນ ຕາກາລອກ ວຽກທີ່ມັກທີ່ສຸດ - ປ້າຍ URL ເຂົ້າໄປໃນ / transcribe / youtube / ຫຼືອັບໂຫລດສຽງໂດຍກົງ.

Whisper ຄ່າໃຊ້ຈ່າຍປະມານ 50 tokens ຕໍ່ນາທີຂອງສຽງ, ດັ່ງນັ້ນການບັນທຶກຫນຶ່ງຊົ່ວໂມງແມ່ນ ~3,000 tokens. ຜູ້ໃຊ້ສ່ວນໃຫຍ່ບໍ່ເຄີຍໃຊ້ຈ່າຍຫຍັງ - ຫ້ອງນ້ໍາຟຣີທຸກໆມື້ຂອງ 30,000 tokens ປົກຄຸມຄລິບສັ້ນ, ຂໍ້ຄວາມສຽງ, ແລະ podcasts ຫນຶ່ງ-off. ນອກເຫນືອໄປຈາກມັນ, ການແປແມ່ນຈ່າຍ-ເປັນ-ທ່ານ-ໄປ, ທີ່ມີ token top-ups ຈາກ $1.

ຍິນດີ - ລະດັບ segment (ທຸກໆ ~ 10-30 ວິນາທີ) ແລະ ລະດັບຄໍາ ເວລາ stamps ແມ່ນມີ. ລະດັບຄໍາ ແມ່ນປັ໊ມເດີມສໍາລັບ VTT / SRT ສົ່ງອອກບົດຂຽນພາຍໃຕ້ດັ່ງນັ້ນບົດຂຽນ sync ເສັ້ນ-by-line. ຢູ່ໃນ API ຕັ້ງ timestamps=" ຄໍາ "ໃນຮ່າງກາຍຄໍາຮ້ອງຂໍ. ຕົວອັກສອນ ຕາກາລອກ ຈະຖືກສົ່ງຄືນເປັນ UTF-8 ມາດຕະຖານ​ພ້ອມ​ກັບ​ການ​ອັກສອນ​ປົກກະຕິ​ຂອງ​ພາສາ.

ຍິນດີ. POST ສຽງ (multipart/form-data, ຊື່ພື້ນທີ່ "ໄຟລ໌") ໄປ /v1/transcribe / ກັບພາສາ=tl - ຫຼືລົບພາຣາມິດພາສາເພື່ອໃຫ້ Whisper ກວດພົບອັດຕະໂນມັດ. ສົ່ງຄືນ JSON ກັບ transcript, segments, timestamps, ແລະ ແທັກຜູ້ເວົ້າ. ຄໍາແນະນໍາເຕັມແລະ SDK snippets ທີ່ /api /.

ຍິນດີ - ຫຼັງຈາກການແປພາສາສໍາເລັດ, ກົດແປຫຼືຕິດຂໍ້ຄວາມເຂົ້າໄປໃນ / translate /. ຕາກາລອກ ຄູ່ກັບພາສາອື່ນໆທຸກຢ່າງທີ່ພວກເຮົາສະຫນັບສະຫນູນ (200+). ສໍາລັບກອງປະຊຸມນາທີປັ໊ບການແປຜ່ານ / summarize /; ສໍາລັບ dubbing ສົ່ງມັນໄປ / voice / tts / ເພື່ອສະແດງສຽງໃນພາສາເປົ້າຫມາຍ.

ຄວາມແຂງແຮງຂອງສຽງລົບກວນຂອງ Whisper ຍັງໃຊ້ໄດ້ກັບ ຕາກາລອກ, ແຕ່ໃນລະດັບຄວາມຖືກຕ້ອງນີ້ສຽງລົບກວນທີ່ເພີ່ມເຂົ້າມາຈະເພີ່ມອັດຕາຄວາມຜິດພາດຂອງພື້ນຖານ. ສຽງຂອງຫູຟັງທີ່ສະອາດຈະໃຫ້ຜົນໄດ້ຮັບທີ່ດີກວ່າການບັນທຶກໂທລະສັບ ຫຼື ໄມໂຄໂຟນຄອມພິວເຕີໂນດບຸກ.ຖ້າວ່າ ບົດບັນທຶກ ບໍ່ສາມາດໃຊ້ໄດ້ ສົ່ງອີເມວ contact@free.ai ໄປພ້ອມກັບ ເອກະສານ - ພວກເຮົາ ຈະ ຈ່າຍຄືນ ຄ່າ ລິ້ງ ແລະ ເບິ່ງວ່າ ເຄື່ອງຈັກ ອື່ນ ໆ ຈະ ຈັດການ ສຽງຂອງທ່ານໄດ້ດີກວ່າ.

ຮັກ Free.ai? ເວົ້າກັບເພື່ອນຂອງທ່ານ!

ຈັດ​ອັນ​ດັບ​ໜ້າ​ນີ້