fors эркин транскрипция

fors аудио ва видеони AI билан матнга кўчиринг. Тез, аниқ ва бепул.

У қандай ишлайди

  1. _Кейинги саҳифага ўтиш Free.ai Транскриптор
  2. fors аудио ёки видео файлингизни юклаб олиш
  3. Бизнинг ИИ fors ни автоматик равишда аниқлаб, уни кўчириб ёзади
  4. Транскриптингизни матн ёки SRT субтитрлари сифатида юклаб олинг

fors Транскрипция хусусиятлари

  • faster-whisper томонидан қўлланилган (MIT лицензияси билан)
  • fors тили автоматик аниқлаш
  • MP3, WAV, MP4, M4A, FLAC ва бошқаларни қўллаб-қувватлайди
  • Вақт белгилари ва субтитр экспорти (SRT)
  • Файл ҳажми чеклови йўқ
  • Шахсий ва хавфсиз -- файллар ишловдан сўнг ўчирилади

Тил тафсилотлари

Тилfors
ISO кодиfa
AI моделиfaster-whisper
НархОбод

Кўпроқ тиллар

Барча тилларни кўриш

Кўп саволлар

fors Whisper учун ўртача ресурс тилидир — катта-v3-turbo 15-25% сўз хато даражаси диапазонига тушади. Транскриптнинг асосий қисми ишончли; номланган-энтитет хатоларини, вақти-вақти билан код-ўтиш қийинчиликлари ва қисқа-айтиш хатоларини кутинг. Чоп этиш-саноатли чиқинди учун инсон ўтказмасини режалаштиринг. (Tier C, 15-25% word error rate on benchmark sets - we publish honest WER tiers rather than marketing claims.)

Ҳа — fors транскрипцияси аввало сизнинг кундалик бепул токенларингиздан фойдаланади. Аудио дақиқасига 50 та токенга тушади, шунинг учун кундалик нотаниш токенлар кунига бир неча соат аудиони қамраб олади. Кириб борган ҳисоблар кунига 30 000 та токендан кўпроқ тўплайди. Будан кейин, транскрипция $1 дан бошланувчи токен тўловлари билан фойдаланилгани учун тўловни амалга оширади.

fors транскриптлари ўзларининг ўнгдан чапга скриптлари билан қайтарилади ва RTL-эҳтиёткор кўрувчида (браузерлар, Word, Google Docs) тўғри кўрсатилади.

MP3, WAV, M4A, FLAC, OGG, OPUS ва WEBM тўғридан-тўғри қабул қилинади. Видео учун (MP4, MOV, MKV) биз аудио йўлакни Whisper'га жўнатишдан олдин сервер томонида ажратамиз — сиз ҳеч нарсани ўзингизга айлантиришга эҳтиёж сезмайсиз. Манба тилидан қатъи назар, fors ҳам қўшилган ҳолда, бир хил канал.

Аноним юклашлар ҳар бир файл учун тахминан 500 MB гача чекланади. Кирган ҳисоблар 2 GB гача. Умумий муддат чеклови йўқ - узун файллар автоматик равишда бўлакларга ажратилади (30 сониялик ойналар бир-бирига ўхшаш) ва давомли вақт белгилари билан бир нусхага бирлаштирилади. Бир неча соатлик fors ёзувлари (подкастлар, тўлиқ дарсликлар, йиғилишлар) яхши ишлайди.

Ҳа — ҳар бир fors транскрипти учун сўзловчининг диаризацияси аввалдан ишга туширилган. Чоп этилган маълумотлар 1-сўзловчи / 2-сўзловчи / 3-сўзловчига бўлинади ва вақт белгилари билан белгиланади, шунинг учун интервьюлар, панел муҳокамалари ва кўп томонлама учрашувлар белгиланган ҳолда қайтарилади. Диаризация алоҳида моделда ишлайди ва биз қўллаб-қувватлайдиган барча тилларда бир хил ишлайди.

Ҳа — URL-манзилни YouTube учун /transcribe/youtube/ ёки подкастлар учун /transcribe/podcast/ га жойланг (Apple, Spotify, RSS). Биз аудиони юклаб оламиз, уни Whisper орқали language=fa билан ишга туширамиз ва вақт белгилари ва сўзловчилар белгилари билан транскриптни қайтарамиз. Типик fors мазмуни: forsда янгиликлар, маърузалар, лекциялар ва сиёсий интервьюлар энг кўп учрайдиган иш юкларидир; YouTube URL манзилини /transcribe/youtube/га жойланг ёки файлни юкланг.

Whisper ҳар бир аудио дақиқаси учун 50 та токен сарфлайди, шунинг учун бир соатлик ёзув ~3000 та токенга тенг. Кўпчилик фойдаланувчилар ҳеч нарса сарфламайди - 30 та токендан иборат кундалик бепул пул жамғармаси қисқа клиплар, овозли ёзувлар ва бир марталик подкастларни қамраб олади. Бунинг устига, транскрипция $1 дан бошланувчи токен тўловлари билан фойдаланилгани учун тўловни ўз ичига олади.

Ҳа — сегмент даражасидаги (ҳар ~10-30 сонияда) ва сўз даражасидаги вақт белгилари мавжуд. ВТТ/SRT субтитр экспорти учун сўз даражаси олдиндан белгиланган, шунинг учун субтитрлар сатрма-сатр синхронлаштирилади. API талабнинг бошида timestamps="word"ни ўрнатиш керак. fors транскриптлари ўзларининг ўнгдан чапга скриптлари билан қайтарилади ва RTL-эҳтиёткор кўрувчида (браузерлар, Word, Google Docs) тўғри кўрсатилади.

Ҳа. Audio (multipart/form-data, field name "file") ни language=fa билан /v1/transcribe/'га POST қилинг — ёки Whisper'га автоматик аниқлаш учун тил параметрини қолдиринг. Транскрипт, сегментлар, вақт белгилари ва сўзловчи белгилари билан JSON'ни қайтаради. /api/'да тўлиқ манба ва SDK парчалари.

Ҳа — транскрипция тугаганидан сўнг, Таржимани босинг ёки матнни /translate/ га жойланг. fors биз қўллаб-қувватлайдиган барча тиллар билан (200+) жуфтлашади. Йиғилишда протокол учун транскрипцияни /summarize/ орқали юборинг; дубллаш учун уни /voice/tts/ га юборинг, у ерда у мақсад тилидаги аудиони кўрсатади.

Whisperнинг шовқинга чидамлилиги forsга ҳам тааллуқли, аммо бу аниқлик даражасида қўшимча шовқин базавий хато даражасини оширади. Тиш ювиш қурилмаси овози телефон ёки ноутбук микрофонлари билан ёзилгандан кўра яхшироқ натижа беради.Агар транскрипт ишлатилмаса, contact@free.ai манзилига файл билан бирга электрон почта юборинг — биз сизга тўловни қайтарамиз ва бошқа мотор сизнинг аудионгизни яхшироқ ишлатишини текширамиз.

Free.aiни севасанми? Дўстларингга айт!

Бу саҳифани баҳолаш