faster-whisper large-v3-turbo

Free.ai (self-hosted) · stt · ~500 Ցուցադրել minute

Ցույց տալ ձայնային կամ տեսագրական ֆայլը կամ ներքևում տեղադրել URL- ը

~500 Ցուցադրել minute

faster-whisper large-v3-turbo is a խոսել-տեքստը մոդել built by OpenAI / SYSTRAN. Strongest at Accurate transcription. Free.ai GPU-ների վրա ինքնուրույն տեղադրված — աշխատում է անվճար ձեր օրական token pool-ի դեմ (500 tokens րոպե). Հրապարակված է MIT - առևտրային օգտագործման թույլտվությամբ Free.ai.

Օգտագործել API- ի միջոցով

OpenAI-ի հետ համընկնող REST API-ը։ Գործարկեք կոդը և մի քանի վայրկյանում զանգահարեք այս մոդելին։

curl -X POST https://api.free.ai/v1/stt/ \
  -H "Authorization: Bearer sk-free-..." \
  -H "Content-Type: application/json" \
  -d '{"model":"whisper","audio_url":"https://..."}'
API փաստաթղթավորում Գրանցվել API կոդով

Հաճախակի տրվող հարցեր

faster-whisper large-v3-turbo-ը ձայնագրում է խոսված ձայնը տեքստի մեջ։ Բեռնեք MP3, WAV, M4A կամ վիդեո ֆայլ և faster-whisper large-v3-turbo-ը կվերադարձնի ամբողջական ձայնագրությունը և ընտրելի SRT/VTT ենթատեքստերը ժամանակային նշաններով։

faster-whisper large-v3-turbo handles dozens of languages - Whisper-family models cover 90+, others vary. Pick "auto-detect" or specify the language for highest accuracy.

Խոսքի սխալների ցուցանիշը 5-10% է անգլերեն լեզվի ձայնագրության դեպքում, 10-20%` աղմկոտ կամ ակցենտավորված ձայնագրության դեպքում։ Այդ նույն ճարտարապետության մեծ տարբերակները ավելի լավ են աշխատում դժվար օրինակներում՝ ընտրեք ավելի մեծը, երբ ձայնագրությունը խճճված է։

Այո - յուրաքանչյուր հատված ներառում է սկզբ/ավարտ ժամանակային նշաններ։ Արտահանել որպես SRT կամ VTT և ժամանակային նշանները ուղղակիորեն ներառել Ձեր տեսահոլովակում։

faster-whisper large-v3-turbo-ը աշխատում է մեր սեփական GPU-ների վրա, սկզբում ձեր օրական անվճար պոլի դեմ, հետո $5 → 200,000 վճարված տոկոսադրույքներ։ Մոտ ~500 տոկոսադրույք րոպեում։

MP3, WAV, M4A, FLAC, OGG, plus video (MP4, MOV, WebM) — մենք դուրս ենք բերում ձայնը։ Ավելի շատ 500 ՄԲ մեկ բեռնման համար։ Ավելի երկար ֆայլեր? Փոխարինել /audio/cut/-ով կամ օգտագործել /v1/stt/batch/-ը։

Ընդունողի դիարիզացիան առանձին անցում է - փոխել "diarize" /transcribe/-ում. faster-whisper large-v3-turbo-ը կառավարում է թարգմանությունը; դիարիզացիան յուրաքանչյուր հատվածի համար նշում է Ընդունող 1 / Ընդունող 2 / և այլն

Այո - /batch/-ը ընդունում է ձայնային ֆայլերի պանակը։ Յուրաքանչյուր ձայնագրություն տեղադրվում է /account/?tab=history սկզբնական ֆայլի անունով։ Ծառի պահպանման համար օգտագործեք API-ն։

Այո - POST ձայնային տվյալները /v1/stt/transcribe/-ին՝ model="faster-whisper large-v3-turbo"-ով։ Վերադարձնում է JSON-ը տեքստի + հատվածների + բառի մակարդակի ժամանակային նշանների հետ։ /api/-ն ունի ամբողջական հղում։

Ինքնաապահովված մոդելները պահում են ձայնը մեր GPU-ներում, premium-ը անցնում է DPA-ով։ Ձայնը հեռացվում է կիսում-պատուհանի (24 ժամ անանուն, 7 օր մուտքագրում) ավարտին։ Մենք չենք սովորեցնում ձեր մուտքագրումները։

Այո - Free.ai- ը թույլ է տալիս օգտագործել տեքստը առևտրային նպատակներով: Դուք պետք է ունեք ձեր տեղադրած ձայնագրության իրավունքները (ձեր սեփական ձայնագրությունը, լիցենզավորված նյութը կամ համաձայնության դեպքում բովանդակությունը)։

Օգտագործեք ընթացիկ ժամանակի գործոնը մոտավորապես 0.05-0.2× — 60 րոպեանոց podcast-ը վերծանում է 3-12 րոպեում։ Premium մոդելները հաճախ ավելի արագ են ավարտվում։ Ձեռքի վրա պահեք ընթացիկ ժամանակի գործոնը, որպեսզի փակեք վահանակը։

Սիրում ես Free.ai-ը, ասա ընկերներիդ։

Առաջարկել այս էջը