Wizper (Whisper v3)

Free.ai · stt · ~500 tokens për minute

Lëviz një file audio apo video, ose ngjite një URL më poshtë

~500 tokens për minute

Wizper (Whisper v3) është a model fjalimi-në-tekst. E drejtuar nëpërmjet modeleve të jashtme - ~500 tokens për minutë (50% markup mbi koston e upstream).

Përdorimi nëpërmjet API

API REST e përshtatshme me OpenAI. Gjenerati një kyç dhe thirreni këtë model në sekonda.

curl -X POST https://api.free.ai/v1/stt/ \
  -H "Authorization: Bearer sk-free-..." \
  -H "Content-Type: application/json" \
  -d '{"model":"premium/wizper","audio_url":"https://..."}'
Dokumentacioni API Merr kyçin API

Pyetja e shpeshtë

Wizper (Whisper v3) transkripton audion e folur në tekst. Ngarko një file MP3, WAV, M4A ose video dhe Wizper (Whisper v3) kthen transkriptimin e plotë plus subtitrat opcionalë SRT/VTT me shenjat e kohës.

Wizper (Whisper v3) handles dozens of languages - Whisper-family models cover 90+, others vary. Pick "auto-detect" or specify the language for highest accuracy.

Norma e gabimeve të fjalëve është 5-10% në audion e pastër anglisht, 10-20% në audion me zhurmë apo me theksim. Variantet e mëdha të të njëjtës arkitekturë bëjnë më mirë në raste të vështira - zgjedh më të mëdha kur audio është e papërpunuar.

Po - çdo segment përfshin një shtyllë kohore fillimi/fundi. Eksporto si SRT ose VTT dhe kohët do të vendosen drejtpërdrejt në video.

Wizper (Whisper v3) është një motor premium për transkriptim. Rreth ~500-1,500 token për minutë të audios, të shfaqur në kohë reale para se të gjenerosh. Transkriptimi i vetë-hostuar është i lirë në poolin tuaj të përditshëm prej 30,000 token; modelet premium janë të paguara sipas përdorimit, me rifreskime nga $1.

MP3, WAV, M4A, FLAC, OGG, plus video (MP4, MOV, WebM) - nxjerrim audion. Maksimum 500 MB për upload. File më të gjatë? Ndaj me /audio/cut/ ose përdor /v1/stt/batch/.

Diarizimi i folësit është një kalim i veçantë - ndërro "diarize" në /transcribe/. Wizper (Whisper v3) trajton transkriptimin; diarization etiketon çdo segment me Folësi 1 / Folësi 2 / etj.

Po - /batch/ pranon një kartelë me file audio. Çdo transkriptim përfundon në /account/?tab=history me emrin origjinal të file. Për ruajtjen e pemës së kartelave përdor API.

Po - POST audion tuaj tek /v1/stt/transcribe/ me modelin "Wizper (Whisper v3)". Kthen JSON me tekst + segmente + timestamp në nivel fjalësh. /api/ ka referencën e plotë.

Modelet e vetë-hostuar mbajnë audion në GPU-të tona; premium kalojnë nëpërmjet me një DPA. Audio fshihet pas dritares së ndarjes (24 orë anonim, 7 ditë të hyrjes). Ne nuk trajnojmë input-in tuaj.

Po - Free.ai lejon përdorimin komercial të transkriptave. Ju duhet të keni të drejtat për audion që keni ngarkuar (inxhinieri juaj, material i licencuar, ose përmbajtje me leje).

Faktori i kohës së vërtetë është rreth 0.05-0.2× - një podcast 60-minutësh transkribohet në 3-12 minuta. Modelet Premium shpesh përfundojnë më shpejt. Përdor butonin e radhës për të mbyllur skedën.

Të pëlqen Free.ai?

Vlerësoni këtë faqe