Wizper (Whisper v3)
Free.ai
·
stt
·
~500 märgid per minute
Wizper (Whisper v3) on a kõne-teksti mudel. Läbi suunatud välised mudelid - ~500 tokens minuti kohta (50% hinnalisand üle eelmise etapi kulud).
Kasutamine API kaudu
OpenAI- ühilduv REST API. Genereeri võti ja kutsu seda mudelit sekundites.
curl -X POST https://api.free.ai/v1/stt/ \
-H "Authorization: Bearer sk-free-..." \
-H "Content-Type: application/json" \
-d '{"model":"premium/wizper","audio_url":"https://..."}'
API dokumentatsioon
API võtme hankimine
Korduma kippuvad küsimused
Wizper (Whisper v3) transkribeerib kõnes oleva audio teksti. MP3, WAV, M4A või videofaili üleslaadimine ja Wizper (Whisper v3) tagastab täieliku ärakirja pluss valikulised SRT/VTT subtiitrid ajatemplitega.
Wizper (Whisper v3) handles dozens of languages - Whisper-family models cover 90+, others vary. Pick "auto-detect" or specify the language for highest accuracy.
Sõna-error määr on 5-10% puhas inglise heli, 10-20% müra või aktsent heli. Suured variandid sama arhitektuuri teha tähendusrikkalt parem rasketel juhtudel - valida suurem, kui heli on töötlemata.
Jah - iga segmendis on stardi/lõpu ajatemplid. Eksporditakse kui SRT või VTT ja ajad kaardi otse oma video.
Wizper (Whisper v3) on premium transkriptsiooni mootor. Umbes 500-1500 märgid minutis audio, kuvatakse otse enne genereerida. Isehostitud transkriptsioon jookseb tasuta oma 30,000-token päevas bassein; premium mudelid on tasu-nagu-you-go, koos lisandub $ 1.
MP3, WAV, M4A, FLAC, OGG, pluss video (MP4, MOV, WebM) - me eraldada audio. Max 500 MB kohta üles. Pikemad failid? Split with /audio/cut / või kasutada /v1/stt/batch /.
Speaker diarization on eraldi pass - lülitamine "diarize" sees / trancribe /. Wizper (Whisper v3) tegeleb transkriptsioon; diarization sildid iga segmendiga koos Kõlar 1 / Speaker 2 / jne.
Jah - / batch/ a kaust / audio failid Iga transkript asukohas konto /? tab=ajalugu koos originaal failinimi. Kaustapuu säilitamine kasutamine API.
Jah - sisesta heli /v1/stt/transcribe/ mudeliga="Wizper (Whisper v3)". Tagastab JSON- i teksti + segmentidega + sõnataseme ajatemplid. /api/ on täielik viide.
Isehostitud mudelid hoida audio meie GPUs; premium läbida DPA. Audio kustutatakse pärast aktsiaakna (24h anon, 7d signed-in). Me ei treeni oma sisendeid.
Jah - Free.ai annab transkriptide kaubandusliku kasutamise. Vajad õigusi üleslaaditud audiole (omaenda salvestusele, litsentsitud materjalile või sisule nõusolekul).
Reaalajas tegur on umbes 0.05-0.2× - 60-minutiline podcast trancribes 3-12 minutit. Premium mudelid sageli lõpetada kiiremini. Kasutage järjekorda nuppu sulgeda kaart.