Wizper (Whisper v3)

Free.ai · stt · ~500 Токенҳо minute

Файли аудио ё видеоро партоед ё URL-ро дар поён ҷойгир кунед

~500 Токенҳо minute
Дар ҳоли ҳозир дар риштаи журналистика фаъолият мекунад. Навсозӣ барои Wizper (Whisper v3) →

Wizper (Whisper v3) аст a Модули гуфтугӯ ба матн. Routed through external models - ~500 tokens дар дақиқа (50% markup over upstream cost).

Истифода аз API

API-и REST-и OpenAI-и мувофиқ. Калидро эҷод кунед ва ин моделро дар якчанд сония даъват кунед.

curl -X POST https://api.free.ai/v1/stt/ \
  -H "Authorization: Bearer sk-free-..." \
  -H "Content-Type: application/json" \
  -d '{"model":"premium/wizper","audio_url":"https://..."}'
Ҳуҷҷатҳо Гирифтани калиди API

Саволҳои зиёд

Wizper (Whisper v3) садои гуфташударо ба матн нусхабардорӣ мекунад. Файлҳои MP3, WAV, M4A ё видеоиро бор кунед ва Wizper (Whisper v3) нусхабардории пурра ва зернависи SRT/VTT-ро бо нишонаҳои вақт бармегардонад.

Wizper (Whisper v3) handles dozens of languages - Whisper-family models cover 90+, others vary. Pick "auto-detect" or specify the language for highest accuracy.

Дараҷаи хатогии калима 5- 10% дар аудиои англисии тоза, 10- 20% дар аудиои овоздор ё бо акцент мебошад. Вариантҳои калони ҳамон сохтори дар ҳолатҳои душвор беҳтар кор мекунанд - калонтарро интихоб кунед, вақте ки аудио сахт аст.

Бале - ҳар як сегмент дорои аломати вақти оғоз/охири мебошад. Содирот ҳамчун SRT ё VTT ва аломати вақти бевосита ба видеои шумо.

Wizper (Whisper v3) муҳаррики транскрипсияи Premium мебошад. Дар бораи ~500-1,500 нишондиҳанда дар як дақиқаи аудио, пеш аз эҷод кардани шумо нишон дода мешавад. Транскрипсияи худи соҳиб дар 30,000-токенҳои ҳаррӯзаи шумо ройгон кор мекунад; моделҳои Premium бо пардохти шумо пардохт карда мешаванд, бо иловаҳо аз $1.

MP3, WAV, M4A, FLAC, OGG, ва видео (MP4, MOV, WebM) - мо аудиоро бароварда мебарорем. Ҳаҷми максималии 500 МБ барои ҳар боркунӣ. Файлҳои дарозтар? Бо /audio/cut/ ҷудо кунед ё /v1/stt/batch/-ро истифода баред.

Speaker diarization is a separate pass - toggle "diarize" on /transcribe/. Wizper (Whisper v3) handles the transcription; diarization labels each segment with Speaker 1 / Speaker 2 / etc.

Да — /batch/ каталоги файлҳои аудиоиро қабул мекунад. Ҳар як нусхаи нусхаи нусха дар /account/?tab=history бо номи файли аслӣ ҷойгир мешавад. Барои нигоҳдории дарахти каталог API-ро истифода баред.

Ҳа - аудиои худро ба /v1/stt/transcribe/ бо модел "Wizper (Whisper v3)" POST кунед. JSON-ро бо матн + қисмҳо + аломати вақти сатҳҳои калима бармегардонад. /api/ истиноди пурра дорад.

Модельҳои худи соҳиб аудиоро дар GPU-и мо нигоҳ медоранд; Premium бо DPA мегузарад. Аудио баъди тирезаи муштарак (24 соат бе қайд, 7 рӯз ворид шудан) нест карда мешавад. Мо дар воридоти шумо машқ намекунем.

Бале — Free.ai иҷозат медиҳад, ки истифодаи тиҷоратии нусхаҳои нусхаҳои нусхаҳоро истифода баред. Шумо бояд ҳуқуқи аудиоро, ки шумо бор кардаед (записьи худ, маводи иҷозатномадор ё мундариҷа бо иҷозатнома) дошта бошед.

Фактори вақти воқеӣ тақрибан 0.05-0.2× - 60 дақиқаи podcast дар 3-12 дақиқа нусхабардорӣ мешавад. Намунаҳои Premium аксар вақт зудтар ба итмом мерасанд. Барои пӯшидани ҷадвалбандӣ тугмаи навбатро истифода баред.

Шумо дӯст медоред Free.ai? Ба дӯстонатон бигӯед!

Баҳогузории ин саҳифа