Distil-Whisper large-v3

Free.ai (self-hosted) · stt · ~500 Токенҳо minute

Файли аудио ё видеоро партоед ё URL-ро дар поён ҷойгир кунед

~500 Токенҳо minute

Distil-Whisper large-v3 ин a Модули гуфтугӯ ба матн аст, ки аз тарафи HuggingFace сохта шудааст. Strongest at Real-time transcription, large-volume batch STT.. Free.ai (Free.ai) — як адад аст, ки дар рӯйхати ситорагон бо аломати (88) ифода шудааст. Дар асоси MIT - истифодаи тиҷоратӣ дар Free.ai иҷозат дода шудааст.

Истифода аз API

API-и REST-и OpenAI-и мувофиқ. Калидро эҷод кунед ва ин моделро дар якчанд сония даъват кунед.

curl -X POST https://api.free.ai/v1/stt/ \
  -H "Authorization: Bearer sk-free-..." \
  -H "Content-Type: application/json" \
  -d '{"model":"distil-whisper-large-v3","audio_url":"https://..."}'
Ҳуҷҷатҳо Гирифтани калиди API

Саволҳои зиёд

Distil-Whisper large-v3 садои гуфташударо ба матн нусхабардорӣ мекунад. Файлҳои MP3, WAV, M4A ё видеоиро бор кунед ва Distil-Whisper large-v3 нусхабардории пурра ва зернависи SRT/VTT-ро бо нишонаҳои вақт бармегардонад.

Distil-Whisper large-v3 handles dozens of languages - Whisper-family models cover 90+, others vary. Pick "auto-detect" or specify the language for highest accuracy.

Дараҷаи хатогии калима 5- 10% дар аудиои англисии тоза, 10- 20% дар аудиои овоздор ё бо акцент мебошад. Вариантҳои калони ҳамон сохтори дар ҳолатҳои душвор беҳтар кор мекунанд - калонтарро интихоб кунед, вақте ки аудио сахт аст.

Бале - ҳар як сегмент дорои аломати вақти оғоз/охири мебошад. Содирот ҳамчун SRT ё VTT ва аломати вақти бевосита ба видеои шумо.

Distil-Whisper large-v3 дар аввал дар GPU-ҳои худамон дар муқобили ҳавзаи озоди ҳаррӯзаи шумо кор мекунад; $5 → 200,000 нишонаҳои пардохтшуда баъд аз он. Дар бораи ~500 нишонаҳо дар як дақиқа.

MP3, WAV, M4A, FLAC, OGG, ва видео (MP4, MOV, WebM) - мо аудиоро бароварда мебарорем. Ҳаҷми максималии 500 МБ барои ҳар боркунӣ. Файлҳои дарозтар? Бо /audio/cut/ ҷудо кунед ё /v1/stt/batch/-ро истифода баред.

Speaker diarization is a separate pass - toggle "diarize" on /transcribe/. Distil-Whisper large-v3 handles the transcription; diarization labels each segment with Speaker 1 / Speaker 2 / etc.

Да — /batch/ каталоги файлҳои аудиоиро қабул мекунад. Ҳар як нусхаи нусхаи нусха дар /account/?tab=history бо номи файли аслӣ ҷойгир мешавад. Барои нигоҳдории дарахти каталог API-ро истифода баред.

Ҳа - аудиои худро ба /v1/stt/transcribe/ бо модел "Distil-Whisper large-v3" POST кунед. JSON-ро бо матн + қисмҳо + аломати вақти сатҳҳои калима бармегардонад. /api/ истиноди пурра дорад.

Модельҳои худи соҳиб аудиоро дар GPU-и мо нигоҳ медоранд; Premium бо DPA мегузарад. Аудио баъди тирезаи муштарак (24 соат бе қайд, 7 рӯз ворид шудан) нест карда мешавад. Мо дар воридоти шумо машқ намекунем.

Бале — Free.ai иҷозат медиҳад, ки истифодаи тиҷоратии нусхаҳои нусхаҳои нусхаҳоро истифода баред. Шумо бояд ҳуқуқи аудиоро, ки шумо бор кардаед (записьи худ, маводи иҷозатномадор ё мундариҷа бо иҷозатнома) дошта бошед.

Фактори вақти воқеӣ тақрибан 0.05-0.2× - 60 дақиқаи podcast дар 3-12 дақиқа нусхабардорӣ мешавад. Намунаҳои Premium аксар вақт зудтар ба итмом мерасанд. Барои пӯшидани ҷадвалбандӣ тугмаи навбатро истифода баред.

Шумо дӯст медоред Free.ai? Ба дӯстонатон бигӯед!

Баҳогузории ин саҳифа