Distil-Whisper large-v3

Free.ai (self-hosted) · stt · ~500 біт minute

Перацягніце файл аўдыё ці відэа, альбо ўстаўце спасылку ніжэй

~500 біт minute

Distil-Whisper large-v3 is a Модэль пераўтварэння мовы ў тэкст built by HuggingFace. Strongest at Real-time transcription, large-volume batch STT.. Самастойна на Free.ai GPU - працуе бясплатна з дапамогай вашага штодзённага рэсурснага фонду (500 рэсурсы у хвіліну). Released under MIT — commercial use permitted on Free.ai.

Выкарыстаць праз API

OpenAI- сумяшчальны REST API. Стварыць ключ і выклікаць гэтую мадэль у некалькі секунд.

curl -X POST https://api.free.ai/v1/stt/ \
  -H "Authorization: Bearer sk-free-..." \
  -H "Content-Type: application/json" \
  -d '{"model":"distil-whisper-large-v3","audio_url":"https://..."}'
Дакументацыя API Атрымаць ключ API

Частыя пытанні

Distil-Whisper large-v3 перакладае гукавыя паведамленні ў тэксты. Загрузіце файл MP3, WAV, M4A або відэа, і Distil-Whisper large-v3 верне поўны пераклад і дадатковыя субтытры SRT/VTT з часовымі знакамі.

Distil-Whisper large-v3 handles dozens of languages - Whisper-family models cover 90+, others vary. Pick "auto-detect" or specify the language for highest accuracy.

Частата памылак у словах складае 5- 10% пры чыстым англійскім гучанні, 10- 20% пры шумным або акцэнтаваным гучанні. Вялікія варыянты той жа архітэктуры значна лепш працуюць на цяжкіх выпадках - выбірайце большыя, калі гучанне грубае.

Так - кожны сегмент утрымлівае час пачатку/ канца. Экспартаваць як SRT або VTT і час будзе адлюстраваны ў відэа.

Distil-Whisper large-v3 працуе на нашых уласных GPU супраць вашага штодзённага бясплатнага пулу; $5 → 200,000 плацежных знакаў пасля гэтага. Прыблізна ~ 500 знакаў у хвіліну.

MP3, WAV, M4A, FLAC, OGG, плюс відэа (MP4, MOV, WebM) - мы выцягваем аўдыё. Макс. 500 МБ за загрузку. Большыя файлы? Раздзяліце з / audio/ cut / або выкарыстоўвайце / v1/ stt/ batch /.

Speaker diarization is a separate pass - toggle "diarize" on /transcribe/. Distil-Whisper large-v3 handles the transcription; diarization labels each segment with Speaker 1 / Speaker 2 / etc.

Так — / batch / прымае тэчку з аўдыё файламі. Кожны транскрыпт запісваецца ў / account/? tab=history з арыгінальнай назвай файла. Для захавання дрэва тэчак выкарыстоўвайце API.

Так — POST ваш аўдыё ў /v1/stt/transcribe/ з model="Distil-Whisper large-v3". Верне JSON з тэкстам + сегментамі + часамі на ўзроўні слова. /api/ мае поўную спасылку.

У самаабслугоўваных мадэлях гук захоўваецца на нашых GPU; у прэміум- мадэлях ён праходзіць праз DPA. Гук выдаляецца пасля заканчэння часу абмену (24 гадзіны без перапынку, 7 дзён уводу). Мы не трэніруемся на вашых уводах.

Так - Free.ai дазваляе выкарыстанне транскрыптаў у камерцыйных мэтах. Вы павінны мець правы на загружаны гукавы файл (ваш уласны запіс, ліцэнзаваны матэрыял або змест з дазволам).

Коэфіцыент рэальнага часу складае каля 0.05- 0.2 × - 60- хвілінны подкаст транскрыптуецца за 3- 12 хвілін. Модэлі Premium звычайна заканчваюцца хутчэй. Выкарыстоўвайце кнопку чаргі, каб закрыць картку.

Любіце Free.ai? Раскажыце сваім сябрам!

Ацэнка гэтай старонкі