ElevenLabs STT

Free.ai · stt · ~500 біт minute

Перацягніце файл аўдыё ці відэа, альбо ўстаўце спасылку ніжэй

~500 біт minute
Уваходзіць у склад Глыбоцкага раёна. Абнавіць на ElevenLabs STT →

ElevenLabs STT is a Модэль пераўтварэння мовы ў тэкст. Routed through external models - ~500 tokens у хвіліну (50% markup over upstream cost).

Выкарыстаць праз API

OpenAI- сумяшчальны REST API. Стварыць ключ і выклікаць гэтую мадэль у некалькі секунд.

curl -X POST https://api.free.ai/v1/stt/ \
  -H "Authorization: Bearer sk-free-..." \
  -H "Content-Type: application/json" \
  -d '{"model":"premium/elevenlabs/speech-to-text","audio_url":"https://..."}'
Дакументацыя API Атрымаць ключ API

Частыя пытанні

ElevenLabs STT перакладае гукавыя паведамленні ў тэксты. Загрузіце файл MP3, WAV, M4A або відэа, і ElevenLabs STT верне поўны пераклад і дадатковыя субтытры SRT/VTT з часовымі знакамі.

ElevenLabs STT handles dozens of languages - Whisper-family models cover 90+, others vary. Pick "auto-detect" or specify the language for highest accuracy.

Частата памылак у словах складае 5- 10% пры чыстым англійскім гучанні, 10- 20% пры шумным або акцэнтаваным гучанні. Вялікія варыянты той жа архітэктуры значна лепш працуюць на цяжкіх выпадках - выбірайце большыя, калі гучанне грубае.

Так - кожны сегмент утрымлівае час пачатку/ канца. Экспартаваць як SRT або VTT і час будзе адлюстраваны ў відэа.

ElevenLabs STT - гэта прэміум-рухавік транскрыпцыі. Прыблізна ~500-1500 знакаў за хвіліну гуку, паказаных у рэжыме рэальнага часу перад стварэннем. Самастойная транскрыпцыя працуе бясплатна на вашым штодзённым пункце 30 000 знакаў; прэміум-мадэлі плацяць па выкарыстанні, з дадатковымі плацяжамі ад $1.

MP3, WAV, M4A, FLAC, OGG, плюс відэа (MP4, MOV, WebM) - мы выцягваем аўдыё. Макс. 500 МБ за загрузку. Большыя файлы? Раздзяліце з / audio/ cut / або выкарыстоўвайце / v1/ stt/ batch /.

Speaker diarization is a separate pass - toggle "diarize" on /transcribe/. ElevenLabs STT handles the transcription; diarization labels each segment with Speaker 1 / Speaker 2 / etc.

Так — / batch / прымае тэчку з аўдыё файламі. Кожны транскрыпт запісваецца ў / account/? tab=history з арыгінальнай назвай файла. Для захавання дрэва тэчак выкарыстоўвайце API.

Так — POST ваш аўдыё ў /v1/stt/transcribe/ з model="ElevenLabs STT". Верне JSON з тэкстам + сегментамі + часамі на ўзроўні слова. /api/ мае поўную спасылку.

У самаабслугоўваных мадэлях гук захоўваецца на нашых GPU; у прэміум- мадэлях ён праходзіць праз DPA. Гук выдаляецца пасля заканчэння часу абмену (24 гадзіны без перапынку, 7 дзён уводу). Мы не трэніруемся на вашых уводах.

Так - Free.ai дазваляе выкарыстанне транскрыптаў у камерцыйных мэтах. Вы павінны мець правы на загружаны гукавы файл (ваш уласны запіс, ліцэнзаваны матэрыял або змест з дазволам).

Коэфіцыент рэальнага часу складае каля 0.05- 0.2 × - 60- хвілінны подкаст транскрыптуецца за 3- 12 хвілін. Модэлі Premium звычайна заканчваюцца хутчэй. Выкарыстоўвайце кнопку чаргі, каб закрыць картку.

Любіце Free.ai? Раскажыце сваім сябрам!

Ацэнка гэтай старонкі