faster-whisper large-v3-turbo

Free.ai (self-hosted) · stt · ~500 ҳар бир minute

Аудио ёки видео файлни ташланг ёки URL'ни қуйига жойланг

~500 ҳар бир minute

faster-whisper large-v3-turbo a сўздан матнга модел томонидан OpenAI / SYSTRAN томонидан яратилган. Accurate transcription да энг кучли. Free.ai GPU'ларда ўз-ўзидан жойлаштирилган — сизнинг кундалик токенларингизга қарши бепул ишлайди (500 токенлар дақиқада). MIT остида чиқарилган - Free.ai остида савдо учун фойдаланишга рухсат берилган.

API орқали фойдаланиш

OpenAI-га мос REST API. Алоқани яратинг ва бу моделни секундларда чақиринг.

curl -X POST https://api.free.ai/v1/stt/ \
  -H "Authorization: Bearer sk-free-..." \
  -H "Content-Type: application/json" \
  -d '{"model":"whisper","audio_url":"https://..."}'
Ҳужжатлар API калитини олиш

Доимий сўраладиган саволлар

faster-whisper large-v3-turbo сўзланган аудиони матнга транскрипция қилади. MP3, WAV, M4A ёки видео файлни юклаб олинг ва faster-whisper large-v3-turbo тўлиқ транскрипцияни ва вақт белгилари билан қўшимча SRT/VTT субтитрларини қайтаради.

faster-whisper large-v3-turbo handles dozens of languages - Whisper-family models cover 90+, others vary. Pick "auto-detect" or specify the language for highest accuracy.

Ўзбекча аудиода сўз хатолари 5-10%, инглизча аудиода 10-20% ни ташкил қилади. Бундай архитектурадаги катта вариантлар қийин ҳолатларда яхшироқ ишлайди - аудио нотекис бўлса, катта вариантни танланг.

Ҳа - ҳар бир сегмент бошланиш/охирига вақт белгиларини ўз ичига олади. СРТ ёки VTT сифатида экспорт қилинг ва вақт белгилари видеога тўғридан-тўғри жойлаштирилади.

faster-whisper large-v3-turbo ўз GPUларимизда ишлайди, аввал сизнинг кундалик бепул пулингизга қарши; $5 → 200,000 тўлов токенлари кейин. Ҳар дақиқада ~500 токен.

MP3, WAV, M4A, FLAC, OGG, видео (MP4, MOV, WebM) - аудиони ажратамиз. Ҳар бир юклашда максимум 500 MB. Кўп файллар? /audio/cut/ билан ажратамиз ёки /v1/stt/batch/ни ишлатамиз.

Сўзловчи диаризацияси алоҳида ўтади - /transcribe/'да "diarize"ни ўчириб қўйинг. faster-whisper large-v3-turbo транскрипцияни бошқаради; диаризация ҳар бир сегментни Сўзловчи 1 / Сўзловчи 2 / ва ҳоказо билан белгилайди.

Ҳа - /batch/ аудио файллар жилдини қабул қилади. Ҳар бир транскрипт /account/?tab=history'га асл файл номи билан тушади. Жилд дарахти сақлаш учун API'дан фойдаланинг.

Ҳа - аудиони "faster-whisper large-v3-turbo" модели билан /v1/stt/transcribe/'га POST қилинг. Матн + сегментлар + сўз даражасидаги вақт белгилари билан JSON қайтарилади. /api/ тўлиқ манбага эга.

Ўз-ўзини хост қилувчи моделлар аудиони GPU'ларда сақлайди; premium DPA билан ўтади. Аудио ўртоқлашиш ойнаси (24 соат анонс, 7 кун кириш)дан кейин ўчирилади. Биз сизнинг киритишларингизни ўрганмаймиз.

Ҳа - Free.ai транскриптларни савдо мақсадларида фойдаланишга рухсат беради. Сиз юклаб олган аудио учун ҳуқуқлар (ўзингизнинг ёзувингиз, лицензияланган материал ёки рухсат билан мазмун) керак.

Реал вақт фактори тахминан 0.05-0.2× - 60 дақиқалик подкаст 3-12 дақиқада транскрипция қилинади. Premium моделлари тезроқ тугайди. Табни ёпиш учун навбат тугмасини ишлатинг.

Free.aiни севинг? Дўстларингизга айтинг!

Бу саҳифани баҳолаш