Fal Speech-to-Text

Free.ai · stt · ~500 ҳар бир minute

Аудио ёки видео файлни ташланг ёки URL'ни қуйига жойланг

~500 ҳар бир minute
Бизнинг GPUларда бепул ишлайди. Янгилаш Fal Speech-to-Text →

Fal Speech-to-Text a сўздан матнга модел га тенг. Ташқи моделлар орқали йўлланган - ~500 tokens дақиқада (50% markup over upstream cost).

API орқали фойдаланиш

OpenAI-га мос REST API. Алоқани яратинг ва бу моделни секундларда чақиринг.

curl -X POST https://api.free.ai/v1/stt/ \
  -H "Authorization: Bearer sk-free-..." \
  -H "Content-Type: application/json" \
  -d '{"model":"premium/speech-to-text","audio_url":"https://..."}'
Ҳужжатлар API калитини олиш

Доимий сўраладиган саволлар

Fal Speech-to-Text сўзланган аудиони матнга транскрипция қилади. MP3, WAV, M4A ёки видео файлни юклаб олинг ва Fal Speech-to-Text тўлиқ транскрипцияни ва вақт белгилари билан қўшимча SRT/VTT субтитрларини қайтаради.

Fal Speech-to-Text handles dozens of languages - Whisper-family models cover 90+, others vary. Pick "auto-detect" or specify the language for highest accuracy.

Ўзбекча аудиода сўз хатолари 5-10%, инглизча аудиода 10-20% ни ташкил қилади. Бундай архитектурадаги катта вариантлар қийин ҳолатларда яхшироқ ишлайди - аудио нотекис бўлса, катта вариантни танланг.

Ҳа - ҳар бир сегмент бошланиш/охирига вақт белгиларини ўз ичига олади. СРТ ёки VTT сифатида экспорт қилинг ва вақт белгилари видеога тўғридан-тўғри жойлаштирилади.

Fal Speech-to-Text - бу юқори сифатли транскрипция двигатели. Ҳар дақиқада ~500-1500 та аудио токен, сиз яратишдан олдин жонли намойиш этилади. Ўз-ўзидан хост қилинган транскрипция сизнинг 30,000 та токенли кундалик пулингизда бепул ишлайди; юқори сифатли моделлар $1 дан бошланувчи тўловлар билан фойдаланилганда тўловни амалга оширади.

MP3, WAV, M4A, FLAC, OGG, видео (MP4, MOV, WebM) - аудиони ажратамиз. Ҳар бир юклашда максимум 500 MB. Кўп файллар? /audio/cut/ билан ажратамиз ёки /v1/stt/batch/ни ишлатамиз.

Сўзловчи диаризацияси алоҳида ўтади - /transcribe/'да "diarize"ни ўчириб қўйинг. Fal Speech-to-Text транскрипцияни бошқаради; диаризация ҳар бир сегментни Сўзловчи 1 / Сўзловчи 2 / ва ҳоказо билан белгилайди.

Ҳа - /batch/ аудио файллар жилдини қабул қилади. Ҳар бир транскрипт /account/?tab=history'га асл файл номи билан тушади. Жилд дарахти сақлаш учун API'дан фойдаланинг.

Ҳа - аудиони "Fal Speech-to-Text" модели билан /v1/stt/transcribe/'га POST қилинг. Матн + сегментлар + сўз даражасидаги вақт белгилари билан JSON қайтарилади. /api/ тўлиқ манбага эга.

Ўз-ўзини хост қилувчи моделлар аудиони GPU'ларда сақлайди; premium DPA билан ўтади. Аудио ўртоқлашиш ойнаси (24 соат анонс, 7 кун кириш)дан кейин ўчирилади. Биз сизнинг киритишларингизни ўрганмаймиз.

Ҳа - Free.ai транскриптларни савдо мақсадларида фойдаланишга рухсат беради. Сиз юклаб олган аудио учун ҳуқуқлар (ўзингизнинг ёзувингиз, лицензияланган материал ёки рухсат билан мазмун) керак.

Реал вақт фактори тахминан 0.05-0.2× - 60 дақиқалик подкаст 3-12 дақиқада транскрипция қилинади. Premium моделлари тезроқ тугайди. Табни ёпиш учун навбат тугмасини ишлатинг.

Free.aiни севинг? Дўстларингизга айтинг!

Бу саҳифани баҳолаш