Fal Speech-to-Text

Free.ai · stt · ~500 tokens per minute

Səs və ya video faylını burax ya da URL-ni aşağıya yapışdır

~500 tokens per minute
GPU-larda pulsuz işləyir. Yenilə Fal Speech-to-Text →

Fal Speech-to-Text a söz-mətnə model. Xarici modellər vasitəsilə yönləndirilir - ~500 tokenləri Dəyişdir (50% markup upstream xərcləri).

API vasitəsilə istifadə et

OpenAI-a uyğun REST API. Açar yaradın və bu modeli saniyələr içində çağırın.

curl -X POST https://api.free.ai/v1/stt/ \
  -H "Authorization: Bearer sk-free-..." \
  -H "Content-Type: application/json" \
  -d '{"model":"premium/speech-to-text","audio_url":"https://..."}'
API sənədləşdirməsi API Açarı

Tez-tez Sorulan Sual

Fal Speech-to-Text səsli mətni mətnə çevirir. MP3, WAV, M4A və ya video fayl yükləyin və Fal Speech-to-Text bütün transkripti və əlavə olaraq vaxt işarələrlə SRT/VTT subtitrlərini geri qaytarır.

Fal Speech-to-Text handles dozens of languages - Whisper-family models cover 90+, others vary. Pick "auto-detect" or specify the language for highest accuracy.

Söz səhvləri nisbəti təmiz İngilis səsi üçün 5-10%, səsli və ya aksentli səs üçün 10-20%'dir. Bu arxitekturanın böyük variantları çətin hallarda daha yaxşı işləyir - səsin tüklü olduğu zaman böyük variantları seçin.

Bəli - hər hissə başlanğıc/son vaxt damğaları daxildir. SRT ya da VTT olaraq ixrac et və vaxtlar videonuza doğrudan-doğruya köçürüləcəkdir.

Fal Speech-to-Text premium transkripsiya mühərrikidir. Hər dəqiqədə ~500-1,500 token səsi, siz yaratmazdan əvvəl canlı göstərilir. Öz-özünə host edilmiş transkripsiya sizin 30,000-token günlük bazası üzərində pulsuz işləyir; premium modellər $1-dən başlayaraq top-uplarla pay-as-you-go modelləridir.

MP3, WAV, M4A, FLAC, OGG, video (MP4, MOV, WebM) - səsi çıxarırıq. Yükləmə başına maksimum 500 MB. Daha uzun fayllar? /audio/cut/ ilə bölün ya da /v1/stt/batch/ istifadə edin.

Sənədçi diarizasiya ayrı bir keçiddir - /transcribe/ üzərində "diarize" fəallaşdırın. Fal Speech-to-Text transkripsiyanı idarə edir; diarization hər bir segmenti Sənədçi 1 / Sənədçi 2 / və s. ilə etiketləyir.

Bəli - /batch/ audio faylları qovluğunu qəbul edir. Hər transkript orijinal fayl adı ilə /account/?tab=history-də yerləşir. Qovluq ağacının qorunması üçün API-ni istifadə et.

Bəli - Audionuzu model="Fal Speech-to-Text" ilə /v1/stt/transcribe/-ə POST edin. JSON-u mətn + hissə + söz səviyyəli vaxt damğaları ilə geri qaytarır. /api/ tam istinaddır.

Öz-özünə qoşulan modellər səsi GPU-da saxlayır; premium DPA ilə keçid verir. Səs paylaşma pəncərəsindən sonra silinir (24 saat anon, 7 gün daxil). Biz sizin daxil olmalarınızı öyrənmirik.

Bəli - Free.ai transkriptlərin kommersiya istifadəsini icazə verir. Siz yüklədiyiniz səsin hüquqlarını (öz qeydinizi, lisenziyalı materialı, ya da icazəli məzmunu) tələb edirsiniz.

Real vaxt faktoru təxminən 0.05-0.2× - 60 dəqiqəlik podcast 3-12 dəqiqədə transkriptləşir. Premium modellər tez-tez daha sürətli bitir. Səkənəni bağlamaq üçün növbə düyməsini istifadə et.

Free.ai sevmirəm? Dostlarına deyin!

Bu səhifəni qiymətləndir