ElevenLabs STT
Free.ai
·
stt
·
~500 žetona po minute
ElevenLabs STT je a model govora u tekst. Putovanje kroz vanjske modele - ~500 žetoni po minuti (50% označavanje iznad troškova iznad streama).
Koristi preko API
OpenAI kompatibilan REST API. Generiraj ključ i nazovi ovaj model u sekundama.
curl -X POST https://api.free.ai/v1/stt/ \
-H "Authorization: Bearer sk-free-..." \
-H "Content-Type: application/json" \
-d '{"model":"premium/elevenlabs/speech-to-text","audio_url":"https://..."}'
API dokumentacija
Dobavi API ključ
Česta pitanja
ElevenLabs STT transcribes spoken audio into text. Upload an MP3, WAV, M4A, or video file and ElevenLabs STT returns the full transcript plus optional SRT/VTT subtitles with timestamps.
ElevenLabs STT handles dozens of languages - Whisper-family models cover 90+, others vary. Pick "auto-detect" or specify the language for highest accuracy.
Brzina riječi-grebotina je 5-10% na čist engleski audio, 10-20% na bučno ili naglasak audio. Velika varijante iste arhitekture učiniti smisao bolje na tvrde slučajeve - odaberi veći kada je zvuk grub.
Da - svaki segment uključuje početna/krajnja vremenska mjesta. Izvezi kao SRT ili VTT i vremensku mapu ravno na vaš video.
ElevenLabs STT je premium transkripcija motor. O ~500-1,500 žetoni po minuti zvuka, prikazan uživo prije nego što generirati. Samo-hosted transkripcija radi besplatno na 30.000-taken dnevni bazen; premium modeli su pay-as-yo-go, s top-upovima od $1.
MP3, WAV, M4A, FLAC, OGG, plus video (MP4, MOV, WebM) - izvlačimo zvuk. Max 500 MB po slanju. Duži datoteke? Split s /audio/cut/ ili koristiti /v1/stt/batch /.
Dijarizacija zvučnika je odvojena prolaznica - uključite "dijarise" na /transkripciju /. ElevenLabs STT upravlja transkripcijom; dijarizacijski oznake svaki segment sa zvučnikom 1 / Zvučnik 2 / itd.
Da - /batch / prihvaća mapu audio datoteka. Svaki transkripti sleti u /account /?tab=history s originalnim imenom datoteke. Za očuvanje mape-tree koristite API.
Da - POST svoj audio na /v1/stt/transcribec/ s modelom="ElevenLabs STT". Povratak JSON s tekstom + segmenti + vremenski znakovi na razini riječi. /api/ ima punu referencu.
Samodomoćni modeli čuvaju zvuk na našim GPU-ovima; premium prolazi s DPA. Audio se briše nakon dio-prozora (24h, 7d potpisanih). Ne treniramo na vašim ulazima.
Da - Free.ai dodjeljuje komercijalnu upotrebu transkripta. Potrebna su vam prava na audio koji ste upisali (vlastiti snimak, licencirani materijal ili sadržaj s pristankom).
Faktor u realnom vremenu je približno 0,05-0,2× - 60-minutni podcast transkripti za 3-12 minuta. Premium modeli često završe brže. Koristite gumb reda za zatvaranje kartice.