ElevenLabs STT

Free.ai · stt · ~500 žetonai minute

Numeskite garso ar vaizdo failą arba įklijuokite URL žemiau

~500 žetonai minute
Nemokami mūsų GPU. Atnaujinti ElevenLabs STT →

ElevenLabs STT yra a kalbos modelis. Maršrutizuojama per išorės modelius - ~500 tolens per minutę (50% markės per pirmesnius kaštus).

Naudoti per API

Suderinama su OpenAI REST API. Generuokite raktą ir paskambinkite šiam modeliui per kelias sekundes.

curl -X POST https://api.free.ai/v1/stt/ \
  -H "Authorization: Bearer sk-free-..." \
  -H "Content-Type: application/json" \
  -d '{"model":"premium/elevenlabs/speech-to-text","audio_url":"https://..."}'
API dokumentacija Gauti API raktą

Dažnai užduodami klausimai

ElevenLabs STT transcribes spoken audio into text. Upload an MP3, WAV, M4A, or video file and ElevenLabs STT returns the full transcript plus optional SRT/VTT subtitles with timestamps.

ElevenLabs STT handles dozens of languages - Whisper-family models cover 90+, others vary. Pick "auto-detect" or specify the language for highest accuracy.

Žodžių klaidų lygis yra 5-10% švaraus anglų garso, 10-20% garsiai ar akcentuotas garso. Dideli variantai tos pačios architektūros daro prasmingai geriau kietais atvejais - pasirinkti didesnis, kai garso yra grubus.

Taip - kiekvienas segmentas apima pradžios/galutinės žymes. Eksportuoti kaip SRT ar VTT ir laiko žemėlapį tiesiai į savo vaizdo įrašą.

ElevenLabs STT yra aukščiausios klasės transkripcijos variklis. Apie ~500-1,500 žetonų per minutę garso, rodomas gyvai prieš generuojant. Savarankiškai transkripcija veikia nemokamai savo 30,000-token dienos baseinas; premium modeliai mokamas kaip jums-go, su papildomų-ups nuo $ 1.

MP3, WAV, M4A, FLAC, OGG, plius video (MP4, MOV, WebM) - mes ištraukiame garso. Maks. 500 MB vienam įkelimui. Ilgesni failai? Split with /audio/cut/ or use /v1/stt/partch/.

Garsiakalbio diarizacija yra atskiras leidimas - įjungti "dializuoti" /trantracter/. ElevenLabs STT tvarko transkripciją; Diarizavimo etiketes kiekviename segmente su Garsiakalbiu 1 / Garsiakalbiu 2 / ir tt

Taip - /partch/ priima aplanką garso failų. Kiekvienas stenogramos failas / paskyra /?tab=istorija su originalu failo pavadinimu. Aplanko- eilės išsaugojimui naudoti API.

Taip - Padėkite garso įrašą /v1/stt/tractor/ su modeliu="ElevenLabs STT". Grįžta JSON su tekstu + segmentai + žodžio lygio žymos. /api/ turi visą nuorodą.

Savarankiškai priimti modeliai išlaikyti garso mūsų GPU; premija perduoti per su DPA. Audio yra ištrinta po akcijų akcijų-window (24h anon, 7d prisijungė). Mes ne mokyti jūsų įėjimai.

Taip - Free.ai suteikia komercinį transkriptų naudojimą. Jums reikia teisių į įkeltą garsą (savo įrašymo, licencijuotos medžiagos ar turinio su sutikimu).

Realaus laiko faktorius yra maždaug 0,05-0,2× - 60 minučių podcast transliuoja per 3-12 minučių. Premium modeliai dažnai baigiasi greičiau. Naudokite eilės mygtuką uždaryti kortelę.

Like this tool? Share it!

Įvertinti šį puslapį