ElevenLabs STT

Free.ai · stt · ~500 znaki na minute

Przesuń plik audio lub wideo, lub wklej URL poniżej

~500 znaki na minute
Nasze OGP działa wolniej. Uaktualnij ElevenLabs STT →

ElevenLabs STT to a model mowy do tekstu. Przeprowadzany przez modele zewnętrzne - ~500 tokeny za minutę (50% marking nad kosztami przestrzennymi).

Użyj przez API

Kompatybilny z OpenAI REST API. Generuj klucz i zadzwoń po tym modelu w sekundach.

curl -X POST https://api.free.ai/v1/stt/ \
  -H "Authorization: Bearer sk-free-..." \
  -H "Content-Type: application/json" \
  -d '{"model":"premium/elevenlabs/speech-to-text","audio_url":"https://..."}'
Dokumentacja API Pobierz klucz API

Często zadawane pytania

ElevenLabs STT transcribe audio w tekst. Wyślij MP3, WAV, M4A, lub plik wideo i ElevenLabs STT zwraca pełną transkrypcję plus opcjonalne napisy SRT/VTT z czasem.

ElevenLabs STT handles dozens of languages - Whisper-family models cover 90+, others vary. Pick "auto-detect" or specify the language for highest accuracy.

Wskaźnik błędów jest 5-10% na czystym angielskim audio, 10-20% na głośnym lub akcentowanym audio. Duże warianty tej samej architektury robią znacząco lepiej w trudnych przypadkach - wybierz większe, gdy dźwięk jest surowy.

Tak - każdy segment zawiera czasowe ślady startu i końca. Eksportować jako SRT lub VTT oraz mapę czasów bezpośrednio do swojego wideo.

ElevenLabs STT jest prymium transkription silnik. Około ~500-1,500 tokena na minutę audio, pokazany na żywo przed generowaniem. Samo-hosted transkripcja biegnie bezpłatnie na 30 000-takenowy basen; premium modele są pay-as-yo-go, z top-up od $1.

MP3, WAV, M4A, FLAC, OGG, plus video (MP4, MOV, WebM) - wyciągamy dźwięk. Max 500 MB na wysłanie. Długiej pliki? Rozdzielić z /audio/cut/ lub użyć /v1/stt/batch /.

Dializacja głośnika jest oddzielnym przepustką - włączanie "diarize" na /transcribek /. ElevenLabs STT obsługuje transkrypcję; etykiety diaryzacyjne każdego segmentu z głośnika 1 / głośnika 2 / itd.

Tak - /batch/ akceptuje folder plików audio. Każdy transkrypt wpada w /account /?tab=historya z oryginalnym nazwą pliku. Dla zachowania folderów- drewna używaj API.

Tak - POST audio do /v1/stt/transcribe/ z modelem="ElevenLabs STT". Zwraca JSON z tekstem + segmenty + czasowe szczebla rzędu słowa. /api/ ma pełne odniesienie.

Samodomowe modele trzymają audio na naszych GPU; premium przejść z DPA. Audio jest usuwane po okienku share-okien (24h anon, 7d podpisywanie). Nie trenujemy na wejściu.

Tak - Free.ai przyznaje komercyjne wykorzystanie transkryptów. Potrzebujesz praw do zajętego audio (własny materiał, licencjonowany lub zawartość z zgodą).

W rzeczywistości współczynnik wynosi około 0,05-0,2× - 60 minutowy transkrypt podcast w ciągu 3-12 minut. Modele premium często zakończą się szybciej. Użyj przycisku kolejki, aby zamknąć zakładkę.

Love Free.ai? Tell your friends!

Oceń tę stronę