ElevenLabs STT

Free.ai · stt · ~500 토큰당 minute

오디오 또는 비디오 파일을 드래그하거나 URL을 아래에 붙여넣기

~500 토큰당 minute
우리의 GPU에서 무료로 실행됩니다. 업그레이드 ElevenLabs STT →

ElevenLabs STT는 a 음성에서 텍스트로 모델입니다. 외부 모델을 통해 라우팅 - ~500 토큰 분당 (업스트림 비용에 대한 50% 마킹).

API를 통해 사용

OpenAI 호환 REST API. 키를 생성하고 몇 초 안에 이 모델을 호출합니다.

curl -X POST https://api.free.ai/v1/stt/ \
  -H "Authorization: Bearer sk-free-..." \
  -H "Content-Type: application/json" \
  -d '{"model":"premium/elevenlabs/speech-to-text","audio_url":"https://..."}'
API 문서화 API 키 가져오기

자주 묻는 질문

ElevenLabs STT은 말하는 오디오를 텍스트로 변환합니다. MP3, WAV, M4A 또는 비디오 파일을 업로드하면 ElevenLabs STT은 전체 녹음본과 타임스탬프가 있는 선택적 SRT/VTT 자막을 반환합니다.

ElevenLabs STT handles dozens of languages - Whisper-family models cover 90+, others vary. Pick "auto-detect" or specify the language for highest accuracy.

단어 오류율은 깨끗한 영어 오디오에서 5-10%, 시끄럽거나 악센트가 있는 오디오에서 10-20%입니다. 동일한 구조의 큰 변형은 하드 케이스에서 의미있게 더 잘 작동합니다. 오디오가 거칠 때 큰 변형을 선택하십시오.

예 - 모든 세그먼트는 시작/종료 타임스탬프를 포함합니다. SRT 또는 VTT로 내보내고 타임스탬프를 비디오에 바로 매핑합니다.

ElevenLabs STT는 프리미엄 녹음 엔진입니다. 생성하기 전에 라이브로 보여주는 오디오의 분당 ~500-1,500 토큰입니다. 자체 호스팅 녹음은 30,000 토큰 일일 풀에서 무료로 실행됩니다. 프리미엄 모델은 사용량에 따라 지불하며 $1부터 업그레이드 할 수 있습니다.

MP3, WAV, M4A, FLAC, OGG, 플러스 비디오 (MP4, MOV, WebM) - 우리는 오디오를 추출합니다. 업로드 당 최대 500 MB. 긴 파일? /audio/cut/로 분할하거나 /v1/stt/batch/를 사용합니다.

스피커 diarization은 별도의 패스 - /transcribe /에서 "diarize"를 전환합니다. ElevenLabs STT는 녹음을 처리; diarization은 스피커 1 / 스피커 2 / 등으로 각 세그먼트를 라벨링합니다.

예 - /batch/는 오디오 파일의 폴더를 받아들입니다. 각각의 녹음은 /account/?tab=history에 원래 파일 이름과 함께 놓입니다. 폴더 트리 보존을 위해 API를 사용합니다.

예 - 오디오를 /v1/stt/transcribe/에 POST하고 model="ElevenLabs STT"를 사용합니다. 텍스트 + 세그먼트 + 단어 수준 타임스탬프가 포함된 JSON을 반환합니다. /api/는 전체 참조를 가지고 있습니다.

자체 호스팅 모델은 GPU에 오디오를 보관하며, 프리미엄 모델은 DPA를 통해 오디오를 전송합니다. 오디오는 공유 창이 종료된 후 삭제됩니다(24시간 익명, 7일 로그인).

네 - Free.ai는 기록물의 상업적 사용을 허용합니다. 업로드한 오디오(자신의 녹음, 라이선스 자료 또는 동의를 받은 콘텐츠)에 대한 권리가 필요합니다.

실시간 요인은 대략 0.05-0.2× - 60 분 팟캐스트 3-12 분에 번역. 프리미엄 모델은 종종 빠르게 끝납니다. 탭을 닫으려면 큐 버튼을 사용합니다.

Love Free.ai? Tell your friends!

이 페이지 평가하기