ElevenLabs STT
Free.ai
·
stt
·
~500 1個あたりのトークン数 minute
ElevenLabs STTはa,音声からテキストに変換するモデルですである。 外部モデルを経由してルーティング - ~500トークン 1分あたりの (アップストリームコストの50%マークアップ)。
API を使う
OpenAI 互換の REST API。鍵を生成し、数秒でモデルを呼び出す。
curl -X POST https://api.free.ai/v1/stt/ \
-H "Authorization: Bearer sk-free-..." \
-H "Content-Type: application/json" \
-d '{"model":"premium/elevenlabs/speech-to-text","audio_url":"https://..."}'
API ドキュメント
API キーを取得
よくある質問
ElevenLabs STTは音声をテキストに変換します。MP3、WAV、M4A、またはビデオファイルをアップロードすると、ElevenLabs STTはタイムスタンプを付けたオプションのSRT/VTT字幕を加えた完全な転写を返します。
ElevenLabs STT handles dozens of languages - Whisper-family models cover 90+, others vary. Pick "auto-detect" or specify the language for highest accuracy.
単語誤り率は、清潔な英語音声では5-10%、ノイズやアクセントのある音声では10-20%です。同じアーキテクチャの大きな変種は、ハードケースで意味深に優れています。音声が荒いときは、大きいものを選択してください。
はい - 各セグメントには開始/終了タイムスタンプが含まれています。SRT または VTT としてエクスポートし、タイムマップをビデオに直接マッピングします。
ElevenLabs STTはプレミアム転写エンジンです。生成前にライブで表示されるオーディオの約500-1500トークン/分です。セルフホスト転写は30,000トークンの日々のプールで無料で実行できます。プレミアムモデルは$1からのトークンを追加すると、使用分の支払いができます。
MP3, WAV, M4A, FLAC, OGG, さらにビデオ (MP4, MOV, WebM) - オーディオを抽出します。アップロードごとに最大 500 MB。長いファイルは /audio/cut/ で分割しますか?または /v1/stt/batch/ を使用します。
音声転写は別のパスで行われます。 /transcribe/ に diarize をオン/オフします。ElevenLabs STT は転写を処理します。音声転写は各セグメントを Speaker 1/Speaker 2 などでラベル化します。
はい - /batch/ はオーディオファイルのフォルダを受け入れます。それぞれのトランスポートは元のファイル名で /account/?tab=history に移動します。フォルダのツリーを保存するには API を使用してください。
はい — 音声を /v1/stt/transcribe/ に POST します。 model="ElevenLabs STT" を使用します。 テキスト + セグメント + ワードレベルタイムスタンプを含む JSON を返します。 /api/ には完全な参照が含まれています。
自己ホストモデルはオーディオをGPUに保持します。プレミアムモデルは DPA を通してオーディオを通過します。オーディオは共有ウィンドウ(24時間アノン、7日ログイン)の後に削除されます。入力は訓練されません。
はい - Free.ai はトランスクリプトの商用利用を許可します。アップロードしたオーディオの権利 (自分の録音、ライセンス物、許可を得たコンテンツ) が必要です。
リアルタイムの要素は約 0.05-0.2× で、60 分のポッドキャストは 3-12 分で転写されます。プレミアムモデルは通常より早く終了します。キューボタンを使ってタブを閉じます。