Fal Speech-to-Text

Free.ai · stt · ~500 1個あたりのトークン数 minute

音声やビデオファイルをドラッグまたは URL を下に貼り付け

~500 1個あたりのトークン数 minute
私たちのGPUでフリーで動く アップグレード Fal Speech-to-Text →

Fal Speech-to-Textはa,音声からテキストに変換するモデルですである。 外部モデルを経由してルーティング - ~500トークン 1分あたりの (アップストリームコストの50%マークアップ)。

API を使う

OpenAI 互換の REST API。鍵を生成し、数秒でモデルを呼び出す。

curl -X POST https://api.free.ai/v1/stt/ \
  -H "Authorization: Bearer sk-free-..." \
  -H "Content-Type: application/json" \
  -d '{"model":"premium/speech-to-text","audio_url":"https://..."}'
API ドキュメント API キーを取得

よくある質問

Fal Speech-to-Textは音声をテキストに変換します。MP3、WAV、M4A、またはビデオファイルをアップロードすると、Fal Speech-to-Textはタイムスタンプを付けたオプションのSRT/VTT字幕を加えた完全な転写を返します。

Fal Speech-to-Text handles dozens of languages - Whisper-family models cover 90+, others vary. Pick "auto-detect" or specify the language for highest accuracy.

単語誤り率は、清潔な英語音声では5-10%、ノイズやアクセントのある音声では10-20%です。同じアーキテクチャの大きな変種は、ハードケースで意味深に優れています。音声が荒いときは、大きいものを選択してください。

はい - 各セグメントには開始/終了タイムスタンプが含まれています。SRT または VTT としてエクスポートし、タイムマップをビデオに直接マッピングします。

Fal Speech-to-Textはプレミアム転写エンジンです。生成前にライブで表示されるオーディオの約500-1500トークン/分です。セルフホスト転写は30,000トークンの日々のプールで無料で実行できます。プレミアムモデルは$1からのトークンを追加すると、使用分の支払いができます。

MP3, WAV, M4A, FLAC, OGG, さらにビデオ (MP4, MOV, WebM) - オーディオを抽出します。アップロードごとに最大 500 MB。長いファイルは /audio/cut/ で分割しますか?または /v1/stt/batch/ を使用します。

音声転写は別のパスで行われます。 /transcribe/ に diarize をオン/オフします。Fal Speech-to-Text は転写を処理します。音声転写は各セグメントを Speaker 1/Speaker 2 などでラベル化します。

はい - /batch/ はオーディオファイルのフォルダを受け入れます。それぞれのトランスポートは元のファイル名で /account/?tab=history に移動します。フォルダのツリーを保存するには API を使用してください。

はい — 音声を /v1/stt/transcribe/ に POST します。 model="Fal Speech-to-Text" を使用します。 テキスト + セグメント + ワードレベルタイムスタンプを含む JSON を返します。 /api/ には完全な参照が含まれています。

自己ホストモデルはオーディオをGPUに保持します。プレミアムモデルは DPA を通してオーディオを通過します。オーディオは共有ウィンドウ(24時間アノン、7日ログイン)の後に削除されます。入力は訓練されません。

はい - Free.ai はトランスクリプトの商用利用を許可します。アップロードしたオーディオの権利 (自分の録音、ライセンス物、許可を得たコンテンツ) が必要です。

リアルタイムの要素は約 0.05-0.2× で、60 分のポッドキャストは 3-12 分で転写されます。プレミアムモデルは通常より早く終了します。キューボタンを使ってタブを閉じます。

Love Free.ai? Tell your friends!

このページを評価