Moonshine Base
Free.ai (self-hosted)
·
stt
·
~500 1個あたりのトークン数 minute
Moonshine Baseはa 音声からテキストに変換するモデルですはUseful Sensorsが作ったものだ Strongest at Low-latency live transcription, embedded devices.. Free.ai GPU でセルフホストされ、毎日のトークンプール(500トークン、1分あたりの)に対してフリーで動作します。 ライセンスはMITでリリースされ、商用利用はFree.aiで許可されている。
API を使う
OpenAI 互換の REST API。鍵を生成し、数秒でモデルを呼び出す。
curl -X POST https://api.free.ai/v1/stt/ \
-H "Authorization: Bearer sk-free-..." \
-H "Content-Type: application/json" \
-d '{"model":"moonshine-base","audio_url":"https://..."}'
API ドキュメント
API キーを取得
よくある質問
Moonshine Baseは音声をテキストに変換します。MP3、WAV、M4A、またはビデオファイルをアップロードすると、Moonshine Baseはタイムスタンプを付けたオプションのSRT/VTT字幕を加えた完全な転写を返します。
Moonshine Base handles dozens of languages - Whisper-family models cover 90+, others vary. Pick "auto-detect" or specify the language for highest accuracy.
単語誤り率は、清潔な英語音声では5-10%、ノイズやアクセントのある音声では10-20%です。同じアーキテクチャの大きな変種は、ハードケースで意味深に優れています。音声が荒いときは、大きいものを選択してください。
はい - 各セグメントには開始/終了タイムスタンプが含まれています。SRT または VTT としてエクスポートし、タイムマップをビデオに直接マッピングします。
Moonshine Baseは私たちのGPUで あなたの日常のフリープールに対して 初めて動作します その後$5→200,000有料トークン 約~500トークン/分
MP3, WAV, M4A, FLAC, OGG, さらにビデオ (MP4, MOV, WebM) - オーディオを抽出します。アップロードごとに最大 500 MB。長いファイルは /audio/cut/ で分割しますか?または /v1/stt/batch/ を使用します。
音声転写は別のパスで行われます。 /transcribe/ に diarize をオン/オフします。Moonshine Base は転写を処理します。音声転写は各セグメントを Speaker 1/Speaker 2 などでラベル化します。
はい - /batch/ はオーディオファイルのフォルダを受け入れます。それぞれのトランスポートは元のファイル名で /account/?tab=history に移動します。フォルダのツリーを保存するには API を使用してください。
はい — 音声を /v1/stt/transcribe/ に POST します。 model="Moonshine Base" を使用します。 テキスト + セグメント + ワードレベルタイムスタンプを含む JSON を返します。 /api/ には完全な参照が含まれています。
自己ホストモデルはオーディオをGPUに保持します。プレミアムモデルは DPA を通してオーディオを通過します。オーディオは共有ウィンドウ(24時間アノン、7日ログイン)の後に削除されます。入力は訓練されません。
はい - Free.ai はトランスクリプトの商用利用を許可します。アップロードしたオーディオの権利 (自分の録音、ライセンス物、許可を得たコンテンツ) が必要です。
リアルタイムの要素は約 0.05-0.2× で、60 分のポッドキャストは 3-12 分で転写されます。プレミアムモデルは通常より早く終了します。キューボタンを使ってタブを閉じます。