Moonshine Base

Free.ai (self-hosted) · stt · ~500 1個あたりのトークン数 minute

音声やビデオファイルをドラッグまたは URL を下に貼り付け

~500 1個あたりのトークン数 minute

Moonshine Baseはa 音声からテキストに変換するモデルですはUseful Sensorsが作ったものだ Strongest at Low-latency live transcription, embedded devices.. Free.ai GPU でセルフホストされ、毎日のトークンプール(500トークン、1分あたりの)に対してフリーで動作します。 ライセンスはMITでリリースされ、商用利用はFree.aiで許可されている。

API を使う

OpenAI 互換の REST API。鍵を生成し、数秒でモデルを呼び出す。

curl -X POST https://api.free.ai/v1/stt/ \
  -H "Authorization: Bearer sk-free-..." \
  -H "Content-Type: application/json" \
  -d '{"model":"moonshine-base","audio_url":"https://..."}'
API ドキュメント API キーを取得

よくある質問

Moonshine Baseは音声をテキストに変換します。MP3、WAV、M4A、またはビデオファイルをアップロードすると、Moonshine Baseはタイムスタンプを付けたオプションのSRT/VTT字幕を加えた完全な転写を返します。

Moonshine Base handles dozens of languages - Whisper-family models cover 90+, others vary. Pick "auto-detect" or specify the language for highest accuracy.

単語誤り率は、清潔な英語音声では5-10%、ノイズやアクセントのある音声では10-20%です。同じアーキテクチャの大きな変種は、ハードケースで意味深に優れています。音声が荒いときは、大きいものを選択してください。

はい - 各セグメントには開始/終了タイムスタンプが含まれています。SRT または VTT としてエクスポートし、タイムマップをビデオに直接マッピングします。

Moonshine Baseは私たちのGPUで あなたの日常のフリープールに対して 初めて動作します その後$5→200,000有料トークン 約~500トークン/分

MP3, WAV, M4A, FLAC, OGG, さらにビデオ (MP4, MOV, WebM) - オーディオを抽出します。アップロードごとに最大 500 MB。長いファイルは /audio/cut/ で分割しますか?または /v1/stt/batch/ を使用します。

音声転写は別のパスで行われます。 /transcribe/ に diarize をオン/オフします。Moonshine Base は転写を処理します。音声転写は各セグメントを Speaker 1/Speaker 2 などでラベル化します。

はい - /batch/ はオーディオファイルのフォルダを受け入れます。それぞれのトランスポートは元のファイル名で /account/?tab=history に移動します。フォルダのツリーを保存するには API を使用してください。

はい — 音声を /v1/stt/transcribe/ に POST します。 model="Moonshine Base" を使用します。 テキスト + セグメント + ワードレベルタイムスタンプを含む JSON を返します。 /api/ には完全な参照が含まれています。

自己ホストモデルはオーディオをGPUに保持します。プレミアムモデルは DPA を通してオーディオを通過します。オーディオは共有ウィンドウ(24時間アノン、7日ログイン)の後に削除されます。入力は訓練されません。

はい - Free.ai はトランスクリプトの商用利用を許可します。アップロードしたオーディオの権利 (自分の録音、ライセンス物、許可を得たコンテンツ) が必要です。

リアルタイムの要素は約 0.05-0.2× で、60 分のポッドキャストは 3-12 分で転写されます。プレミアムモデルは通常より早く終了します。キューボタンを使ってタブを閉じます。

Love Free.ai? Tell your friends!

このページを評価