Distil-Whisper large-v3

Free.ai (self-hosted) · stt · ~500 Anzahl der Token je minute

Eine Audio- oder Videodatei ablegen oder eine URL unten einfügen

~500 Anzahl der Token je minute

Distil-Whisper large-v3 ist a Sprach-Text-Modell, gebaut von HuggingFace. Am stärksten bei Real-time transcription, large-volume batch STT.. Selbstgehostet auf Free.ai GPUs — läuft kostenlos gegen Ihren täglichen Tokenpool ({tpm__tokens} pro Minute). Veröffentlicht unter MIT - kommerzielle Nutzung auf Free.ai erlaubt.

Verwendung über API

OpenAI-kompatible REST API. Generieren Sie einen Schlüssel und rufen Sie dieses Modell in Sekundenschnelle auf.

curl -X POST https://api.free.ai/v1/stt/ \
  -H "Authorization: Bearer sk-free-..." \
  -H "Content-Type: application/json" \
  -d '{"model":"distil-whisper-large-v3","audio_url":"https://..."}'
API-Dokumentation API-Schlüssel abrufen

Häufig gestellte Fragen

Distil-Whisper large-v3 transkribiert gesprochenes Audio in Text. Laden Sie eine MP3, WAV, M4A oder Videodatei hoch und Distil-Whisper large-v3 gibt das vollständige Transkript plus optionale SRT/VTT-Untertitel mit Zeitstempeln zurück.

Distil-Whisper large-v3 handles dozens of languages - Whisper-family models cover 90+, others vary. Pick "auto-detect" or specify the language for highest accuracy.

Die Word-Fehlerrate beträgt 5-10% auf sauberem Englisch, 10-20% auf lautem oder akzentuiertem Audio. Große Varianten derselben Architektur machen es bei harten Fällen sinnvoll besser - wählen Sie größer, wenn das Audio rau ist.

Ja - jedes Segment enthält Start/End-Zeitstempel. Exportieren Sie als SRT oder VTT und die Zeiten zeigen Sie direkt auf Ihr Video.

Distil-Whisper large-v3 läuft auf unseren eigenen GPUs gegen Ihren täglichen kostenlosen Pool zuerst; $5 → 200.000 bezahlte Token danach. Etwa ~500 Token pro Minute.

MP3, WAV, M4A, FLAC, OGG, plus Video (MP4, MOV, WebM) - wir extrahieren das Audio. Max 500 MB pro Upload. Längere Dateien? Mit /audio/cut/ teilen oder /v1/stt/batch/ verwenden.

Die Lautsprecherdiarisierung ist ein separater Pass - tippen Sie "diarize" auf /transcribe/. Distil-Whisper large-v3 übernimmt die Transkription; die Diarisierungsetiketten jedes Segment mit Lautsprecher 1 / Lautsprecher 2 / etc.

Ja - /batch/ akzeptiert einen Ordner von Audiodateien. Jedes Transkript landet in /account/?tab=history mit dem ursprünglichen Dateinamen. Zur Ordner-Baum-Konservierung verwenden Sie die API.

Ja - POST Ihr Audio auf /v1/stt/transcribe/ mit model="Distil-Whisper large-v3". Gibt JSON mit Text + Segmente + Word-Level-Timestamps zurück. /api/ hat die volle Referenz.

Selbst gehostete Modelle halten Audio auf unseren GPUs; Premium-Durchlauf mit einem DPA. Audio wird nach dem Share-Fenster (24h anon, 7d Sign-in) gelöscht. Wir trainieren nicht auf Ihren Eingängen.

Ja - Free.ai gewährt kommerzielle Verwendung von Transkripten. Sie benötigen Rechte an dem Audio, das Sie hochgeladen haben (Ihre eigene Aufzeichnung, lizenziertes Material oder Inhalte mit Zustimmung).

Echtzeitfaktor ist etwa 0.05-0.2× - ein 60-minütiger Podcast transkribiert in 3-12 Minuten. Premium-Modelle werden oft schneller fertig. Verwenden Sie die Warteschlange, um die Registerkarte zu schließen.

Liebe Free.ai? Erzählen Sie Ihren Freunden!

Bewerten Sie diese Seite