Fal Speech-to-Text

Free.ai · stt · ~500 Anzahl der Token je minute

Eine Audio- oder Videodatei ablegen oder eine URL unten einfügen

~500 Anzahl der Token je minute
Läuft frei auf unseren GPUs. Aktualisierung für Fal Speech-to-Text →

Fal Speech-to-Text ist a Sprach-Text-Modell. Durch externe Modelle geleitet - ~500 Tokens pro Minute (50% Markup über den vorgelagerten Kosten).

Verwendung über API

OpenAI-kompatible REST API. Generieren Sie einen Schlüssel und rufen Sie dieses Modell in Sekundenschnelle auf.

curl -X POST https://api.free.ai/v1/stt/ \
  -H "Authorization: Bearer sk-free-..." \
  -H "Content-Type: application/json" \
  -d '{"model":"premium/speech-to-text","audio_url":"https://..."}'
API-Dokumentation API-Schlüssel abrufen

Häufig gestellte Fragen

Fal Speech-to-Text transkribiert gesprochenes Audio in Text. Laden Sie eine MP3, WAV, M4A oder Videodatei hoch und Fal Speech-to-Text gibt das vollständige Transkript plus optionale SRT/VTT-Untertitel mit Zeitstempeln zurück.

Fal Speech-to-Text handles dozens of languages - Whisper-family models cover 90+, others vary. Pick "auto-detect" or specify the language for highest accuracy.

Die Word-Fehlerrate beträgt 5-10% auf sauberem Englisch, 10-20% auf lautem oder akzentuiertem Audio. Große Varianten derselben Architektur machen es bei harten Fällen sinnvoll besser - wählen Sie größer, wenn das Audio rau ist.

Ja - jedes Segment enthält Start/End-Zeitstempel. Exportieren Sie als SRT oder VTT und die Zeiten zeigen Sie direkt auf Ihr Video.

Fal Speech-to-Text ist eine Premium-Transkriptions-Engine. Etwa ~500-1.500 Token pro Minute Audio, live gezeigt, bevor Sie erzeugen. Selbst-hosted Transkription läuft kostenlos auf Ihrem 30.000-Token-Tagespool; Premium-Modelle sind Pay-as-you-go, mit Top-ups von $1.

MP3, WAV, M4A, FLAC, OGG, plus Video (MP4, MOV, WebM) - wir extrahieren das Audio. Max 500 MB pro Upload. Längere Dateien? Mit /audio/cut/ teilen oder /v1/stt/batch/ verwenden.

Die Lautsprecherdiarisierung ist ein separater Pass - tippen Sie "diarize" auf /transcribe/. Fal Speech-to-Text übernimmt die Transkription; die Diarisierungsetiketten jedes Segment mit Lautsprecher 1 / Lautsprecher 2 / etc.

Ja - /batch/ akzeptiert einen Ordner von Audiodateien. Jedes Transkript landet in /account/?tab=history mit dem ursprünglichen Dateinamen. Zur Ordner-Baum-Konservierung verwenden Sie die API.

Ja - POST Ihr Audio auf /v1/stt/transcribe/ mit model="Fal Speech-to-Text". Gibt JSON mit Text + Segmente + Word-Level-Timestamps zurück. /api/ hat die volle Referenz.

Selbst gehostete Modelle halten Audio auf unseren GPUs; Premium-Durchlauf mit einem DPA. Audio wird nach dem Share-Fenster (24h anon, 7d Sign-in) gelöscht. Wir trainieren nicht auf Ihren Eingängen.

Ja - Free.ai gewährt kommerzielle Verwendung von Transkripten. Sie benötigen Rechte an dem Audio, das Sie hochgeladen haben (Ihre eigene Aufzeichnung, lizenziertes Material oder Inhalte mit Zustimmung).

Echtzeitfaktor ist etwa 0.05-0.2× - ein 60-minütiger Podcast transkribiert in 3-12 Minuten. Premium-Modelle werden oft schneller fertig. Verwenden Sie die Warteschlange, um die Registerkarte zu schließen.

Liebe Free.ai? Erzählen Sie Ihren Freunden!

Bewerten Sie diese Seite