ElevenLabs STT

Free.ai · stt · ~500 Anzahl der Token je minute

Eine Audio- oder Videodatei ablegen oder eine URL unten einfügen

~500 Anzahl der Token je minute
Läuft frei auf unseren GPUs. Aktualisierung für ElevenLabs STT →

ElevenLabs STT ist a Sprach-Text-Modell. Durch externe Modelle geleitet - ~500 Tokens pro Minute (50% Markup über den vorgelagerten Kosten).

Verwendung über API

OpenAI-kompatible REST API. Generieren Sie einen Schlüssel und rufen Sie dieses Modell in Sekundenschnelle auf.

curl -X POST https://api.free.ai/v1/stt/ \
  -H "Authorization: Bearer sk-free-..." \
  -H "Content-Type: application/json" \
  -d '{"model":"premium/elevenlabs/speech-to-text","audio_url":"https://..."}'
API-Dokumentation API-Schlüssel abrufen

Häufig gestellte Fragen

ElevenLabs STT transkribiert gesprochenes Audio in Text. Laden Sie eine MP3, WAV, M4A oder Videodatei hoch und ElevenLabs STT gibt das vollständige Transkript plus optionale SRT/VTT-Untertitel mit Zeitstempeln zurück.

ElevenLabs STT handles dozens of languages - Whisper-family models cover 90+, others vary. Pick "auto-detect" or specify the language for highest accuracy.

Die Word-Fehlerrate beträgt 5-10% auf sauberem Englisch, 10-20% auf lautem oder akzentuiertem Audio. Große Varianten derselben Architektur machen es bei harten Fällen sinnvoll besser - wählen Sie größer, wenn das Audio rau ist.

Ja - jedes Segment enthält Start/End-Zeitstempel. Exportieren Sie als SRT oder VTT und die Zeiten zeigen Sie direkt auf Ihr Video.

ElevenLabs STT ist eine Premium-Transkriptions-Engine. Etwa ~500-1.500 Token pro Minute Audio, live gezeigt, bevor Sie erzeugen. Selbst-hosted Transkription läuft kostenlos auf Ihrem 30.000-Token-Tagespool; Premium-Modelle sind Pay-as-you-go, mit Top-ups von $1.

MP3, WAV, M4A, FLAC, OGG, plus Video (MP4, MOV, WebM) - wir extrahieren das Audio. Max 500 MB pro Upload. Längere Dateien? Mit /audio/cut/ teilen oder /v1/stt/batch/ verwenden.

Die Lautsprecherdiarisierung ist ein separater Pass - tippen Sie "diarize" auf /transcribe/. ElevenLabs STT übernimmt die Transkription; die Diarisierungsetiketten jedes Segment mit Lautsprecher 1 / Lautsprecher 2 / etc.

Ja - /batch/ akzeptiert einen Ordner von Audiodateien. Jedes Transkript landet in /account/?tab=history mit dem ursprünglichen Dateinamen. Zur Ordner-Baum-Konservierung verwenden Sie die API.

Ja - POST Ihr Audio auf /v1/stt/transcribe/ mit model="ElevenLabs STT". Gibt JSON mit Text + Segmente + Word-Level-Timestamps zurück. /api/ hat die volle Referenz.

Selbst gehostete Modelle halten Audio auf unseren GPUs; Premium-Durchlauf mit einem DPA. Audio wird nach dem Share-Fenster (24h anon, 7d Sign-in) gelöscht. Wir trainieren nicht auf Ihren Eingängen.

Ja - Free.ai gewährt kommerzielle Verwendung von Transkripten. Sie benötigen Rechte an dem Audio, das Sie hochgeladen haben (Ihre eigene Aufzeichnung, lizenziertes Material oder Inhalte mit Zustimmung).

Echtzeitfaktor ist etwa 0.05-0.2× - ein 60-minütiger Podcast transkribiert in 3-12 Minuten. Premium-Modelle werden oft schneller fertig. Verwenden Sie die Warteschlange, um die Registerkarte zu schließen.

Liebe Free.ai? Erzählen Sie Ihren Freunden!

Bewerten Sie diese Seite