Fal Speech-to-Text

Free.ai · stt · ~500 jetons par minute

Déposer un fichier audio ou vidéo, ou coller une URL ci-dessous

~500 jetons par minute
Il est libre sur nos GPU. Mise à jour pour Fal Speech-to-Text →

Fal Speech-to-Text est a modèle de parole en texte. Tracé à travers des modèles externes - ~500 jetons par minute (50 % de marge sur le coût en amont).

Utiliser via l'API

API REST compatible OpenAI. Générez une clé et appelez ce modèle en quelques secondes.

curl -X POST https://api.free.ai/v1/stt/ \
  -H "Authorization: Bearer sk-free-..." \
  -H "Content-Type: application/json" \
  -d '{"model":"premium/speech-to-text","audio_url":"https://..."}'
Documentation API Obtenir la clé API

Foire aux questions

Fal Speech-to-Text transcrit l'audio parlé en texte. Téléchargez un fichier MP3, WAV, M4A ou vidéo et Fal Speech-to-Text retourne la transcription complète ainsi que les sous-titres optionnels SRT/VTT avec horodatage.

Fal Speech-to-Text handles dozens of languages - Whisper-family models cover 90+, others vary. Pick "auto-detect" or specify the language for highest accuracy.

Le taux d'erreur de mot est de 5-10% sur un son anglais propre, de 10-20% sur un son bruyant ou accentué. De grandes variantes de la même architecture font significativement mieux sur les cas difficiles - choisissez plus grand lorsque l'audio est rugueux.

Oui - chaque segment comprend des horodatages de départ/fin. Exportez en SRT ou VTT et la carte des heures directement sur votre vidéo.

Fal Speech-to-Text est un moteur de transcription premium. Environ 500-1 500 jetons par minute d'audio, montré en direct avant de générer. La transcription auto-organisé fonctionne gratuitement sur votre pool quotidien de 30 000 jetons; les modèles premium sont payants au fur et à mesure, avec des recharges à partir de 1 $.

MP3, WAV, M4A, FLAC, OGG, plus vidéo (MP4, MOV, WebM) - nous extrayons l'audio. Max 500 MB par téléchargement. Fichiers plus longs? Split avec /audio/cut/ ou utilisez /v1/stt/batch/.

La diarisation des haut-parleurs est un passage séparé - basculer « diarize » sur /transcribe/. Fal Speech-to-Text gère la transcription; la diarisation étiquette chaque segment avec le haut-parleur 1 / haut-parleur 2 / etc.

Oui - /batch/ accepte un dossier de fichiers audio. Chaque transcription se trouve dans /account/?tab=history avec le nom de fichier original. Pour la préservation des arbres de dossiers, utilisez l'API.

Oui - POST votre audio vers /v1/stt/transcribe/ avec model="Fal Speech-to-Text". Retourne JSON avec texte + segments + word-level timestamps. /api/ a la référence complète.

Les modèles auto-portés gardent l'audio sur nos GPUs; la prime passe avec un DPA. L'audio est supprimé après la fenêtre de partage (24h anon, 7d signé-in). Nous ne nous formons pas sur vos entrées.

Oui - Free.ai accorde l'utilisation commerciale des transcriptions. Vous avez besoin de droits sur l'audio que vous avez téléchargé (votre propre enregistrement, matériel sous licence ou contenu avec consentement).

Le facteur temps réel est d'environ 0,05-0,2× - un podcast de 60 minutes transcrit en 3-12 minutes. Les modèles Premium finissent souvent plus vite. Utilisez le bouton de queue pour fermer l'onglet.

Aimez Free.ai? Dites à vos amis!

Évaluer cette page