Distil-Whisper large-v3

Free.ai (self-hosted) · stt · ~500 ਟੋਕਨ ਪ੍ਰਤੀ minute

ਆਡੀਓ ਜਾਂ ਵੀਡਿਓ ਫਾਇਲ ਸੁੱਟੋ ਜਾਂ URL ਹੇਠਾਂ ਚਿਪਕਾਓ

~500 ਟੋਕਨ ਪ੍ਰਤੀ minute

Distil-Whisper large-v3 a ਬੋਲੀ- ਤੋਂ- ਪਾਠ ਮਾਡਲ HuggingFace ਵਲੋਂ ਬਣਾਇਆ ਗਿਆ ਹੈ । ਸਭ ਤੋਂ ਮਜ਼ਬੂਤ Real-time transcription, large-volume batch STT. ਉੱਤੇ ਹੈ। Free.ai GPUs ਉੱਤੇ ਸਵੈ-ਹੋਸਟ ਕੀਤਾ — ਤੁਹਾਡੀ ਰੋਜ਼ਾਨਾ ਟੋਕਨ ਪੁਲ (500 ਟੋਕਨ ਪ੍ਰਤੀ ਮਿੰਟ) ਦੇ ਖਿਲਾਫ ਮੁਫ਼ਤ ਚੱਲਦਾ ਹੈ। MIT ਅਧੀਨ ਛਾਪਿਆ ਗਿਆ - Free.ai ਉੱਤੇ ਵਪਾਰਕ ਵਰਤੋਂ ਦੀ ਇਜਾਜ਼ਤ ਹੈ।

API ਰਾਹੀਂ ਵਰਤੋਂ

OpenAI- ਅਨੁਕੂਲ REST API ਹੈ। ਇੱਕ ਕੁੰਜੀ ਬਣਾਓ ਅਤੇ ਇਸ ਮਾਡਲ ਨੂੰ ਸਕਿੰਟ ਵਿੱਚ ਕਾਲ ਕਰੋ।

curl -X POST https://api.free.ai/v1/stt/ \
  -H "Authorization: Bearer sk-free-..." \
  -H "Content-Type: application/json" \
  -d '{"model":"distil-whisper-large-v3","audio_url":"https://..."}'
API ਡੌਕੂਮੈਂਟੇਸ਼ਨ API ਕੁੰਜੀ ਲਵੋ

ਅਕਸਰ ਪੁੱਛੇ ਜਾਂਦੇ ਸਵਾਲ

Distil-Whisper large-v3 ਬੋਲੀ ਆਡੀਓ ਨੂੰ ਪਾਠ ਵਿੱਚ ਤਬਦੀਲ ਕਰਦਾ ਹੈ। MP3, WAV, M4A, ਜਾਂ ਵੀਡਿਓ ਫਾਇਲ ਅੱਪਲੋਡ ਕਰੋ ਅਤੇ Distil-Whisper large-v3 ਪੂਰੀ ਤਬਦੀਲ ਅਤੇ ਚੋਣਵੀਂ SRT/VTT ਸਬਟਾਈਟਲ ਨੂੰ ਟਾਈਮ-ਸਟੈਂਪ ਨਾਲ ਵਾਪਸ ਕਰ ਦੇਵੇਗਾ।

Distil-Whisper large-v3 handles dozens of languages - Whisper-family models cover 90+, others vary. Pick "auto-detect" or specify the language for highest accuracy.

ਸ਼ਬਦ- ਗਲਤੀ ਦਰ ਸਾਫ਼ ਅੰਗਰੇਜ਼ੀ ਆਡੀਓ ਉੱਤੇ 5- 10% ਹੈ, ਨੋਇਸੀ ਜਾਂ ਐਕਸੈਂਟਡ ਆਡੀਓ ਉੱਤੇ 10- 20% ਹੈ । ਇੱਕੋ ਢਾਂਚੇ ਦੇ ਵੱਡੇ ਵੇਰੀਐਂਟ ਸਖਤ ਕੇਸਾਂ ਉੱਤੇ ਚੰਗੇ ਕੰਮ ਕਰਦੇ ਹਨ - ਜਦੋਂ ਆਡੀਓ ਗਿੱਲਾ ਹੋਵੇ ਤਾਂ ਵੱਡਾ ਚੁਣੋ ।

ਹਾਂ - ਹਰੇਕ ਸੈਗਮੈਂਟ ਵਿੱਚ ਸ਼ੁਰੂ/ਅਧਿਆਨ ਟਾਈਮ-ਸਟੈਂਪ ਸ਼ਾਮਲ ਹਨ। SRT ਜਾਂ VTT ਵਾਂਗ ਐਕਸਪੋਰਟ ਕਰੋ ਅਤੇ ਟਾਈਮ ਮੈਪ ਸਿੱਧਾ ਆਪਣੇ ਵਿਡੀਓ ਉੱਤੇ ਕਰੋ।

Distil-Whisper large-v3 ਪਹਿਲਾਂ ਤੁਹਾਡੇ ਰੋਜ਼ਾਨਾ ਮੁਫ਼ਤ ਪੁਲ ਦੇ ਵਿਰੁੱਧ ਸਾਡੇ ਆਪਣੇ GPUs ਉੱਤੇ ਚੱਲਦਾ ਹੈ; $5 → 200,000 ਭੁਗਤਾਨ ਟੋਕਨ ਬਾਅਦ ਵਿੱਚ। ਪ੍ਰਤੀ ਮਿੰਟ ~500 ਟੋਕਨ ਦੇ ਬਾਰੇ ਵਿੱਚ।

MP3, WAV, M4A, FLAC, OGG, ਅਤੇ ਵੀਡਿਓ (MP4, MOV, WebM) - ਅਸੀਂ ਆਡੀਓ ਐਕਸਟਰੈਕਟ ਕਰਦੇ ਹਾਂ। ਵੱਧ ਤੋਂ ਵੱਧ 500 MB ਪ੍ਰਤੀ ਅੱਪਲੋਡ। ਲੰਬੀਆਂ ਫਾਇਲਾਂ? /audio/cut/ ਨਾਲ ਵੰਡੋ ਜਾਂ /v1/stt/batch/ ਵਰਤੋਂ।

ਸਪੀਕਰ ਡਾਇਰੀਜ਼ੇਸ਼ਨ ਵੱਖਰਾ ਪਾਸ ਹੈ - /transcribe/ ਉੱਤੇ "diarize" ਬਦਲੋ । Distil-Whisper large-v3 ਟਰਾਂਸਕਰੀਪਸ਼ਨ ਹੈਂਡਲ ਕਰਦਾ ਹੈ; ਡਾਇਰੀਜ਼ੇਸ਼ਨ ਹਰੇਕ ਸੈਗਮੈਂਟ ਨੂੰ ਸਪੀਕਰ 1 / ਸਪੀਕਰ2/ ਆਦਿ ਨਾਲ ਲੇਬਲ ਕਰਦਾ ਹੈ ।

ਹਾਂ - /batch/ ਆਡੀਓ ਫਾਇਲਾਂ ਦਾ ਫੋਲਡਰ ਸਵੀਕਾਰ ਕਰਦਾ ਹੈ । ਹਰੇਕ ਟਰਾਂਸਕਰੀਪਟ ਅਸਲੀ ਫਾਇਲ ਨਾਂ ਨਾਲ /account/?tab=history ਵਿੱਚ ਪਹੁੰਚਦੀ ਹੈ । ਫੋਲਡਰ- ਟਰੀ ਸੰਭਾਲਣ ਲਈ API ਵਰਤੋਂ ।

ਹਾਂ - ਆਪਣੇ ਆਡੀਓ ਨੂੰ /v1/stt/transcribe/ ਨਾਲ POST ਕਰੋ, ਜਿਸ ਦਾ ਮਾਡਲ "Distil-Whisper large-v3" ਹੈ । ਪਾਠ + ਸੈਗਮੈਂਟ + ਸ਼ਬਦ- ਪੱਧਰ ਟਾਈਮ- ਸਟੈਂਪ ਨਾਲ JSON ਵਾਪਸ ਕਰੋ । /api/ ਵਿੱਚ ਪੂਰਾ ਹਵਾਲਾ ਹੈ ।

ਆਪਣਾ-ਆਪ ਹੋਸਟ ਮਾਡਲ ਸਾਡੇ GPU ਉੱਤੇ ਆਡੀਓ ਰੱਖਦਾ ਹੈ; ਪ੍ਰੀਮੀਅਮ DPA ਨਾਲ ਪਾਸ ਹੁੰਦਾ ਹੈ। ਸਾਂਝ-ਵਿੰਡੋ ਤੋਂ ਬਾਅਦ ਆਡੀਓ ਹਟਾ ਦਿੱਤਾ ਜਾਂਦਾ ਹੈ (24 ਘੰਟੇ ਬਾਅਦ,7ਦਿਨ ਲਾਗਇਨ ਹੋਣ ਤੋਂ ਬਾਅਦ)। ਅਸੀਂ ਤੁਹਾਡੇ ਇੰਪੁੱਟ ਉੱਤੇ ਟਰੇਨਿੰਗ ਨਹੀਂ ਕਰਦੇ।

ਹਾਂ - Free.ai ਟਰਾਂਸਕਰੀਪਟ ਦਾ ਵਪਾਰਕ ਵਰਤੋਂ ਦਿੰਦਾ ਹੈ । ਤੁਹਾਨੂੰ ਆਡੀਓ ਲਈ ਅਧਿਕਾਰ ਲੋੜੀਦੇ ਹਨ, ਜੋ ਤੁਸੀਂ ਅੱਪਲੋਡ ਕੀਤਾ ਹੈ (ਆਪਣੇ ਰਿਕਾਰਡ, ਲਾਈਸੈਂਸਡ ਮਾਮਲਿਆਂ, ਜਾਂ ਮਨਜ਼ੂਰ ਸਮੱਗਰੀ) ।

ਰੀਅਲ-ਟਾਈਮ ਫੈਕਟਰ ਲਗਭਗ 0.05-0.2× ਹੈ - 60 ਮਿੰਟ ਦਾ ਪੋਡਕਾਸਟ3- 12 ਮਿੰਟ ਵਿੱਚ ਟਰਾਂਸਕਰੀਪਟ ਹੁੰਦਾ ਹੈ । ਪ੍ਰੀਮੀਅਮ ਮਾਡਲ ਅਕਸਰ ਤੇਜ਼ ਹੁੰਦੇ ਹਨ । ਟੈਬ ਬੰਦ ਕਰਨ ਲਈ ਕਤਾਰ ਬਟਨ ਵਰਤੋਂ ।

Free.ai ਨੂੰ ਪਿਆਰ ਕਰੋ? ਆਪਣੇ ਦੋਸਤਾਂ ਨੂੰ ਦੱਸੋ!

ਇਹ ਪੇਜ਼ ਰੇਟਿੰਗ