Distil-Whisper large-v3

Free.ai (self-hosted) · stt · ~500 ٹوکنس پر minute

آ ڈیو يا ويڈیو فائل ڈاليں يا URL کو نيچے چپکا دیں

~500 ٹوکنس پر minute

Distil-Whisper large-v3 a زبان سے متن ماڈل HuggingFace کے ليے بنا يا گيا هے Real-time transcription, large-volume batch STT. میں سب سے مضبوط. Free.ai GPUs پر خود مہمان — آپ کے روزانہ ٹوکن پول کے خلاف مفت چلتا ہے (500 ٹوکن منٹ). MIT کے تحت آزاد کیا گیا - Free.ai پر تجارتی استعمال کی اجازت.

API کے ذریعے استعمال کریں

اوپن اے آئی-مطابق REST API. ایک کلید پیدا کریں اور اس ماڈل کو سیکنڈز میں بلايں

curl -X POST https://api.free.ai/v1/stt/ \
  -H "Authorization: Bearer sk-free-..." \
  -H "Content-Type: application/json" \
  -d '{"model":"distil-whisper-large-v3","audio_url":"https://..."}'
API دستاویزی API کلید حاصل کریں

بار بار پوچھے گئے سوالات

Distil-Whisper large-v3 بولے گئے اوڈيو کو متن میں نقل کرتا ہے MP3، WAV، M4A يا ويڈیو فائل اپ لوڈ کريں اور Distil-Whisper large-v3 پورے نقل کو واپس لاتا هے اور اختياري SRT/VTT سب ٹیٹل کو وقت کے نشان کے ساتھ

Distil-Whisper large-v3 handles dozens of languages - Whisper-family models cover 90+, others vary. Pick "auto-detect" or specify the language for highest accuracy.

لفظ غلطيوں کا ريٹ صاف انگريزي او ديو پر 5-10% هے ، شوردار يا افراط آ ديو پر 10-20% هے ۔ يک ئي اڑان کے بڑے تقسيمات سخت حالات پر قابلِ ذکر طور پر بہتر کام کريں هيں ۔

ہاں - ہر سگمنٹ میں شروع/آخر وقت کے نشان شامل ہیں. SRT یا VTT کے طور پر برآمد کریں اور وقت کی میپ براہ راست آپ کی ویڈیو پر.

Distil-Whisper large-v3 آپکے روزانہ مفت پول کے خلاف پہلے ہمارے خود GPUs پر چلتا ہے؛ $5 → اس کے بعد 200,000 ادا کئے گئے ٹوکن. ہر منٹ میں ~500 ٹوکن کے بارے میں.

MP3, WAV, M4A, FLAC, OGG, اور ویڈیو (MP4, MOV, WebM) - ہم آڈیو کو نکالیں. ہر اپ لوڈ کے لیے زیادہ سے زیادہ 500 MB. لمبی فائلیں؟ /audio/cut/ کے ساتھ تقسیم کریں یا /v1/stt/batch/ استعمال کریں.

اسپیکر ڈائريزيشن ایک الگ پاس ہے - /transcribe/ پر "diarize" کو ٹگل کریں. Distil-Whisper large-v3 نقل کو ہینڈل کرتا ہے؛ ڈائريزيشن ہر سگمنٹ کو اسپیکر 1 / اسپیکر 2 / اور اور کے ساتھ لیبل کرتا ہے

ہاں - /batch/ آڈیو فائلیں کا فولڈر قبول کرتا ہے ہر نقل /account/؟tab=history میں اصلی فائلیں کے نام کے ساتھ لگتا ہے فولڈر درخت محفوظ رکھنے کے لیے API استعمال کریں

ہاں - آپ کی آڈیو کو /v1/stt/transcribe/ میں POST کریں موڈل ""Distil-Whisper large-v3"" کے ساتھ. JSON متن + سگمنٹ + ورڈ سطح timestamps کے ساتھ واپس کرتا ہے. /api/ میں پورا حوالہ ہے.

خود مہمان ماڈل ہمارے GPUs پر آڈیو رکھتے ہیں؛ پرائم DPA کے ساتھ گزرتے ہیں۔ آڈیو شیئر-وینڈو کے بعد حذف کی جاتی ہے (24h anon، 7d sign-in). ہم آپ کی انٹیجوں پر تربیت نہیں کرتے.

ہاں - Free.ai نقل کے تجارتی استعمال کو اجازت دیتا ہے آپ کو آپ نے اپ لوڈ کی ہوئی آڈیو کے حقوق کی ضرورت ہے (اپنا خود ریکارڈ، لائسنس شدہ مواد، یا رضامندی کے ساتھ مواد)

ریئل ٹائم فیکٹر تقریبا 0.05-0.2× ہے - ایک 60 منٹ پوڈکاسٹ 3-12 منٹ میں نقل کرتا ہے. پرائم ماڈل اکثر تیزی سے ختم ہوتا ہے. ٹیب بند کرنے کے لیے قطار بٹن استعمال کریں.

Free.ai سے محبت؟ اپنے دوستوں کو بتاؤ۔

اس صفحے کو درجہ دیں