Distil-Whisper large-v3

Free.ai (self-hosted) · stt · ~500 توکنها در هر minute

پروندۀ صوتی یا ویدئویی را رها کنید، یا نشانی وب را در زیر بچسبانید

~500 توکنها در هر minute

. Distil-Whisper large-v3 a مدل گفتار به متن ساخته شده توسط HuggingFace Strongest at Real-time transcription, large-volume batch STT.. Free.ai GPUs self-hosted — freely runs against your daily token pool (500 tokens در دقیقه). انتشار تحت MIT - استفاده تجاری اجازه داده شده در Free.ai.

استفاده از طریق API

API REST OpenAI-compatible. یک کلید تولید کنید و این مدل را در چند ثانیه فراخوانی کنید.

curl -X POST https://api.free.ai/v1/stt/ \
  -H "Authorization: Bearer sk-free-..." \
  -H "Content-Type: application/json" \
  -d '{"model":"distil-whisper-large-v3","audio_url":"https://..."}'
مستندات API دریافت کلید API

پرسشهای متداول

Distil-Whisper large-v3 صدای گفتار را به متن رونوشت می‌کند. یک پرونده MP3 ، WAV ، M4A یا ویدئویی را بارگذاری کنید و Distil-Whisper large-v3 رونوشت کامل را به علاوه زیرنویس‌های اختیاری SRT / VTT با مهرهای زمانی برمی‌گرداند.

Distil-Whisper large-v3 handles dozens of languages - Whisper-family models cover 90+, others vary. Pick "auto-detect" or specify the language for highest accuracy.

نرخ خطای کلمه ۵-۱۰٪ در صدای انگلیسی تمیز، ۱۰-۲۰٪ در صدای پر سر و صدا یا با لهجه است. انواع بزرگ از معماری مشابه به طور قابل توجهی در موارد سخت بهتر عمل می‌کنند - هنگامی که صدا خشن است، بزرگتر را انتخاب کنید.

بله - هر قطعه شامل علامت زمان آغاز/پایان است. صادرات به عنوان SRT یا VTT و نقشه زمان مستقیماً در ویدئو شما.

Distil-Whisper large-v3 runs on our own GPUs against your daily free pool first; $5 → 200,000 paid tokens after that. About ~500 tokens per minute.

MP3, WAV, M4A, FLAC, OGG, plus video (MP4, MOV, WebM) - ما صدا را استخراج می‌کنیم. حداکثر ۵۰۰ مگابایت در بارگذاری. پرونده‌های طولانی‌تر؟ با /audio/cut/ تقسیم کنید یا از /v1/stt/batch/ استفاده کنید.

دیاریزه کردن سخنران یک گذرگاه جداگانه است - "diarize" را در /transcribe/ تغییر دهید. Distil-Whisper large-v3 رونویسی را انجام می‌دهد؛ دیاریزه کردن هر بخش را با Speaker 1 / Speaker 2 / و غیره برچسب می‌زند.

بله - /batch/ پوشه‌ای از پرونده‌های صوتی را قبول می‌کند. هر رونوشت در /account/?tab=history با نام پرونده اصلی قرار می‌گیرد. برای حفظ درخت پوشه از API استفاده کنید.

بله - POST صدای خود را به /v1/stt/transcribe/ با model="Distil-Whisper large-v3". با متن + segments + timestamp سطح کلمه JSON را بازگرداند. /api/ دارای مرجع کامل است.

مدل‌های خود میزبانی صدا را در GPUهای ما نگه می‌دارند؛ Premium با DPA از طریق آن عبور می‌کند. صدا پس از پنجره اشتراک حذف می‌شود (۲۴ ساعت بدون علامت، ۷ روز ثبت نام). ما ورودی‌های شما را آموزش نمی‌دهیم.

بله - Free.ai اجازه استفاده تجاری از رونوشت‌ها را می‌دهد. شما نیاز به حق برای صدایی دارید که بارگذاری کرده‌اید (صداسازی خودتان، مواد مجوزدار، یا محتوا با اجازه).

Real-time factor is roughly 0.05-0.2× - a 60-minute podcast transcribes in 3-12 minutes. Premium models often finish faster. Use the queue button to close the tab.

دوست Free.ai رو به دوستانت بگو

رتبه این صفحه