Wizper (Whisper v3)

Free.ai · stt · ~500 توکنها در هر minute

پروندۀ صوتی یا ویدئویی را رها کنید، یا نشانی وب را در زیر بچسبانید

~500 توکنها در هر minute
در گراف‌های گسسته آزاد است. ارتقا برای Wizper (Whisper v3) →

Wizper (Whisper v3) برابر با a مدل گفتار به متن است. مسیریابی از طریق مدل‌های خارجی - ~500 توکن‌های در دقیقه (50٪ مارکاپ بر روی هزینه بالا).

استفاده از طریق API

API REST OpenAI-compatible. یک کلید تولید کنید و این مدل را در چند ثانیه فراخوانی کنید.

curl -X POST https://api.free.ai/v1/stt/ \
  -H "Authorization: Bearer sk-free-..." \
  -H "Content-Type: application/json" \
  -d '{"model":"premium/wizper","audio_url":"https://..."}'
مستندات API دریافت کلید API

پرسشهای متداول

Wizper (Whisper v3) صدای گفتار را به متن رونوشت می‌کند. یک پرونده MP3 ، WAV ، M4A یا ویدئویی را بارگذاری کنید و Wizper (Whisper v3) رونوشت کامل را به علاوه زیرنویس‌های اختیاری SRT / VTT با مهرهای زمانی برمی‌گرداند.

Wizper (Whisper v3) handles dozens of languages - Whisper-family models cover 90+, others vary. Pick "auto-detect" or specify the language for highest accuracy.

نرخ خطای کلمه ۵-۱۰٪ در صدای انگلیسی تمیز، ۱۰-۲۰٪ در صدای پر سر و صدا یا با لهجه است. انواع بزرگ از معماری مشابه به طور قابل توجهی در موارد سخت بهتر عمل می‌کنند - هنگامی که صدا خشن است، بزرگتر را انتخاب کنید.

بله - هر قطعه شامل علامت زمان آغاز/پایان است. صادرات به عنوان SRT یا VTT و نقشه زمان مستقیماً در ویدئو شما.

Wizper (Whisper v3) is a premium transcription engine. About ~500-1,500 tokens per minute of audio, shown live before you generate. Self-hosted transcription runs free on your 30,000-token daily pool; premium models are pay-as-you-go, with top-ups from $1.

MP3, WAV, M4A, FLAC, OGG, plus video (MP4, MOV, WebM) - ما صدا را استخراج می‌کنیم. حداکثر ۵۰۰ مگابایت در بارگذاری. پرونده‌های طولانی‌تر؟ با /audio/cut/ تقسیم کنید یا از /v1/stt/batch/ استفاده کنید.

دیاریزه کردن سخنران یک گذرگاه جداگانه است - "diarize" را در /transcribe/ تغییر دهید. Wizper (Whisper v3) رونویسی را انجام می‌دهد؛ دیاریزه کردن هر بخش را با Speaker 1 / Speaker 2 / و غیره برچسب می‌زند.

بله - /batch/ پوشه‌ای از پرونده‌های صوتی را قبول می‌کند. هر رونوشت در /account/?tab=history با نام پرونده اصلی قرار می‌گیرد. برای حفظ درخت پوشه از API استفاده کنید.

بله - POST صدای خود را به /v1/stt/transcribe/ با model="Wizper (Whisper v3)". با متن + segments + timestamp سطح کلمه JSON را بازگرداند. /api/ دارای مرجع کامل است.

مدل‌های خود میزبانی صدا را در GPUهای ما نگه می‌دارند؛ Premium با DPA از طریق آن عبور می‌کند. صدا پس از پنجره اشتراک حذف می‌شود (۲۴ ساعت بدون علامت، ۷ روز ثبت نام). ما ورودی‌های شما را آموزش نمی‌دهیم.

بله - Free.ai اجازه استفاده تجاری از رونوشت‌ها را می‌دهد. شما نیاز به حق برای صدایی دارید که بارگذاری کرده‌اید (صداسازی خودتان، مواد مجوزدار، یا محتوا با اجازه).

Real-time factor is roughly 0.05-0.2× - a 60-minute podcast transcribes in 3-12 minutes. Premium models often finish faster. Use the queue button to close the tab.

دوست Free.ai رو به دوستانت بگو

رتبه این صفحه