ElevenLabs STT

Free.ai · stt · ~500 توکنها در هر minute

پروندۀ صوتی یا ویدئویی را رها کنید، یا نشانی وب را در زیر بچسبانید

~500 توکنها در هر minute
در گراف‌های گسسته آزاد است. ارتقا برای ElevenLabs STT →

ElevenLabs STT برابر با a مدل گفتار به متن است. مسیریابی از طریق مدل‌های خارجی - ~500 توکن‌های در دقیقه (50٪ مارکاپ بر روی هزینه بالا).

استفاده از طریق API

API REST OpenAI-compatible. یک کلید تولید کنید و این مدل را در چند ثانیه فراخوانی کنید.

curl -X POST https://api.free.ai/v1/stt/ \
  -H "Authorization: Bearer sk-free-..." \
  -H "Content-Type: application/json" \
  -d '{"model":"premium/elevenlabs/speech-to-text","audio_url":"https://..."}'
مستندات API دریافت کلید API

پرسشهای متداول

ElevenLabs STT صدای گفتار را به متن رونوشت می‌کند. یک پرونده MP3 ، WAV ، M4A یا ویدئویی را بارگذاری کنید و ElevenLabs STT رونوشت کامل را به علاوه زیرنویس‌های اختیاری SRT / VTT با مهرهای زمانی برمی‌گرداند.

ElevenLabs STT handles dozens of languages - Whisper-family models cover 90+, others vary. Pick "auto-detect" or specify the language for highest accuracy.

نرخ خطای کلمه ۵-۱۰٪ در صدای انگلیسی تمیز، ۱۰-۲۰٪ در صدای پر سر و صدا یا با لهجه است. انواع بزرگ از معماری مشابه به طور قابل توجهی در موارد سخت بهتر عمل می‌کنند - هنگامی که صدا خشن است، بزرگتر را انتخاب کنید.

بله - هر قطعه شامل علامت زمان آغاز/پایان است. صادرات به عنوان SRT یا VTT و نقشه زمان مستقیماً در ویدئو شما.

ElevenLabs STT is a premium transcription engine. About ~500-1,500 tokens per minute of audio, shown live before you generate. Self-hosted transcription runs free on your 30,000-token daily pool; premium models are pay-as-you-go, with top-ups from $1.

MP3, WAV, M4A, FLAC, OGG, plus video (MP4, MOV, WebM) - ما صدا را استخراج می‌کنیم. حداکثر ۵۰۰ مگابایت در بارگذاری. پرونده‌های طولانی‌تر؟ با /audio/cut/ تقسیم کنید یا از /v1/stt/batch/ استفاده کنید.

دیاریزه کردن سخنران یک گذرگاه جداگانه است - "diarize" را در /transcribe/ تغییر دهید. ElevenLabs STT رونویسی را انجام می‌دهد؛ دیاریزه کردن هر بخش را با Speaker 1 / Speaker 2 / و غیره برچسب می‌زند.

بله - /batch/ پوشه‌ای از پرونده‌های صوتی را قبول می‌کند. هر رونوشت در /account/?tab=history با نام پرونده اصلی قرار می‌گیرد. برای حفظ درخت پوشه از API استفاده کنید.

بله - POST صدای خود را به /v1/stt/transcribe/ با model="ElevenLabs STT". با متن + segments + timestamp سطح کلمه JSON را بازگرداند. /api/ دارای مرجع کامل است.

مدل‌های خود میزبانی صدا را در GPUهای ما نگه می‌دارند؛ Premium با DPA از طریق آن عبور می‌کند. صدا پس از پنجره اشتراک حذف می‌شود (۲۴ ساعت بدون علامت، ۷ روز ثبت نام). ما ورودی‌های شما را آموزش نمی‌دهیم.

بله - Free.ai اجازه استفاده تجاری از رونوشت‌ها را می‌دهد. شما نیاز به حق برای صدایی دارید که بارگذاری کرده‌اید (صداسازی خودتان، مواد مجوزدار، یا محتوا با اجازه).

Real-time factor is roughly 0.05-0.2× - a 60-minute podcast transcribes in 3-12 minutes. Premium models often finish faster. Use the queue button to close the tab.

دوست Free.ai رو به دوستانت بگو

رتبه این صفحه