ElevenLabs STT

Free.ai · stt · ~500 প্রতি minute

অডিও অথবা ভিডিও ফাইল ছেড়ে দিন, অথবা নিচে একটি URL পেস্ট করুন

~500 প্রতি minute
আমাদের GPUs উপর ফ্রি চালানো হয়. এর জন্য উন্নীত করুন ElevenLabs STT →

ElevenLabs STT is a বাক্যের- থেকে- টেক্সট মডেল. - আমি জানি না। বাইরের মডেলগুলোর মাধ্যমে পথ নির্ধারণ করা হয়েছে - ~500 টোকেন % 1 সেকেন্ড (আপস্ট্রিম খরচের উপর ৫০% মার্কআপ)।

API ব্যবহার করো

OpenAI-সমর্থিত REST API। একটি কী তৈরি করুন এবং সেকেন্ডের মধ্যে এই মডেলটি কল করুন।

curl -X POST https://api.free.ai/v1/stt/ \
  -H "Authorization: Bearer sk-free-..." \
  -H "Content-Type: application/json" \
  -d '{"model":"premium/elevenlabs/speech-to-text","audio_url":"https://..."}'
API ডকুমেন্টেশন API কী পাওয়া যায়নি

প্রায়শ জিজ্ঞাসিত প্রশ্ন

ElevenLabs STT কথা বলা অডিওকে টেক্সটে রূপান্তর করে। MP3, WAV, M4A, অথবা ভিডিও ফাইল আপলোড করুন এবং ElevenLabs STT টাইমসটাম্প সহ সম্পূর্ণ ট্রান্সক্রিপশন এবং বৈকল্পিক SRT/VTT সাবটাইটেল ফিরিয়ে দেবে।

ElevenLabs STT handles dozens of languages - Whisper-family models cover 90+, others vary. Pick "auto-detect" or specify the language for highest accuracy.

শব্দ-ত্রুটির হার পরিষ্কার ইংরেজি অডিওতে ৫-১০%, ঝামেলাপূর্ণ অথবা উচ্চারণযুক্ত অডিওতে ১০-২০%। একই স্থাপত্যের বড় ধরনের বর্ণনা কঠিন ক্ষেত্রে অনেক ভালো কাজ করে - অডিও ঝামেলাপূর্ণ হলে বড় ধরনের বর্ণনা বেছে নিন।

হ্যাঁ - প্রতিটি সেগমেন্টে শুরু/শেষ সময়সূচী অন্তর্ভুক্ত রয়েছে। SRT অথবা VTT হিসাবে রপ্তানি করুন এবং সময়সূচী সরাসরি আপনার ভিডিওতে ম্যাপ করুন।

ElevenLabs STT একটি প্রাইম ট্রান্সক্রিপশন ইঞ্জিন। প্রতি মিনিটে ~৫০০-১,৫০০ টোকেন অডিও, আপনি তৈরি করার আগে সরাসরি প্রদর্শিত। স্ব-হোস্ট ট্রান্সক্রিপশন আপনার ৩০,০০০-টোকেন দৈনিক পুলে বিনামূল্যে চলছে; প্রাইম মডেলগুলি আপনি যা চান তা পেতে পারেন, $১ থেকে শুরু করে।

MP3, WAV, M4A, FLAC, OGG, এবং ভিডিও (MP4, MOV, WebM) - আমরা অডিও এক্সট্র্যাক্ট করব। প্রতি আপলোডে সর্বোচ্চ ৫০০ মেগাবাইট। দীর্ঘ ফাইল? /audio/cut/ ব্যবহার করে বিভক্ত করুন অথবা /v1/stt/batch/ ব্যবহার করুন।

স্পিকারের ডায়ারিজম একটি আলাদা পাস - /transcribe/-এ "diarize" টগল করুন। ElevenLabs STT অনুবাদ পরিচালনা করে; ডায়ারিজম প্রত্যেক অংশকে স্পিকার ১ / স্পিকার ২ / ইত্যাদির সাথে লেবেল করে।

হ্যাঁ - /batch/ অডিও ফাইলের ফোল্ডার গ্রহণ করে। প্রত্যেকটি ট্রান্সক্রিপ্ট মূল ফাইলের নাম সহ /account/?tab=history-এ অবস্থিত হয়। ফোল্ডার-ট্রী সংরক্ষণের জন্য API ব্যবহার করুন।

হ্যাঁ - আপনার অডিও /v1/stt/transcribe/ এ POST করুন model="ElevenLabs STT" সহযোগে। JSON ফিরিয়ে আনে টেক্সট + সেগমেন্ট + শব্দ-স্তরের সময়সূচী সহ। /api/-এ সম্পূর্ণ রেফারেন্স রয়েছে।

স্ব-হোস্টকৃত মডেলগুলি আমাদের GPU-তে অডিও সংরক্ষণ করে; প্রাইম একটি DPA-র মাধ্যমে প্রবেশ করে। শেয়ার-উইন্ডোর পরে অডিও মুছে ফেলা হয় (২৪ ঘন্টা অজ্ঞাত, ৭ দিন লগ-ইন)। আমরা আপনার ইনপুটগুলির উপর প্রশিক্ষণ দিই না।

হ্যাঁ - Free.ai ট্রান্সক্রিপ্ট বাণিজ্যিক ব্যবহারের অনুমতি দেয়। আপলোড করা অডিও ফাইলের জন্য আপনার অধিকার প্রয়োজন (আপনার নিজের রেকর্ড, লাইসেন্সকৃত উপাদান, অথবা অনুমতিপ্রাপ্ত বিষয়বস্তু)।

বাস্তব সময়ের ফ্যাক্টর হল প্রায় ০.০৫-০.২× - ৬০ মিনিটের একটি পডকাস্ট ৩-১২ মিনিটে অনুবাদ করা হয়। প্রাইম মডেলগুলি সাধারণত দ্রুত শেষ হয়। ট্যাবটি বন্ধ করতে লাইন বাটন ব্যবহার করুন।

Free.ai ভালোবাসো?

এই পাতাটি রেটিং দিন