Distil-Whisper large-v3

Free.ai (self-hosted) · stt · ~500 প্রতি minute

অডিও অথবা ভিডিও ফাইল ছেড়ে দিন, অথবা নিচে একটি URL পেস্ট করুন

~500 প্রতি minute

Distil-Whisper large-v3 হল a বাক্যের- থেকে- টেক্সট মডেল HuggingFace দ্বারা নির্মিত। সবচেয়ে শক্তিশালী Real-time transcription, large-volume batch STT.. Free.ai GPUs-এ স্ব-হোস্ট করা - আপনার দৈনিক টোকেন পুলের বিরুদ্ধে বিনামূল্যে চলছে (500 টোকেন % 1 সেকেন্ড)। MIT লাইসেন্সের অধীনে প্রকাশিত - বাণিজ্যিক ব্যবহারের অনুমতি Free.ai লাইসেন্সের অধীনে।

API ব্যবহার করো

OpenAI-সমর্থিত REST API। একটি কী তৈরি করুন এবং সেকেন্ডের মধ্যে এই মডেলটি কল করুন।

curl -X POST https://api.free.ai/v1/stt/ \
  -H "Authorization: Bearer sk-free-..." \
  -H "Content-Type: application/json" \
  -d '{"model":"distil-whisper-large-v3","audio_url":"https://..."}'
API ডকুমেন্টেশন API কী পাওয়া যায়নি

প্রায়শ জিজ্ঞাসিত প্রশ্ন

Distil-Whisper large-v3 কথা বলা অডিওকে টেক্সটে রূপান্তর করে। MP3, WAV, M4A, অথবা ভিডিও ফাইল আপলোড করুন এবং Distil-Whisper large-v3 টাইমসটাম্প সহ সম্পূর্ণ ট্রান্সক্রিপশন এবং বৈকল্পিক SRT/VTT সাবটাইটেল ফিরিয়ে দেবে।

Distil-Whisper large-v3 handles dozens of languages - Whisper-family models cover 90+, others vary. Pick "auto-detect" or specify the language for highest accuracy.

শব্দ-ত্রুটির হার পরিষ্কার ইংরেজি অডিওতে ৫-১০%, ঝামেলাপূর্ণ অথবা উচ্চারণযুক্ত অডিওতে ১০-২০%। একই স্থাপত্যের বড় ধরনের বর্ণনা কঠিন ক্ষেত্রে অনেক ভালো কাজ করে - অডিও ঝামেলাপূর্ণ হলে বড় ধরনের বর্ণনা বেছে নিন।

হ্যাঁ - প্রতিটি সেগমেন্টে শুরু/শেষ সময়সূচী অন্তর্ভুক্ত রয়েছে। SRT অথবা VTT হিসাবে রপ্তানি করুন এবং সময়সূচী সরাসরি আপনার ভিডিওতে ম্যাপ করুন।

Distil-Whisper large-v3 আমাদের নিজস্ব GPUs-এ আপনার দৈনিক ফ্রি পুলে প্রথমে কাজ করে; $৫ → ২০০,০০০ পেইড টোকেন এর পরে। প্রতি মিনিটে ~৫০০ টোকেন।

MP3, WAV, M4A, FLAC, OGG, এবং ভিডিও (MP4, MOV, WebM) - আমরা অডিও এক্সট্র্যাক্ট করব। প্রতি আপলোডে সর্বোচ্চ ৫০০ মেগাবাইট। দীর্ঘ ফাইল? /audio/cut/ ব্যবহার করে বিভক্ত করুন অথবা /v1/stt/batch/ ব্যবহার করুন।

স্পিকারের ডায়ারিজম একটি আলাদা পাস - /transcribe/-এ "diarize" টগল করুন। Distil-Whisper large-v3 অনুবাদ পরিচালনা করে; ডায়ারিজম প্রত্যেক অংশকে স্পিকার ১ / স্পিকার ২ / ইত্যাদির সাথে লেবেল করে।

হ্যাঁ - /batch/ অডিও ফাইলের ফোল্ডার গ্রহণ করে। প্রত্যেকটি ট্রান্সক্রিপ্ট মূল ফাইলের নাম সহ /account/?tab=history-এ অবস্থিত হয়। ফোল্ডার-ট্রী সংরক্ষণের জন্য API ব্যবহার করুন।

হ্যাঁ - আপনার অডিও /v1/stt/transcribe/ এ POST করুন model="Distil-Whisper large-v3" সহযোগে। JSON ফিরিয়ে আনে টেক্সট + সেগমেন্ট + শব্দ-স্তরের সময়সূচী সহ। /api/-এ সম্পূর্ণ রেফারেন্স রয়েছে।

স্ব-হোস্টকৃত মডেলগুলি আমাদের GPU-তে অডিও সংরক্ষণ করে; প্রাইম একটি DPA-র মাধ্যমে প্রবেশ করে। শেয়ার-উইন্ডোর পরে অডিও মুছে ফেলা হয় (২৪ ঘন্টা অজ্ঞাত, ৭ দিন লগ-ইন)। আমরা আপনার ইনপুটগুলির উপর প্রশিক্ষণ দিই না।

হ্যাঁ - Free.ai ট্রান্সক্রিপ্ট বাণিজ্যিক ব্যবহারের অনুমতি দেয়। আপলোড করা অডিও ফাইলের জন্য আপনার অধিকার প্রয়োজন (আপনার নিজের রেকর্ড, লাইসেন্সকৃত উপাদান, অথবা অনুমতিপ্রাপ্ত বিষয়বস্তু)।

বাস্তব সময়ের ফ্যাক্টর হল প্রায় ০.০৫-০.২× - ৬০ মিনিটের একটি পডকাস্ট ৩-১২ মিনিটে অনুবাদ করা হয়। প্রাইম মডেলগুলি সাধারণত দ্রুত শেষ হয়। ট্যাবটি বন্ধ করতে লাইন বাটন ব্যবহার করুন।

Free.ai ভালোবাসো?

এই পাতাটি রেটিং দিন