Moonshine Base

Free.ai (self-hosted) · stt · ~500 প্রতি minute

অডিও অথবা ভিডিও ফাইল ছেড়ে দিন, অথবা নিচে একটি URL পেস্ট করুন

~500 প্রতি minute

Moonshine Base হল a বাক্যের- থেকে- টেক্সট মডেল Useful Sensors দ্বারা নির্মিত। সবচেয়ে শক্তিশালী Low-latency live transcription, embedded devices.. Free.ai GPUs-এ স্ব-হোস্ট করা - আপনার দৈনিক টোকেন পুলের বিরুদ্ধে বিনামূল্যে চলছে (500 টোকেন % 1 সেকেন্ড)। MIT লাইসেন্সের অধীনে প্রকাশিত - বাণিজ্যিক ব্যবহারের অনুমতি Free.ai লাইসেন্সের অধীনে।

API ব্যবহার করো

OpenAI-সমর্থিত REST API। একটি কী তৈরি করুন এবং সেকেন্ডের মধ্যে এই মডেলটি কল করুন।

curl -X POST https://api.free.ai/v1/stt/ \
  -H "Authorization: Bearer sk-free-..." \
  -H "Content-Type: application/json" \
  -d '{"model":"moonshine-base","audio_url":"https://..."}'
API ডকুমেন্টেশন API কী পাওয়া যায়নি

প্রায়শ জিজ্ঞাসিত প্রশ্ন

Moonshine Base কথা বলা অডিওকে টেক্সটে রূপান্তর করে। MP3, WAV, M4A, অথবা ভিডিও ফাইল আপলোড করুন এবং Moonshine Base টাইমসটাম্প সহ সম্পূর্ণ ট্রান্সক্রিপশন এবং বৈকল্পিক SRT/VTT সাবটাইটেল ফিরিয়ে দেবে।

Moonshine Base handles dozens of languages - Whisper-family models cover 90+, others vary. Pick "auto-detect" or specify the language for highest accuracy.

শব্দ-ত্রুটির হার পরিষ্কার ইংরেজি অডিওতে ৫-১০%, ঝামেলাপূর্ণ অথবা উচ্চারণযুক্ত অডিওতে ১০-২০%। একই স্থাপত্যের বড় ধরনের বর্ণনা কঠিন ক্ষেত্রে অনেক ভালো কাজ করে - অডিও ঝামেলাপূর্ণ হলে বড় ধরনের বর্ণনা বেছে নিন।

হ্যাঁ - প্রতিটি সেগমেন্টে শুরু/শেষ সময়সূচী অন্তর্ভুক্ত রয়েছে। SRT অথবা VTT হিসাবে রপ্তানি করুন এবং সময়সূচী সরাসরি আপনার ভিডিওতে ম্যাপ করুন।

Moonshine Base আমাদের নিজস্ব GPUs-এ আপনার দৈনিক ফ্রি পুলে প্রথমে কাজ করে; $৫ → ২০০,০০০ পেইড টোকেন এর পরে। প্রতি মিনিটে ~৫০০ টোকেন।

MP3, WAV, M4A, FLAC, OGG, এবং ভিডিও (MP4, MOV, WebM) - আমরা অডিও এক্সট্র্যাক্ট করব। প্রতি আপলোডে সর্বোচ্চ ৫০০ মেগাবাইট। দীর্ঘ ফাইল? /audio/cut/ ব্যবহার করে বিভক্ত করুন অথবা /v1/stt/batch/ ব্যবহার করুন।

স্পিকারের ডায়ারিজম একটি আলাদা পাস - /transcribe/-এ "diarize" টগল করুন। Moonshine Base অনুবাদ পরিচালনা করে; ডায়ারিজম প্রত্যেক অংশকে স্পিকার ১ / স্পিকার ২ / ইত্যাদির সাথে লেবেল করে।

হ্যাঁ - /batch/ অডিও ফাইলের ফোল্ডার গ্রহণ করে। প্রত্যেকটি ট্রান্সক্রিপ্ট মূল ফাইলের নাম সহ /account/?tab=history-এ অবস্থিত হয়। ফোল্ডার-ট্রী সংরক্ষণের জন্য API ব্যবহার করুন।

হ্যাঁ - আপনার অডিও /v1/stt/transcribe/ এ POST করুন model="Moonshine Base" সহযোগে। JSON ফিরিয়ে আনে টেক্সট + সেগমেন্ট + শব্দ-স্তরের সময়সূচী সহ। /api/-এ সম্পূর্ণ রেফারেন্স রয়েছে।

স্ব-হোস্টকৃত মডেলগুলি আমাদের GPU-তে অডিও সংরক্ষণ করে; প্রাইম একটি DPA-র মাধ্যমে প্রবেশ করে। শেয়ার-উইন্ডোর পরে অডিও মুছে ফেলা হয় (২৪ ঘন্টা অজ্ঞাত, ৭ দিন লগ-ইন)। আমরা আপনার ইনপুটগুলির উপর প্রশিক্ষণ দিই না।

হ্যাঁ - Free.ai ট্রান্সক্রিপ্ট বাণিজ্যিক ব্যবহারের অনুমতি দেয়। আপলোড করা অডিও ফাইলের জন্য আপনার অধিকার প্রয়োজন (আপনার নিজের রেকর্ড, লাইসেন্সকৃত উপাদান, অথবা অনুমতিপ্রাপ্ত বিষয়বস্তু)।

বাস্তব সময়ের ফ্যাক্টর হল প্রায় ০.০৫-০.২× - ৬০ মিনিটের একটি পডকাস্ট ৩-১২ মিনিটে অনুবাদ করা হয়। প্রাইম মডেলগুলি সাধারণত দ্রুত শেষ হয়। ট্যাবটি বন্ধ করতে লাইন বাটন ব্যবহার করুন।

Free.ai ভালোবাসো?

এই পাতাটি রেটিং দিন