Wizper (Whisper v3)

Free.ai · stt · ~500 প্রতি minute

অডিও অথবা ভিডিও ফাইল ছেড়ে দিন, অথবা নিচে একটি URL পেস্ট করুন

~500 প্রতি minute
আমাদের GPUs উপর ফ্রি চালানো হয়. এর জন্য উন্নীত করুন Wizper (Whisper v3) →

Wizper (Whisper v3) is a বাক্যের- থেকে- টেক্সট মডেল. - আমি জানি না। বাইরের মডেলগুলোর মাধ্যমে পথ নির্ধারণ করা হয়েছে - ~500 টোকেন % 1 সেকেন্ড (আপস্ট্রিম খরচের উপর ৫০% মার্কআপ)।

API ব্যবহার করো

OpenAI-সমর্থিত REST API। একটি কী তৈরি করুন এবং সেকেন্ডের মধ্যে এই মডেলটি কল করুন।

curl -X POST https://api.free.ai/v1/stt/ \
  -H "Authorization: Bearer sk-free-..." \
  -H "Content-Type: application/json" \
  -d '{"model":"premium/wizper","audio_url":"https://..."}'
API ডকুমেন্টেশন API কী পাওয়া যায়নি

প্রায়শ জিজ্ঞাসিত প্রশ্ন

Wizper (Whisper v3) কথা বলা অডিওকে টেক্সটে রূপান্তর করে। MP3, WAV, M4A, অথবা ভিডিও ফাইল আপলোড করুন এবং Wizper (Whisper v3) টাইমসটাম্প সহ সম্পূর্ণ ট্রান্সক্রিপশন এবং বৈকল্পিক SRT/VTT সাবটাইটেল ফিরিয়ে দেবে।

Wizper (Whisper v3) handles dozens of languages - Whisper-family models cover 90+, others vary. Pick "auto-detect" or specify the language for highest accuracy.

শব্দ-ত্রুটির হার পরিষ্কার ইংরেজি অডিওতে ৫-১০%, ঝামেলাপূর্ণ অথবা উচ্চারণযুক্ত অডিওতে ১০-২০%। একই স্থাপত্যের বড় ধরনের বর্ণনা কঠিন ক্ষেত্রে অনেক ভালো কাজ করে - অডিও ঝামেলাপূর্ণ হলে বড় ধরনের বর্ণনা বেছে নিন।

হ্যাঁ - প্রতিটি সেগমেন্টে শুরু/শেষ সময়সূচী অন্তর্ভুক্ত রয়েছে। SRT অথবা VTT হিসাবে রপ্তানি করুন এবং সময়সূচী সরাসরি আপনার ভিডিওতে ম্যাপ করুন।

Wizper (Whisper v3) একটি প্রাইম ট্রান্সক্রিপশন ইঞ্জিন। প্রতি মিনিটে ~৫০০-১,৫০০ টোকেন অডিও, আপনি তৈরি করার আগে সরাসরি প্রদর্শিত। স্ব-হোস্ট ট্রান্সক্রিপশন আপনার ৩০,০০০-টোকেন দৈনিক পুলে বিনামূল্যে চলছে; প্রাইম মডেলগুলি আপনি যা চান তা পেতে পারেন, $১ থেকে শুরু করে।

MP3, WAV, M4A, FLAC, OGG, এবং ভিডিও (MP4, MOV, WebM) - আমরা অডিও এক্সট্র্যাক্ট করব। প্রতি আপলোডে সর্বোচ্চ ৫০০ মেগাবাইট। দীর্ঘ ফাইল? /audio/cut/ ব্যবহার করে বিভক্ত করুন অথবা /v1/stt/batch/ ব্যবহার করুন।

স্পিকারের ডায়ারিজম একটি আলাদা পাস - /transcribe/-এ "diarize" টগল করুন। Wizper (Whisper v3) অনুবাদ পরিচালনা করে; ডায়ারিজম প্রত্যেক অংশকে স্পিকার ১ / স্পিকার ২ / ইত্যাদির সাথে লেবেল করে।

হ্যাঁ - /batch/ অডিও ফাইলের ফোল্ডার গ্রহণ করে। প্রত্যেকটি ট্রান্সক্রিপ্ট মূল ফাইলের নাম সহ /account/?tab=history-এ অবস্থিত হয়। ফোল্ডার-ট্রী সংরক্ষণের জন্য API ব্যবহার করুন।

হ্যাঁ - আপনার অডিও /v1/stt/transcribe/ এ POST করুন model="Wizper (Whisper v3)" সহযোগে। JSON ফিরিয়ে আনে টেক্সট + সেগমেন্ট + শব্দ-স্তরের সময়সূচী সহ। /api/-এ সম্পূর্ণ রেফারেন্স রয়েছে।

স্ব-হোস্টকৃত মডেলগুলি আমাদের GPU-তে অডিও সংরক্ষণ করে; প্রাইম একটি DPA-র মাধ্যমে প্রবেশ করে। শেয়ার-উইন্ডোর পরে অডিও মুছে ফেলা হয় (২৪ ঘন্টা অজ্ঞাত, ৭ দিন লগ-ইন)। আমরা আপনার ইনপুটগুলির উপর প্রশিক্ষণ দিই না।

হ্যাঁ - Free.ai ট্রান্সক্রিপ্ট বাণিজ্যিক ব্যবহারের অনুমতি দেয়। আপলোড করা অডিও ফাইলের জন্য আপনার অধিকার প্রয়োজন (আপনার নিজের রেকর্ড, লাইসেন্সকৃত উপাদান, অথবা অনুমতিপ্রাপ্ত বিষয়বস্তু)।

বাস্তব সময়ের ফ্যাক্টর হল প্রায় ০.০৫-০.২× - ৬০ মিনিটের একটি পডকাস্ট ৩-১২ মিনিটে অনুবাদ করা হয়। প্রাইম মডেলগুলি সাধারণত দ্রুত শেষ হয়। ট্যাবটি বন্ধ করতে লাইন বাটন ব্যবহার করুন।

Free.ai ভালোবাসো?

এই পাতাটি রেটিং দিন