Fal Speech-to-Text

Free.ai · stt · ~500 প্রতি minute

অডিও অথবা ভিডিও ফাইল ছেড়ে দিন, অথবা নিচে একটি URL পেস্ট করুন

~500 প্রতি minute
আমাদের GPUs উপর ফ্রি চালানো হয়. এর জন্য উন্নীত করুন Fal Speech-to-Text →

Fal Speech-to-Text is a বাক্যের- থেকে- টেক্সট মডেল. - আমি জানি না। বাইরের মডেলগুলোর মাধ্যমে পথ নির্ধারণ করা হয়েছে - ~500 টোকেন % 1 সেকেন্ড (আপস্ট্রিম খরচের উপর ৫০% মার্কআপ)।

API ব্যবহার করো

OpenAI-সমর্থিত REST API। একটি কী তৈরি করুন এবং সেকেন্ডের মধ্যে এই মডেলটি কল করুন।

curl -X POST https://api.free.ai/v1/stt/ \
  -H "Authorization: Bearer sk-free-..." \
  -H "Content-Type: application/json" \
  -d '{"model":"premium/speech-to-text","audio_url":"https://..."}'
API ডকুমেন্টেশন API কী পাওয়া যায়নি

প্রায়শ জিজ্ঞাসিত প্রশ্ন

Fal Speech-to-Text কথা বলা অডিওকে টেক্সটে রূপান্তর করে। MP3, WAV, M4A, অথবা ভিডিও ফাইল আপলোড করুন এবং Fal Speech-to-Text টাইমসটাম্প সহ সম্পূর্ণ ট্রান্সক্রিপশন এবং বৈকল্পিক SRT/VTT সাবটাইটেল ফিরিয়ে দেবে।

Fal Speech-to-Text handles dozens of languages - Whisper-family models cover 90+, others vary. Pick "auto-detect" or specify the language for highest accuracy.

শব্দ-ত্রুটির হার পরিষ্কার ইংরেজি অডিওতে ৫-১০%, ঝামেলাপূর্ণ অথবা উচ্চারণযুক্ত অডিওতে ১০-২০%। একই স্থাপত্যের বড় ধরনের বর্ণনা কঠিন ক্ষেত্রে অনেক ভালো কাজ করে - অডিও ঝামেলাপূর্ণ হলে বড় ধরনের বর্ণনা বেছে নিন।

হ্যাঁ - প্রতিটি সেগমেন্টে শুরু/শেষ সময়সূচী অন্তর্ভুক্ত রয়েছে। SRT অথবা VTT হিসাবে রপ্তানি করুন এবং সময়সূচী সরাসরি আপনার ভিডিওতে ম্যাপ করুন।

Fal Speech-to-Text একটি প্রাইম ট্রান্সক্রিপশন ইঞ্জিন। প্রতি মিনিটে ~৫০০-১,৫০০ টোকেন অডিও, আপনি তৈরি করার আগে সরাসরি প্রদর্শিত। স্ব-হোস্ট ট্রান্সক্রিপশন আপনার ৩০,০০০-টোকেন দৈনিক পুলে বিনামূল্যে চলছে; প্রাইম মডেলগুলি আপনি যা চান তা পেতে পারেন, $১ থেকে শুরু করে।

MP3, WAV, M4A, FLAC, OGG, এবং ভিডিও (MP4, MOV, WebM) - আমরা অডিও এক্সট্র্যাক্ট করব। প্রতি আপলোডে সর্বোচ্চ ৫০০ মেগাবাইট। দীর্ঘ ফাইল? /audio/cut/ ব্যবহার করে বিভক্ত করুন অথবা /v1/stt/batch/ ব্যবহার করুন।

স্পিকারের ডায়ারিজম একটি আলাদা পাস - /transcribe/-এ "diarize" টগল করুন। Fal Speech-to-Text অনুবাদ পরিচালনা করে; ডায়ারিজম প্রত্যেক অংশকে স্পিকার ১ / স্পিকার ২ / ইত্যাদির সাথে লেবেল করে।

হ্যাঁ - /batch/ অডিও ফাইলের ফোল্ডার গ্রহণ করে। প্রত্যেকটি ট্রান্সক্রিপ্ট মূল ফাইলের নাম সহ /account/?tab=history-এ অবস্থিত হয়। ফোল্ডার-ট্রী সংরক্ষণের জন্য API ব্যবহার করুন।

হ্যাঁ - আপনার অডিও /v1/stt/transcribe/ এ POST করুন model="Fal Speech-to-Text" সহযোগে। JSON ফিরিয়ে আনে টেক্সট + সেগমেন্ট + শব্দ-স্তরের সময়সূচী সহ। /api/-এ সম্পূর্ণ রেফারেন্স রয়েছে।

স্ব-হোস্টকৃত মডেলগুলি আমাদের GPU-তে অডিও সংরক্ষণ করে; প্রাইম একটি DPA-র মাধ্যমে প্রবেশ করে। শেয়ার-উইন্ডোর পরে অডিও মুছে ফেলা হয় (২৪ ঘন্টা অজ্ঞাত, ৭ দিন লগ-ইন)। আমরা আপনার ইনপুটগুলির উপর প্রশিক্ষণ দিই না।

হ্যাঁ - Free.ai ট্রান্সক্রিপ্ট বাণিজ্যিক ব্যবহারের অনুমতি দেয়। আপলোড করা অডিও ফাইলের জন্য আপনার অধিকার প্রয়োজন (আপনার নিজের রেকর্ড, লাইসেন্সকৃত উপাদান, অথবা অনুমতিপ্রাপ্ত বিষয়বস্তু)।

বাস্তব সময়ের ফ্যাক্টর হল প্রায় ০.০৫-০.২× - ৬০ মিনিটের একটি পডকাস্ট ৩-১২ মিনিটে অনুবাদ করা হয়। প্রাইম মডেলগুলি সাধারণত দ্রুত শেষ হয়। ট্যাবটি বন্ধ করতে লাইন বাটন ব্যবহার করুন।

Free.ai ভালোবাসো?

এই পাতাটি রেটিং দিন