Fal Speech-to-Text

Free.ai · stt · ~500 ටොකන් minute

ශ්‍රව්‍ය හෝ දෘශ්‍ය ගොනුවක් ඉවත් කරන්න, හෝ URL ලිපිනය පහතට ඇල කරන්න

~500 ටොකන් minute
අපේ GPU වල නිදහසේ ධාවනය වෙනවා. සඳහා උසස් කරන්න Fal Speech-to-Text →

Fal Speech-to-Text යනු a කථා-පෙළ ආකෘතිය වේ. බාහිර ආකෘති හරහා මාර්ගය - ~ 500 ටොකන් මිනිත්තුවට (50% උඩුගත පිරිවැය මත මාකප්).

API හරහා භාවිත කරන්න

OpenAI අනුකූල REST API. යතුරක් ජනනය කර තත්පර කිහිපයකින් මෙම ආකෘතිය ඇමතීමට.

curl -X POST https://api.free.ai/v1/stt/ \
  -H "Authorization: Bearer sk-free-..." \
  -H "Content-Type: application/json" \
  -d '{"model":"premium/speech-to-text","audio_url":"https://..."}'
API ලේඛන API යතුර ලබාගන්න

නිතර අසන ප්රශ්න

Fal Speech-to-Text පෙළ බවට කතා ශබ්ද පරිවර්තනය. MP3 ප්රවේශ, WAV, M4A, හෝ වීඩියෝ ගොනුවක් හා Fal Speech-to-Text සම්පූර්ණ පරිවර්තනය ප්ලස් කාල සටහන් සමග විකල්ප SRT / VTT උපසිරැසි ආපසු.

Fal Speech-to-Text handles dozens of languages - Whisper-family models cover 90+, others vary. Pick "auto-detect" or specify the language for highest accuracy.

වචන-දෝෂ අනුපාතය පිරිසිදු ඉංග්රීසි ශබ්ද 5-10% වේ, ශබ්ද හෝ accented ශබ්ද 10-20% වේ. එම ගෘහ නිර්මාණ ශිල්පය විශාල විකල්ප දෘඩ නඩු මත අර්ථවත් වඩා හොඳ කරන්නේ - ශබ්ද දෘඩ විට විශාල තෝරන්න.

ඔව් - සෑම කොටසක් ආරම්භ / අවසන් timestamps ඇතුළත් වේ. SRT හෝ VTT ලෙස අපනයනය සහ ඔබේ වීඩියෝව මත කෙලින්ම කාලය සිතියම.

Fal Speech-to-Text වාරික පරිවර්තනය එන්ජිම වේ. ~ 500-1,500 ශ්රව්ය මිනිත්තු ටොකන් ගැන, ඔබ ජනනය කිරීමට පෙර සජීවී පෙන්නුම්. ස්වයං-සත්කාරක පරිවර්තනය ඔබේ 30,000-ටොකන් දෛනික පූල් මත නිදහස් ධාවනය; වාරික ආකෘති ගෙවීම්-ඔබ-යන්න ලෙස, සිට top-ups සමග $1.

MP3, WAV, M4A, FLAC, OGG, ප්ලස් වීඩියෝ (MP4, MOV, WebM) - අපි ශ්රව්ය ඉවත්. උපරිම 500 MB එකකට. දිගු ගොනු? /audio/cut/ සමඟ බෙදා හරින්න හෝ /v1/stt/batch/ භාවිතා කරන්න.

කථානායක diarization වෙනම සමත් වේ - / පරිවර්තනය / මත "diarize" මාරු. Fal Speech-to-Text පරිවර්තනය හැසිරවීම; කථානායක diarization එක් එක් කොටස ලේබල් 1 / කථානායක 2/ ආදිය.

ඔව් - /batch/ ශ්රව්ය ගොනු බහාලුමක් පිළිගනී. එක් එක් පරිවර්තනය මුල් ගොනු නාමය සමග /account/?tab=history තුළ ගොඩබසියි. බහාලුම්-ගස සංරක්ෂණය සඳහා API භාවිතා කරන්න.

ඔව් - ඔබේ ශ්රව්ය /v1/stt/transcribe/ සමග ආකෘතිය සමග POST "Fal Speech-to-Text". පෙළ සමග JSON ආපසු + කොටස් + වචන මට්ටමේ timestamps. /api/ සම්පූර්ණ උපුටා ඇත.

ස්වයං-හෝස්ටඩ් ආකෘති අපගේ GPUs මත ශබ්දය තබා; DPA සමග වාරික හරහා ගමන්. හුවමාරු-කවුළුව පසු ශබ්දය මකා දමයි (24h anon, 7d සභාපති-in). අපි ඔබේ ආදාන පුහුණු නැහැ.

ඔව් - Free.ai පරිවර්තන වාණිජ භාවිතය ලබා දෙයි. ඔබ ඔබ උඩුගත ශ්රව්ය අයිතිවාසිකම් අවශ්ය (ඔබේම පටිගත, බලපත්ර ද්රව්ය, හෝ අනුමැතිය සමග අන්තර්ගතය).

තත්ත්ව සාධකය දළ වශයෙන් 0.05-0.2 × වේ - මිනිත්තු 60 ක පොඩ්කාස්ට් මිනිත්තු 3-12 ක් තුළ පරිවර්තනය කරයි. ප් රතිලාභ ආකෘති බොහෝ විට වේගයෙන් අවසන් වේ. ටැබය වසා දැමීමට පෝලිම් බොත්තම භාවිතා කරන්න.

ආදරය Free.ai? ඔබේ මිතුරන්ට කියන්න!

මෙම පිටුව අගය