StyleTTS 2

Free.ai (self-hosted) · tts · ~500 ପ୍ରତି ଟୋକନଗୁଡ଼ିକ clip · 4.6 ରୁ 5 ଏହି ବିଭାଗର ଚାଳକମାନେ
~500 ପ୍ରତି ଟୋକନଗୁଡ଼ିକ clip

StyleTTS 2 ହେଉଛି a ପାଠ୍ୟ-ରୁ-ବାକ୍ୟ ଧ୍ୱନି Yinghao Aaron Li ଦ୍ୱାରା ନିର୍ମିତ । Voice cloning without training data; expressive multilingual speech. ରେ ସବୁଠାରୁ ଶକ୍ତିଶାଳୀ । Free.ai GPUs ଉପରେ ସ୍ୱୟଂ-ହୋଷ୍ଟ — ଆପଣଙ୍କର ଦୈନିକ ଟୋକନ ପୁଲ (500 ଟୋକନ ପ୍ରତି କ୍ଲିପ) ବିରୋଧରେ ମୁକ୍ତ ଭାବରେ ଚାଲୁଛି। MIT ଅନ୍ତର୍ଗତ ମୁକ୍ତ କରାଯାଇଛି - ବାଣିଜ୍ୟିକ ବ୍ୟବହାର ପାଇଁ Free.ai ରେ ଅନୁମତି ଦିଆଯାଇଛି ।

ସାଧାରଣ ପ୍ରଶ୍ନ

StyleTTS 2 ଭାଷାଗୁଡ଼ିକର ଏକ ବିଶାଳ ପରିସରକୁ ସମର୍ଥନ କରେ। ସଠିକ ତାଲିକା ଯନ୍ତ୍ର ଉପରେ ନିର୍ଭର କରେ; ଏହି ପୃଷ୍ଠାରେ ଥିବା ଫର୍ମ କୌଣସି ପାଠ୍ୟକୁ ଗ୍ରହଣ କରେ ଏବଂ ଯନ୍ତ୍ରଟି ଏହାର ସମର୍ଥିତ ଭାଷାରେ ରେଣ୍ଡର କରିବ। ଯଦି ଆପଣ ଗୋଟିଏ ନିର୍ଦ୍ଦିଷ୍ଟ ଭାଷାକୁ ଆବଶ୍ୟକ କରନ୍ତି ତେବେ ସମ୍ପୂର୍ଣ୍ଣ ବହୁମୂଖୀ ଯନ୍ତ୍ର ଚୟନକାରୀ ପାଇଁ /voice/ କୁ ଦେଖନ୍ତୁ।

ଅଧିକାଂଶ ଯନ୍ତ୍ର ପୂର୍ବନିର୍ଦ୍ଧାରିତ ଭାବରେ ତୃଣମୂଳ- ଆମେରିକୀୟ ଇଂରାଜୀ ଏବଂ ଅଣ- ଇଂରାଜୀ ଭାଷାଗୁଡ଼ିକ ପାଇଁ ଏକ କ୍ଷେତ୍ର- ଅନୁକୂଳ ଉଚ୍ଚାରଣକୁ ପ୍ରଦର୍ଶନ କରିଥାଏ । ପ୍ରିମିଆ ଯନ୍ତ୍ରଗୁଡ଼ିକ ଉଚ୍ଚାରଣ ବିକଳ୍ପଗୁଡ଼ିକୁ ପ୍ରଦର୍ଶନ କରିପାରେ - ତୁଳନା କରିବା ପାଇଁ ଗୋଟିଏ ନମୁନାକୁ ଲଗାନ୍ତୁ ।

SSML ସମର୍ଥନ ଯନ୍ତ୍ର ଦ୍ୱାରା ପରିବର୍ତ୍ତିତ ହୋଇଥାଏ । ବିରତି, ପ୍ରୋସୋଡି, ଏବଂ ଗୁରୁତ୍ୱପୂର୍ଣ୍ଣ ଟ୍ୟାଗଗୁଡ଼ିକ ଅଧିକାଂଶ ପ୍ରିମିଆ ଯନ୍ତ୍ର ଏବଂ କିଛି ସ୍ୱୟଂ- ହୋଷ୍ଟ ହୋଇଥିବା ଉପରେ ସମ୍ମାନିତ ହୋଇଥାଏ । ସାଦା ପାଠ୍ୟ ସବୁବେଳେ କାମ କରେ - କୌଣସି ମାର୍କଅପ ଆବଶ୍ୟକ ନାହିଁ ।

/v1/tts/ API endpoint ମାଧ୍ୟମରେ stream=true ସହିତ ପ୍ରିମିଆ ଇଞ୍ଜିନଗୁଡ଼ିକରେ ପ୍ରବାହିତ TTS ଉପଲବ୍ଧ ଅଛି। ଏହି ପୃଷ୍ଠାରେ ୱେବ UI ଗୋଟିଏ ରେଣ୍ଡରିଂ ସମାପ୍ତ ହେବା ପରେ ସମ୍ପୂର୍ଣ୍ଣ କଲିପକୁ ଫେରାଇଥାଏ।

StyleTTS 2 ଆମର ନିଜ GPUs ଉପରେ ଚାଲୁଛି। ଜନ୍ମ ପ୍ରଥମେ ଆପଣଙ୍କର ଦୈନିକ ମୁକ୍ତ ପୁଲରୁ ଆଣେ। ଏକଥର ଖାଲିହେବା ପରେ, ପଇସା ଦେଇ ଟୋକନଗୁଡ଼ିକ $5 → 200,000 ଟୋକନଗୁଡ଼ିକରେ ଆରମ୍ଭ ହୁଏ। ପାଖାପାଖି ~5 ଟୋକନ ପ୍ରତି ଅକ୍ଷର, ସର୍ବନିମ୍ନ 100 ପ୍ରତି କଲିପ।

ୱେବ UI ଉପରେ ପ୍ରତି ଅନୁରୋଧରେ 5,000 ଅକ୍ଷର ପର୍ଯ୍ୟନ୍ତ। ଲମ୍ବା ଅଂଶଗୁଡ଼ିକ ପାଇଁ (ଧ୍ୱନି ପୁସ୍ତକ, ସମ୍ପୂର୍ଣ୍ଣ ଅଧ୍ୟାୟଗୁଡ଼ିକ), /voice/audiobook/ କୁ ବ୍ୟବହାର କରନ୍ତୁ ଯାହାକି ସ୍ୱୟଂଚାଳିତ ଭାବରେ ଚୁମ୍ବକ ଏବଂ ଷ୍ଟିଚକୁ ବା API କୁ ଗୋଟିଏ ଲୁପରେ ଡାକନ୍ତୁ।

ହଁ - /v1/tts/batch/ କୁ ବାକ୍ୟଖଣ୍ଡଗୁଡ଼ିକର ଗୋଟିଏ ତାଲିକା POST କରନ୍ତୁ, କିମ୍ବା /workspace/ ରେ TTS କୁ ଲମ୍ବା ପାଇପଲାଇନରେ ଚେନ୍ କରିବା ପାଇଁ କାର୍ଯ୍ୟସ୍ଥଳ UI କୁ ବ୍ୟବହାର କରନ୍ତୁ (ଯେପରିକି, ଅନୁବାଦ କରନ୍ତୁ → କହିବା → ଷ୍ଟିଚ)।

ହଁ - /v1/tts/ କୁ POST ପାଠ୍ୟ ମଡେଲ="StyleTTS 2" ସହିତ (ଅଥବା ଏହି ପୃଷ୍ଠାରେ slug) । WAV କିମ୍ବା MP3 ଫେରାଇଥାଏ । ସମ୍ପୂର୍ଣ୍ଣ ସଂଯୋଗ + SDK ସ୍ନିପେଟଗୁଡ଼ିକ ପାଇଁ /api/ କୁ ଦେଖନ୍ତୁ ।

ଏହି ପୃଷ୍ଠାଟି ପାଠ୍ୟ-ରୁ-ବାକ୍ୟ, ସ୍ୱର କ୍ଲୋନିଂ ନୁହେଁ - ସ୍ୱର ଯନ୍ତ୍ରର ପୂର୍ବନିର୍ଦ୍ଧାରିତ। ସ୍ୱର କ୍ଲୋନିଂ ପାଇଁ (ସଂକେତ ଧ୍ୱନିକୁ ଅପଲୋଡ କରିବା), /voice/clone/କୁ ଦେଖନ୍ତୁ, ଯାହାକି ଆପଣଙ୍କୁ ବାକ୍ୟ ଅଧିକାରର ମାଲିକ କିମ୍ବା ସ୍ପଷ୍ଟ ଲିଖିତ ଅନୁମତି ଆବଶ୍ୟକ କରେ।

ସ୍ୱୟଂ-ହୋଷ୍ଟ ଇଞ୍ଜିନଗୁଡ଼ିକ Free.ai-ସମ୍ପାଦିତ GPUs ଉପରେ ଚଲାଇଥାଏ; ଆମ ସର୍ଭରଗୁଡ଼ିକରୁ କିଛି ବି ଛାଡିଯାଏ ନାହିଁ। ପ୍ରିମିଆ ଇଞ୍ଜିନଗୁଡ଼ିକ ପାଠ୍ୟକୁ ଆମ DPA ଅଧୀନରେ ଉପରମୁହାଣ ମଡେଲ ପ୍ରଦାନକାରୀମାନଙ୍କୁ ପଠାଇଥାଏ। ଆମେ ଆପଣଙ୍କର ନିବେଶ ଉପରେ ପ୍ରଶିକ୍ଷଣ କରୁନୁ ଏବଂ ତଥ୍ୟ ବିକ୍ରି କରୁନୁ।

ହଁ - Free.ai ଉତ୍ପନ୍ନ ଧ୍ୱନିର ବାଣିଜ୍ୟିକ ବ୍ୟବହାରକୁ ଅନୁମତି ଦେଇଥାଏ। ଇଞ୍ଜିନର ଆଧାର ଲାଇସେନ୍ସ (Apache 2.0, MIT, କିମ୍ବା ବିକ୍ରେତା ଶବ୍ଦଗୁଡ଼ିକ) ଉପର ଏବଂ ଆକାର ଅନୁସରଣ ପୃଷ୍ଠାରେ ଦର୍ଶାଯାଇଛି; ପ୍ରୟୋଗରେ ଏହାର ଅର୍ଥ ହେଉଛି ଭାଷା, ବିଜ୍ଞାପନ, ପୋଡକାଷ୍ଟ, ଏବଂ ଆପଲେଟଗୁଡ଼ିକ ସମସ୍ତେ ପରିସରରେ ଅଛି।

ହଁ - ବିଫଳ କାର୍ଯ୍ୟଗୁଡ଼ିକୁ ଉତ୍ସକୁ ସ୍ୱୟଂଚାଳିତ ଭାବରେ ପୁନଃସ୍ଥାପନ କରନ୍ତୁ (ଦିନକୁ ପୁଲ କିମ୍ବା ପଇଠ କରାଯାଇଥିବା ଟୋକନଗୁଡ଼ିକ)। ଯଦି ଗୋଟିଏ ପୁନଃସ୍ଥାପନ ସେହି ଦିନରେ ଦେଖାଯାଉନାହିଁ, ଇମେଲ କରନ୍ତୁ contact@free.ai।

Free.ai କୁ ଭଲପାଅ? ଆପଣଙ୍କ ବନ୍ଧୁମାନଙ୍କୁ କହିଦିଅନ୍ତୁ!

ଏହି ପୃଷ୍ଠାକୁ ଆକଳନ କରନ୍ତୁ