StyleTTS 2

Free.ai (self-hosted) · tts · ~500 Ama-token ngalinye clip · 4.6 kusuka 5 Abasebenzisi balolu hlu
~500 Ama-token ngalinye clip

StyleTTS 2 yi an umsindo wokubhala-kuya-kwesikhulumi eyenziwe ngu Yinghao Aaron Li. Onamandla kakhulu ku-Voice cloning without training data; expressive multilingual speech.. I-self-hosted ku-Free.ai GPUs - isebenza ngokukhululekile ngaphezu kwe-token pool yakho yansuku zonke (500 tokens isiqephu ngasinye). Kukhishwa ngaphansi kwe-MIT - ukusetshenziswa kokuthengiswayo kuvunyelwe ku-Free.ai.

Imibuzo ebuzwa kaningi

StyleTTS 2 isekela ubukhulu obubanzi bezinhlamvu. Uhlu oluphelele luyahlukana ngenjini; ifomu kulekhasi livuma noma yiluphi ubhalo futhi i-engine izoveza ngezinhlamvu zayo ezixhasiwe. Bona /voice/ ukukhethwa kwe-engine eminingi egcwele uma ufuna ulwimi oluthile.

Injini eziningi zinikeza i-American English engekho emthethweni ngokuzenzakalela kanye nendawo efanele yendawo ye-English. Injini eziphezulu zingaveza izilinganiso ze-accent - chofoza isibonelo ukulinganisa.

SSML insizakalo ihluka ngenjini. Ukuphumula, i-prosody, kanye ne-emphasis tags zihlonishwa kuningi kwama-premium engines kanye namanye ama-hosted self. Umbhalo ocacile usebenza njalo - akukho uphawu oludingayo.

Ukusakazwa kwe-TTS kutholakala kuma-premium engines nge /v1/tts/ API endpoint nge stream=true. I-web UI kule khasi ibuyisela i-clip ephelele uma ukusakazwa kuqediwe.

StyleTTS 2 isebenza ku-GPUs yethu. Uhlobo luqala kusuka ku-pool yakho yamahhala yansuku zonke. Uma kuqediwe, ama-token akhokhelwa aqala ku-$5 → 200,000 ama-token. Kunzima ~5 ama-token ngamagama, okuncane 100 nge-clip.

Kuze ku-5,000 izibonakaliso ngesicelo ngasinye kwi-web UI. Ukusebenzisa amathuluzi abanzi (amabhuku omsindo, amasigaba agcwele), sebenzisa /voice/audiobook/ owenza ama-chunks futhi agqoke ngokuzenzakalela, noma thinta i-API emlonyeni.

Yebo - ITHOLA uhlu lwama-strings ku /v1/tts/batch/, noma sebenzisa indawo yokusebenzela UI ku /workspace/ ukudlulisa i-TTS ku-pipeline ende (isibonelo, guqula → khuluma → stitch).

Yebo - ITHOLA umbhalo ku /v1/tts/ ngemodeli "StyleTTS 2" (noma i-slug kulekhasi). Ibuyisela i-WAV noma i-MP3. Bona /api/ ukubhekisa okugcwele + ama-SDK snippets.

Lekhasi liyi-text-to-speech, hhayi ukuklonya umsindo - umsindo yi-engine's default. Ukuklonya umsindo (ukulayisha umsindo obhekiswe kuwo), bona /voice/clone/, okudinga ukuthi ube nelungelo lokukhuluma noma ube negunya elibhalwe ngaphambili.

Ama-engine ahlala asebenza ngeFree.ai-owned GPUs; akukho okushiya amaseva ethu. Ama-engine aphezulu adlulisa umbhalo kuma-upstream model providers ngaphansi kwe-DPA yethu. Sizoqeqesha ngemingeniso yakho futhi asithengi idatha.

Yebo - Free.ai inikeza ukusetshenziswa komphakathi kwesandi esikhiqizwe. Ilayisense eliphansi lenjini (Apache 2.0, MIT, noma imithetho yomthengisi) libonisa phezulu futhi kukhasi lo referensi lemodeli; ngokuya ngenqubo lokhu kusho ukuthi i-voiceovers, izikhangiso, amapodcasts, nama-apps wonke atholakala ngaphakathi kwe-scope.

Yebo - imisebenzi engaphumelelanga ibuyiselwa ngokuzenzakalela emthonjeni (i-pool yansuku zonke noma ama-token akhokhelwe). Uma ubuyiselo olungabonakali ngosuku olufanayo, thumela i-imeyili contact@free.ai.

Uthando Free.ai? Uthi abangane bakho!

Linganisa lelikhasi