StyleTTS 2

Free.ai (self-hosted) · tts · ~500 Token pro clip · 4.6 vun 5 Benotzer vun dëser Kategorie
~500 Token pro clip

StyleTTS 2 is a Text-zu-Sprooch-Stëmm built by Yinghao Aaron Li. Strongest at Voice cloning without training data; expressive multilingual speech.. Self-hosted on Free.ai GPUs — runs free against your daily token pool (500 tokens pro Clip). D'Lizenz ass ënner der MIT publizéiert ginn, déi op Free.ai autoriséiert ass.

Häufig gestallte Froen

StyleTTS 2 ënnerstëtzt eng grouss Zuel vu Sproochen. D' genau Lëscht hänkt vum Motor of; d' Formulaire op dëser Säit akzeptéiert all Text an de Motor wäert an de ugepasste Sproochen renderen. Kuckt / voice / fir d' voll Multi-Motor Auswiel wann Dir eng spezifesch Sprooch braucht.

D' meescht Motoren renderéieren standardméisseg neutralt amerikanescht Englesch an e regional passenden Akzent fir net- englesch Sproochen. Premium Motoren kënnen Akzentvarianten ausléisen - fügt e Beispill fir ze vergläichen.

D'SSML-Unterstützung ass jee no Motor ënnerschiddlech. Pause, Prosody an Emphasis Tags ginn op de meeschte Premiummotoren an op e puer selwer gehosten Motoren respektéiert. Plain Text funktionnéiert ëmmer - keng Markup néideg.

D'Streaming TTS ass op Premium-Enginen iwwer den /v1/tts/ API Endpoint mat stream=true verfügbar. D'Web-Benotzerinterface op dëser Säit gëtt de komplette Clip zréck, wann d'Renderen ofgeschloss ass.

StyleTTS 2 leeft op eise GPUen. D'Generatioun zielt zuerst aus Ärem gratis Pool. Wann et erschöpft ass, fänken d'bezuelte Token un bei $5 → 200.000 Token. Ongeféier ~5 Token pro Zeichen, mindestens 100 pro Clip.

Bis zu 5.000 Zeichen pro Ufro op der Web-UI. Fir méi laang Stécker (Audiobicher, ganz Kapitelen), benotzt /voice/audiobook/, dat automatesch Stécker a Stécker zesummesetzt, oder rufft d'API an enger Schleif op.

Yes - POST a list of strings to /v1/tts/batch/, or use the workspace UI at /workspace/ to chain TTS into a longer pipeline (e.g., translate → speak → stitch).

Ja - POST Text op /v1/tts/ mat model="StyleTTS 2" (oder den Slug op dëser Säit). Gitt WAV oder MP3 zréck. Kuckt /api/ fir déi komplett Referenz + SDK Schnëtt.

Dës Säit ass Text-zu-Sprooch, net Sproochklonen - d'Sprooch ass d'Standard-Modul. Fir Sproochklonen (eng Referenz-Audio-Datei erofzelueden), kuckt /voice/clone/, fir dat musst Dir entweder d'Sproochrechter hunn oder eng explizit schreiwelch Zoustëmmung hunn.

Self-hosted Engines lafen op Free.ai-eigenen GPUen; näischt verléisst eis Server. Premium Engines ginn Text un Upstream Modell Provider ënner eisem DPA. Mir trainéieren net op Är Inputen an verkafen keng Daten.

Ja - Free.ai erlaabt kommerziell Benotzung vum generéierten Audio. D'Lizenz vun der Engine (Apache 2.0, MIT oder Verkeeferbedingungen) ass uewen an op der Modellreferenzsäit gewisen; an der Praxis bedeit dat Voiceover, Annoncen, Podcasts an Apps sinn all am Spektrum.

Ja - verluer Aufgaben automatesch un d'Quell zréckginn (daglich Pool oder bezuelt Token). Wann eng Rückzahlung net den selwechten Dag erschéngt, schéckt eng E-Mail un contact@free.ai.

Liewe Free.ai? Erzielt Är Frënn!

Dës Säit bewäerten