StyleTTS 2

Free.ai (self-hosted) · tts · ~500 символи за clip · 4.6 от 5 потребители от тази категория
~500 символи за clip

StyleTTS 2 е a Текст-то-пейчов глас, построен от Yinghao Aaron Li. Най-силно в Voice cloning without training data; expressive multilingual speech.. Самоу домакин на Free.ai GPU — тече свободен срещу ежедневния си резервоар за жетони (500 žeтони за изрезване). Освободен под MIT - търговска употреба разрешена на Free.ai.

Често задавани въпроси

StyleTTS 2 поддържа широка гама от езиците. Точният списък зависи от двигателя; формата на тази страница приема всеки текст и двигателят ще излъчи на поддържаните си езици. Виж /voice/ за пълния многодвигателен избирател, ако се нуждаете от определен език.

Повечето двигатели правят неутрален американски английски по подразбиране и регион-подходящ акцент за не-английски език. Премиум двигатели могат да изложат нагласи варианти - вставете проба за сравнение.

SSML подкрепа варира от двигателя. Пауза, прозоди и акцент етикети се уважават на повечето премиумни двигатели и на няколко самостоятелни. Обикновеният текст винаги работи - не се изисква маркиране.

Преминаването на TTS е на разположение на премиум двигатели чрез точката /v1/tts/ API с поток=истина. Web UI на тази страница връща пълния клип след преработване на финиш.

StyleTTS 2 работи на собствените си GPUs. Генерирането извлича от вашия дневен свободен басейн първо. След като изчерпани, плащаните жетони започват с $ 5 → 200 000 жетона. Грубо ~5 жетони на символ, минимум 100 на клип.

До 5000 символа на запитване в уеб компютъра. За по-дълги части (аудиокниги, пълни глави), използвайте /voice/audiobook / които парчета и шевове автоматично, или се обадите на API в запетая.

Да - POST списък на струните на /v1/tts/batch /, или използвайте работен UI на /workspace/ на верига TTS в по-дългопровод (напр., превежда → говори → шев).

Да - текстът на POST до /v1/tts/ с модел="StyleTTS 2" (или куршума на тази страница). Връща WAV или MP3. Виж /api/ за пълно справочно + SDK щипчета.

Тази страница е текст-то-пис, а не гласово клониране - гласът е по подразбиране на двигателя. За клониране на глас (зареждане на референтен звук), вижте /voice/klone /, което изисква от вас да притежавате правата на глас или да имате изрично писмено съгласие.

Самоуправляващи двигатели, работещи на GPU, притежавани от Free.ai; нищо не напуска сървърите ни. Премиум двигатели прехвърлят текст на доставчиците на модели нагоре по DPA. Ние не тренираме на входа ви и не продаваме данни.

Да - Free.ai предоставя търговска употреба на генерирани аудио. Основният лиценз на двигателя (Apache 2.0, MIT, или условия на доставчика) е показан по-горе и на референтната страница на модела; на практика това означава гласово преглеждане, реклами, подкасти и приложения са всички в скептури.

Да — провалени работни места за автовъзстановяване на източника (дневен басейн или платени жетони). Ако възстановяването не се появи в същия ден, e-mail contact@free.ai.

Love Free.ai? Tell your friends!

Оцени тази страница