StyleTTS 2

Free.ai (self-hosted) · tts · ~500 tokens per clip · 4.6 desde 5 usuarios de esta categoría
~500 tokens per clip

StyleTTS 2 es a voz de texto a voz construido por Yinghao Aaron Li. Más fuerte en Voice cloning without training data; expressive multilingual speech.. Auto-alojado en Free.ai GPUs — funciona gratis contra su piscina diaria de tokens (500 tokens por clip). Liberado bajo MIT - uso comercial permitido en Free.ai.

Preguntas frecuentes

StyleTTS 2 admite una amplia gama de idiomas. La lista exacta depende del motor; el formulario de esta página acepta cualquier texto y el motor se renderizará en sus idiomas soportados. Vea /voice/ para el selector multimotor completo si necesita un idioma específico.

La mayoría de los motores representan el inglés americano neutral por defecto y un acento apropiado para la región para idiomas no ingleses. Los motores premium pueden exponer variantes de acento - pegar una muestra para comparar.

El soporte SSML varía según el motor. Las etiquetas de pausa, prosodia y énfasis se honran en la mayoría de los motores premium y en algunos auto-anfitriones. El texto plano siempre funciona - no se requiere marcado.

La transmisión TTS está disponible en motores premium a través del punto final /v1/tts/ API con stream=true. La interfaz de usuario web de esta página devuelve el clip completo una vez que termina la renderización.

StyleTTS 2 se ejecuta en nuestras propias GPUs. Generación se extrae de su piscina gratuita diaria primero. Una vez agotado, tokens pagados comienzan en $5 → 200.000 tokens. Aproximadamente ~5 tokens por carácter, mínimo 100 por clip.

Hasta 5.000 caracteres por petición en la interfaz de usuario web. Para piezas más largas (audiolibros, capítulos completos), use /voice/audiobook/ que trozos y puntos automáticamente, o llame a la API en un bucle.

Sí - POST una lista de cadenas a /v1/tts/batch/, o utilizar la interfaz de usuario del espacio de trabajo en /workspace/ para encadenar TTS en una tubería más larga (por ejemplo, traducir → hablar → punto).

Sí - Mensaje de texto a /v1/tts/ con modelo="StyleTTS 2" (o la bala en esta página). Devuelve WAV o MP3. Vea /api/ para la referencia completa + fragmentos SDK.

Esta página es texto a voz, no clonación de voz - la voz es el valor predeterminado del motor. Para la clonación de voz (cargando un audio de referencia), véase /voice/clone/, que requiere que usted sea propietario de los derechos de voz o tenga consentimiento explícito por escrito.

Los motores auto-alojados funcionan con GPUs de Free.ai; nada sale de nuestros servidores. Los motores Premium pasan texto a los proveedores de modelos de arriba bajo nuestro DPA. No entrenamos en sus entradas y no vendemos datos.

Sí - Free.ai concede el uso comercial de audio generado. La licencia subyacente del motor (Apache 2.0, MIT, o términos del proveedor) se muestra arriba y en la página de referencia del modelo; en la práctica esto significa que las voces en off, anuncios, podcasts y aplicaciones están todas en el alcance.

Sí - trabajos fallidos auto-reembolso a la fuente (al día de la reserva o tokens pagados). Si un reembolso no aparece el mismo día, envíe un correo electrónico a contact@free.ai.

¿Ama a Free.ai? ¡Dile a tus amigos!

Calificar esta página