MeloTTS

Free.ai (self-hosted) · tts · ~500 الرموز لكل clip · 4.6 من 5 المستخدمون في هذه الفئة
~500 الرموز لكل clip

MeloTTS هو a النص إلى صوت الذي بنته MyShell. أقوى في Multilingual TTS. استضافة ذاتية على Free.ai GPUs — يعمل مجانا ضد مجمع الرموز اليومية (500 tokens لكل مقطع). تم إصداره تحت MIT - الاستخدام التجاري مسموح به تحت Free.ai.

الاستخدام عن طريق رابطة البرمجيات المشتركة

API REST متوافق مع OpenAI. تولد مفتاحاً وتدعو هذا النموذج في ثوانٍ.

curl -X POST https://api.free.ai/v1/tts/ \
  -H "Authorization: Bearer sk-free-..." \
  -H "Content-Type: application/json" \
  -d '{"model":"melotts","text":"hello world"}'
وثائق API الحصول على مفتاح API

الأسئلة المتكررة

يدعم MeloTTS مجموعة واسعة من اللغات. القائمة الدقيقة تعتمد على المحرك؛ النموذج على هذه الصفحة يقبل أي نص والمحرك سيعرض في لغاته المدعومة. انظر / voice / لاختيار كامل متعدد المحركات إذا كنت بحاجة إلى لغة محددة.

معظم المحركات تقوم بعرض إنجليزية أمريكية محايدة بشكل افتراضي ولغات مناسبة للمنطقة للغات غير الإنجليزية. المحركات العالية قد تكشف عن متغيرات لهجة - لصق عينة للمقارنة.

يختلف دعم SSML حسب المحرك. يتم احترام علامات التوقف، والصوت، والتأكيد على معظم المحركات العالية الجودة وعلى عدد قليل من المحركات المستضافة ذاتياً. يعمل النص البسيط دائماً - لا توجد علامات مطلوبة.

تدفق TTS متاح على محركات عالية الجودة من خلال / v1 / tts / API نقطة نهاية مع stream=true.

MeloTTS يجري على وحدات المعالجة المركزية الخاصة بنا. التوليد يستمد من مجمعك اليومي المجاني أولاً. بمجرد أن تنفد، الرموز المدفوعة تبدأ من $5 → 200,000 الرموز. تقريباً ~ 5 رموز لكل شخصية، الحد الأدنى 100 لكل مقطع.

يصل إلى 5000 كلمة لكل طلب على واجهة المستخدم الشبكية. وبالنسبة للقطع الأطول (كتب مسموعة، فصول كاملة)، استخدم /voice/audiobook/ الذي يقطع ويجمع تلقائيا، أو استدعاء API في حلقة.

نعم - POST قائمة من السلسلة إلى /v1/tts/batch/، أو استخدام واجهة المستخدم في مساحة العمل في /workspace/ لتسلسل TTS في خط أنابيب أطول (مثلا، ترجمة → تحدث → خيوط).

نعم - POST text to /v1/tts/ with model="MeloTTS" (or the slug on this page). returns WAV or MP3. See /api/ for full reference + SDK snippets.

هذه الصفحة هي نص إلى حديث، وليس استنساخ الصوت - الصوت هو المحرك الافتراضي. لاستنساخ الصوت (تحميل مرجع صوت)، انظر /voice/clone/، الذي يتطلب منك إما امتلاك حقوق الصوت أو الحصول على موافقة مكتوبة صريحة.

المحركات المستضافة ذاتياً تعمل على وحدات المعالجة المركزية المملوكة لـ Free.ai؛ ولا يخرج أي شيء من خوادمنا. المحركات العالية الجودة تنقل النص إلى مقدمي النماذج في المرحلة الأولى من التطوير في إطار اتفاقية البيانات الخاصة بنا.

نعم - Free.ai يمنح الاستخدام التجاري للصوت المولد. ترخيص المحرك الأساسي (Apache 2.0، MIT، أو شروط البائع) يظهر أعلى وعلى صفحة النموذج المرجعية؛ في الممارسة العملية، يعني هذا أن الصوتيات، والإعلانات، والبث، والتطبيقات كلها في النطاق.

نعم - الوظائف الفاشلة إعادة تلقائية إلى المصدر (المجمع اليومي أو الرموز المدفوعة). إذا لم يظهر رد في اليوم نفسه، بريد إلكتروني contact@free.ai.

أحب Free.ai؟ أخبر أصدقائك!

تقييم هذه الصفحة