MMAudio v2 (video→audio)
Free.ai
·
audio
·
~500 الرموز لكل clip
MMAudio v2 (video→audio) هو a نموذج الذكاء الاصطناعي. تم توجيهها من خلال نماذج خارجية - ~500 tokens لكل استخدام (50% mark-up over upstream cost).
الاستخدام عن طريق رابطة البرمجيات المشتركة
REST API متوافق مع OpenAI. تولد مفتاحاً وتدعو هذا النموذج في ثوانٍ.
curl -X POST https://api.free.ai/v1/music/generate/ \
-H "Authorization: Bearer sk-free-..." \
-H "Content-Type: application/json" \
-d '{"model":"premium/mmaudio-v2","prompt":"your prompt here"}'
وثائق API
الحصول على مفتاح API
الأسئلة المتكررة
MMAudio v2 (video→audio) يولد تأثيرات صوتية قصيرة وصوت محيط من نص أو مرجع فيديو. خطوات، المطر، الآلات، صوت مخلوقات فضائية - يصف الصوت وMMAudio v2 (video→audio) يقوم بتوليفه.
عادة ما تتراوح من 1 إلى 22 ثانية اعتمادا على المحرك.المسارات المحيطة القابلة للدوران يمكن تمديدها باستخدام /audio/loop/.
نعم — محركات الفيديو إلى صوت مثل MMAudio v2 تقرأ إطارات من الفيديو الخاص بك وتقوم بتصنيع مسار صوت مطابق (خطوات عندما تتحرك الأقدام، رشقات عندما تضرب المياه).
WAV تلقائياً. MP3 متاح في خيار الشكل.
MMAudio v2 (video→audio) هو نموذج صوت أعلى جودة. حوالي ~1,000-5,000 رموز لكل مقطع، يظهر مباشرة قبل أن تقوم بإنشاءه. الصوت المستضاف ذاتيًا يعمل مجانًا على مجمعك اليومي من الرموز البالغ 30,000؛ النماذج الأعلى جودة هي مدفوعة حسب الاستخدام، مع إعادة الشحن من $1.
هذه النماذج هي مصممة للتأثيرات الصوتية + فولي، وليس الموسيقى. للموسيقى الموسيقية أو مسارات الصوت انظر /music/ حيث MusicGen، ACE-Step، Stable Audio تتعامل مع هذه الحالة.
نعم — الطلب وصفي (اصف الصوت، لا الكلمات)، لذا فإن أي لغة تعمل ما دام النموذج يفهمها، واللغة الإنجليزية تعطي أكثر النتائج اتساقاً.
نعم - /batch/ يقبل قائمة من الطلبات. كل مقطع يقع في /account/?tab=history. API هو الطريق الأكثر مرونة للحفاظ على شجرة المجلد.
نعم — POST إلى /v1/audio/generate/ مع model="MMAudio v2 (video→audio)" وطلبك (أو الفيديو للمحركات v2a). /api/ لديها المرجع الكامل.
نفس السياسة التي تتبعها بقية Free.ai — استضافة ذاتية على وحدات المعالجة الرسومية الخاصة بنا ، مكافأة مع DPA ، تنتهي صلاحية التحميلات في الجدول الزمني لنافذة المشاركة.
نعم - Free.ai يمنح الاستخدام التجاري للصوت المولد لتصميم صوت الألعاب، والأفلام، والبرامج الصوتية، والإعلانات.
5 إلى 30 ثانية لكل مقطع. الترجمة من الفيديو إلى الصوت تستغرق وقتاً أطول (بالتناسب مع طول الفيديو). استخدم زر الصف في /audio/ لإغلاق العلامة.