Moonshine Base

Free.ai (self-hosted) · stt · ~500 الرموز لكل minute

إسقاط ملف صوت أو فيديو، أو لصق عنوان URL أدناه

~500 الرموز لكل minute

Moonshine Base هو a نموذج تحويل الكلام إلى نص الذي بنته Useful Sensors. أقوى في Low-latency live transcription, embedded devices.. استضافة ذاتية على Free.ai GPUs — يعمل مجانا ضد مجمع الرموز اليومية (500 tokens في الدقيقة). تم إصداره تحت MIT - الاستخدام التجاري مسموح به تحت Free.ai.

الاستخدام عن طريق رابطة البرمجيات المشتركة

API REST متوافق مع OpenAI. تولد مفتاحاً وتدعو هذا النموذج في ثوانٍ.

curl -X POST https://api.free.ai/v1/stt/ \
  -H "Authorization: Bearer sk-free-..." \
  -H "Content-Type: application/json" \
  -d '{"model":"moonshine-base","audio_url":"https://..."}'
وثائق API الحصول على مفتاح API

الأسئلة المتكررة

Moonshine Base يقوم بنسخ الصوت المنطوق إلى نص. قم بتحميل ملف MP3 أو WAV أو M4A أو فيديو وMoonshine Base يعيد النص الكامل بالإضافة إلى النصوص الجانبية الاختيارية SRT/VTT مع الأختام الزمنية.

Moonshine Base handles dozens of languages - Whisper-family models cover 90+, others vary. Pick "auto-detect" or specify the language for highest accuracy.

إن معدل أخطاء الكلمات هو 5-10% على الصوت الإنجليزي النظيف، و10-20% على الصوت المضطرب أو الملفت. والمتغيرات الكبيرة من نفس البنية تفعل بشكل أفضل بشكل ملموس في الحالات الصعبة - اختار أكبر عندما يكون الصوت قاسي.

نعم - كل جزء يتضمن بداية/نهاية الختم الزمني. تصدير ك SRT أو VTT وخريطة الزمن مباشرة على الفيديو الخاص بك.

Moonshine Base يجري على وحدات المعالجة المركزية الخاصة بنا ضد مجمعك اليومي المجاني أولاً؛ $5 → 200,000 الرموز المدفوعة بعد ذلك. حوالي ~ 500 الرموز في الدقيقة.

MP3, WAV, M4A, FLAC, OGG, plus video (MP4, MOV, WebM) — نقوم باستخراج الصوت. الحد الأقصى 500 ميغابايت لكل تحميل. الملفات الأطول؟ تقسيم مع /audio/cut/ أو استخدام /v1/stt/batch/.

معالجة المتحدث هي مرور منفصل - تبديل "diarize" على /transcribe/. Moonshine Base يتعامل مع النسخ؛ معالجة المتحدث تضع علامات على كل جزء مع المتحدث 1 / المتحدث 2 / إلخ.

نعم - /batch/ يقبل مجلد من الملفات الصوتية. كل نسخة تصل إلى /account/?tab=history مع اسم الملف الأصلي. لحفظ شجرة المجلد استخدم API.

نعم - ضع صوتك إلى /v1/stt/transcribe/ مع النموذج "Moonshine Base". يعيد JSON مع النص + الأجزاء + كلمة مستوى الختم الزمني. /api/ لديها المرجع الكامل.

النماذج المستضافة ذاتياً تحتفظ بالصوت على وحدات المعالجة المركزية الخاصة بنا؛ وتمر الرسوم العالية عبر DPA. ويتم حذف الصوت بعد نافذة المشاركة (24 ساعة من دون تسجيل، 7 أيام من التسجيل).

نعم - Free.ai يمنح الاستخدام التجاري للنصوص. أنت بحاجة إلى حقوق على الصوت الذي قمت بتحميل (تسجيلك الخاص، المواد المرخصة، أو المحتوى مع الموافقة).

عامل الوقت الحقيقي هو حوالي 0.05-0.2× - 60 دقيقة بث نسخ في 3-12 دقيقة. النماذج العالية غالبا ما تنتهي أسرع. استخدم زر الصف لإغلاق العلامة.

أحب Free.ai؟ أخبر أصدقائك!

تقييم هذه الصفحة