Distil-Whisper large-v3

Free.ai (self-hosted) · stt · ~500 ટોકન પ્રતિ minute

ઓડિયો અથવા વિડીયો ફાઇલ મૂકો, અથવા URL નીચે ચોંટાડો

~500 ટોકન પ્રતિ minute

Distil-Whisper large-v3 એ a ભાષણ-થી-લખાણ મોડેલ છે, HuggingFace દ્વારા બનાવેલ છે. Real-time transcription, large-volume batch STT. પર સૌથી મજબૂત. Free.ai GPUs પર સ્વયં-હોસ્ટ થયેલ — તમારા રોજિંદા ટોકન પુલ (500 ટોકન મિનિટ) સામે મુક્ત રીતે ચાલે છે. MIT નીચે બહાર પાડવામાં આવ્યું - Free.ai પર વ્યવસાયિક ઉપયોગની પરવાનગી.

API વડે વાપરો

OpenAI-સુસંગત REST API. કી બનાવો અને સેકન્ડોમાં આ મોડેલને બોલાવો.

curl -X POST https://api.free.ai/v1/stt/ \
  -H "Authorization: Bearer sk-free-..." \
  -H "Content-Type: application/json" \
  -d '{"model":"distil-whisper-large-v3","audio_url":"https://..."}'
API દસ્તાવેજ API કી મેળવો

વારંવાર પૂછાતા પ્રશ્નો

Distil-Whisper large-v3 લખાણમાં બોલાયેલ ઓડિયોનું અનુવાદ કરે છે. MP3, WAV, M4A, અથવા વિડીયો ફાઈલ અપલોડ કરો અને Distil-Whisper large-v3 સમયસમાપ્તિ સાથે વૈકલ્પિક SRT/VTT ઉપશીર્ષકો સાથે સંપૂર્ણ અનુવાદ પાછો આપે છે.

Distil-Whisper large-v3 handles dozens of languages - Whisper-family models cover 90+, others vary. Pick "auto-detect" or specify the language for highest accuracy.

શબ્દ-ક્ષતિ દર સાફ અંગ્રેજી ઓડિયો પર ૫-૧૦% છે, ઊંઘતા અથવા અવાજો સાથેના ઓડિયો પર ૧૦-૨૦% છે. એ જ આર્કિટેક્ચરની મોટી આવૃત્તિઓ હરકતના કિસ્સામાં અર્થપૂર્ણ રીતે સારી રીતે કરે છે - જ્યારે ઓડિયો કઠિન હોય ત્યારે મોટું પસંદ કરો.

હા - દરેક સેગમેન્ટ શરૂઆત/અંત સમયસમાપ્તિઓ સમાવે છે. SRT અથવા VTT તરીકે નિકાસ કરો અને સમય મેપ તમારા વિડિયો પર સીધો જાઓ.

Distil-Whisper large-v3 તમારા દિવસભરના મુક્ત પુલ સામે પહેલા અમારા પોતાના GPUs પર ચલાવે છે; $5 → 200,000 ચૂકવેલ ટોકન પછી. મિનિટમાં ~500 ટોકન વિશે.

MP3, WAV, M4A, FLAC, OGG, વીડિયો (MP4, MOV, WebM) - અમે ઓડિયો કાઢી નાંખીએ છીએ. અપલોડ પર મહત્તમ ૫૦૦ MB. લાંબી ફાઈલો? /audio/cut/ સાથે વિભાજીત કરો અથવા /v1/stt/batch/ વાપરો.

સ્પીકર ડાયરીકરણ અલગ પાસવર્ડ છે - /transcribe/ પર "diarize" બદલો. Distil-Whisper large-v3 લખાણને સંભાળે છે; ડાયરીકરણ સ્પીકર ૧ / સ્પીકર ૨ / વગેરે સાથે દરેક સેગમેન્ટને લેબલ કરે છે

હા - /batch/ ઓડિયો ફાઇલોના ફોલ્ડરને સ્વીકારે છે. દરેક ટ્રાન્સક્રિપ્ટ મૂળભૂત ફાઇલનામ સાથે /account/?tab=history માં સ્થિત થાય છે. ફોલ્ડર-ટ્રી સંગ્રહ માટે API વાપરો.

હા - મોડેલ="Distil-Whisper large-v3" સાથે /v1/stt/transcribe/ માં તમારો ઓડિયો POST કરો. લખાણ + સેગમેન્ટ્સ + શબ્દ-સ્તર સમયસૂચકો સાથે JSON પાછું આપે છે. /api/ એ સંપૂર્ણ સંદર્ભ છે.

સ્વયં-હોસ્ટ કરેલ મોડેલો અમારા GPUs પર ઓડિયો રાખે છે; પ્રીમિયમ DPA સાથે પસાર થાય છે. ઓડિયો વહેંચણી-વિન્ડો પછી કાઢી નાંખવામાં આવે છે (24h anoin, 7d sign-in). અમે તમારા ઇનપુટ પર તાલીમ આપતા નથી.

હા - Free.ai ટ્રાન્સક્રિપ્ટનો વાણિજ્યિક ઉપયોગ પ્રદાન કરે છે. તમારે ઓડિયો માટે અધિકારો જરૂરી છે કે જે તમે અપલોડ કર્યા છે (તમારી પોતાની રેકોર્ડિંગ, લાઇસન્સ થયેલ સામગ્રી, અથવા સંમતિ સાથે સમાવિષ્ટો).

વાસ્તવિક સમય ઘટક લગભગ 0.05-0.2× છે - 60-મિનિટ પોડકાસ્ટ 3-12 મિનિટમાં ટ્રાન્સક્રિપ્ટ કરે છે. પ્રીમિયમ મોડેલો ઘણીવાર ઝડપથી સમાપ્ત થાય છે. ટેબ બંધ કરવા માટે કતાર બટનનો ઉપયોગ કરો.

Free.ai પ્રેમ કરો? તમારા મિત્રોને કહો!

આ પાનાંને દર આપો