Distil-Whisper large-v3

Free.ai (self-hosted) · stt · ~500 ტოკენები minute

აუდიო ან ვიდეო ფაილის ჩამოგდება ან URL-ის ქვემოთ ჩასმა

~500 ტოკენები minute

Distil-Whisper large-v3 is a საუბარი-ტექსტი მოდელი built by HuggingFace. Strongest at Real-time transcription, large-volume batch STT.. Free.ai GPU-ზე — მუშაობს უფასოდ თქვენი ყოველდღიური ტოკენების ბაზის წინააღმდეგ (500 tokens წუთში). Free.ai-ზე გამოშვებული MIT-ის ქვეშ - კომერციული გამოყენება ნებადართულია.

API- ს გამოყენება

OpenAI- სთან თავსებადი REST API. გასაღების შექმნა და ამ მოდელის გამოძახება წამებში.

curl -X POST https://api.free.ai/v1/stt/ \
  -H "Authorization: Bearer sk-free-..." \
  -H "Content-Type: application/json" \
  -d '{"model":"distil-whisper-large-v3","audio_url":"https://..."}'
დოკუმენტაცია API კოდის მიღება

ხშირად დასმული კითხვებიName

Distil-Whisper large-v3 ხმამაღალი აუდიოს ტექსტად გადაწერს. MP3, WAV, M4A ან ვიდეო ფაილის ჩატვირთვა და Distil-Whisper large-v3- მა დააბრუნებს სრულ ტრანსკრიპციას და შესაძლებელ SRT/ VTT სუბტიტრებს დროის ნიშნებით.

Distil-Whisper large-v3 handles dozens of languages - Whisper-family models cover 90+, others vary. Pick "auto-detect" or specify the language for highest accuracy.

სიტყვების შეცდომის მაჩვენებელი 5-10% -ია სუფთა ინგლისურ აუდიოში, 10-20% -ია ხმაურიან ან აქცენტირებული აუდიოში. იგივე არქიტექტურის დიდი ვარიანტები უფრო მეტად ახერხებენ რთული შემთხვევების გაუმჯობესებას - აირჩიეთ უფრო დიდი, თუ აუდიო უხეშია.

დიახ - ყველა სეგმენტი შეიცავს დაწყების/დასრულების დროის ნიშნებს. ექსპორტი როგორც SRT ან VTT და დროის ნიშნები პირდაპირ თქვენს ვიდეოზე.

Distil-Whisper large-v3 მუშაობს ჩვენი GPU- ებზე თქვენი ყოველდღიური უფასო ბაზის წინააღმდეგ პირველად; $5 → 200,000 გადახდილი ტოკენები ამის შემდეგ. დაახლოებით ~500 ტოკენები წუთში.

MP3, WAV, M4A, FLAC, OGG, და ვიდეო (MP4, MOV, WebM) - აუდიოს ამოღება. მაქსიმალური 500 MB ერთ ჩატვირთვაზე. უფრო დიდი ფაილები? გაყოფა /audio/cut/-ით ან /v1/stt/batch/-ის გამოყენებით.

Speaker diarization is a separate pass - toggle "diarize" on /transcribe/. Distil-Whisper large-v3 handles the transcription; diarization labels each segment with Speaker 1 / Speaker 2 / etc.

დიახ - / batch / იღებს აუდიო ფაილების საქაღალდეს. ყოველი ტრანსკრიპცია ხვდება /account/? tab=history- ში ორიგინალური ფაილის სახელით. საქაღალდეების ხის შენარჩუნებისთვის გამოიყენეთ API.

Yes - POST your audio to /v1/stt/transcribe/ with model="Distil-Whisper large-v3". Returns JSON with text + segments + word-level timestamps. /api/ has the full reference.

თვით-დაფუძნებული მოდელები ხმას გრაფიკული პროცესორის საშუალებით იღებენ; პრემიუმ მოდელები DPA-ს საშუალებით იღებენ. ხმა წაიშლება გაზიარების ფანჯრის შემდეგ (24 საათი ანონსირებული, 7 დღე ჩართული). ჩვენ არ ვასწავლით თქვენს შეყვანას.

დიახ - Free.ai უფლებას გაძლევთ ტრანსკრიპტების კომერციული გამოყენება. თქვენ უნდა გქონდეთ აუდიოს უფლება, რომელიც თქვენ ჩატვირთეთ (თქვენი საკუთარი ჩანაწერი, ლიცენზირებული მასალა ან შენახვა ნებართვის გარეშე).

რეალური დროის ფაქტორი დაახლოებით 0.05-0.2× - 60 წუთიანი ვიდეო ჩანაწერი 3-12 წუთში იწერება. Premium მოდელი ხშირად უფრო სწრაფად მთავრდება. ჩანართის დახურვისთვის გამოიყენეთ რიგის ღილაკი.

ჲბთფაქ ლთ Free.ai?

ამ გვერდის შეფასება