faster-whisper large-v3-turbo

Free.ai (self-hosted) · stt · ~500 tags на minute

Скинути звуковий або відеофайл або вставити адресу URL нижче

~500 tags на minute

faster-whisper large-v3-turbo - це a Модель мовлення з тексту, побудований OpenAI / SYSTRAN. Найсильніший зекAccurate transcription. Self- host on Free.ai GPUs } безкоштовно йде проти вашого щоденного набору (500 _ на хвилину _). Випущено з MIT - комерційне використання на Free.ai.

Використовувати через API

Сумісний з OpenAI API REST. Створіть ключ і звантажте цю модель у секундах.

curl -X POST https://api.free.ai/v1/stt/ \
  -H "Authorization: Bearer sk-free-..." \
  -H "Content-Type: application/json" \
  -d '{"model":"whisper","audio_url":"https://..."}'
Документація API Отримати ключ API

Часті запитання

faster-whisper large-v3-turbo transes вимовлений звук буде записано у текст. Вивантажити субтитри MP3, WAV, M4A або відеофайл і faster-whisper large-v3-turbo повертає повний архів плюс необов' язковий SRT/ VTT з часовими штампами.

faster-whisper large-v3-turbo handles dozens of languages - Whisper-family models cover 90+, others vary. Pick "auto-detect" or specify the language for highest accuracy.

Частота помилок слова 5- 10% на чистому звуковому звуковому звукові англійською, 10- 20% на шумному або акцентованому звуковому звукові. Великі варіанти однієї архітектури значно краще у складних випадках, якщо звук є грубим, виберіть більше.

Так, кожен сегмент містить часові штампи початку/ завершення. Експортувати як SRT або VTT і карту часу безпосередньо на відео.

faster-whisper large-v3-turbo спершу працює на наших власних GPU з вашим щоденним басейном; 5 → 200 000 доларів оплачуються після цього. Близько $500 марок за хвилину.

MP3, WAV, M4A, FLAC, OGG, плюс відео (MP4, MOV, WebM) - ми витягуємо звук. Макс. 500 МБ на вивантаження. Довші файли? Розділити за допомогою / audio/cut / або скористатися / v1/ st/ batch /.

Діаресифікація мови - це окремий пропуск, - перемикання " diarize " на / trancess /. faster-whisper large-v3-turbo керує записом; розмінювання міток кожного сегменту за допомогою Douber 1 / speaker 2 / etc.

Так - / batch/ приймає теку звукових файлів. Кожен з записів буде записано у / account /? tab=історію з початковою назвою файла. Для збереження файлів з використанням каталогів скористайтеся API.

Так - POST ваш звуковий файл до / v1/ stt/ trancess / з моделем=" faster-whisper large-v3-turbo." Повертає JSON з текстом + відрізками слова + часовими штампами. / api / має повний довідник.

Самоутверджені моделі зберігають звукові дані у наших GPU; внесокний прохід за допомогою DPA. Звук буде вилучено після вікна спільного ресурсу (24h anon, 7d підписаних вами). Ми не тренуємо ваші вхідні дані.

Так - Free.ai надає комерційні права на використання трансляцій. Вам потрібні права на вивантажений вами звуковий запис (ваш власний запис, ліцензований матеріал або вміст з згідою).

Real-time factor is roughly 0.05-0.2× - a 60-minute podcast transcribes in 3-12 minutes. Premium models often finish faster. Use the queue button to close the tab.

Люблю заккFree.ai?

Оцінити цю сторінку