faster-whisper large-v3-turbo

Free.ai (self-hosted) · stt · ~500 tokens per minute

Thổi xuống một tập tin âm thanh hoặc video, hoặc dán URL dưới đây

~500 tokens per minute

faster-whisper large-v3-turbo là a mô hình nói- thành- văn bản được xây bởi OpenAI / SYSTRAN. Đứng đầu là Accurate transcription. Tự lưu trữ trên Free.ai GPU — chạy miễn phí đối với hồ token hàng ngày của bạn (500 tokens mỗi phút). Phát hành dưới MIT - sử dụng thương mại được phép trên Free.ai.

Dùng qua API

API REST tương thích OpenAI. Tạo một chìa khóa và gọi mô hình này trong vài giây.

curl -X POST https://api.free.ai/v1/stt/ \
  -H "Authorization: Bearer sk-free-..." \
  -H "Content-Type: application/json" \
  -d '{"model":"whisper","audio_url":"https://..."}'
Tài liệu API Nhập khóa API

Câu hỏi thường gặp

faster-whisper large-v3-turbo chuyển âm thanh nói thành văn bản. Tải lên một tập tin MP3, WAV, M4A, hoặc video và faster-whisper large-v3-turbo sẽ trả lại bản dịch đầy đủ cộng thêm phụ đề SRT/ VTT tùy chọn với dấu thời gian.

faster-whisper large-v3-turbo handles dozens of languages - Whisper-family models cover 90+, others vary. Pick "auto-detect" or specify the language for highest accuracy.

Tỷ lệ lỗi từ là 5- 10% trên âm thanh tiếng Anh sạch, 10- 20% trên âm thanh ồn ào hoặc có giọng điệu. Các biến thể lớn của cùng một kiến trúc làm tốt hơn đáng kể trên các trường hợp khó - chọn lớn hơn khi âm thanh thô ráp.

Có - mỗi đoạn bao gồm dấu thời gian bắt đầu/ kết thúc. Xuất dạng SRT hoặc VTT và thời gian được vẽ trực tiếp vào đoạn phim.

faster-whisper large-v3-turbo chạy trên GPU của chúng tôi trước khi chạy trên máy chủ miễn phí hàng ngày của bạn; $5 → 200,000 token trả sau đó. Khoảng ~500 token mỗi phút.

MP3, WAV, M4A, FLAC, OGG, plus video (MP4, MOV, WebM) - chúng tôi sẽ nén âm thanh. Hơn 500 MB mỗi lần tải lên. Tập tin dài hơn? Đổi tên bằng /audio/cut/ hoặc dùng /v1/stt/batch/.

Diarization của người nói là một bước riêng biệt - chuyển đổi "diarize" trên /transcribe/. faster-whisper large-v3-turbo xử lý phiên dịch; diarization đánh dấu mỗi phân đoạn với Người nói 1 / Người nói 2 / v.v.

Có - / batch / chấp nhận thư mục tập tin âm thanh. Mỗi bản ghi sẽ được lưu trong / account /? tab=history với tên tập tin gốc. Để bảo tồn cây thư mục, dùng API.

Có - POST âm thanh của bạn vào /v1/stt/transcribe/ với model="faster-whisper large-v3-turbo". Trả lại JSON với văn bản + phân đoạn + dấu thời gian ở cấp từ. /api/ có tham chiếu đầy đủ.

Các mô hình tự chủ giữ âm thanh trên GPU của chúng tôi; cao cấp đi qua với DPA. Âm thanh bị xóa sau cửa sổ chia sẻ (24h anon, 7d đăng nhập). Chúng tôi không huấn luyện vào đầu vào của bạn.

Có - Free.ai cho phép sử dụng thương mại các bản ghi âm. Bạn cần phải có quyền cho âm thanh bạn tải lên (bản ghi của chính bạn, tài liệu được cấp phép, hoặc nội dung được chấp thuận).

Hiệu suất thời gian thực là khoảng 0.05–0.2× — một podcast 60 phút được phiên âm trong 3–12 phút. Các mẫu Premium thường kết thúc nhanh hơn. Dùng nút xếp hàng để đóng thẻ.

Cậu yêu Free.ai?

Đánh giá trang này