Fal Speech-to-Text

Free.ai · stt · ~500 tokens per minute

Thổi xuống một tập tin âm thanh hoặc video, hoặc dán URL dưới đây

~500 tokens per minute
Chạy miễn phí trên GPU của chúng tôi. Nâng cấp cho Fal Speech-to-Text →

Fal Speech-to-Text là a mô hình nói- thành- văn bản. Đường dẫn qua các mô hình bên ngoài - ~500 tokens mỗi phút (50% markup trên chi phí upstream).

Dùng qua API

API REST tương thích OpenAI. Tạo một chìa khóa và gọi mô hình này trong vài giây.

curl -X POST https://api.free.ai/v1/stt/ \
  -H "Authorization: Bearer sk-free-..." \
  -H "Content-Type: application/json" \
  -d '{"model":"premium/speech-to-text","audio_url":"https://..."}'
Tài liệu API Nhập khóa API

Câu hỏi thường gặp

Fal Speech-to-Text chuyển âm thanh nói thành văn bản. Tải lên một tập tin MP3, WAV, M4A, hoặc video và Fal Speech-to-Text sẽ trả lại bản dịch đầy đủ cộng thêm phụ đề SRT/ VTT tùy chọn với dấu thời gian.

Fal Speech-to-Text handles dozens of languages - Whisper-family models cover 90+, others vary. Pick "auto-detect" or specify the language for highest accuracy.

Tỷ lệ lỗi từ là 5- 10% trên âm thanh tiếng Anh sạch, 10- 20% trên âm thanh ồn ào hoặc có giọng điệu. Các biến thể lớn của cùng một kiến trúc làm tốt hơn đáng kể trên các trường hợp khó - chọn lớn hơn khi âm thanh thô ráp.

Có - mỗi đoạn bao gồm dấu thời gian bắt đầu/ kết thúc. Xuất dạng SRT hoặc VTT và thời gian được vẽ trực tiếp vào đoạn phim.

Fal Speech-to-Text là một máy phiên dịch cao cấp. Khoảng ~500-1,500 token mỗi phút âm thanh, được hiển thị trực tiếp trước khi bạn tạo ra. Phiên dịch tự động chạy miễn phí trên 30,000 token hàng ngày của bạn; các mô hình cao cấp là trả theo thời gian, với tiền nạp từ $1.

MP3, WAV, M4A, FLAC, OGG, plus video (MP4, MOV, WebM) - chúng tôi sẽ nén âm thanh. Hơn 500 MB mỗi lần tải lên. Tập tin dài hơn? Đổi tên bằng /audio/cut/ hoặc dùng /v1/stt/batch/.

Diarization của người nói là một bước riêng biệt - chuyển đổi "diarize" trên /transcribe/. Fal Speech-to-Text xử lý phiên dịch; diarization đánh dấu mỗi phân đoạn với Người nói 1 / Người nói 2 / v.v.

Có - / batch / chấp nhận thư mục tập tin âm thanh. Mỗi bản ghi sẽ được lưu trong / account /? tab=history với tên tập tin gốc. Để bảo tồn cây thư mục, dùng API.

Có - POST âm thanh của bạn vào /v1/stt/transcribe/ với model="Fal Speech-to-Text". Trả lại JSON với văn bản + phân đoạn + dấu thời gian ở cấp từ. /api/ có tham chiếu đầy đủ.

Các mô hình tự chủ giữ âm thanh trên GPU của chúng tôi; cao cấp đi qua với DPA. Âm thanh bị xóa sau cửa sổ chia sẻ (24h anon, 7d đăng nhập). Chúng tôi không huấn luyện vào đầu vào của bạn.

Có - Free.ai cho phép sử dụng thương mại các bản ghi âm. Bạn cần phải có quyền cho âm thanh bạn tải lên (bản ghi của chính bạn, tài liệu được cấp phép, hoặc nội dung được chấp thuận).

Hiệu suất thời gian thực là khoảng 0.05–0.2× — một podcast 60 phút được phiên âm trong 3–12 phút. Các mẫu Premium thường kết thúc nhanh hơn. Dùng nút xếp hàng để đóng thẻ.

Cậu yêu Free.ai?

Đánh giá trang này