STT.ai Enhanced

STT.ai chạy mô hình này trên cấp độ trả tiền. Nó là mô hình đằng sau STT.ai Enhanced. Phiên âm miễn phí sử dụng Whisper Large v3 Turbo, nhanh hơn. Xem kế hoạch → · Transcript free with Whisper Turbo →
4.2%
WER
99
Ngôn ngữ
15.9x
Tốc độ
MIT
Giấy phép

Về STT.ai Enhanced

STT.ai Enhanced là mô hình chuyển từ nói sang văn bản chính xác nhất và nhanh nhất của chúng tôi. Tạo ra trên kiến trúc biến đổi tiên tiến với tối ưu hóa độc quyền, nó cung cấp tỷ lệ sai từ dẫn đầu trong ngành trên 100+ ngôn ngữ. Tốt nhất cho phiên dịch sản xuất, phụ đề thời gian thực, và ứng dụng doanh nghiệp.
✦ Mở khóa mô hình tăng cường

Tìm hiểu về mô hình chính xác nhất của chúng tôi với bất kỳ kế hoạch trả phí nào — Whisper large-v3, 99 ngôn ngữ, và diarization của người nói.

Xem kế hoạch →
Thông tin mẫu
  • Nhà cung cấpOpenAI (hosted by STT.ai)
  • Kiến trúc-
  • Giấy phépMIT
  • Cập nhậtAug 2026

Câu hỏi thường gặp

STT.ai Enhanced là một mô hình chuyển từ nói sang văn bản của OpenAI (hosted by STT.ai). STT.ai chạy nó trên GPU của chúng tôi cho các tài khoản trên một kế hoạch trả tiền, và nó là mô hình đằng sau tầng tăng cường STT.ai. Phiên âm miễn phí sử dụng Whisper Large v3 Turbo, điểm kiểm tra nhanh hơn của cùng một gia đình.

Độ chính xác thực tế phụ thuộc vào chất lượng âm thanh, giọng nói và ngôn ngữ; đối với các bản ghi âm ồn ào hoặc có giọng nói, chờ đợi một vài điểm phần trăm cao hơn WER.

STT.ai Enhanced là một mô hình cao cấp - bao gồm với bất kỳ kế hoạch STT.ai trả tiền nào bắt đầu từ $ 9 / tháng. Nó không có sẵn trên tầng miễn phí: các tải lên miễn phí và nặc danh chạy Whisper Turbo thay vì.

STT.ai Enhanced được phát hành dưới giấy phép mã nguồn mở MIT. Bạn có thể tự lưu trữ STT.ai Enhanced trên phần cứng của mình hoặc sử dụng phiên bản lưu trữ của chúng tôi — cả hai đều có thể sử dụng thương mại.

STT.ai Enhanced hỗ trợ 99 ngôn ngữ. Tự động phát hiện chọn ngôn ngữ đúng cho hầu hết âm thanh; bạn cũng có thể chỉ định nó bằng tay để tăng độ chính xác một chút.

STT.ai Enhanced xử lý âm thanh với tốc độ khoảng 15.9x thời gian thực trên GPU của chúng tôi. Một tập tin âm thanh 1 giờ hoàn thành trong 3 phút; tập tin dài hơn xếp hàng và thông báo bằng email khi hoàn thành.

STT.ai Enhanced có các tham số 1.55B. Các mẫu lớn có xu hướng chính xác hơn nhưng chậm hơn; STT.ai host STT.ai Enhanced trên GPU vì vậy số lượng tham số không ảnh hưởng đến hiệu suất bên máy khách.

STT.ai Enhanced chấp nhận mọi định dạng STT.ai hỗ trợ — MP3, WAV, M4A, FLAC, OGG, MP4, MKV, MOV, WebM, AVI, và những thứ khác.

Vâng. Tính toán các người nói chạy cùng với STT.ai Enhanced cho mỗi bản phiên âm — mỗi người nói được đánh dấu và bạn có thể đổi tên chúng trong trình biên tập sau đó.

STT.ai Enhanced chạy trong cơ sở hạ tầng riêng của chúng tôi - âm thanh được xử lý và xóa theo mặc định. Pro + thêm mã hóa bên khách hàng vì vậy bản ghi không thể đọc được mà không có chìa khóa của bạn, và Private Cloud cho phép bạn tự chủ STT.ai Enhanced hoàn toàn trong VPC của riêng bạn.

Dùng công cụ compare-stt để chạy STT.ai Enhanced so với bất kỳ mô hình nào được hỗ trợ trên cùng một âm thanh — bạn sẽ thấy WER, số phân đoạn, nhãn loa, và điểm tin cậy cạnh nhau.

Có, trên một kế hoạch trả tiền. Chỉ ra "stt-ai-enhanced" như là tham số mô hình trên điểm kết thúc /v1/transcribe. Các chìa khóa không có kế hoạch hoạt động sẽ được phục vụ Whisper Large v3 Turbo thay thế. Yêu cầu vẫn thành công; nó chỉ chạy mô hình miễn phí.

Vâng. Bởi vì STT.ai Enhanced được cấp phép MIT, bạn có thể tự lưu trữ nó. Trang mã nguồn mở của STT.ai liệt kê dự án và trọng lượng. Hầu hết các nhóm sản xuất sử dụng phiên bản lưu trữ của chúng tôi để bỏ qua việc mua GPU, thay đổi mô hình và các hoạt động.