Báo cáo lỗi / yêu cầu tính năng

Bản dịch bằng Whisper Large V3

Name: Whisper Large V3
Author: OpenAI

Làm việc với âm thanh và video công cộng. Không hỗ trợ nội dung được bảo vệ DRM.

Tăng cấp cho nâng cấp

Bản dịch riêng

Trò chuyện với bản ghi chép

Mở khóa với Pro →

Thả tập tin vào đây hoặc nhấn để duyệt

MP3, WAV, M4A, FLAC, MP4, MKV, MOV, WebM — lên đến 2GB

Tải lên nhiều tập tin một lúc với Pro

Tăng cấp cho nâng cấp

Bản dịch riêng

Trò chuyện với bản ghi chép

Mở khóa với Pro →

Tăng cấp cho nâng cấp

Tự động sửa lỗi khi bạn nói — độ chính xác tăng lên khi nói lâu hơn.

Kiểm tra micro đầu tiên

10 phút miễn phí/ngày 600 phút miễn phí với đăng ký Không có thẻ tín dụng Đã mã hóa

Đăng ký miễn phí →

4.2%

WER

Ngôn ngữ

8.0x

Tốc độ

MIT

Giấy phép

Về Whisper Large V3

Whisper Large V3 là mô hình nhận dạng giọng nói mã nguồn mở của OpenAI. Với 1,55 tỷ tham số, nó cung cấp độ chính xác tuyệt vời trên 99 ngôn ngữ. Nó sử dụng một kiến trúc mã hóa- giải mã biến đổi được huấn luyện trên 680.000 giờ dữ liệu âm thanh đa ngôn ngữ.

Ngôn ngữ được hỗ trợ Whisper Large V3

Tiếng Anh

Tiếng Tây Ban Nha

Tiếng Pháp

Tiếng Đức

Tiếng Trung

Tiếng Nhật

Tiếng Hàn

Tiếng Bồ Đào Nha

Tiếng Ả Rập

Tiếng Hindi

Tiếng Nga

Tiếng Italy

Tiếng Hà Lan

Tiếng Thổ Nhĩ Kỳ

Tiếng Ba Lan

Tiếng Thụy Điển

Tiếng Indonesia

Tiếng Thái

Tiếng Việt

Tiếng Séc

Tiếng Hy Lạp

Tiếng Romania

Tiếng Hungary

Tiếng Do Thái

Tiếng Đan Mạch

Tiếng Phần Lan

Tiếng Na Uy

Tiếng Ukraina

Tiếng Mã Lai

Tiếng Bangla

Thông tin mẫu

Nhà cung cấpOpenAI
Kiến trúc-
Giấy phépMIT
Cập nhậtMar 2026

Mô hình liên quan

3.2% WER

5.1% WER

3.5% WER

7.8% WER

3.0% WER

Câu hỏi thường gặp

STT.ai host Whisper Large V3 on our GPU infrastructure so you can use it without provisioning your own hardware — upload audio or video and pick Whisper Large V3 from the model picker.

Độ chính xác thực tế phụ thuộc vào chất lượng âm thanh, giọng nói và ngôn ngữ; đối với các bản ghi âm ồn ào hoặc có giọng nói, chờ đợi một vài điểm phần trăm cao hơn WER.

Whisper Large V3 chạy trên tầng miễn phí của STT.ai - mỗi khách truy cập có 600 phút để bắt đầu miễn phí. Các kế hoạch trả phí thêm giới hạn dài hơn cho mỗi tập tin, bản ghi riêng tư, và xếp hàng ưu tiên.

Whisper Large V3 được phát hành dưới giấy phép mã nguồn mở MIT. Bạn có thể tự lưu trữ Whisper Large V3 trên phần cứng của mình hoặc sử dụng phiên bản lưu trữ của chúng tôi — cả hai đều có thể sử dụng thương mại.

Whisper Large V3 hỗ trợ 99 ngôn ngữ. Tự động phát hiện chọn ngôn ngữ đúng cho hầu hết âm thanh; bạn cũng có thể chỉ định nó bằng tay để tăng độ chính xác một chút.

Whisper Large V3 xử lý âm thanh với tốc độ khoảng 8.0x thời gian thực trên GPU của chúng tôi. Một tập tin âm thanh 1 giờ hoàn thành trong 7 phút; tập tin dài hơn xếp hàng và thông báo bằng email khi hoàn thành.

Whisper Large V3 có các tham số 1.55B. Các mẫu lớn có xu hướng chính xác hơn nhưng chậm hơn; STT.ai host Whisper Large V3 trên GPU vì vậy số lượng tham số không ảnh hưởng đến hiệu suất bên máy khách.

Whisper Large V3 chấp nhận mọi định dạng STT.ai hỗ trợ — MP3, WAV, M4A, FLAC, OGG, MP4, MKV, MOV, WebM, AVI, và những thứ khác.

Vâng. Tính toán các người nói chạy cùng với Whisper Large V3 cho mỗi bản phiên âm — mỗi người nói được đánh dấu và bạn có thể đổi tên chúng trong trình biên tập sau đó.

Có. Whisper Large V3 chạy trong môi trường quản lý của chúng tôi — âm thanh được xử lý và xóa theo mặc định và không bao giờ được sử dụng cho huấn luyện mà không có sự đồng ý rõ ràng. Các kế hoạch Pro thêm mã hóa bên khách hàng cho các bản ghi khi nghỉ.

Dùng công cụ compare-stt để chạy Whisper Large V3 so với bất kỳ mô hình nào được hỗ trợ trên cùng một âm thanh — bạn sẽ thấy WER, số phân đoạn, nhãn loa, và điểm tin cậy cạnh nhau.

Có. Chỉ ra "whisper-large-v3" như tham số mô hình trên điểm kết thúc /v1/transcribe. Python và Node.js SDK bao gồm ví dụ Whisper Large V3. Lớp API miễn phí bao gồm 100 phút/tháng.

Vâng. Bởi vì Whisper Large V3 được cấp phép MIT, bạn có thể tự lưu trữ nó. Trang mã nguồn mở của STT.ai liệt kê dự án và trọng lượng. Hầu hết các nhóm sản xuất sử dụng phiên bản lưu trữ của chúng tôi để bỏ qua việc mua GPU, thay đổi mô hình và các hoạt động.

Bản dịch bằng Whisper Large V3

Về Whisper Large V3

Ngôn ngữ được hỗ trợ Whisper Large V3

Thông tin mẫu

Mô hình liên quan

Câu hỏi thường gặp

Whisper Large V3 là gì?

Whisper Large V3 chính xác đến đâu?

Whisper Large V3 có miễn phí không?

Whisper Large V3 dùng giấy phép gì?

Whisper Large V3 hỗ trợ bao nhiêu ngôn ngữ?

Whisper Large V3 nhanh thế nào?

Kiểu Whisper Large V3 to cỡ nào?

Whisper Large V3 có thể chuyển đổi định dạng âm thanh nào?

Whisper Large V3 có phát hiện nhiều loa không?

Dữ liệu của tôi có riêng tư khi sử dụng Whisper Large V3 không?

Whisper Large V3 so sánh với các mẫu STT khác như thế nào?

Tôi có thể dùng Whisper Large V3 qua API không?

Tôi có thể chạy Whisper Large V3 trên máy chủ của mình không?