Free Speech to Text Online

Chuyển đổi giọng nói thành văn bản với phiên dịch AI. Tải lên tập tin âm thanh, ghi từ microphone của bạn, hoặc dán một URL. 100+ ngôn ngữ, 10+ mẫu, chính xác 98%+.

Làm việc với âm thanh và video công cộng. Không hỗ trợ nội dung được bảo vệ DRM.

Tăng cấp cho nâng cấp
Bản dịch riêng
Trò chuyện với bản ghi chép
Mở khóa với Pro →
Thả tập tin vào đây hoặc nhấn để duyệt
MP3, WAV, M4A, FLAC, MP4, MKV, MOV, WebM — lên đến 2GB
Tăng cấp cho nâng cấp
Bản dịch riêng
Trò chuyện với bản ghi chép
Mở khóa với Pro →
Tăng cấp cho nâng cấp
Ghi âm: 0:00
Thời gian thực Sáp (trong giây lát)
Tăng cường Tiếng thì thầm (đúng)
Liên kết công cộng: 24h, chỉ văn bản · Đăng ký cho 7d + âm thanh · Tốt cho liên kết riêng

Tự động sửa lỗi khi bạn nói — độ chính xác tăng lên khi nói lâu hơn.

Kiểm tra micro đầu tiên
❤️ Cảm ơn bạn đã ghé thăm STT.ai.
Anh đã dùng bản dịch miễn phí của mình.

Đăng ký miễn phí để nhận 600 phút, hoặc nâng cấp từ $5/tháng cho hàng ngàn người khác.

10 phút miễn phí/ngày 600 phút miễn phí với đăng ký Không có thẻ tín dụng Đã mã hóa
Đăng ký miễn phí →

1. Upload Speech Recording

Upload an audio or video file, paste a URL, or record speech from your mic.

2. AI Converts Speech to Text

Choose from 10+ AI models. Speaker detection and language auto-detect included.

3. Export Your Transcript

Download in 6 formats. Share transcript links with audio playback.

Supported Speech Input Formats

Ready to convert speech to text?

Bắt đầu miễn phí →

Câu hỏi thường gặp

Speech to text (cũng được gọi là nhận dạng giọng nói hoặc ASR) chuyển đổi âm thanh nói thành từ viết tự động. STT.ai chạy ghi âm của bạn thông qua một mô hình AI nghe âm thanh và xuất văn bản có thể chỉnh sửa với dấu thời gian và nhãn phát thanh - không cần gõ.

Một mô hình âm thanh vẽ hình sóng âm thanh thành các âm tiết, sau đó một mô hình ngôn ngữ lắp ráp chúng thành các từ và dấu chấm có khả năng nhất. STT.ai làm điều này trên GPU với các mô hình như Whisper Large V3 và NVIDIA Canary, vì vậy một bản ghi một giờ thường được thực hiện trong 2-3 phút.

Có, mỗi người truy cập sẽ được 600 phút miễn phí để bắt đầu, không cần đăng ký cho tập tin đầu tiên. Các kế hoạch trả tiền bắt đầu từ $5/tháng và thêm các tập tin dài hơn, bản dịch riêng và xử lý ưu tiên.

Trong các bài nói rõ ràng, các mô hình tốt nhất của chúng tôi đạt được độ chính xác 95-97% (tỷ lệ sai lầm từ 3-5% trên các tiêu chuẩn). Độ chính xác giảm với tiếng ồn nền, giọng nói nặng, tiếng nói xuyên qua, hoặc âm thanh tốc độ bit thấp - sử dụng một microphone tốt và một phòng yên tĩnh tạo ra sự khác biệt lớn nhất.

Có. Nói vào micro và STT.ai sẽ truyền tải bản ghi trực tiếp qua công cụ bản ghi trực tiếp. Bạn cũng có thể tải lên bản ghi hoàn thành để chuyển thể hàng loạt nếu bạn không cần nó từng từ một khi nói.

STT.ai nhận ra hơn 100 ngôn ngữ và tự động phát hiện ngôn ngữ nói cho hầu hết âm thanh. Bạn cũng có thể đặt ngôn ngữ bằng tay để tăng độ chính xác một chút, và ghi âm hỗn hợp ngôn ngữ được xử lý bằng cách chuyển đổi giữa đoạn phim.

Có. Tính toán ngày của loa đánh dấu mỗi giọng nói (Loa 1, Loa 2,...) và bạn có thể đổi tên chúng trong trình biên tập. Điều này hoạt động trên tất cả các mẫu và ngôn ngữ được hỗ trợ.

STT.ai chấp nhận hơn 20 định dạng bao gồm MP3, WAV, M4A, FLAC, OGG, MP4, MKV, MOV, WebM, và AVI.

Speech to text phiên âm WHAT đã được nói thành từ; nhận dạng giọng nói (định danh người nói) xác định ai đã nói nó. STT.ai làm cả hai — phiên âm cộng với diarization người nói — nhưng các thuật ngữ mô tả các nhiệm vụ khác nhau.

Có. Âm thanh được xử lý và xóa theo mặc định. Các kế hoạch chuyên nghiệp thêm mã hóa bên khách hàng vì vậy bản ghi không thể đọc được nếu không có chìa khóa của bạn, thậm chí là STT.ai, và dữ liệu của bạn không bao giờ được sử dụng cho việc huấn luyện mô hình mà không có sự đồng ý rõ ràng.

STT.ai có một API REST với Python và Node.js SDKs cộng thêm một máy chủ MCP cho Claude và Cursor. Lớp API miễn phí bao gồm 100 phút / tháng, với việc tính theo giây ngoài đó.

Có. Mỗi bản ghi sẽ được mở trong trình biên tập nội bộ, nơi bạn có thể sửa chữa những từ nghe sai, đổi tên người nói, điều chỉnh dấu thời gian, và thêm ghi chú. Sửa đổi sẽ được lưu lại trong mọi định dạng xuất.