Free Speech to Text Online
Chuyển đổi giọng nói thành văn bản với phiên dịch AI. Tải lên tập tin âm thanh, ghi từ microphone của bạn, hoặc dán một URL. 100+ ngôn ngữ, 10+ mẫu, chính xác 98%+.
1. Upload Speech Recording
Upload an audio or video file, paste a URL, or record speech from your mic.
2. AI Converts Speech to Text
Choose from 10+ AI models. Speaker detection and language auto-detect included.
3. Export Your Transcript
Download in 6 formats. Share transcript links with audio playback.
Speech to Text Models
Choose the AI model that fits your needs — or let us pick the best one.
Speech to Text in 100+ Languages
Ready to convert speech to text?
Bắt đầu miễn phí →Câu hỏi thường gặp
Speech to text (cũng được gọi là nhận dạng giọng nói hoặc ASR) chuyển đổi âm thanh nói thành từ viết tự động. STT.ai chạy ghi âm của bạn thông qua một mô hình AI nghe âm thanh và xuất văn bản có thể chỉnh sửa với dấu thời gian và nhãn phát thanh - không cần gõ.
Một mô hình âm thanh vẽ hình sóng âm thanh thành các âm tiết, sau đó một mô hình ngôn ngữ lắp ráp chúng thành các từ và dấu chấm có khả năng nhất. STT.ai làm điều này trên GPU với các mô hình như Whisper Large V3 và NVIDIA Canary, vì vậy một bản ghi một giờ thường được thực hiện trong 2-3 phút.
Có, mỗi người truy cập sẽ được 600 phút miễn phí để bắt đầu, không cần đăng ký cho tập tin đầu tiên. Các kế hoạch trả tiền bắt đầu từ $5/tháng và thêm các tập tin dài hơn, bản dịch riêng và xử lý ưu tiên.
Trong các bài nói rõ ràng, các mô hình tốt nhất của chúng tôi đạt được độ chính xác 95-97% (tỷ lệ sai lầm từ 3-5% trên các tiêu chuẩn). Độ chính xác giảm với tiếng ồn nền, giọng nói nặng, tiếng nói xuyên qua, hoặc âm thanh tốc độ bit thấp - sử dụng một microphone tốt và một phòng yên tĩnh tạo ra sự khác biệt lớn nhất.
Có. Nói vào micro và STT.ai sẽ truyền tải bản ghi trực tiếp qua công cụ bản ghi trực tiếp. Bạn cũng có thể tải lên bản ghi hoàn thành để chuyển thể hàng loạt nếu bạn không cần nó từng từ một khi nói.
STT.ai nhận ra hơn 100 ngôn ngữ và tự động phát hiện ngôn ngữ nói cho hầu hết âm thanh. Bạn cũng có thể đặt ngôn ngữ bằng tay để tăng độ chính xác một chút, và ghi âm hỗn hợp ngôn ngữ được xử lý bằng cách chuyển đổi giữa đoạn phim.
Có. Tính toán ngày của loa đánh dấu mỗi giọng nói (Loa 1, Loa 2,...) và bạn có thể đổi tên chúng trong trình biên tập. Điều này hoạt động trên tất cả các mẫu và ngôn ngữ được hỗ trợ.
STT.ai chấp nhận hơn 20 định dạng bao gồm MP3, WAV, M4A, FLAC, OGG, MP4, MKV, MOV, WebM, và AVI.
Speech to text phiên âm WHAT đã được nói thành từ; nhận dạng giọng nói (định danh người nói) xác định ai đã nói nó. STT.ai làm cả hai — phiên âm cộng với diarization người nói — nhưng các thuật ngữ mô tả các nhiệm vụ khác nhau.
Có. Âm thanh được xử lý và xóa theo mặc định. Các kế hoạch chuyên nghiệp thêm mã hóa bên khách hàng vì vậy bản ghi không thể đọc được nếu không có chìa khóa của bạn, thậm chí là STT.ai, và dữ liệu của bạn không bao giờ được sử dụng cho việc huấn luyện mô hình mà không có sự đồng ý rõ ràng.
STT.ai có một API REST với Python và Node.js SDKs cộng thêm một máy chủ MCP cho Claude và Cursor. Lớp API miễn phí bao gồm 100 phút / tháng, với việc tính theo giây ngoài đó.
Có. Mỗi bản ghi sẽ được mở trong trình biên tập nội bộ, nơi bạn có thể sửa chữa những từ nghe sai, đổi tên người nói, điều chỉnh dấu thời gian, và thêm ghi chú. Sửa đổi sẽ được lưu lại trong mọi định dạng xuất.