Bebas Berbicara ke Teks Daring
Ubah pidato ke teks dengan transkripsi buatan AI. Unggah berkas audio, rekam dari mikrofon Anda, atau tempelkan URL. 100+ bahasa, model terbuka, akurasi 98%+.
1. Unggah rekaman suara
Unggah file audio atau video, tempel URL, atau rekam dari mikrofon.
2. AI mengubah ucapan menjadi teks
Pilih model Whisper yang cocok dengan audio Anda.
3. Ekspor transkrip Anda
Unduh dalam 6 format. Bagikan tautan transkrip dengan pemutaran audio.
Speech to Text Models
Choose the AI model that fits your needs — or let us pick the best one.
Speech to Text in 100+ Languages
Ready to convert speech to text?
Mulai gratis →Pertanyaan yang Sering Diajukan
Pidato ke teks (juga disebut pengenalan suara atau ASR) mengubah audio yang digunakan menjadi kata-kata tertulis secara otomatis. STT.ai menjalankan rekaman Anda melalui model AI yang mendengarkan audio dan keluaran teks yang dapat diedit dengan label timest dan speaker ▪ tidak perlu mengetik.
Model akustik memetakan bentuk gelombang suara ke phoneme, lalu model bahasa merakitnya menjadi kata dan tanda baca yang paling mungkin. STT.ai melakukan ini di GPU dengan keluarga Whisper (Large V3 dan Turbo), jadi rekaman satu jam biasanya dilakukan dalam 2-3 menit.
Setiap pengunjung mendapat 600 menit gratis per bulan tanpa perlu pendaftaran untuk file pertama Anda dibayar mulai dari $ 9/bulan dan menambahkan file yang lebih panjang, transkrip pribadi, dan pengolahan prioritas.
Pada pidato yang bersih model terbaik kami mencapai akurasi 95-97% (A 3-5% Rate Word Error di benchmarks). Accuracy turun dengan suara latar belakang, aksen berat, crosstalk, atau audio rendah bitrat å menggunakan mikrofon yang layak dan ruangan yang tenang membuat perbedaan besar.
Ya. Berbicaralah ke mikrofon Anda dan STT.ai stream transkrip hidup melalui alat live-trankripsi. Anda juga dapat mengunggah rekaman selesai untuk transkripsi batch jika Anda tidak membutuhkannya kata-kata-oleh-kata saat Anda berbicara.
STT.ai mengenali 100 bahasa+ dan auto-detects bahasa yang digunakan untuk kebanyakan audio. Anda juga dapat mengatur bahasa secara manual untuk angkat akurasi kecil, dan rekaman bahasa campuran ditangani dengan menukar pertengahan klip.
Ya. diarisasi pembicara label setiap suara (Speaker 1, Speaker 2,...) dan Anda dapat mengubah nama mereka dalam penyunting. Ini bekerja di setiap model dan bahasa yang didukung.
STT.ai menerima 20+ format termasuk MP3, WAV, M4A, FLAC, OGG, MP4, MKV, MOV, WebM, dan AVI. Keluaran ke TXT, SRT, VTT, DOCX, JSON, atau PDF.
Speech to text transcribes WHAT was said into words; voice recognition (speaker identification) determines WHO said it. STT.ai does both — transcription plus speaker diarization — but the terms describe different tasks.
Ya. Audio diproses dan dihapus secara baku. Rencana pro menambahkan enkripsi sisi klien sehingga transkrip tidak dapat dibaca tanpa kunci Anda, bahkan ke STT.ai, dan data Anda tidak pernah digunakan untuk pelatihan model tanpa eksplisit opt-in.
STT.ai memiliki API EST dengan Python dan Node.js SDK ditambah server MCP untuk Claude dan Kursor. Dewan API gratis mencakup 100 menit/bulan, dengan tagihan per detik di luar itu.
Ya. setiap transkrip dibuka dalam sebuah editor di mana anda dapat memperbaiki kata yang salah dengar, pembicara pengganti nama, menyesuaikan penanda waktu, dan menambahkan catatan. Edit bertahan di setiap format ekspor.