Bebas Berbicara ke Teks Daring

Ubah pidato ke teks dengan transkripsi buatan AI. Unggah berkas audio, rekam dari mikrofon Anda, atau tempelkan URL. 100+ bahasa, model terbuka, akurasi 98%+.

Bekerja dengan audio & video yang tersedia di publik. Isi yang dilindungi DRM tidak didukung.

Tingkatkan untuk Diperbarui
Transkrip pribadi
Percakapan dengan transkrip
Buka Kunci dengan Pro →
Jatuhkan berkas di sini atau klik untuk diramban
MP3, WAV, M4A, FLAC, MP4, MKV, MOV, WebM sembari 2GB
Tingkatkan untuk Diperbarui
Transkrip pribadi
Percakapan dengan transkrip
Buka Kunci dengan Pro →
Tingkatkan untuk Diperbarui
Rekaman: 0:00
Real-time Vosk (instant)
Enhanced Berbisik (akurat)
Link publik: 24h, hanya teks · Daftar untuk audio 7d + · Pro untuk sambungan privat

Pidato real-time dengan teks. AI auto-treksis saat Anda berbicara dengan akurasi meningkatkan dengan pidato yang lebih panjang.

Uji mikrofon Anda terlebih dahulu
❤️ Katakan pada teman-temanmu!
Anda telah menggunakan transkripsi gratis Anda

Daftarlah gratis untuk mendapatkan 600 menit, atau upgrade dari $9/bulan untuk ribuan lebih.

10 menit/hari bebas 600 menit gratis dengan signup Tidak ada kartu kredit Terenkripsi
Bebas mendaftar →

1. Unggah rekaman suara

Unggah file audio atau video, tempel URL, atau rekam dari mikrofon.

2. AI mengubah ucapan menjadi teks

Pilih model Whisper yang cocok dengan audio Anda.

3. Ekspor transkrip Anda

Unduh dalam 6 format. Bagikan tautan transkrip dengan pemutaran audio.

Supported Speech Input Formats

Speech to Text Models

Choose the AI model that fits your needs — or let us pick the best one.

Speech to Text Use Cases

Ready to convert speech to text?

Mulai gratis →

Pertanyaan yang Sering Diajukan

Pidato ke teks (juga disebut pengenalan suara atau ASR) mengubah audio yang digunakan menjadi kata-kata tertulis secara otomatis. STT.ai menjalankan rekaman Anda melalui model AI yang mendengarkan audio dan keluaran teks yang dapat diedit dengan label timest dan speaker ▪ tidak perlu mengetik.

Model akustik memetakan bentuk gelombang suara ke phoneme, lalu model bahasa merakitnya menjadi kata dan tanda baca yang paling mungkin. STT.ai melakukan ini di GPU dengan keluarga Whisper (Large V3 dan Turbo), jadi rekaman satu jam biasanya dilakukan dalam 2-3 menit.

Setiap pengunjung mendapat 600 menit gratis per bulan tanpa perlu pendaftaran untuk file pertama Anda dibayar mulai dari $ 9/bulan dan menambahkan file yang lebih panjang, transkrip pribadi, dan pengolahan prioritas.

Pada pidato yang bersih model terbaik kami mencapai akurasi 95-97% (A 3-5% Rate Word Error di benchmarks). Accuracy turun dengan suara latar belakang, aksen berat, crosstalk, atau audio rendah bitrat å menggunakan mikrofon yang layak dan ruangan yang tenang membuat perbedaan besar.

Ya. Berbicaralah ke mikrofon Anda dan STT.ai stream transkrip hidup melalui alat live-trankripsi. Anda juga dapat mengunggah rekaman selesai untuk transkripsi batch jika Anda tidak membutuhkannya kata-kata-oleh-kata saat Anda berbicara.

STT.ai mengenali 100 bahasa+ dan auto-detects bahasa yang digunakan untuk kebanyakan audio. Anda juga dapat mengatur bahasa secara manual untuk angkat akurasi kecil, dan rekaman bahasa campuran ditangani dengan menukar pertengahan klip.

Ya. diarisasi pembicara label setiap suara (Speaker 1, Speaker 2,...) dan Anda dapat mengubah nama mereka dalam penyunting. Ini bekerja di setiap model dan bahasa yang didukung.

STT.ai menerima 20+ format termasuk MP3, WAV, M4A, FLAC, OGG, MP4, MKV, MOV, WebM, dan AVI. Keluaran ke TXT, SRT, VTT, DOCX, JSON, atau PDF.

Speech to text transcribes WHAT was said into words; voice recognition (speaker identification) determines WHO said it. STT.ai does both — transcription plus speaker diarization — but the terms describe different tasks.

Ya. Audio diproses dan dihapus secara baku. Rencana pro menambahkan enkripsi sisi klien sehingga transkrip tidak dapat dibaca tanpa kunci Anda, bahkan ke STT.ai, dan data Anda tidak pernah digunakan untuk pelatihan model tanpa eksplisit opt-in.

STT.ai memiliki API EST dengan Python dan Node.js SDK ditambah server MCP untuk Claude dan Kursor. Dewan API gratis mencakup 100 menit/bulan, dengan tagihan per detik di luar itu.

Ya. setiap transkrip dibuka dalam sebuah editor di mana anda dapat memperbaiki kata yang salah dengar, pembicara pengganti nama, menyesuaikan penanda waktu, dan menambahkan catatan. Edit bertahan di setiap format ekspor.