Bimbing dengan Vosk

Bekerja dengan audio & video yang tersedia di publik. Isi yang dilindungi DRM tidak didukung.

Tingkatkan untuk Diperbarui
Transkrip pribadi
Percakapan dengan transkrip
Buka Kunci dengan Pro →
Jatuhkan berkas di sini atau klik untuk diramban
MP3, WAV, M4A, FLAC, MP4, MKV, MOV, WebM sembari 2GB
Tingkatkan untuk Diperbarui
Transkrip pribadi
Percakapan dengan transkrip
Buka Kunci dengan Pro →
Tingkatkan untuk Diperbarui
Rekaman: 0:00
Real-time Vosk (instant)
Enhanced Berbisik (akurat)
Link publik: 24h, hanya teks · Daftar untuk audio 7d + · Pro untuk sambungan privat

Pidato real-time dengan teks. AI auto-treksis saat Anda berbicara dengan akurasi meningkatkan dengan pidato yang lebih panjang.

Uji mikrofon Anda terlebih dahulu
❤️ Katakan pada teman-temanmu!
Anda telah menggunakan transkripsi gratis Anda

Daftarlah gratis untuk mendapatkan 600 menit, atau upgrade dari $9/bulan untuk ribuan lebih.

10 menit/hari bebas 600 menit gratis dengan signup Tidak ada kartu kredit Terenkripsi
Bebas mendaftar →
12.0%
WER
20
Bahasa
100.0x
Kecepatan
Apache 2.0
Lisensi

Tentang Vosk

Vosk adalah sebuah toolkit pengenalan pidato luring yang bekerja tanpa koneksi internet. yang mendukung 20+ bahasa dengan model padat yang dapat dijalankan pada perangkat ponsel, Raspberry Pi, dan platform apapun. yang dibangun di Kaldi dan Zipformer arsitektur.

Pertanyaan yang Sering Diajukan

Vosk is a speech-to-text model by Alpha Cephei. STT.ai hosts Vosk on our GPU infrastructure so you can use it without provisioning your own hardware — upload audio or video and pick Vosk from the model picker.

Pada benchmark standar, Vosk mencapai sekitar 12.0% Word Error Rate. Keakuratan Real-world tergantung pada kualitas audio, aksen, dan bahasa; untuk rekaman bising atau aksen, mengharapkan beberapa poin persentase lebih tinggi WER.

Vosk berjalan di STT.ai's free å setiap pengunjung mendapat 600 menit tanpa biaya. Rencana dibayar menambahkan batas per-berkas, transkrip pribadi, dan antrian prioritas.

Vosk dirilis di bawah Apache 2.0, lisensi sumber terbuka perresensi. Anda dapat mengenali Vosk sendiri dengan perangkat keras Anda atau menggunakan versi host kami keduanya dapat digunakan secara komersial.

Vosk mendukung bahasa 20. Auto-deteksi memilih bahasa yang tepat untuk kebanyakan audio; Anda juga dapat menentukan secara manual untuk angkat akurasi kecil.

Vosk memproses audio pada sekitar 100.0x real-time pada GPUs kami. Sebuah berkas audio 1-jam selesai di bawah menit 1; antrian berkas lebih panjang dan beritahu melalui email ketika dilakukan.

Vosk memiliki parameter 50M. Model yang lebih besar cenderung lebih akurat tetapi lebih lambat; STT.ai host Vosk pada GPU sehingga parameter tak mempengaruhi kinerja sisi klien Anda.

Vosk menerima setiap format yang didukung STT.ai ▪ MP3, WAV, M4A, FLAC, OGG, MP4, MKV, MOV, WebM, AVI, dan lainnya. Keluaran sebagai TXT, SRT, VTT, DOCX, JSON, atau PDF.

Dirasi Speaker berjalan bersama Vosk untuk setiap transkripsi setiap pembicara diberi label dan Anda dapat mengubah nama mereka di editor sesudahnya.

Vosk berjalan di lingkungan yang dikelola kami audio diproses dan dihapus secara baku dan tidak pernah digunakan untuk pelatihan tanpa eksplisit opt-in. Pro rencana menambahkan klien-sisi enkripsi untuk transkrip di istirahat.

Use the compare-stt tool to run Vosk against any other supported model on the same audio — you'll see WER, segment count, speaker labels, and confidence scores side-by-side. The Vosk vs Whisper Large V3 comparison is the most commonly run.

Ya. Nyatakan "vosk" sebagai parameter model pada titik akhir /v1/trascrite. Python dan Node.js SDKs termasuk contoh Vosk. Deret API gratis meliputi 100 menit/bulan.

Yes. Because Vosk is Apache 2.0-licensed, you can self-host it. STT.ai's open-source page lists the project repo and weights. Most production teams use our hosted version to skip GPU procurement, model swaps, and ops.