Bimbing dengan Vosk
12.0%
WER
20
Bahasa
100.0x
Kecepatan
Apache 2.0
Lisensi
Tentang Vosk
Vosk adalah sebuah toolkit pengenalan pidato luring yang bekerja tanpa koneksi internet. yang mendukung 20+ bahasa dengan model padat yang dapat dijalankan pada perangkat ponsel, Raspberry Pi, dan platform apapun. yang dibangun di Kaldi dan Zipformer arsitektur.
Info Model
- OperatorAlpha Cephei
- Arsitektur-
- LisensiApache 2.0
- DiperbaruiMar 2026
Pertanyaan yang Sering Diajukan
Vosk is a speech-to-text model by Alpha Cephei. STT.ai hosts Vosk on our GPU infrastructure so you can use it without provisioning your own hardware — upload audio or video and pick Vosk from the model picker.
Pada benchmark standar, Vosk mencapai sekitar 12.0% Word Error Rate. Keakuratan Real-world tergantung pada kualitas audio, aksen, dan bahasa; untuk rekaman bising atau aksen, mengharapkan beberapa poin persentase lebih tinggi WER.
Vosk berjalan di STT.ai's free å setiap pengunjung mendapat 600 menit tanpa biaya. Rencana dibayar menambahkan batas per-berkas, transkrip pribadi, dan antrian prioritas.
Vosk dirilis di bawah Apache 2.0, lisensi sumber terbuka perresensi. Anda dapat mengenali Vosk sendiri dengan perangkat keras Anda atau menggunakan versi host kami keduanya dapat digunakan secara komersial.
Vosk mendukung bahasa 20. Auto-deteksi memilih bahasa yang tepat untuk kebanyakan audio; Anda juga dapat menentukan secara manual untuk angkat akurasi kecil.
Vosk memproses audio pada sekitar 100.0x real-time pada GPUs kami. Sebuah berkas audio 1-jam selesai di bawah menit 1; antrian berkas lebih panjang dan beritahu melalui email ketika dilakukan.
Vosk memiliki parameter 50M. Model yang lebih besar cenderung lebih akurat tetapi lebih lambat; STT.ai host Vosk pada GPU sehingga parameter tak mempengaruhi kinerja sisi klien Anda.
Vosk menerima setiap format yang didukung STT.ai ▪ MP3, WAV, M4A, FLAC, OGG, MP4, MKV, MOV, WebM, AVI, dan lainnya. Keluaran sebagai TXT, SRT, VTT, DOCX, JSON, atau PDF.
Dirasi Speaker berjalan bersama Vosk untuk setiap transkripsi setiap pembicara diberi label dan Anda dapat mengubah nama mereka di editor sesudahnya.
Vosk berjalan di lingkungan yang dikelola kami audio diproses dan dihapus secara baku dan tidak pernah digunakan untuk pelatihan tanpa eksplisit opt-in. Pro rencana menambahkan klien-sisi enkripsi untuk transkrip di istirahat.
Use the compare-stt tool to run Vosk against any other supported model on the same audio — you'll see WER, segment count, speaker labels, and confidence scores side-by-side. The Vosk vs Whisper Large V3 comparison is the most commonly run.
Ya. Nyatakan "vosk" sebagai parameter model pada titik akhir /v1/trascrite. Python dan Node.js SDKs termasuk contoh Vosk. Deret API gratis meliputi 100 menit/bulan.
Yes. Because Vosk is Apache 2.0-licensed, you can self-host it. STT.ai's open-source page lists the project repo and weights. Most production teams use our hosted version to skip GPU procurement, model swaps, and ops.