Transcribe with Vosk

Ngagunakeun audio & video anu aya di dieu. Kandungan anu dilindungi ku DRM henteu didukung.

Ningkatake kanggo Diperbaiki
Private transcript
Chat with transcript
Buka karo Pro →
Gunakake file ing kene utawa klik kanggo browse
MP3, WAV, M4A, FLAC, MP4, MKV, MOV, WebM — nganti 2GB
Muat-up file karo Pro
Ningkatake kanggo Diperbaiki
Private transcript
Chat with transcript
Buka karo Pro →
Ningkatake kanggo Diperbaiki
Recording: 0:00
Wektu nyata Lilin (sekarang)
Dioptimalake Wisp (akurat)
Link umum: 24h, teks mung · Ndaftar for 7d + audio · Pro for private links

Parobihan basa kana teks. AI ngalereskeun otomatis nalika anjeun nyarios - akurasi naék ku kecap-kecap anu langkung panjang.

Uji mikrofonmu sadurunge
❤️ Love STT.ai? Beritahu kanca-kancamu!
Sampeyan wis nggunakake transkripsi gratis sampeyan

1000 taun ka pengker, 600 taun ka tukang, 100 taun ka tukang, 100 taun ka tukang, 100 taun ka tukang.

10 free min/day 600 min gratis karo ndhaptar Tanpa kartu kredit Dienkripsi
Daftar gratis →
12.0%
WER
20
Languages
100.0x
Speed
Apache 2.0
License

About Vosk

Takon-takon sing asring diajukake

STT.ai hosts Vosk on our GPU infrastructure so you can use it without provisioning your own hardware — upload audio or video and pick Vosk from the model picker.

Dina benchmarks standar, Vosk ngahontal kira-kira 12.0% Word Error Rate. Akurasi dunya nyata gumantung kana kualitas audio, accent, jeung basa; pikeun rekaman noisy atawa accented, ngarepkeun sababaraha poin persentase luhur WER.

Vosk dijalankeun dina tingkat bébas STT.ai - unggal pengunjung kéngingkeun menit / bulan 600 tanpa biaya. Rencana anu dibayar nambihan wates per file anu langkung lami, transkripsi pribadi, sareng prioritas.

Vosk dikaluarkeun di handapeun Apache 2.0, lisénsi sumber terbuka anu permisif. Anjeun tiasa ngahost Vosk dina perkakas anjeun atanapi nganggo vérsi anu dihost urang - kaduana tiasa dianggo sacara komersial.

Vosk ngadukung 20 basa. Auto-deteksi milih basa anu bener pikeun kabéh audio; anjeun ogé bisa nyatet éta sacara manual pikeun ngaronjatkeun akurasi.

Vosk ngaproses audio dina kira-kira 100.0x real-time dina GPU urang. A file audio 1 jam réngsé dina handapeun 1 menit; file leuwih panjang diulit jeung ngalaporkeun ku surél nalika réngsé.

Vosk mibanda parameter 50M. Model anu leuwih gedé leuwih akurat tapi leuwih lambat; STT.ai mibanda Vosk dina GPU supados jumlah parameter teu mangaruhan kinerja klien.

Vosk nampa saben format STT.ai dukungan - MP3, WAV, M4A, FLAC, OGG, MP4, MKV, MOV, WebM, AVI, lan liya-liyane. Output minangka TXT, SRT, VTT, DOCX, JSON, utawa PDF.

Ya. Diarization speaker jalan bareng jeung Vosk pikeun unggal transkripsi — unggal speaker dilabelkeun sarta anjeun bisa ngaganti ngaranna dina penyunting saterusna.

Ya. Vosk dijalankeun dina lingkungan anu diurus urang — audio diolah sareng dihapus sacara piawai sareng henteu pernah dianggo pikeun latihan tanpa opt-in eksplisit. Rencana Pro nambahan enkripsi sisi klien pikeun transkripsi nalika istirahat.

Gunakeun alat compare-stt pikeun ngajalankeun Vosk ngalawan model séjén anu didukung dina audio anu sami — anjeun bakal ningali WER, jumlah segmen, label panyatur, sarta skor confidence dibarengan-dibarengan. Perbandingan Vosk vs Whisper Large V3 nyaéta anu paling umum dijalankeun.

Ya. Nyatakeun "vosk" minangka parameter model dina titik akhir /v1/transcribe. Python sareng Node.js SDK kalebet conto Vosk. Tingkat API gratis kalebet 100 menit / bulan.

Ya. Kusabab Vosk dilisensikeun ku Apache 2.0, anjeun tiasa ngahost éta nyalira. Halaman sumber terbuka STT.ai nyarankeun repo sareng beurat proyek. Kabéh tim produksi nganggo vérsi anu dihost pikeun ngaleupaskeun GPU procurement, swaps model, sareng ops.