رونوشت با Vosk
12.0%
WER
20
زبانها
100.0x
سرعت
Apache 2.0
مجوز
در مورد Vosk
Vosk یک ابزار تشخیص گفتار آفلاین است که بدون اتصال به اینترنت کار میکند. از ۲۰+ زبان با مدلهای فشرده پشتیبانی میکند که میتواند روی دستگاههای موبایل، Raspberry Pi و هر پلتفرم دیگری اجرا شود. بر روی معماریهای Kaldi و Zipformer ساخته شده است.
اطلاعات مدل
- ارائهدهندهAlpha Cephei
- معماری-
- مجوزApache 2.0
- به روزرسانیMar 2026
پرسشهای متداول
STT.ai میزبان Vosk در زیرساخت GPU ماست بنابراین میتوانید بدون فراهم کردن سختافزار خود از آن استفاده کنید - صدا یا ویدئو را بارگذاری کنید و Vosk را از گزینش مدل انتخاب کنید.
On standard benchmarks, Vosk achieves around 12.0% Word Error Rate. Real-world accuracy depends on audio quality, accent, and language; for noisy or accented recordings, expect a few percentage points higher WER.
Vosk در لایه رایگان STT.ai اجرا میشود - هر بازدیدکننده ۶۰۰ دقیقه برای شروع بدون هزینه دریافت میکند.
Vosk تحت Apache 2.0 منتشر میشود، یک مجوز آزاد آزاد. شما میتوانید خودتان Vosk را در سختافزار خود میزبانی کنید یا از نسخه میزبانی شده ما استفاده کنید - هر دو قابل استفاده تجاری هستند.
Vosk از زبانهای 20 پشتیبانی میکند. تشخیص خودکار زبان درست را برای بیشتر صداها انتخاب میکند؛ همچنین میتوانید آن را برای یک بالا رفتن دقت کوچک دستی مشخص کنید.
Vosk processes audio at about 100.0x real-time on our GPUs. A 1-hour audio file finishes in under 1 minutes; longer files queue and notify by email when done.
Vosk has 50M parameters. Larger models tend to be more accurate but slower; STT.ai hosts Vosk on GPU so the parameter count doesn't affect your client-side performance.
Vosk هر فرمتی را که STT.ai پشتیبانی میکند را میپذیرد - MP3, WAV, M4A, FLAC, OGG, MP4, MKV, MOV, WebM, AVI و دیگران.
بله. نوشتار شنونده در کنار Vosk برای هر رونوشت اجرا می شود — هر شنونده برچسب گذاری شده و می توانید بعداً آنها را در ویرایشگر تغییر نام دهید.
بله. Vosk در محیط مدیریت شده ما اجرا میشود - صدا به صورت پیشفرض پردازش و حذف میشود و هیچگاه برای آموزش بدون انتخاب صریح استفاده نمیشود. برنامههای Pro رمزگذاری سمت مشتری را برای رونوشتهای در حال استراحت اضافه میکنند.
Use the compare-stt tool to run Vosk against any other supported model on the same audio — you'll see WER, segment count, speaker labels, and confidence scores side-by-side. The Vosk vs Whisper Large V3 comparison is the most commonly run.
بله. "vosk" را به عنوان پارامتر مدل در /v1/transcribe endpoint مشخص کنید. Python و Node.js SDK شامل نمونههای Vosk هستند. سطح API رایگان شامل ۱۰۰ دقیقه در ماه است.
بله. چون Vosk دارای مجوز Apache 2.0 است، شما میتوانید آن را خودتان میزبانی کنید. صفحهٔ منبع باز STT.ai فهرستی از پروژه و وزنها را ارائه میدهد. بیشتر تیمهای تولید از نسخهٔ میزبانی شده ما برای فراموش کردن خرید GPU، مبادلات مدل و عملیات استفاده میکنند.