رونوشت با Vosk

با صوت و ویدئوهای در دسترس عمومی کار می‌کند. محتوای محافظت شده با DRM پشتیبانی نمی‌شود.

ارتقا برای بهبودیافته
رونوشت خصوصی
گپ زدن با رونوشت
باز کردن قفل با Pro →
پروندۀ را اینجا بگذارید یا برای مرور کلیک کنید
MP3, WAV, M4A, FLAC, MP4, MKV, MOV, WebM — تا ۲ گیگابایت
ارتقا برای بهبودیافته
رونوشت خصوصی
گپ زدن با رونوشت
باز کردن قفل با Pro →
ارتقا برای بهبودیافته
ضبط: 0:00
زمان واقعی موم (موقت)
بهبودیافته زمزمه (دقت)
وبگاه رسمی 24hours.com · ثبت نام برای 7d + صدا · حرفه اي برای پیوندهای خصوصی

گفتار به متن در زمان واقعی. هوش مصنوعی خودکاراً در حین صحبت کردن شما را اصلاح می‌کند - دقت با صحبت طولانی تر بهبود می‌یابد.

ابتدا میکروفون خود را امتحان کنید
❤️ دوست STT.ai رو به دوستانت بگو
تو از رونوشت هاي مجانيت استفاده کردي

برای دریافت ۶۰۰ دقیقه رایگان ثبت نام کنید یا از ۹ دلار در ماه برای هزاران دلار بیشتر ارتقاء دهید.

۱۰ دقیقه آزاد در روز 600 دقیقه رایگان با ثبت نام کارت اعتباري ندارم رمزگذاری شده
ثبت نام مجانی →
12.0%
WER
20
زبانها
100.0x
سرعت
Apache 2.0
مجوز

در مورد Vosk

Vosk یک ابزار تشخیص گفتار آفلاین است که بدون اتصال به اینترنت کار می‌کند. از ۲۰+ زبان با مدل‌های فشرده پشتیبانی می‌کند که می‌تواند روی دستگاه‌های موبایل، Raspberry Pi و هر پلتفرم دیگری اجرا شود. بر روی معماری‌های Kaldi و Zipformer ساخته شده است.
اطلاعات مدل
  • ارائه‌دهندهAlpha Cephei
  • معماری-
  • مجوزApache 2.0
  • به روزرسانیMar 2026

پرسشهای متداول

STT.ai میزبان Vosk در زیرساخت GPU ماست بنابراین می‌توانید بدون فراهم کردن سخت‌افزار خود از آن استفاده کنید - صدا یا ویدئو را بارگذاری کنید و Vosk را از گزینش مدل انتخاب کنید.

On standard benchmarks, Vosk achieves around 12.0% Word Error Rate. Real-world accuracy depends on audio quality, accent, and language; for noisy or accented recordings, expect a few percentage points higher WER.

Vosk در لایه رایگان STT.ai اجرا می‌شود - هر بازدیدکننده ۶۰۰ دقیقه برای شروع بدون هزینه دریافت می‌کند.

Vosk تحت Apache 2.0 منتشر می‌شود، یک مجوز آزاد آزاد. شما می‌توانید خودتان Vosk را در سخت‌افزار خود میزبانی کنید یا از نسخه میزبانی شده ما استفاده کنید - هر دو قابل استفاده تجاری هستند.

Vosk از زبان‌های 20 پشتیبانی می‌کند. تشخیص خودکار زبان درست را برای بیشتر صداها انتخاب می‌کند؛ همچنین می‌توانید آن را برای یک بالا رفتن دقت کوچک دستی مشخص کنید.

Vosk processes audio at about 100.0x real-time on our GPUs. A 1-hour audio file finishes in under 1 minutes; longer files queue and notify by email when done.

Vosk has 50M parameters. Larger models tend to be more accurate but slower; STT.ai hosts Vosk on GPU so the parameter count doesn't affect your client-side performance.

Vosk هر فرمتی را که STT.ai پشتیبانی می‌کند را می‌پذیرد - MP3, WAV, M4A, FLAC, OGG, MP4, MKV, MOV, WebM, AVI و دیگران.

بله. نوشتار شنونده در کنار Vosk برای هر رونوشت اجرا می شود — هر شنونده برچسب گذاری شده و می توانید بعداً آنها را در ویرایشگر تغییر نام دهید.

بله. Vosk در محیط مدیریت شده ما اجرا می‌شود - صدا به صورت پیشفرض پردازش و حذف می‌شود و هیچگاه برای آموزش بدون انتخاب صریح استفاده نمی‌شود. برنامه‌های Pro رمزگذاری سمت مشتری را برای رونوشت‌های در حال استراحت اضافه می‌کنند.

Use the compare-stt tool to run Vosk against any other supported model on the same audio — you'll see WER, segment count, speaker labels, and confidence scores side-by-side. The Vosk vs Whisper Large V3 comparison is the most commonly run.

بله. "vosk" را به عنوان پارامتر مدل در /v1/transcribe endpoint مشخص کنید. Python و Node.js SDK شامل نمونه‌های Vosk هستند. سطح API رایگان شامل ۱۰۰ دقیقه در ماه است.

بله. چون Vosk دارای مجوز Apache 2.0 است، شما می‌توانید آن را خودتان میزبانی کنید. صفحهٔ منبع باز STT.ai فهرستی از پروژه و وزن‌ها را ارائه می‌دهد. بیشتر تیم‌های تولید از نسخهٔ میزبانی شده ما برای فراموش کردن خرید GPU، مبادلات مدل و عملیات استفاده می‌کنند.