Distil-Whisper

STT.ai این مدل را اجرا نمی‌کند. این صفحه اطلاعات مرجع در مورد آن است. با مدل هايي که اجرا ميکنيم رونوشت کن →
5.8%
WER
99
زبانها
48.0x
سرعت
MIT
مجوز

در مورد Distil-Whisper

Distil-Whisper یک نسخه تقطیر شده از Whisper است که توسط Hugging Face ایجاد شده‌است.این مدل اندازه را 49٪ کاهش می‌دهد و به استنتاج 6x سریع‌تر می‌رسد در حالی که در مجموعه‌های ارزیابی خارج از توزیع در حدود 1٪ WER از Whisper Large V2 اصلی حفظ می‌شود.
اطلاعات مدل
  • ارائه‌دهندهHugging Face
  • معماری-
  • مجوزMIT
  • به روزرسانیMar 2026

پرسشهای متداول

Distil-Whisper یک مدل گفتار به متن توسط Hugging Face است. STT.ai در حال حاضر Distil-Whisper را اجرا نمی‌کند — این صفحه اطلاعات مرجع در مورد مدل است. برای رونویسی در STT.ai ، انتخاب‌کننده مدل خانواده Whisper (Turbo, Large V3, Medium, Small) را ارائه می‌دهد.

On standard benchmarks, Distil-Whisper achieves around 5.8% Word Error Rate. Real-world accuracy depends on audio quality, accent, and language; for noisy or accented recordings, expect a few percentage points higher WER.

Distil-Whisper در STT.ai در دسترس نیست. شرایط مجوز خود را برای اجرای خود تنظیم می‌کند. STT.ai سطح رایگان مدل Whisper را پوشش می‌دهد که ما اجرا می‌کنیم - 600 دقیقه برای شروع، سپس یک ماه رایگان اضافه کردن.

Distil-Whisper تحت MIT منتشر می‌شود، یک مجوز آزاد آزاد. شما می‌توانید خودتان Distil-Whisper را در سخت‌افزار خود میزبانی کنید یا از نسخه میزبانی شده ما استفاده کنید - هر دو قابل استفاده تجاری هستند.

Distil-Whisper از زبان‌های 99 پشتیبانی می‌کند. تشخیص خودکار زبان درست را برای بیشتر صداها انتخاب می‌کند؛ همچنین می‌توانید آن را برای یک بالا رفتن دقت کوچک دستی مشخص کنید.

Distil-Whisper processes audio at about 48.0x real-time on our GPUs. A 1-hour audio file finishes in under 1 minutes; longer files queue and notify by email when done.

Distil-Whisper has 756M parameters. Larger models tend to be more accurate but slower; STT.ai hosts Distil-Whisper on GPU so the parameter count doesn't affect your client-side performance.

Distil-Whisper هر فرمتی را که STT.ai پشتیبانی می‌کند را می‌پذیرد - MP3, WAV, M4A, FLAC, OGG, MP4, MKV, MOV, WebM, AVI و دیگران.

بله. نوشتار شنونده در کنار Distil-Whisper برای هر رونوشت اجرا می شود — هر شنونده برچسب گذاری شده و می توانید بعداً آنها را در ویرایشگر تغییر نام دهید.

بله. Distil-Whisper در محیط مدیریت شده ما اجرا می‌شود - صدا به صورت پیشفرض پردازش و حذف می‌شود و هیچگاه برای آموزش بدون انتخاب صریح استفاده نمی‌شود. برنامه‌های Pro رمزگذاری سمت مشتری را برای رونوشت‌های در حال استراحت اضافه می‌کنند.

Use the compare-stt tool to run Distil-Whisper against any other supported model on the same audio — you'll see WER, segment count, speaker labels, and confidence scores side-by-side. The Distil-Whisper vs Whisper Large V3 comparison is the most commonly run.

بله. "distil-whisper" را به عنوان پارامتر مدل در /v1/transcribe endpoint مشخص کنید. Python و Node.js SDK شامل نمونه‌های Distil-Whisper هستند. سطح API رایگان شامل ۱۰۰ دقیقه در ماه است.

بله. چون Distil-Whisper دارای مجوز MIT است، شما می‌توانید آن را خودتان میزبانی کنید. صفحهٔ منبع باز STT.ai فهرستی از پروژه و وزن‌ها را ارائه می‌دهد. بیشتر تیم‌های تولید از نسخهٔ میزبانی شده ما برای فراموش کردن خرید GPU، مبادلات مدل و عملیات استفاده می‌کنند.