SenseVoice

STT.ai این مدل را اجرا نمی‌کند. این صفحه اطلاعات مرجع در مورد آن است. با مدل هايي که اجرا ميکنيم رونوشت کن →
5.5%
WER
50
زبانها
50.0x
سرعت
MIT
مجوز

در مورد SenseVoice

SenseVoice یک مدل پایهٔ گفتار از FunAudioLLM است که فراتر از رونویسی می‌رود. این از ۵۰ زبان پشتیبانی می‌کند و قابلیت‌های شناسایی احساسات، شناسایی رویدادهای صوتی و نرم‌سازی متن معکوس را در یک مدل واحد شامل می‌شود.
اطلاعات مدل
  • ارائه‌دهندهFunAudioLLM
  • معماری-
  • مجوزMIT
  • به روزرسانیMar 2026

پرسشهای متداول

SenseVoice یک مدل گفتار به متن توسط FunAudioLLM است. STT.ai در حال حاضر SenseVoice را اجرا نمی‌کند — این صفحه اطلاعات مرجع در مورد مدل است. برای رونویسی در STT.ai ، انتخاب‌کننده مدل خانواده Whisper (Turbo, Large V3, Medium, Small) را ارائه می‌دهد.

On standard benchmarks, SenseVoice achieves around 5.5% Word Error Rate. Real-world accuracy depends on audio quality, accent, and language; for noisy or accented recordings, expect a few percentage points higher WER.

SenseVoice در STT.ai در دسترس نیست. شرایط مجوز خود را برای اجرای خود تنظیم می‌کند. STT.ai سطح رایگان مدل Whisper را پوشش می‌دهد که ما اجرا می‌کنیم - 600 دقیقه برای شروع، سپس یک ماه رایگان اضافه کردن.

SenseVoice تحت MIT منتشر می‌شود، یک مجوز آزاد آزاد. شما می‌توانید خودتان SenseVoice را در سخت‌افزار خود میزبانی کنید یا از نسخه میزبانی شده ما استفاده کنید - هر دو قابل استفاده تجاری هستند.

SenseVoice از زبان‌های 50 پشتیبانی می‌کند. تشخیص خودکار زبان درست را برای بیشتر صداها انتخاب می‌کند؛ همچنین می‌توانید آن را برای یک بالا رفتن دقت کوچک دستی مشخص کنید.

SenseVoice processes audio at about 50.0x real-time on our GPUs. A 1-hour audio file finishes in under 1 minutes; longer files queue and notify by email when done.

SenseVoice has 234M parameters. Larger models tend to be more accurate but slower; STT.ai hosts SenseVoice on GPU so the parameter count doesn't affect your client-side performance.

SenseVoice هر فرمتی را که STT.ai پشتیبانی می‌کند را می‌پذیرد - MP3, WAV, M4A, FLAC, OGG, MP4, MKV, MOV, WebM, AVI و دیگران.

بله. نوشتار شنونده در کنار SenseVoice برای هر رونوشت اجرا می شود — هر شنونده برچسب گذاری شده و می توانید بعداً آنها را در ویرایشگر تغییر نام دهید.

بله. SenseVoice در محیط مدیریت شده ما اجرا می‌شود - صدا به صورت پیشفرض پردازش و حذف می‌شود و هیچگاه برای آموزش بدون انتخاب صریح استفاده نمی‌شود. برنامه‌های Pro رمزگذاری سمت مشتری را برای رونوشت‌های در حال استراحت اضافه می‌کنند.

Use the compare-stt tool to run SenseVoice against any other supported model on the same audio — you'll see WER, segment count, speaker labels, and confidence scores side-by-side. The SenseVoice vs Whisper Large V3 comparison is the most commonly run.

بله. "sensevoice" را به عنوان پارامتر مدل در /v1/transcribe endpoint مشخص کنید. Python و Node.js SDK شامل نمونه‌های SenseVoice هستند. سطح API رایگان شامل ۱۰۰ دقیقه در ماه است.

بله. چون SenseVoice دارای مجوز MIT است، شما می‌توانید آن را خودتان میزبانی کنید. صفحهٔ منبع باز STT.ai فهرستی از پروژه و وزن‌ها را ارائه می‌دهد. بیشتر تیم‌های تولید از نسخهٔ میزبانی شده ما برای فراموش کردن خرید GPU، مبادلات مدل و عملیات استفاده می‌کنند.