SenseVoice
STT.ai این مدل را اجرا نمیکند. این صفحه اطلاعات مرجع در مورد آن است.
با مدل هايي که اجرا ميکنيم رونوشت کن →
5.5%
WER
50
زبانها
50.0x
سرعت
MIT
مجوز
در مورد SenseVoice
SenseVoice یک مدل پایهٔ گفتار از FunAudioLLM است که فراتر از رونویسی میرود. این از ۵۰ زبان پشتیبانی میکند و قابلیتهای شناسایی احساسات، شناسایی رویدادهای صوتی و نرمسازی متن معکوس را در یک مدل واحد شامل میشود.
اطلاعات مدل
- ارائهدهندهFunAudioLLM
- معماری-
- مجوزMIT
- به روزرسانیMar 2026
پرسشهای متداول
SenseVoice یک مدل گفتار به متن توسط FunAudioLLM است. STT.ai در حال حاضر SenseVoice را اجرا نمیکند — این صفحه اطلاعات مرجع در مورد مدل است. برای رونویسی در STT.ai ، انتخابکننده مدل خانواده Whisper (Turbo, Large V3, Medium, Small) را ارائه میدهد.
On standard benchmarks, SenseVoice achieves around 5.5% Word Error Rate. Real-world accuracy depends on audio quality, accent, and language; for noisy or accented recordings, expect a few percentage points higher WER.
SenseVoice در STT.ai در دسترس نیست. شرایط مجوز خود را برای اجرای خود تنظیم میکند. STT.ai سطح رایگان مدل Whisper را پوشش میدهد که ما اجرا میکنیم - 600 دقیقه برای شروع، سپس یک ماه رایگان اضافه کردن.
SenseVoice تحت MIT منتشر میشود، یک مجوز آزاد آزاد. شما میتوانید خودتان SenseVoice را در سختافزار خود میزبانی کنید یا از نسخه میزبانی شده ما استفاده کنید - هر دو قابل استفاده تجاری هستند.
SenseVoice از زبانهای 50 پشتیبانی میکند. تشخیص خودکار زبان درست را برای بیشتر صداها انتخاب میکند؛ همچنین میتوانید آن را برای یک بالا رفتن دقت کوچک دستی مشخص کنید.
SenseVoice processes audio at about 50.0x real-time on our GPUs. A 1-hour audio file finishes in under 1 minutes; longer files queue and notify by email when done.
SenseVoice has 234M parameters. Larger models tend to be more accurate but slower; STT.ai hosts SenseVoice on GPU so the parameter count doesn't affect your client-side performance.
SenseVoice هر فرمتی را که STT.ai پشتیبانی میکند را میپذیرد - MP3, WAV, M4A, FLAC, OGG, MP4, MKV, MOV, WebM, AVI و دیگران.
بله. نوشتار شنونده در کنار SenseVoice برای هر رونوشت اجرا می شود — هر شنونده برچسب گذاری شده و می توانید بعداً آنها را در ویرایشگر تغییر نام دهید.
بله. SenseVoice در محیط مدیریت شده ما اجرا میشود - صدا به صورت پیشفرض پردازش و حذف میشود و هیچگاه برای آموزش بدون انتخاب صریح استفاده نمیشود. برنامههای Pro رمزگذاری سمت مشتری را برای رونوشتهای در حال استراحت اضافه میکنند.
Use the compare-stt tool to run SenseVoice against any other supported model on the same audio — you'll see WER, segment count, speaker labels, and confidence scores side-by-side. The SenseVoice vs Whisper Large V3 comparison is the most commonly run.
بله. "sensevoice" را به عنوان پارامتر مدل در /v1/transcribe endpoint مشخص کنید. Python و Node.js SDK شامل نمونههای SenseVoice هستند. سطح API رایگان شامل ۱۰۰ دقیقه در ماه است.
بله. چون SenseVoice دارای مجوز MIT است، شما میتوانید آن را خودتان میزبانی کنید. صفحهٔ منبع باز STT.ai فهرستی از پروژه و وزنها را ارائه میدهد. بیشتر تیمهای تولید از نسخهٔ میزبانی شده ما برای فراموش کردن خرید GPU، مبادلات مدل و عملیات استفاده میکنند.