رونوشت با STT.ai Enhanced
4.2%
WER
99
زبانها
15.9x
سرعت
MIT
مجوز
در مورد STT.ai Enhanced
STT.ai Enhanced دقت و سرعت مدل گفتار به متن ماست. ساخته شده بر روی معماری تبدیل پیشرو با بهینهسازیهای انحصاری، نرخ خطای کلمات پیشرو در صنعت را در بیش از 100 زبان ارائه میدهد. ایدهآل برای رونویسی تولید، زیرنویسهای زمان واقعی و برنامههای کاربردی شرکتی.
✦ باز کردن مدل بهبودیافته
Get access to our most accurate model with any paid plan — Whisper large-v3, 99 languages, and speaker diarization.
نمایش نقشه →اطلاعات مدل
- ارائهدهندهOpenAI (hosted by STT.ai)
- معماری-
- مجوزMIT
- به روزرسانیAug 2026
پرسشهای متداول
STT.ai میزبان STT.ai Enhanced در زیرساخت GPU ماست بنابراین میتوانید بدون فراهم کردن سختافزار خود از آن استفاده کنید - صدا یا ویدئو را بارگذاری کنید و STT.ai Enhanced را از گزینش مدل انتخاب کنید.
On standard benchmarks, STT.ai Enhanced achieves around 4.2% Word Error Rate. Real-world accuracy depends on audio quality, accent, and language; for noisy or accented recordings, expect a few percentage points higher WER.
STT.ai Enhanced یک مدل پریمیوم است که در هر برنامهٔ پرداختی STT.ai با قیمت ۵ دلار در ماه شامل میشود.این در سطح رایگان در دسترس نیست: بارگذاریهای رایگان و ناشناس در عوض Whisper Turbo را اجرا میکنند.
STT.ai Enhanced تحت MIT منتشر میشود، یک مجوز آزاد آزاد. شما میتوانید خودتان STT.ai Enhanced را در سختافزار خود میزبانی کنید یا از نسخه میزبانی شده ما استفاده کنید - هر دو قابل استفاده تجاری هستند.
STT.ai Enhanced از زبانهای 99 پشتیبانی میکند. تشخیص خودکار زبان درست را برای بیشتر صداها انتخاب میکند؛ همچنین میتوانید آن را برای یک بالا رفتن دقت کوچک دستی مشخص کنید.
STT.ai Enhanced processes audio at about 15.9x real-time on our GPUs. A 1-hour audio file finishes in under 3 minutes; longer files queue and notify by email when done.
STT.ai Enhanced has 1.55B parameters. Larger models tend to be more accurate but slower; STT.ai hosts STT.ai Enhanced on GPU so the parameter count doesn't affect your client-side performance.
STT.ai Enhanced هر فرمتی را که STT.ai پشتیبانی میکند را میپذیرد - MP3, WAV, M4A, FLAC, OGG, MP4, MKV, MOV, WebM, AVI و دیگران.
بله. نوشتار شنونده در کنار STT.ai Enhanced برای هر رونوشت اجرا می شود — هر شنونده برچسب گذاری شده و می توانید بعداً آنها را در ویرایشگر تغییر نام دهید.
بله. STT.ai Enhanced در زیرساخت خصوصی ما اجرا میشود - صدا به صورت پیشفرض پردازش و حذف میشود. Pro+ رمزگذاری سمت مشتری را اضافه میکند تا رونوشتها بدون کلید شما قابل خواندن نباشند، و Private Cloud به شما اجازه میدهد که STT.ai Enhanced را کاملاً در VPC خود خود میزبانی کنید.
Use the compare-stt tool to run STT.ai Enhanced against any other supported model on the same audio — you'll see WER, segment count, speaker labels, and confidence scores side-by-side. The STT.ai Enhanced vs Whisper Large V3 comparison is the most commonly run.
بله. "stt-ai-enhanced" را به عنوان پارامتر مدل در /v1/transcribe endpoint مشخص کنید. Python و Node.js SDK شامل نمونههای STT.ai Enhanced هستند. سطح API رایگان شامل ۱۰۰ دقیقه در ماه است.
بله. چون STT.ai Enhanced دارای مجوز MIT است، شما میتوانید آن را خودتان میزبانی کنید. صفحهٔ منبع باز STT.ai فهرستی از پروژه و وزنها را ارائه میدهد. بیشتر تیمهای تولید از نسخهٔ میزبانی شده ما برای فراموش کردن خرید GPU، مبادلات مدل و عملیات استفاده میکنند.