STT.ai Enhanced

STT.ai يقوم بتشغيل هذا النموذج على المستوى المدفوع. إنه النموذج وراء STT.ai المعزز. النسخ الحر يستخدم Whisper Large v3 Turbo، وهو أسرع. انظر الخطط → · .. لقد حدثت مشكلة →
4.2%
WER
99
اللغات
15.9x
السرعة
MIT
الترخيص

حول STT.ai Enhanced

STT.ai Enhanced هو نموذجنا الأكثر دقة وأسرع لتحويل الكلام إلى نص. وهو مبني على أحدث بنية تحويل مع تحسينات مسجلة الملكية، وهو يوفر معدلات أخطاء الكلمات الرائدة في الصناعة عبر أكثر من 100 لغة. مثالي للنسخ الإنتاجي، والشروح النصية في الوقت الحقيقي، وتطبيقات الشركات.
✦ فتح النموذج المعزز

احصل على الوصول إلى نموذجنا الأكثر دقة مع أي خطة مدفوعة - Whisper large-v3، 99 لغات، و المتحدث دياريزي.

عرض الخطط →
معلومات النموذج
  • مقدم الخدمةOpenAI (hosted by STT.ai)
  • الهندسة المعمارية-
  • الترخيصMIT
  • مستكملةAug 2026

الأسئلة الشائعة

STT.ai Enhanced is a speech-to-text model by OpenAI (hosted by STT.ai). STT.ai runs it on our own GPU for accounts on a paid plan, and it is the model behind the STT.ai Enhanced tier. Free transcription uses Whisper Large v3 Turbo, the faster checkpoint of the same family.

على المعايير القياسية، STT.ai Enhanced يحقق حوالي 4.2% معدل خطأ الكلمات. تعتمد دقة العالم الحقيقي على جودة الصوت، والهجة، واللغة؛ بالنسبة للتسجيلات المضطربة أو الملفتة، توقع بضع نقاط مئوية أعلى WER.

STT.ai Enhanced هو نموذج أداء أعلى - متضمنة مع أي خطة STT.ai مدفوعة تبدأ من $9/شهر. فهو غير متاح على المستوى المجاني: تحميل مجاني وغير معروف يجري Whisper Turbo بدلا من ذلك.

STT.ai Enhanced يصدر تحت رخصة MIT، وهي رخصة مفتوحة المصدر متساهلة. يمكنك استضافة STT.ai Enhanced على أجهزة الكمبيوتر الخاصة بك أو استخدام نسختنا المستضافة - وكلاهما قابل للاستخدام التجاري.

STT.ai Enhanced يدعم 99 لغات. الكشف التلقائي يختار اللغة الصحيحة لمعظم الصوتيات؛ يمكنك أيضا تحديدها يدويا لزيادة الدقة قليلا.

STT.ai Enhanced يقوم بمعالجة الصوت بحوالي 15.9x في الوقت الحقيقي على وحدات المعالجة المركزية لدينا. ملف صوت لمدة ساعة واحدة ينتهي في أقل من 3 دقيقة؛ الملفات الأطول توضع في صف وتخطر بالبريد الإلكتروني عند الانتهاء.

النماذج الأكبر تميل إلى أن تكون أكثر دقة ولكنها أبطأ؛ STT.ai تستضيف STT.ai Enhanced على وحدة المعالجة المركزية الرسومية بحيث لا يؤثر عدد البارامترات على أداء جانب العميل.

STT.ai Enhanced يقبل كل صيغة STT.ai يدعمها - MP3, WAV, M4A, FLAC, OGG, MP4, MKV, MOV, WebM, AVI, وغيرها.خرج TXT, SRT, VTT, DOCX, JSON, أو PDF.

نعم، تشغيل تسجيل المتحدثين إلى جانب STT.ai Enhanced لكل نسخة - كل متحدث يحمل علامة ويمكنك إعادة تسميتهم في المحرر بعد ذلك.

نعم. STT.ai Enhanced يعمل في بنية تحتية خاصة - الصوت يتم معالجته وحذفها تلقائيا. Pro + يضيف تشفير جانب العميل بحيث تكون النصوص غير مقروءة بدون مفتاحك، والسحابة الخاصة تسمح لك استضافة STT.ai Enhanced بالكامل في VPC الخاص بك.

استخدم أداة compare-stt لتشغيل STT.ai Enhanced ضد أي نموذج مدعوم آخر على نفس الصوت - سترى WER، عدد القطاعات، علامات المتحدث، وعلامات الثقة جنبًا إلى جنب.

نعم، على خطة مدفوعة. حدد "stt-ai-enhanced" كبارامترات النموذج على نقطة النهاية /v1/transcribe. المفاتيح بدون خطة نشطة يتم تقديمها Whisper Large v3 Turbo بدلاً من ذلك. الطلب لا يزال ناجحاً؛ إنه فقط يقوم بتشغيل النموذج المجاني.

نعم، لأن STT.ai Enhanced مرخصة من قبل MIT، يمكنك استضافتها بنفسك. صفحة المصدر المفتوح لـ STT.ai تتضمن قائمة بمشروع إعادة تخزين المشروع وأوزانه. معظم فرق الإنتاج تستخدم نسختنا المستضافة لتجاوز شراء وحدة المعالجة الرسومية، ومبادلات النماذج، والعمليات.