Distil-Whisper
STT.ai ले यो नमूना चलाउँदैन । यो पृष्ठ यसका बारेमा सन्दर्भ सूचना हो ।
हामी चलाउने नमूनाहरूसँग प्रतिलिपि गर्नुहोस् →
5.8%
WER
99
भाषा
48.0x
गति
MIT
इजाजतपत्र
यसका बारेमा Distil-Whisper
Distil-Whisper Hugging Face द्वारा सिर्जना Whisper को एक डिस्टाइल संस्करण हो। यो 49% द्वारा मोडेल साइज घटाउँछ र बाहिर-को-वितरण मूल्यांकन सेट मा मूल Whisper ठूलो V2 को 1% WER भित्र कायम राख्दै 6x छिटो inference प्राप्त गर्दछ।
नमूना सूचना
- प्रदायकHugging Face
- वास्तुकला-
- इजाजतपत्रMIT
- अद्यावधिक गर्नुहोस्Mar 2026
प्राय सोधिने प्रश्नहरू
Distil-Whisper Hugging Face द्वारा एक भाषण- पाठ मोडेल हो। STT.ai हाल Distil-Whisper चल्दैन - यो पृष्ठ मोडेलको बारेमा सन्दर्भ सूचना हो। STT.ai मा पदानुक्रमका लागि, मोडेल चयनकर्ताले Whisper परिवार (Turbo, Large V3, Medium, Small) प्रस्ताव गर्दछ।
मानक बेन्चमार्क मा, Distil-Whisper वरिपरि 5.8% शब्द त्रुटि दर प्राप्त गर्दछ। वास्तविक-विश्व सटीकता अडियो गुणस्तर, उच्चारण, र भाषा निर्भर गर्दछ; हल्ला वा उच्चारण रेकर्ड लागि, केही प्रतिशत अंक उच्च WER अपेक्षा।
Distil-Whisper STT.ai मा उपलब्ध छैन। यसको आफ्नै लाइसेन्स शर्तहरू आफैलाई चलाउन शासन गर्दछ। STT.ai को निःशुल्क तहले हामी चलाउने Whisper मोडेलहरू कभर गर्दछ - सुरु गर्न 600 मिनेट, त्यसपछि एक मासिक निःशुल्क टॉप-अप।
Distil-Whisper MIT, एक permissive खुला स्रोत लाइसेन्स अन्तर्गत जारी गरिएको छ। तपाईं आफ्नो हार्डवेयर मा स्व-होस्ट गर्न सक्नुहुन्छ Distil-Whisper वा हाम्रो होस्ट गरिएको संस्करण प्रयोग गर्नुहोस् - दुवै व्यावसायिक रूपमा प्रयोग गर्न सकिन्छ।
Distil-Whisper ले 99 भाषाहरू समर्थन गर्दछ । स्वचालित पत्ता लगाउनले धेरै अडियोका लागि सही भाषा चयन गर्दछ; तपाईँले सानो सटीकता लिफ्टका लागि यसलाई म्यानुअल रूपमा पनि निर्दिष्ट गर्न सक्नुहुन्छ ।
Distil-Whisper हाम्रो GPUs मा 48.0x वास्तविक समयमा अडियो प्रक्रिया गर्दछ। एक 1-घण्टा अडियो फाइल 1 मिनेट अन्तर्गत समाप्त हुन्छ; लामो फाइलहरू लामबद्ध र इमेल द्वारा सूचना दिनुहोस् जब यो पूरा हुन्छ।
Distil-Whisper मा 756M परिमितिहरू छन्। ठूला नमूनाहरू अधिक सटीक तर ढिलो हुन्छन्; STT.ai ले GPU मा Distil-Whisper होस्ट गर्दछ त्यसैले परिमिति गणनाले तपाईँको क्लाइन्ट-साइड प्रदर्शनलाई असर गर्दैन।
Distil-Whisper हरेक ढाँचा स्वीकार गर्दछ STT.ai समर्थन - MP3, WAV, M4A, FLAC, OGG, MP4, MKV, MOV, WebM, AVI, र अन्य. TXT, SRT, VTT, DOCX, JSON, वा PDF रूपमा निर्गत।
हो. वक्ता diarization साथै चल्छ Distil-Whisper हरेक प्रतिलिपि लागि — प्रत्येक वक्ता लेबल छ र तपाईं पछि सम्पादक तिनीहरूलाई पुन: नाम गर्न सक्नुहुन्छ.
हो। Distil-Whisper हाम्रो प्रबन्धित वातावरणमा चल्छ - अडियो प्रक्रिया र पूर्वनिर्धारित द्वारा मेटिएको छ र स्पष्ट विकल्प बिना प्रशिक्षणको लागि कहिल्यै प्रयोग गरिएको छैन। प्रो योजनाहरू आराममा प्रतिलिपिहरूको लागि क्लाइन्ट-साइड एन्क्रिप्शन थप्दछ।
तुलना-STT उपकरण प्रयोग गर्न Distil-Whisper उही अडियो मा कुनै पनि अन्य समर्थित मोडेल विरुद्ध चलाउन - तपाईं WER देख्नेछन्, खण्ड गणना, वक्ता लेबल, र आत्मविश्वास स्कोर साइड-by-साइड. को Distil-Whisper विरुद्ध Whisper ठूलो V3 तुलना सबैभन्दा सामान्यतया चलाउन छ.
हो । /v1/transcribe अन्त बिन्दुमा मोडेल परिमितिको रूपमा "distil-whisper" निर्दिष्ट गर्नुहोस् । पाइथन र Node.js SDKs Distil-Whisper उदाहरण समावेश गर्दछ । निःशुल्क API तहमा 100 मिनेट / महिना समावेश छ ।
हो। किनभने Distil-Whisper MIT-लाइसेन्स गरिएको छ, तपाईं यसलाई स्व-होस्ट गर्न सक्नुहुन्छ। STT.ai को खुला स्रोत पृष्ठले परियोजना रिपो र वजन सूचीबद्ध गर्दछ। अधिकांश उत्पादन टोलीहरूले जीपीयू खरिद, मोडेल स्वीप र ओपीएस छोड्न हाम्रो होस्ट गरिएको संस्करण प्रयोग गर्दछ।