SenseVoice
STT.ai ले यो नमूना चलाउँदैन । यो पृष्ठ यसका बारेमा सन्दर्भ सूचना हो ।
हामी चलाउने नमूनाहरूसँग प्रतिलिपि गर्नुहोस् →
5.5%
WER
50
भाषा
50.0x
गति
MIT
इजाजतपत्र
यसका बारेमा SenseVoice
SenseVoice FunAudioLLM बाट एक भाषण आधार मोडेल हो जुन प्रतिलिपि भन्दा बाहिर जान्छ। यो 50+ भाषाहरू समर्थन गर्दछ र एकल मोडेलमा भावना पहिचान, अडियो घटना पत्ता लगाउन र उल्टो पाठ सामान्यीकरणको लागि क्षमताहरू समावेश गर्दछ।
नमूना सूचना
- प्रदायकFunAudioLLM
- वास्तुकला-
- इजाजतपत्रMIT
- अद्यावधिक गर्नुहोस्Mar 2026
प्राय सोधिने प्रश्नहरू
SenseVoice FunAudioLLM द्वारा एक भाषण- पाठ मोडेल हो। STT.ai हाल SenseVoice चल्दैन - यो पृष्ठ मोडेलको बारेमा सन्दर्भ सूचना हो। STT.ai मा पदानुक्रमका लागि, मोडेल चयनकर्ताले Whisper परिवार (Turbo, Large V3, Medium, Small) प्रस्ताव गर्दछ।
मानक बेन्चमार्क मा, SenseVoice वरिपरि 5.5% शब्द त्रुटि दर प्राप्त गर्दछ। वास्तविक-विश्व सटीकता अडियो गुणस्तर, उच्चारण, र भाषा निर्भर गर्दछ; हल्ला वा उच्चारण रेकर्ड लागि, केही प्रतिशत अंक उच्च WER अपेक्षा।
SenseVoice STT.ai मा उपलब्ध छैन। यसको आफ्नै लाइसेन्स शर्तहरू आफैलाई चलाउन शासन गर्दछ। STT.ai को निःशुल्क तहले हामी चलाउने Whisper मोडेलहरू कभर गर्दछ - सुरु गर्न 600 मिनेट, त्यसपछि एक मासिक निःशुल्क टॉप-अप।
SenseVoice MIT, एक permissive खुला स्रोत लाइसेन्स अन्तर्गत जारी गरिएको छ। तपाईं आफ्नो हार्डवेयर मा स्व-होस्ट गर्न सक्नुहुन्छ SenseVoice वा हाम्रो होस्ट गरिएको संस्करण प्रयोग गर्नुहोस् - दुवै व्यावसायिक रूपमा प्रयोग गर्न सकिन्छ।
SenseVoice ले 50 भाषाहरू समर्थन गर्दछ । स्वचालित पत्ता लगाउनले धेरै अडियोका लागि सही भाषा चयन गर्दछ; तपाईँले सानो सटीकता लिफ्टका लागि यसलाई म्यानुअल रूपमा पनि निर्दिष्ट गर्न सक्नुहुन्छ ।
SenseVoice हाम्रो GPUs मा 50.0x वास्तविक समयमा अडियो प्रक्रिया गर्दछ। एक 1-घण्टा अडियो फाइल 1 मिनेट अन्तर्गत समाप्त हुन्छ; लामो फाइलहरू लामबद्ध र इमेल द्वारा सूचना दिनुहोस् जब यो पूरा हुन्छ।
SenseVoice मा 234M परिमितिहरू छन्। ठूला नमूनाहरू अधिक सटीक तर ढिलो हुन्छन्; STT.ai ले GPU मा SenseVoice होस्ट गर्दछ त्यसैले परिमिति गणनाले तपाईँको क्लाइन्ट-साइड प्रदर्शनलाई असर गर्दैन।
SenseVoice हरेक ढाँचा स्वीकार गर्दछ STT.ai समर्थन - MP3, WAV, M4A, FLAC, OGG, MP4, MKV, MOV, WebM, AVI, र अन्य. TXT, SRT, VTT, DOCX, JSON, वा PDF रूपमा निर्गत।
हो. वक्ता diarization साथै चल्छ SenseVoice हरेक प्रतिलिपि लागि — प्रत्येक वक्ता लेबल छ र तपाईं पछि सम्पादक तिनीहरूलाई पुन: नाम गर्न सक्नुहुन्छ.
हो। SenseVoice हाम्रो प्रबन्धित वातावरणमा चल्छ - अडियो प्रक्रिया र पूर्वनिर्धारित द्वारा मेटिएको छ र स्पष्ट विकल्प बिना प्रशिक्षणको लागि कहिल्यै प्रयोग गरिएको छैन। प्रो योजनाहरू आराममा प्रतिलिपिहरूको लागि क्लाइन्ट-साइड एन्क्रिप्शन थप्दछ।
तुलना-STT उपकरण प्रयोग गर्न SenseVoice उही अडियो मा कुनै पनि अन्य समर्थित मोडेल विरुद्ध चलाउन - तपाईं WER देख्नेछन्, खण्ड गणना, वक्ता लेबल, र आत्मविश्वास स्कोर साइड-by-साइड. को SenseVoice विरुद्ध Whisper ठूलो V3 तुलना सबैभन्दा सामान्यतया चलाउन छ.
हो । /v1/transcribe अन्त बिन्दुमा मोडेल परिमितिको रूपमा "sensevoice" निर्दिष्ट गर्नुहोस् । पाइथन र Node.js SDKs SenseVoice उदाहरण समावेश गर्दछ । निःशुल्क API तहमा 100 मिनेट / महिना समावेश छ ।
हो। किनभने SenseVoice MIT-लाइसेन्स गरिएको छ, तपाईं यसलाई स्व-होस्ट गर्न सक्नुहुन्छ। STT.ai को खुला स्रोत पृष्ठले परियोजना रिपो र वजन सूचीबद्ध गर्दछ। अधिकांश उत्पादन टोलीहरूले जीपीयू खरिद, मोडेल स्वीप र ओपीएस छोड्न हाम्रो होस्ट गरिएको संस्करण प्रयोग गर्दछ।