SenseVoice
STT.ai इत्यनेन यन्त्रेण इदं मॉडल् चालयितुं शक्यते। इदं यन्त्रम् अस्मिन् विषये सूचयति।
वर्तन्ते च →
5.5%
WER
50
भाषाः
50.0x
गतिः
MIT
लाइसेन्स
विषये SenseVoice
SenseVoice इति FunAudioLLM इत्यस्य भाषणस्य आधारभूतः मॉडेलः अस्ति, यस्मिन् 50+ भाषाः समर्थिताः सन्ति, एतादृशः मॉडेलः यदा एकस्मिन् यन्त्रे इमोशन-रिकोग्नीशन, ऑडियो-इवेंट्स-डिटेक्शन, तथा इनवर्स् टेक्स्ट-नोर्मलिजेशन-कार्यक्षमताम् च समाहितम् अस्ति ।
भाषाः SenseVoice
मॉडेल- सूचना
- प्रदाताFunAudioLLM
- आर्किटेक्चर-
- लाइसेन्सMIT
- अद्यतनीकृतःMar 2026
यदा-कदा सोध्यमानानि प्रश्नानि
SenseVoice FunAudioLLM द्वारा निर्मित एक भाषण-से-पाठ मॉडल है। STT.ai वर्तमान में SenseVoice चलाता नहीं है - यह पृष्ठ मॉडल के बारे में जानकारी है। STT.ai पर ट्रांसक्रिप्शन के लिए, मॉडल चुनने वाला Whisper परिवार (Turbo, Large V3, Medium, Small) प्रदान करता है।
SenseVoice-या 5.5% शब्द-त्रुटि-दरः अस्ति। वास्तविक-विश्वे त्रुटि-निवारणं ध्वनि-गुणवत्ते, उच्चारणे, भाषायां च निर्भरम् अस्ति। शोरमय-या उच्चारणयुक्त-रेकॉर्डिङ्ग-कार्ये WER-गुणवत्तेः प्रति प्रतिशतं 100% अधिकं भविष्यति।
SenseVoice STT.ai पर उपलब्धं नास्ति। STT.ai पर तस्य स्वेच्छानुज्ञायाः नियमाः अस्ति। STT.ai's free tier covers the Whisper models we do run — 600 minutes to start, then a monthly free top-up.
SenseVoice MIT, एकः अनुकूलः ओपन-सोर्स-लिसिन् इत्यनेन जारीः अस्ति । SenseVoice तम् अहं स्व-होस्टं कृत्वा तम् अहं ह्यर्डवेर् परं स्थापयितुं शक्नुमि, अथवा तम् अहं ह्यर्डवेर् परं स्थापयितुं शक्नुमि — एतयोः द्वयोः व्यापारिकः उपयोगः क्रियते ।
SenseVoice 50 भाषान् समर्थयति । स्वचालित-दृष्टिः अधिकतरेभ्यः ऑडियोभ्यः उचितं भाषां चेत् । तव येन प्रकारेण स्वचालिततया चेत् तात्पुरं अधिकं स्थिरं भाषां चेत् ।
SenseVoice प्रोसेसस् ऑडियो 50.0x रियल-टाइम परन्तु आमने-सामने GPUs. एक 1-घण्टा ऑडियो फाइल 1 मिनटे समाप्तः; अधिक फाइल्स क्यूएन्, तथा इलेक्ट्रॉनिक-मेल द्वारा सूचना दीयते जब पूरा किया जाता है।
SenseVoice स्य 234M परमाणुः सन्ति । बृहत् मॉडेलः अधिकं सटीकं तथापि धीमं भवति । STT.ai SenseVoice म् GPU परम् स्थापयति, अतः परमाणुसंख्या स्य क्लायन्ट-साइड परफॉर्मेन्सिम् न प्रभाविता भवति ।
SenseVoice स्वीकरोति STT.ai समर्थितेषु सर्वेषु प्रारूपेषु — MP3, WAV, M4A, FLAC, OGG, MP4, MKV, MOV, WebM, AVI, and others. Output as TXT, SRT, VTT, DOCX, JSON, or PDF.
Yes. Speaker diarization runs alongside SenseVoice for every transcription — each speaker is labeled and you can rename them in the editor afterwards.
SenseVoice सञ्चालितेषु वातावरणेषु सञ्चालितम् - अडियो प्रक्रियया प्रवर्त्यते, डिफॉल्टेन लोप्यते, तथा पर्यवेक्षणार्थं स्वीक्रियते। प्रो प्लान्स् क्रीडायां न सञ्चालितानां वार्तानां क्लायन्ट-साइड एन्क्रिप्शनम् आगच्छति।
SenseVoice सह अन्ये समर्थिताः मॉडेलः समाने ऑडियो पर्यन्तं चलयितुं compare-stt यन्त्रं सञ्चालितं भवति - WER, segment count, speaker labels, and confidence scores side-by-side दृश्यन्ते । SenseVoice वि Whisper Large V3 सह तुलना सर्वाधिकं प्रचलति ।
sensevoice इति मॉडेल-परिमाणम् /v1/transcribe-एण्डपॉइंट् पर्यन्तं निर्दिष्टं भवति। Python तथा Node.js SDKs SenseVoice उदाहरणानि समाविष्टानि सन्ति। मुफ्त-API-स्तरे 100 मिनटाः/मासः समाविष्टाः सन्ति।
STT.ai's open-source page lists the project repo and weights. Most production teams use our hosted version to skip GPU procurement, model swaps, and ops. STT.ai's open-source page lists the project repo and weights.