SenseVoice
Zobraziť všetky STT.ai nespúšťa tento model. Táto stránka je referenčné informácie o ňom.
Prepisujte s modelmi, ktoré prevádzkujeme →
5.5%
WER
50
Jazyky
50.0x
Rýchlosť
MIT
Licencia
O nás SenseVoice
SenseVoice je model pre prepis reči od FunAudioLLM, ktorý podporuje viac ako 50 jazykov a zahŕňa schopnosti pre rozpoznávanie emócií, detekciu zvukových udalostí a inverznú normalizáciu textu v jednom modeli.
Jazyky podporované SenseVoice
Informácie o modeli
- PoskytovateľFunAudioLLM
- Architektúra-
- LicenciaMIT
- AktualizovanéMar 2026
Často kladené otázky
SenseVoice je model pre prevod reči na text od FunAudioLLM. STT.ai momentálne nefunguje SenseVoice — táto stránka je referenčná informácia o modeli. Pre prepis na STT.ai, výber modelu ponúka Whisper rodinu (Turbo, Large V3, Medium, Small).
V štandardných testoch dosahuje SenseVoice okolo 5.5% Word Error Rate.Reálna presnosť závisí od kvality zvuku, prízvuku a jazyka; pre hlučné alebo akcentované nahrávky očakávajte o niekoľko percentuálnych bodov vyššiu WER.
SenseVoice nie je k dispozícii na STT.ai, jeho vlastné licenčné podmienky upravujú jeho vlastné spustenie. Bezplatná úroveň STT.ai pokrýva modely Whisper, ktoré používame – 600 minút na spustenie, potom bezplatné mesačné dobíjanie.
SenseVoice je vydaný pod MIT, povolenou open-source licenciou.SenseVoice môžete hosťovať na svojom vlastnom hardvéri alebo použiť našu hosťovanú verziu — obe sú komerčne použiteľné.
SenseVoice podporuje 50 jazykov.Automatická detekcia vyberie správny jazyk pre väčšinu zvuku; môžete ho tiež zadať manuálne pre malý nárast presnosti.
SenseVoice spracováva zvuk približne 50.0x v reálnom čase na našich grafických procesoroch. 1-hodinový zvukový súbor sa dokončí za menej ako 1 minút. Dlhšie súbory sa ukladajú do frontu a po dokončení sa upozornia e-mailom.
Väčšie modely majú tendenciu byť presnejšie, ale pomalšie; STT.ai hostí SenseVoice na GPU, takže počet parametrov neovplyvňuje výkon na strane klienta.
SenseVoice prijíma všetky formáty, ktoré podporuje STT.ai — MP3, WAV, M4A, FLAC, OGG, MP4, MKV, MOV, WebM, AVI a ďalšie.Výstup ako TXT, SRT, VTT, DOCX, JSON alebo PDF.
Diarizácia hovoriacich beží spolu s SenseVoice pre každý prepis — každý hovoriaci je označený a môžete ho neskôr premenovať v editore.
Áno, SenseVoice je spustené v našom spravovanom prostredí – zvuk sa predvolene spracováva a odstraňuje a nikdy sa nepoužíva na školenie bez výslovného súhlasu. Plány Pro pridávajú šifrovanie na strane klienta pre prepisy v pokoji.
Použite nástroj compare-stt na porovnanie SenseVoice s akýmkoľvek iným podporovaným modelom na rovnakom zvuku. Uvidíte WER, počet segmentov, popisky reproduktorov a skóre spoľahlivosti vedľa seba. Porovnanie SenseVoice vs Whisper Large V3 je najčastejšie používané.
Áno. Ako parameter modelu v koncovom bode /v1/transcribe zadajte hodnotu sensevoice. Súpravy SDK pre jazyk Python a jazyk Node.js obsahujú príklady pre hodnotu SenseVoice.
Áno, pretože SenseVoice je licencovaný na MIT, môžete ho hosťovať sami.Stránka s otvoreným zdrojovým kódom STT.ai uvádza úložisko projektu a váhy.Väčšina produkčných tímov používa našu hosťovanú verziu na preskočenie obstarávania GPU, výmen modelov a operácií.