Transcribe with SenseVoice
5.5%
WER
50
Languages
50.0x
Speed
MIT
License
About SenseVoice
Model Info
- ProviderFunAudioLLM
- Architecture-
- LicenseMIT
- UpdatedMar 2026
Кўп бериладиган саволлар
SenseVoice FunAudioLLM томонидан сўздан матнга моделдир. STT.ai SenseVoice ни GPU инфратузилмасида сақлайди, шунинг учун сиз уни ўз жиҳозингизни таъминламасдан фойдалана оласиз — аудио ёки видео юклаб олиб, SenseVoice ни модел танловчидан танлайсиз.
Стандарт бенчмаркларда SenseVoice та сўз хатосининг 5.5% га етишини кўрсатади. Ҳақиқий аниқлик аудио сифати, акцент ва тилга боғлиқ; шовқинли ёки акцентли ёзувлар учун WER дан бир неча фоиз юқори бўлишини кутиш мумкин.
SenseVoice STT.ai'нинг бепул даражасида ишлайди — ҳар бир меҳмон ойига 600 дақиқа бепул олади. Умумий тарифлар ҳар бир файл учун узоқроқ чегараларни, шахсий транскриптларни ва устувор навбатни қўшиб беради.
SenseVoice MIT лицензияси остида чиқарилган, бу оммавий очиқ манбали лицензиядир. Сиз SenseVoice ни ўз қурилмангизда ёки бизнинг хост қилинган версиямизда ўзингизга жойлаштирсангиз бўлади — иккаласи ҳам савдо учун ишлатилиши мумкин.
SenseVoice 50 тилларни қўллаб-қувватлайди. Авто-таърифлаш кўплаб аудио учун тўғри тилни танлайди; сиз уни кичик аниқлик учун қўлда ҳам белгилашингиз мумкин.
SenseVoice аудиони GPUларда 50.0x реал вақтда ишлайди. 1 соатлик аудио файл 1 дақиқада тугайди; узун файллар навбатда туради ва тугаганида электрон почта орқали хабар беради.
SenseVoice нинг 234M параметрлари бор. Кўпроқ моделлар аниқроқ, аммо секинроқ; STT.ai GPUда SenseVoice ни қабул қилади, шунинг учун параметрлар сони сизнинг клиент томони ишлашингизга таъсир қилмайди.
SenseVoice STT.ai қўллаб-қувватлайдиган барча форматларни қабул қилади — MP3, WAV, M4A, FLAC, OGG, MP4, MKV, MOV, WebM, AVI ва бошқалар. Тўқима TXT, SRT, VTT, DOCX, JSON ёки PDF шаклида.
Ҳа. Ҳар бир транскрипция учун SenseVoice билан биргаликда сўзловчилар рўйхати ишлайди - ҳар бир сўзловчи белгиланади ва кейинчалик уларни редакторда қайта номлашингиз мумкин.
Ҳа. SenseVoice бизнинг бошқариладиган муҳитда ишлайди — аудио ишланади ва стандарт тарзда ўчирилади ва ҳеч қачон очиқ танловсиз машғулот учун фойдаланилмайди. Pro режалари дам олганда ёзилган транскриптлар учун клиент томони шифрлашини қўшиб беради.
SenseVoice'ни бошқа қўллаб-қувватланадиган моделлар билан бир хил аудиода ишлатиш учун compare-stt асбобидан фойдаланинг — сиз WER, сегментлар сони, овоз берувчиларнинг белгилари ва ишончлилик балларини бир-бирига қарама-қарши кўришингиз мумкин. SenseVoice ва Whisper Large V3 ўртасидаги таққослашни энг кўп ишлатиш мумкин.
Ҳа. /v1/transcribe охирида "sensevoice" модели параметрини кўрсатинг. Python ва Node.js SDK лар SenseVoice мисолларни ўз ичига олади. Бепул API даражаси ойига 100 дақиқани ўз ичига олади.
Ҳа. SenseVoice MIT лицензиясига эга бўлгани учун, сиз уни ўзингиз хост қила оласиз. STT.ai'нинг очиқ манба саҳифасида лойиҳа репозиторияси ва вазнлари кўрсатилган. Продукция жамоаларининг кўпчилиги GPU харид қилиш, модел алмаштириш ва ишга тушириш учун бизнинг хост қилинган версиямизни фойдаланади.