SenseVoice
STT.ai не запускае гэты мадэлі. Гэтая старонка змяшчае дапаможную інфармацыю пра яго.
Прапісаць з мадэлямі, якія мы запускаем →
5.5%
WER
50
Мовы
50.0x
Хуткасць
MIT
Ліцэнзія
Пра SenseVoice
SenseVoice - гэта мадэль маўлення FunAudioLLM, якая выходзіць за рамкі транскрыпцыі. Яна падтрымлівае больш за 50 моў і ўключае ў сябе магчымасці для распазнавання эмоцый, выяўлення гукавых падзеяў і зваротнай нармалізацыі тэксту ў адным модулі.
Мовы, якія падтрымліваюцца SenseVoice
Звесткі пра мадэль
- ПастаўшчыкFunAudioLLM
- Архітэктура-
- ЛіцэнзіяMIT
- АбнавіцьMar 2026
Часта задаваемыя пытанні
SenseVoice - гэта мадэль пераўтварэння мовы ў тэкст, распрацаваная кампаніяй FunAudioLLM. STT.ai не працуе з SenseVoice - гэтая старонка змяшчае інфармацыю пра мадэль. Для транскрыпцыі на STT.ai, выбіральнік мадэляў прапануе сям' ю Whisper (Turbo, Large V3, Medium, Small).
На стандартных тэставанні, SenseVoice дасягае каля 5.5% Word Error Rate. Рэальная дакладнасць залежыць ад якасці гуку, акцэнту і мовы; для шумных або акцэнтаваных запісаў чакайце на некалькі працэнтных пунктаў вышэй WER.
SenseVoice не даступны на STT.ai. Яго ўласныя ліцэнзійныя ўмовы рэгулююць яго запуск. Бясплатны ўзровень STT.ai ахоплівае мадэлі Whisper, якія мы запускаем - 600 хвілін для запуску, затым штомесячнае бясплатнае дапаўненне.
SenseVoice выпушчаны пад ліцэнзіяй MIT, дазваляе адкрыты код. Вы можаце самастойна ўсталяваць SenseVoice на вашым камп' ютары або выкарыстоўваць нашу версію - абодва могуць быць выкарыстаны ў камерцыйных мэтах.
SenseVoice падтрымлівае 50 моў. Аўтаматычнае выяўленне выбірае правільную мову для большасці гукаў; вы таксама можаце вызначыць яе ўручную для невялікага павышэння дакладнасці.
SenseVoice апрацоўвае аўдыё з хуткасцю 50.0x у рэальным часе на нашых GPU. 1- гадзінны аўдыё файл скончыцца менш чым за 1 хвіліны; даўжэйшыя файлы будуць адпраўляцца ў чаргу і абвяшчаць па электроннай пошце, калі яны будуць завершаны.
SenseVoice мае параметры 234M. Большыя мадэлі больш дакладныя, але павольнейшыя; STT.ai мае SenseVoice на GPU, таму колькасць параметраў не ўплывае на хуткасць працы кліента.
SenseVoice прымае ўсе фарматы, якія падтрымлівае STT.ai — MP3, WAV, M4A, FLAC, OGG, MP4, MKV, MOV, WebM, AVI і іншыя. Вывад у фармаце TXT, SRT, VTT, DOCX, JSON або PDF.
Так. Дыярызацыя гукавых файлаў працуе разам з SenseVoice для кожнай транскрыпцыі - кожны гукавы файл мае этыкетку, і вы можаце змяніць яго назву ў рэдактара пасля.
Так. SenseVoice працуе ў нашым кіруемым асяроддзі - гук апрацоўваецца і выдаляецца па змаўчанні і ніколі не выкарыстоўваецца для трэніровак без выразнага дазволу. Планы Pro дадаюць шыфраванне з боку кліента для транскрыптаў у спакоі.
Выкарыстоўвайце інструмент compare-stt, каб правесці параўнанне SenseVoice з любым іншым падтрымліваемым мадэллю на тым жа аўдыё - вы ўбачыце WER, колькасць сегментаў, этыкеткі дынамікаў і рэйтынгі даверу бок аб бок. Параўнанне SenseVoice супраць Whisper Large V3 - гэта найбольш частае параўнанне.
Так. Вызначце "sensevoice" як параметр мадэлі ў канечнай кропцы /v1/transcribe. Python і Node.js SDK ўключаюць прыклады SenseVoice. Бясплатны ўзровень API ўключае 100 хвілін / месяц.
Так. Паколькі SenseVoice мае ліцэнзію MIT, вы можаце самастойна яго ўсталяваць. На старонцы адкрытага кода STT.ai паказаны рэпазітары і вагі праекту. Большасць каманд выкарыстаюць нашу ўсталяваную версію, каб прапусціць закупку GPU, абмен мадэлямі і аперацыі.