SenseVoice

ʻAʻole ka STT.ai e hoʻokō i kēia mau mea. He hōʻike kēia ʻaoʻao i nā ʻike e pili ana iā ia. Hoʻouna i nā mea me nā mea i hoʻouna ʻia →
5.5%
WER
50
ʻO nā ʻōlelo
50.0x
Ka wikiwiki
MIT
Kaʻa Kaʻa

E pili ana i SenseVoice

SenseVoice he hōʻailona o ka hoʻokumu ʻana i ka ʻōlelo mai FunAudioLLM e hele ana i waho o ka hoʻololi ʻana. Hoʻohana ia i nā ʻōlelo 50 + a hoʻohui i nā hiki no ka ʻike ʻana i ka ʻike, ka ʻike ʻana i nā hanana leo, a me ka hoʻomālamalama ʻana i ka huaʻōlelo i kahi hōʻailona like.

Nā nīnau i nīnau pinepine ʻia

SenseVoice he'ōlelo-i-ka-mea kākau'ōnaehana e FunAudioLLM. STT.ai i kēia manawaʻaʻole e holo ana SenseVoice — kēiaʻaoʻao kaʻike hōʻike e pili ana i ka'ōnaehana. No ka transliteration ma STT.ai, ka'ōnaehana koho e hāʻawi i ka Whisper'ohana (Turbo, Large V3, Medium, Small).

Ma nā mea hoʻohālikelike paʻa, SenseVoice e loaʻa ana ma kahi o 5.5% Word Error Rate. Real-world ka pololei e pili ana i ka maikaʻi leo, accent, a me ka'ōlelo; no ka noisy a i ʻole accented recordings, e manaʻo i kekahi mau pūʻulu o ka helu o ka WER kiʻekiʻe.

ʻAʻole hiki ke loaʻa ka SenseVoice ma ka STT.ai. ʻO kāna mau kānāwai laikini e hoʻokele i ka hoʻouka ʻana iā ia iho. Hoʻopuni ka ʻāpana manuahi o STT.ai i nā ʻano Whisper a mākou e hoʻouka ai - 600 mau minuke e hoʻomaka ai, a laila he mahina manuahi ka hoʻouka.

SenseVoice i hoʻokuʻu ʻia ma lalo o MIT, he laikini open-source permissive. Hiki iā ʻoe ke hoʻokani i ka SenseVoice ma kāu pono ponoʻī a i ʻole e hoʻohana i kā mākou mana hoʻokani - ʻo nā mea a pau e hoʻohana ʻia ana i ka mākeke.

Hoʻohana ʻia nā ʻōlelo SenseVoice a me 50 e SenseVoice. Hoʻohuli ʻia ka ʻōlelo kūpono no ka hapa nui o nā leo e ka ʻike ʻana i ka mīkini; hiki iā ʻoe ke hoʻonohonoho pū iā ia me ka lima no ka hoʻonui ʻana i ka pololei.

SenseVoice nā hana leo ma ka manawa maoli o 50.0x ma kā mākou GPUs. Hoʻopau ka faila leo 1-hour i lalo o nā minuke 1; nā faila lōʻihi a me ka leka uila i ka wā i hana ʻia.

SenseVoice he 234M mau paramita. ʻO nā ʻano nui e ʻoi aku ka pololei akā ʻoi aku ka wikiwiki; STT.ai nā mea hoʻokipa SenseVoice ma GPU no laila ʻaʻole i hoʻopilikia ka helu paramita i kāu hana ʻana o ka ʻaoʻao mea kūʻai aku.

SenseVoice accepts every format STT.ai supports — MP3, WAV, M4A, FLAC, OGG, MP4, MKV, MOV, WebM, AVI, and others. Output as TXT, SRT, VTT, DOCX, JSON, or PDF.

ʻAe. Hoʻokō ʻia ka diarization speaker ma kahi o SenseVoice no kēlā me kēia hoʻololi — ʻo kēlā me kēia mea haʻi ʻōlelo i kapa ʻia a hiki iā ʻoe ke hoʻololi i ko lākou inoa i ka mea hoʻoponopono ma hope.

ʻAe. SenseVoice e holo ana i kā mākou kaiaolaola hoʻokele - hoʻokō ʻia ka leo a hoʻopau ʻia e ka hoʻonohonoho hoʻonohonoho a ʻaʻole i hoʻohana ʻia no ka hoʻomaʻamaʻa ʻana me ka ʻole o ka hoʻoholo ʻana. Hoʻohui nā papa hana Pro i ka hoʻopunipuni ʻana i ka ʻaoʻao o ka mea kūʻai aku no nā transcripts i ka wā e noho ai.

Hoʻohana i ka mea hana e hoʻohālikelike i ka stt e hoʻokō i ka SenseVoice ma mua o kekahi mau ʻano ʻē aʻe i kākoʻo ʻia ma ka leo like - e ʻike ʻoe i ka WER, ka helu ʻana i nā ʻāpana, nā ʻōlelo kīwī, a me nā helu hōʻoia ʻana i nā ʻōlelo.

ʻAe. E hoʻonohonoho i "sensevoice" ma ke ʻano he parameter model ma ka / v1 / transcribe endpoint. Python a me Node.js SDKs e like me nā hōʻailona SenseVoice.

ʻAʻole. No ka mea he SenseVoice ka MIT-licensed, hiki iā ʻoe ke hoʻokani iā ia. Hoʻonohonoho ka ʻaoʻao open-source o STT.ai i ka repo a me nā mānoanoa o ka papahana. Hoʻohana ka hapa nui o nā hui hana i kā mākou mana hoʻokipa e hoʻokau i ka hoʻopaʻa ʻana o GPU, nā hoʻololi o nā hōʻailona a me nā ops.