SenseVoice

STT.ai kò bá fún ìṣàmúlò-ètò yìí ṣiṣẹ́. Àtòjọ-ẹ̀yàn yìí ní àwọn ìròyìn àwọn ìròyìn láti inú rẹ̀. Ṣàfihàn àwọn àwọn ìṣàmúlò-ètò tí a tí n rọ́ọ̀nù →
5.5%
WER
50
Àwọn Àkọ́lé
50.0x
Ìjánú ìsàlẹ̀-ilà
MIT
Àwọn Àmì-ìwé

Ààyè-iṣẹ́ SenseVoice

SenseVoice ní móòdù ìdájọ́ ìtàn ìsàlẹ̀-ilà láti FunAudioLLM tí o lọ́wọ́lú àwọn àkọ́kọ́. Ò ǹfàyè àwọn ìtàn 50+ àti àwọn ìṣẹ̀dá fún ìmọ́ àwọn ìrànwọ́, ìṣàfihàn àwọn àgbèwọlé àwọn àgbèwọlé, àti ìṣàfihàn àwọn àkọ́kọ́ nínú móòdù kan.
Àwọn Àlàyé Àwọn
  • Àwọn Ìṣàmúlò-ètòFunAudioLLM
  • Àwọn Ìṣàmúlò-ètò-
  • Àwọn Àmì-ìwéMIT
  • ÀkóónúMar 2026

Àwọn Àtòjọ-ẹ̀yàn

SenseVoice ní móòdù ìtàn-si-àkọ́kọ́ láti FunAudioLLM. STT.ai kò bá SenseVoice lọ́wọ́lọ́wọ́ - ojú-ìwé yìí ní àwọn ìròyìn àwọn ìròyìn láti inú móòdù yìí. Fún àkọ́kọ́ nípa STT.ai, àwọn àwọn ìṣàfihàn móòdù náà ǹfi ẹ̀yàn Whisper (Turbo, Large V3, Medium, Small) pamọ́.

On standard benchmarks, SenseVoice achieves around 5.5% Word Error Rate. Real-world accuracy depends on audio quality, accent, and language; for noisy or accented recordings, expect a few percentage points higher WER.

SenseVoice is not available on STT.ai. Its own licence terms govern running it yourself. STT.ai's free tier covers the Whisper models we do run — 600 minutes to start, then a monthly free top-up.

SenseVoice tí a fi pamọ́ láti inú MIT, ìlàyè ìṣàfilọ́lẹ̀-ìṣílọ́lẹ̀. O lè fi SenseVoice pamọ́ sípàrà rẹ̀ láti lò nínú àwọn ìṣàfilọ́lẹ̀ wà - gbogbo wọn ní a lè lò nínú iṣẹ́.

SenseVoice ǹfà àwọn ìtàn 50. Àwọn ìṣàfihàn-ìdáràn àwọn ìtàn tí a fẹ́ fún àwọn ìṣàfihàn àwọn ìranlọwọ; o lè sọ̀rọ̀ nípa ìrànwọ́ fún ìṣàfihàn àwọn ìṣàfihàn àwọn ìṣàfihàn.

SenseVoice ń ṣé ìṣàmúlò-ètò ìraǹdárà ní àwọn ìṣàmúlò-ètò 50.0x ní àwọn GPÙ wa. Fáìlì ìraǹdárà àwọn ààyè-ètò 1-àgójútó tí wọ́n tí ìjáde 1 àwọn ààyè-ètò; àwọn fáìlì tí o jú lọ ní àwọn ààyè-ètò àti àwọn ìṣàmúlò-ètò láti fi hàn látigbá tí a tí parí.

SenseVoice ní àwọn ààtòjútó 234M. Àwọn àwọn ìṣàmúlò-ètò nlà ní ìṣàmúlò-ètò tí o darà jù lọ àwọn àwọn ààtòjútó tí o ní ìjánu-ìjánú; STT.ai ní àwọn ààtòjútó SenseVoice lórí GPU láti jẹ́ pe àwọn ààtòjútó àwọn ààtòjútó kò bá ìṣẹ́dá ààtòjútó ààtòjútó rẹ̀ pẹ̀lú klíntì.

SenseVoice gba gbogbo àwọn ìrísí-lẹ́tà tí STT.ai ǹfàyè — MP3, WAV, M4A, FLAC, OGG, MP4, MKV, MOV, WebM, AVI, àti àwọn mìíràn. Àwọn ìṣàfilọ́lẹ̀ bí TXT, SRT, VTT, DOCX, JSON, tàbí PDF.

Ya. Ìṣàfilọ́lẹ̀ àwọn àkọlé àwọn àkọlé náà tí wọ́n lọ́wọ́lọ́wọ́ SenseVoice fún ìṣàfilọ́lẹ̀ gbogbó - àwọn àkọlé àwòrán ní pàtó àwọn àkọlé àwòrán náà nínú àwọn àwọn àkọlé àwòrán.

Yes. SenseVoice runs in our managed environment — audio is processed and deleted by default and never used for training without explicit opt-in. Pro plans add client-side encryption for transcripts at rest.

Use the compare-stt tool to run SenseVoice against any other supported model on the same audio — you'll see WER, segment count, speaker labels, and confidence scores side-by-side. The SenseVoice vs Whisper Large V3 comparison is the most commonly run.

Ya. Ṣàfihàn "sensevoice" bí àwọn ààtò ìṣàmúlò-ètò módè́èlì lórí àwọn ààtò ìparí iṣẹ́ /v1/transscribe. Python àti Node.js SDKs ní àwọn ààtò ìṣàmúlò-ètò SenseVoice. Àwọn ààtò API àìfẹ́ ní àwọn ààtò 100 àwọn àkókò/óṣù.

Yes. Because SenseVoice is MIT-licensed, you can self-host it. STT.ai's open-source page lists the project repo and weights. Most production teams use our hosted version to skip GPU procurement, model swaps, and ops.