SenseVoice
Nid yw STT.ai yn rhedeg y model yma. Gwybodaeth gyfeirio am hyn yw' r dudalen yma.
Trosysgrifo gyda'r modelau yr ydym yn rhedeg →
5.5%
WER
50
Iaith:
50.0x
Cyflymder
MIT
Trwydded
Am SenseVoice
SenseVoice yw model sylfaen siarad o FunAudioLLM sy'n mynd y tu hwnt i drosi. Mae'n cynnal 50+ iaith ac yn cynnwys galluoedd ar gyfer adnabod teimladau, darganfod digwyddiadau sain, a normaleiddio testun gwrthdro mewn model sengl.
Gwybodaeth Model
- DarparwrFunAudioLLM
- Adeiladu-
- TrwyddedMIT
- DiweddarwydMar 2026
Cwestiynau a Ofynnir yn Aml
Model siarad-i-testun gan FunAudioLLM yw SenseVoice. Nid yw STT.ai yn rhedeg SenseVoice ar hyn o bryd - gwybodaeth gyfeirio am y model yw'r dudalen hon. Ar gyfer trosysgrifo ar STT.ai, mae'r dewisydd model yn cynnig y teulu Whisper (Turbo, Large V3, Medium, Small).
Ar fesurau safonol, mae SenseVoice yn cyrraedd Cyfradd Gwallau Geiriau o tua 5.5%. Mae cywirdeb yn y byd go iawn yn dibynnu ar ansawdd sain, sain a iaith; ar gyfer recordiadau swnllyd neu sainedig, disgwyliwch ychydig o bwyntiau canran uwch WER.
Nid yw SenseVoice ar gael ar STT.ai. Mae ei delerau trwydded ei hun yn llywodraethu ei redeg chi eich hun. Mae lefel rhad ac am ddim STT.ai yn cwmpasu'r modelau Whisper yr ydym yn eu rhedeg - 600 munud i ddechrau, yna tocyn misol am ddim.
Cyhoeddir SenseVoice o dan MIT, trwydded ffynhonnell agored ganiataol. Gallwch hunan-gartrefu SenseVoice ar eich caledwedd eich hun neu ddefnyddio ein fersiwn cartrefiedig — mae'r ddau yn defnyddiol yn fasnachol.
Cynhelir SenseVoice iaith 50. Mae darganfod yn awtomatig yn dewis yr iaith gywir ar gyfer y rhan fwyaf o sain; gallwch hefyd ei benodi â llaw er mwyn gwella cywirdeb ychydig.
Mae SenseVoice yn prosesu sain ar tua 50.0x amser real ar ein GPUs. Mae ffeil sain 1 awr yn gorffen mewn llai na 1 munud; mae ffeiliau hirach yn rhedeg yn y rhes a chaiff eu hysbysu drwy e-bost pan fyddant wedi gorffen.
Mae gan SenseVoice baramedrau 234M. Mae modelau mwy yn tueddu i fod yn fwy cywir ond yn araf; mae STT.ai yn gwestiwn SenseVoice ar y GPU felly nid yw'r cyfrif paramedrau yn effeithio ar eich perfformiad ochr y cleient.
Mae SenseVoice yn derbyn pob fformat a gynhelir gan STT.ai — MP3, WAV, M4A, FLAC, OGG, MP4, MKV, MOV, WebM, AVI, ac eraill. Allbwn fel TXT, SRT, VTT, DOCX, JSON, neu PDF.
Ie. Rheda diareiddio siaradwyr gyda SenseVoice ar gyfer pob trosysgrifiad - mae pob siaradwr yn cael ei labelu a gallwch eu hail-enwi yn y golygydd yna.
Ydy. Mae SenseVoice yn rhedeg yn ein hamgylchedd rheoli — mae sain yn cael ei brosesu a'i ddileu yn rhagosodedig ac ni chaiff ei ddefnyddio erioed ar gyfer hyfforddiant heb optio i mewn yn glir. Mae cynlluniau Pro yn ychwanegu amgryptio ochr y cleient ar gyfer trosysgrifau wrth aros.
Defnyddiwch yr erfyn compare-stt i redeg SenseVoice yn erbyn unrhyw ddull arall a gynhelir ar yr un sain — byddwch yn gweld WER, cyfrif segmentau, labeli siaradwyr, a sgôr ymddiriedaeth ochr yn ochr. Y cymhariaeth SenseVoice vs Whisper Large V3 yw'r un fwyaf cyffredin.
Ie. Penodi "sensevoice" fel paramedr model ar y /v1/transcribe diwedd-bwynt. Mae Python a Node.js SDKs yn cynnwys enghreifftiau SenseVoice. Mae lefel API am ddim yn cynnwys 100 munud/mis.
Ie. Gan fod SenseVoice yn cael ei drwyddedu gan MIT, gallwch ei hunan-gartrefu. Mae tudalen ffynhonnell agored STT.ai yn rhestru'r storfa a'r pwysau. Mae'r rhan fwyaf o'r timau cynhyrchu yn defnyddio ein fersiwn cartrefi i hepgor prynu GPU, cyfnewid modelau, ac ops.