SenseVoice
STT.ai neveikia šio modelio. Šis puslapis yra informacijos apie jį nuoroda.
Atsekti su modeliais mes veikiame →
5.5%
WER
50
Kalbos
50.0x
Greitis
MIT
Licencija
Apie SenseVoice
SenseVoice yra kalbos fondo FunAudioLLM modelis, kuris apima ne tik transkripciją. Jis palaiko 50+ kalbų ir apima galimybes emocijų atpažinimo, garso įvykių nustatymo ir atvirkštinio teksto normalizavimo viename modelyje.
Pavyzdinės informacijos
- TeikėjasFunAudioLLM
- Architektūra-
- LicencijaMIT
- AtnaujintaMar 2026
Dažnai užduodami klausimai
SenseVoice yra kalbos-teksto modelis FunAudioLLM. STT.ai negalioja SenseVoice – šis puslapis yra informacinis informacija apie modelį. Transkripcijos STT.ai, modelis purtyklė siūlo Whisper šeima (Turbo, Didelis V3, vidutinis, mažas).
Dėl standartinių lyginamųjų standartų, SenseVoice pasiekia apie 8801% Word error Rate. Realaus pasaulio tikslumas priklauso nuo garso kokybės, akcentas, ir kalba; Triukšmingų ar akcentuotų įrašų, tikėtis keletą procentinių punktų didesnis WER.
SenseVoice nėra prieinama STT.ai. Jo pačios licencijos sąlygos reglamentuoja veikia pats. STT.ai nemokamai pakopa apima Whisper modelius mes paleisti – 600 minučių pradėti, tada kas mėnesį nemokamai papildo.
SenseVoice yra išleistas pagal MIT, leistina atviro kodo licencija. Galite savarankiškai-host SenseVoice ant savo aparatūros arba naudoti mūsų palaikomą versiją - abu yra komerciškai naudoti.
SenseVoice palaiko 50 kalbas. Automatinis aptikimas pasirenka reikiamą kalbą daugumai garso; taip pat galite nurodyti ją rankiniu būdu nedideliam tikslumui pakelti.
SenseVoice apdoroja garsą maždaug 50.0x realiu laiku mūsų GPU. 1 valandos garso failas baigiasi po 1 minučių; ilgesnis failų eilė ir apie tai praneš el. paštu, kai tai bus padaryta.
SenseVoice turi 234M parametrus. Didesni modeliai yra tikslesni, bet lėčiau; STT.ai GPU mazgai SenseVoice, todėl parametrų skaičius neturi įtakos Jūsų klientų veiklos rezultatams.
SenseVoice priima kiekvieną formatą STT.ai palaiko: MP3, WAV, M4A, FLAC, OGG, MP4, MKV, MOV, WebM, AVI ir kt. Išvesti kaip TXT, SRT, VTT, DOCX, JSON, arba PDF.
Taip. Garsiakalbio diarizacija veikia šalia SenseVoice kiekvienam transkripcija – kiekvienas garsiakalbis yra pažymėtas ir galite pervadinti juos redaktoriuje po to.
Taip. SenseVoice veikia mūsų valdomoje aplinkoje — garso yra apdorojamas ir ištrinamas pagal nutylėjimą ir niekada naudojamas mokymui be aiškaus opt-in. Pro planai pridėti kliento pusėje šifravimo stenogramos poilsio.
Naudokite palyginimo-stt įrankis paleisti SenseVoice prieš bet kurį kitą palaikomą modelį tame pačiame garso — pamatysite WER, segmentų skaičių, garsiakalbių etiketes ir pasitikėjimo balus šalia-by-by. SenseVoice palyginti Whisper didelis V3 yra dažniausiai paleisti.
Taip. Nurodykite "sensevoice" kaip modelio parametrą /v1/tractor parametrą. Python ir Node.js SDK yra SenseVoice pavyzdžiai. Nemokama API pakopa apima 100 minučių/mėnesį.
Taip. Kadangi SenseVoice yra MIT-licencijuotas, galite patys-host jį. STT.ai atviro kodo puslapis išvardija projekto atpirkimo ir svorius. Dauguma gamybos komandos naudoja mūsų įdiegtą versiją praleisti GPU pirkimų, modelių apsikeitimo, ir ops.