SenseVoice

STT.ai kjører ikke denne modellen. Denne siden er referanseinformasjon om den. Transkriber med de modellene vi kjører →
5.5%
WER
50
Språk
50.0x
Hastighet
MIT
Lisens

Om SenseVoice

SenseVoice er en tale- foundation- modell fra FunAudioLLM som går utover transkription. Det støtter 50+ språk og har muligheter til å gjenkjenne følelser, oppdage hendelser og normalisere omvendt tekst i en enkelt modell.

Ofte stilte spørsmål

SenseVoice er en tale- til- tekst- modell av FunAudioLLM. STT.ai kjører ikke SenseVoice – denne siden er referanseinformasjon om modellen. For utskrift på STT.ai tilbyr modellvelgeren Whisper - familien (Turbo, Stor V3, Middels, Liten).

Standard standardverdier viser at SenseVoice oppnår rundt 5.5% Word Error Rate. Nøyaktighet i den virkelige verden avhenger av lydkvalitet, aksent og språk. For opptak med støy eller aksent, forvent noen prosentpoeng høyere WER.

SenseVoice finnes ikke på STT.ai. Dens egne lisensvilkår styrer selv om den kjører. STT.ai fritt nivå dekker de Whisper- modellene vi kjører. 600 minutter å starte, så en månedlig gratis top- up.

SenseVoice er frigitt under MIT, en ettergivende åpen kildekode- lisens. Du kan selv være vert SenseVoice på din egen maskinvare eller bruke vår vertsversjon – begge kan brukes kommersielt.

SenseVoice støtter 50 språk. Auto- deteksjon velger det riktige språket for de fleste lydene. Du kan også oppgi det manuelt for en liten presisjonsheis.

SenseVoice behandler lyd ved omlag 50.0x i sanntid på våre GPU- er. En en- times lydfil er ferdig på under 1 minutter, lengre filkø og varsles med e- post når den er ferdig.

SenseVoice har 234M parametre. Større modeller har en tendens til å være mer presise men langsommere. STT.ai er verter SenseVoice på GPU så parametertallet påvirker ikke din ytelse på klientsiden.

SenseVoice godtar alle format STT.ai støtter – MP3, WAV, M4A, FLAC, OGG, MP4, MKV, MOV, WebM, AVI og andre. Utdata som TXT, SRT, VTT, DOCX, JSON eller PDF.

Ja. Høytalerdiarisering går sammen med SenseVoice for hver utskrift – hver høyttaler er merket og du kan endre navn på dem i redigeringen etterpå.

Ja. SenseVoice kjører i vårt styrte miljø – lyd behandles og slettes som standard og brukes aldri til trening uten eksplisitt valg. Pro planer legger til kryptering på klientsiden for utskrifter i hvile.

Bruk sammenlikningsverktøyet til å kjøre SenseVoice mot alle andre modeller som støttes på samme lyd – du får se WER, segmenttelling, høyttal og tillitspoeng side om side. Sammenlikningen SenseVoice mot Whisper Stor V3 er det vanligste kjøreverktøyet.

Ja. Oppgi « sensevoice » som modellparameter for sluttpunktet / v1/ trancribe. Python og Node. js SDK inkluderer SenseVoice eksempler. Free API- nivå inkluderer 100 minutter/ måned.

Ja, fordi SenseVoice er MIT-lisensert, kan du selv være vert for det. STT.ai-tallets åpen-kildekode side lister prosjektet repo og vekter. de fleste produksjonsteam bruker vår vertsversjon til å hoppe over GPU innkjøp, modellbytteavtaler og ops.