SenseVoice
STT.ai kör inte den här modellen. Sidan är referensinformation om den.
Skriv över de modeller vi kör →
5.5%
WER
50
Språk
50.0x
Varvtal
MIT
Licens
Om jag inte kan SenseVoice
SenseVoice är en talfunderingsmodell från FunAudiollm som går längre än transkription. Den stöder 50+ språk och innehåller funktioner för känslaigenkänning, ljudhändelsedetektering, och omvänd text normalisering i en enda modell.
Språk som stöds av SenseVoice
Förlaga till information
- LeverantörFunAudioLLM
- Arkitektur-
- LicensMIT
- UppdateradMar 2026
Vanliga frågor
SenseVoice är en tal-till-text-modell av FunAudioLLM. STT.ai kör för närvarande inte SenseVoice – denna sida är referensinformation om modellen. För transkription på STT.ai, erbjuder modellen plockaren Whisper familjen (Turbo, Large V3, Medium, Small).
På standard riktmärken, SenseVoice uppnår cirka 8801% Word Felfrekvens. Real-world noggrannhet beror på ljudkvalitet, accent och språk; för bullriga eller accentiva inspelningar, förvänta sig några procentenheter högre WER.
SenseVoice finns inte på STT.ai. Dess egna licensvillkor styr själv. STT.ai's fria nivå täcker de Whisper modeller vi kör – 600 minuter för att starta, sedan en månatlig gratis topp.
SenseVoice släpps under MIT, en tillåtande öppen källkod licens. Du kan själv värd SenseVoice på din egen hårdvara eller använda vår värd version – båda är kommersiellt användbara.
SenseVoice stöder 50 språk. Automatisk upptäckt väljer rätt språk för de flesta ljud; du kan också ange det manuellt för en liten noggrannhet lyft.
SenseVoice behandlar ljud på ca 50.0x realtid på våra GPUs. En 1-timmars ljudfil slutar på under 1 minuter; längre filer köa och meddela via e-post när det är gjort.
SenseVoice har 234M parametrar. Större modeller tenderar att vara mer exakta men långsammare; STT.ai värd SenseVoice på GPU så parametern räknas inte påverkar din klient-sidan prestanda.
SenseVoice accepterar varje format STT.ai stöder — MP3, WAV, M4A, FLAC, OGG, MP4, MKV, MOV, WebM, AVI, med flera. Utmatning som TXT, SRT, VTT, DOCX, JSON, eller PDF.
Ja. Högtalardiarization körs vid sidan av SenseVoice för varje transkription — varje talare är märkt och du kan byta namn på dem i redaktören efteråt.
Ja. SenseVoice körs i vår hanterade miljö — ljud behandlas och tas bort som standard och aldrig används för utbildning utan uttrycklig opt-in. Pro planer lägga klient-side kryptering för utskrifter i vila.
Använd jämförelse-stt verktyg för att köra SenseVoice mot någon annan stöds modell på samma ljud - du kommer att se WER, segment räkna, högtalare etiketter och förtroende poäng sida vid sida. SenseVoice vs Whisper Large V3 jämförelse är den vanligaste köras.
Ja. Ange "sensevoice" som modellparameter för /v1/transkriptiv endpoint. Python och Node.js SDKs inkluderar SenseVoice exempel. Gratis API-nivå inkluderar 100 minuter/månad.
Ja. Eftersom SenseVoice är MIT-licensierad, kan du själv värd den. STT.ai öppen källkod sida listar projektet repo och vikter. De flesta produktionsteam använder vår värd version för att hoppa över GPU upphandling, modellswappar, och ops.