SenseVoice

STT.ai nu execută acest model. Această pagină este informații de referință despre el. Transcrie cu modelele pe care le rulam →
5.5%
WER
50
Limbi
50.0x
Viteza
MIT
Licență

Despre SenseVoice

SenseVoice este un model de fundație de vorbire din FunAudioLLM care depășește transcrierea. Acesta suportă 50 de limbi și include capacitatea de recunoaștere a emoțiilor, detectarea evenimentelor audio și normalizarea inversă a textului într-un singur model.

Întrebări frecvente

SenseVoice este un model de vorbire la text până la FunAudioLLM. STT.ai nu rulează în prezent SenseVoice — această pagină este informații de referință despre model. Pentru transcrierea pe STT.ai, modelul de alegere oferă familia Whisper (Turbo, Large V3, Medium, Small).

Pe baza standardelor de referință, SenseVoice realizează aproximativ 5.5% Rata de eroare Word. Acuratețea lumii reale depinde de calitatea audio, accentul și limba; pentru înregistrări zgomotoase sau accentuate, se așteaptă la câteva puncte procentuale mai mari WER.

SenseVoice nu este disponibil pe STT.ai. Condițiile proprii de licență reglementează rulmentul. STT.ai de nivel gratuit acoperă modelele Whisper pe care le rulează – 600 de minute pentru a începe, apoi un top-up lunar gratuit.

SenseVoice este lansat sub MIT, o licență permisivă de open-source. Puteți auto-gazdă SenseVoice pe propriul hardware sau utiliza versiunea noastră gazdă — ambele sunt utilizabile comercial.

SenseVoice suportă 50 limbi. Auto-detection alege limba corectă pentru majoritatea audio; puteți, de asemenea, să o specificați manual pentru un mic lift de precizie.

SenseVoice procesează audio la aproximativ 50.0x în timp real pe GPU-urile noastre. Un fișier audio de 1 oră se termină în sub 1 minute; fișiere mai lungi coada și notificare prin e-mail atunci când este gata.

SenseVoice are parametri 234M. Modelele mai mari tind să fie mai precise, dar mai lent; STT.ai găzduiește SenseVoice pe GPU astfel încât numărul de parametri nu afectează performanța client-side.

SenseVoice acceptă fiecare format de suport STT.ai — MP3, WAV, M4A, FLAC, OGG, MP4, MKV, MOV, WebM, AVI și alții. Produsă ca TXT, SRT, VTT, DOCX, JSON sau PDF.

Da. Diarizarea speakerului merge alături de SenseVoice pentru fiecare transcriere — fiecare speaker este etichetat și le puteți renoma în editor după aceea.

Da. SenseVoice rulează în mediul nostru gestionat – audio este prelucrat și șterse în mod implicit și nu este utilizat niciodată pentru antrenament fără opt-in explicit. Pro planuri adaugă criptare pe partea clientului pentru transcripții în odihnă.

Utilizați instrumentul compara-stt pentru a rula SenseVoice împotriva oricărui alt model suportat pe același audio — veți vedea WER, număr de segmente, etichete de speaker și scoruri de încredere lado-a-side. SenseVoice vs Whisper Large V3 comparație este cel mai frecvent rulat.

Da. Specificați "sensevoice" ca parametrul model pe punctul final /v1/transcrie. Python și Node.js SDKs includ SenseVoice exemple. Nivelul API gratuit include 100 minute/luna.

Da. Deoarece SenseVoice este MIT- licenciat, puteți să-l găzduiți. STT.ai de pagini de open-source listează proiectul repo și greutăți. Cele mai multe echipe de producție folosesc versiunea noastră găzduită pentru a trece peste GPU achiziții, swaps de model și ops.