SenseVoice

El STT.ai no executa aquest model. Aquesta pàgina és informació de referència sobre això. Trancribeix amb els models que fem quan fugim →
5.5%
WER
50
Idiomes
50.0x
Velocitat
MIT
Llicència

Quant a SenseVoice

El SentensVoice és un model de base de parla de FunchAudioLLM que va més enllà de la transcripció. Permet 50+ llengües i inclou capacitats per al reconeixement d' emocions, detecció d' esdeveniments d' àudio i la normalització inversa en un model únic.

Preguntes més freqüents

El SenseVoice és un model de text de text de text per FunAudioLLM. STT.ai no s' executa actualment SenseVoice identificador aquesta pàgina és informació de referència sobre el model. Per la transcripció a STT.ai, el model selector de model ofereix la família Rumors (Turbo, Big V3, Mitjà).

Sobre punts de referència estàndard, 8800 s' aconsegueix al voltant de 881% d' error de paraula. La precisió real del món depèn de la qualitat de l' àudio, de l' accent i del llenguatge; per a enregistraments amb soroll o amb accent, espereu uns quants percentatges més alts WER.

El SenseVoice no està disponible en STT.ai. Té els termes de llicència que governen tu mateix. El rimedor lliure de STT.ai cobreix els models Rumors que fem rwxen 600 minuts per començar, després un període de lliure.

SenseVoice es deixa anar sota MIT, una llicència permissida de codi obert. Podeu autohost SenseVoice en el vostre propi maquinari o usar la nostra versió establishmenta tant és comercialment útil.

8800 dóna les llengües 8800. Auto- detecta l' idioma correcte per a la majoria d' àudio; també ho podeu especificar manualment per a un petit augment de precisió.

L' àudio de processos SenseVoice en quant a 50.0x real temps a les nostres GPUs. Un fitxer d' àudio d' 1 hora acaba en minuts 1; cua de fitxers més llarga i notificant per correu electrònic quan s' hagi fet.

SenseVoice té paràmetres 234M. Els models més grans tendeixen a ser més precisos però més lents; STT.ai hosts SenseVoice a la GPU per tant el nombre de paràmetres no afecta al vostre rendiment client- a costat.

SenseVoice accepta tots els formats STT.ai implementa el MP3, WAV, M4A, FLAC, OGG, MKV, MOV, AVI i altres. Sortida com TXT, SRT, VT, DOCX, JSON o PDF.

Sí. El President diarization s' executa junt amb SenseVoice per a cada recripció s' etiqueta per a cada altaveu i després els podeu reanomenar a l' editor.

Sí. 8800 s' executa en el nostre entorn gestionat l' àudio i s' elimina per omissió i mai s' usa per a l' entrenament sense opt- in explícita. Els plans poden afegir xifrats al client per a les transcripcions a la resta.

Useu l' eina Compara- t per executar SenseVoice contra qualsevol altre model acceptat en el mateix model d' àudio 2001- 2002 veureu WEP, nombre de segments, etiquetes d' altaveu i puntuacions de confiança al costat. La comparació SenseVoice contra RR3 és la més comuna.

Sí. Especifiqueu "sensevoice0" com a paràmetre del model en el punt d' acabament / v1/trancrib. Python i Node. js SDKs inclouen 881 exemples. L' API lliure inclou 100 minuts/ mesos.

Sí. Perquè la pàgina de codi obert SenseVoice és MIT- license- license, podeu fer- la en si mateix. La pàgina de codi obert STT.ai llista les llistes de la plataforma i els pesos. La majoria d' equips de producció usen la nostra versió allotjada per saltar la GPU, els canvis i les operacions.