Moonshine

O STT.ai non executa este modelo; esta páxina é información de referencia sobre el. Transcríbeo cos modelos que executamos →
7.8%
WER
1
Linguas
80.0x
Velocidade
MIT
Licenza

Acerca de Moonshine

Moonshine é un modelo de voz a texto extremadamente compacto deseñado para ambientes con poucos recursos. Con só 61M de parámetros, funciona eficientemente en dispositivos periféricos como o Raspberry Pi, mantendo unha precisión razoable na transcrición do inglés.

Linguas soportadas Moonshine

Preguntas frecuentes

Moonshine é un modelo de voz a texto de Useful Sensors. STT.ai non executa actualmente Moonshine, esta páxina é información de referencia acerca do modelo. Para a transcrición en STT.ai, o selector de modelos ofrece a familia Whisper (Turbo, Large V3, Medium, Small).

En probas estándar, Moonshine alcanza unha taxa de erro de palabra do 7.8%. A precisión real depende da calidade do son, do acento e da linguaxe; para gravacións ruidosas ou acentuadas, espere uns poucos puntos porcentuais máis altos de WER.

Moonshine non está dispoñíbel en STT.ai. Os termos da súa licenza rexerán o seu funcionamento. O nivel libre de STT.ai cobre os modelos Whisper que executamos: 600 minutos para comezar, despois unha recarga mensual gratuita.

Moonshine é publicado baixo MIT, unha licenza permisiva de código aberto. Pode aloxar Moonshine no seu propio hardware ou usar a nosa versión aloxada, ambas as dúas son comercialmente utilizables.

Moonshine soporta 1 linguas. A detección automática escolle a lingua correcta para a maioría do son; tamén pode especificala manualmente para un pequeno aumento de precisión.

Moonshine procesa o son a uns 80.0x en tempo real nas nosas GPU. Un ficheiro de son de 1 hora remata en menos de 1 minutos; os ficheiros máis longos enfróntanse e avísanse por correo electrónico cando rematan.

Moonshine ten parámetros 61M. Os modelos maiores tenden a ser máis precisos pero máis lentos; STT.ai aloxa Moonshine na GPU polo que a contaxe de parámetros non afecta ao rendemento do lado do cliente.

Moonshine acepta todos os formatos soportados por STT.ai: MP3, WAV, M4A, FLAC, OGG, MP4, MKV, MOV, WebM, AVI e outros. Saída como TXT, SRT, VTT, DOCX, JSON ou PDF.

Si. A diarización do falante corre xunto co Moonshine para cada transcrición - cada falante está etiquetado e pode mudarlle o nome no editor despois.

Si. Moonshine executase no noso entorno xestionado — o son é procesado e borrado por omisión e nunca é usado para adestramento sen unha opción explícita. Os plans Pro engadirán cifrado do lado do cliente para as transcricións en repouso.

Use a ferramenta compare- stt para executar o Moonshine contra calquera outro modelo soportado no mesmo son — verá o WER, o número de segmentos, as etiquetas dos altofalantes e as puntuacións de confianza lado a lado. A comparación Moonshine vs Whisper Large V3 é a máis común.

Si. Especifique « moonshine » como parámetro do modelo no punto final / v1/ transcribe. Os SDK de Python e Node. js inclúen exemplos de Moonshine. O nivel de API gratuíto inclúe 100 minutos/ mes.

Si. Como Moonshine ten licenza MIT, pode aloxalo vostede mesmo. A páxina de código aberto de STT.ai lista o repositorio e os pesos do proxecto. A maioría dos equipos de produción usan a nosa versión aloxada para saltar a procura de GPU, intercambios de modelos e operacións.
Made by @nadermx