SenseVoice

STT.ai não executa este modelo. Esta página é informação de referência sobre ele. Transcribe com os modelos que executamos →
5.5%
WER
50
Línguas
50.0x
Velocidade
MIT
Licença

Sobre SenseVoice

O SenseVoice é um modelo de fundação de fala do FunAudioLLM que vai além da transcrição. Ele suporta mais de 50 idiomas e inclui capacidades para reconhecimento emotivo, detecção de eventos de áudio e normalização de texto inverso em um único modelo.

Perguntas frequentes

SenseVoice é um modelo de fala a texto por FunAudioLLM. STT.ai não executa atualmente SenseVoice — esta página é informações de referência sobre o modelo. Para transcrição em STT.ai, o modelo de picker oferece a família Whisper (Turbo, Large V3, Medium, Small).

Nas referências padrão, SenseVoice atinge cerca de 8801% da taxa de erro do Word. A precisão do mundo real depende da qualidade, acento e linguagem do áudio; para gravações ruidosas ou acentuadas, esperam alguns pontos percentuais mais altos WER.

SenseVoice não está disponível em STT.ai. Os seus próprios termos de licença governam o seu próprio. STT.ai nível livre cobre os modelos de Whisper que nós fazemo funcionar — 600 minutos para começar, então um top-up mensal gratuito.

SenseVoice é lançado sob MIT, uma licença permissiva de código aberto. Você pode auto-hoste SenseVoice em seu próprio hardware ou usar a nossa versão hospedada — ambos são comercialmente utilizáveis.

SenseVoice suporta 50 idiomas. Auto-detecção escolhe a linguagem certa para a maioria do áudio; você também pode especificar manualmente para um pequeno elevador de precisão.

SenseVoice processa áudio a cerca de 50.0x em tempo real em nosso GPUs. Um arquivo de áudio de 1 hora termina em menos de 1 minutos; arquivos mais longos cola e notifica por e-mail quando feito.

SenseVoice tem 234M parâmetros. Os modelos mais grandes tendem a ser mais precisos mas mais lentos; STT.ai hosts SenseVoice na GPU para que a contagem de parâmetros não afecte o seu desempenho do lado do cliente.

SenseVoice aceita cada formato STT.ai suportes — MP3, WAV, M4A, FLAC, OGG, MP4, MKV, MOV, WebM, AVI e outros. Saída como TXT, SRT, VTT, DOCX, JSON ou PDF.

Sim. Diarização do orador corre ao lado de SenseVoice para cada transcrição — cada orador é rotulado e você pode renomeá-los no editor depois.

Sim. SenseVoice funciona no nosso ambiente gerenciado — áudio é processado e excluído por padrão e nunca usado para treinamento sem opt-in explícito. Pro planos adicionar criptografia do lado do cliente para transcrições no repouso.

Use a ferramenta compar-stt para executar SenseVoice contra qualquer outro modelo suportado no mesmo áudio — você verá WER, contagem de segmentos, rótulos de alto-falante e pontuação de confiança lado a lado. A comparação SenseVoice vs Whisper Large V3 é a mais comumente executada.

Sim. Especifique "sensevoice" como o parâmetro do modelo no ponto final /v1/transcribe. Python e Node.js SDKs incluem SenseVoice exemplos. O nível de API gratuito inclui 100 minutos/mes.

Sim. Como SenseVoice é MIT-licenciado, você pode hospedá-lo. STT.ai página de código aberto lista o projeto repo e pesos. A maioria das equipes de produção usa a nossa versão hospedada para saltar compras GPU, swaps de modelos e ops.