Transcrição com STT.ai Enhanced
3.2%
WER
100
Línguas
160.0x
Velocidade
Proprietary
Licença
Sobre STT.ai Enhanced
STT.ai Melhorado é o nosso modelo mais preciso e mais rápido de fala a texto. Construído na arquitetura de transformadores de ponta com otimizações proprietárias, oferece taxas de erro de palavras líderes da indústria em mais de 100 idiomas. Ideal para transcrição de produção, legendamento em tempo real e aplicações empresariais.
✦ Desbloquear o modelo melhorado
Acesso ao nosso modelo mais preciso com qualquer plano pago. 3.2% WER, 160x velocidade em tempo real, 100+ idiomas.
Ver Planos →Informações do Modelo
- FornecedorSTT.ai
- Arquitetura-
- LicençaProprietary
- ActualizadoMar 2026
Perguntas frequentes
STT.ai Enhanced é um modelo de fala a texto por STT.ai. STT.ai hospeda STT.ai Enhanced em nossa infraestrutura GPU para que você possa usá-lo sem providenciar seu próprio hardware — carregar áudio ou vídeo e escolher STT.ai Enhanced do seletor de modelos.
Nas referências padrão, STT.ai Enhanced atinge cerca de 8801% da taxa de erro do Word. A precisão do mundo real depende da qualidade, acento e linguagem do áudio; para gravações ruidosas ou acentuadas, esperam alguns pontos percentuais mais altos WER.
STT.ai Enhanced é um modelo premium — incluído com qualquer plano de STT.ai pagos a partir de $5/mês. Os usuários gratuitos podem visualizar STT.ai Enhanced em clipes curtos; arquivos mais longos requerem um plano ativo.
STT.ai Enhanced é distribuído abaixo de Proprietary. A versão hospedada de STT.ai lida com a conformidade de licença para você, portanto, uso comercial através do nosso serviço é simples.
STT.ai Enhanced suporta 100 idiomas. Auto-detecção escolhe a linguagem certa para a maioria do áudio; você também pode especificar manualmente para um pequeno elevador de precisão.
STT.ai Enhanced processa áudio a cerca de 160.0x em tempo real em nosso GPUs. Um arquivo de áudio de 1 hora termina em menos de 1 minutos; arquivos mais longos cola e notifica por e-mail quando feito.
STT.ai Enhanced tem 1.5B parâmetros. Os modelos mais grandes tendem a ser mais precisos mas mais lentos; STT.ai hosts STT.ai Enhanced na GPU para que a contagem de parâmetros não afecte o seu desempenho do lado do cliente.
STT.ai Enhanced aceita cada formato STT.ai suportes — MP3, WAV, M4A, FLAC, OGG, MP4, MKV, MOV, WebM, AVI e outros. Saída como TXT, SRT, VTT, DOCX, JSON ou PDF.
Sim. Diarização do orador corre ao lado de STT.ai Enhanced para cada transcrição — cada orador é rotulado e você pode renomeá-los no editor depois.
Sim. STT.ai Enhanced funciona em nossa infraestrutura privada — áudio é processado e excluído por padrão. Pro+ adiciona criptografia do lado do cliente para que as transcrições são ilegíveis sem sua chave, e o Private Cloud permite que você auto-hoste STT.ai Enhanced inteiramente em seu próprio VPC.
Use a ferramenta compar-stt para executar STT.ai Enhanced contra qualquer outro modelo suportado no mesmo áudio — você verá WER, contagem de segmentos, rótulos de alto-falante e pontuação de confiança lado a lado. A comparação STT.ai Enhanced vs Whisper Large V3 é a mais comumente executada.
Sim. Especifique "stt-ai-enhanced" como o parâmetro do modelo no ponto final /v1/transcribe. Python e Node.js SDKs incluem STT.ai Enhanced exemplos. O nível de API gratuito inclui 100 minutos/mes.
O licenciamento para STT.ai Enhanced é definido por STT.ai; o auto-hosting depende de seus termos. O serviço hospedado STT.ai é executado STT.ai Enhanced em GPU gerenciado para que você não precise lidar com essa integração.