STT.ai Enhanced
STT.ai executa este modelo na faixa paga. É o modelo atrás de STT.ai Enhanced. Transcrição gratuita usa Whisper Large v3 Turbo, que é mais rápido.
Ver planos →
·
Transcriba grátis com Whisper Turbo →
4.2%
WER
99
Línguas
15.9x
Velocidade
MIT
Licença
Sobre STT.ai Enhanced
STT.ai Melhorado é o nosso modelo mais preciso e mais rápido de fala a texto. Construído na arquitetura de transformadores de ponta com otimizações proprietárias, oferece taxas de erro de palavras líderes da indústria em mais de 100 idiomas. Ideal para transcrição de produção, legendamento em tempo real e aplicações empresariais.
✦ Desbloquear o modelo melhorado
Acesso ao nosso modelo mais preciso com qualquer plano pago — Whisper grande-v3, 99 idiomas, e diarização de falantes.
Ver Planos →Informações do Modelo
- FornecedorOpenAI (hosted by STT.ai)
- Arquitetura-
- LicençaMIT
- ActualizadoAug 2026
Perguntas frequentes
STT.ai Enhanced é um modelo de fala a texto por OpenAI (hosted by STT.ai). STT.ai é executado por nossa própria GPU para contas em um plano pago, e é o modelo por trás da nível melhorado STT.ai. Transcrição gratuita usa Whisper Large v3 Turbo, o ponto de controle mais rápido da mesma família.
Nas referências padrão, STT.ai Enhanced atinge cerca de 8801% da taxa de erro do Word. A precisão do mundo real depende da qualidade, acento e linguagem do áudio; para gravações ruidosas ou acentuadas, esperam alguns pontos percentuais mais altos WER.
STT.ai Enhanced é um modelo premium — incluído com qualquer plano STT.ai pago a partir de 9 dólares/mes. Não está disponível na linha livre: uploads grátis e anônimo executam Whisper Turbo.
STT.ai Enhanced é lançado sob MIT, uma licença permissiva de código aberto. Você pode auto-hoste STT.ai Enhanced em seu próprio hardware ou usar a nossa versão hospedada — ambos são comercialmente utilizáveis.
STT.ai Enhanced suporta 99 idiomas. Auto-detecção escolhe a linguagem certa para a maioria do áudio; você também pode especificar manualmente para um pequeno elevador de precisão.
STT.ai Enhanced processa áudio a cerca de 15.9x em tempo real em nosso GPUs. Um arquivo de áudio de 1 hora termina em menos de 3 minutos; arquivos mais longos cola e notifica por e-mail quando feito.
STT.ai Enhanced tem 1.55B parâmetros. Os modelos mais grandes tendem a ser mais precisos mas mais lentos; STT.ai hosts STT.ai Enhanced na GPU para que a contagem de parâmetros não afecte o seu desempenho do lado do cliente.
STT.ai Enhanced aceita cada formato STT.ai suportes — MP3, WAV, M4A, FLAC, OGG, MP4, MKV, MOV, WebM, AVI e outros. Saída como TXT, SRT, VTT, DOCX, JSON ou PDF.
Sim. Diarização do orador corre ao lado de STT.ai Enhanced para cada transcrição — cada orador é rotulado e você pode renomeá-los no editor depois.
Sim. STT.ai Enhanced funciona em nossa infraestrutura privada — áudio é processado e excluído por padrão. Pro+ adiciona criptografia do lado do cliente para que as transcrições são ilegíveis sem sua chave, e o Private Cloud permite que você auto-hoste STT.ai Enhanced inteiramente em seu próprio VPC.
Use a ferramenta compar-stt para executar STT.ai Enhanced contra qualquer outro modelo suportado no mesmo áudio — você verá WER, contagem de segmentos, rótulos de alto-falante e pontuação de confiança lado a lado. A comparação STT.ai Enhanced vs Whisper Large V3 é a mais comumente executada.
Sim, em um plano pago. Especifique "stt-ai-enhanced" como o parâmetro modelo no ponto final /v1/transcribe. As chaves sem um plano ativo são servidas Whisper Large v3 Turbo. O pedido ainda é bem sucedido; ele apenas executa o modelo livre.
Sim. Como STT.ai Enhanced é MIT-licenciado, você pode hospedá-lo. STT.ai página de código aberto lista o projeto repo e pesos. A maioria das equipes de produção usa a nossa versão hospedada para saltar compras GPU, swaps de modelos e ops.