Whisper Large V3
STT.ai executa este modelo na faixa paga. É o modelo atrás de STT.ai Enhanced. Transcrição gratuita usa Whisper Large v3 Turbo, que é mais rápido.
Ver planos →
·
Transcriba grátis com Whisper Turbo →
4.2%
WER
99
Línguas
15.9x
Velocidade
MIT
Licença
Sobre Whisper Large V3
O Whisper Large V3 é o modelo de reconhecimento de fala de código aberto da OpenAI. Com 1,5 bilhões de parâmetros, oferece uma precisão excepcional em 99 línguas. Usa uma arquitetura de codificador-decoder transformador treinada em 680.000 horas de dados de áudio multilingue.
Informações do Modelo
- FornecedorOpenAI
- Arquitetura-
- LicençaMIT
- ActualizadoAug 2026
Perguntas frequentes
Whisper Large V3 é um modelo de fala a texto por OpenAI. STT.ai é executado por nossa própria GPU para contas em um plano pago, e é o modelo por trás da nível melhorado STT.ai. Transcrição gratuita usa Whisper Large v3 Turbo, o ponto de controle mais rápido da mesma família.
Nas referências padrão, Whisper Large V3 atinge cerca de 8801% da taxa de erro do Word. A precisão do mundo real depende da qualidade, acento e linguagem do áudio; para gravações ruidosas ou acentuadas, esperam alguns pontos percentuais mais altos WER.
Whisper Large V3 corre na nível livre de STT.ai — cada visitante recebe 600 minutos para começar sem custo. Planos pagos adicionam mais limites por arquivo, transcrições privadas e filas de espera prioritárias.
Whisper Large V3 é lançado sob MIT, uma licença permissiva de código aberto. Você pode auto-hoste Whisper Large V3 em seu próprio hardware ou usar a nossa versão hospedada — ambos são comercialmente utilizáveis.
Whisper Large V3 suporta 99 idiomas. Auto-detecção escolhe a linguagem certa para a maioria do áudio; você também pode especificar manualmente para um pequeno elevador de precisão.
Whisper Large V3 processa áudio a cerca de 15.9x em tempo real em nosso GPUs. Um arquivo de áudio de 1 hora termina em menos de 3 minutos; arquivos mais longos cola e notifica por e-mail quando feito.
Whisper Large V3 tem 1.55B parâmetros. Os modelos mais grandes tendem a ser mais precisos mas mais lentos; STT.ai hosts Whisper Large V3 na GPU para que a contagem de parâmetros não afecte o seu desempenho do lado do cliente.
Whisper Large V3 aceita cada formato STT.ai suportes — MP3, WAV, M4A, FLAC, OGG, MP4, MKV, MOV, WebM, AVI e outros. Saída como TXT, SRT, VTT, DOCX, JSON ou PDF.
Sim. Diarização do orador corre ao lado de Whisper Large V3 para cada transcrição — cada orador é rotulado e você pode renomeá-los no editor depois.
Sim. Whisper Large V3 funciona no nosso ambiente gerenciado — áudio é processado e excluído por padrão e nunca usado para treinamento sem opt-in explícito. Pro planos adicionar criptografia do lado do cliente para transcrições no repouso.
Use a ferramenta compar-stt para executar Whisper Large V3 contra qualquer outro modelo suportado no mesmo áudio — você verá WER, contagem de segmentos, rótulos de alto-falante e pontuação de confiança lado a lado. A comparação Whisper Large V3 vs Whisper Large V3 é a mais comumente executada.
Sim, em um plano pago. Especifique "whisper-large-v3" como o parâmetro modelo no ponto final /v1/transcribe. As chaves sem um plano ativo são servidas Whisper Large v3 Turbo. O pedido ainda é bem sucedido; ele apenas executa o modelo livre.
Sim. Como Whisper Large V3 é MIT-licenciado, você pode hospedá-lo. STT.ai página de código aberto lista o projeto repo e pesos. A maioria das equipes de produção usa a nossa versão hospedada para saltar compras GPU, swaps de modelos e ops.