Transcreber con STT.ai Enhanced
4.2%
WER
99
Linguas
15.9x
Velocidade
MIT
Licenza
Acerca de STT.ai Enhanced
STT.ai Enhanced é o noso modelo de voz a texto máis preciso e rápido. Construído sobre unha arquitectura de transformador de vangarda con optimizacións propietarias, ofrece taxas de erro de palabra líderes na industria en máis de 100 linguas. Ideal para transcrición de produción, subtítulos en tempo real e aplicacións empresariais.
✦ Desbloquear o modelo mellorado
Obteña acceso ao noso modelo máis preciso con calquera plan de pago: Whisper large-v3, 99 linguas e diarización de falantes.
Ver os planos →Información do modelo
- ProvedorOpenAI (hosted by STT.ai)
- Arquitectura-
- LicenzaMIT
- ActualizadoAug 2026
Preguntas frecuentes
STT.ai Enhanced é un modelo de voz a texto de OpenAI (hosted by STT.ai). STT.ai aloxa STT.ai Enhanced na nosa infraestrutura de GPU para que poida usalo sen ter que aprovisionar o seu propio hardware: envíe son ou vídeo e escolla STT.ai Enhanced no selector de modelos.
En probas estándar, STT.ai Enhanced alcanza unha taxa de erro de palabra do 4.2%. A precisión real depende da calidade do son, do acento e da linguaxe; para gravacións ruidosas ou acentuadas, espere uns poucos puntos porcentuais máis altos de WER.
STT.ai Enhanced é un modelo premium — incluído en calquera plan STT.ai pagado a partir de $5/ mes. Non está dispoñíbel no nivel gratuíto: os envíos gratuítos e anónimos executan Whisper Turbo no seu lugar.
STT.ai Enhanced é publicado baixo MIT, unha licenza permisiva de código aberto. Pode aloxar STT.ai Enhanced no seu propio hardware ou usar a nosa versión aloxada, ambas as dúas son comercialmente utilizables.
STT.ai Enhanced soporta 99 linguas. A detección automática escolle a lingua correcta para a maioría do son; tamén pode especificala manualmente para un pequeno aumento de precisión.
STT.ai Enhanced procesa o son a uns 15.9x en tempo real nas nosas GPU. Un ficheiro de son de 1 hora remata en menos de 3 minutos; os ficheiros máis longos enfróntanse e avísanse por correo electrónico cando rematan.
STT.ai Enhanced ten parámetros 1.55B. Os modelos maiores tenden a ser máis precisos pero máis lentos; STT.ai aloxa STT.ai Enhanced na GPU polo que a contaxe de parámetros non afecta ao rendemento do lado do cliente.
STT.ai Enhanced acepta todos os formatos soportados por STT.ai: MP3, WAV, M4A, FLAC, OGG, MP4, MKV, MOV, WebM, AVI e outros. Saída como TXT, SRT, VTT, DOCX, JSON ou PDF.
Si. A diarización do falante corre xunto co STT.ai Enhanced para cada transcrición - cada falante está etiquetado e pode mudarlle o nome no editor despois.
Si. STT.ai Enhanced executase na nosa infraestrutura privada — o son é procesado e borrado por omisión. Pro+ engade cifrado do lado do cliente para que as transcricións sexan ilegibles sen a súa chave, e Private Cloud permítelle aloxar STT.ai Enhanced completamente na súa propia VPC.
Use a ferramenta compare- stt para executar o STT.ai Enhanced contra calquera outro modelo soportado no mesmo son — verá o WER, o número de segmentos, as etiquetas dos altofalantes e as puntuacións de confianza lado a lado. A comparación STT.ai Enhanced vs Whisper Large V3 é a máis común.
Si. Especifique « stt-ai-enhanced » como parámetro do modelo no punto final / v1/ transcribe. Os SDK de Python e Node. js inclúen exemplos de STT.ai Enhanced. O nivel de API gratuíto inclúe 100 minutos/ mes.
Si. Como STT.ai Enhanced ten licenza MIT, pode aloxalo vostede mesmo. A páxina de código aberto de STT.ai lista o repositorio e os pesos do proxecto. A maioría dos equipos de produción usan a nosa versión aloxada para saltar a procura de GPU, intercambios de modelos e operacións.