STT.ai Enhanced

STT.ai ejecuta este modelo en el nivel de pago. Es el modelo detrás de STT.ai Enhanced. La transcripción libre utiliza Whisper Large v3 Turbo, que es más rápido. Ver planes → · Transcribe gratis con Whisper Turbo →
4.2%
WER
99
Idiomas
15.9x
Velocidad
MIT
Licencia

Acerca de STT.ai Enhanced

STT.ai Enhanced es nuestro modelo de voz a texto más preciso y rápido. Construido en la arquitectura de transformadores de vanguardia con optimizaciones patentadas, ofrece tasas de error de palabras líderes en la industria en más de 100 idiomas. Ideal para transcripciones de producción, subtítulos en tiempo real y aplicaciones empresariales.
✦ Desbloquear modelo mejorado

Obtenga acceso a nuestro modelo más preciso con cualquier plan de pago: Whisper large-v3, 99 idiomas y diarización de hablantes.

Ver los planes →
Información del modelo
  • ProveedorOpenAI (hosted by STT.ai)
  • Arquitectura-
  • LicenciaMIT
  • ActualizadoAug 2026

Preguntas frecuentes

STT.ai Enhanced es un modelo de voz a texto de OpenAI (hosted by STT.ai). STT.ai lo ejecuta en nuestra propia GPU para cuentas en un plan de pago, y es el modelo detrás del nivel mejorado STT.ai. La transcripción gratuita utiliza Whisper Large v3 Turbo, el punto de control más rápido de la misma familia.

En puntos de referencia estándar, STT.ai Enhanced alcanza alrededor de 4.2% tasa de error de Word. La precisión en el mundo real depende de la calidad de audio, el acento y el lenguaje; para grabaciones ruidosas o acentuadas, espere unos puntos porcentuales más alto WER.

STT.ai Enhanced es un modelo premium — incluido con cualquier plan de pago STT.ai a partir de $9/mes. No está disponible en el nivel gratuito: gratis y las cargas anónimas ejecutar Whisper Turbo en su lugar.

STT.ai Enhanced es lanzado bajo MIT, una licencia de código abierto permisiva. Usted puede auto-anfitriona STT.ai Enhanced en su propio hardware o utilizar nuestra versión alojada — ambos son comercialmente utilizables.

STT.ai Enhanced admite 99 idiomas. La detección automática selecciona el idioma adecuado para la mayoría de audio; también puede especificarlo manualmente para un pequeño ascensor de precisión.

STT.ai Enhanced procesa audio en aproximadamente 15.9x en tiempo real en nuestras GPUs. Un archivo de audio de 1 hora termina en menos de 3 minutos; los archivos más largos cola y notificar por correo electrónico cuando se hace.

STT.ai Enhanced tiene parámetros 1.55B. Los modelos más grandes tienden a ser más precisos pero más lentos; STT.ai aloja STT.ai Enhanced en GPU para que el recuento de parámetros no afecte el rendimiento de su cliente.

STT.ai Enhanced acepta todos los soportes de formato STT.ai — MP3, WAV, M4A, FLAC, OGG, MP4, MKV, MOV, WebM, AVI, y otros. Salida como TXT, SRT, VTT, DOCX, JSON o PDF.

Sí. Diarización del altavoz corre junto a STT.ai Enhanced para cada transcripción - cada altavoz está etiquetado y se puede cambiar el nombre en el editor después.

Sí. STT.ai Enhanced se ejecuta en nuestra infraestructura privada — el audio se procesa y elimina por defecto. Pro+ añade cifrado del lado del cliente para que las transcripciones sean ilegibles sin su clave, y Private Cloud le permite albergar STT.ai Enhanced completamente en su propio VPC.

Utilice la herramienta compare-stt para ejecutar STT.ai Enhanced contra cualquier otro modelo soportado en el mismo audio: verá WER, conteo de segmentos, etiquetas de altavoz y puntuaciones de confianza lado a lado. La comparación STT.ai Enhanced vs Whisper Large V3 es la más común.

Sí, en un plan de pago. Especifique "stt-ai-enhanced" como el parámetro de modelo en el punto final /v1/transcribir. Las claves sin un plan activo se sirven Whisper Large v3 Turbo en su lugar. La petición todavía tiene éxito; sólo se ejecuta el modelo libre.

Sí. Debido a que STT.ai Enhanced es licenciada MIT, usted puede auto-anfitrionarlo. STT.ai's página de código abierto lista la repo proyecto y pesos. La mayoría de los equipos de producción utilizan nuestra versión alojada para saltarse la adquisición de GPU, modelos swaps, y ops.