STT.ai Enhanced

STT.ai esegue questo modello sul livello pagato. È il modello dietro STT.ai migliorato. Trascrizione gratuita utilizza Whisper Large v3 Turbo, che è più veloce. Cfr. piani → · Trascrivere gratuitamente con Whisper Turbo →
4.2%
WER
99
Lingue
15.9x
Velocità
MIT
Licenza

Informazioni STT.ai Enhanced

STT.ai Enhanced è il nostro modello speech-to-text più preciso e veloce. Costruito su un'architettura di trasformatori all'avanguardia con ottimizzazioni proprietarie, offre velocità di errore di parola leader nel settore in oltre 100 lingue. Ideale per la trascrizione di produzione, la didascalia in tempo reale e applicazioni aziendali.
✦ Sblocca il modello migliorato

Ottieni accesso al nostro modello più accurato con qualsiasi piano a pagamento.Whisper large-v3, 99 lingue, e diarizzazione dei diffusori.

Visualizza Piani →
Informazioni sul modello
  • FornitoreOpenAI (hosted by STT.ai)
  • Architettura-
  • LicenzaMIT
  • AggiornatoAug 2026

Domande frequenti

STT.ai Enhanced is a speech-to-text model by OpenAI (hosted by STT.ai). STT.ai runs it on our own GPU for accounts on a paid plan, and it is the model behind the STT.ai Enhanced tier. Free transcription uses Whisper Large v3 Turbo, the faster checkpoint of the same family.

Sui benchmark standard, STT.ai Enhanced raggiunge circa 4.2% Word Error Rate. L'accuratezza del mondo reale dipende dalla qualità audio, dall'accento e dal linguaggio; per le registrazioni rumorose o accentuate, aspettatevi qualche punto percentuale più alto WER.

STT.ai Enhanced is a premium model — included with any paid STT.ai plan starting at $9/month. It is not available on the free tier: free and anonymous uploads run Whisper Turbo instead.

STT.ai Enhanced è rilasciato sotto MIT, una licenza open-source permissiva. È possibile auto-host STT.ai Enhanced sul proprio hardware o utilizzare la nostra versione hosted entrambi sono commercialmente utilizzabili.

STT.ai Enhanced supporta 99 lingue. Rilevamento automatico sceglie la lingua giusta per la maggior parte dell'audio; è anche possibile specificarlo manualmente per un piccolo sollevamento di precisione.

STT.ai Enhanced elabora audio a circa 15.9x in tempo reale sulle nostre GPU. Un file audio di 1 ora termina in meno di 3 minuti; file più lunghi coda e notifica per e-mail quando fatto.

STT.ai Enhanced ha 1.55B parametri. I modelli più grandi tendono ad essere più precisi ma più lenti; STT.ai host STT.ai Enhanced su GPU in modo che il conteggio dei parametri non influisca sulle prestazioni lato client.

STT.ai Enhanced accetta ogni formato STT.ai supporta © MP3, WAV, M4A, FLAC, OGG, MP4, MKV, MOV, WebM, AVI, e altri. Uscita come TXT, SRT, VTT, DOCX, JSON, o PDF.

Sì. La diarizzazione degli altoparlanti corre accanto a STT.ai Enhanced per ogni trascrizione ogni altoparlante è etichettato e si può rinominare in seguito nell'editor.

Sì. STT.ai Enhanced è eseguito nella nostra infrastruttura privata L'audio è elaborato e cancellato per impostazione predefinita. Pro+ aggiunge crittografia lato client in modo che le trascrizioni sono illeggibili senza la tua chiave, e Private Cloud consente di auto-host STT.ai Enhanced interamente nel proprio VPC.

Utilizzare lo strumento di confronto-stt per eseguire STT.ai Enhanced contro qualsiasi altro modello supportato sullo stesso audio. Vedrete WER, conteggio dei segmenti, etichette degli altoparlanti e punteggi di confidenza fianco a fianco. Il confronto STT.ai Enhanced vs Whisper Large V3 è il più comunemente eseguito.

Sì, su un piano a pagamento. Specificare "stt-ai-enhanced" come parametro del modello sull'endpoint /v1/trascrivere. Le chiavi senza un piano attivo sono servite Whisper Large v3 Turbo invece. La richiesta riesce ancora; esegue semplicemente il modello Gratis.

Sì. Poiché STT.ai Enhanced è MIT-licensed, si può auto-ospitare esso. STT.ai pagina open-source elenca il progetto repo e pesi. La maggior parte dei team di produzione utilizzano la nostra versione ospitata per saltare GPU approvvigionamento, modelli di swap, e op.