Transcrie cu STT.ai Enhanced
4.2%
WER
99
Limbi
15.9x
Viteza
MIT
Licență
Despre STT.ai Enhanced
STT.ai Dezvoltat este modelul nostru cel mai precis și rapid de vorbire la text. Construit pe arhitectura de transformator de avans cu optimizații proprietare, acesta oferă rate de eroare cu cuvinte lider din industria în 100 de limbi. Ideal pentru transcriere de producție, detindere în timp real, și aplicații de întreprindere.
Limbi suportate de STT.ai Enhanced
✦ Deblocați modelul îmbunătăţit
Accesaţi la modelul nostru cel mai precis cu orice plan plătit — Whisper mare-v3, 99 de limbi şi diarizarea vorbitorilor.
Vizualizare planuri →Informații model
- FurnizorOpenAI (hosted by STT.ai)
- Arhitectura-
- LicențăMIT
- ActualizatAug 2026
Întrebări frecvente
STT.ai Enhanced este un model de vorbire la text până la OpenAI (hosted by STT.ai). STT.ai găzduiește STT.ai Enhanced pe infrastructura noastră GPU astfel încât să-l puteți utiliza fără a furniza propriul hardware – încărca audio sau video și alege STT.ai Enhanced de la selector de model.
Pe baza standardelor de referință, STT.ai Enhanced realizează aproximativ 4.2% Rata de eroare Word. Acuratețea lumii reale depinde de calitatea audio, accentul și limba; pentru înregistrări zgomotoase sau accentuate, se așteaptă la câteva puncte procentuale mai mari WER.
STT.ai Enhanced este un model de primă — inclus în orice plan de STT.ai de dolari plătit începând cu 5 dolari pe lună. Nu este disponibil pe nivel gratuit: încărcături gratuite și anonime rulează în schimb Whisper Turbo.
STT.ai Enhanced este lansat sub MIT, o licență permisivă de open-source. Puteți auto-gazdă STT.ai Enhanced pe propriul hardware sau utiliza versiunea noastră gazdă — ambele sunt utilizabile comercial.
STT.ai Enhanced suportă 99 limbi. Auto-detection alege limba corectă pentru majoritatea audio; puteți, de asemenea, să o specificați manual pentru un mic lift de precizie.
STT.ai Enhanced procesează audio la aproximativ 15.9x în timp real pe GPU-urile noastre. Un fișier audio de 1 oră se termină în sub 3 minute; fișiere mai lungi coada și notificare prin e-mail atunci când este gata.
STT.ai Enhanced are parametri 1.55B. Modelele mai mari tind să fie mai precise, dar mai lent; STT.ai găzduiește STT.ai Enhanced pe GPU astfel încât numărul de parametri nu afectează performanța client-side.
STT.ai Enhanced acceptă fiecare format de suport STT.ai — MP3, WAV, M4A, FLAC, OGG, MP4, MKV, MOV, WebM, AVI și alții. Produsă ca TXT, SRT, VTT, DOCX, JSON sau PDF.
Da. Diarizarea speakerului merge alături de STT.ai Enhanced pentru fiecare transcriere — fiecare speaker este etichetat și le puteți renoma în editor după aceea.
Da. STT.ai Enhanced rulează în infrastructura noastră privată — audio este prelucrat și eliminat prin implicit. Pro+ adaugă criptare de partea clientului astfel că transcripțiile sunt nelegibil fără cheia ta, iar Private Cloud vă permite să vă gazduiți STT.ai Enhanced în întregime în propriul VPC.
Utilizați instrumentul compara-stt pentru a rula STT.ai Enhanced împotriva oricărui alt model suportat pe același audio — veți vedea WER, număr de segmente, etichete de speaker și scoruri de încredere lado-a-side. STT.ai Enhanced vs Whisper Large V3 comparație este cel mai frecvent rulat.
Da. Specificați "stt-ai-enhanced" ca parametrul model pe punctul final /v1/transcrie. Python și Node.js SDKs includ STT.ai Enhanced exemple. Nivelul API gratuit include 100 minute/luna.
Da. Deoarece STT.ai Enhanced este MIT- licenciat, puteți să-l găzduiți. STT.ai de pagini de open-source listează proiectul repo și greutăți. Cele mai multe echipe de producție folosesc versiunea noastră găzduită pentru a trece peste GPU achiziții, swaps de model și ops.