Transkripto me STT.ai Enhanced
4.2%
WER
99
Gjuhë
15.9x
Shpejtësia
MIT
Liçenca
Për STT.ai Enhanced
STT.ai Enhanced është modeli ynë më i saktë dhe më i shpejtë i fjalës në tekst. I ndërtuar mbi arkitekturën e transformimit të fundit me optimizime të pronësisë, ai jep normat më të mira të gabimeve të fjalëve në industri në më shumë se 100 gjuhë. Ideal për transkriptimin e prodhimit, subtitrimin në kohë reale dhe aplikimet e ndërmarrjeve.
Gjuhët e mbështetura STT.ai Enhanced
✦ Shblloko
Merrni akses në modelin tonë më të saktë me çdo plan të paguar - Whisper large-v3, 99 gjuhë, dhe diarization folës.
Shiko Planet →Informacione mbi modelin
- ProviderOpenAI (hosted by STT.ai)
- Arkitektura-
- LiçencaMIT
- PërditësoAug 2026
Pyetje të shpeshta
STT.ai Enhanced është një model i fjalës në tekst nga OpenAI (hosted by STT.ai). STT.ai mban STT.ai Enhanced në infrastrukturën tonë të GPU kështu që mund ta përdorni pa furnizuar hardware-in tuaj — ngarkoni audion ose videon dhe zgjidhni STT.ai Enhanced nga zgjedhësi i modelit.
Në standartet e vlerësimit, STT.ai Enhanced arrin rreth 4.2% të normave të gabimeve të fjalëve. Saktësia në botën reale varet nga cilësia e audios, theksi dhe gjuha; për regjistrime me zhurmë ose theks, prit disa përqindje më të larta WER.
STT.ai Enhanced është një model premium — i përfshirë me çdo plan të paguar STT.ai duke filluar nga $5/muaj. Nuk është në dispozicion në nivelin e lirë: ngarkimet e lirë dhe anonime përdorin Whisper Turbo në vend të tij.
STT.ai Enhanced është lëshuar nën MIT, një licencë e hapur e hapur. Mund të vetë-hostoni STT.ai Enhanced në hardware-in tuaj ose të përdorni versionin tonë të pritur — të dy janë komercialisht të përdorshëm.
STT.ai Enhanced suporton 99 gjuhë. Zbulimi automatik zgjedh gjuhën e duhur për shumicën e audiove; mund ta specifikoni gjithashtu manualisht për një rritje të vogël të saktësisë.
STT.ai Enhanced përpunon audion në rreth 15.9x në kohë reale në GPU-të tona. Një file audio 1 orë përfundon në më pak se 3 minuta; file më të gjatë vënë në radhë dhe njoftohen me email kur përfundojnë.
STT.ai Enhanced ka parametrat 1.55B. Modelet më të mëdha priren të jenë më të sakta por më të ngadalshme; STT.ai hosts STT.ai Enhanced në GPU kështu që numërimi i parametrave nuk ndikon në performancën e anës së klientit.
STT.ai Enhanced pranon çdo format që suporton STT.ai — MP3, WAV, M4A, FLAC, OGG, MP4, MKV, MOV, WebM, AVI, dhe të tjerë. Shfaq si TXT, SRT, VTT, DOCX, JSON, ose PDF.
Po. Diarization e folësit punon së bashku me STT.ai Enhanced për çdo transkriptim - çdo folës është i etiketuar dhe mund t'i riemërtoni ata në editor më pas.
Po. STT.ai Enhanced punon në infrastrukturën tonë private — audiot përpunohen dhe fshihen në mënyrë të prezgjedhur. Pro+ shton kriptimin në anën e klientit kështu që transkriptat janë të pa lexueshme pa çelësin tuaj, dhe Private Cloud ju lejon të vetë-hostoni STT.ai Enhanced krejtësisht në VPC tuaj.
Përdor instrumentin compare-stt për të ekzekutuar STT.ai Enhanced kundër çdo modeli tjetër të suportuar në të njëjtin audio — do të shihni WER, numrin e segmenteve, etiketat e folësve dhe rezultatet e besimit krah-për-krah. Krahasimi STT.ai Enhanced vs Whisper Large V3 është më i zakonshmi.
Po. Specifiko "stt-ai-enhanced" si parametri i modelit në /v1/transcribe endpoint. Python dhe Node.js SDK përfshijnë shembuj STT.ai Enhanced. Niveli i API pa pagesë përfshin 100 minuta në muaj.
Po. Sepse STT.ai Enhanced është i licencuar MIT, mund ta hostosh vetë. Faqja e burimit të hapur të STT.ai-ës përmban listën e projektit dhe peshat. Shumica e ekipeve të prodhimit përdorin versionin tonë të pritur për të kaluar GPU-në, modelin e shkëmbimit dhe operacionet.