Översätt med STT.ai Enhanced
4.2%
WER
99
Språk
15.9x
Varvtal
MIT
Licens
Om jag inte kan STT.ai Enhanced
STT.ai Enhanced är vår mest exakta och snabbaste tal-till-text-modell. Den bygger på banbrytande transformatorarkitektur med egenutvecklade optimeringar och ger branschledande felfrekvenser över 100+ språk. Idealisk för produktions transkription, bildtext i realtid och företagsapplikationer.
Språk som stöds av STT.ai Enhanced
✦ Lås upp utökad modell
Få tillgång till vår mest exakta modell med någon betald plan — Whisper stor-v3, 99 språk, och högtalare diarization.
Visa Planer →Förlaga till information
- LeverantörOpenAI (hosted by STT.ai)
- Arkitektur-
- LicensMIT
- UppdateradAug 2026
Vanliga frågor
STT.ai Enhanced är en tal-till-text-modell med OpenAI (hosted by STT.ai). STT.ai värd STT.ai Enhanced på vår GPU-infrastruktur så att du kan använda den utan att tillhandahålla din egen hårdvara – ladda upp ljud eller video och plocka STT.ai Enhanced från modellen plockare.
På standard riktmärken, STT.ai Enhanced uppnår cirka 8801% Word Felfrekvens. Real-world noggrannhet beror på ljudkvalitet, accent och språk; för bullriga eller accentiva inspelningar, förvänta sig några procentenheter högre WER.
STT.ai Enhanced är en premium modell - ingår i alla betalda STT.ai plan med start på $ 5 / månad. Det är inte tillgängligt på den fria nivån: gratis och anonyma uppladdningar kör Whisper Turbo istället.
STT.ai Enhanced släpps under MIT, en tillåtande öppen källkod licens. Du kan själv värd STT.ai Enhanced på din egen hårdvara eller använda vår värd version – båda är kommersiellt användbara.
STT.ai Enhanced stöder 99 språk. Automatisk upptäckt väljer rätt språk för de flesta ljud; du kan också ange det manuellt för en liten noggrannhet lyft.
STT.ai Enhanced behandlar ljud på ca 15.9x realtid på våra GPUs. En 1-timmars ljudfil slutar på under 3 minuter; längre filer köa och meddela via e-post när det är gjort.
STT.ai Enhanced har 1.55B parametrar. Större modeller tenderar att vara mer exakta men långsammare; STT.ai värd STT.ai Enhanced på GPU så parametern räknas inte påverkar din klient-sidan prestanda.
STT.ai Enhanced accepterar varje format STT.ai stöder — MP3, WAV, M4A, FLAC, OGG, MP4, MKV, MOV, WebM, AVI, med flera. Utmatning som TXT, SRT, VTT, DOCX, JSON, eller PDF.
Ja. Högtalardiarization körs vid sidan av STT.ai Enhanced för varje transkription — varje talare är märkt och du kan byta namn på dem i redaktören efteråt.
Ja. STT.ai Enhanced körs i vår privata infrastruktur — ljud behandlas och tas bort som standard. Pro+ lägger till klient-side kryptering så utskrifter är oläsbara utan din nyckel, och Private Cloud låter dig själv-värd STT.ai Enhanced helt i din egen VPC.
Använd jämförelse-stt verktyg för att köra STT.ai Enhanced mot någon annan stöds modell på samma ljud - du kommer att se WER, segment räkna, högtalare etiketter och förtroende poäng sida vid sida. STT.ai Enhanced vs Whisper Large V3 jämförelse är den vanligaste köras.
Ja. Ange "stt-ai-enhanced" som modellparameter för /v1/transkriptiv endpoint. Python och Node.js SDKs inkluderar STT.ai Enhanced exempel. Gratis API-nivå inkluderar 100 minuter/månad.
Ja. Eftersom STT.ai Enhanced är MIT-licensierad, kan du själv värd den. STT.ai öppen källkod sida listar projektet repo och vikter. De flesta produktionsteam använder vår värd version för att hoppa över GPU upphandling, modellswappar, och ops.