Transkriber med STT.ai Enhanced
4.2%
WER
99
Språk
15.9x
Hastighet
MIT
Lisens
Om STT.ai Enhanced
STT.ai Forbedret er vår mest nøyaktige og raskeste tale-til-tekst-modell. Byggt på banebrytende transformer-arkitektur med egne optimeringer, leverer den industri-ledende ordfeilhastigheter på 100+ språk. Ideelt for produksjonskopiering, sanntidsteksting og foretaksapplikasjoner.
✦ Lås opp en utvidet modell
Få tilgang til vår mest nøyaktige modell med alle betalte planer - Whisper stor-v3, 99 språk, og høyttaler diarisering.
Vis planer →Modellinfo
- LeverandørOpenAI (hosted by STT.ai)
- Arkitektur-
- LisensMIT
- OppdatertAug 2026
Ofte stilte spørsmål
STT.ai Enhanced er en tale-til-tekst-modell av OpenAI (hosted by STT.ai). STT.ai er verter STT.ai Enhanced på vår GPU-infrastruktur slik at du kan bruke den uten å skaffe til veie din egen maskinvare – last opp lyd eller video og velg STT.ai Enhanced fra modellvelgeren.
Standard standardverdier viser at STT.ai Enhanced oppnår rundt 4.2% Word Error Rate. Nøyaktighet i den virkelige verden avhenger av lydkvalitet, aksent og språk. For opptak med støy eller aksent, forvent noen prosentpoeng høyere WER.
STT.ai Enhanced er en premiummodell – inkludert med enhver betalt STT.ai plan som begynner på $ 5/ måned. Den er ikke tilgjengelig på det frie nivået: gratis og anonyme opplastinger kjører Whisper Turbo i stedet.
STT.ai Enhanced er frigitt under MIT, en ettergivende åpen kildekode- lisens. Du kan selv være vert STT.ai Enhanced på din egen maskinvare eller bruke vår vertsversjon – begge kan brukes kommersielt.
STT.ai Enhanced støtter 99 språk. Auto- deteksjon velger det riktige språket for de fleste lydene. Du kan også oppgi det manuelt for en liten presisjonsheis.
STT.ai Enhanced behandler lyd ved omlag 15.9x i sanntid på våre GPU- er. En en- times lydfil er ferdig på under 3 minutter, lengre filkø og varsles med e- post når den er ferdig.
STT.ai Enhanced har 1.55B parametre. Større modeller har en tendens til å være mer presise men langsommere. STT.ai er verter STT.ai Enhanced på GPU så parametertallet påvirker ikke din ytelse på klientsiden.
STT.ai Enhanced godtar alle format STT.ai støtter – MP3, WAV, M4A, FLAC, OGG, MP4, MKV, MOV, WebM, AVI og andre. Utdata som TXT, SRT, VTT, DOCX, JSON eller PDF.
Ja. Høytalerdiarisering går sammen med STT.ai Enhanced for hver utskrift – hver høyttaler er merket og du kan endre navn på dem i redigeringen etterpå.
Ja. STT.ai Enhanced kjører i vår private infrastruktur – lyd behandles og slettes som standard. Pro+ legger til kryptering på klientsiden slik at utskrifter er uleselige uten din nøkkel, og Private Cloud lar deg bruke selvtjener STT.ai Enhanced helt i din egen VPC.
Bruk sammenlikningsverktøyet til å kjøre STT.ai Enhanced mot alle andre modeller som støttes på samme lyd – du får se WER, segmenttelling, høyttal og tillitspoeng side om side. Sammenlikningen STT.ai Enhanced mot Whisper Stor V3 er det vanligste kjøreverktøyet.
Ja. Oppgi « stt-ai-enhanced » som modellparameter for sluttpunktet / v1/ trancribe. Python og Node. js SDK inkluderer STT.ai Enhanced eksempler. Free API- nivå inkluderer 100 minutter/ måned.
Ja, fordi STT.ai Enhanced er MIT-lisensert, kan du selv være vert for det. STT.ai-tallets åpen-kildekode side lister prosjektet repo og vekter. de fleste produksjonsteam bruker vår vertsversjon til å hoppe over GPU innkjøp, modellbytteavtaler og ops.