Transkriber med STT.ai Enhanced
4.2%
WER
99
Språk
15.9x
Fart
MIT
Lisens
Om STT.ai Enhanced
STT.ai Enhanced er vår mest nøyaktige og raske tale-til-tekst-modell. Bygt på ein banebrytande transformatorarkitektur med proprietære optimaliseringar, leverer han bransjeleiande ordfeilrater på over 100 språk.
✦ Lås opp utvida modell
Få tilgang til vår mest nøyaktige modell med alle betalte abonnement - Whisper large-v3, 99 språk og talardiarisering.
Vis planar →Modellinformasjon
- TilbydarOpenAI (hosted by STT.ai)
- Arkitektur-
- LisensMIT
- OppdatertAug 2026
Ofte stilte spørsmål
STT.ai Enhanced er ein tale-til-tekst-modell frå OpenAI (hosted by STT.ai). STT.ai er vert for STT.ai Enhanced på vår GPU-infrastruktur, slik at du kan bruka han utan å ha din eigen maskinvare — last opp lyd eller video og vel STT.ai Enhanced frå modellveljaren.
På standard målestokkar oppnår STT.ai Enhanced om lag 4.2% ordfeilrate. Nøyaktigheita i verkeleg liv avheng av lydkvalitet, aksent og språk. For støyande eller aksenterte opptak, kan du venta eit par prosentpoeng høgare WER.
STT.ai Enhanced er ein premiummodell — inkludert i alle betalte STT.ai-planar frå $5/månad. Han er ikkje tilgjengeleg på gratisnivået: gratis og anonyme opplastingar køyrer Whisper Turbo i staden.
STT.ai Enhanced er utgjeve under MIT, ein permissiv open kjeldekode-lisens. Du kan sjølv ha STT.ai Enhanced på din eigen maskinvare eller bruke vår vertsversjon — begge er kommersielt brukbare.
STT.ai Enhanced støttar 99 språk. Automatisk oppdaging vel det rette språket for dei fleste lydfiler. Du kan òg velja språket manuelt for å få ein liten forbetring av nøyaktigheita.
STT.ai Enhanced prosesserer lyd med om lag 15.9x sanntid på grafikkprosessorane våre. Ein 1-timers lydfil er ferdig på under 3 minutt. Lengre filer vert lagt i kø og varsla via e-post når dei er ferdige.
STT.ai Enhanced har 1.55B-parametrar. Større modeller har ein tendens til å vera meir nøyaktige, men tregare. STT.ai er vert for STT.ai Enhanced på GPU-en, så parametertalet påverkar ikkje ytinga på klientsida.
STT.ai Enhanced godtek alle formata STT.ai støttar — MP3, WAV, M4A, FLAC, OGG, MP4, MKV, MOV, WebM, AVI og andre. Utdata som TXT, SRT, VTT, DOCX, JSON eller PDF.
Ja. Diarisering av talarar køyrer saman med STT.ai Enhanced for kvar transkripsjon — kvar talar er merket og du kan endra namnet på dei i redigeringa etterpå.
Ja. STT.ai Enhanced køyrer i vår private infrastruktur – lyd blir handsama og sletta som standard. Pro+ legg til kryptering på klientsida slik at transkripsjonar er uleselege utan nøkkelen din, og Private Cloud let deg vere vert for STT.ai Enhanced heilt i din eigen VPC.
Bruk verktøyet compare-stt for å køyra STT.ai Enhanced mot ein annan støtta modell på same lyd. Du vil sjå WER, segmenttal, høgtalarnamn og tiltrupoeng side om side. Samanlikninga STT.ai Enhanced vs Whisper Large V3 er den mest brukte.
Ja. Oppgje «stt-ai-enhanced» som modellparameter på /v1/transcribe-endepunktet. Python- og Node.js-SDK-ar inneheld STT.ai Enhanced-eksempela. Gratis API-nivå inkluderer 100 minutt/månad.
Ja. Sidan STT.ai Enhanced er MIT-lisensiert, kan du sjølv vera vert for det. STT.ai sin open kjeldekode-side viser prosjektarkivet og vektene. Dei fleste produksjonsteam brukar vår vertsversjon for å hoppa over GPU-innkjøp, modellbytte og operasjonar.