Distil-Whisper
STT.ai kjører ikke denne modellen. Denne siden er referanseinformasjon om den.
Transkriber med de modellene vi kjører →
5.8%
WER
99
Språk
48.0x
Hastighet
MIT
Lisens
Om Distil-Whisper
Destill- Whisper er en destillert versjon av Whisper laget av Hugging Face. Den reduserer modellstørrelsen med 49% og gir 6x raskere konklusjoner, samtidig som den opprinnelige Whisper Large V2 holdes innenfor 1% WER på evalueringssett som ikke er fordelt.
Modellinfo
- LeverandørHugging Face
- Arkitektur-
- LisensMIT
- OppdatertMar 2026
Ofte stilte spørsmål
Distil-Whisper er en tale- til- tekst- modell av Hugging Face. STT.ai kjører ikke Distil-Whisper – denne siden er referanseinformasjon om modellen. For utskrift på STT.ai tilbyr modellvelgeren Whisper - familien (Turbo, Stor V3, Middels, Liten).
Standard standardverdier viser at Distil-Whisper oppnår rundt 5.8% Word Error Rate. Nøyaktighet i den virkelige verden avhenger av lydkvalitet, aksent og språk. For opptak med støy eller aksent, forvent noen prosentpoeng høyere WER.
Distil-Whisper finnes ikke på STT.ai. Dens egne lisensvilkår styrer selv om den kjører. STT.ai fritt nivå dekker de Whisper- modellene vi kjører. 600 minutter å starte, så en månedlig gratis top- up.
Distil-Whisper er frigitt under MIT, en ettergivende åpen kildekode- lisens. Du kan selv være vert Distil-Whisper på din egen maskinvare eller bruke vår vertsversjon – begge kan brukes kommersielt.
Distil-Whisper støtter 99 språk. Auto- deteksjon velger det riktige språket for de fleste lydene. Du kan også oppgi det manuelt for en liten presisjonsheis.
Distil-Whisper behandler lyd ved omlag 48.0x i sanntid på våre GPU- er. En en- times lydfil er ferdig på under 1 minutter, lengre filkø og varsles med e- post når den er ferdig.
Distil-Whisper har 756M parametre. Større modeller har en tendens til å være mer presise men langsommere. STT.ai er verter Distil-Whisper på GPU så parametertallet påvirker ikke din ytelse på klientsiden.
Distil-Whisper godtar alle format STT.ai støtter – MP3, WAV, M4A, FLAC, OGG, MP4, MKV, MOV, WebM, AVI og andre. Utdata som TXT, SRT, VTT, DOCX, JSON eller PDF.
Ja. Høytalerdiarisering går sammen med Distil-Whisper for hver utskrift – hver høyttaler er merket og du kan endre navn på dem i redigeringen etterpå.
Ja. Distil-Whisper kjører i vårt styrte miljø – lyd behandles og slettes som standard og brukes aldri til trening uten eksplisitt valg. Pro planer legger til kryptering på klientsiden for utskrifter i hvile.
Bruk sammenlikningsverktøyet til å kjøre Distil-Whisper mot alle andre modeller som støttes på samme lyd – du får se WER, segmenttelling, høyttal og tillitspoeng side om side. Sammenlikningen Distil-Whisper mot Whisper Stor V3 er det vanligste kjøreverktøyet.
Ja. Oppgi « distil-whisper » som modellparameter for sluttpunktet / v1/ trancribe. Python og Node. js SDK inkluderer Distil-Whisper eksempler. Free API- nivå inkluderer 100 minutter/ måned.
Ja, fordi Distil-Whisper er MIT-lisensert, kan du selv være vert for det. STT.ai-tallets åpen-kildekode side lister prosjektet repo og vekter. de fleste produksjonsteam bruker vår vertsversjon til å hoppe over GPU innkjøp, modellbytteavtaler og ops.