Distil-Whisper

STT.ai kör inte den här modellen. Sidan är referensinformation om den. Skriv över de modeller vi kör →
5.8%
WER
99
Språk
48.0x
Varvtal
MIT
Licens

Om jag inte kan Distil-Whisper

Distil-Whisper är en destillerad version av Whisper skapad av Hugging Face. Det minskar modellstorleken med 49% och uppnår 6x snabbare slutsats samtidigt som den håller inom 1% WER av den ursprungliga Whisper Large V2 på out-of-distribution utvärderingsset.

Vanliga frågor

Distil-Whisper är en tal-till-text-modell av Hugging Face. STT.ai kör för närvarande inte Distil-Whisper – denna sida är referensinformation om modellen. För transkription på STT.ai, erbjuder modellen plockaren Whisper familjen (Turbo, Large V3, Medium, Small).

På standard riktmärken, Distil-Whisper uppnår cirka 8801% Word Felfrekvens. Real-world noggrannhet beror på ljudkvalitet, accent och språk; för bullriga eller accentiva inspelningar, förvänta sig några procentenheter högre WER.

Distil-Whisper finns inte på STT.ai. Dess egna licensvillkor styr själv. STT.ai's fria nivå täcker de Whisper modeller vi kör – 600 minuter för att starta, sedan en månatlig gratis topp.

Distil-Whisper släpps under MIT, en tillåtande öppen källkod licens. Du kan själv värd Distil-Whisper på din egen hårdvara eller använda vår värd version – båda är kommersiellt användbara.

Distil-Whisper stöder 99 språk. Automatisk upptäckt väljer rätt språk för de flesta ljud; du kan också ange det manuellt för en liten noggrannhet lyft.

Distil-Whisper behandlar ljud på ca 48.0x realtid på våra GPUs. En 1-timmars ljudfil slutar på under 1 minuter; längre filer köa och meddela via e-post när det är gjort.

Distil-Whisper har 756M parametrar. Större modeller tenderar att vara mer exakta men långsammare; STT.ai värd Distil-Whisper på GPU så parametern räknas inte påverkar din klient-sidan prestanda.

Distil-Whisper accepterar varje format STT.ai stöder — MP3, WAV, M4A, FLAC, OGG, MP4, MKV, MOV, WebM, AVI, med flera. Utmatning som TXT, SRT, VTT, DOCX, JSON, eller PDF.

Ja. Högtalardiarization körs vid sidan av Distil-Whisper för varje transkription — varje talare är märkt och du kan byta namn på dem i redaktören efteråt.

Ja. Distil-Whisper körs i vår hanterade miljö — ljud behandlas och tas bort som standard och aldrig används för utbildning utan uttrycklig opt-in. Pro planer lägga klient-side kryptering för utskrifter i vila.

Använd jämförelse-stt verktyg för att köra Distil-Whisper mot någon annan stöds modell på samma ljud - du kommer att se WER, segment räkna, högtalare etiketter och förtroende poäng sida vid sida. Distil-Whisper vs Whisper Large V3 jämförelse är den vanligaste köras.

Ja. Ange "distil-whisper" som modellparameter för /v1/transkriptiv endpoint. Python och Node.js SDKs inkluderar Distil-Whisper exempel. Gratis API-nivå inkluderar 100 minuter/månad.

Ja. Eftersom Distil-Whisper är MIT-licensierad, kan du själv värd den. STT.ai öppen källkod sida listar projektet repo och vikter. De flesta produktionsteam använder vår värd version för att hoppa över GPU upphandling, modellswappar, och ops.