Distil-Whisper
STT.ai ora ngoperasikaké modél iki. Halaman iki minangka referensi informasi bab iku.
Transkrip karo model kang kita lakoni →
5.8%
WER
99
Basa
48.0x
Kecepatan
MIT
Lisénsi
Ngendi Distil-Whisper
Distil-Whisper iku versi Whisper kang distilasi kang digawé déning Hugging Face. Distil-Whisper ngurangi ukuran model kanthi 49% lan bisa ngasilaké inferensi 6x luwih cepet nalika tetep ana ing 1% WER saka Whisper Large V2 asli ing set evaluasi out-of-distribusi.
Informasi Model
- PenyiarHugging Face
- Arsitektur-
- LisénsiMIT
- DioptimalakeMar 2026
Pitakon kang asring diajukake
Distil-Whisper ya iku modél swara-ka-teks déning Hugging Face. STT.ai saiki ora ngoperasikaké Distil-Whisper — kaca iki minangka informasi referensi bab modél. Kanggo transkripsi ing STT.ai, pemilih modél nawakake kulawarga Whisper (Turbo, Large V3, Medium, Small).
Ing standar benchmarks, Distil-Whisper ngrampungake sekitar 5.8% Word Error Rate. Real-world akurasi gumantung ing kualitas audio, accent, lan basa; kanggo noisey utawa accented rekaman, ngarepake sawetara persentase poin luwih dhuwur WER.
Distil-Whisper ora ana ing STT.ai. Lisensiné dhewe-dhewe ngontrol cara ngoperasikaké. Titik gratis STT.ai nglindhungi model Whisper sing kita lakoni - 600 menit kanggo miwiti, banjur tambahan gratis saben wulan.
Distil-Whisper dirilis ing ngisor MIT, lisensi sumber terbuka sing permisif. Sampeyan bisa nginstal Distil-Whisper ing piranti keras dhewe utawa nggunakake versi sing dihost - loro-loroné bisa digunakake kanthi komersial.
Distil-Whisper nyokong 99 basa. Auto-deteksi milih basa kang bener kanggo akèh audio; sampeyan uga bisa nyetel kanthi manual kanggo nambah akurasi.
Distil-Whisper ngproses audio ing kira-kira 48.0x real-time ing GPU kita. Fail audio 1 jam rampung ing ngisor 1 menit; file luwih dawa ing gulungan lan dilaporake liwat email nalika rampung.
Distil-Whisper duwé parameter 756M. Model kang luwih gedhé luwih akurat nanging luwih lambat; STT.ai duwé host Distil-Whisper ing GPU supaya penghitungan parameter ora ngrusak kinerja klien.
Distil-Whisper nampa saben format STT.ai nyokong - MP3, WAV, M4A, FLAC, OGG, MP4, MKV, MOV, WebM, AVI, lan liyane. Output minangka TXT, SRT, VTT, DOCX, JSON, utawa PDF.
Distil-Whisper diarization speakers dijalanaken kaliyan saben transkripsi - saben speaker dipunlabel lan sampeyan saged mènèhi jeneng anyar ing editor.
Ya. Distil-Whisper dijalanaké ing lingkungan sing diurus — audio diproses lan dipasak kanthi pigura lan ora pernah digunakake kanggo latihan tanpa opt-in eksplisit. Rencana Pro nambah enkripsi klien-sisi kanggo transkripsi nalika ora aktif.
Gunakaké alat compare-stt kanggo nglakokaké Distil-Whisper karo modél liya kang didhukung ing audio kang padha — sampeyan bakal ndeleng WER, penghitung segmen, label speaker, lan skor confidence side-by-side. Perbandingan Distil-Whisper vs Whisper Large V3 iku sing paling umum dilakokaké.
Ya. Nyathet "distil-whisper" minangka parameter model ing /v1/transcribe endpoint. Python lan Node.js SDKs ngemot conto Distil-Whisper. Lapisan API gratis ngemot 100 menit/wulan.
Ya. Amargi Distil-Whisper dipunlisensi MIT, sampeyan saged nghostaken piyambakipun. Lampiran sumber-bukah STT.ai nyathet repo proyèk lan bobot. Kathah tim produksi ingkang ngginakaken versi ingkang dipunhostaken kanggé nglewati GPU procurement, model swaps, lan ops.