Distil-Whisper
STT.ai tidak menjalankan model ini. Halaman ini adalah informasi referensi tentang hal itu.
Bimbing dengan model yang kita jalankan →
5.8%
WER
99
Bahasa
48.0x
Kecepatan
MIT
Lisensi
Tentang Distil-Whisper
Distil-Whisper adalah versi disuling Whisper yang diciptakan oleh Hugging Face. Ini mengurangi ukuran model dengan 49% dan mencapai 6x inferensi lebih cepat sementara mempertahankan dalam 1% WER dari Whisper Besar V2 asli di out-of-distribusi evaluasi set.
Info Model
- OperatorHugging Face
- Arsitektur-
- LisensiMIT
- DiperbaruiMar 2026
Pertanyaan yang Sering Diajukan
Distil-Whisper adalah model pidato-to-teks oleh Hugging Face. STT.ai tidak saat ini menjalankan Distil-Whisper ▪ Halaman ini adalah informasi referensi tentang model. Untuk transkripsi di STT.ai, model pemilih menawarkan keluarga Whisper (Turbo, Besar V3, Medium, Small).
Pada benchmark standar, Distil-Whisper mencapai sekitar 5.8% Word Error Rate. Keakuratan Real-world tergantung pada kualitas audio, aksen, dan bahasa; untuk rekaman bising atau aksen, mengharapkan beberapa poin persentase lebih tinggi WER.
Distil-Whisper tidak tersedia di STT.ai. dengan ketentuan lisensinya sendiri mengatur sendiri tingkat Gratis STT.ai mencakup model Whisper yang kita jalankan 600 menit untuk memulai, kemudian bulan Gratis.
Distil-Whisper dirilis di bawah MIT, lisensi sumber terbuka perresensi. Anda dapat mengenali Distil-Whisper sendiri dengan perangkat keras Anda atau menggunakan versi host kami keduanya dapat digunakan secara komersial.
Distil-Whisper mendukung bahasa 99. Auto-deteksi memilih bahasa yang tepat untuk kebanyakan audio; Anda juga dapat menentukan secara manual untuk angkat akurasi kecil.
Distil-Whisper memproses audio pada sekitar 48.0x real-time pada GPUs kami. Sebuah berkas audio 1-jam selesai di bawah menit 1; antrian berkas lebih panjang dan beritahu melalui email ketika dilakukan.
Distil-Whisper memiliki parameter 756M. Model yang lebih besar cenderung lebih akurat tetapi lebih lambat; STT.ai host Distil-Whisper pada GPU sehingga parameter tak mempengaruhi kinerja sisi klien Anda.
Distil-Whisper menerima setiap format yang didukung STT.ai ▪ MP3, WAV, M4A, FLAC, OGG, MP4, MKV, MOV, WebM, AVI, dan lainnya. Keluaran sebagai TXT, SRT, VTT, DOCX, JSON, atau PDF.
Dirasi Speaker berjalan bersama Distil-Whisper untuk setiap transkripsi setiap pembicara diberi label dan Anda dapat mengubah nama mereka di editor sesudahnya.
Distil-Whisper berjalan di lingkungan yang dikelola kami audio diproses dan dihapus secara baku dan tidak pernah digunakan untuk pelatihan tanpa eksplisit opt-in. Pro rencana menambahkan klien-sisi enkripsi untuk transkrip di istirahat.
Use the compare-stt tool to run Distil-Whisper against any other supported model on the same audio — you'll see WER, segment count, speaker labels, and confidence scores side-by-side. The Distil-Whisper vs Whisper Large V3 comparison is the most commonly run.
Ya. Nyatakan "distil-whisper" sebagai parameter model pada titik akhir /v1/trascrite. Python dan Node.js SDKs termasuk contoh Distil-Whisper. Deret API gratis meliputi 100 menit/bulan.
Yes. Because Distil-Whisper is MIT-licensed, you can self-host it. STT.ai's open-source page lists the project repo and weights. Most production teams use our hosted version to skip GPU procurement, model swaps, and ops.