Distil-Whisper
STT.ai bu modeli çalıştırmaz. Bu sayfa onun hakkında referans bilgisidir.
Modelleri çalıştırıyoruz. →
5.8%
WER
99
Dilleri
48.0x
Hız
MIT
Lisans
Hakkında Distil-Whisper
Distil-Whisper, Hugging Face tarafından yaratılan Whisper'ın bir damak tadına sahip bir versiyonudur. Modelin boyutlarını %49 oranında azaltıyor ve dağıtım dışı değerlendirme setlerinde orijinal Whisper Large V2'nin %1 WER'i içinde tutarak 6x daha hızlı bir çıkarım sağlamaktadır.
Model Bilgisi
- SağlayıcıHugging Face
- Mimarlık-
- LisansMIT
- GüncellendiMar 2026
Sıkça Sorulan Sorular
Distil-Whisper, Hugging Face tarafından geliştirilen bir konuşmadan metne dönüştürme modelidir. STT.ai şu anda Distil-Whisper'i çalıştırmaz — bu sayfa model hakkında referans bilgisidir. STT.ai üzerindeki çeviri için, model seçici Whisper ailesini (Turbo, Büyük V3, Orta, Küçük) sunar.
Standart referanslarda, Distil-Whisper yaklaşık %5.8 kelime hata oranına ulaşmıştır.Gerçek dünya doğruluğu ses kalitesine, aksan ve dile bağlıdır; gürültülü veya aksanlı kayıtlar için, birkaç yüzde puan daha yüksek WER bekleyin.
Distil-Whisper STT.ai'de mevcut değildir. Kendi lisans şartları onu kendin çalıştırmayı yönetir. STT.ai'in ücretsiz seviyesi Whisper modellerini çalıştırıyoruz - 600 dakika başlatmak, sonra aylık ücretsiz bir yükleme.
Distil-Whisper, MIT, bir açık kaynak lisansı altında yayınlanmıştır. Distil-Whisper'i kendi donanımınızda kendi kendinize konumlandırabilir veya bizim konumlandırılmış sürümümüzü kullanabilirsiniz - her ikisi de ticari olarak kullanılabilir.
Distil-Whisper 99 dillerini destekler. Otomatik tespit çoğu ses için doğru dili seçer; küçük bir doğruluk artırımı için el ile de belirtebilirsiniz.
Distil-Whisper, GPU'larımızda yaklaşık 48.0x gerçek zamanlı ses işleme hızına sahiptir. 1 saatlik bir ses dosyası 1 dakikanın altında tamamlanır; daha uzun dosyalar kuyruğa alınır ve bittiğinde e-posta ile bildirim yapılır.
Distil-Whisper'in 756M parametresi vardır. Daha büyük modellerin daha doğru ama daha yavaş olmasına eğilim vardır; STT.ai GPU'da Distil-Whisper'e ev sahipliği yapar bu yüzden parametre sayısı istemci taraf performansınızı etkilemez.
Distil-Whisper, STT.ai'in desteklediği her biçimi kabul eder - MP3, WAV, M4A, FLAC, OGG, MP4, MKV, MOV, WebM, AVI ve diğerleri. Çıkış TXT, SRT, VTT, DOCX, JSON veya PDF olarak.
Evet, her bir transkrip için Distil-Whisper'in yanında konuşanların diarizasyonu çalışıyor. Her bir konuşan etiketleniyor ve sonradan editöründe isimlerini değiştirebilirsiniz.
Evet. Distil-Whisper bizim yönetilen ortamımızda çalışıyor - ses işleme ve varsayılan olarak silinir ve açıkça opt-in olmadan eğitim için asla kullanılmaz. Pro planları, bekleyen transkripler için istemci tarafı şifreleme ekler.
Aynı ses üzerinde Distil-Whisper'i diğer desteklenen modellerle karşılaştırmak için compare-stt aracı kullanın - WER, segment sayısını, hoparlör etiketlerini ve güven puanlarını yan yana göreceksiniz. Distil-Whisper vs Whisper Large V3 karşılaştırması en sık yapılandır.
Evet. /v1/transcribe son noktasında model parametresi olarak "distil-whisper"yi belirtin. Python ve Node.js SDK'ları Distil-Whisper örneklerini içerir. Ücretsiz API katmanı ayda 100 dakika içerir.
Evet. Distil-Whisper MIT lisanslı olduğu için kendine ev sahipliği yapabilirsin. STT.ai'in açık kaynak sayfası proje deposunu ve ağırlıklarını listeler. Çoğu üretim ekibi GPU satın alımı, model değişimi ve operasyonları atlamak için ev sahipliği yaptığımız sürümü kullanır.