Tracs avec Distil-Whisper
5.8%
WER
99
Langues
48.0x
Vitesse
MIT
Licence
À propos Distil-Whisper
Distil-Whisper est une version distillée de Whisper créée par Hugging Face. Il réduit la taille du modèle de 49% et atteint une inférence 6x plus rapide tout en maintenant à 1% WER de l'original Whisper Large V2 sur les ensembles d'évaluation hors distribution.
Modèle Info
- FournisseurHugging Face
- Architecture-
- LicenceMIT
- Mise à jourMar 2026
Questions fréquemment posées
Distil-Whisper est un modèle speech-to-text par Hugging Face. STT.ai héberge Distil-Whisper sur notre infrastructure GPU afin que vous puissiez l'utiliser sans fournir votre propre matériel — télécharger audio ou vidéo et choisir Distil-Whisper à partir du modèle de sélection.
Sur les repères standard, Distil-Whisper atteint environ 5.8% de Word Error Rate. La précision du monde réel dépend de la qualité audio, de l'accent et de la langue; pour les enregistrements bruyants ou accentués, attendez quelques points de pourcentage plus haut WER.
Distil-Whisper fonctionne sur le niveau gratuit de STT.ai — chaque visiteur obtient 600 minutes pour commencer sans frais. Les plans payés ajoutent des limites plus longues par fichier, des transcriptions privées et la file d'attente prioritaire.
Distil-Whisper est publié sous MIT, une licence open-source permissive. Vous pouvez vous-même héberger Distil-Whisper sur votre propre matériel ou utiliser notre version hébergée — les deux sont utilisables commercialement.
Distil-Whisper prend en charge 99 langues. La détection automatique choisit la bonne langue pour la plupart des audio; vous pouvez également le spécifier manuellement pour un petit ascenseur de précision.
Distil-Whisper traite l'audio à environ 48.0x en temps réel sur nos GPUs. Un fichier audio d'une heure se termine en moins de 1 minutes; des fichiers plus longs font la file d'attente et les avisent par courrier électronique lorsque cela est fait.
Distil-Whisper a 756M paramètres. Les modèles plus grands ont tendance à être plus précis mais plus lents; STT.ai hôtes Distil-Whisper sur GPU de sorte que le nombre de paramètres n'affecte pas les performances de votre client.
Distil-Whisper accepte chaque format STT.ai supports — MP3, WAV, M4A, FLAC, OGG, MP4, MKV, MOV, WebM, AVI, et autres. Sortie comme TXT, SRT, VTT, DOCX, JSON ou PDF.
Oui. La diarisation des haut-parleurs se déroule aux côtés de Distil-Whisper pour chaque transcription — chaque haut-parleur est étiqueté et vous pouvez les renommer dans l'éditeur par la suite.
Oui. Distil-Whisper fonctionne dans notre environnement géré — l'audio est traité et supprimé par défaut et jamais utilisé pour la formation sans opt-in explicite.
Utilisez l'outil compare-stt pour exécuter Distil-Whisper contre n'importe quel autre modèle pris en charge sur le même son — vous verrez WER, le nombre de segments, les étiquettes des haut-parleurs et les scores de confiance côte à côte. La comparaison Distil-Whisper vs Whisper Large V3 est la plus courante.
Oui. Spécifiez "distil-whisper" comme paramètre de modèle sur le paramètre /v1/transcrire. Les SDKs Python et Node.js incluent Distil-Whisper exemples. Le niveau d'API gratuit comprend 100 minutes/mois.
Oui. Parce que Distil-Whisper est MIT-licenced, vous pouvez auto-héberger. STT.ai's open-source page liste la prise en charge du projet et les poids. La plupart des équipes de production utilisent notre version hébergée pour sauter l'approvisionnement GPU, les swaps de modèles, et les ops.