Distil-Whisper
El STT.ai no executa aquest model. Aquesta pàgina és informació de referència sobre això.
Trancribeix amb els models que fem quan fugim →
5.8%
WER
99
Idiomes
48.0x
Velocitat
MIT
Llicència
Quant a Distil-Whisper
Distil-Whisper és una versió destil·lada del Rumors creat per l'Ubrat Face. Redueix la mida del model del 49% i aconsegueix 6x més ràpid inferència mentre es manté dins de l' 1% WeR del Rumors original V2 sobre conjunts d' avaluació de la distribució.
Informació del model
- ProveïdorHugging Face
- Arquitectura-
- LlicènciaMIT
- ActualitzatMar 2026
Preguntes més freqüents
El Distil-Whisper és un model de text de text de text per Hugging Face. STT.ai no s' executa actualment Distil-Whisper identificador aquesta pàgina és informació de referència sobre el model. Per la transcripció a STT.ai, el model selector de model ofereix la família Rumors (Turbo, Big V3, Mitjà).
Sobre punts de referència estàndard, 8800 s' aconsegueix al voltant de 881% d' error de paraula. La precisió real del món depèn de la qualitat de l' àudio, de l' accent i del llenguatge; per a enregistraments amb soroll o amb accent, espereu uns quants percentatges més alts WER.
El Distil-Whisper no està disponible en STT.ai. Té els termes de llicència que governen tu mateix. El rimedor lliure de STT.ai cobreix els models Rumors que fem rwxen 600 minuts per començar, després un període de lliure.
Distil-Whisper es deixa anar sota MIT, una llicència permissida de codi obert. Podeu autohost Distil-Whisper en el vostre propi maquinari o usar la nostra versió establishmenta tant és comercialment útil.
8800 dóna les llengües 8800. Auto- detecta l' idioma correcte per a la majoria d' àudio; també ho podeu especificar manualment per a un petit augment de precisió.
L' àudio de processos Distil-Whisper en quant a 48.0x real temps a les nostres GPUs. Un fitxer d' àudio d' 1 hora acaba en minuts 1; cua de fitxers més llarga i notificant per correu electrònic quan s' hagi fet.
Distil-Whisper té paràmetres 756M. Els models més grans tendeixen a ser més precisos però més lents; STT.ai hosts Distil-Whisper a la GPU per tant el nombre de paràmetres no afecta al vostre rendiment client- a costat.
Distil-Whisper accepta tots els formats STT.ai implementa el MP3, WAV, M4A, FLAC, OGG, MKV, MOV, AVI i altres. Sortida com TXT, SRT, VT, DOCX, JSON o PDF.
Sí. El President diarization s' executa junt amb Distil-Whisper per a cada recripció s' etiqueta per a cada altaveu i després els podeu reanomenar a l' editor.
Sí. 8800 s' executa en el nostre entorn gestionat l' àudio i s' elimina per omissió i mai s' usa per a l' entrenament sense opt- in explícita. Els plans poden afegir xifrats al client per a les transcripcions a la resta.
Useu l' eina Compara- t per executar Distil-Whisper contra qualsevol altre model acceptat en el mateix model d' àudio 2001- 2002 veureu WEP, nombre de segments, etiquetes d' altaveu i puntuacions de confiança al costat. La comparació Distil-Whisper contra RR3 és la més comuna.
Sí. Especifiqueu "distil-whisper0" com a paràmetre del model en el punt d' acabament / v1/trancrib. Python i Node. js SDKs inclouen 881 exemples. L' API lliure inclou 100 minuts/ mesos.
Sí. Perquè la pàgina de codi obert Distil-Whisper és MIT- license- license, podeu fer- la en si mateix. La pàgina de codi obert STT.ai llista les llistes de la plataforma i els pesos. La majoria d' equips de producció usen la nostra versió allotjada per saltar la GPU, els canvis i les operacions.