Distil-Whisper

STT.ai не стартира този модел. Тази страница е референтна информация за него. Преписвай с моделите, които управляваме. →
5.8%
WER
99
Езици
48.0x
Скорост
MIT
Лицензация

За Distil-Whisper

Distil-Whisper е дестилирана версия на Whisper, създадена от Hugging Face. Тя намалява размера на модела с 49% и достига 6x по-бързо заключение, докато поддържа в рамките на 1% WER от оригиналния WHIPER Large V2 при излишно разпределение на комплекти за оценка.
Информация за модела
  • ДоставчикHugging Face
  • Архитектура-
  • ЛицензацияMIT
  • ОбновеноMar 2026

Често задавани въпроси

Distil-Whisper е модел за реч към текст от Hugging Face. STT.ai не работи в момента Distil-Whisper — тази страница е референтна информация за модела. За транскриптиране на STT.ai, моделът избирач предлага на семейство Whisper (Turbo, Large V3, Medium, Small).

По стандартни бенчмаркове Distil-Whisper достига около 5.8% Word Error Rate. Real-world точност зависи от качеството на звука, акцента и езика; за шумни или акцентирани записи, очакват няколко процентни пункта по-висока WER.

Distil-Whisper не е на разположение на STT.ai. Лицензирането на нейните собствени условия за управление на ръководството. STT.ai безплатно ниво покрива модели Whisper, които работим — 600 минути за начало, след това месечен безплатно топ-up.

Distil-Whisper е освободен под MIT, допустим лиценз за отворен източник. Можете да се самоприемате Distil-Whisper на своя собствен хардуер или да използвате нашата хостинг версия - и двете са търговски приложими.

Distil-Whisper поддържа 99 езика. Автоматично откриване избира правилния език за повечето аудио; можете да го ръчно посочите и за малък асансьор за точност.

Distil-Whisper процеси аудио на около 48.0x в реално време на нашите GPU. 1-часов аудио файл завършва в под 8802 минути; по-дълги файлове редица и уведомяване по имейл, когато се направи.

Distil-Whisper има 8802 параметри. По-големите модели са по-точни, но по-бавни; STT.ai домакини Distil-Whisper на GPU, така че броят на параметрите не влияе на производителността на вашия клиент.

Distil-Whisper приема всеки формат STT.ai поддръжки — MP3, WAV, M4A, FLAC, OGG, MP4, MKV, MOV, WebM, AVI и др. Изход като TXT, SRT, VTT, DOCX, JSON или PDF.

Да. Диагностикацията на спикера се движи до Distil-Whisper за всяка транскрипция — всеки говорител е етикетиран и можете да ги преименувате в редактора след това.

Да. Distil-Whisper ходове в нашата управлявана среда — аудио се обработва и изтрива по подразбиране и никога не се използва за обучение без изрично оптимизиране. Про планове добавят клиент-страна шифриране за транскрипти в почивка.

Използвайте инструмента за сравнение, за да стартирате Distil-Whisper срещу всеки друг подкрепен модел на един и същ звук – ще видите WER, сегмент брой, говорител етикети и доверителни резултати странично дострани. Distil-Whisper спрямо Whisper Large V3 сравнението е най-често извършено.

Да. Определяте "distil-whisper" като параметр за модела на точката /v1/transcribe. Python и Node.js SDKs включват Distil-Whisper примери. Free API низ включва 100 минути/месечно.

Да. Тъй като Distil-Whisper е 8802-лицензиран, можете да го самостоятелно домакин. STT.ai на отворения източник страница изброява репо и тежести на проекта. Повечето производствени екипи използват нашата хостинг версия, за да пропуснат GPU поръчки, смяна на модели и операции.