Переписатися на Vosk
12.0%
WER
20
Мови
100.0x
Швидкість
Apache 2.0
Ліцензія
Про програму Vosk
Vosk - це автономний інструмент розпізнавання мовлення, який працює без з' єднання з інтернетом. Він підтримує 20+ мов компактними моделями, які можуть працювати на мобільних пристроях, Raspberry Pi та будь- якій платформі. Його створено на архітектурах Kaldi і Zipsander.
Мови, що підтримуються Vosk
Інформація про модель
- ПровайдерAlpha Cephei
- Архітектура-
- ЛіцензіяApache 2.0
- ОновленоMar 2026
Часті запитання
Vosk is a speech-to-text model by Alpha Cephei. STT.ai hosts Vosk on our GPU infrastructure so you can use it without provisioning your own hardware — upload audio or video and pick Vosk from the model picker.
За стандартними полями Vosk досягає приблизно 12.0% Частота помилок за словами. Точність реального світу залежить від якості звуку, акценту та мови; для галасливих або акцентованих записів очікується на декількох відсоткових пунктах вищого WER.
Vosk працює на межі STT.ai- годинних дзвінків кожен відвідувач отримує 600 хвилин, щоб почати з жодної вартості. Плани паудів додають більше за обмеження файлів, приватних записів і черги пріоритетів.
Vosk is released under Apache 2.0, a permissive open-source license. You can self-host Vosk on your own hardware or use our hosted version — both are commercially usable.
Vosk підтримують 20 мови. Автовиявлення обирає правильну мову для більшості звукових файлів; ви також можете вказати її вручну для невеличкого підйому точності.
Vosk processes audio at about 100.0x real-time on our GPUs. A 1-hour audio file finishes in under 1 minutes; longer files queue and notify by email when done.
Vosk має 8882 параметри. Великі моделі зазвичай є точнішими, але повільнішими; STT.ai вузлів - Vosk на GPU, отже кількість параметрів не впливає на швидкодію вашого клієнта.
Vosk приймає кожен формат STT.ai підтримує MP3, WAV, M4A, FLAC, OGG, MP4, MKV, MOV, WebM, AVI та інші. Вивід у вигляді TXT, SRT, VTT, DOCX, JSON або PDF.
Так. diamer diaarization працює поряд Vosk на кожен запис, кожен з промов буде позначено, і ви зможете перейменувати їх у редакторі після цього.
Yes. Vosk runs in our managed environment — audio is processed and deleted by default and never used for training without explicit opt-in. Pro plans add client-side encryption for transcripts at rest.
Скористайтеся інструментом порівняння- stest, щоб запустити Vosk у порівнянні з будь- якою іншою моделлю, що підтримується, на одному і тому ж звуковому каналі, ви побачите WER, кількість сегментів, надписи промовців, а також результати довіри збоку. Порівняння Vosk проти Wisper Великий V3 є найбільш поширеним.
Так. Вкажіть " vosk " як параметр моделі у теці / v1/ trancess кінцевій точці. У назвах Python і вузла. js SDKs містяться Vosk приклади. У вільний інтерфейс API міститься 100 хвилин/ місяців.
Так. Оскільки Vosk має 8882- ліцензію, ви можете виконати її. STT.ai - на сторінці з відкритим кодом наведено список експропріаторів та ваг. Більшість команд з виробництва використовують нашу власницьку версію для того, щоб пропустити закупівлю на GPU, моделі свопінгу і ops.