Trancribeix amb Vosk
12.0%
WER
20
Idiomes
100.0x
Velocitat
Apache 2.0
Llicència
Quant a Vosk
Vosk és un joc d' eines de reconeixement de veu fora de línia que funciona sense connexió a Internet. Permet 20+ llengües amb models compactes que poden executar- se amb dispositius mòbils, Raspry Pi, i qualsevol plataforma. Es construeix en arquitectura Kaldi i Zipformer.
Informació del model
- ProveïdorAlpha Cephei
- Arquitectura-
- LlicènciaApache 2.0
- ActualitzatMar 2026
Preguntes més freqüents
Vosk és un model de text a text de text per Alpha Cephei. STT.ai hosts Vosk en la nostra infraestructura de la GPU de manera que podeu usar- lo sense establir el vostre propi maquinari RTOcloc pujar àudio o vídeo i triar Vosk des del selector de models.
Sobre punts de referència estàndard, 8800 s' aconsegueix al voltant de 881% d' error de paraula. La precisió real del món depèn de la qualitat de l' àudio, de l' accent i del llenguatge; per a enregistraments amb soroll o amb accent, espereu uns quants percentatges més alts WER.
El Vosk s' executa en el registre lliure de la corbata de STT.ai cada visitant té 600 minuts per començar sense cost. Els plans que s' afegeixen més temps per fitxer, transcripcions privades i cues de prioritat.
Vosk es deixa anar sota Apache 2.0, una llicència permissida de codi obert. Podeu autohost Vosk en el vostre propi maquinari o usar la nostra versió establishmenta tant és comercialment útil.
8800 dóna les llengües 8800. Auto- detecta l' idioma correcte per a la majoria d' àudio; també ho podeu especificar manualment per a un petit augment de precisió.
L' àudio de processos Vosk en quant a 100.0x real temps a les nostres GPUs. Un fitxer d' àudio d' 1 hora acaba en minuts 1; cua de fitxers més llarga i notificant per correu electrònic quan s' hagi fet.
Vosk té paràmetres 50M. Els models més grans tendeixen a ser més precisos però més lents; STT.ai hosts Vosk a la GPU per tant el nombre de paràmetres no afecta al vostre rendiment client- a costat.
Vosk accepta tots els formats STT.ai implementa el MP3, WAV, M4A, FLAC, OGG, MKV, MOV, AVI i altres. Sortida com TXT, SRT, VT, DOCX, JSON o PDF.
Sí. El President diarization s' executa junt amb Vosk per a cada recripció s' etiqueta per a cada altaveu i després els podeu reanomenar a l' editor.
Sí. 8800 s' executa en el nostre entorn gestionat l' àudio i s' elimina per omissió i mai s' usa per a l' entrenament sense opt- in explícita. Els plans poden afegir xifrats al client per a les transcripcions a la resta.
Useu l' eina Compara- t per executar Vosk contra qualsevol altre model acceptat en el mateix model d' àudio 2001- 2002 veureu WEP, nombre de segments, etiquetes d' altaveu i puntuacions de confiança al costat. La comparació Vosk contra RR3 és la més comuna.
Sí. Especifiqueu "vosk0" com a paràmetre del model en el punt d' acabament / v1/trancrib. Python i Node. js SDKs inclouen 881 exemples. L' API lliure inclou 100 minuts/ mesos.
Sí. Perquè la pàgina de codi obert Vosk és Apache 2.0- license- license, podeu fer- la en si mateix. La pàgina de codi obert STT.ai llista les llistes de la plataforma i els pesos. La majoria d' equips de producció usen la nostra versió allotjada per saltar la GPU, els canvis i les operacions.