Trancribeix amb Whisper Large V3
4.2%
WER
99
Idiomes
15.9x
Velocitat
MIT
Llicència
Quant a Whisper Large V3
Els murmuris grans V3 són el model de reconeixement per a la bandera d' OpenAI, amb 1.5 mil milions de paràmetres, ofereix una precisió excepcional a través de 99 idiomes. Usa una arquitectura transformadora del codificador entrenat en 680.000 hores de dades d' àudio multilingüe.
Informació del model
- ProveïdorOpenAI
- Arquitectura-
- LlicènciaMIT
- ActualitzatAug 2026
Preguntes més freqüents
Whisper Large V3 és un model de text a text de text per OpenAI. STT.ai hosts Whisper Large V3 en la nostra infraestructura de la GPU de manera que podeu usar- lo sense establir el vostre propi maquinari RTOcloc pujar àudio o vídeo i triar Whisper Large V3 des del selector de models.
Sobre punts de referència estàndard, 8800 s' aconsegueix al voltant de 881% d' error de paraula. La precisió real del món depèn de la qualitat de l' àudio, de l' accent i del llenguatge; per a enregistraments amb soroll o amb accent, espereu uns quants percentatges més alts WER.
El Whisper Large V3 s' executa en el registre lliure de la corbata de STT.ai cada visitant té 600 minuts per començar sense cost. Els plans que s' afegeixen més temps per fitxer, transcripcions privades i cues de prioritat.
Whisper Large V3 es deixa anar sota MIT, una llicència permissida de codi obert. Podeu autohost Whisper Large V3 en el vostre propi maquinari o usar la nostra versió establishmenta tant és comercialment útil.
8800 dóna les llengües 8800. Auto- detecta l' idioma correcte per a la majoria d' àudio; també ho podeu especificar manualment per a un petit augment de precisió.
L' àudio de processos Whisper Large V3 en quant a 15.9x real temps a les nostres GPUs. Un fitxer d' àudio d' 1 hora acaba en minuts 3; cua de fitxers més llarga i notificant per correu electrònic quan s' hagi fet.
Whisper Large V3 té paràmetres 1.55B. Els models més grans tendeixen a ser més precisos però més lents; STT.ai hosts Whisper Large V3 a la GPU per tant el nombre de paràmetres no afecta al vostre rendiment client- a costat.
Whisper Large V3 accepta tots els formats STT.ai implementa el MP3, WAV, M4A, FLAC, OGG, MKV, MOV, AVI i altres. Sortida com TXT, SRT, VT, DOCX, JSON o PDF.
Sí. El President diarization s' executa junt amb Whisper Large V3 per a cada recripció s' etiqueta per a cada altaveu i després els podeu reanomenar a l' editor.
Sí. 8800 s' executa en el nostre entorn gestionat l' àudio i s' elimina per omissió i mai s' usa per a l' entrenament sense opt- in explícita. Els plans poden afegir xifrats al client per a les transcripcions a la resta.
Useu l' eina Compara- t per executar Whisper Large V3 contra qualsevol altre model acceptat en el mateix model d' àudio 2001- 2002 veureu WEP, nombre de segments, etiquetes d' altaveu i puntuacions de confiança al costat. La comparació Whisper Large V3 contra RR3 és la més comuna.
Sí. Especifiqueu "whisper-large-v30" com a paràmetre del model en el punt d' acabament / v1/trancrib. Python i Node. js SDKs inclouen 881 exemples. L' API lliure inclou 100 minuts/ mesos.
Sí. Perquè la pàgina de codi obert Whisper Large V3 és MIT- license- license, podeu fer- la en si mateix. La pàgina de codi obert STT.ai llista les llistes de la plataforma i els pesos. La majoria d' equips de producció usen la nostra versió allotjada per saltar la GPU, els canvis i les operacions.