Modelos de IA

Escolla o seu motor de transcrición — Compare a precisión, velocidade e soporte de linguaxe entre os principais modelos de recoñecemento de voz.

Como escoller o modelo correcto

Diferentes modelos de transcrición sobresaen en diferentes áreas. Empregue esta guía para escoller o mellor modelo para as súas necesidades.

Modelo WER Velocidade Linguas Mellor para
STT.ai Enhanced 3.2% 160.0x 100 O modelo de voz a texto máis destacado do STT.ai, …
Whisper Large V3 4.2% 8.0x 99 O modelo Whisper máis grande e preciso de OpenAI. Excelente …
Whisper Turbo 5.1% 32.0x 99 A variante Whisper de OpenAI optimizada para a velocidade. 4 …
NVIDIA Canary 3.5% 45.0x 4 O modelo ASR multitarefa de NVIDIA con precisión de nivel …
Moonshine 7.8% 80.0x 1 Modelo ASR ultraligeiro deseñado para dispositivos periféricos. Execútase en Raspberry …
NVIDIA Parakeet 3.0% 55.0x 1 O modelo ASR inglés baseado en CTC de NVIDIA. Un …
SenseVoice 5.5% 50.0x 50 Modelo de comprensión da fala multilingüe con recoñecemento de emocións …
Distil-Whisper 5.8% 48.0x 99 Versión destilada de Whisper Large V3. 6x máis rápido cun …
Vosk 12.0% 100.0x 20 Recoñecemento de voz lixeiro e sen conexión. Funciona sen Internet, …

Que é WER (taxa de erro de palabra)?

A taxa de erro de palabra (WER) é a métrica estándar para medir a precisión do recoñecemento de voz. Calcula a porcentaxe de palabras nunha transcrición que difiren da referencia. Unha WER do 5% significa que aproximadamente 5 de cada 100 palabras conteñen un erro. Canto menor, mellor.

Os transcriptores humanos profesionais normalmente acadan un WER do 4- 5%. Os mellores modelos de IA agora igualan ou se aproximan á precisión de nivel humano en son limpo.

Non está seguro de que modelo empregar?

Probe o noso predeterminado: Whisper Large V3 Turbo ofrece o mellor equilibrio entre velocidade e precisión. É gratuíto comezar, non se require rexistro.

Comezar a transcrición libre