AI- modeller

Velg transskriptormotor – sammenlikne nøyaktighet, hastighet og språkstøtte på tvers av de ledende talegjenkjenningsmodellene.

Hvordan velge den riktige modellen

Forskjellige utskriftsmodeller utmerker seg på forskjellige områder. Bruk denne veiledningen for å velge den modellen du vil bruke.

Modell WER Hastighet Språk Beste for
STT.ai Enhanced 3.2% 160.0x 100 STT.ais flaggskips tale- til- tekst- modell med best mulig nøyaktighet …
Whisper Large V3 4.2% 8.0x 99 OpenAIs største og mest nøyaktige Visper- modell. Fremragende flerspråklig støtte …
Whisper Turbo 5.1% 32.0x 99 OpenAIs hastighetsoptimerte Whisper-variant. 4 ganger raskere enn Stor V3 med …
NVIDIA Canary 3.5% 45.0x 4 NVIDIAs ASR- modell for fleroppgaver, med høynivånøyaktighet på engelsk. Byggt …
Moonshine 7.8% 80.0x 1 Ultralett ASR-modell konstruert for kantinnretninger. Kjører på Raspberry Pi med …
NVIDIA Parakeet 3.0% 55.0x 1 NVIDIAs CTC- baserte engelske ASR- modell. En av de mest …
SenseVoice 5.5% 50.0x 50 Flerspråklig taleforståelsesmodell med følelsesgjenkjenning og oppdaging av lydhendelser.
Distil-Whisper 5.8% 48.0x 99 Destillert versjon av Whisper Large V3. 6x raskere med 49% …
Vosk 12.0% 100.0x 20 Lett frakoblet talegjenkjenning. Fungerer uten Internett, ideelt for personvernsfølsomme og …

Hva er WER (ordfeilrate)?

Ordfeilrate (WER) er standardmål for måling av talegjenkjenningsnøyaktighet. Det beregner prosentvis antall ord i en utskrift som er forskjellig fra referansen. En WER på 5% betyr omtrent 5 av hver 100 ord inneholder en feil. Lavere er bedre.

Profesjonelle transkriptionister oppnår typisk en WER på 4-5%. De beste AI- modellene samsvarer nå eller nærmer seg nøyaktighet på menneskenivå på ren lyd.

Er du usikker på hvilken modell som skal brukes?

Forsøk vår standard – Whisper Large V3 Turbo gir den beste likevekten mellom fart og nøyaktighet. Fri til å starte, ikke nødvendig å logge inn.

Begynn å tranulere gratis