NVIDIA Canary

STT.ai non esegue questo modello Trascrivere con i modelli che facciamo eseguire →
3.5%
WER
4
Lingue
45.0x
Velocità
CC-BY-4.0
Licenza

Informazioni NVIDIA Canary

NVIDIA Canary è un modello di parametri 1B che eccelle alla trascrizione inglese, tedesco, francese e spagnolo. Costruito sul framework NeMo, utilizza un encoder FastConformer con un decodificatore di trasformatori e supporta il rilevamento automatico della lingua e la traduzione.

Lingue supportate da NVIDIA Canary

Domande frequenti

NVIDIA Canary è un modello vocale-testo di NVIDIA. STT.ai attualmente non è eseguito NVIDIA Canary.. Questa pagina è informazioni di riferimento sul modello. Per la trascrizione su STT.ai, il modellista offre la famiglia Whisper (Turbo, Large V3, Medium, Small).

Sui benchmark standard, NVIDIA Canary raggiunge circa 3.5% Word Error Rate. L'accuratezza del mondo reale dipende dalla qualità audio, dall'accento e dal linguaggio; per le registrazioni rumorose o accentuate, aspettatevi qualche punto percentuale più alto WER.

NVIDIA Canary non è disponibile su STT.ai. I suoi termini di licenza governano la gestione da soli. STT.ai di livello Gratis copre i modelli Whisper che facciamo eseguire 600 minuti per iniziare, poi un mensile gratuito top-up.

NVIDIA Canary è rilasciato sotto CC-BY-4.0, una licenza open-source permissiva. È possibile auto-host NVIDIA Canary sul proprio hardware o utilizzare la nostra versione hosted entrambi sono commercialmente utilizzabili.

NVIDIA Canary supporta 4 lingue. Rilevamento automatico sceglie la lingua giusta per la maggior parte dell'audio; è anche possibile specificarlo manualmente per un piccolo sollevamento di precisione.

NVIDIA Canary elabora audio a circa 45.0x in tempo reale sulle nostre GPU. Un file audio di 1 ora termina in meno di 1 minuti; file più lunghi coda e notifica per e-mail quando fatto.

NVIDIA Canary ha 1B parametri. I modelli più grandi tendono ad essere più precisi ma più lenti; STT.ai host NVIDIA Canary su GPU in modo che il conteggio dei parametri non influisca sulle prestazioni lato client.

NVIDIA Canary accetta ogni formato STT.ai supporta © MP3, WAV, M4A, FLAC, OGG, MP4, MKV, MOV, WebM, AVI, e altri. Uscita come TXT, SRT, VTT, DOCX, JSON, o PDF.

Sì. La diarizzazione degli altoparlanti corre accanto a NVIDIA Canary per ogni trascrizione ogni altoparlante è etichettato e si può rinominare in seguito nell'editor.

Sì. NVIDIA Canary è eseguito nel nostro ambiente gestito L'audio è elaborato e cancellato per impostazione predefinita e mai utilizzato per l'allenamento senza esplicito opt-in. Piani Pro aggiungere la crittografia lato client per le trascrizioni a riposo.

Utilizzare lo strumento di confronto-stt per eseguire NVIDIA Canary contro qualsiasi altro modello supportato sullo stesso audio. Vedrete WER, conteggio dei segmenti, etichette degli altoparlanti e punteggi di confidenza fianco a fianco. Il confronto NVIDIA Canary vs Whisper Large V3 è il più comunemente eseguito.

Sì. Specificare "nvidia-canary" come parametro del modello sull'endpoint /v1/transcribe. Gli SDK Python e Node.js includono NVIDIA Canary esempi. Il livello API gratuito include 100 minuti/mese.

Sì. Poiché NVIDIA Canary è CC-BY-4.0-licensed, si può auto-ospitare esso. STT.ai pagina open-source elenca il progetto repo e pesi. La maggior parte dei team di produzione utilizzano la nostra versione ospitata per saltare GPU approvvigionamento, modelli di swap, e op.