NVIDIA Canary

STT.ai ne exécute pas ce modèle. Cette page est une référence. Tracscribe avec les modèles que nous faisons tourner →
3.5%
WER
4
Langues
45.0x
Vitesse
CC-BY-4.0
Licence

À propos NVIDIA Canary

NVIDIA Canary est un modèle de paramètre 1B qui excelle dans la transcription anglaise, allemande, française et espagnole. Construit sur le framework NeMo, il utilise un encodeur FastConformer avec un décodeur de transformateur et prend en charge la détection automatique de la langue et la traduction.

Langues soutenues par NVIDIA Canary

Questions fréquemment posées

NVIDIA Canary est un modèle de parole en texte par NVIDIA. STT.ai ne fonctionne pas actuellement NVIDIA Canary — cette page est des informations de référence sur le modèle. Pour la transcription sur STT.ai, le model se fait à la famille Whisper (Turbo, Large V3, Medium, Small).

Sur les repères standard, NVIDIA Canary atteint environ 3.5% de Word Error Rate. La précision du monde réel dépend de la qualité audio, de l'accent et de la langue; pour les enregistrements bruyants ou accentués, attendez quelques points de pourcentage plus haut WER.

NVIDIA Canary n'est pas disponible sur STT.ai. Ses propres conditions de licence le régissent vous-même. Le niveau gratuit de STT.ai couvre les modèles Whisper que nous faisons tourner — 600 minutes pour commencer, puis un supplément gratuit mensuel.

NVIDIA Canary est publié sous CC-BY-4.0, une licence open-source permissive. Vous pouvez vous-même héberger NVIDIA Canary sur votre propre matériel ou utiliser notre version hébergée — les deux sont utilisables commercialement.

NVIDIA Canary prend en charge 4 langues. La détection automatique choisit la bonne langue pour la plupart des audio; vous pouvez également le spécifier manuellement pour un petit ascenseur de précision.

NVIDIA Canary traite l'audio à environ 45.0x en temps réel sur nos GPUs. Un fichier audio d'une heure se termine en moins de 1 minutes; des fichiers plus longs font la file d'attente et les avisent par courrier électronique lorsque cela est fait.

NVIDIA Canary a 1B paramètres. Les modèles plus grands ont tendance à être plus précis mais plus lents; STT.ai hôtes NVIDIA Canary sur GPU de sorte que le nombre de paramètres n'affecte pas les performances de votre client.

NVIDIA Canary accepte chaque format STT.ai supports — MP3, WAV, M4A, FLAC, OGG, MP4, MKV, MOV, WebM, AVI, et autres. Sortie comme TXT, SRT, VTT, DOCX, JSON ou PDF.

Oui. La diarisation des haut-parleurs se déroule aux côtés de NVIDIA Canary pour chaque transcription — chaque haut-parleur est étiqueté et vous pouvez les renommer dans l'éditeur par la suite.

Oui. NVIDIA Canary fonctionne dans notre environnement géré — l'audio est traité et supprimé par défaut et jamais utilisé pour la formation sans opt-in explicite.

Utilisez l'outil compare-stt pour exécuter NVIDIA Canary contre n'importe quel autre modèle pris en charge sur le même son — vous verrez WER, le nombre de segments, les étiquettes des haut-parleurs et les scores de confiance côte à côte. La comparaison NVIDIA Canary vs Whisper Large V3 est la plus courante.

Oui. Spécifiez "nvidia-canary" comme paramètre de modèle sur le paramètre /v1/transcrire. Les SDKs Python et Node.js incluent NVIDIA Canary exemples. Le niveau d'API gratuit comprend 100 minutes/mois.

Oui. Parce que NVIDIA Canary est CC-BY-4.0-licenced, vous pouvez auto-héberger. STT.ai's open-source page liste la prise en charge du projet et les poids. La plupart des équipes de production utilisent notre version hébergée pour sauter l'approvisionnement GPU, les swaps de modèles, et les ops.