NVIDIA Canary
STT.ai ei käytä tätä mallia – tämä sivu on viitetietoa siitä.
Ratkiriemukasta pyörittämiemme mallien kanssa →
3.5%
WER
4
Kielet
45.0x
Nopeus
CC-BY-4.0
Lisenssi
Tietoja NVIDIA Canary
NVIDIA Canary on 1B-parametrimalli, joka on erinomainen englannin, saksan, ranskan ja espanjan kielen transkriptioissa. NeMo-kehykseen rakennettuna se käyttää muuntajan dekooderilla varustettua FastConformer-kooderia ja tukee automaattista kielentunnistusta ja kääntämistä.
Malli-info
- TarjoajaNVIDIA
- Arkkitehtuuri-
- LisenssiCC-BY-4.0
- PäivitettyMar 2026
Usein kysyttyjä kysymyksiä
NVIDIA Canary on NVIDIA-mallin puhe-tekstimalli. STT.ai ei tällä hetkellä pyöri NVIDIA Canary-mallin mukaan – tämä sivu on viitetieto mallista. Mallinvalitsin tarjoaa Whisper-perheen (Turbo, Large V3, Medium, Small) STT.ai-kirjaintekstiä varten.
Standardimittauksissa NVIDIA Canary saavuttaa noin 8801 prosentin Word Error Rate -arvon. Todellisen maailman tarkkuus riippuu äänenlaadusta, aksentista ja kielestä; äänekkäiden tai korostuneiden äänitteiden osalta WER:n odotetaan olevan muutaman prosenttiyksikön korkeampi.
NVIDIA Canary ei ole saatavilla STT.ai:lla. Sen omat lisenssiehdot hallitsevat sen pyörittämistä itse. STT.ai:n vapaa taso kattaa meidän Whisper-mallit, joita pyöritämme – 600 minuuttia aikaa aloittaa, sitten kuukausittain ilmainen lisä.
NVIDIA Canary julkaistaan sallivan avoimen lähdekoodin lisenssin alla. Voit itse isännöidä NVIDIA Canary:ta omalla laitteistollasi tai käyttää isäntäversiotamme – molemmat ovat kaupallisesti käyttökelpoisia.
NVIDIA Canary tukee 4 kieltä. Automaattinen havainnointi valitsee oikean kielen useimmille äänille; voit myös määrittää sen manuaalisesti pientä tarkkuusnosturia varten.
NVIDIA Canary prosessorin äänentoisto noin 45.0x reaaliaikaisesti GPU:issa. Tunnin äänitiedosto valmistuu alle 1 minuutissa, pidempi tiedostojono ja ilmoitus sähköpostitse, kun se on tehty.
NVIDIA Canary:ssa on 1B parametria. Suuremmat mallit ovat yleensä tarkempia, mutta hitaampia; STT.ai isännöi NVIDIA Canary:a GPU:ssa, joten parametrien määrä ei vaikuta asiakaspuolen suorituskykyyn.
NVIDIA Canary hyväksyy jokaisen formaatin STT.ai tukea: MP3, WAV, M4A, FLAC, OGG, MP4, MKV, MOV, WebM, AVI ja muut. Tuotos on TXT, SRT, VTT, DOCX, JSON tai PDF.
Kyllä. Kaiuttimen diarisointi kulkee NVIDIA Canary:n rinnalla jokaista transkriptiota kohden – jokainen puhuja on merkitty, ja voit nimetä sen myöhemmin uudelleen päätoimittajaksi.
Kyllä. NVIDIA Canary kulkee hallitussa ympäristössämme – ääntä käsitellään ja poistetaan oletuksena, eikä sitä koskaan käytetä harjoitteluun ilman nimenomaista opt-iniä. Pro suunnittelee lisäävänsä asiakaspuolen salauksen selostuksiin levossa.
Verrattuna ensimmäiseen työkaluun voit ajaa NVIDIA Canary muuta saman äänen avulla tuettua mallia vastaan – näet WER:n, segmentin, kaiuttimen tarroja ja itseluottamuspisteitä vierekkäin. NVIDIA Canary vs. Whisper Large V3 -vertailu on yleisin.
Kyllä. Määrittele "nvidia-canary" mallimuuttujaksi /v1/transcribe-päätetapahtumassa. Python ja Node.js SDKs sisältävät NVIDIA Canary esimerkkiä. Vapaa API-taso sisältää 100 minuuttia kuukaudessa.
Kyllä. Koska NVIDIA Canary on CC-BY-4.0-lisensoitu, voit itse isännöidä sitä. STT.ai:n avoimen lähdekoodin sivulla on listattu projektin repo ja painot. Useimmat tuotantoryhmät käyttävät isäntäversiotamme jättääkseen GPU-hankinnat, mallivaihdot ja opsit väliin.