NVIDIA Canary

STT.ai tidak menjalankan model ini. Halaman ini adalah informasi referensi tentang hal itu. Bimbing dengan model yang kita jalankan →
3.5%
WER
4
Bahasa
45.0x
Kecepatan
CC-BY-4.0
Lisensi

Tentang NVIDIA Canary

NVIDIA Canary adalah model parameter 1B yang unggul dalam bahasa Inggris, Jerman, Prancis, dan Spanyol. Dibangun pada kerangka NeMo, menggunakan enkoder FastConformer dengan decoder transformer dan mendukung deteksi dan terjemahan bahasa otomatis.

Bahasa yang Didukung NVIDIA Canary

Pertanyaan yang Sering Diajukan

NVIDIA Canary adalah model pidato-to-teks oleh NVIDIA. STT.ai tidak saat ini menjalankan NVIDIA Canary ▪ Halaman ini adalah informasi referensi tentang model. Untuk transkripsi di STT.ai, model pemilih menawarkan keluarga Whisper (Turbo, Besar V3, Medium, Small).

Pada benchmark standar, NVIDIA Canary mencapai sekitar 3.5% Word Error Rate. Keakuratan Real-world tergantung pada kualitas audio, aksen, dan bahasa; untuk rekaman bising atau aksen, mengharapkan beberapa poin persentase lebih tinggi WER.

NVIDIA Canary tidak tersedia di STT.ai. dengan ketentuan lisensinya sendiri mengatur sendiri tingkat Gratis STT.ai mencakup model Whisper yang kita jalankan 600 menit untuk memulai, kemudian bulan Gratis.

NVIDIA Canary dirilis di bawah CC-BY-4.0, lisensi sumber terbuka perresensi. Anda dapat mengenali NVIDIA Canary sendiri dengan perangkat keras Anda atau menggunakan versi host kami keduanya dapat digunakan secara komersial.

NVIDIA Canary mendukung bahasa 4. Auto-deteksi memilih bahasa yang tepat untuk kebanyakan audio; Anda juga dapat menentukan secara manual untuk angkat akurasi kecil.

NVIDIA Canary memproses audio pada sekitar 45.0x real-time pada GPUs kami. Sebuah berkas audio 1-jam selesai di bawah menit 1; antrian berkas lebih panjang dan beritahu melalui email ketika dilakukan.

NVIDIA Canary memiliki parameter 1B. Model yang lebih besar cenderung lebih akurat tetapi lebih lambat; STT.ai host NVIDIA Canary pada GPU sehingga parameter tak mempengaruhi kinerja sisi klien Anda.

NVIDIA Canary menerima setiap format yang didukung STT.ai ▪ MP3, WAV, M4A, FLAC, OGG, MP4, MKV, MOV, WebM, AVI, dan lainnya. Keluaran sebagai TXT, SRT, VTT, DOCX, JSON, atau PDF.

Dirasi Speaker berjalan bersama NVIDIA Canary untuk setiap transkripsi setiap pembicara diberi label dan Anda dapat mengubah nama mereka di editor sesudahnya.

NVIDIA Canary berjalan di lingkungan yang dikelola kami audio diproses dan dihapus secara baku dan tidak pernah digunakan untuk pelatihan tanpa eksplisit opt-in. Pro rencana menambahkan klien-sisi enkripsi untuk transkrip di istirahat.

Use the compare-stt tool to run NVIDIA Canary against any other supported model on the same audio — you'll see WER, segment count, speaker labels, and confidence scores side-by-side. The NVIDIA Canary vs Whisper Large V3 comparison is the most commonly run.

Ya. Nyatakan "nvidia-canary" sebagai parameter model pada titik akhir /v1/trascrite. Python dan Node.js SDKs termasuk contoh NVIDIA Canary. Deret API gratis meliputi 100 menit/bulan.

Yes. Because NVIDIA Canary is CC-BY-4.0-licensed, you can self-host it. STT.ai's open-source page lists the project repo and weights. Most production teams use our hosted version to skip GPU procurement, model swaps, and ops.