NVIDIA Canary

STT.ai این مدل را اجرا نمی‌کند - این صفحه اطلاعات مرجعی در مورد آن است. با مدل هايي که اجرا ميکنيم رونوشت کن →
3.5%
WER
4
زبانها
45.0x
سرعت
CC-BY-4.0
مجوز

در مورد NVIDIA Canary

انویدیا کانری یک مدل پارامتر ۱ بی است که در رونویسی انگلیسی، آلمانی، فرانسوی و اسپانیایی برتری دارد.این مدل بر روی چارچوب NeMo ساخته شده است و از یک کدگذار FastConformer با یک رمزگشایی تبدیل استفاده می‌کند و از تشخیص و ترجمه خودکار زبان پشتیبانی می‌کند.

زبانهای پشتیبانی‌شده NVIDIA Canary

اطلاعات مدل
  • ارائه‌دهندهNVIDIA
  • معماری-
  • مجوزCC-BY-4.0
  • به روزرسانیMar 2026

پرسشهای متداول

NVIDIA Canary یک مدل گفتار به متن توسط NVIDIA است. STT.ai در حال حاضر NVIDIA Canary را اجرا نمی‌کند — این صفحه اطلاعات مرجع در مورد مدل است. برای رونویسی در STT.ai ، انتخاب‌کننده مدل خانواده Whisper (Turbo, Large V3, Medium, Small) را ارائه می‌دهد.

On standard benchmarks, NVIDIA Canary achieves around 3.5% Word Error Rate. Real-world accuracy depends on audio quality, accent, and language; for noisy or accented recordings, expect a few percentage points higher WER.

NVIDIA Canary در STT.ai در دسترس نیست. شرایط مجوز خود را برای اجرای خود تنظیم می‌کند. STT.ai سطح رایگان مدل Whisper را پوشش می‌دهد که ما اجرا می‌کنیم - 600 دقیقه برای شروع، سپس یک ماه رایگان اضافه کردن.

NVIDIA Canary تحت CC-BY-4.0 منتشر می‌شود، یک مجوز آزاد آزاد. شما می‌توانید خودتان NVIDIA Canary را در سخت‌افزار خود میزبانی کنید یا از نسخه میزبانی شده ما استفاده کنید - هر دو قابل استفاده تجاری هستند.

NVIDIA Canary از زبان‌های 4 پشتیبانی می‌کند. تشخیص خودکار زبان درست را برای بیشتر صداها انتخاب می‌کند؛ همچنین می‌توانید آن را برای یک بالا رفتن دقت کوچک دستی مشخص کنید.

NVIDIA Canary processes audio at about 45.0x real-time on our GPUs. A 1-hour audio file finishes in under 1 minutes; longer files queue and notify by email when done.

NVIDIA Canary has 1B parameters. Larger models tend to be more accurate but slower; STT.ai hosts NVIDIA Canary on GPU so the parameter count doesn't affect your client-side performance.

NVIDIA Canary هر فرمتی را که STT.ai پشتیبانی می‌کند را می‌پذیرد - MP3, WAV, M4A, FLAC, OGG, MP4, MKV, MOV, WebM, AVI و دیگران.

بله. نوشتار شنونده در کنار NVIDIA Canary برای هر رونوشت اجرا می شود — هر شنونده برچسب گذاری شده و می توانید بعداً آنها را در ویرایشگر تغییر نام دهید.

بله. NVIDIA Canary در محیط مدیریت شده ما اجرا می‌شود - صدا به صورت پیشفرض پردازش و حذف می‌شود و هیچگاه برای آموزش بدون انتخاب صریح استفاده نمی‌شود. برنامه‌های Pro رمزگذاری سمت مشتری را برای رونوشت‌های در حال استراحت اضافه می‌کنند.

Use the compare-stt tool to run NVIDIA Canary against any other supported model on the same audio — you'll see WER, segment count, speaker labels, and confidence scores side-by-side. The NVIDIA Canary vs Whisper Large V3 comparison is the most commonly run.

بله. "nvidia-canary" را به عنوان پارامتر مدل در /v1/transcribe endpoint مشخص کنید. Python و Node.js SDK شامل نمونه‌های NVIDIA Canary هستند. سطح API رایگان شامل ۱۰۰ دقیقه در ماه است.

بله. چون NVIDIA Canary دارای مجوز CC-BY-4.0 است، شما می‌توانید آن را خودتان میزبانی کنید. صفحهٔ منبع باز STT.ai فهرستی از پروژه و وزن‌ها را ارائه می‌دهد. بیشتر تیم‌های تولید از نسخهٔ میزبانی شده ما برای فراموش کردن خرید GPU، مبادلات مدل و عملیات استفاده می‌کنند.
Made by @nadermx