NVIDIA Canary
STT.ai এই মডেল চালায় না । এই পাতাটি এর সম্পর্কে রেফারেন্স তথ্য ।
আমরা যে মডেলগুলো ব্যবহার করি সেগুলোর সাথে অনুলিপি করুন →
3.5%
WER
4
ভাষা
45.0x
গতি
CC-BY-4.0
লাইসেন্স
পরিচিতি NVIDIA Canary
এনভিডিএ ক্যানারি একটি ১বি প্যারামিটার মডেল যা ইংরেজি, জার্মান, ফরাসি এবং স্প্যানিশ অনুবাদ করতে পারদর্শী। NeMo ফ্রেমওয়ার্কের উপর নির্মিত, এটি একটি ট্রান্সফরমার ডিকোডার সহ একটি FastConformer এনকোডার ব্যবহার করে এবং স্বয়ংক্রিয় ভাষা সনাক্তকরণ এবং অনুবাদ সমর্থন করে।
মডেল তথ্য
- প্রদানকারীNVIDIA
- স্থাপত্য-
- লাইসেন্সCC-BY-4.0
- হালনাগাদMar 2026
প্রায়শই জিজ্ঞাসিত প্রশ্ন
NVIDIA Canary হল NVIDIA-এর একটি বাক্যের-থেকে-লেখ্য মডেল। STT.ai বর্তমানে NVIDIA Canary চালায় না - এই পাতাটি মডেল সম্পর্কে তথ্যের রেফারেন্স। STT.ai-র উপর অনুবাদ করার জন্য, মডেল নির্বাচনকারী Whisper পরিবার (টর্বো, বড় V3, মাঝারি, ছোট) প্রদান করে।
প্রমিত বেঞ্চমার্কে, NVIDIA Canary 3.5% শব্দ ভুল হার অর্জন করে। বাস্তব বিশ্বের সঠিকতা অডিও গুণমান, উচ্চারণ, এবং ভাষার উপর নির্ভর করে; ঝামেলাপূর্ণ বা উচ্চারণযুক্ত রেকর্ডিংয়ের জন্য, কিছু শতাংশ পয়েন্ট উচ্চতর WER আশা করুন।
NVIDIA Canary STT.ai এ উপলব্ধ নয়। এর নিজস্ব লাইসেন্সের শর্তাবলী এটি নিজেই চালানোর জন্য নিয়ন্ত্রণ করে। STT.ai এর বিনামূল্যে স্তর Whisper মডেলগুলিকে আমরা চালানোর জন্য আবৃত করে -600 মিনিট শুরু করার জন্য, তারপর মাসিক বিনামূল্যে টপ-আপ।
NVIDIA Canary CC-BY-4.0 এর অধীনে প্রকাশিত, একটি অনুমতিমূলক উন্মুক্ত সোর্স লাইসেন্স। আপনি আপনার নিজের হার্ডওয়্যারের উপর NVIDIA Canary-কে স্ব-হোস্ট করতে পারেন অথবা আমাদের হোস্ট করা সংস্করণ ব্যবহার করতে পারেন - উভয়ই বাণিজ্যিকভাবে ব্যবহারযোগ্য।
NVIDIA Canary 4 ভাষা সমর্থন করে। অধিকাংশ অডিও ফাইলের জন্য স্বয়ংক্রিয়ভাবে সঠিক ভাষা নির্ধারণ করা হয়; আপনি এটি স্বয়ংক্রিয়ভাবে নির্ধারণ করেও সঠিকতা বাড়াতে পারেন।
NVIDIA Canary অডিও প্রসেস করে আমাদের GPU-তে প্রায় 45.0x বাস্তব-সময়ে। ১ ঘন্টা অডিও ফাইল 1 মিনিটের মধ্যে শেষ হয়; দীর্ঘ ফাইল লাইন এবং শেষ হলে ই-মেইল দ্বারা জানানো হয়।
NVIDIA Canary এর 1B পরামিতি রয়েছে। বড় মডেলগুলো আরও সঠিক কিন্তু ধীর; STT.ai GPU-তে NVIDIA Canary হোস্ট করে, ফলে পরামিতি সংখ্যা আপনার ক্লায়েন্ট-সাইড পারফরম্যান্সে প্রভাব ফেলে না।
NVIDIA Canary সমস্ত ফরম্যাট গ্রহণ করে যা STT.ai সমর্থন করে — MP3, WAV, M4A, FLAC, OGG, MP4, MKV, MOV, WebM, AVI, এবং অন্যান্য। আউটপুট TXT, SRT, VTT, DOCX, JSON, অথবা PDF হিসাবে।
হ্যাঁ। প্রত্যেক অনুবাদ করার জন্য NVIDIA Canary এর সাথে স্পিকার ডায়ারাইজেশন চলছে - প্রত্যেক স্পিকার লেবেল করা হয়েছে এবং আপনি পরে সম্পাদকে তাদের নাম পরিবর্তন করতে পারেন।
হ্যাঁ। ৮৮০ আমাদের পরিচালিত পরিবেশে চলছে - অডিও ডিফল্টভাবে প্রক্রিয়াজাত করা হয় এবং মুছে ফেলা হয় এবং স্পষ্টভাবে অটো-ইন না করে প্রশিক্ষণের জন্য কখনও ব্যবহার করা হয় না। প্রফেশনাল প্ল্যানে ক্লায়েন্ট-সাইড এনক্রিপশন যোগ করা হয় নিষ্ক্রিয় ট্রান্সক্রিপশনের জন্য।
একই অডিওতে অন্য যেকোন সমর্থিত মডেলের সাথে NVIDIA Canary চালানোর জন্য compare-stt টুল ব্যবহার করুন - আপনি WER, সেগমেন্ট সংখ্যা, স্পিকার লেবেল এবং বিশ্বাস স্কোর পাশে পাশে দেখতে পাবেন। NVIDIA Canary vs Whisper Large V3 তুলনা সবচেয়ে সাধারণভাবে চালানো হয়।
হ্যাঁ। /v1/transcribe এন্ডপয়েন্টে মডেল পরামিতি হিসাবে "nvidia-canary" উল্লেখ করুন। Python এবং Node.js SDK-এ NVIDIA Canary উদাহরণ অন্তর্ভুক্ত রয়েছে। বিনামূল্যে API স্তরে ১০০ মিনিট/মাস অন্তর্ভুক্ত রয়েছে।
হ্যাঁ। যেহেতু NVIDIA Canary CC-BY-4.0-লাইসেন্সপ্রাপ্ত, আপনি এটি স্ব-হোস্ট করতে পারেন। STT.ai এর উন্মুক্ত উৎস পৃষ্ঠা প্রকল্পের রেপো এবং ওজনের তালিকা প্রদান করে। বেশিরভাগ উৎপাদন দল GPU ক্রয়, মডেল স্ব্যাপ এবং অপস ছাড়তে আমাদের হোস্ট করা সংস্করণ ব্যবহার করে।