এর সাথে অনুলিপি করো Vosk
12.0%
WER
20
ভাষা
100.0x
গতি
Apache 2.0
লাইসেন্স
পরিচিতি Vosk
Vosk একটি অফলাইন বাক সনাক্তকরণ টুলকিট যা ইন্টারনেট সংযোগ ছাড়া কাজ করে। এটি ২০+ ভাষা সমর্থন করে যা মোবাইল ডিভাইস, রাসবেরি পাই এবং যেকোন প্ল্যাটফর্মে চালানো যেতে পারে। Kaldi এবং Zipformer স্থাপত্যের উপর নির্মিত।
মডেল তথ্য
- প্রদানকারীAlpha Cephei
- স্থাপত্য-
- লাইসেন্সApache 2.0
- হালনাগাদMar 2026
প্রায়শই জিজ্ঞাসিত প্রশ্ন
Vosk হল Alpha Cephei এর একটি বাক্যের টেক্সট মডেল। STT.ai আমাদের GPU অবকাঠামোতে Vosk হোস্ট করে যাতে আপনি এটি আপনার নিজের হার্ডওয়্যার প্রদান না করে ব্যবহার করতে পারেন - অডিও অথবা ভিডিও আপলোড করুন এবং মডেল নির্বাচনকারী থেকে Vosk বেছে নিন।
প্রমিত বেঞ্চমার্কে, Vosk 12.0% শব্দ ভুল হার অর্জন করে। বাস্তব বিশ্বের সঠিকতা অডিও গুণমান, উচ্চারণ, এবং ভাষার উপর নির্ভর করে; ঝামেলাপূর্ণ বা উচ্চারণযুক্ত রেকর্ডিংয়ের জন্য, কিছু শতাংশ পয়েন্ট উচ্চতর WER আশা করুন।
Vosk STT.ai এর বিনামূল্যে স্তরে চলছে - প্রতিটি দর্শক বিনামূল্যে শুরু করার জন্য600 মিনিট পায়। পে-পাইড পরিকল্পনা প্রতি ফাইল সীমাবদ্ধতা, ব্যক্তিগত ট্রান্সক্রিপশন এবং অগ্রাধিকার লাইন যোগ করে।
Vosk Apache 2.0 এর অধীনে প্রকাশিত, একটি অনুমতিমূলক উন্মুক্ত সোর্স লাইসেন্স। আপনি আপনার নিজের হার্ডওয়্যারের উপর Vosk-কে স্ব-হোস্ট করতে পারেন অথবা আমাদের হোস্ট করা সংস্করণ ব্যবহার করতে পারেন - উভয়ই বাণিজ্যিকভাবে ব্যবহারযোগ্য।
Vosk 20 ভাষা সমর্থন করে। অধিকাংশ অডিও ফাইলের জন্য স্বয়ংক্রিয়ভাবে সঠিক ভাষা নির্ধারণ করা হয়; আপনি এটি স্বয়ংক্রিয়ভাবে নির্ধারণ করেও সঠিকতা বাড়াতে পারেন।
Vosk অডিও প্রসেস করে আমাদের GPU-তে প্রায় 100.0x বাস্তব-সময়ে। ১ ঘন্টা অডিও ফাইল 1 মিনিটের মধ্যে শেষ হয়; দীর্ঘ ফাইল লাইন এবং শেষ হলে ই-মেইল দ্বারা জানানো হয়।
Vosk এর 50M পরামিতি রয়েছে। বড় মডেলগুলো আরও সঠিক কিন্তু ধীর; STT.ai GPU-তে Vosk হোস্ট করে, ফলে পরামিতি সংখ্যা আপনার ক্লায়েন্ট-সাইড পারফরম্যান্সে প্রভাব ফেলে না।
Vosk সমস্ত ফরম্যাট গ্রহণ করে যা STT.ai সমর্থন করে — MP3, WAV, M4A, FLAC, OGG, MP4, MKV, MOV, WebM, AVI, এবং অন্যান্য। আউটপুট TXT, SRT, VTT, DOCX, JSON, অথবা PDF হিসাবে।
হ্যাঁ। প্রত্যেক অনুবাদ করার জন্য Vosk এর সাথে স্পিকার ডায়ারাইজেশন চলছে - প্রত্যেক স্পিকার লেবেল করা হয়েছে এবং আপনি পরে সম্পাদকে তাদের নাম পরিবর্তন করতে পারেন।
হ্যাঁ। ৮৮০ আমাদের পরিচালিত পরিবেশে চলছে - অডিও ডিফল্টভাবে প্রক্রিয়াজাত করা হয় এবং মুছে ফেলা হয় এবং স্পষ্টভাবে অটো-ইন না করে প্রশিক্ষণের জন্য কখনও ব্যবহার করা হয় না। প্রফেশনাল প্ল্যানে ক্লায়েন্ট-সাইড এনক্রিপশন যোগ করা হয় নিষ্ক্রিয় ট্রান্সক্রিপশনের জন্য।
একই অডিওতে অন্য যেকোন সমর্থিত মডেলের সাথে Vosk চালানোর জন্য compare-stt টুল ব্যবহার করুন - আপনি WER, সেগমেন্ট সংখ্যা, স্পিকার লেবেল এবং বিশ্বাস স্কোর পাশে পাশে দেখতে পাবেন। Vosk vs Whisper Large V3 তুলনা সবচেয়ে সাধারণভাবে চালানো হয়।
হ্যাঁ। /v1/transcribe এন্ডপয়েন্টে মডেল পরামিতি হিসাবে "vosk" উল্লেখ করুন। Python এবং Node.js SDK-এ Vosk উদাহরণ অন্তর্ভুক্ত রয়েছে। বিনামূল্যে API স্তরে ১০০ মিনিট/মাস অন্তর্ভুক্ত রয়েছে।
হ্যাঁ। যেহেতু Vosk Apache 2.0-লাইসেন্সপ্রাপ্ত, আপনি এটি স্ব-হোস্ট করতে পারেন। STT.ai এর উন্মুক্ত উৎস পৃষ্ঠা প্রকল্পের রেপো এবং ওজনের তালিকা প্রদান করে। বেশিরভাগ উৎপাদন দল GPU ক্রয়, মডেল স্ব্যাপ এবং অপস ছাড়তে আমাদের হোস্ট করা সংস্করণ ব্যবহার করে।