SenseVoice
STT.ai এই মডেল চালায় না । এই পাতাটি এর সম্পর্কে রেফারেন্স তথ্য ।
আমরা যে মডেলগুলো ব্যবহার করি সেগুলোর সাথে অনুলিপি করুন →
5.5%
WER
50
ভাষা
50.0x
গতি
MIT
লাইসেন্স
পরিচিতি SenseVoice
SenseVoice একটি FunAudioLLM থেকে একটি বক্তব্য ভিত্তি মডেল যা অনুবাদ ছাড়িয়ে যায়। এটি ৫০+ ভাষা সমর্থন করে এবং একক মডেলে আবেগ স্বীকৃতি, অডিও ঘটনা সনাক্তকরণ এবং বিপরীত টেক্সট স্বাভাবিককরণ ক্ষমতা অন্তর্ভুক্ত করে।
মডেল তথ্য
- প্রদানকারীFunAudioLLM
- স্থাপত্য-
- লাইসেন্সMIT
- হালনাগাদMar 2026
প্রায়শই জিজ্ঞাসিত প্রশ্ন
SenseVoice হল FunAudioLLM-এর একটি বাক্যের-থেকে-লেখ্য মডেল। STT.ai বর্তমানে SenseVoice চালায় না - এই পাতাটি মডেল সম্পর্কে তথ্যের রেফারেন্স। STT.ai-র উপর অনুবাদ করার জন্য, মডেল নির্বাচনকারী Whisper পরিবার (টর্বো, বড় V3, মাঝারি, ছোট) প্রদান করে।
প্রমিত বেঞ্চমার্কে, SenseVoice 5.5% শব্দ ভুল হার অর্জন করে। বাস্তব বিশ্বের সঠিকতা অডিও গুণমান, উচ্চারণ, এবং ভাষার উপর নির্ভর করে; ঝামেলাপূর্ণ বা উচ্চারণযুক্ত রেকর্ডিংয়ের জন্য, কিছু শতাংশ পয়েন্ট উচ্চতর WER আশা করুন।
SenseVoice STT.ai এ উপলব্ধ নয়। এর নিজস্ব লাইসেন্সের শর্তাবলী এটি নিজেই চালানোর জন্য নিয়ন্ত্রণ করে। STT.ai এর বিনামূল্যে স্তর Whisper মডেলগুলিকে আমরা চালানোর জন্য আবৃত করে -600 মিনিট শুরু করার জন্য, তারপর মাসিক বিনামূল্যে টপ-আপ।
SenseVoice MIT এর অধীনে প্রকাশিত, একটি অনুমতিমূলক উন্মুক্ত সোর্স লাইসেন্স। আপনি আপনার নিজের হার্ডওয়্যারের উপর SenseVoice-কে স্ব-হোস্ট করতে পারেন অথবা আমাদের হোস্ট করা সংস্করণ ব্যবহার করতে পারেন - উভয়ই বাণিজ্যিকভাবে ব্যবহারযোগ্য।
SenseVoice 50 ভাষা সমর্থন করে। অধিকাংশ অডিও ফাইলের জন্য স্বয়ংক্রিয়ভাবে সঠিক ভাষা নির্ধারণ করা হয়; আপনি এটি স্বয়ংক্রিয়ভাবে নির্ধারণ করেও সঠিকতা বাড়াতে পারেন।
SenseVoice অডিও প্রসেস করে আমাদের GPU-তে প্রায় 50.0x বাস্তব-সময়ে। ১ ঘন্টা অডিও ফাইল 1 মিনিটের মধ্যে শেষ হয়; দীর্ঘ ফাইল লাইন এবং শেষ হলে ই-মেইল দ্বারা জানানো হয়।
SenseVoice এর 234M পরামিতি রয়েছে। বড় মডেলগুলো আরও সঠিক কিন্তু ধীর; STT.ai GPU-তে SenseVoice হোস্ট করে, ফলে পরামিতি সংখ্যা আপনার ক্লায়েন্ট-সাইড পারফরম্যান্সে প্রভাব ফেলে না।
SenseVoice সমস্ত ফরম্যাট গ্রহণ করে যা STT.ai সমর্থন করে — MP3, WAV, M4A, FLAC, OGG, MP4, MKV, MOV, WebM, AVI, এবং অন্যান্য। আউটপুট TXT, SRT, VTT, DOCX, JSON, অথবা PDF হিসাবে।
হ্যাঁ। প্রত্যেক অনুবাদ করার জন্য SenseVoice এর সাথে স্পিকার ডায়ারাইজেশন চলছে - প্রত্যেক স্পিকার লেবেল করা হয়েছে এবং আপনি পরে সম্পাদকে তাদের নাম পরিবর্তন করতে পারেন।
হ্যাঁ। ৮৮০ আমাদের পরিচালিত পরিবেশে চলছে - অডিও ডিফল্টভাবে প্রক্রিয়াজাত করা হয় এবং মুছে ফেলা হয় এবং স্পষ্টভাবে অটো-ইন না করে প্রশিক্ষণের জন্য কখনও ব্যবহার করা হয় না। প্রফেশনাল প্ল্যানে ক্লায়েন্ট-সাইড এনক্রিপশন যোগ করা হয় নিষ্ক্রিয় ট্রান্সক্রিপশনের জন্য।
একই অডিওতে অন্য যেকোন সমর্থিত মডেলের সাথে SenseVoice চালানোর জন্য compare-stt টুল ব্যবহার করুন - আপনি WER, সেগমেন্ট সংখ্যা, স্পিকার লেবেল এবং বিশ্বাস স্কোর পাশে পাশে দেখতে পাবেন। SenseVoice vs Whisper Large V3 তুলনা সবচেয়ে সাধারণভাবে চালানো হয়।
হ্যাঁ। /v1/transcribe এন্ডপয়েন্টে মডেল পরামিতি হিসাবে "sensevoice" উল্লেখ করুন। Python এবং Node.js SDK-এ SenseVoice উদাহরণ অন্তর্ভুক্ত রয়েছে। বিনামূল্যে API স্তরে ১০০ মিনিট/মাস অন্তর্ভুক্ত রয়েছে।
হ্যাঁ। যেহেতু SenseVoice MIT-লাইসেন্সপ্রাপ্ত, আপনি এটি স্ব-হোস্ট করতে পারেন। STT.ai এর উন্মুক্ত উৎস পৃষ্ঠা প্রকল্পের রেপো এবং ওজনের তালিকা প্রদান করে। বেশিরভাগ উৎপাদন দল GPU ক্রয়, মডেল স্ব্যাপ এবং অপস ছাড়তে আমাদের হোস্ট করা সংস্করণ ব্যবহার করে।