Distil-Whisper

STT.ai এই মডেল চালায় না । এই পাতাটি এর সম্পর্কে রেফারেন্স তথ্য । আমরা যে মডেলগুলো ব্যবহার করি সেগুলোর সাথে অনুলিপি করুন →
5.8%
WER
99
ভাষা
48.0x
গতি
MIT
লাইসেন্স

পরিচিতি Distil-Whisper

Distil-Whisper হ্যাগিং ফেস দ্বারা তৈরি Whisper এর একটি ডিস্টিলেড সংস্করণ। এটি মডেলের আকার 49% দ্বারা হ্রাস করে এবং 6x দ্রুততর অনুমান অর্জন করে, একই সাথে বিতরণ-এর বাইরে মূল্যায়ন সেটগুলিতে মূল Whisper Large V2 এর 1% WER এর মধ্যে রাখে।
মডেল তথ্য
  • প্রদানকারীHugging Face
  • স্থাপত্য-
  • লাইসেন্সMIT
  • হালনাগাদMar 2026

প্রায়শই জিজ্ঞাসিত প্রশ্ন

Distil-Whisper হল Hugging Face-এর একটি বাক্যের-থেকে-লেখ্য মডেল। STT.ai বর্তমানে Distil-Whisper চালায় না - এই পাতাটি মডেল সম্পর্কে তথ্যের রেফারেন্স। STT.ai-র উপর অনুবাদ করার জন্য, মডেল নির্বাচনকারী Whisper পরিবার (টর্বো, বড় V3, মাঝারি, ছোট) প্রদান করে।

প্রমিত বেঞ্চমার্কে, Distil-Whisper 5.8% শব্দ ভুল হার অর্জন করে। বাস্তব বিশ্বের সঠিকতা অডিও গুণমান, উচ্চারণ, এবং ভাষার উপর নির্ভর করে; ঝামেলাপূর্ণ বা উচ্চারণযুক্ত রেকর্ডিংয়ের জন্য, কিছু শতাংশ পয়েন্ট উচ্চতর WER আশা করুন।

Distil-Whisper STT.ai এ উপলব্ধ নয়। এর নিজস্ব লাইসেন্সের শর্তাবলী এটি নিজেই চালানোর জন্য নিয়ন্ত্রণ করে। STT.ai এর বিনামূল্যে স্তর Whisper মডেলগুলিকে আমরা চালানোর জন্য আবৃত করে -600 মিনিট শুরু করার জন্য, তারপর মাসিক বিনামূল্যে টপ-আপ।

Distil-Whisper MIT এর অধীনে প্রকাশিত, একটি অনুমতিমূলক উন্মুক্ত সোর্স লাইসেন্স। আপনি আপনার নিজের হার্ডওয়্যারের উপর Distil-Whisper-কে স্ব-হোস্ট করতে পারেন অথবা আমাদের হোস্ট করা সংস্করণ ব্যবহার করতে পারেন - উভয়ই বাণিজ্যিকভাবে ব্যবহারযোগ্য।

Distil-Whisper 99 ভাষা সমর্থন করে। অধিকাংশ অডিও ফাইলের জন্য স্বয়ংক্রিয়ভাবে সঠিক ভাষা নির্ধারণ করা হয়; আপনি এটি স্বয়ংক্রিয়ভাবে নির্ধারণ করেও সঠিকতা বাড়াতে পারেন।

Distil-Whisper অডিও প্রসেস করে আমাদের GPU-তে প্রায় 48.0x বাস্তব-সময়ে। ১ ঘন্টা অডিও ফাইল 1 মিনিটের মধ্যে শেষ হয়; দীর্ঘ ফাইল লাইন এবং শেষ হলে ই-মেইল দ্বারা জানানো হয়।

Distil-Whisper এর 756M পরামিতি রয়েছে। বড় মডেলগুলো আরও সঠিক কিন্তু ধীর; STT.ai GPU-তে Distil-Whisper হোস্ট করে, ফলে পরামিতি সংখ্যা আপনার ক্লায়েন্ট-সাইড পারফরম্যান্সে প্রভাব ফেলে না।

Distil-Whisper সমস্ত ফরম্যাট গ্রহণ করে যা STT.ai সমর্থন করে — MP3, WAV, M4A, FLAC, OGG, MP4, MKV, MOV, WebM, AVI, এবং অন্যান্য। আউটপুট TXT, SRT, VTT, DOCX, JSON, অথবা PDF হিসাবে।

হ্যাঁ। প্রত্যেক অনুবাদ করার জন্য Distil-Whisper এর সাথে স্পিকার ডায়ারাইজেশন চলছে - প্রত্যেক স্পিকার লেবেল করা হয়েছে এবং আপনি পরে সম্পাদকে তাদের নাম পরিবর্তন করতে পারেন।

হ্যাঁ। ৮৮০ আমাদের পরিচালিত পরিবেশে চলছে - অডিও ডিফল্টভাবে প্রক্রিয়াজাত করা হয় এবং মুছে ফেলা হয় এবং স্পষ্টভাবে অটো-ইন না করে প্রশিক্ষণের জন্য কখনও ব্যবহার করা হয় না। প্রফেশনাল প্ল্যানে ক্লায়েন্ট-সাইড এনক্রিপশন যোগ করা হয় নিষ্ক্রিয় ট্রান্সক্রিপশনের জন্য।

একই অডিওতে অন্য যেকোন সমর্থিত মডেলের সাথে Distil-Whisper চালানোর জন্য compare-stt টুল ব্যবহার করুন - আপনি WER, সেগমেন্ট সংখ্যা, স্পিকার লেবেল এবং বিশ্বাস স্কোর পাশে পাশে দেখতে পাবেন। Distil-Whisper vs Whisper Large V3 তুলনা সবচেয়ে সাধারণভাবে চালানো হয়।

হ্যাঁ। /v1/transcribe এন্ডপয়েন্টে মডেল পরামিতি হিসাবে "distil-whisper" উল্লেখ করুন। Python এবং Node.js SDK-এ Distil-Whisper উদাহরণ অন্তর্ভুক্ত রয়েছে। বিনামূল্যে API স্তরে ১০০ মিনিট/মাস অন্তর্ভুক্ত রয়েছে।

হ্যাঁ। যেহেতু Distil-Whisper MIT-লাইসেন্সপ্রাপ্ত, আপনি এটি স্ব-হোস্ট করতে পারেন। STT.ai এর উন্মুক্ত উৎস পৃষ্ঠা প্রকল্পের রেপো এবং ওজনের তালিকা প্রদান করে। বেশিরভাগ উৎপাদন দল GPU ক্রয়, মডেল স্ব্যাপ এবং অপস ছাড়তে আমাদের হোস্ট করা সংস্করণ ব্যবহার করে।