Whisper Large V3
STT.ai এই মডেলটি পে-টাইরে চালায়। এটা STT.ai Enhanced এর পিছনের মডেল। ফ্রি ট্রান্সক্রিপশন Whisper Large v3 Turbo ব্যবহার করে, যা দ্রুততর।
পরিকল্পনা দেখুন →
·
Whisper Turbo এর সাথে বিনামূল্যে অনুবাদ করুন →
4.2%
WER
99
ভাষা
15.9x
গতি
MIT
লাইসেন্স
পরিচিতি Whisper Large V3
উইস্পার লম্বা ভি৩ হচ্ছে ওপেনএআই-এর প্রধান মুক্ত উৎস বাক্য স্বীকৃতি মডেল। ১.৫৫ বিলিয়ন প্যারামিটার সহ, এটি ৯৯টি ভাষার মধ্যে অসাধারণ সঠিকতা প্রদান করে। এটি একটি ট্রান্সফরমার এনকোডার-ডিকোডার স্থাপত্য ব্যবহার করে যা ৬৮০,০০০ ঘণ্টার বহুভাষিক অডিও ডাটাতে প্রশিক্ষিত।
মডেল তথ্য
- প্রদানকারীOpenAI
- স্থাপত্য-
- লাইসেন্সMIT
- হালনাগাদAug 2026
প্রায়শই জিজ্ঞাসিত প্রশ্ন
Whisper Large V3 হল OpenAI দ্বারা তৈরি একটি বাক্যের টেক্সট মডেল। STT.ai এটি আমাদের নিজস্ব GPU এ চালায়, একটি পেমেন্ট প্লান অ্যাকাউন্টের জন্য, এবং এটি STT.ai Enhanced tier এর পিছনের মডেল। বিনামূল্যে অনুবাদ Whisper Large v3 Turbo ব্যবহার করে, একই পরিবারের দ্রুত চেকপয়েন্ট।
প্রমিত বেঞ্চমার্কে, Whisper Large V3 4.2% শব্দ ভুল হার অর্জন করে। বাস্তব বিশ্বের সঠিকতা অডিও গুণমান, উচ্চারণ, এবং ভাষার উপর নির্ভর করে; ঝামেলাপূর্ণ বা উচ্চারণযুক্ত রেকর্ডিংয়ের জন্য, কিছু শতাংশ পয়েন্ট উচ্চতর WER আশা করুন।
Whisper Large V3 STT.ai এর বিনামূল্যে স্তরে চলছে - প্রতিটি দর্শক বিনামূল্যে শুরু করার জন্য600 মিনিট পায়। পে-পাইড পরিকল্পনা প্রতি ফাইল সীমাবদ্ধতা, ব্যক্তিগত ট্রান্সক্রিপশন এবং অগ্রাধিকার লাইন যোগ করে।
Whisper Large V3 MIT এর অধীনে প্রকাশিত, একটি অনুমতিমূলক উন্মুক্ত সোর্স লাইসেন্স। আপনি আপনার নিজের হার্ডওয়্যারের উপর Whisper Large V3-কে স্ব-হোস্ট করতে পারেন অথবা আমাদের হোস্ট করা সংস্করণ ব্যবহার করতে পারেন - উভয়ই বাণিজ্যিকভাবে ব্যবহারযোগ্য।
Whisper Large V3 99 ভাষা সমর্থন করে। অধিকাংশ অডিও ফাইলের জন্য স্বয়ংক্রিয়ভাবে সঠিক ভাষা নির্ধারণ করা হয়; আপনি এটি স্বয়ংক্রিয়ভাবে নির্ধারণ করেও সঠিকতা বাড়াতে পারেন।
Whisper Large V3 অডিও প্রসেস করে আমাদের GPU-তে প্রায় 15.9x বাস্তব-সময়ে। ১ ঘন্টা অডিও ফাইল 3 মিনিটের মধ্যে শেষ হয়; দীর্ঘ ফাইল লাইন এবং শেষ হলে ই-মেইল দ্বারা জানানো হয়।
Whisper Large V3 এর 1.55B পরামিতি রয়েছে। বড় মডেলগুলো আরও সঠিক কিন্তু ধীর; STT.ai GPU-তে Whisper Large V3 হোস্ট করে, ফলে পরামিতি সংখ্যা আপনার ক্লায়েন্ট-সাইড পারফরম্যান্সে প্রভাব ফেলে না।
Whisper Large V3 সমস্ত ফরম্যাট গ্রহণ করে যা STT.ai সমর্থন করে — MP3, WAV, M4A, FLAC, OGG, MP4, MKV, MOV, WebM, AVI, এবং অন্যান্য। আউটপুট TXT, SRT, VTT, DOCX, JSON, অথবা PDF হিসাবে।
হ্যাঁ। প্রত্যেক অনুবাদ করার জন্য Whisper Large V3 এর সাথে স্পিকার ডায়ারাইজেশন চলছে - প্রত্যেক স্পিকার লেবেল করা হয়েছে এবং আপনি পরে সম্পাদকে তাদের নাম পরিবর্তন করতে পারেন।
হ্যাঁ। ৮৮০ আমাদের পরিচালিত পরিবেশে চলছে - অডিও ডিফল্টভাবে প্রক্রিয়াজাত করা হয় এবং মুছে ফেলা হয় এবং স্পষ্টভাবে অটো-ইন না করে প্রশিক্ষণের জন্য কখনও ব্যবহার করা হয় না। প্রফেশনাল প্ল্যানে ক্লায়েন্ট-সাইড এনক্রিপশন যোগ করা হয় নিষ্ক্রিয় ট্রান্সক্রিপশনের জন্য।
একই অডিওতে অন্য যেকোন সমর্থিত মডেলের সাথে Whisper Large V3 চালানোর জন্য compare-stt টুল ব্যবহার করুন - আপনি WER, সেগমেন্ট সংখ্যা, স্পিকার লেবেল এবং বিশ্বাস স্কোর পাশে পাশে দেখতে পাবেন। Whisper Large V3 vs Whisper Large V3 তুলনা সবচেয়ে সাধারণভাবে চালানো হয়।
হ্যাঁ, একটি পরিশোধিত পরিকল্পনার ক্ষেত্রে। /v1/transcribe endpoint-এ মডেল পরামিতি হিসাবে "whisper-large-v3" উল্লেখ করুন। সক্রিয় পরিকল্পনা ছাড়া কী-গুলির পরিবর্তে Whisper Large v3 Turbo পরিসেবা প্রদান করা হবে। অনুরোধটি সফল হবে; এটি শুধুমাত্র বিনামূল্যে মডেল চালায়।
হ্যাঁ। যেহেতু Whisper Large V3 MIT-লাইসেন্সপ্রাপ্ত, আপনি এটি স্ব-হোস্ট করতে পারেন। STT.ai এর উন্মুক্ত উৎস পৃষ্ঠা প্রকল্পের রেপো এবং ওজনের তালিকা প্রদান করে। বেশিরভাগ উৎপাদন দল GPU ক্রয়, মডেল স্ব্যাপ এবং অপস ছাড়তে আমাদের হোস্ট করা সংস্করণ ব্যবহার করে।