Whisper Large V3
STT.ai ใช้โมเดลนี้ในระดับที่จ่ายเงิน มันเป็นโมเดลที่อยู่เบื้องหลัง STT.ai Enhanced การบันทึกฟรีใช้ Whisper Large v3 Turbo ซึ่งเร็วกว่า
ลองดูแผน →
·
เขียนฟรีด้วย Whisper Turbo →
4.2%
WER
99
ภาษา
15.9x
ความเร็ว
MIT
ใบอนุญาต
เกี่ยวกับ Whisper Large V3
วิสเปอร์ แลกซ์ วี3 เป็นโมเดลการรับรู้เสียงแบบเปิดซอร์สของโอเพนเอไอ ที่มีพารามิเตอร์ 1.55 พันล้านตัว มันให้ความแม่นยำที่ยอดเยี่ยม ผ่านภาษา 99 ภาษา มันใช้สถาปัตยกรรมของเครื่องเข้ารหัส-ออกรหัสที่ถูกฝึกมาแล้ว 680,000 ชั่วโมงของข้อมูลเสียงหลายภาษา
ข้อมูลรุ่น
- ตัวจัดหาOpenAI
- สถาปัตยกรรม-
- ใบอนุญาตMIT
- ปรับปรุงใหม่Aug 2026
คำถามที่พบบ่อย
Whisper Large V3 เป็นโมเดลการพูดเป็นข้อความ โดย OpenAI STT.ai ทำงานบน GPU ของพวกเราเอง สำหรับบัญชีที่จ่ายค่าบริการ และมันเป็นโมเดลที่อยู่เบื้องหลัง STT.ai Enhanced tier การแปลภาษาฟรีใช้ Whisper Large v3 Turbo จุดตรวจสอบที่เร็วกว่าของครอบครัวเดียวกัน
ตามมาตรฐานการทดสอบ Whisper Large V3 สามารถทำได้ราว 4.2% ของอัตราความผิดพลาดของคำ ความแม่นยำในโลกจริงขึ้นอยู่กับคุณภาพเสียง สำเนียง และภาษา สำหรับเสียงรบกวนหรือสำเนียงที่บันทึกไว้ ควรจะคาดหวังให้ WER สูงกว่า WER หลายเปอร์เซ็นต์
Whisper Large V3 ทำงานบน STT.ai ระดับฟรี - ผู้เข้าชมทุกคนได้รับ 600 นาทีเพื่อเริ่มต้นโดยไม่มีค่าใช้จ่าย แผนจ่ายเพิ่มการ จำกัด ต่อไฟล์ ส่วนตัวและคิวที่สำคัญ
Whisper Large V3 ถูกปล่อยออกมาภายใต้ MIT ใบอนุญาตโอเพนซอร์สที่อนุญาตให้คุณสามารถใช้ Whisper Large V3 บนฮาร์ดแวร์ของคุณเอง หรือใช้เวอร์ชั่นที่เราจัดเตรียมไว้ — ทั้งหมดนี้สามารถใช้ได้ในเชิงพาณิชย์
Whisper Large V3 รองรับภาษา 99 ตัวตรวจจับอัตโนมัติจะเลือกภาษาที่ถูกต้องสำหรับเสียงส่วนใหญ่ คุณสามารถกำหนดเองได้ด้วยเพื่อเพิ่มความแม่นยำเล็กน้อย
Whisper Large V3 ประมวลผลเสียงด้วยความเร็วประมาณ 15.9x ตามเวลาจริงบน GPU ของเรา แฟ้มเสียง 1 ชั่วโมง จะใช้เวลาไม่ถึง 3 นาที ส่วนแฟ้มที่ยาวกว่าจะถูกจัดเป็นคิวและแจ้งให้ทราบทางอีเมลเมื่อเสร็จสิ้น
Whisper Large V3 มีพารามิเตอร์ 1.55B รุ่นที่ใหญ่กว่าจะมีแนวโน้มที่จะแม่นยำกว่า แต่ช้ากว่า; STT.ai ใช้ Whisper Large V3 บน GPU ดังนั้น การนับพารามิเตอร์จะไม่ส่งผลต่อประสิทธิภาพด้านคลาวด์ของคุณ
Whisper Large V3 รองรับทุกรูปแบบที่ STT.ai รองรับ — MP3, WAV, M4A, FLAC, OGG, MP4, MKV, MOV, WebM, AVI และอื่นๆ อีกมากมาย นำออกมาเป็น TXT, SRT, VTT, DOCX, JSON หรือ PDF
ใช่ การจัดเรียงผู้พูด ทำงานร่วมกับ Whisper Large V3 สำหรับทุกการแปล ทุกคนที่พูดมีฉลาก และคุณสามารถเปลี่ยนชื่อพวกเขาในเครื่องมือแก้ไข
ใช่ Whisper Large V3 ทำงานในสภาพแวดล้อมที่จัดการได้ของเรา - เสียงจะถูกประมวลผลและลบโดยปริยาย และไม่เคยใช้สำหรับการฝึกอบรมโดยไม่ต้องเลือกอย่างชัดเจน แพ็คเกจโปรเพิ่มการเข้ารหัสด้านคลาวด์สำหรับแปลภาษาที่พัก
ใช้เครื่องมือ compare- stt เพื่อประมวลผล Whisper Large V3 กับรุ่นอื่นที่รองรับบนเครื่องเสียงเดียวกัน คุณจะเห็น WER, จำนวนเซกเมนต์, แท็กลำโพง และคะแนนความเชื่อมั่น ติดกัน การเปรียบเทียบ Whisper Large V3 กับ Whisper Large V3 นั้นเป็นวิธีที่ใช้กันมากที่สุด
ใช่ สำหรับแผนการจ่ายค่าบริการ ระบุ "whisper-large-v3" เป็นพารามิเตอร์แบบจำลองบนจุดจบ / v1/ transcribe กุญแจที่ไม่มีแผนการใช้งานจะถูกบริการด้วย Whisper Large v3 Turbo แทน การร้องขอยังคงสำเร็จ มันแค่ทำงานแบบจำลองฟรี
ใช่ เพราะ Whisper Large V3 ได้รับอนุญาตจาก MIT คุณสามารถโฮสต์มันเองได้ หน้าโอเพนซอร์สของ STT.ai แสดงรายการโครงการและน้ำหนัก ทีมผลิตส่วนใหญ่ใช้เวอร์ชั่นโฮสต์ของเรา ข้ามการซื้อ GPU แบบจำลองสลับและปฏิบัติการ