เขียนเป็นลำดับ STT.ai Enhanced
3.2%
WER
100
ภาษา
160.0x
ความเร็ว
Proprietary
ใบอนุญาต
เกี่ยวกับ STT.ai Enhanced
STT.ai Enhanced เป็นโมเดลการแปลงเสียงเป็นข้อความที่แม่นยำที่สุดและเร็วที่สุดของเรา สร้างขึ้นบนสถาปัตยกรรมแปลงที่ทันสมัยที่สุดด้วยการปรับปรุงที่ถูกต้องตามกฎหมาย มันส่งมอบอัตราความผิดพลาดของคำที่นำหน้าในอุตสาหกรรม ผ่าน 100 ภาษา เหมาะสำหรับการแปลงเสียง, คำอธิบายแบบเรียลไทม์และแอพพลิเคชันระดับองค์กร
✦ เปิดใช้งานโมเดลที่เพิ่มคุณภาพ
เข้าถึงแบบจำลองที่แม่นยำที่สุดของเรา ด้วยแพ็คเกจที่จ่ายเงิน 3.2% WER ความเร็ว 160x ภาษา 100+
แสดงแผนการ →ข้อมูลรุ่น
- ตัวจัดหาSTT.ai
- สถาปัตยกรรม-
- ใบอนุญาตProprietary
- ปรับปรุงใหม่Mar 2026
คำถามที่พบบ่อย
STT.ai Enhanced เป็นโมเดลการแปลงเสียงเป็นข้อความของ STT.ai STT.ai ใช้โครงสร้างพื้นฐานของ GPU ของเรา ดังนั้นคุณสามารถใช้มันได้โดยไม่ต้องจัดหาฮาร์ดแวร์ของคุณเอง — โหลดเสียงหรือวิดีโอ และเลือก STT.ai Enhanced จากตัวเลือกโมเดล
ตามมาตรฐานการทดสอบ STT.ai Enhanced สามารถทำได้ราว 3.2% ของอัตราความผิดพลาดของคำ ความแม่นยำในโลกจริงขึ้นอยู่กับคุณภาพเสียง สำเนียง และภาษา สำหรับเสียงรบกวนหรือสำเนียงที่บันทึกไว้ ควรจะคาดหวังให้ WER สูงกว่า WER หลายเปอร์เซ็นต์
STT.ai Enhanced เป็นรุ่นพิเศษ — ประกอบด้วยแพ็คเกจ STT.ai ที่มีค่าใช้จ่ายตั้งแต่ $5/ เดือน ผู้ใช้ฟรีสามารถดูภาพยนตร์ STT.ai Enhanced ก่อนดูได้ในคลิปสั้นๆ; แฟ้มที่ยาวกว่าต้องมีแพ็คเกจที่ใช้งานอยู่
STT.ai Enhanced ถูกจัดจำหน่ายภายใต้ Proprietary STT.ai เวอร์ชั่นที่จัดเก็บไว้ จัดการการอนุญาตให้ใช้สิทธิ์ ดังนั้นการใช้ในเชิงพาณิชย์ผ่านบริการของเราจึงง่าย
STT.ai Enhanced รองรับภาษา 100 ตัวตรวจจับอัตโนมัติจะเลือกภาษาที่ถูกต้องสำหรับเสียงส่วนใหญ่ คุณสามารถกำหนดเองได้ด้วยเพื่อเพิ่มความแม่นยำเล็กน้อย
STT.ai Enhanced ประมวลผลเสียงด้วยความเร็วประมาณ 160.0x ตามเวลาจริงบน GPU ของเรา แฟ้มเสียง 1 ชั่วโมง จะใช้เวลาไม่ถึง 1 นาที ส่วนแฟ้มที่ยาวกว่าจะถูกจัดเป็นคิวและแจ้งให้ทราบทางอีเมลเมื่อเสร็จสิ้น
STT.ai Enhanced มีพารามิเตอร์ 1.5B รุ่นที่ใหญ่กว่าจะมีแนวโน้มที่จะแม่นยำกว่า แต่ช้ากว่า; STT.ai ใช้ STT.ai Enhanced บน GPU ดังนั้น การนับพารามิเตอร์จะไม่ส่งผลต่อประสิทธิภาพด้านคลาวด์ของคุณ
STT.ai Enhanced รองรับทุกรูปแบบที่ STT.ai รองรับ — MP3, WAV, M4A, FLAC, OGG, MP4, MKV, MOV, WebM, AVI และอื่นๆ อีกมากมาย นำออกมาเป็น TXT, SRT, VTT, DOCX, JSON หรือ PDF
ใช่ การจัดเรียงผู้พูด ทำงานร่วมกับ STT.ai Enhanced สำหรับทุกการแปล ทุกคนที่พูดมีฉลาก และคุณสามารถเปลี่ยนชื่อพวกเขาในเครื่องมือแก้ไข
ใช่ STT.ai Enhanced ทำงานในโครงสร้างพื้นฐานส่วนตัวของเรา เสียงจะถูกประมวลผลและลบโดยปริยาย Pro + เพิ่มการเข้ารหัสด้านคลาวด์ ดังนั้นการแปลเป็นภาษาอังกฤษจะไม่สามารถอ่านได้โดยไม่มีกุญแจของคุณ และ Private Cloud ทำให้คุณสามารถโฮสต์ STT.ai Enhanced เองได้โดยสมบูรณ์ใน VPC ของคุณเอง
ใช้เครื่องมือ compare- stt เพื่อประมวลผล STT.ai Enhanced กับรุ่นอื่นที่รองรับบนเครื่องเสียงเดียวกัน คุณจะเห็น WER, จำนวนเซกเมนต์, แท็กลำโพง และคะแนนความเชื่อมั่น ติดกัน การเปรียบเทียบ STT.ai Enhanced กับ Whisper Large V3 นั้นเป็นวิธีที่ใช้กันมากที่สุด
ใช่ ระบุ "stt-ai-enhanced" เป็นพารามิเตอร์แบบจำลองบนจุดจบ /v1/transcribe Python และ Node.js SDKs รวมถึงตัวอย่าง STT.ai Enhanced ระดับ API ฟรี รวมถึง 100 นาที/เดือน
การอนุญาตสำหรับ STT.ai Enhanced ถูกตั้งค่าโดย STT.ai; การโฮสต์ด้วยตนเองขึ้นอยู่กับเงื่อนไขของพวกเขา บริการโฮสต์ของ STT.ai ทำงาน STT.ai Enhanced บน GPU ที่จัดการได้ ดังนั้นคุณจึงไม่ต้องจัดการการรวมเข้าด้วยกัน