NVIDIA Canary

STT.ai ไม่ได้ทำงานโมเดลนี้ หน้านี้เป็นข้อมูลอ้างอิงเกี่ยวกับมัน เขียนแบบจำลองที่เราทำ →
3.5%
WER
4
ภาษา
45.0x
ความเร็ว
CC-BY-4.0
ใบอนุญาต

เกี่ยวกับ NVIDIA Canary

NVIDIA Canary เป็นโมเดลพารามิเตอร์ 1B ที่ยอดเยี่ยมในการแปลภาษาอังกฤษ เยอรมัน ฝรั่งเศส และสเปน สร้างบนเฟรมเวิร์ก NeMo ใช้เครื่องเข้ารหัส FastConformer กับเครื่องถอดรหัส Transformer และรองรับการตรวจจับและแปลภาษาอัตโนมัติ

ภาษาที่รองรับ NVIDIA Canary

ข้อมูลรุ่น
  • ตัวจัดหาNVIDIA
  • สถาปัตยกรรม-
  • ใบอนุญาตCC-BY-4.0
  • ปรับปรุงใหม่Mar 2026

คำถามที่พบบ่อย

NVIDIA Canary เป็นโมเดลการแปลงเสียงเป็นข้อความของ NVIDIA STT.ai ไม่ได้ทำงาน NVIDIA Canary อยู่ ตอนนี้ - หน้านี้เป็นข้อมูลอ้างอิงเกี่ยวกับโมเดล สำหรับการแปลงเสียงบน STT.ai ตัวเลือกโมเดลจะเสนอครอบครัว Whisper (Turbo, Large V3, Medium, Small)

ตามมาตรฐานการทดสอบ NVIDIA Canary สามารถทำได้ราว 3.5% ของอัตราความผิดพลาดของคำ ความแม่นยำในโลกจริงขึ้นอยู่กับคุณภาพเสียง สำเนียง และภาษา สำหรับเสียงรบกวนหรือสำเนียงที่บันทึกไว้ ควรจะคาดหวังให้ WER สูงกว่า WER หลายเปอร์เซ็นต์

NVIDIA Canary ไม่ได้มีอยู่ใน STT.ai เงื่อนไขของใบอนุญาตของมันเอง ควบคุมการทำงานของคุณเอง STT.ai ระดับฟรี ปกป้อง Whisper โมเดลที่เราทำงาน - 600 นาทีเพื่อเริ่มต้น จากนั้นเดือนฟรีเติม

NVIDIA Canary ถูกปล่อยออกมาภายใต้ CC-BY-4.0 ใบอนุญาตโอเพนซอร์สที่อนุญาตให้คุณสามารถใช้ NVIDIA Canary บนฮาร์ดแวร์ของคุณเอง หรือใช้เวอร์ชั่นที่เราจัดเตรียมไว้ — ทั้งหมดนี้สามารถใช้ได้ในเชิงพาณิชย์

NVIDIA Canary รองรับภาษา 4 ตัวตรวจจับอัตโนมัติจะเลือกภาษาที่ถูกต้องสำหรับเสียงส่วนใหญ่ คุณสามารถกำหนดเองได้ด้วยเพื่อเพิ่มความแม่นยำเล็กน้อย

NVIDIA Canary ประมวลผลเสียงด้วยความเร็วประมาณ 45.0x ตามเวลาจริงบน GPU ของเรา แฟ้มเสียง 1 ชั่วโมง จะใช้เวลาไม่ถึง 1 นาที ส่วนแฟ้มที่ยาวกว่าจะถูกจัดเป็นคิวและแจ้งให้ทราบทางอีเมลเมื่อเสร็จสิ้น

NVIDIA Canary มีพารามิเตอร์ 1B รุ่นที่ใหญ่กว่าจะมีแนวโน้มที่จะแม่นยำกว่า แต่ช้ากว่า; STT.ai ใช้ NVIDIA Canary บน GPU ดังนั้น การนับพารามิเตอร์จะไม่ส่งผลต่อประสิทธิภาพด้านคลาวด์ของคุณ

NVIDIA Canary รองรับทุกรูปแบบที่ STT.ai รองรับ — MP3, WAV, M4A, FLAC, OGG, MP4, MKV, MOV, WebM, AVI และอื่นๆ อีกมากมาย นำออกมาเป็น TXT, SRT, VTT, DOCX, JSON หรือ PDF

ใช่ การจัดเรียงผู้พูด ทำงานร่วมกับ NVIDIA Canary สำหรับทุกการแปล ทุกคนที่พูดมีฉลาก และคุณสามารถเปลี่ยนชื่อพวกเขาในเครื่องมือแก้ไข

ใช่ NVIDIA Canary ทำงานในสภาพแวดล้อมที่จัดการได้ของเรา - เสียงจะถูกประมวลผลและลบโดยปริยาย และไม่เคยใช้สำหรับการฝึกอบรมโดยไม่ต้องเลือกอย่างชัดเจน แพ็คเกจโปรเพิ่มการเข้ารหัสด้านคลาวด์สำหรับแปลภาษาที่พัก

ใช้เครื่องมือ compare- stt เพื่อประมวลผล NVIDIA Canary กับรุ่นอื่นที่รองรับบนเครื่องเสียงเดียวกัน คุณจะเห็น WER, จำนวนเซกเมนต์, แท็กลำโพง และคะแนนความเชื่อมั่น ติดกัน การเปรียบเทียบ NVIDIA Canary กับ Whisper Large V3 นั้นเป็นวิธีที่ใช้กันมากที่สุด

ใช่ ระบุ "nvidia-canary" เป็นพารามิเตอร์แบบจำลองบนจุดจบ /v1/transcribe Python และ Node.js SDKs รวมถึงตัวอย่าง NVIDIA Canary ระดับ API ฟรี รวมถึง 100 นาที/เดือน

ใช่ เพราะ NVIDIA Canary ได้รับอนุญาตจาก CC-BY-4.0 คุณสามารถโฮสต์มันเองได้ หน้าโอเพนซอร์สของ STT.ai แสดงรายการโครงการและน้ำหนัก ทีมผลิตส่วนใหญ่ใช้เวอร์ชั่นโฮสต์ของเรา ข้ามการซื้อ GPU แบบจำลองสลับและปฏิบัติการ