SenseVoice

STT.ai δεν τρέχει αυτό το μοντέλο. Αυτή η σελίδα είναι πληροφορίες αναφοράς σχετικά με αυτό. Τρανσέρβερ με τα μοντέλα που τρέχουμε →
5.5%
WER
50
Γλώσσες
50.0x
Ταχύτητα
MIT
Άδεια

Σχετικά SenseVoice

Η SenseVoice είναι ένα μοντέλο βάσης ομιλίας από το FunAudioLLM που πηγαίνει πέρα από τη μεταγραφή. Υποστηρίζει 50+ γλώσσες και περιλαμβάνει δυνατότητες για αναγνώριση συναισθημάτων, ανίχνευση γεγονότων ήχου, και αντιστροφή ομαλοποίηση κειμένου σε ένα ενιαίο μοντέλο.
Υπόδειγμα πληροφοριών
  • ΠρομηθευτήςFunAudioLLM
  • Αρχιτεκτονική-
  • ΆδειαMIT
  • ΕνημέρωσηMar 2026

Συχνές Ερωτήσεις

SenseVoice is a speech-to-text model by FunAudioLLM. STT.ai does not currently run SenseVoice — this page is reference information about the model. For transcription on STT.ai, the model picker offers the Whisper family (Turbo, Large V3, Medium, Small).

Στα πρότυπα σημεία αναφοράς, SenseVoice επιτυγχάνει περίπου 5.5% Word Error Rate. Ακρίβεια σε πραγματικό κόσμο εξαρτάται από την ποιότητα ήχου, την προφορά, και τη γλώσσα? για θορυβώδη ή τονισμένη ηχογραφήσεις, αναμένουν μερικές ποσοστιαίες μονάδες υψηλότερη WER.

SenseVoice δεν είναι διαθέσιμη στις STT.ai. Οι δικοί του όροι άδειας λειτουργίας του μόνοι σας. STT.ai δωρεάν βαθμίδα καλύπτει τα μοντέλα Whisper κάνουμε τρέξει 600 λεπτά για να ξεκινήσετε, στη συνέχεια, ένα μηνιαίο δωρεάν top-up.

SenseVoice κυκλοφορεί κάτω από MIT, μια ανεκτική άδεια ανοικτού κώδικα. Μπορείτε να αυτο-φιλοξενήσετε SenseVoice στο δικό σας υλικό ή να χρησιμοποιήσετε μας φιλοξενείται έκδοση και τα δύο είναι εμπορικά χρησιμοποιήσιμα.

SenseVoice υποστηρίζει 50 γλώσσες. Auto-detection επιλέγει τη σωστή γλώσσα για τους περισσότερους ήχους? μπορείτε επίσης να το καθορίσετε χειροκίνητα για ένα μικρό ανελκυστήρα ακρίβειας.

SenseVoice διαδικασίες ήχου σε περίπου 50.0x σε πραγματικό χρόνο στις GPUs μας. Ένα αρχείο ήχου 1 ώρας τελειώνει σε λιγότερο από 1 λεπτά; μεγαλύτερη ουρά αρχείων και να ειδοποιήσει με email όταν γίνει.

SenseVoice έχει 234M παραμέτρους. Μεγαλύτερα μοντέλα τείνουν να είναι πιο ακριβή αλλά πιο αργά; STT.ai φιλοξενεί SenseVoice σε GPU έτσι ώστε η μέτρηση παραμέτρου δεν επηρεάζει τις επιδόσεις του πελάτη-πλευρά σας.

Το SenseVoice δέχεται κάθε μορφή STT.ai υποστηρίζει MP3, WAV, M4A, FLAC, OGG, MP4, MKV, MOV, WebM, AVI, και άλλα. Έξοδος ως TXT, SRT, VTT, DOCX, JSON, ή PDF.

Ναι. Διαχωρισμός ομιλητών τρέχει παράλληλα με SenseVoice για κάθε μεταγραφή. Κάθε ομιλητής φέρει την ετικέτα και μπορείτε να τα μετονομάσετε στον επεξεργαστή στη συνέχεια.

Ναι. SenseVoice τρέχει στο διαχειριστικό περιβάλλον μας Ο ήχος επεξεργάζεται και διαγράφεται από προεπιλογή και δεν χρησιμοποιείται ποτέ για την εκπαίδευση χωρίς ρητή opt-in. Pro σχέδια προσθέτουν κρυπτογράφηση client-side για τα πρακτικά σε κατάσταση ηρεμίας.

Χρησιμοποιήστε το εργαλείο σύγκρισης-stt για να τρέξει SenseVoice με οποιοδήποτε άλλο υποστηριζόμενο μοντέλο για το ίδιο ακουστικό ~ θα δείτε WER, section μετρώντας, ετικέτες ηχείων, και βαθμολογία εμπιστοσύνης δίπλα-δίπλα. Η σύγκριση SenseVoice vs Whisper Large V3 είναι η πιο συχνά τρέχει.

Ναι. Καθορίστε το "sensevoice" ως την παράμετρο του μοντέλου στο τελικό σημείο /v1/trancribe. Python και Node.js SDKs περιλαμβάνουν SenseVoice παραδείγματα. Free API βαθμίδα περιλαμβάνει 100 λεπτά/μήνα.

Ναι. Επειδή το SenseVoice είναι MIT-licensed, μπορείτε να το αυτο-φιλοξενήσετε. STT.ai ανοιχτής πηγής σελίδα του αναφέρει το repo του έργου και τα βάρη. Οι περισσότερες ομάδες παραγωγής χρησιμοποιούν την φιλοξενούμενη έκδοση μας για να παραλείψετε προμήθειες GPU, μοντέλα ανταλλαγής, και ops.