SenseVoice
Цю модель не запущено з STT.ai. Про неї можна дізнатися з цієї сторінки.
Приписуйтесь до моделей, які ми бігаємо →
5.5%
WER
50
Мови
50.0x
Швидкість
MIT
Ліцензія
Про програму SenseVoice
Відчуттєвий голос - це модель основи мовлення FunAudioLM, яка знаходиться поза архівацією. У програмі передбачено підтримку 50+ мов і можливості розпізнавання емоцій, виявлення подій звуковими даними та обернену нормалізацію тексту у одній моделі.
Мови, що підтримуються SenseVoice
Інформація про модель
- ПровайдерFunAudioLLM
- Архітектура-
- ЛіцензіяMIT
- ОновленоMar 2026
Часті запитання
SenseVoice is a speech-to-text model by FunAudioLLM. STT.ai does not currently run SenseVoice — this page is reference information about the model. For transcription on STT.ai, the model picker offers the Whisper family (Turbo, Large V3, Medium, Small).
За стандартними полями SenseVoice досягає приблизно 5.5% Частота помилок за словами. Точність реального світу залежить від якості звуку, акценту та мови; для галасливих або акцентованих записів очікується на декількох відсоткових пунктах вищого WER.
SenseVoice is not available on STT.ai. Its own licence terms govern running it yourself. STT.ai's free tier covers the Whisper models we do run — 600 minutes to start, then a monthly free top-up.
SenseVoice is released under MIT, a permissive open-source license. You can self-host SenseVoice on your own hardware or use our hosted version — both are commercially usable.
SenseVoice підтримують 50 мови. Автовиявлення обирає правильну мову для більшості звукових файлів; ви також можете вказати її вручну для невеличкого підйому точності.
SenseVoice processes audio at about 50.0x real-time on our GPUs. A 1-hour audio file finishes in under 1 minutes; longer files queue and notify by email when done.
SenseVoice має 8882 параметри. Великі моделі зазвичай є точнішими, але повільнішими; STT.ai вузлів - SenseVoice на GPU, отже кількість параметрів не впливає на швидкодію вашого клієнта.
SenseVoice приймає кожен формат STT.ai підтримує MP3, WAV, M4A, FLAC, OGG, MP4, MKV, MOV, WebM, AVI та інші. Вивід у вигляді TXT, SRT, VTT, DOCX, JSON або PDF.
Так. diamer diaarization працює поряд SenseVoice на кожен запис, кожен з промов буде позначено, і ви зможете перейменувати їх у редакторі після цього.
Yes. SenseVoice runs in our managed environment — audio is processed and deleted by default and never used for training without explicit opt-in. Pro plans add client-side encryption for transcripts at rest.
Скористайтеся інструментом порівняння- stest, щоб запустити SenseVoice у порівнянні з будь- якою іншою моделлю, що підтримується, на одному і тому ж звуковому каналі, ви побачите WER, кількість сегментів, надписи промовців, а також результати довіри збоку. Порівняння SenseVoice проти Wisper Великий V3 є найбільш поширеним.
Так. Вкажіть " sensevoice " як параметр моделі у теці / v1/ trancess кінцевій точці. У назвах Python і вузла. js SDKs містяться SenseVoice приклади. У вільний інтерфейс API міститься 100 хвилин/ місяців.
Так. Оскільки SenseVoice має 8882- ліцензію, ви можете виконати її. STT.ai - на сторінці з відкритим кодом наведено список експропріаторів та ваг. Більшість команд з виробництва використовують нашу власницьку версію для того, щоб пропустити закупівлю на GPU, моделі свопінгу і ops.