SenseVoice

STT.ai не работает с этой моделью. Эта страница содержит справочную информацию о ней. Переписать модели, которые мы используем →
5.5%
WER
50
Знание языков
50.0x
Скорость
MIT
Лицензия

О том, что SenseVoice

SenseVoice — это модель фундамента речи из FunAudioLM, которая выходит за рамки транскрипции. Она поддерживает язык 50+ и включает в себя возможности для распознавания эмоций, распознавания звуковых событий и обратной текстовой нормализации в одной модели.
Модель
  • ПоставщикFunAudioLLM
  • Архитектура-
  • ЛицензияMIT
  • ОбновленныеMar 2026

Часто задаваемые вопросы

SenseVoice — это модель речи к тексту на FunAudioLLM. STT.ai в настоящее время не работает SenseVoice — эта страница содержит справочную информацию о модели. STT.ai для транскрипции, набор моделей предлагает семейство Whisper (Turbo, Крупный V3, Simed, Small).

При стандартных контрольных параметрах SenseVoice достигает примерно 5.5% скорости ошибок в Word. Точность в реальном мире зависит от качества звука, акцента и языка; для шумных или заостренных записей ожидается, что на несколько процентных пунктов выше WER.

SenseVoice не доступен на STT.ai. Его собственные условия лицензирования регулируют его сам. STT.ai бесплатный уровень охватывает модели Whisper, которые мы используем — 600 минут для начала, затем ежемесячно бесплатный сверху.

SenseVoice выпущено на MIT год, разрешительная лицензия с открытым исходным кодом. Вы можете самостоятельно принять SenseVoice на вашем собственном оборудовании или использовать нашу приёмную версию — оба они могут быть использованы на коммерческой основе.

SenseVoice поддерживает 50 язык. Автообнаружение выбирает правильный язык для большинства звуков; вы также можете указать его вручную для небольшого лифта с точностью.

SenseVoice обрабатывает аудио примерно 50.0x в режиме реального времени на наших GPU. 1-часовой аудио файл заканчивается меньше чем за 1 минуты; более длинный список файлов и уведомление по электронной почте, когда он будет сделан.

SenseVoice имеет параметры 234M. Большие модели, как правило, более точны, но медленнее; STT.ai носит SenseVoice на GPU, так что число параметров не влияет на производительность вашего клиента.

SenseVoice принимает каждый формат STT.ai поддержки — MP3, WAV, M4A, FLAC, OGG, MP4, MKV, MOV, WebM, AVI и другие.

Да, диааризация спикера проводится вместе с SenseVoice за каждую транскрипцию — каждый оратор помечен ярлыком, и после этого вы можете переименовать их в редактора.

Да. SenseVoice прогонов в нашей регулируемой среде — аудио обрабатывается и удаляется по умолчанию и никогда не используется для обучения без прямого выбора. Про-планы добавляют шифрование клиентом для расшифровки стенограмм.

Используйте инструмент для сравнения с SenseVoice против любой другой поддерживаемой модели на одном и том же аудио — вы увидите WER, число сегментов, ярлыки громкостей и оценки достоверности одновременно. Сопоставление SenseVoice vs Whisper Крупный V3 — наиболее частое сравнение.

Да. Указать "sensevoice" в качестве параметра модели на конечных точках /v1/tranarip. Python и Node.js SDKs включают SenseVoice примеры. Свободный API уровень включает 100 минут в месяц.

Да, так как SenseVoice имеет MIT-лицензию, вы можете самостоятельно завести его. На странице с открытым исходным кодом STT.ai перечисляются репо и весы проекта. Большинство производственных команд используют нашу хост-версия, чтобы пропустить закупки GPU, свопы моделей и операции.