Транкриптиране с STT.ai Enhanced
4.2%
WER
99
Езици
15.9x
Скорост
MIT
Лицензация
За STT.ai Enhanced
STT.ai Подобрен е нашият най-точен и най-бърз модел за говорене-то-текст. Построен върху най-напреднала трансформаторна архитектура с промоционални оптимизации, той предоставя водещи стандарти на индустрията на думи грешки на 100+ езици. Идеален за производството транскрипция, реално време на надписи и предприятие приложения.
✦ Отключи подобрен модел
Намерете достъп до най-точния модел с всеки платен план — шепнете голям-v3, 99 езика и говорител диаризация.
Преглед на плановете →Информация за модела
- ДоставчикOpenAI (hosted by STT.ai)
- Архитектура-
- ЛицензацияMIT
- ОбновеноAug 2026
Често задавани въпроси
STT.ai Enhanced е модел от реч към текст от OpenAI (hosted by STT.ai). STT.ai домакини STT.ai Enhanced на нашата GPU инфраструктура, така че можете да го използвате, без да предоставяте своя собствен хардуер — качване на аудио или видео и изберете STT.ai Enhanced от модела избирач.
По стандартни бенчмаркове STT.ai Enhanced достига около 4.2% Word Error Rate. Real-world точност зависи от качеството на звука, акцента и езика; за шумни или акцентирани записи, очакват няколко процентни пункта по-висока WER.
STT.ai Enhanced е премиен модел — включван с всички платени STT.ai план започващи от $5 на месец. Той не е на разположение на свободен ступеон: безплатно и анонимно изпращане на изпращане вместо това Whisper Turbo.
STT.ai Enhanced е освободен под MIT, допустим лиценз за отворен източник. Можете да се самоприемате STT.ai Enhanced на своя собствен хардуер или да използвате нашата хостинг версия - и двете са търговски приложими.
STT.ai Enhanced поддържа 99 езика. Автоматично откриване избира правилния език за повечето аудио; можете да го ръчно посочите и за малък асансьор за точност.
STT.ai Enhanced процеси аудио на около 15.9x в реално време на нашите GPU. 1-часов аудио файл завършва в под 8802 минути; по-дълги файлове редица и уведомяване по имейл, когато се направи.
STT.ai Enhanced има 8802 параметри. По-големите модели са по-точни, но по-бавни; STT.ai домакини STT.ai Enhanced на GPU, така че броят на параметрите не влияе на производителността на вашия клиент.
STT.ai Enhanced приема всеки формат STT.ai поддръжки — MP3, WAV, M4A, FLAC, OGG, MP4, MKV, MOV, WebM, AVI и др. Изход като TXT, SRT, VTT, DOCX, JSON или PDF.
Да. Диагностикацията на спикера се движи до STT.ai Enhanced за всяка транскрипция — всеки говорител е етикетиран и можете да ги преименувате в редактора след това.
Да. STT.ai Enhanced тече в нашата частна инфраструктура — аудио се обработва и изтрива по подразбиране. Pro+ добавя кодиране на клиента, така че транскрипти са непрочитани без вашия ключ, и Private Cloud ви позволява самостоятелен домакин STT.ai Enhanced изцяло в собствения си VPC.
Използвайте инструмента за сравнение, за да стартирате STT.ai Enhanced срещу всеки друг подкрепен модел на един и същ звук – ще видите WER, сегмент брой, говорител етикети и доверителни резултати странично дострани. STT.ai Enhanced спрямо Whisper Large V3 сравнението е най-често извършено.
Да. Определяте "stt-ai-enhanced" като параметр за модела на точката /v1/transcribe. Python и Node.js SDKs включват STT.ai Enhanced примери. Free API низ включва 100 минути/месечно.
Да. Тъй като STT.ai Enhanced е 8802-лицензиран, можете да го самостоятелно домакин. STT.ai на отворения източник страница изброява репо и тежести на проекта. Повечето производствени екипи използват нашата хостинг версия, за да пропуснат GPU поръчки, смяна на модели и операции.