Перазапісаць STT.ai Enhanced
4.2%
WER
99
Мовы
15.9x
Хуткасць
MIT
Ліцэнзія
Пра STT.ai Enhanced
STT.ai Enhanced - гэта наша самая дакладная і хуткая мадэль пераўтварэння мовы ў тэкст. Пабудаваная на найноўшай архітэктуры трансфарматараў з уласнымі аптымізацыямі, яна дае найбольшую колькасць памылак у словах на 100+ мовах. Ідэальна падыходзіць для транскрыпцыі, стварэння субтытраў у рэальным часе і для прадпрыемстваў.
Мовы, якія падтрымліваюцца STT.ai Enhanced
✦ Разблакаваць пашыраную мадэль
Get access to our most accurate model with any paid plan — Whisper large-v3, 99 languages, and speaker diarization.
Прагляд планаў →Звесткі пра мадэль
- ПастаўшчыкOpenAI (hosted by STT.ai)
- Архітэктура-
- ЛіцэнзіяMIT
- АбнавіцьAug 2026
Часта задаваемыя пытанні
STT.ai Enhanced - гэта мадэль пераўтварэння мовы ў тэкст ад OpenAI (hosted by STT.ai). STT.ai размяшчае STT.ai Enhanced на нашай інфраструктуры GPU, таму вы можаце выкарыстоўваць яго без стварэння свайго апаратнага забеспячэння - загрузіце аўдыё або відэа і выберыце STT.ai Enhanced з выбару мадэлі.
На стандартных тэставанні, STT.ai Enhanced дасягае каля 4.2% Word Error Rate. Рэальная дакладнасць залежыць ад якасці гуку, акцэнту і мовы; для шумных або акцэнтаваных запісаў чакайце на некалькі працэнтных пунктаў вышэй WER.
STT.ai Enhanced — гэта прэміум-мадэлі, уключаныя ў любы плацежны план STT.ai, пачынаючы з $5/месяц. Гэта не даступна на бясплатным узроўні: бясплатныя і ананімныя загрузкі працуюць Whisper Turbo.
STT.ai Enhanced выпушчаны пад ліцэнзіяй MIT, дазваляе адкрыты код. Вы можаце самастойна ўсталяваць STT.ai Enhanced на вашым камп' ютары або выкарыстоўваць нашу версію - абодва могуць быць выкарыстаны ў камерцыйных мэтах.
STT.ai Enhanced падтрымлівае 99 моў. Аўтаматычнае выяўленне выбірае правільную мову для большасці гукаў; вы таксама можаце вызначыць яе ўручную для невялікага павышэння дакладнасці.
STT.ai Enhanced апрацоўвае аўдыё з хуткасцю 15.9x у рэальным часе на нашых GPU. 1- гадзінны аўдыё файл скончыцца менш чым за 3 хвіліны; даўжэйшыя файлы будуць адпраўляцца ў чаргу і абвяшчаць па электроннай пошце, калі яны будуць завершаны.
STT.ai Enhanced мае параметры 1.55B. Большыя мадэлі больш дакладныя, але павольнейшыя; STT.ai мае STT.ai Enhanced на GPU, таму колькасць параметраў не ўплывае на хуткасць працы кліента.
STT.ai Enhanced прымае ўсе фарматы, якія падтрымлівае STT.ai — MP3, WAV, M4A, FLAC, OGG, MP4, MKV, MOV, WebM, AVI і іншыя. Вывад у фармаце TXT, SRT, VTT, DOCX, JSON або PDF.
Так. Дыярызацыя гукавых файлаў працуе разам з STT.ai Enhanced для кожнай транскрыпцыі - кожны гукавы файл мае этыкетку, і вы можаце змяніць яго назву ў рэдактара пасля.
Так. STT.ai Enhanced працуе ў нашай прыватнай інфраструктуры — гук апрацоўваецца і выдаляецца па змаўчанні. Pro+ дадае шыфраванне на баку кліента, таму транскрыпты нечытальныя без вашага ключа, а Private Cloud дазваляе вам самастойна размясціць STT.ai Enhanced цалкам у вашым уласным VPC.
Выкарыстоўвайце інструмент compare-stt, каб правесці параўнанне STT.ai Enhanced з любым іншым падтрымліваемым мадэллю на тым жа аўдыё - вы ўбачыце WER, колькасць сегментаў, этыкеткі дынамікаў і рэйтынгі даверу бок аб бок. Параўнанне STT.ai Enhanced супраць Whisper Large V3 - гэта найбольш частае параўнанне.
Так. Вызначце "stt-ai-enhanced" як параметр мадэлі ў канечнай кропцы /v1/transcribe. Python і Node.js SDK ўключаюць прыклады STT.ai Enhanced. Бясплатны ўзровень API ўключае 100 хвілін / месяц.
Так. Паколькі STT.ai Enhanced мае ліцэнзію MIT, вы можаце самастойна яго ўсталяваць. На старонцы адкрытага кода STT.ai паказаны рэпазітары і вагі праекту. Большасць каманд выкарыстаюць нашу ўсталяваную версію, каб прапусціць закупку GPU, абмен мадэлямі і аперацыі.