Přepsat s STT.ai Enhanced
4.2%
WER
99
Jazyky
15.9x
Rychlost
MIT
Licence
O aplikaci STT.ai Enhanced
STT.ai Enhanced je náš nejpřesnější a nejrychlejší model řeči-textu. Vestavěný na špičkové transformátorové architektuře s proprietárními optimalizacemi, poskytuje oborově vedoucí hodnoty chyb ve 100+ jazycích. Ideální pro transkripci výroby, real-time titulkování a podnikové aplikace.
Jazyky podporované STT.ai Enhanced
✦ Odemknout vylepšený model
Získejte přístup k našemu nejpřesnějšímu modelu s jakýmkoli placeným plánem ¶ Whisper large-v3, 99 jazyků, a reproduktor diarizace.
Zobrazit plány →Vzorové informace
- PoskytovatelOpenAI (hosted by STT.ai)
- Architektura-
- LicenceMIT
- AktualizovánoAug 2026
Často kladené otázky
STT.ai Enhanced je ukázkový model od OpenAI (hosted by STT.ai). STT.ai hostů STT.ai Enhanced na naší GPU infrastruktuře, takže ji můžete použít bez poskytnutí vlastního hardwaru a nahrát audio nebo video a vybrat STT.ai Enhanced z modelového sběrače.
Na standardních referenčních hodnotách dosahuje STT.ai Enhanced přibližně 4.2% Word Error Rate. Skutečná přesnost závisí na kvalitě zvuku, přízvuku a jazyku; u hlučných nebo akcentovaných nahrávek očekáváme o několik procentních bodů vyšší WER.
STT.ai Enhanced is a premium model — included with any paid STT.ai plan starting at $5/month. It is not available on the free tier: free and anonymous uploads run Whisper Turbo instead.
STT.ai Enhanced je uvolněno pod MIT, povolná open-source licence. Můžete self-host STT.ai Enhanced na vašem vlastním hardwaru, nebo použít naši hostitelskou verzi dírky oba jsou komerčně použitelné.
STT.ai Enhanced podporuje 99 jazyků. Auto-detekce vybírá správný jazyk pro většinu audio; můžete jej také ručně zadat pro malý výtah přesnosti.
STT.ai Enhanced zpracovává audio na cca 15.9x v reálném čase na našich GPU. 1-hodinový audio soubor končí za méně než 3 minut; delší fronta souborů a upozornění e-mailem, když je hotovo.
STT.ai Enhanced má 1.55B parametrů. Větší modely mají tendenci být přesnější, ale pomalejší; STT.ai hostů STT.ai Enhanced na GPU, takže počet parametrů nemá vliv na výkon na straně klienta.
STT.ai Enhanced přijímá každý formát STT.ai podporuje MP3, WAV, M4A, FLAC, OGG, MP4, MKV, MOV, WebM, AVI a další. Výstup jako TXT, SRT, VTT, DOCX, JSON, nebo PDF.
Ano. Diarizace reproduktorů vede vedle STT.ai Enhanced pro každý přepis a každý reproduktor je označen a můžete je přejmenovat v editoru později.
Ano. STT.ai Enhanced běží v naší soukromé infrastruktuře Audio je zpracováno a smazáno ve výchozím nastavení. Pro+ přidává šifrování na straně klienta, takže přepisy jsou bez vašeho klíče nečitelné, a Private Cloud vám umožní samo-host STT.ai Enhanced zcela ve vašem vlastním VPC.
Pomocí porovná-stt nástroj spustit STT.ai Enhanced proti jakémukoliv jinému podporovanému modelu na stejném zvuku, budete vidět WER, počet segmentů, reproduktory štítky, a sebedůvěry skóre vedle sebe. STT.ai Enhanced vs Whisper Large V3 srovnání je nejčastějším spuštěním.
Ano. Zadejte "stt-ai-enhanced" jako parametr modelu na cílovém parametru /v1/transcribe. Python a Node.js SDKs obsahují STT.ai Enhanced příklady. Bezplatná úroveň API zahrnuje 100 minut/měsíc.
Ano. Vzhledem k tomu, STT.ai Enhanced je MIT-licencován, můžete si ho sami-hostit. STT.ai open-source stránky uvádí projekt repo a váhy. Většina výrobních týmů používá naši hostitelskou verzi přeskočit GPU zadávání zakázek, modelové swapy, a ops.