_Trenskripsikan dengan STT.ai Enhanced
4.2%
WER
99
Bahasa
15.9x
Kelajuan
MIT
Lesen
Tentang STT.ai Enhanced
STT.ai Enhanced adalah model ucapan-ke-teks kami yang paling tepat dan pantas. Dibina pada arsitektur transformator terkini dengan pengoptimuman hak milik, ia memberikan kadar ralat perkataan terkemuka dalam industri melebihi 100+ bahasa. Ideal untuk transkripsi pengeluaran, subtitel masa nyata, dan aplikasi perniagaan.
✦ Nyahkunci Model Diperbaiki
Dapatkan akses kepada model kami yang paling tepat dengan sebarang rancangan berbayar — Whisper besar-v3, 99 bahasa, dan speaker diarization.
Papar Rencana →Maklumat Model
- PenyediaOpenAI (hosted by STT.ai)
- Arkitektur-
- LesenMIT
- DikemaskiniAug 2026
Soalan Lazim
STT.ai Enhanced adalah model pertuturan-ke-teks oleh OpenAI (hosted by STT.ai). STT.ai memuatkan STT.ai Enhanced pada infrastruktur GPU kami supaya anda boleh menggunakannya tanpa menyediakan perkakasan anda sendiri — muat naik audio atau video dan pilih STT.ai Enhanced dari pemilih model.
Pada piawaian piawai, STT.ai Enhanced mencapai kira-kira 4.2% Kadar Ralat Perkataan. Ketepatan dunia nyata bergantung pada kualiti audio, loghat, dan bahasa; untuk rakaman bising atau loghat, harapkan beberapa peratusan WER yang lebih tinggi.
STT.ai Enhanced adalah model premium — dimasukkan dengan mana-mana rancangan STT.ai berbayar bermula pada $5/bulan. Ia tidak tersedia pada aras percuma: muat naik percuma dan anonim menjalankan Whisper Turbo sebaliknya.
STT.ai Enhanced dikeluarkan di bawah lesen sumber terbuka MIT. Anda boleh memuat turun STT.ai Enhanced pada perkakasan anda sendiri atau menggunakan versi kami yang dimuat turun — kedua-duanya boleh digunakan secara komersial.
STT.ai Enhanced menyokong 99 bahasa. Auto-kesan memilih bahasa yang betul untuk kebanyakan audio; anda juga boleh nyatakannya secara manual untuk ketelusan yang lebih baik.
STT.ai Enhanced memproses audio pada kira-kira 15.9x masa nyata pada GPU kami. Fail audio 1 jam selesai dalam kurang daripada 3 minit; fail yang lebih panjang berijil dan maklumkan melalui emel bila selesai.
STT.ai Enhanced mempunyai parameter 1.55B. Model yang lebih besar cenderung lebih tepat tetapi lebih perlahan; STT.ai memuatkan STT.ai Enhanced pada GPU jadi kiraan parameter tidak mempengaruhi prestasi sisi klien anda.
STT.ai Enhanced menerima setiap format yang disokong STT.ai — MP3, WAV, M4A, FLAC, OGG, MP4, MKV, MOV, WebM, AVI, dan lain-lain. Output sebagai TXT, SRT, VTT, DOCX, JSON, atau PDF.
Ya. Diarisasi pembicara berjalan bersama STT.ai Enhanced untuk setiap transkripsi — setiap pembicara dilabel dan anda boleh menamakan semula mereka dalam editor selepas itu.
Ya. STT.ai Enhanced berjalan dalam infrastruktur persendirian kami — audio diproses dan dipadam secara lalai. Pro+ menambah penyulitan sisi klien supaya transkripsi tidak boleh dibaca tanpa kunci anda, dan Awan Persendirian membolehkan anda menghost STT.ai Enhanced sepenuhnya dalam VPC anda sendiri.
Gunakan alat compare-stt untuk jalankan STT.ai Enhanced terhadap model yang disokong lain pada audio yang sama — anda akan lihat WER, kiraan segmen, label pengeras, dan skor keyakinan berdampingan. Perbandingan STT.ai Enhanced vs Whisper Large V3 adalah yang paling biasa dijalankan.
Ya. Nyatakan "stt-ai-enhanced" sebagai parameter model pada titik akhir /v1/transcribe. Python dan Node.js SDKs termasuk contoh STT.ai Enhanced. Tahap API percuma termasuk 100 minit/bulan.
Ya. Kerana STT.ai Enhanced adalah MIT-licensed, anda boleh self-host ia. STT.ai's open-source page lists the project repo and weights. Kebanyakan pasukan produksi menggunakan versi kami yang dihost untuk melepasi pembelian GPU, pertukaran model, dan ops.