Kebijakan & Transparansi
Ing taun 2000, dhèwèké dadi anggota Dewan Perwakilan Rakyat lan dadi anggota Dewan Perwakilan Rakyat (DPR) wiwit taun 2005 nganti 2006.
TL;DR
- Sedaya transkripsi dipunciptaaken déning AI. Saben output ngandhut informasi ingkang bisa dibaca mesin.
- Sedaya AI dipun-ginakaken ing GPU kita piyambak. Kita NON ngirim audio utawa teks sampeyan menyang OpenAI, Anthropic, Google, utawa LLM API pihak katelu.
- Kita ora nglatih model basis ing transkripsimu. Mung opt-in fine-tune kang nggunakake pangowahan kang eksplisit sampeyan lakoni.
- Saliyané iku, ana uga sing diarani "metadata" (metadata) kang digunakaké kanggo ngenali file, file, utawa file.
Model kang kita gunakake
| Model | Digunakaké kanggo | Lisénsi | Diwiwiti |
|---|---|---|---|
| Whisper large-v3-turbo (faster-whisper) | Transkripsi (piranti lunak) | MIT | GPU kita |
| STT.ai Enhanced (custom fine-tune) | Transkripsi (plan bayar) | MIT (base) / Proprietary (fine-tune weights) | GPU kita |
| Vosk | Real-time word streaming | Apache 2.0 | GPU kita |
| SpeechBrain ECAPA-TDNN | Prasasti Kadhiri | Apache 2.0 | GPU kita |
| MadLAD-400 3B | Terjemah (450+ basa) | Apache 2.0 | GPU kita |
| Qwen2.5-1.5B (llama.cpp) | Kaca, kaca | Apache 2.0 | GPU kita |
| F5-TTS | Kloning swara / teks-ka-waca | MIT | GPU kita |
| all-MiniLM-L6-v2 | Kaca isi kanggo pencarian RAG | Apache 2.0 | GPU kita |
Kita ora manggil OpenAI, Anthropic, Google Cloud, utawa pihak katelu LLM API kanggo fitur apa wae. Saben model ing ndhuwur dioperasikake ing piranti keras sing kita duwe lan operasi. Saben layanan AI njaba sing kita gunakake yaiku translateapi.ai (utawa Muddy Holdings) kanggo terjemahan string UI - iki ora tau nyentuh isi sing ditranskripsi.
Kajaba iku, ana uga generasi anyar.
- Transkrip kaca HTML: kalebu <meta jeneng=\
- Eksport teks (TXT, SRT, VTT, JSON, CSV, DOCX, PDF): nyakup baris pengepala 'AI-generated transcript' ing ndhuwur saben berkas.
- Sinétron: Berkas WAV ngemot tag'synthetic-voice' ing metadata lan kabar kang jelas ing kaca ngundhuh. Disclaimer kang bisa didengar ana ing roadmap.
- Jawaban API: nyakup _ai_generated: medan bener ing saben balasan JSON kang ngandhut isi kang ditranskripsi.
Data latihan
- Model dasar (Whisper, MadLAD, Qwen, lsp) teka pra-dilatih saka penerbité. Kita nggunakake kaya-kaya wis dikirim.
- Transkrip sampeyan ora digunakaké kanggo nglatih model basis.
- Yen sampeyan ngresiki segmen transkripsi (gambar pethak) utawa nyathet salah (gambar bendera), lan sampeyan wis milih ing / privasi-aturan / (\
- Ing sisih liya, tombol Kontribusi pambenahan plus audio kanggé Voice Lab (ugi wonten ing /privacy-settings/, ugi boten dipunaktifaken kanthi pitados), mènèhi pilihan kanggé mènèhi audio saking segmen ingkang dipunbetahaken, kaliyan teks ingkang dipunbetahaken, kanggé dataset Voice Lab kanggé CC-BY-SA-4.0. Kawiji tombol punika independen — sampeyan saged mènèhi salah satunggal, kathah, utawi boten.
- Audio kang sampeyan unggah bakal dipasak sajrone 24 jam liwat cleanup_uploads cron — KABEH sampeyan wis milih ing \
Ketepatan lan Kesalahan
Transkripsi AI ora sampurna. Kasalahan tembung bisa beda-beda gumantung saka swara, kualitas swara, basa, lan kosakata domain. Kanggo panggunaan kritis (legal, medis, industri sing diatur) verifikasi karo audio asli. Benchmark WER umum kita saben model ana ing /models/.
Takon
Kanggo EU AI Act, GDPR, utawa pitakonan compliance liyane: hello@stt.ai utawa gunakake formulir kontak.
Diperbarui: 2026-04-26.