Kebijakan & Transparansi

Ing taun 2000, dhèwèké dadi anggota Dewan Perwakilan Rakyat lan dadi anggota Dewan Perwakilan Rakyat (DPR) wiwit taun 2005 nganti 2006.

TL;DR

  • Sedaya transkripsi dipunciptaaken déning AI. Saben output ngandhut informasi ingkang bisa dibaca mesin.
  • Sedaya AI dipun-ginakaken ing GPU kita piyambak. Kita NON ngirim audio utawa teks sampeyan menyang OpenAI, Anthropic, Google, utawa LLM API pihak katelu.
  • Kita ora nglatih model basis ing transkripsimu. Mung opt-in fine-tune kang nggunakake pangowahan kang eksplisit sampeyan lakoni.
  • Saliyané iku, ana uga sing diarani "metadata" (metadata) kang digunakaké kanggo ngenali file, file, utawa file.

Model kang kita gunakake

ModelDigunakaké kanggoLisénsiDiwiwiti
Whisper large-v3-turbo (faster-whisper)Transkripsi (piranti lunak)MITGPU kita
STT.ai Enhanced (custom fine-tune)Transkripsi (plan bayar)MIT (base) / Proprietary (fine-tune weights)GPU kita
VoskReal-time word streamingApache 2.0GPU kita
SpeechBrain ECAPA-TDNNPrasasti KadhiriApache 2.0GPU kita
MadLAD-400 3BTerjemah (450+ basa)Apache 2.0GPU kita
Qwen2.5-1.5B (llama.cpp)Kaca, kacaApache 2.0GPU kita
F5-TTSKloning swara / teks-ka-wacaMITGPU kita
all-MiniLM-L6-v2Kaca isi kanggo pencarian RAGApache 2.0GPU kita

Kita ora manggil OpenAI, Anthropic, Google Cloud, utawa pihak katelu LLM API kanggo fitur apa wae. Saben model ing ndhuwur dioperasikake ing piranti keras sing kita duwe lan operasi. Saben layanan AI njaba sing kita gunakake yaiku translateapi.ai (utawa Muddy Holdings) kanggo terjemahan string UI - iki ora tau nyentuh isi sing ditranskripsi.

Kajaba iku, ana uga generasi anyar.

  • Transkrip kaca HTML: kalebu <meta jeneng=\
  • Eksport teks (TXT, SRT, VTT, JSON, CSV, DOCX, PDF): nyakup baris pengepala 'AI-generated transcript' ing ndhuwur saben berkas.
  • Sinétron: Berkas WAV ngemot tag'synthetic-voice' ing metadata lan kabar kang jelas ing kaca ngundhuh. Disclaimer kang bisa didengar ana ing roadmap.
  • Jawaban API: nyakup _ai_generated: medan bener ing saben balasan JSON kang ngandhut isi kang ditranskripsi.

Data latihan

  • Model dasar (Whisper, MadLAD, Qwen, lsp) teka pra-dilatih saka penerbité. Kita nggunakake kaya-kaya wis dikirim.
  • Transkrip sampeyan ora digunakaké kanggo nglatih model basis.
  • Yen sampeyan ngresiki segmen transkripsi (gambar pethak) utawa nyathet salah (gambar bendera), lan sampeyan wis milih ing / privasi-aturan / (\
  • Ing sisih liya, tombol Kontribusi pambenahan plus audio kanggé Voice Lab (ugi wonten ing /privacy-settings/, ugi boten dipunaktifaken kanthi pitados), mènèhi pilihan kanggé mènèhi audio saking segmen ingkang dipunbetahaken, kaliyan teks ingkang dipunbetahaken, kanggé dataset Voice Lab kanggé CC-BY-SA-4.0. Kawiji tombol punika independen — sampeyan saged mènèhi salah satunggal, kathah, utawi boten.
  • Audio kang sampeyan unggah bakal dipasak sajrone 24 jam liwat cleanup_uploads cron — KABEH sampeyan wis milih ing \

Ketepatan lan Kesalahan

Transkripsi AI ora sampurna. Kasalahan tembung bisa beda-beda gumantung saka swara, kualitas swara, basa, lan kosakata domain. Kanggo panggunaan kritis (legal, medis, industri sing diatur) verifikasi karo audio asli. Benchmark WER umum kita saben model ana ing /models/.

Takon

Kanggo EU AI Act, GDPR, utawa pitakonan compliance liyane: hello@stt.ai utawa gunakake formulir kontak.

Diperbarui: 2026-04-26.