AI Policy & Transparency
AI anu urang anggo, dimana éta dijalankeun, sareng kumaha urang ngalaksanakeun sarat kabuka (EU AI Act Artikel 50, efektif 2026-08-02).
TL;DR
- Sagala transkripsi dihasilkeun ku AI. Satiap hasilna ngandung katerangan anu bisa dibaca ku mesin.
- Sadaya AI dijalankeun dina GPU urang sorangan. Kami NON ngirim audio atanapi teks anjeun ka OpenAI, Anthropic, Google, atanapi API LLM pihak katilu naon waé.
- Kami NON-latih model basis dina transcript anjeun. Ngan hiji opt-in fine-tune ngagunakeun panyesuaian anjeun explicitly nyieun.
- Synthetic voice clones (TTS) jelas dilabelkeun salaku AI-generated dina nami file, metadata, sareng dina halaman.
Model sing kita gunakake
| Model | Digunakaké kanggo | Lisensi | Dijalankan |
|---|---|---|---|
| Whisper large-v3-turbo (faster-whisper) | Transkripsi (piawai) | MIT | GPU kita |
| STT.ai Enhanced (custom fine-tune) | Transkripsi (rencana bayar) | MIT (base) / Proprietary (fine-tune weights) | GPU kita |
| Vosk | Real-time word streaming | Apache 2.0 | GPU kita |
| SpeechBrain ECAPA-TDNN | Speaker diarization | Apache 2.0 | GPU kita |
| MadLAD-400 3B | Terjemah (450+ basa) | Apache 2.0 | GPU kita |
| Qwen2.5-1.5B (llama.cpp) | Ringkasan, analisis, produksi isi, RAG chatting | Apache 2.0 | GPU kita |
| F5-TTS | Kloning swara / teks-ka-waca | MIT | GPU kita |
| all-MiniLM-L6-v2 | Penyaring kanggo pencarian RAG | Apache 2.0 | GPU kita |
Kami henteu ngahubungi OpenAI, Anthropic, Google Cloud, atanapi LLM API pihak katilu pikeun fitur naon waé. Satiap model di luhur dijalankeun dina perkakas anu urang gaduh sareng operasi. Sahiji-hijina jasa AI luar anu urang anggo nyaéta translateapi.ai (sareng Muddy Holdings) pikeun ngawaskeun string UI - ieu henteu kantos nyababkeun isi anu ditransliterasikeun.
Cara kita nyathet generasi AI
- Halaman HTML: include <meta name=\
- Eksport teks (TXT, SRT, VTT, JSON, CSV, DOCX, PDF): ngandung 'AI-generated transcript' baris pangungkeman di luhur sakabéh berkas.
- Suara sintetik / TTS output: Berkas WAV ngandung tag'synthetic-voice' dina metadata sarta peringatan anu jelas dina halaman ngundeur. Disclaimer anu bisa didengarkeun aya dina roadmap.
- Jawaban API: ngawengku _ai_generated:: true medan dina saben balasan JSON nu ngandung isi anu ditranskripsikeun.
Data latihan
- Model dasar (Whisper, MadLAD, Qwen, jsb) datangna dilatih ti penerbitna. Kami nganggona kaya-kaya diangkut.
- Transkripsi sampeyan ora digunakake kanggo nglatih model basis.
- Yen sampeyan ngaresiki segmen transcript (gambar pensil) utawa nyathet salah (gambar bendera), lan sampeyan wis milih ing /privacy-settings/ (\
- Sacara mandiri, tombol Kontribusi panyebut plus audio ka Lab Suara (di /privacy-settings/ ogé, ogé di-off sacara standar) milih anjeun pikeun ngakontribusikeun audio segmen anu anjeun panyebut, dibarengan ku teks anu dipésér, ka dataset Lab Suara kami di handapeun CC-BY-SA-4.0. Dua tombol ieu mandiri — anjeun bisa masihan salah sahiji, kadua, atawa teu aya.
- Audio sing diunggah bakal dipateni sajrone 24 jam liwat cleanup_uploads cron — KABEH sampeyan ora milih kanggo \
Ketepatan lan kesalahan
AI transcription ora sampurna. Kasalahan tembung tingkat beda-beda dening speaker accent, kualitas audio, basa, lan kosakata domain. Kanggo panggunaan kritis (legal, medis, industri diatur) verifikasi ing audio asli. Benchmarks WER umum kita saben model ing /models/.
Takon
Kanggo EU AI Act, GDPR, utawa pitakonan adhedhasar liyane: hello@stt.ai utawa gunakake formulir kontak.
Diperbarui: 2026-04-26.