Kebijakan AI & Transparansi
Apa yang kita gunakan, di mana itu berjalan, dan bagaimana kita mematuhi persyaratan pengungkapan (EU AI Act Butir 50, efektif 2026-08-02).
TL;DR
- Semua transkrip dihasilkan AI. Setiap output membawa pengungkapan yang dapat dibaca mesin.
- Semua AI berjalan pada GPU kita sendiri. Kami TIDAK mengirim audio atau teks Anda ke OpenAI, Anthropic, Google, atau LLM API pihak ketiga.
- Kami tidak melatih model dasar pada transkrip Anda. hanya opt-in fine-tune menggunakan koreksi Anda secara eksplisit membuat.
- Kloning suara sintetis (TTS) dengan jelas diberi label sebagai AI-generated dalam nama berkas, metadata, dan pada halaman.
Model yang kita gunakan
| Model | Digunakan untuk | Lisensi | Berjalan |
|---|---|---|---|
| Whisper large-v3-turbo (faster-whisper) | Transkripsi (baku) | MIT | GPU kami |
| STT.ai Enhanced (custom fine-tune) | Transkripsi (rencana berbayar) | MIT (base) / Proprietary (fine-tune weights) | GPU kami |
| Vosk | streaming kata real-time | Apache 2.0 | GPU kami |
| SpeechBrain ECAPA-TDNN | Diarasi Speaker | Apache 2.0 | GPU kami |
| MadLAD-400 3B | Terjemahan (450+ bahasa) | Apache 2.0 | GPU kami |
| Qwen2.5-1.5B (llama.cpp) | Ringkasan, analisis, pembuatan konten, percakapan RAG | Apache 2.0 | GPU kami |
| F5-TTS | Voice clone / text-to-spiech | MIT | GPU kami |
| all-MiniLM-L6-v2 | Embedding untuk pencarian RAG | Apache 2.0 | GPU kami |
Kami tidak menyebut OpenAI, Antropik, Google Cloud, atau fitur LLM API pihak ketiga. Setiap model di atas berjalan pada perangkat keras yang kami punya dan beroperasi. Satu-satunya layanan AI eksternal yang kami gunakan adalah menerjemahkanapi.ai (juga Muddy Holdings) untuk menerjemahkan string UI ▪ ini tidak pernah menyentuh isi transcripted Anda.
Bagaimana kita mengungkapkan generasi AI
- Halaman HTML transkrip: termasuk <meta nama=\
- Ekspor teks (TXT, SRT, VTT, JSON, CSV, DOCX, PDF): termasuk baris header 'AI-generated' header line di bagian atas setiap file.
- Suara sintetis / Keluaran TTS: Berkas WAV termasuk tag'sintetic-voice' di metadata dan pemberitahuan yang jelas di halaman unduh. Disklaimer Audible berada di peta jalan.
- Respon API: termasuk sebuah _ai_generasi: ruas benar dalam setiap respon JSON yang berisi konten yang ditranscriped.
Data pelatihan
- Model dasar (Whisper, MadLAD, Qwen, dll) datang pra-dilatih dari penerbit mereka masing-masing.
- Transkrip Anda TIDAK digunakan untuk melatih model dasar.
- Jika Anda mengoreksi segmen transkrip (icon pensil) atau menandainya salah (icon bendera), DAN Anda telah memilih di dalam /privacy-settings/ (\
- Secara terpisah, Kontributor ditambah audio ke toggle (juga pada /privacy-settings/, juga default) memilih Anda untuk menyumbangkan audio segmen yang Anda benar, dipasangkan dengan teks yang dikoreksi, untuk dataset Lab Suara kami di bawah CC-BY-SA-4.0. Kedua toggles adalah independen å Anda dapat memberikan, baik, maupun.
- Audio yang Anda upload dihapus dalam waktu 24 jam melalui pembersihan_uploads cron those loaded for ocped
Akurasi dan kesalahan
Transkripsi AI tidak sempurna. Tingkat kesalahan Word bervariasi dengan aksen speaker, kualitas audio, bahasa, dan domain kosa kata. Untuk penggunaan kritis ( industri medis, pengaturan) verifikasi terhadap audio asli. Tanda bangku publik kami berada di /models/.
Pertanyaan kepatuhan
Untuk UU EU AI, PDPR, atau pertanyaan kepatuhan lainnya: hello@stt.ai atau menggunakan formulir kontak.
Terakhir diperbarui: 2026-04-26.