AI Policy & Transparency

AI anu urang anggo, dimana éta dijalankeun, sareng kumaha urang ngalaksanakeun sarat kabuka (EU AI Act Artikel 50, efektif 2026-08-02).

TL;DR

  • Sagala transkripsi dihasilkeun ku AI. Satiap hasilna ngandung katerangan anu bisa dibaca ku mesin.
  • Sadaya AI dijalankeun dina GPU urang sorangan. Kami NON ngirim audio atanapi teks anjeun ka OpenAI, Anthropic, Google, atanapi API LLM pihak katilu naon waé.
  • Kami NON-latih model basis dina transcript anjeun. Ngan hiji opt-in fine-tune ngagunakeun panyesuaian anjeun explicitly nyieun.
  • Synthetic voice clones (TTS) jelas dilabelkeun salaku AI-generated dina nami file, metadata, sareng dina halaman.

Model sing kita gunakake

ModelDigunakaké kanggoLisensiDijalankan
Whisper large-v3-turbo (faster-whisper)Transkripsi (piawai)MITGPU kita
STT.ai Enhanced (custom fine-tune)Transkripsi (rencana bayar)MIT (base) / Proprietary (fine-tune weights)GPU kita
VoskReal-time word streamingApache 2.0GPU kita
SpeechBrain ECAPA-TDNNSpeaker diarizationApache 2.0GPU kita
MadLAD-400 3BTerjemah (450+ basa)Apache 2.0GPU kita
Qwen2.5-1.5B (llama.cpp)Ringkasan, analisis, produksi isi, RAG chattingApache 2.0GPU kita
F5-TTSKloning swara / teks-ka-wacaMITGPU kita
all-MiniLM-L6-v2Penyaring kanggo pencarian RAGApache 2.0GPU kita

Kami henteu ngahubungi OpenAI, Anthropic, Google Cloud, atanapi LLM API pihak katilu pikeun fitur naon waé. Satiap model di luhur dijalankeun dina perkakas anu urang gaduh sareng operasi. Sahiji-hijina jasa AI luar anu urang anggo nyaéta translateapi.ai (sareng Muddy Holdings) pikeun ngawaskeun string UI - ieu henteu kantos nyababkeun isi anu ditransliterasikeun.

Cara kita nyathet generasi AI

  • Halaman HTML: include <meta name=\
  • Eksport teks (TXT, SRT, VTT, JSON, CSV, DOCX, PDF): ngandung 'AI-generated transcript' baris pangungkeman di luhur sakabéh berkas.
  • Suara sintetik / TTS output: Berkas WAV ngandung tag'synthetic-voice' dina metadata sarta peringatan anu jelas dina halaman ngundeur. Disclaimer anu bisa didengarkeun aya dina roadmap.
  • Jawaban API: ngawengku _ai_generated:: true medan dina saben balasan JSON nu ngandung isi anu ditranskripsikeun.

Data latihan

  • Model dasar (Whisper, MadLAD, Qwen, jsb) datangna dilatih ti penerbitna. Kami nganggona kaya-kaya diangkut.
  • Transkripsi sampeyan ora digunakake kanggo nglatih model basis.
  • Yen sampeyan ngaresiki segmen transcript (gambar pensil) utawa nyathet salah (gambar bendera), lan sampeyan wis milih ing /privacy-settings/ (\
  • Sacara mandiri, tombol Kontribusi panyebut plus audio ka Lab Suara (di /privacy-settings/ ogé, ogé di-off sacara standar) milih anjeun pikeun ngakontribusikeun audio segmen anu anjeun panyebut, dibarengan ku teks anu dipésér, ka dataset Lab Suara kami di handapeun CC-BY-SA-4.0. Dua tombol ieu mandiri — anjeun bisa masihan salah sahiji, kadua, atawa teu aya.
  • Audio sing diunggah bakal dipateni sajrone 24 jam liwat cleanup_uploads cron — KABEH sampeyan ora milih kanggo \

Ketepatan lan kesalahan

AI transcription ora sampurna. Kasalahan tembung tingkat beda-beda dening speaker accent, kualitas audio, basa, lan kosakata domain. Kanggo panggunaan kritis (legal, medis, industri diatur) verifikasi ing audio asli. Benchmarks WER umum kita saben model ing /models/.

Takon

Kanggo EU AI Act, GDPR, utawa pitakonan adhedhasar liyane: hello@stt.ai utawa gunakake formulir kontak.

Diperbarui: 2026-04-26.