Tekoälypolitiikka ja avoimuus
Mitä tekoälyä käytämme, missä se toimii ja miten noudatamme julkistamisvaatimuksia (EU AI Act 50 artikla, voimassa 2026-08-02).
TL;DR
- Kaikki dokumentit ovat tekoälyjä. Jokainen ulostulo sisältää koneella luettavan ilmoituksen.
- Kaikki tekoälyt toimivat omalla GPU:llaan. Emme lähetä ääntä tai tekstiä OpenAI:lle, Antropicille, Googlelle tai kolmannen osapuolen LLM API:lle.
- Emme kouluta tukikohtia kirjoituksistasi. Vain opt-in-nouse käyttää korjauksia, joita nimenomaisesti teet.
- Synteettiset äänikloonit (TTS) on selvästi merkitty tekoälyksi, joka on luotu tiedostonimellä, metatiedoilla ja sivulla.
Mallit joita käytämme
| Malli | Käytetty | Lisenssi | Toimii |
|---|---|---|---|
| Whisper large-v3-turbo (faster-whisper) | Transkriptio (oletus) | MIT | GPU:mme |
| STT.ai Enhanced (custom fine-tune) | Transkriptio (maksettu hoito) | MIT (base) / Proprietary (fine-tune weights) | GPU:mme |
| Vosk | Reaaliaikainen sanan suoratoisto | Apache 2.0 | GPU:mme |
| SpeechBrain ECAPA-TDNN | Kaiuttimen diarisointi | Apache 2.0 | GPU:mme |
| MadLAD-400 3B | Kääntäminen (450+ kieltä) | Apache 2.0 | GPU:mme |
| Qwen2.5-1.5B (llama.cpp) | Yhteenveto, analyysi, sisällöntuotanto, RAG-chat | Apache 2.0 | GPU:mme |
| F5-TTS | Äänien kloonaus / tekstistä ääneen | MIT | GPU:mme |
| all-MiniLM-L6-v2 | Liitännät aluetukien hakuun | Apache 2.0 | GPU:mme |
Emme kutsu OpenAI:ta, Antropicia, Google Cloudia tai kolmannen osapuolen LLM API:tä mihinkään toimintoon. Jokainen yllä oleva malli toimii omistamassamme ja käyttämässämme laitteistossa. Ainoa ulkoinen tekoälypalvelu on translatapi.ai (myös Muddy Holdings) UI:n jousien kääntämiseen – tämä ei koskaan koske transscripted-sisältöäsi.
Miten paljastamme tekoälyn sukupolven
- Transscript HTML-sivut: sisältää <meta-nimi=\
- Tekstin vienti (TXT, SRT, VTT, JSON, CSV, DOCX, PDF): Sisällytä jokaisen tiedoston yläosaan AI-tulostettu tekstirivi.
- Synteettinen ääni / TTS-lähtö: WAV -tiedostot sisältävät "synteettisen äänen" tagin metadatassa ja selkeän ilmoituksen lataussivulla. Äänitettä koskeva vastuulauseke on tietueessa.
- API-vastaukset: Sisällytä _ai_luotu: todellinen kenttä jokaiseen JSON-vastaukseen, joka sisältää kirjoitettua sisältöä.
Koulutustiedot
- Perusmallit (Whisper, MadLAD, Qwen jne.) tulevat esikoulutetuilta kustantajilta. Käytämme niitä laivattuina.
- Selostuksiasi EI käytetä tukikohtien mallien kouluttamiseen.
- Jos korjaat transkriptiosegmentin (kynän kuvakkeen) tai merkitset sen virheelliseksi (lippukuvake), JA olet valinnut nimen / yksityisasetukset/ (\
- Erikseen Contribute-korjaukset ja äänentoisto Voice Lab toggle (myös / yksityisasetuksissa/, myös oletus pois päältä) valitsevat sinut antamaan korjattuun tekstiin yhdistettynä korjattujen segmenttien äänentoistoa Voice Lab -aineistoomme CC-BY-SA-4.0 kohdassa. Nämä kaksi taklausta ovat itsenäisiä – voit myöntää joko molempia tai kumpaakaan.
- Ääni jonka lataat poistetaan 24 tunnin kuluessa puhdistus_uploads-kuilun kautta – UNLES-äänenvalitsit \
Tarkkuus ja virheet
Tekoälyn transkriptio ei ole täydellinen. Sanavirheiden määrä vaihtelee puhuja-aksentin, äänenlaadun, kielen ja verkkosanaston mukaan. Kriittistä käyttöä (laillista, lääketieteellistä, säänneltyä teollisuutta) varten varmistamme alkuperäisen äänen suhteen. Julkiset WER-vertailuarvomme mallia kohti ovat /models/.
Noudattamista koskevat kysymykset
EU:n tekoälylain, GDPR:n tai muiden vaatimusten noudattamista koskevien kysymysten osalta: hello@stt.ai tai käytä yhteydenottolomake.
Viimeksi päivitetty: 2026-04-26.