AI-politik og gennemsigtighed

Hvad AI vi bruger, hvor det kører, og hvordan vi overholder oplysningskrav (EU AI Act artikel 50, effektiv 2026-08-02).

TL;DR

  • Alle udskrifter er AI-genererede, og alle udskrifter har en maskinlæsbar afsløring.
  • Alle AI kører på vores egen GPU. Vi sender IKKE din lyd eller tekst til OpenAI, Anthropic, Google eller nogen tredjepart LLM API.
  • Vi træner IKKE basemodeller på dine udskrifter. Kun en opt-in fintune bruger rettelser, du udtrykkeligt foretager.
  • Syntetiske stemme kloner (TTS) er tydeligt mærket som AI-genereret i filnavn, metadata, og på siden.

Modeller vi bruger

ModelAnvendes tilLicensKører videre
Whisper large-v3-turbo (faster-whisper)Transcription (standard)MITVores GPU
STT.ai Enhanced (custom fine-tune)Transcription (betalte planer)MIT (base) / Proprietary (fine-tune weights)Vores GPU
VoskReal- time ordstreamingApache 2.0Vores GPU
SpeechBrain ECAPA-TDNNHøjttalerdiariseringApache 2.0Vores GPU
MadLAD-400 3BOversættelse (450+ sprog)Apache 2.0Vores GPU
Qwen2.5-1.5B (llama.cpp)Oversigt, analyse, indholdsgenerering, RAG chatApache 2.0Vores GPU
F5-TTSStemmekloning / tekst-til-taleMITVores GPU
all-MiniLM-L6-v2Indlejringer til RAG-søgningApache 2.0Vores GPU

Vi kalder ikke OpenAI, Anthropic, Google Cloud eller tredjeparts LLM API for enhver funktion. Hver model ovenfor kører på hardware, vi ejer og oper. Den eneste eksterne AI-tjeneste, vi bruger, er translateapi.ai (også Muddy Holdings) til oversættelse af UI strenge • dette berører aldrig dit transskriberede indhold.

Hvordan vi afslører AI generation

  • Transskript HTML- sider: inkludere <meta name=\
  • Teksteksport (TXT, SRT, VTT, JSON, CSV, DOCX, PDF): omfatter en headerlinje med "AI-genereret udskrift" øverst i hver fil.
  • Syntetisk stemme / TTS output: WAV-filer omfatter et'syntetiske-stemme' mærke i metadata og en klar meddelelse på download-siden. Audible ansvarsfraskrivelse er på køreplanen.
  • API-svar: omfatter en _ai_genereret: sandt felt i hver JSON svar, der indeholder transkristne indhold.

Uddannelsesdata

  • Basemodeller (Whisper, MadLAD, Qwen, etc.) kommer præ-uddannet fra deres respektive udgivere. Vi bruger dem som-afskibet.
  • Dine udskrifter bruges IKKE til at træne basemodeller.
  • Hvis du retter et udskriftssegment (blyant-ikonet) eller markerer det forkert (flagikonet), og du har valgt at bruge /privacy-settings/ (\
  • Separat, Contribute rettelser plus lyd til Voice Lab skifte (også på /privacy-indstillinger /, også standard off) vælger dig i at bidrage lyden af segmenter, du korrekte, parret med den korrigerede tekst, til vores Voice Lab datasæt under CC-BY-SA-4.0. De to toggles er uafhængige • du kan give enten, begge eller ingen af delene.
  • Lyd du uploader slettes inden for 24 timer via cleanup_uploads cron! ULESS du har valgt at \

Nøjagtighed og fejl

AI transskription er ikke perfekt. Word fejlfrekvenser varierer efter højttaler accent, lydkvalitet, sprog og domæne ordforråd. Til kritisk brug (juridisk, medicinsk, reguleret industrier) verificere mod den oprindelige lyd. Vores offentlige WER benchmarks pr model er på /models/.

Spørgsmål om overholdelse

For EU AI-lov, GDPR eller andre compliance-spørgsmål: hello@stt.ai eller kontaktformular.

Sidst opdateret: 2026-04-26.