AI Beleid & Transparantie

Welke AI gebruiken we, waar het draait, en hoe we voldoen aan de openbaarmakingsvereisten (EU AI Act Article 50, effectief 2026-08-02).

TL;DR

  • Alle transcripten zijn AI-gegenereerd. Elke uitvoer heeft een machine leesbare openbaarmaking.
  • Alle AI draait op onze eigen GPU. Wij sturen uw audio of tekst NIET naar OpenAI, Antropic, Google of een derde partij LLM API.
  • We trainen GEEN basismodellen op uw transcripten. Alleen een opt-in fine-tune gebruikt correcties die u expliciet maakt.
  • Synthetische stemklonen (TTS) worden duidelijk aangeduid als AI-gegenereerd in bestandsnaam, metadata en op de pagina.

Modellen die we gebruiken

ModelGebruikt voorLicentieLoopt op
Whisper large-v3-turbo (faster-whisper)Transcriptie (standaard)MITOnze GPU
STT.ai Enhanced (custom fine-tune)Beschrijving (betaald plan)MIT (base) / Proprietary (fine-tune weights)Onze GPU
VoskReal-time woordstreamingApache 2.0Onze GPU
SpeechBrain ECAPA-TDNNDiaratie van de luidsprekerApache 2.0Onze GPU
MadLAD-400 3BVertaling (450+ talen)Apache 2.0Onze GPU
Qwen2.5-1.5B (llama.cpp)Samenvatting, analyse, content generation, RAG chatApache 2.0Onze GPU
F5-TTSVoice klonen / tekst-tot-spraakMITOnze GPU
all-MiniLM-L6-v2Inbeddingen voor RAG-zoekopdrachtApache 2.0Onze GPU

We bellen niet OpenAI, Anthropic, Google Cloud, of een derde-partij LLM API voor een functie. Elk model hierboven draait op hardware die we bezitten en bedienen. De enige externe AI-service die we gebruiken is translatapi.ai (ook Muddy Holdings) voor het vertalen van UI strings.Dit nooit raakt uw getranscribeerde inhoud.

Hoe we de AI-generatie onthullen

  • Transcript HTML pagina's: <metanaam=\ bevatten
  • Uitvoer van teksten (TXT, SRT, VTT, JSON, CSV, DOCX, PDF): een 'AI-generated transcript' header regel bovenaan elk bestand.
  • Synthetische spraak / TTS-uitvoer: WAV-bestanden bevatten een'synthetische-stem'-tag in metadata en een duidelijke mededeling op de downloadpagina. Hoorbare disclaimer staat op de routekaart.
  • API-antwoorden: een _ai_generated: waar veld in elke JSON-respons die transcribed content bevat.

Opleidingsgegevens

  • Basismodellen (Whisper, MadLAD, Qwen, enz.) komen vooraf bij hun respectieve uitgevers. We gebruiken ze als schipper.
  • Uw transcripten worden NIET gebruikt om basismodellen te trainen.
  • Als je een transcript segment corrigeert (het potloodpictogram) of het incorrect markeert (het vlagpictogram), EN je hebt gekozen bij /privacy-instellingen/ (\
  • Apart, de Contribute correcties plus audio aan Voice Lab toggle (ook bij /privacy-instellingen/, ook default off) opteert u in het bijdragen van de audio van segmenten die u correct, gekoppeld met de gecorrigeerde tekst, aan onze Voice Lab dataset onder CC-BY-SA-4.0. De twee schakels zijn onafhankelijk
  • Audio die u uploadt wordt verwijderd binnen 24 uur via de cleanup_uploads cron

Nauwkeurigheid en fouten

AI transcriptie is niet perfect. Word foutpercentages variëren door speaker accent, audio-kwaliteit, taal, en domein woordenschat. Voor kritisch gebruik (juridisch, medisch, gereguleerde industrieën) controleren tegen de oorspronkelijke audio. Onze publieke WER benchmarks per model zijn op /models/.

Nalevingsvraagstukken

Voor de EU-AI-wet, AVG of andere nalevingskwesties: hello@stt.ai of gebruik de contactformulier.

Laatst bijgewerkt: 2026-04-26.