AI Beleid & Transparantie
Welke AI gebruiken we, waar het draait, en hoe we voldoen aan de openbaarmakingsvereisten (EU AI Act Article 50, effectief 2026-08-02).
TL;DR
- Alle transcripten zijn AI-gegenereerd. Elke uitvoer heeft een machine leesbare openbaarmaking.
- Alle AI draait op onze eigen GPU. Wij sturen uw audio of tekst NIET naar OpenAI, Antropic, Google of een derde partij LLM API.
- We trainen GEEN basismodellen op uw transcripten. Alleen een opt-in fine-tune gebruikt correcties die u expliciet maakt.
- Synthetische stemklonen (TTS) worden duidelijk aangeduid als AI-gegenereerd in bestandsnaam, metadata en op de pagina.
Modellen die we gebruiken
| Model | Gebruikt voor | Licentie | Loopt op |
|---|---|---|---|
| Whisper large-v3-turbo (faster-whisper) | Transcriptie (standaard) | MIT | Onze GPU |
| STT.ai Enhanced (custom fine-tune) | Beschrijving (betaald plan) | MIT (base) / Proprietary (fine-tune weights) | Onze GPU |
| Vosk | Real-time woordstreaming | Apache 2.0 | Onze GPU |
| SpeechBrain ECAPA-TDNN | Diaratie van de luidspreker | Apache 2.0 | Onze GPU |
| MadLAD-400 3B | Vertaling (450+ talen) | Apache 2.0 | Onze GPU |
| Qwen2.5-1.5B (llama.cpp) | Samenvatting, analyse, content generation, RAG chat | Apache 2.0 | Onze GPU |
| F5-TTS | Voice klonen / tekst-tot-spraak | MIT | Onze GPU |
| all-MiniLM-L6-v2 | Inbeddingen voor RAG-zoekopdracht | Apache 2.0 | Onze GPU |
We bellen niet OpenAI, Anthropic, Google Cloud, of een derde-partij LLM API voor een functie. Elk model hierboven draait op hardware die we bezitten en bedienen. De enige externe AI-service die we gebruiken is translatapi.ai (ook Muddy Holdings) voor het vertalen van UI strings.Dit nooit raakt uw getranscribeerde inhoud.
Hoe we de AI-generatie onthullen
- Transcript HTML pagina's: <metanaam=\ bevatten
- Uitvoer van teksten (TXT, SRT, VTT, JSON, CSV, DOCX, PDF): een 'AI-generated transcript' header regel bovenaan elk bestand.
- Synthetische spraak / TTS-uitvoer: WAV-bestanden bevatten een'synthetische-stem'-tag in metadata en een duidelijke mededeling op de downloadpagina. Hoorbare disclaimer staat op de routekaart.
- API-antwoorden: een _ai_generated: waar veld in elke JSON-respons die transcribed content bevat.
Opleidingsgegevens
- Basismodellen (Whisper, MadLAD, Qwen, enz.) komen vooraf bij hun respectieve uitgevers. We gebruiken ze als schipper.
- Uw transcripten worden NIET gebruikt om basismodellen te trainen.
- Als je een transcript segment corrigeert (het potloodpictogram) of het incorrect markeert (het vlagpictogram), EN je hebt gekozen bij /privacy-instellingen/ (\
- Apart, de Contribute correcties plus audio aan Voice Lab toggle (ook bij /privacy-instellingen/, ook default off) opteert u in het bijdragen van de audio van segmenten die u correct, gekoppeld met de gecorrigeerde tekst, aan onze Voice Lab dataset onder CC-BY-SA-4.0. De twee schakels zijn onafhankelijk
- Audio die u uploadt wordt verwijderd binnen 24 uur via de cleanup_uploads cron
Nauwkeurigheid en fouten
AI transcriptie is niet perfect. Word foutpercentages variëren door speaker accent, audio-kwaliteit, taal, en domein woordenschat. Voor kritisch gebruik (juridisch, medisch, gereguleerde industrieën) controleren tegen de oorspronkelijke audio. Onze publieke WER benchmarks per model zijn op /models/.
Nalevingsvraagstukken
Voor de EU-AI-wet, AVG of andere nalevingskwesties: hello@stt.ai of gebruik de contactformulier.
Laatst bijgewerkt: 2026-04-26.