Politika a transparentnost AI
Co používáme, kam běžíme, a jak dodržujeme požadavky na zveřejňování informací (článek 50 zákona EU o ochraně osobních údajů, s účinností 2026-08-02).
TL;DR
- Všechny přepisy jsou vytvořené AI. Každý výstup nese strojově čitelné odhalení.
- Všechny AI běží na našem vlastním GPU. Neposíláme váš zvuk nebo text na OpenAI, Antropic, Google, nebo žádné třetí strany LLM API.
- My neškolíme základní modely na vašem přepisu. Pouze opt-in fine-tune používá opravy, které výslovně provést.
- Syntetické hlasové klony (TTS) jsou jasně označeny jako AI generované v názvu souboru, metadat a na stránce.
Modely, které používáme
| Vzor | Používá se pro | Licence | Běží dál. |
|---|---|---|---|
| Whisper large-v3-turbo (faster-whisper) | Transkripce (přednastaveno) | MIT | Naše GPU |
| STT.ai Enhanced (custom fine-tune) | Transkripce (placené plány) | MIT (base) / Proprietary (fine-tune weights) | Naše GPU |
| Vosk | Streamování slov v reálném čase | Apache 2.0 | Naše GPU |
| SpeechBrain ECAPA-TDNN | Diarizace reproduktorů | Apache 2.0 | Naše GPU |
| MadLAD-400 3B | Překlady (450+ jazyky) | Apache 2.0 | Naše GPU |
| Qwen2.5-1.5B (llama.cpp) | Shrnutí, analýza, tvorba obsahu, chat RAG | Apache 2.0 | Naše GPU |
| F5-TTS | Klonování hlasu / text-to-speech | MIT | Naše GPU |
| all-MiniLM-L6-v2 | Vkládání do vyhledávání RAG | Apache 2.0 | Naše GPU |
Nenazýváme OpenAI, Antropic, Google Cloud, nebo žádné třetí strany LLM API pro jakoukoli funkci. Každý výše uvedený model běží na hardware, které vlastníme a provozujeme. Jedinou externí AI službu používáme je translatapi.ai (také Muddy Holdings) pro překlad UI řetězců? To se nikdy nedotkne vašeho přepsaného obsahu.
Jak odhalíme generaci AI
- Transcript HTML stránky: zahrnovat <meta name=\
- Text export (TXT, SRT, VTT, JSON, CSV, DOCX, PDF): v horní části každého souboru obsahuje záhlaví 'AI-generovaný přepis'.
- Syntetický hlas / výstup TTS: WAV soubory obsahují'syntetický-hlasové' tag v metadatech a jasné upozornění na stránce stahování. Zvučné vyloučení odpovědnosti je na plánu.
- Odpovědi API: obsahovat _ai_genered: true field v každé JSON odpovědi, která obsahuje transcripted obsah.
Údaje o odborné přípravě
- Základní modely (Whisper, MadLAD, Qwen, atd.) přicházejí předem vyškoleni od jejich příslušných vydavatelů. Používáme je jako-lodí.
- Vaše přepisy nejsou zvyklé trénovat základní modely.
- Pokud opravíte ikonu (ikonu tužky) nebo ji označíte za nesprávnou (ikonu vlajky), a zvolili jste si ji v /privacy-setings/ (\
- Samostatně, Příspěvkové opravy plus audio do hlasové laboratoře přepnout (také na /privacy-settings /, také default off) se rozhodnete přispět zvuk segmentů, které jste opravili, spárovali s opraveným textem, na náš Voice Lab soubor pod CC-BY-SA-4. Dva přepínače jsou nezávislé, můžete udělit buď obojí, nebo ani jedno.
- Audio, které nahrajete, je smazáno do 24 hodin prostřednictvím cleakup_uploads cron UNLESS, které jste zvolili do \
Přesnost a chyby
Transkripce AI není perfektní. Rychlosti chyb slov se liší podle reproduktorů akcent, kvalita zvuku, jazyk, a doména slovní zásoba. Pro kritické použití (legální, lékařský, regulovaný průmysl) ověřit proti původnímu zvuku. Naše veřejné WER standardy na model jsou na /models/.
Otázky týkající se souladu
Pro AI zákon, GDPR nebo jiné otázky týkající se dodržování předpisů: hello@stt.ai nebo kontaktní formulář.
Poslední aktualizace: 2026-04-26.