Politika a transparentnost AI

Co používáme, kam běžíme, a jak dodržujeme požadavky na zveřejňování informací (článek 50 zákona EU o ochraně osobních údajů, s účinností 2026-08-02).

TL;DR

  • Všechny přepisy jsou vytvořené AI. Každý výstup nese strojově čitelné odhalení.
  • Všechny AI běží na našem vlastním GPU. Neposíláme váš zvuk nebo text na OpenAI, Antropic, Google, nebo žádné třetí strany LLM API.
  • My neškolíme základní modely na vašem přepisu. Pouze opt-in fine-tune používá opravy, které výslovně provést.
  • Syntetické hlasové klony (TTS) jsou jasně označeny jako AI generované v názvu souboru, metadat a na stránce.

Modely, které používáme

VzorPoužívá se proLicenceBěží dál.
Whisper large-v3-turbo (faster-whisper)Transkripce (přednastaveno)MITNaše GPU
STT.ai Enhanced (custom fine-tune)Transkripce (placené plány)MIT (base) / Proprietary (fine-tune weights)Naše GPU
VoskStreamování slov v reálném časeApache 2.0Naše GPU
SpeechBrain ECAPA-TDNNDiarizace reproduktorůApache 2.0Naše GPU
MadLAD-400 3BPřeklady (450+ jazyky)Apache 2.0Naše GPU
Qwen2.5-1.5B (llama.cpp)Shrnutí, analýza, tvorba obsahu, chat RAGApache 2.0Naše GPU
F5-TTSKlonování hlasu / text-to-speechMITNaše GPU
all-MiniLM-L6-v2Vkládání do vyhledávání RAGApache 2.0Naše GPU

Nenazýváme OpenAI, Antropic, Google Cloud, nebo žádné třetí strany LLM API pro jakoukoli funkci. Každý výše uvedený model běží na hardware, které vlastníme a provozujeme. Jedinou externí AI službu používáme je translatapi.ai (také Muddy Holdings) pro překlad UI řetězců? To se nikdy nedotkne vašeho přepsaného obsahu.

Jak odhalíme generaci AI

  • Transcript HTML stránky: zahrnovat <meta name=\
  • Text export (TXT, SRT, VTT, JSON, CSV, DOCX, PDF): v horní části každého souboru obsahuje záhlaví 'AI-generovaný přepis'.
  • Syntetický hlas / výstup TTS: WAV soubory obsahují'syntetický-hlasové' tag v metadatech a jasné upozornění na stránce stahování. Zvučné vyloučení odpovědnosti je na plánu.
  • Odpovědi API: obsahovat _ai_genered: true field v každé JSON odpovědi, která obsahuje transcripted obsah.

Údaje o odborné přípravě

  • Základní modely (Whisper, MadLAD, Qwen, atd.) přicházejí předem vyškoleni od jejich příslušných vydavatelů. Používáme je jako-lodí.
  • Vaše přepisy nejsou zvyklé trénovat základní modely.
  • Pokud opravíte ikonu (ikonu tužky) nebo ji označíte za nesprávnou (ikonu vlajky), a zvolili jste si ji v /privacy-setings/ (\
  • Samostatně, Příspěvkové opravy plus audio do hlasové laboratoře přepnout (také na /privacy-settings /, také default off) se rozhodnete přispět zvuk segmentů, které jste opravili, spárovali s opraveným textem, na náš Voice Lab soubor pod CC-BY-SA-4. Dva přepínače jsou nezávislé, můžete udělit buď obojí, nebo ani jedno.
  • Audio, které nahrajete, je smazáno do 24 hodin prostřednictvím cleakup_uploads cron UNLESS, které jste zvolili do \

Přesnost a chyby

Transkripce AI není perfektní. Rychlosti chyb slov se liší podle reproduktorů akcent, kvalita zvuku, jazyk, a doména slovní zásoba. Pro kritické použití (legální, lékařský, regulovaný průmysl) ověřit proti původnímu zvuku. Naše veřejné WER standardy na model jsou na /models/.

Otázky týkající se souladu

Pro AI zákon, GDPR nebo jiné otázky týkající se dodržování předpisů: hello@stt.ai nebo kontaktní formulář.

Poslední aktualizace: 2026-04-26.