Politika in preglednost AI
Kaj uporabljamo, kje teče in kako izpolnjujemo zahteve za razkritje (člen 50 zakona EU AI, ki velja 2026–08-02).
TL;DR
- Vsi zapisi so pridobljeni z AI, vsak izhod pa ima strojno čitljivo razkritje.
- Vsi AI teče na lasten GPU. NE pošiljamo vašega zvoka ali besedila OpenAI, Antropic, Google ali nobene tretje stranke LLM API.
- NE treniramo baznih modelov na vaših prepisih. Samo opt-in-tone uporablja popravke, ki jih izrecno naredite.
- Sintetični glasovni kloni (TTS) so jasno označeni kot AI generirani v datoteki, metapodatki in na strani.
Modeli, ki jih uporabljamo
| Vzorec | Uporablja se za | Licenca | Teče naprej |
|---|---|---|---|
| Whisper large-v3-turbo (faster-whisper) | Transcription (privzeto) | MIT | Naš GPU |
| STT.ai Enhanced (custom fine-tune) | Prepis (plačani načrti) | MIT (base) / Proprietary (fine-tune weights) | Naš GPU |
| Vosk | Realnočasovno streaming besed | Apache 2.0 | Naš GPU |
| SpeechBrain ECAPA-TDNN | Diarizacija govornika | Apache 2.0 | Naš GPU |
| MadLAD-400 3B | Prevod (450+ jezikov) | Apache 2.0 | Naš GPU |
| Qwen2.5-1.5B (llama.cpp) | Povzetek, analiza, ustvarjanje vsebin, RAG klepetnik | Apache 2.0 | Naš GPU |
| F5-TTS | Glasovna klonacija / besedila | MIT | Naš GPU |
| all-MiniLM-L6-v2 | Vgrajena vgradnja za iskanje RAG | Apache 2.0 | Naš GPU |
Ne kličemo OpenAI, Antropic, Google Cloud ali nobene tretje stranke LLM API za katero koli funkcijo. Vsak model zgoraj teče na strojni stroji, ki jo lastnimo in delujemo. Edini zunanji AI storitev, ki jo uporabljamo, je translateapi.ai (tudi Muddy Holdings) za prevajanje nizov UI – to nikoli ne dotakne vaše transcribirane vsebine.
Kako razkrivamo generacijo AI
- Strani Transcript HTML: vključi < meta name=\
- Izvoz besedila (TXT, SRT, VTT, JSON, CSV, DOCX, PDF): Vključi „AI-generiran prepis“ na vrhu vsake datoteke.
- Sintetični glas / TTS izhod: Datoteke WAV vključujejo oznako "sintetik-voice" v metapodatke in jasno obvestilo na strani za prenos. Zvočno odpoved je na načrtu.
- Odgovori API: vključi _ai_generated: pravo polje v vsak odgovor JSON, ki vsebuje transkriptirano vsebino.
Podatki o usposabljanju
- Osnovni modeli (Whisper, MadLAD, Qwen itd.) so vnaprej izurjeni od njihovih založnikov. Uporabljamo jih kot ladje.
- Vaši zapisi niso uporabljeni za usposabljanje modelov baze.
- Če popravite segment transkripta (ikona svinčnika) ali ga označite nepravilno (ikona zastave), IN ste se odločili na / nastavitvah privatizacije / (\
- Posebno vas popravki prispevka in zvočni lab preklapljač (tudi na /privacy-settings /, tudi privzeto off) izbirajo pri prispevanju avdio segmentov, ki jih pravilno popravljate, v paru s popravljenim besedilom, v naš glasovni lab podatkovni niz pod CC-BY-SA-4.0. Dva preklopnika so neodvisna – lahko odobrite bodisi oboje, bodisi ne.
- Zvok, ki ga naložite, se izbriše v 24 urah prek čistilnice_uploads cron – POZARJENO, da ste se odločili \
Natančnost in napake
AI transkripcija ni popolna. Stopnje besednih napak se razlikujejo glede na naglas zvočnika, kakovost avdio, jezik in domeno besednjaka. Za kritično uporabo (legalno, medicinsko, regulirano industrijo) preverite proti izvirnemu zvoku. Naša javna merila WER na model so na /models/.
Vprašanja glede skladnosti
Za akt EU o II, GDPR ali druga vprašanja o skladnosti: hello@stt.ai ali uporabite kontaktni obrazec.
Zadnje posodobljeno: 2026-04-26.