Politika in preglednost AI

Kaj uporabljamo, kje teče in kako izpolnjujemo zahteve za razkritje (člen 50 zakona EU AI, ki velja 2026–08-02).

TL;DR

  • Vsi zapisi so pridobljeni z AI, vsak izhod pa ima strojno čitljivo razkritje.
  • Vsi AI teče na lasten GPU. NE pošiljamo vašega zvoka ali besedila OpenAI, Antropic, Google ali nobene tretje stranke LLM API.
  • NE treniramo baznih modelov na vaših prepisih. Samo opt-in-tone uporablja popravke, ki jih izrecno naredite.
  • Sintetični glasovni kloni (TTS) so jasno označeni kot AI generirani v datoteki, metapodatki in na strani.

Modeli, ki jih uporabljamo

VzorecUporablja se zaLicencaTeče naprej
Whisper large-v3-turbo (faster-whisper)Transcription (privzeto)MITNaš GPU
STT.ai Enhanced (custom fine-tune)Prepis (plačani načrti)MIT (base) / Proprietary (fine-tune weights)Naš GPU
VoskRealnočasovno streaming besedApache 2.0Naš GPU
SpeechBrain ECAPA-TDNNDiarizacija govornikaApache 2.0Naš GPU
MadLAD-400 3BPrevod (450+ jezikov)Apache 2.0Naš GPU
Qwen2.5-1.5B (llama.cpp)Povzetek, analiza, ustvarjanje vsebin, RAG klepetnikApache 2.0Naš GPU
F5-TTSGlasovna klonacija / besedilaMITNaš GPU
all-MiniLM-L6-v2Vgrajena vgradnja za iskanje RAGApache 2.0Naš GPU

Ne kličemo OpenAI, Antropic, Google Cloud ali nobene tretje stranke LLM API za katero koli funkcijo. Vsak model zgoraj teče na strojni stroji, ki jo lastnimo in delujemo. Edini zunanji AI storitev, ki jo uporabljamo, je translateapi.ai (tudi Muddy Holdings) za prevajanje nizov UI – to nikoli ne dotakne vaše transcribirane vsebine.

Kako razkrivamo generacijo AI

  • Strani Transcript HTML: vključi < meta name=\
  • Izvoz besedila (TXT, SRT, VTT, JSON, CSV, DOCX, PDF): Vključi „AI-generiran prepis“ na vrhu vsake datoteke.
  • Sintetični glas / TTS izhod: Datoteke WAV vključujejo oznako "sintetik-voice" v metapodatke in jasno obvestilo na strani za prenos. Zvočno odpoved je na načrtu.
  • Odgovori API: vključi _ai_generated: pravo polje v vsak odgovor JSON, ki vsebuje transkriptirano vsebino.

Podatki o usposabljanju

  • Osnovni modeli (Whisper, MadLAD, Qwen itd.) so vnaprej izurjeni od njihovih založnikov. Uporabljamo jih kot ladje.
  • Vaši zapisi niso uporabljeni za usposabljanje modelov baze.
  • Če popravite segment transkripta (ikona svinčnika) ali ga označite nepravilno (ikona zastave), IN ste se odločili na / nastavitvah privatizacije / (\
  • Posebno vas popravki prispevka in zvočni lab preklapljač (tudi na /privacy-settings /, tudi privzeto off) izbirajo pri prispevanju avdio segmentov, ki jih pravilno popravljate, v paru s popravljenim besedilom, v naš glasovni lab podatkovni niz pod CC-BY-SA-4.0. Dva preklopnika so neodvisna – lahko odobrite bodisi oboje, bodisi ne.
  • Zvok, ki ga naložite, se izbriše v 24 urah prek čistilnice_uploads cron – POZARJENO, da ste se odločili \

Natančnost in napake

AI transkripcija ni popolna. Stopnje besednih napak se razlikujejo glede na naglas zvočnika, kakovost avdio, jezik in domeno besednjaka. Za kritično uporabo (legalno, medicinsko, regulirano industrijo) preverite proti izvirnemu zvoku. Naša javna merila WER na model so na /models/.

Vprašanja glede skladnosti

Za akt EU o II, GDPR ali druga vprašanja o skladnosti: hello@stt.ai ali uporabite kontaktni obrazec.

Zadnje posodobljeno: 2026-04-26.