AI politika eta gardentasuna

Zer da AI erabiltzen duguna, non exekutatzen den eta nola betetzen dugun informazioa emateko betebeharrak (Europar Batasuneko AI Legearen 50. artikulua, 2026-08-02an indarrean).

TL;DR

  • Transkribapen guztiak AI-k sortzen ditu. Irteera bakoitzak makina irakurgai bat du.
  • AI guztiak gure GPU propioan exekutatzen dira. Ez dugu zure audioa edo testua OpenAI, Anthropic, Google edo beste edozein LLM API-ra bidaltzen.
  • EZ ditugu oinarrizko ereduak zure transkribapenetan entrenatzen. Soilik aukeratutako doikuntzak erabiltzen ditu zuk esplizituki egiten dituzun zuzenketak.
  • Ahots sintetikoaren klonak (TTS) AI-k sortutakoak bezala etiketatzen dira fitxategi-izenetan, metadatuetan eta orrialdean.

Erabili ditugun ereduak

ModeloaHoni erabiliaLizentziaExekutatzen ari da
Whisper large-v3-turbo (faster-whisper)Transkripzioa (lehenetsia)MITGure GPUa
STT.ai Enhanced (custom fine-tune)Transkribapena (ordainpeko planak)MIT (base) / Proprietary (fine-tune weights)Gure GPUa
VoskDenbora errealeko hitz-fluxuaApache 2.0Gure GPUa
SpeechBrain ECAPA-TDNNAhoskariaren diarizazioaApache 2.0Gure GPUa
MadLAD-400 3BItzulpena (450+ hizkuntza)Apache 2.0Gure GPUa
Qwen2.5-1.5B (llama.cpp)Laburpena, analisia, edukien sorkuntza, RAG berriketaApache 2.0Gure GPUa
F5-TTSAhots klonaketa / testua hizketanMITGure GPUa
all-MiniLM-L6-v2RAG bilaketaren kapsulazioakApache 2.0Gure GPUa

Ez dugu OpenAI, Anthropic, Google Cloud edo beste edozein LLM API deitzen, ezta bestelakorik ere. Goiko modelo guztiak gure hardwarean exekutatzen dira. Kanpoko AI zerbitzu bakarra translateapi.ai da (Muddy Holdings ere bai) UI kateak itzultzeko. Ez du inoiz zure transkribatutako edukia ukitzen.

Nola azaltzen dugu AI sorkuntza

  • Transkribatu HTML orriak: <meta name=\> barnean
  • Testu esportazioak (TXT, SRT, VTT, JSON, CSV, DOCX, PDF): 'AI-k sortutako transkribapena' goiburu-lerroa sartu fitxategi bakoitzaren goialdean.
  • Ahots sintetikoa / TTS irteera: WAV fitxategiek 'ahots sintetikoa' etiketa metadatuetan dute eta jakinarazpen argi bat deskarga-orrian. Eragozpen entzungarria bide-orriaren gainean dago.
  • API erantzunak: _ai_generated: true eremua txertatzen du eduki transkribatua duen JSON erantzun guztietan.

Entrenamendu-datuak

  • Oinarrizko ereduak (Whisper, MadLAD, Qwen, etab.) beren argitaletxeen aldetik prestatuta datoz. Bidali bezala erabiltzen ditugu.
  • Zure transkribapenak EZ dira oinarrizko modeloak entrenatzeko erabiltzen.
  • Transkribapen segmentu bat zuzentzen baduzu (lapis ikonoa) edo okerra dela markatzen baduzu (banderak ikonoa), ETA /privacy-settings/ (\
  • Bestetik, Egin ekarpena zuzenketei eta audioari Ahots-laborategian txandakatzaileak (/privacy-settings/-en ere badago, lehenespenez desgaituta ere badago) aukeratzen du zuzentzen dituzun segmentuen audioa, zuzendutako testuarekin batera, gure Ahots-laborategiko datu-multzoan CC-BY-SA-4.0 lizentziapean partekatzea. Bi txandakatzaileak independenteak dira: bat, biak edo biak ematea aukera dezakezu.
  • Igotzen duzun audioa 24 orduren buruan ezabatu egiten da cleanup_uploads cron-en bidez — \ aukeratu ez baduzu

Zehaztasuna eta erroreak

AI transkribapena ez da perfektua. Hitzen errore-tasak aldakorrak dira hiztunaren ahotsaren, audio-kalitatearen, hizkuntzaren eta domeinuaren hiztegiaren arabera. Erabilera kritikoetarako (legezkoa, medikoa, industria arautuak) jatorrizko audioarekin egiaztatu. Gure WER erreferentzia publikoak modelo bakoitzeko honakoak dira: /models/.

Konformitateari buruzko galderak

EU AI Act, GDPR edo bestelako betekizunei buruzko galderei erantzuteko: hello@stt.ai edo erabili kontaktu-inprimakia.

Azken eguneratzea: 2026-04-26.