AI politika eta gardentasuna
Zer da AI erabiltzen duguna, non exekutatzen den eta nola betetzen dugun informazioa emateko betebeharrak (Europar Batasuneko AI Legearen 50. artikulua, 2026-08-02an indarrean).
TL;DR
- Transkribapen guztiak AI-k sortzen ditu. Irteera bakoitzak makina irakurgai bat du.
- AI guztiak gure GPU propioan exekutatzen dira. Ez dugu zure audioa edo testua OpenAI, Anthropic, Google edo beste edozein LLM API-ra bidaltzen.
- EZ ditugu oinarrizko ereduak zure transkribapenetan entrenatzen. Soilik aukeratutako doikuntzak erabiltzen ditu zuk esplizituki egiten dituzun zuzenketak.
- Ahots sintetikoaren klonak (TTS) AI-k sortutakoak bezala etiketatzen dira fitxategi-izenetan, metadatuetan eta orrialdean.
Erabili ditugun ereduak
| Modeloa | Honi erabilia | Lizentzia | Exekutatzen ari da |
|---|---|---|---|
| Whisper large-v3-turbo (faster-whisper) | Transkripzioa (lehenetsia) | MIT | Gure GPUa |
| STT.ai Enhanced (custom fine-tune) | Transkribapena (ordainpeko planak) | MIT (base) / Proprietary (fine-tune weights) | Gure GPUa |
| Vosk | Denbora errealeko hitz-fluxua | Apache 2.0 | Gure GPUa |
| SpeechBrain ECAPA-TDNN | Ahoskariaren diarizazioa | Apache 2.0 | Gure GPUa |
| MadLAD-400 3B | Itzulpena (450+ hizkuntza) | Apache 2.0 | Gure GPUa |
| Qwen2.5-1.5B (llama.cpp) | Laburpena, analisia, edukien sorkuntza, RAG berriketa | Apache 2.0 | Gure GPUa |
| F5-TTS | Ahots klonaketa / testua hizketan | MIT | Gure GPUa |
| all-MiniLM-L6-v2 | RAG bilaketaren kapsulazioak | Apache 2.0 | Gure GPUa |
Ez dugu OpenAI, Anthropic, Google Cloud edo beste edozein LLM API deitzen, ezta bestelakorik ere. Goiko modelo guztiak gure hardwarean exekutatzen dira. Kanpoko AI zerbitzu bakarra translateapi.ai da (Muddy Holdings ere bai) UI kateak itzultzeko. Ez du inoiz zure transkribatutako edukia ukitzen.
Nola azaltzen dugu AI sorkuntza
- Transkribatu HTML orriak: <meta name=\> barnean
- Testu esportazioak (TXT, SRT, VTT, JSON, CSV, DOCX, PDF): 'AI-k sortutako transkribapena' goiburu-lerroa sartu fitxategi bakoitzaren goialdean.
- Ahots sintetikoa / TTS irteera: WAV fitxategiek 'ahots sintetikoa' etiketa metadatuetan dute eta jakinarazpen argi bat deskarga-orrian. Eragozpen entzungarria bide-orriaren gainean dago.
- API erantzunak: _ai_generated: true eremua txertatzen du eduki transkribatua duen JSON erantzun guztietan.
Entrenamendu-datuak
- Oinarrizko ereduak (Whisper, MadLAD, Qwen, etab.) beren argitaletxeen aldetik prestatuta datoz. Bidali bezala erabiltzen ditugu.
- Zure transkribapenak EZ dira oinarrizko modeloak entrenatzeko erabiltzen.
- Transkribapen segmentu bat zuzentzen baduzu (lapis ikonoa) edo okerra dela markatzen baduzu (banderak ikonoa), ETA /privacy-settings/ (\
- Bestetik, Egin ekarpena zuzenketei eta audioari Ahots-laborategian txandakatzaileak (/privacy-settings/-en ere badago, lehenespenez desgaituta ere badago) aukeratzen du zuzentzen dituzun segmentuen audioa, zuzendutako testuarekin batera, gure Ahots-laborategiko datu-multzoan CC-BY-SA-4.0 lizentziapean partekatzea. Bi txandakatzaileak independenteak dira: bat, biak edo biak ematea aukera dezakezu.
- Igotzen duzun audioa 24 orduren buruan ezabatu egiten da cleanup_uploads cron-en bidez — \ aukeratu ez baduzu
Zehaztasuna eta erroreak
AI transkribapena ez da perfektua. Hitzen errore-tasak aldakorrak dira hiztunaren ahotsaren, audio-kalitatearen, hizkuntzaren eta domeinuaren hiztegiaren arabera. Erabilera kritikoetarako (legezkoa, medikoa, industria arautuak) jatorrizko audioarekin egiaztatu. Gure WER erreferentzia publikoak modelo bakoitzeko honakoak dira: /models/.
Konformitateari buruzko galderak
EU AI Act, GDPR edo bestelako betekizunei buruzko galderei erantzuteko: hello@stt.ai edo erabili kontaktu-inprimakia.
Azken eguneratzea: 2026-04-26.