Политика и прозрачност на МАИ

Какво използваме, където работи и как спазваме изискванията за разкриване (член 50 от Закона за ЕС за ВИ, който е ефективен от 2026-08-02).

ТЛ;ДР

  • Всички записи са генерирани от АИ.Всички изходи носят машинно четено разкриване.
  • Всички ВИ работи по собствен ГПУ. НЕ изпращаме вашия звук или текст на OpenAI, Антропически, Google, или на всяка трета страна LLM API.
  • Ние не тренираме бази модели на вашите транскрипти. Само един оптимален-в фина-туне използва корекции, които изрично правите.
  • Синтетичните клонинги на гласа (TTS) са ясно етикетирани като AI-генерирани в име на име, метаданни и на страницата.

Модели, които използваме

МоделИзползва се заЛицензацияПродължава.
Whisper large-v3-turbo (faster-whisper)Преписване (по подразбиране)MITНашият ГПУ
STT.ai Enhanced (custom fine-tune)Преписване (платени планове)MIT (base) / Proprietary (fine-tune weights)Нашият ГПУ
VoskРеално време на излъчване на думиApache 2.0Нашият ГПУ
SpeechBrain ECAPA-TDNNДиагностика на оратораApache 2.0Нашият ГПУ
MadLAD-400 3BПревод (450+ езици)Apache 2.0Нашият ГПУ
Qwen2.5-1.5B (llama.cpp)Резюме, анализ, създаване на съдържание, RAG chatApache 2.0Нашият ГПУ
F5-TTSГласово клониране / текст-то-пекMITНашият ГПУ
all-MiniLM-L6-v2Вграждане за търсене на RAGApache 2.0Нашият ГПУ

Ние не наричаме OpenAI, Antropic, Google Cloud, или всяка трета страна LLM API за всяка функция. Всеки модел по-горе работи на хардуер, който притежаваме и работи. Единственият външен AI услуга, която използваме е translateapi.ai (също Muddy Holdings) за превод на UI низове – това никога не докосва транскрибираното ви съдържание.

Как ще разкрием поколението на АИ

  • Текстове за HTML страници: включва <мета име=\
  • Текстов износ (TXT, SRT, VTT, JSON, CSV, DOCX, PDF): Включват главна линия с МА, създадена от AI, в върха на всеки файл.
  • Синтетичен глас / TTS изход: WAV файлове включват "синтезичен глас" в метаданите и ясно известие на страницата за изтегляне. Чувствителното отхвърляне на информация е в картата.
  • API отговори: включва _ai_generated: истинско поле във всеки отговор на JSON, което съдържа транскриптирано съдържание.

Данни за обучението

  • Базови модели (Whisper, MadLAD, Qwen и т.н.) идват предварително обучени от съответните им издатели. Ние ги използваме като кораб.
  • Вашите записи не са използвани за обучение на бази модели.
  • Ако коригирате сегмент на транскрипция (икона на молив) или го маркирате неправилно (икона на знамето), И вие сте избрали в / privacy-settings / (\
  • Отделно, корекциите на вноса плюс аудио за Voice Lab превключване (също в /privacy-settings /, също и по подразбиране изключени) ви избират за допринасяне на аудиото на сегментите, които коректирате, парирани с коригирания текст, към нашия Гласов лабораторен набор данни под CC-BY-SA-4.0. Двете превключватели са независими — можете да предоставите или двете, или нито едното.
  • Аудио, който качвате се изтрива в рамките на 24 часа чрез чистене_uploads cron — без да сте избрали \

Точност и грешки

AI транскрипция не е перфектна. Честотата на грешката на думите варира по акцент, качеството на звука, езика и домейн речник. За критична употреба (правна, медицинска, регулирана индустрия) проверка срещу оригиналния аудио. Нашите обществени WER бенчмаркове на модел са на /models/.

Въпроси за спазване

За ЕС Акт за МАИ, GDPR или други въпроси за съответствие: hello@stt.ai или да използвате формуляр за контакт.

Последно актуализиране: 2026-04-26.