Свободная речь для текста в онлайновом режиме

Преобразовать речь в текст с помощью АИ. Загрузить аудиофайлы, записать из микрофона или вставить URL. 100+ языки, 10+ модели, 98%+ точность.

Работа с общедоступным аудио- и видеозаписями не поддерживается.

Модернизация в целях повышения квалификации
Частный стенограмма
Говорить с стенограммой
Разблокировать с Про →
Сбрасывать файл здесь или щёлкнуть для просмотра
MP3, WAV, M4A, FLAC, MP4, MKV, MOV, WebM — до 2GB
Модернизация в целях повышения квалификации
Частный стенограмма
Говорить с стенограммой
Разблокировать с Про →
Модернизация в целях повышения квалификации
Запись: 0:00
В реальном масштабе времени Воск (мгновенно)
Усовершенствованные Шепот (с точностью)
Ссылка для общественности: 24 ч., только текст · Подписывайся. для 7d + аудио · Про для частных связей

В реальном времени речь в текст. AI автоматически корректирует, как вы говорите — точность улучшается с помощью более длинной речи.

Сначала проверьте микрофон.
❤️ Скажи своим друзьям!
Вы использовали свои бесплатные стенограммы.

Запишитесь бесплатно, чтобы получить 600 минут, или повысить с 5 долл. США в месяц на тысячи других.

10 мин./сутки 600 мин. без регистрации Нет кредитной карты Зашифровано
Запишитесь бесплатно. →

1. Загрузите запись речи

Загрузите аудио- или видеофайл, вставьте URL или запишите с микрофона.

2. ИИ преобразует речь в текст

Выберите из 10+ моделей ИИ. Определение говорящих и автоопределение языка включены.

3. Экспортируйте транскрипт

Скачайте в 6 форматах. Поделитесь ссылками на транскрипт с воспроизведением аудио.

Поддерживаемые форматы речевого ввода

Модели речи в текст

Выберите модель ИИ под ваши нужды — или позвольте нам выбрать лучшую.

Случаи использования речи в текст

Готовы преобразовать речь в текст?

Начать бесплатно →

Часто задаваемые вопросы

Речи к тексту (также называемому распознаванием речи или ASR) автоматически преобразуют звуковую запись в письменные слова. STT.ai запускает вашу запись с помощью модели AI, которая слушает звук и выходы, редактироваемый с помощью тайм-маркеров и лейблов, — не требуется печатать.

Акустическая модель картирует звуковую волну на телефоны, затем языковая модель соединяет их в наиболее вероятные слова и пробту. STT.ai делает это на GPU с моделями, такими как Whisper Large V3 и NVIDIA Canary, так что одночасовая запись обычно производится за 2-3 минуты.

Каждый посетитель получает 600 минут, чтобы начать с того, что не требуется для первого файла.

На чистой речи наши лучшие модели достигают 95 - 97 процентов точности (добавление 3 - 5 процентов ошибок в словах по контрольным параметрам). Точность падает с фоновым шумом, тяжелым акцентом, перекрестным разговором или малобитратным звуком — самое большое значение имеет использование приличного микрофона и тихой комнаты.

Да. Говори в микрофон, и STT.ai транслирует транскрипцию в прямом эфире. Вы также можете загрузить записную запись для записи партии, если она не понадобится по буквам, пока вы говорите.

STT.ai распознает языки 100+ и автоматически обнаруживает разговорный язык для большинства звуков. Вы также можете вручную установить язык для небольшого лифта с точностью, и записи на смешанном языке обрабатываются путем переключения на средний щелчок.

Да. Диааризация спикера обозначает каждый голос (спикер 1, спикер 2,...) и вы можете переименовать его в редакторе. Это работает по каждой поддерживаемой модели и языку.

STT.ai принимает 20+ форматов, включая MP3, WAV, M4A, FLAC, OGG, MP4, MKV, MOV, WebM и AVI. Выход в TXT, SRT, VTT, DOCX, JSON или PDF.

Говорить о текстовых транскрипциях ЧТО было сказано на слова; распознавание голоса (идентификация говорящего) определяет ВОЗ. STT.ai человек делают и то, и другое — транскрипция и диарея, но термины описывают различные задачи.

Да. Аудио обрабатывается и удаляется по умолчанию. Про-планы добавляют шифрование в сторону клиента, так что стенограммы не поддаются прочтению без ключа, даже до STT.ai, и ваши данные никогда не используются для подготовки модели без прямого согласия.

Да. STT.ai имеет REST API с Python и Node.js SDKs плюс сервер MCP для Клода и Курзора. Бесплатный API-ядр включает 100 минут в месяц, с каждой секундой выписки сверх этого.

Да. Каждая запись открывается в встроенном редакторе, где вы можете исправить неправильно слышимые слова, переименовать ораторов, скорректировать время и добавить заметки. Редактирование сохраняется во всех экспортных форматах.