Libre expresión para texto en línea

Convierte voz a texto con transcripción con IA. Sube archivos de audio, graba desde tu micrófono o pega una URL. Más de 100 idiomas, más de 10 modelos, más del 98% de precisión.

Funciona con audio y vídeo de acceso público. El contenido protegido por DRM no es compatible.

Actualizar para mejorar
Transcripciones privadas
Charla con transcripción
Desbloquear con Pro →
Soltar archivo aquí o haga clic para navegar
MP3, WAV, M4A, FLAC, MP4, MKV, MOV, WebM — hasta 2 GB
Actualizar para mejorar
Transcripciones privadas
Charla con transcripción
Desbloquear con Pro →
Actualizar para mejorar
Grabación: 0:00
En tiempo real Vosk (instante)
Mejorado Susurro (exacto)
Enlaces públicos: 24h, sólo texto · Inscríbete para 7d + audio · Pro para enlaces privados

Discurso en tiempo real al texto. IA corrige automáticamente mientras habla — la precisión mejora con un discurso más largo.

Pon a prueba tu micrófono primero
❤️ ¡Díselo a tus amigos!
Has usado tus transcripciones gratis.

Inscríbete gratis para obtener 600 minutos, o actualizar desde $5/mes por miles más.

10 min/día gratis 600 min gratis con registro Sin tarjeta de crédito Cifrado
Inscríbete gratis →

1. Suba su grabación de voz

Suba un archivo de audio o video, pegue una URL o grabe desde su micrófono.

2. La IA convierte voz a texto

Elija entre más de 10 modelos de IA. Incluye detección de hablantes e idioma automática.

3. Exporte su transcripción

Descargue en 6 formatos. Comparta enlaces de transcripción con reproducción de audio.

Formatos de entrada de voz compatibles

Casos de uso de voz a texto

¿Listo para convertir voz a texto?

Comenzar gratis →

Preguntas frecuentes

El discurso al texto (también llamado reconocimiento de voz o ASR) convierte automáticamente el audio hablado en palabras escritas. STT.ai ejecuta su grabación a través de un modelo de IA que escucha el audio y emite texto editable con marcas de tiempo y etiquetas de altavoz, sin necesidad de escribir.

Un modelo acústico mapea la forma de onda sonora a fonemas, luego un modelo de lenguaje ensambla aquellos en las palabras y puntuación más probables. STT.ai hace esto en GPU con modelos como Whisper Large V3 y NVIDIA Canary, por lo que una grabación de una hora se hace generalmente en 2-3 minutos.

Sí. Cada visitante tiene 600 minutos gratis para empezar sin necesidad de registrarse para su primer archivo. Los planes pagados comienzan a $5/mes y añaden archivos más largos, transcripciones privadas y procesamiento de prioridad.

En el discurso limpio nuestros mejores modelos alcanzan una precisión del 95-97% (una tasa de error de palabra del 3-5% en los puntos de referencia). La precisión cae con el ruido de fondo, acentos pesados, crosstalk o audio de baja frecuencia, usando un micrófono decente y una habitación tranquila marca la mayor diferencia.

Sí. Habla en tu micrófono y STT.ai transmite la transcripción en vivo a través de la herramienta de transcripción en vivo. También puedes subir una grabación terminada para la transcripción por lotes si no la necesitas palabra por palabra mientras hablas.

STT.ai reconoce más de 100 idiomas y autodetecta el idioma hablado para la mayoría de audio. También puede configurar el idioma manualmente para un pequeño levantamiento de precisión, y las grabaciones en lenguaje mixto se manejan cambiando el clip medio.

Sí. La diarización del altavoz etiqueta cada voz (hablador 1, altavoz 2,...) y puede renombrarlos en el editor. Esto funciona en todos los modelos y lenguajes soportados.

STT.ai acepta más de 20 formatos incluyendo MP3, WAV, M4A, FLAC, OGG, MP4, MKV, MOV, WebM y AVI. Salida a TXT, SRT, VTT, DOCX, JSON o PDF.

El discurso al texto transcribe LO que se dijo en palabras; el reconocimiento de voz (identificación del orador) determina la OMS lo dijo. STT.ai hace ambos — transcripción más diarización del altavoz — pero los términos describen diferentes tareas.

Sí. El audio se procesa y elimina por defecto. Los planes Pro añaden cifrado del lado del cliente para que las transcripciones sean ilegibles sin su clave, incluso a STT.ai, y sus datos nunca se utilizan para la formación de modelos sin opt-in explícito.

Sí. STT.ai tiene una API REST con Python y SDKs Node.js más un servidor MCP para Claude y Cursor. El nivel gratuito de API incluye 100 minutos/mes, con facturación por segundo más allá de eso.

Sí. Cada transcripción se abre en un editor integrado donde puede corregir palabras escuchadas erróneamente, renombrar altavoces, ajustar marcas de tiempo y añadir notas. Las ediciones persisten en cada formato de exportación.