Libre expresión para texto en línea
Convierte voz a texto con transcripción con IA. Sube archivos de audio, graba desde tu micrófono o pega una URL. Más de 100 idiomas, más de 10 modelos, más del 98% de precisión.
1. Suba su grabación de voz
Suba un archivo de audio o video, pegue una URL o grabe desde su micrófono.
2. La IA convierte voz a texto
Elija entre más de 10 modelos de IA. Incluye detección de hablantes e idioma automática.
3. Exporte su transcripción
Descargue en 6 formatos. Comparta enlaces de transcripción con reproducción de audio.
Modelos de voz a texto
Elija el modelo de IA que se adapte a sus necesidades, o déjenos elegir el mejor.
Voz a texto en más de 100 idiomas
Casos de uso de voz a texto
¿Listo para convertir voz a texto?
Comenzar gratis →Preguntas frecuentes
El discurso al texto (también llamado reconocimiento de voz o ASR) convierte automáticamente el audio hablado en palabras escritas. STT.ai ejecuta su grabación a través de un modelo de IA que escucha el audio y emite texto editable con marcas de tiempo y etiquetas de altavoz, sin necesidad de escribir.
Un modelo acústico mapea la forma de onda sonora a fonemas, luego un modelo de lenguaje ensambla aquellos en las palabras y puntuación más probables. STT.ai hace esto en GPU con modelos como Whisper Large V3 y NVIDIA Canary, por lo que una grabación de una hora se hace generalmente en 2-3 minutos.
Sí. Cada visitante tiene 600 minutos gratis para empezar sin necesidad de registrarse para su primer archivo. Los planes pagados comienzan a $5/mes y añaden archivos más largos, transcripciones privadas y procesamiento de prioridad.
En el discurso limpio nuestros mejores modelos alcanzan una precisión del 95-97% (una tasa de error de palabra del 3-5% en los puntos de referencia). La precisión cae con el ruido de fondo, acentos pesados, crosstalk o audio de baja frecuencia, usando un micrófono decente y una habitación tranquila marca la mayor diferencia.
Sí. Habla en tu micrófono y STT.ai transmite la transcripción en vivo a través de la herramienta de transcripción en vivo. También puedes subir una grabación terminada para la transcripción por lotes si no la necesitas palabra por palabra mientras hablas.
STT.ai reconoce más de 100 idiomas y autodetecta el idioma hablado para la mayoría de audio. También puede configurar el idioma manualmente para un pequeño levantamiento de precisión, y las grabaciones en lenguaje mixto se manejan cambiando el clip medio.
Sí. La diarización del altavoz etiqueta cada voz (hablador 1, altavoz 2,...) y puede renombrarlos en el editor. Esto funciona en todos los modelos y lenguajes soportados.
STT.ai acepta más de 20 formatos incluyendo MP3, WAV, M4A, FLAC, OGG, MP4, MKV, MOV, WebM y AVI. Salida a TXT, SRT, VTT, DOCX, JSON o PDF.
El discurso al texto transcribe LO que se dijo en palabras; el reconocimiento de voz (identificación del orador) determina la OMS lo dijo. STT.ai hace ambos — transcripción más diarización del altavoz — pero los términos describen diferentes tareas.
Sí. El audio se procesa y elimina por defecto. Los planes Pro añaden cifrado del lado del cliente para que las transcripciones sean ilegibles sin su clave, incluso a STT.ai, y sus datos nunca se utilizan para la formación de modelos sin opt-in explícito.
Sí. STT.ai tiene una API REST con Python y SDKs Node.js más un servidor MCP para Claude y Cursor. El nivel gratuito de API incluye 100 minutos/mes, con facturación por segundo más allá de eso.
Sí. Cada transcripción se abre en un editor integrado donde puede corregir palabras escuchadas erróneamente, renombrar altavoces, ajustar marcas de tiempo y añadir notas. Las ediciones persisten en cada formato de exportación.