Free Speech to Text en liña
Converta a voz en texto coa transcrición con IA. Envíe ficheiros de son, grave co micrófono ou apegue un URL. Máis de 100 idiomas, máis de 10 modelos, máis do 98% de precisión.
1. Enviar a gravación de voz
Envíe un ficheiro de son ou vídeo, apegue un URL ou grave a voz co micrófono.
2. A IA converte a fala en texto
Escolla entre máis de 10 modelos de IA. Detección de falantes e detección automática de lingua incluídas.
3. Exportar a súa transcrición
Obteña en 6 formatos. Comparta ligazóns de transcrición con reprodución de son.
Modelos de voz a texto
Escolla o modelo de IA que mellor se adapte ás súas necesidades — ou deixe que escollamos o mellor.
Fala a texto en máis de 100 idiomas
Listo para converter a voz en texto?
Comezar libre →Preguntas frecuentes
A voz a texto (tamén chamada recoñecemento de voz ou ASR) converte automaticamente o son falado en palabras escritas. STT.ai executa a gravación mediante un modelo de IA que escoita o son e saca un texto editábel con marcas de tempo e etiquetas do falante, sen necesidade de escribir.
Un modelo acústico mapea a forma de onda do son aos fonemas, e logo un modelo de linguaxe ensambla estes nos fonemas nas palabras e puntuacións máis probables. O STT.ai fai isto na GPU con modelos como Whisper Large V3 e NVIDIA Canary, polo que unha gravación dunha hora normalmente faise en 2- 3 minutos.
Si. Cada visitante recibe 600 minutos gratuítos para comezar sen necesidade de rexistrarse para o seu primeiro ficheiro. Os plans de pago comezan en $5/ mes e engaden ficheiros máis longos, transcricións privadas e procesamento prioritario.
En fala clara os nosos mellores modelos acadan unha precisión do 95- 97% (unha taxa de erro de palabra do 3- 5% nos benchmarks). A precisión cae con ruído de fondo, acentos pesados, interferencia ou son de baixa taxa de bits; usar un micrófono decente e unha habitación silenciosa fai a maior diferenza.
Si. Fale no micrófono e STT.ai transmitirá a transcrición en directo mediante a ferramenta de transcrición en directo. Tamén pode enviar unha gravación rematada para a transcrición por lotes se non a precisa palabra por palabra mentres fala.
O STT.ai recoñece máis de 100 linguas e detecta automaticamente a lingua falada para a maioría do son. Tamén pode axustar a lingua manualmente para un pequeno aumento de precisión, e as gravacións en linguas mixtas manexáronse cambiando a medio clip.
Si. A diarización dos oradores etiqueta cada voz (Orador 1, Orador 2,...) e pode mudarlles o nome no editor. Isto funciona en todos os modelos e linguaxes soportados.
STT.ai acepta máis de 20 formatos, incluíndo MP3, WAV, M4A, FLAC, OGG, MP4, MKV, MOV, WebM e AVI. A saída é TXT, SRT, VTT, DOCX, JSON ou PDF.
A voz a texto transcríbe O QUE se dixo en palabras; o recoñecemento de voz (identificación do falante) determina QUEN o dixo. STT.ai fai as dúas cousas — transcrición máis diarización do falante — pero os termos describen tarefas diferentes.
Si. O son é procesado e borrado por omisión. Os plans Pro engadirán cifrado do lado do cliente para que as transcricións sexan ilegibles sen a súa chave, mesmo a STT.ai, e os seus datos nunca se empregarán para adestramento de modelos sen a súa aceptación explícita.
Si. STT.ai ten unha API REST con Python e Node. js SDKs máis un servidor MCP para Claude e Cursor. O nivel de API gratuíto inclúe 100 minutos/ mes, co cobro por segundo por riba diso.
Si. Cada transcrición ábrese nun editor incorporado onde pode corrixir as palabras mal oídas, mudar o nome dos oradores, axustar os selos de data/ hora e engadir notas. As edicións persisten en todos os formatos de exportación.