Libre de audio a texto en liña
Converta son en texto coa transcrición con IA. Envíe ficheiros de son, grave co micrófono ou apegue un URL. Máis de 100 idiomas, máis de 10 modelos, máis do 98% de precisión.
1. Enviar o son
Envíe MP3, WAV, M4A, FLAC, OGG ou calquera formato de son. Ata 2 GB.
2. AI Processes Audio
A IA extrae a fala do seu son con detección de falante e marcas de tempo.
3. Obter a súa transcripción
Vexa, edite, descargue ou comparta. Exporte como TXT, SRT, VTT, DOCX ou PDF.
Modelos de son a texto
Escolla o modelo de IA que mellor se adapte ás súas necesidades — ou deixe que escollamos o mellor.
Transcríbe audio en máis de 100 idiomas
Listo para converter o son en texto?
Comezar libre →Preguntas frecuentes
Envíe o seu ficheiro de son ou apegue un URL, escolla un modelo de IA e prema en Transcribir. STT.ai devolve texto editábel con marcas de tempo e etiquetas de orador. A maioría dos ficheiros rematan en menos de cinco minutos.
MP3, WAV, M4A, FLAC, OGG, AAC, AMR e máis de 10 formatos máis están soportados. Non precisa converter entre formatos primeiro, envíe o que a gravadora ou o programa produza.
Un pouco. Os formatos sen perdas como WAV e FLAC levan son bit- perfect, polo que a precisión só está limitada polo modelo e a claridade do altofalante. Os formatos con perdas (MP3, M4A) a 128 kbps ou máis son efectivamente idénticos; taxas de bits moi baixas por baixo de 64 kbps poden custar uns puntos.
Si. STT.ai inclúe 600 minutos gratuítos para comezar sen rexistrarse para o seu primeiro ficheiro. Os plans pagados que comezan en $5/ mes engaden ficheiros máis longos, transcricións privadas e procesamento prioritario.
En son limpo os nosos mellores modelos alcanzan unha precisión do 95- 97% (3- 5% de taxa de erros de palabra). O ruído de fondo, os altofalantes superpostos e os acentos fortes son os factores principais que reducen a precisión.
Si. Os usuarios gratuítos poden transcribir ata unha hora por ficheiro; os plans de pago esténdense a máis de 8 horas, o que cobre podcasts completos, entrevistas e audiolibros nunha soa pasada.
Si. A diarización dos altofalantes etiqueta cada voz (Altofalante 1, Altofalante 2,...) e pode mudarlles o nome no editor. Funciona con todos os formatos e modelos de son soportados.
Exportar a subtítulos TXT, DOCX, PDF, JSON ou SRT/ VTT. JSON mantén marcas de tempo e etiquetas de locutor lexíbeis por máquina; DOCX e PDF son os mellores para compartir e arquivar.
Si. Máis de 100 linguas con detección automática, máis a opción de configurar a lingua manualmente. O son en linguas mixtas é xestionado cambiando a medio do ficheiro, e pode traducir o resultado despois.
Si. O son é procesado e borrado por omisión, e os plans Pro engadirán cifrado do lado do cliente para que as transcricións non sexan lexíbeis sen a súa chave. Non se emprega nada para adestramento sen a aceptación explícita.
Si. Apegue unha ligazón desde calquera das máis de 1300 plataformas soportadas — podcasts, SoundCloud, YouTube e máis — e STT.ai obterá o son directamente. As fontes protexidas con DRM non se poden transcreber.
Si. A API REST acepta ficheiros de son directamente, con SDK de Python e Node. js e un nivel gratuíto de 100 minutos/ mes. A facturación por segundo aplicase despois do nivel gratuíto.