Free Speech to Text en liña

Converta a voz en texto coa transcrición con IA. Envíe ficheiros de son, grave co micrófono ou apegue un URL. Máis de 100 idiomas, máis de 10 modelos, máis do 98% de precisión.

Funciona con son e vídeo dispoñíbeis publicamente. Non se admiten contidos protexidos con DRM.

Actualización para mellorado
Transcripción privada
Conversa con transcrición
Desbloquear con Pro →
Solte aquí o ficheiro ou prema para examinar
MP3, WAV, M4A, FLAC, MP4, MKV, MOV, WebM — ata 2 GB
Actualización para mellorado
Transcripción privada
Conversa con transcrición
Desbloquear con Pro →
Actualización para mellorado
Gravación: 0:00
En tempo real Cera (instantánea)
Mellorado Sussurrar (preciso)
Ligazóns públicas: 24h, só texto · Inscríbete para 7d + audio · Pro para ligazóns privadas

Fala a texto en tempo real. A IA corrixe automaticamente mentres fala — a precisión mellora coa duración da fala.

Probe primeiro o micrófono
❤️ Amas STT.ai?
Esgotou as súas transcricións libres.

Inscríbase de balde para obter 600 minutos, ou actualice desde $5/mes para obter miles máis.

10 minutos libres/día 600 min gratis con rexistro Sen tarxeta de crédito Cifrado
Inscríbete gratis →

1. Enviar a gravación de voz

Envíe un ficheiro de son ou vídeo, apegue un URL ou grave a voz co micrófono.

2. A IA converte a fala en texto

Escolla entre máis de 10 modelos de IA. Detección de falantes e detección automática de lingua incluídas.

3. Exportar a súa transcrición

Obteña en 6 formatos. Comparta ligazóns de transcrición con reprodución de son.

Formatos de entrada de voz soportados

Casos de uso de voz a texto

Listo para converter a voz en texto?

Comezar libre →

Preguntas frecuentes

A voz a texto (tamén chamada recoñecemento de voz ou ASR) converte automaticamente o son falado en palabras escritas. STT.ai executa a gravación mediante un modelo de IA que escoita o son e saca un texto editábel con marcas de tempo e etiquetas do falante, sen necesidade de escribir.

Un modelo acústico mapea a forma de onda do son aos fonemas, e logo un modelo de linguaxe ensambla estes nos fonemas nas palabras e puntuacións máis probables. O STT.ai fai isto na GPU con modelos como Whisper Large V3 e NVIDIA Canary, polo que unha gravación dunha hora normalmente faise en 2- 3 minutos.

Si. Cada visitante recibe 600 minutos gratuítos para comezar sen necesidade de rexistrarse para o seu primeiro ficheiro. Os plans de pago comezan en $5/ mes e engaden ficheiros máis longos, transcricións privadas e procesamento prioritario.

En fala clara os nosos mellores modelos acadan unha precisión do 95- 97% (unha taxa de erro de palabra do 3- 5% nos benchmarks). A precisión cae con ruído de fondo, acentos pesados, interferencia ou son de baixa taxa de bits; usar un micrófono decente e unha habitación silenciosa fai a maior diferenza.

Si. Fale no micrófono e STT.ai transmitirá a transcrición en directo mediante a ferramenta de transcrición en directo. Tamén pode enviar unha gravación rematada para a transcrición por lotes se non a precisa palabra por palabra mentres fala.

O STT.ai recoñece máis de 100 linguas e detecta automaticamente a lingua falada para a maioría do son. Tamén pode axustar a lingua manualmente para un pequeno aumento de precisión, e as gravacións en linguas mixtas manexáronse cambiando a medio clip.

Si. A diarización dos oradores etiqueta cada voz (Orador 1, Orador 2,...) e pode mudarlles o nome no editor. Isto funciona en todos os modelos e linguaxes soportados.

STT.ai acepta máis de 20 formatos, incluíndo MP3, WAV, M4A, FLAC, OGG, MP4, MKV, MOV, WebM e AVI. A saída é TXT, SRT, VTT, DOCX, JSON ou PDF.

A voz a texto transcríbe O QUE se dixo en palabras; o recoñecemento de voz (identificación do falante) determina QUEN o dixo. STT.ai fai as dúas cousas — transcrición máis diarización do falante — pero os termos describen tarefas diferentes.

Si. O son é procesado e borrado por omisión. Os plans Pro engadirán cifrado do lado do cliente para que as transcricións sexan ilegibles sen a súa chave, mesmo a STT.ai, e os seus datos nunca se empregarán para adestramento de modelos sen a súa aceptación explícita.

Si. STT.ai ten unha API REST con Python e Node. js SDKs máis un servidor MCP para Claude e Cursor. O nivel de API gratuíto inclúe 100 minutos/ mes, co cobro por segundo por riba diso.

Si. Cada transcrición ábrese nun editor incorporado onde pode corrixir as palabras mal oídas, mudar o nome dos oradores, axustar os selos de data/ hora e engadir notas. As edicións persisten en todos os formatos de exportación.