Free Speech to Text en linha
Convertir la votz en tèxt amb la transcripcion alimentada per IA. Telecargar de fichièrs àudio, enregistrar amb vòstre microfòn o colar una URL. Mai de 100 lengas, mai de 10 modèls, mai de 98% de precision.
Enregistrament vocal
Telecargar un fichièr àudio o vidèo, colar una URL, o enregistrar de discors a partir de vòstre microfòn.
2. AI convertit la votz en tèxt
Triar entre mai de 10 modèls d'IA. Deteccion de locutor e deteccion automatica de lenga inclusas.
3. Exportar vòstra transcripcion
Telecargar en 6 formats. Partejar de ligams de transcripcion amb lectura àudio.
Models de sintèsi vocala en tèxt
Seleccionatz lo modèl d'IA que correspond a vòstres besonhs — o nos permetètz de causir lo melhor.
Sintetizar la votz en tèxt en mai de 100 lengas
@ info: status
Començar liure →Questions frequentas
La conversion vocala en tèxt (també nomenada reconeissença vocala o ASR) convertis automaticament l'audio parlat en mots escrichs. STT.ai executa vòstre enregistrament a travèrs d'un modèl d'IA qu'escóta l'audio e produsís un tèxt editable amb de marcadors de temps e d'etiquetas de locutor — pas de picada necessària.
Un modèl acústic transforma la forma d'onda del son en fonèmas, puèi un modèl de lenga los assembla dins los mots e la ponctuacion mai probables. STT.ai fa aquò sus GPU amb de modèls coma Whisper Large V3 e NVIDIA Canary, doncas un enregistrament d'una ora se fa normalament en 2-3 minutas.
@ info: status
@ info
Yes. Speak into your microphone and STT.ai streams the transcript live via the live-transcription tool. You can also upload a finished recording for batch transcription if you don't need it word-by-word as you talk.
STT.ai reconeis mai de 100 lengas e detecta automaticament la lenga parlada per la majoritat dels documents audio. Podètz tanben definir la lenga manualmente per una melhora precision, e los enregistraments en lengas mixtas son gestionats en cambiant a mièg clip.
@ info: status
STT.ai accepta mai de 20 formats, coma MP3, WAV, M4A, FLAC, OGG, MP4, MKV, MOV, WebM e AVI. Sortida en TXT, SRT, VTT, DOCX, JSON o PDF.
La sintèsi vocala transcriu çò que se ditz en mots; la reconeissença vocala (identificacion del locutor) determina qui lo ditz. STT.ai fa ambedos — transcripcion e diarizacion del locutor — mas los tèrmes descrivon de tascas diferentas.
Yes. Audio is processed and deleted by default. Pro plans add client-side encryption so transcripts are unreadable without your key, even to STT.ai, and your data is never used for model training without explicit opt-in.
Òc. STT.ai a una API REST amb Python e Node.js SDKs mai un servidor MCP per Claude e Cursor. Lo nivèl API liure inclutz 100 minutas/mes, amb facturacion per segonda al delà.
@ info: status