Discorso gratuito al testo online
Convertire discorso in testo con trascrizione AI-powered. Caricare file audio, registrare dal microfono, o incollare un URL. 100+ lingue, 10+ modelli, 98%+ precisione.
1. Carica la registrazione vocale
Carica un file audio o video, incolla un URL o registra dal microfono.
2. L'IA converte il parlato in testo
Scegli tra oltre 10 modelli IA. Rilevamento parlante e rilevamento automatico della lingua inclusi.
3. Esporta la trascrizione
Scarica in 6 formati. Condividi link di trascrizione con riproduzione audio.
Modelli voce-testo
Scegli il modello IA adatto alle tue esigenze — o lascia che scegliamo il migliore.
Voce-testo in oltre 100 lingue
Pronto a convertire il parlato in testo?
Inizia gratis →Domande frequenti
Discorso a testo (chiamato anche riconoscimento vocale o ASR) converte automaticamente l'audio parlato in parole scritte. STT.ai esegue la registrazione attraverso un modello AI che ascolta l'audio e le uscite testo modificabile con timestamps ed etichette di altoparlanti.
Un modello acustico mappa la forma d'onda sonora ai fonemi, poi un modello di linguaggio assembla quelli nelle parole e nella punteggiatura più probabili. STT.ai lo fa sulla GPU con modelli come Whisper Large V3 e NVIDIA Canary, quindi una registrazione di un'ora è di solito fatta in 2-3 minuti.
Sì. Ogni visitatore riceve 600 minuti gratuiti per iniziare senza registrazione richiesta per il tuo primo file. I piani pagati iniziano a $5/mese e aggiungere file più lunghi, trascrizioni private, e l'elaborazione prioritaria.
Sulla parola pulita i nostri migliori modelli raggiungono il 95-97% di precisione (un 3-5% di Word Error Rate sui benchmark). Accuratezza scende con rumore di fondo, accenti pesanti, crosstalk, o basso bitrate audio... utilizzando un microfono decente e una stanza tranquilla fa la differenza più grande.
Sì. Parlate nel vostro microfono e STT.ai flussi la trascrizione in diretta tramite lo strumento live-trascrizione. È anche possibile caricare una registrazione finita per la trascrizione batch se non avete bisogno di parola per parola mentre si parla.
STT.ai riconosce oltre 100 lingue e rileva automaticamente la lingua parlata per la maggior parte dell'audio. È anche possibile impostare la lingua manualmente per un piccolo sollevamento di precisione, e le registrazioni in lingua mista sono gestite tramite commutazione mid-clip.
Sì. La diarizzazione dei diffusori etichetta ogni voce (Speaker 1, Speaker 2,...) e puoi rinominarli nell'editor. Questo funziona su ogni modello e lingua supportati.
STT.ai accetta 20+ formati tra cui MP3, WAV, M4A, FLAC, OGG, MP4, MKV, MOV, WebM e AVI. Output in TXT, SRT, VTT, DOCX, JSON, o PDF.
Speech to text transcribes What was said in words; voice recognition (speaker identification) determina WHO said it. STT.ai fa sia la trascrizione che la diarizzazione degli altoparlanti ma i termini descrivono compiti diversi.
Sì. L'audio viene elaborato e cancellato per impostazione predefinita. I piani Pro aggiungono crittografia lato client in modo che le trascrizioni siano illeggibili senza la tua chiave, anche a STT.ai, e i tuoi dati non vengono mai utilizzati per l'allenamento di modelli senza esplicito opt-in.
Sì. STT.ai ha un API REST con SDK Python e Node.js più un server MCP per Claude e Cursor. Il livello API gratuito include 100 minuti al mese, con fatturazione al secondo oltre a questo.
Sì. Ogni trascrizione si apre in un editor integrato dove è possibile correggere le parole sbagliate, rinominare gli altoparlanti, regolare i timestamp e aggiungere note. Le modifiche persistono in ogni formato di esportazione.