Discorso gratuito al testo online

Convertire discorso in testo con trascrizione AI-powered. Caricare file audio, registrare dal microfono, o incollare un URL. 100+ lingue, 10+ modelli, 98%+ precisione.

Funziona con audio e video pubblicamente disponibili. I contenuti protetti da DRM non sono supportati.

Aggiornamento per Enhanced
Trascrizione privata
Parlare con la trascrizione
Sblocca con Pro →
Rilascia il file qui o fai clic per navigare
MP3, WAV, M4A, FLAC, MP4, MKV, MOV, WebM fino a 2GB
Aggiornamento per Enhanced
Trascrizione privata
Parlare con la trascrizione
Sblocca con Pro →
Aggiornamento per Enhanced
Registrazione: 0:00
In tempo reale Vosk (istante)
Migliorato Sussurro (accurato)
Collegamenti pubblici: 24h, solo testo · Iscriviti per 7d + audio · Pro per collegamenti privati

Discorso in tempo reale al testo. AI auto-corregge mentre si parla di precisione di galattosio migliora con il discorso più lungo.

Prova prima il microfono
❤️ Love STT.ai? Dillo ai tuoi amici!
Hai usato le tue trascrizioni gratuite.

Iscriviti gratuitamente per ottenere 600 minuti, o l'aggiornamento da $5/mese per migliaia di più.

10 minuti/giorno gratuiti 600 min gratis con iscrizione Nessuna carta di credito Cifrato
Iscriviti gratis →

1. Carica la registrazione vocale

Carica un file audio o video, incolla un URL o registra dal microfono.

2. L'IA converte il parlato in testo

Scegli tra oltre 10 modelli IA. Rilevamento parlante e rilevamento automatico della lingua inclusi.

3. Esporta la trascrizione

Scarica in 6 formati. Condividi link di trascrizione con riproduzione audio.

Formati di input vocale supportati

Pronto a convertire il parlato in testo?

Inizia gratis →

Domande frequenti

Discorso a testo (chiamato anche riconoscimento vocale o ASR) converte automaticamente l'audio parlato in parole scritte. STT.ai esegue la registrazione attraverso un modello AI che ascolta l'audio e le uscite testo modificabile con timestamps ed etichette di altoparlanti.

Un modello acustico mappa la forma d'onda sonora ai fonemi, poi un modello di linguaggio assembla quelli nelle parole e nella punteggiatura più probabili. STT.ai lo fa sulla GPU con modelli come Whisper Large V3 e NVIDIA Canary, quindi una registrazione di un'ora è di solito fatta in 2-3 minuti.

Sì. Ogni visitatore riceve 600 minuti gratuiti per iniziare senza registrazione richiesta per il tuo primo file. I piani pagati iniziano a $5/mese e aggiungere file più lunghi, trascrizioni private, e l'elaborazione prioritaria.

Sulla parola pulita i nostri migliori modelli raggiungono il 95-97% di precisione (un 3-5% di Word Error Rate sui benchmark). Accuratezza scende con rumore di fondo, accenti pesanti, crosstalk, o basso bitrate audio... utilizzando un microfono decente e una stanza tranquilla fa la differenza più grande.

Sì. Parlate nel vostro microfono e STT.ai flussi la trascrizione in diretta tramite lo strumento live-trascrizione. È anche possibile caricare una registrazione finita per la trascrizione batch se non avete bisogno di parola per parola mentre si parla.

STT.ai riconosce oltre 100 lingue e rileva automaticamente la lingua parlata per la maggior parte dell'audio. È anche possibile impostare la lingua manualmente per un piccolo sollevamento di precisione, e le registrazioni in lingua mista sono gestite tramite commutazione mid-clip.

Sì. La diarizzazione dei diffusori etichetta ogni voce (Speaker 1, Speaker 2,...) e puoi rinominarli nell'editor. Questo funziona su ogni modello e lingua supportati.

STT.ai accetta 20+ formati tra cui MP3, WAV, M4A, FLAC, OGG, MP4, MKV, MOV, WebM e AVI. Output in TXT, SRT, VTT, DOCX, JSON, o PDF.

Speech to text transcribes What was said in words; voice recognition (speaker identification) determina WHO said it. STT.ai fa sia la trascrizione che la diarizzazione degli altoparlanti ma i termini descrivono compiti diversi.

Sì. L'audio viene elaborato e cancellato per impostazione predefinita. I piani Pro aggiungono crittografia lato client in modo che le trascrizioni siano illeggibili senza la tua chiave, anche a STT.ai, e i tuoi dati non vengono mai utilizzati per l'allenamento di modelli senza esplicito opt-in.

Sì. STT.ai ha un API REST con SDK Python e Node.js più un server MCP per Claude e Cursor. Il livello API gratuito include 100 minuti al mese, con fatturazione al secondo oltre a questo.

Sì. Ogni trascrizione si apre in un editor integrato dove è possibile correggere le parole sbagliate, rinominare gli altoparlanti, regolare i timestamp e aggiungere note. Le modifiche persistono in ogni formato di esportazione.