Whisper Large V3
STT.ai esegue questo modello sul livello pagato. È il modello dietro STT.ai migliorato. Trascrizione gratuita utilizza Whisper Large v3 Turbo, che è più veloce.
Cfr. piani →
·
Trascrivere gratuitamente con Whisper Turbo →
4.2%
WER
99
Lingue
15.9x
Velocità
MIT
Licenza
Informazioni Whisper Large V3
Whisper Large V3 è l'ammiraglio modello di riconoscimento vocale open-source di OpenAI. Con 1,55 miliardi di parametri, offre una precisione eccezionale in 99 lingue. Utilizza un'architettura encoder-decoder trasformatore addestrato su 680.000 ore di dati audio multilingue.
Lingue supportate da Whisper Large V3
Informazioni sul modello
- FornitoreOpenAI
- Architettura-
- LicenzaMIT
- AggiornatoAug 2026
Domande frequenti
Whisper Large V3 is a speech-to-text model by OpenAI. STT.ai runs it on our own GPU for accounts on a paid plan, and it is the model behind the STT.ai Enhanced tier. Free transcription uses Whisper Large v3 Turbo, the faster checkpoint of the same family.
Sui benchmark standard, Whisper Large V3 raggiunge circa 4.2% Word Error Rate. L'accuratezza del mondo reale dipende dalla qualità audio, dall'accento e dal linguaggio; per le registrazioni rumorose o accentuate, aspettatevi qualche punto percentuale più alto WER.
Whisper Large V3 funziona su STT.ai di livello libero molto di più ogni visitatore ottiene 600 minuti per iniziare senza alcun costo. I piani a pagamento aggiungono limiti più lunghi per file, trascrizioni private, e la coda di priorità.
Whisper Large V3 è rilasciato sotto MIT, una licenza open-source permissiva. È possibile auto-host Whisper Large V3 sul proprio hardware o utilizzare la nostra versione hosted entrambi sono commercialmente utilizzabili.
Whisper Large V3 supporta 99 lingue. Rilevamento automatico sceglie la lingua giusta per la maggior parte dell'audio; è anche possibile specificarlo manualmente per un piccolo sollevamento di precisione.
Whisper Large V3 elabora audio a circa 15.9x in tempo reale sulle nostre GPU. Un file audio di 1 ora termina in meno di 3 minuti; file più lunghi coda e notifica per e-mail quando fatto.
Whisper Large V3 ha 1.55B parametri. I modelli più grandi tendono ad essere più precisi ma più lenti; STT.ai host Whisper Large V3 su GPU in modo che il conteggio dei parametri non influisca sulle prestazioni lato client.
Whisper Large V3 accetta ogni formato STT.ai supporta © MP3, WAV, M4A, FLAC, OGG, MP4, MKV, MOV, WebM, AVI, e altri. Uscita come TXT, SRT, VTT, DOCX, JSON, o PDF.
Sì. La diarizzazione degli altoparlanti corre accanto a Whisper Large V3 per ogni trascrizione ogni altoparlante è etichettato e si può rinominare in seguito nell'editor.
Sì. Whisper Large V3 è eseguito nel nostro ambiente gestito L'audio è elaborato e cancellato per impostazione predefinita e mai utilizzato per l'allenamento senza esplicito opt-in. Piani Pro aggiungere la crittografia lato client per le trascrizioni a riposo.
Utilizzare lo strumento di confronto-stt per eseguire Whisper Large V3 contro qualsiasi altro modello supportato sullo stesso audio. Vedrete WER, conteggio dei segmenti, etichette degli altoparlanti e punteggi di confidenza fianco a fianco. Il confronto Whisper Large V3 vs Whisper Large V3 è il più comunemente eseguito.
Sì, su un piano a pagamento. Specificare "whisper-large-v3" come parametro del modello sull'endpoint /v1/trascrivere. Le chiavi senza un piano attivo sono servite Whisper Large v3 Turbo invece. La richiesta riesce ancora; esegue semplicemente il modello Gratis.
Sì. Poiché Whisper Large V3 è MIT-licensed, si può auto-ospitare esso. STT.ai pagina open-source elenca il progetto repo e pesi. La maggior parte dei team di produzione utilizzano la nostra versione ospitata per saltare GPU approvvigionamento, modelli di swap, e op.