NVIDIA Parakeet

STT.ai ora ngoperasikaké model iki - kaca iki minangka referensi informasi babagan iki. Transkrip karo model kang kita lakoni →
3.0%
WER
1
Basa
55.0x
Kecepatan
CC-BY-4.0
Lisénsi

Ngendi NVIDIA Parakeet

NVIDIA Parakeet TDT 1.1B ya iku model ASR basa Inggris kang nganggo arsitektur FastConformer kanthi Token-and-Duration Transducer (TDT). Iki bisa nggayuh akurasi manungsa ing standar benchmark basa Inggris lan dioptimalake kanggo NVIDIA GPU.

Basa sing didhukung déning NVIDIA Parakeet

Pitakon kang asring diajukake

NVIDIA Parakeet ya iku modél swara-ka-teks déning NVIDIA. STT.ai saiki ora ngoperasikaké NVIDIA Parakeet — kaca iki minangka informasi referensi bab modél. Kanggo transkripsi ing STT.ai, pemilih modél nawakake kulawarga Whisper (Turbo, Large V3, Medium, Small).

Ing standar benchmarks, NVIDIA Parakeet ngrampungake sekitar 3.0% Word Error Rate. Real-world akurasi gumantung ing kualitas audio, accent, lan basa; kanggo noisey utawa accented rekaman, ngarepake sawetara persentase poin luwih dhuwur WER.

NVIDIA Parakeet ora ana ing STT.ai. Lisensiné dhewe-dhewe ngontrol cara ngoperasikaké. Titik gratis STT.ai nglindhungi model Whisper sing kita lakoni - 600 menit kanggo miwiti, banjur tambahan gratis saben wulan.

NVIDIA Parakeet dirilis ing ngisor CC-BY-4.0, lisensi sumber terbuka sing permisif. Sampeyan bisa nginstal NVIDIA Parakeet ing piranti keras dhewe utawa nggunakake versi sing dihost - loro-loroné bisa digunakake kanthi komersial.

NVIDIA Parakeet nyokong 1 basa. Auto-deteksi milih basa kang bener kanggo akèh audio; sampeyan uga bisa nyetel kanthi manual kanggo nambah akurasi.

NVIDIA Parakeet ngproses audio ing kira-kira 55.0x real-time ing GPU kita. Fail audio 1 jam rampung ing ngisor 1 menit; file luwih dawa ing gulungan lan dilaporake liwat email nalika rampung.

NVIDIA Parakeet duwé parameter 1.1B. Model kang luwih gedhé luwih akurat nanging luwih lambat; STT.ai duwé host NVIDIA Parakeet ing GPU supaya penghitungan parameter ora ngrusak kinerja klien.

NVIDIA Parakeet nampa saben format STT.ai nyokong - MP3, WAV, M4A, FLAC, OGG, MP4, MKV, MOV, WebM, AVI, lan liyane. Output minangka TXT, SRT, VTT, DOCX, JSON, utawa PDF.

NVIDIA Parakeet diarization speakers dijalanaken kaliyan saben transkripsi - saben speaker dipunlabel lan sampeyan saged mènèhi jeneng anyar ing editor.

Ya. NVIDIA Parakeet dijalanaké ing lingkungan sing diurus — audio diproses lan dipasak kanthi pigura lan ora pernah digunakake kanggo latihan tanpa opt-in eksplisit. Rencana Pro nambah enkripsi klien-sisi kanggo transkripsi nalika ora aktif.

Gunakaké alat compare-stt kanggo nglakokaké NVIDIA Parakeet karo modél liya kang didhukung ing audio kang padha — sampeyan bakal ndeleng WER, penghitung segmen, label speaker, lan skor confidence side-by-side. Perbandingan NVIDIA Parakeet vs Whisper Large V3 iku sing paling umum dilakokaké.

Ya. Nyathet "nvidia-parakeet" minangka parameter model ing /v1/transcribe endpoint. Python lan Node.js SDKs ngemot conto NVIDIA Parakeet. Lapisan API gratis ngemot 100 menit/wulan.

Ya. Amargi NVIDIA Parakeet dipunlisensi CC-BY-4.0, sampeyan saged nghostaken piyambakipun. Lampiran sumber-bukah STT.ai nyathet repo proyèk lan bobot. Kathah tim produksi ingkang ngginakaken versi ingkang dipunhostaken kanggé nglewati GPU procurement, model swaps, lan ops.
Made by @nadermx