Distil-Whisper

STT.ai ora ngoperasikake model iki. Halaman iki mung informasi referensi babagan STT.ai. Transkrip karo model sing kita lakoni →
5.8%
WER
99
Basa
48.0x
Kecepatan
MIT
Lisensi

_Tentang Distil-Whisper

Distil-Whisper nyaéta versi distilasi tina Whisper anu diciptakeun ku Hugging Face. Éta ngirangan ukuran model ku 49% sareng ngahontal inference 6x langkung gancang nalika ngajaga dina 1% WER tina Whisper Large V2 aslina dina set evaluasi luar-distribusi.

Takon-takon sing asring diajukake

Distil-Whisper nyaéta model basa-ka-teks ku Hugging Face. STT.ai ayeuna henteu ngajalankeun Distil-Whisper — halaman ieu mangrupa inpormasi referensi ngeunaan model. Pikeun transkripsi dina STT.ai, pamilihan model nawiskeun kulawarga Whisper (Turbo, Large V3, Medium, Small).

Dina benchmarks standar, Distil-Whisper ngahontal kira-kira 5.8% Word Error Rate. Akurasi dunya nyata gumantung kana kualitas audio, accent, jeung basa; pikeun rekaman noisy atawa accented, ngarepkeun sababaraha poin persentase luhur WER.

Distil-Whisper teu aya dina STT.ai. Sarat lisénsina sorangan ngawatesan ngajalankeunana sorangan. Lapisan bébas STT.ai ngawengku model Whisper anu urang jalankeun - 600 menit pikeun ngamimitian, teras bulanan gratis.

Distil-Whisper dikaluarkeun di handapeun MIT, lisénsi sumber terbuka anu permisif. Anjeun tiasa ngahost Distil-Whisper dina perkakas anjeun atanapi nganggo vérsi anu dihost urang - kaduana tiasa dianggo sacara komersial.

Distil-Whisper ngadukung 99 basa. Auto-deteksi milih basa anu bener pikeun kabéh audio; anjeun ogé bisa nyatet éta sacara manual pikeun ngaronjatkeun akurasi.

Distil-Whisper ngaproses audio dina kira-kira 48.0x real-time dina GPU urang. A file audio 1 jam réngsé dina handapeun 1 menit; file leuwih panjang diulit jeung ngalaporkeun ku surél nalika réngsé.

Distil-Whisper mibanda parameter 756M. Model anu leuwih gedé leuwih akurat tapi leuwih lambat; STT.ai mibanda Distil-Whisper dina GPU supados jumlah parameter teu mangaruhan kinerja klien.

Distil-Whisper nampa saben format STT.ai dukungan - MP3, WAV, M4A, FLAC, OGG, MP4, MKV, MOV, WebM, AVI, lan liya-liyane. Output minangka TXT, SRT, VTT, DOCX, JSON, utawa PDF.

Ya. Diarization speaker jalan bareng jeung Distil-Whisper pikeun unggal transkripsi — unggal speaker dilabelkeun sarta anjeun bisa ngaganti ngaranna dina penyunting saterusna.

Ya. Distil-Whisper dijalankeun dina lingkungan anu diurus urang — audio diolah sareng dihapus sacara piawai sareng henteu pernah dianggo pikeun latihan tanpa opt-in eksplisit. Rencana Pro nambahan enkripsi sisi klien pikeun transkripsi nalika istirahat.

Gunakeun alat compare-stt pikeun ngajalankeun Distil-Whisper ngalawan model séjén anu didukung dina audio anu sami — anjeun bakal ningali WER, jumlah segmen, label panyatur, sarta skor confidence dibarengan-dibarengan. Perbandingan Distil-Whisper vs Whisper Large V3 nyaéta anu paling umum dijalankeun.

Ya. Nyatakeun "distil-whisper" minangka parameter model dina titik akhir /v1/transcribe. Python sareng Node.js SDK kalebet conto Distil-Whisper. Tingkat API gratis kalebet 100 menit / bulan.

Ya. Kusabab Distil-Whisper dilisensikeun ku MIT, anjeun tiasa ngahost éta nyalira. Halaman sumber terbuka STT.ai nyarankeun repo sareng beurat proyek. Kabéh tim produksi nganggo vérsi anu dihost pikeun ngaleupaskeun GPU procurement, swaps model, sareng ops.