SenseVoice

STT.ai ora ngoperasikake model iki. Halaman iki mung informasi referensi babagan STT.ai. Transkrip karo model sing kita lakoni →
5.5%
WER
50
Basa
50.0x
Kecepatan
MIT
Lisensi

_Tentang SenseVoice

SenseVoice nyaéta model dasarna basa ti FunAudioLLM anu ngaliwatan transkripsi. Éta ngadukung 50+ basa sareng ngawengku kamampuan pikeun ngartos emosi, ngadeteksi kajadian audio, sareng normalisasi teks balik dina hiji model.

Takon-takon sing asring diajukake

SenseVoice nyaéta model basa-ka-teks ku FunAudioLLM. STT.ai ayeuna henteu ngajalankeun SenseVoice — halaman ieu mangrupa inpormasi referensi ngeunaan model. Pikeun transkripsi dina STT.ai, pamilihan model nawiskeun kulawarga Whisper (Turbo, Large V3, Medium, Small).

Dina benchmarks standar, SenseVoice ngahontal kira-kira 5.5% Word Error Rate. Akurasi dunya nyata gumantung kana kualitas audio, accent, jeung basa; pikeun rekaman noisy atawa accented, ngarepkeun sababaraha poin persentase luhur WER.

SenseVoice teu aya dina STT.ai. Sarat lisénsina sorangan ngawatesan ngajalankeunana sorangan. Lapisan bébas STT.ai ngawengku model Whisper anu urang jalankeun - 600 menit pikeun ngamimitian, teras bulanan gratis.

SenseVoice dikaluarkeun di handapeun MIT, lisénsi sumber terbuka anu permisif. Anjeun tiasa ngahost SenseVoice dina perkakas anjeun atanapi nganggo vérsi anu dihost urang - kaduana tiasa dianggo sacara komersial.

SenseVoice ngadukung 50 basa. Auto-deteksi milih basa anu bener pikeun kabéh audio; anjeun ogé bisa nyatet éta sacara manual pikeun ngaronjatkeun akurasi.

SenseVoice ngaproses audio dina kira-kira 50.0x real-time dina GPU urang. A file audio 1 jam réngsé dina handapeun 1 menit; file leuwih panjang diulit jeung ngalaporkeun ku surél nalika réngsé.

SenseVoice mibanda parameter 234M. Model anu leuwih gedé leuwih akurat tapi leuwih lambat; STT.ai mibanda SenseVoice dina GPU supados jumlah parameter teu mangaruhan kinerja klien.

SenseVoice nampa saben format STT.ai dukungan - MP3, WAV, M4A, FLAC, OGG, MP4, MKV, MOV, WebM, AVI, lan liya-liyane. Output minangka TXT, SRT, VTT, DOCX, JSON, utawa PDF.

Ya. Diarization speaker jalan bareng jeung SenseVoice pikeun unggal transkripsi — unggal speaker dilabelkeun sarta anjeun bisa ngaganti ngaranna dina penyunting saterusna.

Ya. SenseVoice dijalankeun dina lingkungan anu diurus urang — audio diolah sareng dihapus sacara piawai sareng henteu pernah dianggo pikeun latihan tanpa opt-in eksplisit. Rencana Pro nambahan enkripsi sisi klien pikeun transkripsi nalika istirahat.

Gunakeun alat compare-stt pikeun ngajalankeun SenseVoice ngalawan model séjén anu didukung dina audio anu sami — anjeun bakal ningali WER, jumlah segmen, label panyatur, sarta skor confidence dibarengan-dibarengan. Perbandingan SenseVoice vs Whisper Large V3 nyaéta anu paling umum dijalankeun.

Ya. Nyatakeun "sensevoice" minangka parameter model dina titik akhir /v1/transcribe. Python sareng Node.js SDK kalebet conto SenseVoice. Tingkat API gratis kalebet 100 menit / bulan.

Ya. Kusabab SenseVoice dilisensikeun ku MIT, anjeun tiasa ngahost éta nyalira. Halaman sumber terbuka STT.ai nyarankeun repo sareng beurat proyek. Kabéh tim produksi nganggo vérsi anu dihost pikeun ngaleupaskeun GPU procurement, swaps model, sareng ops.