SenseVoice

STT.ai tidak menjalankan model ini. Halaman ini adalah informasi referensi tentang hal itu. Bimbing dengan model yang kita jalankan →
5.5%
WER
50
Bahasa
50.0x
Kecepatan
MIT
Lisensi

Tentang SenseVoice

SenseVoice adalah model dasar pidato dari FunAudioLLM yang tidak dapat diterjemahkan. Ini mendukung 50 bahasa dan mencakup kemampuan untuk pengakuan emosi, deteksi acara audio, dan normalisasi teks terbalik dalam satu model.

Pertanyaan yang Sering Diajukan

SenseVoice adalah model pidato-to-teks oleh FunAudioLLM. STT.ai tidak saat ini menjalankan SenseVoice ▪ Halaman ini adalah informasi referensi tentang model. Untuk transkripsi di STT.ai, model pemilih menawarkan keluarga Whisper (Turbo, Besar V3, Medium, Small).

Pada benchmark standar, SenseVoice mencapai sekitar 5.5% Word Error Rate. Keakuratan Real-world tergantung pada kualitas audio, aksen, dan bahasa; untuk rekaman bising atau aksen, mengharapkan beberapa poin persentase lebih tinggi WER.

SenseVoice tidak tersedia di STT.ai. dengan ketentuan lisensinya sendiri mengatur sendiri tingkat Gratis STT.ai mencakup model Whisper yang kita jalankan 600 menit untuk memulai, kemudian bulan Gratis.

SenseVoice dirilis di bawah MIT, lisensi sumber terbuka perresensi. Anda dapat mengenali SenseVoice sendiri dengan perangkat keras Anda atau menggunakan versi host kami keduanya dapat digunakan secara komersial.

SenseVoice mendukung bahasa 50. Auto-deteksi memilih bahasa yang tepat untuk kebanyakan audio; Anda juga dapat menentukan secara manual untuk angkat akurasi kecil.

SenseVoice memproses audio pada sekitar 50.0x real-time pada GPUs kami. Sebuah berkas audio 1-jam selesai di bawah menit 1; antrian berkas lebih panjang dan beritahu melalui email ketika dilakukan.

SenseVoice memiliki parameter 234M. Model yang lebih besar cenderung lebih akurat tetapi lebih lambat; STT.ai host SenseVoice pada GPU sehingga parameter tak mempengaruhi kinerja sisi klien Anda.

SenseVoice menerima setiap format yang didukung STT.ai ▪ MP3, WAV, M4A, FLAC, OGG, MP4, MKV, MOV, WebM, AVI, dan lainnya. Keluaran sebagai TXT, SRT, VTT, DOCX, JSON, atau PDF.

Dirasi Speaker berjalan bersama SenseVoice untuk setiap transkripsi setiap pembicara diberi label dan Anda dapat mengubah nama mereka di editor sesudahnya.

SenseVoice berjalan di lingkungan yang dikelola kami audio diproses dan dihapus secara baku dan tidak pernah digunakan untuk pelatihan tanpa eksplisit opt-in. Pro rencana menambahkan klien-sisi enkripsi untuk transkrip di istirahat.

Use the compare-stt tool to run SenseVoice against any other supported model on the same audio — you'll see WER, segment count, speaker labels, and confidence scores side-by-side. The SenseVoice vs Whisper Large V3 comparison is the most commonly run.

Ya. Nyatakan "sensevoice" sebagai parameter model pada titik akhir /v1/trascrite. Python dan Node.js SDKs termasuk contoh SenseVoice. Deret API gratis meliputi 100 menit/bulan.

Yes. Because SenseVoice is MIT-licensed, you can self-host it. STT.ai's open-source page lists the project repo and weights. Most production teams use our hosted version to skip GPU procurement, model swaps, and ops.