SenseVoice

STT.ai ಈ ಮಾದರಿಯನ್ನು ಚಲಾಯಿಸುವುದಿಲ್ಲ. ಈ ಪುಟವು ಅದರ ಬಗ್ಗೆ ಪ್ರೊಗ್ರಾಮ್ ಮಾಹಿತಿ ಕೊಡುತ್ತದೆ. [ ಪುಟ 19ರಲ್ಲಿರುವ ಚಿತ್ರ] →
5.5%
WER
50
ಭಾಷೆಗಳುName
50.0x
ವೇಗ
MIT
ಪರವಾನಗಿ

ಕುರಿತು SenseVoice

ಸುವಿನ್ಯಾಸವು ಒಂದು ಉಪಘಟಕವಾಗಿದ್ದು, ಇದು ಜಾಲತಾಣವನ್ನು ಅಳೆಯುವುದನ್ನೂ ಮೀರುತ್ತದೆ. ಇದು 50+ ಭಾಷೆಗಳನ್ನು ಬೆಂಬಲಿಸುತ್ತದೆ ಮತ್ತು ಇದು ಭಾವಾಭಿಲಾಷೆ, ಆಡಿಯೋ ಘಟನೆಯನ್ನು ಪತ್ತೆಹಚ್ಚುವಿಕೆ, ಮತ್ತು ವಿಲೋಚನಾ ಪಠ್ಯವನ್ನು ಆಕ್ರಮಿಸುವುದರ ಸಾಮರ್ಥ್ಯವನ್ನು ಒಳಗೊಂಡಿದೆ.
ಮಾದರಿ ಮಾಹಿತಿName
  • ಪೂರೈಕೆದಾರ (provider)FunAudioLLM
  • ವಿಸ್ತರಣಾ (ಕ್ಯಾಸಲ್) Name-
  • ಪರವಾನಗಿMIT
  • ಅಪ್ಡೇಟ್ ಮಾಡಲಾಗಿದೆMar 2026

ಪದೇ ಪದೇ ಕೇಳುವ ಪ್ರಶ್ನೆಗಳು

SenseVoice is a speech-to-text model by FunAudioLLM. STT.ai does not currently run SenseVoice — this page is reference information about the model. For transcription on STT.ai, the model picker offers the Whisper family (Turbo, Large V3, Medium, Small).

On standard benchmarks, SenseVoice achieves around 5.5% Word Error Rate. Real-world accuracy depends on audio quality, accent, and language; for noisy or accented recordings, expect a few percentage points higher WER.

SenseVoice ಲಭ್ಯವಿಲ್ಲ. ಅದರ ಸ್ವಂತ ಅನುಮತಿಗಳು ಸ್ವತಃ ಅದನ್ನು ನಿಯಂತ್ರಿಸುತ್ತವೆ. STT.aiದ ಮುಕ್ತ ಹಾರ್ಡ್ನನ ಮುಕ್ತ ಹಾರ್ಡ್ ನಾವು ಚಲಾಯಿಸುತ್ತಿರುವ whisper ಮಾದರಿಗಳನ್ನು ಆವರಿಸುತ್ತದೆ —⁠ ಆರಂಭಿಸಲು 600 ನಿಮಿಷಗಳು, ಒಂದು ತಿಂಗಳಿಂದ ಒಂದು ತಿಂಗಳು ಮುಕ್ತ ಮುಕ್ತ-ಪಂಕ್ತಿಯಲ್ಲಿ ಲಭ್ಯ. ಮತ್ತು ಇದು QQXB ಆನ್ ಮತ್ತು ಸರ್ ಸರ್ಜ್ ಸ್ವತಃ ನೀವು ಇದನ್ನು ಚಾಲನೆಯಲ್ಲಿಡಲು ಬಯಸುವಲ್ಲಿ, ನೀವು ಈ ಪ್ರೊಫೈರ್ ಪ್ರೊಫೈಲ್ ಪ್ರೊಫೈಲ್ ಅನ್ನು ಉಪಯೋಗಿಸಲು ಬಯಸುತ್ತೀರಾ? ಮತ್ತು ಇದು ನಿಮ್ಮ ಪ್ರಶಸ್ತಿಗಳಿಗೆ ಸಂಬಂಧಿಸಿದೆ. ನೀವು ಒಂದು ಹೊಸ ಪ್ರೊಗ್ರಾಮ್ ಅನ್ನು ಉಪಯೋಗಿಸಲು ಬಯಸುತ್ತೀರಾ?

SenseVoice ಯು ೮೦ ಮುದ್ರಿತ, ಒಂದು ರಕ್ಷಾ ಮುಕ್ತ-ಸಂಸ್ಕಾರ ಲೈಸನ್ಸ್ ಅನ್ನು ಬಿಡುಗಡೆ ಮಾಡಲಾಗಿದೆ. ನೀವು ನಿಮ್ಮ ಸ್ವಂತ ಯಂತ್ರದ ಮೂಲಕ ಸ್ವ-host SenseVoice ನೀಡಬಹುದು ಅಥವಾ ನಮ್ಮ host ಆವೃತ್ತಿಯನ್ನು ಬಳಸಬಹುದು. ಎರಡೂ ಬಳಕೆಗಳು ವಾಣಿಜ್ಯಾರ್ಥವಾಗಿ ಆಗುತ್ತವೆ.

SenseVoice ಭಾಷೆಗಳು 50 ಭಾಷೆಗಳನ್ನು ಬೆಂಬಲಿಸುತ್ತದೆ. ಹೆಚ್ಚಿನ ಆಡಿಯೊಕ್ಕಾಗಿ ಸರಿಯಾದ ಭಾಷೆಯನ್ನು ಆರಿಸುವುದು; ಒಂದು ಚಿಕ್ಕ ಚುಕ್ಕಿ ತೆರಳುವಿಕೆಗಾಗಿ ಇದನ್ನು ಕೈಯಾರೆ ಸೂಚಿಸಬಹುದಾಗಿದೆ.

SenseVoice ಪ್ರಕ್ರಿಯೆಗಳು ನಮ್ಮ GPUS ನಲ್ಲಿ ಆಡಿಯೊ ರಿಯಲ್‌ಟೈಮ್ ರಿಯಲ್ ಸಮಯ. ಒಂದು ೧- ಗಂಟೆ ಆಡಿಯೋ ಕಡತವು 8802 ನಿಮಿಷಗಳ ಕೆಳಗಿದೆ; ಉದ್ದವಾದ ಕಡತಗಳು ಅನುಕ್ರಮವಾಗಿ ಮುಗಿಸಲ್ಪಡುತ್ತವೆ ಹಾಗು ಇ- ಅಂಚೆ ಮೂಲಕ ಮಾಹಿತಿಯನ್ನು ಒದಗಿಸುತ್ತವೆ.

SenseVoice has 234M parameters. Larger models tend to be more accurate but slower; STT.ai hosts SenseVoice on GPU so the parameter count doesn't affect your client-side performance.

SenseVoice accepts every format STT.ai supports — MP3, WAV, M4A, FLAC, OGG, MP4, MKV, MOV, WebM, AVI, and others. Output as TXT, SRT, VTT, DOCX, JSON, or PDF.

ಹೌದು, ಭಾಷಣಕರ್ತರು ಪ್ರತಿ ಅಕ್ಷರಮಾಲೆಯಲ್ಲಿ SenseVoiceಕ್ಕೂ ಹೆಚ್ಚು ವೇಗವಾಗಿ ಓಡುತ್ತಾರೆ.

ಹೌದು. SenseVoice ನಮ್ಮ ಸಮರ್ಥವಾದ ಪರಿಸರದಲ್ಲಿ ಚಲನೆಗೊಂಡಿದೆ. ಆಡಿಯೊವನ್ನು ಪೂರ್ವನಿಯೋಜಿತವಾಗಿ ಸಂಸ್ಕರಿಸಲಾಗಿದೆ ಹಾಗು ಅಳಿಸಲಾಗಿದೆ ಮತ್ತು ಯಾವುದೇ ಸ್ಪಷ್ಟವಾದ ಆಪ್ಲೆಟ್- incent ತರಬೇತಿಯನ್ನು ಬಳಸುವುದಿಲ್ಲ. ಪ್ರೋಗ್ರಾಂನಲ್ಲಿ ಫೆಡರಿಟ್‌-ಭಾಗದ ಗೂಢಲಿಪೀಕರಣವನ್ನು ಸೇರಿಸಿ.

SenseVoice ಪ್ರತಿಬಿಂಬಿತ (ಆಡಿಯೋ) ಮಾದರಿಗೆ ವಿರುದ್ಧವಾದ SenseVoice ಅನ್ನು ಚಲಾಯಿಸಲು ಬಳಸಿ. ನೀವು WER, ಭಾಗದ ಲೆಕ್ಕ, ಭಾಷಣಕಾರಕ ಗುರುತು, ಮತ್ತು ದೃಢಭರವಸೆಯ ಬದಿಯಲ್ಲಿ ಗುರುತುಗಳನ್ನು ಕಾಣುವಿರಿ. SenseVoice ವಿಸ್ಪರ್ ವಿಸ್ಪರ್ ದೊಡ್ಡ ವಿಸ್ಪರ್ ವಿ೩ ನ ತುಣುಕುಗಳು ಹೆಚ್ಚಾಗಿ ಚಾಲನೆಗೊಳ್ಳುತ್ತಿದೆ.

ಹೌದು. "8000" ಅನ್ನು /v1/trance ಹಂತದಲ್ಲಿನ ಮಾದರಿಯ ಅಕ್ಷವಾಗಿ ನಿಗದಿಪಡಿಸು. ಪೈಥಾನ್‌ ಹಾಗು ನೋಡ್ಸ್ SDKs SenseVoice ಉದಾಹರಣೆಗಳನ್ನು ಒಳಗೊಂಡಿದೆ. ಫ್ರೀ API ಬೋರ್ ಅನ್ನು 100 minutes/ minute( 100 minutle) ಹೊಂದಿರುತ್ತದೆ.

೮೮೦೧ ಎಂದರೆ MIT-ಅಂಕಿಯ ವರ್ಗಾವಣೆ ಆಗಿರುವುದರಿಂದ, ನೀವು ಸ್ವಪ್ರಯೋಜನೆ ಮಾಡಲು ಸಾಧ್ಯವಾಗುತ್ತದೆ. STT.aiರ ತೆರೆದ ಲೇಬಲ್ ಪುಟ ರೀಪಾ ಹಾಗು ಭಾರಗಳ ಪಟ್ಟಿ. ಹೆಚ್ಚಿನ ಉತ್ಪಾದನಾ ತಂಡಗಳು GPU ಔಟ್‌ವರ್ಕ್, ಮಾದರಿ ಸ್ಯಾಪ್ಸ್ ಮತ್ತು ops ಅನ್ನು ಕೆಳಕ್ಕೆ ಎಳೆದುಕೊಳ್ಳಲು ನಮ್ಮ ಹವ್ಯಾಸದ ಆವೃತ್ತಿಯನ್ನು ಬಳಸುತ್ತವೆ.