SenseVoice

STT.ai ਇਹ ਮਾਡਲ ਚਲਾਉਂਦਾ ਨਹੀਂ ਹੈ । ਇਹ ਪੇਜ਼ ਇਸ ਬਾਰੇ ਹਵਾਲਾ ਜਾਣਕਾਰੀ ਹੈ । ਮਾਡਲ ਨਾਲ ਟਰਾਂਸਕਰੀਪਟ ਕਰੋ, ਜੋ ਕਿ ਅਸੀਂ ਚਲਾ ਰਹੇ ਹਾਂ →
5.5%
WER
50
ਭਾਸ਼ਾਵਾਂ
50.0x
ਗਤੀ
MIT
ਲਾਈਸੈਂਸ

ਬਾਰੇ SenseVoice

SenseVoice FunAudioLLM ਦਾ ਇੱਕ ਬੋਲੀ ਫਾਊਂਡੇਸ਼ਨ ਮਾਡਲ ਹੈ, ਜੋ ਕਿ ਟਰਾਂਸਕਰੀਪਸ਼ਨ ਤੋਂ ਵੱਧ ਹੈ । ਇਹ 50+ ਭਾਸ਼ਾਵਾਂ ਲਈ ਸਹਾਇਕ ਹੈ ਅਤੇ ਇੱਕੋ ਮਾਡਲ ਵਿੱਚ ਭਾਵਨਾ ਪਛਾਣ, ਆਡੀਓ ਘਟਨਾ ਖੋਜ ਅਤੇ ਉਲਟ ਪਾਠ ਨਾਰਮਲਾਈਜ਼ੇਸ਼ਨ ਲਈ ਸਮਰੱਥਾ ਸ਼ਾਮਲ ਹੈ ।
ਮਾਡਲ ਜਾਣਕਾਰੀ
  • ਪਰੋਵਾਈਡਰFunAudioLLM
  • ਆਰਕੀਟੈਕਚਰ-
  • ਲਾਈਸੈਂਸMIT
  • ਅੱਪਡੇਟMar 2026

ਅਕਸਰ ਪੁੱਛੇ ਜਾਣ ਵਾਲੇ ਸਵਾਲ

SenseVoice FunAudioLLM ਦਾ ਇੱਕ ਬੋਲੀ- ਤੋਂ- ਪਾਠ ਮਾਡਲ ਹੈ । STT.ai ਮੌਜੂਦਾ ਸਮੇਂ SenseVoice ਚਲਾਉਂਦਾ ਨਹੀਂ ਹੈ — ਇਹ ਪੇਜ਼ ਮਾਡਲ ਬਾਰੇ ਜਾਣਕਾਰੀ ਹੈ । STT.ai ਉੱਤੇ ਟਰਾਂਸਕਰੀਪਸ਼ਨ ਲਈ, ਮਾਡਲ ਚੋਣਕਾਰ ਵਿਸਪਰ ਪਰਿਵਾਰ (ਟਰਬੋ, ਵੱਡਾ V3, ਮੱਧਮ, ਛੋਟਾ) ਦਿੰਦਾ ਹੈ ।

ਸਟੈਂਡਰਡ ਬੈਂਕਮਾਰਕਾਂ ਉੱਤੇ, SenseVoice ਨੇ 5.5% ਸ਼ਬਦ ਗਲਤੀ ਦਰ ਪ੍ਰਾਪਤ ਕੀਤੀ ਹੈ। ਅਸਲੀ- ਦੁਨੀਆ ਦੀ ਸਹੀਤਾ ਆਡੀਓ ਕੁਆਲਟੀ, ਅੱਖਰਾਂ ਅਤੇ ਭਾਸ਼ਾ ਉੱਤੇ ਨਿਰਭਰ ਕਰਦੀ ਹੈ; ਗੂੰਜ ਜਾਂ ਅੱਖਰਾਂ ਨਾਲ ਰਿਕਾਰਡਿੰਗ ਲਈ, ਕੁਝ ਪ੍ਰਤੀਸ਼ਤ ਅੰਕਾਂ ਦੀ ਵੱਧ WER ਦੀ ਉਮੀਦ ਕਰੋ।

SenseVoice STT.ai ਉੱਤੇ ਉਪਲੱਬਧ ਨਹੀਂ ਹੈ। ਇਸ ਦੀ ਆਪਣੀ ਲਾਈਸੈਂਸ ਸ਼ਰਤਾਂ ਇਸ ਨੂੰ ਤੁਸੀਂ ਚਲਾਓ। STT.ai ਦੀ ਮੁਫ਼ਤ ਟਾਇਰ ਵਿਸਪਰ ਮਾਡਲਾਂ ਨੂੰ ਕਵਰ ਕਰਦੀ ਹੈ ਜੋ ਅਸੀਂ ਚਲਾ ਰਹੇ ਹਾਂ - ਸ਼ੁਰੂ ਕਰਨ ਲਈ 600 ਮਿੰਟ, ਫਿਰ ਮਹੀਨਾਵਾਰ ਮੁਫ਼ਤ ਟਾਪ-ਅੱਪ।

SenseVoice ਨੂੰ MIT, ਇੱਕ ਖੋਲ੍ਹੇ ਸਰੋਤ ਲਾਈਸੈਂਸ ਅਧੀਨ ਜਾਰੀ ਕੀਤਾ ਗਿਆ ਹੈ । ਤੁਸੀਂ ਆਪਣੇ ਹਾਰਡਵੇਅਰ ਉੱਤੇ SenseVoice ਨੂੰ ਆਪ ਹੀ ਹੋਸਟ ਕਰ ਸਕਦੇ ਹੋ ਜਾਂ ਸਾਡਾ ਹੋਸਟ ਵਰਜਨ ਵਰਤ ਸਕਦੇ ਹੋ — ਦੋਵੇਂ ਵਪਾਰਕ ਤੌਰ ਉੱਤੇ ਵਰਤੇ ਜਾ ਸਕਦੇ ਹਨ ।

SenseVoice 50 ਭਾਸ਼ਾਵਾਂ ਲਈ ਸਹਾਇਕ ਹੈ। ਆਟੋ-ਖੋਜ ਬਹੁਤੇ ਆਡੀਓ ਲਈ ਸਹੀ ਭਾਸ਼ਾ ਚੁਣਦੀ ਹੈ; ਤੁਸੀਂ ਇਸ ਨੂੰ ਛੋਟੀ ਸਹੀਤਾ ਲਈ ਦਸਤੀ ਵੀ ਦੇ ਸਕਦੇ ਹੋ।

SenseVoice ਸਾਡੇ GPUs ਉੱਤੇ 50.0x ਰੀਅਲ-ਟਾਈਮ ਉੱਤੇ ਆਡੀਓ ਪਰੋਸੈਸ ਕਰਦਾ ਹੈ। 1 ਘੰਟੇ ਦੀ ਆਡੀਓ ਫਾਇਲ 1 ਮਿੰਟਾਂ ਵਿੱਚ ਖਤਮ ਹੁੰਦੀ ਹੈ; ਲੰਬੀਆਂ ਫਾਇਲਾਂ ਕਤਾਰ ਵਿੱਚ ਲੱਗੀਆਂ ਰਹਿੰਦੀਆਂ ਹਨ ਅਤੇ ਜਦੋਂ ਖਤਮ ਹੁੰਦੀਆਂ ਹਨ ਤਾਂ ਈ-ਮੇਲ ਰਾਹੀਂ ਸੂਚਿਤ ਹੁੰਦੀਆਂ ਹਨ।

SenseVoice ਵਿੱਚ 234M ਪੈਰਾਮੀਟਰ ਹਨ। ਵੱਡੇ ਮਾਡਲ ਵਧੇਰੇ ਸਹੀ ਪਰ ਹੌਲੀ ਹੁੰਦੇ ਹਨ; STT.ai GPU ਉੱਤੇ SenseVoice ਹੋਸਟ ਕਰਦਾ ਹੈ ਤਾਂ ਕਿ ਪੈਰਾਮੀਟਰ ਗਿਣਤੀ ਤੁਹਾਡੀ ਕਲਾਇਟ-ਸਾਈਡ ਕਾਰਗੁਜ਼ਾਰੀ ਨੂੰ ਪ੍ਰਭਾਵਿਤ ਨਹੀਂ ਕਰਦੀ ਹੈ।

SenseVoice ਹਰ ਫਾਰਮੈਟ ਨੂੰ ਸਵੀਕਾਰ ਕਰਦਾ ਹੈ, ਜੋ ਕਿ STT.ai ਸਹਿਯੋਗੀ ਹੈ - MP3, WAV, M4A, FLAC, OGG, MP4, MKV, MOV, WebM, AVI, ਅਤੇ ਹੋਰ। ਆਉਟਪੁੱਟ TXT, SRT, VTT, DOCX, JSON, ਜਾਂ PDF ਦੇ ਰੂਪ ਵਿੱਚ ਹੈ।

ਹਾਂ । ਸਪੀਕਰ ਡਾਇਰੀਜ਼ੇਸ਼ਨ ਹਰੇਕ ਟਰਾਂਸਕਰੀਪਸ਼ਨ ਲਈ SenseVoice ਦੇ ਨਾਲ ਚੱਲਦਾ ਹੈ — ਹਰੇਕ ਸਪੀਕਰ ਨੂੰ ਲੇਬਲ ਦਿੱਤਾ ਜਾਂਦਾ ਹੈ ਅਤੇ ਤੁਸੀਂ ਬਾਅਦ ਵਿੱਚ ਐਡੀਟਰ ਵਿੱਚ ਉਨ੍ਹਾਂ ਦਾ ਨਾਂ ਬਦਲ ਸਕਦੇ ਹੋ ।

ਹਾਂ । SenseVoice ਸਾਡੇ ਪਰਬੰਧਿਤ ਵਾਤਾਵਰਣ ਵਿੱਚ ਚੱਲਦਾ ਹੈ — ਆਡੀਓ ਡਿਫਾਲਟ ਤੌਰ ਤੇ ਪਰੋਸੈੱਸ ਅਤੇ ਹਟਾਏ ਜਾਂਦੇ ਹਨ ਅਤੇ ਬਿਨਾਂ ਸਪੱਸ਼ਟ ਚੋਣ-ਇਨ ਦੇ ਟਰੇਨਿੰਗ ਲਈ ਕਦੇ ਨਹੀਂ ਵਰਤੇ ਜਾਂਦੇ ਹਨ । ਪਰੋ ਪਲਾਨ ਠੀਕ ਸਮੇਂ ਉੱਤੇ ਟਰਾਂਸਕਰੀਪਟ ਲਈ ਕਲਾਂਇਟ-ਸਾਈਡ ਇੰਕ੍ਰਿਪਸ਼ਨ ਸ਼ਾਮਲ ਕਰਦੇ ਹਨ ।

ਇੱਕੋ ਆਡੀਓ ਉੱਤੇ ਕਿਸੇ ਹੋਰ ਸਹਾਇਕ ਮਾਡਲ ਨਾਲ SenseVoice ਚਲਾਉਣ ਲਈ compare-stt ਟੂਲ ਵਰਤੋਂ - ਤੁਸੀਂ WER, ਸੈਗਮੈਂਟ ਗਿਣਤੀ, ਸਪੀਕਰ ਲੇਬਲ ਅਤੇ ਭਰੋਸੇਯੋਗ ਸਕੋਰ ਨੂੰ ਪਾਸੇ-ਪਾਸੇ ਵੇਖੋਗੇ। SenseVoice ਵਿਰੁੱਧ Whisper Large V3 ਤੁਲਨਾ ਸਭ ਤੋਂ ਵੱਧ ਚਲਾਈ ਜਾਂਦੀ ਹੈ।

ਹਾਂ। /v1/transcribe ਅੰਤ-ਬਿੱਟ ਉੱਤੇ ਮਾਡਲ ਪੈਰਾਮੀਟਰ ਵਜੋਂ "sensevoice" ਦਿਓ। Python ਅਤੇ Node.js SDKs ਵਿੱਚ SenseVoice ਉਦਾਹਰਣ ਸ਼ਾਮਲ ਹਨ। ਮੁਫਤ API ਟਾਇਰ ਵਿੱਚ 100 ਮਿੰਟ/ਮਹੀਨਾ ਸ਼ਾਮਲ ਹੈ।

ਹਾਂ, ਕਿਉਂਕਿ SenseVoice MIT-ਲਾਈਸੈਂਸਡ ਹੈ, ਤੁਸੀਂ ਇਸ ਨੂੰ ਆਪ ਹੀ ਹੋਸਟ ਕਰ ਸਕਦੇ ਹੋ। STT.ai ਦਾ ਓਪਨ-ਸੋਰਸ ਪੇਜ਼ ਪ੍ਰੋਜੈਕਟ ਰੈਪੋ ਅਤੇ ਭਾਰ ਦੀ ਸੂਚੀ ਦਿੰਦਾ ਹੈ। ਜ਼ਿਆਦਾਤਰ ਉਤਪਾਦਨ ਟੀਮਾਂ GPU ਖਰੀਦ, ਮਾਡਲ ਸਵਾਪ ਅਤੇ ਓਪਸ ਛੱਡਣ ਲਈ ਸਾਡੇ ਹੋਸਟ ਵਰਜਨ ਦੀ ਵਰਤੋਂ ਕਰਦੀਆਂ ਹਨ।