Transcribe con SenseVoice

Funciona con audio y vídeo de acceso público. El contenido protegido por DRM no es compatible.

Actualizar para mejorar
Transcripciones privadas
Charla con transcripción
Desbloquear con Pro →
Soltar archivo aquí o haga clic para navegar
MP3, WAV, M4A, FLAC, MP4, MKV, MOV, WebM — hasta 2 GB
Actualizar para mejorar
Transcripciones privadas
Charla con transcripción
Desbloquear con Pro →
Actualizar para mejorar
Grabación: 0:00
En tiempo real Vosk (instante)
Mejorado Susurro (exacto)
Enlaces públicos: 24h, sólo texto · Inscríbete para 7d + audio · Pro para enlaces privados

Discurso en tiempo real al texto. IA corrige automáticamente mientras habla — la precisión mejora con un discurso más largo.

Pon a prueba tu micrófono primero
❤️ ¡Díselo a tus amigos!
Has usado tus transcripciones gratis.

Inscríbete gratis para obtener 600 minutos, o actualizar desde $5/mes por miles más.

10 min/día gratis 600 min gratis con registro Sin tarjeta de crédito Cifrado
Inscríbete gratis →
5.5%
WER
50
Idiomas
50.0x
Velocidad
MIT
Licencia

Acerca de SenseVoice

SenseVoice es un modelo de base de voz de FunAudioLLM que va más allá de la transcripción. Soporta más de 50 idiomas e incluye capacidades para el reconocimiento de emociones, detección de eventos de audio y normalización inversa de texto en un solo modelo.

Preguntas frecuentes

SenseVoice es un modelo de voz a texto de FunAudioLLM. STT.ai aloja SenseVoice en nuestra infraestructura de GPU para que pueda usarlo sin aprovisionamiento de su propio hardware — subir audio o vídeo y elegir SenseVoice del selector de modelos.

En puntos de referencia estándar, SenseVoice alcanza alrededor de 5.5% tasa de error de Word. La precisión en el mundo real depende de la calidad de audio, el acento y el lenguaje; para grabaciones ruidosas o acentuadas, espere unos puntos porcentuales más alto WER.

SenseVoice funciona en el nivel gratuito de STT.ai — cada visitante tiene 600 minutos para empezar sin costo. Los planes pagados añaden límites por archivo más largos, transcripciones privadas y cola de prioridad.

SenseVoice es lanzado bajo MIT, una licencia de código abierto permisiva. Usted puede auto-anfitriona SenseVoice en su propio hardware o utilizar nuestra versión alojada — ambos son comercialmente utilizables.

SenseVoice admite 50 idiomas. La detección automática selecciona el idioma adecuado para la mayoría de audio; también puede especificarlo manualmente para un pequeño ascensor de precisión.

SenseVoice procesa audio en aproximadamente 50.0x en tiempo real en nuestras GPUs. Un archivo de audio de 1 hora termina en menos de 1 minutos; los archivos más largos cola y notificar por correo electrónico cuando se hace.

SenseVoice tiene parámetros 234M. Los modelos más grandes tienden a ser más precisos pero más lentos; STT.ai aloja SenseVoice en GPU para que el recuento de parámetros no afecte el rendimiento de su cliente.

SenseVoice acepta todos los soportes de formato STT.ai — MP3, WAV, M4A, FLAC, OGG, MP4, MKV, MOV, WebM, AVI, y otros. Salida como TXT, SRT, VTT, DOCX, JSON o PDF.

Sí. Diarización del altavoz corre junto a SenseVoice para cada transcripción - cada altavoz está etiquetado y se puede cambiar el nombre en el editor después.

Sí. SenseVoice se ejecuta en nuestro entorno gestionado — audio se procesa y elimina por defecto y nunca se utiliza para el entrenamiento sin opt-in explícito. Planes Pro añadir cifrado del lado del cliente para transcripciones en reposo.

Utilice la herramienta compare-stt para ejecutar SenseVoice contra cualquier otro modelo soportado en el mismo audio: verá WER, conteo de segmentos, etiquetas de altavoz y puntuaciones de confianza lado a lado. La comparación SenseVoice vs Whisper Large V3 es la más común.

Sí. Especifique "sensevoice" como parámetro de modelo en el endpoint /v1/transcribir. Los SDKs de Python y Node.js incluyen SenseVoice ejemplos. El nivel de API libre incluye 100 minutos/mes.

Sí. Debido a que SenseVoice es licenciada MIT, usted puede auto-anfitrionarlo. STT.ai's página de código abierto lista la repo proyecto y pesos. La mayoría de los equipos de producción utilizan nuestra versión alojada para saltarse la adquisición de GPU, modelos swaps, y ops.