Signaler la demande de bogue/caractère

Tracs avec Vosk

Name: Vosk
Author: Alpha Cephei

Fonctionne avec audio et vidéo accessibles au public. Le contenu protégé par DRM n'est pas pris en charge.

Mise à niveau pour amélioration

Transcription privée

Dialogue avec la transcription

Débloquer avec Pro →

Déposer le fichier ici ou cliquer pour parcourir

MP3, WAV, M4A, FLAC, MP4, MKV, MOV, WebM — jusqu'à 2 Go

Téléchargement par lots de plusieurs fichiers avec Pro

Mise à niveau pour amélioration

Transcription privée

Dialogue avec la transcription

Débloquer avec Pro →

Mise à niveau pour amélioration

La parole en temps réel au texte. L'IA corrige automatiquement lorsque vous parlez — la précision s'améliore avec la parole plus longue.

Testez d'abord votre microphone

10 min/jour gratuit 600 min sans inscription Pas de carte de crédit Chiffres

Inscrivez-vous gratuitement →

12.0%

WER

Langues

100.0x

Vitesse

Apache 2.0

Licence

À propos Vosk

Vosk est une boîte à outils hors ligne de reconnaissance vocale qui fonctionne sans connexion Internet. Il prend en charge 20+ langues avec des modèles compacts qui peuvent fonctionner sur les appareils mobiles, Raspberry Pi, et n'importe quelle plate-forme. Construit sur les architectures Kaldi et Zipformer.

Langues soutenues par Vosk

Anglais

Espagnol

Français

Allemand

Chinois

Japonais

Coréen

Portugais

Arabe

Hindi

Russe

Italien

Néerlandais

Turc

Polonais

Suédois

Indonésien

Vietnamien

Tchèque

Grec

Modèle Info

FournisseurAlpha Cephei
Architecture-
LicenceApache 2.0
Mise à jourMar 2026

Modèles connexes

3.2% WER

4.2% WER

5.1% WER

3.5% WER

7.8% WER

Questions fréquemment posées

Vosk est un modèle speech-to-text par Alpha Cephei. STT.ai héberge Vosk sur notre infrastructure GPU afin que vous puissiez l'utiliser sans fournir votre propre matériel — télécharger audio ou vidéo et choisir Vosk à partir du modèle de sélection.

Sur les repères standard, Vosk atteint environ 12.0% de Word Error Rate. La précision du monde réel dépend de la qualité audio, de l'accent et de la langue; pour les enregistrements bruyants ou accentués, attendez quelques points de pourcentage plus haut WER.

Vosk fonctionne sur le niveau gratuit de STT.ai — chaque visiteur obtient 600 minutes pour commencer sans frais. Les plans payés ajoutent des limites plus longues par fichier, des transcriptions privées et la file d'attente prioritaire.

Vosk est publié sous Apache 2.0, une licence open-source permissive. Vous pouvez vous-même héberger Vosk sur votre propre matériel ou utiliser notre version hébergée — les deux sont utilisables commercialement.

Vosk prend en charge 20 langues. La détection automatique choisit la bonne langue pour la plupart des audio; vous pouvez également le spécifier manuellement pour un petit ascenseur de précision.

Vosk traite l'audio à environ 100.0x en temps réel sur nos GPUs. Un fichier audio d'une heure se termine en moins de 1 minutes; des fichiers plus longs font la file d'attente et les avisent par courrier électronique lorsque cela est fait.

Vosk a 50M paramètres. Les modèles plus grands ont tendance à être plus précis mais plus lents; STT.ai hôtes Vosk sur GPU de sorte que le nombre de paramètres n'affecte pas les performances de votre client.

Vosk accepte chaque format STT.ai supports — MP3, WAV, M4A, FLAC, OGG, MP4, MKV, MOV, WebM, AVI, et autres. Sortie comme TXT, SRT, VTT, DOCX, JSON ou PDF.

Oui. La diarisation des haut-parleurs se déroule aux côtés de Vosk pour chaque transcription — chaque haut-parleur est étiqueté et vous pouvez les renommer dans l'éditeur par la suite.

Oui. Vosk fonctionne dans notre environnement géré — l'audio est traité et supprimé par défaut et jamais utilisé pour la formation sans opt-in explicite.

Utilisez l'outil compare-stt pour exécuter Vosk contre n'importe quel autre modèle pris en charge sur le même son — vous verrez WER, le nombre de segments, les étiquettes des haut-parleurs et les scores de confiance côte à côte. La comparaison Vosk vs Whisper Large V3 est la plus courante.

Oui. Spécifiez "vosk" comme paramètre de modèle sur le paramètre /v1/transcrire. Les SDKs Python et Node.js incluent Vosk exemples. Le niveau d'API gratuit comprend 100 minutes/mois.

Oui. Parce que Vosk est Apache 2.0-licenced, vous pouvez auto-héberger. STT.ai's open-source page liste la prise en charge du projet et les poids. La plupart des équipes de production utilisent notre version hébergée pour sauter l'approvisionnement GPU, les swaps de modèles, et les ops.

Tracs avec Vosk

À propos Vosk

Langues soutenues par Vosk

Modèle Info

Modèles connexes

Questions fréquemment posées

Qu'est-ce que Vosk?

Quelle est la précision de Vosk?

Vosk est-il libre d'utilisation?

Quelle licence Vosk utilise-t-elle?

Combien de langues Vosk supporte-t-il?

À quelle vitesse est Vosk?

Quelle est la taille du modèle Vosk?

Quels formats audio peuvent transcrire Vosk?

Est-ce que Vosk détecte plusieurs haut-parleurs?

Mes données sont-elles privées lors de l'utilisation de Vosk?

Comment Vosk se compare-t-il à d'autres modèles STT?

Puis-je utiliser Vosk via l'API?

Puis-je lancer Vosk sur mon propre serveur?