STT.ai Enhanced
STT.ai exécute ce modèle sur le niveau payé. C'est le modèle derrière STT.ai Enhanced. La transcription gratuite utilise Whisper Large v3 Turbo, qui est plus rapide.
Voir plans →
·
Tranccrivez gratuitement avec Whisper Turbo →
4.2%
WER
99
Langues
15.9x
Vitesse
MIT
Licence
À propos STT.ai Enhanced
STT.ai Enhanced est notre modèle le plus précis et le plus rapide de parole-texte. Construit sur une architecture de transformateur de pointe avec des optimisations propriétaires, il offre des taux d'erreur de mots leader dans l'industrie dans plus de 100 langues. Idéal pour la transcription de production, le sous-titrage en temps réel et les applications d'entreprise.
✦ Déverrouillage du modèle amélioré
Obtenez l'accès à notre modèle le plus précis avec n'importe quel forfait payant — Whisper grand-v3, 99 langues, et la diarisation des haut-parleurs.
Afficher les plans →Modèle Info
- FournisseurOpenAI (hosted by STT.ai)
- Architecture-
- LicenceMIT
- Mise à jourAug 2026
Questions fréquemment posées
STT.ai Enhanced est un modèle de parole en texte de OpenAI (hosted by STT.ai). STT.ai l'exécute sur notre propre GPU pour les comptes sur un plan payé, et c'est le modèle derrière le niveau amélioré STT.ai. La transcription gratuite utilise Whisper Large v3 Turbo, le point de contrôle plus rapide de la même famille.
Sur les repères standard, STT.ai Enhanced atteint environ 4.2% de Word Error Rate. La précision du monde réel dépend de la qualité audio, de l'accent et de la langue; pour les enregistrements bruyants ou accentués, attendez quelques points de pourcentage plus haut WER.
STT.ai Enhanced est un modèle premium, inclus dans tout forfait STT.ai payant à partir de 9$/mois. Il n'est pas disponible sur le niveau gratuit: les téléchargements gratuits et anonymes fonctionnent plutôt Whisper Turbo.
STT.ai Enhanced est publié sous MIT, une licence open-source permissive. Vous pouvez vous-même héberger STT.ai Enhanced sur votre propre matériel ou utiliser notre version hébergée — les deux sont utilisables commercialement.
STT.ai Enhanced prend en charge 99 langues. La détection automatique choisit la bonne langue pour la plupart des audio; vous pouvez également le spécifier manuellement pour un petit ascenseur de précision.
STT.ai Enhanced traite l'audio à environ 15.9x en temps réel sur nos GPUs. Un fichier audio d'une heure se termine en moins de 3 minutes; des fichiers plus longs font la file d'attente et les avisent par courrier électronique lorsque cela est fait.
STT.ai Enhanced a 1.55B paramètres. Les modèles plus grands ont tendance à être plus précis mais plus lents; STT.ai hôtes STT.ai Enhanced sur GPU de sorte que le nombre de paramètres n'affecte pas les performances de votre client.
STT.ai Enhanced accepte chaque format STT.ai supports — MP3, WAV, M4A, FLAC, OGG, MP4, MKV, MOV, WebM, AVI, et autres. Sortie comme TXT, SRT, VTT, DOCX, JSON ou PDF.
Oui. La diarisation des haut-parleurs se déroule aux côtés de STT.ai Enhanced pour chaque transcription — chaque haut-parleur est étiqueté et vous pouvez les renommer dans l'éditeur par la suite.
Oui. STT.ai Enhanced fonctionne dans notre infrastructure privée — audio est traité et supprimé par défaut. Pro+ ajoute le cryptage côté client afin que les transcriptions soient illisibles sans votre clé, et Private Cloud vous permet d'auto-héberger STT.ai Enhanced entièrement dans votre propre VPC.
Utilisez l'outil compare-stt pour exécuter STT.ai Enhanced contre n'importe quel autre modèle pris en charge sur le même son — vous verrez WER, le nombre de segments, les étiquettes des haut-parleurs et les scores de confiance côte à côte. La comparaison STT.ai Enhanced vs Whisper Large V3 est la plus courante.
Oui, sur un plan payé. Spécifiez "stt-ai-enhanced" comme paramètre de modèle sur le paramètre /v1/transcribe. Les clés sans plan actif sont servies Whisper Large v3 Turbo à la place. La requête réussit encore; il suffit de lancer le modèle libre.
Oui. Parce que STT.ai Enhanced est MIT-licenced, vous pouvez auto-héberger. STT.ai's open-source page liste la prise en charge du projet et les poids. La plupart des équipes de production utilisent notre version hébergée pour sauter l'approvisionnement GPU, les swaps de modèles, et les ops.