L'expression libre pour texte en ligne
Convertissez la parole en texte avec transcription assistée par l'IA. Chargez des fichiers audio, enregistrez depuis votre microphone ou collez une URL. 100+ langues, 10+ modèles, 98%+ précision.
1. Téléchargez votre enregistrement vocal
Téléchargez un fichier audio ou vidéo, collez une URL ou enregistrez depuis votre micro.
2. L'IA convertit la parole en texte
Choisissez parmi plus de 10 modèles d'IA. Détection des locuteurs et détection automatique de la langue incluses.
3. Exportez votre transcription
Téléchargez en 6 formats. Partagez des liens de transcription avec lecture audio.
Modèles de reconnaissance vocale
Choisissez le modèle d'IA adapté à vos besoins — ou laissez-nous choisir le meilleur.
Reconnaissance vocale en plus de 100 langues
Cas d'utilisation de la reconnaissance vocale
Prêt à convertir la parole en texte ?
Commencer gratuitement →Questions fréquemment posées
Le discours au texte (également appelé reconnaissance vocale ou ASR) convertit automatiquement l'audio parlé en mots écrits. STT.ai exécute votre enregistrement à travers un modèle AI qui écoute le texte audio et les sorties modifiables avec horodatage et étiquettes de haut-parleur — pas de saisie nécessaire.
Un modèle acoustique map le son de forme d'onde pour phonèmes, puis un modèle de langue assemble ceux en mots et ponctuation les plus probables. STT.ai le fait sur GPU avec des modèles comme Whisper Large V3 et NVIDIA Canary, donc un enregistrement d'une heure est généralement fait en 2-3 minutes.
Oui. Chaque visiteur obtient 600 minutes gratuites pour commencer sans inscription nécessaire pour votre premier dossier. Les plans payés commencent à $5/mois et ajoutent des fichiers plus longs, des transcriptions privées et le traitement des priorités.
Sur la parole propre, nos meilleurs modèles atteignent 95-97% de précision (un taux d'erreur de 3-5% de Word sur les repères). L'exactitude diminue avec le bruit de fond, les accents lourds, le crosstalk, ou l'audio à faible débit – en utilisant un microphone décent et une pièce tranquille fait la plus grande différence.
Oui. Parlez dans votre microphone et STT.ai flux de la transcription en direct via l'outil de transcription en direct. Vous pouvez également télécharger un enregistrement fini pour la transcription par lots si vous n'avez pas besoin de lui mot par mot pendant que vous parlez.
STT.ai reconnaît plus de 100 langues et détecte automatiquement la langue parlée pour la plupart de l'audio. Vous pouvez également définir la langue manuellement pour un petit lifting de précision, et les enregistrements en langage mixte sont traités par commutation mi-clip.
Oui. La diarisation des haut-parleurs marque chaque voix (Speaker 1, Speaker 2,...) et vous pouvez les renommer dans l'éditeur. Cela fonctionne sur chaque modèle et langue pris en charge.
STT.ai accepte les formats 20+ incluant MP3, WAV, M4A, FLAC, OGG, MP4, MKV, MOV, WebM et AVI. Sortie vers TXT, SRT, VTT, DOCX, JSON ou PDF.
Le discours au texte transcrit ce qui a été dit en mots; la reconnaissance vocale (identification du haut-parleur) détermine l'OMS l'a dit. STT.ai fait les deux — transcription plus diarisation du haut-parleur — mais les termes décrivent différentes tâches.
Oui. L'audio est traité et supprimé par défaut. Les plans pro ajoutent le cryptage côté client de sorte que les transcriptions sont illisibles sans votre clé, même à STT.ai, et vos données ne sont jamais utilisées pour la formation du modèle sans opt-in explicite.
Oui. STT.ai a une API REST avec Python et Node.js SDKs plus un serveur MCP pour Claude et Cursor. Le niveau API gratuit comprend 100 minutes/mois, avec une facturation par seconde au-delà de cela.
Oui. Chaque transcription s'ouvre dans un éditeur intégré où vous pouvez corriger les mots mal entendus, renommer les haut-parleurs, ajuster les horodatages et ajouter des notes. Les éditions persistent dans chaque format d'exportation.