Transcription en direct en ligne gratuite

Transcription en direct par IA. Parlez dans votre micro et voyez vos mots apparaître en texte en temps réel. Plus de 100 langues, 10+ modèles, 98%+ de précision.

Fonctionne avec audio et vidéo accessibles au public. Le contenu protégé par DRM n'est pas pris en charge.

Mise à niveau pour amélioration
Transcription privée
Dialogue avec la transcription
Débloquer avec Pro →
Déposer le fichier ici ou cliquer pour parcourir
MP3, WAV, M4A, FLAC, MP4, MKV, MOV, WebM — jusqu'à 2 Go
Mise à niveau pour amélioration
Transcription privée
Dialogue avec la transcription
Débloquer avec Pro →
Mise à niveau pour amélioration
Enregistrement : 0:00
Temps réel Vosk (instantanément)
Amélioration Whisper (préciser)
Liens publics: 24h, texte seulement · Inscrivez-vous pour 7d + audio · Pour pour les liaisons privées

La parole en temps réel au texte. L'IA corrige automatiquement lorsque vous parlez — la précision s'améliore avec la parole plus longue.

Testez d'abord votre microphone
❤️ Aimez STT.ai? Dites à vos amis!
Vous avez utilisé vos transcriptions gratuites

Inscrivez-vous gratuitement pour obtenir 600 minutes, ou mise à jour à partir de 5 $/mois pour des milliers de plus.

10 min/jour gratuit 600 min sans inscription Pas de carte de crédit Chiffres
Inscrivez-vous gratuitement →

1. Cliquez sur Enregistrer

Cliquez sur le bouton micro et commencez à parler. Vos mots apparaissent instantanément.

2. L'IA transcrit en direct

Vosk fournit des mots instantanés. Whisper corrige automatiquement pour la précision pendant que vous parlez.

3. Améliorer et partager

Améliorez avec la transcription IA complète. Téléchargez, partagez ou sauvegardez dans votre compte.

Également transcrire des fichiers préenregistrés

Cas d'utilisation de la transcription en direct

Prêt à essayer la transcription en direct ?

Commencer gratuitement →

Questions fréquemment posées

La transcription en direct convertit la parole en texte en temps réel, au lieu d'une fin d'enregistrement. STT.ai diffuse les mots sur votre écran dans une ou deux secondes de la parole.

Cliquez sur le microphone, laissez l'accès au micro lorsque votre navigateur vous invite, et commencez à parler — les légendes apparaissent en direct. Pour sous-titrer une réunion ou une vidéo à jouer sur votre ordinateur, partagez l'audio du système au lieu du micro.

Typiquement une à deux secondes entre la parole et le texte. Latence dépend de votre réseau et de la charge GPU actuelle; une connexion stable maintient les légendes en douceur sans grands écarts.

Il fonctionne dans Chrome, Edge, Firefox, et Safari sur le bureau et mobile, en utilisant le microphone standard et les API WebSocket. Aucun plugin ou téléchargement est nécessaire; juste accorder la permission de microphone.

Oui. STT.ai comprend 600 minutes gratuites pour commencer la transcription en direct. Les plans payés à partir de 5 $/mois ajoutent des sessions plus longues, des transcriptions privées et de la diffusion en continu prioritaire.

La transcription en direct atteint 90-95% sur la parole claire — légèrement en dessous de la transcription par lots parce que le modèle s'engage à des mots en temps réel plutôt que de passer en revue l'ensemble de l'enregistrement.

Oui. Pointez la transcription en direct à l'événement audio (audio métrique ou système) et affichez les légendes à l'écran pour faciliter l'accès. Vous pouvez également enregistrer la transcription complète lorsque la session se termine.

Oui. Plus de 100 langues sont prises en charge. Définissez la langue avant de commencer pour les résultats en temps réel les plus fiables, car la détection automatique nécessite un moment d'audio pour verrouiller la langue.

Oui. Lorsque vous arrêtez, la session en direct est enregistrée comme une transcription complète, vous pouvez modifier, renommer des haut-parleurs et exporter vers TXT, DOCX, PDF, SRT ou VTT.

Oui. La diarisation des orateurs marque les voix pendant la session, et vous pouvez les renommer en vrais noms dans la transcription enregistrée après.

Oui. L'audio en streaming est traité en temps réel et n'est pas conservé au-delà de la production de la transcription, qui est supprimée par défaut.

Les mots enroulés et tombés viennent habituellement d'un réseau instable ou parlent loin du micro. Une connexion Wi-Fi câblée ou forte et un microphone plus proche maintiennent les légendes en temps réel précis et à temps.