Kostenlose Rede zum Text Online

Konvertieren Sie Sprache in Text mit KI-powered Transkription. Hochladen von Audiodateien, Aufnahme von Ihrem Mikrofon, oder fügen Sie eine URL. 100+ Sprachen, 10+ Modelle, 98% + Genauigkeit.

Funktioniert mit öffentlich zugänglichem Audio & Video. DRM-geschützte Inhalte werden nicht unterstützt.

Upgrade für Verbesserte
Privater Abschriften
Chatten Sie mit Transkript
Entsperren mit Pro →
Drop-Datei hier oder klicken Sie zum Durchsuchen
MP3, WAV, M4A, FLAC, MP4, MKV, MOV, WebM — bis zu 2 GB
Upgrade für Verbesserte
Privater Abschriften
Chatten Sie mit Transkript
Entsperren mit Pro →
Upgrade für Verbesserte
Aufzeichnung: 0:00
In Echtzeit Vosk (instant)
Verstärkt Flüstern (genau)
Öffentliche Links: 24h, nur Text · Melden Sie sich an für 7d + Audio · Pro für private Links

Echtzeit-Sprache zu Text. AI-Auto-Korrekturen, wie Sie sprechen – Genauigkeit verbessert sich mit längeren Sprache.

Testen Sie zuerst Ihr Mikrofon
❤️ Liebe STT.ai? Erzählen Sie Ihren Freunden!
Du hast deine freien Transkriptionen benutzt.

Melden Sie sich kostenlos an, um 600 Minuten zu bekommen, oder ein Upgrade von $5/Monat für Tausende mehr.

10 kostenlos min/Tag 600 min frei mit Anmeldung Keine Kreditkarte Verschlüsselt
Melde dich kostenlos an →

1. Sprachaufnahme hochladen

Laden Sie eine Audio- oder Videodatei hoch, fügen Sie eine URL ein oder nehmen Sie über Ihr Mikrofon auf.

2. KI wandelt Sprache in Text um

Wählen Sie aus über 10 KI-Modellen. Sprechererkennung und automatische Spracherkennung inklusive.

3. Transkript exportieren

In 6 Formaten herunterladen. Transkript-Links mit Audiowiedergabe teilen.

Unterstützte Spracheingabeformate

Sprache-zu-Text-Modelle

Wählen Sie das KI-Modell, das Ihren Anforderungen entspricht — oder lassen Sie uns das beste auswählen.

Anwendungsfälle für Sprache zu Text

Bereit, Sprache in Text umzuwandeln?

Kostenlos starten →

Häufig gestellte Fragen

Die Sprache zum Text (auch Spracherkennung oder ASR genannt) wandelt gesprochenes Audio automatisch in geschriebene Wörter um. STT.ai läuft Ihre Aufnahme durch ein AI-Modell, das Audio anhört und editierbaren Text mit Zeitstempeln und Lautsprecheretiketten ausgibt – keine Eingabe erforderlich.

Ein akustisches Modell kartiert die Klangwellenform zu Phonemen, dann montiert ein Sprachmodell diese zu den wahrscheinlichsten Wörtern und Zeichensetzungen. STT.ai macht dies auf GPU mit Modellen wie Whisper Large V3 und NVIDIA Canary, so dass eine einstündige Aufnahme in der Regel in 2-3 Minuten erfolgt.

Ja. Jeder Besucher erhält 600 freie Minuten, um ohne Anmeldung für Ihre erste Datei zu beginnen. Bezahlte Pläne beginnen bei $ 5/Monat und fügen Sie längere Dateien, private Transkripte und Prioritätsverarbeitung hinzu.

Bei sauberer Sprache erreichen unsere besten Modelle 95-97% Genauigkeit (eine 3-5% Word Error Rate auf Benchmarks). Genauigkeit sinkt mit Hintergrundgeräuschen, starken Akzenten, Crosstalk oder niedrigbitratem Audio – mit einem anständigen Mikrofon und einem ruhigen Raum macht den größten Unterschied.

Ja. Sprechen Sie in Ihr Mikrofon und STT.ai streamt das Transkript live über das Live-Transcription-Tool. Sie können auch eine fertige Aufzeichnung für Batch-Transkription hochladen, wenn Sie es nicht Wort für Wort benötigen, während Sie sprechen.

STT.ai erkennt 100+ Sprachen und erkennt automatisch die gesprochene Sprache für die meisten Audio. Sie können die Sprache auch manuell für einen kleinen Genauigkeitslift einstellen, und gemischtsprachige Aufnahmen werden durch das Umschalten von Mid-Clip behandelt.

Ja. Speaker-Diarisierung beschriftet jede Stimme (Sprecher 1, Speaker 2,...) und Sie können sie im Editor umbenennen. Dies funktioniert über jedes unterstützte Modell und jede Sprache hinweg.

STT.ai akzeptiert 20+ Formate einschließlich MP3, WAV, M4A, FLAC, OGG, MP4, MKV, MOV, WebM und AVI. Ausgabe auf TXT, SRT, VTT, DOCX, JSON oder PDF.

Rede zu Text transkribiert WAS in Worte gesagt wurde; Spracherkennung (Sprecheridentifikation) bestimmt, wer es gesagt hat. STT.ai tut beides — Transkription plus Lautsprecherdiarisierung — aber die Begriffe beschreiben verschiedene Aufgaben.

Ja. Audio wird standardmäßig verarbeitet und gelöscht. Pro-Pläne fügen clientseitige Verschlüsselung hinzu, so dass Transkripte ohne Ihren Schlüssel unlesbar sind, sogar auf STT.ai, und Ihre Daten werden nie für Modelltraining ohne explizites Opt-In verwendet.

Ja. STT.ai hat eine REST API mit Python und Node.js SDKs sowie einen MCP-Server für Claude und Cursor. Die kostenlose API-Tier enthält 100 Minuten/Monat, wobei pro Sekunde Rechnung darüber hinaus.

Ja. Jedes Transkript öffnet sich in einem integrierten Editor, in dem Sie falsche Wörter beheben, Lautsprecher umbenennen, Zeitstempel anpassen und Notizen hinzufügen können. Edits bestehen in jedem Exportformat.