STT.ai Enhanced
STT.ai runs this model on the paid tier. It is the model behind STT.ai Enhanced. Free transcription uses Whisper Large v3 Turbo, which is faster.
Siehe Pläne →
·
Mit Whisper Turbo kostenlos transferieren →
4.2%
WER
99
Sprachen
15.9x
Geschwindigkeit
MIT
Lizenz
Über STT.ai Enhanced
STT.ai Enhanced ist unser präzises und schnellstes Sprach-zu-Text-Modell. Es basiert auf modernster Transformator-Architektur mit proprietären Optimierungen und liefert branchenführende Wortfehlerraten in über 100 Sprachen. Ideal für Produktionstranskription, Echtzeit-Beschriftung und Unternehmensanwendungen.
Sprachen unterstützt von STT.ai Enhanced
✦ Verbessertes Modell entsperren
Erhalten Sie Zugriff auf unser genauestes Modell mit jedem bezahlten Plan — Whisper large-v3, 99 Sprachen und Lautsprecher-Diarisierung.
Pläne anzeigen →Modellinformation
- AnbieterOpenAI (hosted by STT.ai)
- Architektur-
- LizenzMIT
- AktualisiertAug 2026
Häufig gestellte Fragen
STT.ai Enhanced ist ein Sprach-Text-Modell von OpenAI (hosted by STT.ai). STT.ai läuft es auf unserer eigenen GPU für Konten auf einem bezahlten Plan, und es ist das Modell hinter der STT.ai Enhanced tier. Kostenlose Transkription verwendet Whisper Large v3 Turbo, der schnellere Checkpoint der gleichen Familie.
Auf Standard-Benchmarks erreicht STT.ai Enhanced rund 4.2% Word Error Rate. Real-Welt-Genauigkeit hängt von Audio-Qualität, Akzent und Sprache; für laute oder akzentuierte Aufnahmen, erwarten ein paar Prozentpunkte höher WER.
STT.ai Enhanced ist ein Premiummodell – inklusive mit einem bezahlten STT.ai-Plan ab $9/Monat. Es ist nicht auf der freien Ebene verfügbar: kostenlose und anonyme Uploads laufen Whisper Turbo statt.
STT.ai Enhanced wird unter MIT veröffentlicht, einer permissiven Open-Source-Lizenz. Sie können STT.ai Enhanced auf Ihrer eigenen Hardware selbst hosten oder unsere gehostete Version verwenden – beide sind kommerziell nutzbar.
STT.ai Enhanced unterstützt 99 Sprachen. Auto-Erkennung wählt die richtige Sprache für die meisten Audio-; Sie können es auch manuell für einen kleinen Genauigkeitsheber angeben.
STT.ai Enhanced verarbeitet Audio bei ca. 15.9x Echtzeit auf unseren GPUs. Eine 1-stündige Audiodatei endet in weniger als 3 Minuten; längere Dateien stehen Schlange und benachrichtigen per E-Mail, wenn getan.
STT.ai Enhanced hat 1.55B Parameter. Größere Modelle neigen dazu, genauer, aber langsamer zu sein; STT.ai Hosts STT.ai Enhanced auf GPU, so dass die Parameteranzahl Ihre clientseitige Leistung nicht beeinflusst.
STT.ai Enhanced akzeptiert jedes Format STT.ai unterstützt — MP3, WAV, M4A, FLAC, OGG, MP4, MKV, MOV, WebM, AVI und andere. Ausgabe als TXT, SRT, VTT, DOCX, JSON oder PDF.
Ja. Die Lautsprecherdiarisierung läuft bei jeder Transkription neben STT.ai Enhanced – jeder Lautsprecher ist beschriftet und Sie können sie anschließend im Editor umbenennen.
Ja. STT.ai Enhanced läuft in unserer privaten Infrastruktur – Audio wird standardmäßig verarbeitet und gelöscht. Pro+ fügt clientseitige Verschlüsselung hinzu, so dass Transkripte ohne Ihren Schlüssel nicht lesbar sind, und Private Cloud ermöglicht es Ihnen, STT.ai Enhanced vollständig in Ihrem eigenen VPC zu hosten.
Verwenden Sie das Vergleichs-stt-Tool, um STT.ai Enhanced gegen jedes andere unterstützte Modell auf dem gleichen Audio laufen zu lassen – Sie sehen WER, Segmentanzahl, Lautsprecheretiketten und Konfidenzwerte nebeneinander. Der STT.ai Enhanced vs Whisper Large V3 Vergleich ist der am häufigsten ausgeführte.
Ja, auf einem bezahlten Plan. Geben Sie "stt-ai-enhanced" als Modellparameter auf dem /v1/transcribe Endpunkt an. Es werden stattdessen Schlüssel ohne aktiven Plan bedient Whisper Large v3 Turbo. Die Anfrage gelingt immer noch; es läuft einfach das freie Modell.
Ja. Da STT.ai Enhanced MIT-lizenziert ist, können Sie es selbst hosten. STT.ai Open-Source-Seite listet die Projekt-Repo und Gewichte. Die meisten Produktionsteams verwenden unsere gehostete Version, um GPU Beschaffung, Modell-Swaps und Ops überspringen.