Whisper Large V3
STT.ai runs this model on the paid tier. It is the model behind STT.ai Enhanced. Free transcription uses Whisper Large v3 Turbo, which is faster.
Siehe Pläne →
·
Mit Whisper Turbo kostenlos transferieren →
4.2%
WER
99
Sprachen
15.9x
Geschwindigkeit
MIT
Lizenz
Über Whisper Large V3
Whisper Large V3 ist das Flaggschiff Open-Source-Spracherkennungsmodell von OpenAI. Mit 1,55 Milliarden Parametern bietet es außergewöhnliche Genauigkeit in 99 Sprachen. Es verwendet eine auf 680.000 Stunden mehrsprachige Audiodaten geschulte Transformatoren-Encoder-Architektur.
Sprachen unterstützt von Whisper Large V3
Modellinformation
- AnbieterOpenAI
- Architektur-
- LizenzMIT
- AktualisiertAug 2026
Häufig gestellte Fragen
Whisper Large V3 ist ein Sprach-Text-Modell von OpenAI. STT.ai läuft es auf unserer eigenen GPU für Konten auf einem bezahlten Plan, und es ist das Modell hinter der STT.ai Enhanced tier. Kostenlose Transkription verwendet Whisper Large v3 Turbo, der schnellere Checkpoint der gleichen Familie.
Auf Standard-Benchmarks erreicht Whisper Large V3 rund 4.2% Word Error Rate. Real-Welt-Genauigkeit hängt von Audio-Qualität, Akzent und Sprache; für laute oder akzentuierte Aufnahmen, erwarten ein paar Prozentpunkte höher WER.
Whisper Large V3 läuft auf STT.ais freier Ebene – jeder Besucher erhält 600 Minuten, um kostenlos zu starten. Bezahlte Pläne fügen längere pro-Datei-Grenzen, private Transkripte und Priorität Warteschlange hinzu.
Whisper Large V3 wird unter MIT veröffentlicht, einer permissiven Open-Source-Lizenz. Sie können Whisper Large V3 auf Ihrer eigenen Hardware selbst hosten oder unsere gehostete Version verwenden – beide sind kommerziell nutzbar.
Whisper Large V3 unterstützt 99 Sprachen. Auto-Erkennung wählt die richtige Sprache für die meisten Audio-; Sie können es auch manuell für einen kleinen Genauigkeitsheber angeben.
Whisper Large V3 verarbeitet Audio bei ca. 15.9x Echtzeit auf unseren GPUs. Eine 1-stündige Audiodatei endet in weniger als 3 Minuten; längere Dateien stehen Schlange und benachrichtigen per E-Mail, wenn getan.
Whisper Large V3 hat 1.55B Parameter. Größere Modelle neigen dazu, genauer, aber langsamer zu sein; STT.ai Hosts Whisper Large V3 auf GPU, so dass die Parameteranzahl Ihre clientseitige Leistung nicht beeinflusst.
Whisper Large V3 akzeptiert jedes Format STT.ai unterstützt — MP3, WAV, M4A, FLAC, OGG, MP4, MKV, MOV, WebM, AVI und andere. Ausgabe als TXT, SRT, VTT, DOCX, JSON oder PDF.
Ja. Die Lautsprecherdiarisierung läuft bei jeder Transkription neben Whisper Large V3 – jeder Lautsprecher ist beschriftet und Sie können sie anschließend im Editor umbenennen.
Ja. Whisper Large V3 läuft in unserer verwalteten Umgebung – Audio wird standardmäßig verarbeitet und gelöscht und nie ohne explizites Opt-In zum Training verwendet. Pro-Pläne fügen Client-seitige Verschlüsselung für Transkripte in Ruhe hinzu.
Verwenden Sie das Vergleichs-stt-Tool, um Whisper Large V3 gegen jedes andere unterstützte Modell auf dem gleichen Audio laufen zu lassen – Sie sehen WER, Segmentanzahl, Lautsprecheretiketten und Konfidenzwerte nebeneinander. Der Whisper Large V3 vs Whisper Large V3 Vergleich ist der am häufigsten ausgeführte.
Ja, auf einem bezahlten Plan. Geben Sie "whisper-large-v3" als Modellparameter auf dem /v1/transcribe Endpunkt an. Es werden stattdessen Schlüssel ohne aktiven Plan bedient Whisper Large v3 Turbo. Die Anfrage gelingt immer noch; es läuft einfach das freie Modell.
Ja. Da Whisper Large V3 MIT-lizenziert ist, können Sie es selbst hosten. STT.ai Open-Source-Seite listet die Projekt-Repo und Gewichte. Die meisten Produktionsteams verwenden unsere gehostete Version, um GPU Beschaffung, Modell-Swaps und Ops überspringen.