NVIDIA Parakeet

STT.ai führt dieses Modell nicht aus. Diese Seite ist Referenzinformationen darüber. Transcribe mit den Modellen, die wir ausführen →
3.0%
WER
1
Sprachen
55.0x
Geschwindigkeit
CC-BY-4.0
Lizenz

Über NVIDIA Parakeet

NVIDIA Parakeet TDT 1.1B ist ein hochmodernes englisches ASR-Modell mit FastConformer-Architektur mit Token-and-Duration Transducer (TDT). Es erreicht nahezu menschliche Genauigkeit auf Standard-Englisch Benchmarks und ist hoch optimiert für NVIDIA GPUs.

Sprachen unterstützt von NVIDIA Parakeet

Häufig gestellte Fragen

NVIDIA Parakeet ist ein Sprach-Text-Modell von NVIDIA. STT.ai läuft derzeit nicht NVIDIA Parakeet — diese Seite ist Referenzinformationen über das Modell. Für Transkription auf STT.ai, bietet der Modellpicker die Whisper-Familie (Turbo, Large V3, Medium, Small).

Auf Standard-Benchmarks erreicht NVIDIA Parakeet rund 3.0% Word Error Rate. Real-Welt-Genauigkeit hängt von Audio-Qualität, Akzent und Sprache; für laute oder akzentuierte Aufnahmen, erwarten ein paar Prozentpunkte höher WER.

NVIDIA Parakeet ist nicht auf STT.ai verfügbar. Die eigenen Lizenzbedingungen regeln den Betrieb selbst. STT.ais freie Ebene deckt die Whisper Modelle, die wir laufen - 600 Minuten bis zum Start, dann eine monatliche kostenlose Top-up.

NVIDIA Parakeet wird unter CC-BY-4.0 veröffentlicht, einer permissiven Open-Source-Lizenz. Sie können NVIDIA Parakeet auf Ihrer eigenen Hardware selbst hosten oder unsere gehostete Version verwenden – beide sind kommerziell nutzbar.

NVIDIA Parakeet unterstützt 1 Sprachen. Auto-Erkennung wählt die richtige Sprache für die meisten Audio-; Sie können es auch manuell für einen kleinen Genauigkeitsheber angeben.

NVIDIA Parakeet verarbeitet Audio bei ca. 55.0x Echtzeit auf unseren GPUs. Eine 1-stündige Audiodatei endet in weniger als 1 Minuten; längere Dateien stehen Schlange und benachrichtigen per E-Mail, wenn getan.

NVIDIA Parakeet hat 1.1B Parameter. Größere Modelle neigen dazu, genauer, aber langsamer zu sein; STT.ai Hosts NVIDIA Parakeet auf GPU, so dass die Parameteranzahl Ihre clientseitige Leistung nicht beeinflusst.

NVIDIA Parakeet akzeptiert jedes Format STT.ai unterstützt — MP3, WAV, M4A, FLAC, OGG, MP4, MKV, MOV, WebM, AVI und andere. Ausgabe als TXT, SRT, VTT, DOCX, JSON oder PDF.

Ja. Die Lautsprecherdiarisierung läuft bei jeder Transkription neben NVIDIA Parakeet – jeder Lautsprecher ist beschriftet und Sie können sie anschließend im Editor umbenennen.

Ja. NVIDIA Parakeet läuft in unserer verwalteten Umgebung – Audio wird standardmäßig verarbeitet und gelöscht und nie ohne explizites Opt-In zum Training verwendet. Pro-Pläne fügen Client-seitige Verschlüsselung für Transkripte in Ruhe hinzu.

Verwenden Sie das Vergleichs-stt-Tool, um NVIDIA Parakeet gegen jedes andere unterstützte Modell auf dem gleichen Audio laufen zu lassen – Sie sehen WER, Segmentanzahl, Lautsprecheretiketten und Konfidenzwerte nebeneinander. Der NVIDIA Parakeet vs Whisper Large V3 Vergleich ist der am häufigsten ausgeführte.

Ja. Geben Sie "nvidia-parakeet" als Modellparameter auf dem Endpunkt /v1/transcribe an. Python und Node.js SDKs enthalten NVIDIA Parakeet Beispiele. Freie API-Ebene enthält 100 Minuten/Monat.

Ja. Da NVIDIA Parakeet CC-BY-4.0-lizenziert ist, können Sie es selbst hosten. STT.ai Open-Source-Seite listet die Projekt-Repo und Gewichte. Die meisten Produktionsteams verwenden unsere gehostete Version, um GPU Beschaffung, Modell-Swaps und Ops überspringen.