Beschriftung mit SenseVoice

Funktioniert mit öffentlich zugänglichem Audio & Video. DRM-geschützte Inhalte werden nicht unterstützt.

Upgrade für Verbesserte
Privater Abschriften
Chatten Sie mit Transkript
Entsperren mit Pro →
Drop-Datei hier oder klicken Sie zum Durchsuchen
MP3, WAV, M4A, FLAC, MP4, MKV, MOV, WebM — bis zu 2 GB
Upgrade für Verbesserte
Privater Abschriften
Chatten Sie mit Transkript
Entsperren mit Pro →
Upgrade für Verbesserte
Aufzeichnung: 0:00
In Echtzeit Vosk (instant)
Verstärkt Flüstern (genau)
Öffentliche Links: 24h, nur Text · Melden Sie sich an für 7d + Audio · Pro für private Links

Echtzeit-Sprache zu Text. AI-Auto-Korrekturen, wie Sie sprechen – Genauigkeit verbessert sich mit längeren Sprache.

Testen Sie zuerst Ihr Mikrofon
❤️ Liebe STT.ai? Erzählen Sie Ihren Freunden!
Du hast deine freien Transkriptionen benutzt.

Melden Sie sich kostenlos an, um 600 Minuten zu bekommen, oder ein Upgrade von $5/Monat für Tausende mehr.

10 kostenlos min/Tag 600 min frei mit Anmeldung Keine Kreditkarte Verschlüsselt
Melde dich kostenlos an →
5.5%
WER
50
Sprachen
50.0x
Geschwindigkeit
MIT
Lizenz

Über SenseVoice

SenseVoice ist ein Sprachstiftungsmodell von FunAudioLLM, das über die Transkription hinausgeht. Es unterstützt mehr als 50 Sprachen und beinhaltet Funktionen zur Emotionserkennung, Audio-Erkennung und inverse Textnormalisierung in einem einzigen Modell.

Häufig gestellte Fragen

SenseVoice ist ein Sprach-zu-Text-Modell von FunAudioLLM. STT.ai Hosts SenseVoice auf unserer GPU-Infrastruktur, so dass Sie es ohne Bereitstellung Ihrer eigenen Hardware nutzen können – laden Sie Audio oder Video hoch und wählen Sie SenseVoice vom Modellpicker.

Auf Standard-Benchmarks erreicht SenseVoice rund 5.5% Word Error Rate. Real-Welt-Genauigkeit hängt von Audio-Qualität, Akzent und Sprache; für laute oder akzentuierte Aufnahmen, erwarten ein paar Prozentpunkte höher WER.

SenseVoice läuft auf STT.ais freier Ebene – jeder Besucher erhält 600 Minuten, um kostenlos zu starten. Bezahlte Pläne fügen längere pro-Datei-Grenzen, private Transkripte und Priorität Warteschlange hinzu.

SenseVoice wird unter MIT veröffentlicht, einer permissiven Open-Source-Lizenz. Sie können SenseVoice auf Ihrer eigenen Hardware selbst hosten oder unsere gehostete Version verwenden – beide sind kommerziell nutzbar.

SenseVoice unterstützt 50 Sprachen. Auto-Erkennung wählt die richtige Sprache für die meisten Audio-; Sie können es auch manuell für einen kleinen Genauigkeitsheber angeben.

SenseVoice verarbeitet Audio bei ca. 50.0x Echtzeit auf unseren GPUs. Eine 1-stündige Audiodatei endet in weniger als 1 Minuten; längere Dateien stehen Schlange und benachrichtigen per E-Mail, wenn getan.

SenseVoice hat 234M Parameter. Größere Modelle neigen dazu, genauer, aber langsamer zu sein; STT.ai Hosts SenseVoice auf GPU, so dass die Parameteranzahl Ihre clientseitige Leistung nicht beeinflusst.

SenseVoice akzeptiert jedes Format STT.ai unterstützt — MP3, WAV, M4A, FLAC, OGG, MP4, MKV, MOV, WebM, AVI und andere. Ausgabe als TXT, SRT, VTT, DOCX, JSON oder PDF.

Ja. Die Lautsprecherdiarisierung läuft bei jeder Transkription neben SenseVoice – jeder Lautsprecher ist beschriftet und Sie können sie anschließend im Editor umbenennen.

Ja. SenseVoice läuft in unserer verwalteten Umgebung – Audio wird standardmäßig verarbeitet und gelöscht und nie ohne explizites Opt-In zum Training verwendet. Pro-Pläne fügen Client-seitige Verschlüsselung für Transkripte in Ruhe hinzu.

Verwenden Sie das Vergleichs-stt-Tool, um SenseVoice gegen jedes andere unterstützte Modell auf dem gleichen Audio laufen zu lassen – Sie sehen WER, Segmentanzahl, Lautsprecheretiketten und Konfidenzwerte nebeneinander. Der SenseVoice vs Whisper Large V3 Vergleich ist der am häufigsten ausgeführte.

Ja. Geben Sie "sensevoice" als Modellparameter auf dem Endpunkt /v1/transcribe an. Python und Node.js SDKs enthalten SenseVoice Beispiele. Freie API-Ebene enthält 100 Minuten/Monat.

Ja. Da SenseVoice MIT-lizenziert ist, können Sie es selbst hosten. STT.ai Open-Source-Seite listet die Projekt-Repo und Gewichte. Die meisten Produktionsteams verwenden unsere gehostete Version, um GPU Beschaffung, Modell-Swaps und Ops überspringen.