AIモデル

Choose Your Transcription Engine - 主な音声認識モデルの正確性、速度、言語サポートを比較。

正しいモデルを選ぶ方法

異なる転写モデルは異なる領域で優れている。このガイドを使って、あなたのニーズに最適なモデルを選択してください。

モデル WER スピード 言語 ベスト・フォー
STT.ai Enhanced 3.2% 160.0x 100 STT.aiの旗艦モデルで、 クラス最高の正確さと速度を持ち、 生産性の高いワークロードに最適化されています。
Whisper Large V3 4.2% 8.0x 99 OpenAIの最大で最も正確な Whisper モデル。99 言語の優れた多言語サポート。
Whisper Turbo 5.1% 32.0x 99 OpenAIの速度最適化 Whisper 変種 Large V3より4倍速く 精度の損失は最小限
NVIDIA Canary 3.5% 45.0x 4 英語で最高の精度を持つ NVIDIA のマルチタスク ASR モデル。NeMo フレームワークに基づいています。
Moonshine 7.8% 80.0x 1 端末用に設計された超軽量の ASR モデル。Raspberry Pi 上で最小の遅延で動作します。
NVIDIA Parakeet 3.0% 55.0x 1 NVIDIA の CTC に基づく英語 ASR モデル。最も正確なオープンソース英語モデルの一つ。
SenseVoice 5.5% 50.0x 50 音声イベント検出と感情認識を組み合わせた多言語音声理解モデルを提案した。
Distil-Whisper 5.8% 48.0x 99 Whisper Large V3の蒸留版。 6倍速く、パラメータは49%減少し、精度は維持されている。
Vosk 12.0% 100.0x 20 軽量なオフライン音声認識。インターネットなしで動作し、プライバシーに敏感なユーザや組み込みユーザに適しています。

ワードエラー率(WER)とは何か。

単語誤り率 (WER) は音声認識の正確性を測る標準的な指標です。転写中の単語の割合が参照と異なるかどうかを計算します。WER が 5% なら、100 語中 5 語が誤りを含んでいます。低いほど良い。

プロの人間の転写者は通常4〜5%のWERを達成する。

どのモデルを使うか分からないのですか?

私たちのデフォルトの Whisper Large V3 Turbo を試してみてください。速度と正確性のバランスが良いです。無料で始められ、登録は不要です。

無料で転写を開始