Distil-Whisper

STT.ai はこのモデルを実行していません。このページはそのモデルの参考情報です。 モデルを使って 転写して →
5.8%
WER
99
言語
48.0x
スピード
MIT
ライセンス

情報 Distil-Whisper

Distil‐Whisperは,Hugging Faceによって作成されたWhisperの蒸留版である。

よくある質問

Distil-Whisper は Hugging Face による音声からテキストへの変換モデルです。STT.ai は現在 Distil-Whisper を実行していません。このページはモデルに関する参考情報です。STT.ai の転写に対して、モデル選択器は Whisper ファミリー (Turbo, Large V3, Medium, Small) を提供します。

標準ベンチマークでは、Distil-Whisperは約5.8%のワードエラー率を達成しています。実際の精度は音声品質、アクセント、言語に依存します。ノイズやアクセントのある録音の場合、数パーセント高いWERを期待してください。

Distil-WhisperはSTT.aiでは利用できません。ライセンス条件は自分で実行するのが適しています。STT.aiのフリー版は Whisper モデルを実行します。600分の開始時間と月額無料の追加料金があります。

Distil-Whisperは、オープンソースライセンスのMITでリリースされています。Distil-Whisperを自分のハードウェア上でセルフホストすることも、私たちのホストバージョンを使用することもできます。どちらも商用利用可能です。

Distil-Whisper は 99 言語をサポートします。自動検出はほとんどのオーディオに適した言語を選択します。手動で指定することもできます。

Distil-WhisperはGPU上で音声を約48.0xのリアルタイムで処理します。1時間の音声ファイルは1分以下で終了します。長いファイルはキューに並び、完了したらメールで通知します。

Distil-Whisper には 756M パラメータがあります。より大きなモデルはより正確ですが、遅い傾向にあります。STT.ai は GPU 上で Distil-Whisper をホストしていますので、パラメータ数はクライアント側の性能に影響しません。

Distil-WhisperはSTT.aiがサポートするすべてのフォーマットを受け入れます。MP3、WAV、M4A、FLAC、OGG、MP4、MKV、MOV、WebM、AVIなど。出力はTXT、SRT、VTT、DOCX、JSON、PDFです。

はい。スピーカーダイアリゼーションはDistil-Whisperと共に実行されます。各スピーカーはラベル付きで、後でエディタで名前を変更できます。

はい。Distil-Whisper回の実行を管理環境で行います。オーディオはデフォルトで処理され削除され、明示的なオプションなしに訓練に使用されません。プロプランは静止中の転写に対してクライアント側暗号化を追加します。

Distil-Whisperと同じオーディオでサポートされている他のモデルを比較するには compare-stt ツールを使用してください。WER、セグメント数、スピーカーラベル、信頼度スコアが並んで表示されます。Distil-Whisperと Whisper Large V3 の比較が最もよく行われます。

はい。 /v1/transcribe エンドポイントにモデルパラメータとして"distil-whisper"を指定してください。PythonとNode.js SDKにはDistil-Whisperの例が含まれています。無料のAPIは月間100分の利用が含まれています。

STT.aiのオープンソースページにはプロジェクトのリポと重みがリストされています。ほとんどのプロダクションチームは、GPUの調達、モデルのスワップ、オペレーションを省略するために、私たちのホストバージョンを使用しています。