話者検出と話者分離

音声・動画の文字起こしで異なる話者を自動的に識別・ラベル付け。誰が何を言ったかを正確に把握。

公開されているオーディオとビデオで動作します。DRM 保護されたコンテンツはサポートされていません。

アップグレード
プライベート・トランスクリプト
転写付きチャット
プロでロック解除 →
ファイルをここにドラッグまたはクリックしてブラウズ
MP3, WAV, M4A, FLAC, MP4, MKV, MOV, WebM — 最大2GB
アップグレード
プライベート・トランスクリプト
転写付きチャット
プロでロック解除 →
アップグレード
録音: 0:00
リアルタイム ワックス (瞬間)
強化 囁き (正確)
公開リンク:24時間、テキストのみ · 登録 7d+オーディオのための · プロ 私的なリンクを

リアルタイムの音声からテキストに変換。AI は話すときに自動的に訂正します。長い話をすると正確さが向上します。

まずマイクをテストしてください
❤️ STT.aiを愛しているなら 友達に伝えて!
あなたは無料の転写を使った

無料で登録して600分を得るか、月5ドルからアップグレードして、 さらに何千人もの人に話せるようになる。

10分フリー/日 600分無料 クレジットカードなし 暗号化
無料登録 →

話者分離とは?

話者分離とは、音声ストリームを話者の身元に基づいてセグメントに分割するプロセスです。簡単に言えば、「誰がいつ話したか?」という質問に答えます。 This is essential for multi-speaker recordings like meetings, interviews, podcasts, conference calls, and legal proceedings where knowing who said what is just as important as what was said.

STT.ai uses advanced neural speaker diarization models that can detect and label speakers in real time. The system creates speaker embeddings -- numerical representations of each voice's unique characteristics -- and clusters them to distinguish between different people. This works even when speakers have similar voices or frequently interrupt each other.

話者検出の仕組み

1. 音声活動検出

システムはまず、どの音声セグメントに発話が含まれ、どれが無音、音楽、背景ノイズかを識別します。

2. 話者エンベディング

各発話セグメントは話者エンベディングに変換されます — 話者のユニークな声の特徴を捉えたコンパクトなベクトルです。

3. クラスタリングとラベリング

エンベディングをクラスタリングして同じ話者のセグメントをグループ化し、各クラスタにラベルを割り当てます(話者1、話者2など)。

話者検出の活用事例

会議の文字起こし
会議録音の各参加者を自動的にラベル付け。誰が何を言ったかを明確にした議事録を作成。
ポッドキャストの文字起こし
ポッドキャストエピソードのホストとゲストを区別。正確な話者帰属のショーノートを作成。
インタビューの文字起こし
研究、ジャーナリズム、採用ドキュメント用にインタビュアーと回答者の回答を分離。
法律とコンプライアンス
明確な話者識別付きの供述書、聴聞会、コンプライアンスコールの公式記録を作成。

STT.aiの話者検出

Speaker detection is available on all paid plans. When you transcribe audio or video with speaker detection enabled, the transcript will include speaker labels inline with the text. You can also export speaker-labeled transcripts in all supported formats including SRT, VTT, DOCX, JSON, and PDF.

Speaker 1 [00:00:01]: Welcome to the meeting, everyone. Let's start with the quarterly review. Speaker 2 [00:00:05]: Thanks. I have the numbers ready. Revenue is up 23% quarter over quarter. Speaker 1 [00:00:12]: That's great news. Can you walk us through the breakdown?

The system can detect up to 20 distinct speakers in a single recording. For best results, ensure each speaker has at least a few seconds of solo speech. Overlapping speech is handled but may reduce accuracy in heavily cross-talked segments.

話者検出を今すぐ試す

複数話者の録音をアップロードして、話者が自動的にラベル付けされるのをご覧ください。

無料で文字起こしを開始

よくある質問

話者検出 はブラウザで実行されます。URLを貼り付け、ファイルをアップロード、またはマイクから録音します。STT.ai は AI モデルを選択し、5 分以内に転写を返します。 TXT、SRT、VTT、DOCX、JSON、PDF としてエクスポートします。

はい - 訪問者はSTT.aiで開始するために600分のフリーミニットを得ます。 話者検出 は他のワークフローと同じように使用できます。有料プランは月額5ドルから始まり、長いファイル、プライベートトランスクリプト、優先キューをロックします。

話者検出 は STT.ai の他の部分と同じ AI モデルで動作します。我々の最良のモデルは清潔な音声の 95-97% の正確さに達します。最初のパスが目標より低い場合は、モデルをフライで切り替えます。

話者検出はSTT.aiの10以上のモデルで動作します。STT.ai Enhanced (最も正確)、Whisper Large V3 (99言語)、NVIDIA Canary (#1 WER on supported langs)、Whisper Turbo (fast)、Moonshine (lightweight)、その他。

はい。すべての字幕は SRT または VTT としてエクスポートされます。YouTube、Vimeo、TikTok、VLC、その他の主要なビデオプレーヤーで動作します。Burn-Subtitles ツールはこれらをビデオにハードサブとしてオーバーレイします。

はい。スピーカーダイアリズムは自動的に各音声にラベルを付けます (スピーカー 1, スピーカー 2, など)。内蔵エディタで名前を変更できます。すべてのモデルと言語で動作します。

話者検出 ジョブのほとんどは 5 分以内に完了します。1 時間のオーディオファイルは、最も速いモデルでは 2-3 分で完了します。速度は選択したモデルと現在の GPU 負荷に依存します。

話者検出 は MP3、WAV、M4A、FLAC、OGG、MP4、MKV、MOV、WebM、AVI などの 20 以上のフォーマットをサポートします。出力は TXT、SRT、VTT、DOCX、JSON、または PDF です。

はい。話者検出に送信されたオーディオファイルは、標準で処理され削除されます。プロプランはクライアント側暗号化を追加します。STT.aiのデータベースが破壊されたとしても、鍵なしで転写は読み取れません。データは明示的なオプションなしにモデルの訓練に使用されません。

STT.aiはPythonとNode.js SDKを使ったREST APIを提供し、ClaudeとCursorのためのMCPサーバを提供します。これらはすべて話者検出ワークフローに使用できます。無料APIの階層には月間100分が含まれます。

はい。すべてのトランスポートは内蔵されたエディタで開きます。そこで言葉を訂正し、話者の名前を変更し、タイムスタンプを調整し、ノートを追加できます。すべての変更は自動的に保存されます。

すべての転写は共有可能なユニークな URL を持ちます。メールのために DOCX または PDF にエクスポートします。プロプランはパスワード保護された永続リンクを追加します。クライアントの作業に役立ちます。

STT.aiはYouTube、Vimeo、TikTok、SoundCloud、Zoom、Google Meet、ポッドキャストホストなど1,300以上のプラットフォームを扱う。URL転写は公開可能なコンテンツのみで動作します。DRM保護されたソースは転写できません。