AI ボイスクロナー
短いオーディオクリップからどんな声でもクローンできます。3-10秒の音声をアップロードし、テキストを入力して同じ声でオーディオを生成します。
クローン: 3-10秒の参照クリップを提供します。プレセット: 多言語音声のバンドルから選択します。
音声参照音声をアップロード
MP3, WAV, M4A, FLAC
VibeVoiceのプレセットは英語、ドイツ語、フランス語、日本語、韓国語、ポーランド語、ポルトガル語、スペイン語、イタリア語、オランダ語をカバーします。
最大500文字
0/500
世代ごとに1クレジット使用
どうやって働くのか
1
参照をアップロード
クローンしたい声から3-10秒の明瞭な音声を提供してください。
2
人工知能が音声を分析する
F5‐TTSは音色,ピッチ,話し方,アクセントなどの音声特性を抽出する。
3
音声を生成
テキストはクローンされた音声で読み上げられます。結果を WAV としてダウンロードします。
声のクローンは個人的な認可のみの使用です。話者の同意なしに声をクローンしてはなりません。
よくある質問
声のクローン化 はブラウザで実行されます。URLを貼り付け、ファイルをアップロード、またはマイクから録音します。STT.ai は AI モデルを選択し、5 分以内に転写を返します。 TXT、SRT、VTT、DOCX、JSON、PDF としてエクスポートします。
はい - 訪問者はSTT.aiで開始するために600分のフリーミニットを得ます。 声のクローン化 は他のワークフローと同じように使用できます。有料プランは月額5ドルから始まり、長いファイル、プライベートトランスクリプト、優先キューをロックします。
声のクローン化 は STT.ai の他の部分と同じ AI モデルで動作します。我々の最良のモデルは清潔な音声の 95-97% の正確さに達します。最初のパスが目標より低い場合は、モデルをフライで切り替えます。
声のクローン化はSTT.aiの10以上のモデルで動作します。STT.ai Enhanced (最も正確)、Whisper Large V3 (99言語)、NVIDIA Canary (#1 WER on supported langs)、Whisper Turbo (fast)、Moonshine (lightweight)、その他。
はい。すべての字幕は SRT または VTT としてエクスポートされます。YouTube、Vimeo、TikTok、VLC、その他の主要なビデオプレーヤーで動作します。Burn-Subtitles ツールはこれらをビデオにハードサブとしてオーバーレイします。
はい。スピーカーダイアリズムは自動的に各音声にラベルを付けます (スピーカー 1, スピーカー 2, など)。内蔵エディタで名前を変更できます。すべてのモデルと言語で動作します。
声のクローン化 ジョブのほとんどは 5 分以内に完了します。1 時間のオーディオファイルは、最も速いモデルでは 2-3 分で完了します。速度は選択したモデルと現在の GPU 負荷に依存します。
声のクローン化 は MP3、WAV、M4A、FLAC、OGG、MP4、MKV、MOV、WebM、AVI などの 20 以上のフォーマットをサポートします。出力は TXT、SRT、VTT、DOCX、JSON、または PDF です。
はい。声のクローン化に送信されたオーディオファイルは、標準で処理され削除されます。プロプランはクライアント側暗号化を追加します。STT.aiのデータベースが破壊されたとしても、鍵なしで転写は読み取れません。データは明示的なオプションなしにモデルの訓練に使用されません。
STT.aiはPythonとNode.js SDKを使ったREST APIを提供し、ClaudeとCursorのためのMCPサーバを提供します。これらはすべて声のクローン化ワークフローに使用できます。無料APIの階層には月間100分が含まれます。
はい。すべてのトランスポートは内蔵されたエディタで開きます。そこで言葉を訂正し、話者の名前を変更し、タイムスタンプを調整し、ノートを追加できます。すべての変更は自動的に保存されます。
すべての転写は共有可能なユニークな URL を持ちます。メールのために DOCX または PDF にエクスポートします。プロプランはパスワード保護された永続リンクを追加します。クライアントの作業に役立ちます。
STT.aiはYouTube、Vimeo、TikTok、SoundCloud、Zoom、Google Meet、ポッドキャストホストなど1,300以上のプラットフォームを扱う。URL転写は公開可能なコンテンツのみで動作します。DRM保護されたソースは転写できません。