無料音声変換ソフト
人工知能を利用した音声転写で音声をテキストに変換します。オーディオファイルをアップロード、マイクから録音、URLを貼り付けることができます。100以上の言語、10以上のモデル、98%以上の正確性。
1. 音声録音をアップロード
音声・動画ファイルをアップロード、URLを貼り付け、またはマイクで録音。
2. AIが音声をテキストに変換
10以上のAIモデルから選択。話者検出と言語自動検出を搭載。
3. 文字起こしをエクスポート
6つの形式でダウンロード。音声再生付きの文字起こしリンクを共有。
音声テキスト変換モデル
ニーズに合ったAIモデルを選択 — または最適なモデルをお任せください。
100以上の言語で音声をテキストに
音声をテキストに変換する準備はできましたか?
無料で始める →よくある質問
音声からテキストへの変換は、音声を文字に自動的に変換します。STT.aiは、音声を聴き、タイムスタンプとスピーカーラベルを含む編集可能なテキストを出力するAIモデルを通して、録音を実行します。タイプする必要はありません。
音響モデルは音波を音素にマッピングし、言語モデルはそれを最も似ている単語と句読点に組み合わせる。STT.aiは、GPU上で、Whisper Large V3やNVIDIA Canaryのようなモデルでこれを行い、1時間の録音は通常2〜3分で完了する。
はい、訪問者は600分無料で利用できます。 登録は必要ありません。 月額5ドルから始まり、長いファイル、プライベートの転写、優先処理を追加します。
清潔な音声に対して,我々の最良のモデルは95〜97%の正確性に達する(ベンチマークでは3〜5%の単語誤り率)。
はい。マイクに話しかけると、STT.ai はライブ転写ツールを使ってライブで転写をストリーミングします。話すときに単語ごとに必要でない場合は、完成した録音をアップロードしてバッチ転写を行うこともできます。
STT.aiは100以上の言語を認識し、ほとんどのオーディオのために話された言語を自動的に検出します。小さな精度のリフトのために手動で言語を設定することもできます。混合言語の録音はクリップの中央でスイッチを入れることで処理されます。
はい。スピーカーダイアリズムは各音声にラベルを付けます (スピーカー 1, スピーカー 2,...) それらの名前をエディタで変更できます。これはサポートされているすべてのモデルと言語で動作します。
STT.aiはMP3、WAV、M4A、FLAC、OGG、MP4、MKV、MOV、WebM、AVIなど20以上のフォーマットをサポートします。出力はTXT、SRT、VTT、DOCX、JSON、PDFです。
Speech to text transcribes WHAT was said into words; voice recognition (speaker identification) determines WHO said it. STT.ai does both — transcription plus speaker diarization — but the terms describe different tasks.
はい。オーディオは標準で処理され削除されます。プロプランはクライアント側の暗号化を追加します。それによって、転写はあなたの鍵なしでは読み取れません。STT.aiまででも読み取れます。あなたのデータは明示的にオプションを選択しない限り、モデルの訓練に使用されません。
STT.aiは Pythonと Node.js SDK を含むREST APIと Claude と Cursor のための MCP サーバを備えています。無料の API は月間100分を含み、それ以上は秒単位で請求されます。
はい。すべての転写は内蔵されたエディタで開きます。そこで誤った単語を修正し、発音者の名前を変更し、タイムスタンプを調整し、メモを追加できます。編集はすべてのエクスポートフォーマットで保持されます。