フリーAI 音声からテキストへ
100 以上の言語で音声とビデオをテキストに転写します。複数の Whisper モデル。話者検出。登録は不要です。
12K
転写
290.2K
記録された
100+
言語
70+
無料のツールを
どうやって STT.ai が動くのか
正確な転写のための3つのステップ
1. URL をアップロード、録音、または貼り付け
音声やビデオファイル (MP3、WAV、MP4、20以上のフォーマット) をドラッグ&ドロップして録音します。マイクからリアルタイムで録音できます。YouTube、Vimeo、TikTok、1,300以上のプラットフォームからリンクを貼り付けることもできます。
2)AIはモデルを選択して転写する
適切な Whisper モデルを選択: Enhanced (large-v3, 最も正確な)、Turbo (速い、デフォルト)、Medium、Small。99 のオプションから言語を自動検出します。スピーカーダイアリズムは誰が何を言ったかを識別します。
3. エクスポート、共有、統合
TXT、SRT、VTT、DOCX、JSON、または PDF としてダウンロードできます。リンクを通して共有できます。API を使って転写をアプリケーションに統合できます。字幕、会議ノート、ポッドキャストなどに最適です。
オーディオ・ビデオ用のすべて
70以上の無料ツールがAIにより動作します
100+
サポートされている言語
70+
フリーツール
1,300+
サポートされているプラットフォーム
7
エクスポートフォーマット
開発者優先型API
音声からテキストへの変換をアプリケーションに数分で統合。リアルタイム WebSocket ストリーミングを備えた RESTful API。
REST + Webソケット — ファイルアップロードとリアルタイムストリーミング
複数のモデル — ウィスペル・ターボ、ラージ・V3、ミディアム・スモール
話者の透析 — 誰が何を言ったか自動検出
柔軟な出力 — ワードタイムスタンプ付きの JSON、TXT、SRT、VTT
import requests
response = requests.post(
"https://api.stt.ai/v1/transcribe",
headers={"Authorization": f"Bearer {API_KEY}"},
files={"file": open("meeting.mp3", "rb")},
data={
"model": "large-v3-turbo",
"language": "auto",
"diarize": "true",
"response_format": "json",
},
)
result = response.json()
for seg in result["segments"]:
print(f"{seg['speaker']}: {seg['text']}")
他の音声からテキストサービスに切り替えますか?
よくある質問
音声からテキストに変換する はブラウザで実行されます。URLを貼り付け、ファイルをアップロード、またはマイクから録音します。STT.ai は AI モデルを選択し、5 分以内に転写を返します。 TXT、SRT、VTT、DOCX、JSON、PDF としてエクスポートします。
はい - 訪問者はSTT.aiで開始するために600分のフリーミニットを得ます。 音声からテキストに変換する は他のワークフローと同じように使用できます。有料プランは月額5ドルから始まり、長いファイル、プライベートトランスクリプト、優先キューをロックします。
音声からテキストに変換する は STT.ai の他の部分と同じ AI モデルで動作します。我々の最良のモデルは清潔な音声の 95-97% の正確さに達します。最初のパスが目標より低い場合は、モデルをフライで切り替えます。
音声からテキストに変換する can run on any of the Whisper models STT.ai hosts — STT.ai Enhanced (Whisper large-v3, most accurate, on paid plans), Whisper Large V3, Whisper Turbo (fast), Whisper Medium and Whisper Small.
はい。すべての字幕は SRT または VTT としてエクスポートされます。YouTube、Vimeo、TikTok、VLC、その他の主要なビデオプレーヤーで動作します。Burn-Subtitles ツールはこれらをビデオにハードサブとしてオーバーレイします。
はい。スピーカーダイアリズムは自動的に各音声にラベルを付けます (スピーカー 1, スピーカー 2, など)。内蔵エディタで名前を変更できます。すべてのモデルと言語で動作します。
音声からテキストに変換する ジョブのほとんどは 5 分以内に完了します。1 時間のオーディオファイルは、最も速いモデルでは 2-3 分で完了します。速度は選択したモデルと現在の GPU 負荷に依存します。
音声からテキストに変換する は MP3、WAV、M4A、FLAC、OGG、MP4、MKV、MOV、WebM、AVI などの 20 以上のフォーマットをサポートします。出力は TXT、SRT、VTT、DOCX、JSON、または PDF です。
はい。音声からテキストに変換するに送信されたオーディオファイルは、標準で処理され削除されます。プロプランはクライアント側暗号化を追加します。STT.aiのデータベースが破壊されたとしても、鍵なしで転写は読み取れません。データは明示的なオプションなしにモデルの訓練に使用されません。
STT.aiはPythonとNode.js SDKを使ったREST APIを提供し、ClaudeとCursorのためのMCPサーバを提供します。これらはすべて音声からテキストに変換するワークフローに使用できます。無料APIの階層には月間100分が含まれます。
はい。すべてのトランスポートは内蔵されたエディタで開きます。そこで言葉を訂正し、話者の名前を変更し、タイムスタンプを調整し、ノートを追加できます。すべての変更は自動的に保存されます。
すべての転写は共有可能なユニークな URL を持ちます。メールのために DOCX または PDF にエクスポートします。プロプランはパスワード保護された永続リンクを追加します。クライアントの作業に役立ちます。
STT.aiはYouTube、Vimeo、TikTok、SoundCloud、Zoom、Google Meet、ポッドキャストホストなど1,300以上のプラットフォームを扱う。URL転写は公開可能なコンテンツのみで動作します。DRM保護されたソースは転写できません。