자유 AI 음성을 텍스트로

100개 이상의 언어로 오디오 및 비디오를 텍스트로 변환합니다. 여러 Whisper 모델. 스피커 감지. 가입이 필요하지 않습니다.

12K
번역
290.2K
번역된 분
100+
언어
70+
무료 도구

공개적으로 사용 가능한 오디오 및 비디오와 함께 작동합니다. DRM 보호 콘텐츠는 지원되지 않습니다.

향상된 업그레이드
개인 녹음
녹음본과 채팅
Pro로 잠금 해제 →
파일을 여기에 드롭하거나 클릭하여 찾아보십시오.
MP3, WAV, M4A, FLAC, MP4, MKV, MOV, WebM — 최대 2GB
향상된 업그레이드
개인 녹음
녹음본과 채팅
Pro로 잠금 해제 →
향상된 업그레이드
녹음 중: 0:00
실시간 왁스 (즉각)
향상된 속삭임 (정확)
공개 링크: 24시간, 텍스트만 · 가입하기 7d + 오디오를위한 · 프로 개인 링크에 대한

실시간 음성 텍스트로. AI가 말하는 동안 자동으로 수정합니다.

먼저 마이크 테스트
❤️ STT.ai를 사랑하시나요? 친구들에게 알려주세요!
너는 너의 무료 녹음을 사용했어

무료로 가입하여 600분을 받거나 $5/월에서 수천분을 더 받으려면 업그레이드하세요.

10 무료 분/일 가입 시 600분 무료 신용카드 필요 없음 암호화됨
무료로 가입하세요 →
클라이언트 측 암호화 스토리지 — 브라우저에서 암호화되어 있어요 우리도 읽을 수 없어요 작동 방법 알아보기 →

전 세계 전문가들의 신뢰

STT.ai 작동 방식

정확한 번역을 위한 3단계

1. 업로드, 녹화 또는 URL 붙여넣기

오디오 또는 비디오 파일(MP3, WAV, MP4, 20+ 형식)을 드래그 앤 드롭하여 마이크로폰으로 실시간으로 녹음하거나 YouTube, Vimeo, TikTok 및 1,300+ 플랫폼에서 링크를 붙여넣을 수 있습니다.

2. AI는 모델의 선택에 따라 녹음

향상된(large-v3, 가장 정확한), 터보(빠른, 기본), 중간 또는 작은 맞는 Whisper 모델을 선택합니다. 99 옵션에서 언어를 자동으로 감지. 스피커 다이어리 식별 누가 무엇을 말했다.

3. 내보내기, 공유 또는 통합

TXT, SRT, VTT, DOCX, JSON 또는 PDF로 다운로드하고 링크를 통해 공유하세요. API를 사용하여 앱에 기록을 통합하세요. 자막, 회의 메모, 팟캐스트 등에 완벽합니다.

100+
지원되는 언어
70+
무료 도구
1,300+
지원되는 플랫폼
7
내보내기 형식

개발자 우선 API

몇 분 안에 음성 변환을 앱에 통합하세요. 실시간 WebSocket 스트리밍을 지원하는 RESTful API.

REST + 웹소켓 — 파일 업로드 및 실시간 스트리밍
여러 모델 — Whisper Turbo, 라지 V3, 미디엄 및 스몰
스피커 디아리제이션 — 누가 무엇을 말했는지 자동으로 감지
유연한 출력 — JSON, TXT, SRT, VTT와 단어 타임스탬프
import requests

response = requests.post(
    "https://api.stt.ai/v1/transcribe",
    headers={"Authorization": f"Bearer {API_KEY}"},
    files={"file": open("meeting.mp3", "rb")},
    data={
        "model": "large-v3-turbo",
        "language": "auto",
        "diarize": "true",
        "response_format": "json",
    },
)

result = response.json()
for seg in result["segments"]:
    print(f"{seg['speaker']}: {seg['text']}")

다른 음성에서 텍스트 서비스로 전환하시겠습니까?

녹음할 준비가 되셨나요?

첫 번째 파일을 무료로 업로드하세요. 신용카드 없이 가입도 불가합니다. 무료 플랜을 시작하기 위해 600분이 필요합니다.

번역 시작

자주 묻는 질문

브라우저에서 실행되는 음성을 텍스트로 : URL을 붙여넣기, 파일을 업로드하거나 마이크에서 녹음합니다. STT.ai은 AI 모델을 선택하고 5분 이내에 녹음을 반환합니다. TXT, SRT, VTT, DOCX, JSON 또는 PDF로 내보내기.

예 — 방문자는 STT.ai에서 시작할 때 600분의 무료 시간을 얻으며, 다른 워크플로와 동일하게 음성을 텍스트로에서 사용할 수 있습니다. $5/월부터 시작하는 유료 플랜은 더 긴 파일, 개인 전자 서류, 우선 순위 큐를 잠금 해제합니다.

음성을 텍스트로은 STT.ai의 나머지 부분과 동일한 AI 모델을 사용합니다. 우리의 최고 모델은 명확한 음성에 대해 95-97%의 정확도를 달성합니다(벤치마크에서 3-5%의 단어 오류율). 첫 번째 패스가 목표치 이하라면 모델을 즉시 전환하십시오.

음성을 텍스트로 can run on any of the Whisper models STT.ai hosts — STT.ai Enhanced (Whisper large-v3, most accurate, on paid plans), Whisper Large V3, Whisper Turbo (fast), Whisper Medium and Whisper Small.

모든 녹음은 YouTube, Vimeo, TikTok, VLC, 모든 주요 비디오 플레이어에서 작동하는 SRT 또는 VTT로 내보냅니다. 자막 레코딩 도구는 하드 서브텍스트로 비디오에 자막을 오버레이합니다.

스피커 디아리제이션은 자동으로 각 음성에 레이블을 부여합니다(스피커 1, 스피커 2,...) 그리고 내장된 편집기에서 이름을 변경할 수 있습니다. 모든 모델과 언어에서 작동합니다.

대부분의 음성을 텍스트로 작업은 5분 이내에 완료됩니다. 1시간 오디오 파일은 일반적으로 가장 빠른 모델에서 2-3분 안에 완료됩니다. 속도는 선택한 모델과 현재 GPU 부하에 따라 다릅니다.

음성을 텍스트로 accepts 20+ formats — MP3, WAV, M4A, FLAC, OGG, MP4, MKV, MOV, WebM, AVI, and more. Output to TXT, SRT, VTT, DOCX, JSON, or PDF.

음성을 텍스트로에 제출된 오디오 파일은 기본적으로 처리되고 삭제됩니다. Pro 플랜은 클라이언트 측 암호화를 추가합니다. STT.ai의 데이터베이스가 침해된 경우에도 키 없이는 녹음된 내용을 읽을 수 없습니다. 데이터는 명시적인 옵트인 없이는 모델 트레이닝에 사용되지 않습니다.

STT.ai은 Python 및 Node.js SDK가 포함된 REST API를 제공하며 Claude 및 Cursor용 MCP 서버를 제공합니다. 이 모든 기능은 음성을 텍스트로 워크플로우에서 사용할 수 있습니다. 무료 API 계층에는 월 100분이 포함됩니다.

네, 모든 녹음은 내장된 편집기에서 열리며, 여기에서 단어를 수정하고, 발표자 이름을 변경하고, 타임스탬프를 조정하고, 메모를 추가할 수 있습니다. 모든 변경 사항은 자동으로 저장됩니다.

모든 녹음은 공유할 수 있는 고유 URL을 얻습니다. 이메일을 위해 DOCX 또는 PDF로 내보내기. 프로 플랜은 암호로 보호된 영구 링크를 추가하여 클라이언트 작업에 유용합니다.

STT.ai은 YouTube, Vimeo, TikTok, SoundCloud, Zoom, Google Meet, 팟캐스트 호스트 등 1,300개 이상의 플랫폼을 처리합니다. URL 변환은 공개적으로 사용 가능한 콘텐츠만 작동합니다. DRM 보호 소스는 변환할 수 없습니다.