무료 음성 텍스트 온라인

AI 기반의 음성 변환 기능으로 음성을 텍스트로 변환하세요. 오디오 파일을 업로드하거나 마이크로폰에서 녹음하거나 URL을 붙여넣으세요. 100개 이상의 언어, 10개 이상의 모델, 98% 이상의 정확도.

공개적으로 사용 가능한 오디오 및 비디오와 함께 작동합니다. DRM 보호 콘텐츠는 지원되지 않습니다.

향상된 업그레이드
개인 녹음
녹음본과 채팅
Pro로 잠금 해제 →
파일을 여기에 드롭하거나 클릭하여 찾아보십시오.
MP3, WAV, M4A, FLAC, MP4, MKV, MOV, WebM — 최대 2GB
향상된 업그레이드
개인 녹음
녹음본과 채팅
Pro로 잠금 해제 →
향상된 업그레이드
녹음 중: 0:00
실시간 왁스 (즉각)
향상된 속삭임 (정확)
공개 링크: 24시간, 텍스트만 · 가입하기 7d + 오디오를위한 · 프로 개인 링크에 대한

실시간 음성 텍스트로. AI가 말하는 동안 자동으로 수정합니다.

먼저 마이크 테스트
❤️ STT.ai를 사랑하시나요? 친구들에게 알려주세요!
너는 너의 무료 녹음을 사용했어

무료로 가입하여 600분을 받거나 $5/월에서 수천분을 더 받으려면 업그레이드하세요.

10 무료 분/일 가입 시 600분 무료 신용카드 필요 없음 암호화됨
무료로 가입하세요 →

1. 음성 녹음 업로드

오디오 또는 비디오 파일을 업로드하거나, URL을 붙여넣거나, 마이크로 녹음하세요.

2. AI가 음성을 텍스트로 변환

10개 이상의 AI 모델 중 선택. 화자 감지 및 언어 자동 감지 포함.

3. 트랜스크립트 내보내기

6가지 형식으로 다운로드. 오디오 재생이 포함된 트랜스크립트 링크를 공유하세요.

지원되는 음성 입력 형식

음성-텍스트 변환 모델

필요에 맞는 AI 모델을 선택하세요 — 또는 최적의 모델을 선택해 드립니다.

100개 이상 언어의 음성-텍스트 변환

음성-텍스트 변환 활용 사례

음성을 텍스트로 변환할 준비가 되셨나요?

무료로 시작 →

자주 묻는 질문

음성 텍스트(음성 인식 또는 ASR)는 말하는 오디오를 쓰는 단어로 자동으로 변환합니다. STT.ai은 오디오를 듣고 타임스탬프 및 스피커 라벨이 포함된 편집 가능한 텍스트를 출력하는 AI 모델을 통해 녹음을 실행합니다.

음향 모델은 소리 파형을 음성에 매핑하고, 언어 모델은 이를 가장 가능성이 높은 단어와 구두점으로 조립합니다. STT.ai은 Whisper Large V3 및 NVIDIA Canary와 같은 모델을 사용하여 GPU에서 이 작업을 수행하므로 한 시간의 녹음은 보통 2-3분 안에 완료됩니다.

네, 모든 방문자는 첫 번째 파일에 대한 가입이 필요하지 않은 600 무료 분을 시작합니다. 유료 플랜은 $5/월부터 시작하고 더 긴 파일, 개인 전문 및 우선 처리를 추가합니다.

명확한 음성에 대해서는 최고의 모델이 95-97%의 정확도를 달성합니다(벤치마크에서 3-5%의 단어 오류율). 배경 소음, 큰 억양, 크로스토킹 또는 낮은 비트레이트 오디오로 인해 정확도가 떨어집니다. 괜찮은 마이크와 조용한 방을 사용하는 것이 가장 큰 차이를 만듭니다.

마이크로폰으로 말하면 STT.ai이 라이브 녹음 도구를 통해 라이브로 녹음을 스트리밍합니다. 말하는 동안 단어별로 녹음이 필요하지 않다면 완성된 녹음을 일괄 녹음을 위해 업로드할 수도 있습니다.

STT.ai은 100개 이상의 언어를 인식하고 대부분의 오디오에서 말하는 언어를 자동으로 감지합니다. 작은 정확도 향상을 위해 수동으로 언어를 설정할 수도 있으며 혼합 언어 녹음은 클립 중간에 전환하여 처리됩니다.

네. 스피커 디아리제이션은 각 음성에 레이블을 부여합니다(스피커 1, 스피커 2,...). 편집기에서 이름을 바꿀 수 있습니다. 모든 지원되는 모델과 언어에서 작동합니다.

STT.ai은 MP3, WAV, M4A, FLAC, OGG, MP4, MKV, MOV, WebM, AVI를 포함한 20+ 형식을 수락합니다. TXT, SRT, VTT, DOCX, JSON 또는 PDF로 출력합니다.

음성 텍스트는 말한 내용을 단어로 변환하며, 음성 인식(스피커 식별)은 말한 사람을 결정합니다. STT.ai은 음성 변환과 스피커 음성 변환을 모두 수행하지만, 이 두 용어는 서로 다른 작업을 설명합니다.

예. 오디오는 기본적으로 처리되고 삭제됩니다. Pro 플랜은 클라이언트 측 암호화를 추가하여 귀하의 키 없이는 STT.ai까지도 녹음을 읽을 수 없으며 귀하의 데이터는 명시적인 옵트인 없이는 모델 트레이닝에 사용되지 않습니다.

STT.ai에는 Python 및 Node.js SDK가 포함된 REST API와 Claude 및 Cursor용 MCP 서버가 있습니다. 무료 API 계층에는 월 100분이 포함되며, 그 이상은 초당 청구됩니다.

네, 모든 녹음본은 내장된 편집기에서 열리며, 여기서 오해를 해결하고, 스피커의 이름을 변경하고, 타임스탬프를 조정하고, 메모를 추가할 수 있습니다. 편집 내용은 모든 내보내기 형식에서 유지됩니다.