Free AI Fala a texto

Transcríbe audio e vídeo a texto en máis de 100 linguas. Múltiples modelos Whisper. Detección de falantes. Non se require rexistro.

12K
transcricións
290.2K
minutos transcritos
100+
linguas
70+
ferramentas libres

Funciona con son e vídeo dispoñíbeis publicamente. Non se admiten contidos protexidos con DRM.

Actualización para mellorado
Transcripción privada
Conversa con transcrición
Desbloquear con Pro →
Solte aquí o ficheiro ou prema para examinar
MP3, WAV, M4A, FLAC, MP4, MKV, MOV, WebM — ata 2 GB
Actualización para mellorado
Transcripción privada
Conversa con transcrición
Desbloquear con Pro →
Actualización para mellorado
Gravación: 0:00
En tempo real Cera (instantánea)
Mellorado Sussurrar (preciso)
Ligazóns públicas: 24h, só texto · Inscríbete para 7d + audio · Pro para ligazóns privadas

Fala a texto en tempo real. A IA corrixe automaticamente mentres fala — a precisión mellora coa duración da fala.

Probe primeiro o micrófono
❤️ Amas STT.ai?
Esgotou as súas transcricións libres.

Inscríbase de balde para obter 600 minutos, ou actualice desde $5/mes para obter miles máis.

10 minutos libres/día 600 min gratis con rexistro Sen tarxeta de crédito Cifrado
Inscríbete gratis →
Almacenamento cifrado do lado do cliente — As súas transcricións están cifradas no seu navegador. Nin sequera nós podemos lelas. Aprenda como funciona →

Confiado por profesionais de todo o mundo

Como funciona o STT.ai

Tres pasos para unha transcrición precisa

1. Enviar, Gravar ou Apegar URL

Arrastre e solte calquera ficheiro de son ou vídeo (MP3, WAV, MP4 e máis de 20 formatos). Grave co micrófono en tempo real. Ou apegue unha ligazón de YouTube, Vimeo, TikTok e máis de 1300 plataformas.

2. A IA transcribe coa súa elección de modelo

Escolla o modelo de Whisper que mellor se axuste: Enhanced (large- v3, máis preciso), Turbo (rápido, o predeterminado), Medium ou Small. Detecte automaticamente a lingua entre 99 opcións. A diarización do falante identifica quen dixo que.

3. Exportar, compartir ou integrar

Obteña como TXT, SRT, VTT, DOCX, JSON ou PDF. Compartir mediante ligazón. Use a nosa API para integrar a transcrición no seu programa. Perfecto para subtítulos, notas de reunións, podcasts e máis.

100+
Linguas soportadas
70+
Ferramentas libres
1,300+
Plataformas soportadas
7
Formatos de exportación

API de desenvolvemento

Integre a voz a texto na súa aplicación en minutos. API RESTful con transmisión WebSocket en tempo real.

REST + WebSocket — Envio de ficheiros e transmisión en tempo real
Múltiplos modelos — Whisper Turbo, Grande V3, Medio e Pequeno
Diarización do falante — Detectar automaticamente quen dixo que
Saída flexible — JSON, TXT, SRT, VTT con marcas de tempo de palabra
import requests

response = requests.post(
    "https://api.stt.ai/v1/transcribe",
    headers={"Authorization": f"Bearer {API_KEY}"},
    files={"file": open("meeting.mp3", "rb")},
    data={
        "model": "large-v3-turbo",
        "language": "auto",
        "diarize": "true",
        "response_format": "json",
    },
)

result = response.json()
for seg in result["segments"]:
    print(f"{seg['speaker']}: {seg['text']}")

Listo para transcreber?

Envíe o seu primeiro ficheiro de balde. Sen tarxeta de crédito, sen rexistro. 600 minutos para comezar co plan gratuíto.

Comezar a transcrición

Preguntas frecuentes

voz a texto executase no navegador: apega un URL, envía un ficheiro ou grava co micrófono. STT.ai escolle o modelo de IA e devolve a transcrición en menos de 5 minutos. Exporta como TXT, SRT, VTT, DOCX, JSON ou PDF.

Si, cada visitante recibe 600 minutos libres para comezar en STT.ai, utilizábeis para voz a texto igual que calquera outro fluxo de traballo. Os plans de pago que comezan en $5/ mes desbloquean ficheiros máis longos, transcricións privadas e filas prioritarias.

voz a texto funciona cos mesmos modelos de IA que o resto de STT.ai. Os nosos mellores modelos alcanzan o 95- 97% de precisión na fala clara (3- 5% de taxa de erros de palabra nos benchmarks). Troca de modelo ao instante se a primeira pasada está por baixo do obxectivo.

voz a texto pode executarse en calquera dos modelos Whisper STT.ai — STT.ai Enhanced (Whisper large- v3, máis preciso, en plans de pago), Whisper Large V3, Whisper Turbo (rápido), Whisper Medium e Whisper Small.

Si. Todas as transcricións exportanse como SRT ou VTT, funciona con YouTube, Vimeo, TikTok, VLC e todos os principais reprodutores de vídeo. A ferramenta de gravación de subtítulos sobrepónos ao vídeo como subtítulos hardsub.

Si. A diarización dos oradores etiqueta automaticamente cada voz (Orador 1, Orador 2,...) e pode mudarlles o nome no editor incorporado. Funciona en todos os modelos e linguas.

A maioría dos voz a texto traballos rematan en menos de 5 minutos. Un ficheiro de son de 1 hora normalmente remata en 2- 3 minutos cos nosos modelos máis rápidos. A velocidade depende do modelo escollido e da carga actual da GPU.

voz a texto acepta máis de 20 formatos: MP3, WAV, M4A, FLAC, OGG, MP4, MKV, MOV, WebM, AVI e outros. A saída é TXT, SRT, VTT, DOCX, JSON ou PDF.

Si. Os ficheiros de son enviados a voz a texto son procesados e eliminados por omisión. Os plans Pro engadirán cifrado do lado do cliente - mesmo se a base de datos de STT.ai é violada, as súas transcricións son ilexibles sen a súa chave. Os datos nunca se empregan para adestramento de modelos sen unha opción explícita.

Si. STT.ai ofrece unha API REST con SDK de Python e Node. js, ademais dun servidor MCP para Claude e Cursor, todo útil para voz a texto fluxos de traballo. O nivel de API gratuíto inclúe 100 minutos/ mes.

Si. Cada transcrición ábrese no editor incorporado onde pode corrixir palabras, mudar o nome dos oradores, axustar marcas de tempo e engadir notas. Todos os cambios gárdanse automaticamente.

Cada transcrición obtén un URL único compartible. Exportar a DOCX ou PDF para correo electrónico. Os plans Pro engadirán ligazóns permanentes e protexidas por contrasinal, útiles para o traballo do cliente.

STT.ai xestiona máis de 1300 plataformas, incluíndo YouTube, Vimeo, TikTok, SoundCloud, Zoom, Google Meet, hosts de podcasts e máis. A transcrición de URL só funciona con contidos dispoñibles publicamente; non se poden transcreber fontes protexidas por DRM.