Wolny AI Przemówienie do tekstu

Przepisz audio i wideo do tekstu w 100+ językach. Wiele modeli szepta. Wykrywanie głośnika. Nie wymaga się wpisu.

12K
transkrypcje
290.5K
minut przepisanych
100+
języki
70+
wolne narzędzia

Pracuje z publicznie dostępnym audio & wideo. Zawartość zabezpieczona DRM nie jest obsługiwana.

Aktualizacja dla poprawy
Prywatny transkrypt
Rozmowa z transkrypcją
Odblokuj za pomocą Pro →
Przepuść plik tutaj lub kliknij aby przeglądać
MP3, WAV, M4A, FLAC, MP4, MKV, MOV, WebM — do 2GB
Aktualizacja dla poprawy
Prywatny transkrypt
Rozmowa z transkrypcją
Odblokuj za pomocą Pro →
Aktualizacja dla poprawy
Nagrywanie: 0:00
Realizacja czasu Vosk (instant)
Poprawa Szeptanie (dokładnie)
Odnośniki publiczne: 24h, tylko tekst · Zarejestruj się. dla 7d + audio · Prof. dla odnośników prywatnych

Przemówienie w czasie rzeczywistym do tekstu. AI automatycznie poprawia się w momencie, gdy mówisz – dokładność poprawia się przy dłuższej mowie.

Najpierw sprawdź mikrofon
❤️ Love STT.ai? Tell your friends!
Użyłeś wolnych transkrypcji.

Zarejestruj się za darmo, aby dostać 600 minut, lub ulepszenie z $5/miesiąc za tysiące więcej.

10 bezpłatnych min/dzień 600 minut bezpłatnie z rejestracją Brak karty kredytowej Zaszyfrowane
Zarejestruj się za darmo →
Przechowywanie zaszyfrowane na stronie klienta — Twoje transkrypty są zaszyfrowane w twojej przeglądarce. Naucz się, jak działa. →

Zaufane przez profesjonalistów na całym świecie

Jak działa STT.ai

Trzy kroki do dokładnej transkrypcji

1. Wysyłka, zapis lub wklej URL

Przeciągnij i upuść dowolne pliki audio lub wideo (MP3, WAV, MP4 i 20+). Zapisuj z mikrofonu w czasie rzeczywistym. Albo wklej link z YouTube, Vimeo, TikTok i 1.300+ platform.

2. AI Przepisy z Twoim wyborem modelu

Wybierz model Whisper, który pasuje: Powiększony (wielka-v3, najdokładniejszy), Turbo (szybka, domyślna), Medium lub Mały. Autodetekuj język z 99 opcji. Diaryzacja głośnika identyfikuje, kto co powiedział.

3. Eksport, udział lub integracja

Pobierz jako TXT, SRT, VTT, DOCX, JSON lub PDF. Podziel się przez link. Użyj naszego API do integracji transkrypcji do aplikacji. Idealnie dla napisów, notatek spotkań, podcastów i innych.

100+
Języki obsługiwane
70+
Darmowe narzędzia
1,300+
Obsługiwane platformy
7
Eksportuj formaty

Developer- Pierwszy API

Iнтегрuj przemówienie do tekstu do aplikacji w ciągu kilku minut. RESTful API z streamingiem WebSocket w czasie rzeczywistym.

REST + WebSocket — Przesyłanie plików i strumieniowanie plików w czasie rzeczywistym
Wielokrotne modele — Szepta Turbo, Duży V3, Średni i mały
Dializacja głośnika — Samodzielnie wykryć, kto co powiedział.
Wyjście elastyczne — JSON, TXT, SRT, VTT z czasami słów
import requests

response = requests.post(
    "https://api.stt.ai/v1/transcribe",
    headers={"Authorization": f"Bearer {API_KEY}"},
    files={"file": open("meeting.mp3", "rb")},
    data={
        "model": "large-v3-turbo",
        "language": "auto",
        "diarize": "true",
        "response_format": "json",
    },
)

result = response.json()
for seg in result["segments"]:
    print(f"{seg['speaker']}: {seg['text']}")

Gotowy do transkrypcji?

Wyślij pierwszy plik za darmo. Żadnej karty kredytowej, żadnej rejestracji. 600 minut do rozpoczęcia darmowego planu.

Rozpocznij transkripcję

Często zadawane pytania

wymówka do tekstu działa w przeglądarce: wklej URL, prześlij plik lub nagraj z mikrofonu. STT.ai wybiera model AI i zwraca transkrypcję w ciągu poniżej 5 minut. Eksportuj jako TXT, SRT, VTT, DOCX, JSON lub PDF.

Tak — każdy gościn otrzyma 600 bezpłatnych minut na start na STT.ai, przydatny do użytku dla wymówka do tekstu tak samo jak każdy inny przepływ pracy. Płacone plany rozpoczynające się o $5/miesiąc odblokować dłuższe pliki, prywatne transkrypty i priorytetowe kolejowanie.

wymówka do tekstu działa na tych samych modelach AI, co reszta STT.ai — nasze najlepsze modele osiągają 95-97% dokładności w zakresie czystego wypowiedzi (3-5% Błąd słowa w odniesieniu do poziomów odniesienia). Przełącz modele w czasie lotu, jeśli pierwszy przejazd jest poniżej celu.

wymówka do tekstu może działać na dowolnym z modeli Whisper STT.ai hostów — STT.ai Advanced (Whisper big-v3, najdokładniej, na planach płatnych), Whisper Large V3, Whisper Turbo (szybko), Whisper Medium i Whisper Small.

Tak. Każdy transkryptyczny eksport jako SRT lub VTT – pracuje z YouTube, Vimeo, TikTok, VLC i każdym głównym odtwarzaczem wideo. Narzędzie wypalenia podtytułuje je na wideo jako twarde subsubsy.

Tak. Dializacja głośnika automatycznie etykietuje każdy głos (Głośnik 1, Głośnik 2,...) i można je nazwać w wbudowanym edytorze. Pracuje w każdym modelu i języku.

Większość wymówka do tekstu zakończy się w ciągu nie mniej niż 5 minut. 1-godzinny plik audio zazwyczaj zakończa się w 2-3 minuty z naszymi najszybszymi modelami. Prędkość zależy od wybranego modelu i bieżącego obciążenia GPU.

wymówka do tekstu akceptuje formaty 20+ — MP3, WAV, M4A, FLAC, OGG, MP4, MKV, MOV, WebM, AVI i więcej. Wyjście do TXT, SRT, VTT, DOCX, JSON lub PDF.

Tak. Pliki audio przekazane do wymówka do tekstu są przetwarzane i usuwane domyślnie. Plany Pro dodają szyfrowanie klienta – nawet jeśli naruszono STT.ai danych, Twoje transkrypty są nieczytelne bez klucza. Dane nigdy nie są wykorzystywane do treningu modelu bez wyraźnego opt-in.

Tak. STT.ai oferuje REST API z Python i Node.js SDKs, plus MCP serwer dla Claude i Cursor — wszystko przydatne do użytku dla wymówka do tekstu przepływów pracy. Darmowy API poziom obejmuje 100 minut/miesięczny.

Tak. Każdy transkript otwiera się w wbudowanym edytorze, gdzie można poprawić słowa, nazwę głośników, dostosować czas i dodać notatki. Wszystkie zmiany zachowują automatycznie.

Każdy transkrypt otrzymuje unikalny dzielony URL. Eksport do DOCX lub PDF do e-mailu. Pro plany dodaje hasło ochrona i stałe linki – przydatne dla pracy klienta.

STT.ai obsługuje 1300+ platformy, w tym YouTube, Vimeo, TikTok, SoundCloud, Zoom, Google Meet, podcast hosts i więcej. Transkrypcja URL działa tylko z publicznie dostępnymi treściami — źródła ochrony DRM nie mogą być transkrybowane.