Speaker Detection & Diarization

Automatically identify and label different speakers in your audio and video transcriptions. Know exactly who said what.

Bekerja dengan audio & video yang tersedia di publik. Isi yang dilindungi DRM tidak didukung.

Tingkatkan untuk Diperbarui
Transkrip pribadi
Percakapan dengan transkrip
Buka Kunci dengan Pro →
Jatuhkan berkas di sini atau klik untuk diramban
MP3, WAV, M4A, FLAC, MP4, MKV, MOV, WebM sembari 2GB
Tingkatkan untuk Diperbarui
Transkrip pribadi
Percakapan dengan transkrip
Buka Kunci dengan Pro →
Tingkatkan untuk Diperbarui
Rekaman: 0:00
Real-time Vosk (instant)
Enhanced Berbisik (akurat)
Link publik: 24h, hanya teks · Daftar untuk audio 7d + · Pro untuk sambungan privat

Pidato real-time dengan teks. AI auto-treksis saat Anda berbicara dengan akurasi meningkatkan dengan pidato yang lebih panjang.

Uji mikrofon Anda terlebih dahulu
❤️ Katakan pada teman-temanmu!
Anda telah menggunakan transkripsi gratis Anda

Daftarlah gratis untuk mendapatkan 600 menit, atau upgrade dari $9/bulan untuk ribuan lebih.

10 menit/hari bebas 600 menit gratis dengan signup Tidak ada kartu kredit Terenkripsi
Bebas mendaftar →

What is Speaker Diarization?

Speaker diarization is the process of partitioning an audio stream into segments according to the identity of the speaker. In simpler terms, it answers the question "who spoke when?" This is essential for multi-speaker recordings like meetings, interviews, podcasts, conference calls, and legal proceedings where knowing who said what is just as important as what was said.

STT.ai uses advanced neural speaker diarization models that can detect and label speakers in real time. The system creates speaker embeddings -- numerical representations of each voice's unique characteristics -- and clusters them to distinguish between different people. This works even when speakers have similar voices or frequently interrupt each other.

How Speaker Detection Works

1. Voice Activity Detection

The system first identifies which segments of audio contain speech versus silence, music, or background noise.

2. Speaker Embedding

Each speech segment is converted into a speaker embedding -- a compact vector that captures the unique vocal characteristics of the speaker.

3. Clustering & Labeling

Embeddings are clustered to group segments from the same speaker together, then each cluster is assigned a label (Speaker 1, Speaker 2, etc.).

Use Cases for Speaker Detection

Meeting Transcription
Automatically label each participant in meeting recordings. Generate minutes with clear attribution of who said what.
Podcast Transcription
Distinguish between host and guests in podcast episodes. Create show notes with proper speaker attribution.
Interview Transcription
Separate interviewer and interviewee responses for research, journalism, and hiring documentation.
Legal & Compliance
Create official records of depositions, hearings, and compliance calls with clear speaker identification.

Speaker Detection on STT.ai

Speaker detection is available on all paid plans. When you transcribe audio or video with speaker detection enabled, the transcript will include speaker labels inline with the text. You can also export speaker-labeled transcripts in all supported formats including SRT, VTT, DOCX, JSON, and PDF.

Speaker 1 [00:00:01]: Welcome to the meeting, everyone. Let's start with the quarterly review. Speaker 2 [00:00:05]: Thanks. I have the numbers ready. Revenue is up 23% quarter over quarter. Speaker 1 [00:00:12]: That's great news. Can you walk us through the breakdown?

The system can detect up to 20 distinct speakers in a single recording. For best results, ensure each speaker has at least a few seconds of solo speech. Overlapping speech is handled but may reduce accuracy in heavily cross-talked segments.

Try speaker detection now

Upload a multi-speaker recording and see speakers automatically labeled.

Start Transcribing Free

Pertanyaan yang Sering Diajukan

deteksi speaker berjalan di peramban Anda: paste URL, upload file, atau rekam dari mic Anda. STT.ai mengambil model AI dan mengembalikan transkrip dalam waktu kurang dari 5 menit. Ekspor sebagai TXT, SRT, VTT, DOCX, JSON, atau PDF.

Yes — every visitor gets 600 free minutes/month on STT.ai, usable for deteksi speaker the same as any other workflow. Paid plans starting at $9/month unlock longer files, private transcripts, and priority queueing.

deteksi speaker berjalan pada model AI yang sama seperti sisa STT.ai ▪ model terbaik kita mencapai 95-97% akurasi pada pidato yang bersih (3-5% Word Errors Rates pada benchmarks). Tukar model pada lalat jika lulus pertama adalah di bawah target Anda.

deteksi speaker dapat menjalankan salah satu model Whisper STT.ai host STT.ai Enhanced (Whisper big-v3, paling akurat, pada rencana yang dibayar), Whisper Besar V3, Whisper Turbo (cepat), Whispering Medium dan Whisper Small.

Setiap transkrip ekspor sebagai SRT atau VTT в bekerja dengan YouTube, Vimeo, TikTok, VLC, dan setiap pemutar video utama. alat subtitles terbakar overlays mereka ke video sebagai hardsubs.

Diaraisasi pembicara secara otomatis menandai setiap suara (Speaker 1, Speaker 2,...) dan Anda dapat mengubah nama mereka dalam editor bawaan.

Kebanyakan deteksi speaker pekerjaan selesai dalam waktu kurang dari 5 menit. Berkas audio 1 jam biasanya selesai dalam 2-3 menit dengan model tercepat kita. Kecepatan tergantung pada model pilihan dan muatan GPU saat ini.

deteksi speaker menerima 20+ format ▪ MP3, WAV, M4A, FLAC, OGG, MP4, MKV, MOV, WebM, AVI, dan lebih. Keluaran ke TXT, SRT, VTT, DOCX, JSON, atau PDF.

Ya. file audio yang dikirim ke deteksi speaker diproses dan dihapus secara baku. pro rencana menambahkan enkripsi sisi klien ▪ bahkan jika database STT.ai dilanggar, transkrip anda tidak dapat dibaca tanpa kunci anda. Data tidak pernah digunakan untuk pelatihan model tanpa eksplisit opt-in.

STT.ai menawarkan API TERHEBAT dengan Python dan Node.js SDKs, ditambah server MCP untuk Claude dan Kursor ▪ semua dapat digunakan untuk alur kerja deteksi speaker. Tingkat API gratis mencakup 100 menit/bulan.

Ya. setiap transkrip dibuka di dalam editor yang dibangun dimana anda dapat memperbaiki kata, mengubah nama speaker, menyesuaikan penanda waktu, dan menambahkan catatan. Semua perubahan disimpan secara otomatis.

Setiap transkrip mendapat URL yang unik untuk dibagi. Ekspor ke DOCX atau PDF untuk email. Rencana pro menambahkan password-proteksi dan sambungan permanen å berguna untuk klien kerja.

STT.ai menangani 1.300 platforms+ termasuk YouTube, Vimeo, TikTok, SoundCloud, Zoom, Google Meet, podcast host, dan lebih. URL transkripsi bekerja dengan konten yang tersedia secara publik hanya DRM-protected sourcess tidak dapat ditranskripsi.