Multilingual Speaker Diarization Dataset This dataset contains synthetic multilingual speaker diarization data with Hindi, English, and Punjabi audio samples. Dataset Structure Statistics Total samples : 627 audio files Total duration : ~15 hours Languages : Hindi, English, Punjabi (monolingual, bilingual, and trilingual conversations) Speaker count : 2 5 speakers per conversation Noise levels : Clean, low, medium, high noise conditions Sample rate : 16kHz Format : WAV audio files with CSV/RTTM annotations Language Distribution Hindi only: 83 samples (13.2%) Punjabi only: 99 samples (15.8%) English only: 64 samples (10.2%) Bilingual: 189 samples (30.1%) Trilingual: 192 samples (30.6%) Usage This dataset is designed for training and evaluating speaker diarization models, particularly for multilingual scenarios. Loading the Dataset File Format Details CSV Format AudioFileName : Name of the audio file Speaker : Speaker ID (Speaker 00, Speaker 01, etc.) StartTS : Start timestamp in seconds EndTS : End timestamp in seconds Language : Language code (hi, en, pa) RTTM Format Standard RTTM format for speaker diarization evaluation: Citation License This dataset is released under the MIT Lic…
Runs entirely in your browser via DuckDB-Wasm — this dataset's real data file is loaded once, then queried locally. Nothing is sent to a server.
We use cookies for essential functionality and analytics. You can accept or reject analytics cookies.Cookie policy