Dataset Summary UrduSpeech is a large scale, high fidelity Urdu speech corpus comprising 156 hours of audio with comprehensive 12 dimensional paralinguistic metadata. The corpus addresses the critical under resourcing of Urdu in speech technology by providing: 71,792 diarized utterances across diverse content categories Three specialized subsets: Standard Pakistani Urdu (US Std, 59.2h), Urdu English Code Switched (US CS, 89.4h), and Pakistani Accented English (US EngPk, 7.3h) 12 content categories: Comedy Show, Drama, Film, Food, Interview, News, Podcast, Poetry, Proses, Roadside Interview, Vlogs, YouTube Review Rich paralinguistic annotations: gender, age, pitch, speed, emotion, accent, tone, rhythm, texture, pronunciation, paralinguistic features, and contextual information High quality validation: Mean Opinion Score (MOS) of 4.64 (σ = 0.7) with 0.68 Cohen's Kappa inter rater reliability Gender balance: 60/40 distribution across utterances Transcription confidence: 97.6% confidence score with model generated and manually validated transcriptions The corpus was curated using a rigorous LLM driven pipeline with Gemini 2.5 Pro, addressing Urdu's unique challenges including Right to…
We use cookies for essential functionality and analytics. You can accept or reject analytics cookies.Cookie policy