X Voice Training Dataset Overview The X Voice training dataset is a large scale multilingual speech corpus curated for high performance speech models. It provides a robust foundation for cross lingual phonetic and prosodic modeling. Also the train set of X Voice Model. Core Statistics Total Speech Duration : 420K hours 30 languages European : bg (Bulgarian), cs (Czech), da (Danish), de (German), el (Greek), en (English), es (Spanish), et (Estonian), fi (Finnish), fr (French), hr (Croatian), hu (Hungarian), it (Italian), lt (Lithuanian), lv (Latvian), mt (Maltese), nl (Dutch), pl (Polish), pt (Portuguese), ro (Romanian), ru (Russian), sk (Slovak), sl (Slovenian), sv (Swedish). Asian : id (Indonesian), ja (Japanese), ko (Korean), th (Thai), vi (Vietnamese), zh (Chinese). Data Sources We aggregate high quality open source speech datasets across languages: Chinese & English : Emilia Vietnamese, Thai, Indonesian : GigaSpeech 2 Korean : KoreaSpeech Japanese : ReazonSpeech Russian : LEMAS European Languages (Spanish, Italian, French, etc.) : Multilingual Librispeech (MLS), Granary Source Format Sample Rate Emilia mp3 24kHz Gigaspeech2 flac 16kHz KoreaSpeech flac 16kHz ReazonSpeech flac 16…
We use cookies for essential functionality and analytics. You can accept or reject analytics cookies.Cookie policy