X Voice Training Dataset Overview The X Voice training dataset is a large scale multilingual speech corpus curated for high performance speech models. It provides a robust foundation for cross lingual phonetic and prosodic modeling. Also the train set of X Voice Model. Core Statistics Total Speech Duration : 420K hours 30 languages European : bg (Bulgarian), cs (Czech), da (Danish), de (German), el (Greek), en (English), es (Spanish), et (Estonian), fi (Finnish), fr (French), hr (Croatian), hu (Hungarian), it (Italian), lt (Lithuanian), lv (Latvian), mt (Maltese), nl (Dutch), pl (Polish), pt (Portuguese), ro (Romanian), ru (Russian), sk (Slovak), sl (Slovenian), sv (Swedish). Asian : id (Indonesian), ja (Japanese), ko (Korean), th (Thai), vi (Vietnamese), zh (Chinese). Data Sources We aggregate high quality open source speech datasets across languages: Chinese & English : Emilia Vietnamese, Thai, Indonesian : GigaSpeech 2 Korean : KoreaSpeech Japanese : ReazonSpeech Russian : LEMAS European Languages (Spanish, Italian, French, etc.) : Multilingual Librispeech (MLS), Granary Source Format Sample Rate Emilia mp3 24kHz Gigaspeech2 flac 16kHz KoreaSpeech flac 16kHz ReazonSpeech flac 16…
Runs entirely in your browser via DuckDB-Wasm — this dataset's real data file is loaded once, then queried locally. Nothing is sent to a server.
We use cookies for essential functionality and analytics. You can accept or reject analytics cookies.Cookie policy