CCU Multilingual Speech Dataset Dataset Summary This dataset contains segmented speech audio and transcripts for multiple languages: Korean (ko), Chinese (zh), Hebrew (he), and Turkish (tr).It was inspired by data collected for the DARPA CCU [(Cross Cultural Understanding Program)] (https://www.darpa.mil/research/programs/computational cultural understanding) and meant to resemble that data. Data is organized by language/split folders such as: ko train ko dev ko test (and similarly for zh , he , tr ) Each split includes: .tsv (metadata / transcript table) audio files under files 000/ , files 001/ , ... (for large splits) Languages ko (Korean) zh (Chinese) he (Hebrew) tr (Turkish) Data Fields TSV columns are: audio path (relative path to wav file) transcript / text Splits Current split naming convention: train dev test Example: ko train/train.tsv ko dev/dev.tsv ko test/test.tsv Attribution When using or redistributing items from this dataset, please credit each item as: "[title]" by [uploader] ([uploader id]), [webpage url], licensed under Creative Commons Attribution (reuse allowed) (or: license unconfirmed, selected via YouTube CC filter) . Audio extracted, segmented, and transcri…
We use cookies for essential functionality and analytics. You can accept or reject analytics cookies.Cookie policy