Dataset Card for wili 2018 Table of Contents Dataset Description Dataset Summary Supported Tasks and Leaderboards Languages Dataset Structure Data Instances Data Fields Data Splits Dataset Creation Curation Rationale Source Data Annotations Personal and Sensitive Information Considerations for Using the Data Social Impact of Dataset Discussion of Biases Other Known Limitations Additional Information Dataset Curators Licensing Information Citation Information Contributions Dataset Description Homepage: https://zenodo.org/record/841984 Repository: [Needs More Information] Paper: https://arxiv.org/pdf/1801.07779 Leaderboard: [Needs More Information] Point of Contact: Thoma, Martin (Email: info@martin thoma.de) Dataset Summary WiLI 2018, the Wikipedia language identification benchmark dataset, contains 235000 paragraphs of 235 languages. The dataset is balanced and a train test split is provided. Supported Tasks and Leaderboards [Needs More Information] Languages 235 Different Languages Dataset Structure Data Instances Data Fields [Needs More Information] Data Splits 175000 lines of text each for train and test data. Dataset Creation Curation Rationale [Needs More Information] Source D…
We use cookies for essential functionality and analytics. You can accept or reject analytics cookies.Cookie policy