Dataset Card for CommitPackFT Table of Contents Table of Contents Dataset Description Dataset Summary Languages Dataset Structure Data Instances Data Fields Data Splits Dataset Creation Curation Rationale Source Data Annotations Additional Information Licensing Information Citation Information Contributions Dataset Description Repository: https://github.com/bigcode project/octopack Paper: OctoPack: Instruction Tuning Code Large Language Models Point of Contact: Niklas Muennighoff Dataset Summary CommitPackFT is a 2GB filtered version of CommitPack to contain only high quality commit messages that resemble natural language instructions. Creation: The dataset can be recreated using instructions available here. Languages: 277 OctoPack🐙🎒: Data CommitPack 4TB of GitHub commits across 350 programming languages CommitPackFT Filtered version of CommitPack for high quality commit messages that resemble instructions Model OctoCoder StarCoder (16B parameters) instruction tuned on CommitPackFT + OASST OctoGeeX CodeGeeX2 (6B parameters) instruction tuned on CommitPackFT + OASST Evaluation HumanEvalPack Extension of OpenAI's HumanEval to cover 3 scenarios across 6 languages Dataset…
We use cookies for essential functionality and analytics. You can accept or reject analytics cookies.Cookie policy