Chinese Mixtral 8x7B 🚀 介绍 本项目基于Mistral发布的模型Mixtral 8x7B进行了中文扩词表增量预训练,希望进一步促进中文自然语言处理社区对MoE模型的研究。我们扩充后的词表显著提高了模型对中文的编解码效率,并通过大规模开源语料对扩词表模型进行增量预训练,使模型具备了强大的中文生成和理解能力。 项目开源内容: 中文Mixtral 8x7B扩词表大模型 扩词表增量预训练代码 请注意,Chinese Mixtral 8x7B仍然可能生成包含事实性错误的误导性回复或包含偏见/歧视的有害内容,请谨慎鉴别和使用生成的内容,请勿将生成的有害内容传播至互联网。 📥 模型下载 本项目使用QLoRA进行训练,LoRA权重与合并权重后的模型分别开源,您可以根据自己的需求选择下载: 模型名称 模型大小 下载地址 备注 : : : : : : : : Chinese Mixtral 8x7B 88GB 🤗HuggingFace 中文扩词表完整模型,可以直接使用 Chinese Mixtral 8x7B adapter 2.7GB 🤗HuggingFace LoRA权重,需要与原版Mixtral 8x7B进行合并才可以使用,合并脚本请参考这里 💻 模型推理 Chinese Mixtral 8x7B支持完整的Mixtral 8x7B模型生态,包括使用 vLLM 、 Flash Attention 2 进行加速,使用 bitsandbytes 进行模型量化等。以下是使用Chinese Mixtral 8x7B进行推理的代码示例。 使用Flash Attention 2: 使用4bit量化: 请注意,Chinese Mixtral 8x7B为基座模型,没有经过指令微调,因此指令遵循能力有限。您可以参考微调一节对模型进行微调。 📈 模型性能 模型综合能力 我们分别使用以下评测数据集对Chinese Mixtral 8x7B进行评测: C Eval:一个全面的中文基础模型评估套件。它包含了13948个多项选择题,涵盖了52个不同的学科和四个难度级别。 CMMLU:一个综合性的中文评估基准,专门用于评估语言模型在中文语境下的知识和推理能力,涵盖了从基础学科到高级专业水平的67个主题。 MMLU:一个包含57个多选任务的英文评测数据集,涵盖了初等数学、美国历史、计算机科学、法律等,难度覆盖高中水平到专家水平,是目前主流的LLM评测数据集之一。 HellaSwag:一个极具挑战的英文NLI评测数据集,每一个问题都需要对上下文进行深入理解,而不能基于常识进行回答。 根据Mistral发布的技术报告,Mixtral 8x7B在推理时将激活13B参数。下表为Chinese Mixtral 8x7B与其他13B规模的中文扩词表模型在各个评测数据集上的5 shot…
We use cookies for essential functionality and analytics. You can accept or reject analytics cookies.Cookie policy