非官方仓库,仅作学习交流使用 This is a well performed large language model developed by China Telecom AI, welcome to download and develop on top of it! 星辰语义大模型 TeleChat2 🤗 Hugging Face • 🤖 ModelScope • 🏔 MindSpore • 🐾 gitee ️ • 💬 WeChat 目录 模型介绍 效果评测 声明、协议、引用 最新动态 2024.9.20 开源TeleChat2 115B模型,该模型是 首个完全国产算力训练并开源的千亿参数模型 。 模型介绍 星辰语义大模型 TeleChat2 星辰语义大模型 TeleChat2 是由中国电信人工智能研究院研发训练的大语言模型,该系列模型 完全基于国产算力训练 。 本次开源 TeleChat2 115B 模型采用10万亿 Tokens中英文高质量语料进行训练,同步开源对话模型 TeleChat2 115B 的多格式、多平台权重文件。 TeleChat2 在训练数据、训练方法等方面进行了改进,在通用问答和知识类、代码类、数学类榜单上相比 TeleChat1 均有大幅提升。 TeleChat2 完全基于国产算力和国产深度学习框架进行训练,算力和算法框架更自主可控。优化MP、PP、SP实现方式提升模型性能,优化算子来提升训练速度。 我们使用大量小模型实验来验证scaling law规律,在不同模型结构、不同数据配比和数据清洗方式中寻找最优设计。 采用RingAttention及其他序列切分方式,实现长文训练性能提升;通过ntk aware+attention scaling的方式保证训练长度切换时的平稳过渡,以此来保证模型在不同长度数据下的训练效果。 在微调数据方面,我们进行了指令复杂性提升与多样性扩充,通过数据合成和人工标注生成高质量数据,并使用拒绝采样生成多样的推理路径;通过研究一套基于base模型反向选择偏好对齐数据方案,基于适配数据最大限度提升模型效果。 通用能力较TeleChat系列模型提升超过29%,在逻辑推理、总结摘要、长文写作和数学计算上均有大幅提升。 模型结构 我们采用标准的 Decoder only 结构设计了 TeleChat2 模型,使用 Rotary Embedding 的位置编码方法、使用 SwiGLU 激活函数来替代GELU激活函数、使用基于 RMSNorm 的 Pre Normalization进行层标准化操作。我们将 TeleChat2 的词嵌入层和输出lm head层参数分开,有助于增强训练稳定性和收敛性。我们选择了GQA以节约attention部分的参数量和计算量、提升训练和推理速度。 TeleChat2 的模…
We use cookies for essential functionality and analytics. You can accept or reject analytics cookies.Cookie policy