星辰语义大模型 TeleChat2 🦉 github ️ • 🤗 Hugging Face • 🤖 ModelScope • 🏔 MindSpore • 🐾 gitee ️ • 💬 WeChat 目录 模型介绍 效果评测 模型推理 声明、协议、引用 最新动态 2024.11.08 开源 TeleChat2 3B 、 TeleChat2 7B 、 TeleChat2 35B ,该版本模型均具备 Function Call 功能。 2024.10.18 开源TeleChat2 35B模型。 2024.9.20 开源TeleChat2 115B模型,该模型是 首个完全国产算力训练并开源的千亿参数模型 。 模型介绍 星辰语义大模型 TeleChat2 星辰语义大模型 TeleChat2 是由中国电信人工智能研究院研发训练的大语言模型,该系列模型 完全基于国产算力 训练。 本次开源的 TeleChat2 3B 、 TeleChat2 7B 、 TeleChat2 35B 模型已支持 工具调用 功能。在 Function Call 方面,我们针对性进行了效果优化,在相关榜单评测上相比同尺寸模型均有较好表现。 TeleChat2 115B 模型采用10万亿 Tokens中英文高质量语料进行训练,同步开源对话模型 TeleChat2 115B 的多格式、多平台权重文件。 TeleChat2 在训练数据、训练方法等方面进行了改进,在通用问答和知识类、代码类、数学类榜单上相比 TeleChat1 均有大幅提升。 TeleChat2 完全基于国产算力和国产深度学习框架进行训练,算力和算法框架更自主可控。优化MP、PP、SP实现方式提升模型性能,优化算子来提升训练速度。 我们使用大量小模型实验来验证scaling law规律,在不同模型结构、不同数据配比和数据清洗方式中寻找最优设计。 采用RingAttention及其他序列切分方式,实现长文训练性能提升;通过ntk aware+attention scaling的方式保证训练长度切换时的平稳过渡,以此来保证模型在不同长度数据下的训练效果。 在微调数据方面,我们进行了指令复杂性提升与多样性扩充,通过数据合成和人工标注生成高质量数据,并使用拒绝采样生成多样的推理路径;通过研究一套基于base模型反向选择偏好对齐数据方案,基于适配数据最大限度提升模型效果。 通用能力较TeleChat系列模型提升超过29%,在逻辑推理、总结摘要、长文写作和数学计算上均有大幅提升。 模型结构 我们采用标准的 Decoder only 结构设计了 TeleChat2 模型,使用 Rotary Embedding 的位置编码方法、使用 SwiGLU 激活函数来替代GELU激活函数、使用基于 RMSNorm 的 Pre Normalization进行…
We use cookies for essential functionality and analytics. You can accept or reject analytics cookies.Cookie policy