新闻 News [2024 04 06] 开源puff系列模型, 专门针对检索和语义匹配任务,更多的考虑泛化性和私有通用测试集效果,向量维度可变,中英双语 。 [2024 02 27] 开源stella mrl large zh v3.5 1792d模型,支持 向量可变维度 。 [2024 02 17] 开源stella v3系列、dialogue编码模型和相关训练数据。 [2023 10 19] 开源stella base en v2 使用简单, 不需要任何前缀文本 。 [2023 10 12] 开源stella base zh v2和stella large zh v2, 效果更好且使用简单, 不需要任何前缀文本 。 [2023 09 11] 开源stella base zh和stella large zh 欢迎去本人主页查看最新模型,并提出您的宝贵意见! 1 开源清单 本次开源2个通用向量编码模型和一个针对dialogue进行编码的向量模型,同时开源全量160万对话重写数据集和20万的难负例的检索数据集。 开源模型: ModelName ModelSize MaxTokens EmbeddingDimensions Language Scenario C MTEB Score infgrad/stella base zh v3 1792d 0.4GB 512 1792 zh CN 通用文本 67.96 infgrad/stella large zh v3 1792d 1.3GB 512 1792 zh CN 通用文本 68.48 infgrad/stella dialogue large zh v3 1792d 1.3GB 512 1792 zh CN 对话文本 不适用 开源数据: 1. 全量对话重写数据集 约160万 2. 部分带有难负例的检索数据集 约20万 上述数据集均使用LLM构造,欢迎各位贡献数据集。 2 使用方法 2.1 通用编码模型使用方法 直接SentenceTransformer加载即可: 2.2 dialogue编码模型使用方法 使用场景: 在一段对话中,需要根据用户语句去检索相关文本,但是对话中的用户语句存在大量的指代和省略,导致直接使用通用编码模型效果不好, 可以使用本项目的专门的dialogue编码模型进行编码 使用要点: 1. 对dialogue进行编码时,dialogue中的每个utterance需要是如下格式: "{ROLE}: {TEXT}" ,然后使用 [SEP] join一下 2. 整个对话都要送入模型进行编码,如果长度不够就删掉早期的对话, 编码后的向量本质是对话中最后一句话的重写版本的向量!! 3. 对话用stella dialogue large zh v3 1792d编码,被检索文本使用stella lar…
We use cookies for essential functionality and analytics. You can accept or reject analytics cookies.Cookie policy