🅜 M3E Models m3e small m3e base M3E 是 Moka Massive Mixed Embedding 的缩写 Moka,此模型由 MokaAI 训练,开源和评测,训练脚本使用 uniem ,评测 BenchMark 使用 MTEB zh Massive,此模型通过 千万级 (2200w+) 的中文句对数据集进行训练 Mixed,此模型支持中英双语的同质文本相似度计算,异质文本检索等功能,未来还会支持代码检索 Embedding,此模型是文本嵌入模型,可以将自然语言转换成稠密的向量 🆕 更新说明 2023.06.24,添加微调 M3E 的教程 notebook,几行代码,更佳适配! 2023.06.14,添加了三个中文开源文本嵌入模型到评测中,包括 UER, ErLangShen, DMetaSoul 2023.06.08,添加检索任务的评测结果,在 T2Ranking 1W 中文数据集上,m3e base 在 ndcg@10 上达到了 0.8004,超过了 openai ada 002 的 0.7786 2023.06.07,添加文本分类任务的评测结果,在 6 种文本分类数据集上,m3e base 在 accuracy 上达到了 0.6157,超过了 openai ada 002 的 0.5956 ⚖️ 模型对比 参数数量 维度 中文 英文 s2s s2p s2c 开源 兼容性 s2s Acc s2p ndcg@10 m3e small 24M 512 是 否 是 否 否 是 优 0.5834 0.7262 m3e base 110M 768 是 是 是 是 否 是 优 0.6157 0.8004 text2vec 110M 768 是 否 是 否 否 是 优 0.5755 0.6346 openai ada 002 未知 1536 是 是 是 是 是 否 优 0.5956 0.7786 说明: s2s, 即 sentence to sentence ,代表了同质文本之间的嵌入能力,适用任务:文本相似度,重复问题检测,文本分类等 s2p, 即 sentence to passage ,代表了异质文本之间的嵌入能力,适用任务:文本检索,GPT 记忆模块等 s2c, 即 sentence to code ,代表了自然语言和程序语言之间的嵌入能力,适用任务:代码检索 兼容性,代表了模型在开源社区中各种项目被支持的程度,由于 m3e 和 text2vec 都可以直接通过 sentence transformers 直接使用,所以和 openai 在社区的支持度上相当 ACC & ndcg@10,详情见下方的评测 Tips: 使用场景主要是中文,少量英文的情况,建议使用 m3e 系列的模型 多语言使用场景,并且不介意数据隐私的话,我…
We use cookies for essential functionality and analytics. You can accept or reject analytics cookies.Cookie policy