ruri v3 310m GGUF Q4 K M imatrix cl nagoya/ruri v3 310m を GGUF 形式に変換し、 importance matrix (imatrix) を用いて Q4 K M に量子化したモデルです。 このモデルは 埋め込みモデル であり、チャット用のモデルではありません。 ファイル ruri v3 310m Q4 K M imatrix.gguf : imatrix キャリブレーション付きで生成した Q4 K M 量子化モデル。 benchmarks/benchmark summary.json : サイズ、速度、品質比較をまとめたサマリ。 benchmarks/jmteb jsts q4 scores.json : この GGUF に対する JMTEB JSTS の生結果。 使い方 llama.cpp embedding llama.cpp server 比較サマリ 量子化と評価は、Hugging Face の元重みから変換した F16 GGUF を基準に実施しました。 項目 結果 ファイルサイズ 203.87 MiB F16 GGUF 比 602.59 MiB 203.87 MiB ( 66.17%) Q8 0 GGUF 比 321.34 MiB 203.87 MiB ( 36.56%) F16 との埋め込み類似度 Pairwise Pearson 0.99697 F16 との検索整合性 Top 1 agreement 0.96, Top 3 overlap 0.96 JMTEB JSTS Spearman 0.843297 0.839365 ( 0.003932, 0.47%) GPU スループット RTX 3070 Ti, prompt 512 avg 17180 32000 tok/s (1.86x) 補足 変換には、ModernBERT アーキテクチャとこのモデルの SentencePiece tokenizer に対応させた patched llama.cpp を使っています。 Q4 K M 量子化は日本語テキストで作成した imatrix を用いて生成しています。 評価環境の llama cpp python は modern bert を読めなかったため、JMTEB 評価は llama.cpp の embedding CLI backend で実施しました。 関連リポジトリ Q8 0 版: Targoyle/ruri v3 310m GGUF 元モデル: cl nagoya/ruri v3 310m This is a GGUF release of cl nagoya/ruri v3 310m quantized to Q4 K M with an importance matrix (im…
We use cookies for essential functionality and analytics. You can accept or reject analytics cookies.Cookie policy