n24q02m/Qwen3 Embedding 0.6B ONNX ONNX optimized version of Qwen/Qwen3 Embedding 0.6B for use with qwen3 embed and fastembed (PR 605). Available Variants Variant File Size Description INT8 onnx/model quantized.onnx 572 MB Dynamic INT8 quantization (default) Q4F16 onnx/model q4f16.onnx 517 MB INT4 weights + FP16 activations Usage qwen3 embed fastembed Note : fastembed support requires PR 605 or install from fork: pip install git+https://github.com/n24q02m/fastembed.git@feat/qwen3 support Conversion Details Source : Qwen/Qwen3 Embedding 0.6B ONNX opset : 21 INT8 : onnxruntime.quantization.quantize dynamic (QInt8) Q4F16 : MatMulNBitsQuantizer (block size=128, symmetric) + FP16 cast Related GGUF variants: n24q02m/Qwen3 Embedding 0.6B GGUF
We use cookies for essential functionality and analytics. You can accept or reject analytics cookies.Cookie policy