Qwen3.6 35B A3B APEX I Balanced + Native MTP head (Lynn 推荐 server grade 本地版) 这是 Qwen3.6 35B A3B 的 APEX I Balanced 量化 + MTP head 完整保留 版,在 Lynn GB10 Spark 上实测 think on 长链 75 85 TPS (无 MTP baseline ~66 TPS),适合 24GB+ 显存 / 32GB+ 内存的本地高质量推理。 定位: 端侧 35B 主力,质量接近 BF16,MTP 加速 30% 在 thinking 场景 。 English summary: this is the Qwen3.6 35B A3B model with APEX adaptive precision MoE quantization (I Balanced variant) with the vendor shipped MTP (Multi Token Prediction) head preserved for use with llama.cpp spec type draft mtp . Lynn benchmarked on NVIDIA GB10 Spark (sm 121). Pairs with the lighter Lynn 9B GGUF imatrix release for the Lynn 4 quadrant matrix's heavyweight local tier. 文件 / Files 文件 大小 SHA256 备注 : Qwen3.6 35B A3B APEX MTP I Balanced.gguf 24.27 GiB (26.06 GB) 9bf7d96bb3a9d363e645dd998aee9e9bff8e016a82aec7ff081e0e6cdb53419e APEX I Balanced 量化 + MTP head( blk.40.nextn.eh proj/enorm/hnorm/shared head norm ) 量化来源:本仓库 GGUF 来自社区 APEX quant 流程(adaptive precision MoE),Lynn 未重新量化 ,只做 Spark TPS / 集成验证 + 双语 README + 发布镜像。原始量化产物归属社区 APEX quant project。 为什么选这一档 35B A3B(35B 总参数 / 3B active expert)是 Qwen 在 2025 端侧推理性价比之王: active 3B params → decode 速度跟 dense 3 4B 接近(GB10 Spark 单流 60+ TPS) total 35B +…
We use cookies for essential functionality and analytics. You can accept or reject analytics cookies.Cookie policy