
512专家MoE压到2.4比特Qwen3.8-Flash-Next-GSQ-RCO-GGUF项目全景解读【免费下载链接】Qwen3.8-Flash-Next-GSQ-RCO-GGUF项目地址: https://ai.gitcode.com/hf_mirrors/ISTA-DASLab/Qwen3.8-Flash-Next-GSQ-RCO-GGUFQwen3.8-Flash-Next-GSQ-RCO-GGUF 是一个面向 512 专家 MoE 大模型的高质量 GGUF 量化项目。它使用 GSQ RCO 混合精度量化技术把 Qwen3.8-Flash-Next 压缩到 2.4~3.5 比特体积缩小 5 倍以上性能却几乎无损且提供多模态视觉组件可在 llama.cpp、Ollama、LM Studio 中直接运行。 项目速览把 MoE 巨无霸压进消费级设备Qwen3.8-Flash-Next 是一个稀疏混合专家MoE模型每层有512 个路由专家共 48 层每个 token 只激活其中 10 个。专家矩阵占了绝大部分参数所以也占了体积预算的 95%——这就是压缩的重点。与传统一刀切量化不同本项目采用非均匀混合精度量化GSQGumbel-Softmax 量化逐张量学习最优的低比特标量量化在 2~3 比特下几乎拉平标量量化与向量量化的差距RCO黎曼约束优化在总体积预算约束下为 352 个张量逐一分配最合适的量化类型最终产物是标准 GGUF 文件无需任何魔改即可在主流推理框架中运行。项目由奥地利科技研究院 DASLab 实验室制作许可证为 apache-2.0。 四个量化版本哪个最适合你仓库提供 4 种规格外加一个共享的视觉投影器 mmproj每个版本都是 2 个分片版本平均比特总大小定位Q2_0/2.40 bpw66.4 GB⚡ 速度优先推理吞吐最高IQ2_XS/2.50 bpw68.0 GB 同质量下体积最小IQ3_XXS/3.00 bpw75.8 GB⚖️ 显存紧张时的甜点IQ3_S/3.50 bpw83.6 GB 官方推荐质量最强质量方面对照 BF16 原始模型354 GB任务均分 93.12IQ3_S均分 93.26在 GPQA-Diamond92.93上反超原模型AIME25 满分 100.00IQ3_XXS均分 92.57达到原模型 99.4% 的水平体积却小 4.7 倍Q2_0 / IQ2_XS均分约 89.1在仅 2.4~2.5 比特下仍保住 95% 以上的能力⚡ Q2_0 为什么快 3.4 倍Q2_0 版本刻意避开了依赖大查找表的量化格式——那些格式虽然更省但解码开销大。实测llama.cpp55 条提示词版本提示词吞吐解码速度平均延迟Q2_0367.49 t/s93.79 t/s6.70 sIQ2_XS108.19 t/s70.30 t/s12.68 s在长提示词场景RAG 检索、长文写作优势最大——RAG 场景下 Q2_0 快 9.6 倍而在短提示词的推理类场景两者基本持平。追求吞吐选 Q2_0追求均衡选 IQ3_XXS 或 IQ3_S。 快速上手本地部署三步走# 1. 克隆仓库 git clone https://gitcode.com/hf_mirrors/ISTA-DASLab/Qwen3.8-Flash-Next-GSQ-RCO-GGUF # 2. 下载模型以 IQ3_XXS 为例两个分片都要下 hf download ISTA-DASLab/Qwen3.8-Flash-Next-GSQ-RCO-GGUF --include IQ3_XXS/* --local-dir . # 3. 用 llama.cpp 运行 llama-cli -m IQ3_XXS/Qwen3.8-Flash-Next-GSQ-RCO-IQ3_XXS-00001-of-00002.gguf \ -lm mmap --lazy-mode on -ngl 99 -p 你好显存规划小技巧只有第一分片transformer 权重需要常驻显存第二分片是 28.8 GB 的 n-gram 查找表按行稀疏读取配合-lm mmap --lazy-mode on可以留在 SSD 上内存映射显存需求立减近 29 GB版本需常驻显存可留在磁盘Q2_037.6 GB28.8 GBIQ3_XXS47.0 GB28.8 GBIQ3_S54.8 GB28.8 GBOllama 用户直接ollama run仓库名即可LM Studio 中搜索仓库名选择对应版本。多模态玩法则搭配仓库里的 mmproj-Qwen3.8-Flash-Next-BF16.gguf视觉编码器0.91 GB四个版本通用用llama-mtmd-cli加载即可看图。 透明可审计每个张量的量化分配都公开项目附带 tensor-allocation/ 目录下的分配清单例如 Qwen3.8-Flash-Next-GSQ-RCO-IQ3_S-00001-of-00002.rco-allocation.txt逐条列出 1223 个张量各自被分配到的量化类型IQ2_S、Q4_K、BF16……无需打开模型文件就能审查混合精度到底混在哪里。更多文件清单、完整基准与量化流程详见 README.md。✨ 总结极致压缩512 专家 MoE 从 354 GB 压到 66~84 GB平均仅 2.4~3.5 比特几乎无损IQ3_S 各基准持平甚至反超 BF16 原模型拿来即用标准 GGUFllama.cpp / Ollama / LM Studio 开箱即跑支持多模态公开透明GSQ RCO 双论文背书张量级分配清单随文件发布显存有限又想吃下旗舰级 MoE 模型这套 GGUF 量化是目前相当值得关注的选择。【免费下载链接】Qwen3.8-Flash-Next-GSQ-RCO-GGUF项目地址: https://ai.gitcode.com/hf_mirrors/ISTA-DASLab/Qwen3.8-Flash-Next-GSQ-RCO-GGUF创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考