
本地LLM量化指南club-3090的INT4/FP8/NVFP4精度阶梯完整选型教程质量损失有多大【免费下载链接】club-3090Community recipes for serving LLMs on RTX 3090/4090/5090 CUDA gpus. Multi-engine (vLLM, llama.cpp, ik_llama) and model-agnostic. Currently shipping Qwen3.6-27B Qwen3.6 35B Gemma 4 26B Gemma 4 31B configs for 1× and 2× cards.项目地址: https://gitcode.com/gh_mirrors/cl/club-3090club-3090 是一个面向 RTX 3090/4090/5090 本地部署大模型的开源社区方案库核心思路是用**量化Quantization**把原本需要 50GB 显存的 27B 模型塞进 24GB 单卡。本文基于该项目在真实硬件上的测量数据带你走通INT4、FP8、NVFP4 精度阶梯的选型逻辑并回答新手最关心的问题量化之后模型质量到底掉了多少一句话结论先行8 位量化FP8/INT8几乎无损4 位量化INT4/NVFP4损失可控——同一模型上INT4 与 FP8 的行为质量测试分差在统计噪声带±5~7 分之内真正的代价是文件体积和理论保真度KLD而非肉眼可见的回答质量。先分清两个独立的量化旋钮模型权重 vs KV缓存新手最容易混淆的一点量化其实是两个互不相关的开关详见 docs/QUANTIZATION.md旋钮压缩的对象换来的收益主要代价权重量化INT4/FP8/NVFP4…模型权重本身显存占用变小能装下更大的模型保真度下降质量风险KV缓存量化fp8/int8-PTH/TQ3…推理时的上下文缓存同样显存下支持更长上下文 / 更多并发极小但配置不当会翻车两个旋钮独立选择你可以用 INT4 权重 FP8 KV也可以用 FP8 权重 INT4 上下文GGUF 引擎的q4_0KV。club-3090 的每个 compose 配置都显式声明了这两个值例如 dual/autoround-int4/fp8-mtp.yml 就是INT4 权重 FP8 KV的经典组合。另一个关键概念是bpwbits per weight每权重比特数FP16 16 bpw4-bit 量化算上块级缩放因子后实际约 4~4.5 bpw。bpw 越低 → 文件越小 → 上下文空间越大 → 但质量风险越高。8位档FP8 / INT8质量损失几乎测不出来8 位量化是保真优先档位。项目用 **KLDKL 散度与 BF16 全精度的偏差越低越好**作为保真度的客观标尺Qwen3.6-27B 上的实测阶梯如下数据来自 docs/QUANTIZATION.md §4a量化方案平均 KLD权重大小一句话点评INT8 (W8A16)0.00934 GiB几乎无损FP8 (W8A16)0.02329 GiB保真度最高的实用量化max 档默认AWQ (BF16, INT4)0.04227 GiB4 位里较好AWQ (INT4)0.05120 GiB4 位主力AutoRound INT40.06318 GiB最小最省club-3090 双卡默认NVFP4 各变体0.06–0.19—见下文规律非常清晰保真度随比特数上升8 位 PTQ训练后量化已经接近无损——所以官方默认建议要精度选 FP8要速度/省显存选 INT4。⚠️ 对 3090Ampere sm_86用户有个硬件冷知识3090没有原生 FP8 张量核FP8 权重是通过 Marlin 内核解压回 16 位再算——显存是真的省了计算没有加速详见 docs/DTYPE_MATRIX.md。真正的原生 FP8 要 4090Ada以上才有。8 位档还有一个W8A8 变体INT8 权重 INT8 激活它走 3090 原生 INT8 张量核prefill首 token 延迟比 FP8 快 17~51%TTFT 122ms vs 158ms而质量测试 107/150 与 FP8 打平FP8 则赢得 decode 吞吐83/108 vs 77/96 tok/s。长提示词、RAG、工具链场景选 W8A8纯对话吞吐选 FP8。对应的现成配置FP8 权重档maxdual/fp8/mtp.ymlINT4 权重档fastdual/autoround-int4/fp8-mtp.yml4位档INT4 / NVFP4省一半显存的务实之选INT4AutoRound / AWQ / GPTQ 怎么选vLLM/SGLang 阵营的 4 位量化走safetensors Marlin 内核三种主流算法的区别只在怎么四舍五入AutoRoundIntel 的符号梯度法club-3090 双卡默认27B 只需 18 GiBAWQ激活感知保护重要通道社区可用面最广GPTQ二阶近似老牌稳4 位上通常略逊于前两者。三者硬件路径完全相同Marlin 解压 → FP16 张量核选哪个看校准质量不看谁更快。NVFP4Blackwell 的菜3090 只能喝汤NVFP4 是 NVIDIA 的 4 位浮点格式需要 Blackwell 硬件5090 等才能原生加速。在 5090 上原生 FP4 双卡实测168/215 tok/snarrative/code是 3090 双卡的两倍开外。3090 上并非完全用不了项目通过Marlin W4A16 回退路径成功启动了 NVFP4 检查点dual/nvfp4/mtp.yml质量 110/150 与 FP8 档统计打平——但没有任何速度优势比 AutoRound 档慢约 20%。所以 3090 用户选 INT4 即可NVFP4 留给你升级 5090 之后。GGUF 侧的 4 位阶梯Q4_K_M → IQ4_XS → IQ4_KSllama.cpp 家族的阶梯是另一条线docs/QUANTIZATION.md §2Q4_K_M无校准的默认款到处能跑Ollama/LM Studio 全兼容IQ4_XSimatrix非线性格点 重要性矩阵校准——用真实文本跑一遍模型记录哪些权重最关键量化时保护重要权重、狠压次要权重IQ4_KSimatrix 协同设计内核ik_llama.cpp 分叉独有GGUF 世界单位比特最高质量且解码更快。同一比特数下imatrix 量化的优势在比特越低时越明显2~3 bit 时imatrix 是可用与报废的分界线。单卡 3090 上 ik_llama IQ4_KS 实测 8-pack 101/150、解码比主线 Q4_K_M100/150还快 18~20%引擎说明见 docs/engines/IK_LLAMA.md。KV缓存量化决定你能开多长上下文的第二个旋钮权重量化解决装得下KV 量化解决上下文够长。3090 上可用的 KV 档完整决策表见 docs/DTYPE_MATRIX.mdKV 类型每 token 字节效果备注bf16/f162无损基准最占显存fp8_e4m3 / e5m21池子 ×2vLLM 双卡默认3090 上纯省显存无计算加速int8_per_token_head~1池子 ×2短上下文 decode 更快长上下文深度衰减明显TQ33-bit0.75池子 ×2.5激进档配置不当会翻车q4_0 / q8_0GGUF0.5 / 1单卡 262K 上下文的功臣llama.cpp/ik 系专属上图是项目对 2× 3090 上各 KV 档的实测KV 池大小千 token 单位越大 能并发更多流或开更长上下文。可以看到 8 位 KVINT8 PTH把 Qwen 的并发能力从 bf16 的 1.59× 提到 2.31×262K而 3 位 TQ3 裸用橙条虽然池子最大却被标了BROKEN——量化越激进越需要配套的正确配置这正是下一节要讲的。质量损失到底有多大看8-pack实测club-3090 不靠感觉回答这个问题而是有一套 150 分制的行为质量测试8-pack工具调用、指令遵循、结构化输出、数学推理、数据抽取 代码/Agent 沙箱包由 scripts/quality-test.sh 驱动方法论见 docs/QUALITY_TEST.md。所有量化档位在同一台机器上跑分汇总于 BENCHMARKS.md配置Qwen3.6-27B量化8-pack 得分相对全精度的损失llama.cpp Q4_K_M单卡INT4100/150≈ 同档打平ik_llama IQ4_KS单卡INT4imatrix101/150≈ 同档打平beellama Q5_K_S单卡~5bit107–113/150略优vLLM dual AutoRound INT4INT4103–112/150≈ 同档打平vLLM dual-max FP8FP8107–109/150≈ 同档打平vLLM W8A8INT8 W8A8107/150与 FP8 打平vLLM NVFP43090 回退NVFP4110/150与 FP8 档打平这张逐维度结论矩阵透露了两个关键信息8 位 KVINT8 PTH与 bf16 的质量基本重合94~97 vs bf16 基线验证了KV 量化省的是上下文不是智能3 位 KV 裸跑Qwen TQ3 patch-only质量崩到 18/150、沙箱静默空输出 34/100——量化本身不背锅是缺少配套内核MTP 校验路径才翻车补齐后TQ3MTP Genesis质量回到 86/150接近 bf16。散点图横轴是 262K 上下文下的最大并发数纵轴是 150 分制质量分从 bf16~63 分走到 8 位 KV 投机解码的高并发配置质量只掉 ~5 个百分点并发却翻倍——这就是量化换来的性价比甜点位。给新手的量化损失心智模型FP16 → FP8/INT8质量分不变107 vs 109噪声带内KLD 从 0 变 0.023肉眼与测试都不可见FP8 → INT4KLD 翻 3 倍0.023 → 0.063但 8-pack 仍在 ±5~7 的统计噪声带内——行为质量基本打平代价是 29 GiB → 18 GiBINT4 → 3bit KV 裸跑这是真正的悬崖区必须依赖项目验证过的配套配置不要自由搭配。三档选型速查表fast / max / prefillclub-3090 把量化档位抽象成三个角落各自最大化一条轴、牺牲其他轴档位优化目标典型方案适合谁fast⭐解码速度 上下文空间INT4 权重AutoRound fp8 KV单卡 24GB 的唯一选择追求吞吐和长上下文max权重保真度FP8 / INT8 权重W8A16双卡用户第二张卡的价值就是买得起更高精度prefill首 token 延迟TTFTINT8 W8A8RAG、长提示词、工具链等延迟敏感场景按你的硬件对号入座单张 3090/4090显存逼你走 fast 角——INT4 GGUFQ4_K_M/IQ4_KS或 INT4 vLLMsingle/autoround-int4/minimal.yml配 q4_0/fp8 KV 拿到 200K 上下文双卡 3090fast 与 max 都是真选项——要吞吐选 dual/autoround-int4/fp8-mtp.yml103~112/150要保真选 dual/fp8/mtp.yml107~109/1505090 用户解锁 NVFP4 原生 FP4 路径dual/nvfp4/mtp.yml质量 110/150 不降反快要极致 4 位保真看 QAT量化感知训练路线如 Google 官方的 Gemma QAT 检查点见 models/gemma-4-31b/vllm/——8 位时 QAT 意义不大优势集中在 4 位及以下。常见误区清单❌ NVFP4 硬件不支持 完全用不了 → 3090 可走 W4A16 回退5090 才享受原生加速❌ FP8 权重 FP8 KV → 两个独立旋钮FP8 权重检查点还要避开 fp8 KV配 int8-PTH 或 e4m3 按模型而定❌ 比特数高就一定质量高 → 方法标签不保证保真度KLD 和 8-pack 实测才是裁判❌ 量化是免费的午餐 → 3bit KV 裸跑的 BROKEN 案例说明激进量化必须配验证过的内核。总结在 club-3090 的精度阶梯上8 位量化FP8/INT8≈ 无损可以放心作为双卡默认4 位量化INT4/NVFP4质量损失在行为测试里基本不可见换来的是 40% 的显存释放和最长上下文而真正的质量悬崖不在量化本身而在没有配套验证的激进配置。照项目已验证的 compose 走损失可控、收益实打实。【免费下载链接】club-3090Community recipes for serving LLMs on RTX 3090/4090/5090 CUDA gpus. Multi-engine (vLLM, llama.cpp, ik_llama) and model-agnostic. Currently shipping Qwen3.6-27B Qwen3.6 35B Gemma 4 26B Gemma 4 31B configs for 1× and 2× cards.项目地址: https://gitcode.com/gh_mirrors/cl/club-3090创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考