ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

NInfer 官方模型工件详解:5 种 Qwen3 量化 checkpoint 到底该怎么选

NInfer 官方模型工件详解:5 种 Qwen3 量化 checkpoint 到底该怎么选 NInfer 官方模型工件详解5 种 Qwen3 量化 checkpoint 到底该怎么选【免费下载链接】ninferHigh-performance single-GPU inference for selected model checkpoints and GPUs.项目地址: https://gitcode.com/gh_mirrors/ni/ninferNInfer 是一款面向单张 NVIDIA GeForce RTX 5090 的高性能 C/CUDA 推理引擎官方发布了 5 个 Qwen3 系列的量化 checkpoint.ninfer模型工件覆盖 Qwen3.6-27B、Qwen3.6-35B-A3B 和 Qwen3.8-27B 三个基座模型。面对 groupwise-int、NVFP4 等不同量化格式新手最常问的问题就是到底该下载哪一个本文用一张总览表加四步判断法帮你在 3 分钟内选对 Qwen3 量化 checkpoint。什么是 NInfer 模型工件.ninfer 文件下载之前先理解一下你拿到的到底是什么一个文件 完整推理包v3 版本的.ninfer工件同时包含模型配置、编码后的权重、逻辑绑定和前端资源如聊天模板不需要额外的 tokenizer 或 config 文件不是 GGUF / Safetensors它只给 NInfer 引擎使用无法被 llama.cpp、Transformers 等其它框架读取按需加载组件文件里虽然带有 Vision、MTP 等可选组件但引擎只会在启动时加载你选中的部分不选不占显存。官方工件清单和下载入口见 README.md容器格式细节见 docs/maintainer/artifact-container.md。5 个官方 checkpoint 总览一张表看懂checkpoint 文件名基座模型量化格式体积专属能力模型卡qwen3_6_27b.ninferQwen3.6-27Bgroupwise-intQ4/Q5 投影 Q6 词表16.29 GiBMTP 投机解码模型卡qwen3_6_27b_nvfp4.ninferQwen3.6-27BNVFP4/BF16 混合W4A417.07 GiBMTP 更快的 prefill模型卡qwen3_6_35b_a3b.ninferQwen3.6-35B-A3BMoEgroupwise-intQ4 专家 Q8 共享层21.23 GiBMTP DFlash双后端模型卡qwen3_8_27b.ninferQwen3.8-27Bgroupwise-intQ4/Q5 Q8 词表19.03 GiBMTP DFlash2模型卡qwen3_8_27b_nvfp4.ninferQwen3.8-27BNVFP4/FP8 混合22.09 GiBMTP DFlash2模型卡 共同点全部支持思考/非思考两种模式、图文视频多模态输入、MTP 投机解码草稿窗口 1–5、1–8 并发的小规模本地服务以及 OpenAI Chat / OpenAI Responses / Anthropic Messages 三套 HTTP 接口。第一步先看精度——谁的能力最强NInfer 用统一的 EvalScope 评测协议0-shot、规则判分测了全部 5 个工件分数可以直接对比checkpointAIME 2025AIME 2026GPQA-Diamond多模态RealWorldQAQwen3.8-27BNVFP496.67%96.67%90.40%83.53%Qwen3.8-27Bint96.67%96.67%87.37%82.22%Qwen3.6-27BNVFP493.33%93.33%84.34%—Qwen3.6-35B-A3B90.00%90.00%85.35%—Qwen3.6-27Bint86.67%93.33%86.87%—结论如果你追求推理、数学、科学知识等聪明程度Qwen3.8-27B 系列是精度天花板且 NVFP4 版本在 GPQA 上还略胜一筹——量化并没有明显损失精度。第二步再看速度——MoE 版本快一个量级同样在 RTX 5090 上测得MTP3 投机解码、稳定解码吞吐checkpointC1 tok/sC8 tok/s7,680 token prefillQwen3.6-35B-A3B642.51,380.717,705 tok/sQwen3.6-27BNVFP4202.41,146.911,191 tok/sQwen3.8-27BNVFP4147.7922.412,819 tok/sQwen3.6-27Bint185.8535.03,218 tok/sQwen3.8-27Bint136.5582.43,332 tok/s结论Qwen3.6-35B-A3B 是速度之王——虽然总参 35B但 MoE 架构每个 token 只激活约 3B 参数单请求解码可达 642 tok/s8 并发时是其它 27B 模型的 1.2–2.6 倍。高频聊天、长文本流式输出场景首选它。第三步NVFP4 还是 groupwise-int同一基座下两种格式的定位很清晰NVFP4W4A4 Tensor Core利用 Blackwell 架构的 4-bit 张量核心prefill首字延迟 TTFT大幅缩短。例如 7,680 token 的长 promptQwen3.8 的 NVFP4 prefill 比 int 版快约 3.8 倍groupwise-intQ4/Q5 分组量化更保守稳妥的量化方案解码吞吐略低但兼容所有 MTP 场景是不出错的选择。怎么选长 prompt、多轮长上下文、在意第一字多快→ NVFP4追求最大解码速度、跑批 → 对比上表看 int 版是否够用35B-A3B 只有 int 版。第四步按功能需求做最终确认你的需求对应能力推荐数学 / 科研问答思考模式 长上下文262kQwen3.8-27B 任一版本高并发本地 Agent 服务8 并发 批解码Qwen3.6-35B-A3B图片 / 视频理解全系支持--visionQwen3.8-27B多模态评分最高最快出字草稿窗口 1–15DFlash / DFlash2 投机解码35B-A3B 或 Qwen3.8-27B多模态用法和现成示例消息可参考 examples/cli/服务接口细节见 docs/serving.md完整性能数据见 docs/performance.md。下载后如何校验与运行每个模型卡都公布了 SHA-256下载后务必校验printf %s %s\n \ 81f924d440c27261d820c19a9f8d45794c5aee410f8a68bd358133fa8c0375da \ qwen3_8_27b.ninfer | sha256sum --check运行需要先用源码构建 NInfer 引擎要求 64 位 Linux RTX 5090 CUDA 13.1git clone https://gitcode.com/gh_mirrors/ni/ninfer cd ninfer cmake -S . -B build -G Ninja -DCMAKE_BUILD_TYPERelease cmake --build build -j然后一条命令跑 CLI、一条命令起 HTTP 服务示例见 README.md 的 Quick start 章节。如果你手里还是旧版 v2 工件可以用 tools/upgrade_ninfer_v2_to_v3.py 本地升级无需重新下载权重想自己转换别的量化组合见 docs/weight-conversion.md。结论30 秒选型速查表你的场景闭眼选要最聪明的本地模型数学/科研/多模态Qwen3.8-27B NVFP4⭐要出字最快高频对话、8 并发服务Qwen3.6-35B-A3B⭐磁盘紧张、只求稳妥Qwen3.6-27B int体积最小16.29 GiB长 prompt 多、在意首字延迟对应基座的NVFP4版本记住一个简单逻辑能力看 Qwen3.8速度看 35B-A3B格式看延迟需求。五个 checkpoint 的完整评测与性能复现命令都在各自模型卡里下载前花两分钟看一眼就能避开 90% 的选错坑。【免费下载链接】ninferHigh-performance single-GPU inference for selected model checkpoints and GPUs.项目地址: https://gitcode.com/gh_mirrors/ni/ninfer创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表