ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

WARP快速开始教程:5个命令从零构建零依赖本地大模型推理引擎

WARP快速开始教程:5个命令从零构建零依赖本地大模型推理引擎 WARP快速开始教程5个命令从零构建零依赖本地大模型推理引擎【免费下载链接】warpRun the full 2.78-trillion-parameter Kimi K3 model, DeepSeek V4.1 Flash or GLM-5.3-Flash beyond available RAM by streaming activated weights directly from NVMe. A dependency-free, embeddable C inference engine.项目地址: https://gitcode.com/gh_mirrors/was/warpWARP 是一个零依赖的本地大模型推理引擎用纯 C 语言编写无需 BLAS、Python 或 CUDA就能在消费级电脑上运行 Kimi K32.78 万亿参数、DeepSeek V4.1-Flash552B和 GLM-5.3-Flash313B——它把模型主干放在内存里激活的专家权重直接从 NVMe 流式读取。本教程带你用5 个命令从零构建 WARP 推理引擎并完成第一次本地推理。WARP 大模型推理引擎是什么为什么值得关注WARP全称 Weight-Aware Runtime and Paging的核心理念是模型权重大部分放在高速存储上而不是全部塞进内存。Kimi K3 这类 MoE混合专家模型每个 token 只激活约 4% 的参数。WARP 正是利用这一点共享主干常驻 RAM被路由选中的专家按需从磁盘读取读取与计算重叠剩余内存自动变成专家缓存引擎自己决定预算并打印给你看完整的 2.78 万亿参数 Kimi K3 可以在 64 GB 的 MacBook Pro 上以约 0.6 token/秒运行。官方设计文档在 docs/ENGINE.md磁盘容器格式见 docs/FORMAT.md。开始前的准备工作硬件与软件要求软件要求极低——只需要一个 C11 编译器和make支持 macOS、Linuxarm64 / x86_64和 WindowsMinGW-w64。Python、PyTorch 和 safetensors 只在转换模型这一步需要推理路径完全用不到。硬件方面不同模型的要求差异很大建议先按自己的机器选模型模型容器大小NVMe最低 RAM参考速度Kimi-Linear 48B入门首选19 GB1.32 GB~14–17 tok/sGLM-5.3-Flash 313B文图112 GB5.14 GB~3.9 tok/sDeepSeek-V4.1-Flash 552B299 GiB4.86 GB~3.8 tok/sKimi K3 2.78T~1 TB29.19 GB~0.6 tok/s 提示转换模型时还需要临时暂存空间GLM 约 306 GiB可放外置盘转换完可释放。模型容器务必放在内置 NVMe上——实测内置 SSD 12.78 GB/s外置 USB 盒只有 0.94 GB/s速度差一个数量级。5 个命令从零构建 WARP 推理引擎命令 1获取源码git clonegit clone https://gitcode.com/gh_mirrors/was/warp cd warp仓库只读使用即可源码结构很清晰引擎核心在 src/公开 API 为 src/waste.h命令行入口是 cli/main.c模型转换工具在 tools/。命令 2构建引擎makemake一条命令不到一分钟产物有四个waste—— 命令行推理工具你日常用到的就是它libwaste.a—— 静态库供你自己的 C 程序嵌入libwaste.so / .dylib—— 共享库供 Python 服务端通过 ctypes 调用libwastevq—— 供 tools/convert.py 转换模型时调用编码器。构建规则见 Makefile。注意它不需要安装任何第三方库链接时只用-lm -lpthreadx86 上会自动编译 AVX2/AVX-512 两套 SIMD 代码运行时按 CPU 特性动态选择单个二进制即可适配不同 CPU。命令 3运行免模型测试套件make checkmake checkmake check会编译全部校验二进制并运行 tests/run.sh它自动生成一个小型合成模型完整跑通前向推理、tokenizer、KV 状态、内存规划等测试不需要下载任何真实权重。如果你关心数值正确性项目还有针对真实模型的 PyTorch 对拍门禁标准记录在 docs/GATES.md。✅ 这一步通过后说明你的引擎已经可用——即使永远不下载模型也可以到这里开始阅读代码和文档。命令 4下载并转换模型权重fetch_weights.sh convert.py以 313B 的 GLM-5.3-Flash 为例16 GB 内存的笔记本就能跑# 先做预检分片数、总大小、目标盘剩余空间 tools/fetch_weights.sh --repo zai-org/GLM-5.3-Flash \ --dest /Volumes/staging/glm53 --dry-run # 正式下载306 GiB支持断点续传中断后重跑即可 tools/fetch_weights.sh --repo zai-org/GLM-5.3-Flash \ --dest /Volumes/staging/glm53 # 转换输出容器放到内置 SSD约 45 分钟3 个 worker uv run --with torch python tools/convert.py \ --src /Volumes/staging/glm53 \ --out ~/models/glm53.waste \ --jobs 3关于这一步的要点下载和转换都可断点续传、随时中断重跑已经拉取的分片不会重复下载转换器自动识别架构写入对话格式chat.json、重编码 tokenizer、按需生成视觉配置没有任何模型专属参数磁盘紧张时可加--reclaim on让转换器用掉一个源分片就删掉一个不可逆建议先用--reclaim dry演练如果不想一步步手动执行tools/pipeline.sh 可以把下载→转换→校验串成一条无人值守流水线MODELglm SRC/Volumes/staging/glm53 OUT~/models/glm53.waste tools/pipeline.sh 想体验 Kimi K3 完整模型可以直接用 BitTorrent 下载官方已转换好的 982 GB 容器跳过 1.42 TB 源权重下载和 4.7 小时转换详见 README.md 的 Get Kimi K3, already converted 一节。命令 5运行推理waste run / waste chat# 先看看内存规划不加载权重 ./waste plan ~/models/glm53.waste # 单次推理-n 控制生成 token 上限GLM 会先推理后作答记得留足 ./waste run ~/models/glm53.waste What is the capital of Italy? -n 200 # 交互式聊天 ./waste chat ~/models/glm53.waste典型输出长这样$ ./waste run ~/models/glm53.waste What is the capital of Italy? -n 200 waste: no --budget, using 46.37 GB of 64.00 GB (expert cache 41.36 GB) ... The capital of Italy is Rome. [56 tokens, 12.79 s, 4.38 tok/s | experts 17327 hit / 1489 miss 92%]注意waste:那行引擎自动选择了安全内存预算并告诉你缓存多大——不要手动设--budget除非你确实在调优。多模态则每加一张图多一个--image参数./waste run ~/models/glm53.waste What does this image look like? --image x.png -n 200chat模式还支持/image FILE给下一条消息附图、/stats累计 I/O 统计、/save与/load保存/恢复会话。全部命令示例见 examples/README.md。可选一步把模型变成 OpenAI 兼容 APIWARP 附带一个纯标准库 Python 写的服务端serve/通过 ctypes 复用同一份 C 引擎实现 OpenAI chat-completions 协议支持流式、工具调用、结构化输出和图片make libwaste.so python3 -m serve ~/models/glm53.waste --port 8000之后curl localhost:8000/v1/chat/completions即可访问。协议细节见 docs/SERVE.md完整请求示例在 examples/。常见问题速查Q前几十个 token 比后面慢正常吗正常。专家缓存还在填充跑长回复速度会回升例如 GLM 从 3.3 升到 3.9 tok/s。Q内存不够怎么办命令不用改。引擎按实际可用内存自动缩小预算并打印出来——16 GB 机器跑 GLM 仍有约 3.06 tok/s接近 64 GB 机器的 90%。Q只想先试试引擎不想下载几百 GB选 Kimi-Linear容器仅 19 GB、最低 1.32 GB RAM同一台机器上约 14 tok/s。Q想要 GPU当前 CPUNEON/SIMD路径就是最快的实测实现Metal 后端是可选编译项WASTE_ENABLE_METAL1CUDA/BLAS 尚在研究中见 docs/BACKENDS.md。接下来读什么 想了解的去哪里看引擎架构与内存模型docs/ENGINE.md性能数据与效率分析docs/EFFICIENCY.md磁盘容器格式docs/FORMAT.mdKimi K3 专属指南docs/K3.mdGLM-5.3-Flash 架构docs/GLM.md各硬件后端进展docs/BACKENDS.mdC 库嵌入示例examples/api_text.c、src/waste.hWARP 以 Apache 2.0 协议开源见 LICENSE项目迭代很快、测量数据全部可追溯到具体硬件与 commit。到这里你已经完成了从零构建零依赖本地大模型推理引擎的全部 5 个命令git clone→make→make check→ 下载转换 →waste run。接下来挑一个装得下的模型让它在你的笔记本上跑起来吧。【免费下载链接】warpRun the full 2.78-trillion-parameter Kimi K3 model, DeepSeek V4.1 Flash or GLM-5.3-Flash beyond available RAM by streaming activated weights directly from NVMe. A dependency-free, embeddable C inference engine.项目地址: https://gitcode.com/gh_mirrors/was/warp创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表