
5 分钟上手 Llama ModelsLlama 开源大模型从安装、选型到 Llama 部署完整指南【免费下载链接】llama-modelsUtilities intended for use with Llama models.项目地址: https://gitcode.com/GitHub_Trending/ll/llama-modelsLlama Models 是 Meta 官方的 Llama 开源大模型仓库覆盖 Llama 2 到 Llama 4 全系列的推理代码、Tokenizer 和模型下载 CLI解决从「拿到权重」到「跑出第一个 token」之间最繁琐的工程环节。 快速开始一键安装步骤先明确你要做什么安装 CLI、下载权重、跑通一次推理。三步以内可以完成。环境要求组件要求Python≥ 3.10见 pyproject.toml依赖PyYAML、jinja2、tiktoken、pydantic、Pillow 等pip自动处理GPU可选但推理建议 NVIDIA 显卡Llama 4 精度推理需多卡下文详述第一步装 CLI 并申请权重pip install llama-models llama-model list llama-model download --source meta --model-id Llama-4-Scout-17B-16E-Instruct下载前需先访问 Meta Llama 官网阅读并接受许可审批通过后会收到带签名的下载链接按提示粘贴到 CLI 即可。注意签名链接 24 小时内有效且有下载次数上限失效后重新申请一次就行。第二步装推理依赖git clone https://gitcode.com/GitHub_Trending/ll/llama-models llama-models cd llama-models pip install .[torch]这一步会带上 torch、fairscale、fire 等额外依赖定义在 pyproject.toml 的[torch]附加依赖里。第三步跑通第一次推理仓库自带 Llama 4 对话脚本4 卡 bf16 全精度直接可跑NGPUS4 CHECKPOINT_DIR~/.llama/checkpoints/Llama-4-Scout-17B-16E-Instruct PYTHONPATH$(git rev-parse --show-toplevel) \ torchrun --nproc_per_node$NGPUS \ -m models.llama4.scripts.chat_completion $CHECKPOINT_DIR \ --world_size $NGPUS看到模型逐字输出回复说明链路全通。跑完记得自检一下权重完整性llama-model verify-download。 Llama 模型选型版本对比与选择建议仓库内置了从 Llama 2 到 Llama 4 的完整模型表来源README.md 与 llama4/MODEL_CARD.md。选型时别只看参数量重点看上下文和硬件门槛版本参数量上下文能力亮点bf16 推理门槛80GB 卡Llama 27B/13B/70B4K基础语言理解见模型卡Llama 38B/70B8K推理能力增强见模型卡Llama 3.18B/70B/405B128K超长上下文、多语言见模型卡Llama 3.2 / Vision1B/3B、11B/90B128K轻量 视觉见模型卡Llama 3.370B128K代码能力增强见模型卡Llama 4 Scout激活 17B / 总 109B10MMoE 原生多模态4 张起可量化到 1 张Llama 4 Maverick激活 17B / 总 400B1MMoE 原生多模态4 张起FP8 可 1 台 DGX 主机注README 只给了 Llama 4 系列的明确硬件口径旧版本未提供统一数字故标注「见模型卡」。如果你只有单卡 80GB选 Llama 4 Scout Int4 量化官方确认单卡 80GB 可跑。如果你有 4 卡且要最强综合能力选 Llama 4 Maverick官方 MMLU-Proinstruct80.5比 Scout 的 74.3 高约 6 个点。如果你要处理文档、图表类图像理解选 Llama 3.2-Vision 或 Llama 4 系列它们原生支持图像输入Llama 4 官方测试上限为单次 5 张图。⚙️ 技术内参MoE、量化与多模态核心机制架构总览MoE混合专家把前馈层拆成多个小专家每次只激活其中几个省算力原理一句话每个 token 过路由打分后只由 top_k 个专家加共享专家处理。这样「总参数大、激活参数小」推理成本按激活参数算。核心路由逻辑在 llama_models/llama4/moe.py# llama_models/llama4/moe.py每个 token 只走 top_k 个专家 router_scores torch.matmul(x_aD, self.router_DE).transpose(0, 1) router_scores_aK, router_indices_aK torch.topk( router_scores.transpose(0, 1), self.moe_args.top_k, dim1 ) router_scores torch.sigmoid(router_scores) # 专家输出加权 out_aD self.shared_expert(x_aD) # 共享专家兜底Scout 16 个专家、Maverick 128 个专家激活参数都是 17B。专家权重还支持按 GPU 数切分代码中通过 fairscale 做模型并行这是它能横向扩卡的关键。量化从显存预算角度看量化在这里不是精度算法问题而是显存预算问题。README 给出了两个现成档位--quantization-mode直接切换模式权重激活Scout 所需硬件80GB 卡bf16默认bf16bf164 张fp8_mixedFP8bf162 张int4_mixedInt4bf161 张代价是轻微精度损失官方表述为「minimal loss in accuracy」。量化实现在 llama_models/llama4/quantization/推理时在线量化on-the-fly无需预先转换权重。多模态图像如何进入语言模型Llama 3.2-Vision 的架构图很能说明接入方式文本走 Tokenizer图像走 Vision Encoder 各自编码再通过交叉注意力层Cross Attention把视觉信息注入文本层Llama 4 更进一步用早期融合early fusion做原生多模态输入端直接支持「文本 图像」混合序列脚本 llama_models/llama4/scripts/chat_completion.py 里的示例就是同时喂两张图让模型写俳句。 生产部署进阶Llama Docker 部署与多 GPU 并行Docker 容器化仓库未附带现成 Dockerfile基于 pyproject.toml 的依赖声明自己构建即可核心就三行FROM pytorch/pytorch:latest COPY . /workspace RUN cd /workspace pip install .[torch]镜像里推理入口是python -m models.llama4.scripts.chat_completion CHECKPOINT_DIR注意挂载~/.llama/checkpoints到容器内。多 GPU 并行torchrun拉起进程数等于--nproc_per_node模型经 fairscale 在卡间切分专家权重按 world size 均分。单节点直接复制下面命令即可卡数按显存改NGPUS2 torchrun --nproc_per_node$NGPUS \ -m models.llama4.scripts.chat_completion $CHECKPOINT_DIR \ --world_size $NGPUS --quantization-mode fp8_mixed常用环境变量与参数名称作用PYTHONPATH设为仓库根目录torchrun -m models.xxx依赖它CUDA_VISIBLE_DEVICES控制可见 GPU指定哪些卡参与推理NGPUS/--world_size并行卡数两者保持一致CHECKPOINT_DIR权重目录CLI 下载后默认在~/.llama/checkpoints/--quantization-modefp8_mixed/int4_mixed控制显存档位--max-seq-len/--max-batch-size脚本内置默认 4096 与 1可按业务调❓ 踩坑 FAQ现象下载中断或报403: Forbidden。原因签名链接 24 小时过期或有下载次数上限。解法重新申请链接再跑一次llama-model download。现象单卡跑 Llama 4 直接 OOM。原因Llama 4 系列 bf16 全精度官方要求至少 4 张 GPU。解法加--quantization-mode fp8_mixed2 张 80GB或int4_mixed1 张 80GB。现象报ModuleNotFoundError: No module named models。原因推理脚本以仓库顶层的models/包为导入根没设置路径。解法命令前加PYTHONPATH$(git rev-parse --show-toplevel)。现象pip install .[torch]在已有环境里装出依赖冲突。原因[torch]附加依赖把fbgemm-gpu-genai钉死在 1.1.2与旧环境里的 torch 版本容易打架。解法用干净的 venv/conda 环境安装别复用旧环境。现象Base预训练模型输出没有对话格式。原因chat_completion脚本只适配 Instruct 模型。解法Base 模型改用 llama_models/llama4/scripts/completion.py 对应的-m models.llama4.scripts.completion。结尾Llama Models 的价值在于把「权重获取 → 推理 → 量化 → 多卡」整条链路收敛到一个仓库里CLI 管下载校验torchrun脚本管推理--quantization-mode一个参数切换显存档位。下一步建议你先用 Scout Int4 在单卡上跑通全链路再根据上下文长度和多模态需求决定上 Scout 还是 Maverick要接入 Hugging Face 生态或第三方推理后端可参考 README 中的相关说明。模型细节看 llama_models/llama4/CLI 逻辑看 llama_models/cli/。【免费下载链接】llama-modelsUtilities intended for use with Llama models.项目地址: https://gitcode.com/GitHub_Trending/ll/llama-models创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考