ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

Chinese-LLaMA-Alpaca 模型文件 SHA256 校验完整指南:清单、命令与合并后不一致排查

Chinese-LLaMA-Alpaca 模型文件 SHA256 校验完整指南:清单、命令与合并后不一致排查 大模型人工智能预训练微调LoRA本地部署NLP模型评测【免费下载链接】Chinese-LLaMA-Alpaca中文LLaMAAlpaca大语言模型本地CPU/GPU训练部署 (Chinese LLaMA Alpaca LLMs)项目地址https://gitcode.com/gh_mirrors/ch/Chinese-LLaMA-Alpaca点击查看免费下载本篇技术指南围绕 SHA256.md 展开系统整理 Chinese-LLaMA-Alpaca 项目中全部模型相关文件的 SHA256 校验值清单原版 LLaMA 权重、tokenizer.model、LoRA 权重与合并后全量权重给出 macOS / Linux / Windows 三平台的校验命令并结合仓库中的合并脚本与 FAQ 说明合并后 SHA256 不一致的成因与规避方法。读完本文你将掌握一套完整的模型完整性校验流程能够在下载、合并、部署的每个环节确认模型文件未被篡改或损坏。为什么必须校验 SHA256模型的完整性边界本项目遵循 Facebook 官方 LLaMA 的许可约束不直接发布完整模型权重而是发布 LoRA 权重可理解为原版 LLaMA 上的补丁需要用户自行将 LoRA 与原版 LLaMA 合并后才能获得完整可用的模型见 README.md。这意味着整个使用链条涉及多份来源不同、体积庞大、跨越多个平台Hugging Face、ModelScope、网盘等的文件原版 LLaMA 权重来自 Meta AI 官方渠道或第三方镜像项目发布的 LoRA 权重adapter_model.bin与配套 tokenizer合并脚本产出的全量权重consolidated.*.pth或 Hugging Face 格式任何一环的文件损坏、下载截断或来源不可信都会导致最终模型行为异常如胡言乱语、不理解问题且这类问题极难与训练问题区分。因此 SHA256.md 的开篇即强调为了保证文件的完整性请一定要检查下列文件 SHA256 值的一致性。校验是所有后续推理、量化、二次训练步骤的前提条件。校验清单总览四类文件、四张表SHA256.md 将校验对象划分为四类对应四张清单清单类别文件用途原版 LLaMA原始格式consolidated.*.pthMeta 官方发布的检查点格式原版 LLaMAHF 格式pytorch_model-*.binHugging Face 生态使用的格式本项目 tokenizertokenizer.model词表文件LLaMA 与 Alpaca 版本不同本项目 LoRA 权重adapter_model.bin需与原版 LLaMA 合并的补丁合并后全量权重consolidated.*.pth合并脚本产出的完整模型其中原版 LLaMA 与合并后文件的 SHA256 随模型规格7B / 13B / 33B分片列出tokenizer 与 LoRA 权重则按模型类型LLaMA / Alpaca、基础版 / Plus / Pro列出。下面逐类给出完整清单。原版 LLaMAconsolidated.*.pth 原始格式下表为 Facebook 发布的原版英文 LLaMA 各分片文件的 SHA2567B 单分片13B 两分片33B 四分片ModelPartsSHA256 (consolidated.*.pth)7B00700df0d3013b703a806d2ae7f1bfb8e59814e3d06ae78be0c66368a50059f33d13B00745bf4e29a4dd6f411e72976d92b452da1b49168a4f41c951cfcc8051823cf0813B01d5ccbcc465c71c0de439a5aeffebe8344c68a519bce70bc7f9f92654ee56708533B00e23294a58552d8cdec5b7e8abb87993b97ea6eced4178ff2697c02472539d06733B014e077b7136c7ae2302e954860cf64930458d3076fcde9443f4d0e939e95903ff33B0224a87f01028cbd3a12de551dcedb712346c0b5cbdeff1454e0ddf2df9b67537833B031adfcef71420886119544949767f6a56cb6339b4d5fcde755d80fe68b49de93b原版 LLaMApytorch_model-*.binHugging Face 格式若从 Hugging Face Hub 获取原版 LLaMA需要比对转换后 HF 格式各分片的 SHA256ModelSHA256 (pytorch_model-*.bin)7B0087155d6df07106c1d910bfeb6aab1be8e612dfbf2b56ddfb4ccbde7dbd50d0461bc5e50200db7813ff99cc0b9316c48ccbd6aaaa31bf8cf7bee0b64bc3eda313Bdd20cdee2637408c6ab88c13f5c27d153bacd0e99f2d55f6a66fbd02699444361aba886c5f28d2e2e9b04ab3c4f5bc250c6b06efc1baa3f557677b3097f70e6a2efc56cddb7877c830bc5b402ee72996aedb5694c9e8007bf1d52d72c0d97d2633B9c2a7223ab5f9cf3d46913d2b776e99cbd6ed93f69991594b92a8cef0c681a784984274738e52195f4b1a5b35d719cf0fade6df1f645507d92d61af4dd8dcdfe64c73932562810c5c33b15bfec5921d3ced0e8cdb3766c214eda2f45fa3edd13c7d72d11770f5b58eb45c2dd8e19aae2cbd5a03463b564de3945b21825ebacba174128542031f4ad7ceb6c799e8e5461ec1ca91a72a01402c567e5f6a8b33d8c80e2cfa18994385fa88f03d500017346dfd6dc1e58e957d046af39d9a7e254fa065611608159615ced8d38473ee693129a1a0d872ced0ad8daf09290af7c7061本项目 tokenizer.model项目在合并过程中会对原版 LLaMA 词表进行中文扩充详见 scripts/merge_tokenizer/merge_tokenizers.py因此tokenizer.model与原始 LLaMA 不同。特别注意LLaMA 与 Alpaca 的tokenizer.model不同不可混用而对于同一模型类型不同大小或版本的tokenizer.model相同例如 LLaMA-7B、LLaMA-13B、LLaMA-Plus-7B 的 tokenizer 一致。Model TypeSHA256LLaMA (7B, 13B, 33B)e2676d4ca29ca1750f6ff203328d73b189321dc5776ceede037cbd36541d70c0Alpaca (7B, 13B, 33B)2d967e855b1213a439df6c8ce2791f869c84b4f3b6cfacf22b86440b8192a2f8从源码角度看LoRA 压缩包中tokenizer.model的差异有实质影响合并脚本 scripts/merge_llama_with_chinese_lora.py 在合并时会用 LoRA 包内的 tokenizer 检查词表大小若 base model 词表小于 tokenizer 词表则调用base_model.resize_token_embeddings(len(tokenizer))扩展词表若 tokenizer 词表小于 base model 词表则直接断言失败。脚本中甚至针对[49953, 4096]这类维度不匹配的 RuntimeError 给出明确提示Make sure that you use LLaMA tokenizer with the LLaMA-LoRA weight and Alpaca tokenizer with the Alpaca-LoRA weight!即混用 LLaMA/Alpaca 词表会直接导致合并失败。这与 README.md 中Alpaca 比 LLaMA 多一个 pad token请勿混用 LLaMA/Alpaca 词表的说明相互印证。本项目 LoRA 权重adapter_model.bin下表为各版本 LoRA 主体权重文件adapter_model.bin的 SHA256LoRA Model (adapter_model.bin)SHA256Chinese-LLaMA-7B2a2c24d096f5d509f24946fdbd8c25e1ce4a0acb955902f7436d74c0c0379d86Chinese-LLaMA-Plus-7B8c928db86b2a0cf73f019832f921eb7e1e069ca21441b4bfa12c4381c6cc46beChinese-LLaMA-13B6a4ce789d219bde122f8d9a20371937f2aa2ee86a2311d9f5e303df2e774f9fcChinese-LLaMA-Plus-13B784fcff9c4bdf4e77d442a01158e121caf8fcce0f97ffb32396fe7a3617ee7e8Chinese-LLaMA-33B93a449bafb71ff1bb74a4a21e64e102e5078e5c3898eb40d013790072a0fa3deChinese-LLaMA-Plus-33B16f2544f4b5be9840dbb1a8071a9bc42627ed4232be3b0b600b43f7b4b5f08a7Chinese-Alpaca-7B0d9b6ed8e4a7d1ae590a16c89a452a488d66ff07e45487972f61c2b6e46e36deChinese-Alpaca-Plus-7B4ee0bf805c312a9a771624d481fbdb4485e1b0a70cd2a8da9f96137f177b795dChinese-Alpaca-Pro-7B3cd2776908c3f5efe68bf6cf0248cb0e80fb7c55a52b8406325c9f0ca37b8594Chinese-Alpaca-13Bcb8dda3c005f3343a0740dcd7237fbb600cb14b6bff9b6f3d488c086a2f08adaChinese-Alpaca-Plus-13Ba1fcdcb6d7e1068f925fb36ec78632c76058ba12ba352bed4d44060b8e6f4706Chinese-Alpaca-Pro-13Bf076b20fc2390ddbc35fd56d580d46ea834b33bbae34a4bb3cb7b571e60602e0Chinese-Alpaca-33B6b39da4c682e715a9de30b247b7e9b812d2d54f7d320ec9b452000a5cd4d178dChinese-Alpaca-Plus-33B411f5b9351abcc33c13a82bdd97ddcff81ad7993a8ddb83085b7ea97fad92fc7Chinese-Alpaca-Pro-33B0e7ba4951f605d2c0a7f0bcb983d7f6ed075c8dd23fbbcbc8a8c9643247212a3合并后全量模型consolidated.*.pth将 LoRA 与原版 LLaMA 合并后参考 scripts/merge_llama_with_chinese_lora.py 或低内存版 scripts/merge_llama_with_chinese_lora_low_mem.py产出全量权重。PyTorch 版本不影响权重数据本身但会写入 meta 信息从而导致 SHA256 不同。因此合并时建议使用PyTorch 1.13.0以保证下表 SHA256 有参考性表中标注 TBA待公布的条目Chinese-Alpaca-Pro-7B/13B/33B、Plus-33B 合并版暂无对应参考值。ModelSHA256 (PyTorch 1.13.0)Chinese-LLaMA-7B245427a306e3253db3f534e2a1d7548a8eb781ae8761f9e98979b4aced6b43d8Chinese-LLaMA-Plus-7Bf8d380d63f77a08b7f447f5ec63f0bb1cde9ddeae2207e9f86e6b5f0f95a7955Chinese-LLaMA-13Baa7f4599487ea2b0d0aca2b522c39370897f9afd9839aac7d02155957f1f019f3954f3e7f7264994f23800a04423e6563cc1959ac699d9eaaa6801b4f9392ebdChinese-LLaMA-Plus-13B4de7d188003c778f216342de2dc5c9a9c74278c701c63a7b6bcd7957f5ebfdf5ff8046f9eb8b05dd86597c21edd07894aec00b31842a4c11996a4003091ea7c9Chinese-LLaMA-33B054e9b7dffa3b92a053ca32acac6e22b27c184ed2b8563f8e44e6570ba416357a0fe86c45a0819f45a509776d82778b7de75fbff8d37afa97159b24de5448b7b13df5f74dc7bc1204076b1febef818fb3cec978de27bf8fc85c70e7d62282df9f4f28106c343c5804613faa9852f29fbc60764366bcb0d37ef2811a17be2d336Chinese-LLaMA-Plus-33B0da2fa92c054aa4010ffe1746afbc5bdd89c07b8e418d74debcbf0de74c0069235e25e7fe47f978d52da6cdae3272b3b4ea42a37ea8ece84a4d758350d188397c20f80a7da24b4be72a7f617311e3e2e9346a476d85b3f1a28095497bb1857b0ae5276fe06fd9d039ed295d627c0048d5d96c2390de413f610b093c151370d3cChinese-Alpaca-7Bfbfccc91183169842aac8d093379f0a449b5a26c5ee7a298baf0d556f1499b90Chinese-Alpaca-Plus-7B8b8f6551d0d83f93e378622b9f8dad0bec189da6c29d8a78de493e6aee9bd35fChinese-Alpaca-Pro-7BTBAChinese-Alpaca-13B30cefb5be9091c3e17fbba5d91bf16266a2ddf86cde53370a9982b232ff8a2f4ce946742b0f122f472e192c3f77d506e0c26578b4b881d07d919553333affecdChinese-Alpaca-Plus-13B1834558214c1dddc0d8b2826ece086908b9d2293241d0e12cecb48a035ec561bbf70001600ce166f6ca4ef59df5510f0582cdc119fb74e27d9cf3e4c7b142015Chinese-Alpaca-Pro-13BTBAChinese-Alpaca-33B72bfe67481c0df1b8c3b536acd15ac42c1163b0727b1beb6409ee31d14cb2490fd2151ea714a6e0706a60cca5ab7abf8558e665d4cb001481c6df616c0821c164a7e3de6881769f9c2413f0867e67da20efdf4502602ab90483cb99c593e51ed99c81a7a310802dcc579fe96288fbc18d4486f92020eaf925e1c33db8311378aChinese-Alpaca-Plus-33BTBAChinese-Alpaca-Pro-33BTBA三平台校验命令速查SHA256.md 末尾提供了 macOS、Linux、Windows 三套原生命令无需安装额外工具macOSshasum -a 256 your-model-fileLinuxsha256sum your-model-fileWindowscmd / PowerShellcertutil -hashfile your-model-file sha256执行后将输出的 64 位十六进制摘要与上表逐字符比对即可。校验对象既可以是单独文件如adapter_model.bin、tokenizer.model也可以是目录下的全部分片如consolidated.00.pth~consolidated.03.pth需逐一比对。考虑到 33B 等大文件校验耗时较长建议下载后立即校验避免在模型加载或合并进行到一半时才发现文件损坏。合并后 SHA256 不一致成因与排查路径FAQ 中有一条高频问题正是模型合并之后 SHA256 不一致见 README.md结合 SHA256.md 的注释可归纳出以下成因与排查要点PyTorch 版本影响 meta 信息文档明确指出PyTorch 版本不影响实际权重数据但影响 meta 信息所以 SHA256 也会不同。合并产物的 SHA256 参考值基于PyTorch 1.13.0生成若使用更早版本合并输出文件的 SHA256 大概率与表中不一致此时权重本身仍可能是正确的但无法用表中值验证。合并输入本身未通过校验文档以 ⚠️ 强调请优先确保合并前的基模型和 LoRA 权重的 SHA256 与表中值一致。若原版 LLaMA 分片或adapter_model.bin来自非官方来源或下载不完整合并输出自然无法与参考值对齐。格式差异合并脚本支持--output_type pth|huggingface两种输出见 scripts/merge_llama_with_chinese_lora.py 的参数定义表中仅为consolidated.*.pth格式的参考值若输出为 HF 格式pytorch_model.bin请勿用该表比对。分片归属错误13B、33B 的合并产物按分片列出多行 SHA256比对时需确保按分片序号consolidated.00.pth、consolidated.01.pth…对应而非随机排列。推荐的最小化排查流程先分别校验原版 LLaMA 各分片与 LoRA 压缩包内全部文件对照上文清单确认无误后使用 PyTorch 1.13.0 环境按官方参数重新合并再与合并后清单比对若仍不一致优先检查是否混用了 LLaMA/Alpaca 的 tokenizer合并脚本会对此类错误给出明确断言与提示信息。校验在完整工作流中的位置结合 README.md 的模型压缩包结构与合并流程一份完整的校验工作流建议如下下载后立即校验对 LoRA 压缩包内的adapter_config.json、adapter_model.bin、special_tokens_map.json、tokenizer_config.json、tokenizer.model全部执行 SHA256 比对以 SHA256.md 为准确认 LoRA 与 tokenizer 均完整且类型匹配LLaMA 用 LLaMA 词表、Alpaca 用 Alpaca 词表。校验原版 LLaMA无论是consolidated.*.pth原始格式还是 Hugging Face 格式的pytorch_model-*.bin分别对照对应清单若从 Hugging Face 获取务必比对 HF 格式清单。合并后复检在 PyTorch 1.13.0 下运行合并脚本后对输出目录中consolidated.*.pth与params.json进行 SHA256 比对确认合并过程无误。进入推理/量化环节校验通过的模型即可放心用于 scripts/inference/inference_hf.py、scripts/inference/gradio_demo.py 或 llama.cpp 等推理链路。需要说明的是合并产物的 SHA256 参考值仅覆盖已公布的模型与指定 PyTorch 版本组合表中标注 TBA 的条目如 Chinese-Alpaca-Pro 系列合并版暂无官方参考值遇到此类模型应以输入文件全部校验通过 输出格式/分片正确作为完整性判据而不必强求与某个参考哈希一致。赞分享大模型人工智能预训练微调LoRA本地部署NLP模型评测【免费下载链接】Chinese-LLaMA-Alpaca中文LLaMAAlpaca大语言模型本地CPU/GPU训练部署 (Chinese LLaMA Alpaca LLMs)项目地址https://gitcode.com/gh_mirrors/ch/Chinese-LLaMA-Alpaca点击查看免费下载相关推荐PowerInfer 模型文件完整性校验实战llama-gguf-hash 的分层哈希与清单校验指南PowerInfer 模型文件完整性校验实战llama gguf hash 的分层哈希与清单校验指南 GGUF 是当前 llama 系推理框架通用的模型文件格人工智能大模型推理引擎本地部署中文LLaMA模型微调教程Chinese-alpaca-lora中文LLaMA模型微调教程Chinese alpaca lora 1. 项目介绍 本项目是基于LLaMA模型的中文指令微调项目名为Chinese alpacChinese-LLaMA-Alpaca 模型使用教程Chinese LLaMA Alpaca 模型使用教程 1. 项目介绍 Chinese LLaMA Alpaca 是一个开源项目旨在推动中文自然语言处理NL大模型人工智能预训练微调LoRA本地部署NLP模型评测上一篇进阶技巧使用Phi-3.5-mini-instruct_Uncensored-GGUF构建RAG系统的完整教程下一篇告别颈部疲劳no-neck-pain.nvim让Markdown写作更舒适创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表