
快速上手WeClone从聊天记录到微信数字克隆的完整教程【免费下载链接】WeClone One-stop solution for creating your AI twin from chat history Fine-tune LLMs with your chat logs to capture your unique style, then bind to a chatbot to bring your digital self to life.项目地址: https://gitcode.com/GitHub_Trending/we/WeClone跟着做完这套流程你会得到一个能用你的口吻自动回复私聊和群聊的微信机器人。WeClone 用你真实的聊天记录对 ChatGLM3-6B 大模型做 LoRA 微调绑定微信账号后这个数字分身就能 24 小时替你在线应答。原理速览聊天记录如何变成你的说话风格WeClone 的链路很短把微信聊天记录整理成结构化训练数据在 ChatGLM3-6B 上训练一层小适配器LoRA 只训增量参数不改动整个模型让它学会你的表达习惯。部署时机器人先通过本地 API 服务调用模型再对私聊消息和群聊 消息自动回复。准备清单显存、Python 与数据要求项目要求显卡16GB 显存以上7B LoRA改用 QLoRA 降到 6~10GBPython3.8 以上推荐 3.10依赖通过 requirements.txt 安装含 llmtuner、torch、transformers、peft、trl 等基础模型ChatGLM3-6B 权重放到项目根目录 ./chatglm3-6b聊天数据聊天记录导出为 CSV放在 ./data/csv每个联系人一个文件夹微信账号建议小号封号风险且需绑定银行卡多卡可选多卡训练才需要安装 deepspeed主流程四步装好并部署第一步环境一键安装克隆仓库建独立 conda 环境git clone https://gitcode.com/GitHub_Trending/we/WeClone cd WeClone conda create -n weclone python3.10 conda activate weclone pip install -r requirements.txt训练前把 ChatGLM3-6B 权重下载到 ./chatglm3-6b 目录下载慢可执行export USE_MODELSCOPE_HUB1切换到魔搭社区源Windows 用set。验证点安装命令无报错输出python -c import llmtuner不抛异常。第二步导出记录并生成数据集用 PyWxDump 解密微信数据库后导出多个联系人的 CSV把文件夹放进 ./data/csv然后执行python ./make_dataset/csv_to_json.py脚本会自动剔除手机号、身份证号、邮箱、网址并按词库过滤含禁用词的整句。验证点data/res_csv/pt 和 data/res_csv/sft 下生成 JSON 数据集抽查样本已无敏感信息。第三步LoRA 微调训练单卡训练python src/train_sft.py多卡加速pip install deepspeed deepspeed --num_gpus2 src/train_sft.py验证点model_output 目录产出适配器模型文件loss 降到 3.5 左右即可降得过低反而可能过拟合。第四步推理验证与机器人部署先开网页界面看模型效果python ./src/web_demo.py满意后部署微信机器人python ./src/api_service.py python ./src/wechat_bot/main.py验证点终端出现二维码扫码登录成功私聊能自动回复群聊 机器人同样触发。自定义与进阶参数调优与扩展方向settings.json 统一管理训练与推理参数per_device_train_batch_size和gradient_accumulation_steps调显存占用num_train_epochs、lora_rank、lora_dropout按数据量与质量调整infer_args控制 temperature、重复惩罚等生成行为。src/template.py 里的default_prompt是系统提示词改它可以指定机器人扮演的角色。make_dataset/blocked_words.json 可追加自定义禁用词命中即整句丢弃。连续多句回复有三种处理策略make_dataset/ 下的另外两个脚本分别采用逗号连接、放入多轮 history 等方式。想再补一层底座可先用 src/train_pt.py 跑预训练阶段再回到 SFT。常见坑位最容易翻车的三处现象原因解决训练直接爆显存默认 LoRA 微调 7B 模型约需 16GB换 QLoRA6~10GB或在 settings.json 调小批量与梯度累积步数回复口吻不像你聊天记录太少太杂数据质量不足多导出几个联系人的 CSV 重训效果强烈依赖数据数量与质量微信被封或登录失败Web 接口登录本身有合规风险始终用小号操作且先绑定银行卡再使用从环境搭建到数据生成、LoRA 训练、微信部署主流程四步即可跑通。去 WeClone 仓库把完整链路执行一遍或先点个 Star 再开始动手。【免费下载链接】WeClone One-stop solution for creating your AI twin from chat history Fine-tune LLMs with your chat logs to capture your unique style, then bind to a chatbot to bring your digital self to life.项目地址: https://gitcode.com/GitHub_Trending/we/WeClone创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考