ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

Microduck RL 与 microduck 官方仓库如何分工:训练侧与运行时的完整地图

Microduck RL 与 microduck 官方仓库如何分工:训练侧与运行时的完整地图 Microduck RL 与 microduck 官方仓库如何分工训练侧与运行时的完整地图【免费下载链接】microduck_rlRL training environments for Microduck (mjlab)项目地址: https://gitcode.com/GitHub_Trending/mi/microduck_rlMicroduck RLmicroduck_rl是 Microduck 双足机器人项目的强化学习训练侧仓库基于 mjlabMuJoCo Warp PPO为这台约 800 g、25 cm 高、14 个伺服的双足小鸭子训练 50 Hz 的运动策略再导出 ONNX 部署到真机。它与官方 microduck 运行时仓库形成训练 → 导出 → 部署的完整闭环。本文给你一张清晰的分工地图谁负责什么、数据怎么流动、接口契约是什么。️ 一句话分工仓库角色核心职责microduck_rl本仓库训练侧Python / mjlab建仿真环境、BAM 执行器建模、域随机化、奖励设计、PPO 训练、ONNX 导出、策略发布microduck官方仓库运行时Rust 守护进程真机上跑 50 Hz 控制回路、加载 ONNX 策略、安全/跌倒检测/里程计robotctl管理策略两边通过一个硬接口解耦一份 61 维观察 14 维动作的policy.onnx外加 schema 2 的manifest.json。运行时通过策略热切换walk / stand / trick接管机器人任何策略都能在任意时刻接手这正是两边能独立演进的基石。️ 训练侧microduck_rl 做了什么这个仓库是完整的sim2real 配方机器人模型src/mjlab_microduck/robot/microduck/ 下是从 Onshape 导出的 MJCF 模型按用途分版本——robot_walk.xml走步碰撞精简、robot_groundcontact.xml倒地类任务精细碰撞集、robot_groundcontact_rollers.xml轮滑任务等执行器保真src/mjlab_microduck/actuator/friction_dr_bam.py 用 BAM M6 模型把 XL330 伺服建模到电压控制律层面反电动势、库仑/Stribeck 摩擦并叠加电池电压、电压跌落、指令延迟、摩擦系数等域随机化——在这个尺寸上执行器保真就是 sim2real 差距的大头任务环境src/mjlab_microduck/tasks/ 里每个任务族一个 cfg 文件注册表在 src/mjlab_microduck/tasks/init.py。涵盖走步Velocity、跌倒恢复VelStand、翻身StandUp/Roulade、轮滑Rollers/Swizzle/Slope、捡取GroundPick、踢球BallKick等且每个主任务都有-Backlash-变体±1° 齿轮间隙奖励工程经验AGENTS.md 沉淀了整套血泪教训奖励符号约定、防 reward-hacking 的状态门控、潜基形变、课程调度等常用命令详见 README.mduv run train Mjlab-Velocity-Flat-MicroDuck --env.scene.num-envs 4096 # 训练 uv run play Mjlab-Velocity-Flat-MicroDuck --wandb-run-path run_id # 仿真中观看 uv run scripts/export.py TASK --wandb-run-path run_id # 导出 ONNX uv run scripts/infer_policy.py --walking out.onnx # CPU 端部署预演 uv run publish --onnx out.onnx --repo user/microduck-name --kind episodic --duration-s 4.0没有本地 GPU给任何 train 命令加--hf-jobs即可提交到 Hugging Face 托管 GPU 上跑见 scripts/hf/README.md。⚙️ 运行时侧microduck 官方仓库做了什么官方仓库是机器人的身体和大脑50 Hz 控制回路ONNX 策略推理、安全逻辑、跌倒检测、里程计、运动学——这些代码与真机完全一致策略管理守护进程按 policy manifest schema 2 校验策略拒绝图形状不符非[1,61] - [1,14]、输出含 NaN 的权重robotctl命令行robotctl policy add / load / robot do完成策略的安装、装槽和触发一条命令安装社区策略无需等守护进程发版本仓库刻意不做这些运行时逻辑——src/mjlab_microduck/publish/manifest.py里那句注释说得很直白本模块写 manifest守护进程读它契约文档在官方仓库。 交汇点一个 61 维观察契约这是分工地图的核心两边必须严格遵守61 维 actor 观察 48 维本体感知 13 维指令块[twist(3), head_pose(4), body_pose(6)]顺序固定。不用的指令槽位零填充而非删除保证所有策略可以热切换14 个动作对应 14 个伺服0–4 左腿、5–8 颈/头、9–13 右腿非驱动关节统一命名passive_*轮子、backlash 铰链normalizer 烘焙进 ONNXscripts/export.py 把观察归一化器直接烧进 ONNX 图——仿真里 play 看不出来这个 bug真机上就会让策略看到未归一化的观察所以永远走 export 导出不要手转 checkpoint只发布恒指令策略episodic跑--duration-s后自己回到站立如踢球、空翻和 perpetual持续运行如新走姿--slot walk或保持姿态--unwind-s两类可发布阶段驱动/姿态旗标类策略如地面捡取由守护进程自己驱动留在官方策略集里发布前 src/mjlab_microduck/publish/ 会自动做形状门[1,61] - [1,14]51 维旧策略直接拒收、冒烟输入测试拒 NaN / 常值输出、从 git wandb 填training溯源块任务、commit、branch、run、checkpoint。 完整流水线从训练到真机一步一图mjlab 训练GPU4096 并行环境PPO │ checkpoint (model_XXXXX.pt) ▼ scripts/export.py → ONNX烘焙 normalizer │ ▼ uv run publish → HF Hub 仓库policy.onnx manifest.json README │ ▼ 真机robotctl policy add name user/microduck-name │ ▼ robotctl robot do name → 守护进程 50 Hz 运行上真机之前还有一个重要的排演环节scripts/infer_policy.py 在 CPU MuJoCo 里用与训练相同的 BAM 执行器模拟伺服键盘下发速度指令和G/Y/R/K等动作键多策略同时加载模拟热切换——src/mjlab_microduck/sim/body_server.py 更进一步把整个仿真身体通过 TCP 喂给官方仓库的robotdrobotd --sim 127.0.0.1:7801让真机侧代码原封不动地跑在仿真身体上。 关键路径速查想找什么去哪里全部奖励/事件/观察函数src/mjlab_microduck/tasks/mdp.py走步基准配方其他任务的基础src/mjlab_microduck/tasks/microduck_velocity_env_cfg.pybacklash 变体包装器src/mjlab_microduck/tasks/backlash.py机器人配置与 BAM 执行器参数src/mjlab_microduck/robot/microduck_constants.pymanifest 构建与校验src/mjlab_microduck/publish/manifest.py环境构建工作流与奖励规则AGENTS.mdCPU 回归测试配置不变量、奖励符号tests/❓ 新手常见问题Q我拿到真机策略需要理解 microduck_rl 吗不需要。运行时只认policy.onnx manifest理解本仓库只对想训练新策略的人必要。Q为什么观察必须 61 维不能按任务裁剪这是热切换的前提。裁剪维度 运行时换策略时会错位等于每次都要改守护进程。Q训练环境报错先看什么先跑 5 次迭代的 smoke test64 环境抓掉 95% 的配置错误再看 AGENTS.md 的不变量一节——那里列的都是破坏后仿真里好好的、真机上翻车的坑。Q怎么开始git clone https://link.gitcode.com/i/59bbd3f227e3b05ab0f4aab47798b694 cd microduck_rl uv run list-envs # 看看都有哪些训练任务 uv run train Mjlab-Velocity-Flat-MicroDuck --env.scene.num-envs 64 --agent.max_iterations 5一句话总结分工microduck_rl 造会走路的大脑microduck 官方仓库是戴大脑的鸭子——前者管训练与导出后者管运行与安全中间的桥梁就是那份 61 维观察契约。【免费下载链接】microduck_rlRL training environments for Microduck (mjlab)项目地址: https://gitcode.com/GitHub_Trending/mi/microduck_rl创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表