Microduck RL 4096x6000
这是 Every Embodied 为 Duck Together 共建计划完成的一次 Microduck 速度跟踪策略复现。训练基于 Pollen Robotics 的 microduck_rl,使用 4096 个并行环境完成 6000 次 PPO 迭代,并保留中间 checkpoint、最终 ONNX、训练配置、TensorBoard 事件文件和连续闭环回放视频。
关键结果
| 项目 | 数值 |
|---|---|
| 上游提交 | 29e887ecfbf5d37144759e5a9f8a176dfb83d547 |
| 训练任务 | Mjlab-Velocity-Flat-MicroDuck |
| 并行环境 | 4096 |
| PPO 迭代 | 6000 |
| 环境步数 | 589,824,000 |
| 训练耗时 | 01:27:41 |
| 最后一轮 mean reward | 119.57 |
| 最后一轮 mean episode length | 972.52 |
| ONNX 输入/输出 | [1, 61] -> [1, 14] |
这里的 reward 和 episode length 是训练进程最后一轮的日志值,不是跨随机种子或真机测试的独立 benchmark。使用者应结合视频、固定种子回放和自己的任务评测判断策略质量。
文件结构
checkpoints/
model_0.pt
model_500.pt
...
model_5500.pt
model_5999.pt
configs/
agent.yaml
env.yaml
export/
microduck_policy_5999.onnx
logs/
events.out.tfevents.*
every-embodied-4096x6000.log.gz
provenance/
microduck_rl.diff
videos/
walk_4096x6000.mp4
command_dance_4096x6000.mp4
milestone_0500.mp4
milestone_1000.mp4
milestone_3000.mp4
training_summary.json
SHA256SUMS
中间 checkpoint 每 500 次迭代保存一次,最后一份为 model_5999.pt。这些权重用于观察策略在训练过程中的变化,不应默认认为更靠后的 checkpoint 在所有测试条件下都更优。
下载
hf download Datawhale/Microduck-RL-4096x6000 \
--local-dir Microduck-RL-4096x6000
只下载最终 PyTorch checkpoint:
hf download Datawhale/Microduck-RL-4096x6000 \
checkpoints/model_5999.pt \
--local-dir Microduck-RL-4096x6000
复现与回放
git clone https://github.com/pollen-robotics/microduck_rl.git
cd microduck_rl
git checkout 29e887ecfbf5d37144759e5a9f8a176dfb83d547
uv sync
uv run play Mjlab-Velocity-Flat-MicroDuck \
--checkpoint-file /path/to/checkpoints/model_5999.pt
完整训练、EGL 录像、命令编舞、ONNX 导出和 51/61 维观测排错流程见:
ONNX 说明
最终 ONNX 已包含训练阶段的 observation normalizer,契约为 61 维输入和 14 维动作输出。61 维输入由 48 维本体观测和 13 维命令组成:twist(3) + head_pose(4) + body_pose(6)。
旧版推理脚本可能只构造 51 维输入,因此出现 Got: 51 Expected: 61 时,应修正命令观测布局并启用新版命令输入,不能通过裁剪或盲目补零掩盖契约差异。
使用边界
- 权重用于研究、教学、仿真回放和部署链路验证。
- 视频中的“命令编舞”复用 walking policy,通过连续改变速度、转向和头部姿态命令实现,不是单独训练的舞蹈策略。
- 将策略部署到实体机器人前,必须验证关节顺序、零位、动作尺度、限位、急停和控制频率,并从低增益、悬空或支撑测试开始。
- 本仓库不构成对真机安全性、跨场景泛化或 Sim2Real 成功率的保证。
许可与来源
microduck_rl软件代码采用 Apache-2.0。- Microduck RL 仓库中的 3D 模型采用 Creative Commons BY-SA-NC 4.0。
- 本模型仓库因此使用
license: other,使用权重、配置和衍生结果时应同时核对上游仓库的最新 LICENSE 与资产说明。 - Every Embodied 教程文本采用 CC BY 4.0。