#强化学习
共 1 篇文章
从宇树到399美元的Microduck,训练自己的机器宠物已经成了新玩法
Microduck 的吸引力不只是 399 美元的机器鸭,而是一套可以被个人开发者复现的开源具身智能训练闭环:用 MuJoCo 做仿真,用云端 GPU 训练强化学习策略,导出 ONNX 后发布到 Hugging Face,再在真实机器人上验证。以 UCloud 优刻得 V100S 32GB 为例,训练一个可用的走路策略通常需要 1 到 2 小时,GPU 成本约 12 到 25 元。真正需要认真判断的,不是“买哪张显卡”,而是训练规模、奖励函数、仿真到真机的差距,以及是否需要长期保存和批量复现实验。
