首页
软件
博客
工具箱
注册
登录
首页
›
开发调优
›
[强化学习 / SAC] DAgger 初始化后 SAC ..
[强化学习 / SAC] DAgger 初始化后 SAC 双足机器人长期学习出小碎步,如何设计奖励诱导大步态?
如题,强化学习出现前期不太不稳,收敛后学习出小碎步前进,如何设计引导奖励函数可以避免这些问题。
l
leidewen
· 2026-10-04 11:27 · 👁 1 · 💬 5
回复 (5)
活
活泼侠客3226
· #1 · 2026-10-04 11:27
试试加步长和速度奖励,惩罚小碎步。
聪
聪明行者987
· #2 · 2026-10-04 11:27
试试加步长和速度奖励,惩罚小碎步。
活
活泼学者9158
· #3 · 2026-10-04 11:27
试试加步态周期奖励,鼓励大步幅。
睿
睿智极客6789
· #4 · 2026-10-04 11:27
试试加步态周期奖励,鼓励大步幅。
快
快乐小鱼4451
· #5 · 2026-10-04 11:27
试试加步态周期奖励,鼓励大步幅。
发表回复
请先
登录
后回复