ARTICLE DETAIL

资讯详情

深耕网站建设、视觉设计与SEO优化的一线实战洞察。

158、逆强化学习:从人类演示学习奖励函数的IRL与GAIL

158、逆强化学习:从人类演示学习奖励函数的IRL与GAIL 158、逆强化学习:从人类演示学习奖励函数的IRL与GAIL从一次失败的模仿学习调试说起上个月我在调试一个机械臂插拔USB的任务,用行为克隆(Behavior Cloning)训练了一个策略,数据采集了三千条人类演示。结果模型在仿真里跑得还行,一上真机就露馅——插拔动作僵硬不说,遇到USB口稍微歪一点就直接怼上去硬戳,完全不懂得微调。我盯着loss曲线看了半天,BC的loss已经收敛得很漂亮了,但策略学到的只是“平均动作”,把演示里的多样性全磨平了。这个问题的根源在于行为克隆本质上是监督学习,它假设演示数据是独立同分布的,但机器人操作是序列决策问题,一步错步步错。更致命的是,BC完全没有利用“结果”信息——演示里人类成功插上USB这个结果,在BC的训练目标里根本不存在。这时候我意识到,需要换一个思路:不直接学策略,而是先学“什么行为是好的”,也就是学奖励函数。逆强化学习的核心思想:奖励函数才是关键逆强化学习(Inverse Reinforcement Learning, IRL)的逻辑和强化学习正好相反。强化学习是给定奖励函数学策略,IRL是给定专家演示反推奖励函数。为什么要这么做?因为奖励函数比策略更本质、更可迁移。一个插USB的奖励函数,可以泛化到不同角度、不同力度的插拔场景,但一个BC学出来的策略,换个环境就废了。但IRL有个著名的病态问题:奖励函数不唯一。任何常数奖励都能解释专家演示,因为专家在任意奖励下都是最优的(如果所有轨迹奖励相同的话)。所以经典的IRL(比如Ng和Russell 2000年的工作)需要加约束,比如最大化专家轨迹
返回列表