在人工智能中,学徒学习(或称示教学习或模仿学习)是通过观察专家进行学习的过程。
它可被视为一种监督学习,其中训练数据集由示教教师执行的任务构成。
IRL问题可定义为:
该场景可建模为“合作式逆向强化学习博弈”,其中“人”玩家与“机器人”玩家合作实现人的隐含目标,即便人与机器人都未明确知晓这些目标。
2017年,OpenAI与DeepMind将深度学习应用于简单领域(如雅达利游戏)和简单机器人任务(如后空翻)的合作式逆向强化学习。人类角色仅需回答机器人关于两种动作偏好的询问。研究者发现该技术有望经济地扩展到现代系统。
基于逆向强化学习的学徒学习(AIRP)由加州大学伯克利分校电子工程与计算机科学系教授彼得·阿比爾与斯坦福大学计算机系副教授吳恩達于2004年提出。AIRP处理“马尔可夫决策过程中未显式给出奖励函数,但可观察专家演示待学习任务”的问题。
系统模型方法
系统模型方法通过建模世界动力学来模仿专家行为。
1997年,机器人专家Stefan Schaal在Sarcos机械臂上研究摆起倒立摆任务。机器人可执行动作使摆运动,但动作与运动关系不明确,属于可用数学描述但难以求解的最优控制问题。Schaal的思路是不使用暴力求解,而是记录人类示教动作,在纵轴记录三秒内摆角,形成带模式的图表。
评论 (0)