探索-利用困境

探索-利用困境exploration–exploitation dilemma),亦被称为探索-利用权衡explore–exploit tradeoff),是决策过程中的一个核心概念,广泛存在于多个领域。它被描述为两种对立策略之间的平衡:利用(Exploitation)指根据对系统的当前认知(尽管这些认知可能是不完整或误导性的)选择已知最佳选项;而探索(Exploration)则指尝试新的选项,尽管会牺牲当前的利用机会,但可能在未来带来更好的结果。在许多旨在实现长期收益最大化的决策问题中,寻找这两种策略之间的最优平衡是一项关键挑战。

机器学习中的应用
在机器学习语境下,探索与利用的权衡是强化学习(RL)的基础。强化学习通过训练智能体根据环境反馈进行决策,而这些反馈往往具有不完整性或滞后性。智能体必须决定是利用当前已知的最佳策略,还是通过探索新策略来提升自身表现。

多臂老虎机方法
多臂老虎机(MAB)问题是这种权衡的经典案例。为此人们开发了多种方法,例如\epsilon-贪婪方法、以及置信上限(UCB)算法。

在比MAB问题更复杂的强化学习情境中,智能体可以将每个选择视为一个MAB问题,其收益为预期的未来奖励。例如,若智能体执行\epsilon-贪婪方法,通常会通过选择具有最高预测预期奖励的动作来“拉动最佳杠杆”(利用);然而,它也会以\epsilon的概率选择随机动作(探索)。例如,蒙特卡洛树搜索使用的是UCB方法的变体。

探索难题
有些问题会让探索变得非常困难。

  • 误导性奖励:如果某些早期动作能产生即时的小奖励,而其他动作能产生后续的大奖励,智能体可能会被诱导而放弃对其他动作的探索。
  • 嘈杂电视问题(Noisy TV problem):如果某些观测结果存在不可约减的噪声(比如电视上随机播放的图像),智能体可能会陷入对这些观测结果的探索(也就是“看电视”)而无法自拔。

探索奖励
本节内容基于文献。

探索奖励(也叫探索红利)方法将探索–利用困境转化为了“利用”之间的平衡。也就是说,该方法不再试图平衡探索和利用,而是直接将探索视为利用的一种形式,让智能体简单地去最大化探索奖励与利用奖励的总和。探索奖励可以被看作一种内在奖励

我们将这些奖励记为r_t^i, r_t^e,分别代表在时间步t的内在(intrinsic)奖励和外在(extrinsic)奖励。

然而,探索奖励在两个方面不同于普通的利用:

  • 利用奖励不是自由选择的,而是由环境给出的;但探索奖励可以自由设定。下文描述了设计r_t^i的多种方法。
  • 利用奖励通常是平稳的(即在相同状态下采取相同动作产生的奖励相同),但探索奖励是非平稳的(即随着探索次数增加,在相同状态下采取相同动作产生的奖励应该越来越少)。

最大熵探索中,智能体策略\pi的熵被作为内在奖励的一个项。即r_t^i = -\sum_a \pi(a | s_t) \ln \pi(a | s_t) + \cdots 。

基于预测的方法
本节内容基于文献。

内在好奇心模块(Intrinsic Curiosity Module,简称ICM)方法同时训练前向动力学模型和特征提取器。该特征提取器由一个模型训练,后者是根据当前状态和下一状态的特征来预测当前动作的函数:g: (\phi(s_t), \phi(s_{t+1})) \mapsto a_t。通过优化逆动力学,特征提取器和动力学模型的精度都会提高,进而改善智能体的探索能力。

随机网络蒸馏(Random Network Distillation,简称RND)方法尝试通过教师–学生蒸馏解决这个问题。它拥有两个模型f, f',而不是单一的前向动力学模型。教师模型f'是固定的,而学生模型f通过在状态s上最小化偏差|f(s) - f'(s)|_2^2进行训练。随着某个状态被多次访问,学生网络对教师网络的模拟会变得越来越准确。同时,预测误差也被作为智能体的探索奖励,因此智能体会学习执行能导致更高预测误差的动作。

由于教师模型是冻结的,状态需要通过减去运行平均值并除以运行方差来进行归一化。奖励也需要通过除以运行方差进行归一化。

基于分歧的探索训练前向动力学模型的集成,每个模型都基于(s_t, a_t, s_{t+1})随机子集进行训练。探索奖励就是这些模型预测结果的方差。

噪音
对于基于神经网络的智能体,NoisyNet方法通过将部分神经网络模块替换为噪声版本来引入随机性。也就是说,部分网络参数是从概率分布中提取的随机变量,而该分布的参数本身是可学习的。例如,在全连接层y = Wx + b中,W, b在每一步都从高斯分布\mathcal N(\mu_W, \Sigma_W), \mathcal N(\mu_b, \Sigma_b)中采样,并利用进行学习。

参考
文献
*

评论 (0)

  • 还没有评论,来抢沙发吧。