强化学习的概念
强化学习主要由智能体(agent)和环境(environment)两部分组成。智能体代表具有行为能力的物体,环境指智能体执行动作时所处的场景。其目标是寻找一个最优策略,使智能体在运动过程中获得的累积奖励最大。
强化学习图示
通俗的说:
强化学习算法通过不断的与用户进行交互,先推送少量的类似信息给用户,看用户的反馈,然后根据用户的反馈再推送相关的内容,并在后序交互过程中继续根据用户的反馈不断维护和更新上述内容。

学习过程
强化学习可以用四元组<S,A,P,R>表示,其中S为状态集合、A为动作集合、P为状态转移函数、R为奖励函数,其计算流程如下:

(1)在时刻ttt,智能体所处状态为st∈Ss_t \in SstS,此时需要一定的策略policy从动作集合中选择一个动作at∈Aa_t \in AatA。动作的连续性和集合的大小会直接影响到后面的结果;

(2)在完成动作ata_tat后,环境会给出一个强化信号rtr_trt(奖励或者惩罚),经典的强化信号计算方法为:

GtG_tGt=rt+rt+1+...+γnrt+nr_t+r_{t+1}+...+\gamma^nr_{t+n}rt+rt+1+...+γnrt+n

其中GtG_tGt为奖励的回报,γ\gammaγ是衰减因子0≤γ≤10\leq \gamma \leq 10γ1,nnn是奖励的积累步骤,可以取到无限大。当γ=0\gamma=0γ=0时,回报只考虑当下的奖励,当γ=1\gamma=1γ=1时,回报会考虑整个过程的影响;

(3)动作ata_tat同时会改变环境。从当前状态sts_tst转移到下一状态st+1s_{t+1}st+1,在此之后,智能体根据t+1t+1t+1时刻的状态st+1s_{t+1}st+1选择下一个动作,进入下一个时间点的迭代。

Logo

魔乐社区(Modelers.cn) 是一个中立、公益的人工智能社区,提供人工智能工具、模型、数据的托管、展示与应用协同服务,为人工智能开发及爱好者搭建开放的学习交流平台。社区通过理事会方式运作,由全产业链共同建设、共同运营、共同享有,推动国产AI生态繁荣发展。

更多推荐