Lilian Weng — Lil’Log·· 2020-06-07AI 评估 · 24/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。
深度强化学习中的探索策略
Exploration Strategies in Deep Reinforcement Learning
AI 导读
针对深度强化学习中"探索"这一尚未解决的开放问题,文章梳理了从 epsilon-greedy、UCB、Boltzmann 探索到 Thompson sampling 的经典策略,以及熵损失项和噪声注入等深度 RL 探索方法。
来源:Lilian Weng — Lil’Log · lilianweng.github.io