OpenAI News·· 2018-10-31AI 评分50
OpenAI 用基于预测的奖励做强化学习,RND 首次在 Montezuma's Revenge 上超越人类平均水平
Reinforcement learning with prediction-based rewards
AI 导读
OpenAI 提出 Random Network Distillation(RND),一种基于预测的奖励方法,通过好奇心鼓励强化学习智能体探索环境,首次在 Montezuma's Revenge 上超过人类平均水平。
来源:OpenAI News · openai.com