OpenAI News·· 2017-07-20精选AI 评分62
OpenAI 发布强化学习算法 PPO
Proximal Policy Optimization
AI 导读
OpenAI 发布一类新的强化学习算法 Proximal Policy Optimization(PPO),称其性能与当时最先进方法相当或更好,同时实现和调参都简单得多。PPO 已成为 OpenAI 的默认强化学习算法,原因是易用且性能良好。
推荐理由
OpenAI 官方发布 PPO 算法,说明其性能与实现复杂度的取舍,可作为强化学习方法的背景参考。
来源:OpenAI News · openai.com