跳到正文
原文
Hugging Face Blog·· 2022-06-30AI 评分22

Hugging Face 深度强化学习课程第 5 单元:用 PyTorch 实现策略梯度

Policy Gradient with PyTorch

AI 导读

Hugging Face 深度强化学习课程第 5 单元讲解策略梯度方法,并从头用 PyTorch 实现首个基于策略的算法 Reinforce,随后在 CartPole-v1、PixelCopter 和 Pong 上测试其鲁棒性。策略梯度直接优化策略、无需估计价值函数,可学习随机策略并省去手工的探索/利用权衡,更适合高维和连续动作空间,但易收敛到局部最优、训练更慢且方差较高。

来源:Hugging Face Blog · huggingface.co