跳到正文
原文
Hugging Face Blog·· 2022-08-05AI 评分22

Hugging Face 深度强化学习课程第 8 单元:Proximal Policy Optimization (PPO)

Proximal Policy Optimization (PPO)

AI 导读

Hugging Face 深度强化学习课程第 8 单元讲解 Proximal Policy Optimization (PPO),通过在当前策略与旧策略的概率比上做裁剪(范围 [1−ϵ,1+ϵ])来限制每轮策略更新幅度,避免更新过大导致训练不稳定。课程随后用 PyTorch 从零实现 PPO,并在 CartPole-v1 和 LunarLander-v2 上验证。

来源:Hugging Face Blog · huggingface.co