OpenAI 发布强化学习算法 PPO
OpenAI 发布一类新的强化学习算法 Proximal Policy Optimization(PPO),称其性能与当时最先进方法相当或更好,同时实现和调参都简单得多。PPO 已成为 OpenAI 的默认强化学习算法,原因是易用且性能良好。
推荐理由:OpenAI 官方发布 PPO 算法,说明其性能与实现复杂度的取舍,可作为强化学习方法的背景参考。
OpenAI 发布一类新的强化学习算法 Proximal Policy Optimization(PPO),称其性能与当时最先进方法相当或更好,同时实现和调参都简单得多。PPO 已成为 OpenAI 的默认强化学习算法,原因是易用且性能良好。
推荐理由:OpenAI 官方发布 PPO 算法,说明其性能与实现复杂度的取舍,可作为强化学习方法的背景参考。
OpenAI 造出可从不同尺度和视角稳定欺骗神经网络分类器的对抗图像,直接挑战上周"自动驾驶汽车因多尺度、多角度采集图像而难以被恶意欺骗"的说法。
OpenAI 与 DeepMind 安全团队合作开发了一种算法,通过让人类判断两种候选行为哪个更好,来推断人类想要什么。OpenAI 表示,构建安全 AI 系统的一步是免去人类编写目标函数的需要,因为用简单代理替代复杂目标或把复杂目标写偏一点,都可能导致不良甚至危险的行为。
推荐理由:OpenAI 与 DeepMind 安全团队合作提出用人类偏好比较替代手写目标函数,可了解早期对齐研究的一条思路。
OpenAI 发文指出,智能体争夺资源的多智能体环境是通往 AGI 的踏脚石,其难度由竞争对手的水平决定,与自身克隆体对抗时环境恰好匹配自身能力。这类环境不存在稳定均衡,智能体再聪明也始终面临变得更聪明的压力,因此与传统环境体验迥异,仍需大量研究才能驾驭。
OpenAI 创建了一套机器人系统,完全在仿真中训练并部署到实体机器人上,能够在看过一次任务演示后学会该新任务。
推荐理由:OpenAI 展示了一套完全在仿真中训练、可直接部署到实体机器人的系统,读者可了解其单次示范学习新任务的能力。
OpenAI 开发了一个无监督系统,仅通过预测 Amazon 评论文本中的下一个字符进行训练,却学到了出色的情感表征。该系统由此形成了可解释的"情感神经元",无需任何情感标注数据。
OpenAI 称已造出全球首个完全在仿真中训练、并部署到实体机器人上的垃圾邮件检测 AI。该 AI 无需真实环境数据即可完成训练,随后在物理机器人上运行。
OpenAI 发现,已有数十年历史的进化策略(ES)在现代强化学习基准(如 Atari/MuJoCo)上性能可与标准强化学习(RL)相媲美,同时规避了 RL 的诸多不便。该研究将 ES 定位为强化学习的一种可扩展替代方案。
OpenAI 发布一项新研究,介绍智能体在其中发展出自己的语言。该文为 OpenAI 官方博客文章,正文仅提供摘要,未给出具体方法、实验设置或结果细节。
对抗样本是攻击者刻意设计、能让机器学习模型出错的输入,相当于机器的视觉错觉。OpenAI 展示了对抗样本如何跨不同媒介生效,并讨论了防御这类攻击为何困难。
OpenAI 与 Berkeley、Stanford 研究人员共同合著了由 Google Brain 主导的论文《Concrete Problems in AI Safety》,探讨如何确保现代机器学习系统按预期运行。论文聚焦于围绕这一目标的诸多研究问题。
OpenAI 介绍了四个围绕生成模型的项目,生成模型是机器学习中无监督学习技术的一个分支。文章同时解释了生成模型是什么、为何重要,以及它们可能的发展方向。