跳到正文

#OpenAI

今日 1 条
10月26日周四
10月19日周四
10月11日周三
  1. OpenAI News62

    OpenAI 发现自博弈让模拟 AI 自行学会身体技能

    OpenAI 发现自博弈能让模拟 AI 自行发现擒抱、闪避、假动作、踢球、接球和扑球等身体技能,而无需在设计环境时预先考虑这些技能。自博弈还能让环境难度始终与 AI 的当前水平相匹配。结合此前的 Dota 2 自博弈结果,OpenAI 表示越来越相信自博弈将成为未来强大 AI 系统的核心组成部分。

    推荐理由:OpenAI 用自博弈让模拟 AI 自行涌现出擒抱、假动作等身体技能,可与 Dota 2 结果对照理解自博弈的训练思路。

9月14日周四
8月18日周五
8月16日周三
  1. OpenAI News83

    OpenAI 详解 Dota 2:自对弈如何把系统从人类水平之下推到超人水平

    OpenAI 发文说明其 Dota 2 结果表明,在算力充足的前提下,自对弈能把机器学习系统的表现从远低于人类水平提升到超人水平。该系统在一个月内从勉强与高排名玩家打平,发展到击败顶尖职业选手,此后仍在持续进步。OpenAI 指出,监督式深度学习系统的上限受训练数据集限制,而自对弈系统中可用数据会随智能体变强而自动改善。

    推荐理由:OpenAI 用 Dota 2 结果说明自对弈在算力充足时能把系统从远低于人类提升到超人水平。

8月11日周五
  1. OpenAI News80

    OpenAI 机器人击败 Dota 2 顶级职业选手

    OpenAI 训练出一个机器人,在标准锦标赛规则下的 Dota 2 1v1 对战中击败了世界顶级职业选手。该机器人完全通过自我对弈从零学习游戏,未使用模仿学习或树搜索。OpenAI 称这是朝着构建能在涉及真实人类的混乱复杂情境中完成明确目标的人工智能系统迈出的一步。

    推荐理由:OpenAI 用自我对弈从零训练出的机器人击败 Dota 2 顶级职业选手,展示了在复杂对抗环境中达成目标的一种路径。

8月3日周四
7月27日周四
7月20日周四
  1. OpenAI News62

    OpenAI 发布强化学习算法 PPO

    OpenAI 发布一类新的强化学习算法 Proximal Policy Optimization(PPO),称其性能与当时最先进方法相当或更好,同时实现和调参都简单得多。PPO 已成为 OpenAI 的默认强化学习算法,原因是易用且性能良好。

    推荐理由:OpenAI 官方发布 PPO 算法,说明其性能与实现复杂度的取舍,可作为强化学习方法的背景参考。

7月17日周一
6月28日周三
6月13日周二
  1. OpenAI News62

    OpenAI 与 DeepMind 合作提出从人类偏好中学习的方法

    OpenAI 与 DeepMind 安全团队合作开发了一种算法,通过让人类判断两种候选行为哪个更好,来推断人类想要什么。OpenAI 表示,构建安全 AI 系统的一步是免去人类编写目标函数的需要,因为用简单代理替代复杂目标或把复杂目标写偏一点,都可能导致不良甚至危险的行为。

    推荐理由:OpenAI 与 DeepMind 安全团队合作提出用人类偏好比较替代手写目标函数,可了解早期对齐研究的一条思路。

6月8日周四
5月24日周三
  1. OpenAI News62

    OpenAI 开源 Baselines 项目,首批发布 DQN 及三个变体

    OpenAI 开源内部项目 OpenAI Baselines,目标是以与已发表结果相当的性能复现强化学习算法。算法将在未来数月内陆续发布,今天的首批发布包含 DQN 及其三个变体。

    推荐理由:OpenAI 开源内部复现强化学习算法的 Baselines 项目,首批放出 DQN 及其三个变体,可了解其复现思路与后续发布节奏。

5月16日周二
5月15日周一
4月6日周四
4月1日周六
3月24日周五
3月20日周一
3月16日周四
2月24日周五
1月30日周一
12月21日周三
12月5日周一
  1. OpenAI News62

    OpenAI 发布 Universe 软件平台

    OpenAI 发布 Universe,一个用于衡量和训练 AI 通用智能的软件平台。该平台覆盖全球范围内的游戏、网站及其他应用。

    推荐理由:OpenAI 官方发布 Universe 平台,读者可了解其用游戏和网站训练通用智能的定位。

11月15日周二
10月13日周四
8月29日周一
8月18日周四
8月16日周二
7月28日周四
6月21日周二
6月20日周一
6月16日周四
5月25日周三
4月27日周三
  1. OpenAI News62

    OpenAI 发布强化学习工具包 OpenAI Gym 公测版

    OpenAI 发布 OpenAI Gym 公测版,这是一个用于开发和比较强化学习(RL)算法的工具包。它包含一套持续扩充的环境,涵盖模拟机器人和 Atari 游戏,并提供一个用于比较和复现结果的站点。

    推荐理由:OpenAI 官方发布强化学习工具包公测,读者可了解其环境套件与结果对比站点的构成。

4月26日周二
3月31日周四