OpenAI Retro Contest 首届比赛结果公布
OpenAI 首届 Retro Contest 已完成,该比赛探索能从前序经验中泛化的算法。
OpenAI 首届 Retro Contest 已完成,该比赛探索能从前序经验中泛化的算法。
OpenAI 在一系列多样语言任务上取得当时最优结果,方法结合了 Transformer 与无监督预训练,并同步公开这套可扩展、与任务无关的系统。OpenAI 表示,这一结果说明监督学习方法与无监督预训练搭配效果很好,希望推动在更大、更多样数据集上继续探索这一思路。
推荐理由:OpenAI 用 Transformer 加无监督预训练在多项语言任务上取得当时最优结果,并公开了这套与任务无关的系统。
OpenAI 发布一项分析,指出自 2012 年以来最大规模 AI 训练所用算力呈指数增长,翻倍周期为 3.4 个月,而摩尔定律的翻倍周期为 2 年。该指标自 2012 年以来增长超过 300,000 倍,若按 2 年翻倍则仅增长 7 倍。OpenAI 表示算力提升是 AI 进展的关键组成部分,若这一趋势延续,值得为远超当前能力的系统做准备。
推荐理由:OpenAI 用 3.4 个月翻倍这一量化指标,给出 AI 训练算力增速与摩尔定律的对比参照。
OpenAI 提出一种 AI 安全技术,训练智能体就话题相互辩论,由人类判断胜负。该方法旨在借助辩论提升 AI 系统的安全性。
OpenAI 发布实验性元学习方法 Evolved Policy Gradients(EPG),通过进化学习智能体的损失函数,使其能在新任务上快速训练。用 EPG 训练的智能体在测试时可完成训练范围之外的基础任务,例如学会导航到房间中与训练时放置位置相反一侧的物体。
OpenAI 开发出可扩展元学习算法 Reptile,通过反复采样任务、执行随机梯度下降并将初始参数朝该任务最终参数更新。Reptile 是 Shortest Descent 算法在元学习场景的应用,数学上与一阶 MAML 相似,只需对 SGD 或 Adam 等优化器进行黑盒访问,计算效率与性能相近。
OpenAI 发布八个模拟机器人环境,以及 Hindsight Experience Replay 的 Baselines 实现,均为过去一年研究开发。这些环境已用于训练可在实体机器人上运行的模型,OpenAI 同时发布了一系列机器人研究课题请求。
OpenAI 与 Future of Humanity Institute、Centre for the Study of Existential Risk、Center for a New American Security。
推荐理由:OpenAI 与多家机构联合预测 AI 被恶意利用的路径,并给出预防与缓解思路。
OpenAI 设计了一种让 AI 互相教学的方法,所选取的示例同时也能被人类理解。该方法会自动挑选最具信息量的示例来教授某个概念,例如用最能描述"狗"这一概念的图像,实验显示它对 AI 教学有效。
OpenAI 构建了一套实体消歧系统,通过神经网络判断一个词是否属于约 100 个自动发现的“类型”(非互斥类别),从而自动确定该词指代哪个对象。
OpenAI 发布 Requests for Research 2.0,公开了 7 个在其研究过程中出现的未解问题。该批次问题面向研究社区征集解法,具体方向与参与方式未在原文中展开。
OpenAI 发布面向块稀疏权重神经网络的高度优化 GPU 内核,按所选稀疏度可比 cuBLAS 或 cuSPARSE 快数个数量级。该内核已用于文本情感分析以及文本和图像生成建模,并取得当时最优结果。
OpenAI 开发出一种分层强化学习算法,能学习对解决多类任务有用的高层动作,从而快速求解需要数千个时间步的任务。在导航问题集上,该算法发现了向不同方向行走和爬行的高层动作,使智能体能够快速掌握新的导航任务。
OpenAI 最新机器人技术让完全在模拟中训练的控制器部署到实体机器人后,能在完成简单任务时对环境中未预料的变化做出反应,即从以往的开环系统升级为闭环系统。
OpenAI 展示,在模拟机器人摔跤任务中,元学习智能体能够快速击败更强的非元学习智能体,并能适应物理故障。
OpenAI 发现自博弈能让模拟 AI 自行发现擒抱、闪避、假动作、踢球、接球和扑球等身体技能,而无需在设计环境时预先考虑这些技能。自博弈还能让环境难度始终与 AI 的当前水平相匹配。结合此前的 Dota 2 自博弈结果,OpenAI 表示越来越相信自博弈将成为未来强大 AI 系统的核心组成部分。
推荐理由:OpenAI 用自博弈让模拟 AI 自行涌现出擒抱、假动作等身体技能,可与 Dota 2 结果对照理解自博弈的训练思路。
OpenAI 发布 Learning with Opponent-Learning Awareness(LOLA)算法,该算法考虑到其他智能体也在学习,能在迭代囚徒困境中发现“tit-for-tat”这类既自利又合作的策略。这是迈向能够建模他人心智的智能体的一小步。
OpenAI 发文说明其 Dota 2 结果表明,在算力充足的前提下,自对弈能把机器学习系统的表现从远低于人类水平提升到超人水平。该系统在一个月内从勉强与高排名玩家打平,发展到击败顶尖职业选手,此后仍在持续进步。OpenAI 指出,监督式深度学习系统的上限受训练数据集限制,而自对弈系统中可用数据会随智能体变强而自动改善。
推荐理由:OpenAI 用 Dota 2 结果说明自对弈在算力充足时能把系统从远低于人类提升到超人水平。
OpenAI 训练出一个机器人,在标准锦标赛规则下的 Dota 2 1v1 对战中击败了世界顶级职业选手。该机器人完全通过自我对弈从零学习游戏,未使用模仿学习或树搜索。OpenAI 称这是朝着构建能在涉及真实人类的混乱复杂情境中完成明确目标的人工智能系统迈出的一步。
推荐理由:OpenAI 用自我对弈从零训练出的机器人击败 Dota 2 顶级职业选手,展示了在复杂对抗环境中达成目标的一种路径。
OpenAI 发现向强化学习算法的参数中加入自适应噪声,往往能提升性能。这种探索方法实现简单,且极少导致性能下降,因此值得在任何问题上尝试。
OpenAI 发布一类新的强化学习算法 Proximal Policy Optimization(PPO),称其性能与当时最先进方法相当或更好,同时实现和调参都简单得多。PPO 已成为 OpenAI 的默认强化学习算法,原因是易用且性能良好。
推荐理由:OpenAI 官方发布 PPO 算法,说明其性能与实现复杂度的取舍,可作为强化学习方法的背景参考。
OpenAI 造出可从不同尺度和视角稳定欺骗神经网络分类器的对抗图像,直接挑战上周"自动驾驶汽车因多尺度、多角度采集图像而难以被恶意欺骗"的说法。
OpenAI 与 DeepMind 安全团队合作开发了一种算法,通过让人类判断两种候选行为哪个更好,来推断人类想要什么。OpenAI 表示,构建安全 AI 系统的一步是免去人类编写目标函数的需要,因为用简单代理替代复杂目标或把复杂目标写偏一点,都可能导致不良甚至危险的行为。
推荐理由:OpenAI 与 DeepMind 安全团队合作提出用人类偏好比较替代手写目标函数,可了解早期对齐研究的一条思路。
OpenAI 发文指出,智能体争夺资源的多智能体环境是通往 AGI 的踏脚石,其难度由竞争对手的水平决定,与自身克隆体对抗时环境恰好匹配自身能力。这类环境不存在稳定均衡,智能体再聪明也始终面临变得更聪明的压力,因此与传统环境体验迥异,仍需大量研究才能驾驭。
OpenAI 创建了一套机器人系统,完全在仿真中训练并部署到实体机器人上,能够在看过一次任务演示后学会该新任务。
推荐理由:OpenAI 展示了一套完全在仿真中训练、可直接部署到实体机器人的系统,读者可了解其单次示范学习新任务的能力。
OpenAI 开发了一个无监督系统,仅通过预测 Amazon 评论文本中的下一个字符进行训练,却学到了出色的情感表征。该系统由此形成了可解释的"情感神经元",无需任何情感标注数据。
OpenAI 称已造出全球首个完全在仿真中训练、并部署到实体机器人上的垃圾邮件检测 AI。该 AI 无需真实环境数据即可完成训练,随后在物理机器人上运行。
OpenAI 发现,已有数十年历史的进化策略(ES)在现代强化学习基准(如 Atari/MuJoCo)上性能可与标准强化学习(RL)相媲美,同时规避了 RL 的诸多不便。该研究将 ES 定位为强化学习的一种可扩展替代方案。
OpenAI 发布一项新研究,介绍智能体在其中发展出自己的语言。该文为 OpenAI 官方博客文章,正文仅提供摘要,未给出具体方法、实验设置或结果细节。
对抗样本是攻击者刻意设计、能让机器学习模型出错的输入,相当于机器的视觉错觉。OpenAI 展示了对抗样本如何跨不同媒介生效,并讨论了防御这类攻击为何困难。
OpenAI 与 Berkeley、Stanford 研究人员共同合著了由 Google Brain 主导的论文《Concrete Problems in AI Safety》,探讨如何确保现代机器学习系统按预期运行。论文聚焦于围绕这一目标的诸多研究问题。
OpenAI 介绍了四个围绕生成模型的项目,生成模型是机器学习中无监督学习技术的一个分支。文章同时解释了生成模型是什么、为何重要,以及它们可能的发展方向。