OpenAI 用无监督学习提升语言理解能力
OpenAI 在一系列多样语言任务上取得当时最优结果,方法结合了 Transformer 与无监督预训练,并同步公开这套可扩展、与任务无关的系统。OpenAI 表示,这一结果说明监督学习方法与无监督预训练搭配效果很好,希望推动在更大、更多样数据集上继续探索这一思路。
推荐理由:OpenAI 用 Transformer 加无监督预训练在多项语言任务上取得当时最优结果,并公开了这套与任务无关的系统。
OpenAI 的全部动态:GPT 系列模型、ChatGPT 与 Sora 产品、公司战略与人事的持续追踪。
OpenAI 在一系列多样语言任务上取得当时最优结果,方法结合了 Transformer 与无监督预训练,并同步公开这套可扩展、与任务无关的系统。OpenAI 表示,这一结果说明监督学习方法与无监督预训练搭配效果很好,希望推动在更大、更多样数据集上继续探索这一思路。
推荐理由:OpenAI 用 Transformer 加无监督预训练在多项语言任务上取得当时最优结果,并公开了这套与任务无关的系统。
OpenAI 发布强化学习游戏研究平台 Gym Retro 的完整版,公开可用的游戏数量从约 70 款 Atari 游戏和 30 款 Sega 游戏扩展到覆盖多种模拟器的 1000 款以上。OpenAI 同时发布了用于向该平台添加新游戏的工具。
推荐理由:OpenAI 把强化学习游戏平台 Gym Retro 的游戏规模从约百款扩到 1000 款以上,并公开了添加新游戏的工具。
OpenAI 发布一项分析,指出自 2012 年以来最大规模 AI 训练所用算力呈指数增长,翻倍周期为 3.4 个月,而摩尔定律的翻倍周期为 2 年。该指标自 2012 年以来增长超过 300,000 倍,若按 2 年翻倍则仅增长 7 倍。OpenAI 表示算力提升是 AI 进展的关键组成部分,若这一趋势延续,值得为远超当前能力的系统做准备。
推荐理由:OpenAI 用 3.4 个月翻倍这一量化指标,给出 AI 训练算力增速与摩尔定律的对比参照。
OpenAI 与 Future of Humanity Institute、Centre for the Study of Existential Risk、Center for a New American Security。
推荐理由:OpenAI 与多家机构联合预测 AI 被恶意利用的路径,并给出预防与缓解思路。
OpenAI 发现自博弈能让模拟 AI 自行发现擒抱、闪避、假动作、踢球、接球和扑球等身体技能,而无需在设计环境时预先考虑这些技能。自博弈还能让环境难度始终与 AI 的当前水平相匹配。结合此前的 Dota 2 自博弈结果,OpenAI 表示越来越相信自博弈将成为未来强大 AI 系统的核心组成部分。
推荐理由:OpenAI 用自博弈让模拟 AI 自行涌现出擒抱、假动作等身体技能,可与 Dota 2 结果对照理解自博弈的训练思路。
OpenAI 发文说明其 Dota 2 结果表明,在算力充足的前提下,自对弈能把机器学习系统的表现从远低于人类水平提升到超人水平。该系统在一个月内从勉强与高排名玩家打平,发展到击败顶尖职业选手,此后仍在持续进步。OpenAI 指出,监督式深度学习系统的上限受训练数据集限制,而自对弈系统中可用数据会随智能体变强而自动改善。
推荐理由:OpenAI 用 Dota 2 结果说明自对弈在算力充足时能把系统从远低于人类提升到超人水平。
OpenAI 训练出一个机器人,在标准锦标赛规则下的 Dota 2 1v1 对战中击败了世界顶级职业选手。该机器人完全通过自我对弈从零学习游戏,未使用模仿学习或树搜索。OpenAI 称这是朝着构建能在涉及真实人类的混乱复杂情境中完成明确目标的人工智能系统迈出的一步。
推荐理由:OpenAI 用自我对弈从零训练出的机器人击败 Dota 2 顶级职业选手,展示了在复杂对抗环境中达成目标的一种路径。
OpenAI 发布一类新的强化学习算法 Proximal Policy Optimization(PPO),称其性能与当时最先进方法相当或更好,同时实现和调参都简单得多。PPO 已成为 OpenAI 的默认强化学习算法,原因是易用且性能良好。
推荐理由:OpenAI 官方发布 PPO 算法,说明其性能与实现复杂度的取舍,可作为强化学习方法的背景参考。
OpenAI 与 DeepMind 安全团队合作开发了一种算法,通过让人类判断两种候选行为哪个更好,来推断人类想要什么。OpenAI 表示,构建安全 AI 系统的一步是免去人类编写目标函数的需要,因为用简单代理替代复杂目标或把复杂目标写偏一点,都可能导致不良甚至危险的行为。
推荐理由:OpenAI 与 DeepMind 安全团队合作提出用人类偏好比较替代手写目标函数,可了解早期对齐研究的一条思路。
OpenAI 开源内部项目 OpenAI Baselines,目标是以与已发表结果相当的性能复现强化学习算法。算法将在未来数月内陆续发布,今天的首批发布包含 DQN 及其三个变体。
推荐理由:OpenAI 开源内部复现强化学习算法的 Baselines 项目,首批放出 DQN 及其三个变体,可了解其复现思路与后续发布节奏。
OpenAI 创建了一套机器人系统,完全在仿真中训练并部署到实体机器人上,能够在看过一次任务演示后学会该新任务。
推荐理由:OpenAI 展示了一套完全在仿真中训练、可直接部署到实体机器人的系统,读者可了解其单次示范学习新任务的能力。
OpenAI 发布 Roboschool,这是一款用于机器人仿真的开源软件,并与 OpenAI Gym 集成。
推荐理由:OpenAI 开源机器人仿真软件并接入 Gym,可了解早期具身智能训练环境的开放方式。
OpenAI 发布 Universe,一个用于衡量和训练 AI 通用智能的软件平台。该平台覆盖全球范围内的游戏、网站及其他应用。
推荐理由:OpenAI 官方发布 Universe 平台,读者可了解其用游戏和网站训练通用智能的定位。
OpenAI 发布 OpenAI Gym 公测版,这是一个用于开发和比较强化学习(RL)算法的工具包。它包含一套持续扩充的环境,涵盖模拟机器人和 Atari 游戏,并提供一个用于比较和复现结果的站点。
推荐理由:OpenAI 官方发布强化学习工具包公测,读者可了解其环境套件与结果对比站点的构成。
OpenAI 宣布成立,定位为非营利人工智能研究公司,目标是推进数字智能并以造福全人类为方向,不受盈利需求约束。官方表示,由于研究不受财务义务限制,可以更专注于对人类产生积极影响。
推荐理由:OpenAI 官方公开其非营利定位与使命,可作为理解该机构早期组织形态的一手背景。