OpenAI 的 Learning Day:每周四员工自学技术技能
OpenAI 将每周四设为 Learning Day,员工可自主安排学习日常工作中接触不到的技术技能,以提升工作表现。该制度为可选参与,学习内容聚焦于技术能力。
OpenAI 将每周四设为 Learning Day,员工可自主安排学习日常工作中接触不到的技术技能,以提升工作表现。该制度为可选参与,学习内容聚焦于技术能力。
微软向 OpenAI 投资 10 亿美元,支持其构建通用人工智能(AGI)并让经济收益广泛分布。双方将在 Microsoft Azure 上合作开发可扩展至 AGI 的硬件和软件平台,联合开发新的 Azure AI 超算技术,微软同时成为 OpenAI 的独家云服务提供商。
推荐理由:微软以 10 亿美元投资并成为 OpenAI 独家云服务商,读者可据此理解双方早期算力与平台合作框架。
OpenAI 发布政策研究论文,提出当前可用于提升 AI 安全规范长期行业合作可能性的四项策略:沟通风险与收益、技术协作、提高透明度、激励标准。分析指出,行业安全合作对确保 AI 系统安全有益至关重要,但竞争压力可能导致集体行动问题,使 AI 公司对安全投入不足。
OpenAI 于 2019 年 4 月 27 日举办了首届 OpenAI Robotics Symposium。
OpenAI Scholars 2019 届八位学者全部完成最终项目,并在 OpenAI 举办的 Scholars Demo Day 上展示。这是该项目的第二届结业班。
OpenAI Fellows 第二期学员完成 6 个月学徒期结业,每位学员从机器学习初学者成长为 OpenAI 核心贡献者。OpenAI 目前正滚动审核 OpenAI Fellows Summer 2019 的申请。
OpenAI 开发了 Sparse Transformer,一种深度神经网络,在预测文本、图像或声音序列中下一个内容的任务上创下新纪录。它通过注意力机制的算法改进提取序列模式,可处理的序列长度是此前的 30 倍。
推荐理由:OpenAI 官方介绍 Sparse Transformer 对注意力机制的算法改进,可了解长序列建模在文本、图像和声音上的早期思路。
OpenAI Five 在 Finals 周末连续两局击败 Dota 2 世界冠军战队 OG,成为首个在电竞项目中战胜世界冠军的 AI。此前 OpenAI Five 与 DeepMind 的 AlphaStar 都曾在私下战胜高水平职业选手,但在直播的职业比赛中落败,因此这也是 AI 首次在直播中击败电竞职业选手。
推荐理由:OpenAI Five 在直播中连胜 Dota 2 世界冠军 OG,可对照此前 AlphaStar 私下取胜却直播落败的经历。
OpenAI 将于 4 月 13 日太平洋时间上午 11:30 举办 OpenAI Five 的最后一场线下活动。
OpenAI 在能量模型(EBM)的稳定可扩展训练上取得进展,样本质量和泛化能力优于现有模型。EBM 生成时投入更多算力持续精修答案,在低温下可生成与 GAN 媲美的样本,同时具备似然类模型的模式覆盖保证。
OpenAI 公布 2019 届 Scholars 名单,8 位学者从 550 名申请者中入选。他们的专业背景涵盖文学、哲学、细胞生物学、统计学、经济学、量子物理和商业创新。
OpenAI 宣布成立 OpenAI LP,一家采用利润上限(capped-profit)模式的新公司,目的是快速扩大在算力和人才上的投入,同时通过制衡机制确保使命落地。
推荐理由:OpenAI 官方说明新公司架构的利润上限设计,可了解其兼顾投资扩张与使命约束的组织安排。
OpenAI 与 Google 研究人员合作推出 Activation Atlases,一种可视化神经元之间交互所代表含义的新技术。该技术旨在帮助理解 AI 系统的内部决策过程,从而在 AI 被部署于日益敏感的场景时识别其弱点并调查失败原因。
OpenAI 发布 Neural MMO,一个面向强化学习智能体的大规模多智能体游戏环境,支持在持久、开放式的任务中容纳数量可变的大量智能体。该平台引入多个智能体与物种,带来更好的探索、差异化的生态位形成以及整体能力的提升。
OpenAI 于 2 月 2 日举办了首届 Spinning Up 研讨会,这是其新教育计划的一部分。
OpenAI 发表论文指出,长期 AI 安全研究需要社会科学家参与,才能确保 AI 对齐算法在真实人类参与的场景下有效。论文认为,将先进 AI 系统与人类价值观对齐,需要解决人类理性、情绪与偏见等心理学层面的诸多不确定性。OpenAI 计划招聘社会科学家全职投入这一方向,以推动机器学习与社会科学的进一步合作。
OpenAI 首期 Fellows 项目结业,每位学员在 6 个月学徒期内从机器学习初学者成长为 OpenAI 的核心贡献者。
OpenAI 发现梯度噪声尺度这一统计指标能预测神经网络训练在多种任务上的可并行性。由于复杂任务的梯度噪声更大,未来更大的 batch size 可能变得有用,从而消除 AI 系统继续扩展的一项潜在限制。该结果表明神经网络训练并非神秘技艺,而是可以被严谨化和系统化。
OpenAI 发布训练环境 CoinRun,用于衡量智能体将经验迁移到新情境的能力,并已帮助厘清强化学习领域一个长期存在的难题。该环境在复杂度上取得平衡:比《刺猬索尼克》等传统平台游戏更简单,但仍对当前最先进算法构成值得挑战的泛化测试。
OpenAI 发布 Spinning Up in Deep RL,一套面向任何人的深度强化学习教育资源,目标是让人学会成为熟练的深度强化学习实践者。该资源包含清晰的 RL 代码示例、教学练习、文档和教程。
OpenAI 开发了一种基于能量的模型,仅需五次演示即可学会识别并生成以 2D 点集表达的 near、above、between、closest、furthest 等概念。该模型还展现出跨域迁移能力:在 2D 粒子环境中学会的概念可用于解决 3D 物理机器人任务。
OpenAI 提出 Random Network Distillation(RND),一种基于预测的奖励方法,通过好奇心鼓励强化学习智能体探索环境,首次在 Montezuma's Revenge 上超过人类平均水平。
OpenAI 提出一种名为迭代放大(iterated amplification)的 AI 安全技术,通过把任务分解为更简单的子任务来指定超出人类规模的复杂行为与目标,而非依赖标注数据或奖励函数。该构想仍处早期阶段,目前仅在简单的玩具算法领域完成实验,OpenAI 认为它可能成为可扩展的 AI 安全方案。
OpenAI 开放 OpenAI Scholars 2019 申请,这是该项目的第二批,面向代表性不足群体提供 6–10 个津贴与导师指导名额,入选者可全职学习深度学习 3 个月并开源一个项目。
OpenAI 开始接受 2019 年 Fellows 和 Interns 申请,其中 Fellows 为冬季项目、Interns 为夏季项目。申请通道现已开放,具体岗位与截止时间未在公告中说明。
OpenAI Scholars 2018 首届学员已完成该项目并提交最终项目。这是 OpenAI Scholars 的首批学员,项目至此收官。
OpenAI Five 本周在温哥华 The International 上对阵顶尖 Dota 2 选手,两局均告负,但在两局的前 20–35 分钟都保持了较高的取胜机会。
OpenAI Five 在基准测试中以三局两胜击败由 Blitz、Cap、Fogged、Merlini 和 MoonMeander 组成的 99.95 百分位 Dota 玩家队伍,其中四人有过职业 Dota 经历。比赛在直播观众面前进行,同时在线观看人数达 10 万。
推荐理由:OpenAI Five 在公开直播中三局两胜击败 99.95 百分位人类队伍,可据此了解当时 AI 在复杂实时游戏中的表现边界。
OpenAI 训练了一只类人机械手,使其能以空前的灵巧度操作物理物体。该研究来自 OpenAI,原文未披露具体训练方法与技术细节。
OpenAI 首届 Scholars 项目正在进行中,一批经验丰富的软件开发者正转型为机器学习从业者。该项目进展现已对外公开,可随时关注这批学者的学习与实践动态。
OpenAI Five Benchmark 比赛已结束。OpenAI 公布了这场 Dota 2 人机对抗基准赛的结果。
OpenAI 提出可逆生成模型 Glow,采用可逆 1x1 卷积,在简化架构的同时扩展了此前的可逆生成模型工作。该模型能生成逼真的高分辨率图像,支持高效采样,并可发现用于操控数据属性的特征。OpenAI 已发布模型代码和在线可视化工具。
OpenAI 训练智能体仅凭单次人类演示就在 Montezuma's Revenge 上取得 74,500 分的高分,超过此前所有已发表结果。其算法从演示中精心挑选状态出发,让智能体依次游玩一系列游戏,并用 PPO 优化游戏得分来学习,PPO 也是支撑 OpenAI Five 的同一强化学习算法。
推荐理由:OpenAI 用单次人类演示让智能体在 Montezuma's Revenge 上取得 74,500 分,可了解其基于 PPO 的简单方法。
OpenAI 宣布由五个神经网络组成的 OpenAI Five 已开始击败 Dota 2 业余人类队伍。该团队由五个神经网络构成,此次披露仅给出这一结果,未提供更多技术细节。
推荐理由:OpenAI 官方披露五个神经网络组成的 OpenAI Five 已能击败 Dota 2 业余人类队伍,可了解早期多智能体协作的进展。
OpenAI 首届 Retro Contest 已完成,该比赛探索能从前序经验中泛化的算法。
OpenAI 在一系列多样语言任务上取得当时最优结果,方法结合了 Transformer 与无监督预训练,并同步公开这套可扩展、与任务无关的系统。OpenAI 表示,这一结果说明监督学习方法与无监督预训练搭配效果很好,希望推动在更大、更多样数据集上继续探索这一思路。
推荐理由:OpenAI 用 Transformer 加无监督预训练在多项语言任务上取得当时最优结果,并公开了这套与任务无关的系统。
OpenAI 开放 Fellows 2018 秋季班申请,该项目提供为期 6 个月、带薪酬的 AI 研究学徒岗位。
OpenAI 发布强化学习游戏研究平台 Gym Retro 的完整版,公开可用的游戏数量从约 70 款 Atari 游戏和 30 款 Sega 游戏扩展到覆盖多种模拟器的 1000 款以上。OpenAI 同时发布了用于向该平台添加新游戏的工具。
推荐理由:OpenAI 把强化学习游戏平台 Gym Retro 的游戏规模从约百款扩到 1000 款以上,并公开了添加新游戏的工具。
OpenAI 发布一项分析,指出自 2012 年以来最大规模 AI 训练所用算力呈指数增长,翻倍周期为 3.4 个月,而摩尔定律的翻倍周期为 2 年。该指标自 2012 年以来增长超过 300,000 倍,若按 2 年翻倍则仅增长 7 倍。OpenAI 表示算力提升是 AI 进展的关键组成部分,若这一趋势延续,值得为远超当前能力的系统做准备。
推荐理由:OpenAI 用 3.4 个月翻倍这一量化指标,给出 AI 训练算力增速与摩尔定律的对比参照。
OpenAI 提出一种 AI 安全技术,训练智能体就话题相互辩论,由人类判断胜负。该方法旨在借助辩论提升 AI 系统的安全性。