跳到正文

全部动态

今日 2 条
8月22日周四
7月10日周三
4月23日周二
  1. OpenAI News62

    OpenAI 提出 Sparse Transformer,可处理长 30 倍的序列

    OpenAI 开发了 Sparse Transformer,一种深度神经网络,在预测文本、图像或声音序列中下一个内容的任务上创下新纪录。它通过注意力机制的算法改进提取序列模式,可处理的序列长度是此前的 30 倍。

    推荐理由:OpenAI 官方介绍 Sparse Transformer 对注意力机制的算法改进,可了解长序列建模在文本、图像和声音上的早期思路。

3月21日周四
3月6日周三
3月4日周一
2月19日周二
  1. OpenAI News31

    OpenAI:AI 安全研究需要社会科学家参与

    OpenAI 发表论文指出,长期 AI 安全研究需要社会科学家参与,才能确保 AI 对齐算法在真实人类参与的场景下有效。论文认为,将先进 AI 系统与人类价值观对齐,需要解决人类理性、情绪与偏见等心理学层面的诸多不确定性。OpenAI 计划招聘社会科学家全职投入这一方向,以推动机器学习与社会科学的进一步合作。

12月14日周五
12月6日周四
11月7日周三
10月31日周三
10月22日周一
7月30日周一
7月9日周一
7月4日周三
  1. OpenAI News62

    OpenAI 从单次演示中学会 Montezuma's Revenge

    OpenAI 训练智能体仅凭单次人类演示就在 Montezuma's Revenge 上取得 74,500 分的高分,超过此前所有已发表结果。其算法从演示中精心挑选状态出发,让智能体依次游玩一系列游戏,并用 PPO 优化游戏得分来学习,PPO 也是支撑 OpenAI Five 的同一强化学习算法。

    推荐理由:OpenAI 用单次人类演示让智能体在 Montezuma's Revenge 上取得 74,500 分,可了解其基于 PPO 的简单方法。

6月22日周五
6月11日周一
  1. OpenAI News82

    OpenAI 用无监督学习提升语言理解能力

    OpenAI 在一系列多样语言任务上取得当时最优结果,方法结合了 Transformer 与无监督预训练,并同步公开这套可扩展、与任务无关的系统。OpenAI 表示,这一结果说明监督学习方法与无监督预训练搭配效果很好,希望推动在更大、更多样数据集上继续探索这一思路。

    推荐理由:OpenAI 用 Transformer 加无监督预训练在多项语言任务上取得当时最优结果,并公开了这套与任务无关的系统。

5月16日周三
  1. OpenAI News75

    OpenAI 分析:2012 年以来最大 AI 训练算力每 3.4 个月翻倍

    OpenAI 发布一项分析,指出自 2012 年以来最大规模 AI 训练所用算力呈指数增长,翻倍周期为 3.4 个月,而摩尔定律的翻倍周期为 2 年。该指标自 2012 年以来增长超过 300,000 倍,若按 2 年翻倍则仅增长 7 倍。OpenAI 表示算力提升是 AI 进展的关键组成部分,若这一趋势延续,值得为远超当前能力的系统做准备。

    推荐理由:OpenAI 用 3.4 个月翻倍这一量化指标,给出 AI 训练算力增速与摩尔定律的对比参照。

5月3日周四
4月18日周三
3月7日周三
  1. OpenAI News31

    OpenAI 提出可扩展元学习算法 Reptile

    OpenAI 开发出可扩展元学习算法 Reptile,通过反复采样任务、执行随机梯度下降并将初始参数朝该任务最终参数更新。Reptile 是 Shortest Descent 算法在元学习场景的应用,数学上与一阶 MAML 相似,只需对 SGD 或 Adam 等优化器进行黑盒访问,计算效率与性能相近。

2月26日周一
2月20日周二
2月15日周四
2月7日周三
1月31日周三
12月6日周三
10月26日周四
10月19日周四
10月11日周三
  1. OpenAI News62

    OpenAI 发现自博弈让模拟 AI 自行学会身体技能

    OpenAI 发现自博弈能让模拟 AI 自行发现擒抱、闪避、假动作、踢球、接球和扑球等身体技能,而无需在设计环境时预先考虑这些技能。自博弈还能让环境难度始终与 AI 的当前水平相匹配。结合此前的 Dota 2 自博弈结果,OpenAI 表示越来越相信自博弈将成为未来强大 AI 系统的核心组成部分。

    推荐理由:OpenAI 用自博弈让模拟 AI 自行涌现出擒抱、假动作等身体技能,可与 Dota 2 结果对照理解自博弈的训练思路。

9月14日周四
8月16日周三
  1. OpenAI News83

    OpenAI 详解 Dota 2:自对弈如何把系统从人类水平之下推到超人水平

    OpenAI 发文说明其 Dota 2 结果表明,在算力充足的前提下,自对弈能把机器学习系统的表现从远低于人类水平提升到超人水平。该系统在一个月内从勉强与高排名玩家打平,发展到击败顶尖职业选手,此后仍在持续进步。OpenAI 指出,监督式深度学习系统的上限受训练数据集限制,而自对弈系统中可用数据会随智能体变强而自动改善。

    推荐理由:OpenAI 用 Dota 2 结果说明自对弈在算力充足时能把系统从远低于人类提升到超人水平。

7月27日周四
7月20日周四
  1. OpenAI News62

    OpenAI 发布强化学习算法 PPO

    OpenAI 发布一类新的强化学习算法 Proximal Policy Optimization(PPO),称其性能与当时最先进方法相当或更好,同时实现和调参都简单得多。PPO 已成为 OpenAI 的默认强化学习算法,原因是易用且性能良好。

    推荐理由:OpenAI 官方发布 PPO 算法,说明其性能与实现复杂度的取舍,可作为强化学习方法的背景参考。

7月17日周一
6月13日周二
  1. OpenAI News62

    OpenAI 与 DeepMind 合作提出从人类偏好中学习的方法

    OpenAI 与 DeepMind 安全团队合作开发了一种算法,通过让人类判断两种候选行为哪个更好,来推断人类想要什么。OpenAI 表示,构建安全 AI 系统的一步是免去人类编写目标函数的需要,因为用简单代理替代复杂目标或把复杂目标写偏一点,都可能导致不良甚至危险的行为。

    推荐理由:OpenAI 与 DeepMind 安全团队合作提出用人类偏好比较替代手写目标函数,可了解早期对齐研究的一条思路。

6月8日周四
5月24日周三
  1. OpenAI News62

    OpenAI 开源 Baselines 项目,首批发布 DQN 及三个变体

    OpenAI 开源内部项目 OpenAI Baselines,目标是以与已发表结果相当的性能复现强化学习算法。算法将在未来数月内陆续发布,今天的首批发布包含 DQN 及其三个变体。

    推荐理由:OpenAI 开源内部复现强化学习算法的 Baselines 项目,首批放出 DQN 及其三个变体,可了解其复现思路与后续发布节奏。

5月16日周二