跳到正文

#论文/研究

今日 0 条
11月21日周四
10月15日周二
  1. OpenAI News71

    OpenAI 用机械手解魔方:纯仿真训练加 ADR

    OpenAI 训练了一对神经网络,让类人机械手还原魔方,训练完全在仿真中完成,使用与 OpenAI Five 相同的强化学习代码,并搭配名为 Automatic Domain Randomization(ADR)的新技术。系统能应对训练中从未见过的情况,例如被毛绒长颈鹿戳碰。OpenAI 表示这说明强化学习不只是虚拟任务的工具,也能解决需要前所未有灵巧度的物理世界问题。

    推荐理由:OpenAI 用同一套强化学习代码加 ADR 让机械手在仿真中学会还原魔方,可看仿真到现实迁移的早期思路。

9月19日周四
  1. OpenAI News62

    OpenAI 用人类偏好微调 774M 参数 GPT-2

    OpenAI 用人类反馈微调了 774M 参数的 GPT-2 语言模型,在多项任务上成功匹配外部人类标注者的偏好,但这些偏好并不总与 OpenAI 自身一致。在摘要任务中,标注者偏好直接照抄输入的句子,模型因此学会了复制,该任务需要 60k 条人类标注;而按不同风格续写文本等更简单的任务只需 5k 条标注。OpenAI 表示其动机是让安全技术更接近“机器与人对话”这一通用任务。

    推荐理由:OpenAI 用人类偏好微调 GPT-2 的早期实验,展示了标注偏好如何直接塑造模型行为。

9月17日周二
  1. OpenAI News62

    OpenAI 在多智能体捉迷藏环境中观察到智能体自发使用工具

    OpenAI 在自建的模拟捉迷藏环境中训练智能体,观察到它们逐步学会使用更复杂的工具,并形成六种不同的策略与反策略,其中一些策略是该环境原本未预设支持的。OpenAI 表示,这种在简单环境中自监督涌现出的复杂性,说明多智能体共同适应未来可能产生极其复杂且智能的行为。

    推荐理由:OpenAI 在自建捉迷藏环境中观察到智能体自发形成六种策略与反策略,可了解多智能体协同演化的一种研究路径。

8月22日周四
7月10日周三
4月23日周二
  1. OpenAI News62

    OpenAI 提出 Sparse Transformer,可处理长 30 倍的序列

    OpenAI 开发了 Sparse Transformer,一种深度神经网络,在预测文本、图像或声音序列中下一个内容的任务上创下新纪录。它通过注意力机制的算法改进提取序列模式,可处理的序列长度是此前的 30 倍。

    推荐理由:OpenAI 官方介绍 Sparse Transformer 对注意力机制的算法改进,可了解长序列建模在文本、图像和声音上的早期思路。

3月21日周四
3月6日周三
3月4日周一
2月19日周二
  1. OpenAI News31

    OpenAI:AI 安全研究需要社会科学家参与

    OpenAI 发表论文指出,长期 AI 安全研究需要社会科学家参与,才能确保 AI 对齐算法在真实人类参与的场景下有效。论文认为,将先进 AI 系统与人类价值观对齐,需要解决人类理性、情绪与偏见等心理学层面的诸多不确定性。OpenAI 计划招聘社会科学家全职投入这一方向,以推动机器学习与社会科学的进一步合作。

12月14日周五
12月6日周四
11月7日周三
10月31日周三
10月22日周一
7月30日周一
7月9日周一
7月4日周三
  1. OpenAI News62

    OpenAI 从单次演示中学会 Montezuma's Revenge

    OpenAI 训练智能体仅凭单次人类演示就在 Montezuma's Revenge 上取得 74,500 分的高分,超过此前所有已发表结果。其算法从演示中精心挑选状态出发,让智能体依次游玩一系列游戏,并用 PPO 优化游戏得分来学习,PPO 也是支撑 OpenAI Five 的同一强化学习算法。

    推荐理由:OpenAI 用单次人类演示让智能体在 Montezuma's Revenge 上取得 74,500 分,可了解其基于 PPO 的简单方法。

6月25日周一
  1. OpenAI News70

    OpenAI Five 已能击败 Dota 2 业余人类队伍

    OpenAI 宣布由五个神经网络组成的 OpenAI Five 已开始击败 Dota 2 业余人类队伍。该团队由五个神经网络构成,此次披露仅给出这一结果,未提供更多技术细节。

    推荐理由:OpenAI 官方披露五个神经网络组成的 OpenAI Five 已能击败 Dota 2 业余人类队伍,可了解早期多智能体协作的进展。

6月22日周五
6月11日周一
  1. OpenAI News82

    OpenAI 用无监督学习提升语言理解能力

    OpenAI 在一系列多样语言任务上取得当时最优结果,方法结合了 Transformer 与无监督预训练,并同步公开这套可扩展、与任务无关的系统。OpenAI 表示,这一结果说明监督学习方法与无监督预训练搭配效果很好,希望推动在更大、更多样数据集上继续探索这一思路。

    推荐理由:OpenAI 用 Transformer 加无监督预训练在多项语言任务上取得当时最优结果,并公开了这套与任务无关的系统。

5月16日周三
  1. OpenAI News75

    OpenAI 分析:2012 年以来最大 AI 训练算力每 3.4 个月翻倍

    OpenAI 发布一项分析,指出自 2012 年以来最大规模 AI 训练所用算力呈指数增长,翻倍周期为 3.4 个月,而摩尔定律的翻倍周期为 2 年。该指标自 2012 年以来增长超过 300,000 倍,若按 2 年翻倍则仅增长 7 倍。OpenAI 表示算力提升是 AI 进展的关键组成部分,若这一趋势延续,值得为远超当前能力的系统做准备。

    推荐理由:OpenAI 用 3.4 个月翻倍这一量化指标,给出 AI 训练算力增速与摩尔定律的对比参照。

5月3日周四
4月18日周三
3月7日周三
  1. OpenAI News31

    OpenAI 提出可扩展元学习算法 Reptile

    OpenAI 开发出可扩展元学习算法 Reptile,通过反复采样任务、执行随机梯度下降并将初始参数朝该任务最终参数更新。Reptile 是 Shortest Descent 算法在元学习场景的应用,数学上与一阶 MAML 相似,只需对 SGD 或 Adam 等优化器进行黑盒访问,计算效率与性能相近。

2月26日周一
2月20日周二
2月15日周四
2月7日周三
1月31日周三
12月6日周三
10月26日周四
10月19日周四
10月11日周三
  1. OpenAI News62

    OpenAI 发现自博弈让模拟 AI 自行学会身体技能

    OpenAI 发现自博弈能让模拟 AI 自行发现擒抱、闪避、假动作、踢球、接球和扑球等身体技能,而无需在设计环境时预先考虑这些技能。自博弈还能让环境难度始终与 AI 的当前水平相匹配。结合此前的 Dota 2 自博弈结果,OpenAI 表示越来越相信自博弈将成为未来强大 AI 系统的核心组成部分。

    推荐理由:OpenAI 用自博弈让模拟 AI 自行涌现出擒抱、假动作等身体技能,可与 Dota 2 结果对照理解自博弈的训练思路。

9月14日周四
8月16日周三
  1. OpenAI News83

    OpenAI 详解 Dota 2:自对弈如何把系统从人类水平之下推到超人水平

    OpenAI 发文说明其 Dota 2 结果表明,在算力充足的前提下,自对弈能把机器学习系统的表现从远低于人类水平提升到超人水平。该系统在一个月内从勉强与高排名玩家打平,发展到击败顶尖职业选手,此后仍在持续进步。OpenAI 指出,监督式深度学习系统的上限受训练数据集限制,而自对弈系统中可用数据会随智能体变强而自动改善。

    推荐理由:OpenAI 用 Dota 2 结果说明自对弈在算力充足时能把系统从远低于人类提升到超人水平。

8月11日周五
  1. OpenAI News80

    OpenAI 机器人击败 Dota 2 顶级职业选手

    OpenAI 训练出一个机器人,在标准锦标赛规则下的 Dota 2 1v1 对战中击败了世界顶级职业选手。该机器人完全通过自我对弈从零学习游戏,未使用模仿学习或树搜索。OpenAI 称这是朝着构建能在涉及真实人类的混乱复杂情境中完成明确目标的人工智能系统迈出的一步。

    推荐理由:OpenAI 用自我对弈从零训练出的机器人击败 Dota 2 顶级职业选手,展示了在复杂对抗环境中达成目标的一种路径。

7月27日周四