跳到正文

论文研究

值得读的 AI 论文与研究成果:架构创新、训练方法、能力测量与理论进展的精选解读。

最新精选

第 81–96 条 · 共 96 条
12月13日周五
10月15日周二
  1. OpenAI News71

    OpenAI 用机械手解魔方:纯仿真训练加 ADR

    OpenAI 训练了一对神经网络,让类人机械手还原魔方,训练完全在仿真中完成,使用与 OpenAI Five 相同的强化学习代码,并搭配名为 Automatic Domain Randomization(ADR)的新技术。系统能应对训练中从未见过的情况,例如被毛绒长颈鹿戳碰。OpenAI 表示这说明强化学习不只是虚拟任务的工具,也能解决需要前所未有灵巧度的物理世界问题。

    推荐理由:OpenAI 用同一套强化学习代码加 ADR 让机械手在仿真中学会还原魔方,可看仿真到现实迁移的早期思路。

9月19日周四
  1. OpenAI News62

    OpenAI 用人类偏好微调 774M 参数 GPT-2

    OpenAI 用人类反馈微调了 774M 参数的 GPT-2 语言模型,在多项任务上成功匹配外部人类标注者的偏好,但这些偏好并不总与 OpenAI 自身一致。在摘要任务中,标注者偏好直接照抄输入的句子,模型因此学会了复制,该任务需要 60k 条人类标注;而按不同风格续写文本等更简单的任务只需 5k 条标注。OpenAI 表示其动机是让安全技术更接近“机器与人对话”这一通用任务。

    推荐理由:OpenAI 用人类偏好微调 GPT-2 的早期实验,展示了标注偏好如何直接塑造模型行为。

9月17日周二
  1. OpenAI News62

    OpenAI 在多智能体捉迷藏环境中观察到智能体自发使用工具

    OpenAI 在自建的模拟捉迷藏环境中训练智能体,观察到它们逐步学会使用更复杂的工具,并形成六种不同的策略与反策略,其中一些策略是该环境原本未预设支持的。OpenAI 表示,这种在简单环境中自监督涌现出的复杂性,说明多智能体共同适应未来可能产生极其复杂且智能的行为。

    推荐理由:OpenAI 在自建捉迷藏环境中观察到智能体自发形成六种策略与反策略,可了解多智能体协同演化的一种研究路径。

4月23日周二
  1. OpenAI News62

    OpenAI 提出 Sparse Transformer,可处理长 30 倍的序列

    OpenAI 开发了 Sparse Transformer,一种深度神经网络,在预测文本、图像或声音序列中下一个内容的任务上创下新纪录。它通过注意力机制的算法改进提取序列模式,可处理的序列长度是此前的 30 倍。

    推荐理由:OpenAI 官方介绍 Sparse Transformer 对注意力机制的算法改进,可了解长序列建模在文本、图像和声音上的早期思路。

7月4日周三
  1. OpenAI News62

    OpenAI 从单次演示中学会 Montezuma's Revenge

    OpenAI 训练智能体仅凭单次人类演示就在 Montezuma's Revenge 上取得 74,500 分的高分,超过此前所有已发表结果。其算法从演示中精心挑选状态出发,让智能体依次游玩一系列游戏,并用 PPO 优化游戏得分来学习,PPO 也是支撑 OpenAI Five 的同一强化学习算法。

    推荐理由:OpenAI 用单次人类演示让智能体在 Montezuma's Revenge 上取得 74,500 分,可了解其基于 PPO 的简单方法。

6月25日周一
  1. OpenAI News70

    OpenAI Five 已能击败 Dota 2 业余人类队伍

    OpenAI 宣布由五个神经网络组成的 OpenAI Five 已开始击败 Dota 2 业余人类队伍。该团队由五个神经网络构成,此次披露仅给出这一结果,未提供更多技术细节。

    推荐理由:OpenAI 官方披露五个神经网络组成的 OpenAI Five 已能击败 Dota 2 业余人类队伍,可了解早期多智能体协作的进展。

6月11日周一
  1. OpenAI News82

    OpenAI 用无监督学习提升语言理解能力

    OpenAI 在一系列多样语言任务上取得当时最优结果,方法结合了 Transformer 与无监督预训练,并同步公开这套可扩展、与任务无关的系统。OpenAI 表示,这一结果说明监督学习方法与无监督预训练搭配效果很好,希望推动在更大、更多样数据集上继续探索这一思路。

    推荐理由:OpenAI 用 Transformer 加无监督预训练在多项语言任务上取得当时最优结果,并公开了这套与任务无关的系统。

5月16日周三
  1. OpenAI News75

    OpenAI 分析:2012 年以来最大 AI 训练算力每 3.4 个月翻倍

    OpenAI 发布一项分析,指出自 2012 年以来最大规模 AI 训练所用算力呈指数增长,翻倍周期为 3.4 个月,而摩尔定律的翻倍周期为 2 年。该指标自 2012 年以来增长超过 300,000 倍,若按 2 年翻倍则仅增长 7 倍。OpenAI 表示算力提升是 AI 进展的关键组成部分,若这一趋势延续,值得为远超当前能力的系统做准备。

    推荐理由:OpenAI 用 3.4 个月翻倍这一量化指标,给出 AI 训练算力增速与摩尔定律的对比参照。

2月20日周二
10月11日周三
  1. OpenAI News62

    OpenAI 发现自博弈让模拟 AI 自行学会身体技能

    OpenAI 发现自博弈能让模拟 AI 自行发现擒抱、闪避、假动作、踢球、接球和扑球等身体技能,而无需在设计环境时预先考虑这些技能。自博弈还能让环境难度始终与 AI 的当前水平相匹配。结合此前的 Dota 2 自博弈结果,OpenAI 表示越来越相信自博弈将成为未来强大 AI 系统的核心组成部分。

    推荐理由:OpenAI 用自博弈让模拟 AI 自行涌现出擒抱、假动作等身体技能,可与 Dota 2 结果对照理解自博弈的训练思路。

8月16日周三
  1. OpenAI News83

    OpenAI 详解 Dota 2:自对弈如何把系统从人类水平之下推到超人水平

    OpenAI 发文说明其 Dota 2 结果表明,在算力充足的前提下,自对弈能把机器学习系统的表现从远低于人类水平提升到超人水平。该系统在一个月内从勉强与高排名玩家打平,发展到击败顶尖职业选手,此后仍在持续进步。OpenAI 指出,监督式深度学习系统的上限受训练数据集限制,而自对弈系统中可用数据会随智能体变强而自动改善。

    推荐理由:OpenAI 用 Dota 2 结果说明自对弈在算力充足时能把系统从远低于人类提升到超人水平。

8月11日周五
  1. OpenAI News80

    OpenAI 机器人击败 Dota 2 顶级职业选手

    OpenAI 训练出一个机器人,在标准锦标赛规则下的 Dota 2 1v1 对战中击败了世界顶级职业选手。该机器人完全通过自我对弈从零学习游戏,未使用模仿学习或树搜索。OpenAI 称这是朝着构建能在涉及真实人类的混乱复杂情境中完成明确目标的人工智能系统迈出的一步。

    推荐理由:OpenAI 用自我对弈从零训练出的机器人击败 Dota 2 顶级职业选手,展示了在复杂对抗环境中达成目标的一种路径。

7月20日周四
  1. OpenAI News62

    OpenAI 发布强化学习算法 PPO

    OpenAI 发布一类新的强化学习算法 Proximal Policy Optimization(PPO),称其性能与当时最先进方法相当或更好,同时实现和调参都简单得多。PPO 已成为 OpenAI 的默认强化学习算法,原因是易用且性能良好。

    推荐理由:OpenAI 官方发布 PPO 算法,说明其性能与实现复杂度的取舍,可作为强化学习方法的背景参考。

6月13日周二
  1. OpenAI News62

    OpenAI 与 DeepMind 合作提出从人类偏好中学习的方法

    OpenAI 与 DeepMind 安全团队合作开发了一种算法,通过让人类判断两种候选行为哪个更好,来推断人类想要什么。OpenAI 表示,构建安全 AI 系统的一步是免去人类编写目标函数的需要,因为用简单代理替代复杂目标或把复杂目标写偏一点,都可能导致不良甚至危险的行为。

    推荐理由:OpenAI 与 DeepMind 安全团队合作提出用人类偏好比较替代手写目标函数,可了解早期对齐研究的一条思路。

5月16日周二