OpenAI 论文:语言模型是少样本学习器
OpenAI 发布题为 Language models are few-shot learners 的论文,讨论语言模型的少样本学习能力。该页面正文抓取失败,仅保留标题信息。
OpenAI 发布题为 Language models are few-shot learners 的论文,讨论语言模型的少样本学习能力。该页面正文抓取失败,仅保留标题信息。
OpenAI 发布分析称,自 2012 年以来,在 ImageNet 分类上训练神经网络达到同等性能所需算力每 16 个月减少一半。与 2012 年相比,训练到 AlexNet 水平所需算力减少 44 倍,而同期摩尔定律只带来 11 倍的成本改善。OpenAI 认为,在近期投入较高的 AI 任务上,算法进步带来的收益超过传统硬件效率提升。
推荐理由:OpenAI 用 ImageNet 训练算力数据量化算法进步速度,可与摩尔定律对照理解 AI 效率来源。
OpenAI 推出 Microscope,可视化八个视觉"模式生物"模型的每一重要层与神经元,便于分析神经网络内部形成的特征。该工具面向可解释性研究,旨在帮助研究社区理解这些复杂系统。
Hugging Face 发布教程,演示如何用 transformers 和 tokenizers 库从零训练一个 84M 参数的小型语言模型 EsperBERTo,并在世界语上完成预训练与词性标注微调。
推荐理由:以世界语为例完整走通从零预训练到下游微调的流程,可迁移到其他低资源语言。
OpenAI 发现双重下降现象在 CNN、ResNet 和 Transformer 中普遍存在:随着模型规模、数据规模或训练时间增加,性能先提升、再变差、然后再次提升。这一效应通常可通过精细的正则化避免,但其成因尚不完全清楚,OpenAI 将其视为重要研究方向。
OpenAI 训练了一对神经网络,让类人机械手还原魔方,训练完全在仿真中完成,使用与 OpenAI Five 相同的强化学习代码,并搭配名为 Automatic Domain Randomization(ADR)的新技术。系统能应对训练中从未见过的情况,例如被毛绒长颈鹿戳碰。OpenAI 表示这说明强化学习不只是虚拟任务的工具,也能解决需要前所未有灵巧度的物理世界问题。
推荐理由:OpenAI 用同一套强化学习代码加 ADR 让机械手在仿真中学会还原魔方,可看仿真到现实迁移的早期思路。
OpenAI 用人类反馈微调了 774M 参数的 GPT-2 语言模型,在多项任务上成功匹配外部人类标注者的偏好,但这些偏好并不总与 OpenAI 自身一致。在摘要任务中,标注者偏好直接照抄输入的句子,模型因此学会了复制,该任务需要 60k 条人类标注;而按不同风格续写文本等更简单的任务只需 5k 条标注。OpenAI 表示其动机是让安全技术更接近“机器与人对话”这一通用任务。
推荐理由:OpenAI 用人类偏好微调 GPT-2 的早期实验,展示了标注偏好如何直接塑造模型行为。
OpenAI 发布 774M 参数的 GPT-2 语言模型,此前已先后放出 124M 小模型和 355M 中模型。OpenAI 同时发布一份开源法律协议,便于机构之间建立模型共享合作,并发布技术报告介绍与更广泛 AI 研究社区协调发布规范的经验。
推荐理由:OpenAI 分阶段放出 GPT-2 最大版本,并公开模型共享法律协议,可观察大模型发布节奏与协作机制。
OpenAI 开发了 Sparse Transformer,一种深度神经网络,在预测文本、图像或声音序列中下一个内容的任务上创下新纪录。它通过注意力机制的算法改进提取序列模式,可处理的序列长度是此前的 30 倍。
推荐理由:OpenAI 官方介绍 Sparse Transformer 对注意力机制的算法改进,可了解长序列建模在文本、图像和声音上的早期思路。
OpenAI 在能量模型(EBM)的稳定可扩展训练上取得进展,样本质量和泛化能力优于现有模型。EBM 生成时投入更多算力持续精修答案,在低温下可生成与 GAN 媲美的样本,同时具备似然类模型的模式覆盖保证。
OpenAI 首期 Fellows 项目结业,每位学员在 6 个月学徒期内从机器学习初学者成长为 OpenAI 的核心贡献者。
OpenAI 发现梯度噪声尺度这一统计指标能预测神经网络训练在多种任务上的可并行性。由于复杂任务的梯度噪声更大,未来更大的 batch size 可能变得有用,从而消除 AI 系统继续扩展的一项潜在限制。该结果表明神经网络训练并非神秘技艺,而是可以被严谨化和系统化。
OpenAI 发布 Spinning Up in Deep RL,一套面向任何人的深度强化学习教育资源,目标是让人学会成为熟练的深度强化学习实践者。该资源包含清晰的 RL 代码示例、教学练习、文档和教程。
OpenAI 开发了一种基于能量的模型,仅需五次演示即可学会识别并生成以 2D 点集表达的 near、above、between、closest、furthest 等概念。该模型还展现出跨域迁移能力:在 2D 粒子环境中学会的概念可用于解决 3D 物理机器人任务。
OpenAI 在一系列多样语言任务上取得当时最优结果,方法结合了 Transformer 与无监督预训练,并同步公开这套可扩展、与任务无关的系统。OpenAI 表示,这一结果说明监督学习方法与无监督预训练搭配效果很好,希望推动在更大、更多样数据集上继续探索这一思路。
推荐理由:OpenAI 用 Transformer 加无监督预训练在多项语言任务上取得当时最优结果,并公开了这套与任务无关的系统。
OpenAI 发布一项分析,指出自 2012 年以来最大规模 AI 训练所用算力呈指数增长,翻倍周期为 3.4 个月,而摩尔定律的翻倍周期为 2 年。该指标自 2012 年以来增长超过 300,000 倍,若按 2 年翻倍则仅增长 7 倍。OpenAI 表示算力提升是 AI 进展的关键组成部分,若这一趋势延续,值得为远超当前能力的系统做准备。
推荐理由:OpenAI 用 3.4 个月翻倍这一量化指标,给出 AI 训练算力增速与摩尔定律的对比参照。
OpenAI 发布实验性元学习方法 Evolved Policy Gradients(EPG),通过进化学习智能体的损失函数,使其能在新任务上快速训练。用 EPG 训练的智能体在测试时可完成训练范围之外的基础任务,例如学会导航到房间中与训练时放置位置相反一侧的物体。
OpenAI 推出 Retro Contest 迁移学习竞赛,用于衡量强化学习算法从既往经验中泛化的能力。竞赛聚焦迁移学习,考察算法能否将先前经验迁移到新任务。
OpenAI 设计了一种让 AI 互相教学的方法,所选取的示例同时也能被人类理解。该方法会自动挑选最具信息量的示例来教授某个概念,例如用最能描述"狗"这一概念的图像,实验显示它对 AI 教学有效。
OpenAI 构建了一套实体消歧系统,通过神经网络判断一个词是否属于约 100 个自动发现的“类型”(非互斥类别),从而自动确定该词指代哪个对象。
OpenAI 发布面向块稀疏权重神经网络的高度优化 GPU 内核,按所选稀疏度可比 cuBLAS 或 cuSPARSE 快数个数量级。该内核已用于文本情感分析以及文本和图像生成建模,并取得当时最优结果。
OpenAI 展示,在模拟机器人摔跤任务中,元学习智能体能够快速击败更强的非元学习智能体,并能适应物理故障。
OpenAI 发现自博弈能让模拟 AI 自行发现擒抱、闪避、假动作、踢球、接球和扑球等身体技能,而无需在设计环境时预先考虑这些技能。自博弈还能让环境难度始终与 AI 的当前水平相匹配。结合此前的 Dota 2 自博弈结果,OpenAI 表示越来越相信自博弈将成为未来强大 AI 系统的核心组成部分。
推荐理由:OpenAI 用自博弈让模拟 AI 自行涌现出擒抱、假动作等身体技能,可与 Dota 2 结果对照理解自博弈的训练思路。
OpenAI 发现向强化学习算法的参数中加入自适应噪声,往往能提升性能。这种探索方法实现简单,且极少导致性能下降,因此值得在任何问题上尝试。
OpenAI 开源内部项目 OpenAI Baselines,目标是以与已发表结果相当的性能复现强化学习算法。算法将在未来数月内陆续发布,今天的首批发布包含 DQN 及其三个变体。
推荐理由:OpenAI 开源内部复现强化学习算法的 Baselines 项目,首批放出 DQN 及其三个变体,可了解其复现思路与后续发布节奏。
OpenAI 开发了一个无监督系统,仅通过预测 Amazon 评论文本中的下一个字符进行训练,却学到了出色的情感表征。该系统由此形成了可解释的"情感神经元",无需任何情感标注数据。
OpenAI 发现,已有数十年历史的进化策略(ES)在现代强化学习基准(如 Atari/MuJoCo)上性能可与标准强化学习(RL)相媲美,同时规避了 RL 的诸多不便。该研究将 ES 定位为强化学习的一种可扩展替代方案。
深度学习是一门经验科学,团队基础设施的质量是进展的倍增器。OpenAI 指出,如今的开源生态让任何人都能搭建出色的深度学习基础设施。
OpenAI 介绍了四个围绕生成模型的项目,生成模型是机器学习中无监督学习技术的一个分支。文章同时解释了生成模型是什么、为何重要,以及它们可能的发展方向。