OpenAI 与乔治城大学、斯坦福互联网观测台联合研究语言模型被用于虚假信息活动的潜在风险
OpenAI 研究人员与乔治城大学安全与新兴技术中心、斯坦福互联网观测台合作,调查大语言模型可能被用于虚假信息活动的风险。该合作基于一年多的研究,包括 2021 年 10 月汇集 30 位虚假信息研究者、机器学习专家与政策分析师的研讨会,最终形成联合报告,梳理语言模型对信息环境的威胁并提出潜在缓解措施的分析框架。
OpenAI 研究人员与乔治城大学安全与新兴技术中心、斯坦福互联网观测台合作,调查大语言模型可能被用于虚假信息活动的风险。该合作基于一年多的研究,包括 2021 年 10 月汇集 30 位虚假信息研究者、机器学习专家与政策分析师的研讨会,最终形成联合报告,梳理语言模型对信息环境的威胁并提出潜在缓解措施的分析框架。
Hugging Face 推出 MTEB(Massive Text Embedding Benchmark),覆盖 8 类任务、56 个数据集、最多 112 种语言,排行榜已汇总超 2000 条结果。该基准通过 pip install mteb 即可对任意嵌入模型评测,并将结果提交至公开排行榜,方便按速度、性能与嵌入维度筛选模型。
OpenAI 提出 Video PreTraining(VPT),在大量无标注的人类 Minecraft 游戏视频上训练神经网络,仅使用少量标注的承包商数据。经微调后,模型能学会制作钻石工具,这一任务通常需要熟练人类花费 20 分钟以上、约 24000 次操作。模型使用键盘按键和鼠标移动的原生人类接口,具有较强通用性,是迈向通用计算机操作智能体的一步。
推荐理由:OpenAI 用大量无标注人类游戏视频预训练网络,展示从少量标注数据到通用计算机操作智能体的路径。
OpenAI 训练了批评写作模型,用于描述摘要中的缺陷。人类评估者在看到模型批评后,发现摘要缺陷的频率明显提高。研究还显示,模型越大自我批评能力越强,规模对批评写作的提升大于对摘要写作的提升,这为用 AI 系统辅助人类监督 AI 系统提供了可能。
推荐理由:OpenAI 用自训练模型写批评来辅助人类发现摘要缺陷,并给出模型规模与批评能力的关系。
微软提出 TAPEX,通过让 BART 学习充当神经 SQL 执行器,在合成 SQL 查询语料上完成表格预训练,无需真实数据。该方法在 WikiSQL、TabFact、SQA 和 WikiTableQuestions 四个基准上均取得 SOTA,其中 WikiSQL 准确率达 89.6%,较此前最佳提升 2.3%。
OpenAI 构建了一个面向 Lean 的神经定理证明器,能够求解多道高难度高中数学奥赛题,包括来自 AMC12 和 AIME 竞赛的题目,以及两道改编自 IMO 的问题。
推荐理由:OpenAI 用神经网络定理证明器在 Lean 中求解 AMC12、AIME 及两道 IMO 改编题,可了解形式化数学推理的早期进展。
OpenAI 对 GPT-3 进行微调,使其能借助基于文本的网页浏览器更准确地回答开放式问题。该工作名为 WebGPT,目标是提升语言模型回答的事实准确率。
推荐理由:OpenAI 用文本浏览器微调 GPT-3 提升开放问答事实准确率,可了解早期联网检索思路。
OpenAI 训练了一个求解小学数学应用题的系统,准确率接近微调 GPT-3 模型的两倍。该系统解出的题目数量约为真实儿童的 90%:在一组来自其数据集的测试题上,9-12 岁儿童小样本得分 60%,该系统在同一批题目上得分 55%。
推荐理由:OpenAI 用小学数学应用题对比自家系统与微调 GPT-3 及 9-12 岁儿童的成绩,可看推理能力当时的水平参照。
OpenAI 发布文章介绍用人类反馈总结书籍,目标是扩展人类对 AI 系统在难以评估任务上的监督。材料仅提供摘要,未给出具体方法、数据或结果细节。
Hugging Face 等机构提出 DeDLOC 协作分布式训练方法,可自适应参与者的网络与硬件条件,并用 40 名志愿者预训练出孟加拉语模型 sahajBERT。
推荐理由:DeDLOC 用 40 名志愿者和家用 GPU 预训练出孟加拉语模型,读者可了解分布式协作训练如何绕开算力门槛。
OpenAI 研究发现,通过在小型精选数据集上微调,可以改善语言模型在特定行为价值观方面的表现。
Hugging Face 的月度阅读小组 2021 年 2 月聚焦长程注意力,围绕 Longformer、Compressive Transformer、Linformer、Performer 四篇论文梳理了降低 Transformer 序列长度二次开销的四条路线:自定义注意力模式、循环、低秩近似与核近似。
OpenAI 在 CLIP 中发现了一类神经元,无论概念以字面、符号还是概念化方式呈现,它们都会产生响应。这可能解释 CLIP 为何能准确分类出人意料的视觉变体,也是理解 CLIP 及同类模型所学关联与偏见的重要一步。
推荐理由:OpenAI 公开 CLIP 中跨字面、符号与概念三种呈现方式响应的神经元,为理解多模态模型的关联与偏见提供线索。
OpenAI 将人类反馈强化学习(RLHF)应用于语言模型训练,使其摘要能力得到提升。
OpenAI 发现,正如在语言上训练的大型 Transformer 模型能生成连贯文本,同一套模型在像素序列上训练后也能生成连贯的图像补全与样本。研究通过建立样本质量与图像分类准确率之间的相关性,表明其最佳生成模型在无监督设定下所包含的特征可与顶级卷积网络竞争。
推荐理由:OpenAI 用同一套 Transformer 架构处理像素序列,并给出生成质量与分类精度的关联证据。
OpenAI 发布题为 Language models are few-shot learners 的论文,讨论语言模型的少样本学习能力。该页面正文抓取失败,仅保留标题信息。
OpenAI 发布分析称,自 2012 年以来,在 ImageNet 分类上训练神经网络达到同等性能所需算力每 16 个月减少一半。与 2012 年相比,训练到 AlexNet 水平所需算力减少 44 倍,而同期摩尔定律只带来 11 倍的成本改善。OpenAI 认为,在近期投入较高的 AI 任务上,算法进步带来的收益超过传统硬件效率提升。
推荐理由:OpenAI 用 ImageNet 训练算力数据量化算法进步速度,可与摩尔定律对照理解 AI 效率来源。
OpenAI 发布关于 Dota 2 大规模深度强化学习的研究,标题为 Dota 2 with large scale deep reinforcement learning。原文正文抓取失败,仅标题可用。
OpenAI 发现双重下降现象在 CNN、ResNet 和 Transformer 中普遍存在:随着模型规模、数据规模或训练时间增加,性能先提升、再变差、然后再次提升。这一效应通常可通过精细的正则化避免,但其成因尚不完全清楚,OpenAI 将其视为重要研究方向。
OpenAI 发布 Procgen Benchmark,包含 16 个易于使用的程序化生成环境,用于直接衡量强化学习智能体学习可泛化技能的速度。
OpenAI 发布 Safety Gym,一套用于衡量强化学习智能体在训练中遵守安全约束进展的环境与工具套件。该套件面向在训练过程中兼顾安全约束的强化学习智能体,提供相应的环境和工具来度量其进展。
OpenAI 训练了一对神经网络,让类人机械手还原魔方,训练完全在仿真中完成,使用与 OpenAI Five 相同的强化学习代码,并搭配名为 Automatic Domain Randomization(ADR)的新技术。系统能应对训练中从未见过的情况,例如被毛绒长颈鹿戳碰。OpenAI 表示这说明强化学习不只是虚拟任务的工具,也能解决需要前所未有灵巧度的物理世界问题。
推荐理由:OpenAI 用同一套强化学习代码加 ADR 让机械手在仿真中学会还原魔方,可看仿真到现实迁移的早期思路。
OpenAI 用人类反馈微调了 774M 参数的 GPT-2 语言模型,在多项任务上成功匹配外部人类标注者的偏好,但这些偏好并不总与 OpenAI 自身一致。在摘要任务中,标注者偏好直接照抄输入的句子,模型因此学会了复制,该任务需要 60k 条人类标注;而按不同风格续写文本等更简单的任务只需 5k 条标注。OpenAI 表示其动机是让安全技术更接近“机器与人对话”这一通用任务。
推荐理由:OpenAI 用人类偏好微调 GPT-2 的早期实验,展示了标注偏好如何直接塑造模型行为。
OpenAI 在自建的模拟捉迷藏环境中训练智能体,观察到它们逐步学会使用更复杂的工具,并形成六种不同的策略与反策略,其中一些策略是该环境原本未预设支持的。OpenAI 表示,这种在简单环境中自监督涌现出的复杂性,说明多智能体共同适应未来可能产生极其复杂且智能的行为。
推荐理由:OpenAI 在自建捉迷藏环境中观察到智能体自发形成六种策略与反策略,可了解多智能体协同演化的一种研究路径。
OpenAI 开发出一种评估神经网络分类器能否抵御训练中未见对抗攻击的方法,并提出新指标 UAR(Unforeseen Attack Robustness),用于衡量单一模型面对未预期攻击时的鲁棒性。该方法同时指出,需要在更多样化的未知攻击范围内衡量模型表现。
OpenAI 发布政策研究论文,提出当前可用于提升 AI 安全规范长期行业合作可能性的四项策略:沟通风险与收益、技术协作、提高透明度、激励标准。分析指出,行业安全合作对确保 AI 系统安全有益至关重要,但竞争压力可能导致集体行动问题,使 AI 公司对安全投入不足。
OpenAI 开发了 Sparse Transformer,一种深度神经网络,在预测文本、图像或声音序列中下一个内容的任务上创下新纪录。它通过注意力机制的算法改进提取序列模式,可处理的序列长度是此前的 30 倍。
推荐理由:OpenAI 官方介绍 Sparse Transformer 对注意力机制的算法改进,可了解长序列建模在文本、图像和声音上的早期思路。
OpenAI 在能量模型(EBM)的稳定可扩展训练上取得进展,样本质量和泛化能力优于现有模型。EBM 生成时投入更多算力持续精修答案,在低温下可生成与 GAN 媲美的样本,同时具备似然类模型的模式覆盖保证。
OpenAI 与 Google 研究人员合作推出 Activation Atlases,一种可视化神经元之间交互所代表含义的新技术。该技术旨在帮助理解 AI 系统的内部决策过程,从而在 AI 被部署于日益敏感的场景时识别其弱点并调查失败原因。
OpenAI 发布 Neural MMO,一个面向强化学习智能体的大规模多智能体游戏环境,支持在持久、开放式的任务中容纳数量可变的大量智能体。该平台引入多个智能体与物种,带来更好的探索、差异化的生态位形成以及整体能力的提升。
OpenAI 发表论文指出,长期 AI 安全研究需要社会科学家参与,才能确保 AI 对齐算法在真实人类参与的场景下有效。论文认为,将先进 AI 系统与人类价值观对齐,需要解决人类理性、情绪与偏见等心理学层面的诸多不确定性。OpenAI 计划招聘社会科学家全职投入这一方向,以推动机器学习与社会科学的进一步合作。
OpenAI 发现梯度噪声尺度这一统计指标能预测神经网络训练在多种任务上的可并行性。由于复杂任务的梯度噪声更大,未来更大的 batch size 可能变得有用,从而消除 AI 系统继续扩展的一项潜在限制。该结果表明神经网络训练并非神秘技艺,而是可以被严谨化和系统化。
OpenAI 发布训练环境 CoinRun,用于衡量智能体将经验迁移到新情境的能力,并已帮助厘清强化学习领域一个长期存在的难题。该环境在复杂度上取得平衡:比《刺猬索尼克》等传统平台游戏更简单,但仍对当前最先进算法构成值得挑战的泛化测试。
OpenAI 开发了一种基于能量的模型,仅需五次演示即可学会识别并生成以 2D 点集表达的 near、above、between、closest、furthest 等概念。该模型还展现出跨域迁移能力:在 2D 粒子环境中学会的概念可用于解决 3D 物理机器人任务。
OpenAI 提出 Random Network Distillation(RND),一种基于预测的奖励方法,通过好奇心鼓励强化学习智能体探索环境,首次在 Montezuma's Revenge 上超过人类平均水平。
OpenAI 提出一种名为迭代放大(iterated amplification)的 AI 安全技术,通过把任务分解为更简单的子任务来指定超出人类规模的复杂行为与目标,而非依赖标注数据或奖励函数。该构想仍处早期阶段,目前仅在简单的玩具算法领域完成实验,OpenAI 认为它可能成为可扩展的 AI 安全方案。
OpenAI 训练了一只类人机械手,使其能以空前的灵巧度操作物理物体。该研究来自 OpenAI,原文未披露具体训练方法与技术细节。
OpenAI 提出可逆生成模型 Glow,采用可逆 1x1 卷积,在简化架构的同时扩展了此前的可逆生成模型工作。该模型能生成逼真的高分辨率图像,支持高效采样,并可发现用于操控数据属性的特征。OpenAI 已发布模型代码和在线可视化工具。
OpenAI 训练智能体仅凭单次人类演示就在 Montezuma's Revenge 上取得 74,500 分的高分,超过此前所有已发表结果。其算法从演示中精心挑选状态出发,让智能体依次游玩一系列游戏,并用 PPO 优化游戏得分来学习,PPO 也是支撑 OpenAI Five 的同一强化学习算法。
推荐理由:OpenAI 用单次人类演示让智能体在 Montezuma's Revenge 上取得 74,500 分,可了解其基于 PPO 的简单方法。
OpenAI 宣布由五个神经网络组成的 OpenAI Five 已开始击败 Dota 2 业余人类队伍。该团队由五个神经网络构成,此次披露仅给出这一结果,未提供更多技术细节。
推荐理由:OpenAI 官方披露五个神经网络组成的 OpenAI Five 已能击败 Dota 2 业余人类队伍,可了解早期多智能体协作的进展。