OpenAI 构建 Lean 神经定理证明器,求解部分形式化数学奥赛题
OpenAI 构建了一个面向 Lean 的神经定理证明器,能够求解多道高难度高中数学奥赛题,包括来自 AMC12 和 AIME 竞赛的题目,以及两道改编自 IMO 的问题。
推荐理由:OpenAI 用神经网络定理证明器在 Lean 中求解 AMC12、AIME 及两道 IMO 改编题,可了解形式化数学推理的早期进展。
OpenAI 构建了一个面向 Lean 的神经定理证明器,能够求解多道高难度高中数学奥赛题,包括来自 AMC12 和 AIME 竞赛的题目,以及两道改编自 IMO 的问题。
推荐理由:OpenAI 用神经网络定理证明器在 Lean 中求解 AMC12、AIME 及两道 IMO 改编题,可了解形式化数学推理的早期进展。
OpenAI 训练出比 GPT-3 更能遵循用户意图的语言模型 InstructGPT,同时更真实、毒性更低,采用对齐研究中的人类反馈方法。这些模型现已作为 OpenAI API 的默认语言模型部署。
推荐理由:OpenAI 官方说明 InstructGPT 通过人类反馈训练,在遵循用户意图、真实性和毒性控制上优于 GPT-3,并已成为 API 默认模型。
OpenAI 在 API 中推出 embeddings 新端点,用于自然语言和代码任务。该端点支持语义搜索、聚类、主题建模和分类等场景。
推荐理由:OpenAI 在 API 中新增 embeddings 端点,读者可了解它支持语义搜索、聚类、主题建模与分类等任务。
OpenAI 对 GPT-3 进行微调,使其能借助基于文本的网页浏览器更准确地回答开放式问题。该工作名为 WebGPT,目标是提升语言模型回答的事实准确率。
推荐理由:OpenAI 用文本浏览器微调 GPT-3 提升开放问答事实准确率,可了解早期联网检索思路。
OpenAI 为 GPT-3 推出微调功能,开发者用一条命令即可针对自己的应用定制模型。该功能面向应用场景的个性化需求,降低了定制 GPT-3 的操作门槛。
OpenAI 宣布推出 OpenAI Residency,作为其支持和培养 AI 人才努力的一部分。该项目面向 AI 人才发展,具体申请条件、时间安排与名额等细节未在公告中披露。
OpenAI 宣布其 API 不再需要等待名单即可使用,官方称更广泛的可用性得益于安全方面的进展。
推荐理由:OpenAI 官方宣布 API 取消等待名单,读者可据此了解其开放范围与安全进展的关系。
OpenAI 训练了一个求解小学数学应用题的系统,准确率接近微调 GPT-3 模型的两倍。该系统解出的题目数量约为真实儿童的 90%:在一组来自其数据集的测试题上,9-12 岁儿童小样本得分 60%,该系统在同一批题目上得分 55%。
推荐理由:OpenAI 用小学数学应用题对比自家系统与微调 GPT-3 及 9-12 岁儿童的成绩,可看推理能力当时的水平参照。
一个分布式团队用 RSICD、UCM 和 Sydney 三个遥感数据集对 OpenAI 的 CLIP 进行微调,使其能按文本描述检索卫星图像。训练采用对比学习,并配合图像增强与基于 Marian MT 回译的文本增强来抑制过拟合。微调后的模型已开放下载,并提供在线 demo 供试用。
OpenAI 发布文章介绍用人类反馈总结书籍,目标是扩展人类对 AI 系统在难以评估任务上的监督。材料仅提供摘要,未给出具体方法、数据或结果细节。
OpenAI 宣布任命 Helen Toner 为董事会成员。Helen Toner 此前任职于 Georgetown 安全与新兴技术中心(CSET),长期研究 AI 政策与治理。
OpenAI 发布 Triton 1.0,这是一门开源的类 Python 编程语言,让没有 CUDA 经验的研究者也能编写高效的 GPU 代码,多数情况下能达到专家水准。Triton 1.0 以开源形式发布。
推荐理由:OpenAI 官方发布 Triton 1.0,说明无 CUDA 经验的研究者也能写出接近专家水平的 GPU 代码。
OpenAI 研究发现,通过在小型精选数据集上微调,可以改善语言模型在特定行为价值观方面的表现。
OpenAI 宣布 2021 届 OpenAI Scholars 已完成为期六个月的导师计划,并在 OpenAI 提供的津贴与支持下完成了开源研究项目。
OpenAI 宣布美国国会议员 Will Hurd 加入其董事会。OpenAI 表示,实现造福全人类的通用人工智能目标,既需要技术专长,也需要公共政策方面的经验。
OpenAI 在 CLIP 中发现了一类神经元,无论概念以字面、符号还是概念化方式呈现,它们都会产生响应。这可能解释 CLIP 为何能准确分类出人意料的视觉变体,也是理解 CLIP 及同类模型所学关联与偏见的重要一步。
推荐理由:OpenAI 公开 CLIP 中跨字面、符号与概念三种呈现方式响应的神经元,为理解多模态模型的关联与偏见提供线索。
OpenAI 将 Kubernetes 集群扩展至 7,500 节点,为 GPT-3、CLIP、DALL·E 等大模型提供可扩展基础设施,同时支持小规模快速迭代研究。
OpenAI 发布名为 CLIP 的神经网络,通过自然语言监督高效学习视觉概念。CLIP 只需提供待识别视觉类别的名称,即可应用于任意视觉分类基准,类似 GPT-2 和 GPT-3 的零样本能力。
推荐理由:OpenAI 官方介绍 CLIP 用自然语言监督学习视觉概念,可零样本迁移到任意分类基准。
OpenAI 训练了一个名为 DALL·E 的神经网络,可根据自然语言文本描述生成图像,覆盖自然语言可表达的多种概念。
推荐理由:OpenAI 官方公布 DALL·E,说明其可由自然语言描述生成图像,是文生图方向的早期节点。
OpenAI 发布组织架构更新,称过去一年公司经历了剧烈变化与增长。原文未披露具体调整细节。
OpenAI 宣布已同意将 GPT-3 授权给 Microsoft,供其用于自家产品和服务。材料未披露授权金额、期限或具体产品范围。
OpenAI 将人类反馈强化学习(RLHF)应用于语言模型训练,使其摘要能力得到提升。
OpenAI Scholars 2020 第三届学员在线上 Demo Day 展示了他们过去五个月的研究成果。
OpenAI 宣布与 AIcrowd、卡内基梅隆大学和 DeepMind 共同组织两场 NeurIPS 2020 竞赛,分别基于 Procgen Benchmark 和 MineRL。
OpenAI 发现,正如在语言上训练的大型 Transformer 模型能生成连贯文本,同一套模型在像素序列上训练后也能生成连贯的图像补全与样本。研究通过建立样本质量与图像分类准确率之间的相关性,表明其最佳生成模型在无监督设定下所包含的特征可与顶级卷积网络竞争。
推荐理由:OpenAI 用同一套 Transformer 架构处理像素序列,并给出生成质量与分类精度的关联证据。
OpenAI 发布题为 Language models are few-shot learners 的论文,讨论语言模型的少样本学习能力。该页面正文抓取失败,仅保留标题信息。
OpenAI 发布分析称,自 2012 年以来,在 ImageNet 分类上训练神经网络达到同等性能所需算力每 16 个月减少一半。与 2012 年相比,训练到 AlexNet 水平所需算力减少 44 倍,而同期摩尔定律只带来 11 倍的成本改善。OpenAI 认为,在近期投入较高的 AI 任务上,算法进步带来的收益超过传统硬件效率提升。
推荐理由:OpenAI 用 ImageNet 训练算力数据量化算法进步速度,可与摩尔定律对照理解 AI 效率来源。
OpenAI 参与撰写了一份由 30 家机构、58 位合著者完成的多方报告,提出 10 种提升 AI 系统相关声明可验证性的机制。开发者可借此提供 AI 系统安全、可靠、公平或隐私保护的证据,用户、政策制定者与公民社会也可据此评估 AI 开发过程。
OpenAI 推出 Microscope,可视化八个视觉"模式生物"模型的每一重要层与神经元,便于分析神经网络内部形成的特征。该工具面向可解释性研究,旨在帮助研究社区理解这些复杂系统。
OpenAI 宣布将其深度学习框架标准化为 PyTorch。此前 OpenAI 主要使用 TensorFlow,此次调整意味着 PyTorch 成为其模型训练与研究的统一框架。
OpenAI 发布关于 Dota 2 大规模深度强化学习的研究,标题为 Dota 2 with large scale deep reinforcement learning。原文正文抓取失败,仅标题可用。
OpenAI 发现双重下降现象在 CNN、ResNet 和 Transformer 中普遍存在:随着模型规模、数据规模或训练时间增加,性能先提升、再变差、然后再次提升。这一效应通常可通过精细的正则化避免,但其成因尚不完全清楚,OpenAI 将其视为重要研究方向。
OpenAI 发布 Procgen Benchmark,包含 16 个易于使用的程序化生成环境,用于直接衡量强化学习智能体学习可泛化技能的速度。
OpenAI 发布 Safety Gym,一套用于衡量强化学习智能体在训练中遵守安全约束进展的环境与工具套件。该套件面向在训练过程中兼顾安全约束的强化学习智能体,提供相应的环境和工具来度量其进展。
OpenAI 发布 GPT-2 分阶段发布的最后一个版本,即参数量 1.5B 的最大版本,同时开放代码和模型权重,以便检测 GPT-2 模型的输出。OpenAI 表示,尽管自 8 月以来已有更大的语言模型发布,仍按原定分阶段发布计划推进,为社区提供一个完整分阶段发布流程的测试案例,并希望它对未来强大模型的开发者有用。
推荐理由:OpenAI 按分阶段发布计划放出 GPT-2 最大版本及权重,可作为完整分阶段发布流程的参考案例。
OpenAI 训练了一对神经网络,让类人机械手还原魔方,训练完全在仿真中完成,使用与 OpenAI Five 相同的强化学习代码,并搭配名为 Automatic Domain Randomization(ADR)的新技术。系统能应对训练中从未见过的情况,例如被毛绒长颈鹿戳碰。OpenAI 表示这说明强化学习不只是虚拟任务的工具,也能解决需要前所未有灵巧度的物理世界问题。
推荐理由:OpenAI 用同一套强化学习代码加 ADR 让机械手在仿真中学会还原魔方,可看仿真到现实迁移的早期思路。
OpenAI 已开放第三期 OpenAI Scholars 项目的申请通道,面向 2020 年度学员。该项目此前已举办两期,此次为第三次招收学员。
OpenAI 用人类反馈微调了 774M 参数的 GPT-2 语言模型,在多项任务上成功匹配外部人类标注者的偏好,但这些偏好并不总与 OpenAI 自身一致。在摘要任务中,标注者偏好直接照抄输入的句子,模型因此学会了复制,该任务需要 60k 条人类标注;而按不同风格续写文本等更简单的任务只需 5k 条标注。OpenAI 表示其动机是让安全技术更接近“机器与人对话”这一通用任务。
推荐理由:OpenAI 用人类偏好微调 GPT-2 的早期实验,展示了标注偏好如何直接塑造模型行为。
OpenAI 在自建的模拟捉迷藏环境中训练智能体,观察到它们逐步学会使用更复杂的工具,并形成六种不同的策略与反策略,其中一些策略是该环境原本未预设支持的。OpenAI 表示,这种在简单环境中自监督涌现出的复杂性,说明多智能体共同适应未来可能产生极其复杂且智能的行为。
推荐理由:OpenAI 在自建捉迷藏环境中观察到智能体自发形成六种策略与反策略,可了解多智能体协同演化的一种研究路径。
OpenAI 开发出一种评估神经网络分类器能否抵御训练中未见对抗攻击的方法,并提出新指标 UAR(Unforeseen Attack Robustness),用于衡量单一模型面对未预期攻击时的鲁棒性。该方法同时指出,需要在更多样化的未知攻击范围内衡量模型表现。