GPT-Neo 与 🤗 Accelerated Inference API 的 Few-Shot Learning 实践
Hugging Face 发文介绍如何用 EleutherAI 的 GPT-Neo 配合 🤗 Accelerated Inference API 实现 Few-Shot Learning 预测。
Hugging Face 发文介绍如何用 EleutherAI 的 GPT-Neo 配合 🤗 Accelerated Inference API 实现 Few-Shot Learning 预测。
Hugging Face 发布系列博客第一部分,讲解如何通过硬件优化在 CPU 上扩展 BERT 类模型推理。
Hugging Face 博客解析 BigBird 的块稀疏注意力机制,该模型已随 🤗Transformers 提供 RoBERTa 风格版本,可处理最长 4096 的序列,计算成本远低于 BERT。BigBird 用滑动注意力、全局 token 和随机 token 三种方式近似 BERT 的全注意力,目标不是超越 BERT,而是在长序列上更高效。
Hugging Face 的月度阅读小组 2021 年 2 月聚焦长程注意力,围绕 Longformer、Compressive Transformer、Linformer、Performer 四篇论文梳理了降低 Transformer 序列长度二次开销的四条路线:自定义注意力模式、循环、低秩近似与核近似。
Hugging Face 发布博客详解基于 Transformer 的编码器-解码器架构如何建模序列到序列问题,聚焦其数学模型与推理用法,并拆解编码器、解码器两部分。
Hugging Face 发布教程,介绍如何用 transformers 库实现自回归语言生成的多种解码方法,包括贪心搜索、beam search 和采样。文中以 GPT2 为例给出可运行代码,演示 num_beams、no_repeat_ngram_size、temperature、top_k、top_p 等参数的效果。
推荐理由:系统梳理贪心、beam search 与采样等解码策略的差异,并给出 transformers 中可直接运行的参数配置。
OpenAI 发布关于 Dota 2 大规模深度强化学习的研究,标题为 Dota 2 with large scale deep reinforcement learning。原文正文抓取失败,仅标题可用。
OpenAI 提出 Random Network Distillation(RND),一种基于预测的奖励方法,通过好奇心鼓励强化学习智能体探索环境,首次在 Montezuma's Revenge 上超过人类平均水平。
OpenAI 训练智能体仅凭单次人类演示就在 Montezuma's Revenge 上取得 74,500 分的高分,超过此前所有已发表结果。其算法从演示中精心挑选状态出发,让智能体依次游玩一系列游戏,并用 PPO 优化游戏得分来学习,PPO 也是支撑 OpenAI Five 的同一强化学习算法。
推荐理由:OpenAI 用单次人类演示让智能体在 Montezuma's Revenge 上取得 74,500 分,可了解其基于 PPO 的简单方法。
OpenAI 发文说明其 Dota 2 结果表明,在算力充足的前提下,自对弈能把机器学习系统的表现从远低于人类水平提升到超人水平。该系统在一个月内从勉强与高排名玩家打平,发展到击败顶尖职业选手,此后仍在持续进步。OpenAI 指出,监督式深度学习系统的上限受训练数据集限制,而自对弈系统中可用数据会随智能体变强而自动改善。
推荐理由:OpenAI 用 Dota 2 结果说明自对弈在算力充足时能把系统从远低于人类提升到超人水平。
OpenAI 发文探讨强化学习算法中一种反直觉的失效模式:奖励函数设定错误。当奖励函数被错误指定时,算法会以出人意料的方式崩溃。