OpenAI 发布 Triton 1.0:面向神经网络的 GPU 编程语言
OpenAI 发布 Triton 1.0,这是一门开源的类 Python 编程语言,让没有 CUDA 经验的研究者也能编写高效的 GPU 代码,多数情况下能达到专家水准。Triton 1.0 以开源形式发布。
推荐理由:OpenAI 官方发布 Triton 1.0,说明无 CUDA 经验的研究者也能写出接近专家水平的 GPU 代码。
OpenAI 发布 Triton 1.0,这是一门开源的类 Python 编程语言,让没有 CUDA 经验的研究者也能编写高效的 GPU 代码,多数情况下能达到专家水准。Triton 1.0 以开源形式发布。
推荐理由:OpenAI 官方发布 Triton 1.0,说明无 CUDA 经验的研究者也能写出接近专家水平的 GPU 代码。
Hugging Face 等机构提出 DeDLOC 协作分布式训练方法,可自适应参与者的网络与硬件条件,并用 40 名志愿者预训练出孟加拉语模型 sahajBERT。
推荐理由:DeDLOC 用 40 名志愿者和家用 GPU 预训练出孟加拉语模型,读者可了解分布式协作训练如何绕开算力门槛。
Hugging Face Hub 现已集成 spaCy,用户可通过一条命令上传任意 spaCy pipeline 包,并自动生成模型卡和元数据。spaCy 官方组织已上线 60 多个来自 3.1 版本的最新模型,Inference API 开箱支持 NER,浏览器内即可交互试用。模型可直接通过 pip install 安装,并支持 HTTP 请求调用。
Gradio 2.0 发布,可用一行代码为几乎任意 Hugging Face 模型生成 GUI,默认调用 Hugging Face 托管的 Inference API,也可本地运行 transformers 计算。该版本支持并行加载多个模型做对比、串联多个模型构建复杂应用,例如用 3 行代码搭建翻译并摘要芬兰语新闻的应用。安装方式为 pip install gradio。
推荐理由:Gradio 2.0 把 Hugging Face 模型加载与界面搭建压缩到一行代码,读者可据此判断模型演示与组合应用的门槛变化。
Hugging Face 发布开源库 Accelerate,让原始 PyTorch 训练脚本无需重写即可在任意设备上运行。只需在标准训练脚本中加入约五行代码,即可支持单机或多机多 GPU、TPU 以及混合精度训练,并自动处理设备放置。
推荐理由:官方给出五处代码改动即可跑分布式与混合精度的对比,便于判断迁移成本。
Hugging Face 博客解析 BigBird 的块稀疏注意力机制,该模型已随 🤗Transformers 提供 RoBERTa 风格版本,可处理最长 4096 的序列,计算成本远低于 BERT。BigBird 用滑动注意力、全局 token 和随机 token 三种方式近似 BERT 的全注意力,目标不是超越 BERT,而是在长序列上更高效。
Hugging Face 与 Amazon 宣布战略合作,Hugging Face 将 AWS 作为首选云服务商,并推出 Hugging Face Deep Learning Containers(DLCs),让用户可在 Amazon SageMaker 中训练 Transformer 模型。
Hugging Face 发布教程,演示如何用 🤗 Transformers 微调 Wav2Vec2 预训练模型做英语 ASR。Wav2Vec2 由 Alexei Baevski 等人于 2020 年 9 月发布,仅用 10 分钟标注数据即可在 LibriSpeech 干净测试集上取得低于 5% 的 WER。
Hugging Face Transformers 新增的 RAG 模型通过集成 Ray 实现分布式文档检索,每次检索调用相比 torch.distributed 提速 2 倍,并改善了 RAG 分布式微调的可扩展性。
Hugging Face 与 Facebook PyTorch、Google TPU 团队合作,让 PyTorch 用户能在 Cloud TPU 上训练模型并保持原有 Trainer 接口不变。PyTorch / XLA 新增 xla 设备类型,通过 xm.optimizer_step 完成梯度聚合与优化器更新,并用 MpDeviceLoader 让输入流水线与图追踪重叠执行。
Hugging Face 的 transformers v4.2.0 为 Trainer 加入 DeepSpeed 和 FairScale 的 ZeRO 实验性支持,新增 --deepspeed 和 --sharded_ddp 命令行参数。
推荐理由:作者用 t5-large 与 t5-3b 的实测数据对比 FairScale 与 DeepSpeed 的显存与速度收益,可据此判断自己该先试哪种方案。
Hugging Face 通过模型管线优化、Rust 版 Tokenizers 与智能缓存,为 Accelerated Inference API 客户实现约 10 倍推理提速,再借助 ONNX Runtime 的图优化、算子融合与量化等硬件相关编译手段拿到另外 10 倍,合计 100 倍。
Hugging Face 发布教程,介绍如何用 BERT、GPT2 等预训练检查点热启动 encoder-decoder 模型,从而跳过昂贵的预训练阶段。该方法基于 Rothe 等人 2020 年的论文,在多个序列到序列任务上以极低训练成本达到与 T5、Pegasus 等大型预训练 encoder-decoder 模型相当的效果。
Hugging Face Transformers 在 3.1 版本中与 Ray Tune 集成,用户只需在 Trainer 的 hyperparameter_search 中指定 backend="ray" 即可调用 HyperBand、Bayesian Optimization、Population-Based Training 等调参算法。
Hugging Face 发布博客详解基于 Transformer 的编码器-解码器架构如何建模序列到序列问题,聚焦其数学模型与推理用法,并拆解编码器、解码器两部分。
Hugging Face 博客详解 Reformer 模型,它能在不到 8GB 内存下训练长度达 50 万 token 的序列,而 bert-base-uncased 仅支持 512 token。Reformer 通过局部与 LSH 自注意力、分块前馈层、可逆残差层和轴向位置编码四项改造降低内存占用,并已集成进 Transformers 库。
OpenAI 宣布与 AIcrowd、卡内基梅隆大学和 DeepMind 共同组织两场 NeurIPS 2020 竞赛,分别基于 Procgen Benchmark 和 MineRL。
Hugging Face 发布教程,介绍如何用 transformers 库实现自回归语言生成的多种解码方法,包括贪心搜索、beam search 和采样。文中以 GPT2 为例给出可运行代码,演示 num_beams、no_repeat_ngram_size、temperature、top_k、top_p 等参数的效果。
推荐理由:系统梳理贪心、beam search 与采样等解码策略的差异,并给出 transformers 中可直接运行的参数配置。
Hugging Face 发布教程,演示如何用 transformers 和 tokenizers 库从零训练一个 84M 参数的小型语言模型 EsperBERTo,并在世界语上完成预训练与词性标注微调。
推荐理由:以世界语为例完整走通从零预训练到下游微调的流程,可迁移到其他低资源语言。
OpenAI 宣布将其深度学习框架标准化为 PyTorch。此前 OpenAI 主要使用 TensorFlow,此次调整意味着 PyTorch 成为其模型训练与研究的统一框架。
OpenAI 发布 GPT-2 分阶段发布的最后一个版本,即参数量 1.5B 的最大版本,同时开放代码和模型权重,以便检测 GPT-2 模型的输出。OpenAI 表示,尽管自 8 月以来已有更大的语言模型发布,仍按原定分阶段发布计划推进,为社区提供一个完整分阶段发布流程的测试案例,并希望它对未来强大模型的开发者有用。
推荐理由:OpenAI 按分阶段发布计划放出 GPT-2 最大版本及权重,可作为完整分阶段发布流程的参考案例。
OpenAI 开放 OpenAI Scholars 2019 申请,这是该项目的第二批,面向代表性不足群体提供 6–10 个津贴与导师指导名额,入选者可全职学习深度学习 3 个月并开源一个项目。
OpenAI 发布强化学习游戏研究平台 Gym Retro 的完整版,公开可用的游戏数量从约 70 款 Atari 游戏和 30 款 Sega 游戏扩展到覆盖多种模拟器的 1000 款以上。OpenAI 同时发布了用于向该平台添加新游戏的工具。
推荐理由:OpenAI 把强化学习游戏平台 Gym Retro 的游戏规模从约百款扩到 1000 款以上,并公开了添加新游戏的工具。
OpenAI 推出 Scholars 计划,为来自 underrepresented 群体的个人提供 6–10 份津贴和导师指导,支持其全职学习深度学习 3 个月并开源一个项目。
OpenAI 开源内部项目 OpenAI Baselines,目标是以与已发表结果相当的性能复现强化学习算法。算法将在未来数月内陆续发布,今天的首批发布包含 DQN 及其三个变体。
推荐理由:OpenAI 开源内部复现强化学习算法的 Baselines 项目,首批放出 DQN 及其三个变体,可了解其复现思路与后续发布节奏。
OpenAI 发布 Roboschool,这是一款用于机器人仿真的开源软件,并与 OpenAI Gym 集成。
推荐理由:OpenAI 开源机器人仿真软件并接入 Gym,可了解早期具身智能训练环境的开放方式。
OpenAI 宣布支持 Distill 上线,这是一种旨在出色传播机器学习成果(无论新颖还是已有)的新型期刊。
OpenAI 发布 OpenAI Gym 公测版,这是一个用于开发和比较强化学习(RL)算法的工具包。它包含一套持续扩充的环境,涵盖模拟机器人和 Atari 游戏,并提供一个用于比较和复现结果的站点。
推荐理由:OpenAI 官方发布强化学习工具包公测,读者可了解其环境套件与结果对比站点的构成。