如何用 Megatron-LM 训练语言模型
Hugging Face 发布教程,讲解如何在 NVIDIA GPU 上用 Megatron-LM 训练 GPT2 语言模型,并转换到 Transformers 使用。
Hugging Face 发布教程,讲解如何在 NVIDIA GPU 上用 Megatron-LM 训练 GPT2 语言模型,并转换到 Transformers 使用。
RAIL Initiative 推出 OpenRAIL 系列 AI 专用许可证,在允许免版税访问、下游使用与再分发的同时,嵌入针对特定关键场景的使用限制条款。该框架由 Hugging Face 支持,灵感来自 BigScience、开源与 Creative Commons,旨在让许可方在开放模型时保留对有害用途的约束与执行能力。
Hugging Face Spaces 可通过 3Dmol.js 与 Gradio 的 HTML block 集成,在浏览器中直接可视化蛋白质结构。用户可输入 4 位 PDB 代码或上传 PDB 文件,应用会从 RCSB Protein Databank 获取结构并渲染。文中还提到可用 Molecule3D Gradio 自定义组件简化这一流程。
Hugging Face 发布教程,介绍如何用 Diffusers 库运行 Stable Diffusion,并解释其潜空间扩散模型的工作原理。
推荐理由:Hugging Face 官方给出 Stable Diffusion 在 Diffusers 中的完整用法与原理拆解,可据此理解潜空间扩散的组件分工。
Hugging Face 阐述了其 transformers 库在 TensorFlow 上的设计理念:所有 TensorFlow 模型都是 Keras Model 对象,所有层都是 Keras Layer 对象,用户可直接调用 fit()、compile() 和 predict()。库通过 TFAutoModel 等类一行代码加载预训练模型,并配合 AutoTokenizer 完成匹配的预处理。
Hugging Face 发布 Sentence Transformers 训练与微调教程,讲解如何从零构建模型或从 Hub 加载已有模型微调,并以 distilroberta-base 加池化层为例说明其两层架构。
Hugging Face 深度强化学习课程第 8 单元讲解 Proximal Policy Optimization (PPO),通过在当前策略与旧策略的概率比上做裁剪(范围 [1−ϵ,1+ϵ])来限制每轮策略更新幅度,避免更新过大导致训练不稳定。课程随后用 PyTorch 从零实现 PPO,并在 CartPole-v1 和 LunarLander-v2 上验证。
Hugging Face 发布 Private Hub(PH),为机器学习全生命周期提供统一工具,支持以安全合规的方式加速从研究到生产的各环节。PH 基于拥有 60K+ 模型、6K 数据集和 6K 演示应用的 Hugging Face Hub,通过 Git 仓库、组织账户和权限管理实现团队内部模型、数据集与 Spaces 的共享协作。
Hugging Face 于 2022 年 6 月下旬向白宫 OSTP 和 NSF 提交了对 NAIRR 中期报告的回应,建议任命技术与伦理专家担任顾问、制定模型与数据文档标准(如 Model Cards)、为跨学科非技术专家提供低代码或无代码工具(如 AutoTrain),并投资 Responsible AI Licenses 以应对资源滥用。
Hugging Face 的 transformers 库在 TensorFlow 下现可用 XLA 编译文本生成,速度最高提升 100 倍,甚至快于 PyTorch。该功能需 transformers >= 4.21.0,示例基于 GPT-2 展示采样、贪心解码与 Beam Search 等生成方式。
Hugging Face 博客介绍动态对抗数据收集(DADC):让用户用各种手写方式欺骗模型,再把被标记的对抗样本加入数据集反复训练。文章以 MNIST 手写数字识别为例,模型训练 20 个 epoch 后在测试集上达到 89% 准确率,并借助 🤗 Spaces 搭建交互与标记流程。
Hugging Face 披露了 176B 参数多语言模型 BLOOM 的训练技术细节,该模型基于 Megatron-DeepSpeed 框架、采用 3D 并行技术,在 384 块 80GB A100 GPU 上训练了约 3.5 个月。训练数据为 59 种语言、350B token,模型架构类似 GPT3 并做了改进,词表规模 250,680。
作者用 Sentence Transformers 的语义搜索功能搭建了一个歌单生成器:将歌词按段落切分并嵌入,再对输入提示词做语义搜索匹配歌曲,并封装成基于 Gradio Blocks 的多步应用托管在 Hugging Face Spaces。
Hugging Face 发布 BLOOM,一个 176B 参数的多语言大语言模型,可生成 46 种自然语言和 13 种编程语言的文本,由 70 多个国家 1000 多名研究者协作完成,在法国 Jean Zay 超算上训练 117 天。
推荐理由:BLOOM 以 176B 参数覆盖 46 种自然语言,并公开训练中间检查点,可据此了解开放大模型在透明度上的做法。
Hugging Face 发文介绍如何以 Sentence Transformers(ST)为例从零上手一个新 ML 库并完成首个自驱项目。ST 可将句子、段落和图像转为嵌入向量,并用 util.cos_sim 计算余弦相似度,支持语义搜索、聚类和模型蒸馏等应用。该库在 GitHub 已获近 8,000 stars,超过 3,000 个项目和包依赖它。
Hugging Face 推出 Evaluation on the Hub,由 AutoTrain 驱动,用户无需写代码即可在 Hub 上用任意数据集和指标评测模型。评测结果会以 PR 形式写入模型卡的元数据,并汇总到数据集排行榜,官方已用该工具评测了数百个模型。工具已嵌入现有生态,评测提交界面和排行榜都是 Hugging Face Spaces,用户可从数据集页面发起评测。
推荐理由:官方说明可在 Hub 上零代码评测任意模型与数据集,并给出结果写入模型卡与排行榜的完整流程。
Hugging Face 博客介绍了三种将 Transformers 模型转为 ONNX 的方式:底层 torch.onnx、中层 transformers.onnx 和高级 Optimum。
Hugging Face 深度强化学习课程第三单元讲解 Deep Q-Learning,用神经网络替代 Q-table 来近似各动作的 Q-value,并训练智能体玩 Space Invaders 等 Atari 环境。
Hugging Face Hub 上线 pull requests 和 discussions 功能,所有模型、数据集和 Spaces 仓库的 community 标签页均可使用,社区成员可创建并参与讨论和 PR。PR 不使用 fork 和分支,而是将贡献直接推送到源仓库上的自定义 ref 分支,并可在网页端直接评论、合并或关闭。官方称这是 Hub 史上最大更新。
Hugging Face 深度强化学习课程第二单元第二部分讲解 Q-Learning,并从头实现首个 RL 智能体。Q-Learning 是一种 off-policy、基于价值的方法,通过 TD 方式训练动作价值函数,其内部维护一张 Q-table 记录每个状态-动作对的价值。
Hugging Face 多模态学习团队发布了一份伦理章程,将伦理原则正式纳入其机器学习研究生命周期。章程列出了要防止的用例,包括生成虚假信息、生成个人身份信息,以及在医疗、法律、金融、移民等高风险领域的不谨慎使用。团队同时提出透明、开放可复现、公平、自我批判和尊重署名五项价值观,并承认这些价值观之间可能存在冲突,需逐案权衡。
Hugging Face 深度强化学习课程更新第二单元第一部分,讲解基于价值的方法,并区分蒙特卡洛与时序差分学习。该部分涵盖状态价值函数、动作价值函数与贝尔曼方程,为后续学习 Q-Learning 及深度 Q-Learning 打基础。
Hugging Face 宣布启动 Fellowship 计划,为开源机器学习生态的关键贡献者提供算力资源、周边物资和官方认可,首批 Fellow 包括创建最大西语 NLP 社区的 María Grandury、向 Hub 贡献超 300 个模型的 Manuel Romero 等。
Hugging Face 发布 Gradio 3.0,对 Gradio 库做了彻底重新设计。新版前端改用 Svelte 等现代技术,页面体积更小、加载更快,并改进了 Dataframe 等组件、新增 Gallery 组件和 TabbedInterface 类。
推荐理由:官方说明 Gradio 3.0 的前端重构与 Blocks 低层 API,读者可据此判断自定义 ML demo 布局与数据流的写法。
Hugging Face 开放首届 Student Ambassador Program 申请,截止日期为 2022 年 6 月 13 日,计划于 6 月 30 日启动、12 月 31 日结束。
Hugging Face 开源库 Optimum 发布 1.2 版本,新增对 Transformers pipelines 的推理支持,首批接入 ONNX Runtime,用户可将 AutoModelForXxx 直接替换为对应的 ORTModelForXxx 类。
Hugging Face 宣布完成 1 亿美元 C 轮融资,由 Lux Capital 领投,Sequoia、Coatue 等参与,现有投资方 Addition、a_capital、SV Angel 等继续支持。
推荐理由:Hugging Face 官方披露 C 轮融资规模、领投方与平台现有模型和数据集数量,可据此了解其开源路线与后续投入方向。
Hugging Face 推出免费深度强化学习课程,从入门到专家,使用 Stable Baselines3、RL Baselines3 Zoo 和 RLlib 等库。
Hugging Face 发布教育计划,目标在 2023 年底前向 500 万人教授机器学习。该计划面向所有人、初学者和教师,提供 NLP、深度强化学习、Gradio 演示构建等免费课程,以及翻译成 8 种语言的教师工具包,并已在 3 月的 ML demo.cratization tour 中为 16 个国家超 1000 名学生授课。
Hugging Face 机器学习工程师 Lewis Tunstall 在播客中介绍了自己从 2018 年使用 pytorch-pretrained-bert 到合著《NLP with Transformers》的经历,并谈到在 transformers 库中推动 ONNX 格式导出,让模型只需一行代码即可转换,从而获得更低延迟和更高吞吐。
Habana Labs 与 Hugging Face 宣布合作,将 Habana 的 SynapseAI 软件套件与 Hugging Face Optimum 开源库集成,开发者只需几行代码即可在 Habana Gaudi 处理器上加速 Transformer 训练。
Hugging Face 的 Transformers 库有意不遵循 DRY 原则,转而采用"单模型文件策略",即模型前向传播所需的全部代码只放在一个 model 文件中,注意力机制代码因此被复制 50 多次。官方给出的理由包括:库由开源社区共建、建模代码本身就是产品、机器学习领域演进极快、模型发布后基本静态不变。
Hugging Face 推出为期 9 个月的 AI 研究驻留计划,入选者将与 Science Team 研究员合作选定研究课题、开发新的机器学习技术并争取发表成果。申请不限背景,需具备编程能力与微积分、线性代数等基础,申请截止日期为 2022 年 4 月 3 日。
Hugging Face 博客介绍了利用 Wav2Vec2 的 CTC 架构特性,在 🤗 Transformers 中对任意长音频乃至实时语音做高质量自动语音识别。
🤗 Transformers 现已集成 Kensho Technologies 的 pyctcdecode 库,可将 n-gram 语言模型与微调后的 Wav2Vec2 checkpoint 结合用于音频解码。
Hugging Face 发布教程,介绍如何用 Amazon SageMaker 和 Hugging Face Inference Toolkit 部署 EleutherAI 的 GPT-J 6B 进行实时推理,可在 NVIDIA T4 GPU 实例(约 500 美元/月)上运行。
Hugging Face 收购机器学习初创公司 Gradio,Gradio 联合创始人撰文宣布这一消息。Gradio 于 2019 年由斯坦福博士生与三位室友发布,用于让机器学习工程师快速搭建并分享模型 demo,至今已有超过 30 万个 demo 用它构建。作者表示加入 Hugging Face 后将继续发展 Gradio,让任何有浏览器和网络连接的人都能使用机器学习模型。
推荐理由:Gradio 创始人以当事方身份讲述被收购的经过,读者可了解这款开源库从 2019 年起步到 30 万 demo 的路径。
Hugging Face 将 Google DeepMind 的 Perceiver IO 加入 Transformers 库,这是首个可处理文本、图像、音频、视频、点云等多种模态及其组合的 Transformer 类模型。
推荐理由:Hugging Face 官方详解 Perceiver IO 的接入方式,读者可据此了解这套架构如何处理文本、图像、音频等多模态输入。
Hugging Face 发布教程,介绍如何从零训练 GPT-2 large(1.5B 参数)代码生成模型 CodeParrot,用于自动补全 Python 代码。
Hugging Face 与 Graphcore 合作推出 Optimum Graphcore,让 Transformer 模型可在 Graphcore IPU 上加速,BERT 成为首个 IPU 优化模型。