Hugging Face 推出教育计划:目标 2023 年底教会 500 万人机器学习
Hugging Face 发布教育计划,目标在 2023 年底前向 500 万人教授机器学习。该计划面向所有人、初学者和教师,提供 NLP、深度强化学习、Gradio 演示构建等免费课程,以及翻译成 8 种语言的教师工具包,并已在 3 月的 ML demo.cratization tour 中为 16 个国家超 1000 名学生授课。
Hugging Face 发布教育计划,目标在 2023 年底前向 500 万人教授机器学习。该计划面向所有人、初学者和教师,提供 NLP、深度强化学习、Gradio 演示构建等免费课程,以及翻译成 8 种语言的教师工具包,并已在 3 月的 ML demo.cratization tour 中为 16 个国家超 1000 名学生授课。
Hugging Face Hub 推出 emissions_threshold 参数,可按训练碳排放量筛选模型,例如筛选排放不超过 100 克的模型返回 191 个结果。transformers 集成 codecarbon,训练时自动记录排放数据并生成 emissions.csv,方便写入模型卡。
Hugging Face 机器学习工程师 Lewis Tunstall 在播客中介绍了自己从 2018 年使用 pytorch-pretrained-bert 到合著《NLP with Transformers》的经历,并谈到在 transformers 库中推动 ONNX 格式导出,让模型只需一行代码即可转换,从而获得更低延迟和更高吞吐。
Habana Labs 与 Hugging Face 宣布合作,将 Habana 的 SynapseAI 软件套件与 Hugging Face Optimum 开源库集成,开发者只需几行代码即可在 Habana Gaudi 处理器上加速 Transformer 训练。
Hugging Face 的 Transformers 库有意不遵循 DRY 原则,转而采用"单模型文件策略",即模型前向传播所需的全部代码只放在一个 model 文件中,注意力机制代码因此被复制 50 多次。官方给出的理由包括:库由开源社区共建、建模代码本身就是产品、机器学习领域演进极快、模型发布后基本静态不变。
Hugging Face 将离线强化学习方法 Decision Transformer 集成进 transformers 库和 Hugging Face Hub,并发布 9 个面向 Gym 连续控制任务的预训练 checkpoint,覆盖 Hopper、Walker2D 和 Halfcheetah,Atari 环境 checkpoint 即将推出。
Hugging Face 发布机器学习专家访谈,嘉宾 Margaret Mitchell 曾任 Google 伦理 AI 团队创始人兼联合负责人,现于 Hugging Face 制定伦理 AI 研究协议与包容性招聘体系。她因在微软 Seeing AI 项目中目睹图像数据偏差而转向伦理 AI,指出 ML 团队普遍缺乏相关概念与词汇,且行业"Alpha"文化使女性主导的伦理研究被轻视。
Hugging Face 推出为期 9 个月的 AI 研究驻留计划,入选者将与 Science Team 研究员合作选定研究课题、开发新的机器学习技术并争取发表成果。申请不限背景,需具备编程能力与微积分、线性代数等基础,申请截止日期为 2022 年 4 月 3 日。
Hugging Face 发布教程,演示如何用自建人行道数据集 segments/sidewalk-semantic 微调 SegFormer 语义分割模型,借助 transformers 与 SegformerImageProcessor 完成训练。
Hugging Face 的 🤗 datasets 库新增图像特征类型,可结合 sentence_transformers 与 faiss 为图像数据集建立相似度索引,实现图像搜索。文中以英国图书馆数字化书籍插图数据集为例,通过 ImageFolder 加载器直接读取含 image 和 label 特征的 10000 行数据,label 对应书籍出版年份。
Hugging Face 发布端到端教程,演示如何用 Hugging Face Transformers、Amazon SageMaker 和 AWS Inferentia 加速 BERT 文本分类推理。
Hugging Face 在 🤗 Transformers 中推出约束束搜索(constrained beam search),通过 model.generate() 的 force_words_ids 参数让用户指定生成结果中必须包含的词。
BERT 是 Google AI Language 研究人员于 2018 年开发的 NLP 模型,全称 Bidirectional Encoder Representations from Transformers,可解决情感分析、命名实体识别等 11+ 种常见语言任务。
Hugging Face 发布教程,演示如何用 🤗 datasets 加载 beans 图像分类数据集,并借助 🤗 transformers 微调预训练 ViT 模型。教程使用 google/vit-base-patch16-224-in21k 及其配套 ViTImageProcessor,将图像切分为 patch 并嵌入为 token 序列后送入 Transformer 训练。
Hugging Face Hub 上已有超过 215 个公开的情感分析模型,用 Python 的 transformers pipeline 只需 5 行代码即可调用,默认模型对 "I love you" 和 "I hate you" 分别给出 0.9998 和 0.9991 的置信度。指南还介绍了 Twitter-roBERTa-base 等预训练模型,以及用自有数据微调情感分析模型的方法。
Hugging Face 博客介绍了利用 Wav2Vec2 的 CTC 架构特性,在 🤗 Transformers 中对任意长音频乃至实时语音做高质量自动语音识别。
Hugging Face 为 huggingface_hub 库新增 ModelFilter 和 ModelSearchArguments 类,让用户无需离开 Jupyter 或 Python 环境即可按任务、数据集、框架等条件搜索 Hub 上的模型和数据集。
Hugging Face 将 PyTorch 深度强化学习库 Stable-Baselines3 集成到 Hugging Face Hub,用户可通过 huggingface_sb3 上传和加载已保存的智能体模型。
Hugging Face 公布 Infinity 在第三代 Intel Xeon 可扩展处理器(Ice Lake)上的端到端推理基准:优化后的 DistilBERT 序列分类容器相比 Cascade Lake 实例延迟与吞吐最高提升 34%,相比原生 Transformers 最高提升 800%。
🤗 Transformers 现已集成 Kensho Technologies 的 pyctcdecode 库,可将 n-gram 语言模型与微调后的 Wav2Vec2 checkpoint 结合用于音频解码。
Hugging Face 发布教程,介绍如何用 Amazon SageMaker 和 Hugging Face Inference Toolkit 部署 EleutherAI 的 GPT-J 6B 进行实时推理,可在 NVIDIA T4 GPU 实例(约 500 美元/月)上运行。
Hugging Face 的 AutoNLP 与 Explosion 的标注工具 Prodigy 可组合成主动学习流水线:在 BBC News 分类数据集上,AutoNLP 训练 15 个多分类模型,最佳模型准确率达 98.67%,定价低至每模型 $10。
Hugging Face 收购机器学习初创公司 Gradio,Gradio 联合创始人撰文宣布这一消息。Gradio 于 2019 年由斯坦福博士生与三位室友发布,用于让机器学习工程师快速搭建并分享模型 demo,至今已有超过 30 万个 demo 用它构建。作者表示加入 Hugging Face 后将继续发展 Gradio,让任何有浏览器和网络连接的人都能使用机器学习模型。
推荐理由:Gradio 创始人以当事方身份讲述被收购的经过,读者可了解这款开源库从 2019 年起步到 30 万 demo 的路径。
Hugging Face 将 Google DeepMind 的 Perceiver IO 加入 Transformers 库,这是首个可处理文本、图像、音频、视频、点云等多种模态及其组合的 Transformer 类模型。
推荐理由:Hugging Face 官方详解 Perceiver IO 的接入方式,读者可据此了解这套架构如何处理文本、图像、音频等多模态输入。
Hugging Face 发布教程,介绍如何从零训练 GPT-2 large(1.5B 参数)代码生成模型 CodeParrot,用于自动补全 Python 代码。
Hugging Face 发布首个自定义深度强化学习环境 Snowball Fight 1vs1,玩家可在 Hugging Face Spaces 上在线与深度强化学习智能体对战扔雪球。该环境基于 Unity ML-Agents 构建并已开源托管于 Hugging Face Hub,后续还将推出 2vs2 版本,用 MA-POCA 算法训练智能体团队协作。
Hugging Face 与 Graphcore 合作推出 Optimum Graphcore,让 Transformer 模型可在 Graphcore IPU 上加速,BERT 成为首个 IPU 优化模型。
Hugging Face 发布开源 Python 库与无代码界面 Data Measurements Tool,基于 Dataset 和 Spaces Hub 及 Streamlit 构建,可在线构建、测量和比较数据集。该工具能自动计算词汇量、标签分布、实例长度、重复项及 Zipf 定律拟合度等指标,帮助数据集创建者和用户进行负责任的数据开发。
Hugging Face 发布教程,演示如何用 🤗 Transformers 将预训练检查点 Wav2Vec2-XLS-R-300M 微调用于低资源语音识别。
Hugging Face 博客第二部分聚焦用 Intel 软件栈优化 CPU 上的类 BERT 模型推理,实测新一代 Ice Lake Xeon 在多种 NLP 任务上推理速度较上代 Cascade Lake 最高提升 75%。
微软和 NVIDIA 发布 Megatron-Turing NLG 530B,号称全球最大最强的生成式语言模型,但复现该实验的基础设施成本接近 1 亿美元。作者质疑这类超大模型趋势:单台 DGX A100 服务器售价 19.9 万美元、功耗最高 6.5 千瓦,而 2019 年马萨诸塞大学研究显示在 GPU 上训练 BERT 的碳排放约等于一次横跨美国的飞行。
Hugging Face 课程第二部分将于 11 月 15 日发布,聚焦 token 分类、语言建模、翻译、摘要和问答等常见 NLP 任务,并深入讲解 Datasets 与 Tokenizers。配套社区活动包含两天讲座和团队项目,AWS 通过 Amazon SageMaker 提供免费算力,完成项目者可获结业证书。
Hugging Face 在社区周期间用 10 亿句对训练出 SOTA 句嵌入模型,硬件为 7 块 TPU v3-8。方法采用批内负样本的对比学习(InfoNCE/NTXentLoss),并指出更大 batch size、难负样本与跨数据集批次能提升效果。模型与数据集已在模型卡中公开。
Hugging Face 发文指出,Transformer 正从 NLP 扩展为通用 ML 架构,在语音、计算机视觉、点云乃至蛋白质结构预测上表现优异,Kaggle 调查显示其使用率逐年上升而 RNN、CNN 和梯度提升算法持续下滑。
一个分布式团队用 RSICD、UCM 和 Sydney 三个遥感数据集对 OpenAI 的 CLIP 进行微调,使其能按文本描述检索卫星图像。训练采用对比学习,并配合图像增强与基于 Marian MT 回译的文本增强来抑制过拟合。微调后的模型已开放下载,并提供在线 demo 供试用。
Hugging Face 博客介绍如何用 Gradio 在 Spaces 中托管 ML 演示应用。Gradio 已集成 Hugging Face Hub,只需几行代码调用 gr.Interface.load() 即可通过 Inference API 演示 Hub 上的模型,支持 image-to-text、speech-to-text、text-to-speech 等类型。
Hugging Face 发布教程,介绍如何用 Streamlit 在 Hugging Face Spaces 上托管模型和数据集并搭建演示应用。
Hugging Face 发布夏季回顾,Hub 公开模型仓库从 1 万增至超 1.6 万,并推出免费托管 ML 演示应用的 Spaces Beta,支持 Gradio 和 Streamlit。
Hugging Face 发布开源库 Optimum,目标是简化 Transformer 模型在特定硬件上的训练与推理优化,首个合作方为 Intel。Optimum 与 Intel Neural Compressor 配合,可对 BERT 等模型做训练后量化、量化感知训练和动态量化,用于 Intel Xeon CPU 部署。
推荐理由:Hugging Face 官方发布 Optimum 开源库,读者可了解其与 Intel Neural Compressor 配合量化 Transformer 的路径。
Hugging Face 在 2021 AI Hardware Summit 上宣布启动 Hardware Partner Program,Graphcore 作为创始成员参与,双方将通过新开源库 Optimum 提供经 Hugging Face 认证的 IPU 优化模型,首批模型预计今年晚些时候上线。