Hugging Face 推出 Fellowship 计划,支持开源机器学习贡献者
Hugging Face 宣布启动 Fellowship 计划,为开源机器学习生态的关键贡献者提供算力资源、周边物资和官方认可,首批 Fellow 包括创建最大西语 NLP 社区的 María Grandury、向 Hub 贡献超 300 个模型的 Manuel Romero 等。
Hugging Face 宣布启动 Fellowship 计划,为开源机器学习生态的关键贡献者提供算力资源、周边物资和官方认可,首批 Fellow 包括创建最大西语 NLP 社区的 María Grandury、向 Hub 贡献超 300 个模型的 Manuel Romero 等。
Hugging Face 研究科学家 Sasha Luccioni 在访谈中介绍了她在 Big Science 项目中主持碳足迹工作组的工作,研究范围不止于统计 CO2 排放,还涵盖制造成本乃至一封邮件产生多少 CO2 等维度。
Hugging Face 发布 Gradio 3.0,对 Gradio 库做了彻底重新设计。新版前端改用 Svelte 等现代技术,页面体积更小、加载更快,并改进了 Dataframe 等组件、新增 Gallery 组件和 TabbedInterface 类。
推荐理由:官方说明 Gradio 3.0 的前端重构与 Blocks 低层 API,读者可据此判断自定义 ML demo 布局与数据流的写法。
Hugging Face 开放首届 Student Ambassador Program 申请,截止日期为 2022 年 6 月 13 日,计划于 6 月 30 日启动、12 月 31 日结束。
Hugging Face 发布《机器学习总监洞察》系列第二期,聚焦 SaaS 领域,邀请 Salesforce 的 Omar Rahman 与 Amplitude 的曹(Danica)肖等机器学习总监分享观点。Rahman 指出产品化 ML 远不止训练模型,数据孤岛与维护开销是最大挑战;肖则强调 SaaS 中 ML 训练数据难以覆盖广泛行业场景。
Hugging Face 开源库 Optimum 发布 1.2 版本,新增对 Transformers pipelines 的推理支持,首批接入 ONNX Runtime,用户可将 AutoModelForXxx 直接替换为对应的 ORTModelForXxx 类。
Hugging Face 宣布完成 1 亿美元 C 轮融资,由 Lux Capital 领投,Sequoia、Coatue 等参与,现有投资方 Addition、a_capital、SV Angel 等继续支持。
推荐理由:Hugging Face 官方披露 C 轮融资规模、领投方与平台现有模型和数据集数量,可据此了解其开源路线与后续投入方向。
fastai 现已接入 Hugging Face Hub,开发者用一行 Python 即可将 fastai Learner 上传至 Hub 分享。
Hugging Face 推出免费深度强化学习课程,从入门到专家,使用 Stable Baselines3、RL Baselines3 Zoo 和 RLlib 等库。
Hugging Face 介绍如何通过 Accelerate 库无需改代码即可使用 PyTorch FullyShardedDataParallel(FSDP)训练大模型。
HuggingFace AutoTrain 与数据标注平台 Kili 可组合成主动学习流水线,用于文本分类任务。AutoTrain 全自动完成数据清洗、模型选择和超参数优化,支持二分类与多标签文本分类、token 分类、抽取式问答、摘要和文本打分,并覆盖英语、德语、法语、西班牙语等语言。
Hugging Face 发布教程,演示如何在 AWS EC2 DL1 实例(搭载 8 颗 Habana Gaudi 处理器)上微调 BERT 模型。使用 bert-large-uncased-whole-word-masking 在 GLUE 的 MRPC 任务上训练 3 个 epoch,耗时 2 分 12 秒,F1 达 0.8968。
Hugging Face 发布博客,演示如何用其生态工具搭建客户服务场景中的情感分类系统,将用户消息分为 very unsatisfied 到 very satisfied 五类,以优先回复最不满意的客户。
Hugging Face 发布教育计划,目标在 2023 年底前向 500 万人教授机器学习。该计划面向所有人、初学者和教师,提供 NLP、深度强化学习、Gradio 演示构建等免费课程,以及翻译成 8 种语言的教师工具包,并已在 3 月的 ML demo.cratization tour 中为 16 个国家超 1000 名学生授课。
Hugging Face Hub 推出 emissions_threshold 参数,可按训练碳排放量筛选模型,例如筛选排放不超过 100 克的模型返回 191 个结果。transformers 集成 codecarbon,训练时自动记录排放数据并生成 emissions.csv,方便写入模型卡。
Hugging Face 机器学习工程师 Lewis Tunstall 在播客中介绍了自己从 2018 年使用 pytorch-pretrained-bert 到合著《NLP with Transformers》的经历,并谈到在 transformers 库中推动 ONNX 格式导出,让模型只需一行代码即可转换,从而获得更低延迟和更高吞吐。
Habana Labs 与 Hugging Face 宣布合作,将 Habana 的 SynapseAI 软件套件与 Hugging Face Optimum 开源库集成,开发者只需几行代码即可在 Habana Gaudi 处理器上加速 Transformer 训练。
Hugging Face 的 Transformers 库有意不遵循 DRY 原则,转而采用"单模型文件策略",即模型前向传播所需的全部代码只放在一个 model 文件中,注意力机制代码因此被复制 50 多次。官方给出的理由包括:库由开源社区共建、建模代码本身就是产品、机器学习领域演进极快、模型发布后基本静态不变。
Hugging Face 将离线强化学习方法 Decision Transformer 集成进 transformers 库和 Hugging Face Hub,并发布 9 个面向 Gym 连续控制任务的预训练 checkpoint,覆盖 Hopper、Walker2D 和 Halfcheetah,Atari 环境 checkpoint 即将推出。
Hugging Face 发布机器学习专家访谈,嘉宾 Margaret Mitchell 曾任 Google 伦理 AI 团队创始人兼联合负责人,现于 Hugging Face 制定伦理 AI 研究协议与包容性招聘体系。她因在微软 Seeing AI 项目中目睹图像数据偏差而转向伦理 AI,指出 ML 团队普遍缺乏相关概念与词汇,且行业"Alpha"文化使女性主导的伦理研究被轻视。
Hugging Face 推出为期 9 个月的 AI 研究驻留计划,入选者将与 Science Team 研究员合作选定研究课题、开发新的机器学习技术并争取发表成果。申请不限背景,需具备编程能力与微积分、线性代数等基础,申请截止日期为 2022 年 4 月 3 日。
Hugging Face 发布教程,演示如何用自建人行道数据集 segments/sidewalk-semantic 微调 SegFormer 语义分割模型,借助 transformers 与 SegformerImageProcessor 完成训练。
Hugging Face 的 🤗 datasets 库新增图像特征类型,可结合 sentence_transformers 与 faiss 为图像数据集建立相似度索引,实现图像搜索。文中以英国图书馆数字化书籍插图数据集为例,通过 ImageFolder 加载器直接读取含 image 和 label 特征的 10000 行数据,label 对应书籍出版年份。
Hugging Face 发布端到端教程,演示如何用 Hugging Face Transformers、Amazon SageMaker 和 AWS Inferentia 加速 BERT 文本分类推理。
Hugging Face 在 🤗 Transformers 中推出约束束搜索(constrained beam search),通过 model.generate() 的 force_words_ids 参数让用户指定生成结果中必须包含的词。
BERT 是 Google AI Language 研究人员于 2018 年开发的 NLP 模型,全称 Bidirectional Encoder Representations from Transformers,可解决情感分析、命名实体识别等 11+ 种常见语言任务。
Hugging Face 发布教程,演示如何用 🤗 datasets 加载 beans 图像分类数据集,并借助 🤗 transformers 微调预训练 ViT 模型。教程使用 google/vit-base-patch16-224-in21k 及其配套 ViTImageProcessor,将图像切分为 patch 并嵌入为 token 序列后送入 Transformer 训练。
Hugging Face Hub 上已有超过 215 个公开的情感分析模型,用 Python 的 transformers pipeline 只需 5 行代码即可调用,默认模型对 "I love you" 和 "I hate you" 分别给出 0.9998 和 0.9991 的置信度。指南还介绍了 Twitter-roBERTa-base 等预训练模型,以及用自有数据微调情感分析模型的方法。
Hugging Face 博客介绍了利用 Wav2Vec2 的 CTC 架构特性,在 🤗 Transformers 中对任意长音频乃至实时语音做高质量自动语音识别。
Hugging Face 为 huggingface_hub 库新增 ModelFilter 和 ModelSearchArguments 类,让用户无需离开 Jupyter 或 Python 环境即可按任务、数据集、框架等条件搜索 Hub 上的模型和数据集。
Hugging Face 将 PyTorch 深度强化学习库 Stable-Baselines3 集成到 Hugging Face Hub,用户可通过 huggingface_sb3 上传和加载已保存的智能体模型。
Hugging Face 公布 Infinity 在第三代 Intel Xeon 可扩展处理器(Ice Lake)上的端到端推理基准:优化后的 DistilBERT 序列分类容器相比 Cascade Lake 实例延迟与吞吐最高提升 34%,相比原生 Transformers 最高提升 800%。
🤗 Transformers 现已集成 Kensho Technologies 的 pyctcdecode 库,可将 n-gram 语言模型与微调后的 Wav2Vec2 checkpoint 结合用于音频解码。
Hugging Face 发布教程,介绍如何用 Amazon SageMaker 和 Hugging Face Inference Toolkit 部署 EleutherAI 的 GPT-J 6B 进行实时推理,可在 NVIDIA T4 GPU 实例(约 500 美元/月)上运行。
Hugging Face 的 AutoNLP 与 Explosion 的标注工具 Prodigy 可组合成主动学习流水线:在 BBC News 分类数据集上,AutoNLP 训练 15 个多分类模型,最佳模型准确率达 98.67%,定价低至每模型 $10。
Hugging Face 收购机器学习初创公司 Gradio,Gradio 联合创始人撰文宣布这一消息。Gradio 于 2019 年由斯坦福博士生与三位室友发布,用于让机器学习工程师快速搭建并分享模型 demo,至今已有超过 30 万个 demo 用它构建。作者表示加入 Hugging Face 后将继续发展 Gradio,让任何有浏览器和网络连接的人都能使用机器学习模型。
推荐理由:Gradio 创始人以当事方身份讲述被收购的经过,读者可了解这款开源库从 2019 年起步到 30 万 demo 的路径。
Hugging Face 将 Google DeepMind 的 Perceiver IO 加入 Transformers 库,这是首个可处理文本、图像、音频、视频、点云等多种模态及其组合的 Transformer 类模型。
推荐理由:Hugging Face 官方详解 Perceiver IO 的接入方式,读者可据此了解这套架构如何处理文本、图像、音频等多模态输入。
Hugging Face 发布教程,介绍如何从零训练 GPT-2 large(1.5B 参数)代码生成模型 CodeParrot,用于自动补全 Python 代码。
Hugging Face 发布首个自定义深度强化学习环境 Snowball Fight 1vs1,玩家可在 Hugging Face Spaces 上在线与深度强化学习智能体对战扔雪球。该环境基于 Unity ML-Agents 构建并已开源托管于 Hugging Face Hub,后续还将推出 2vs2 版本,用 MA-POCA 算法训练智能体团队协作。
Hugging Face 与 Graphcore 合作推出 Optimum Graphcore,让 Transformer 模型可在 Graphcore IPU 上加速,BERT 成为首个 IPU 优化模型。