OpenAI 用 GPT-4 解释语言模型神经元并公开 GPT-2 数据集
OpenAI 使用 GPT-4 自动为大型语言模型中的神经元行为撰写解释,并对这些解释打分。团队公开了覆盖 GPT-2 每个神经元的解释与评分数据集,并说明这些解释并不完美。
推荐理由:OpenAI 用 GPT-4 自动解释并打分 GPT-2 神经元行为,公开了逐神经元解释数据集,可供研究模型可解释性方法。
OpenAI 使用 GPT-4 自动为大型语言模型中的神经元行为撰写解释,并对这些解释打分。团队公开了覆盖 GPT-2 每个神经元的解释与评分数据集,并说明这些解释并不完美。
推荐理由:OpenAI 用 GPT-4 自动解释并打分 GPT-2 神经元行为,公开了逐神经元解释数据集,可供研究模型可解释性方法。
Hugging Face 发布端到端教程,演示如何用 🤗 Transformers、TensorFlow 和 TPU 从零训练一个 RoBERTa base 模型,涵盖训练 tokenizer、处理 WikiText v1 数据集、生成 TFRecord 分片并上传至 Google Cloud Storage,以及最终模型训练与上传的完整流程。
Databricks 向 Hugging Face 代码库提交首个官方贡献,新增 Datasets 的 from_spark 函数,可直接将 Apache Spark dataframe 转为 Hugging Face Dataset。以 16GB 数据集为例,处理时间从 22 分钟降至 12 分钟,提速超 40%。Databricks 还计划为 Spark 加入流式支持以进一步加快数据集加载。
Hugging Face 博客发布教程,演示如何用 Transformers 库(版本 >= 4.27.2)完成图分类任务,目前该库中唯一的图 Transformer 模型是微软的 Graphormer。
Hugging Face 与开源联邦学习框架 Substra 合作创建了一个演示 Space,让用户体验数据孤岛下联邦学习的训练效果。联邦学习让数据留在本地、仅传输模型权重,用多源数据训练的模型在验证集上几乎总是优于单一数据源模型。Substra 已在乳腺癌研究等真实场景中落地,MELLODDY 项目中 10 家生物制药公司借此共享了全球最大的小分子活性数据集。
Hugging Face 发布 StackLLaMA 模型并公开完整 RLHF 训练流程,涵盖监督微调、奖励建模和基于 PPO 的强化学习三个阶段,全部代码集成在 TRL 库中。
推荐理由:完整走通 SFT、奖励模型与 PPO 三段 RLHF 流程,并给出 8bit 加 LoRA 在单卡上复现的配置与踩坑记录。
Hugging Face 发布教程,演示如何借助 Flower 框架在多个客户端上联邦微调预训练 Transformer 模型 distilBERT,用于 IMDB 影评情感分类。
Hugging Face 正式发布 trl 与 peft 的集成,让大语言模型的 RLHF 微调更易上手。方案结合 8-bit 矩阵乘法、低秩适配器和 peft 的 disable_adapters 机制,用同一份模型同时充当参考模型与活动模型,从而省去第二份模型副本。
推荐理由:原文给出在 24GB 消费级 GPU 上完成 20B 模型 RLHF 微调的具体组合方案,可迁移到其他显存受限的训练场景。
2023 年土耳其地震后,志愿者在 Hugging Face 上协作搭建救灾应用 afetharita,用 easyocr 做 OCR、基于 bert-base-turkish-cased 微调 token 分类模型提取地址,并通过 Inference API 部署。
Witty Works 借助 Hugging Face Expert Acceleration Program,将写作助手的非包容性词汇检测从 spaCy 迁移到 Sentence Transformers 架构,并用 SetFit 实现少样本微调,每个词仅需 15-20 条标注句子。
红队测试通过构造自然语言提示词诱导 LLM 生成有害内容,从而暴露模型漏洞,与人类难以理解的对抗攻击不同。GPT3 早期版本曾表现出性别歧视与针对穆斯林的偏见,微软 Tay 和 Bing 的 Sydney 是缺乏红队评估导致灾难性后果的真实案例。红队可由人工或另一个 LM 执行,角色扮演攻击和用代码作答能绕过经 RLHF 或 SFT 对齐的模型,该领域仍处早期,需要多机构协作共享数据集与最佳实践。
Hugging Face 发布 PEFT 库,提供 LoRA、Prefix Tuning、Prompt Tuning、P-Tuning 等参数高效微调方法,并与 Transformers 和 Accelerate 集成。
推荐理由:官方给出 PEFT 库支持的微调方法与消费级硬件上的显存占用示例,便于判断低成本微调大模型的可行路径。
Hugging Face 与 Microsoft ONNX Runtime 团队合作,在 Optimum 库中集成 ONNX Runtime 训练后端,为热门 Hugging Face 模型带来 35% 以上的训练提速。
Hugging Face 博客梳理了让对话智能体有用的关键技术,包括指令微调(IFT)、监督微调(SFT)、思维链(CoT)提示和基于人类反馈的强化学习(RLHF),并对比了 LaMDA、BlenderBot 3、Sparrow、ChatGPT/InstructGPT 和 Anthropic Assistant 在访问方式、训练数据、模型架构与评测方向上的差异。
Hugging Face 博客系列教程第二部分介绍如何用 ChatGPT 辅助农场游戏设计,作者让它以专业游戏设计师身份给出作物多样性、成长系统等建议,并自行取舍实现。文章同时解释语言模型与 Transformer 原理,指出 ChatGPT 常言之凿凿却出错,建议将其用作头脑风暴和加速工具而非开发流程的替代品。
Hugging Face 发布图机器学习入门博客,介绍图的基本概念、表示方法及学习范式,涵盖从预神经网络方法到图神经网络(GNN),并延伸至面向图的 Transformer。文章还梳理了图级别、节点级别、边级别和子图级别的典型任务,如分子生成、Alphafold 的原子坐标预测、药物副作用预测与推荐系统中的缺失边预测。
Hugging Face 展示了如何在 AWS 的 Intel Sapphire Rapids(第四代 Xeon)裸金属实例上分布式训练 PyTorch Transformers,借助 Intel oneAPI CCL 和 IPEX 库,无需改动一行代码即可启用 AMX 指令加速矩阵乘法。
Hugging Face 发布 Ethics and Society Newsletter 第二期,讨论机器学习中的偏见问题。文章指出偏见是复杂的社会技术问题,单一技术手段难以有效解决,并介绍了团队在数据集与模型等 ML 开发各环节开发的偏见分析工具。
Hugging Face 用 Optimum Habana 在 BERT 预训练、Stable Diffusion 推理和 T5-3B 微调上对比了 Habana Gaudi2、初代 Gaudi 与 Nvidia A100 80GB,Gaudi2 训练和推理速度约为 A100 80GB 的两倍。
Hugging Face 发布《Deep Learning with Proteins》博文,面向想入门机器学习的生物学家和想入门生物学的机器学习研究者。
Hugging Face 博客发布教程,演示如何用 Concrete-ML 库在完全同态加密(FHE)环境下构建情感分析模型,无需密码学背景即可上手。方案先用 BERT 提取文本隐藏表示(hidden size 为 768),再交给 XGBoost 分类,并通过客户端/服务器协议部署到云端,最终在 Hugging Face Spaces 上提供完整演示。
Hugging Face 将对比搜索(Contrastive Search)解码方法集成进 transformers,PyTorch 和 TensorFlow 均可用,需安装 transformers==4.24.0。
Hugging Face 推出 MTEB(Massive Text Embedding Benchmark),覆盖 8 类任务、56 个数据集、最多 112 种语言,排行榜已汇总超 2000 条结果。该基准通过 pip install mteb 即可对任意嵌入模型评测,并将结果提交至公开排行榜,方便按速度、性能与嵌入维度筛选模型。
Hugging Face 宣布用户可直接在 Hub 的仓库设置中为模型或数据集生成 DOI,其他人在模型或数据集页面点击“Cite this model/dataset”即可引用。该功能与 DataCite 合作实现,DOI 绑定对象的 URL、版本、创建日期等元数据,新版本发布时 DOI 可更新,旧版本 DOI 随之失效。带 DOI 的数据集和模型将永久保留,仅能通过向官方支持提交请求后删除。
Hugging Face 与 Intel Labs、UKP Lab 合作推出 SetFit,一个面向 Sentence Transformers 的高效少样本微调框架。
推荐理由:Hugging Face 与 Intel Labs 等合作方发布少样本微调框架 SetFit,读者可了解其免提示词的两阶段训练思路与成本对比。
Hugging Face 发布教程,教你用 transformers 库的 Trainer 和自定义 Data Collator,从零训练一个离线 Decision Transformer,让 HalfCheetah 学会奔跑。
Hugging Face 发布教程,讲解如何在 NVIDIA GPU 上用 Megatron-LM 训练 GPT2 语言模型,并转换到 Transformers 使用。
Hugging Face 发布教程,演示如何在 AWS DL1 实例上借助 Habana Gaudi 从零预训练 BERT-base,使用 Transformers、Optimum Habana 和 Datasets 库,以 masked-language modeling 为预训练任务。
Hugging Face 发布 Sentence Transformers 训练与微调教程,讲解如何从零构建模型或从 Hub 加载已有模型微调,并以 distilroberta-base 加池化层为例说明其两层架构。
Hugging Face 博客介绍动态对抗数据收集(DADC):让用户用各种手写方式欺骗模型,再把被标记的对抗样本加入数据集反复训练。文章以 MNIST 手写数字识别为例,模型训练 20 个 epoch 后在测试集上达到 89% 准确率,并借助 🤗 Spaces 搭建交互与标记流程。
Hugging Face 披露了 176B 参数多语言模型 BLOOM 的训练技术细节,该模型基于 Megatron-DeepSpeed 框架、采用 3D 并行技术,在 384 块 80GB A100 GPU 上训练了约 3.5 个月。训练数据为 59 种语言、350B token,模型架构类似 GPT3 并做了改进,词表规模 250,680。
Hugging Face 发布 BLOOM,一个 176B 参数的多语言大语言模型,可生成 46 种自然语言和 13 种编程语言的文本,由 70 多个国家 1000 多名研究者协作完成,在法国 Jean Zay 超算上训练 117 天。
推荐理由:BLOOM 以 176B 参数覆盖 46 种自然语言,并公开训练中间检查点,可据此了解开放大模型在透明度上的做法。
Hugging Face 展示了用 Accelerate 库调用 DeepSpeed ZeRO 加速大模型训练的方法,无需改动代码即可启用 ZeRO Stage-2。
OpenAI 提出 Video PreTraining(VPT),在大量无标注的人类 Minecraft 游戏视频上训练神经网络,仅使用少量标注的承包商数据。经微调后,模型能学会制作钻石工具,这一任务通常需要熟练人类花费 20 分钟以上、约 24000 次操作。模型使用键盘按键和鼠标移动的原生人类接口,具有较强通用性,是迈向通用计算机操作智能体的一步。
推荐理由:OpenAI 用大量无标注人类游戏视频预训练网络,展示从少量标注数据到通用计算机操作智能体的路径。
OpenAI 训练了批评写作模型,用于描述摘要中的缺陷。人类评估者在看到模型批评后,发现摘要缺陷的频率明显提高。研究还显示,模型越大自我批评能力越强,规模对批评写作的提升大于对摘要写作的提升,这为用 AI 系统辅助人类监督 AI 系统提供了可能。
推荐理由:OpenAI 用自训练模型写批评来辅助人类发现摘要缺陷,并给出模型规模与批评能力的关系。
大型神经网络是近期许多 AI 进展的核心,但训练它们是一项艰巨的工程与研究挑战,需要协调一整个 GPU 集群来完成单次同步计算。
Hugging Face 博客发布《The Annotated Diffusion Model》,基于 Ho 等人 2020 年的 DDPM 论文,用 PyTorch 逐步实现扩散模型。
推荐理由:从 DDPM 论文出发逐步用 PyTorch 复现扩散模型,读者可据此理解前向加噪与反向去噪的完整训练流程。
微软提出 TAPEX,通过让 BART 学习充当神经 SQL 执行器,在合成 SQL 查询语料上完成表格预训练,无需真实数据。该方法在 WikiSQL、TabFact、SQA 和 WikiTableQuestions 四个基准上均取得 SOTA,其中 WikiSQL 准确率达 89.6%,较此前最佳提升 2.3%。
Sempre Health 借助 Hugging Face 的 Expert Acceleration Program 搭建了自动分类并回复患者短信的 NLP 流水线,上线数周后近 20% 的入站消息由该系统自动处理,此前这些消息都会生成工单。该团队原本的规则系统只能覆盖约 80% 的短信,Hugging Face 团队在标签质量和模型选型上提供了指导。
Hugging Face 研究科学家 Sasha Luccioni 在访谈中介绍了她在 Big Science 项目中主持碳足迹工作组的工作,研究范围不止于统计 CO2 排放,还涵盖制造成本乃至一封邮件产生多少 CO2 等维度。