Hugging Face AutoTrain 新增图像分类任务,支持零代码训练模型
Hugging Face AutoTrain 新增图像分类任务,用户无需编写代码即可上传数据训练模型。AutoTrain 会自动尝试多个模型架构并筛选最优结果,示例中最佳模型达到 84% 准确率,使用 5 个候选模型且图片少于 500 张时可免费训练。
Hugging Face AutoTrain 新增图像分类任务,用户无需编写代码即可上传数据训练模型。AutoTrain 会自动尝试多个模型架构并筛选最优结果,示例中最佳模型达到 84% 准确率,使用 5 个候选模型且图片少于 500 张时可免费训练。
Hugging Face 介绍 Accelerate 如何借助 PyTorch 特性在内存不足的消费级硬件上加载并推理超大模型,示例可在免费 Colab 实例上运行 OPT-6.7B。
推荐理由:以 OPT-6.7B 到 BLOOM 为例,讲清 Accelerate 如何用 meta device、device map 和分片加载把超大模型跑在普通硬件上。
Hugging Face 与 Intel Labs、UKP Lab 合作推出 SetFit,一个面向 Sentence Transformers 的高效少样本微调框架。
推荐理由:Hugging Face 与 Intel Labs 等合作方发布少样本微调框架 SetFit,读者可了解其免提示词的两阶段训练思路与成本对比。
Hugging Face 发布首期《伦理与社会》通讯,计划在每年春分、秋分、夏至、冬至各出一期,由公司内部跨部门开放小组“Ethics and Society regulars”编写。
Hugging Face 发布教程,介绍如何用 DeepSpeed-Inference、Accelerate 和 DeepSpeed ZeRO 为 176B 参数的 BLOOM 模型做快速推理。
推荐理由:文章给出 BLOOM 176B 在多种并行与量化方案下的实测吞吐与显存占用,可据此选择部署路径。
Hugging Face 发布 diffusers 0.3,为扩散模型工具箱新增图生图、文本反转、实验性 inpainting 等 pipeline。优化后 Stable Diffusion 显存占用降至 3.2GB,代价是约 10% 的速度损失,并可通过 mps 在 M1/M2 设备上推理。该版本还提供实验性 ONNX 导出与 pipeline、首版文档,社区已分享超过 200 个文本反转概念。
推荐理由:官方一次性列出 diffusers 0.3 的图生图、文本反转、小显存优化与 Mac 支持,便于判断扩散模型工具链的可用边界。
Hugging Face 发布教程,教你用 transformers 库的 Trainer 和自定义 Data Collator,从零训练一个离线 Decision Transformer,让 HalfCheetah 学会奔跑。
Hugging Face 发布教程,讲解如何在 NVIDIA GPU 上用 Megatron-LM 训练 GPT2 语言模型,并转换到 Transformers 使用。
RAIL Initiative 推出 OpenRAIL 系列 AI 专用许可证,在允许免版税访问、下游使用与再分发的同时,嵌入针对特定关键场景的使用限制条款。该框架由 Hugging Face 支持,灵感来自 BigScience、开源与 Creative Commons,旨在让许可方在开放模型时保留对有害用途的约束与执行能力。
Hugging Face Spaces 可通过 3Dmol.js 与 Gradio 的 HTML block 集成,在浏览器中直接可视化蛋白质结构。用户可输入 4 位 PDB 代码或上传 PDB 文件,应用会从 RCSB Protein Databank 获取结构并渲染。文中还提到可用 Molecule3D Gradio 自定义组件简化这一流程。
Hugging Face 发布教程,介绍如何用 Diffusers 库运行 Stable Diffusion,并解释其潜空间扩散模型的工作原理。
推荐理由:Hugging Face 官方给出 Stable Diffusion 在 Diffusers 中的完整用法与原理拆解,可据此理解潜空间扩散的组件分工。
Hugging Face 发布教程,演示如何在 AWS DL1 实例上借助 Habana Gaudi 从零预训练 BERT-base,使用 Transformers、Optimum Habana 和 Datasets 库,以 masked-language modeling 为预训练任务。
Hugging Face 展示了如何将 ViT B/16 模型部署到 Google Cloud 的 Vertex AI 平台,用远少于 Kubernetes 方案的代码量获得同等扩展能力。
Hugging Face 与 Graphcore 联合发布 Optimum Graphcore 库,提供预训练 ViT 模型检查点和配置文件,可在 IPU 上直接微调。博文以 ImageNet-21k 预训练的 ViT 为例,演示在 ChestX-ray14 数据集上的完整微调流程,并附有 notebook。IPU 的 MIMD 架构与流水线并行可提升训练效率。
Hugging Face 与 BigScience 将 LLM.int8() 8-bit 量化集成进 transformers 和 accelerate,使 BLOOM-176B 等大模型可在更少 GPU 上运行且性能不降。
推荐理由:Hugging Face 与 BigScience 作者复盘 LLM.int8() 接入 transformers 的工程细节,可看到大模型量化落地的真实难点。
Hugging Face 发布新库 Skops,支持将 scikit-learn 模型托管到 Hugging Face Hub,并生成模型卡进行文档记录与协作。Skops 后端目前使用 joblib 加载模型,可自动填充库名、任务标识(如 tabular-classification)及推理 widget 所需元数据,并支持通过 add_metrics、add_plot 添加评估指标与图表。
Hugging Face 阐述了其 transformers 库在 TensorFlow 上的设计理念:所有 TensorFlow 模型都是 Keras Model 对象,所有层都是 Keras Layer 对象,用户可直接调用 fit()、compile() 和 predict()。库通过 TFAutoModel 等类一行代码加载预训练模型,并配合 AutoTokenizer 完成匹配的预处理。
Hugging Face 发布教程,讲解如何用 Docker 和 Kubernetes 将上一篇文章中本地部署的 Vision Transformer(ViT)模型扩展为可服务多用户的线上部署。
Hugging Face 发布 Sentence Transformers 训练与微调教程,讲解如何从零构建模型或从 Hub 加载已有模型微调,并以 distilroberta-base 加池化层为例说明其两层架构。
Hugging Face 深度强化学习课程第 8 单元讲解 Proximal Policy Optimization (PPO),通过在当前策略与旧策略的概率比上做裁剪(范围 [1−ϵ,1+ϵ])来限制每轮策略更新幅度,避免更新过大导致训练不稳定。课程随后用 PyTorch 从零实现 PPO,并在 CartPole-v1 和 LunarLander-v2 上验证。
Hugging Face 发布 Private Hub(PH),为机器学习全生命周期提供统一工具,支持以安全合规的方式加速从研究到生产的各环节。PH 基于拥有 60K+ 模型、6K 数据集和 6K 演示应用的 Hugging Face Hub,通过 Git 仓库、组织账户和权限管理实现团队内部模型、数据集与 Spaces 的共享协作。
Hugging Face 博客介绍了 Nyströmformer,一种用 Nyström 方法将标准自注意力 O(n²) 复杂度近似为 O(n) 的高效 Transformer 模型。
Hugging Face 于 2022 年 6 月下旬向白宫 OSTP 和 NSF 提交了对 NAIRR 中期报告的回应,建议任命技术与伦理专家担任顾问、制定模型与数据文档标准(如 Model Cards)、为跨学科非技术专家提供低代码或无代码工具(如 AutoTrain),并投资 Responsible AI Licenses 以应对资源滥用。
Hugging Face 为 🤗 Datasets 补充了音频和图像数据集的文档,Quickstart 新增端到端加载与处理示例,并引入 to_tf_dataset 函数,可将数据集转换为 tf.data.Dataset 供 TensorFlow 或 Keras 训练。
Hugging Face 的 transformers 库在 TensorFlow 下现可用 XLA 编译文本生成,速度最高提升 100 倍,甚至快于 PyTorch。该功能需 transformers >= 4.21.0,示例基于 GPT-2 展示采样、贪心解码与 Beam Search 等生成方式。
Hugging Face 与外部贡献者为 Transformers 加入了 Vision Transformer、Masked Autoencoders、RegNet、ConvNeXt 等 TensorFlow 视觉模型,并演示如何用 TensorFlow Serving 在本地部署 ViT 图像分类模型,将其暴露为 REST 或 gRPC 端点。
Hugging Face 深度强化学习课程第 7 单元讲解 Advantage Actor Critic (A2C),一种结合基于策略与基于价值方法的混合架构,通过 Critic 评估动作价值来降低 Reinforce 中蒙特卡洛采样带来的高方差,从而稳定并加速训练。课程使用 Stable-Baselines3 在 PyBullet 机器人环境中训练双足步行者和蜘蛛两个智能体行走。
Hugging Face 博客介绍动态对抗数据收集(DADC):让用户用各种手写方式欺骗模型,再把被标记的对抗样本加入数据集反复训练。文章以 MNIST 手写数字识别为例,模型训练 20 个 epoch 后在测试集上达到 89% 准确率,并借助 🤗 Spaces 搭建交互与标记流程。
Hugging Face 披露了 176B 参数多语言模型 BLOOM 的训练技术细节,该模型基于 Megatron-DeepSpeed 框架、采用 3D 并行技术,在 384 块 80GB A100 GPU 上训练了约 3.5 个月。训练数据为 59 种语言、350B token,模型架构类似 GPT3 并做了改进,词表规模 250,680。
作者用 Sentence Transformers 的语义搜索功能搭建了一个歌单生成器:将歌词按段落切分并嵌入,再对输入提示词做语义搜索匹配歌曲,并封装成基于 Gradio Blocks 的多步应用托管在 Hugging Face Spaces。
Hugging Face 发布 BLOOM,一个 176B 参数的多语言大语言模型,可生成 46 种自然语言和 13 种编程语言的文本,由 70 多个国家 1000 多名研究者协作完成,在法国 Jean Zay 超算上训练 117 天。
推荐理由:BLOOM 以 176B 参数覆盖 46 种自然语言,并公开训练中间检查点,可据此了解开放大模型在透明度上的做法。
Hugging Face 发布 Twitter 情感分析入门指南,面向开发者和非开发者分别给出方案。开发者可用 Tweepy 抓取推文并通过 Inference API 几行代码完成情感分类,非开发者则可借助无代码工具 Zapier 将推文分析结果写入 Google Sheets。
Hugging Face 深度强化学习课程第 5 单元讲解策略梯度方法,并从头用 PyTorch 实现首个基于策略的算法 Reinforce,随后在 CartPole-v1、PixelCopter 和 Pong 上测试其鲁棒性。策略梯度直接优化策略、无需估计价值函数,可学习随机策略并省去手工的探索/利用权衡,更适合高维和连续动作空间,但易收敛到局部最优、训练更慢且方差较高。
Hugging Face 发文介绍如何以 Sentence Transformers(ST)为例从零上手一个新 ML 库并完成首个自驱项目。ST 可将句子、段落和图像转为嵌入向量,并用 util.cos_sim 计算余弦相似度,支持语义搜索、聚类和模型蒸馏等应用。该库在 GitHub 已获近 8,000 stars,超过 3,000 个项目和包依赖它。
Hugging Face 推出 Evaluation on the Hub,由 AutoTrain 驱动,用户无需写代码即可在 Hub 上用任意数据集和指标评测模型。评测结果会以 PR 形式写入模型卡的元数据,并汇总到数据集排行榜,官方已用该工具评测了数百个模型。工具已嵌入现有生态,评测提交界面和排行榜都是 Hugging Face Spaces,用户可从数据集页面发起评测。
推荐理由:官方说明可在 Hub 上零代码评测任意模型与数据集,并给出结果写入模型卡与排行榜的完整流程。
Hugging Face 展示了用 Accelerate 库调用 DeepSpeed ZeRO 加速大模型训练的方法,无需改动代码即可启用 ZeRO Stage-2。
Hugging Face 发布 Embeddings 入门教程,演示如何用开源库 Sentence Transformers 和 Inference API 构建一个 FAQ 语义搜索示例。
Hugging Face 博客介绍了三种将 Transformers 模型转为 ONNX 的方式:底层 torch.onnx、中层 transformers.onnx 和高级 Optimum。
Intel 正式加入 Hugging Face 硬件合作伙伴计划,双方将基于开源库 Optimum 合作构建面向 Transformer 的硬件加速方案,覆盖训练、微调和推理。
Hugging Face 发布“机器学习负责人洞察”系列第三期金融版,邀请来自 U.S. Bank、Royal Bank of Canada、Moody's Analytics 及前 Bloomberg AI 研究科学家的专家分享观点。