Hugging Face 与 Google Cloud 达成战略合作,共建开放 AI 生态
Hugging Face 宣布与 Google Cloud 建立战略合作,围绕开放科学、开源、云与硬件展开协作,帮助企业在 Hugging Face 开放模型与 Google Cloud 基础设施上构建自己的 AI。
Hugging Face 宣布与 Google Cloud 建立战略合作,围绕开放科学、开源、云与硬件展开协作,帮助企业在 Hugging Face 开放模型与 Google Cloud 基础设施上构建自己的 AI。
Hugging Face 在 LangChain 的 ReAct 实现中评测了 Llama2-70b-chat、Mixtral-8x7B-Instruct-v0.1、OpenHermes-2.5-Mistral-7B、Zephyr-7b-beta、SOLAR-10.7B-Instruct-v1.0 等开源模型作为通用推理智能体的表现,并与 GPT-3.5、GPT-4 对比。
推荐理由:用同一套 ReAct 基准横向对比多个开源模型与 GPT-3.5、GPT-4,并给出 LangChain 搭建代码,可据此判断开源模型做智能体的可用性。
IBM Research 与 Hugging Face 团队合作,在 Transformers 库中发布了轻量级时间序列建模方法 PatchTSMixer。该模型基于 MLP-Mixer 架构,支持跨 patch、通道和隐藏特征的轻量混合,可预训练后用于预测、分类和回归任务。
Hugging Face 发布教程,介绍如何用 🤗 Transformers 微调 facebook/w2v-bert-2.0 完成低资源 ASR。Wav2Vec2-BERT 是 580M 参数音频模型,预训练于 4.5M 小时、覆盖 143 种语言的无标注音频。
Hugging Face 在 7B 模型上实证评测了 DPO、IPO、KTO 三种无需强化学习的 LLM 偏好对齐方法,扫描 β 等关键超参数并用 MT-Bench 评估。
Hugging Face 发布经 Olive 优化的 SD Turbo 与 SDXL Turbo 模型,在 NVIDIA GPU 上通过 ONNX Runtime 的 CUDA 和 TensorRT 执行提供程序加速推理,吞吐量相比 PyTorch 最高提升 229%(SDXL Turbo)和 120%(SD Turbo)。
Hugging Face 发布教程,讲解如何把 ComfyUI 工作流转成 Gradio 应用并部署到 Spaces 的 ZeroGPU 上免费运行。
推荐理由:完整走通从 ComfyUI 工作流导出 Python、包成 Gradio 应用到 ZeroGPU 免费部署的链路,可迁移到任意工作流。
Vectara 基于 Hugging Face 开源的排行榜模板,发布了新的 HHEM 幻觉排行榜,用于评估 GPT-4、Gemini、Llama 2 等 LLM 在文档摘要中的幻觉频率。该排行榜通过 requests 和 results 两个数据集管理模型评测请求与结果,并支持动态更新和社区提交新模型。Vectara 还公开了定制后的后端源码,可部署为 Hugging Face Space。
Hugging Face 博客介绍社区工具 Unsloth,与 transformers、PEFT、TRL 完全兼容,可将 LLM 微调速度提升约 2 倍、显存占用最多降低 74%,且相对标准 QLoRA 精度损失为 0%。
推荐理由:原文给出 Unsloth 与 TRL 的完整接入代码和 59 次基准数据,读者可据此判断微调提速与显存节省幅度。
Hugging Face 发布 aMUSEd,这是 Google MUSE 的开源复现,采用 Masked Image Model 而非主流潜在扩散方法,以研究预览形式在宽松许可下开放。
Hugging Face 发布新的 diffusers 训练脚本,把 Pivotal Tuning 与 Prodigy 优化器结合,用于 SDXL 的 Dreambooth LoRA 微调。
推荐理由:Hugging Face 官方把 Pivotal Tuning 与 Prodigy 优化器整合进 diffusers 训练脚本,读者可据此复现 SDXL Dreambooth LoRA 微调流程。
Hugging Face 博客介绍如何用投机解码(Transformers 中的 assisted generation)将 Whisper 推理速度提升约 2 倍,且数学上保证输出与单独使用主模型完全一致。
推荐理由:以 Whisper 为例给出投机解码的完整实现与基准数据,可迁移到其他自回归模型的推理加速。
Hugging Face 发布 2023 年开源 LLM 回顾,梳理了 BLOOM、OPT、GLM-130B 等预训练模型家族。BLOOM 最大版本为 176B 参数,基于 350B token 的 46 种人类语言和 13 种编程语言数据训练;Meta 的 OPT 最大版本为 175B 参数,训练数据 180B token。
Hugging Face 发布长文《Mixture of Experts Explained》,以 Mixtral 8x7B 发布为背景,讲解 MoE 的构成、训练与推理取舍。
推荐理由:从 MoE 的稀疏路由、负载均衡到专家并行与部署取舍,系统梳理了这类架构的原理与工程代价。
Mistral 发布 Mixtral 8x7B,采用 Mixture of Experts 架构,8 个专家模型每个时间步激活 2 个,总参数量约 45B,支持 32k token 上下文,在多数基准上超过 Llama 2 70B 并追平 GPT-3.5,以 Apache 2.0 许可开放。
推荐理由:文章给出 Mixtral 8x7B 的架构说明、基准对比与 Hugging Face 全套集成方式,便于判断开源 MoE 模型的可用性。
Hugging Face 与 Intel Labs 推出 SetFitABSA,一个用于少样本训练领域特定方面级情感分析(ABSA)模型的框架,在少样本场景下表现优于 Llama2 和 T5 等生成式模型。
Hugging Face 与 AMD 宣布合作进展,Transformers 模型和任务现可在 AMD Instinct GPU 上无需修改代码直接运行,并已支持 Flash Attention v2、Paged Attention、DeepSpeed、GPTQ 等加速与量化方案。
推荐理由:Hugging Face 与 AMD 公布开箱即用支持进展,读者可了解在 AMD Instinct 上运行 Transformers 与 TGI 的实际路径与性能对比。
Hugging Face 在 Inference API 中实现 LoRA 动态加载,让基础模型保持热启动、按请求即时加载和卸载适配器,把冷启动时间从 25 秒降到 3 秒,用户请求响应时间从 35 秒降到 13 秒。
Hugging Face 发布 Optimum-NVIDIA 推理库,只需把 transformers 的 pipeline 导入改成 optimum.nvidia 一行代码,即可在 NVIDIA 平台获得最高 28 倍吞吐提升和 1200 tokens/秒。
推荐理由:官方给出单行代码替换即可提速的量化数据与 FP8 支持范围,便于判断迁移成本。
Open LLM Leaderboard 新增 DROP 基准后,绝大多数模型 f1-score 低于 10 分。Hugging Face 排查发现,归一化步骤会忽略后接非空格空白符的数字答案,且以 . 作为停止词会截断浮点答案、让长回答的高质量模型 f1 更低。改用 \n 作为停止词重新计算后,分数与模型整体表现的相关性明显改善。
Hugging Face 发布 Latent Consistency LoRA(LCM LoRA),通过训练少量 LoRA 适配层而非蒸馏整个模型,让 SDXL 和 Stable Diffusion 从原本 25 到 50 步降到 4 到 8 步生成图像。
推荐理由:官方给出 LCM LoRA 的推理代码、多硬件速度对比和训练脚本,读者可据此判断少步数生成的可用性。
Explosion 发布 Prodigy-HF 插件,让 Prodigy 标注工具直接对接 Hugging Face 生态。
Hugging Face 的 optimum-neuron 现已支持在 AWS Inferentia2 上部署 LLM 进行文本生成,并以 Llama 2 为例演示。
一项对比实验用 LoRA 微调 RoBERTa-large(355M)、Llama-2-7b 和 Mistral-7B-v0.1(7.3B)三个模型,在灾难推文分类任务上评测性能,统一设置 MAX_LEN=512 以保证公平比较。
Hugging Face 为 Enterprise Hub 推出 Storage Regions,让组织决定模型和数据集的存储位置,目前支持 US 和 EU,亚太地区即将上线。该功能用于满足监管与法律合规(如欧盟 GDPR)需求,并提升性能:欧洲用户将仓库存于 EU 区域时,上传和下载速度约提升 4-5 倍。非默认位置的仓库会直接显示 Region 标签。
Hugging Face 发布博客,介绍如何基于自家 GitHub 组织公开仓库代码微调出代码助手 HugCoder,让开发者可参照搭建自己的个人 copilot。
推荐理由:完整给出从数据采集到 QLoRA 与全量微调的成本对比,可迁移到自有代码库搭建补全助手。
Hugging Face datasets 库与 Renumics Spotlight 集成,只需一行代码即可对数据集进行交互式可视化。Spotlight 直接读取 datasets 的 Arrow 表结构,无需复制或预处理数据,并支持利用模型预测和嵌入向量定位关键数据簇与模型失败模式。用户可通过 GUI 或 Python API 自定义布局,用于 EDA、模型调试和监控。
Hugging Face 复现了 OpenAI 2019 年的 RLHF 代码库 openai/lm-human-preferences,在情感与描述性等风格任务上匹配了其学习曲线。
Hugging Face 发布教程,介绍如何通过 Text Embeddings Inference(TEI)将开源嵌入模型部署到 Hugging Face Inference Endpoints。
Hugging Face 在 A100 40GB 上实测了 SDXL 的多项推理优化,未优化管线需 28GB 显存、72.2 秒,改用 fp16 后降至 21.7GB、14.8 秒,叠加 SDPA 后进一步降到 11.4 秒。
推荐理由:原文给出 SDXL 各项优化前后的显存与延迟实测数据,读者可据此选择适合自己硬件的组合方案。
Hugging Face 发布 @gradio/lite,一个借助 Pyodide 让 Gradio 应用完全在浏览器中运行的 JavaScript 库,无需服务器端基础设施。
推荐理由:官方给出在浏览器内运行 Gradio 的完整用法与限制,可据此判断无服务器部署的可行边界。
Hugging Face 上已有超过 13 万个支持 ONNX 的模型可借助 ONNX Runtime 加速,覆盖 90 多种模型架构,包括 BERT、GPT2、T5、Whisper、Stable-Diffusion 等。以 whisper-tiny 为例,使用 ONNX Runtime 后单次推理平均延迟相比 PyTorch 最高提升 74.30%。
Hugging Face tokenizers 新增 chat_template 属性,用 Jinja 模板保存模型训练时使用的对话格式,避免因格式不一致造成的静默性能下降。
推荐理由:Hugging Face 把聊天格式从 transformers 硬编码搬到 tokenizer 属性,读者可据此理解格式错配为何会静默拉低模型表现。
Hugging Face Diffusers 现已支持在 Cloud TPU 上通过 JAX 运行 Stable Diffusion XL 推理。该方案借助 JAX jit 编译与 XLA pmap 并行,在多个 TPU v5e-4 实例上约 4 秒可生成四张 1024×1024 图像,实际生成时间约 2.3 秒。TPU v5e 成本不到 TPU v4 的一半。
Hugging Face 发布教程,介绍如何通过 Inference API 将 AI Comic Factory 复制并部署到自己的私有 Space,以避免官方 Space 的长时间等待。
Hugging Face 在 trl 库中集成 DDPOTrainer,可用 DDPO(Denoising Diffusion Policy Optimization)对 Stable Diffusion 做强化学习微调。
Hugging Face 发布 Ethics and Society Newsletter #5,回顾 2023 夏季在 AI 伦理与政策方面的工作。CEO Clem 向美国国会作证并在参议院 AI Insight Forum 发言,公司还就 E.U. AI Act、NTIA AI Accountability 提交意见。
Hugging Face 发布教程,展示非工程师如何零代码训练 LLaMA 2 聊天机器人。流程分三步:在 Spaces 部署 AutoTrain 与 ChatUI 模板,用 Alpaca 指令数据集微调 Meta Llama 2 7b,再部署为可分享的聊天应用。训练 7b 模型建议选用 A10G Large GPU,AutoTrain 支持 FP16、Int4/8 量化与 PEFT 等设置。
Mistral AI 发布 7.3B 参数语言模型 Mistral 7B,采用 Apache 2.0 许可,可无限制使用,并提供了参考实现、vLLM 推理服务器、Skypilot 及 HuggingFace 等使用方式。
推荐理由:Mistral 7B 以 7.3B 参数在多项基准上超过 Llama 2 13B,并给出 Apache 2.0 许可与本地、云端部署路径。
Hugging Face 对 Llama 2 在 Amazon SageMaker 上的 60 种部署配置进行了基准测试,覆盖 7B、13B、70B 三种规模、1/5/10/20 并发请求及 GPTQ 4-bit 量化。