Hugging Face 为 PRO 用户推出 Inference for PROs 专属推理 API
Hugging Face 为 PRO 用户推出 Inference for PROs,提供 Meta Llama 3 Instruct、Mixtral 8x7B Instruct、Code Llama 70B、Stable Diffusion XL 等精选模型的专属 HTTP API 端点,由 text-generation-inference 驱动,并享有更高速率限制。
Hugging Face 为 PRO 用户推出 Inference for PROs,提供 Meta Llama 3 Instruct、Mixtral 8x7B Instruct、Code Llama 70B、Stable Diffusion XL 等精选模型的专属 HTTP API 端点,由 text-generation-inference 驱动,并享有更高速率限制。
Rocket Money 将每月超 1 亿笔交易的正则匹配系统迁移到基于 BERT 家族模型的文本分类方案,用于识别交易中的商户与订阅服务。经过三个月评估,团队选择 Hugging Face Inference API 托管模型,一周内即承接部分流量,并通过模拟最坏情况负载测试逐步扩大交易量。
3D Gaussian Splatting 是一种光栅化技术,能从少量图像样本中学习并实时渲染逼真场景。它先用 COLMAP 做 Structure from Motion 估计点云,再将每个点转为高斯并借助可微高斯光栅化训练,通过自动致密化与剪枝优化细节。
Hugging Face 推出 Object Detection Leaderboard,对 Hub 上的目标检测模型按指标进行排名。该榜单基于 IoU、Average Precision(AP)和 Average Recall(AR)等指标评估模型,并解析了评测中可能出现的分歧与陷阱,帮助开发者挑选适合自身应用的开源模型。
Hugging Face 博客梳理了生产环境部署 LLM 的三大优化方向:8-bit 和 4-bit 低精度推理、Flash Attention 以及 Alibi、Rotary embeddings、MQA、GQA 等架构改进。
Hugging Face 发布 Würstchen,一个文本条件部分在高压缩潜空间中工作的扩散模型,通过 Stage A 的 VQGAN 与 Stage B 的 Diffusion Autoencoder 实现 42x 空间压缩,Stage C 在该潜空间中训练。
推荐理由:原文给出 42x 空间压缩与训练算力对比,读者可据此判断文生图模型的成本与显存门槛变化。
Hugging Face 博客介绍了如何用 PyTorch FSDP 在多节点多 GPU 上微调 Llama 2 70B,并给出配套的 Transformers、Accelerate 与 TRL 配置。
推荐理由:完整给出了 70B 模型多节点微调的三个显存与检查点难题及对应配置解法,可直接迁移到自有训练流程。
Hugging Face Transformers 目前原生支持 bitsandbytes 和 auto-gptq 两种量化方案,前者无需校准数据即可对任意含 torch.nn.Linear 的模型做零样本量化,后者在文本生成上更快且支持 2-bit 量化。bitsandbytes 的 4-bit 模型暂不支持序列化,GPTQ 则需校准数据集且目前仅支持语言模型。
Hugging Face 发布企业级代码助手 SafeCoder,基于 155 亿参数的 StarCoder 开源模型,支持 80 多种编程语言、8192 token 上下文窗口和 fill-in-the-middle。
Hugging Face Diffusers 团队与 T2I-Adapter 作者合作,在 diffusers 中为 Stable Diffusion XL 加入 T2I-Adapter 支持,并发布 sketch、canny、lineart、depth、openpose 五种条件控制的预训练权重。
推荐理由:对比 ControlNet 的参数与显存占用,并给出可直接运行的 diffusers 代码与多个条件模型权重。
TII 的 Falcon 180B 正式上线 Hugging Face,以 1800 亿参数成为当时最大的公开可用语言模型,基于 RefinedWeb 等数据训练了 3.5 万亿 token,使用最多 4096 张 GPU、约 700 万 GPU 小时。
推荐理由:官方给出 180B 模型的训练规模、评测对比与显存需求,可据此判断开源大模型的部署门槛。
Fetch 在 AWS 上用 Hugging Face 与 Amazon SageMaker 优化其 ML 流水线,将最慢扫描的延迟降低 50%,文档理解模型准确率提升 200%。
Hugging Face 在 🧨 Diffusers 库中优化 AudioLDM 2 文本到音频模型,通过半精度、flash attention、编译及调度器选择等手段,将推理时间缩短 10 倍以上,10 秒音频样本生成从 30 秒降至 1 秒,质量损失极小。
Meta 发布 Code Llama,这是基于 Llama 2 初始化、在 5000 亿 token 代码数据上训练的代码模型家族,包含 7B、13B、34B 三个规模,并额外提供 Python 专精版和指令微调版,采用与 Llama 2 相同的社区许可,可商用。
推荐理由:Hugging Face 生态对 Code Llama 的集成说明,含 7B/13B/34B 各版本基准与部署方式,便于判断选型与落地成本。
Hugging Face 将 AutoGPTQ 库集成进 Transformers,用户可用 GPTQ 算法把模型量化到 8、4、3 甚至 2-bit 精度运行,4-bit 量化精度损失可忽略,小批量下推理速度与 fp16 基线相当。
推荐理由:Hugging Face 官方说明 GPTQ 量化接入 Transformers 的用法与显存收益,可据此判断本地部署大模型的可行路径。
Hugging Face 发布开源视觉语言模型 IDEFICS,复现 DeepMind 未公开的 Flamingo,接受任意图像与文本序列输入并生成文本。模型提供 9B 和 80B 两个参数规模,各有基础版和指令微调版,仅基于公开数据与模型(LLaMA v1、OpenCLIP)构建。
推荐理由:IDEFICS 用公开数据和模型复现了未开源的 Flamingo,读者可了解其数据构成与开放程度。
Hugging Face 发布企业级代码助手 SafeCoder,基于 StarCoder 系列代码大模型构建,支持客户在自有基础设施上自托管部署,训练与推理全程代码不离开 VPC。该方案采用 15B 参数模型,支持 8,192 tokens 上下文,可适配 NVIDIA、AMD、Intel 及 AWS Inferentia2、Habana Gaudi 等硬件。
Hugging Face Hub 已上线 AWS Marketplace,用户可通过 AWS 账户订阅并直接支付 Hugging Face 使用费用。Inference Endpoints、Spaces 硬件升级和 AutoTrain 等服务的组织用量将自动计入 AWS 账单,价格与 Hugging Face 公开定价一致。
Hugging Face 发布实战教程,演示如何用 Transformers、Optimum 和 Accelerate 三个库对 Suno AI 的 TTS 模型 Bark 做三项优化,以降低显存占用并提升推理速度。
Hugging Face 博客演示了如何用开源模型服务框架 BentoML 部署 DeepFloyd IF 文生图模型。DeepFloyd IF 直接在像素空间工作,由冻结的文本编码器 T5-XXL-1.1 和三个级联像素扩散模块组成,可将 64x64 px 基础图逐步放大至 1024x1024 px。
Hugging Face 在 TRL 库中上线 Direct Preference Optimization(DPO)方法,并给出用 QLoRA 在 stack-exchange 偏好数据上微调 Llama v2 7B 的完整流程。
推荐理由:Hugging Face 官方给出 DPO 在 TRL 中的完整训练流程与代码,读者可据此在自己的偏好数据上复现对齐训练。
Hugging Face 发布 swift-transformers Swift 包及配套工具,让开发者能在 Apple 设备上通过 Core ML 运行 Llama 2、Falcon 等模型。
推荐理由:Hugging Face 发布 Swift 端侧 LLM 工具链,读者可了解在 Apple 设备上跑 Llama 2 的完整路径与当前限制。
Hugging Face 发布教程,介绍如何通过 Inference Endpoints 的自定义 handler 部署 MusicGen 音乐生成模型。用户需复制 facebook/musicgen-large 仓库,添加 handler.py 和 requirements.txt,即可创建端点,用文本提示词生成音乐,也可选用旋律片段作为条件。
Hugging Face 正用机器学习检测 Hub 上缺少语言元数据的数据集语言,并通过 librarian-bots 提交 PR 补全这些元数据。Hub 现有约 5 万个公开数据集,仅约 13% 标注了语言信息,其中约 19% 标注为 en。
Zama 展示了如何借助 Hugging Face transformers 库,用全同态加密(FHE)在加密数据上运行 GPT2 的部分推理,从而同时保护用户数据隐私与模型 IP。实现中将 GPT2 首个多头注意力头改写为 FHE 兼容算子,权重与激活量化为整数,4-bit 量化可保留原模型 96% 的准确率。完整代码已在该用例示例中开源。
Segmind 开源了压缩版 Stable Diffusion 模型 SD-Small 和 SD-Tiny 的权重与蒸馏训练代码,两者参数量分别比基础模型少 35% 和 55%,图像保真度接近基础模型。
这篇教程演示了如何用 OpenAI 开源扩散模型 Shap-E 从文本生成 3D 模型,再经 Blender 的 Decimate 修改器减面、用 Dream Textures 插件生成无缝贴图,最后完成 UV 展开并导出 FBX 导入 Unity。整个流程面向 PS1 低多边形风格,以规避当前 text-to-3D 模型精度不足的问题。
Hugging Face 与 Apple 将 Stable Diffusion XL 基础模型移植到 Core ML,可在运行 macOS 14 公测版的 Apple Silicon Mac 上通过 Swift 应用或 Hugging Face 演示应用运行,目前使用 ORIGINAL attention 实现,refiner 阶段尚未移植。
推荐理由:Hugging Face 与 Apple 把 SD XL 移植到 Core ML 并给出混合位宽量化配方,读者可据此判断 Mac 本地跑大模型的可行路径。
Hugging Face 在 huggingface.js 下发布 Agents.js,一个可在浏览器或服务端为 LLM 提供工具访问的 JavaScript 库,内置若干多模态工具并支持自定义工具与模型。
Hugging Face 联合 Creative Commons、Eleuther AI、GitHub、LAION 和 Open Future 发布立场文件,就 EU AI Act 提出五项建议。
Hugging Face 公布首届开源 AI Game Jam 结果,活动吸引超 1300 人报名、收到 88 款游戏,冠军由 ohmlet 的 Snip It 获得,该游戏用 Stable Diffusion 生成素材。
Hugging Face 的 Diffusers 库迎来一周年,已从文生图扩展为覆盖视频、3D 与图像编辑的模块化扩散模型工具箱。
Meta 发布 Llama 2 系列开放大语言模型,包含 7B、13B、70B 三种规模的预训练与微调版本,采用允许商用的社区许可,代码、预训练模型和微调模型同日放出。
推荐理由:Meta 开放 Llama 2 商用许可,Hugging Face 同步给出推理、量化与微调的完整接入路径。
Hugging Face 推出 AI WebTV 实验性演示,用开源文生视频模型 Zeroscope V2 与音乐生成模型 MusicGen 合成内容并直播。
Hugging Face 梳理其开源文本生成与 LLM 生态,涵盖因果语言模型与 text-to-text 模型、LLM 服务工具及 PEFT 微调。
Hugging Face 展示了在 Intel 第四代 Xeon(Sapphire Rapids)CPU 集群上微调 Stable Diffusion 的完整流程,借助 AMX 加速器与 IPEX、oneCCL 实现分布式训练。
Hugging Face 博客介绍了如何用 Transformers.js 制作实时 ML 网页游戏 Doodle Dash,模型完全在浏览器本地运行。作者基于 Google Quick, Draw!
推荐理由:作者完整走通从微调 MobileViT 到浏览器内实时推理的流程,可迁移到自己的网页 ML 项目。
Hugging Face 发布教程,演示如何用其托管 SaaS 服务 Inference Endpoints 部署开源 LLM,以 Falcon 40B instruct 为例,推荐将实例从 4x NVIDIA T4 换成 1x Nvidia A100,约 10 分钟即可上线。
Hugging Face 发布教程,用 Node.js 结合 WizardCoder-15B 与 Inference Endpoints API 流式生成 HTML 网页,实现文本到 Web 应用。模型通过 textGenerationStream 逐 token 输出,配合 TailwindCSS 提示词约束生成样式,并给出防止模型幻觉的提示词技巧。
Hugging Face 的 Jeff Boudier 对话 Writer 联合创始人兼 CTO Waseem Alshikh,回顾 Writer 从 Hugging Face 用户、客户到开源模型贡献者的历程。双方还讨论了当前生成式 AI 的最大误区、Writer 贡献开源模型的原因,以及 Writer 如何在 CPU 和 GPU 上规模化部署 LLM、CPU 推理效率对生产的重要性。