Hugging Face 详解 LayerSkip 自推测解码:用 transformers 加速文本生成
Hugging Face 发布博客详解 LayerSkip 提出的自推测解码,用同一 LLM 的早期层生成 draft token、深层网络负责验证,无需额外小模型即可加速文本生成并降低显存占用。
Hugging Face 发布博客详解 LayerSkip 提出的自推测解码,用同一 LLM 的早期层生成 draft token、深层网络负责验证,无需额外小模型即可加速文本生成并降低显存占用。
Hugging Face 的 Xet 团队采用内容定义分块(CDC)将文件拆分为可变大小的块,仅传输和存储修改过的块,从而提升存储与迭代效率。在 CORD-19 数据集基准测试中,Xet 后端将平均下载时间从 51 分钟降至 19 分钟,上传从 47 分钟降至 24 分钟,存储占用从 8.9 GB 降至 3.52 GB。
Mistral AI 在 La Plateforme 上线 Batch API,处理高并发请求的成本比同步 API 调用低 50%。用户上传批量文件、处理完成后下载输出文件即可,适用于情感分析、文档批量摘要与翻译、向量嵌入建索引和数据标注等场景。该 API 覆盖 La Plateforme 上全部模型,每个工作区最多 100 万个进行中的请求,并将陆续登陆其云厂商合作伙伴。
Mistral AI 发布新的内容审核 API,即其 Le Chat 审核服务所用的同一套接口,现对外开放供用户按自身安全标准定制。该模型是一个 LLM 分类器,将文本输入分为 9 个类别,提供原始文本和对话内容两个端点,对话端点只对上下文中的最后一条消息分类。
Hugging Face 与 PyCharm 的集成现已上线,开发者可在代码中右键选择 "Insert HF Model",按 image-text-to-text 等任务筛选模型并直接插入示例代码,例如 microsoft/Phi-3.5-vision-instruct。
Intel Labs 与 Hugging Face 提出 Universal Assisted Generation(UAG),让目标模型与助手模型不再需要共享 tokenizer,可跨模型家族配对。
推荐理由:Intel Labs 与 Hugging Face 提出的跨 tokenizer 推测解码方法,给出了可对照的加速数据和 Transformers 调用方式。
Hugging Face 发布生成式 AI 服务 HUGS,提供零配置的优化推理微服务,基于 Text Generation Inference 和 Transformers,支持 NVIDIA、AMD GPU,AWS Inferentia 和 Google TPU 即将支持。
推荐理由:HUGS 把开源模型的推理部署从数周压缩到分钟级,并给出兼容 OpenAI API 的落地路径,可据此判断自托管开源模型的工程成本。
Hugging Face 发布 Speech-to-Speech(S2S)项目,通过 VAD、STT、语言模型和 TTS 组成的级联流水线实现语音对话,支持英语、法语、西班牙语、中文、日语和韩语,可单语言运行或用 auto 标志自动检测语言。
dottxt 与 Hugging Face 联合发布 outlines-core 0.1.0,这是 outlines 结构化生成核心算法的 Rust 移植版,索引编译速度平均提升 2 倍。该库已集成进 outlines,Python 绑定 0.1.0 版本同步上线,其轻量化设计便于其他库直接引入结构化生成能力,Rust 实现还为 Python 之外的语言绑定提供了可能。
Llama 3.2 在 Hugging Face / Transformers 上线两周后,Keras 已从第一天起支持加载 Llama 3.2 checkpoint,包括 meta-llama/Llama-3.2-1B-Instruct,无需转换即可通过 keras_hub 的 Llama3CausalLM.from_preset 直接调用。
AMD 发布基于 Zen5 架构的第五代服务器级 EPYC CPU(代号 Turin),最高 192 核 384 线程。Hugging Face 用 Meta Llama 3.1 8B 在 Turin(128 核)与 Genoa(96 核)上对比测试,借助 ZenDNN PyTorch 插件(zentorch)与 bfloat16,多数配置下解码吞吐提升约 2 倍。
Hugging Face 委托 Trail of Bits 对 Gradio 5 进行独立安全审计,发现的全部安全风险已在 Gradio 5.0 发布前修复并通过验证。
Hugging Face 发布 Gradio 5 稳定版,开发者可用几行 Python 构建生产级机器学习 Web 应用,通过 pip install --upgrade gradio 升级。
推荐理由:官方列出 Gradio 5 在 SSR 加载、流式与安全上的具体改动,可据此判断现有应用的迁移成本。
Hugging Face 联合 Dask 展示用 Dask DataFrame 并行化 pandas,将 FineWeb 数据集的教育价值分类从本地 100 行扩展到云端多 GPU 上的 2.11 亿行。该流程用 FineWeb-Edu classifier 对 432 GB、250 个 Parquet 文件打分,并通过 map_partitions 实现多节点 GPU 并行推理。
Intel Labs 与 Hugging Face 提出动态推测解码方法,可根据助手模型置信度逐 token 动态调整推测前瞻长度,文本生成最高提速 2.7 倍。
Hugging Face 与 Intel 合作的 Optimum-Intel 支持将 Transformers 模型导出为 OpenVINO IR,并通过 OpenVINO GenAI 的 LLMPipeline 在 C++ 或 Python 中部署。
Hugging Face 团队探索出把已有模型微调到 1.58bit 的方法,成功将 Llama3 8B 微调为三值权重模型,并在 MMLU 上超过 Llama 1 7B。
推荐理由:作者公开了把已有 Llama3 8B 微调到 1.58bit 的完整技巧与踩坑过程,可迁移到其他模型的低比特微调。
Mistral 宣布 la Plateforme 推出免费额度,并对全线模型降价,其中 Mistral Small 与 Codestral 输入输出价格均下调 80%,Mistral Large 下调 33%。
推荐理由:官方一次性公布免费额度、全线降价与新模型,可据此比较各档模型的成本与部署选择。
Hugging Face 发布 Accelerate 1.0.0 首个候选版本,可通过 pip install --pre accelerate 或 Docker 镜像试用。
Hugging Face 博客盘点了 Hub 上 5 个常被忽视的工具:ZeroGPU、多进程 Docker、Gradio API、Webhooks 和 Nomic Atlas。
Hugging Face 发布教程,介绍如何用 TGI 和 Deep Learning Containers 在 Google Cloud Vertex AI 上部署 Meta Llama 3.1 405B。
Hugging Face 发布 ggml 入门指南,介绍这个用 C/C++ 编写、专注 Transformer 推理的开源机器学习库。
Mistral AI 宣布在 La Plateforme 上支持对 Mistral Large 2 和 Codestral 等旗舰及专用模型进行定制,可通过 base prompt、few-shot prompting 或微调实现,并支持自带数据集。
OpenAI 在 API 中推出结构化输出(Structured Outputs),模型输出现在可以可靠地遵循开发者提供的 JSON Schema。
推荐理由:OpenAI 官方说明 API 新增结构化输出,模型输出可稳定遵循开发者提供的 JSON Schema。
Hugging Face 展示了如何借助 Diffusers 库中的 Quanto 量化工具降低 Transformer 扩散管线的显存占用。以 PixArt-Sigma、Stable Diffusion 3 和 Aura Flow 为例,将扩散主干与文本编码器量化为 FP8 后,SD3 推理显存从 16.403 GB 降至约 8.2 GB,质量几乎无损、延迟略有上升。
Hugging Face 面向 Enterprise Hub 组织推出 NVIDIA NIM API(serverless),可在 Hugging Face Hub 上以无服务器方式对 Llama、Mistral 等开源模型运行推理,接口标准化于 OpenAI API。
Hugging Face 发布教程,介绍如何借助 WWDC 24 的新 Core ML 特性在 Mac 上运行 Mistral 7B,并用不到 4GB 内存完成 7B 参数模型的推理。
推荐理由:Hugging Face 官方给出把 Mistral 7B 转成 Core ML 并跑在 Mac 上的完整步骤,可据此复现端侧部署流程。
Hugging Face 为 TGI 推出 Multi-LoRA 服务功能,只需部署一次基础模型,即可根据请求中的 adapter_id 动态加载多个 LoRA 适配器,官方称可服务 30 个模型。
推荐理由:TGI 新增 Multi-LoRA 服务能力,给出部署命令与成本对比,可据此评估多微调模型的合并部署方案。
OpenAI 为 ChatGPT Enterprise 新增 Compliance API 集成、SCIM 和 GPT 控制功能,用于支持大规模合规项目、数据安全和用户访问管理。
Hugging Face 与 KerasHub 实现共享模型保存格式,Hub 上 30 万+ Transformers 模型现可直接加载进 KerasHub,首批支持 Gemma 1/2、Llama 3 和 PaliGemma。KerasHub 模型可在 TensorFlow、JAX、PyTorch 后端间一行代码切换,需将 keras 升级至 3.3.3 以上。
Hugging Face 宣布 Google Cloud TPU v5e 正式上线 Inference Endpoints 和 Spaces,提供 v5litepod-1(1 核 16 GB,$1.375/小时)、v5litepod-4(4 核 64 GB,$5.50/小时)和 v5litepod-8(8 核 128 GB,$11.00/小时)三种配置。
Intel 与 MILA 将多模态蛋白质语言模型 ProtST 重新架构并发布在 Hugging Face Hub,并基于 Optimum for Intel Gaudi 库在 Gaudi 2 上完成推理与微调。
Google 发布 Gemma 2 系列开源大模型,包含 9B 和 27B 两个尺寸,各有基础版与指令微调版共 4 个开放权重模型,上下文长度 8K token。
推荐理由:文章梳理了 Gemma 2 的滑动窗口注意力、软上限与知识蒸馏等训练改动,并给出与 Llama 3、Qwen 1.5 的基准对比。
XLSCOUT 发布专有嵌入模型 ParaEmbed 2.0,基于高质量多领域专利数据微调,准确率较 2023 年 10 月发布的 ParaEmbed 1.0 提升 23%。
视觉沟通软件公司 Prezi 加入 Hugging Face Expert Support Program,将更小、更高效的开源模型整合进其 ML 工作流。Prezi 旗舰产品 Prezi AI 结合视觉模型、文本模型和 VLM,专家建议在素材检索流程中加入开源 re-ranker 模型,以更低成本、更快速度找到最佳图文素材。
Hugging Face Accelerate 在 0.30.0 版本中为 FSDP 加入自动 upcasting,使其在混合精度下与 DeepSpeed 行为对齐。
Hugging Face Embedding Container for Amazon SageMaker 正式 GA,AWS 用户可在 SageMaker 上部署嵌入模型构建 RAG 等生成式 AI 应用。
Mistral AI 于 6 月 5 日至 30 日举办线上微调黑客松,参赛项目须使用其全新微调 API,提交截止 6 月 30 日。前三名各获 2500 欧元 Mistral API 额度,入选者可申请 100 美元免费额度,需在 6 月 10 日前填写表单。评审按影响力、技术实现、创意和展示各占 25% 打分,团队最多 4 人。
Hugging Face 将辅助生成(Assisted Generation)适配并优化到 Intel Gaudi,现已集成进 Optimum Habana。该方法基于 Speculative Sampling,用草稿模型生成 K 个 token 再由目标模型评估,大型 Transformer 模型通常可获得约 2x 加速。
Hugging Face 发布 TGI Benchmarking 工具,可在 Hugging Face Space 中部署 TGI 并评测吞吐量与延迟,帮助用户按需调优 LLM 部署。该工具随 TGI 一同安装,需在服务器端运行,通过 CLI 交互式执行,并提供预填充吞吐量与延迟散点图等可视化结果。