Universal Assisted Generation:用任意助手模型加速解码
Intel Labs 与 Hugging Face 提出 Universal Assisted Generation(UAG),让目标模型与助手模型不再需要共享 tokenizer,可跨模型家族配对。
推荐理由:Intel Labs 与 Hugging Face 提出的跨 tokenizer 推测解码方法,给出了可对照的加速数据和 Transformers 调用方式。
Intel Labs 与 Hugging Face 提出 Universal Assisted Generation(UAG),让目标模型与助手模型不再需要共享 tokenizer,可跨模型家族配对。
推荐理由:Intel Labs 与 Hugging Face 提出的跨 tokenizer 推测解码方法,给出了可对照的加速数据和 Transformers 调用方式。
Digital Green 在 CGIAR 主导的 GAIA 项目中开发了农业问答机器人 Farmer.chat,并联合 Hugging Face 专家搭建 LLM-as-a-Judge 评估体系来评测其 RAG 管线。
Hugging Face 发布 Speech-to-Speech(S2S)项目,通过 VAD、STT、语言模型和 TTS 组成的级联流水线实现语音对话,支持英语、法语、西班牙语、中文、日语和韩语,可单语言运行或用 auto 标志自动检测语言。
Llama 3.2 在 Hugging Face / Transformers 上线两周后,Keras 已从第一天起支持加载 Llama 3.2 checkpoint,包括 meta-llama/Llama-3.2-1B-Instruct,无需转换即可通过 keras_hub 的 Llama3CausalLM.from_preset 直接调用。
Hugging Face 修复了 transformers Trainer 中梯度累积的损失计算错误:此前开启梯度累积与全批量训练的损失不一致,正确做法应为累积步内所有批次总损失除以全部非 padding token 数,而非各批次损失的平均值。
Hugging Face 联合 Dask 展示用 Dask DataFrame 并行化 pandas,将 FineWeb 数据集的教育价值分类从本地 100 行扩展到云端多 GPU 上的 2.11 亿行。该流程用 FineWeb-Edu classifier 对 432 GB、250 个 Parquet 文件打分,并通过 map_partitions 实现多节点 GPU 并行推理。
Intel Labs 与 Hugging Face 提出动态推测解码方法,可根据助手模型置信度逐 token 动态调整推测前瞻长度,文本生成最高提速 2.7 倍。
Hugging Face 的 Xet 团队针对 Hub 上超 2.2PB 的 Parquet 存储测试了字节级 CDC 去重效果:追加 10,000 行可去重 99.1%,仅需额外 20MB;但修改一行因列头含绝对偏移量,去重率降至 89%,需额外 230MB。团队提出改用相对偏移量、按行组做内容定义分块等方案,并希望与 Apache Arrow 合作落地。
Hugging Face 发布教程与 InstantTexture 库,可将 InstantMesh 等生成模型输出的顶点着色网格转换为 UV 贴图纹理网格。流程用 xatlas 生成 UV 映射,再通过重心坐标插值填充 1024 像素纹理,并配合修复、中值滤波、高斯模糊与 LANCZOS 降采样消除空洞。该库可通过 pip 安装,将 .obj 网格转换为 .glb 输出。
Hugging Face 与 Intel 合作的 Optimum-Intel 支持将 Transformers 模型导出为 OpenVINO IR,并通过 OpenVINO GenAI 的 LLMPipeline 在 C++ 或 Python 中部署。
Hugging Face 团队探索出把已有模型微调到 1.58bit 的方法,成功将 Llama3 8B 微调为三值权重模型,并在 MMLU 上超过 Llama 1 7B。
推荐理由:作者公开了把已有 Llama3 8B 微调到 1.58bit 的完整技巧与踩坑过程,可迁移到其他模型的低比特微调。
Hugging Face 的 LeRobot 项目提出 LeRobotDataset 格式,用视频编码存储机器人数据集的视觉模态,平均体积仅为原始版本的 14%,最佳情况下可低至 0.2%,同时保持完整训练能力。解码单帧耗时与加载压缩图片相当,连续多帧解码仅需其 25%-50%。该格式轻量、易分享,并原生集成 Hub,还提供可视化工具浏览数据集。
Hugging Face 博客盘点了 Hub 上 5 个常被忽视的工具:ZeroGPU、多进程 Docker、Gradio API、Webhooks 和 Nomic Atlas。
Hugging Face 在 Transformers 中推出 DataCollatorWithFlattening,使无 padding 的打包指令微调与 Flash Attention 2 兼容,训练吞吐最高提升 2 倍。
推荐理由:官方给出打包训练与 Flash Attention 2 兼容的实现方式和吞吐、显存实测数据,可据此评估自家训练流程的改造空间。
Hugging Face 发布教程,介绍如何用 TGI 和 Deep Learning Containers 在 Google Cloud Vertex AI 上部署 Meta Llama 3.1 405B。
Hugging Face 复现 Google 的 Infini-Attention 发现,随着记忆压缩次数增加,模型性能持续下降,且 90% 的调试时间花在收敛问题上。
Hugging Face 发布 ggml 入门指南,介绍这个用 C/C++ 编写、专注 Transformer 推理的开源机器学习库。
Hugging Face 与 Albumentations AI 合作推出面向文档图像的 TextImage 数据增强流程,可同时修改图像内容与文本标注。该流程支持随机插入、删除、交换及停用词替换等文本增强,并配合黑化与 inpaint 保持文本质量,还可用任意文本合成新样本。初始版本中的同义词替换因耗时过高已被移除。
Hugging Face 展示了如何借助 Diffusers 库中的 Quanto 量化工具降低 Transformer 扩散管线的显存占用。以 PixArt-Sigma、Stable Diffusion 3 和 Aura Flow 为例,将扩散主干与文本编码器量化为 FP8 后,SD3 推理显存从 16.403 GB 降至约 8.2 GB,质量几乎无损、延迟略有上升。
Hugging Face 发布教程,介绍如何借助 WWDC 24 的新 Core ML 特性在 Mac 上运行 Mistral 7B,并用不到 4GB 内存完成 7B 参数模型的推理。
推荐理由:Hugging Face 官方给出把 Mistral 7B 转成 Core ML 并跑在 Mac 上的完整步骤,可据此复现端侧部署流程。
这篇教程演示如何用 distilabel 为 Argilla 2.0 构建能理解技术文档的聊天机器人:先从 GitHub 文档切分约 256 token 的 chunk 并生成合成数据集,再微调领域专用嵌入模型、搭建向量数据库,最后将 Gradio 应用部署到 Hugging Face Space,并把对话存入 Argilla 持续评估改进。
Hugging Face 的 TRL 库现已支持对视觉语言模型(VLM)进行直接偏好优化(DPO),并给出基于 Idefics2-8b 的完整训练教程。示例使用包含超 83,000 条标注的 openbmb/RLAIF-V-Dataset,DPO 实现同时支持 Llava 1.5 和 PaliGemma。文章还测算了 8B 模型全参数训练约需 160GB 显存,需借助量化等技术才能跑通。
Intel 与 MILA 将多模态蛋白质语言模型 ProtST 重新架构并发布在 Hugging Face Hub,并基于 Optimum for Intel Gaudi 库在 Gaudi 2 上完成推理与微调。
微软 6 月发布的 Florence-2 视觉语言模型仅有 0.2B 和 0.7B 两种小尺寸,原生支持 captioning、目标检测、OCR 等任务,但发布的模型不含 VQA 能力。在 DocVQA 数据集上微调七个 epoch 后,验证集 Levenshtein 相似度从 0 提升至 57.0,作者建议用 The Cauldron 进一步微调以获得更强的 VQA 模型。
Hugging Face Accelerate 在 0.30.0 版本中为 FSDP 加入自动 upcasting,使其在混合精度下与 DeepSpeed 行为对齐。
Hugging Face 在 TRL 中推出 RLOO(REINFORCE Leave One-Out)Trainer,作为 PPO 之外的在线 RLHF 训练算法。
Hugging Face 宣布重新设计 Transformers 文档,原因是现有文档内容零散、导航困难且过时。新版将面向构建 AI 产品的开发者,采用代码优先、解决方案导向的写法,并放弃 Diátaxis 的刚性结构,改为随内容自然生长的有机结构,让新增内容与原有文档融合而非层层叠加。
Hugging Face 将辅助生成(Assisted Generation)适配并优化到 Intel Gaudi,现已集成进 Optimum Habana。该方法基于 Speculative Sampling,用草稿模型生成 K 个 token 再由目标模型评估,大型 Transformer 模型通常可获得约 2x 加速。
Hugging Face 发布 TGI Benchmarking 工具,可在 Hugging Face Space 中部署 TGI 并评测吞吐量与延迟,帮助用户按需调优 LLM 部署。该工具随 TGI 一同安装,需在服务器端运行,通过 CLI 交互式执行,并提供预填充吞吐量与延迟散点图等可视化结果。
Hugging Face 发布博客,介绍如何用 Python 库 Sentence Transformers 微调嵌入模型以提升特定任务表现,也可从零训练新模型。
Intel 展示了基于 OPEA 平台、用 Intel Gaudi 2 加速器和 Xeon CPU 构建企业级 RAG 应用的方案,嵌入模型跑在 Granite Rapids CPU 上,LLM 跑在 Gaudi 2 上。
Hugging Face 发布自定义推理 handler 方案,在 Inference Endpoints 上把 Whisper 语音识别、Pyannote 说话人分离与推测解码整合进单一 API 端点。
Hugging Face 的 Leaderboards and Evals 团队发现,同一任务下仅改变提示词格式,模型得分波动可达约 10 分,Qwen1.5-7B 在 7 种提示变体下准确率从 51.2% 跌至 22.9%,且模型排名也随之改变。为此 Hugging Face 与 .txt 合作,尝试用结构化生成库 Outlines 约束模型输出,以降低提示词格式带来的评测方差。
Zama 团队将基于全同态加密(FHE)的 Concrete ML 预编译模型部署到 Hugging Face Endpoints,用户可通过自定义 inference handler 一键部署并运行加密推理。
Gradio 推出 reload 模式,用 `gradio app.py` 替代 `python app.py` 启动应用,即可在不重启服务器的情况下拉取源码最新改动。
Hugging Face 发布视觉语言模型入门指南,梳理其核心架构由图像编码器、嵌入投影器和文本解码器组成,并盘点 LLaVA 1.6、CogVLM、Qwen-VL、Yi-VL-34B 等开源模型。文章还介绍了 Vision Arena、Open VLM Leaderboard 等评测榜单及 MMMU、MMBench 等基准,并演示如何用新版 trl 微调这类模型。
MotherDuck 与 Numbers Station 推出的 DuckDB-NSQL-7B 是专为 DuckDB SQL 设计的大语言模型,基于 Meta Llama-2-7b 微调,并用 DuckDB text-to-SQL 数据对进一步优化,可生成包括官方文档与扩展在内的多种有效 DuckDB SQL 语句。
借助 🤗 Optimum Intel 对 SetFit 模型做训练后静态量化(PTQ),可在 Intel Xeon CPU 上把推理速度提升 7.8 倍,实现生产级部署。
Hugging Face 发布面向非技术读者的 Transformers 入门指南,从零解释这一开源 Python 库、Hub 与 Spaces 的基本概念。教程以在 Hugging Face Space 的 JupyterLab notebook 中运行微软 Phi-2 LLM 为例,需租用 24GB 显存的 NVIDIA A10G GPU,每小时仅需几美元。
Hugging Face 发布博客介绍嵌入量化,将 float32 嵌入转为二值或 int8,分别带来 32 倍和 4 倍的内存与存储缩减。
推荐理由:用 41M 维基文本的实测数据说明二值与标量量化在检索速度、内存和成本上的取舍,方法可直接迁移。