Hugging Face 详解 Matryoshka 嵌入模型:原理、训练与实战
Hugging Face 发布 Matryoshka 嵌入模型入门指南,介绍这类模型可将完整嵌入截断为多种维度仍保持性能,灵感来自俄罗斯套娃,由 Kusupati 等人于 2022 年提出。
Hugging Face 发布 Matryoshka 嵌入模型入门指南,介绍这类模型可将完整嵌入截断为多种维度仍保持性能,灵感来自俄罗斯套娃,由 Kusupati 等人于 2022 年提出。
Google 发布开源大模型家族 Gemma,包含 2B 和 7B 两种规模,各有基础版与指令微调版共 4 个开放模型,上下文长度 8K tokens。Hugging Face 同步完成集成,覆盖 Transformers 4.38、Google Cloud、Inference Endpoints 以及用 TRL 在单卡上微调的示例。
推荐理由:Google 开源 Gemma 后,Hugging Face 同步给出 2B/7B 四个模型的集成与部署路径,可对照榜单分数判断其定位。
Upstage 于 2023 年 9 月发起 Open Ko-LLM Leaderboard,用于评测韩语大语言模型,采用 Ko-ARC、Ko-HellaSwag、Ko-MMLU、Ko-Truthful QA 和 Ko-CommonGEN V2 五项任务,并新建私有测试集以防止数据污染。
Hugging Face 在 PEFT 中新增面向 LoRA 适配器的多种合并方法,包括 cat、linear、svd、ties、dare 和 magnitude_prune 系列,可通过 add_weighted_adapter() 调用。
Hugging Face 发布教程,展示如何用开源 LLM 生成合成数据来训练更小更专用的模型。案例以金融新闻投资者情绪分类为例,用 Mixtral-8x7B-Instruct-v0.1 配合 CoT 与 Self-Consistency 标注数据。
推荐理由:用开源 LLM 生成合成数据再蒸馏小模型的完整流程,附可复用 notebook 与成本、延迟、碳排放对比。
AMD 与 Hugging Face 联合启动 Pervasive AI Developer Contest,设生成式 AI、机器人 AI 和 PC AI 三个赛道,总奖金 16 万美元,单个获奖者最高可得 1 万美元,并提供 700 个 AMD 平台供参赛者使用。
SegMind 发布 SegMoE 框架,可从零构建混合专家扩散模型,并已集成进 Hugging Face diffusers 生态。此次发布包括 SegMoE-4x2、SegMoE-2x1 和 SegMoE-SD4x2 三个模型,以及用于自建 MoE 模型的 segmoe 包和 GitHub 仓库,模型采用 Apache 2.0 许可。
Hugging Face Text Generation Inference(TGI)正式在 AWS Inferentia2 和 Amazon SageMaker 上全面可用,为生产级 LLM 部署提供 GPU 之外的替代方案。
Hugging Face 发布用开源模型实现 Constitutional AI 的端到端配方,并开源 llm-swarm 工具,基于 TGI 和 vLLM 在 Slurm 集群上做可扩展合成数据生成。
推荐理由:Hugging Face 给出用开源模型复现 Constitutional AI 的完整配方,含数据集、模型与评测对比,可迁移到自定义价值观对齐。
借助 8bit/4bit 量化与辅助生成(assisted generation),StarCoder-15B 在第四代 Intel Xeon 上实现超过 7 倍的推理加速。其中 Q8-StarCoder 采用 SmoothQuant 静态量化,精度与 BF16 基线持平甚至略有提升,TTFT 与 TPOT 分别提速约 2.19 倍和 2.20 倍。
Hugging Face 宣布与 Google Cloud 建立战略合作,围绕开放科学、开源、云与硬件展开协作,帮助企业在 Hugging Face 开放模型与 Google Cloud 基础设施上构建自己的 AI。
Hugging Face 在 LangChain 的 ReAct 实现中评测了 Llama2-70b-chat、Mixtral-8x7B-Instruct-v0.1、OpenHermes-2.5-Mistral-7B、Zephyr-7b-beta、SOLAR-10.7B-Instruct-v1.0 等开源模型作为通用推理智能体的表现,并与 GPT-3.5、GPT-4 对比。
推荐理由:用同一套 ReAct 基准横向对比多个开源模型与 GPT-3.5、GPT-4,并给出 LangChain 搭建代码,可据此判断开源模型做智能体的可用性。
Hugging Face 发布教程,介绍如何用 🤗 Transformers 微调 facebook/w2v-bert-2.0 完成低资源 ASR。Wav2Vec2-BERT 是 580M 参数音频模型,预训练于 4.5M 小时、覆盖 143 种语言的无标注音频。
Hugging Face 在 7B 模型上实证评测了 DPO、IPO、KTO 三种无需强化学习的 LLM 偏好对齐方法,扫描 β 等关键超参数并用 MT-Bench 评估。
Hugging Face 博客介绍社区工具 Unsloth,与 transformers、PEFT、TRL 完全兼容,可将 LLM 微调速度提升约 2 倍、显存占用最多降低 74%,且相对标准 QLoRA 精度损失为 0%。
推荐理由:原文给出 Unsloth 与 TRL 的完整接入代码和 59 次基准数据,读者可据此判断微调提速与显存节省幅度。
Hugging Face 发布 aMUSEd,这是 Google MUSE 的开源复现,采用 Masked Image Model 而非主流潜在扩散方法,以研究预览形式在宽松许可下开放。
Hugging Face 发布新的 diffusers 训练脚本,把 Pivotal Tuning 与 Prodigy 优化器结合,用于 SDXL 的 Dreambooth LoRA 微调。
推荐理由:Hugging Face 官方把 Pivotal Tuning 与 Prodigy 优化器整合进 diffusers 训练脚本,读者可据此复现 SDXL Dreambooth LoRA 微调流程。
Hugging Face 博客介绍如何用投机解码(Transformers 中的 assisted generation)将 Whisper 推理速度提升约 2 倍,且数学上保证输出与单独使用主模型完全一致。
推荐理由:以 Whisper 为例给出投机解码的完整实现与基准数据,可迁移到其他自回归模型的推理加速。
Hugging Face 发布 2023 年开源 LLM 回顾,梳理了 BLOOM、OPT、GLM-130B 等预训练模型家族。BLOOM 最大版本为 176B 参数,基于 350B token 的 46 种人类语言和 13 种编程语言数据训练;Meta 的 OPT 最大版本为 175B 参数,训练数据 180B token。
Mistral AI 发布 Mixtral 8x7B,一个采用 Apache 2.0 许可、开放权重的稀疏混合专家模型(SMoE)。该模型总参数 46.7B,每个 token 仅激活 12.9B 参数,推理速度比 Llama 2 70B 快 6 倍,在多数基准上匹配或超过 Llama 2 70B 与 GPT3.5,支持 32k token 上下文和英法意德西五种语言。
推荐理由:官方给出 Mixtral 8x7B 的稀疏 MoE 架构与推理成本数据,可据此判断开源模型的性价比边界。
Hugging Face 发布长文《Mixture of Experts Explained》,以 Mixtral 8x7B 发布为背景,讲解 MoE 的构成、训练与推理取舍。
推荐理由:从 MoE 的稀疏路由、负载均衡到专家并行与部署取舍,系统梳理了这类架构的原理与工程代价。
Mistral 发布 Mixtral 8x7B,采用 Mixture of Experts 架构,8 个专家模型每个时间步激活 2 个,总参数量约 45B,支持 32k token 上下文,在多数基准上超过 Llama 2 70B 并追平 GPT-3.5,以 Apache 2.0 许可开放。
推荐理由:文章给出 Mixtral 8x7B 的架构说明、基准对比与 Hugging Face 全套集成方式,便于判断开源 MoE 模型的可用性。
Hugging Face 与 AMD 宣布合作进展,Transformers 模型和任务现可在 AMD Instinct GPU 上无需修改代码直接运行,并已支持 Flash Attention v2、Paged Attention、DeepSpeed、GPTQ 等加速与量化方案。
推荐理由:Hugging Face 与 AMD 公布开箱即用支持进展,读者可了解在 AMD Instinct 上运行 Transformers 与 TGI 的实际路径与性能对比。
Hugging Face 在 Inference API 中实现 LoRA 动态加载,让基础模型保持热启动、按请求即时加载和卸载适配器,把冷启动时间从 25 秒降到 3 秒,用户请求响应时间从 35 秒降到 13 秒。
Hugging Face 发布 Optimum-NVIDIA 推理库,只需把 transformers 的 pipeline 导入改成 optimum.nvidia 一行代码,即可在 NVIDIA 平台获得最高 28 倍吞吐提升和 1200 tokens/秒。
推荐理由:官方给出单行代码替换即可提速的量化数据与 FP8 支持范围,便于判断迁移成本。
Open LLM Leaderboard 新增 DROP 基准后,绝大多数模型 f1-score 低于 10 分。Hugging Face 排查发现,归一化步骤会忽略后接非空格空白符的数字答案,且以 . 作为停止词会截断浮点答案、让长回答的高质量模型 f1 更低。改用 \n 作为停止词重新计算后,分数与模型整体表现的相关性明显改善。
Hugging Face 发布 Latent Consistency LoRA(LCM LoRA),通过训练少量 LoRA 适配层而非蒸馏整个模型,让 SDXL 和 Stable Diffusion 从原本 25 到 50 步降到 4 到 8 步生成图像。
推荐理由:官方给出 LCM LoRA 的推理代码、多硬件速度对比和训练脚本,读者可据此判断少步数生成的可用性。
Hugging Face 的 optimum-neuron 现已支持在 AWS Inferentia2 上部署 LLM 进行文本生成,并以 Llama 2 为例演示。
Hugging Face 发布博客,介绍如何基于自家 GitHub 组织公开仓库代码微调出代码助手 HugCoder,让开发者可参照搭建自己的个人 copilot。
推荐理由:完整给出从数据采集到 QLoRA 与全量微调的成本对比,可迁移到自有代码库搭建补全助手。
Hugging Face datasets 库与 Renumics Spotlight 集成,只需一行代码即可对数据集进行交互式可视化。Spotlight 直接读取 datasets 的 Arrow 表结构,无需复制或预处理数据,并支持利用模型预测和嵌入向量定位关键数据簇与模型失败模式。用户可通过 GUI 或 Python API 自定义布局,用于 EDA、模型调试和监控。
Hugging Face 在 A100 40GB 上实测了 SDXL 的多项推理优化,未优化管线需 28GB 显存、72.2 秒,改用 fp16 后降至 21.7GB、14.8 秒,叠加 SDPA 后进一步降到 11.4 秒。
推荐理由:原文给出 SDXL 各项优化前后的显存与延迟实测数据,读者可据此选择适合自己硬件的组合方案。
Hugging Face 发布 @gradio/lite,一个借助 Pyodide 让 Gradio 应用完全在浏览器中运行的 JavaScript 库,无需服务器端基础设施。
推荐理由:官方给出在浏览器内运行 Gradio 的完整用法与限制,可据此判断无服务器部署的可行边界。
Hugging Face 上已有超过 13 万个支持 ONNX 的模型可借助 ONNX Runtime 加速,覆盖 90 多种模型架构,包括 BERT、GPT2、T5、Whisper、Stable-Diffusion 等。以 whisper-tiny 为例,使用 ONNX Runtime 后单次推理平均延迟相比 PyTorch 最高提升 74.30%。
Hugging Face tokenizers 新增 chat_template 属性,用 Jinja 模板保存模型训练时使用的对话格式,避免因格式不一致造成的静默性能下降。
推荐理由:Hugging Face 把聊天格式从 transformers 硬编码搬到 tokenizer 属性,读者可据此理解格式错配为何会静默拉低模型表现。
Hugging Face 发布 Ethics and Society Newsletter #5,回顾 2023 夏季在 AI 伦理与政策方面的工作。CEO Clem 向美国国会作证并在参议院 AI Insight Forum 发言,公司还就 E.U. AI Act、NTIA AI Accountability 提交意见。
Mistral AI 发布首个模型 Mistral 7B,这是一个 7B 参数模型,在全部标准英文与代码基准上超过当时所有 13B 参数以下的开源模型,并以 Apache 2.0 许可发布、可无限制使用。官方称这是三个月内从零搭建团队、MLops 栈与数据处理流水线的结果,同时开放 GitHub 仓库和 Discord 频道,并计划今年秋季继续发布更大模型与新架构。
推荐理由:Mistral AI 首篇官方博客,交代开源路线与 Mistral 7B 的定位,可对照其后续模型演进。
Mistral AI 发布 7.3B 参数语言模型 Mistral 7B,采用 Apache 2.0 许可,可无限制使用,并提供了参考实现、vLLM 推理服务器、Skypilot 及 HuggingFace 等使用方式。
推荐理由:Mistral 7B 以 7.3B 参数在多项基准上超过 Llama 2 13B,并给出 Apache 2.0 许可与本地、云端部署路径。
Hugging Face 对 Llama 2 在 Amazon SageMaker 上的 60 种部署配置进行了基准测试,覆盖 7B、13B、70B 三种规模、1/5/10/20 并发请求及 GPTQ 4-bit 量化。
Hugging Face 为 PRO 用户推出 Inference for PROs,提供 Meta Llama 3 Instruct、Mixtral 8x7B Instruct、Code Llama 70B、Stable Diffusion XL 等精选模型的专属 HTTP API 端点,由 text-generation-inference 驱动,并享有更高速率限制。
Hugging Face 推出 Object Detection Leaderboard,对 Hub 上的目标检测模型按指标进行排名。该榜单基于 IoU、Average Precision(AP)和 Average Recall(AR)等指标评估模型,并解析了评测中可能出现的分歧与陷阱,帮助开发者挑选适合自身应用的开源模型。