在 Intel Meteor Lake 笔记本上运行 Phi-2:基于 OpenVINO 的 4-bit 量化实践
Hugging Face 与 Intel 合作,通过 Optimum Intel 中的 OpenVINO 集成对微软 Phi-2 模型权重做 4-bit 量化,并在搭载 Core Ultra 7 155H 的中端笔记本上完成推理。
Hugging Face 与 Intel 合作,通过 Optimum Intel 中的 OpenVINO 集成对微软 Phi-2 模型权重做 4-bit 量化,并在搭载 Core Ultra 7 155H 的中端笔记本上完成推理。
Hugging Face 发布博客介绍 GaLore 优化器,可将优化器状态内存占用降低超过 82.5%,让 70 亿参数模型(如 Llama 架构)在 NVIDIA RTX 4090 等消费级 GPU 上训练。
推荐理由:原文给出 GaLore 与 8-bit 优化器结合的完整用法和可运行代码,读者可据此在消费级显卡上复现大模型训练。
Hugging Face 发布 Quanto,一个面向 Optimum 的 PyTorch 量化后端,支持 int2、int4、int8 和 float8 权重以及 int8、float8 激活,可在 CUDA 和 MPS 等任意设备上运行。
Hugging Face 面向 Enterprise Hub 组织推出 Train on DGX Cloud,可一键调用 NVIDIA H100 GPU 微调 Llama、Mistral、Stable Diffusion 等模型。
Hugging Face 展示了如何用 Optimum Habana 的自定义 pipeline 类在 Intel Gaudi 2 AI 加速器上运行 Llama 2 系列模型(7b、13b、70b)进行文本生成,仅需几行代码即可完成端到端的预处理与后处理。
BigCode 发布 StarCoder2,这是新一代透明训练的开放代码大语言模型,包含 3B、7B、15B 三个尺寸,分别由 ServiceNow、Hugging Face 和 NVIDIA 训练。
推荐理由:BigCode 同时放出三个尺寸的代码模型与配套数据集,读者可据此了解开源代码模型当前的规模与训练数据构成。
Hugging Face 发文梳理 AI 生成内容的水印方案,区分生成时嵌入与生成后添加两类方法,并盘点 Hub 上的相关工具。文中提到 Glaze、Photoguard 可微调图像干扰 AI 处理,Nightshade、Fawkes 则通过"投毒"破坏训练假设;Truepic 按 C2PA 标准嵌入元数据,IMATAG 采用水印器与检测器闭源、调用代码开源的混合模式。
Hugging Face 发布教程,介绍如何用 Transformers 和 PEFT 库对 Google DeepMind 的开源模型 Gemma(2B 和 7B 参数)进行参数高效微调(PEFT)。教程以 LoRA 为例,结合 QLoRA 的 4-bit 量化,在 GPU 和 Cloud TPU 上以低显存成本完成微调,并使用 Abirate/english_quotes 数据集演示训练流程。
Hugging Face 发布 Matryoshka 嵌入模型入门指南,介绍这类模型可将完整嵌入截断为多种维度仍保持性能,灵感来自俄罗斯套娃,由 Kusupati 等人于 2022 年提出。
Google 发布开源大模型家族 Gemma,包含 2B 和 7B 两种规模,各有基础版与指令微调版共 4 个开放模型,上下文长度 8K tokens。Hugging Face 同步完成集成,覆盖 Transformers 4.38、Google Cloud、Inference Endpoints 以及用 TRL 在单卡上微调的示例。
推荐理由:Google 开源 Gemma 后,Hugging Face 同步给出 2B/7B 四个模型的集成与部署路径,可对照榜单分数判断其定位。
Upstage 于 2023 年 9 月发起 Open Ko-LLM Leaderboard,用于评测韩语大语言模型,采用 Ko-ARC、Ko-HellaSwag、Ko-MMLU、Ko-Truthful QA 和 Ko-CommonGEN V2 五项任务,并新建私有测试集以防止数据污染。
Hugging Face 在 PEFT 中新增面向 LoRA 适配器的多种合并方法,包括 cat、linear、svd、ties、dare 和 magnitude_prune 系列,可通过 add_weighted_adapter() 调用。
Hugging Face 发布教程,展示如何用开源 LLM 生成合成数据来训练更小更专用的模型。案例以金融新闻投资者情绪分类为例,用 Mixtral-8x7B-Instruct-v0.1 配合 CoT 与 Self-Consistency 标注数据。
推荐理由:用开源 LLM 生成合成数据再蒸馏小模型的完整流程,附可复用 notebook 与成本、延迟、碳排放对比。
AMD 与 Hugging Face 联合启动 Pervasive AI Developer Contest,设生成式 AI、机器人 AI 和 PC AI 三个赛道,总奖金 16 万美元,单个获奖者最高可得 1 万美元,并提供 700 个 AMD 平台供参赛者使用。
SegMind 发布 SegMoE 框架,可从零构建混合专家扩散模型,并已集成进 Hugging Face diffusers 生态。此次发布包括 SegMoE-4x2、SegMoE-2x1 和 SegMoE-SD4x2 三个模型,以及用于自建 MoE 模型的 segmoe 包和 GitHub 仓库,模型采用 Apache 2.0 许可。
Hugging Face Text Generation Inference(TGI)正式在 AWS Inferentia2 和 Amazon SageMaker 上全面可用,为生产级 LLM 部署提供 GPU 之外的替代方案。
Hugging Face 发布用开源模型实现 Constitutional AI 的端到端配方,并开源 llm-swarm 工具,基于 TGI 和 vLLM 在 Slurm 集群上做可扩展合成数据生成。
推荐理由:Hugging Face 给出用开源模型复现 Constitutional AI 的完整配方,含数据集、模型与评测对比,可迁移到自定义价值观对齐。
借助 8bit/4bit 量化与辅助生成(assisted generation),StarCoder-15B 在第四代 Intel Xeon 上实现超过 7 倍的推理加速。其中 Q8-StarCoder 采用 SmoothQuant 静态量化,精度与 BF16 基线持平甚至略有提升,TTFT 与 TPOT 分别提速约 2.19 倍和 2.20 倍。
Hugging Face 宣布与 Google Cloud 建立战略合作,围绕开放科学、开源、云与硬件展开协作,帮助企业在 Hugging Face 开放模型与 Google Cloud 基础设施上构建自己的 AI。
Hugging Face 在 LangChain 的 ReAct 实现中评测了 Llama2-70b-chat、Mixtral-8x7B-Instruct-v0.1、OpenHermes-2.5-Mistral-7B、Zephyr-7b-beta、SOLAR-10.7B-Instruct-v1.0 等开源模型作为通用推理智能体的表现,并与 GPT-3.5、GPT-4 对比。
推荐理由:用同一套 ReAct 基准横向对比多个开源模型与 GPT-3.5、GPT-4,并给出 LangChain 搭建代码,可据此判断开源模型做智能体的可用性。
Hugging Face 发布教程,介绍如何用 🤗 Transformers 微调 facebook/w2v-bert-2.0 完成低资源 ASR。Wav2Vec2-BERT 是 580M 参数音频模型,预训练于 4.5M 小时、覆盖 143 种语言的无标注音频。
Hugging Face 在 7B 模型上实证评测了 DPO、IPO、KTO 三种无需强化学习的 LLM 偏好对齐方法,扫描 β 等关键超参数并用 MT-Bench 评估。
Hugging Face 博客介绍社区工具 Unsloth,与 transformers、PEFT、TRL 完全兼容,可将 LLM 微调速度提升约 2 倍、显存占用最多降低 74%,且相对标准 QLoRA 精度损失为 0%。
推荐理由:原文给出 Unsloth 与 TRL 的完整接入代码和 59 次基准数据,读者可据此判断微调提速与显存节省幅度。
Hugging Face 发布 aMUSEd,这是 Google MUSE 的开源复现,采用 Masked Image Model 而非主流潜在扩散方法,以研究预览形式在宽松许可下开放。
Hugging Face 发布新的 diffusers 训练脚本,把 Pivotal Tuning 与 Prodigy 优化器结合,用于 SDXL 的 Dreambooth LoRA 微调。
推荐理由:Hugging Face 官方把 Pivotal Tuning 与 Prodigy 优化器整合进 diffusers 训练脚本,读者可据此复现 SDXL Dreambooth LoRA 微调流程。
Hugging Face 博客介绍如何用投机解码(Transformers 中的 assisted generation)将 Whisper 推理速度提升约 2 倍,且数学上保证输出与单独使用主模型完全一致。
推荐理由:以 Whisper 为例给出投机解码的完整实现与基准数据,可迁移到其他自回归模型的推理加速。
Hugging Face 发布 2023 年开源 LLM 回顾,梳理了 BLOOM、OPT、GLM-130B 等预训练模型家族。BLOOM 最大版本为 176B 参数,基于 350B token 的 46 种人类语言和 13 种编程语言数据训练;Meta 的 OPT 最大版本为 175B 参数,训练数据 180B token。
Mistral AI 发布 Mixtral 8x7B,一个采用 Apache 2.0 许可、开放权重的稀疏混合专家模型(SMoE)。该模型总参数 46.7B,每个 token 仅激活 12.9B 参数,推理速度比 Llama 2 70B 快 6 倍,在多数基准上匹配或超过 Llama 2 70B 与 GPT3.5,支持 32k token 上下文和英法意德西五种语言。
推荐理由:官方给出 Mixtral 8x7B 的稀疏 MoE 架构与推理成本数据,可据此判断开源模型的性价比边界。
Hugging Face 发布长文《Mixture of Experts Explained》,以 Mixtral 8x7B 发布为背景,讲解 MoE 的构成、训练与推理取舍。
推荐理由:从 MoE 的稀疏路由、负载均衡到专家并行与部署取舍,系统梳理了这类架构的原理与工程代价。
Mistral 发布 Mixtral 8x7B,采用 Mixture of Experts 架构,8 个专家模型每个时间步激活 2 个,总参数量约 45B,支持 32k token 上下文,在多数基准上超过 Llama 2 70B 并追平 GPT-3.5,以 Apache 2.0 许可开放。
推荐理由:文章给出 Mixtral 8x7B 的架构说明、基准对比与 Hugging Face 全套集成方式,便于判断开源 MoE 模型的可用性。
Hugging Face 与 AMD 宣布合作进展,Transformers 模型和任务现可在 AMD Instinct GPU 上无需修改代码直接运行,并已支持 Flash Attention v2、Paged Attention、DeepSpeed、GPTQ 等加速与量化方案。
推荐理由:Hugging Face 与 AMD 公布开箱即用支持进展,读者可了解在 AMD Instinct 上运行 Transformers 与 TGI 的实际路径与性能对比。
Hugging Face 在 Inference API 中实现 LoRA 动态加载,让基础模型保持热启动、按请求即时加载和卸载适配器,把冷启动时间从 25 秒降到 3 秒,用户请求响应时间从 35 秒降到 13 秒。
Hugging Face 发布 Optimum-NVIDIA 推理库,只需把 transformers 的 pipeline 导入改成 optimum.nvidia 一行代码,即可在 NVIDIA 平台获得最高 28 倍吞吐提升和 1200 tokens/秒。
推荐理由:官方给出单行代码替换即可提速的量化数据与 FP8 支持范围,便于判断迁移成本。
Open LLM Leaderboard 新增 DROP 基准后,绝大多数模型 f1-score 低于 10 分。Hugging Face 排查发现,归一化步骤会忽略后接非空格空白符的数字答案,且以 . 作为停止词会截断浮点答案、让长回答的高质量模型 f1 更低。改用 \n 作为停止词重新计算后,分数与模型整体表现的相关性明显改善。
Hugging Face 发布 Latent Consistency LoRA(LCM LoRA),通过训练少量 LoRA 适配层而非蒸馏整个模型,让 SDXL 和 Stable Diffusion 从原本 25 到 50 步降到 4 到 8 步生成图像。
推荐理由:官方给出 LCM LoRA 的推理代码、多硬件速度对比和训练脚本,读者可据此判断少步数生成的可用性。
Hugging Face 的 optimum-neuron 现已支持在 AWS Inferentia2 上部署 LLM 进行文本生成,并以 Llama 2 为例演示。
Hugging Face 发布博客,介绍如何基于自家 GitHub 组织公开仓库代码微调出代码助手 HugCoder,让开发者可参照搭建自己的个人 copilot。
推荐理由:完整给出从数据采集到 QLoRA 与全量微调的成本对比,可迁移到自有代码库搭建补全助手。
Hugging Face datasets 库与 Renumics Spotlight 集成,只需一行代码即可对数据集进行交互式可视化。Spotlight 直接读取 datasets 的 Arrow 表结构,无需复制或预处理数据,并支持利用模型预测和嵌入向量定位关键数据簇与模型失败模式。用户可通过 GUI 或 Python API 自定义布局,用于 EDA、模型调试和监控。
Hugging Face 在 A100 40GB 上实测了 SDXL 的多项推理优化,未优化管线需 28GB 显存、72.2 秒,改用 fp16 后降至 21.7GB、14.8 秒,叠加 SDPA 后进一步降到 11.4 秒。
推荐理由:原文给出 SDXL 各项优化前后的显存与延迟实测数据,读者可据此选择适合自己硬件的组合方案。
Hugging Face 发布 @gradio/lite,一个借助 Pyodide 让 Gradio 应用完全在浏览器中运行的 JavaScript 库,无需服务器端基础设施。
推荐理由:官方给出在浏览器内运行 Gradio 的完整用法与限制,可据此判断无服务器部署的可行边界。