SegMind 发布 SegMoE 混合专家扩散模型框架
SegMind 发布 SegMoE 框架,可从零构建混合专家扩散模型,并已集成进 Hugging Face diffusers 生态。此次发布包括 SegMoE-4x2、SegMoE-2x1 和 SegMoE-SD4x2 三个模型,以及用于自建 MoE 模型的 segmoe 包和 GitHub 仓库,模型采用 Apache 2.0 许可。
SegMind 发布 SegMoE 框架,可从零构建混合专家扩散模型,并已集成进 Hugging Face diffusers 生态。此次发布包括 SegMoE-4x2、SegMoE-2x1 和 SegMoE-SD4x2 三个模型,以及用于自建 MoE 模型的 segmoe 包和 GitHub 仓库,模型采用 Apache 2.0 许可。
Hugging Face 推出 NPHardEval 排行榜,基于密歇根大学和罗格斯大学研究者开发的 NPHardEval 基准,通过计算复杂度类别评估 LLM 推理能力。
Hugging Face Text Generation Inference(TGI)正式在 AWS Inferentia2 和 Amazon SageMaker 上全面可用,为生产级 LLM 部署提供 GPU 之外的替代方案。
Hugging Face 发布用开源模型实现 Constitutional AI 的端到端配方,并开源 llm-swarm 工具,基于 TGI 和 vLLM 在 Slurm 集群上做可扩展合成数据生成。
推荐理由:Hugging Face 给出用开源模型复现 Constitutional AI 的完整配方,含数据集、模型与评测对比,可迁移到自定义价值观对齐。
Hugging Face 博客演示了 PatchTST 时间序列模型的用法:先在 Electricity 数据集上训练并评估预测性能,再用该模型对 ETTh1 数据集做零样本预测,随后进行线性探测与微调。
Patronus 团队与 Hugging Face 合作,基于 Hugging Face Leaderboard Template 推出 Enterprise Scenarios Leaderboard,用于评测语言模型在真实企业用例中的表现。
借助 8bit/4bit 量化与辅助生成(assisted generation),StarCoder-15B 在第四代 Intel Xeon 上实现超过 7 倍的推理加速。其中 Q8-StarCoder 采用 SmoothQuant 静态量化,精度与 BF16 基线持平甚至略有提升,TTFT 与 TPOT 分别提速约 2.19 倍和 2.20 倍。
Hugging Face 发布 Hallucinations Leaderboard,基于 EleutherAI Language Model Evaluation Harness 对多种 LLM 进行幻觉相关基准评测,覆盖闭卷问答、摘要、阅读理解、指令遵循、事实核查等任务,并已发布相关论文。
Hugging Face 推出 LLM Safety Leaderboard,基于 DecodingTrust 评估框架对 LLM 安全性进行评测,该框架曾获 NeurIPS 2023 杰出论文奖。
Hugging Face 宣布与 Google Cloud 建立战略合作,围绕开放科学、开源、云与硬件展开协作,帮助企业在 Hugging Face 开放模型与 Google Cloud 基础设施上构建自己的 AI。
Hugging Face 在 LangChain 的 ReAct 实现中评测了 Llama2-70b-chat、Mixtral-8x7B-Instruct-v0.1、OpenHermes-2.5-Mistral-7B、Zephyr-7b-beta、SOLAR-10.7B-Instruct-v1.0 等开源模型作为通用推理智能体的表现,并与 GPT-3.5、GPT-4 对比。
推荐理由:用同一套 ReAct 基准横向对比多个开源模型与 GPT-3.5、GPT-4,并给出 LangChain 搭建代码,可据此判断开源模型做智能体的可用性。
IBM Research 与 Hugging Face 团队合作,在 Transformers 库中发布了轻量级时间序列建模方法 PatchTSMixer。该模型基于 MLP-Mixer 架构,支持跨 patch、通道和隐藏特征的轻量混合,可预训练后用于预测、分类和回归任务。
Hugging Face 发布教程,介绍如何用 🤗 Transformers 微调 facebook/w2v-bert-2.0 完成低资源 ASR。Wav2Vec2-BERT 是 580M 参数音频模型,预训练于 4.5M 小时、覆盖 143 种语言的无标注音频。
Hugging Face 在 7B 模型上实证评测了 DPO、IPO、KTO 三种无需强化学习的 LLM 偏好对齐方法,扫描 β 等关键超参数并用 MT-Bench 评估。
Hugging Face 发布经 Olive 优化的 SD Turbo 与 SDXL Turbo 模型,在 NVIDIA GPU 上通过 ONNX Runtime 的 CUDA 和 TensorRT 执行提供程序加速推理,吞吐量相比 PyTorch 最高提升 229%(SDXL Turbo)和 120%(SD Turbo)。
Hugging Face 发布教程,讲解如何把 ComfyUI 工作流转成 Gradio 应用并部署到 Spaces 的 ZeroGPU 上免费运行。
推荐理由:完整走通从 ComfyUI 工作流导出 Python、包成 Gradio 应用到 ZeroGPU 免费部署的链路,可迁移到任意工作流。
Vectara 基于 Hugging Face 开源的排行榜模板,发布了新的 HHEM 幻觉排行榜,用于评估 GPT-4、Gemini、Llama 2 等 LLM 在文档摘要中的幻觉频率。该排行榜通过 requests 和 results 两个数据集管理模型评测请求与结果,并支持动态更新和社区提交新模型。Vectara 还公开了定制后的后端源码,可部署为 Hugging Face Space。
Hugging Face 博客介绍社区工具 Unsloth,与 transformers、PEFT、TRL 完全兼容,可将 LLM 微调速度提升约 2 倍、显存占用最多降低 74%,且相对标准 QLoRA 精度损失为 0%。
推荐理由:原文给出 Unsloth 与 TRL 的完整接入代码和 59 次基准数据,读者可据此判断微调提速与显存节省幅度。
Hugging Face 发布 aMUSEd,这是 Google MUSE 的开源复现,采用 Masked Image Model 而非主流潜在扩散方法,以研究预览形式在宽松许可下开放。
Hugging Face 发布新的 diffusers 训练脚本,把 Pivotal Tuning 与 Prodigy 优化器结合,用于 SDXL 的 Dreambooth LoRA 微调。
推荐理由:Hugging Face 官方把 Pivotal Tuning 与 Prodigy 优化器整合进 diffusers 训练脚本,读者可据此复现 SDXL Dreambooth LoRA 微调流程。
Hugging Face 博客介绍如何用投机解码(Transformers 中的 assisted generation)将 Whisper 推理速度提升约 2 倍,且数学上保证输出与单独使用主模型完全一致。
推荐理由:以 Whisper 为例给出投机解码的完整实现与基准数据,可迁移到其他自回归模型的推理加速。
Hugging Face 发布 2023 年开源 LLM 回顾,梳理了 BLOOM、OPT、GLM-130B 等预训练模型家族。BLOOM 最大版本为 176B 参数,基于 350B token 的 46 种人类语言和 13 种编程语言数据训练;Meta 的 OPT 最大版本为 175B 参数,训练数据 180B token。
Hugging Face 发布长文《Mixture of Experts Explained》,以 Mixtral 8x7B 发布为背景,讲解 MoE 的构成、训练与推理取舍。
推荐理由:从 MoE 的稀疏路由、负载均衡到专家并行与部署取舍,系统梳理了这类架构的原理与工程代价。
Mistral 发布 Mixtral 8x7B,采用 Mixture of Experts 架构,8 个专家模型每个时间步激活 2 个,总参数量约 45B,支持 32k token 上下文,在多数基准上超过 Llama 2 70B 并追平 GPT-3.5,以 Apache 2.0 许可开放。
推荐理由:文章给出 Mixtral 8x7B 的架构说明、基准对比与 Hugging Face 全套集成方式,便于判断开源 MoE 模型的可用性。
Hugging Face 与 Intel Labs 推出 SetFitABSA,一个用于少样本训练领域特定方面级情感分析(ABSA)模型的框架,在少样本场景下表现优于 Llama2 和 T5 等生成式模型。
Hugging Face 与 AMD 宣布合作进展,Transformers 模型和任务现可在 AMD Instinct GPU 上无需修改代码直接运行,并已支持 Flash Attention v2、Paged Attention、DeepSpeed、GPTQ 等加速与量化方案。
推荐理由:Hugging Face 与 AMD 公布开箱即用支持进展,读者可了解在 AMD Instinct 上运行 Transformers 与 TGI 的实际路径与性能对比。
Hugging Face 在 Inference API 中实现 LoRA 动态加载,让基础模型保持热启动、按请求即时加载和卸载适配器,把冷启动时间从 25 秒降到 3 秒,用户请求响应时间从 35 秒降到 13 秒。
Hugging Face 发布 Optimum-NVIDIA 推理库,只需把 transformers 的 pipeline 导入改成 optimum.nvidia 一行代码,即可在 NVIDIA 平台获得最高 28 倍吞吐提升和 1200 tokens/秒。
推荐理由:官方给出单行代码替换即可提速的量化数据与 FP8 支持范围,便于判断迁移成本。
Open LLM Leaderboard 新增 DROP 基准后,绝大多数模型 f1-score 低于 10 分。Hugging Face 排查发现,归一化步骤会忽略后接非空格空白符的数字答案,且以 . 作为停止词会截断浮点答案、让长回答的高质量模型 f1 更低。改用 \n 作为停止词重新计算后,分数与模型整体表现的相关性明显改善。
Hugging Face 发布 Latent Consistency LoRA(LCM LoRA),通过训练少量 LoRA 适配层而非蒸馏整个模型,让 SDXL 和 Stable Diffusion 从原本 25 到 50 步降到 4 到 8 步生成图像。
推荐理由:官方给出 LCM LoRA 的推理代码、多硬件速度对比和训练脚本,读者可据此判断少步数生成的可用性。
Explosion 发布 Prodigy-HF 插件,让 Prodigy 标注工具直接对接 Hugging Face 生态。
Hugging Face 的 optimum-neuron 现已支持在 AWS Inferentia2 上部署 LLM 进行文本生成,并以 Llama 2 为例演示。
一项对比实验用 LoRA 微调 RoBERTa-large(355M)、Llama-2-7b 和 Mistral-7B-v0.1(7.3B)三个模型,在灾难推文分类任务上评测性能,统一设置 MAX_LEN=512 以保证公平比较。
Hugging Face 为 Enterprise Hub 推出 Storage Regions,让组织决定模型和数据集的存储位置,目前支持 US 和 EU,亚太地区即将上线。该功能用于满足监管与法律合规(如欧盟 GDPR)需求,并提升性能:欧洲用户将仓库存于 EU 区域时,上传和下载速度约提升 4-5 倍。非默认位置的仓库会直接显示 Region 标签。
Hugging Face 发布博客,介绍如何基于自家 GitHub 组织公开仓库代码微调出代码助手 HugCoder,让开发者可参照搭建自己的个人 copilot。
推荐理由:完整给出从数据采集到 QLoRA 与全量微调的成本对比,可迁移到自有代码库搭建补全助手。
Hugging Face datasets 库与 Renumics Spotlight 集成,只需一行代码即可对数据集进行交互式可视化。Spotlight 直接读取 datasets 的 Arrow 表结构,无需复制或预处理数据,并支持利用模型预测和嵌入向量定位关键数据簇与模型失败模式。用户可通过 GUI 或 Python API 自定义布局,用于 EDA、模型调试和监控。
Hugging Face 复现了 OpenAI 2019 年的 RLHF 代码库 openai/lm-human-preferences,在情感与描述性等风格任务上匹配了其学习曲线。
Hugging Face 发布教程,介绍如何通过 Text Embeddings Inference(TEI)将开源嵌入模型部署到 Hugging Face Inference Endpoints。
Hugging Face 在 A100 40GB 上实测了 SDXL 的多项推理优化,未优化管线需 28GB 显存、72.2 秒,改用 fp16 后降至 21.7GB、14.8 秒,叠加 SDPA 后进一步降到 11.4 秒。
推荐理由:原文给出 SDXL 各项优化前后的显存与延迟实测数据,读者可据此选择适合自己硬件的组合方案。
Hugging Face 发布 @gradio/lite,一个借助 Pyodide 让 Gradio 应用完全在浏览器中运行的 JavaScript 库,无需服务器端基础设施。
推荐理由:官方给出在浏览器内运行 Gradio 的完整用法与限制,可据此判断无服务器部署的可行边界。