Hugging Face 推出 Open Arabic LLM Leaderboard,评估阿拉伯语大模型
Hugging Face 发布 Open Arabic LLM Leaderboard(OALL),专门评估和对比阿拉伯语 LLM 性能,服务全球超 3.8 亿阿拉伯语使用者。
Hugging Face 发布 Open Arabic LLM Leaderboard(OALL),专门评估和对比阿拉伯语 LLM 性能,服务全球超 3.8 亿阿拉伯语使用者。
Hugging Face 发布通用智能体项目 Jack of All Trades(JAT),基于 GPT-Neo 的 Transformer 架构,用单一网络在 Atari 57。
Hugging Face 推出 Open Medical-LLM Leaderboard,用统一平台评测大语言模型在医疗任务上的表现,以准确率为主要指标,覆盖 MedQA、MedMCQA、PubMedQA 及 MMLU 的医学与生物学子集。
OpenAI 为微调 API 增加新功能,让开发者对微调拥有更多控制权,同时公布构建自定义模型的新方式。
MotherDuck 与 Numbers Station 推出的 DuckDB-NSQL-7B 是专为 DuckDB SQL 设计的大语言模型,基于 Meta Llama-2-7b 微调,并用 DuckDB text-to-SQL 数据对进一步优化,可生成包括官方文档与扩展在内的多种有效 DuckDB SQL 语句。
Harvey 与 OpenAI 合作构建了一款面向法律从业者的定制训练模型。该模型基于 OpenAI 技术进行定制训练,具体参数与可用性细节未披露。
Hugging Face 发布 Cosmopedia,一个由 Mixtral-8x7B-Instruct-v0.1 生成的合成预训练数据集,包含超过 3000 万个文件、250 亿 token,目标是复现 Phi-1.5 的训练数据。
推荐理由:Hugging Face 公开了从提示词构建到去污染、训练的完整合成数据流水线,可对照 Phi 系列的做法理解预训练数据如何规模化生成。
Hugging Face 发布博客介绍 GaLore 优化器,可将优化器状态内存占用降低超过 82.5%,让 70 亿参数模型(如 Llama 架构)在 NVIDIA RTX 4090 等消费级 GPU 上训练。
推荐理由:原文给出 GaLore 与 8-bit 优化器结合的完整用法和可运行代码,读者可据此在消费级显卡上复现大模型训练。
Argilla 与 Hugging Face 推出 Data is Better Together 实验,几天内吸引 350 名社区贡献者完成超 11,000 条 prompt 评分,并发布含 10,000 条 prompt 用户评分的 10k_prompts_ranked 数据集。
BigCode 发布 StarCoder2,这是新一代透明训练的开放代码大语言模型,包含 3B、7B、15B 三个尺寸,分别由 ServiceNow、Hugging Face 和 NVIDIA 训练。
推荐理由:BigCode 同时放出三个尺寸的代码模型与配套数据集,读者可据此了解开源代码模型当前的规模与训练数据构成。
Hugging Face 发布教程,介绍如何用 Transformers 和 PEFT 库对 Google DeepMind 的开源模型 Gemma(2B 和 7B 参数)进行参数高效微调(PEFT)。教程以 LoRA 为例,结合 QLoRA 的 4-bit 量化,在 GPU 和 Cloud TPU 上以低显存成本完成微调,并使用 Abirate/english_quotes 数据集演示训练流程。
Hugging Face 发布 Matryoshka 嵌入模型入门指南,介绍这类模型可将完整嵌入截断为多种维度仍保持性能,灵感来自俄罗斯套娃,由 Kusupati 等人于 2022 年提出。
Hugging Face 在 PEFT 中新增面向 LoRA 适配器的多种合并方法,包括 cat、linear、svd、ties、dare 和 magnitude_prune 系列,可通过 add_weighted_adapter() 调用。
Hugging Face 发布教程,展示如何用开源 LLM 生成合成数据来训练更小更专用的模型。案例以金融新闻投资者情绪分类为例,用 Mixtral-8x7B-Instruct-v0.1 配合 CoT 与 Self-Consistency 标注数据。
推荐理由:用开源 LLM 生成合成数据再蒸馏小模型的完整流程,附可复用 notebook 与成本、延迟、碳排放对比。
Hugging Face 发布用开源模型实现 Constitutional AI 的端到端配方,并开源 llm-swarm 工具,基于 TGI 和 vLLM 在 Slurm 集群上做可扩展合成数据生成。
推荐理由:Hugging Face 给出用开源模型复现 Constitutional AI 的完整配方,含数据集、模型与评测对比,可迁移到自定义价值观对齐。
Hugging Face 博客演示了 PatchTST 时间序列模型的用法:先在 Electricity 数据集上训练并评估预测性能,再用该模型对 ETTh1 数据集做零样本预测,随后进行线性探测与微调。
Patronus 团队与 Hugging Face 合作,基于 Hugging Face Leaderboard Template 推出 Enterprise Scenarios Leaderboard,用于评测语言模型在真实企业用例中的表现。
IBM Research 与 Hugging Face 团队合作,在 Transformers 库中发布了轻量级时间序列建模方法 PatchTSMixer。该模型基于 MLP-Mixer 架构,支持跨 patch、通道和隐藏特征的轻量混合,可预训练后用于预测、分类和回归任务。
Hugging Face 在 7B 模型上实证评测了 DPO、IPO、KTO 三种无需强化学习的 LLM 偏好对齐方法,扫描 β 等关键超参数并用 MT-Bench 评估。
Hugging Face 博客介绍社区工具 Unsloth,与 transformers、PEFT、TRL 完全兼容,可将 LLM 微调速度提升约 2 倍、显存占用最多降低 74%,且相对标准 QLoRA 精度损失为 0%。
推荐理由:原文给出 Unsloth 与 TRL 的完整接入代码和 59 次基准数据,读者可据此判断微调提速与显存节省幅度。
Hugging Face 发布 2023 年开源 LLM 回顾,梳理了 BLOOM、OPT、GLM-130B 等预训练模型家族。BLOOM 最大版本为 176B 参数,基于 350B token 的 46 种人类语言和 13 种编程语言数据训练;Meta 的 OPT 最大版本为 175B 参数,训练数据 180B token。
Hugging Face 发布长文《Mixture of Experts Explained》,以 Mixtral 8x7B 发布为背景,讲解 MoE 的构成、训练与推理取舍。
推荐理由:从 MoE 的稀疏路由、负载均衡到专家并行与部署取舍,系统梳理了这类架构的原理与工程代价。
Hugging Face 与 Intel Labs 推出 SetFitABSA,一个用于少样本训练领域特定方面级情感分析(ABSA)模型的框架,在少样本场景下表现优于 Llama2 和 T5 等生成式模型。
OpenAI 启动 Data Partnerships 计划,与各方合作创建用于 AI 训练的开源和私有数据集。
Explosion 发布 Prodigy-HF 插件,让 Prodigy 标注工具直接对接 Hugging Face 生态。
一项对比实验用 LoRA 微调 RoBERTa-large(355M)、Llama-2-7b 和 Mistral-7B-v0.1(7.3B)三个模型,在灾难推文分类任务上评测性能,统一设置 MAX_LEN=512 以保证公平比较。
Hugging Face datasets 库与 Renumics Spotlight 集成,只需一行代码即可对数据集进行交互式可视化。Spotlight 直接读取 datasets 的 Arrow 表结构,无需复制或预处理数据,并支持利用模型预测和嵌入向量定位关键数据簇与模型失败模式。用户可通过 GUI 或 Python API 自定义布局,用于 EDA、模型调试和监控。
Hugging Face 复现了 OpenAI 2019 年的 RLHF 代码库 openai/lm-human-preferences,在情感与描述性等风格任务上匹配了其学习曲线。
Hugging Face tokenizers 新增 chat_template 属性,用 Jinja 模板保存模型训练时使用的对话格式,避免因格式不一致造成的静默性能下降。
推荐理由:Hugging Face 把聊天格式从 transformers 硬编码搬到 tokenizer 属性,读者可据此理解格式错配为何会静默拉低模型表现。
Hugging Face 在 trl 库中集成 DDPOTrainer,可用 DDPO(Denoising Diffusion Policy Optimization)对 Stable Diffusion 做强化学习微调。
Hugging Face 发布教程,展示非工程师如何零代码训练 LLaMA 2 聊天机器人。流程分三步:在 Spaces 部署 AutoTrain 与 ChatUI 模板,用 Alpaca 指令数据集微调 Meta Llama 2 7b,再部署为可分享的聊天应用。训练 7b 模型建议选用 A10G Large GPU,AutoTrain 支持 FP16、Int4/8 量化与 PEFT 等设置。
Mistral AI 发布首个模型 Mistral 7B,这是一个 7B 参数模型,在全部标准英文与代码基准上超过当时所有 13B 参数以下的开源模型,并以 Apache 2.0 许可发布、可无限制使用。官方称这是三个月内从零搭建团队、MLops 栈与数据处理流水线的结果,同时开放 GitHub 仓库和 Discord 频道,并计划今年秋季继续发布更大模型与新架构。
推荐理由:Mistral AI 首篇官方博客,交代开源路线与 Mistral 7B 的定位,可对照其后续模型演进。
Hugging Face 博客梳理了生产环境部署 LLM 的三大优化方向:8-bit 和 4-bit 低精度推理、Flash Attention 以及 Alibi、Rotary embeddings、MQA、GQA 等架构改进。
Hugging Face 博客介绍了如何用 PyTorch FSDP 在多节点多 GPU 上微调 Llama 2 70B,并给出配套的 Transformers、Accelerate 与 TRL 配置。
推荐理由:完整给出了 70B 模型多节点微调的三个显存与检查点难题及对应配置解法,可直接迁移到自有训练流程。
TII 的 Falcon 180B 正式上线 Hugging Face,以 1800 亿参数成为当时最大的公开可用语言模型,基于 RefinedWeb 等数据训练了 3.5 万亿 token,使用最多 4096 张 GPU、约 700 万 GPU 小时。
推荐理由:官方给出 180B 模型的训练规模、评测对比与显存需求,可据此判断开源大模型的部署门槛。
OpenAI 与 Scale 达成合作,企业客户可借助 Scale 的 AI 专业能力微调 OpenAI 最先进的模型。该支持面向企业微调场景,帮助客户定制模型。
OpenAI 宣布开发者可以用自己的数据微调 GPT-3.5 Turbo,以适配各自的使用场景,同时更新了 API。官方未在摘要中给出微调的具体价格、上下文长度或可用范围等细节。
推荐理由:OpenAI 官方开放 GPT-3.5 Turbo 微调,开发者可据此判断自有数据定制模型的可行路径。
Hugging Face 在 TRL 库中上线 Direct Preference Optimization(DPO)方法,并给出用 QLoRA 在 stack-exchange 偏好数据上微调 Llama v2 7B 的完整流程。
推荐理由:Hugging Face 官方给出 DPO 在 TRL 中的完整训练流程与代码,读者可据此在自己的偏好数据上复现对齐训练。
Hugging Face 正用机器学习检测 Hub 上缺少语言元数据的数据集语言,并通过 librarian-bots 提交 PR 补全这些元数据。Hub 现有约 5 万个公开数据集,仅约 13% 标注了语言信息,其中约 19% 标注为 en。
Segmind 开源了压缩版 Stable Diffusion 模型 SD-Small 和 SD-Tiny 的权重与蒸馏训练代码,两者参数量分别比基础模型少 35% 和 55%,图像保真度接近基础模型。