Google 发布开源视觉语言模型 PaliGemma
Google 发布视觉语言模型系列 PaliGemma,由 SigLIP-So400m 图像编码器和 Gemma-2B 文本解码器组成,可输入图像与文本并输出文本。
推荐理由:Google 开源视觉语言模型 PaliGemma 的架构、三种权重类型与微调路径都在文中给出,可据此判断它适合哪些下游任务。
Hugging Face 开源社区动态:热门模型与数据集、排行榜变化与开源生态的晴雨表。
Google 发布视觉语言模型系列 PaliGemma,由 SigLIP-So400m 图像编码器和 Gemma-2B 文本解码器组成,可输入图像与文本并输出文本。
推荐理由:Google 开源视觉语言模型 PaliGemma 的架构、三种权重类型与微调路径都在文中给出,可据此判断它适合哪些下游任务。
Hugging Face 发布 Transformers Agents 2.0,在原有智能体类型之外新增两类可基于历史观察迭代的智能体,并加入共享功能。官方称新框架下 Llama-3-70B-Instruct 智能体在 GAIA 榜单上超过多个基于 GPT-4 的智能体,排名第 4,成为开源类别领先者。
推荐理由:官方给出新智能体框架的模块划分与 GAIA 榜单成绩,可据此判断开源智能体方案的可用性。
Hugging Face 发布 StarCoder2-15B-Instruct-v0.1,这是首个完全自对齐的代码 LLM,训练流程完全透明且宽松许可。
推荐理由:StarCoder2-15B-Instruct 用完全自对齐流程达到 72.6 HumanEval,读者可据此了解不依赖 GPT-4 蒸馏的代码模型训练路径。
Meta 发布 Llama 3 系列开源大模型,包含 8B 和 70B 两个尺寸,各有 base 与 instruct 版本,并推出基于 Llama 3 8B 微调的安全模型 Llama Guard 2。
推荐理由:Meta 发布 Llama 3 并同步落地 Hugging Face 生态,读者可据此了解新分词器与 8K 上下文带来的变化。
Hugging Face 发布 Idefics2,一个 8B 参数的通用多模态模型,可接受任意文本与图像序列输入并生成文本回复,采用 Apache 2.0 开源许可,已集成进 Transformers。
推荐理由:8B 参数、Apache 2.0 许可并同步开源指令微调数据集,可据此判断社区多模态微调的门槛变化。
Google 发布代码专用开源模型系列 CodeGemma,基于预训练的 2B 和 7B Gemma checkpoint 继续训练,额外使用 5000 亿 token 的英文、数学和代码数据,共三个版本:2B 基础模型专注代码填充,7B 基础模型混合代码填充与自然语言,7B Instruct 面向代码对话。
推荐理由:Google 开源代码专用模型 CodeGemma 的三个版本与 Hugging Face 生态集成细节,可据此判断代码补全场景的选型。
Hugging Face 发布博客介绍嵌入量化,将 float32 嵌入转为二值或 int8,分别带来 32 倍和 4 倍的内存与存储缩减。
推荐理由:用 41M 维基文本的实测数据说明二值与标量量化在检索速度、内存和成本上的取舍,方法可直接迁移。
Hugging Face 发布 Cosmopedia,一个由 Mixtral-8x7B-Instruct-v0.1 生成的合成预训练数据集,包含超过 3000 万个文件、250 亿 token,目标是复现 Phi-1.5 的训练数据。
推荐理由:Hugging Face 公开了从提示词构建到去污染、训练的完整合成数据流水线,可对照 Phi 系列的做法理解预训练数据如何规模化生成。
Hugging Face 发布博客介绍 GaLore 优化器,可将优化器状态内存占用降低超过 82.5%,让 70 亿参数模型(如 Llama 架构)在 NVIDIA RTX 4090 等消费级 GPU 上训练。
推荐理由:原文给出 GaLore 与 8-bit 优化器结合的完整用法和可运行代码,读者可据此在消费级显卡上复现大模型训练。
BigCode 发布 StarCoder2,这是新一代透明训练的开放代码大语言模型,包含 3B、7B、15B 三个尺寸,分别由 ServiceNow、Hugging Face 和 NVIDIA 训练。
推荐理由:BigCode 同时放出三个尺寸的代码模型与配套数据集,读者可据此了解开源代码模型当前的规模与训练数据构成。
Google 发布开源大模型家族 Gemma,包含 2B 和 7B 两种规模,各有基础版与指令微调版共 4 个开放模型,上下文长度 8K tokens。Hugging Face 同步完成集成,覆盖 Transformers 4.38、Google Cloud、Inference Endpoints 以及用 TRL 在单卡上微调的示例。
推荐理由:Google 开源 Gemma 后,Hugging Face 同步给出 2B/7B 四个模型的集成与部署路径,可对照榜单分数判断其定位。
Hugging Face 发布教程,展示如何用开源 LLM 生成合成数据来训练更小更专用的模型。案例以金融新闻投资者情绪分类为例,用 Mixtral-8x7B-Instruct-v0.1 配合 CoT 与 Self-Consistency 标注数据。
推荐理由:用开源 LLM 生成合成数据再蒸馏小模型的完整流程,附可复用 notebook 与成本、延迟、碳排放对比。
Hugging Face 为 Text Generation Inference(TGI)和 Inference Endpoints 推出 Messages API,从 TGI 1.4.0 起提供与 OpenAI Chat Completion API 兼容的接口,可直接配合 OpenAI 客户端库以及 LangChain、LlamaIndex 使用。
推荐理由:官方给出 OpenAI 兼容接口的接入方式与限制,读者可据此评估把现有 OpenAI 调用迁到开源模型的成本。
Hugging Face 发布用开源模型实现 Constitutional AI 的端到端配方,并开源 llm-swarm 工具,基于 TGI 和 vLLM 在 Slurm 集群上做可扩展合成数据生成。
推荐理由:Hugging Face 给出用开源模型复现 Constitutional AI 的完整配方,含数据集、模型与评测对比,可迁移到自定义价值观对齐。
Hugging Face 在 LangChain 的 ReAct 实现中评测了 Llama2-70b-chat、Mixtral-8x7B-Instruct-v0.1、OpenHermes-2.5-Mistral-7B、Zephyr-7b-beta、SOLAR-10.7B-Instruct-v1.0 等开源模型作为通用推理智能体的表现,并与 GPT-3.5、GPT-4 对比。
推荐理由:用同一套 ReAct 基准横向对比多个开源模型与 GPT-3.5、GPT-4,并给出 LangChain 搭建代码,可据此判断开源模型做智能体的可用性。
Hugging Face 发布教程,讲解如何把 ComfyUI 工作流转成 Gradio 应用并部署到 Spaces 的 ZeroGPU 上免费运行。
推荐理由:完整走通从 ComfyUI 工作流导出 Python、包成 Gradio 应用到 ZeroGPU 免费部署的链路,可迁移到任意工作流。
Hugging Face 博客介绍社区工具 Unsloth,与 transformers、PEFT、TRL 完全兼容,可将 LLM 微调速度提升约 2 倍、显存占用最多降低 74%,且相对标准 QLoRA 精度损失为 0%。
推荐理由:原文给出 Unsloth 与 TRL 的完整接入代码和 59 次基准数据,读者可据此判断微调提速与显存节省幅度。
Hugging Face 发布新的 diffusers 训练脚本,把 Pivotal Tuning 与 Prodigy 优化器结合,用于 SDXL 的 Dreambooth LoRA 微调。
推荐理由:Hugging Face 官方把 Pivotal Tuning 与 Prodigy 优化器整合进 diffusers 训练脚本,读者可据此复现 SDXL Dreambooth LoRA 微调流程。
Hugging Face 博客介绍如何用投机解码(Transformers 中的 assisted generation)将 Whisper 推理速度提升约 2 倍,且数学上保证输出与单独使用主模型完全一致。
推荐理由:以 Whisper 为例给出投机解码的完整实现与基准数据,可迁移到其他自回归模型的推理加速。
Hugging Face 发布长文《Mixture of Experts Explained》,以 Mixtral 8x7B 发布为背景,讲解 MoE 的构成、训练与推理取舍。
推荐理由:从 MoE 的稀疏路由、负载均衡到专家并行与部署取舍,系统梳理了这类架构的原理与工程代价。