Hugging Face 与 IISc 合作,推动印度多语言模型构建
Hugging Face 与印度科学研究所 IISc/ARTPARK 达成合作,让全球开发者更便捷地使用印度多模态多语言数据集 Vaani。
Hugging Face 与印度科学研究所 IISc/ARTPARK 达成合作,让全球开发者更便捷地使用印度多模态多语言数据集 Vaani。
Artificial Analysis 发布 Big Bench Audio 评测数据集,用于评估音频语言模型的推理能力,该数据集将 Big Bench Hard 的 1000 道题改编为音频形式。
Hugging Face 用 optimum-benchmark 在 Google Cloud 的 C4(第 5 代 Xeon,Emerald Rapids,支持 AMX)与 N2(第 3 代 Xeon,Ice Lake)实例上对比了文本嵌入与文本生成两项智能体负载。
Hugging Face 的开源模型现已通过 Amazon Bedrock Marketplace 提供,AWS 客户可部署 83 个开源模型构建生成式 AI 应用。
Google 发布新一代视觉语言模型 PaliGemma 2,沿用 SigLIP 图像编码器并将文本解码器升级为 Gemma 2,提供 3B、10B、28B 三种参数规格,均支持 224x224、448x448、896x896 三种输入分辨率,而上一代 PaliGemma 仅有 3B 版本。
Hugging Face 用 Keras、JAX 和 TPU 搭建了一个 chatbot arena,让多个 LLM 同时处理同一段日历 API 调用对话,测试它们在用户用自然语言指出错误后能否修正代码。实验在 TPU v5e 2x4 上以 bfloat16 同时加载了 5 个约 8B 参数模型和 3 个约 2B 参数模型,共 7 个 LLM,通过 Gradio Spaces 界面并行对话。
Hugging Face 博客发布 Judge Arena,一个让用户对两个 LLM 裁判的评分和评语进行投票对比的平台,投票结果汇总为 Elo 排行榜并每小时更新。
Google DeepMind 与 Hugging Face 在 Transformers v4.46.0 中发布 SynthID Text,可通过 logits processor 为 AI 生成文本加水印,并用分类器检测。
推荐理由:Google DeepMind 与 Hugging Face 把文本水印做成 Transformers 里的可调用组件,读者可据此了解生成内容溯源的具体做法与边界。
Hugging Face 构建了 FineVideo 数据集,包含 4.3 万个视频、总时长 3.4 千小时,并配有丰富描述、叙事细节、场景切分和 QA 对。该数据集从 YouTube-Commons 的 190 万条英文视频出发,经词密度与视觉动态性过滤后,用 Gemini 1.5 Pro 和 GPT-4o 完成内容标注与结构化输出。
Hugging Face 发布教程,介绍如何用 TGI 和 Deep Learning Containers 在 Google Cloud Vertex AI 上部署 Meta Llama 3.1 405B。
Hugging Face 复现 Google 的 Infini-Attention 发现,随着记忆压缩次数增加,模型性能持续下降,且 90% 的调试时间花在收敛问题上。
Google 在 Gemma 2 发布一个月后扩充 Gemma 模型系列,新增 2.6B 参数的 Gemma 2 2B(含 base 与指令微调版)、安全分类器 ShieldGemma 以及稀疏自编码器套件 Gemma Scope。
推荐理由:Google 一次补齐 Gemma 2 的小尺寸、安全分类器和可解释性工具,读者可据此判断端侧部署与内容审核的可用选项。
Hugging Face 与 KerasHub 实现共享模型保存格式,Hub 上 30 万+ Transformers 模型现可直接加载进 KerasHub,首批支持 Gemma 1/2、Llama 3 和 PaliGemma。KerasHub 模型可在 TensorFlow、JAX、PyTorch 后端间一行代码切换,需将 keras 升级至 3.3.3 以上。
Hugging Face 宣布 Google Cloud TPU v5e 正式上线 Inference Endpoints 和 Spaces,提供 v5litepod-1(1 核 16 GB,$1.375/小时)、v5litepod-4(4 核 64 GB,$5.50/小时)和 v5litepod-8(8 核 128 GB,$11.00/小时)三种配置。
Google 发布 Gemma 2 系列开源大模型,包含 9B 和 27B 两个尺寸,各有基础版与指令微调版共 4 个开放权重模型,上下文长度 8K token。
推荐理由:文章梳理了 Gemma 2 的滑动窗口注意力、软上限与知识蒸馏等训练改动,并给出与 Llama 3、Qwen 1.5 的基准对比。
Google 发布视觉语言模型系列 PaliGemma,由 SigLIP-So400m 图像编码器和 Gemma-2B 文本解码器组成,可输入图像与文本并输出文本。
推荐理由:Google 开源视觉语言模型 PaliGemma 的架构、三种权重类型与微调路径都在文中给出,可据此判断它适合哪些下游任务。
Hugging Face 推出 Open Medical-LLM Leaderboard,用统一平台评测大语言模型在医疗任务上的表现,以准确率为主要指标,覆盖 MedQA、MedMCQA、PubMedQA 及 MMLU 的医学与生物学子集。
Hugging Face 推出 Deploy on Google Cloud 集成,可将数千个基础模型通过 Vertex AI 或 GKE 部署到用户自己的 Google Cloud 账号,并作为 API Endpoint 运行。
Google 发布代码专用开源模型系列 CodeGemma,基于预训练的 2B 和 7B Gemma checkpoint 继续训练,额外使用 5000 亿 token 的英文、数学和代码数据,共三个版本:2B 基础模型专注代码填充,7B 基础模型混合代码填充与自然语言,7B Instruct 面向代码对话。
推荐理由:Google 开源代码专用模型 CodeGemma 的三个版本与 Hugging Face 生态集成细节,可据此判断代码补全场景的选型。
Lighthouz AI 联合 Hugging Face 推出 Chatbot Guardrails Arena,让用户与两个匿名 LLM 聊天,尝试诱导其泄露虚构银行 XYZ001 客户的敏感财务信息,再投票选出隐私保护更强的模型。
Hugging Face 发布教程,介绍如何用 Transformers 和 PEFT 库对 Google DeepMind 的开源模型 Gemma(2B 和 7B 参数)进行参数高效微调(PEFT)。教程以 LoRA 为例,结合 QLoRA 的 4-bit 量化,在 GPU 和 Cloud TPU 上以低显存成本完成微调,并使用 Abirate/english_quotes 数据集演示训练流程。
Google 发布开源大模型家族 Gemma,包含 2B 和 7B 两种规模,各有基础版与指令微调版共 4 个开放模型,上下文长度 8K tokens。Hugging Face 同步完成集成,覆盖 Transformers 4.38、Google Cloud、Inference Endpoints 以及用 TRL 在单卡上微调的示例。
推荐理由:Google 开源 Gemma 后,Hugging Face 同步给出 2B/7B 四个模型的集成与部署路径,可对照榜单分数判断其定位。
Hugging Face 宣布与 Google Cloud 建立战略合作,围绕开放科学、开源、云与硬件展开协作,帮助企业在 Hugging Face 开放模型与 Google Cloud 基础设施上构建自己的 AI。
Hugging Face 发布 aMUSEd,这是 Google MUSE 的开源复现,采用 Masked Image Model 而非主流潜在扩散方法,以研究预览形式在宽松许可下开放。
OpenAI 联合 Anthropic、Google 和 Microsoft 宣布 Frontier Model Forum 新任执行董事,并设立 1000 万美元 AI 安全基金。该论坛由上述四家公司共同推进,此次更新聚焦于治理层人事与安全资金两项安排。
Hugging Face Diffusers 现已支持在 Cloud TPU 上通过 JAX 运行 Stable Diffusion XL 推理。该方案借助 JAX jit 编译与 XLA pmap 并行,在多个 TPU v5e-4 实例上约 4 秒可生成四张 1024×1024 图像,实际生成时间约 2.3 秒。TPU v5e 成本不到 TPU v4 的一半。
OpenAI 宣布参与组建一个新的行业机构 Frontier Model Forum,以推动前沿 AI 系统的安全与负责任开发。该机构的目标包括推进 AI 安全研究、识别最佳实践与标准,并促进政策制定者与产业界之间的信息共享。
Hugging Face 发布端到端教程,演示如何用 🤗 Transformers、TensorFlow 和 TPU 从零训练一个 RoBERTa base 模型,涵盖训练 tokenizer、处理 WikiText v1 数据集、生成 TFRecord 分片并上传至 Google Cloud Storage,以及最终模型训练与上传的完整流程。
Hugging Face 的 AI for Game Development 系列教程第五篇展示了用 ChatGPT 为农场游戏生成剧情:先让模型写故事梗概,再通过多轮对话要求其更具原创性并去除魔法元素,最后生成游戏与商店物品描述。
Hugging Face 博客梳理了让对话智能体有用的关键技术,包括指令微调(IFT)、监督微调(SFT)、思维链(CoT)提示和基于人类反馈的强化学习(RLHF),并对比了 LaMDA、BlenderBot 3、Sparrow、ChatGPT/InstructGPT 和 Anthropic Assistant 在访问方式、训练数据、模型架构与评测方向上的差异。
Hugging Face 博客图解 RLHF 的完整流程,将其拆为预训练语言模型、收集人类偏好数据训练奖励模型、用 PPO 微调语言模型三个核心步骤。
推荐理由:把 RLHF 拆成预训练、奖励模型、PPO 微调三步,并梳理了 TRL、TRLX、RL4LMs 等开源工具与主要论文,便于建立整体认识。
Hugging Face Diffusers 自 0.5.1 版本起支持 Flax,可在 Colab、Kaggle 或 Google Cloud 的 TPU 上运行 Stable Diffusion 推理。
推荐理由:官方教程给出在 TPU 上并行跑 Stable Diffusion 的完整代码路径,可迁移到自己的推理部署。
Hugging Face 展示了如何将 ViT B/16 模型部署到 Google Cloud 的 Vertex AI 平台,用远少于 Kubernetes 方案的代码量获得同等扩展能力。
Hugging Face 与 Graphcore 联合发布 Optimum Graphcore 库,提供预训练 ViT 模型检查点和配置文件,可在 IPU 上直接微调。博文以 ImageNet-21k 预训练的 ViT 为例,演示在 ChestX-ray14 数据集上的完整微调流程,并附有 notebook。IPU 的 MIMD 架构与流水线并行可提升训练效率。
Hugging Face 与外部贡献者为 Transformers 加入了 Vision Transformer、Masked Autoencoders、RegNet、ConvNeXt 等 TensorFlow 视觉模型,并演示如何用 TensorFlow Serving 在本地部署 ViT 图像分类模型,将其暴露为 REST 或 gRPC 端点。
Hugging Face 发布机器学习专家访谈,嘉宾 Margaret Mitchell 曾任 Google 伦理 AI 团队创始人兼联合负责人,现于 Hugging Face 制定伦理 AI 研究协议与包容性招聘体系。她因在微软 Seeing AI 项目中目睹图像数据偏差而转向伦理 AI,指出 ML 团队普遍缺乏相关概念与词汇,且行业"Alpha"文化使女性主导的伦理研究被轻视。
BERT 是 Google AI Language 研究人员于 2018 年开发的 NLP 模型,全称 Bidirectional Encoder Representations from Transformers,可解决情感分析、命名实体识别等 11+ 种常见语言任务。
Hugging Face 发布教程,演示如何用 🤗 datasets 加载 beans 图像分类数据集,并借助 🤗 transformers 微调预训练 ViT 模型。教程使用 google/vit-base-patch16-224-in21k 及其配套 ViTImageProcessor,将图像切分为 patch 并嵌入为 token 序列后送入 Transformer 训练。
Hugging Face 将 Google DeepMind 的 Perceiver IO 加入 Transformers 库,这是首个可处理文本、图像、音频、视频、点云等多种模态及其组合的 Transformer 类模型。
推荐理由:Hugging Face 官方详解 Perceiver IO 的接入方式,读者可据此了解这套架构如何处理文本、图像、音频等多模态输入。
Hugging Face 在社区周期间用 10 亿句对训练出 SOTA 句嵌入模型,硬件为 7 块 TPU v3-8。方法采用批内负样本的对比学习(InfoNCE/NTXentLoss),并指出更大 batch size、难负样本与跨数据集批次能提升效果。模型与数据集已在模型卡中公开。