Gradio 5 安全审计:Trail of Bits 发现的风险已全部修复
Hugging Face 委托 Trail of Bits 对 Gradio 5 进行独立安全审计,发现的全部安全风险已在 Gradio 5.0 发布前修复并通过验证。
Hugging Face 委托 Trail of Bits 对 Gradio 5 进行独立安全审计,发现的全部安全风险已在 Gradio 5.0 发布前修复并通过验证。
Hugging Face 发布 Gradio 5 稳定版,开发者可用几行 Python 构建生产级机器学习 Web 应用,通过 pip install --upgrade gradio 升级。
推荐理由:官方列出 Gradio 5 在 SSR 加载、流式与安全上的具体改动,可据此判断现有应用的迁移成本。
Intel Labs 与 Hugging Face 提出动态推测解码方法,可根据助手模型置信度逐 token 动态调整推测前瞻长度,文本生成最高提速 2.7 倍。
Hugging Face 的 Xet 团队针对 Hub 上超 2.2PB 的 Parquet 存储测试了字节级 CDC 去重效果:追加 10,000 行可去重 99.1%,仅需额外 20MB;但修改一行因列头含绝对偏移量,去重率降至 89%,需额外 230MB。团队提出改用相对偏移量、按行组做内容定义分块等方案,并希望与 Apache Arrow 合作落地。
非凡研究 6 月报告显示,全球 1500 家活跃 AI 公司中有 751 家位于中国,其中 103 家已向海外扩张。华为、腾讯、阿里聚焦云计算与 AI 基础设施,主攻东南亚和中东;字节跳动七个月内推出 11 款海外应用,CapCut 月活超 3 亿、截至 2024 年 7 月移动端累计收入 1.25 亿美元。
Hugging Face 发布 BenCzechMark,首个面向捷克语的大语言模型综合评测套件,涵盖 9 大类共 50 项任务,其中 90% 为原生非翻译内容。配套榜单已收录超过 25 个不同规模的开源模型,任务采用 Acc、EM、AUROC、Ppl 等指标,并区分阅读理解、事实知识、捷克语理解、语言建模、数学推理、自然语言推理、命名实体识别、情感分析与文档检索等类别。
Meta 发布 Llama 3.2 系列共十款开放权重模型,包括 5 款多模态视觉模型和 5 款纯文本模型,均已上线 Hugging Face Hub。
推荐理由:Hugging Face 官方给出 Llama 3.2 十款开源权重的规格、基准与端侧运行方式,可据此判断多模态与 1B/3B 小模型的落地路径。
Hugging Face 的 Daily Papers 页面已收录超过 3,700 篇论文、订阅者突破 12k,作者可一键认领论文并关联模型、数据集与 demo。用户还能提交论文、用 @librarian-bot 推荐相似论文、多语言评论并借助内置翻译交流,订阅后每个工作日可收到最新论文邮件。
Hugging Face 团队探索出把已有模型微调到 1.58bit 的方法,成功将 Llama3 8B 微调为三值权重模型,并在 MMLU 上超过 Llama 1 7B。
推荐理由:作者公开了把已有 Llama3 8B 微调到 1.58bit 的完整技巧与踩坑过程,可迁移到其他模型的低比特微调。
Mistral AI 发布 Pixtral 12B,一个原生多模态模型,采用新训练的 400M 参数视觉编码器和基于 Mistral Nemo 的 12B 多模态解码器,支持可变图像尺寸与 128k token 上下文窗口内的多图输入,以 Apache 2.0 许可开源。
推荐理由:官方给出架构、评测协议与多模态基准对比,可据此判断 12B 级开源多模态模型的真实能力边界。
Hugging Face Hub 为数据集上线 SQL Console,用户可在浏览器中直接对数据集运行 SQL 查询。该控制台由 DuckDB WASM 驱动,100% 本地运行,支持完整 DuckDB 语法、结果导出为 parquet 及公开数据集查询链接分享。内存上限约 3GB,暂不支持 hf:// 协议。
Hugging Face 在 Transformers 中推出 DataCollatorWithFlattening,使无 padding 的打包指令微调与 Flash Attention 2 兼容,训练吞吐最高提升 2 倍。
推荐理由:官方给出打包训练与 Flash Attention 2 兼容的实现方式和吞吐、显存实测数据,可据此评估自家训练流程的改造空间。
Hugging Face 发布教程,介绍如何用 TGI 和 Deep Learning Containers 在 Google Cloud Vertex AI 上部署 Meta Llama 3.1 405B。
Hugging Face 发布 ggml 入门指南,介绍这个用 C/C++ 编写、专注 Transformer 推理的开源机器学习库。
阿布扎比技术创新研究院(TII)发布 Falcon Mamba 7B,这是首个通用大规模纯 Mamba 模型,采用 TII Falcon Mamba 7B License 1.0 开放获取,已在 Hugging Face 生态上线。
推荐理由:TII 发布首个纯 Mamba 架构的 7B 开源模型,并给出与同规模 Transformer 的基准对比和长序列内存数据。
Hugging Face 在 Transformers 中推出统一的工具调用 API,同一套代码可在 Mistral、Cohere、NousResearch 和 Llama 等模型家族间通用,几乎无需针对模型做改动。
推荐理由:Hugging Face 把工具调用统一进 chat template,读者可据此判断跨模型复用同一套代码的可行边界。
Hugging Face 宣布收购西雅图公司 XetHub,其创始团队此前在 Apple 构建并扩展内部 ML 基础设施,团队共 12 人。XetHub 的技术让 Git 能扩展到 TB 级仓库,HF CTO Julien Chaumond 表示该团队将帮助 Hub 把存储后端从 Git LFS 换成自研的更好版本。
推荐理由:Hugging Face 官方披露收购 XetHub 的动机与存储后端替换计划,可了解 Hub 未来在超大模型与数据集上的版本管理方向。
Hugging Face 梳理了截至 2024 年 8 月 6 日 Hub 上的安全功能:面向所有用户的细粒度 Token、2FA、GPG commit signing、组织访问控制和自动化安全扫描(ClamAV 恶意软件扫描、picklescan 与 trufflehog 密钥扫描)。
Google 在 Gemma 2 发布一个月后扩充 Gemma 模型系列,新增 2.6B 参数的 Gemma 2 2B(含 base 与指令微调版)、安全分类器 ShieldGemma 以及稀疏自编码器套件 Gemma Scope。
推荐理由:Google 一次补齐 Gemma 2 的小尺寸、安全分类器和可解释性工具,读者可据此判断端侧部署与内容审核的可用选项。
Meta 发布 Llama 3.1,包含 8B、70B、405B 三个尺寸的 base 与 instruct 版本共六个开放权重模型,全部支持 128K token 上下文和 8 种语言,并新增 Llama Guard 3 与 Prompt Guard 两个安全模型。
推荐理由:Hugging Face 官方梳理了 Llama 3.1 三个尺寸的显存需求、量化方案与工具调用格式,可作为部署选型的参考。
Hugging Face 发布教程,介绍如何借助 WWDC 24 的新 Core ML 特性在 Mac 上运行 Mistral 7B,并用不到 4GB 内存完成 7B 参数模型的推理。
推荐理由:Hugging Face 官方给出把 Mistral 7B 转成 Core ML 并跑在 Mac 上的完整步骤,可据此复现端侧部署流程。
Mistral AI 与 NVIDIA 合作发布 12B 模型 Mistral NeMo,支持最高 128k token 上下文窗口,并以 Apache 2.0 许可开放预训练基座和指令微调 checkpoint。
推荐理由:Mistral 与 NVIDIA 联合发布的 12B 模型,给出 128k 上下文、Apache 2.0 权重和 FP8 推理等关键规格,便于评估其替换 Mistral 7B 的可行性。
Hugging Face 发布 Docmatix 文档视觉问答(DocVQA)数据集,包含 240 万张图像和 950 万对 Q/A,规模是此前数据集的 240 倍。
Hugging Face 为 TGI 推出 Multi-LoRA 服务功能,只需部署一次基础模型,即可根据请求中的 adapter_id 动态加载多个 LoRA 适配器,官方称可服务 30 个模型。
推荐理由:TGI 新增 Multi-LoRA 服务能力,给出部署命令与成本对比,可据此评估多微调模型的合并部署方案。
Mistral 发布 Codestral Mamba,这是一个基于 Mamba 架构的代码模型,采用 Apache 2.0 许可,可免费使用、修改和分发。该模型为指令模型,参数量 7,285,403,648,具备线性时间推理能力,在 256k tokens 的上下文检索测试中表现良好,官方称其代码与推理能力可对标 SOTA Transformer 模型。
推荐理由:Mamba 架构首次以代码模型形态开放权重,读者可据此了解线性时间推理在代码场景的落地方式。
Hugging Face 发布 SmolLM 系列小语言模型,包含 135M、360M 和 1.7B 三个参数规模,并同步开源训练语料 SmolLM-Corpus。
推荐理由:官方披露了 135M 到 1.7B 三档小模型的训练数据构成与同尺寸对比结果,可据此判断端侧部署的可行边界。
Numina 与 Hugging Face 合作的 NuminaMath 7B TIR 赢得首届 AI 数学奥林匹克(AIMO)进步奖,在私有测试集 50 题中解出 29 题。
推荐理由:获胜方案完整公开了两阶段微调、SC-TIR 解码与内部验证集设计,可迁移到其他推理类竞赛与模型训练。
Hugging Face 与 KerasHub 实现共享模型保存格式,Hub 上 30 万+ Transformers 模型现可直接加载进 KerasHub,首批支持 Gemma 1/2、Llama 3 和 PaliGemma。KerasHub 模型可在 TensorFlow、JAX、PyTorch 后端间一行代码切换,需将 keras 升级至 3.3.3 以上。
Banque des Territoires(CDC 集团)、Polyconseil 与 Hugging Face 合作,为法国校园生态改造项目 EduRénov 打造基于 RAG 的主权数据方案,首阶段已完成。该方案用于优化 BdT 对地方政府的支持流程,目标覆盖 10,000 个学校设施改造项目、5 年内实现 40% 节能,CDC 为此投入 20 亿欧元贷款和 5000 万欧元前期工程资金。
Hugging Face 宣布 Google Cloud TPU v5e 正式上线 Inference Endpoints 和 Spaces,提供 v5litepod-1(1 核 16 GB,$1.375/小时)、v5litepod-4(4 核 64 GB,$5.50/小时)和 v5litepod-8(8 核 128 GB,$11.00/小时)三种配置。
Hugging Face 为 Dataset Hub 的数据集搜索新增按模态、大小、格式和库四项筛选功能,可按 Text、Image、Audio 等模态及最小/最大行数过滤,并支持 Parquet、WebDataset 等格式和 Pandas、Dask、Datasets 库兼容性筛选。这些筛选可与语言、任务、许可证等现有条件组合使用,覆盖 Hub 上超过 180,000 个公开数据集。
Hugging Face 用 transformers.agents 构建的 ReactCodeAgent 在 GAIA 验证集上取得 44.2%,排名第一,比第二名高 4 个百分点;测试集为 33.3%,排名第二,并在 Level 3 难题上取得最佳平均分。
推荐理由:官方披露 Code Agent 在 GAIA 上的成绩与实现细节,可看到代码动作与多智能体编排的具体做法。
Google 发布 Gemma 2 系列开源大模型,包含 9B 和 27B 两个尺寸,各有基础版与指令微调版共 4 个开放权重模型,上下文长度 8K token。
推荐理由:文章梳理了 Gemma 2 的滑动窗口注意力、软上限与知识蒸馏等训练改动,并给出与 Llama 3、Qwen 1.5 的基准对比。
Hugging Face Accelerate 在 0.30.0 版本中为 FSDP 加入自动 upcasting,使其在混合精度下与 DeepSpeed 行为对齐。
Stability AI 的 Stable Diffusion 3 Medium(2B 参数)已上线 Hugging Face Hub 并支持 Diffusers 调用,官方同时提供了模型、Diffusers 集成以及 SD3 Dreambooth 和 LoRA 训练脚本。
推荐理由:官方给出 SD3 Medium 在 Diffusers 中的接入方式、显存优化与微调脚本,可直接对照复现。
Hugging Face 宣布重新设计 Transformers 文档,原因是现有文档内容零散、导航困难且过时。新版将面向构建 AI 产品的开发者,采用代码优先、解决方案导向的写法,并放弃 Diátaxis 的刚性结构,改为随内容自然生长的有机结构,让新增内容与原有文档融合而非层层叠加。
Artificial Analysis 推出文生图排行榜与 Image Arena,基于超 45,000 次人类图像偏好投票计算 ELO 分数,覆盖 Midjourney、DALL·E、Stable Diffusion、Playground 等开源与闭源模型。
Mistral AI 在 la Plateforme 上线模型定制功能,提供三种微调入口:面向自建基础设施的开源微调代码库 mistral-finetune、平台上的无服务器微调服务,以及面向特定客户的定制训练服务。
推荐理由:Mistral 给出微调的三条落地路径与 LoRA 效率对比,读者可据此判断自建还是托管微调更合适。
Hugging Face 将辅助生成(Assisted Generation)适配并优化到 Intel Gaudi,现已集成进 Optimum Habana。该方法基于 Speculative Sampling,用草稿模型生成 K 个 token 再由目标模型评估,大型 Transformer 模型通常可获得约 2x 加速。
Mistral AI 发布首个代码模型 Codestral,22B 开放权重,支持 80+ 编程语言,上下文窗口 32k,并通过 fill-in-the-middle 机制补全代码。
推荐理由:Codestral 以 22B 开放权重和 32k 上下文切入代码补全,读者可据此判断它在延迟与长仓库补全上的取舍。