Hugging Face 发布 Open Medical-LLM Leaderboard:医疗大模型评测基准
Hugging Face 推出 Open Medical-LLM Leaderboard,用统一平台评测大语言模型在医疗任务上的表现,以准确率为主要指标,覆盖 MedQA、MedMCQA、PubMedQA 及 MMLU 的医学与生物学子集。
Hugging Face 推出 Open Medical-LLM Leaderboard,用统一平台评测大语言模型在医疗任务上的表现,以准确率为主要指标,覆盖 MedQA、MedMCQA、PubMedQA 及 MMLU 的医学与生物学子集。
Meta 发布 Llama 3 系列开源大模型,包含 8B 和 70B 两个尺寸,各有 base 与 instruct 版本,并推出基于 Llama 3 8B 微调的安全模型 Llama Guard 2。
推荐理由:Meta 发布 Llama 3 并同步落地 Hugging Face 生态,读者可据此了解新分词器与 8K 上下文带来的变化。
Zama 团队将基于全同态加密(FHE)的 Concrete ML 预编译模型部署到 Hugging Face Endpoints,用户可通过自定义 inference handler 一键部署并运行加密推理。
Ryght 正式公开发布面向生命科学知识工作者的免费安全平台 Ryght Preview,用于加速药物研发、临床试验与商业化中的数据分析。
Gradio 推出 reload 模式,用 `gradio app.py` 替代 `python app.py` 启动应用,即可在不重启服务器的情况下拉取源码最新改动。
Hugging Face 上线 LiveCodeBench 排行榜,基于 UC Berkeley、MIT 和 Cornell 研究者开发的基准,从 LeetCode、AtCoder、CodeForces 持续收集带发布日期的编程题,通过“随时间滚动”评估窗口检测并防止数据污染。
Hugging Face 发布 Idefics2,一个 8B 参数的通用多模态模型,可接受任意文本与图像序列输入并生成文本回复,采用 Apache 2.0 开源许可,已集成进 Transformers。
推荐理由:8B 参数、Apache 2.0 许可并同步开源指令微调数据集,可据此判断社区多模态微调的门槛变化。
Hugging Face 发布视觉语言模型入门指南,梳理其核心架构由图像编码器、嵌入投影器和文本解码器组成,并盘点 LLaVA 1.6、CogVLM、Qwen-VL、Yi-VL-34B 等开源模型。文章还介绍了 Vision Arena、Open VLM Leaderboard 等评测榜单及 MMMU、MMBench 等基准,并演示如何用新版 trl 微调这类模型。
Hugging Face 推出 Deploy on Google Cloud 集成,可将数千个基础模型通过 Vertex AI 或 GKE 部署到用户自己的 Google Cloud 账号,并作为 API Endpoint 运行。
Google 发布代码专用开源模型系列 CodeGemma,基于预训练的 2B 和 7B Gemma checkpoint 继续训练,额外使用 5000 亿 token 的英文、数学和代码数据,共三个版本:2B 基础模型专注代码填充,7B 基础模型混合代码填充与自然语言,7B Instruct 面向代码对话。
推荐理由:Google 开源代码专用模型 CodeGemma 的三个版本与 Hugging Face 生态集成细节,可据此判断代码补全场景的选型。
MotherDuck 与 Numbers Station 推出的 DuckDB-NSQL-7B 是专为 DuckDB SQL 设计的大语言模型,基于 Meta Llama-2-7b 微调,并用 DuckDB text-to-SQL 数据对进一步优化,可生成包括官方文档与扩展在内的多种有效 DuckDB SQL 语句。
Hugging Face 宣布与云安全公司 Wiz 合作提升平台及 AI/ML 生态安全,Wiz 研究团队通过 pickle 在沙箱计算环境中运行任意代码,发现了平台的安全缺陷,相关问题已全部修复。Hugging Face 已将 Wiz 用于漏洞管理和云安全态势管理(CSPM),并基于其工具自动修复 Spaces 等产品中的问题。
借助 🤗 Optimum Intel 对 SetFit 模型做训练后静态量化(PTQ),可在 Intel Xeon CPU 上把推理速度提升 7.8 倍,实现生产级部署。
Hugging Face Hub 上线 "Deploy on Cloudflare Workers AI" 集成,让开发者以无服务器 API 方式调用 Llama、Gemma、Mistral 等热门开源模型,由 Cloudflare 边缘数据中心的 GPU 和 Text Generation Inference 驱动,按请求计费、无需自管 GPU。
Pollen Robotics 开源 pollen-vision 库,为机器人提供零样本视觉模型统一接口,首个版本聚焦 3D 物体检测,输出物体在三维空间中的 (x, y, z) 坐标。
Hugging Face 发布面向非技术读者的 Transformers 入门指南,从零解释这一开源 Python 库、Hub 与 Spaces 的基本概念。教程以在 Hugging Face Space 的 JupyterLab notebook 中运行微软 Phi-2 LLM 为例,需租用 24GB 显存的 NVIDIA A10G GPU,每小时仅需几美元。
Hugging Face 发布博客介绍嵌入量化,将 float32 嵌入转为二值或 int8,分别带来 32 倍和 4 倍的内存与存储缩减。
推荐理由:用 41M 维基文本的实测数据说明二值与标量量化在检索速度、内存和成本上的取舍,方法可直接迁移。
Lighthouz AI 联合 Hugging Face 推出 Chatbot Guardrails Arena,让用户与两个匿名 LLM 聊天,尝试诱导其泄露虚构银行 XYZ001 客户的敏感财务信息,再投票选出隐私保护更强的模型。
Hugging Face 发布 Cosmopedia,一个由 Mixtral-8x7B-Instruct-v0.1 生成的合成预训练数据集,包含超过 3000 万个文件、250 亿 token,目标是复现 Phi-1.5 的训练数据。
推荐理由:Hugging Face 公开了从提示词构建到去污染、训练的完整合成数据流水线,可对照 Phi 系列的做法理解预训练数据如何规模化生成。
Hugging Face 与 Intel 合作,通过 Optimum Intel 中的 OpenVINO 集成对微软 Phi-2 模型权重做 4-bit 量化,并在搭载 Core Ultra 7 155H 的中端笔记本上完成推理。
Hugging Face 发布博客介绍 GaLore 优化器,可将优化器状态内存占用降低超过 82.5%,让 70 亿参数模型(如 Llama 架构)在 NVIDIA RTX 4090 等消费级 GPU 上训练。
推荐理由:原文给出 GaLore 与 8-bit 优化器结合的完整用法和可运行代码,读者可据此在消费级显卡上复现大模型训练。
Hugging Face 发布 Quanto,一个面向 Optimum 的 PyTorch 量化后端,支持 int2、int4、int8 和 float8 权重以及 int8、float8 激活,可在 CUDA 和 MPS 等任意设备上运行。
Hugging Face 面向 Enterprise Hub 组织推出 Train on DGX Cloud,可一键调用 NVIDIA H100 GPU 微调 Llama、Mistral、Stable Diffusion 等模型。
Hugging Face 推出 WebSight 数据集,用于训练 AI 将网页截图转换为 HTML 代码,初版 WebSight-v0.1 包含 823,000 对 HTML 与截图,更新版 WebSight-v0.2 改用真实图片和 Tailwind CSS 并扩展至 200 万样本。
Hugging Face 博客展示如何借助 Optimum Intel 与 fastRAG,在基于 Xeon 的 CPU 上为 BGE 等嵌入模型带来显著性能提升,并轻松接入现有 RAG 流水线。
UCLA 研究者发布 ConTextual,一个面向 LMM 的上下文敏感文本密集视觉推理数据集,含 506 条指令,覆盖时间阅读、购物、导航、信息图等 8 类真实场景,并同步上线排行榜。首轮评测 13 个模型,GPT-4V 表现最佳,在抽象推理上超过人类,但在时间相关任务上不及人类;开源模型在多个领域表现明显落后。用 OCR 或 caption 增强 LLM 的方案人类通过率仅 17.2%。
Argilla 与 Hugging Face 推出 Data is Better Together 实验,几天内吸引 350 名社区贡献者完成超 11,000 条 prompt 评分,并发布含 10,000 条 prompt 用户评分的 10k_prompts_ranked 数据集。
Hugging Face 展示了如何用 Optimum Habana 的自定义 pipeline 类在 Intel Gaudi 2 AI 加速器上运行 Llama 2 系列模型(7b、13b、70b)进行文本生成,仅需几行代码即可完成端到端的预处理与后处理。
BigCode 发布 StarCoder2,这是新一代透明训练的开放代码大语言模型,包含 3B、7B、15B 三个尺寸,分别由 ServiceNow、Hugging Face 和 NVIDIA 训练。
推荐理由:BigCode 同时放出三个尺寸的代码模型与配套数据集,读者可据此了解开源代码模型当前的规模与训练数据构成。
Hugging Face 发布 TTS Arena,借鉴 LMSys 的 Chatbot Arena,让用户输入文本后对比两个 TTS 模型的合成语音并投票选出更自然的一方,结果汇入公开排行榜。
Hugging Face 发文梳理 AI 生成内容的水印方案,区分生成时嵌入与生成后添加两类方法,并盘点 Hub 上的相关工具。文中提到 Glaze、Photoguard 可微调图像干扰 AI 处理,Nightshade、Fawkes 则通过"投毒"破坏训练假设;Truepic 按 C2PA 标准嵌入元数据,IMATAG 采用水印器与检测器闭源、调用代码开源的混合模式。
Hugging Face 发布教程,介绍如何用 Transformers 和 PEFT 库对 Google DeepMind 的开源模型 Gemma(2B 和 7B 参数)进行参数高效微调(PEFT)。教程以 LoRA 为例,结合 QLoRA 的 4-bit 量化,在 GPU 和 Cloud TPU 上以低显存成本完成微调,并使用 Abirate/english_quotes 数据集演示训练流程。
Haize Labs 在 Hugging Face 团队支持下发布 Red Teaming Resistance Benchmark,用真实人类越狱提示词测试前沿模型的抗攻击能力,最终得分由 LlamaGuard 与 GPT-4 判定为 Safe 的提示词百分比构成。
Hugging Face 发布 Matryoshka 嵌入模型入门指南,介绍这类模型可将完整嵌入截断为多种维度仍保持性能,灵感来自俄罗斯套娃,由 Kusupati 等人于 2022 年提出。
Google 发布开源大模型家族 Gemma,包含 2B 和 7B 两种规模,各有基础版与指令微调版共 4 个开放模型,上下文长度 8K tokens。Hugging Face 同步完成集成,覆盖 Transformers 4.38、Google Cloud、Inference Endpoints 以及用 TRL 在单卡上微调的示例。
推荐理由:Google 开源 Gemma 后,Hugging Face 同步给出 2B/7B 四个模型的集成与部署路径,可对照榜单分数判断其定位。
Upstage 于 2023 年 9 月发起 Open Ko-LLM Leaderboard,用于评测韩语大语言模型,采用 Ko-ARC、Ko-HellaSwag、Ko-MMLU、Ko-Truthful QA 和 Ko-CommonGEN V2 五项任务,并新建私有测试集以防止数据污染。
Hugging Face 在 PEFT 中新增面向 LoRA 适配器的多种合并方法,包括 cat、linear、svd、ties、dare 和 magnitude_prune 系列,可通过 add_weighted_adapter() 调用。
Hugging Face 发布教程,展示如何用开源 LLM 生成合成数据来训练更小更专用的模型。案例以金融新闻投资者情绪分类为例,用 Mixtral-8x7B-Instruct-v0.1 配合 CoT 与 Self-Consistency 标注数据。
推荐理由:用开源 LLM 生成合成数据再蒸馏小模型的完整流程,附可复用 notebook 与成本、延迟、碳排放对比。
AMD 与 Hugging Face 联合启动 Pervasive AI Developer Contest,设生成式 AI、机器人 AI 和 PC AI 三个赛道,总奖金 16 万美元,单个获奖者最高可得 1 万美元,并提供 700 个 AMD 平台供参赛者使用。
Hugging Face 为 Text Generation Inference(TGI)和 Inference Endpoints 推出 Messages API,从 TGI 1.4.0 起提供与 OpenAI Chat Completion API 兼容的接口,可直接配合 OpenAI 客户端库以及 LangChain、LlamaIndex 使用。
推荐理由:官方给出 OpenAI 兼容接口的接入方式与限制,读者可据此评估把现有 OpenAI 调用迁到开源模型的成本。