用 Optimum-Intel 和 OpenVINO GenAI 优化并部署模型
Hugging Face 与 Intel 合作的 Optimum-Intel 支持将 Transformers 模型导出为 OpenVINO IR,并通过 OpenVINO GenAI 的 LLMPipeline 在 C++ 或 Python 中部署。
Hugging Face 与 Intel 合作的 Optimum-Intel 支持将 Transformers 模型导出为 OpenVINO IR,并通过 OpenVINO GenAI 的 LLMPipeline 在 C++ 或 Python 中部署。
Hugging Face 团队探索出把已有模型微调到 1.58bit 的方法,成功将 Llama3 8B 微调为三值权重模型,并在 MMLU 上超过 Llama 1 7B。
推荐理由:作者公开了把已有 Llama3 8B 微调到 1.58bit 的完整技巧与踩坑过程,可迁移到其他模型的低比特微调。
Mistral 宣布 la Plateforme 推出免费额度,并对全线模型降价,其中 Mistral Small 与 Codestral 输入输出价格均下调 80%,Mistral Large 下调 33%。
推荐理由:官方一次性公布免费额度、全线降价与新模型,可据此比较各档模型的成本与部署选择。
Hugging Face 发布 Accelerate 1.0.0 首个候选版本,可通过 pip install --pre accelerate 或 Docker 镜像试用。
Hugging Face 博客盘点了 Hub 上 5 个常被忽视的工具:ZeroGPU、多进程 Docker、Gradio API、Webhooks 和 Nomic Atlas。
Hugging Face 发布教程,介绍如何用 TGI 和 Deep Learning Containers 在 Google Cloud Vertex AI 上部署 Meta Llama 3.1 405B。
Hugging Face 发布 ggml 入门指南,介绍这个用 C/C++ 编写、专注 Transformer 推理的开源机器学习库。
Mistral AI 宣布在 La Plateforme 上支持对 Mistral Large 2 和 Codestral 等旗舰及专用模型进行定制,可通过 base prompt、few-shot prompting 或微调实现,并支持自带数据集。
OpenAI 在 API 中推出结构化输出(Structured Outputs),模型输出现在可以可靠地遵循开发者提供的 JSON Schema。
推荐理由:OpenAI 官方说明 API 新增结构化输出,模型输出可稳定遵循开发者提供的 JSON Schema。
Hugging Face 展示了如何借助 Diffusers 库中的 Quanto 量化工具降低 Transformer 扩散管线的显存占用。以 PixArt-Sigma、Stable Diffusion 3 和 Aura Flow 为例,将扩散主干与文本编码器量化为 FP8 后,SD3 推理显存从 16.403 GB 降至约 8.2 GB,质量几乎无损、延迟略有上升。
Hugging Face 面向 Enterprise Hub 组织推出 NVIDIA NIM API(serverless),可在 Hugging Face Hub 上以无服务器方式对 Llama、Mistral 等开源模型运行推理,接口标准化于 OpenAI API。
Hugging Face 发布教程,介绍如何借助 WWDC 24 的新 Core ML 特性在 Mac 上运行 Mistral 7B,并用不到 4GB 内存完成 7B 参数模型的推理。
推荐理由:Hugging Face 官方给出把 Mistral 7B 转成 Core ML 并跑在 Mac 上的完整步骤,可据此复现端侧部署流程。
Hugging Face 为 TGI 推出 Multi-LoRA 服务功能,只需部署一次基础模型,即可根据请求中的 adapter_id 动态加载多个 LoRA 适配器,官方称可服务 30 个模型。
推荐理由:TGI 新增 Multi-LoRA 服务能力,给出部署命令与成本对比,可据此评估多微调模型的合并部署方案。
OpenAI 为 ChatGPT Enterprise 新增 Compliance API 集成、SCIM 和 GPT 控制功能,用于支持大规模合规项目、数据安全和用户访问管理。
Hugging Face 与 KerasHub 实现共享模型保存格式,Hub 上 30 万+ Transformers 模型现可直接加载进 KerasHub,首批支持 Gemma 1/2、Llama 3 和 PaliGemma。KerasHub 模型可在 TensorFlow、JAX、PyTorch 后端间一行代码切换,需将 keras 升级至 3.3.3 以上。
Hugging Face 宣布 Google Cloud TPU v5e 正式上线 Inference Endpoints 和 Spaces,提供 v5litepod-1(1 核 16 GB,$1.375/小时)、v5litepod-4(4 核 64 GB,$5.50/小时)和 v5litepod-8(8 核 128 GB,$11.00/小时)三种配置。
Intel 与 MILA 将多模态蛋白质语言模型 ProtST 重新架构并发布在 Hugging Face Hub,并基于 Optimum for Intel Gaudi 库在 Gaudi 2 上完成推理与微调。
Google 发布 Gemma 2 系列开源大模型,包含 9B 和 27B 两个尺寸,各有基础版与指令微调版共 4 个开放权重模型,上下文长度 8K token。
推荐理由:文章梳理了 Gemma 2 的滑动窗口注意力、软上限与知识蒸馏等训练改动,并给出与 Llama 3、Qwen 1.5 的基准对比。
XLSCOUT 发布专有嵌入模型 ParaEmbed 2.0,基于高质量多领域专利数据微调,准确率较 2023 年 10 月发布的 ParaEmbed 1.0 提升 23%。
视觉沟通软件公司 Prezi 加入 Hugging Face Expert Support Program,将更小、更高效的开源模型整合进其 ML 工作流。Prezi 旗舰产品 Prezi AI 结合视觉模型、文本模型和 VLM,专家建议在素材检索流程中加入开源 re-ranker 模型,以更低成本、更快速度找到最佳图文素材。
Hugging Face Accelerate 在 0.30.0 版本中为 FSDP 加入自动 upcasting,使其在混合精度下与 DeepSpeed 行为对齐。
Hugging Face Embedding Container for Amazon SageMaker 正式 GA,AWS 用户可在 SageMaker 上部署嵌入模型构建 RAG 等生成式 AI 应用。
Mistral AI 于 6 月 5 日至 30 日举办线上微调黑客松,参赛项目须使用其全新微调 API,提交截止 6 月 30 日。前三名各获 2500 欧元 Mistral API 额度,入选者可申请 100 美元免费额度,需在 6 月 10 日前填写表单。评审按影响力、技术实现、创意和展示各占 25% 打分,团队最多 4 人。
Hugging Face 将辅助生成(Assisted Generation)适配并优化到 Intel Gaudi,现已集成进 Optimum Habana。该方法基于 Speculative Sampling,用草稿模型生成 K 个 token 再由目标模型评估,大型 Transformer 模型通常可获得约 2x 加速。
Hugging Face 发布 TGI Benchmarking 工具,可在 Hugging Face Space 中部署 TGI 并评测吞吐量与延迟,帮助用户按需调优 LLM 部署。该工具随 TGI 一同安装,需在服务器端运行,通过 CLI 交互式执行,并提供预填充吞吐量与延迟散点图等可视化结果。
Hugging Face 宣布可在 AWS Inferentia2 上部署 Hub 中超过 100,000 个公开模型,新增 14 种模型架构和 6 类机器学习任务,并支持在 Amazon SageMaker 上使用。
Hugging Face Spaces 发布 Dev Mode,支持一键从 VS Code 或 SSH 直连 Space 编辑代码,无需再用 git 推送本地改动。该功能目前处于 beta 阶段,仅面向 PRO 订阅用户开放,可在 Space 设置中启用。编辑后直接在 Space 内点击 Refresh 即可测试,满意后再 commit 和 merge 保存改动。
Hugging Face 与 Dell 联合发布 Dell Enterprise Hub,可在 Dell 平台上本地训练和部署开源模型,将原本数周的工程工作缩短至几分钟。
Hugging Face 宣布 AMD Instinct MI300 已在 Hugging Face 平台获得一等公民级集成,用户无需改动代码即可通过 transformers 和 text-generation-inference 在 Azure ND MI300x V5 虚拟机上部署模型。
Hugging Face 与微软在 Microsoft Build 上宣布深化战略合作,将 Llama 3、Mistral 7B、Command R Plus、Qwen 1.5 110B 等热门开源大模型加入 Azure Model Catalog 的 Hugging Face Collection,支持从 Azure AI Studio 一键部署。
Hugging Face 在 Transformers 中推出 KV Cache 量化功能,通过降低 KV 缓存精度减少长上下文生成的内存占用,对生成质量影响较小。
Hugging Face 现已支持通过 AWS 账户将组织升级至 Enterprise Hub,订阅入口在 AWS Marketplace,定价与 Hugging Face 公开定价一致,但账单由 AWS 账户结算。
Intel 展示了基于 OPEA 平台、用 Intel Gaudi 2 加速器和 Xeon CPU 构建企业级 RAG 应用的方案,嵌入模型跑在 Granite Rapids CPU 上,LLM 跑在 Gaudi 2 上。
Stack Overflow 与 OpenAI 宣布达成 API 合作,将这一技术知识平台与 OpenAI 的大语言模型结合,为开发者提供支持。Stack Overflow 称其拥有全球领先的高技术内容知识平台,OpenAI 则拥有最受欢迎的 AI 开发 LLM 模型。
Artificial Analysis 开发的 LLM Performance Leaderboard 现已上线 Hugging Face,覆盖超过 100 个 serverless LLM API 端点,综合评估质量、价格与速度。
Hugging Face 发布自定义推理 handler 方案,在 Inference Endpoints 上把 Whisper 语音识别、Pyannote 说话人分离与推测解码整合进单一 API 端点。
OpenAI 宣布 GPT-4 API 正式可用,GPT-3.5 Turbo、DALL·E 和 Whisper API 也同步转为正式可用。同时 OpenAI 发布了旧版 Completions API 模型的退役计划,这些模型将于 2024 年初退役。
推荐理由:OpenAI 官方公布 GPT-4 等 API 正式可用,并给出旧版 Completions 模型的退役时间表,便于开发者安排迁移。
OpenAI 为 API 客户新增更多安全功能与控制项,并更新 Assistants API,同时提供更好地管理成本的工具,以加强对企业的支持。
Zama 团队将基于全同态加密(FHE)的 Concrete ML 预编译模型部署到 Hugging Face Endpoints,用户可通过自定义 inference handler 一键部署并运行加密推理。
Ryght 正式公开发布面向生命科学知识工作者的免费安全平台 Ryght Preview,用于加速药物研发、临床试验与商业化中的数据分析。