Hugging Face 支持从 Hub 部署模型到 AWS Inferentia2
Hugging Face 宣布可在 AWS Inferentia2 上部署 Hub 中超过 100,000 个公开模型,新增 14 种模型架构和 6 类机器学习任务,并支持在 Amazon SageMaker 上使用。
Hugging Face 宣布可在 AWS Inferentia2 上部署 Hub 中超过 100,000 个公开模型,新增 14 种模型架构和 6 类机器学习任务,并支持在 Amazon SageMaker 上使用。
Hugging Face Spaces 发布 Dev Mode,支持一键从 VS Code 或 SSH 直连 Space 编辑代码,无需再用 git 推送本地改动。该功能目前处于 beta 阶段,仅面向 PRO 订阅用户开放,可在 Space 设置中启用。编辑后直接在 Space 内点击 Refresh 即可测试,满意后再 commit 和 merge 保存改动。
Hugging Face 与 Dell 联合发布 Dell Enterprise Hub,可在 Dell 平台上本地训练和部署开源模型,将原本数周的工程工作缩短至几分钟。
Hugging Face 宣布 AMD Instinct MI300 已在 Hugging Face 平台获得一等公民级集成,用户无需改动代码即可通过 transformers 和 text-generation-inference 在 Azure ND MI300x V5 虚拟机上部署模型。
Hugging Face 与微软在 Microsoft Build 上宣布深化战略合作,将 Llama 3、Mistral 7B、Command R Plus、Qwen 1.5 110B 等热门开源大模型加入 Azure Model Catalog 的 Hugging Face Collection,支持从 Azure AI Studio 一键部署。
Hugging Face 在 Transformers 中推出 KV Cache 量化功能,通过降低 KV 缓存精度减少长上下文生成的内存占用,对生成质量影响较小。
Hugging Face 现已支持通过 AWS 账户将组织升级至 Enterprise Hub,订阅入口在 AWS Marketplace,定价与 Hugging Face 公开定价一致,但账单由 AWS 账户结算。
Intel 展示了基于 OPEA 平台、用 Intel Gaudi 2 加速器和 Xeon CPU 构建企业级 RAG 应用的方案,嵌入模型跑在 Granite Rapids CPU 上,LLM 跑在 Gaudi 2 上。
Stack Overflow 与 OpenAI 宣布达成 API 合作,将这一技术知识平台与 OpenAI 的大语言模型结合,为开发者提供支持。Stack Overflow 称其拥有全球领先的高技术内容知识平台,OpenAI 则拥有最受欢迎的 AI 开发 LLM 模型。
Artificial Analysis 开发的 LLM Performance Leaderboard 现已上线 Hugging Face,覆盖超过 100 个 serverless LLM API 端点,综合评估质量、价格与速度。
Hugging Face 发布自定义推理 handler 方案,在 Inference Endpoints 上把 Whisper 语音识别、Pyannote 说话人分离与推测解码整合进单一 API 端点。
OpenAI 宣布 GPT-4 API 正式可用,GPT-3.5 Turbo、DALL·E 和 Whisper API 也同步转为正式可用。同时 OpenAI 发布了旧版 Completions API 模型的退役计划,这些模型将于 2024 年初退役。
推荐理由:OpenAI 官方公布 GPT-4 等 API 正式可用,并给出旧版 Completions 模型的退役时间表,便于开发者安排迁移。
OpenAI 为 API 客户新增更多安全功能与控制项,并更新 Assistants API,同时提供更好地管理成本的工具,以加强对企业的支持。
Zama 团队将基于全同态加密(FHE)的 Concrete ML 预编译模型部署到 Hugging Face Endpoints,用户可通过自定义 inference handler 一键部署并运行加密推理。
Ryght 正式公开发布面向生命科学知识工作者的免费安全平台 Ryght Preview,用于加速药物研发、临床试验与商业化中的数据分析。
Gradio 推出 reload 模式,用 `gradio app.py` 替代 `python app.py` 启动应用,即可在不重启服务器的情况下拉取源码最新改动。
Hugging Face 推出 Deploy on Google Cloud 集成,可将数千个基础模型通过 Vertex AI 或 GKE 部署到用户自己的 Google Cloud 账号,并作为 API Endpoint 运行。
借助 🤗 Optimum Intel 对 SetFit 模型做训练后静态量化(PTQ),可在 Intel Xeon CPU 上把推理速度提升 7.8 倍,实现生产级部署。
Hugging Face Hub 上线 "Deploy on Cloudflare Workers AI" 集成,让开发者以无服务器 API 方式调用 Llama、Gemma、Mistral 等热门开源模型,由 Cloudflare 边缘数据中心的 GPU 和 Text Generation Inference 驱动,按请求计费、无需自管 GPU。
Pollen Robotics 开源 pollen-vision 库,为机器人提供零样本视觉模型统一接口,首个版本聚焦 3D 物体检测,输出物体在三维空间中的 (x, y, z) 坐标。
Hugging Face 发布面向非技术读者的 Transformers 入门指南,从零解释这一开源 Python 库、Hub 与 Spaces 的基本概念。教程以在 Hugging Face Space 的 JupyterLab notebook 中运行微软 Phi-2 LLM 为例,需租用 24GB 显存的 NVIDIA A10G GPU,每小时仅需几美元。
Hugging Face 发布博客介绍嵌入量化,将 float32 嵌入转为二值或 int8,分别带来 32 倍和 4 倍的内存与存储缩减。
推荐理由:用 41M 维基文本的实测数据说明二值与标量量化在检索速度、内存和成本上的取舍,方法可直接迁移。
JetBrains 使用 OpenAI 的 API 打造出公司史上增长最快的产品。该产品将 AI 嵌入开发者软件之中。
Hugging Face 与 Intel 合作,通过 Optimum Intel 中的 OpenVINO 集成对微软 Phi-2 模型权重做 4-bit 量化,并在搭载 Core Ultra 7 155H 的中端笔记本上完成推理。
Hugging Face 发布 Quanto,一个面向 Optimum 的 PyTorch 量化后端,支持 int2、int4、int8 和 float8 权重以及 int8、float8 激活,可在 CUDA 和 MPS 等任意设备上运行。
Hugging Face 面向 Enterprise Hub 组织推出 Train on DGX Cloud,可一键调用 NVIDIA H100 GPU 微调 Llama、Mistral、Stable Diffusion 等模型。
Hugging Face 博客展示如何借助 Optimum Intel 与 fastRAG,在基于 Xeon 的 CPU 上为 BGE 等嵌入模型带来显著性能提升,并轻松接入现有 RAG 流水线。
Hugging Face 展示了如何用 Optimum Habana 的自定义 pipeline 类在 Intel Gaudi 2 AI 加速器上运行 Llama 2 系列模型(7b、13b、70b)进行文本生成,仅需几行代码即可完成端到端的预处理与后处理。
Google 发布开源大模型家族 Gemma,包含 2B 和 7B 两种规模,各有基础版与指令微调版共 4 个开放模型,上下文长度 8K tokens。Hugging Face 同步完成集成,覆盖 Transformers 4.38、Google Cloud、Inference Endpoints 以及用 TRL 在单卡上微调的示例。
推荐理由:Google 开源 Gemma 后,Hugging Face 同步给出 2B/7B 四个模型的集成与部署路径,可对照榜单分数判断其定位。
AMD 与 Hugging Face 联合启动 Pervasive AI Developer Contest,设生成式 AI、机器人 AI 和 PC AI 三个赛道,总奖金 16 万美元,单个获奖者最高可得 1 万美元,并提供 700 个 AMD 平台供参赛者使用。
Hugging Face 为 Text Generation Inference(TGI)和 Inference Endpoints 推出 Messages API,从 TGI 1.4.0 起提供与 OpenAI Chat Completion API 兼容的接口,可直接配合 OpenAI 客户端库以及 LangChain、LlamaIndex 使用。
推荐理由:官方给出 OpenAI 兼容接口的接入方式与限制,读者可据此评估把现有 OpenAI 调用迁到开源模型的成本。
Hugging Face Text Generation Inference(TGI)正式在 AWS Inferentia2 和 Amazon SageMaker 上全面可用,为生产级 LLM 部署提供 GPU 之外的替代方案。
借助 8bit/4bit 量化与辅助生成(assisted generation),StarCoder-15B 在第四代 Intel Xeon 上实现超过 7 倍的推理加速。其中 Q8-StarCoder 采用 SmoothQuant 静态量化,精度与 BF16 基线持平甚至略有提升,TTFT 与 TPOT 分别提速约 2.19 倍和 2.20 倍。
Hugging Face 宣布与 Google Cloud 建立战略合作,围绕开放科学、开源、云与硬件展开协作,帮助企业在 Hugging Face 开放模型与 Google Cloud 基础设施上构建自己的 AI。
Hugging Face 发布经 Olive 优化的 SD Turbo 与 SDXL Turbo 模型,在 NVIDIA GPU 上通过 ONNX Runtime 的 CUDA 和 TensorRT 执行提供程序加速推理,吞吐量相比 PyTorch 最高提升 229%(SDXL Turbo)和 120%(SD Turbo)。
Hugging Face 发布教程,讲解如何把 ComfyUI 工作流转成 Gradio 应用并部署到 Spaces 的 ZeroGPU 上免费运行。
推荐理由:完整走通从 ComfyUI 工作流导出 Python、包成 Gradio 应用到 ZeroGPU 免费部署的链路,可迁移到任意工作流。
Mistral AI 发布 Mixtral 8x7B,一个采用 Apache 2.0 许可、开放权重的稀疏混合专家模型(SMoE)。该模型总参数 46.7B,每个 token 仅激活 12.9B 参数,推理速度比 Llama 2 70B 快 6 倍,在多数基准上匹配或超过 Llama 2 70B 与 GPT3.5,支持 32k token 上下文和英法意德西五种语言。
推荐理由:官方给出 Mixtral 8x7B 的稀疏 MoE 架构与推理成本数据,可据此判断开源模型的性价比边界。
Mistral AI 开放首个平台服务 La Plateforme 的 beta 访问,提供三个生成文本的 chat 端点和 一个嵌入端点,各端点性能与价格不同。
推荐理由:Mistral 官方公布首批平台服务,给出三个生成端点的模型、语言与 MT-Bench 分数,可据此判断其早期 API 的能力与定价分层。
Hugging Face 发布长文《Mixture of Experts Explained》,以 Mixtral 8x7B 发布为背景,讲解 MoE 的构成、训练与推理取舍。
推荐理由:从 MoE 的稀疏路由、负载均衡到专家并行与部署取舍,系统梳理了这类架构的原理与工程代价。
Hugging Face 与 AMD 宣布合作进展,Transformers 模型和任务现可在 AMD Instinct GPU 上无需修改代码直接运行,并已支持 Flash Attention v2、Paged Attention、DeepSpeed、GPTQ 等加速与量化方案。
推荐理由:Hugging Face 与 AMD 公布开箱即用支持进展,读者可了解在 AMD Instinct 上运行 Transformers 与 TGI 的实际路径与性能对比。