Hugging Face 推出 Quanto:面向 Optimum 的 PyTorch 量化后端
Hugging Face 发布 Quanto,一个面向 Optimum 的 PyTorch 量化后端,支持 int2、int4、int8 和 float8 权重以及 int8、float8 激活,可在 CUDA 和 MPS 等任意设备上运行。
Hugging Face 发布 Quanto,一个面向 Optimum 的 PyTorch 量化后端,支持 int2、int4、int8 和 float8 权重以及 int8、float8 激活,可在 CUDA 和 MPS 等任意设备上运行。
Hugging Face 面向 Enterprise Hub 组织推出 Train on DGX Cloud,可一键调用 NVIDIA H100 GPU 微调 Llama、Mistral、Stable Diffusion 等模型。
Lifespan 利用 GPT-4 大幅提升健康素养并改善患者预后。该机构借助 GPT-4 帮助患者更好理解医疗信息,从而改善健康结果。
Match Group 正在使用 ChatGPT Enterprise 激发创意并扩大影响力。OpenAI 介绍了这家公司借助企业版 ChatGPT 提升生产力的实践。
Paradigm 正使用 OpenAI 的 API 改善患者参与临床试验的可及性。该举措旨在让更多患者更容易找到并加入合适的临床试验。
Argilla 与 Hugging Face 推出 Data is Better Together 实验,几天内吸引 350 名社区贡献者完成超 11,000 条 prompt 评分,并发布含 10,000 条 prompt 用户评分的 10k_prompts_ranked 数据集。
Hugging Face 发布 TTS Arena,借鉴 LMSys 的 Chatbot Arena,让用户输入文本后对比两个 TTS 模型的合成语音并投票选出更自然的一方,结果汇入公开排行榜。
Mistral AI 发布对话助手 Le Chat,作为与 Mistral 各模型交互的对话入口,底层可调用 Mistral Large、Mistral Small 或原型模型 Mistral Next。
推荐理由:Mistral 官方发布对话助手 Le Chat 及企业版,可了解其模型接入方式与自部署、审核机制。
Hugging Face 在 PEFT 中新增面向 LoRA 适配器的多种合并方法,包括 cat、linear、svd、ties、dare 和 magnitude_prune 系列,可通过 add_weighted_adapter() 调用。
OpenAI 正在测试 ChatGPT 记住用户讨论内容的能力,以便让后续对话更有帮助。官方表示,记忆功能的控制权在用户手中。
推荐理由:OpenAI 官方说明 ChatGPT 记忆功能的测试范围与用户控制方式,可了解该能力上线时的边界设定。
Hugging Face 为 Text Generation Inference(TGI)和 Inference Endpoints 推出 Messages API,从 TGI 1.4.0 起提供与 OpenAI Chat Completion API 兼容的接口,可直接配合 OpenAI 客户端库以及 LangChain、LlamaIndex 使用。
推荐理由:官方给出 OpenAI 兼容接口的接入方式与限制,读者可据此评估把现有 OpenAI 调用迁到开源模型的成本。
SegMind 发布 SegMoE 框架,可从零构建混合专家扩散模型,并已集成进 Hugging Face diffusers 生态。此次发布包括 SegMoE-4x2、SegMoE-2x1 和 SegMoE-SD4x2 三个模型,以及用于自建 MoE 模型的 segmoe 包和 GitHub 仓库,模型采用 Apache 2.0 许可。
Hugging Face Text Generation Inference(TGI)正式在 AWS Inferentia2 和 Amazon SageMaker 上全面可用,为生产级 LLM 部署提供 GPU 之外的替代方案。
Digital Green 借助 OpenAI 构建农业数据库,用于提升农民收入。
OpenAI 发布 GPT Store,官方公告标题为 Introducing the GPT Store,正文内容未能抓取。
OpenAI 发布面向各种规模团队的新 ChatGPT 套餐 ChatGPT Team,提供安全、可协作的工作空间,帮助团队在工作中充分利用 ChatGPT。
推荐理由:OpenAI 官方发布面向团队的 ChatGPT 新套餐,读者可了解其安全协作工作区的定位。
WHOOP 基于 GPT-4 打造个性化健身与健康指导服务。该健康解决方案由 LLM 驱动,为用户提供定制化的训练与健康建议。
Mistral AI 开放首个平台服务 La Plateforme 的 beta 访问,提供三个生成文本的 chat 端点和 一个嵌入端点,各端点性能与价格不同。
推荐理由:Mistral 官方公布首批平台服务,给出三个生成端点的模型、语言与 MT-Bench 分数,可据此判断其早期 API 的能力与定价分层。
Hugging Face 与 AMD 宣布合作进展,Transformers 模型和任务现可在 AMD Instinct GPU 上无需修改代码直接运行,并已支持 Flash Attention v2、Paged Attention、DeepSpeed、GPTQ 等加速与量化方案。
推荐理由:Hugging Face 与 AMD 公布开箱即用支持进展,读者可了解在 AMD Instinct 上运行 Transformers 与 TGI 的实际路径与性能对比。
Hugging Face 发布 Optimum-NVIDIA 推理库,只需把 transformers 的 pipeline 导入改成 optimum.nvidia 一行代码,即可在 NVIDIA 平台获得最高 28 倍吞吐提升和 1200 tokens/秒。
推荐理由:官方给出单行代码替换即可提速的量化数据与 FP8 支持范围,便于判断迁移成本。
Hugging Face 发布 Latent Consistency LoRA(LCM LoRA),通过训练少量 LoRA 适配层而非蒸馏整个模型,让 SDXL 和 Stable Diffusion 从原本 25 到 50 步降到 4 到 8 步生成图像。
推荐理由:官方给出 LCM LoRA 的推理代码、多硬件速度对比和训练脚本,读者可据此判断少步数生成的可用性。
Explosion 发布 Prodigy-HF 插件,让 Prodigy 标注工具直接对接 Hugging Face 生态。
Hugging Face 为 Enterprise Hub 推出 Storage Regions,让组织决定模型和数据集的存储位置,目前支持 US 和 EU,亚太地区即将上线。该功能用于满足监管与法律合规(如欧盟 GDPR)需求,并提升性能:欧洲用户将仓库存于 EU 区域时,上传和下载速度约提升 4-5 倍。非默认位置的仓库会直接显示 Region 标签。
Hugging Face 发布 @gradio/lite,一个借助 Pyodide 让 Gradio 应用完全在浏览器中运行的 JavaScript 库,无需服务器端基础设施。
推荐理由:官方给出在浏览器内运行 Gradio 的完整用法与限制,可据此判断无服务器部署的可行边界。
Typeform 借助 GPT-3.5 和 GPT-4 把在线表单升级为动态、对话式的数据收集体验。
Ironclad 借助 GPT-4 简化合同审查流程。该工具将 AI 引入合同审阅环节,帮助用户更高效地处理合同文本。
Retool 借助 GPT-4 为企业提供快速、安全的 AI 应用构建方式。该方案面向商业场景,强调速度与安全性。
Hugging Face 上已有超过 13 万个支持 ONNX 的模型可借助 ONNX Runtime 加速,覆盖 90 多种模型架构,包括 BERT、GPT2、T5、Whisper、Stable-Diffusion 等。以 whisper-tiny 为例,使用 ONNX Runtime 后单次推理平均延迟相比 PyTorch 最高提升 74.30%。
Hugging Face tokenizers 新增 chat_template 属性,用 Jinja 模板保存模型训练时使用的对话格式,避免因格式不一致造成的静默性能下降。
推荐理由:Hugging Face 把聊天格式从 transformers 硬编码搬到 tokenizer 属性,读者可据此理解格式错配为何会静默拉低模型表现。
OpenAI 宣布 ChatGPT 新增看、听、说能力,可处理图像与语音输入并语音回复。
Hugging Face 为 PRO 用户推出 Inference for PROs,提供 Meta Llama 3 Instruct、Mixtral 8x7B Instruct、Code Llama 70B、Stable Diffusion XL 等精选模型的专属 HTTP API 端点,由 text-generation-inference 驱动,并享有更高速率限制。
Hugging Face 发布企业级代码助手 SafeCoder,基于 155 亿参数的 StarCoder 开源模型,支持 80 多种编程语言、8192 token 上下文窗口和 fill-in-the-middle。
Hugging Face Diffusers 团队与 T2I-Adapter 作者合作,在 diffusers 中为 Stable Diffusion XL 加入 T2I-Adapter 支持,并发布 sketch、canny、lineart、depth、openpose 五种条件控制的预训练权重。
推荐理由:对比 ControlNet 的参数与显存占用,并给出可直接运行的 diffusers 代码与多个条件模型权重。
OpenAI 发布面向教师的 ChatGPT 课堂使用指南,涵盖推荐提示词、ChatGPT 工作原理与局限、AI 检测工具的有效性以及偏见问题。
OpenAI 发布 ChatGPT Enterprise,主打企业级安全与隐私,并称其为目前能力最强的 ChatGPT 版本。
推荐理由:OpenAI 官方发布企业版 ChatGPT,读者可了解其面向企业的安全隐私定位与能力版本。
Hugging Face 将 AutoGPTQ 库集成进 Transformers,用户可用 GPTQ 算法把模型量化到 8、4、3 甚至 2-bit 精度运行,4-bit 量化精度损失可忽略,小批量下推理速度与 fp16 基线相当。
推荐理由:Hugging Face 官方说明 GPTQ 量化接入 Transformers 的用法与显存收益,可据此判断本地部署大模型的可行路径。
OpenAI 宣布开发者可以用自己的数据微调 GPT-3.5 Turbo,以适配各自的使用场景,同时更新了 API。官方未在摘要中给出微调的具体价格、上下文长度或可用范围等细节。
推荐理由:OpenAI 官方开放 GPT-3.5 Turbo 微调,开发者可据此判断自有数据定制模型的可行路径。
Hugging Face 发布企业级代码助手 SafeCoder,基于 StarCoder 系列代码大模型构建,支持客户在自有基础设施上自托管部署,训练与推理全程代码不离开 VPC。该方案采用 15B 参数模型,支持 8,192 tokens 上下文,可适配 NVIDIA、AMD、Intel 及 AWS Inferentia2、Habana Gaudi 等硬件。
OpenAI 将 GPT-4 用于内容政策制定与内容审核决策,可实现更一致的标注、更快的政策优化反馈循环,并减少人工审核员的参与。
Hugging Face Hub 已上线 AWS Marketplace,用户可通过 AWS 账户订阅并直接支付 Hugging Face 使用费用。Inference Endpoints、Spaces 硬件升级和 AutoTrain 等服务的组织用量将自动计入 AWS 账单,价格与 Hugging Face 公开定价一致。