Hugging Face 发布 LCM LoRA,SDXL 4 步即可出图
Hugging Face 发布 Latent Consistency LoRA(LCM LoRA),通过训练少量 LoRA 适配层而非蒸馏整个模型,让 SDXL 和 Stable Diffusion 从原本 25 到 50 步降到 4 到 8 步生成图像。
推荐理由:官方给出 LCM LoRA 的推理代码、多硬件速度对比和训练脚本,读者可据此判断少步数生成的可用性。
Hugging Face 发布 Latent Consistency LoRA(LCM LoRA),通过训练少量 LoRA 适配层而非蒸馏整个模型,让 SDXL 和 Stable Diffusion 从原本 25 到 50 步降到 4 到 8 步生成图像。
推荐理由:官方给出 LCM LoRA 的推理代码、多硬件速度对比和训练脚本,读者可据此判断少步数生成的可用性。
Explosion 发布 Prodigy-HF 插件,让 Prodigy 标注工具直接对接 Hugging Face 生态。
Hugging Face 为 Enterprise Hub 推出 Storage Regions,让组织决定模型和数据集的存储位置,目前支持 US 和 EU,亚太地区即将上线。该功能用于满足监管与法律合规(如欧盟 GDPR)需求,并提升性能:欧洲用户将仓库存于 EU 区域时,上传和下载速度约提升 4-5 倍。非默认位置的仓库会直接显示 Region 标签。
Hugging Face 发布 @gradio/lite,一个借助 Pyodide 让 Gradio 应用完全在浏览器中运行的 JavaScript 库,无需服务器端基础设施。
推荐理由:官方给出在浏览器内运行 Gradio 的完整用法与限制,可据此判断无服务器部署的可行边界。
Typeform 借助 GPT-3.5 和 GPT-4 把在线表单升级为动态、对话式的数据收集体验。
Ironclad 借助 GPT-4 简化合同审查流程。该工具将 AI 引入合同审阅环节,帮助用户更高效地处理合同文本。
Retool 借助 GPT-4 为企业提供快速、安全的 AI 应用构建方式。该方案面向商业场景,强调速度与安全性。
Hugging Face 上已有超过 13 万个支持 ONNX 的模型可借助 ONNX Runtime 加速,覆盖 90 多种模型架构,包括 BERT、GPT2、T5、Whisper、Stable-Diffusion 等。以 whisper-tiny 为例,使用 ONNX Runtime 后单次推理平均延迟相比 PyTorch 最高提升 74.30%。
Hugging Face tokenizers 新增 chat_template 属性,用 Jinja 模板保存模型训练时使用的对话格式,避免因格式不一致造成的静默性能下降。
推荐理由:Hugging Face 把聊天格式从 transformers 硬编码搬到 tokenizer 属性,读者可据此理解格式错配为何会静默拉低模型表现。
OpenAI 宣布 ChatGPT 新增看、听、说能力,可处理图像与语音输入并语音回复。
Hugging Face 为 PRO 用户推出 Inference for PROs,提供 Meta Llama 3 Instruct、Mixtral 8x7B Instruct、Code Llama 70B、Stable Diffusion XL 等精选模型的专属 HTTP API 端点,由 text-generation-inference 驱动,并享有更高速率限制。
Hugging Face 发布企业级代码助手 SafeCoder,基于 155 亿参数的 StarCoder 开源模型,支持 80 多种编程语言、8192 token 上下文窗口和 fill-in-the-middle。
Hugging Face Diffusers 团队与 T2I-Adapter 作者合作,在 diffusers 中为 Stable Diffusion XL 加入 T2I-Adapter 支持,并发布 sketch、canny、lineart、depth、openpose 五种条件控制的预训练权重。
推荐理由:对比 ControlNet 的参数与显存占用,并给出可直接运行的 diffusers 代码与多个条件模型权重。
OpenAI 发布面向教师的 ChatGPT 课堂使用指南,涵盖推荐提示词、ChatGPT 工作原理与局限、AI 检测工具的有效性以及偏见问题。
OpenAI 发布 ChatGPT Enterprise,主打企业级安全与隐私,并称其为目前能力最强的 ChatGPT 版本。
推荐理由:OpenAI 官方发布企业版 ChatGPT,读者可了解其面向企业的安全隐私定位与能力版本。
Hugging Face 将 AutoGPTQ 库集成进 Transformers,用户可用 GPTQ 算法把模型量化到 8、4、3 甚至 2-bit 精度运行,4-bit 量化精度损失可忽略,小批量下推理速度与 fp16 基线相当。
推荐理由:Hugging Face 官方说明 GPTQ 量化接入 Transformers 的用法与显存收益,可据此判断本地部署大模型的可行路径。
OpenAI 宣布开发者可以用自己的数据微调 GPT-3.5 Turbo,以适配各自的使用场景,同时更新了 API。官方未在摘要中给出微调的具体价格、上下文长度或可用范围等细节。
推荐理由:OpenAI 官方开放 GPT-3.5 Turbo 微调,开发者可据此判断自有数据定制模型的可行路径。
Hugging Face 发布企业级代码助手 SafeCoder,基于 StarCoder 系列代码大模型构建,支持客户在自有基础设施上自托管部署,训练与推理全程代码不离开 VPC。该方案采用 15B 参数模型,支持 8,192 tokens 上下文,可适配 NVIDIA、AMD、Intel 及 AWS Inferentia2、Habana Gaudi 等硬件。
OpenAI 将 GPT-4 用于内容政策制定与内容审核决策,可实现更一致的标注、更快的政策优化反馈循环,并减少人工审核员的参与。
Hugging Face Hub 已上线 AWS Marketplace,用户可通过 AWS 账户订阅并直接支付 Hugging Face 使用费用。Inference Endpoints、Spaces 硬件升级和 AutoTrain 等服务的组织用量将自动计入 AWS 账单,价格与 Hugging Face 公开定价一致。
Hugging Face 发布 swift-transformers Swift 包及配套工具,让开发者能在 Apple 设备上通过 Core ML 运行 Llama 2、Falcon 等模型。
推荐理由:Hugging Face 发布 Swift 端侧 LLM 工具链,读者可了解在 Apple 设备上跑 Llama 2 的完整路径与当前限制。
Hugging Face 正用机器学习检测 Hub 上缺少语言元数据的数据集语言,并通过 librarian-bots 提交 PR 补全这些元数据。Hub 现有约 5 万个公开数据集,仅约 13% 标注了语言信息,其中约 19% 标注为 en。
Segmind 开源了压缩版 Stable Diffusion 模型 SD-Small 和 SD-Tiny 的权重与蒸馏训练代码,两者参数量分别比基础模型少 35% 和 55%,图像保真度接近基础模型。
Hugging Face 与 Apple 将 Stable Diffusion XL 基础模型移植到 Core ML,可在运行 macOS 14 公测版的 Apple Silicon Mac 上通过 Swift 应用或 Hugging Face 演示应用运行,目前使用 ORIGINAL attention 实现,refiner 阶段尚未移植。
推荐理由:Hugging Face 与 Apple 把 SD XL 移植到 Core ML 并给出混合位宽量化配方,读者可据此判断 Mac 本地跑大模型的可行路径。
Hugging Face 在 huggingface.js 下发布 Agents.js,一个可在浏览器或服务端为 LLM 提供工具访问的 JavaScript 库,内置若干多模态工具并支持自定义工具与模型。
OpenAI 为 ChatGPT 推出自定义指令功能,用户可设置自己的偏好,ChatGPT 会在之后所有对话中记住这些偏好。该功能让用户对 ChatGPT 的回复方式拥有更多控制权。
推荐理由:OpenAI 官方说明 ChatGPT 自定义指令的用途,读者可据此了解对话偏好设置的适用范围。
Hugging Face 的 Diffusers 库迎来一周年,已从文生图扩展为覆盖视频、3D 与图像编辑的模块化扩散模型工具箱。
Viable 利用 GPT-4 以革命性规模分析定性数据,并实现前所未有的准确度。
Hugging Face 与 Panel 达成合作,在 Hugging Face Spaces 中集成了 Panel 模板,方便用户构建并部署 Panel 应用。
OpenAI 宣布一系列 API 更新,包括更易控制的 API 模型、函数调用能力、更长的上下文以及更低的价格。官方未在摘要中给出具体模型版本、上下文长度和价格数字。
推荐理由:OpenAI 官方公布 API 模型可控性、函数调用、上下文与价格四项变化,可据此判断接口能力与成本走向。
Hugging Face Hub 新增 DuckDB 集成,用户可对 Hub 上任意公开数据集运行 SQL 查询。数据集查看器会自动将所有公开数据集转换为 Parquet 文件,大文件按 500MB 分片,可通过 /parquet 端点获取 URL,再借助 httpfs 扩展直接查询远程文件。
Hugging Face 开始托管 Meta AI 开源的 fastText 官方镜像,涵盖全部 157 种语言的词向量和最新语言识别模型,用户可通过 huggingface_hub 的 hf_hub_download 几行命令下载使用。该集成同时支持文本分类与特征提取 widget,并提供语言识别在线体验。
Hugging Face 发布 LLM Inference DLC,可在 Amazon SageMaker 上部署开源大语言模型,底层由 Text Generation Inference(TGI)驱动,支持 Tensor Parallelism、bitsandbytes 量化和连续批处理。
Hugging Face 宣布将主题建模工具 BERTopic 集成到 Hugging Face Hub,用户可直接在 Hub 上访问和共享 BERTopic 模型。BERTopic 基于 Transformer 嵌入向量与 c-TF-IDF 生成可解释的主题,此次集成让主题模型的发布、复用和协作更便捷。
Hugging Face 与 bitsandbytes 合作,在 transformers 中支持以 4-bit 精度加载模型,覆盖文本、视觉和多模态等大多数 HF 模型,并可在 4bit 模型上训练适配器。
推荐理由:Hugging Face 与 bitsandbytes 合作把 4-bit 量化接入 transformers,读者可据此了解消费级硬件跑大模型的具体路径。
OpenAI 发布 ChatGPT iOS 应用,支持对话同步和语音输入,并将最新的模型改进带到移动端。
推荐理由:OpenAI 官方公布 ChatGPT iOS 应用,说明对话同步与语音输入两项能力,可据此了解其移动端入口的初始形态。
Databricks 向 Hugging Face 代码库提交首个官方贡献,新增 Datasets 的 from_spark 函数,可直接将 Apache Spark dataframe 转为 Hugging Face Dataset。以 16GB 数据集为例,处理时间从 22 分钟降至 12 分钟,提速超 40%。Databricks 还计划为 Spark 加入流式支持以进一步加快数据集加载。
ChatGPT 用户现在可以关闭聊天记录,自行选择哪些对话可以被用于训练 OpenAI 的模型。
推荐理由:官方说明 ChatGPT 新增关闭聊天记录的能力,读者可据此了解对话数据是否用于模型训练的自主控制方式。
Hugging Face 与 AWS 合作,将 Hugging Face Transformers 针对 AWS Inferentia2 推理加速器进行优化,借助 optimum-neuron 无需切分或修改模型,一行代码即可编译。
OpenAI 宣布 ChatGPT 已实现插件的初步支持。插件是专为语言模型设计的工具,以安全为核心原则,可帮助 ChatGPT 获取最新信息、执行计算或调用第三方服务。
推荐理由:OpenAI 官方给出插件机制的最初定义,可据此了解 ChatGPT 接入外部工具与实时信息的早期形态。