Meta 发布 Llama 2,Hugging Face 同步上线 12 个开放模型
Meta 发布 Llama 2 系列开放大语言模型,包含 7B、13B、70B 三种规模的预训练与微调版本,采用允许商用的社区许可,代码、预训练模型和微调模型同日放出。
推荐理由:Meta 开放 Llama 2 商用许可,Hugging Face 同步给出推理、量化与微调的完整接入路径。
Meta 发布 Llama 2 系列开放大语言模型,包含 7B、13B、70B 三种规模的预训练与微调版本,采用允许商用的社区许可,代码、预训练模型和微调模型同日放出。
推荐理由:Meta 开放 Llama 2 商用许可,Hugging Face 同步给出推理、量化与微调的完整接入路径。
Hugging Face 推出 AI WebTV 实验性演示,用开源文生视频模型 Zeroscope V2 与音乐生成模型 MusicGen 合成内容并直播。
Hugging Face 梳理其开源文本生成与 LLM 生态,涵盖因果语言模型与 text-to-text 模型、LLM 服务工具及 PEFT 微调。
Hugging Face 展示了在 Intel 第四代 Xeon(Sapphire Rapids)CPU 集群上微调 Stable Diffusion 的完整流程,借助 AMX 加速器与 IPEX、oneCCL 实现分布式训练。
Hugging Face 博客介绍了如何用 Transformers.js 制作实时 ML 网页游戏 Doodle Dash,模型完全在浏览器本地运行。作者基于 Google Quick, Draw!
推荐理由:作者完整走通从微调 MobileViT 到浏览器内实时推理的流程,可迁移到自己的网页 ML 项目。
Hugging Face 发布教程,演示如何用其托管 SaaS 服务 Inference Endpoints 部署开源 LLM,以 Falcon 40B instruct 为例,推荐将实例从 4x NVIDIA T4 换成 1x Nvidia A100,约 10 分钟即可上线。
Hugging Face 发布教程,用 Node.js 结合 WizardCoder-15B 与 Inference Endpoints API 流式生成 HTML 网页,实现文本到 Web 应用。模型通过 textGenerationStream 逐 token 输出,配合 TailwindCSS 提示词约束生成样式,并给出防止模型幻觉的提示词技巧。
Hugging Face 的 Jeff Boudier 对话 Writer 联合创始人兼 CTO Waseem Alshikh,回顾 Writer 从 Hugging Face 用户、客户到开源模型贡献者的历程。双方还讨论了当前生成式 AI 的最大误区、Writer 贡献开源模型的原因,以及 Writer 如何在 CPU 和 GPU 上规模化部署 LLM、CPU 推理效率对生产的重要性。
Optimum Habana v1.7 在 Habana Gaudi2 上微调 BridgeTower 视觉语言模型,相比 A100 实现 2.5 倍加速,相比 H100 实现 1.4 倍加速。
Hugging Face 发布 Ethics and Society Newsletter 第4期,聚焦文本到图像模型的偏见问题。文章梳理了训练数据、预训练数据过滤、推理、模型潜在空间及事后过滤等偏见来源,并指出 Stable Diffusion 和 Dall-E 2 等模型存在多样性不足与刻板印象。文中还介绍了 Stable Bias 项目用于探索和比较偏见的工具。
Hugging Face 发文解释 Open LLM Leaderboard 上 LLaMA 的 MMLU 分数为何显著低于 LLaMA 论文报告值:榜单基于 EleutherAI LM Evaluation Harness,而 LLaMA 团队用的是 UC Berkeley 原始实现,Stanford HELM 又是第三种实现。
Hugging Face 与 Panel 达成合作,在 Hugging Face Spaces 中集成了 Panel 模板,方便用户构建并部署 Panel 应用。
Hugging Face 于 6 月 12 日向美国商务部 NTIA 提交 AI 问责政策回应,强调文档与透明度规范在推动 AI 问责中的作用。其建议问责机制应覆盖 ML 开发全流程、结合内部要求与外部访问透明,并吸纳开发者、多学科研究社区、倡导组织、政策制定者和记者等最广泛参与者。Hugging Face 称已在 BigScience 和 BigCode 项目中实践上述思路。
Hugging Face 发布教程,介绍如何基于 Meta AI 的 MMS 检查点微调 Adapter 层以适配低资源语言的语音识别。MMS 的 Adapter 训练仅需 10-20 分钟微调即可获得极低词错误率,每个 Adapter 层仅约 2.5M 权重,比微调整个模型更省内存、更稳健。
Hugging Face 用实验反驳了 AAAI 2023 论文《Are Transformers Effective for Time Series Forecasting?
Hugging Face 介绍了借助 Core ML 新优化在 iPhone、iPad 和 Mac 上加速 Stable Diffusion 的方法,核心是 6-bit palettization 量化,将权重从 16-bit 浮点压到每参数 6 bit,并在推理时逐层解压以节省内存。
推荐理由:Hugging Face 与 Apple 官方给出 6-bit palettization 的量化原理与转换命令,读者可据此把 Stable Diffusion 压到端侧运行。
Hugging Face 更新了平台内容政策,并发布配套博客说明其制定理由与核心价值。新政策针对机器学习内容审核的特殊挑战,强调“同意”作为核心价值,关注用户作品、形象与隐私权利,同时禁止针对用户及 Hugging Face 员工的攻击性或骚扰性语言。
Elixir 社区用 Livebook 构建了一个基于 Whisper 的语音聊天应用,并部署到 Hugging Face Spaces,全程不到 15 分钟。
Hugging Face 宣布 AMD 正式加入其硬件合作伙伴计划,双方将共同在 AMD CPU 和 GPU 上优化 Transformer 模型性能。
Hugging Face Hub 面向美术馆、图书馆、档案馆与博物馆(GLAM)从业者,介绍如何查找模型、上传数据集并托管演示应用。Hub 目前托管超 190,000 个模型、33,000 个数据集和超 100,000 个应用与 demo,覆盖文本、图像、音频等任务。文中以挪威语文献的命名实体识别(NER)模型为例,并演示通过浏览器界面上传 CSV 数据集。
Hugging Face 通过扩展 Open LLM Leaderboard 评估套件,对比了人类标注与 GPT-4 对开源模型输出的偏好评分。
Hugging Face Hub 新增 DuckDB 集成,用户可对 Hub 上任意公开数据集运行 SQL 查询。数据集查看器会自动将所有公开数据集转换为 Parquet 文件,大文件按 500MB 分片,可通过 /parquet 端点获取 URL,再借助 httpfs 扩展直接查询远程文件。
Hugging Face 开始托管 Meta AI 开源的 fastText 官方镜像,涵盖全部 157 种语言的词向量和最新语言识别模型,用户可通过 huggingface_hub 的 hf_hub_download 几行命令下载使用。该集成同时支持文本分类与特征提取 widget,并提供语言识别在线体验。
阿布扎比 TII 发布 Apache 2.0 许可的 Falcon 语言模型家族,包含 Falcon-40B 与 Falcon-7B 两个基础模型及对应 instruct 版本。
推荐理由:以 Apache 2.0 开源的 Falcon 系列在 Hugging Face 生态中的推理、量化与微调路径被完整拆解,可据此判断开源大模型落地成本。
Hugging Face 发布教程,演示如何借助 Hugging Face Unity API 在 Unity 游戏中实现语音识别,把玩家语音转成文本,可用于下达指令、与 NPC 对话或提升无障碍体验。教程从搭建含开始/停止按钮和 TextMeshPro 文本框的场景入手,用 Microphone.Start() 以 44100 Hz 录制最长 10 秒音频,再编码为 WAV 格式发送给 API。
Hugging Face 宣布举办首届 Open Source AI Game Jam,活动时间为 7 月 7 日至 9 日,参与者需在周末内用 AI 工具做出一款游戏。
Hugging Face 发布 LLM Inference DLC,可在 Amazon SageMaker 上部署开源大语言模型,底层由 Text Generation Inference(TGI)驱动,支持 Tensor Parallelism、bitsandbytes 量化和连续批处理。
Hugging Face 宣布将主题建模工具 BERTopic 集成到 Hugging Face Hub,用户可直接在 Hub 上访问和共享 BERTopic 模型。BERTopic 基于 Transformer 嵌入向量与 c-TF-IDF 生成可解释的主题,此次集成让主题模型的发布、复用和协作更便捷。
Hugging Face 借助 OpenVINO 的 NNCF 与 Optimum,通过量化感知训练(QAT)结合 Token Merging 优化 Stable Diffusion 的 UNet,在 Intel CPU 上实现 5.1 倍推理加速和 4 倍模型体积缩减。优化从 Pokemons 数据集微调模型出发,仅需 4096 次迭代、单张 24GB 显存 GPU 不到一天即可完成。
Hugging Face 与 bitsandbytes 合作,在 transformers 中支持以 4-bit 精度加载模型,覆盖文本、视觉和多模态等大多数 HF 模型,并可在 4bit 模型上训练适配器。
推荐理由:Hugging Face 与 bitsandbytes 合作把 4-bit 量化接入 transformers,读者可据此了解消费级硬件跑大模型的具体路径。
Hugging Face 与微软合作,在 Azure Machine Learning Studio 内推出 Hugging Face Hub 模型目录,收录数千个热门 Transformers 模型,用户可在数分钟内将模型部署到托管端点进行实时推理。该目录已在所有支持 Azure Machine Learning 的区域开放公开预览。
Hugging Face 宣布与 IBM 合作,其开源库被集成进 IBM 新一代企业 AI 工作室 watsonx.ai。watsonx.ai 基于 RedHat OpenShift 构建,提供云端和本地部署两种方式,集成了 transformers、accelerate、peft 和 Text Generation Inference 等 Hugging Face 开源库。
Hugging Face 联合 EleutherAI 和 Stability AI 委托 Trail of Bits 对 safetensors 库做了外部安全审计,未发现可导致任意代码执行的关键安全漏洞,报告已完全公开。
推荐理由:外部安全审计结果与三家机构推动默认格式的路线,能帮读者理解模型权重存储格式的安全取舍。
Hugging Face 博客介绍如何借鉴 InstructPix2Pix 的训练策略与 FLAN 的指令模板思路,对 Stable Diffusion 做指令微调,使其按输入图像加指令完成卡通化、去雨等图像翻译与底层图像处理任务。
Hugging Face 博客分享了 BigCode 项目在大规模代码数据集上做近重复数据删除(near-deduplication)的实践,采用 MinHash + LSH 方法,参数为 (256, 0.7, 5)。该工作延续自 BigScience 的 ROOTS 语料去重经验,此前已确认去重能提升代码模型表现,同时使用更小的数据集。
Intel 用 SmoothQuant-O3 对 OPT 2.7B/6.7B、LLaMA 7B、Alpaca 7B、Vicuna 7B、BloomZ 7.1B、MPT-7B-chat 等模型做 8-bit 量化,模型体积缩小约 2 倍,多数基准指标不降反升。
Hugging Face 被法国数据保护机构 CNIL 选中,加入其强化支持计划。该计划从 40 多个候选企业中选出三家“具有强劲经济发展潜力”的公司,为其理解和履行数据保护义务提供支持。Hugging Face 表示,此前 BigScience 和 BigCode 项目已在数据选择、治理与假名化工具方面投入隐私保护工作。
Hugging Face 博客介绍 RWKV 架构,它结合了 RNN 与 Transformer 的优点,并已被集成进 transformers 库。
推荐理由:文章解释了 RWKV 如何把 RNN 的推理效率与 Transformer 的并行训练结合,并给出可直接运行的代码示例。
Hugging Face 发布教程,介绍如何在单块 AMD GPU 上通过 ROCm 运行 13B 参数的 Vicuna 聊天机器人。Vicuna 由 UC Berkeley 等团队基于 LLaMA 微调,训练成本约 300 美元,据 GPT-4 评估其质量达到 ChatGPT 的 90% 以上。
Hugging Face 发布辅助生成(assisted generation)方法,用一个至少小一个数量级的助手模型生成候选 token,再由主模型一次前向验证,从而减少前向次数、降低文本生成延迟。
推荐理由:Hugging Face 官方给出辅助生成方法的原理与可复现代码,读者可据此判断低延迟推理的落地条件。